1
00:00:05,920 --> 00:00:09,519
Bun venit la pur și simplu învață YouTube

2
00:00:07,520 --> 00:00:11,200
canal. Inteligența artificială și

3
00:00:09,519 --> 00:00:13,280
învățarea automată transformă

4
00:00:11,200 --> 00:00:14,960
modul în care afacerile funcționează, iau decizii și

5
00:00:13,280 --> 00:00:17,279
inovează. De la personalizat

6
00:00:14,960 --> 00:00:19,039
recomandare pe platformele de streaming

7
00:00:17,279 --> 00:00:20,960
și roboti de chat inteligenți la

8
00:00:19,039 --> 00:00:22,960
vehicule autonome și avansate

9
00:00:20,960 --> 00:00:25,199
sisteme de sănătate, AI și mașină

10
00:00:22,960 --> 00:00:27,439
învățarea le alimentează pe unele dintre cele mai multe

11
00:00:25,199 --> 00:00:29,119
tehnologii de impact ale timpului nostru. Şi

12
00:00:27,439 --> 00:00:31,199
AI și inginerie de învățare automată

13
00:00:29,119 --> 00:00:33,120
combină programarea, matematica,

14
00:00:31,199 --> 00:00:35,600
statistică, știința datelor, mașină

15
00:00:33,120 --> 00:00:37,280
învățarea expertizei pentru a crea inteligente

16
00:00:35,600 --> 00:00:39,440
aplicații care oferă afaceri

17
00:00:37,280 --> 00:00:41,200
valoare. În acest AI complet și mașină

18
00:00:39,440 --> 00:00:42,719
învățarea cursului de inginerie, vei face

19
00:00:41,200 --> 00:00:45,120
învață totul din elementele fundamentale

20
00:00:42,719 --> 00:00:47,039
de AI și învățare automată la avansat

21
00:00:45,120 --> 00:00:48,480
concept folosit la inteligentul modern

22
00:00:47,039 --> 00:00:50,399
sisteme. Vom începe cu

23
00:00:48,480 --> 00:00:52,960
programare și fundație matematică

24
00:00:50,399 --> 00:00:54,719
apoi treceți treptat la analiza datelor,

25
00:00:52,960 --> 00:00:56,239
algoritmi de învățare automată, profunde

26
00:00:54,719 --> 00:00:57,680
învățare și IA generativă. Pe tot parcursul

27
00:00:56,239 --> 00:00:59,520
cursul, vei câștiga practică

28
00:00:57,680 --> 00:01:02,000
experiență cu instrumente standard din industrie

29
00:00:59,520 --> 00:01:04,320
și cadre precum Python, NumPy,

30
00:01:02,000 --> 00:01:06,640
Pandas, Kikit Learn, TensorFlow,

31
00:01:04,320 --> 00:01:08,720
PyTorch și alții. Vei invata si tu

32
00:01:06,640 --> 00:01:10,799
cum să colectați și să pregătiți date, să construiți

33
00:01:08,720 --> 00:01:12,880
modele predictive, antrenează neuronale

34
00:01:10,799 --> 00:01:14,880
rețele, evaluează performanța modelului,

35
00:01:12,880 --> 00:01:16,799
și implementați soluția de învățare automată în

36
00:01:14,880 --> 00:01:17,920
medii din lumea reală. Până la sfârșitul

37
00:01:16,799 --> 00:01:20,000
acest curs, vei avea un puternic

38
00:01:17,920 --> 00:01:22,240
înțelegerea completă a IA și a mașinii

39
00:01:20,000 --> 00:01:25,360
învățarea ciclului de viață și a abilităților practice

40
00:01:22,240 --> 00:01:27,119
necesare pentru a urma o carieră ca IA și

41
00:01:25,360 --> 00:01:28,479
inginer de învățare automată. După ce am spus

42
00:01:27,119 --> 00:01:30,479
asta, să aruncăm o privire la cea de azi

43
00:01:28,479 --> 00:01:32,000
agenda. Vom începe cu modulul unu,

44
00:01:30,479 --> 00:01:33,840
care este introducerea în artificial

45
00:01:32,000 --> 00:01:36,640
inteligență și învățare automată.

46
00:01:33,840 --> 00:01:39,119
Modulul doi este programarea Python pentru AI

47
00:01:36,640 --> 00:01:41,439
și ML. Modulul trei este matematică,

48
00:01:39,119 --> 00:01:43,280
statistici și probabilitate pentru mașină

49
00:01:41,439 --> 00:01:44,560
învăţarea. Modulul patru este date

50
00:01:43,280 --> 00:01:46,479
colectare, curățare și

51
00:01:44,560 --> 00:01:48,880
preprocesare. Modulul cinci este

52
00:01:46,479 --> 00:01:51,119
analiza exploratorie a datelor și a datelor

53
00:01:48,880 --> 00:01:53,280
vizualizare. Modulul șase este o mașină

54
00:01:51,119 --> 00:01:55,439
fundamentele învățării. Modulul șapte este

55
00:01:53,280 --> 00:01:56,880
algoritmi de învățare supravegheată. Modul

56
00:01:55,439 --> 00:01:59,600
opt este învățarea nesupravegheată

57
00:01:56,880 --> 00:02:02,000
algoritmi. Modulul 9 este evaluarea modelului

58
00:01:59,600 --> 00:02:04,000
și ingineria caracteristicilor. Modulul 10 este

59
00:02:02,000 --> 00:02:05,840
învățare profundă și rețele neuronale.

60
00:02:04,000 --> 00:02:08,640
Modulul 11 este limbajul natural

61
00:02:05,840 --> 00:02:11,039
prelucrare. Modulul 12 este viziunea computerizată

62
00:02:08,640 --> 00:02:15,280
fundamentale. Modulul 13 este generativ

63
00:02:11,039 --> 00:02:17,920
Agenți AI, LLMS și AI. Modulul 14 este

64
00:02:15,280 --> 00:02:20,720
plicuri, implementare model și AI

65
00:02:17,920 --> 00:02:23,200
fluxuri de lucru de inginerie. Modulul 15 este real

66
00:02:20,720 --> 00:02:25,280
proiecte mondiale de IA. Modulul 16 este

67
00:02:23,200 --> 00:02:27,200
întrebări și răspunsuri la interviu. Sper ca eu

68
00:02:25,280 --> 00:02:28,480
m-am făcut clar cu acea agendă.

69
00:02:27,200 --> 00:02:29,840
Asta este. Dacă acestea sunt tipul de

70
00:02:28,480 --> 00:02:31,280
videoclipurile pe care doriți să le vizionați, apoi apăsați

71
00:02:29,840 --> 00:02:33,440
acel buton de abonare cu pictograma clopoțel

72
00:02:31,280 --> 00:02:34,560
pentru a primi notificări ori de câte ori găzduim. De asemenea,

73
00:02:33,440 --> 00:02:36,400
doar ca să știi, dacă vrei

74
00:02:34,560 --> 00:02:38,640
perfecționează-te, stăpânește AI generativ

75
00:02:36,400 --> 00:02:40,080
și obțineți jobul de vis sau chiar să creșteți

76
00:02:38,640 --> 00:02:42,080
cariera ta, atunci trebuie să explorezi

77
00:02:40,080 --> 00:02:44,239
Cohorta lui Simply Learn de diverse

78
00:02:42,080 --> 00:02:46,080
antrenament AI generativ și profesional

79
00:02:44,239 --> 00:02:47,360
programe de certificare. Învață pur și simplu

80
00:02:46,080 --> 00:02:48,959
oferă o varietate de maeștri

81
00:02:47,360 --> 00:02:50,319
certificare și programe postuniversitare

82
00:02:48,959 --> 00:02:51,840
în colaborare cu unii dintre

83
00:02:50,319 --> 00:02:53,280
universități de top din lume. Prin

84
00:02:51,840 --> 00:02:55,040
cursurile noastre, veți dobândi cunoștințe

85
00:02:53,280 --> 00:02:57,599
împreună cu expertiza pregătită pentru lucru în

86
00:02:55,040 --> 00:03:00,239
abilități precum Python, Aentic AI, AI

87
00:02:57,599 --> 00:03:02,000
sisteme de automatizare, LLM-uri și peste a

88
00:03:00,239 --> 00:03:03,920
alții zeci. Și asta nu este tot. tu

89
00:03:02,000 --> 00:03:05,440
va avea, de asemenea, posibilitatea de a lucra

90
00:03:03,920 --> 00:03:07,200
proiecte multiple conduse de industrie

91
00:03:05,440 --> 00:03:09,200
experți care lucrează la nivelul superior

92
00:03:07,200 --> 00:03:10,640
companii bazate pe servicii și produse.

93
00:03:09,200 --> 00:03:12,159
După finalizarea acestor cursuri,

94
00:03:10,640 --> 00:03:14,480
mii de cursanți au tranziție

95
00:03:12,159 --> 00:03:16,480
într-un rol de AI și de învățare automată ca

96
00:03:14,480 --> 00:03:17,920
un proaspăt sau a trecut la nivelul superior

97
00:03:16,480 --> 00:03:19,440
loc de muncă și profil plătitor. Dacă ești

98
00:03:17,920 --> 00:03:20,879
pasionat de a-ți face cariera în

99
00:03:19,440 --> 00:03:22,959
acest câmp, apoi asigurați-vă că verificați

100
00:03:20,879 --> 00:03:25,519
linkul din comentariile fixate și în

101
00:03:22,959 --> 00:03:27,840
caseta de descriere pentru a găsi un AI și

102
00:03:25,519 --> 00:03:29,599
program de învățare automată care se potrivește cu dvs

103
00:03:27,840 --> 00:03:31,440
experiență și domenii de interes. Deci

104
00:03:29,599 --> 00:03:33,120
să începem cu AI-ul nostru și

105
00:03:31,440 --> 00:03:36,159
curs complet de inginer de învățare automată

106
00:03:33,120 --> 00:03:38,239
cu un mic test. Ce este NLP? este

107
00:03:36,159 --> 00:03:40,400
procesare strat de rețea, natural

108
00:03:38,239 --> 00:03:42,959
procesarea limbajului, învățarea neuronală

109
00:03:40,400 --> 00:03:44,400
platformă sau este limba maternă

110
00:03:42,959 --> 00:03:45,920
programare? Vă rugăm să ne spuneți dvs

111
00:03:44,400 --> 00:03:48,480
răspunsuri în secțiunea de comentarii de mai jos.

112
00:03:45,920 --> 00:03:50,720
Acum treceți la experții noștri în formare.

113
00:03:48,480 --> 00:03:53,599
>> A fost odată ca niciodată în orașul liniștit

114
00:03:50,720 --> 00:03:56,080
Newite, acolo locuia un adolescent curios

115
00:03:53,599 --> 00:03:58,239
pe nume Arya. Ea nu era ca majoritatea copiilor

116
00:03:56,080 --> 00:04:01,120
scoala ei. În timp ce alții erau ocupați cu

117
00:03:58,239 --> 00:04:03,519
sport sau muzică, Arya a fost fascinată de

118
00:04:01,120 --> 00:04:05,840
mașini, în special ideea de a face

119
00:04:03,519 --> 00:04:07,920
mașinile gândesc ca oamenii. Ei

120
00:04:05,840 --> 00:04:09,760
curiozitatea a început într-o seară când ea

121
00:04:07,920 --> 00:04:11,840
a întrebat bunicul ei, care era odinioară a

122
00:04:09,760 --> 00:04:14,319
inginer computer, „Mașinile pot fi vreodată

123
00:04:11,840 --> 00:04:16,320
gandeste?" Bunicul ei a zâmbit și a spus:

124
00:04:14,319 --> 00:04:18,959
„Asta este inteligența artificială

125
00:04:16,320 --> 00:04:21,759
totul despre.” Ochii Aryei s-au luminat.

126
00:04:18,959 --> 00:04:24,000
Inteligenţă artificială? Ce-i asta? Deci

127
00:04:21,759 --> 00:04:25,919
a început să-i spună o poveste, nu o

128
00:04:24,000 --> 00:04:28,800
basm, dar o poveste reală despre

129
00:04:25,919 --> 00:04:31,440
știință și idei din spatele mașinilor care

130
00:04:28,800 --> 00:04:34,160
învață, decide și uneori chiar

131
00:04:31,440 --> 00:04:37,680
surprinde creatorii lor. Artificial

132
00:04:34,160 --> 00:04:39,759
inteligența, sau AI, este știința

133
00:04:37,680 --> 00:04:42,639
făcând mașini care pot face lucruri care

134
00:04:39,759 --> 00:04:44,960
necesită în mod normal inteligență umană.

135
00:04:42,639 --> 00:04:47,680
Aceasta include sarcini precum recunoașterea

136
00:04:44,960 --> 00:04:50,560
chipuri, înțelegerea vorbirii, realizarea

137
00:04:47,680 --> 00:04:53,120
decizii și chiar joc. Dar

138
00:04:50,560 --> 00:04:56,240
AI nu este magie. Este construit prin

139
00:04:53,120 --> 00:04:58,240
programare, matematică și date. Arya

140
00:04:56,240 --> 00:05:00,560
mi-a imaginat un robot care ar putea vorbi ca un

141
00:04:58,240 --> 00:05:02,880
uman și ajută la teme. Ea

142
00:05:00,560 --> 00:05:05,199
bunicul dădu din cap. Acesta este un fel de

143
00:05:02,880 --> 00:05:07,039
AI, dar există multe tipuri. El

144
00:05:05,199 --> 00:05:10,400
a explicat că AI nu este doar despre

145
00:05:07,039 --> 00:05:12,639
roboți. De fapt, majoritatea sistemelor AI sunt

146
00:05:10,400 --> 00:05:15,039
doar programe de calculator care rulează înăuntru

147
00:05:12,639 --> 00:05:17,759
aparate pe care le folosim deja, cum ar fi telefoanele,

148
00:05:15,039 --> 00:05:19,919
laptopuri sau chiar frigidere. Ea

149
00:05:17,759 --> 00:05:22,639
bunicul i-a spus că intră AI

150
00:05:19,919 --> 00:05:25,759
două tipuri principale, AI îngustă și generală

151
00:05:22,639 --> 00:05:28,560
AI. Narrow AI este genul pe care îl vedem astăzi.

152
00:05:25,759 --> 00:05:30,800
Este conceput pentru a face o sarcină specifică.

153
00:05:28,560 --> 00:05:32,880
De exemplu, AI dintr-un smartphone care

154
00:05:30,800 --> 00:05:35,360
deblochează ecranul recunoscându-vă

155
00:05:32,880 --> 00:05:38,400
Fața este bună doar la acel singur loc de muncă. Ea

156
00:05:35,360 --> 00:05:41,120
nu pot găti sau scrie o poveste. AI general,

157
00:05:38,400 --> 00:05:44,240
pe de altă parte, ar fi la fel de inteligent ca

158
00:05:41,120 --> 00:05:47,440
un om, capabil să învețe orice și să facă

159
00:05:44,240 --> 00:05:50,639
multe sarcini. Dar acest tip de IA nu

160
00:05:47,440 --> 00:05:52,800
exista inca. Deocamdată este mai mult un vis.

161
00:05:50,639 --> 00:05:54,800
Arya a întrebat: „Cum fac aceste mașini

162
00:05:52,800 --> 00:05:57,759
invata? Acolo este învățarea automată

163
00:05:54,800 --> 00:05:59,840
intră”, a răspuns bunicul ei.

164
00:05:57,759 --> 00:06:01,759
Învățarea automată este un tip de IA care

165
00:05:59,840 --> 00:06:04,639
învață din date în loc să i se spună

166
00:06:01,759 --> 00:06:07,520
ce sa faci pas cu pas. „Imaginați-vă

167
00:06:04,639 --> 00:06:10,639
învățând un câine să stea. Arată-i cum,

168
00:06:07,520 --> 00:06:13,280
dă-i bunătăți și repetă. De-a lungul timpului,

169
00:06:10,639 --> 00:06:15,360
învață câinele. Învățarea automată funcționează

170
00:06:13,280 --> 00:06:18,240
la fel. Îi alimentezi cu date și cu el

171
00:06:15,360 --> 00:06:19,919
găsește modele. De exemplu, dacă vrei

172
00:06:18,240 --> 00:06:22,319
un computer pentru a recunoaște imaginile

173
00:06:19,919 --> 00:06:24,960
pisici, îi arăți mii de pisici

174
00:06:22,319 --> 00:06:27,840
poze. Începe să vadă ce pisici

175
00:06:24,960 --> 00:06:31,120
de obicei arata ca. mustati blani,

176
00:06:27,840 --> 00:06:34,160
urechi ascuțite. Cu timpul, învață

177
00:06:31,120 --> 00:06:36,000
distinge o pisică de un câine sau de un scaun.

178
00:06:34,160 --> 00:06:39,039
Programul care face această învățare este

179
00:06:36,000 --> 00:06:41,199
numit model. Un model este ca un creier

180
00:06:39,039 --> 00:06:43,759
construite de computer folosind datele pe care le face

181
00:06:41,199 --> 00:06:45,840
a fost dat. Cu cât primesc mai multe date, cu atât

182
00:06:43,759 --> 00:06:48,960
mai bine invata. Dar cum face

183
00:06:45,840 --> 00:06:51,520
calculatorul stii ce este o pisica? întrebă Arya.

184
00:06:48,960 --> 00:06:53,520
Bunicul ei a spus: „Asta datorită

185
00:06:51,520 --> 00:06:55,680
ceva numit o rețea neuronală. Este

186
00:06:53,520 --> 00:06:58,479
o metodă folosită în învățarea automată care este

187
00:06:55,680 --> 00:07:00,479
inspirat de modul în care funcționează creierul nostru. A

188
00:06:58,479 --> 00:07:03,520
rețeaua neuronală este formată din straturi de

189
00:07:00,479 --> 00:07:06,880
părți minuscule numite neuroni. Acestea nu sunt

190
00:07:03,520 --> 00:07:09,440
celule cerebrale reale, dar funcții matematice.

191
00:07:06,880 --> 00:07:11,919
Fiecare neuron ia numere, face unele

192
00:07:09,440 --> 00:07:14,880
matematică și trece rezultatul la următorul

193
00:07:11,919 --> 00:07:17,039
stratul de neuroni. Imaginați-vă că dați o notă

194
00:07:14,880 --> 00:07:19,199
printr-un grup de prieteni și fiecare

195
00:07:17,039 --> 00:07:21,919
adaugă sau schimbă un cuvânt înainte de a-l da

196
00:07:19,199 --> 00:07:24,800
la următorul. Până la sfârșit, nota poate

197
00:07:21,919 --> 00:07:28,160
s-au transformat într-un mod util. Asta e

198
00:07:24,800 --> 00:07:30,880
ce face o rețea neuronală datelor. Ea

199
00:07:28,160 --> 00:07:33,919
îl transformă în ceva semnificativ, de exemplu

200
00:07:30,880 --> 00:07:36,960
recunoscând o pisică într-o imagine. Cu atât mai mult

201
00:07:33,919 --> 00:07:39,039
straturi pe care le are o rețea, cu atât mai complexe

202
00:07:36,960 --> 00:07:41,280
modele pe care le poate înțelege. Când a

203
00:07:39,039 --> 00:07:43,520
rețeaua are multe straturi, se numește

204
00:07:41,280 --> 00:07:46,160
învăţare profundă. Pentru a obține o rețea neuronală

205
00:07:43,520 --> 00:07:48,080
pentru a lucra, trebuie antrenat.

206
00:07:46,160 --> 00:07:50,319
Antrenamentul este procesul în care modelul

207
00:07:48,080 --> 00:07:52,560
este prezentată o mulțime de exemple, așa că poate

208
00:07:50,319 --> 00:07:54,560
invata. Antrenamentul presupune oferirea

209
00:07:52,560 --> 00:07:56,080
date model și lăsându-l să ghicească

210
00:07:54,560 --> 00:07:59,360
ceva de genul dacă o imagine are o

211
00:07:56,080 --> 00:08:01,360
pisica. La început, s-a ghicit prost, dar

212
00:07:59,360 --> 00:08:03,840
apoi își compară presupunerea cu

213
00:08:01,360 --> 00:08:06,000
raspuns corect. Dacă este greșit, asta

214
00:08:03,840 --> 00:08:08,879
se ajustează folosind o metodă numită

215
00:08:06,000 --> 00:08:11,360
propagarea înapoi. Propagarea înapoi este

216
00:08:08,879 --> 00:08:14,000
cum ar fi să-ți verifici temele de matematică. Dacă

217
00:08:11,360 --> 00:08:17,280
răspunsul este greșit, te întorci și găsești unde

218
00:08:14,000 --> 00:08:20,000
ai încurcat și ai reparat-o. În AI, asta

219
00:08:17,280 --> 00:08:22,000
ajută modelul să se îmbunătățească pas cu pas.

220
00:08:20,000 --> 00:08:24,639
Acest ciclu de ghicire, verificare și

221
00:08:22,000 --> 00:08:27,440
reglarea se repetă de mai multe ori. The

222
00:08:24,639 --> 00:08:31,039
modelul devine încet mai bun la sarcină.

223
00:08:27,440 --> 00:08:34,399
Poate AI să facă greșeli? întrebă Arya. Oh!

224
00:08:31,039 --> 00:08:36,959
da, bunicul ei a spus că AI este inteligentă

225
00:08:34,399 --> 00:08:39,039
unele moduri, dar nu perfect. Numai AI

226
00:08:36,959 --> 00:08:42,399
învață din datele pe care i le oferim. Dacă

227
00:08:39,039 --> 00:08:45,279
datele sunt proaste, AI-ul va fi prost. Aceasta este

228
00:08:42,399 --> 00:08:47,440
numită părtinire. De exemplu, dacă o față

229
00:08:45,279 --> 00:08:49,839
sistemul de recunoaștere este instruit mai ales pe

230
00:08:47,440 --> 00:08:52,399
fotografii cu oameni de rudenie ușoară, s-ar putea

231
00:08:49,839 --> 00:08:54,959
nu funcționează bine la persoanele cu pielea întunecată.

232
00:08:52,399 --> 00:08:58,160
De asemenea, AI nu prea înțelege

233
00:08:54,959 --> 00:09:00,480
lume. Vede doar modele în numere.

234
00:08:58,160 --> 00:09:02,959
Nu știe cum se simte o pisică sau

235
00:09:00,480 --> 00:09:05,279
de ce le iubim. De aceea AI poate

236
00:09:02,959 --> 00:09:07,120
uneori fi păcălit de simple trucuri

237
00:09:05,279 --> 00:09:09,760
ca niște imagini ciudate pe care le-ar face un om

238
00:09:07,120 --> 00:09:12,160
nu confunda niciodată cu o pisică. AI este

239
00:09:09,760 --> 00:09:14,640
peste tot, a explicat bunicul ei.

240
00:09:12,160 --> 00:09:16,800
Vă ajută să recomandați videoclipuri pe YouTube,

241
00:09:14,640 --> 00:09:20,560
dă putere asistenților vocali precum Siri sau

242
00:09:16,800 --> 00:09:23,600
Alexa, conduce unele mașini și chiar ajută

243
00:09:20,560 --> 00:09:26,320
medicii găsesc boli și scanări. Dar nu

244
00:09:23,600 --> 00:09:29,839
toată IA este inofensivă. Poate fi folosit pentru

245
00:09:26,320 --> 00:09:31,680
spionarea, răspândirea de știri false sau crearea

246
00:09:29,839 --> 00:09:34,160
decizii care afectează viața oamenilor,

247
00:09:31,680 --> 00:09:35,680
cum ar fi cine primește un împrumut sau un loc de muncă? Asta e

248
00:09:34,160 --> 00:09:38,480
de ce este important ca oamenii să

249
00:09:35,680 --> 00:09:41,279
să înțeleagă cum funcționează AI, astfel încât să poată întreba

250
00:09:38,480 --> 00:09:44,080
întrebări bune și construiți-l în mod responsabil.

251
00:09:41,279 --> 00:09:46,640
Arya a întrebat: „Va prelua AI-ul

252
00:09:44,080 --> 00:09:48,399
lume?" Bunicul ei a râs. Nu

253
00:09:46,640 --> 00:09:51,120
ca în filme, dar se va schimba

254
00:09:48,399 --> 00:09:53,519
lumea. Viitorul AI depinde de

255
00:09:51,120 --> 00:09:55,519
cum aleg oamenii să-l folosească. Poate ajuta

256
00:09:53,519 --> 00:09:58,000
rezolva probleme mari precum schimbările climatice

257
00:09:55,519 --> 00:10:00,240
sau boala. Dar are nevoie și de reguli și

258
00:09:58,000 --> 00:10:02,880
gândire atentă. La fel ca focul sau

259
00:10:00,240 --> 00:10:05,440
electricitate, AI este un instrument, un puternic

260
00:10:02,880 --> 00:10:08,880
unul. Dacă este folosit cu înțelepciune, se poate descurca de minune

261
00:10:05,440 --> 00:10:10,480
bine. Arya se lăsă pe spate, cu mintea bâzâind.

262
00:10:08,880 --> 00:10:12,959
Începuse ziua întrebându-se dacă

263
00:10:10,480 --> 00:10:15,040
mașinile puteau gândi. Acum ea știe asta

264
00:10:12,959 --> 00:10:17,360
în timp ce ei nu gândesc ca oamenii, ei

265
00:10:15,040 --> 00:10:20,320
pot face lucruri uimitoare prin învățare

266
00:10:17,360 --> 00:10:22,560
date și programare inteligentă. Ea a zâmbit

267
00:10:20,320 --> 00:10:25,120
și a spus: „Poate voi construi un AI

268
00:10:22,560 --> 00:10:26,959
într-o zi.” Bunicul ei a zâmbit și el.

269
00:10:25,120 --> 00:10:28,959
Nu uitați, nu este vorba despre a face o

270
00:10:26,959 --> 00:10:32,079
mașină inteligentă. Este vorba despre realizarea

271
00:10:28,959 --> 00:10:35,040
util și corect pentru toată lumea. Și de la

272
00:10:32,079 --> 00:10:38,240
în ziua aceea, Arya și-a început călătoria

273
00:10:35,040 --> 00:10:41,680
nu doar pentru a înțelege AI, ci pentru a modela

274
00:10:38,240 --> 00:10:43,760
cu grijă, creativitate și curiozitate.

275
00:10:41,680 --> 00:10:46,160
>> Știm că oamenii învață din trecutul lor

276
00:10:43,760 --> 00:10:48,880
experiențe, iar mașinile urmează

277
00:10:46,160 --> 00:10:51,120
instructiuni date de oameni.

278
00:10:48,880 --> 00:10:52,720
Dar dacă oamenii pot antrena

279
00:10:51,120 --> 00:10:54,800
mașinile să învețe din datele lor trecute

280
00:10:52,720 --> 00:10:56,800
și fă ceea ce oamenii pot face și multe

281
00:10:54,800 --> 00:10:58,560
mai repede? Ei bine, asta se numește mașină

282
00:10:56,800 --> 00:11:00,640
învăţarea. Dar este mult mai mult decât doar

283
00:10:58,560 --> 00:11:02,880
învăţarea. Este și despre înțelegere

284
00:11:00,640 --> 00:11:05,920
și raționament. Așa că astăzi vom învăța

285
00:11:02,880 --> 00:11:08,399
despre elementele de bază ale învățării automate. Deci

286
00:11:05,920 --> 00:11:10,320
acesta este Paul. Îi place să asculte noi

287
00:11:08,399 --> 00:11:12,399
cântece.

288
00:11:10,320 --> 00:11:14,640
Fie îi plac, fie nu îi plac.

289
00:11:12,399 --> 00:11:19,040
Paul decide acest lucru pe baza

290
00:11:14,640 --> 00:11:21,680
tempo-ul, genul, intensitatea melodiei și

291
00:11:19,040 --> 00:11:24,320
genul vocii. Pentru simplitate, haideți

292
00:11:21,680 --> 00:11:27,760
folosește doar tempo și intensitatea deocamdată.

293
00:11:24,320 --> 00:11:30,480
Deci, aici tempo este pe axa x, variind

294
00:11:27,760 --> 00:11:33,440
de la relaxat la rapid, în timp ce intensitate

295
00:11:30,480 --> 00:11:36,880
este pe axa y, variind de la lumină la

296
00:11:33,440 --> 00:11:40,079
avântându-se. Vedem că lui Paul îi place cântecul

297
00:11:36,880 --> 00:11:43,040
cu un tempo rapid și o intensitate vertiginoasă

298
00:11:40,079 --> 00:11:45,519
în timp ce îi displace cântecul cu relaxat

299
00:11:43,040 --> 00:11:47,680
tempo și intensitatea luminii. Deci acum noi

300
00:11:45,519 --> 00:11:49,920
cunoaște alegerile lui Paul. Să spunem Paul

301
00:11:47,680 --> 00:11:53,200
ascultă o melodie nouă. Să-l numim ca

302
00:11:49,920 --> 00:11:55,600
cântecul A. Cântecul A are tempo rapid și a

303
00:11:53,200 --> 00:11:58,000
intensitate crescândă. Deci se află undeva

304
00:11:55,600 --> 00:12:00,240
aici. Privind datele, poți ghici

305
00:11:58,000 --> 00:12:02,800
dacă lui Paul îi va plăcea sau nu cântecul?

306
00:12:00,240 --> 00:12:05,040
Corecta. Deci lui Paul îi place acest cântec. De către

307
00:12:02,800 --> 00:12:07,519
Privind alegerile din trecut ale lui Paul, am fost

308
00:12:05,040 --> 00:12:10,160
capabil să clasifice cântecul necunoscut foarte

309
00:12:07,519 --> 00:12:12,800
usor, nu? Să spunem acum Paul

310
00:12:10,160 --> 00:12:16,880
ascultă o melodie nouă. Să-l etichetăm ca

311
00:12:12,800 --> 00:12:19,680
cântecul B. Deci cântecul B se află undeva aici

312
00:12:16,880 --> 00:12:22,399
cu tempo mediu și intensitate medie.

313
00:12:19,680 --> 00:12:24,639
Nici relaxat, nici rapid, nici ușor

314
00:12:22,399 --> 00:12:26,800
nici avântându-se. Acum, poți ghici dacă

315
00:12:24,639 --> 00:12:29,200
Lui Paul îi place sau nu? Nu pot ghici

316
00:12:26,800 --> 00:12:31,519
dacă lui Pavel îi va plăcea sau nu.

317
00:12:29,200 --> 00:12:34,320
Sunt alegerile neclare? Corecta. Noi

318
00:12:31,519 --> 00:12:36,639
putea clasifica cu ușurință cântecul A. Dar când

319
00:12:34,320 --> 00:12:39,120
alegerea a devenit complicată ca în

320
00:12:36,639 --> 00:12:40,880
cazul cântecului B. Da. Și acolo

321
00:12:39,120 --> 00:12:43,600
Învățarea automată intră. Să vedem

322
00:12:40,880 --> 00:12:45,839
Cum. În același exemplu pentru cântecul B, dacă

323
00:12:43,600 --> 00:12:48,240
desenăm un cerc în jurul cântecului B, noi

324
00:12:45,839 --> 00:12:50,959
vezi ca sunt patru voturi pentru like

325
00:12:48,240 --> 00:12:53,200
în timp ce un vot pentru antipatie. Dacă mergem

326
00:12:50,959 --> 00:12:54,959
pentru majoritatea voturilor, putem spune că

327
00:12:53,200 --> 00:12:56,720
Cu siguranță lui Paul îi va plăcea melodia.

328
00:12:54,959 --> 00:12:58,720
Asta e tot. Aceasta a fost o mașină de bază

329
00:12:56,720 --> 00:13:00,800
algoritm de învățare de asemenea. Se numeste K

330
00:12:58,720 --> 00:13:03,200
vecinii cei mai apropiati. Deci acesta este doar un

331
00:13:00,800 --> 00:13:05,920
mic exemplu într-una dintre multele mașini

332
00:13:03,200 --> 00:13:08,959
algoritmi de învățare destul de ușor corect

333
00:13:05,920 --> 00:13:11,440
crede-mă, dar ce se întâmplă când

334
00:13:08,959 --> 00:13:13,279
alegerile devin complicate ca în

335
00:13:11,440 --> 00:13:15,440
cazul cântecului B, atunci mașină

336
00:13:13,279 --> 00:13:17,519
învățarea vine în ea învață datele

337
00:13:15,440 --> 00:13:19,760
construiește modelul de predicție și când

338
00:13:17,519 --> 00:13:22,240
un nou punct de date vine cu ușurință

339
00:13:19,760 --> 00:13:24,800
prezice pentru ea mai mult datele mai bine

340
00:13:22,240 --> 00:13:26,800
modelul mai mare va fi precizia acolo

341
00:13:24,800 --> 00:13:29,120
sunt multe moduri în care mașina

342
00:13:26,800 --> 00:13:31,120
învață că poate fi fie supravegheat

343
00:13:29,120 --> 00:13:32,800
învăţarea învăţării nesupravegheate sau

344
00:13:31,120 --> 00:13:35,279
învăţarea prin întărire. Să mai întâi

345
00:13:32,800 --> 00:13:37,440
înțelege rapid învățarea supravegheată.

346
00:13:35,279 --> 00:13:39,920
Să presupunem că prietenul tău îți dă 1 milion

347
00:13:37,440 --> 00:13:43,200
monede din trei monede diferite. Spune

348
00:13:39,920 --> 00:13:45,279
1 rupie, 1 și 1 dirham. Fiecare monedă are

349
00:13:43,200 --> 00:13:49,120
greutăți diferite. De exemplu, o monedă

350
00:13:45,279 --> 00:13:51,839
de 1 rupia cantareste 3 g. 1 euro cantareste 7 g

351
00:13:49,120 --> 00:13:54,160
iar 1 dirham cântărește 4 g. Modelul tău va

352
00:13:51,839 --> 00:13:56,480
prezice moneda monedei. Aici

353
00:13:54,160 --> 00:13:58,639
greutatea ta devine caracteristica monedelor

354
00:13:56,480 --> 00:14:00,320
în timp ce moneda devine eticheta lor. Când

355
00:13:58,639 --> 00:14:03,040
furnizați aceste date mașinii

356
00:14:00,320 --> 00:14:05,440
model de învățare, învață care caracteristică

357
00:14:03,040 --> 00:14:07,920
este asociat cu ce etichetă. Pentru

358
00:14:05,440 --> 00:14:10,720
de exemplu, va învăța că dacă o monedă este

359
00:14:07,920 --> 00:14:12,320
de 3 g, va fi o monedă de 1 rupia. hai sa

360
00:14:10,720 --> 00:14:14,399
dă o monedă nouă mașinii. Pe

361
00:14:12,320 --> 00:14:16,480
baza greutății noii monede,

362
00:14:14,399 --> 00:14:19,120
modelul dvs. va prezice moneda.

363
00:14:16,480 --> 00:14:21,040
Prin urmare, învățarea supravegheată folosește eticheta

364
00:14:19,120 --> 00:14:23,199
date pentru antrenarea modelului. Aici,

365
00:14:21,040 --> 00:14:25,440
mașina cunoștea caracteristicile obiectului

366
00:14:23,199 --> 00:14:27,440
precum și etichetele asociate cu

367
00:14:25,440 --> 00:14:29,360
acele caracteristici. În această notă, să ne mișcăm

368
00:14:27,440 --> 00:14:31,040
la învățare nesupravegheată și pentru a vedea

369
00:14:29,360 --> 00:14:33,040
diferenta. Să presupunem că ai cricket

370
00:14:31,040 --> 00:14:35,199
setul de date al diverșilor jucători cu lor

371
00:14:33,040 --> 00:14:37,360
scorurile respective și wicket-urile luate.

372
00:14:35,199 --> 00:14:39,519
Când transmitem acest set de date către

373
00:14:37,360 --> 00:14:41,600
mașină, mașina identifică

374
00:14:39,519 --> 00:14:43,199
modelul performanței jucătorului. Deci, asta

375
00:14:41,600 --> 00:14:45,440
trasează aceste date cu respectivele

376
00:14:43,199 --> 00:14:47,120
wickets pe axa x în timp ce rulează pe

377
00:14:45,440 --> 00:14:49,279
axa y. Privind datele,

378
00:14:47,120 --> 00:14:51,279
vei vedea clar că sunt două

379
00:14:49,279 --> 00:14:53,600
clustere. Singurul grup sunt

380
00:14:51,279 --> 00:14:56,160
jucători care au marcat puncte mari și au luat

381
00:14:53,600 --> 00:14:58,399
mai puține wicket-uri în timp ce celălalt grup este

382
00:14:56,160 --> 00:15:00,880
dintre jucătorii care au înscris mai puține puncte dar

383
00:14:58,399 --> 00:15:03,199
a luat multe wickets. Deci aici interpretăm

384
00:15:00,880 --> 00:15:05,120
aceste două ciorchini ca batsmen și

385
00:15:03,199 --> 00:15:07,040
bowlieri. Punctul important de remarcat

386
00:15:05,120 --> 00:15:09,519
iată că nu existau etichete ale

387
00:15:07,040 --> 00:15:12,000
baterii şi bowlieri. De aici și învățarea

388
00:15:09,519 --> 00:15:13,760
cu date neetichetate este nesupravegheată

389
00:15:12,000 --> 00:15:15,600
învăţarea. Așa că am văzut învățarea supravegheată

390
00:15:13,760 --> 00:15:17,519
unde au fost etichetate datele și

391
00:15:15,600 --> 00:15:19,440
învățarea nesupravegheată unde se aflau datele

392
00:15:17,519 --> 00:15:21,040
neetichetat. Și apoi există

393
00:15:19,440 --> 00:15:22,959
învăţarea prin întărire care este a

394
00:15:21,040 --> 00:15:24,720
învăţare bazată pe recompense sau putem spune asta

395
00:15:22,959 --> 00:15:26,560
funcționează pe principiul feedback-ului.

396
00:15:24,720 --> 00:15:28,880
Aici să presupunem că oferiți sistemul

397
00:15:26,560 --> 00:15:31,600
cu o imagine a unui câine și cere-i să

398
00:15:28,880 --> 00:15:33,519
identificați-l. Sistemul îl identifică ca

399
00:15:31,600 --> 00:15:35,519
o pisica. Deci oferi un feedback negativ

400
00:15:33,519 --> 00:15:37,199
la aparat spunându-i că e al unui câine

401
00:15:35,519 --> 00:15:39,199
imagine. Mașina va învăța de la

402
00:15:37,199 --> 00:15:41,440
feedback și, în sfârșit, dacă apare

403
00:15:39,199 --> 00:15:43,440
orice altă imagine a unui câine, va putea

404
00:15:41,440 --> 00:15:45,440
pentru a o clasifica corect. Adică

405
00:15:43,440 --> 00:15:47,120
învăţarea prin întărire. A generaliza

406
00:15:45,440 --> 00:15:49,279
model de învățare automată, să vedem a

407
00:15:47,120 --> 00:15:50,880
organigramă. Intrarea este dată unei mașini

408
00:15:49,279 --> 00:15:52,480
model de învățare care oferă apoi cel

409
00:15:50,880 --> 00:15:54,560
ieșire conform algoritmului

410
00:15:52,480 --> 00:15:57,199
aplicat. Dacă este corect, luăm

411
00:15:54,560 --> 00:15:58,959
rezultatul nostru final. Altfel noi

412
00:15:57,199 --> 00:16:02,000
oferi feedback la modelul de instruire

413
00:15:58,959 --> 00:16:03,680
și cereți-i să prezică până învață. eu

414
00:16:02,000 --> 00:16:05,519
sper că ai înțeles supravegheat și

415
00:16:03,680 --> 00:16:07,440
învăţare nesupravegheată. Deci haideți să luăm un

416
00:16:05,519 --> 00:16:09,360
test rapid. Trebuie să determinați

417
00:16:07,440 --> 00:16:11,279
dacă scenariile date utilizează

418
00:16:09,360 --> 00:16:13,519
învăţare supravegheată sau nesupravegheată.

419
00:16:11,279 --> 00:16:15,680
Simplu, nu? Scenariul unu. Facebook

420
00:16:13,519 --> 00:16:19,040
recunoaște prietenul tău într-o poză din

421
00:16:15,680 --> 00:16:21,680
un album de fotografii etichetate.

422
00:16:19,040 --> 00:16:23,759
Scenariul doi, Netflix recomandă noi

423
00:16:21,680 --> 00:16:25,360
filme bazate pe filmul trecut al cuiva

424
00:16:23,759 --> 00:16:28,000
alegeri.

425
00:16:25,360 --> 00:16:30,399
Scenariul trei, analiza datelor bancare pentru

426
00:16:28,000 --> 00:16:32,720
tranzacții suspecte și semnalarea

427
00:16:30,399 --> 00:16:34,880
tranzacții frauduloase. Gândește cu înțelepciune și

428
00:16:32,720 --> 00:16:37,040
comentați mai jos răspunsurile dvs. Mergând mai departe,

429
00:16:34,880 --> 00:16:38,880
nu te întrebi uneori cum este

430
00:16:37,040 --> 00:16:40,800
învățarea automată este posibilă în zilele noastre

431
00:16:38,880 --> 00:16:43,519
epoca? Ei bine, asta pentru că astăzi avem

432
00:16:40,800 --> 00:16:46,000
date uriașe disponibile. Al tuturor

433
00:16:43,519 --> 00:16:47,759
online fie efectuând o tranzacție, fie

434
00:16:46,000 --> 00:16:50,079
doar navigând pe internet și atât

435
00:16:47,759 --> 00:16:52,480
generând o cantitate imensă de date fiecare

436
00:16:50,079 --> 00:16:54,560
minute și acele date prietenul meu este

437
00:16:52,480 --> 00:16:56,560
cheia analizei. De asemenea, memoria

438
00:16:54,560 --> 00:16:58,560
capabilitățile de manipulare ale computerelor au

439
00:16:56,560 --> 00:17:01,440
crescut în mare măsură ceea ce îi ajută să

440
00:16:58,560 --> 00:17:04,079
procesează o cantitate atât de mare de date la îndemână

441
00:17:01,440 --> 00:17:06,640
fără nicio întârziere. Și da, computere

442
00:17:04,079 --> 00:17:08,400
acum au puteri de calcul mari. Deci

443
00:17:06,640 --> 00:17:10,240
există o mulțime de aplicații ale

444
00:17:08,400 --> 00:17:12,000
învățare automată acolo. Pentru a numi un

445
00:17:10,240 --> 00:17:13,839
puține, învățarea automată este folosită în

446
00:17:12,000 --> 00:17:15,600
asistență medicală acolo unde sunt diagnostice

447
00:17:13,839 --> 00:17:17,600
prezis pentru evaluarea medicului. The

448
00:17:15,600 --> 00:17:19,760
analiza sentimentelor pe care giganții tehnologiei

449
00:17:17,600 --> 00:17:21,439
fac pe rețelele sociale este alta

450
00:17:19,760 --> 00:17:23,360
aplicație interesantă a mașinii

451
00:17:21,439 --> 00:17:25,360
învăţarea. Detectarea fraudelor în finanțe

452
00:17:23,360 --> 00:17:27,280
sector și, de asemenea, pentru a prezice client

453
00:17:25,360 --> 00:17:29,360
abandon în sectorul comerțului electronic. în timp ce

454
00:17:27,280 --> 00:17:31,760
rezervarea unui taxi, trebuie să fi întâlnit

455
00:17:29,360 --> 00:17:33,919
caută adesea prețuri acolo unde scrie

456
00:17:31,760 --> 00:17:35,919
târgul călătoriei dvs. a fost actualizat.

457
00:17:33,919 --> 00:17:38,799
Continuați rezervarea. Da, te rog. eu sunt

458
00:17:35,919 --> 00:17:40,799
întârzierea la birou. Ei bine, asta e un

459
00:17:38,799 --> 00:17:43,280
model interesant de învățare automată care

460
00:17:40,799 --> 00:17:44,960
este folosit de gigantul global al taximetriei Uber și

461
00:17:43,280 --> 00:17:47,200
altele unde au diferential

462
00:17:44,960 --> 00:17:49,280
stabilirea prețurilor în timp real în funcție de cerere,

463
00:17:47,200 --> 00:17:51,919
numărul de mașini disponibile, rău

464
00:17:49,280 --> 00:17:54,240
vremea, ora de vârf etc. Deci folosesc

465
00:17:51,919 --> 00:17:56,960
modelul de prețuri de căutare pentru a se asigura că

466
00:17:54,240 --> 00:17:59,440
cei care au nevoie de un taxi pot lua unul. De asemenea,

467
00:17:56,960 --> 00:18:01,440
folosește modelarea predictivă pentru a prezice

468
00:17:59,440 --> 00:18:03,520
unde cererea va fi mare cu a

469
00:18:01,440 --> 00:18:05,280
obiectivul că șoferii pot avea grijă de

470
00:18:03,520 --> 00:18:07,600
cererea și prețurile de căutare pot fi

471
00:18:05,280 --> 00:18:10,000
minimizat. Mare. Hei Siri, poți

472
00:18:07,600 --> 00:18:11,919
Amintește-mi să rezerv un taxi la 18:00. astăzi?

473
00:18:10,000 --> 00:18:12,640
>> Bine, vă reamintesc.

474
00:18:11,919 --> 00:18:13,600
>> Mulțumesc.

475
00:18:12,640 --> 00:18:15,120
>> Nicio problemă.

476
00:18:13,600 --> 00:18:16,640
>> Inteligență artificială, mașină

477
00:18:15,120 --> 00:18:18,559
învățarea și învățarea profundă reprezintă

478
00:18:16,640 --> 00:18:21,280
evolutia informaticii

479
00:18:18,559 --> 00:18:23,360
spre crearea de sisteme inteligente. AI

480
00:18:21,280 --> 00:18:25,039
este conceptul mai larg care se străduiește să construiască

481
00:18:23,360 --> 00:18:27,600
mașini capabile să fie asemănătoare omului

482
00:18:25,039 --> 00:18:29,840
inteligență. ML este un subset al AI

483
00:18:27,600 --> 00:18:32,320
punând accent pe algoritmi care învață din

484
00:18:29,840 --> 00:18:35,039
date pentru a face predicții sau decizii.

485
00:18:32,320 --> 00:18:37,360
DL la rândul său este o ramură specializată a ML

486
00:18:35,039 --> 00:18:39,919
care folosește rețele neuronale profunde pentru a

487
00:18:37,360 --> 00:18:42,400
modelați modele complexe. Imaginați-vă un AI

488
00:18:39,919 --> 00:18:45,120
asistent vocal alimentat precum Apple Siri.

489
00:18:42,400 --> 00:18:47,039
Utilizează ML pentru a înțelege și a răspunde

490
00:18:45,120 --> 00:18:49,200
la întrebările utilizatorilor, învățând din

491
00:18:47,039 --> 00:18:51,520
interacțiuni de-a lungul timpului. Învățare profundă

492
00:18:49,200 --> 00:18:53,520
intră în joc când Siri recunoaște

493
00:18:51,520 --> 00:18:55,520
modele de vorbire sau interpretări naturale

494
00:18:53,520 --> 00:18:57,840
limbaj folosind rețele neuronale pentru a

495
00:18:55,520 --> 00:18:59,760
procesează caracteristici complexe. Cu atât mai bine

496
00:18:57,840 --> 00:19:01,840
devine la înțelegere diversă

497
00:18:59,760 --> 00:19:03,440
accente sau răspunsuri rafinate

498
00:19:01,840 --> 00:19:06,080
exemplificând învăţarea continuă

499
00:19:03,440 --> 00:19:08,080
inerente acestor tehnologii. AI caută

500
00:19:06,080 --> 00:19:10,880
pentru a emula inteligența umană. ML

501
00:19:08,080 --> 00:19:13,360
valorifică datele pentru învățare și DL folosește

502
00:19:10,880 --> 00:19:15,520
rețele neuronale profunde pentru sarcini complicate.

503
00:19:13,360 --> 00:19:17,840
Integrarea acestor tehnologii

504
00:19:15,520 --> 00:19:20,000
se manifestă în aplicațiile de zi cu zi,

505
00:19:17,840 --> 00:19:22,400
transformând modul în care interacționăm cu și

506
00:19:20,000 --> 00:19:24,400
beneficiază de sisteme inteligente. Aceasta

507
00:19:22,400 --> 00:19:26,400
tehnologia permite interacțiunea vocală,

508
00:19:24,400 --> 00:19:28,480
permițând dispozitivului să redea muzică, setați

509
00:19:26,400 --> 00:19:30,880
alarme, prezentați cărți audio și furnizați

510
00:19:28,480 --> 00:19:32,799
informații actualizate pe subiecte precum

511
00:19:30,880 --> 00:19:35,360
știri, vreme, sport și trafic

512
00:19:32,799 --> 00:19:37,360
rapoarte, etc. Să mergem înainte și să vedem

513
00:19:35,360 --> 00:19:38,880
ce este învățarea automată. Masina

514
00:19:37,360 --> 00:19:40,960
învăţarea este un subset de artificial

515
00:19:38,880 --> 00:19:42,880
inteligență care se concentrează pe dezvoltare

516
00:19:40,960 --> 00:19:45,039
algoritmi si modele capabile de

517
00:19:42,880 --> 00:19:47,200
învăţarea şi realizarea de predicţii sau

518
00:19:45,039 --> 00:19:49,360
decizii fără a fi în mod explicit

519
00:19:47,200 --> 00:19:51,679
programat. Sistemele ML folosesc date pentru

520
00:19:49,360 --> 00:19:53,360
recunoașteți tipare, adaptați și îmbunătățiți

521
00:19:51,679 --> 00:19:55,039
performanța lor în timp. Există

522
00:19:53,360 --> 00:19:57,120
mai multe tipuri de învățare automată.

523
00:19:55,039 --> 00:19:59,440
Numărul unu, învățarea supravegheată. The

524
00:19:57,120 --> 00:20:01,600
algoritmul este antrenat pe un set de date de etichetă

525
00:19:59,440 --> 00:20:03,600
unde fiecare intrare este asociată cu a

526
00:20:01,600 --> 00:20:05,760
ieșirea corespunzătoare. Vine numărul doi

527
00:20:03,600 --> 00:20:07,600
ca învăţare nesupravegheată. Nesupravegheat

528
00:20:05,760 --> 00:20:09,440
învăţarea se ocupă de date neetichetate la

529
00:20:07,600 --> 00:20:11,360
găsiți modele sau structuri inerente

530
00:20:09,440 --> 00:20:13,679
în cadrul informațiilor. Și apoi vine

531
00:20:11,360 --> 00:20:15,280
învăţarea prin întărire. Acest tip

532
00:20:13,679 --> 00:20:17,200
implică pregătirea agenților de a realiza

533
00:20:15,280 --> 00:20:19,280
secvenţe de decizii prin interacţiune

534
00:20:17,200 --> 00:20:20,960
cu un mediu. Și apoi vine

535
00:20:19,280 --> 00:20:22,480
învăţare semi-supravegheată.

536
00:20:20,960 --> 00:20:24,240
Se combină învățarea semi-supravegheată

537
00:20:22,480 --> 00:20:26,160
învățarea supravegheată și nesupravegheată

538
00:20:24,240 --> 00:20:28,480
elemente folosind de obicei o cantitate mică

539
00:20:26,160 --> 00:20:30,640
de date etichetate și un număr mai mare de

540
00:20:28,480 --> 00:20:32,559
date neetichetate. Să mergem înainte și

541
00:20:30,640 --> 00:20:34,240
vezi ce este învățarea profundă. Adânc

542
00:20:32,559 --> 00:20:36,240
învățarea, o ramură a învățării automate,

543
00:20:34,240 --> 00:20:38,320
se concentrează pe algoritmi inspirați de

544
00:20:36,240 --> 00:20:40,320
structura și funcționalitatea creierului uman.

545
00:20:38,320 --> 00:20:42,320
Excelează în procesarea unor cantități mari de

546
00:20:40,320 --> 00:20:43,919
date structurate și nestructurate.

547
00:20:42,320 --> 00:20:45,760
În centrul învățării profunde se află

548
00:20:43,919 --> 00:20:47,840
rețele neuronale artificiale, împuternicire

549
00:20:45,760 --> 00:20:49,280
mașini pentru a lua decizii. Cheia

550
00:20:47,840 --> 00:20:50,720
distincția între învățarea profundă și

551
00:20:49,280 --> 00:20:52,159
învățarea automată se află în date

552
00:20:50,720 --> 00:20:53,919
prezentare. Învățare automată

553
00:20:52,159 --> 00:20:55,679
algoritmii cer de obicei structurat

554
00:20:53,919 --> 00:20:57,120
date în timp ce rețelele de deep learning

555
00:20:55,679 --> 00:20:59,200
operează prin mai multe straturi de

556
00:20:57,120 --> 00:21:02,159
rețele neuronale artificiale care le permit

557
00:20:59,200 --> 00:21:03,440
pentru a gestiona diverse formate de date. Deci haideți

558
00:21:02,159 --> 00:21:04,880
începe cu diferența dintre

559
00:21:03,440 --> 00:21:07,440
inteligență artificială, mașină

560
00:21:04,880 --> 00:21:09,919
învăţare şi învăţare profundă. Și asta

561
00:21:07,440 --> 00:21:11,840
vom arăta sub formă de tabel. Deci incepand

562
00:21:09,919 --> 00:21:13,840
cu definitia.

563
00:21:11,840 --> 00:21:16,480
Deci definiția artificială

564
00:21:13,840 --> 00:21:18,000
inteligență. Câmp atât de larg al mașinii

565
00:21:16,480 --> 00:21:19,760
învăţarea sau crearea de maşini cu

566
00:21:18,000 --> 00:21:21,360
comportamentul inteligent este artificial

567
00:21:19,760 --> 00:21:23,360
inteligență. Și când vorbim despre

568
00:21:21,360 --> 00:21:25,120
învățarea automată, este subsetul AI

569
00:21:23,360 --> 00:21:27,200
concentrându-se pe algoritmi care învață din

570
00:21:25,120 --> 00:21:29,360
date. Și apoi vine învățarea profundă

571
00:21:27,200 --> 00:21:32,080
care este un subset specializat de ML folosind

572
00:21:29,360 --> 00:21:33,600
rețele neuronale profunde. Și acum vom vedea

573
00:21:32,080 --> 00:21:35,919
diferența cu învățarea

574
00:21:33,600 --> 00:21:37,520
abordare între toate acestea trei. Deci in

575
00:21:35,919 --> 00:21:39,440
abordarea învățării artificiale

576
00:21:37,520 --> 00:21:42,080
inteligența poate include bazate pe reguli

577
00:21:39,440 --> 00:21:43,919
sisteme, sistem expert și multe altele. Și în

578
00:21:42,080 --> 00:21:46,559
machine learning, învață din date

579
00:21:43,919 --> 00:21:48,240
modele fără programare explicită.

580
00:21:46,559 --> 00:21:50,400
Și apoi vine învățarea profundă unde

581
00:21:48,240 --> 00:21:52,640
învaţă reprezentarea ierarhică

582
00:21:50,400 --> 00:21:54,880
folosind rețele neuronale. Și dacă vorbim

583
00:21:52,640 --> 00:21:57,039
despre domeniul de aplicare, acesta cuprinde diverse

584
00:21:54,880 --> 00:21:58,799
tehnici dincolo de învăţarea din date.

585
00:21:57,039 --> 00:22:01,120
Și în învățarea automată, în primul rând

586
00:21:58,799 --> 00:22:02,960
concentrați-vă pe modelele de învățare din date.

587
00:22:01,120 --> 00:22:04,799
Și apoi învățarea profundă, asta

588
00:22:02,960 --> 00:22:07,679
utilizează în mod specific neuronale profunde

589
00:22:04,799 --> 00:22:09,440
rețele pentru sarcini complexe. Și acum vom face

590
00:22:07,679 --> 00:22:12,080
trece la următoarea diferență. Și vom face

591
00:22:09,440 --> 00:22:14,400
începe cu un exemplu. Deci în artificial

592
00:22:12,080 --> 00:22:17,440
inteligenta, exemplul este autonom

593
00:22:14,400 --> 00:22:18,880
vehicule, chatboard-uri sau sisteme expert.

594
00:22:17,440 --> 00:22:20,799
Și pentru învățarea automată, este spam

595
00:22:18,880 --> 00:22:22,799
filtre, sisteme de recomandare, imagine

596
00:22:20,799 --> 00:22:25,280
recunoaștere. Și în învățarea profundă este

597
00:22:22,799 --> 00:22:27,520
recunoașterea imaginii și a vorbirii naturale

598
00:22:25,280 --> 00:22:29,039
prelucrarea limbajului. Și acum vom vedea

599
00:22:27,520 --> 00:22:31,039
diferența pentru date

600
00:22:29,039 --> 00:22:32,960
cerințe. Deci depinde de

601
00:22:31,039 --> 00:22:34,880
aplicație specifică și rezolvarea problemelor

602
00:22:32,960 --> 00:22:36,799
abordare. Și în învățarea automată

603
00:22:34,880 --> 00:22:38,799
necesită date etichetate sau neetichetate sau

604
00:22:36,799 --> 00:22:40,799
antrenament. Și pentru învățarea profundă

605
00:22:38,799 --> 00:22:44,000
se bazează pe cantități mari de date etichetate

606
00:22:40,799 --> 00:22:46,400
pentru formarea rețelelor profunde. Și acum pentru

607
00:22:44,000 --> 00:22:48,480
complexitatea inteligenței artificiale

608
00:22:46,400 --> 00:22:50,400
se adresează unei game largi de sarcini, inclusiv

609
00:22:48,480 --> 00:22:52,240
cei dincolo de ML. Și în mașină

610
00:22:50,400 --> 00:22:54,720
învăţare, se ocupă cu moderată la

611
00:22:52,240 --> 00:22:56,320
sarcină complexă în funcție de algoritmi.

612
00:22:54,720 --> 00:22:58,640
Și pentru învățarea profundă, este bine

613
00:22:56,320 --> 00:23:00,480
potrivit pentru sarcini complicate adesea

614
00:22:58,640 --> 00:23:03,919
necesită un calcul substanțial

615
00:23:00,480 --> 00:23:06,240
resurse. Și acum vedeți flexibilitatea.

616
00:23:03,919 --> 00:23:08,320
Deci, pentru inteligența artificială, asta

617
00:23:06,240 --> 00:23:10,480
pot fi bazate pe reguli, în evoluție și

618
00:23:08,320 --> 00:23:12,960
adaptativ. Și pentru învățarea automată,

619
00:23:10,480 --> 00:23:14,960
flexibilitatea se adaptează tiparelor şi

620
00:23:12,960 --> 00:23:17,120
modificările de date. Și pentru adânc

621
00:23:14,960 --> 00:23:20,400
învăţare, se adaptează la ierarhic

622
00:23:17,120 --> 00:23:23,280
reprezentări și diverse tipuri de date.

623
00:23:20,400 --> 00:23:25,039
Și apoi vine procesul de pregătire. Deci

624
00:23:23,280 --> 00:23:27,200
în inteligență artificială, antrenament

625
00:23:25,039 --> 00:23:28,799
procesul variază în funcție de IA specifică

626
00:23:27,200 --> 00:23:31,039
tehnici folosite. Și în mașină

627
00:23:28,799 --> 00:23:33,679
învăţare, antrenamentul implică furnizarea de date

628
00:23:31,039 --> 00:23:35,120
și ajustarea parametrilor modelului. Și în

629
00:23:33,679 --> 00:23:37,039
învățare profundă, antrenamentul implică

630
00:23:35,120 --> 00:23:39,120
optimizarea greutăților neuronale și

631
00:23:37,039 --> 00:23:40,880
structurilor. Și acum vom vorbi despre

632
00:23:39,120 --> 00:23:43,760
aplicații între toate acestea trei

633
00:23:40,880 --> 00:23:45,840
termeni care sunt IML și deep learning.

634
00:23:43,760 --> 00:23:47,520
Deci, pentru inteligența artificială

635
00:23:45,840 --> 00:23:49,840
aplicațiile sunt robotice, naturale

636
00:23:47,520 --> 00:23:51,600
procesarea limbajului, jocul și

637
00:23:49,840 --> 00:23:53,600
pentru învățarea automată este predictivă

638
00:23:51,600 --> 00:23:55,520
analiză, detectarea fraudelor și

639
00:23:53,600 --> 00:23:57,600
diagnostic de sănătate și pentru profund

640
00:23:55,520 --> 00:23:59,520
învățarea care este recunoașterea imaginii,

641
00:23:57,600 --> 00:24:00,240
sinteza vorbirii și limbajul

642
00:23:59,520 --> 00:24:02,159
traducere.

643
00:24:00,240 --> 00:24:05,760
>> Acum, băieți, trebuie să vă gândiți de ce ar trebui

644
00:24:02,159 --> 00:24:08,720
Consider o carieră în AI? Ei bine, AI este

645
00:24:05,760 --> 00:24:11,600
nu doar o tendință trecătoare. Este un seismic

646
00:24:08,720 --> 00:24:14,159
schimbare care ne remodelează lumea și

647
00:24:11,600 --> 00:24:16,799
crearea de noi locuri pentru inovare și

648
00:24:14,159 --> 00:24:19,760
descoperire. Acum, îmbrățișând o carieră în

649
00:24:16,799 --> 00:24:22,559
AI, devii o parte a câmpului dinamic

650
00:24:19,760 --> 00:24:25,279
care prosperă pe rezolvarea unei probleme complexe,

651
00:24:22,559 --> 00:24:28,159
împingând granițele și făcând o profundă

652
00:24:25,279 --> 00:24:30,559
impact asupra societății. Cererea de AI

653
00:24:28,159 --> 00:24:32,960
profesioniștii crește vertiginos peste

654
00:24:30,559 --> 00:24:34,720
industrii din domeniul sănătății, finanțe,

655
00:24:32,960 --> 00:24:37,039
divertisment, transport.

656
00:24:34,720 --> 00:24:39,520
Organizațiile caută activ

657
00:24:37,039 --> 00:24:42,080
indivizi talentați care pot valorifica

658
00:24:39,520 --> 00:24:44,559
puterea AI și să-și conducă afacerea

659
00:24:42,080 --> 00:24:46,799
redirecţiona. Dar pentru ce aptitudini este nevoie

660
00:24:44,559 --> 00:24:49,120
devii inginer AI? Cum poți

661
00:24:46,799 --> 00:24:51,840
porniți în această călătorie palpitantă? Noi

662
00:24:49,120 --> 00:24:53,840
ai răspunsul la toate întrebările tale.

663
00:24:51,840 --> 00:24:56,559
Unii pași sunt cruciali pentru a stăpâni

664
00:24:53,840 --> 00:24:59,440
domeniul AI și deveniți inginer AI.

665
00:24:56,559 --> 00:25:01,600
Să le parcurgem foarte repede. Deci

666
00:24:59,440 --> 00:25:03,679
primul pas este de a stabili un puternic

667
00:25:01,600 --> 00:25:06,640
fundament în matematică și

668
00:25:03,679 --> 00:25:08,960
programare. Începeți prin a obține un solid

669
00:25:06,640 --> 00:25:12,080
înțelegerea matematicii critice

670
00:25:08,960 --> 00:25:14,720
concept precum algebra liniară, calculul

671
00:25:12,080 --> 00:25:16,720
și teoria probabilității. În plus, acesta

672
00:25:14,720 --> 00:25:19,600
este esențial pentru a deveni competent

673
00:25:16,720 --> 00:25:22,240
limbaje de programare precum Python care

674
00:25:19,600 --> 00:25:25,200
este folosit în mod obișnuit în IA și dezvoltă

675
00:25:22,240 --> 00:25:27,200
abilități de codificare. În continuare, trebuie să urmăriți

676
00:25:25,200 --> 00:25:29,520
o diplomă în domeniul relevant. Câștigă

677
00:25:27,200 --> 00:25:32,480
diplomă de licență sau master în

678
00:25:29,520 --> 00:25:34,640
informatică, știința datelor, AI sau a

679
00:25:32,480 --> 00:25:37,039
disciplina legata de a dobandi a

680
00:25:34,640 --> 00:25:39,919
înțelegere cuprinzătoare a IA

681
00:25:37,039 --> 00:25:42,080
principiu și tehnici și după aceea

682
00:25:39,919 --> 00:25:44,640
trebuie să dobândești cunoștințe în mașină

683
00:25:42,080 --> 00:25:47,200
învăţare şi învăţare profundă. Familiarizați-vă

684
00:25:44,640 --> 00:25:50,240
tu cu algoritmi ML, neuronali

685
00:25:47,200 --> 00:25:53,120
cadre de rețea și de învățare profundă

686
00:25:50,240 --> 00:25:56,240
cum ar fi, de exemplu, TensorFlow, PyTorch to

687
00:25:53,120 --> 00:25:59,520
antrenați și optimizați modele folosind real

688
00:25:56,240 --> 00:26:02,000
seturi de date mondiale și apoi să se angajeze în

689
00:25:59,520 --> 00:26:04,480
proiecte practice. Câștigă hands-on

690
00:26:02,000 --> 00:26:08,080
experiență și demonstrează-ți abilitățile

691
00:26:04,480 --> 00:26:10,400
lucrând la proiecte AI. Clădirea a

692
00:26:08,080 --> 00:26:13,360
portofoliu de proiecte care vă prezintă

693
00:26:10,400 --> 00:26:15,200
capacitatea de a rezolva problemele AI poate face a

694
00:26:13,360 --> 00:26:18,559
impresie puternică asupra potențialului

695
00:26:15,200 --> 00:26:20,720
angajatorii. După aceea, colaborați și

696
00:26:18,559 --> 00:26:23,200
rețea. Acest lucru este cu adevărat important.

697
00:26:20,720 --> 00:26:25,919
Interacționează cu comunitățile AR, participă

698
00:26:23,200 --> 00:26:28,559
conferințe și participați la online

699
00:26:25,919 --> 00:26:31,200
forumuri pentru a intra în legătură cu profesioniști în

700
00:26:28,559 --> 00:26:33,840
acest domeniu. Colaborarea cu ceilalți

701
00:26:31,200 --> 00:26:36,480
vă poate îmbunătăți experiența de învățare și

702
00:26:33,840 --> 00:26:39,919
deschide noi oportunități.

703
00:26:36,480 --> 00:26:42,240
Căutați stagii de practică sau posturi la nivel de intrare

704
00:26:39,919 --> 00:26:44,960
unde poți câștiga experiență practică

705
00:26:42,240 --> 00:26:47,039
prin stagii AI sau la nivel de intrare

706
00:26:44,960 --> 00:26:49,279
roluri în industrie sau cercetare

707
00:26:47,039 --> 00:26:51,520
instituție. Acum aceasta va oferi

708
00:26:49,279 --> 00:26:54,159
expunere valoroasă și vă ajută în continuare

709
00:26:51,520 --> 00:26:56,960
dezvolta-ti abilitatile. După aceea

710
00:26:54,159 --> 00:26:59,440
învață și adaptează continuu. În

711
00:26:56,960 --> 00:27:01,200
lumea rapidă a AR, este foarte

712
00:26:59,440 --> 00:27:04,000
important să fii la curent cu noile

713
00:27:01,200 --> 00:27:06,559
dezvoltări, explorați domenii specializate,

714
00:27:04,000 --> 00:27:08,559
și să îmbrățișeze tehnologiile emergente și

715
00:27:06,559 --> 00:27:10,880
unelte. Învățare continuă și

716
00:27:08,559 --> 00:27:14,080
adaptabilitatea sunt esențiale pentru urmărire

717
00:27:10,880 --> 00:27:16,000
o carieră de succes ca inginer AI.

718
00:27:14,080 --> 00:27:17,679
Acum că ești familiarizat cu pașii

719
00:27:16,000 --> 00:27:19,919
implicat în călătoria unei IA

720
00:27:17,679 --> 00:27:22,159
inginer, hai să discutăm despre esențial

721
00:27:19,919 --> 00:27:24,559
abilitățile pe care trebuie să le cunoașteți pentru a deveni IA

722
00:27:22,159 --> 00:27:26,960
inginer. Deci, iată o defalcare a

723
00:27:24,559 --> 00:27:29,440
aptitudinile necesare. Prima este a avea

724
00:27:26,960 --> 00:27:32,000
abilități puternice de programare. Aceasta

725
00:27:29,440 --> 00:27:34,480
de obicei se referă la expertiză într-unul sau

726
00:27:32,000 --> 00:27:37,120
mai multe limbaje de programare utilizate în mod obișnuit

727
00:27:34,480 --> 00:27:40,080
în știința datelor și învățarea automată

728
00:27:37,120 --> 00:27:42,640
cum ar fi limbajul Python sau R. Acum,

729
00:27:40,080 --> 00:27:45,440
competența în programare vă permite

730
00:27:42,640 --> 00:27:48,400
scrie cod eficient și scalabil pentru

731
00:27:45,440 --> 00:27:49,919
analiza datelor, modelare și algoritm

732
00:27:48,400 --> 00:27:51,760
implementare.

733
00:27:49,919 --> 00:27:53,840
În continuare, aveți nevoie de cunoștințe despre mașină

734
00:27:51,760 --> 00:27:56,320
algoritmi de învățare. Aceasta implică

735
00:27:53,840 --> 00:27:58,640
înţelegere şi familiaritate cu largi

736
00:27:56,320 --> 00:28:00,720
gama de algoritmi de învățare automată

737
00:27:58,640 --> 00:28:03,600
inclusiv atât supravegheate cât şi

738
00:28:00,720 --> 00:28:05,760
tehnici nesupravegheate. Ar trebui să fii

739
00:28:03,600 --> 00:28:08,559
capabil să selecteze și să aplice adecvat

740
00:28:05,760 --> 00:28:10,720
algoritmi și pentru probleme specifice

741
00:28:08,559 --> 00:28:13,520
ca evaluarea si optimizarea acestora

742
00:28:10,720 --> 00:28:16,559
performanta. Următoarea abilitate este competența

743
00:28:13,520 --> 00:28:18,880
în statistică şi matematică. Sunetul

744
00:28:16,559 --> 00:28:21,520
cunoștințe de statistică și matematică

745
00:28:18,880 --> 00:28:23,600
este fundamentală pentru analiza datelor şi

746
00:28:21,520 --> 00:28:25,679
învățarea automată. Ar trebui să fii

747
00:28:23,600 --> 00:28:28,399
confortabil cu conceptele statistice,

748
00:28:25,679 --> 00:28:31,120
testarea ipotezelor, analiza regresiei,

749
00:28:28,399 --> 00:28:32,960
teoria probabilităților, algebră liniară și

750
00:28:31,120 --> 00:28:35,039
calculul.

751
00:28:32,960 --> 00:28:37,120
Acum, după aceea, ai dobândit un bun

752
00:28:35,039 --> 00:28:39,840
cantitatea de cunoștințe despre acest set de abilități,

753
00:28:37,120 --> 00:28:42,080
vom trece la următoarea noastră abilitate care este

754
00:28:39,840 --> 00:28:44,799
fiind familiarizat cu învățarea profundă

755
00:28:42,080 --> 00:28:47,520
cadre. Acum învățarea profundă a câștigat

756
00:28:44,799 --> 00:28:49,600
popularitate semnificativă în ultimii ani

757
00:28:47,520 --> 00:28:52,399
și familiaritatea cu învățarea profundă

758
00:28:49,600 --> 00:28:55,919
cadre precum TensorFlow, PyTorch sau

759
00:28:52,399 --> 00:28:57,520
Keras este valoros. Acum aceste cadre

760
00:28:55,919 --> 00:28:59,600
oferi instrumente și biblioteci pt

761
00:28:57,520 --> 00:29:02,480
construirea, instruirea și desfășurarea profundă

762
00:28:59,600 --> 00:29:04,960
rețele neuronale pentru sarcini precum imaginea

763
00:29:02,480 --> 00:29:08,399
recunoaștere, procesare a limbajului natural

764
00:29:04,960 --> 00:29:11,120
și analiza serii de timp. În continuare, ai nevoie

765
00:29:08,399 --> 00:29:13,039
experiență cu tehnologiile de date mari.

766
00:29:11,120 --> 00:29:14,960
Se ocupă de seturi de date la scară largă

767
00:29:13,039 --> 00:29:17,520
necesită cunoștințe de date mari

768
00:29:14,960 --> 00:29:19,600
tehnologii precum Apache, Hadoop,

769
00:29:17,520 --> 00:29:22,000
Spark sau calcul distribuit

770
00:29:19,600 --> 00:29:24,000
cadre. Înțelegerea cum să

771
00:29:22,000 --> 00:29:26,399
procesează, stochează și analizează datele

772
00:29:24,000 --> 00:29:28,559
eficient în medii distribuite

773
00:29:26,399 --> 00:29:30,399
este foarte esential. Acum, după ce ai

774
00:29:28,559 --> 00:29:32,399
am dobândit experiență cu big data

775
00:29:30,399 --> 00:29:34,080
tehnologii, acum este momentul să facem mișcare

776
00:29:32,399 --> 00:29:36,480
la următoarea noastră abilitate pe care o avem

777
00:29:34,080 --> 00:29:39,120
excelentă rezolvare a problemelor și analitică

778
00:29:36,480 --> 00:29:42,080
aptitudini. Acum aceste abilități îți vor permite

779
00:29:39,120 --> 00:29:44,559
pentru a defalca probleme complexe, identifica

780
00:29:42,080 --> 00:29:46,159
factori cheie și se dezvoltă eficient

781
00:29:44,559 --> 00:29:48,000
solutie.

782
00:29:46,159 --> 00:29:50,080
Acum ar trebui să te poți adapta la

783
00:29:48,000 --> 00:29:52,159
gândire critică, depanare și

784
00:29:50,080 --> 00:29:54,480
depanare pentru a gestiona lumea reală

785
00:29:52,159 --> 00:29:56,880
provocări în știința datelor și mașini

786
00:29:54,480 --> 00:29:59,200
învăţarea. Deci băieți, amintiți-vă să rămâneți

787
00:29:56,880 --> 00:30:01,520
actualizat cu cele mai recente progrese în

788
00:29:59,200 --> 00:30:03,840
câmpul și continuă să înveți să rămâi

789
00:30:01,520 --> 00:30:06,320
în fruntea științei datelor și

790
00:30:03,840 --> 00:30:08,799
învățarea automată. Deci asta e tot ce aveam

791
00:30:06,320 --> 00:30:11,600
pentru tine în această foaie de parcurs pentru inginer AI. Fă

792
00:30:08,799 --> 00:30:13,760
știi cum AI a devenit atât de rapid? Este

793
00:30:11,600 --> 00:30:17,120
acum înlocuind echipe întregi în unele

794
00:30:13,760 --> 00:30:19,360
industrii. Da, este adevărat. Peste 50% din

795
00:30:17,120 --> 00:30:21,840
companiile folosesc deja AI pentru

796
00:30:19,360 --> 00:30:24,000
automatizarea locurilor de muncă. Instrumentele AI scriu

797
00:30:21,840 --> 00:30:26,320
e-mailuri, crearea de conținut și chiar

798
00:30:24,000 --> 00:30:28,799
acordarea interviurilor de angajare. Și în timp ce unii

799
00:30:26,320 --> 00:30:31,919
oamenii sunt îngrijorați că AI va prelua postul,

800
00:30:28,799 --> 00:30:34,640
Ți-am spus un secret. AI este, de asemenea

801
00:30:31,919 --> 00:30:37,039
creând tone de roluri bine plătite. The

802
00:30:34,640 --> 00:30:39,600
prindeți, aveți nevoie de abilitățile potrivite pentru a obține

803
00:30:37,039 --> 00:30:41,919
ea. Și asta începe cu învățarea cu

804
00:30:39,600 --> 00:30:44,320
limbajul de programare potrivit. Acum,

805
00:30:41,919 --> 00:30:48,159
Am testat o grămadă de ele.

806
00:30:44,320 --> 00:30:50,799
Python, C, R, Java, ce-i spune. Şi

807
00:30:48,159 --> 00:30:54,000
în acest videoclip, defalc partea de sus

808
00:30:50,799 --> 00:30:56,000
cinci limbaje de programare pentru AI care

809
00:30:54,000 --> 00:30:58,480
trebuie să știi dacă vrei să construiești un

810
00:30:56,000 --> 00:31:01,360
carieră, obține locuri de muncă reale și, de fapt

811
00:30:58,480 --> 00:31:04,080
rămâne relevant în era AI. Vom face

812
00:31:01,360 --> 00:31:06,480
acoperiți la ce este cel mai bine fiecare limbă, cum

813
00:31:04,080 --> 00:31:09,279
pentru a începe să învețe, ce fel de locuri de muncă AI

814
00:31:06,480 --> 00:31:12,000
duc la, și da, cât de mult poți

815
00:31:09,279 --> 00:31:14,559
castiga cu fiecare. Bine, mai întâi,

816
00:31:12,000 --> 00:31:17,440
avem Python. Și sincer, acesta

817
00:31:14,559 --> 00:31:19,919
este cel mai valoros jucător al AI

818
00:31:17,440 --> 00:31:22,799
dezvoltare. La fel ca jucătorul vedetă

819
00:31:19,919 --> 00:31:26,000
într-o echipă sportivă, Python este alegerea

820
00:31:22,799 --> 00:31:28,559
limbaj pe care se bazează toată lumea atunci când acesta

821
00:31:26,000 --> 00:31:30,880
vine la construirea unui sistem AI. Deci, de ce este

822
00:31:28,559 --> 00:31:34,000
Python, regele AI? Lasă-mă să-l rup

823
00:31:30,880 --> 00:31:36,559
jos. Simplitate și lizibilitate. Acum,

824
00:31:34,000 --> 00:31:38,960
Python este foarte ușor de învățat. Este

825
00:31:36,559 --> 00:31:40,399
aproape ca scris într-o engleză simplă.

826
00:31:38,960 --> 00:31:42,320
Nu trebuie să-ți faci griji

827
00:31:40,399 --> 00:31:44,480
cod complicat. Dacă ești doar

828
00:31:42,320 --> 00:31:47,039
începând cu programare, adică

829
00:31:44,480 --> 00:31:49,360
cu siguranță limba în care vei merge

830
00:31:47,039 --> 00:31:52,080
te simti cel mai confortabil cu. Are

831
00:31:49,360 --> 00:31:54,640
această atmosferă prietenoasă care o face

832
00:31:52,080 --> 00:31:56,559
simplu chiar și pentru cei care nu cunosc codificare.

833
00:31:54,640 --> 00:31:58,799
În al doilea rând, a devenit nesfârșit

834
00:31:56,559 --> 00:32:00,960
biblioteci. Acum, Python este plin

835
00:31:58,799 --> 00:32:03,919
unelte. Îi spunem biblioteci ca

836
00:32:00,960 --> 00:32:06,320
TensorFlow, PyTorch și Scikitlearn.

837
00:32:03,919 --> 00:32:09,360
Gândiți-vă la aceste biblioteci ca fiind prefabricate

838
00:32:06,320 --> 00:32:11,840
truse de instrumente care fac dezvoltarea AI

839
00:32:09,360 --> 00:32:13,760
mai usor. Vă economisesc mult timp

840
00:32:11,840 --> 00:32:15,760
pentru că în loc să construiască totul

841
00:32:13,760 --> 00:32:18,320
de la zero, le puteți folosi

842
00:32:15,760 --> 00:32:20,880
biblioteci pentru a vă instrui rapid modelele

843
00:32:18,320 --> 00:32:23,440
și rulați algoritmi. E ca și cum ai avea un

844
00:32:20,880 --> 00:32:26,000
comandă rapidă pentru construirea sistemului AI. Are

845
00:32:23,440 --> 00:32:28,720
a primit, de asemenea, prototipare rapidă. Dacă ai nevoie

846
00:32:26,000 --> 00:32:30,720
pentru a-ți testa ideile rapid, Python este

847
00:32:28,720 --> 00:32:33,360
perfect pentru asta. Puteți construi un model,

848
00:32:30,720 --> 00:32:35,360
o versiune simplă a sistemului dumneavoastră AI la nr

849
00:32:33,360 --> 00:32:37,279
timp. Deci, indiferent dacă lucrați

850
00:32:35,360 --> 00:32:39,760
modele de învățare automată sau neuronale

851
00:32:37,279 --> 00:32:42,240
rețele, cuvânt de lux pentru sistem AI care

852
00:32:39,760 --> 00:32:45,120
Învață ca creierul, te lasă Python

853
00:32:42,240 --> 00:32:47,039
prototipați sau construiți rapid un model rapid.

854
00:32:45,120 --> 00:32:49,919
Așa că știu că trebuie să te întrebi acum ce

855
00:32:47,039 --> 00:32:52,640
un fel de locuri de muncă AI poate Python să mă aterizeze? Este

856
00:32:49,919 --> 00:32:55,279
o intrebare grozava. Cu Python, ai putea

857
00:32:52,640 --> 00:32:58,320
locuri de muncă de teren, cum ar fi științific de date, mașină

858
00:32:55,279 --> 00:33:00,399
inginer de învățare sau un cercetător AI.

859
00:32:58,320 --> 00:33:03,360
Acum, aceste locuri de muncă plătesc de obicei între

860
00:33:00,399 --> 00:33:05,600
aproximativ șase lakh până la 15 lakh peranom.

861
00:33:03,360 --> 00:33:07,760
Acesta este intervalul de salariu. Dar cel mai bun

862
00:33:05,600 --> 00:33:10,159
parte este pe măsură ce câștigi mai multă experiență și

863
00:33:07,760 --> 00:33:12,880
expertiza acel număr va merge bine

864
00:33:10,159 --> 00:33:15,120
mai înalt. Deci, cum începi să înveți

865
00:33:12,880 --> 00:33:17,440
Piton? Nu trebuie să spargi banca

866
00:33:15,120 --> 00:33:19,679
pentru a învăța Python. Puteți începe

867
00:33:17,440 --> 00:33:22,159
cu platforme gratuite și YouTube

868
00:33:19,679 --> 00:33:24,559
canale. Pur și simplu învață chiar și oferte a

869
00:33:22,159 --> 00:33:26,240
curs cuprinzător gratuit în Python și

870
00:33:24,559 --> 00:33:29,039
Vă las linkul pentru a verifica

871
00:33:26,240 --> 00:33:31,600
afară. Și cea mai bună parte este că Python are

872
00:33:29,039 --> 00:33:34,000
comunitate imensă. Deci dacă simți vreodată

873
00:33:31,600 --> 00:33:36,399
blocat, mereu e cineva acolo

874
00:33:34,000 --> 00:33:39,679
care este gata să te ajute. În continuare, vom face

875
00:33:36,399 --> 00:33:42,000
vorbim despre C. Acum C nu mai este ca

876
00:33:39,679 --> 00:33:44,640
prietenos pentru începători ca Python, dar este un

877
00:33:42,000 --> 00:33:46,720
bestie când vine vorba de performanță grea

878
00:33:44,640 --> 00:33:49,600
aplicatii. Dacă lucrezi la

879
00:33:46,720 --> 00:33:52,240
AI în timp real, cum ar fi mașinile autonome sau

880
00:33:49,600 --> 00:33:55,360
atunci, algoritmi de tranzacționare de înaltă frecvență

881
00:33:52,240 --> 00:33:58,240
C este locul unde vrei să fii. Dar de ce a făcut-o

882
00:33:55,360 --> 00:34:00,799
alegem C pentru AI? In primul rand,

883
00:33:58,240 --> 00:34:03,840
datorită vitezei și eficienței sale.

884
00:34:00,799 --> 00:34:05,519
Acum, C este totul despre viteza sa. Este

885
00:34:03,840 --> 00:34:08,320
limba pe care o vrei când ești

886
00:34:05,519 --> 00:34:11,280
lucrul cu seturi mari de date sau AI

887
00:34:08,320 --> 00:34:13,440
aplicații care trebuie să fie super rapide.

888
00:34:11,280 --> 00:34:16,079
În al doilea rând, are un nivel scăzut

889
00:34:13,440 --> 00:34:18,240
managementul memoriei. Acum, C vă oferă

890
00:34:16,079 --> 00:34:20,560
control deplin asupra memoriei, care este

891
00:34:18,240 --> 00:34:23,440
esențial atunci când construiți un sistem AI

892
00:34:20,560 --> 00:34:26,480
care necesită calcule extinse și

893
00:34:23,440 --> 00:34:29,040
performanță în timp real. Dar nu este C mai mult

894
00:34:26,480 --> 00:34:30,639
complex decât Python? Cu siguranta, da.

895
00:34:29,040 --> 00:34:32,399
Dar dacă te scufundi în AI

896
00:34:30,639 --> 00:34:34,879
aplicații care necesită mare

897
00:34:32,399 --> 00:34:38,560
performanță, gândiți-vă la viziunea computerizată sau

898
00:34:34,879 --> 00:34:40,560
robotică, C este de neegalat. Este un pic

899
00:34:38,560 --> 00:34:43,440
mai dificil de învățat, dar dacă vrei

900
00:34:40,560 --> 00:34:45,839
construiți sisteme AI în timp real, merită

901
00:34:43,440 --> 00:34:48,399
efortul. Roluri precum software-ul AI

902
00:34:45,839 --> 00:34:51,839
dezvoltator sau inginer de viziune computerizată

903
00:34:48,399 --> 00:34:54,399
sunteți goto cu C. Gama de salarii

904
00:34:51,839 --> 00:34:56,879
pentru aceste roluri este în jur de 8 lakh până la 20

905
00:34:54,399 --> 00:34:59,680
lakh peranom în funcție de proiect

906
00:34:56,879 --> 00:35:02,720
complexitatea și experiența ta. Al treilea pe

907
00:34:59,680 --> 00:35:05,839
o listă este Java. Acesta este un cal de bătaie

908
00:35:02,720 --> 00:35:09,040
în lumea AI. Și dacă țintiți

909
00:35:05,839 --> 00:35:11,280
să lucreze la proiecte AI la nivel de întreprindere,

910
00:35:09,040 --> 00:35:13,520
atunci Java este cu siguranță o limbă pentru tine

911
00:35:11,280 --> 00:35:16,240
vreau sa stiu. Acum, nu este primul

912
00:35:13,520 --> 00:35:19,119
alegere pentru proiecte AI la scară mică. Dar

913
00:35:16,240 --> 00:35:22,880
când vine vorba de sisteme mari scalabile,

914
00:35:19,119 --> 00:35:24,960
Java este de neatins. Deci, de ce Java pentru AI?

915
00:35:22,880 --> 00:35:27,440
Datorită scalabilității sale. Acum, poți

916
00:35:24,960 --> 00:35:29,920
gândește-te la Java ca pe o fiară când vine vorba de

917
00:35:27,440 --> 00:35:32,079
manipularea aplicațiilor la scară largă. Dacă

918
00:35:29,920 --> 00:35:34,880
lucrezi la un sistem AI care trebuie

919
00:35:32,079 --> 00:35:37,359
procesează seturi uriașe de date sau gestionează complexe

920
00:35:34,880 --> 00:35:39,599
calculele, atunci Java se poate descurca

921
00:35:37,359 --> 00:35:41,760
totul fără a transpira. Este

922
00:35:39,599 --> 00:35:44,480
conceput la scară, ceea ce îl face perfect

923
00:35:41,760 --> 00:35:46,480
pentru proiecte de IA la nivel de întreprindere unde

924
00:35:44,480 --> 00:35:48,480
big data este implicată. Platformă

925
00:35:46,480 --> 00:35:51,119
independenta. Unul dintre cele mai bune lucruri

926
00:35:48,480 --> 00:35:53,200
despre Java este cel potrivit care rulează

927
00:35:51,119 --> 00:35:54,880
caracteristică oriunde. Nu contează

928
00:35:53,200 --> 00:35:58,240
ce platformă utilizați, dacă

929
00:35:54,880 --> 00:36:01,200
este Windows, Mac, Linux, Java poate rula

930
00:35:58,240 --> 00:36:03,440
totul fără probleme. Acesta este un imens

931
00:36:01,200 --> 00:36:05,520
câștigă atunci când construiești sisteme AI care

932
00:36:03,440 --> 00:36:08,400
trebuie să funcționeze pe mai multe

933
00:36:05,520 --> 00:36:10,160
platforme. Biblioteci mature. Java are

934
00:36:08,400 --> 00:36:12,160
exista de zeci de ani si din cauza

935
00:36:10,160 --> 00:36:15,200
asta, este plin de fiabile

936
00:36:12,160 --> 00:36:17,599
biblioteci pentru AI. Biblioteci precum Qua,

937
00:36:15,200 --> 00:36:20,400
H2O face implementarea învățării automate

938
00:36:17,599 --> 00:36:22,880
modele sau construirea unui sistem AI foarte mult

939
00:36:20,400 --> 00:36:24,960
mai netedă. Aceste biblioteci le-am încercat și

940
00:36:22,880 --> 00:36:27,599
testat ca să știi cu care lucrezi

941
00:36:24,960 --> 00:36:29,839
unelte solide. Să vorbim despre ce locuri de muncă

942
00:36:27,599 --> 00:36:32,000
poti de fapt ateriza cu Java. Acum

943
00:36:29,839 --> 00:36:34,800
cu Java te uiți la unele mari

944
00:36:32,000 --> 00:36:37,119
roluri în lumea AI. Gândește-te la AI

945
00:36:34,800 --> 00:36:39,680
arhitect soluție sau backend AI

946
00:36:37,119 --> 00:36:42,160
dezvoltator. Aceste poziții nu sunt doar

947
00:36:39,680 --> 00:36:45,119
foarte respectat, dar vine și cu

948
00:36:42,160 --> 00:36:47,760
un interval de salariu solid, de obicei, între 7

949
00:36:45,119 --> 00:36:50,000
lakh până la 18 lakh peranom. Și cu

950
00:36:47,760 --> 00:36:52,720
experiență, ei bine, să spunem asta

951
00:36:50,000 --> 00:36:54,720
numărul poate urca cu ușurință mai sus. Acum, tu

952
00:36:52,720 --> 00:36:56,720
trebuie să mă gândesc, cum să încep

953
00:36:54,720 --> 00:36:58,400
cu Java? Acum, dacă ești deja

954
00:36:56,720 --> 00:37:00,560
familiarizat cu orientarea obiectelor

955
00:36:58,400 --> 00:37:02,720
programare, învățarea Java va fi o

956
00:37:00,560 --> 00:37:04,880
briză. Și dacă ești nou în acest domeniu, nu

957
00:37:02,720 --> 00:37:07,200
îngrijorare. Puteți începe cu unele grozave

958
00:37:04,880 --> 00:37:09,440
resurse precum un canal YouTube sau

959
00:37:07,200 --> 00:37:11,760
LinkedIn Learning. Sunt destule

960
00:37:09,440 --> 00:37:14,960
cursuri care vă vor învăța cum să utilizați

961
00:37:11,760 --> 00:37:17,440
Java pentru AI de la zero. Acum,

962
00:37:14,960 --> 00:37:20,000
să vorbim despre R. Acesta este pentru toți

963
00:37:17,440 --> 00:37:22,560
pasionații de știință a datelor acolo. Dacă

964
00:37:20,000 --> 00:37:24,880
te scufundi în IA statistică și

965
00:37:22,560 --> 00:37:26,960
limbajul construit special pentru

966
00:37:24,880 --> 00:37:29,920
manipularea datelor masive și performanța

967
00:37:26,960 --> 00:37:32,960
analiză statistică complexă, R este dvs

968
00:37:29,920 --> 00:37:35,280
du-te la. Deci de ce R pentru AI? Din cauza ei

969
00:37:32,960 --> 00:37:37,760
putere statistică. R este plin cu

970
00:37:35,280 --> 00:37:39,760
instrumente de modelare statistică. Deci dacă

971
00:37:37,760 --> 00:37:41,920
lucrezi la proiecte AI care au nevoie

972
00:37:39,760 --> 00:37:44,960
analiza datelor chiar înainte de a începe

973
00:37:41,920 --> 00:37:47,680
aplicând învățarea automată, R îl face a

974
00:37:44,960 --> 00:37:50,320
briză. Are tot ce ai nevoie

975
00:37:47,680 --> 00:37:53,119
analiza tendințelor, găsirea tiparelor și

976
00:37:50,320 --> 00:37:54,960
construirea unor modele predictive puternice. Ea

977
00:37:53,119 --> 00:37:57,520
are, de asemenea, o caracteristică a datelor sale

978
00:37:54,960 --> 00:38:00,560
explorare și vizualizare. Unul dintre

979
00:37:57,520 --> 00:38:03,040
Punctul forte al lui R este explorarea datelor

980
00:38:00,560 --> 00:38:05,359
și capabilități de vizualizare. Poți

981
00:38:03,040 --> 00:38:07,760
trasează, diagramează și analizează cu ușurință datele tale

982
00:38:05,359 --> 00:38:10,240
pentru a descoperi perspective. Aceasta face ca arta

983
00:38:07,760 --> 00:38:12,079
perfect pentru partea bazată pe date a AI

984
00:38:10,240 --> 00:38:14,320
dezvoltare în cazul în care înțelegerea dvs

985
00:38:12,079 --> 00:38:16,800
datele sunt la fel de importante ca și construirea

986
00:38:14,320 --> 00:38:19,200
modelele. Dar stai, mai pot lucra?

987
00:38:16,800 --> 00:38:22,079
în AI dacă învăț R sau este doar pentru

988
00:38:19,200 --> 00:38:24,640
analiza datelor? Absolut. R este

989
00:38:22,079 --> 00:38:27,040
fantastic pentru proiectele AI care se bazează pe

990
00:38:24,640 --> 00:38:29,040
metode statistice și analiza datelor.

991
00:38:27,040 --> 00:38:31,200
Este de fapt limba preferată pentru

992
00:38:29,040 --> 00:38:33,440
roluri precum analist de date AI sau

993
00:38:31,200 --> 00:38:35,760
analist cantitativ unde te vei afla

994
00:38:33,440 --> 00:38:38,880
construirea de modele predictive sau analizarea

995
00:38:35,760 --> 00:38:41,520
tendințele datelor pentru a lua decizii. Acum astea

996
00:38:38,880 --> 00:38:43,920
rolurile sunt la mare căutare și salariul

997
00:38:41,520 --> 00:38:46,320
intervalul se încadrează de obicei între 6 lakh la

998
00:38:43,920 --> 00:38:48,079
12 lakh peranom dar cu experiență tu

999
00:38:46,320 --> 00:38:50,560
cu siguranță poate împinge acele numere

1000
00:38:48,079 --> 00:38:52,640
mai înalt. Acum să începem cu arta, tu

1001
00:38:50,560 --> 00:38:55,440
puteți găsi tone de resurse gratuite pe un

1002
00:38:52,640 --> 00:38:58,000
plat nou copil pe blocul care este în creștere

1003
00:38:55,440 --> 00:39:01,440
rapid în spațiul AI. Este relativ

1004
00:38:58,000 --> 00:39:04,000
tânăr în comparație cu Python sau C . Dar

1005
00:39:01,440 --> 00:39:06,480
crede-mă, are un impact uriaș. Şi

1006
00:39:04,000 --> 00:39:09,599
iată de ce. Acum, Julia a fost creată înapoi

1007
00:39:06,480 --> 00:39:11,920
în 2012 de către un grup de cercetători care

1008
00:39:09,599 --> 00:39:14,880
dorea un limbaj de programare care să poată

1009
00:39:11,920 --> 00:39:17,359
gestionează calculele complexe necesare

1010
00:39:14,880 --> 00:39:20,320
pentru calcul științific și au bătut în cuie

1011
00:39:17,359 --> 00:39:22,480
ea. Dar de ce a crescut Julia atât de repede?

1012
00:39:20,320 --> 00:39:25,200
Ei bine, a luat viteză pentru că

1013
00:39:22,480 --> 00:39:28,160
combină performanța lui C cu

1014
00:39:25,200 --> 00:39:30,880
lizibilitatea lui Python. Primești

1015
00:39:28,160 --> 00:39:33,440
viteza și eficiența pe care C este cunoscută

1016
00:39:30,880 --> 00:39:35,920
pentru, dar cu Python curat și ușor de

1017
00:39:33,440 --> 00:39:38,000
scrie cod, este ca cel mai bun dintre ambele

1018
00:39:35,920 --> 00:39:40,160
lumi. Să vorbim de ce am făcut-o

1019
00:39:38,000 --> 00:39:42,480
alegi Julia pentru AI? Din cauza ei

1020
00:39:40,160 --> 00:39:44,880
viteză și simplitate. Acum, viteza Juliei

1021
00:39:42,480 --> 00:39:46,960
este unul dintre cele mai mari avantaje. Este

1022
00:39:44,880 --> 00:39:49,280
proiectat pentru calcul de înaltă performanță.

1023
00:39:46,960 --> 00:39:52,160
Deci, dacă trebuie să rulați modele complexe de IA

1024
00:39:49,280 --> 00:39:54,400
sau procesează tone de date, Julia va face

1025
00:39:52,160 --> 00:39:56,800
într-o fracțiune din timp ar fi

1026
00:39:54,400 --> 00:39:58,800
luați în alte limbi. Și sintaxa,

1027
00:39:56,800 --> 00:40:00,880
este, de asemenea, foarte ușor de citit și de scris.

1028
00:39:58,800 --> 00:40:02,960
Deci nu sacrificați confortul

1029
00:40:00,880 --> 00:40:04,800
pentru performanță. Are, de asemenea,

1030
00:40:02,960 --> 00:40:07,440
caracteristică a calculului științific. Acum

1031
00:40:04,800 --> 00:40:09,760
Julia este optimizată pentru sarcini AI precum deep

1032
00:40:07,440 --> 00:40:12,160
învăţare şi analiză numerică. Poți

1033
00:40:09,760 --> 00:40:14,160
gândiți-vă la aplicații AI în robotică, date

1034
00:40:12,160 --> 00:40:15,839
știință și cercetare științifică. Acum,

1035
00:40:14,160 --> 00:40:18,640
dacă lucrezi la proiecte care

1036
00:40:15,839 --> 00:40:21,520
necesită calcule grele sau avansate

1037
00:40:18,640 --> 00:40:24,240
Modele AI, Julia's este alegerea ta. Deci,

1038
00:40:21,520 --> 00:40:26,480
de ce nu toată lumea o folosește încă pe Julia? Este

1039
00:40:24,240 --> 00:40:29,040
încă în creștere, dar comunitatea Julia

1040
00:40:26,480 --> 00:40:31,200
extinzându-se rapid și mai multe biblioteci

1041
00:40:29,040 --> 00:40:33,280
iar cadrele sunt dezvoltate fiecare

1042
00:40:31,200 --> 00:40:35,760
zi. Devine rapid o alegere de top

1043
00:40:33,280 --> 00:40:38,000
pentru IA de înaltă performanță și asta

1044
00:40:35,760 --> 00:40:40,079
continuă să evolueze. Și bineînțeles, eu

1045
00:40:38,000 --> 00:40:43,040
așteaptă-te să fie și mai popular. Deci, este

1046
00:40:40,079 --> 00:40:44,880
Julia mai bună decât Python sau C? Acum, cel

1047
00:40:43,040 --> 00:40:47,119
raspunsul este ca depinde. Acum, dacă ești

1048
00:40:44,880 --> 00:40:49,359
construirea de aplicații științifice AI care

1049
00:40:47,119 --> 00:40:51,599
necesită performanță ridicată, Julia este un

1050
00:40:49,359 --> 00:40:53,359
opțiune fantastică. Inca creste dar

1051
00:40:51,599 --> 00:40:55,440
comunitatea se extinde. Julia va

1052
00:40:53,359 --> 00:40:57,599
deveni rapid mai puternic în AI

1053
00:40:55,440 --> 00:40:59,440
spatiu. Julia este perfectă pentru roluri precum

1054
00:40:57,599 --> 00:41:01,920
Dezvoltator AI în domeniul științific sau

1055
00:40:59,440 --> 00:41:04,560
spațiu de calcul numeric. Salariile pot

1056
00:41:01,920 --> 00:41:06,240
variază de la 7 la 15 lakh peranom

1057
00:41:04,560 --> 00:41:08,720
mai ales dacă lucrezi cu

1058
00:41:06,240 --> 00:41:11,119
AI avansat. Deci, băieți, o aveți

1059
00:41:08,720 --> 00:41:12,720
cele mai bune cinci limbaje de programare pentru

1060
00:41:11,119 --> 00:41:15,200
AI. Deci, indiferent dacă sunteți interesat

1061
00:41:12,720 --> 00:41:17,280
învățare automată, IA în timp real sau date

1062
00:41:15,200 --> 00:41:20,160
știință, există limbaj pentru tine. Fiecare

1063
00:41:17,280 --> 00:41:21,839
dintre acestea vă vor ajuta să obțineți un loc de muncă AI

1064
00:41:20,160 --> 00:41:24,560
vrei și să-ți ofere instrumentele de care ai nevoie

1065
00:41:21,839 --> 00:41:26,240
construi un sistem AI puternic. Care sunt

1066
00:41:24,560 --> 00:41:27,920
vei incepe cu? Aruncă-ți

1067
00:41:26,240 --> 00:41:29,920
gânduri în secțiunea de comentarii de mai jos

1068
00:41:27,920 --> 00:41:32,079
și hai să vorbim despre asta. Și dacă tu

1069
00:41:29,920 --> 00:41:34,319
am găsit acest videoclip util, dă like,

1070
00:41:32,079 --> 00:41:36,800
butonul de distribuire și abonare pentru a obține mai multe

1071
00:41:34,319 --> 00:41:38,560
Sfaturi AI și sfaturi de carieră prin simplu

1072
00:41:36,800 --> 00:41:40,480
invata. începeți cu integrarea

1073
00:41:38,560 --> 00:41:42,640
și interfață, inclusiv abonamentul

1074
00:41:40,480 --> 00:41:47,119
planul. După cum puteți vedea aici, este

1075
00:41:42,640 --> 00:41:49,040
oferindu-ne trei planuri majore. Acum, acum

1076
00:41:47,119 --> 00:41:51,359
există o versiune gratuită a manualelor dvs

1077
00:41:49,040 --> 00:41:54,160
poate fi folosit de zi cu zi. Dar fă

1078
00:41:51,359 --> 00:41:55,200
sigur că știi că creditele de zi cu zi sunt

1079
00:41:54,160 --> 00:41:57,599
șase rupii.

1080
00:41:55,200 --> 00:42:00,880
>> Dar asigurați-vă că creditele de zi cu zi sunt doar

1081
00:41:57,599 --> 00:42:02,720
300 până la limitat. Dar doar 300 de credite

1082
00:42:00,880 --> 00:42:05,680
vi se va atribui zilnic

1083
00:42:02,720 --> 00:42:08,720
baza. Acum, primul plan este de 20 USD per

1084
00:42:05,680 --> 00:42:11,440
luna, care vă oferă 300 de credite noi

1085
00:42:08,720 --> 00:42:13,359
în fiecare zi, 4.000 de credite pe lună,

1086
00:42:11,440 --> 00:42:14,960
cercetare aprofundată pentru sarcinile de zi cu zi,

1087
00:42:13,359 --> 00:42:17,520
site web profesional pentru standard

1088
00:42:14,960 --> 00:42:19,440
tobogane exterioare, perspicace pentru obișnuite

1089
00:42:17,520 --> 00:42:21,760
conținut, sperierea sarcinilor și larg

1090
00:42:19,440 --> 00:42:24,560
cercetare, acces timpuriu funcții beta,

1091
00:42:21,760 --> 00:42:26,720
și 20 de sarcini concomitente, 20 de program

1092
00:42:24,560 --> 00:42:28,880
sarcini. Acum, din nou, dacă lucrați

1093
00:42:26,720 --> 00:42:31,040
o organizație în care puteți auto

1094
00:42:28,880 --> 00:42:35,599
trebuie să auto prea multe chestii poți

1095
00:42:31,040 --> 00:42:37,599
upgrade la un plan de 40 sau 200 USD. Acum 20 USD

1096
00:42:35,599 --> 00:42:39,920
este pentru o singură utilizare pentru că

1097
00:42:37,599 --> 00:42:43,040
sunt doar 300 de credite proaspete pe zi.

1098
00:42:39,920 --> 00:42:46,400
În total, sunt și 4.000 pe lună.

1099
00:42:43,040 --> 00:42:48,640
Deci, când este așa, când vine vorba de planul de 40 USD

1100
00:42:46,400 --> 00:42:51,920
puteți lua în considerare să-l împărtășiți cu doi to

1101
00:42:48,640 --> 00:42:54,960
trei persoane. Din nou sunt 300 de credite dar

1102
00:42:51,920 --> 00:42:57,760
8.000 de credite pe lună. toate celelalte

1103
00:42:54,960 --> 00:43:00,800
lucruri plus plus vei primi un plus

1104
00:42:57,760 --> 00:43:03,119
încă 4.000 de credite de lucrat. Acum

1105
00:43:00,800 --> 00:43:05,280
când vine vorba de 200, vei primi un

1106
00:43:03,119 --> 00:43:06,720
în primul rând, veți obține cloud computing gratuit

1107
00:43:05,280 --> 00:43:09,760
unde nu trebuie să vă faceți griji pentru

1108
00:43:06,720 --> 00:43:12,240
depozitare și alte lucruri și aici sunt 40.000

1109
00:43:09,760 --> 00:43:15,760
credite pe lună o organizație care

1110
00:43:12,240 --> 00:43:18,079
folosește instrumente de automatizare mult mai multe pot folosi

1111
00:43:15,760 --> 00:43:20,640
asta acum vom începe cu

1112
00:43:18,079 --> 00:43:22,640
înţelegerea interfeţei manusi şi

1113
00:43:20,640 --> 00:43:24,800
primul lucru la care trebuie să ne blocăm

1114
00:43:22,640 --> 00:43:26,880
hub-ul care este practic principalul tău

1115
00:43:24,800 --> 00:43:29,520
tabloul de bord. Acum înainte să începem să dăm

1116
00:43:26,880 --> 00:43:32,079
sarcina de a manus AI este foarte important

1117
00:43:29,520 --> 00:43:34,640
înțelege cum funcționează creditele pentru că pt

1118
00:43:32,079 --> 00:43:36,319
Mulți utilizatori credite pot fi puțin

1119
00:43:34,640 --> 00:43:38,079
confuz la început. Când tu

1120
00:43:36,319 --> 00:43:40,960
deschide tabloul de bord vei observa asta

1121
00:43:38,079 --> 00:43:43,040
IA omului arată două credite diferite

1122
00:43:40,960 --> 00:43:45,280
contoare. Prima este cea zilnică

1123
00:43:43,040 --> 00:43:47,599
reîmprospătare credite. Acestea sunt creditele

1124
00:43:45,280 --> 00:43:50,400
care împrospătează în fiecare zi. De exemplu tu

1125
00:43:47,599 --> 00:43:51,920
poate vedea aproximativ 300 de credite pe zi. The

1126
00:43:50,400 --> 00:43:55,520
lucru important de reținut este că

1127
00:43:51,920 --> 00:43:58,079
acestea le folosesc sau le pierde credite.

1128
00:43:55,520 --> 00:44:00,720
Asta înseamnă că se resetează la fiecare 24 de ore și

1129
00:43:58,079 --> 00:44:02,720
dacă nu le folosiți, nu le poartă

1130
00:44:00,720 --> 00:44:04,560
înainte în ziua următoare. Deci astea sunt

1131
00:44:02,720 --> 00:44:07,040
creditele zilnice care sunt bune pentru

1132
00:44:04,560 --> 00:44:09,359
sarcină obișnuită, experimente rapide, mici

1133
00:44:07,040 --> 00:44:11,359
munca de cercetare, testare promptă sau chiar

1134
00:44:09,359 --> 00:44:14,319
încercând diferite caracteristici în interior

1135
00:44:11,359 --> 00:44:17,040
Manusa. Al doilea contor de credit este

1136
00:44:14,319 --> 00:44:18,960
piscina dvs. lunară. Acesta este principalul tău

1137
00:44:17,040 --> 00:44:21,680
soldul creditului pentru luna. Pentru

1138
00:44:18,960 --> 00:44:23,680
de exemplu, dacă aveți un plan standard,

1139
00:44:21,680 --> 00:44:26,319
s-ar putea să ai nevoie de ceva de genul 4.000

1140
00:44:23,680 --> 00:44:29,280
credite lunare. Aceste credite sunt mai multe

1141
00:44:26,319 --> 00:44:31,760
util pentru sarcini mai mari și mai complexe.

1142
00:44:29,280 --> 00:44:34,000
Deci, dacă îi ceri lui manus AI să facă ceva

1143
00:44:31,760 --> 00:44:36,000
lungind ca cercetarea unui subiect

1144
00:44:34,000 --> 00:44:38,240
profund, crearea unui raport, răsfoirea

1145
00:44:36,000 --> 00:44:40,240
surse multiple, analiza informațiilor,

1146
00:44:38,240 --> 00:44:42,960
sau chiar finalizarea unui pas multiplu

1147
00:44:40,240 --> 00:44:45,119
fluxul de lucru, atunci acest pool lunar dă

1148
00:44:42,960 --> 00:44:47,440
tu pista principală pentru a le completa

1149
00:44:45,119 --> 00:44:50,240
sarcini mai mari. Așa că amintește-ți asta

1150
00:44:47,440 --> 00:44:53,200
simpla diferenta. Creditele zilnice sunt pentru

1151
00:44:50,240 --> 00:44:55,680
utilizare zilnică și resetare la fiecare 24 de ore.

1152
00:44:53,200 --> 00:44:57,599
Creditele lunare sunt creditul dvs. mai mare

1153
00:44:55,680 --> 00:44:59,680
pool pentru sarcini mai mari pe tot parcursul acestui

1154
00:44:57,599 --> 00:45:02,160
luna. Acum următorul lucru important în

1155
00:44:59,680 --> 00:45:04,160
tabloul de bord este fereastra de activitate activă.

1156
00:45:02,160 --> 00:45:06,319
Aici manusci arată sarcinile

1157
00:45:04,160 --> 00:45:08,160
care rulează în prezent și asta este

1158
00:45:06,319 --> 00:45:09,599
una dintre cele mai puternice părți ale

1159
00:45:08,160 --> 00:45:11,760
platforma.

1160
00:45:09,599 --> 00:45:14,400
Spre deosebire de un chatbot normal unde poți

1161
00:45:11,760 --> 00:45:16,960
pune o întrebare, așteaptă un răspuns,

1162
00:45:14,400 --> 00:45:18,960
Manos AI poate lucra la mai multe sarcini la

1163
00:45:16,960 --> 00:45:21,200
in acelasi timp. De exemplu, pe asta

1164
00:45:18,960 --> 00:45:23,920
abonament puteți rula până la 20

1165
00:45:21,200 --> 00:45:26,880
sarcină concomitentă deodată. Asta înseamnă

1166
00:45:23,920 --> 00:45:29,440
manos poate lucra la cereri multiple în

1167
00:45:26,880 --> 00:45:31,200
paralel. Poate că o sarcină este cercetarea

1168
00:45:29,440 --> 00:45:33,440
un subiect, altul pregătește o

1169
00:45:31,200 --> 00:45:35,440
document, altul analizează un site web

1170
00:45:33,440 --> 00:45:37,680
iar altul organizează

1171
00:45:35,440 --> 00:45:40,560
informaţii. Pentru utilizatorii gratuiti,

1172
00:45:37,680 --> 00:45:42,720
limita este de obicei mai mică în jur de cinci

1173
00:45:40,560 --> 00:45:45,040
sarcini concurente. Dar important

1174
00:45:42,720 --> 00:45:47,119
lucru nu este doar numărul de sarcini.

1175
00:45:45,040 --> 00:45:49,760
Important este că aceste sarcini

1176
00:45:47,119 --> 00:45:52,079
sunt asincrone și bazate pe cloud. Aceasta

1177
00:45:49,760 --> 00:45:54,640
înseamnă odată ce începi o sarcină, Manus AI

1178
00:45:52,079 --> 00:45:56,720
lucrează continuu în cloud. Tu faci

1179
00:45:54,640 --> 00:45:59,520
nu trebuie să urmăriți în continuare ecranul

1180
00:45:56,720 --> 00:46:01,200
tot timpul. Puteți începe o sarcină, închideți

1181
00:45:59,520 --> 00:46:03,920
browser, deconectați-vă de la

1182
00:46:01,200 --> 00:46:07,200
internet și chiar reveniți mai târziu. şi

1183
00:46:03,920 --> 00:46:09,280
Manus AI poate continua să lucreze

1184
00:46:07,200 --> 00:46:12,079
acea sarcină în fundal. Aceasta este

1185
00:46:09,280 --> 00:46:14,640
ceea ce îl face să se simtă mai puțin ca un AI normal

1186
00:46:12,079 --> 00:46:16,880
port de chat și mai mult ca un lucrător AI.

1187
00:46:14,640 --> 00:46:18,960
Nu pui doar o întrebare și

1188
00:46:16,880 --> 00:46:21,119
asteptand raspunsul. Tu atribui

1189
00:46:18,960 --> 00:46:23,280
lucru, lăsând agentul să-l proceseze și

1190
00:46:21,119 --> 00:46:26,560
apoi verificând rezultatele odată ce sarcina

1191
00:46:23,280 --> 00:46:28,560
este finalizată. Deci, înainte de a folosi Minus AI

1192
00:46:26,560 --> 00:46:30,960
pentru fluxuri de lucru reale, înțelegeți întotdeauna

1193
00:46:28,560 --> 00:46:33,359
aceste trei lucruri. Creditele dvs. zilnice

1194
00:46:30,960 --> 00:46:36,160
resetați în fiecare zi. Creditele dvs. lunare

1195
00:46:33,359 --> 00:46:38,480
sprijină sarcini mai mari și mai lungi și dvs

1196
00:46:36,160 --> 00:46:41,040
fereastra sarcinilor concurente arată câte

1197
00:46:38,480 --> 00:46:43,359
locuri de muncă pentru care Manus AI se ocupă în prezent

1198
00:46:41,040 --> 00:46:45,520
tu. După ce înțelegeți acest tablou de bord,

1199
00:46:43,359 --> 00:46:47,920
devine mult mai ușor să-ți gestionezi

1200
00:46:45,520 --> 00:46:50,480
credite, planificați-vă sarcina în mod corespunzător și

1201
00:46:47,920 --> 00:46:52,240
utilizați Manus AI mai eficient. Acum că

1202
00:46:50,480 --> 00:46:53,839
am înțeles tabloul de bord și

1203
00:46:52,240 --> 00:46:56,079
credite, să trecem la următorul

1204
00:46:53,839 --> 00:46:58,560
parte importantă a interfeței Manus AI,

1205
00:46:56,079 --> 00:47:00,560
care este scopul, intrarea și sarcina

1206
00:46:58,560 --> 00:47:03,280
zona de planificare. Acum aici este locul în care tu

1207
00:47:00,560 --> 00:47:05,280
începe de fapt să lucrezi cu manus. Într-o

1208
00:47:03,280 --> 00:47:07,920
chatbot normal, de obicei, dăm un mic

1209
00:47:05,280 --> 00:47:10,480
instrucțiuni pe rând. Dar în Manus AI

1210
00:47:07,920 --> 00:47:13,520
ideea este putin diferita. Aici tu

1211
00:47:10,480 --> 00:47:15,680
da un obiectiv highle și manus planuri de

1212
00:47:13,520 --> 00:47:17,920
pașii necesari pentru a îndeplini acest obiectiv. Deci

1213
00:47:15,680 --> 00:47:21,040
în caseta de introducere principală să introducem a

1214
00:47:17,920 --> 00:47:24,240
obiectiv simplu, cum ar fi cercetarea IA de top

1215
00:47:21,040 --> 00:47:26,880
instrumente pentru crearea de conținut și crearea a

1216
00:47:24,240 --> 00:47:30,560
raport de comparație. Deci să începem.

1217
00:47:26,880 --> 00:47:35,040
cercetați cele mai importante instrumente AI pentru conținut

1218
00:47:30,560 --> 00:47:37,359
crearea și crearea unui raport de comparație.

1219
00:47:35,040 --> 00:47:40,160
Acum, aici ne-am atribuit un obiectiv adecvat

1220
00:47:37,359 --> 00:47:43,040
lui Manus AI. Acum observați ce se întâmplă

1221
00:47:40,160 --> 00:47:45,599
după ce introducem acest prompt. Manos o face

1222
00:47:43,040 --> 00:47:48,000
nu sari direct in raspunsul final.

1223
00:47:45,599 --> 00:47:50,400
Mai întâi creează un plan de sarcini. Aceasta este

1224
00:47:48,000 --> 00:47:52,880
unde veți vedea o listă de activități sau

1225
00:47:50,400 --> 00:47:55,280
structură pas cu pas care arată cum Manus

1226
00:47:52,880 --> 00:47:57,440
plănuiește să finalizeze sarcina. Pentru

1227
00:47:55,280 --> 00:47:59,119
de exemplu, manus poate sparge obiectivul în

1228
00:47:57,440 --> 00:48:01,119
pași precum înțelegerea subiectului,

1229
00:47:59,119 --> 00:48:03,359
căutarea conținutului AI, crearea

1230
00:48:01,119 --> 00:48:05,200
instrumente, colectarea de informații utile și

1231
00:48:03,359 --> 00:48:07,119
comparând acele instrumente și în cele din urmă

1232
00:48:05,200 --> 00:48:09,680
întocmirea raportului. Deci aici poți

1233
00:48:07,119 --> 00:48:12,000
vezi pasii. Cu cuvinte simple, manus este

1234
00:48:09,680 --> 00:48:14,319
luând un singur obiectiv mare și spargându-l

1235
00:48:12,000 --> 00:48:15,920
actiuni mai mici. Această vedere este foarte

1236
00:48:14,319 --> 00:48:18,240
important pentru că ne oferă o șansă

1237
00:48:15,920 --> 00:48:20,960
să revizuiască planul înaintea agentului

1238
00:48:18,240 --> 00:48:22,720
începe să facă o muncă grea. Înainte de manos

1239
00:48:20,960 --> 00:48:25,200
începe răsfoirea, deschiderea paginilor,

1240
00:48:22,720 --> 00:48:27,040
analizând sursele și consumând mai mult

1241
00:48:25,200 --> 00:48:29,440
credite, putem verifica rapid dacă

1242
00:48:27,040 --> 00:48:31,839
planul pare corect. De exemplu, în

1243
00:48:29,440 --> 00:48:33,839
În acest caz, ar trebui să verificăm bunele maniere

1244
00:48:31,839 --> 00:48:36,000
cautarea tipului potrivit de dinte.

1245
00:48:33,839 --> 00:48:38,319
Planifică să le compare corect?

1246
00:48:36,000 --> 00:48:41,040
Va crea un raport final ca

1247
00:48:38,319 --> 00:48:42,720
am intrebat noi? Dacă planul pare corect, noi

1248
00:48:41,040 --> 00:48:44,559
poate continua. Dar dacă planul arată

1249
00:48:42,720 --> 00:48:46,960
incomplet sau ușor greșit, putem

1250
00:48:44,559 --> 00:48:49,440
opriți și ajustați promptul înainte de a vă muta

1251
00:48:46,960 --> 00:48:51,920
înainte. Acest lucru ne ajută să evităm risipa

1252
00:48:49,440 --> 00:48:54,880
timp și credite. Deci punctul cheie aici

1253
00:48:51,920 --> 00:48:57,359
este simplu. În manus AI, nu avem nevoie

1254
00:48:54,880 --> 00:48:59,839
scrie manual fiecare pas. Putem da

1255
00:48:57,359 --> 00:49:02,240
un obiectiv clar și manus va crea un

1256
00:48:59,839 --> 00:49:04,319
plan pentru finalizarea acestuia. Dar înainte

1257
00:49:02,240 --> 00:49:07,040
permițând ca sarcina să continue, întotdeauna

1258
00:49:04,319 --> 00:49:08,640
revizuiește descompunerea documentației.

1259
00:49:07,040 --> 00:49:10,240
Dar înainte de a permite sarcinii

1260
00:49:08,640 --> 00:49:13,040
continuați, revizuiți întotdeauna

1261
00:49:10,240 --> 00:49:14,960
vedere de descompunere. Acest lucru te ajută

1262
00:49:13,040 --> 00:49:17,119
să înțeleagă cum gândește agentul și

1263
00:49:14,960 --> 00:49:19,920
fie că se mișcă în dreapta

1264
00:49:17,119 --> 00:49:22,640
direcție. Deci, în acest exemplu, scopul nostru

1265
00:49:19,920 --> 00:49:24,800
a fost să cercetez cele mai bune instrumente AI pentru

1266
00:49:22,640 --> 00:49:27,520
crearea de conținut și crearea unei comparații

1267
00:49:24,800 --> 00:49:29,920
raport. Și Manus întoarce acel singur bol

1268
00:49:27,520 --> 00:49:32,319
în planul de sarcini structurat care poate

1269
00:49:29,920 --> 00:49:34,400
revizuire înainte de execuție. Aceasta este ceea ce

1270
00:49:32,319 --> 00:49:36,720
face ca aerul lui Manus să fie diferit de un obișnuit

1271
00:49:34,400 --> 00:49:38,880
chatbot. Nu doar răspunde

1272
00:49:36,720 --> 00:49:40,640
imediat. Planifică mai întâi munca,

1273
00:49:38,880 --> 00:49:42,880
arată direcția și apoi începe

1274
00:49:40,640 --> 00:49:45,359
finalizarea sarcinii. Acum că Manus are

1275
00:49:42,880 --> 00:49:48,079
a înțeles scopul nostru, sarcina creată

1276
00:49:45,359 --> 00:49:50,160
plan, următorul pas este execuția. Este

1277
00:49:48,079 --> 00:49:52,640
execută deja. Aici este Manus

1278
00:49:50,160 --> 00:49:54,880
AI începe de fapt să lucreze la o sarcină.

1279
00:49:52,640 --> 00:49:56,960
Vă puteți gândi la această parte ca la o mână de lucru

1280
00:49:54,880 --> 00:49:59,200
platforma. Intrarea obiectivului este unde

1281
00:49:56,960 --> 00:50:01,680
Manus înțelege ce vrem. The

1282
00:49:59,200 --> 00:50:04,480
vizualizarea de planificare este locul în care decide cum

1283
00:50:01,680 --> 00:50:06,880
fă-o și vizualizarea de execuție este acolo unde este

1284
00:50:04,480 --> 00:50:08,880
efectuează efectiv munca. Odată ce noi

1285
00:50:06,880 --> 00:50:11,119
aproba sau continua sarcina,

1286
00:50:08,880 --> 00:50:13,760
gestionează începe să parcurgă pașii unu

1287
00:50:11,119 --> 00:50:16,240
de unul. Partea interesantă este că noi

1288
00:50:13,760 --> 00:50:17,920
pot urmări acest lucru în timp real. Pornit

1289
00:50:16,240 --> 00:50:20,880
pe o parte, veți vedea de obicei

1290
00:50:17,920 --> 00:50:23,839
lista de progres sau pașii sarcinii. Asta arată

1291
00:50:20,880 --> 00:50:25,839
că manus a terminat ceea ce este

1292
00:50:23,839 --> 00:50:28,319
se face în prezent și ce este încă

1293
00:50:25,839 --> 00:50:30,160
ramanand. Următorul este că poți vedea

1294
00:50:28,319 --> 00:50:33,040
manus acţionând efectiv. Pentru

1295
00:50:30,160 --> 00:50:35,040
de exemplu, dacă sarcina se repetă, pt

1296
00:50:33,040 --> 00:50:36,960
de exemplu, dacă sarcina necesită cercetare,

1297
00:50:35,040 --> 00:50:39,599
puteți vedea agentul deschizând site-uri web

1298
00:50:36,960 --> 00:50:41,680
și navigarea paginilor. Dacă sarcina cere

1299
00:50:39,599 --> 00:50:44,079
colectarea de informații, poate fi nevoie

1300
00:50:41,680 --> 00:50:46,880
capturi de ecran, extrage detalii sau chiar

1301
00:50:44,079 --> 00:50:49,119
organizează datele. Dacă sarcina necesită a

1302
00:50:46,880 --> 00:50:51,119
ieșire structurată, manualele se pot actualiza a

1303
00:50:49,119 --> 00:50:53,920
foaie de calcul, scrieți conținut, rulați

1304
00:50:51,119 --> 00:50:56,319
cod, sau chiar construi un interactiv

1305
00:50:53,920 --> 00:50:58,640
artefact. Deci, în loc să arate doar

1306
00:50:56,319 --> 00:51:00,720
rezultatul final, manos arată fluxul de lucru

1307
00:50:58,640 --> 00:51:02,640
în timp ce se întâmplă. Acest lucru este util

1308
00:51:00,720 --> 00:51:05,119
pentru că putem înțelege cum agentul

1309
00:51:02,640 --> 00:51:07,200
funcționează nu doar răspunsul pe care îl oferă

1310
00:51:05,119 --> 00:51:10,000
până la capăt. Acum încă un lucru important

1311
00:51:07,200 --> 00:51:12,720
este să înțelegem aici este sandbox

1312
00:51:10,000 --> 00:51:14,880
mediu. Manos nu face direct

1313
00:51:12,720 --> 00:51:17,359
operați computerul local. Funcționează

1314
00:51:14,880 --> 00:51:20,000
în interiorul unui nor și este creat pentru

1315
00:51:17,359 --> 00:51:21,839
sarcina. În interiorul acestei cutii cu nisip, minerii pot

1316
00:51:20,000 --> 00:51:24,319
navigați pe site-uri web, colectați informații,

1317
00:51:21,839 --> 00:51:26,400
testați ideile, rulați codul, completați formulare și

1318
00:51:24,319 --> 00:51:28,800
construiți rezultate fără a vă afecta

1319
00:51:26,400 --> 00:51:30,800
sistem personal. De exemplu, dacă întrebăm

1320
00:51:28,800 --> 00:51:32,800
minerii să cerceteze instrumente AI și să se pregătească

1321
00:51:30,800 --> 00:51:34,720
un raport de viziune, poate naviga diferit

1322
00:51:32,800 --> 00:51:36,960
site-ul web, colectați detaliile necesare,

1323
00:51:34,720 --> 00:51:39,760
organizați-le și apoi creați finala

1324
00:51:36,960 --> 00:51:42,240
raportați în acest spațiu de lucru. Și pentru

1325
00:51:39,760 --> 00:51:44,559
sarcină mai avansată, cutia de nisip poate, de asemenea

1326
00:51:42,240 --> 00:51:46,880
ajutați manierele să creeze lucruri precum site-uri web,

1327
00:51:44,559 --> 00:51:49,040
diapozitive, foi de calcul, tablouri de bord,

1328
00:51:46,880 --> 00:51:51,280
și alte fișiere interactive. Acesta este unul

1329
00:51:49,040 --> 00:51:53,520
dintre principalele motive pentru care maners simte

1330
00:51:51,280 --> 00:51:55,760
diferit de chatbot-ul normal. A

1331
00:51:53,520 --> 00:51:58,240
chatbot obișnuit oferă în principal un text

1332
00:51:55,760 --> 00:52:00,160
răspunsuri. Dar manierele pot de fapt

1333
00:51:58,240 --> 00:52:02,079
efectuează acțiuni în interiorul unui control controlat

1334
00:52:00,160 --> 00:52:04,079
mediu. Deci, în timp ce sarcina este

1335
00:52:02,079 --> 00:52:06,720
alergând, ar trebui să stăm cu ochii pe doi

1336
00:52:04,079 --> 00:52:09,040
lucruri. Mai întâi lista de progres la

1337
00:52:06,720 --> 00:52:12,480
înțelegeți ce pas lucrează manus

1338
00:52:09,040 --> 00:52:14,800
pe. În al doilea rând este vizualizarea acțiunii în timp real

1339
00:52:12,480 --> 00:52:16,640
vezi ce face agentul de fapt.

1340
00:52:14,800 --> 00:52:18,880
Acest lucru face ca întregul proces să fie mai mult

1341
00:52:16,640 --> 00:52:20,720
transparentă. Nu aștepți orbește

1342
00:52:18,880 --> 00:52:22,960
pentru rezultatul final. Puteți vedea

1343
00:52:20,720 --> 00:52:25,680
navigarea agentilor, verificarea informatiilor,

1344
00:52:22,960 --> 00:52:28,160
organizarea datelor și construirea rezultatelor

1345
00:52:25,680 --> 00:52:31,119
pas cu pas. Deci, în termeni simpli,

1346
00:52:28,160 --> 00:52:33,760
vedere de execuție arată manus în acțiune.

1347
00:52:31,119 --> 00:52:36,480
Fluxul de lucru alăturat ne ajută să urmărim

1348
00:52:33,760 --> 00:52:38,960
sarcina în timp real și sandbox

1349
00:52:36,480 --> 00:52:41,440
mediu îi oferă lui Manus un nor sigur

1350
00:52:38,960 --> 00:52:43,760
spațiu de lucru unde poate naviga, rula cod,

1351
00:52:41,440 --> 00:52:45,760
colectează date și creează rezultate utile.

1352
00:52:43,760 --> 00:52:47,760
Aceasta este partea din care se mută Manus

1353
00:52:45,760 --> 00:52:50,079
planificarea muncii pentru a face efectiv

1354
00:52:47,760 --> 00:52:52,319
munca. Deci vom reveni la această sarcină

1355
00:52:50,079 --> 00:52:54,559
odată ce este finalizat. Să începem cu a

1356
00:52:52,319 --> 00:52:56,640
sarcină nouă. Acum că am văzut cum

1357
00:52:54,559 --> 00:53:00,000
Manus lucrează în interiorul browserului, haideți

1358
00:52:56,640 --> 00:53:02,640
uite cum poate fi Manus pe web normal

1359
00:53:00,000 --> 00:53:05,920
interfata. Acum, aici vă puteți chiar conecta

1360
00:53:02,640 --> 00:53:08,240
o aplicație diferită, cum ar fi Gmail, browser,

1361
00:53:05,920 --> 00:53:10,079
meta și puteți adăuga alți conectori ca

1362
00:53:08,240 --> 00:53:12,319
bine dacă intenționați să automatizați oricare

1363
00:53:10,079 --> 00:53:14,319
un fel de flux de lucru. Acum aici când vii

1364
00:53:12,319 --> 00:53:16,559
în partea de desktop veți avea un

1365
00:53:14,319 --> 00:53:18,480
aplicația mobilă, precum și aplicația desktop ca

1366
00:53:16,559 --> 00:53:20,880
bine. Acum, dacă ajungi la setări, tu

1367
00:53:18,480 --> 00:53:23,680
poate găsi o opțiune numită integrare.

1368
00:53:20,880 --> 00:53:25,760
Aici vă puteți conecta de fapt

1369
00:53:23,680 --> 00:53:28,240
manos cu platforme ca slăbire,

1370
00:53:25,760 --> 00:53:30,559
telegramă sau chiar linie. Deci, după cum puteți vedea

1371
00:53:28,240 --> 00:53:32,400
aici sunt conectori. Aceasta este

1372
00:53:30,559 --> 00:53:34,800
util deoarece vă permite să interacționați

1373
00:53:32,400 --> 00:53:37,119
cu manus printr-o aplicații de mesagerie

1374
00:53:34,800 --> 00:53:39,760
utilizați deja. De exemplu, în loc de

1375
00:53:37,119 --> 00:53:42,960
deschiderea browserului de fiecare dată,

1376
00:53:39,760 --> 00:53:45,040
puteți doar să delegați o sarcină, verificați

1377
00:53:42,960 --> 00:53:46,960
progresul sau monitorizarea actualizărilor de la a

1378
00:53:45,040 --> 00:53:49,520
aplicație de mesagerie. Deci, dacă lucrezi cu

1379
00:53:46,960 --> 00:53:52,000
o echipă, Slack poate fi util. Dacă vrei

1380
00:53:49,520 --> 00:53:54,720
acces rapid mobil, WhatsApp, Telegram

1381
00:53:52,000 --> 00:53:57,200
sau Leul poate face mai ușor să rămână

1382
00:53:54,720 --> 00:54:00,319
legat de agent. Partea a doua manus

1383
00:53:57,200 --> 00:54:02,640
AI. Să continuăm. Principalul beneficiu este

1384
00:54:00,319 --> 00:54:05,119
telecomanda. Puteți începe monitorizarea

1385
00:54:02,640 --> 00:54:07,280
sarcină chiar și atunci când nu există loc

1386
00:54:05,119 --> 00:54:09,680
fața sistemului principal. Acum următorul

1387
00:54:07,280 --> 00:54:12,160
caracteristica avansată este desktop-ul meu

1388
00:54:09,680 --> 00:54:14,240
caracteristica computerului. Puteți descărca

1389
00:54:12,160 --> 00:54:16,559
versiune de computer aici pe desktop

1390
00:54:14,240 --> 00:54:19,119
aplicația. Acesta este disponibil atunci când aveți

1391
00:54:16,559 --> 00:54:22,160
Aplicația desktop Manus instalată pe Mac

1392
00:54:19,119 --> 00:54:23,920
sau un PC. Aici Manus poate solicita acces

1393
00:54:22,160 --> 00:54:26,240
pentru mașina dvs. locală pentru anumite

1394
00:54:23,920 --> 00:54:28,720
acţiune. De exemplu, ar putea fi nevoie de tine

1395
00:54:26,240 --> 00:54:31,040
citiți un fișier local, deschideți un folder sau rulați

1396
00:54:28,720 --> 00:54:33,359
o comandă de terminal. Dar important

1397
00:54:31,040 --> 00:54:36,079
lucru este de a observa că manus nu

1398
00:54:33,359 --> 00:54:38,640
obțineți un acces complet automat. Acolo

1399
00:54:36,079 --> 00:54:40,800
sunt notele de permisiuni. Există o

1400
00:54:38,640 --> 00:54:43,280
poarta de permis cand manus vrea

1401
00:54:40,800 --> 00:54:45,440
efectuați o acțiune pe computer. tu

1402
00:54:43,280 --> 00:54:48,640
va vedea solicitări precum permiteți o dată sau

1403
00:54:45,440 --> 00:54:50,880
permite mereu. Din punct de vedere al siguranței

1404
00:54:48,640 --> 00:54:52,960
vedere, permite o dată înseamnă că oferi

1405
00:54:50,880 --> 00:54:55,200
permisiunea numai pentru acel anume

1406
00:54:52,960 --> 00:54:56,960
acțiune. Permite întotdeauna înseamnă că ești

1407
00:54:55,200 --> 00:54:59,280
permițând acest tip de acțiune mai mult

1408
00:54:56,960 --> 00:55:01,680
regulat, în funcție de configurație. Deci

1409
00:54:59,280 --> 00:55:04,000
în timp ce arată acest lucru, acest lucru este în special

1410
00:55:01,680 --> 00:55:06,319
util atunci când doriți să lucrați cu Manos

1411
00:55:04,000 --> 00:55:08,800
fișiere pe sisteme, rulați scripturi sau chiar

1412
00:55:06,319 --> 00:55:11,680
ajutor în sarcinile de dezvoltare locală. Acum

1413
00:55:08,800 --> 00:55:13,599
a treia zonă avansată este aplicația web

1414
00:55:11,680 --> 00:55:15,440
constructor. Aici devine gestionarea

1415
00:55:13,599 --> 00:55:17,440
chiar mai puternic. În aplicația web

1416
00:55:15,440 --> 00:55:19,280
interfață de constructor, puteți vedea gestionați

1417
00:55:17,440 --> 00:55:21,520
generarea unui web interactiv live

1418
00:55:19,280 --> 00:55:23,520
aplicarea. Aceasta nu este doar scrierea a

1419
00:55:21,520 --> 00:55:25,200
text sau oferind fragmente de cod. Se poate

1420
00:55:23,520 --> 00:55:27,280
de fapt, construiți pagini, conectați

1421
00:55:25,200 --> 00:55:29,599
baze de date, structurați aplicația și pregătiți

1422
00:55:27,280 --> 00:55:31,760
aceasta în timp ce lucrați cu proiectul. Pentru

1423
00:55:29,599 --> 00:55:34,000
de exemplu, dacă îi cerem lui manus să creeze un

1424
00:55:31,760 --> 00:55:35,920
o simplă pagină de destinație sau o mică aplicație web,

1425
00:55:34,000 --> 00:55:37,760
poate genera un aspect și poate adăuga

1426
00:55:35,920 --> 00:55:40,000
secțiuni interactive, conectați

1427
00:55:37,760 --> 00:55:42,480
logica backend necesară și chiar suport

1428
00:55:40,000 --> 00:55:45,119
lucruri precum configurarea bazei de date și SEO

1429
00:55:42,480 --> 00:55:47,520
optimizare. Cea mai bună parte aici este că

1430
00:55:45,119 --> 00:55:50,400
puteți urmări agentul lucrând pas cu pas

1431
00:55:47,520 --> 00:55:52,400
pas. Îl poți vedea creând fișiere,

1432
00:55:50,400 --> 00:55:54,799
actualizarea designului, testarea paginilor

1433
00:55:52,400 --> 00:55:57,040
și chiar îmbunătățirea rezultatului final. Deci

1434
00:55:54,799 --> 00:55:58,559
această parte este utilă pentru utilizatorii care doresc

1435
00:55:57,040 --> 00:56:00,559
pentru a construi ceva practic ca

1436
00:55:58,559 --> 00:56:02,559
site-uri web, tablou de bord, instrument intern,

1437
00:56:00,559 --> 00:56:05,280
pagina de produs sau chiar prototip fără

1438
00:56:02,559 --> 00:56:08,160
scrierea manuală a tuturor liniilor de cod

1439
00:56:05,280 --> 00:56:10,640
de la zero. Pentru a rezuma această secțiune,

1440
00:56:08,160 --> 00:56:13,920
deci acum să testăm aceeași logică. Acum

1441
00:56:10,640 --> 00:56:16,559
să cerem minus AI să creeze un web

1442
00:56:13,920 --> 00:56:19,760
pagina de destinație pentru o marcă de îngrijire a pielii. Deci

1443
00:56:16,559 --> 00:56:21,680
creați un brand. Acum, pentru a rezuma acest lucru

1444
00:56:19,760 --> 00:56:24,400
secțiunea, browserul este locul principal

1445
00:56:21,680 --> 00:56:26,559
unde folosești manus AI care este acesta.

1446
00:56:24,400 --> 00:56:28,720
Integrarea mesageriei vă ajută

1447
00:56:26,559 --> 00:56:30,960
delegați și monitorizați sarcina de la distanță. The

1448
00:56:28,720 --> 00:56:32,720
Aplicația desktop vă oferă control manual

1449
00:56:30,960 --> 00:56:34,720
acces la mașina dvs. locală cu

1450
00:56:32,720 --> 00:56:36,559
solicitări de permisiune. Și aplicația web

1451
00:56:34,720 --> 00:56:39,440
constructorul ajută manus să creeze live

1452
00:56:36,559 --> 00:56:42,000
proiect web interactiv. Deci asta este ceea ce

1453
00:56:39,440 --> 00:56:44,160
ia manus de la a fi doar un web-based

1454
00:56:42,000 --> 00:56:46,240
Agent AI la ceva care se poate conecta

1455
00:56:44,160 --> 00:56:48,400
cu instrumentul dvs. de comunicare, dvs

1456
00:56:46,240 --> 00:56:50,960
computer și proiectul tău real funcționează.

1457
00:56:48,400 --> 00:56:53,359
Acum, după cum puteți vedea, există abordări

1458
00:56:50,960 --> 00:56:55,760
aici. Acesta este codul pentru întreg

1459
00:56:53,359 --> 00:56:57,920
pagină web. Lasă-l să genereze. Îți voi arăta

1460
00:56:55,760 --> 00:56:59,359
ieșirea deoarece aceasta doar rulează

1461
00:56:57,920 --> 00:57:01,520
primul pas. Mai sunt trei

1462
00:56:59,359 --> 00:57:03,839
pașii implicați în aceasta. Deci vom primi

1463
00:57:01,520 --> 00:57:06,079
revenim la asta odată ce acest lucru este făcut. Acum noi

1464
00:57:03,839 --> 00:57:08,640
vom vedea unde devine Manus AI

1465
00:57:06,079 --> 00:57:11,040
cu adevărat puternic, care este o cercetare profundă

1466
00:57:08,640 --> 00:57:13,520
și date. Ideea principală aici este foarte

1467
00:57:11,040 --> 00:57:16,240
simplu. Manus AI nu este doar un chatboard

1468
00:57:13,520 --> 00:57:18,880
care oferă un răspuns rapid. Poate funcționa

1469
00:57:16,240 --> 00:57:21,040
mai mult ca un cercetător autonom.

1470
00:57:18,880 --> 00:57:22,880
Asta înseamnă că îi poți da un obiectiv și el

1471
00:57:21,040 --> 00:57:24,559
poate planifica sarcina, răsfoiți mai multe

1472
00:57:22,880 --> 00:57:26,319
surse, culege informații, încrucișează

1473
00:57:24,559 --> 00:57:28,079
detaliile verificării și organizați

1474
00:57:26,319 --> 00:57:30,559
constatări și în cele din urmă să creeze un propriu

1475
00:57:28,079 --> 00:57:32,720
ieșire. Deci, în loc să se deschidă manual

1476
00:57:30,559 --> 00:57:34,480
20 de file și copierea nodurilor, verificarea

1477
00:57:32,720 --> 00:57:36,960
resursele și construirea raportului

1478
00:57:34,480 --> 00:57:39,680
te poți descurca cu o parte mai mare a

1479
00:57:36,960 --> 00:57:42,400
acel flux de lucru pentru tine. Să începem cu

1480
00:57:39,680 --> 00:57:44,960
a vom folosi doar o indicație practică

1481
00:57:42,400 --> 00:57:47,599
ca de acum. Acum, pentru această demonstrație, puteți

1482
00:57:44,960 --> 00:57:49,440
trebuie doar să introduceți și să căutați cele mai bune instrumente CRM

1483
00:57:47,599 --> 00:57:51,520
pentru afaceri mici și a crea un

1484
00:57:49,440 --> 00:57:54,799
raport de comparație cu prețuri, cheie

1485
00:57:51,520 --> 00:57:56,720
caracteristici, argumente pro, contra, cele mai bune cazuri de utilizare și

1486
00:57:54,799 --> 00:57:59,200
link sursă. Deci am dat exact

1487
00:57:56,720 --> 00:58:01,520
același îndemn. Acum, odată ce intrăm în asta

1488
00:57:59,200 --> 00:58:03,440
Scopul, manus creează mai întâi un plan. Aceasta

1489
00:58:01,520 --> 00:58:05,680
este important pentru că sarcina nu este

1490
00:58:03,440 --> 00:58:08,000
cer doar un răspuns simplu. Suntem

1491
00:58:05,680 --> 00:58:09,760
cerând să reușești să cercetezi mai multe CRM

1492
00:58:08,000 --> 00:58:12,160
instrumente, comparați-le și pregătiți a

1493
00:58:09,760 --> 00:58:14,640
raport structurat. Odată ce sarcina începe,

1494
00:58:12,160 --> 00:58:17,760
observați cum manierele nu depind doar

1495
00:58:14,640 --> 00:58:19,920
pe un rezultat al căutării. Începe să se viziteze

1496
00:58:17,760 --> 00:58:22,400
diferite site-uri web și verificarea produsului

1497
00:58:19,920 --> 00:58:24,799
pagini, pagini de prețuri, platformă de recenzii,

1498
00:58:22,400 --> 00:58:27,040
bloguri și alte surse disponibile.

1499
00:58:24,799 --> 00:58:29,440
Aceasta este ceea ce numim multi-sursă

1500
00:58:27,040 --> 00:58:31,440
cercetare. De exemplu, dacă MinusAI este

1501
00:58:29,440 --> 00:58:33,760
cercetând instrumente CRM, se poate verifica

1502
00:58:31,440 --> 00:58:35,760
site-uri web oficiale pentru prețuri, recenzii

1503
00:58:33,760 --> 00:58:38,400
platforme pentru feedbackul utilizatorilor și

1504
00:58:35,760 --> 00:58:40,319
articole de comparație pentru nivel de caracteristică

1505
00:58:38,400 --> 00:58:42,480
diferenta. Important este aici

1506
00:58:40,319 --> 00:58:44,160
că Manos nu strânge doar aleatoriu

1507
00:58:42,480 --> 00:58:46,640
informaţii. Încearcă să traverseze

1508
00:58:44,160 --> 00:58:49,200
interfață detaliile. Deci, dacă un site

1509
00:58:46,640 --> 00:58:52,000
menționează un preț, Manos îl poate compara

1510
00:58:49,200 --> 00:58:53,920
cu pagina oficială de prețuri. Dacă unul

1511
00:58:52,000 --> 00:58:55,920
sursa menționează o caracteristică, poate verifica

1512
00:58:53,920 --> 00:58:57,920
dacă aceeași caracteristică este de asemenea listată

1513
00:58:55,920 --> 00:59:00,400
pe site-ul produsului. Acest lucru ajută

1514
00:58:57,920 --> 00:59:02,480
îmbunătățirea calității cercetării.

1515
00:59:00,400 --> 00:59:04,640
Acum, cât timp agentul lucrează, păstrați

1516
00:59:02,480 --> 00:59:07,040
atenția dumneavoastră asupra interacțiunii în timp real

1517
00:59:04,640 --> 00:59:08,720
vedere. Pe de o parte, puteți vedea sarcina

1518
00:59:07,040 --> 00:59:11,040
progres. Pe de altă parte, vezi

1519
00:59:08,720 --> 00:59:12,400
minus navigarea pe site-uri web, deschiderea paginilor,

1520
00:59:11,040 --> 00:59:14,880
luând capturi de ecran, citind

1521
00:59:12,400 --> 00:59:17,040
informații și actualizarea constatărilor acesteia.

1522
00:59:14,880 --> 00:59:19,280
Acest lucru face procesul mai transparent.

1523
00:59:17,040 --> 00:59:21,200
Nu ești orb. Nu ești orbește

1524
00:59:19,280 --> 00:59:23,040
asteptand raspunsul final. Deci ești

1525
00:59:21,200 --> 00:59:24,400
văzând de fapt cum este agentul

1526
00:59:23,040 --> 00:59:26,480
colectarea și organizarea

1527
00:59:24,400 --> 00:59:28,640
informaţii. Un alt lucru important este

1528
00:59:26,480 --> 00:59:30,880
pentru a observa cum gestionați mânerele mici

1529
00:59:28,640 --> 00:59:33,200
probleme în timpul căutării. Uneori a

1530
00:59:30,880 --> 00:59:35,359
pagina poate să nu se deschidă. Uneori un link poate

1531
00:59:33,200 --> 00:59:38,000
fi rupt. Uneori un site web poate fi

1532
00:59:35,359 --> 00:59:40,960
JavaScript greu și greu de citit.

1533
00:59:38,000 --> 00:59:43,440
În fluxul de lucru manual ne-am fi oprit

1534
00:59:40,960 --> 00:59:45,599
și găsiți o altă sursă de active. Dar

1535
00:59:43,440 --> 00:59:48,240
maners are strat de planificare care poate

1536
00:59:45,599 --> 00:59:50,000
creați pași de recuperare. Deci, dacă o sursă

1537
00:59:48,240 --> 00:59:52,319
nu merge, se poate incerca altul

1538
00:59:50,000 --> 00:59:54,720
sursa. căutați din nou sau ajustați calea

1539
00:59:52,319 --> 00:59:56,480
fără a avea nevoie de ajutor uman constant.

1540
00:59:54,720 --> 00:59:58,880
Acesta este motivul pentru care maniere este utilă pentru

1541
00:59:56,480 --> 01:00:00,880
cercetează sarcini grele. La final, cel

1542
00:59:58,880 --> 01:00:03,520
ieșirea nu ar trebui să fie doar un paragraf

1543
01:00:00,880 --> 01:00:05,839
rezumat. Un rezultat bun ar trebui să fie a

1544
01:00:03,520 --> 01:00:08,480
artefact structurat ca o comparație

1545
01:00:05,839 --> 01:00:10,319
tabel sau un raport de cercetare complet. Pentru

1546
01:00:08,480 --> 01:00:12,319
Exemplu CRM, rezultatul final poate

1547
01:00:10,319 --> 01:00:14,640
includ instrumente, nume, prețuri, cheie

1548
01:00:12,319 --> 01:00:16,720
caracteristici, avantaje, contra, cele mai bune cazuri de utilizare,

1549
01:00:14,640 --> 01:00:19,440
și link-uri sursă, pe care le vom verifica înapoi

1550
01:00:16,720 --> 01:00:22,079
în câteva minute. Dacă poți să treci dincolo

1551
01:00:19,440 --> 01:00:24,400
unul răspunde scurt și prefer un complet

1552
01:00:22,079 --> 01:00:27,520
fluxul de lucru de cercetare în mai multe

1553
01:00:24,400 --> 01:00:30,640
surse, manusi este instrumentul. Acum hai

1554
01:00:27,520 --> 01:00:33,200
trece la care este căutare largă. Aceasta este

1555
01:00:30,640 --> 01:00:35,920
caracteristică mai avansată de credit intensiv.

1556
01:00:33,200 --> 01:00:38,079
Așa că vom reveni la toate cele trei într-un

1557
01:00:35,920 --> 01:00:40,160
minut. Vom reveni la toate trei

1558
01:00:38,079 --> 01:00:43,280
ieșiri și explic care a fost exact

1559
01:00:40,160 --> 01:00:45,200
pașii necesari. Deci revenind la larg

1560
01:00:43,280 --> 01:00:47,599
cercetare. În cercetările normale, agentul

1561
01:00:45,200 --> 01:00:49,440
poate explora sursele pas cu pas. Dar în

1562
01:00:47,599 --> 01:00:52,160
cercetare amplă, ideea este foarte

1563
01:00:49,440 --> 01:00:54,160
diferite. Cercetarea largă este concepută pentru

1564
01:00:52,160 --> 01:00:56,640
scalare. În loc să verifici câteva

1565
01:00:54,160 --> 01:00:59,359
sursele una după alta, se poate

1566
01:00:56,640 --> 01:01:01,440
explorați mai multe surse în paralel. Manus

1567
01:00:59,359 --> 01:01:03,839
a descris cercetări ample ca fiind folositoare

1568
01:01:01,440 --> 01:01:06,079
orchestrare paralelă cu mai mulți agenți unde

1569
01:01:03,839 --> 01:01:08,559
mulți agenți pot lucra în mari dimensiuni

1570
01:01:06,079 --> 01:01:10,799
spațiu de cercetare în același timp. Deci asta

1571
01:01:08,559 --> 01:01:14,000
nu este destinat pentru întrebări de bază precum

1572
01:01:10,799 --> 01:01:16,079
ce este CRM sau chiar da-mi cinci instrumente.

1573
01:01:14,000 --> 01:01:18,880
Această caracteristică este mai bună pentru un impact ridicat

1574
01:01:16,079 --> 01:01:20,960
sarcini de cercetare cum ar fi analiza pieței,

1575
01:01:18,880 --> 01:01:23,040
cercetare competitivă, rapoarte din industrie,

1576
01:01:20,960 --> 01:01:25,839
cercetare de investiții, cercetare de produs,

1577
01:01:23,040 --> 01:01:28,400
sau chiar planificarea strategiei. De exemplu,

1578
01:01:25,839 --> 01:01:31,520
putem folosi o versiune mare a acestuia

1579
01:01:28,400 --> 01:01:33,920
subiect CRM. Efectuați cercetări ample despre CRM

1580
01:01:31,520 --> 01:01:36,160
piața de software pentru întreprinderile mai mici.

1581
01:01:33,920 --> 01:01:37,839
Comparați jucătorii importanți, prețurile, tendințele,

1582
01:01:36,160 --> 01:01:39,760
Caracteristici AI și chiar client

1583
01:01:37,839 --> 01:01:41,760
sentiment, poziții pe piață sau chiar a

1584
01:01:39,760 --> 01:01:44,480
oportunități de creștere. Acest tip de

1585
01:01:41,760 --> 01:01:46,720
promptul este mult mai larg. Aici nu suntem

1586
01:01:44,480 --> 01:01:48,480
cer doar o comparație de instrumente. Noi

1587
01:01:46,720 --> 01:01:50,720
cer minerilor să înțeleagă

1588
01:01:48,480 --> 01:01:53,040
piata din unghiuri diferite. S-ar putea

1589
01:01:50,720 --> 01:01:55,359
explora companii, site-uri web, recenzie

1590
01:01:53,040 --> 01:01:57,920
site-uri, rapoarte de piață, concurenți,

1591
01:01:55,359 --> 01:02:00,640
pagini, documentația produsului, utilizator

1592
01:01:57,920 --> 01:02:02,480
discuții și alte surse publice.

1593
01:02:00,640 --> 01:02:05,040
Acum, înainte de a începe cercetări ample,

1594
01:02:02,480 --> 01:02:07,280
explicați întotdeauna în mod clar partea de credit.

1595
01:02:05,040 --> 01:02:09,680
Acest tip de sarcină poate consuma mult mai mult

1596
01:02:07,280 --> 01:02:12,000
credite decât ar face o cercetare normală.

1597
01:02:09,680 --> 01:02:13,760
Deoarece cercetările ample explorează o mare

1598
01:02:12,000 --> 01:02:15,440
număr de surse și rulează mult

1599
01:02:13,760 --> 01:02:17,680
flux de lucru mai greu, poate costa

1600
01:02:15,440 --> 01:02:20,240
semnificativ mai multe credite. Deci ar trebui

1601
01:02:17,680 --> 01:02:22,960
folosiți-l pentru lucrări importante de cercetare, nu

1602
01:02:20,240 --> 01:02:25,200
pentru un simplu QandA. Acest lucru este important pentru

1603
01:02:22,960 --> 01:02:27,599
cursanţilor. Gândiți-vă la asta ca la angajarea unui full

1604
01:02:25,200 --> 01:02:29,359
echipa de cercetare pentru o sarcină. Ai vrea

1605
01:02:27,599 --> 01:02:31,200
nu le folosiți doar pentru un mic

1606
01:02:29,359 --> 01:02:33,359
definiție. L-ai folosi atunci când

1607
01:02:31,200 --> 01:02:36,319
producția are valoare reală de afaceri. Deci

1608
01:02:33,359 --> 01:02:38,480
principala variantă aici este utilizarea normală

1609
01:02:36,319 --> 01:02:40,400
cercetare pentru o sarcină concentrată. Folosește de ce

1610
01:02:38,480 --> 01:02:43,119
cercetare atunci când aveți nevoie de o scară largă

1611
01:02:40,400 --> 01:02:45,680
analiză de mare profunzime din mai multe surse.

1612
01:02:43,119 --> 01:02:47,760
Acum, în continuare, vom trece la ea este utilă

1613
01:02:45,680 --> 01:02:49,760
pentru că arată cum se pot mișca manualele

1614
01:02:47,760 --> 01:02:52,240
de la date brute la o afacere finalizată

1615
01:02:49,760 --> 01:02:55,359
raport. Aici, de exemplu, să spunem hai

1616
01:02:52,240 --> 01:02:57,599
încărcați un fișier CSV. Deci aici am luat un

1617
01:02:55,359 --> 01:03:00,400
set de date aleatorii de la Kaggle și am

1618
01:02:57,599 --> 01:03:02,240
l-a încărcat. Scrie set de date despre împrumut. Acum

1619
01:03:00,400 --> 01:03:04,400
să-i dăm un proverb prompt analizează

1620
01:03:02,240 --> 01:03:06,559
aceste date de împrumut și creați un raport

1621
01:03:04,400 --> 01:03:09,520
care arată tendințele veniturilor, cele mai performante

1622
01:03:06,559 --> 01:03:14,079
produse etc. Deci să spunem doar să analizăm

1623
01:03:09,520 --> 01:03:17,760
aceste date de împrumut și creați un raport

1624
01:03:14,079 --> 01:03:20,640
arătând tendințele. Așa că ține cont că am

1625
01:03:17,760 --> 01:03:24,480
deja curățat aceste date și executat

1626
01:03:20,640 --> 01:03:26,559
folosind AI care este în colaborare, dar tot ea

1627
01:03:24,480 --> 01:03:29,200
mi-a luat o oră ca să creez

1628
01:03:26,559 --> 01:03:31,200
ea. Deci hai să lăsăm. Acum ca tine

1629
01:03:29,200 --> 01:03:33,520
pot vedea că aici devine manierele

1630
01:03:31,200 --> 01:03:35,680
diferit de instrumentele AI normale. Da

1631
01:03:33,520 --> 01:03:37,920
nu numai să te uiți în dosar și să ghicești

1632
01:03:35,680 --> 01:03:40,799
raspunsul. Poate funcționa în interiorul unui nor

1633
01:03:37,920 --> 01:03:43,039
cutie cu nisip. În interiorul acestei cutii cu nisip, minerii pot

1634
01:03:40,799 --> 01:03:44,880
scrieți și executați cod, cum ar fi Python

1635
01:03:43,039 --> 01:03:46,799
procesează datele. Deci, dacă fișierul

1636
01:03:44,880 --> 01:03:48,720
conține mii de rânduri, minerii pot

1637
01:03:46,799 --> 01:03:50,079
calcula totaluri, medii, tendințe,

1638
01:03:48,720 --> 01:03:51,920
categorie performanță, produs

1639
01:03:50,079 --> 01:03:54,160
performanță, performanță regională și

1640
01:03:51,920 --> 01:03:56,480
alte valori utile. În timp ce aceasta este

1641
01:03:54,160 --> 01:03:58,400
care se întâmplă, arată perspectiva execuțională.

1642
01:03:56,480 --> 01:04:00,079
Poate vezi că omul citește fișierul,

1643
01:03:58,400 --> 01:04:01,680
scrierea codului, rularea analizei,

1644
01:04:00,079 --> 01:04:04,160
verificarea ieșirii și generarea

1645
01:04:01,680 --> 01:04:06,000
grafice. Aceasta este manus nu produce

1646
01:04:04,160 --> 01:04:07,839
text. De fapt, este mini

1647
01:04:06,000 --> 01:04:09,839
date și acesta este fluxul de lucru. După

1648
01:04:07,839 --> 01:04:12,240
prelucrarea datelor, Manus poate, de asemenea

1649
01:04:09,839 --> 01:04:14,079
creați vizualizare. De exemplu, ea

1650
01:04:12,240 --> 01:04:17,200
poate genera diagrame care arată împrumutul

1651
01:04:14,079 --> 01:04:19,680
date de predicție, care categorie va

1652
01:04:17,200 --> 01:04:21,440
luați mai mult împrumut etc. Apoi finala

1653
01:04:19,680 --> 01:04:24,000
pas, poate sintetiza totul în

1654
01:04:21,440 --> 01:04:26,400
un raport de afaceri. Acum, ce face un bine

1655
01:04:24,000 --> 01:04:28,400
raportul include? ce arată datele,

1656
01:04:26,400 --> 01:04:30,640
ce produse au performanțe bune,

1657
01:04:28,400 --> 01:04:32,480
ce zone necesită atenție, ce tendințe

1658
01:04:30,640 --> 01:04:34,960
sunt vizibile și ce acțiuni

1659
01:04:32,480 --> 01:04:37,520
afacerile ar trebui să ia mai departe. Deci dintr-una

1660
01:04:34,960 --> 01:04:40,480
încărcarea fișierului și un prompt, Manus

1661
01:04:37,520 --> 01:04:42,559
poate finaliza un flux de lucru cap la cap. Ea

1662
01:04:40,480 --> 01:04:44,240
poate transmite datele, rula codul, crea

1663
01:04:42,559 --> 01:04:47,680
diagrame, interpretați rezultatele și scrieți

1664
01:04:44,240 --> 01:04:49,599
un raport final. Acesta este motivul pentru care Minus este

1665
01:04:47,680 --> 01:04:51,839
foarte util pentru utilizatorii de afaceri,

1666
01:04:49,599 --> 01:04:53,680
analiză, marketing, echipe de vânzări,

1667
01:04:51,839 --> 01:04:56,480
fondatorii și datele de învățare ale studenților

1668
01:04:53,680 --> 01:04:59,039
analiza. Acum să vedem cum poate Manis AI

1669
01:04:56,480 --> 01:05:00,880
lucru pe lucrător de cercetare autonom. Ea

1670
01:04:59,039 --> 01:05:02,799
poate răsfoi mai multe surse, analiza

1671
01:05:00,880 --> 01:05:05,039
date, rulați cod și pregătiți structurat

1672
01:05:02,799 --> 01:05:07,359
rapoarte. Acum, în acest modul vom vedea

1673
01:05:05,039 --> 01:05:09,520
manus AI ca creator. Aici este locul

1674
01:05:07,359 --> 01:05:12,319
manus trece de la doar a da răspunsuri la

1675
01:05:09,520 --> 01:05:14,079
crearea de artefacte funcționale finite.

1676
01:05:12,319 --> 01:05:16,319
Deci, în loc să-i ceri doar lui manus să

1677
01:05:14,079 --> 01:05:18,640
explicați ceva, putem cere să construim

1678
01:05:16,319 --> 01:05:20,880
ceva. Poate crea aplicații web, slide

1679
01:05:18,640 --> 01:05:23,280
text, postere, infografic, vizual

1680
01:05:20,880 --> 01:05:25,680
conținut și, de asemenea, activele complete ale proiectului

1681
01:05:23,280 --> 01:05:27,760
dintr-un singur prompt al limbajului natural.

1682
01:05:25,680 --> 01:05:30,160
Deci, să începem. Deci aici hai să dăm

1683
01:05:27,760 --> 01:05:32,000
maniere un singur prompt. Acum să întrebăm

1684
01:05:30,160 --> 01:05:34,079
pentru a crea o pagină de destinație pentru AI

1685
01:05:32,000 --> 01:05:35,920
instrumente de productivitate pentru elevi cu

1686
01:05:34,079 --> 01:05:38,480
secțiuni pentru caracteristici, prețuri,

1687
01:05:35,920 --> 01:05:41,359
mărturii, întrebări frecvente și apel în acțiune.

1688
01:05:38,480 --> 01:05:43,280
Acum poți observa ce se întâmplă aici? Noi

1689
01:05:41,359 --> 01:05:45,440
nu oferă minerilor un design complet

1690
01:05:43,280 --> 01:05:48,400
document. Nu scriem cod. Noi

1691
01:05:45,440 --> 01:05:50,799
nu explic foarte secțiunea pas cu

1692
01:05:48,400 --> 01:05:52,880
pas. Îi dăm doar o idee.

1693
01:05:50,799 --> 01:05:55,119
Manus ia această idee, înțelege

1694
01:05:52,880 --> 01:05:56,880
obiectiv, creează un plan, decide pagina

1695
01:05:55,119 --> 01:05:58,640
structura, scrie conținutul, proiectează

1696
01:05:56,880 --> 01:06:01,599
aspectul și începe să construiască

1697
01:05:58,640 --> 01:06:03,760
pagina. Acest lucru este important. Manus nu este

1698
01:06:01,599 --> 01:06:06,319
dându-ne doar un răspuns text. Este

1699
01:06:03,760 --> 01:06:08,319
crearea unui portofoliu pe care se poate face clic. Deci, ca

1700
01:06:06,319 --> 01:06:10,240
puteți vedea, a început deja să se creeze

1701
01:06:08,319 --> 01:06:12,240
Acest lucru poate fi foarte util pentru

1702
01:06:10,240 --> 01:06:14,559
dezvoltatori, manageri de produs, startup

1703
01:06:12,240 --> 01:06:16,799
fondatori, marketeri și echipe de afaceri.

1704
01:06:14,559 --> 01:06:19,039
Dacă cineva are o idee și vrea

1705
01:06:16,799 --> 01:06:21,280
vezi rapid cum ar putea arata a

1706
01:06:19,039 --> 01:06:23,359
site-ul web, manierele pot ajuta la crearea

1707
01:06:21,280 --> 01:06:25,680
prima versiune foarte repede. În loc de

1708
01:06:23,359 --> 01:06:28,559
petrecând ore întregi pregătind un cadru sau

1709
01:06:25,680 --> 01:06:30,799
explicând ideea unui designer sau unui

1710
01:06:28,559 --> 01:06:33,280
dezvoltator, ne putem folosi doar de maniere

1711
01:06:30,799 --> 01:06:35,520
creați o versiune brută. Apoi noi

1712
01:06:33,280 --> 01:06:37,839
îl puteți împărtăși cu echipa, clientul sau

1713
01:06:35,520 --> 01:06:39,760
părțile interesate pentru feedback. In functie de

1714
01:06:37,839 --> 01:06:42,640
tunelurile pot ajuta și cu mai mult

1715
01:06:39,760 --> 01:06:44,799
piese avansate precum baze de date, plată

1716
01:06:42,640 --> 01:06:46,880
flux, structură SEO prietenoasă și

1717
01:06:44,799 --> 01:06:48,319
etapele legate de implementare. Dar pentru

1718
01:06:46,880 --> 01:06:51,680
începători, principalul lucru este să

1719
01:06:48,319 --> 01:06:54,480
înțelege acest manual se poate trece de la o

1720
01:06:51,680 --> 01:06:56,720
idee la un prototip funcțional. De asemenea,

1721
01:06:54,480 --> 01:06:59,359
acest tip de sarcină reprezintă mai multe resurse

1722
01:06:56,720 --> 01:07:01,920
inensiv decât un simplu răspuns prin chat.

1723
01:06:59,359 --> 01:07:04,640
Construirea unei pagini web poate consuma sute

1724
01:07:01,920 --> 01:07:06,319
de credite. Uneori între 500 și 000

1725
01:07:04,640 --> 01:07:09,039
sau chiar mai mult in functie de

1726
01:07:06,319 --> 01:07:11,359
complexitate. Deci, înainte de a rula o aplicație web

1727
01:07:09,039 --> 01:07:13,920
sarcină, verificați întotdeauna creditul estimat

1728
01:07:11,359 --> 01:07:16,960
utilizare. Acest lucru se datorează faptului că minus nu este numai

1729
01:07:13,920 --> 01:07:19,119
scrierea textului, este planificarea, codificarea,

1730
01:07:16,960 --> 01:07:21,359
testarea, construirea și uneori manipularea

1731
01:07:19,119 --> 01:07:24,319
de asemenea, etapele de implementare. Acum să ne mișcăm

1732
01:07:21,359 --> 01:07:28,079
la partea următoare. Acum, acum hai să întrebăm

1733
01:07:24,319 --> 01:07:30,640
manus pentru a crea un slide deck. Acum hai

1734
01:07:28,079 --> 01:07:33,200
cereți manus AI să creeze un text pe

1735
01:07:30,640 --> 01:07:35,280
viitorul agenților AI pentru echipele de afaceri.

1736
01:07:33,200 --> 01:07:37,119
Acum, odată ce dăm acest îndemn, Manus

1737
01:07:35,280 --> 01:07:39,039
începe să planifice tehnologia slide. Da

1738
01:07:37,119 --> 01:07:41,200
nu creează diapozitiv la întâmplare. Mai întâi

1739
01:07:39,039 --> 01:07:43,119
creează o structură adecvată. De exemplu,

1740
01:07:41,200 --> 01:07:45,359
atunci poate începe cu o introducere

1741
01:07:43,119 --> 01:07:47,119
explicați ce sunt agenții AI, de ce

1742
01:07:45,359 --> 01:07:49,200
companiile le folosesc, lor

1743
01:07:47,119 --> 01:07:51,520
beneficii, cazuri de utilizare, provocări și

1744
01:07:49,200 --> 01:07:53,760
in sfarsit o concluzie. Aceasta este ceea ce face

1745
01:07:51,520 --> 01:07:56,079
ieșirea utilă. Nu este doar un set

1746
01:07:53,760 --> 01:07:58,640
de diapozitive separate. Este un structurat

1747
01:07:56,079 --> 01:08:01,280
poveste vizuală pentru subiecte grele de cercetare.

1748
01:07:58,640 --> 01:08:03,440
Minerii pot, de asemenea, să navigheze pe web, să colecteze

1749
01:08:01,280 --> 01:08:05,359
informații utile și includ citate

1750
01:08:03,440 --> 01:08:07,200
puncte. Acest lucru îl face util pentru

1751
01:08:05,359 --> 01:08:09,440
prezentare de afaceri, pachete de cercetare,

1752
01:08:07,200 --> 01:08:11,760
pitch decks, modele de antrenament și

1753
01:08:09,440 --> 01:08:14,079
rapoarte interne. În timp ce sarcina este

1754
01:08:11,760 --> 01:08:15,920
alergând, uită-te la vizualizarea interacțiunii.

1755
01:08:14,079 --> 01:08:17,759
Puteți vedea maniere creând

1756
01:08:15,920 --> 01:08:19,759
schiță, pregătirea conținutului diapozitivelor,

1757
01:08:17,759 --> 01:08:22,480
îmbunătățirea designului, construirea finalului

1758
01:08:19,759 --> 01:08:24,640
punte și odată ce puntea este gata, poți

1759
01:08:22,480 --> 01:08:27,359
descărcați de obicei într-un mediu de afaceri

1760
01:08:24,640 --> 01:08:29,359
format ca Pex. Deci încă îl putem deschide

1761
01:08:27,359 --> 01:08:31,040
în PowerPoint și faceți manualul final

1762
01:08:29,359 --> 01:08:33,040
schimbari. Acum acest lucru este foarte important

1763
01:08:31,040 --> 01:08:35,040
pentru că manus ne dă o primă puternică

1764
01:08:33,040 --> 01:08:37,440
versiune, dar încă o putem regla fin

1765
01:08:35,040 --> 01:08:39,759
diapozitivele bazate pe publicul mărcii noastre

1766
01:08:37,440 --> 01:08:42,080
sau chiar stilul de prezentare. Acum hai

1767
01:08:39,759 --> 01:08:44,000
mergi mai departe. Să revenim la asta mai târziu.

1768
01:08:42,080 --> 01:08:46,159
Să vedem care sunt rezultatele pentru toți

1769
01:08:44,000 --> 01:08:48,719
îndemnul pe care l-am dat. Deci

1770
01:08:46,159 --> 01:08:51,120
în primul rând i-am cerut să creeze un

1771
01:08:48,719 --> 01:08:53,600
pagina de destinație pentru o marcă de îngrijire a pielii. Acum

1772
01:08:51,120 --> 01:08:56,239
după cum puteți vedea, există o marcă de îngrijire a pielii

1773
01:08:53,600 --> 01:08:59,600
unde le puteți edita și pe acestea. Deci

1774
01:08:56,239 --> 01:09:02,000
numele este dat produsele beneficii

1775
01:08:59,600 --> 01:09:05,759
tensor purificator care este costul in

1776
01:09:02,000 --> 01:09:07,839
dolari. Puteți edita pagina de destinație.

1777
01:09:05,759 --> 01:09:10,400
Acest lucru de obicei dura zile pentru o

1778
01:09:07,839 --> 01:09:12,960
Designer UIUX pentru a proiecta întreaga pagină.

1779
01:09:10,400 --> 01:09:15,920
se termină doar cu un mic prompt. Deci tu

1780
01:09:12,960 --> 01:09:17,920
au produse, recenzii, cumpără acum și dacă

1781
01:09:15,920 --> 01:09:21,679
vii aici gata să-ți transformi

1782
01:09:17,920 --> 01:09:24,799
pielea, magazinele, nou-veniti, colle

1783
01:09:21,679 --> 01:09:27,359
colectare, sprijin, etc. Acest lucru nu este

1784
01:09:24,799 --> 01:09:29,759
arata ca tocmai s-a facut dintr-o

1785
01:09:27,359 --> 01:09:33,679
îndemnul. Acum dacă ajungi la al doilea

1786
01:09:29,759 --> 01:09:36,560
unul, haideți că am cerut să comparăm

1787
01:09:33,679 --> 01:09:39,839
instrumente de top CRM. Să vedem care este

1788
01:09:36,560 --> 01:09:42,159
raspunde pentru asta. Deci aici a fost promptul

1789
01:09:39,839 --> 01:09:44,000
pentru a cerceta instrumentele de top CRM pentru mici

1790
01:09:42,159 --> 01:09:46,000
afaceri și creați o comparație

1791
01:09:44,000 --> 01:09:48,400
raport cu prețuri, caracteristici cheie, avantaje,

1792
01:09:46,000 --> 01:09:52,400
contra, cele mai bune cazuri de utilizare și linkul cursului. Deci

1793
01:09:48,400 --> 01:09:54,560
după cum vedeți, să deschidem acest raport.

1794
01:09:52,400 --> 01:09:56,400
Deci aici avem un rezumat unde este mic

1795
01:09:54,560 --> 01:09:59,040
Secțiunea CRM de afaceri este cea mai bună

1796
01:09:56,400 --> 01:10:01,120
abordare ca un compromis între acestea ușor

1797
01:09:59,040 --> 01:10:03,120
unelte. Acum se compară toate

1798
01:10:01,120 --> 01:10:06,159
lucruri pe care le-am dat? Primul

1799
01:10:03,120 --> 01:10:09,679
este prețul de pornire al hub-ului de vânzări HubSpot

1800
01:10:06,159 --> 01:10:11,679
caracteristici cheie pro contra cele mai bune cazuri de utilizare

1801
01:10:09,679 --> 01:10:15,280
și link sursă toate lucrurile sunt

1802
01:10:11,679 --> 01:10:16,960
prezent de obicei dacă folosești o persoană ei

1803
01:10:15,280 --> 01:10:19,040
folosit pentru a naviga prin fiecare

1804
01:10:16,960 --> 01:10:22,159
site-ul web pe care l-ar putea găsi și crea astfel

1805
01:10:19,040 --> 01:10:24,320
un fel de raport acum se face doar într-o

1806
01:10:22,159 --> 01:10:26,320
micul prompt pe care l-am dat acum să

1807
01:10:24,320 --> 01:10:28,719
treceți la următoarea care este împrumutul

1808
01:10:26,320 --> 01:10:31,679
analiza datelor aceasta este cea mai utilă

1809
01:10:28,719 --> 01:10:34,080
instrument pentru analist de date pentru că cheltuim

1810
01:10:31,679 --> 01:10:36,560
ore. Ei petrec ore întregi curățând

1811
01:10:34,080 --> 01:10:38,640
date, vizualizarea tendințelor, ce sunt graficele

1812
01:10:36,560 --> 01:10:41,040
potrivit pentru ce fel de date,

1813
01:10:38,640 --> 01:10:43,040
normalizarea datelor și atâtea altele

1814
01:10:41,040 --> 01:10:45,440
trepte. Acum, dacă puteți încărca doar un

1815
01:10:43,040 --> 01:10:47,920
fișier și cereți-i să creeze toate fișierele

1816
01:10:45,440 --> 01:10:50,320
rapoarte și toate lucrurile necesare pentru

1817
01:10:47,920 --> 01:10:53,520
luați o decizie de afaceri, asta va fi

1818
01:10:50,320 --> 01:10:55,760
cel mai util instrument pentru analiștii de date.

1819
01:10:53,520 --> 01:10:57,679
Acum, să vedem răspunsul pentru aceasta. Ca

1820
01:10:55,760 --> 01:10:59,760
puteți vedea că graficele sunt acolo. Lasă-mă

1821
01:10:57,679 --> 01:11:01,520
doar deschis. Puteți da un prompt unde

1822
01:10:59,760 --> 01:11:04,320
ce fel de grafic vrei, ce

1823
01:11:01,520 --> 01:11:06,719
față de ce grafic doriți etc. Puteți

1824
01:11:04,320 --> 01:11:08,239
vezi istoricul creditului, starea civilă,

1825
01:11:06,719 --> 01:11:10,560
zona de proprietate, educatie,

1826
01:11:08,239 --> 01:11:13,040
munca independentă și dependență toate

1827
01:11:10,560 --> 01:11:15,440
față de rata de aprobare. Acum dacă vii

1828
01:11:13,040 --> 01:11:18,239
aici există și un rezumat care este

1829
01:11:15,440 --> 01:11:20,880
un raport. Acum, rezumatul este că

1830
01:11:18,239 --> 01:11:22,719
raport analizeaza 614 fac aplicatii

1831
01:11:20,880 --> 01:11:24,800
folosind setul de date de împrumut încărcat

1832
01:11:22,719 --> 01:11:27,600
care acoperă veniturile demografice ale solicitanților

1833
01:11:24,800 --> 01:11:30,080
venitul co-licant etc. Setul de date arată

1834
01:11:27,600 --> 01:11:33,360
Au fost aprobate 422 de cereri

1835
01:11:30,080 --> 01:11:35,199
prezentând un total de 68% în timp ce 192

1836
01:11:33,360 --> 01:11:38,640
cererile au fost respinse reprezentând

1837
01:11:35,199 --> 01:11:42,960
o rată de respingere de 31%. Acum cât poți

1838
01:11:38,640 --> 01:11:45,199
vezi că avem aprobare și rata respinsă

1839
01:11:42,960 --> 01:11:47,040
și prezentarea generală a datelor. Care sunt

1840
01:11:45,199 --> 01:11:49,040
date?

1841
01:11:47,040 --> 01:11:51,440
Acum, acesta este un set de date foarte mic

1842
01:11:49,040 --> 01:11:54,159
și mi-a luat aproape o zi să lucrez

1843
01:11:51,440 --> 01:11:56,880
acest set de date și creați modelare etc.

1844
01:11:54,159 --> 01:11:59,679
Acest lucru se face în câteva minute și

1845
01:11:56,880 --> 01:12:01,600
este uimitor pentru că este nevoie de mult

1846
01:11:59,679 --> 01:12:05,040
de timp curăţarea setului de date ştiind

1847
01:12:01,600 --> 01:12:07,280
datele cum să înțelegeți datele.

1848
01:12:05,040 --> 01:12:10,480
Asta rezolvă toată problema. Acum

1849
01:12:07,280 --> 01:12:13,280
se ajunge la următoarea creare de conținut.

1850
01:12:10,480 --> 01:12:15,440
Așa că aici îl rugasem pe manusi să cerceteze

1851
01:12:13,280 --> 01:12:18,320
cele mai importante instrumente AI pentru crearea de conținut

1852
01:12:15,440 --> 01:12:20,719
și creați un raport al companiei. Deci aici ca

1853
01:12:18,320 --> 01:12:23,040
puteți vedea că există un raport care este

1854
01:12:20,719 --> 01:12:25,040
dat. Să o previzualizam. Deci aici

1855
01:12:23,040 --> 01:12:27,600
titlul este acolo instrumente de explorare descărcare

1856
01:12:25,040 --> 01:12:29,199
raportul din nou acesta este tratat ca

1857
01:12:27,600 --> 01:12:31,600
ca un site web care are toate

1858
01:12:29,199 --> 01:12:34,320
informaţii. Deci aici puteți vedea instrumentul

1859
01:12:31,600 --> 01:12:37,120
distribuție pe categorii de generare de text

1860
01:12:34,320 --> 01:12:41,199
instrumentul este ca unul etc. Nivelul de prețuri

1861
01:12:37,120 --> 01:12:44,159
distribuția 63.2 către instrumentele AI direct.

1862
01:12:41,199 --> 01:12:46,800
Primul lucru este chat GPT care este

1863
01:12:44,159 --> 01:12:49,840
probabil consumat cel mai mult cred. În continuare

1864
01:12:46,800 --> 01:12:54,000
este Jasper AI. Apoi avem Canva AI și

1865
01:12:49,840 --> 01:12:55,520
următorul Grammarly Ptory Morph AI Descript

1866
01:12:54,000 --> 01:12:59,760
Mijlocul călătoriei

1867
01:12:55,520 --> 01:13:02,320
Surfer SEO Gemeni Claude Copy.ai etc. Deci

1868
01:12:59,760 --> 01:13:04,960
aici puteti vedea si pretul care este

1869
01:13:02,320 --> 01:13:07,840
cel mai potrivit pentru că există o versiune gratuită

1870
01:13:04,960 --> 01:13:10,320
asemenea. Deci are și versiunea gratuită

1871
01:13:07,840 --> 01:13:12,080
rating. Acest lucru este uimitor pentru conținut

1872
01:13:10,320 --> 01:13:14,880
creație pentru că de obicei nu primim

1873
01:13:12,080 --> 01:13:17,679
imagini care dau directia exacta

1874
01:13:14,880 --> 01:13:19,920
sau raportul exact al numerelor exacte care

1875
01:13:17,679 --> 01:13:22,640
am gasit online. Este fie că trebuie

1876
01:13:19,920 --> 01:13:25,600
creați de la zero. Deci asta este uimitor

1877
01:13:22,640 --> 01:13:28,320
pentru conținut ca tine ai evaluări, tu

1878
01:13:25,600 --> 01:13:30,320
au prețuri, trebuie să le compari,

1879
01:13:28,320 --> 01:13:33,120
selectați instrumentele de top pentru a compara. hai sa

1880
01:13:30,320 --> 01:13:35,360
compară chat chibity și Jasper scuze

1881
01:13:33,120 --> 01:13:38,800
Jasper și chat chibity și, de asemenea, Canva

1882
01:13:35,360 --> 01:13:41,040
AI toate trei sunt folosite în mod egal. Acum hai

1883
01:13:38,800 --> 01:13:43,760
deselectați-le și copiați.ai. Acum ca tine

1884
01:13:41,040 --> 01:13:47,040
poate vedea copy.ai este un pic mai puțin activ

1885
01:13:43,760 --> 01:13:50,560
evaluări. Doamne, asta e prea bun

1886
01:13:47,040 --> 01:13:52,960
fi un instrument. Aceasta este literalmente AI pentru a funcționa.

1887
01:13:50,560 --> 01:13:55,920
Să verificăm următorul care este

1888
01:13:52,960 --> 01:13:58,560
pagina de destinație pentru productivitatea AI. Acum

1889
01:13:55,920 --> 01:14:01,040
din nou, aceasta va fi și o pagină de destinație.

1890
01:13:58,560 --> 01:14:02,719
Deci practic este ca un site web. Acum ca

1891
01:14:01,040 --> 01:14:04,800
puteți vedea că avem colegiul principal

1892
01:14:02,719 --> 01:14:07,760
fluxul de studiu prezintă mărturii de preț

1893
01:14:04,800 --> 01:14:10,000
Întrebări frecvente, fluxul de studiu AI este AI-ul tău personal

1894
01:14:07,760 --> 01:14:12,239
tutore planificator de studii partener productiv

1895
01:14:10,000 --> 01:14:14,320
obține în schimb explicația organizează-ți

1896
01:14:12,239 --> 01:14:16,640
listări există un ceas de probă gratuită a

1897
01:14:14,320 --> 01:14:18,480
demo caracteristici puternice pentru succes

1898
01:14:16,640 --> 01:14:21,440
tot ce ai nevoie pentru a excela în ta

1899
01:14:18,480 --> 01:14:24,719
studiază toate într-un singur loc etc. Și tu

1900
01:14:21,440 --> 01:14:29,280
au si pretul. Asta arată

1901
01:14:24,719 --> 01:14:32,960
ca un site web de platformă legitimă care are

1902
01:14:29,280 --> 01:14:35,760
fara defecte. Există literalmente o recenzie

1903
01:14:32,960 --> 01:14:38,159
evaluarea și întrebările frecvente

1904
01:14:35,760 --> 01:14:41,920
care este comun în majoritatea site-urilor web.

1905
01:14:38,159 --> 01:14:44,560
Și apoi ai studiul down at 2024

1906
01:14:41,920 --> 01:14:48,320
flow AI toate drepturile rezervate. În continuare, haideți

1907
01:14:44,560 --> 01:14:51,280
vezi dacă toboganul este gata. Acum

1908
01:14:48,320 --> 01:14:54,080
hai să jucăm PPT-ul. Este vorba despre

1909
01:14:51,280 --> 01:14:57,120
viitorul agenților AI pentru afaceri. Deci ca

1910
01:14:54,080 --> 01:15:00,000
puteți vedea că primul este titlul

1911
01:14:57,120 --> 01:15:02,880
filmări. Următorul este core ship with

1912
01:15:00,000 --> 01:15:04,800
acești agenți AI schimbă unitatea de lucru.

1913
01:15:02,880 --> 01:15:09,040
Și apoi ai ce și toate lucrurile

1914
01:15:04,800 --> 01:15:12,000
se schimbă. De ce acum stiva de agenți este

1915
01:15:09,040 --> 01:15:13,440
maturizarea. Agenții AI nu sunt doar mai inteligenți

1916
01:15:12,000 --> 01:15:16,159
roboti de chat. Care sunt diferența

1917
01:15:13,440 --> 01:15:18,960
între agentul agent AI copilot chatbot

1918
01:15:16,159 --> 01:15:21,520
portofoliu? Noul model de echipă în om

1919
01:15:18,960 --> 01:15:24,239
colaborare agent echipe de afaceri vor

1920
01:15:21,520 --> 01:15:26,000
adopta agenți prin agenții de scară de funcții

1921
01:15:24,239 --> 01:15:29,840
arhitectura de întreprindere necesară

1922
01:15:26,000 --> 01:15:32,880
adoptarea guvernării. Este un PPT legitim

1923
01:15:29,840 --> 01:15:35,760
explicați fiecare pas al AI

1924
01:15:32,880 --> 01:15:38,960
viitorul agentilor. Manus AI este la propriu

1925
01:15:35,760 --> 01:15:40,880
descriind modul în care AI este pusă să funcționeze, nu

1926
01:15:38,960 --> 01:15:42,560
doar da un răspuns text.

1927
01:15:40,880 --> 01:15:45,280
>> Bine, așa că suntem gata să începem. uh

1928
01:15:42,560 --> 01:15:46,960
Vom începe cu asta, știi

1929
01:15:45,280 --> 01:15:49,360
primul curs care urmează să studieze

1930
01:15:46,960 --> 01:15:52,960
elementele de bază ale Python. Python va fi al nostru

1931
01:15:49,360 --> 01:15:56,239
obiectivul principal pentru întregul program. Hm

1932
01:15:52,960 --> 01:15:59,760
vom folosi copilot. Deci există

1933
01:15:56,239 --> 01:16:01,679
va fi material de copilot, mai târziu

1934
01:15:59,760 --> 01:16:03,360
programul dar ca in aceasta prima

1935
01:16:01,679 --> 01:16:06,000
bineînțeles că ne vom concentra

1936
01:16:03,360 --> 01:16:08,560
Python și și pentru majoritatea lucrurilor noi

1937
01:16:06,000 --> 01:16:11,520
va folosi Python. Hm, chiar și atunci când noi

1938
01:16:08,560 --> 01:16:12,880
folosiți copilotul va produce cod Python

1939
01:16:11,520 --> 01:16:14,480
tot ceea ce facem va fi în Python. eu

1940
01:16:12,880 --> 01:16:17,040
credeți că unul dintre lucruri este de la voi știți

1941
01:16:14,480 --> 01:16:19,920
până la sfârșitul programului, dacă ceva

1942
01:16:17,040 --> 01:16:21,600
altfel, băieți, veți fi într-o situație mult mai bună

1943
01:16:19,920 --> 01:16:23,600
poziție cu Python. Vei fi mai bine

1944
01:16:21,600 --> 01:16:24,719
Codificatorii Python până la sfârșitul până la sfârșitul

1945
01:16:23,600 --> 01:16:27,360
programul. Daca nu inveti nimic

1946
01:16:24,719 --> 01:16:29,360
altfel te vei face mai bine la Python. eu

1947
01:16:27,360 --> 01:16:32,080
promisiune. Pentru că asta știi tot

1948
01:16:29,360 --> 01:16:34,640
din exemplele noastre toate demo-urile noastre

1949
01:16:32,080 --> 01:16:37,199
tot ceea ce facem va fi în Python. Aşa

1950
01:16:34,640 --> 01:16:39,360
vei deveni mai bun la asta. uh pentru

1951
01:16:37,199 --> 01:16:42,880
sigur și vom avea multă practică

1952
01:16:39,360 --> 01:16:45,520
face asta. Bine. Deci prima lecție este

1953
01:16:42,880 --> 01:16:47,920
totul despre o introducere la ceea ce Python

1954
01:16:45,520 --> 01:16:51,360
este. Deci, dacă ești complet necunoscut

1955
01:16:47,920 --> 01:16:53,679
cu el, absolut bine. Vom primi

1956
01:16:51,360 --> 01:16:55,600
tu la viteză și vorbești despre

1957
01:16:53,679 --> 01:16:57,920
fundamentale și cum să setați totul

1958
01:16:55,600 --> 01:17:01,520
pe propriul computer și vorbește despre

1959
01:16:57,920 --> 01:17:04,000
diferitele moduri de a utiliza Python.

1960
01:17:01,520 --> 01:17:05,520
că unele dintre ele vor implica o configurație pe care o vei avea

1961
01:17:04,000 --> 01:17:09,600
poate face pe propriul computer. Unele dintre ele

1962
01:17:05,520 --> 01:17:11,360
va implica niște resurse cloud, așadar

1963
01:17:09,600 --> 01:17:13,280
că nu trebuie să configurați nimic

1964
01:17:11,360 --> 01:17:15,520
pe computer dacă nu vrei.

1965
01:17:13,280 --> 01:17:17,920
Vom avea opțiuni acolo, care vor

1966
01:17:15,520 --> 01:17:19,840
fii cuminte. Așa că o să ne arăt pe acelea și

1967
01:17:17,920 --> 01:17:23,360
ghidează-ne prin acestea. Dar asta mai întâi

1968
01:17:19,840 --> 01:17:27,199
lecție despre elementele de bază uh și

1969
01:17:23,360 --> 01:17:28,480
instalandu-se. Deci, ce este

1970
01:17:27,199 --> 01:17:31,280
interesant este ca la începutul lui

1971
01:17:28,480 --> 01:17:35,520
la fiecare lecție, de obicei avem asta

1972
01:17:31,280 --> 01:17:37,120
un fel de logodnă sau discuție. Uh

1973
01:17:35,520 --> 01:17:40,560
dar știi, am cam deja

1974
01:17:37,120 --> 01:17:41,840
v-am întrebat despre asta despre uh uh dacă

1975
01:17:40,560 --> 01:17:44,159
ești familiarizat cu programarea, dacă

1976
01:17:41,840 --> 01:17:45,520
sunteți familiarizat cu Python. Hm, dar unul

1977
01:17:44,159 --> 01:17:48,320
lucru la care vreau să te gândești puțin

1978
01:17:45,520 --> 01:17:51,199
un pic este că um, mai ales pe măsură ce mergem

1979
01:17:48,320 --> 01:17:53,840
și aflați despre ce este Python, motiv pentru care este

1980
01:17:51,199 --> 01:17:57,280
Python-ul

1981
01:17:53,840 --> 01:18:00,640
limba aleasă pentru AI? Deci de ce este

1982
01:17:57,280 --> 01:18:03,520
una pe care toată lumea o folosește pentru a face AI? Şi

1983
01:18:00,640 --> 01:18:08,719
Cred că ceea ce vei învăța este

1984
01:18:03,520 --> 01:18:10,960
că are un ecosistem cu adevărat uimitor

1985
01:18:08,719 --> 01:18:15,760
care există de multă vreme

1986
01:18:10,960 --> 01:18:19,520
că um suportă AI în special. Deci,

1987
01:18:15,760 --> 01:18:21,360
Python este soluția pentru orice AI,

1988
01:18:19,520 --> 01:18:25,920
știința datelor, învățarea automată, orice

1989
01:18:21,360 --> 01:18:28,800
în genul ăsta. Uh, pentru că a fost folosit

1990
01:18:25,920 --> 01:18:31,199
de atâta timp pentru asta și are o astfel de

1991
01:18:28,800 --> 01:18:32,800
comunitatea și ecosistemul din jurul lui.

1992
01:18:31,199 --> 01:18:36,560
Asta e ceva ce vom învăța.

1993
01:18:32,800 --> 01:18:39,760
De asemenea, este foarte ușor de învățat și de utilizat,

1994
01:18:36,560 --> 01:18:42,560
ceea ce face plăcut să fii

1995
01:18:39,760 --> 01:18:44,800
o introducere în domeniu. Nu este

1996
01:18:42,560 --> 01:18:47,840
ia mult pentru a începe în ea.

1997
01:18:44,800 --> 01:18:49,280
pentru că este atât de ușor de lucrat. Hm, eu

1998
01:18:47,840 --> 01:18:51,360
vă pot spune ca pe cineva care a plecat

1999
01:18:49,280 --> 01:18:54,320
prin acea experiență, așa cum am studiat

2000
01:18:51,360 --> 01:18:56,880
matematică la facultate și la absolvire

2001
01:18:54,320 --> 01:18:59,040
scoala si studiat ca probabilitate si

2002
01:18:56,880 --> 01:19:02,560
statistici, dar am putut preda

2003
01:18:59,040 --> 01:19:04,159
eu însumi Python în primul rând și îl folosesc pentru a

2004
01:19:02,560 --> 01:19:06,480
intra într-un fel de știință a datelor și

2005
01:19:04,159 --> 01:19:08,880
învățarea automată în industrie.

2006
01:19:06,480 --> 01:19:10,800
Deci, și cred că aceasta este o poveste comună

2007
01:19:08,880 --> 01:19:12,640
oameni și am văzut asta de la mulți

2008
01:19:10,800 --> 01:19:14,880
elevi care vin din diferiți

2009
01:19:12,640 --> 01:19:17,360
fundaluri. Au fost capabili

2010
01:19:14,880 --> 01:19:19,280
ridicați Python destul de ușor pentru că

2011
01:19:17,360 --> 01:19:22,960
este un limbaj foarte ușor de înțeles

2012
01:19:19,280 --> 01:19:24,880
și și sintaxa lui și sunt atât de multe

2013
01:19:22,960 --> 01:19:26,719
instrumente din ea care o fac cu adevărat ușor

2014
01:19:24,880 --> 01:19:31,520
pentru a lucra cu.

2015
01:19:26,719 --> 01:19:33,840
Deci, promit că nu va fi la fel

2016
01:19:31,520 --> 01:19:36,159
oricât de descurajantă ar părea, chiar dacă ești

2017
01:19:33,840 --> 01:19:39,120
venind la asta din experiență zero. Uh, eu

2018
01:19:36,159 --> 01:19:41,920
cred că vei găsi că acesta este perfect

2019
01:19:39,120 --> 01:19:44,159
mod de a intra în programare și de a intra în

2020
01:19:41,920 --> 01:19:46,880
știința datelor și și AI și mașină

2021
01:19:44,159 --> 01:19:48,960
învăț pentru că este atât de ușor de înțeles

2022
01:19:46,880 --> 01:19:51,280
și învață și are o bogatie atât de drăguță

2023
01:19:48,960 --> 01:19:55,120
ecosistem comunitar.

2024
01:19:51,280 --> 01:19:57,920
Deci, am vrut doar să menționez asta.

2025
01:19:55,120 --> 01:20:00,560
Bine. Deci, unele dintre obiectivele noastre pentru

2026
01:19:57,920 --> 01:20:02,880
aceasta prima lectie va fi de vorbit

2027
01:20:00,560 --> 01:20:05,199
limbaje de programare în general și um

2028
01:20:02,880 --> 01:20:08,000
programare in general. Deci poate tu

2029
01:20:05,199 --> 01:20:10,640
știi mai multe generice decât Python doar tu

2030
01:20:08,000 --> 01:20:12,880
stiu care sunt ce fac programele generale

2031
01:20:10,640 --> 01:20:15,679
arata ca? Care sunt unele dintre clădiri

2032
01:20:12,880 --> 01:20:17,840
blocuri de programe care sunt importante?

2033
01:20:15,679 --> 01:20:20,000
Care sunt câteva dintre acele principii cheie

2034
01:20:17,840 --> 01:20:21,920
de programare pe care o vom dori

2035
01:20:20,000 --> 01:20:25,440
urmeaza si tu? Chiar dacă facem

2036
01:20:21,920 --> 01:20:27,679
Python pentru scopuri AI.

2037
01:20:25,440 --> 01:20:29,199
Așa că vorbește doar despre programare

2038
01:20:27,679 --> 01:20:31,920
general și apoi un fel de mărire

2039
01:20:29,199 --> 01:20:33,280
Python pe măsură ce mergem. Unul dintre lucruri

2040
01:20:31,920 --> 01:20:34,960
vom fi interesați să facem este doar

2041
01:20:33,280 --> 01:20:37,600
să vă setați băieți. Deci vorbește despre

2042
01:20:34,960 --> 01:20:40,159
cum putem configura Python pentru dvs

2043
01:20:37,600 --> 01:20:41,679
utilizați pe propria mașină. Hm, dar și

2044
01:20:40,159 --> 01:20:43,199
au unele opțiuni care nu necesită

2045
01:20:41,679 --> 01:20:46,400
instalând orice pe propria mașină.

2046
01:20:43,199 --> 01:20:47,760
Uh, ceea ce este frumos. Um și apoi, după cum am spus,

2047
01:20:46,400 --> 01:20:50,480
Vom mări un fel de Python, vorbim

2048
01:20:47,760 --> 01:20:51,679
despre beneficiile sale, unele dintre cele frumoase

2049
01:20:50,480 --> 01:20:53,760
caracteristici. Am cam menționat deja

2050
01:20:51,679 --> 01:20:55,679
ea. O comunitate foarte mare în jurul ei, ușor

2051
01:20:53,760 --> 01:20:58,640
a invata. Vom vorbi doar despre acestea

2052
01:20:55,679 --> 01:21:02,080
mai detaliat. Vorbește despre de ce

2053
01:20:58,640 --> 01:21:03,840
atât de popular în lumea AI. um,

2054
01:21:02,080 --> 01:21:05,840
și apoi vom intra în unele foarte

2055
01:21:03,840 --> 01:21:07,920
lucruri fundamentale specifice lui Python.

2056
01:21:05,840 --> 01:21:12,239
Deci, odată ce vorbim despre fundal,

2057
01:21:07,920 --> 01:21:15,360
pregătiți-vă, vom intra în uh

2058
01:21:12,239 --> 01:21:17,360
unele dintre elementele de bază despre sintaxă, lucruri precum

2059
01:21:15,360 --> 01:21:20,080
identificatori, lucruri precum indentarea,

2060
01:21:17,360 --> 01:21:21,679
comentează, um, unele dintre elementele de bază ale

2061
01:21:20,080 --> 01:21:24,640
cod pentru care va fi important

2062
01:21:21,679 --> 01:21:26,080
cu care să începi. Hm și

2063
01:21:24,640 --> 01:21:28,159
apoi vorbiți despre unele dintre datele de bază

2064
01:21:26,080 --> 01:21:30,159
tipurile pe care Python le oferă să le manipuleze

2065
01:21:28,159 --> 01:21:33,199
și lucrați cu date care, desigur, sunt

2066
01:21:30,159 --> 01:21:35,679
important atunci când știi cum mergem

2067
01:21:33,199 --> 01:21:37,679
înainte și și face orice cu date

2068
01:21:35,679 --> 01:21:41,120
care bineînțeles cu AI vom fi

2069
01:21:37,679 --> 01:21:42,719
interesat să o fac, dar asta sunt

2070
01:21:41,120 --> 01:21:45,920
sunt doar obiectivele acestui

2071
01:21:42,719 --> 01:21:48,320
prima lectie. Pe măsură ce mergem înainte suntem

2072
01:21:45,920 --> 01:21:51,760
o să înveți despre multe alte elemente de bază

2073
01:21:48,320 --> 01:21:54,480
subiecte din Python. Deci lucruri precum cum

2074
01:21:51,760 --> 01:21:57,920
să scrieți funcții, cum să construiți

2075
01:21:54,480 --> 01:21:59,840
obiecte, cum să ne manipulăm fluxul de

2076
01:21:57,920 --> 01:22:02,719
programul cu lucruri asemănătoare de genul dacă

2077
01:21:59,840 --> 01:22:04,800
else declarații, lucruri precum bucle.

2078
01:22:02,719 --> 01:22:07,280
Vom afla totul despre asta într-un fel

2079
01:22:04,800 --> 01:22:09,840
următoarele lecții după aceasta. Dar

2080
01:22:07,280 --> 01:22:12,320
acesta este tot conținutul acestei lecții.

2081
01:22:09,840 --> 01:22:13,840
anticipez astăzi

2082
01:22:12,320 --> 01:22:15,920
vom trece peste toate astea astăzi

2083
01:22:13,840 --> 01:22:19,040
și apoi intră în a doua lecție

2084
01:22:15,920 --> 01:22:21,520
care va intra în genul ăsta de dacă

2085
01:22:19,040 --> 01:22:24,400
else și bucle. Așa că vom obține

2086
01:22:21,520 --> 01:22:26,639
Sunt sigur că până astăzi vom intra în ele.

2087
01:22:24,400 --> 01:22:27,760
În regulă. Orice întrebări despre ce anume

2088
01:22:26,639 --> 01:22:29,280
vom învăța mai întâi în asta

2089
01:22:27,760 --> 01:22:30,960
lecție? Deci, în principal, încerc să vă atrag

2090
01:22:29,280 --> 01:22:32,960
configurați, vă oferă câteva informații despre

2091
01:22:30,960 --> 01:22:35,600
Python și apoi spre sfârșitul

2092
01:22:32,960 --> 01:22:38,880
lecția um intra în câteva elemente de bază ale

2093
01:22:35,600 --> 01:22:39,920
sintaxa este un fel de obiective aș spune.

2094
01:22:38,880 --> 01:22:42,480
Bine. Bine. Deci când vorbim despre

2095
01:22:39,920 --> 01:22:44,960
programare um ce înțelegem prin

2096
01:22:42,480 --> 01:22:47,040
programare in general? Este cu adevărat uh

2097
01:22:44,960 --> 01:22:49,679
sinonim cu instruire. Deci

2098
01:22:47,040 --> 01:22:52,239
programarea înseamnă cu adevărat a da sau

2099
01:22:49,679 --> 01:22:56,719
scrierea instrucțiunilor pentru un computer

2100
01:22:52,239 --> 01:23:00,320
executa sarcini. Um deci aceste instrucțiuni

2101
01:22:56,719 --> 01:23:01,840
scriem în ceea ce numim cod. Dar

2102
01:23:00,320 --> 01:23:03,520
acelea care tocmai le spun

2103
01:23:01,840 --> 01:23:05,440
computer ce să faci. Și bineînțeles că

2104
01:23:03,520 --> 01:23:08,960
computerul nu va face nimic

2105
01:23:05,440 --> 01:23:11,360
cu excepția cazului în care notăm aceste instrucțiuni.

2106
01:23:08,960 --> 01:23:13,199
Deci aceste instrucțiuni pot face cu adevărat

2107
01:23:11,360 --> 01:23:15,280
lucruri puternice. Ei pot puterea, tu

2108
01:23:13,199 --> 01:23:17,280
știm, aplicații întregi, lucruri pe care noi

2109
01:23:15,280 --> 01:23:19,920
folosiți în fiecare zi ca Microsoft Word,

2110
01:23:17,280 --> 01:23:22,800
PowerPoint, Excel, astfel de lucruri.

2111
01:23:19,920 --> 01:23:26,560
Ei pot automatiza sarcini. Ei pot um

2112
01:23:22,800 --> 01:23:28,239
site-uri web de putere. Ei pot face AI,

2113
01:23:26,560 --> 01:23:32,080
nu? Deci putem avea lucruri de genul

2114
01:23:28,239 --> 01:23:35,360
chat GBT și Alexa și Siri etc., etc.

2115
01:23:32,080 --> 01:23:37,440
Acestea sunt toate alimentate de instrucțiuni

2116
01:23:35,360 --> 01:23:38,800
spunând computerului ce să facă.

2117
01:23:37,440 --> 01:23:41,280
Unul dintre lucrurile pe care le vom obține

2118
01:23:38,800 --> 01:23:42,800
mai bine pe măsură ce mergem este să ne dăm seama

2119
01:23:41,280 --> 01:23:45,920
cum să scrieți aceste instrucțiuni în

2120
01:23:42,800 --> 01:23:48,800
Python. Python va fi

2121
01:23:45,920 --> 01:23:52,480
limba în care scriem aceste instrucțiuni

2122
01:23:48,800 --> 01:23:56,560
um și și vor fi executate de a

2123
01:23:52,480 --> 01:23:58,560
Programul Python. Dar ar trebui să ne gândim

2124
01:23:56,560 --> 01:24:01,440
de programare în general ca justă

2125
01:23:58,560 --> 01:24:03,679
instruind computerul ce trebuie să facă

2126
01:24:01,440 --> 01:24:07,120
la un nivel înalt. Corect?

2127
01:24:03,679 --> 01:24:10,639
Deci, când vorbim despre acestea

2128
01:24:07,120 --> 01:24:15,120
instrucțiuni, au două moduri de

2129
01:24:10,639 --> 01:24:17,360
fiind executat de calculator. Hm

2130
01:24:15,120 --> 01:24:20,320
și aproximativ acestea se descompun în ce

2131
01:24:17,360 --> 01:24:22,960
numim limbi interpretate şi

2132
01:24:20,320 --> 01:24:25,679
limbaje compilate. Deci codul

2133
01:24:22,960 --> 01:24:28,320
că scriem ceea ce reprezintă um

2134
01:24:25,679 --> 01:24:32,560
instructiunile pe care le scriem pot fi

2135
01:24:28,320 --> 01:24:33,840
executat într-unul din aceste două moduri.

2136
01:24:32,560 --> 01:24:35,920
Lasă-mă să încep cu stânga. Deci

2137
01:24:33,840 --> 01:24:38,480
limbi interpretate.

2138
01:24:35,920 --> 01:24:41,679
Aceasta înseamnă că computerul este

2139
01:24:38,480 --> 01:24:45,040
executând literal instrucțiunile

2140
01:24:41,679 --> 01:24:49,920
linie cu linie când rulăm

2141
01:24:45,040 --> 01:24:51,520
program. Deci nu există

2142
01:24:49,920 --> 01:24:53,120
traducerea a orice. Este doar

2143
01:24:51,520 --> 01:24:55,199
luând la propriu instrucțiunile noastre și

2144
01:24:53,120 --> 01:24:59,440
rulând-o linie cu linie, instrucțiuni de către

2145
01:24:55,199 --> 01:25:03,440
instrucție în esență. Hm, acum

2146
01:24:59,440 --> 01:25:06,320
avantajul de a face asta este că este uh

2147
01:25:03,440 --> 01:25:07,760
mai ușor de depanat deoarece instrucțiunile

2148
01:25:06,320 --> 01:25:09,360
vor fi executate unul câte unul. Deci

2149
01:25:07,760 --> 01:25:12,320
poate lovi o eroare destul de repede. Dacă

2150
01:25:09,360 --> 01:25:15,920
există o greșeală într-o instrucțiune,

2151
01:25:12,320 --> 01:25:18,400
nimic altceva nu va rula. Hm, totuși, este

2152
01:25:15,920 --> 01:25:22,080
de asemenea mai încet pentru că vom lua

2153
01:25:18,400 --> 01:25:26,400
este o instrucțiune la un moment dat. Hm, și așa

2154
01:25:22,080 --> 01:25:29,199
uh acest mod de a rula programe

2155
01:25:26,400 --> 01:25:32,320
tinde să fie mai lent, dar este și mai ușor

2156
01:25:29,199 --> 01:25:34,159
cu care să lucrăm, de aceea suntem așa

2157
01:25:32,320 --> 01:25:36,239
interesat de Python. Este în asta

2158
01:25:34,159 --> 01:25:38,639
găleată de ceea ce numim interpretat

2159
01:25:36,239 --> 01:25:40,560
limbi. Deci mult scripting

2160
01:25:38,639 --> 01:25:43,840
limbile se găsesc în această găleată

2161
01:25:40,560 --> 01:25:45,840
de a fi executat pe rând. Nu

2162
01:25:43,840 --> 01:25:47,600
traducerea necesară mașinii. Ea

2163
01:25:45,840 --> 01:25:50,560
doar citește instrucțiunile noastre și execută

2164
01:25:47,600 --> 01:25:52,800
ea. Lucrul care face execuția este

2165
01:25:50,560 --> 01:25:56,239
numit interpret.

2166
01:25:52,800 --> 01:25:59,280
Hm, și Python are un interpret care

2167
01:25:56,239 --> 01:26:01,280
vă vom pune pe voi băieți

2168
01:25:59,280 --> 01:26:04,159
propria mașină care poate executa Python

2169
01:26:01,280 --> 01:26:05,520
cod. Deci ai nevoie de un interpret. The

2170
01:26:04,159 --> 01:26:08,400
interpretul doar execută dvs

2171
01:26:05,520 --> 01:26:10,159
instrucțiuni rând cu rând cu rând. um,

2172
01:26:08,400 --> 01:26:12,159
deci unele exemple ar fi ca Python.

2173
01:26:10,159 --> 01:26:14,960
Asta vom studia în asta

2174
01:26:12,159 --> 01:26:17,840
um întreg programul. Dar mai sunt altele

2175
01:26:14,960 --> 01:26:21,840
limbi precum JavaScript, Ruby,

2176
01:26:17,840 --> 01:26:23,280
um Pearl, multe altele care sunt uh

2177
01:26:21,840 --> 01:26:24,960
interpretat. Ei necesită o

2178
01:26:23,280 --> 01:26:26,719
interpret, dar execută rândul de

2179
01:26:24,960 --> 01:26:29,440
linie cu linie și nu există intermediar

2180
01:26:26,719 --> 01:26:34,320
traducerea a orice. E un fel de

2181
01:26:29,440 --> 01:26:37,920
executat ca atare. Acum, contrastează asta cu

2182
01:26:34,320 --> 01:26:40,320
limbaje compilate, care sunt oarecum

2183
01:26:37,920 --> 01:26:42,960
o piesă diferită. ele acestea acestea

2184
01:26:40,320 --> 01:26:45,120
instrucțiunile trebuie traduse în

2185
01:26:42,960 --> 01:26:47,360
ceva în care mașina poate înțelege

2186
01:26:45,120 --> 01:26:50,719
pentru a executa. Deci există o

2187
01:26:47,360 --> 01:26:55,679
pas intermediar a ceea ce numim

2188
01:26:50,719 --> 01:26:57,120
compilarea codului în uh practic

2189
01:26:55,679 --> 01:26:59,040
o versiune tradusă a dvs

2190
01:26:57,120 --> 01:27:01,600
instrucțiuni pentru ca mașina să poată

2191
01:26:59,040 --> 01:27:03,920
executa-l. Acum există un compromis

2192
01:27:01,600 --> 01:27:05,679
acolo. Făcând asta se poate face mai mult

2193
01:27:03,920 --> 01:27:07,600
greu de dezvoltat și poate dura

2194
01:27:05,679 --> 01:27:09,199
mai mult de depanat pentru că trebuie să pleci

2195
01:27:07,600 --> 01:27:12,639
prin acest pas de traducere fiecare

2196
01:27:09,199 --> 01:27:15,120
o singură dată prin compilator.

2197
01:27:12,639 --> 01:27:16,960
Dar când rulezi codul pentru că este

2198
01:27:15,120 --> 01:27:20,159
a fost deja tradus în asta

2199
01:27:16,960 --> 01:27:22,000
format mașină, este mult mai rapid. um,

2200
01:27:20,159 --> 01:27:25,120
deci câteva exemple de limbi ca acesta

2201
01:27:22,000 --> 01:27:27,120
sunt C, C, Java,

2202
01:27:25,120 --> 01:27:29,840
um, du-te,

2203
01:27:27,120 --> 01:27:31,280
dar nu vom lucra cu adevărat

2204
01:27:29,840 --> 01:27:32,639
aceste. Vom rămâne doar cu

2205
01:27:31,280 --> 01:27:34,400
Python. Dar dacă ai experiență cu

2206
01:27:32,639 --> 01:27:36,400
acele limbi, probabil că ești

2207
01:27:34,400 --> 01:27:38,480
familiarizat cu asta, trebuie să compilați

2208
01:27:36,400 --> 01:27:41,679
programul mai întâi înainte de a putea executa

2209
01:27:38,480 --> 01:27:43,760
ea. Dar vom fi în asta

2210
01:27:41,679 --> 01:27:45,040
lumea interpretată. Dacă știi și este

2211
01:27:43,760 --> 01:27:48,000
Bine, dacă nimic din toate astea nu are sens,

2212
01:27:45,040 --> 01:27:50,480
e în regulă. Doar să înțelegi asta

2213
01:27:48,000 --> 01:27:52,880
limbile interpretate în general sunt

2214
01:27:50,480 --> 01:27:55,760
va fi mai ușor de utilizat deoarece

2215
01:27:52,880 --> 01:27:58,000
sunt mai ușor de executat. Ei

2216
01:27:55,760 --> 01:28:01,280
nu necesită atâtea piese mobile ca

2217
01:27:58,000 --> 01:28:02,880
ce ar necesita un limbaj compilat.

2218
01:28:01,280 --> 01:28:04,560
care este frumos pentru noi, nu? Frumos pentru

2219
01:28:02,880 --> 01:28:08,560
Python. Asta vom fi

2220
01:28:04,560 --> 01:28:10,880
interesat să lucreze cu. Uh cam

2221
01:28:08,560 --> 01:28:12,320
um da, sunt oarecum rel. Deci, deci

2222
01:28:10,880 --> 01:28:16,000
întrebarea este JavaScript și Java

2223
01:28:12,320 --> 01:28:19,679
legate? Cam. Um, JavaScript este amabil

2224
01:28:16,000 --> 01:28:22,639
de ca um the

2225
01:28:19,679 --> 01:28:25,280
versiunea de scripting a um unele dintre ele

2226
01:28:22,639 --> 01:28:29,600
concepte pe care le vedem în Java, dar Java este

2227
01:28:25,280 --> 01:28:31,760
compilat um it necesită o specială

2228
01:28:29,600 --> 01:28:35,120
un fel de ceea ce se numește un timp de rulare Java,

2229
01:28:31,760 --> 01:28:39,040
care este un compilator pentru a traduce

2230
01:28:35,120 --> 01:28:42,560
Codul Java în codul de mașină pe care

2231
01:28:39,040 --> 01:28:44,239
Runtime Java se va executa. JavaScript este

2232
01:28:42,560 --> 01:28:47,280
deloc asa. Chiar poate fi

2233
01:28:44,239 --> 01:28:49,440
a rulat într-un browser web care este um

2234
01:28:47,280 --> 01:28:52,000
JavaScript dă de obicei o mulțime de lucruri similare

2235
01:28:49,440 --> 01:28:54,960
site-urile web front-end sunt de obicei alimentate

2236
01:28:52,000 --> 01:28:57,360
prin JavaScript și Java de obicei puteri

2237
01:28:54,960 --> 01:28:59,840
mai degrabă backend

2238
01:28:57,360 --> 01:29:01,840
um aplicații precum software-ul propriu-zis

2239
01:28:59,840 --> 01:29:04,239
programele sunt de obicei ar fi codificate în

2240
01:29:01,840 --> 01:29:06,880
Java. JavaScript va fi folosit

2241
01:29:04,239 --> 01:29:08,960
mai mult pentru construirea unui site web. Dar,

2242
01:29:06,880 --> 01:29:11,120
știi, nu sunt un expert în asta

2243
01:29:08,960 --> 01:29:13,440
really, but that's kind of my

2244
01:29:11,120 --> 01:29:15,120
understanding of it. And if anyone is an

2245
01:29:13,440 --> 01:29:18,000
expert on those differences, feel free

2246
01:29:15,120 --> 01:29:20,800
to let us know in the chat. Dar, uh,

2247
01:29:18,000 --> 01:29:24,080
that's my that's my basic summary of

2248
01:29:20,800 --> 01:29:25,679
că. Bine. So, we have interpreted

2249
01:29:24,080 --> 01:29:29,679
limbi. That's where Python falls

2250
01:29:25,679 --> 01:29:30,960
under. So, it just um summarizing that,

2251
01:29:29,679 --> 01:29:32,560
it's going to be easier to work with

2252
01:29:30,960 --> 01:29:34,159
those, which is great for us. Asta e

2253
01:29:32,560 --> 01:29:36,000
another reason why Python's so easy.

2254
01:29:34,159 --> 01:29:37,520
It's interpreted, meaning that

2255
01:29:36,000 --> 01:29:40,960
everything executes. We don't need to

2256
01:29:37,520 --> 01:29:45,280
vă faceți griji cu privire la compilarea lucrurilor, adică

2257
01:29:40,960 --> 01:29:48,080
frumos. Um, but also in terms of

2258
01:29:45,280 --> 01:29:51,199
programare, există și categorii

2259
01:29:48,080 --> 01:29:53,280
despre modul în care sunt scrise instrucțiunile

2260
01:29:51,199 --> 01:29:56,880
puteți include diferite limbi în.

2261
01:29:53,280 --> 01:29:59,199
Deci, de exemplu, unele limbi sunt

2262
01:29:56,880 --> 01:30:01,120
mai mult um de natură procedurală sens

2263
01:29:59,199 --> 01:30:04,159
că scrieți toate instrucțiunile

2264
01:30:01,120 --> 01:30:06,159
exact fel de linie cu linie cu linie.

2265
01:30:04,159 --> 01:30:08,239
Nu prea organizezi deloc lucrurile

2266
01:30:06,159 --> 01:30:10,000
in your instructions.

2267
01:30:08,239 --> 01:30:11,520
Hm, deci câteva exemple ar fi ca C și

2268
01:30:10,000 --> 01:30:15,199
Pascal

2269
01:30:11,520 --> 01:30:16,880
are more like that. Um then on the

2270
01:30:15,199 --> 01:30:18,800
capătul opus al spectrului este un fel

2271
01:30:16,880 --> 01:30:22,639
orientat pe obiecte

2272
01:30:18,800 --> 01:30:24,080
caz în care vă construiți codul și

2273
01:30:22,639 --> 01:30:26,800
organizează-l în jurul ideii de

2274
01:30:24,080 --> 01:30:28,400
totul fiind un obiect. Și așa unii

2275
01:30:26,800 --> 01:30:31,920
Python se încadrează de fapt în asta

2276
01:30:28,400 --> 01:30:34,320
categoria în care umh cele mai multe lucruri

2277
01:30:31,920 --> 01:30:37,199
Python sunt obiecte și tu manipulezi

2278
01:30:34,320 --> 01:30:39,280
obiectele și obiectele au date pentru ele.

2279
01:30:37,199 --> 01:30:42,560
Au lucruri pe care le pot face și

2280
01:30:39,280 --> 01:30:44,159
interacționează cu alte obiecte. Um, deci

2281
01:30:42,560 --> 01:30:46,480
Gândiți-vă la asta doar ca la o modalitate pe care o vom face

2282
01:30:44,159 --> 01:30:48,800
ne organizăm instrucțiunile.

2283
01:30:46,480 --> 01:30:50,480
Python ne permite să-l organizăm

2284
01:30:48,800 --> 01:30:52,880
conceptul de obiect. Vom învăța

2285
01:30:50,480 --> 01:30:55,840
despre ce înseamnă asta pe măsură ce mergem,

2286
01:30:52,880 --> 01:31:00,000
dar doar realizând că niște programare

2287
01:30:55,840 --> 01:31:03,920
limbile se descompun de-a lungul acestor um fel

2288
01:31:00,000 --> 01:31:06,239
de găleți aici. Hm, Python este, de asemenea, un

2289
01:31:03,920 --> 01:31:09,760
limbaj scris, adică poți scrie

2290
01:31:06,239 --> 01:31:11,120
scoateți codul într-un script individual și

2291
01:31:09,760 --> 01:31:13,679
poţi e că poţi avea o

2292
01:31:11,120 --> 01:31:15,920
interpret care execută acel script.

2293
01:31:13,679 --> 01:31:18,320
Hm, deci nu trebuie să organizezi totul

2294
01:31:15,920 --> 01:31:22,400
codul dvs. din interiorul unui obiect. Deci pentru

2295
01:31:18,320 --> 01:31:24,639
din acest motiv, Python super flexibil.

2296
01:31:22,400 --> 01:31:26,480
Acesta este un alt motiv pentru care este atât de frumos

2297
01:31:24,639 --> 01:31:28,560
a folosi. De fapt, se încadrează în ambele

2298
01:31:26,480 --> 01:31:30,800
aceste găleți din dreapta, care este

2299
01:31:28,560 --> 01:31:32,320
foarte convenabil. Putem avea practic

2300
01:31:30,800 --> 01:31:34,960
asta înseamnă că putem avea o mulțime de

2301
01:31:32,320 --> 01:31:37,120
organizare sau foarte puțină organizare

2302
01:31:34,960 --> 01:31:39,280
în funcție de modul în care vrem să-l setăm.

2303
01:31:37,120 --> 01:31:42,960
Da, Roberto. Deci, chiar dacă există

2304
01:31:39,280 --> 01:31:45,280
diferite tipuri deci Java este compilat și

2305
01:31:42,960 --> 01:31:48,480
Python este interpretat

2306
01:31:45,280 --> 01:31:51,600
um, ambele au sens orientat pe obiect

2307
01:31:48,480 --> 01:31:55,199
așa că gândește-te la acest diapozitiv ca fiind grăitor

2308
01:31:51,600 --> 01:31:57,760
tu cum sunt organizate instrucțiunile.

2309
01:31:55,199 --> 01:32:00,960
Deci modul în care sunt executate este diferit.

2310
01:31:57,760 --> 01:32:02,880
Deci, Java necesită un compilator

2311
01:32:00,960 --> 01:32:05,040
executa lucruri. Python necesită un

2312
01:32:02,880 --> 01:32:06,719
interpret.

2313
01:32:05,040 --> 01:32:10,080
Acesta este mai mult despre modul în care instrucțiunile

2314
01:32:06,719 --> 01:32:11,679
sunt organizate. Deci, Java și Python ambele

2315
01:32:10,080 --> 01:32:13,600
vă permit să vă organizați codul în

2316
01:32:11,679 --> 01:32:16,080
obiecte.

2317
01:32:13,600 --> 01:32:17,520
Hm, dar ce e frumos la Python este că

2318
01:32:16,080 --> 01:32:20,400
cade și sub găleata de

2319
01:32:17,520 --> 01:32:23,199
scripting, ceea ce înseamnă că vă permite

2320
01:32:20,400 --> 01:32:25,440
organizați lucrurile în scripturi, adică

2321
01:32:23,199 --> 01:32:26,880
mai puțină organizare decât ar fi

2322
01:32:25,440 --> 01:32:29,120
în obiecte. De fapt o vom face

2323
01:32:26,880 --> 01:32:31,679
aflați despre obiecte mai târziu în viitor

2324
01:32:29,120 --> 01:32:34,159
lecție, cum ar fi cum să construiești obiecte și

2325
01:32:31,679 --> 01:32:35,760
ce înseamnă ele.

2326
01:32:34,159 --> 01:32:37,920
Deci da, chiar dacă sunt diferiți,

2327
01:32:35,760 --> 01:32:40,159
ambele sunt orientate pe obiecte, ceea ce doar

2328
01:32:37,920 --> 01:32:42,880
înseamnă că vă puteți organiza codul

2329
01:32:40,159 --> 01:32:45,520
în obiecte. Python permite asta. Deci

2330
01:32:42,880 --> 01:32:48,480
face Java. La fel și C.

2331
01:32:45,520 --> 01:32:52,400
Multe limbi permit asta

2332
01:32:48,480 --> 01:32:54,880
organizarea codului în obiecte.

2333
01:32:52,400 --> 01:32:57,520
Așa că vom învăța despre asta.

2334
01:32:54,880 --> 01:33:00,960
Nu e că unul e mai bun. Ei sunt

2335
01:32:57,520 --> 01:33:03,199
doar eu le-aș pune la diferit

2336
01:33:00,960 --> 01:33:05,520
Deci, lasă-mă să desenez asta. le-as pune

2337
01:33:03,199 --> 01:33:07,920
la spectru diferit, capete diferite ale

2338
01:33:05,520 --> 01:33:10,880
spectrul de organizare.

2339
01:33:07,920 --> 01:33:14,320
Deci, scripting

2340
01:33:10,880 --> 01:33:18,480
este foarte lejer. Practic, tu este mai mult

2341
01:33:14,320 --> 01:33:21,120
ca un individ um uh set de

2342
01:33:18,480 --> 01:33:22,560
instrucțiuni pentru a face o sarcină. poti

2343
01:33:21,120 --> 01:33:24,560
doar ai și poți avea multe

2344
01:33:22,560 --> 01:33:27,280
scripturi individuale pentru a face multe mici

2345
01:33:24,560 --> 01:33:29,520
sarcini. Um, și apoi la celălalt capăt al

2346
01:33:27,280 --> 01:33:32,880
spectrul, gândiți-vă la el ca și cum ar fi

2347
01:33:29,520 --> 01:33:37,199
ți-ai organizat cabinetul în mai multe

2348
01:33:32,880 --> 01:33:39,760
foldere și multe ca uh, știți multe

2349
01:33:37,199 --> 01:33:43,600
piese de organizare care sunt noi

2350
01:33:39,760 --> 01:33:46,320
apelează obiecte. Hm atât de orientat pe obiecte

2351
01:33:43,600 --> 01:33:48,080
programarea OOP este oarecum pe de altă parte

2352
01:33:46,320 --> 01:33:51,360
sfârşitul spectrului când vine vorba de

2353
01:33:48,080 --> 01:33:55,400
ca nivel de nivel

2354
01:33:51,360 --> 01:33:55,400
de organizare.

2355
01:33:56,560 --> 01:34:01,280
Are sens? Deci scripting foarte

2356
01:33:58,000 --> 01:34:03,679
liber. De obicei, scriptul este este um

2357
01:34:01,280 --> 01:34:04,719
rezervat pentru o singură sarcină și este um

2358
01:34:03,679 --> 01:34:06,080
doar iti scrii

2359
01:34:04,719 --> 01:34:07,600
instrucțiuni pentru a-l îndeplini

2360
01:34:06,080 --> 01:34:09,520
sarcina.

2361
01:34:07,600 --> 01:34:11,600
um, care este util pentru automatizare similară

2362
01:34:09,520 --> 01:34:14,000
de lucruri pentru că te duci tu ești

2363
01:34:11,600 --> 01:34:16,159
de obicei automatizarea ca o singură sarcină.

2364
01:34:14,000 --> 01:34:17,760
Deci e foarte liber. Nu este foarte

2365
01:34:16,159 --> 01:34:20,800
organizat în nimic este organizat

2366
01:34:17,760 --> 01:34:24,080
neapărat în obiecte. Hm foarte liber

2367
01:34:20,800 --> 01:34:26,639
organizare. Orientat pe obiecte este mult

2368
01:34:24,080 --> 01:34:28,960
mai multă structură la ea și lucrurile fiind

2369
01:34:26,639 --> 01:34:30,400
pune în obiecte um pentru a

2370
01:34:28,960 --> 01:34:33,040
manipulează și lucrează cu obiecte

2371
01:34:30,400 --> 01:34:35,040
pe tot parcursul programului. Da, nu este

2372
01:34:33,040 --> 01:34:38,480
acela e mai bun. Cred că este mai mult

2373
01:34:35,040 --> 01:34:41,120
doar în funcție de caz. Sunt

2374
01:34:38,480 --> 01:34:45,040
momente în care de fapt ne va aduce beneficii

2375
01:34:41,120 --> 01:34:46,719
de la folosirea obiectelor. Hm și cred că

2376
01:34:45,040 --> 01:34:49,679
lucru la care să acordați atenție în acest diapozitiv

2377
01:34:46,719 --> 01:34:51,360
este acea privire la locul în care cade Python.

2378
01:34:49,679 --> 01:34:54,080
De fapt se încadrează în ambele. Sens

2379
01:34:51,360 --> 01:34:56,000
că putem avea lucrurile foarte libere şi

2380
01:34:54,080 --> 01:34:58,239
ușor de lucrat, deoarece scripting

2381
01:34:56,000 --> 01:35:00,400
de obicei, va fi mai rapid și mai ușor

2382
01:34:58,239 --> 01:35:03,760
scrie doar ceva pentru a realiza

2383
01:35:00,400 --> 01:35:05,600
o sarcină. Dar avem flexibilitatea

2384
01:35:03,760 --> 01:35:08,960
ne organizăm codul în obiecte dacă noi

2385
01:35:05,600 --> 01:35:11,520
vreau să. care va fi mai bine pentru

2386
01:35:08,960 --> 01:35:13,120
sarcini mai mari care necesită mai mult

2387
01:35:11,520 --> 01:35:16,239
organizare

2388
01:35:13,120 --> 01:35:18,960
ca antrenarea unei rețele neuronale sau

2389
01:35:16,239 --> 01:35:20,800
construirea unui LLM.

2390
01:35:18,960 --> 01:35:23,760
Aceste sarcini mai mari ar beneficia

2391
01:35:20,800 --> 01:35:26,000
organizare.

2392
01:35:23,760 --> 01:35:27,600
Și apoi, în sfârșit, pe acest diapozitiv

2393
01:35:26,000 --> 01:35:31,040
există limbi pe care sunt construite

2394
01:35:27,600 --> 01:35:33,199
conceptul de um tot felul lor

2395
01:35:31,040 --> 01:35:35,120
de scriere a instrucțiunilor este mai mult într-o

2396
01:35:33,199 --> 01:35:38,239
mod funcțional, adică totul este

2397
01:35:35,120 --> 01:35:41,440
pe baza funcţiilor uh de operare şi

2398
01:35:38,239 --> 01:35:43,199
variabile. Hm și așa sunt câteva

2399
01:35:41,440 --> 01:35:49,120
limbi ca acesta are și savant sunt

2400
01:35:43,199 --> 01:35:51,360
cele foarte populare. Hm, dar asta se poate

2401
01:35:49,120 --> 01:35:53,600
foarte greu de învățat. Se poate

2402
01:35:51,360 --> 01:35:56,239
dificil, dar foarte frumos în anumite privințe

2403
01:35:53,600 --> 01:35:59,679
pentru că poate fi foarte natural

2404
01:35:56,239 --> 01:36:01,520
Gândește-te la tu manipulezi ca și cum ai da

2405
01:35:59,679 --> 01:36:03,520
instrucțiuni către computer într-un mod funcțional

2406
01:36:01,520 --> 01:36:05,760
mod. Gândește-te la asta ca la aplicarea unui

2407
01:36:03,520 --> 01:36:09,040
funcţie la o variabilă.

2408
01:36:05,760 --> 01:36:10,880
Hm, asta are sens, dar să scrii totul

2409
01:36:09,040 --> 01:36:13,199
a instrucțiunilor dumneavoastră în acest fel poate fi

2410
01:36:10,880 --> 01:36:15,120
cam greu de învățat. Deci pentru asta

2411
01:36:13,199 --> 01:36:17,199
motiv pentru care cred că aceste limbi sunt mai multe

2412
01:36:15,120 --> 01:36:20,800
greu de învățat, dar pot fi foarte

2413
01:36:17,199 --> 01:36:23,280
puternic. Hm și ei se regăsesc

2414
01:36:20,800 --> 01:36:24,800
foarte util în operarea pe mare

2415
01:36:23,280 --> 01:36:27,679
date.

2416
01:36:24,800 --> 01:36:30,000
Dacă ai auzit vreodată de Spark

2417
01:36:27,679 --> 01:36:34,560
Spark operează cu Scola pt

2418
01:36:30,000 --> 01:36:36,880
exemplu, dar nu ne vom concentra cu adevărat

2419
01:36:34,560 --> 01:36:38,400
pe funcțional. Este cam propriu

2420
01:36:36,880 --> 01:36:42,480
paradigmă.

2421
01:36:38,400 --> 01:36:45,920
Hm, dar din nou, ca și Python acolo unde suntem

2422
01:36:42,480 --> 01:36:48,159
concentrarea va fi. Ne permite să fim cu adevărat

2423
01:36:45,920 --> 01:36:51,199
organizat, vag organizat. frumos

2424
01:36:48,159 --> 01:36:53,280
flexibilitate acolo.

2425
01:36:51,199 --> 01:36:54,880
Deci, până acum

2426
01:36:53,280 --> 01:36:57,520
pe baza acestor două diapozitive, le arăt

2427
01:36:54,880 --> 01:37:00,159
tu că Python este interpretat, adică

2428
01:36:57,520 --> 01:37:02,480
mai ușor și mai rapid de lucrat. Nu

2429
01:37:00,159 --> 01:37:03,600
mai repede să alergi, dar mai repede să te ridici și

2430
01:37:02,480 --> 01:37:06,400
alergând pentru că nu ai nevoie

2431
01:37:03,600 --> 01:37:08,239
compila lucruri. E frumos din partea noastră

2432
01:37:06,400 --> 01:37:11,040
perspectiva.

2433
01:37:08,239 --> 01:37:12,320
Și are, de asemenea, o flexibilitate foarte bună

2434
01:37:11,040 --> 01:37:14,719
când vine vorba de organizarea noastră

2435
01:37:12,320 --> 01:37:17,119
instrucțiuni, organizarea codului nostru poate fi

2436
01:37:14,719 --> 01:37:21,040
foarte liber în scripturi, ar putea fi foarte

2437
01:37:17,119 --> 01:37:23,600
structurat în obiecte.

2438
01:37:21,040 --> 01:37:26,639
Bine. Bine. Deci, în general, indiferent cum

2439
01:37:23,600 --> 01:37:29,760
Indiferent de ce limbă este, atunci când

2440
01:37:26,639 --> 01:37:32,159
procesați acele instrucțiuni în general

2441
01:37:29,760 --> 01:37:33,679
lucrurile vor fi organizate

2442
01:37:32,159 --> 01:37:35,440
chiar dacă este într-un scenariu sau dacă este

2443
01:37:33,679 --> 01:37:38,080
orientat pe obiecte

2444
01:37:35,440 --> 01:37:40,080
um, în general vei avea

2445
01:37:38,080 --> 01:37:42,719
chiar la începutul programului

2446
01:37:40,080 --> 01:37:45,360
configurarea intrării apoi mijlocul

2447
01:37:42,719 --> 01:37:46,960
chiar procesează asta și face

2448
01:37:45,360 --> 01:37:49,040
ceva cu asta. Deci asta e de obicei

2449
01:37:46,960 --> 01:37:51,440
ca cea mai mare parte a logicii este în

2450
01:37:49,040 --> 01:37:53,760
faza de prelucrare si apoi in general

2451
01:37:51,440 --> 01:37:56,000
produci ceva rezultate. Așa că

2452
01:37:53,760 --> 01:37:59,600
ar putea fi ca un model de predicție, că

2453
01:37:56,000 --> 01:38:02,080
ar putea fi un grafic pe care l-ați construit

2454
01:37:59,600 --> 01:38:04,159
din codul tău, indiferent de ieșire

2455
01:38:02,080 --> 01:38:06,560
este. Dar, în general, curge astfel.

2456
01:38:04,159 --> 01:38:08,400
Asta are sens, nu? De

2457
01:38:06,560 --> 01:38:10,159
bineînțeles că există o intrare, tu ești

2458
01:38:08,400 --> 01:38:11,840
manipulând acea intrare într-un fel și

2459
01:38:10,159 --> 01:38:13,119
atunci produci ceva rezultate. eu

2460
01:38:11,840 --> 01:38:15,520
cred că totul are sens. Asta este o

2461
01:38:13,119 --> 01:38:17,040
mod foarte logic de a curge.

2462
01:38:15,520 --> 01:38:19,520
Hm

2463
01:38:17,040 --> 01:38:22,880
acum asta nu înseamnă că în asta

2464
01:38:19,520 --> 01:38:25,600
etapa de procesare poate să nu existe

2465
01:38:22,880 --> 01:38:28,320
um iterație ca desigur că ar putea

2466
01:38:25,600 --> 01:38:30,239
pot fi momente în care trebuie să facem parte

2467
01:38:28,320 --> 01:38:33,679
tipul de procesare a itera și a face

2468
01:38:30,239 --> 01:38:35,840
treceri multiple de procesare. Hm deci

2469
01:38:33,679 --> 01:38:37,760
procesarea ar putea fi mult. Am putea fi

2470
01:38:35,840 --> 01:38:38,960
făcând multe. Am putea face puțin.

2471
01:38:37,760 --> 01:38:41,119
Depinde doar de ceea ce suntem de fapt

2472
01:38:38,960 --> 01:38:44,239
făcând. Deci, dacă citim câteva date

2473
01:38:41,119 --> 01:38:47,280
ca intrare um și apoi suntem doar

2474
01:38:44,239 --> 01:38:49,280
făcând niște simple feliere și cubulețe

2475
01:38:47,280 --> 01:38:51,119
din el, asta este o procesare ușoară și

2476
01:38:49,280 --> 01:38:53,360
poate producerea unui grafic sau producerea unui

2477
01:38:51,119 --> 01:38:56,159
metric, ceva de genul ăsta, asta e

2478
01:38:53,360 --> 01:38:59,600
destul de usor de facut. Dar dacă ne antrenăm

2479
01:38:56,159 --> 01:39:01,600
o rețea neuronală sau antrenarea unui model,

2480
01:38:59,600 --> 01:39:03,840
etapa de prelucrare poate dura ceva timp și

2481
01:39:01,600 --> 01:39:06,239
poate, știți, să fie foarte iterativ în

2482
01:39:03,840 --> 01:39:08,960
natura. Deci depinde doar de ceea ce suntem

2483
01:39:06,239 --> 01:39:11,360
face și acele instrucțiuni.

2484
01:39:08,960 --> 01:39:14,000
Dar orice ar fi, majoritatea programelor noastre

2485
01:39:11,360 --> 01:39:16,159
va curge în acest fel tipul de intrare

2486
01:39:14,000 --> 01:39:19,119
ieșire de procesare. Are sens. Este

2487
01:39:16,159 --> 01:39:22,239
foarte logic.

2488
01:39:19,119 --> 01:39:24,159
Deci, care sunt unele principii pe care noi

2489
01:39:22,239 --> 01:39:26,159
ar trebui să respecte atunci când scriem

2490
01:39:24,159 --> 01:39:28,400
cod? Deci asta ar fi cu adevărat pentru

2491
01:39:26,159 --> 01:39:31,679
orice limbă, dar desigur pentru Python

2492
01:39:28,400 --> 01:39:32,719
care ne interesează. Um deci

2493
01:39:31,679 --> 01:39:36,719
ceva care ne va interesa

2494
01:39:32,719 --> 01:39:39,760
în a face este practic evitarea

2495
01:39:36,719 --> 01:39:42,560
repetare acolo unde putem. Deci în loc de

2496
01:39:39,760 --> 01:39:45,440
având copy paste peste tot, vom face

2497
01:39:42,560 --> 01:39:47,360
în general favorizează organizarea codului nostru pentru

2498
01:39:45,440 --> 01:39:49,040
oarecare grad. Adică vom folosi

2499
01:39:47,360 --> 01:39:50,960
funcţii acolo unde are sens şi

2500
01:39:49,040 --> 01:39:54,639
obiecte în care are sens să se organizeze

2501
01:39:50,960 --> 01:39:57,360
lucruri. Și, de asemenea, în loc să ai

2502
01:39:54,639 --> 01:40:00,639
cod foarte repetitiv, vom favoriza

2503
01:39:57,360 --> 01:40:04,159
folosind structuri bucle care pot

2504
01:40:00,639 --> 01:40:06,480
repetă peste lucruri de multe ori

2505
01:40:04,159 --> 01:40:08,880
în loc să fim nevoiți să scriem tot

2506
01:40:06,480 --> 01:40:10,400
cei scoși unul câte unul. Deci suntem

2507
01:40:08,880 --> 01:40:12,320
vom afla despre aceste instrumente pe care noi

2508
01:40:10,400 --> 01:40:15,600
avem la dispoziție, dar ne vor ajuta

2509
01:40:12,320 --> 01:40:17,199
ne organizăm codul, evităm repetarea

2510
01:40:15,600 --> 01:40:21,119
peste tot. Unul dintre lucrurile pe care noi

2511
01:40:17,199 --> 01:40:24,000
vrei să evit este să ai același cod

2512
01:40:21,119 --> 01:40:25,440
repetate peste tot. Dacă dacă noi

2513
01:40:24,000 --> 01:40:28,080
să ne găsim făcând asta, ar trebui

2514
01:40:25,440 --> 01:40:29,920
pune într-adevăr acel cod într-o funcție sau

2515
01:40:28,080 --> 01:40:32,080
poate într-un obiect ca să putem

2516
01:40:29,920 --> 01:40:36,080
reutilizați-l. Deci, chiar o vom face

2517
01:40:32,080 --> 01:40:39,920
favoarea ca reutilizarea lucrurilor,

2518
01:40:36,080 --> 01:40:42,320
reciclează, refolosește, știi. Deci, suntem

2519
01:40:39,920 --> 01:40:44,000
o să înveți cum să faci asta, cum

2520
01:40:42,320 --> 01:40:44,960
build functions, cum se construiesc obiecte.

2521
01:40:44,000 --> 01:40:46,719
Dar asta e ceva la care vom merge

2522
01:40:44,960 --> 01:40:47,679
favorizați uh când suntem când suntem

2523
01:40:46,719 --> 01:40:50,000
programare. Este ceva ce ar trebui

2524
01:40:47,679 --> 01:40:52,159
fii atent. Daca gasesti

2525
01:40:50,000 --> 01:40:55,119
scriind singur același cod peste și

2526
01:40:52,159 --> 01:40:57,360
doar în locuri diferite, asta e

2527
01:40:55,119 --> 01:40:58,880
probabil un indiciu pe care ar trebui să-l organizezi

2528
01:40:57,360 --> 01:41:00,800
într-o funcție, astfel încât să puteți apela

2529
01:40:58,880 --> 01:41:03,199
acea funcție oriunde ai nevoie

2530
01:41:00,800 --> 01:41:05,600
în loc să copiezi tot acel cod. bine,

2531
01:41:03,199 --> 01:41:06,960
deci vom evita repetarea.

2532
01:41:05,600 --> 01:41:11,600
Acum, motivul pe care îl vom face

2533
01:41:06,960 --> 01:41:13,679
adică să știi să păstrezi totul

2534
01:41:11,600 --> 01:41:16,320
simplu. Vrem să ne asigurăm că lucrurile sunt

2535
01:41:13,679 --> 01:41:18,560
curat, simplu, de înțeles.

2536
01:41:16,320 --> 01:41:21,440
Nu vrem, nu vrem

2537
01:41:18,560 --> 01:41:23,040
au lucruri prea complexe care sunt foarte

2538
01:41:21,440 --> 01:41:25,440
greu de urmarit. Deci, unul dintre

2539
01:41:23,040 --> 01:41:27,600
lucruri care vor fi cu adevărat frumoase

2540
01:41:25,440 --> 01:41:31,199
despre Python se pretează foarte mult

2541
01:41:27,600 --> 01:41:33,760
bine să fie simplu pentru că merge

2542
01:41:31,199 --> 01:41:36,639
să fie atât de ușor de citit efectiv și

2543
01:41:33,760 --> 01:41:38,400
înțelege, știi, înțelege

2544
01:41:36,639 --> 01:41:41,520
ce se întâmplă. Dar unul dintre lucruri

2545
01:41:38,400 --> 01:41:43,679
care se încadrează în acest sens este ca um

2546
01:41:41,520 --> 01:41:45,520
de exemplu denumirea lucrurilor

2547
01:41:43,679 --> 01:41:47,760
în mod corespunzător. Deci, în loc de doar

2548
01:41:45,520 --> 01:41:50,800
apelând totul din codul nostru ca X Y

2549
01:41:47,760 --> 01:41:53,360
și Z dacă vine cineva și citește

2550
01:41:50,800 --> 01:41:56,320
oh, văd că codul tău are un X Y și Z care

2551
01:41:53,360 --> 01:41:58,239
poate să nu aibă sens. Știi că am face-o

2552
01:41:56,320 --> 01:42:00,159
vreau să fiu mai atent cu

2553
01:41:58,239 --> 01:42:02,800
nume ale variabilelor noastre și nume ale noastre

2554
01:42:00,159 --> 01:42:06,560
funcția. Deci, în loc de XYZ, poate noi

2555
01:42:02,800 --> 01:42:08,960
ar folosi ceva de genul nume sau loc

2556
01:42:06,560 --> 01:42:12,800
sau știi ceva potrivit

2557
01:42:08,960 --> 01:42:14,480
identifica asta este ceea ce este. Deci gandeste-te

2558
01:42:12,800 --> 01:42:17,360
despre asta când îți scrii codul

2559
01:42:14,480 --> 01:42:20,000
este să încerci să-l faci de înțeles. Nume

2560
01:42:17,360 --> 01:42:21,840
lucruri pe care altcineva le citește

2561
01:42:20,000 --> 01:42:24,080
ar înțelege ce este dacă ar vedea

2562
01:42:21,840 --> 01:42:25,600
acel nume. Deci asta e o greșeală

2563
01:42:24,080 --> 01:42:27,199
vezi o mulțime de oameni când fac prima dată

2564
01:42:25,600 --> 01:42:28,800
începe. E în regulă ca atunci când ești primul

2565
01:42:27,199 --> 01:42:30,400
începerea și exersarea pentru a numi

2566
01:42:28,800 --> 01:42:32,639
lucruri precum X, Y și Z. Cred că asta este

2567
01:42:30,400 --> 01:42:34,159
bine. Sau ca ABC.

2568
01:42:32,639 --> 01:42:35,840
um,

2569
01:42:34,159 --> 01:42:38,320
dar are sens? Ca dacă

2570
01:42:35,840 --> 01:42:40,719
Altcineva o citea, văd

2571
01:42:38,320 --> 01:42:43,119
XYZ în program, care poate să nu facă

2572
01:42:40,719 --> 01:42:45,600
sens, știi? Deci, dar dacă are un

2573
01:42:43,119 --> 01:42:47,440
Bun nume pentru asta, ai putea spune, oh, ca

2574
01:42:45,600 --> 01:42:50,159
Văd că acesta este numele cuiva

2575
01:42:47,440 --> 01:42:51,679
variabila se referă la sau aceasta este um a

2576
01:42:50,159 --> 01:42:54,159
obiect anume la care se referă

2577
01:42:51,679 --> 01:42:58,960
la. Hm, nu este doar un fel de

2578
01:42:54,159 --> 01:43:02,000
abstract X sau Y sau Z.

2579
01:42:58,960 --> 01:43:04,880
Da, fără spaghete. Da, asta e

2580
01:43:02,000 --> 01:43:07,760
ce uh asta este o mulțime de oameni

2581
01:43:04,880 --> 01:43:12,080
referiți-vă la asta ca. Doar neglijent,

2582
01:43:07,760 --> 01:43:13,199
neorganizat, cod greu de înțeles.

2583
01:43:12,080 --> 01:43:15,119
Unul dintre lucrurile care sunt grozave

2584
01:43:13,199 --> 01:43:17,440
Python este în mod natural foarte

2585
01:43:15,119 --> 01:43:19,760
de înțeles. Așa că nu cred că noi

2586
01:43:17,440 --> 01:43:22,080
vom avea această problemă la fel de mult ca și cum noi

2587
01:43:19,760 --> 01:43:23,760
a avut alte limbi, dar este încă

2588
01:43:22,080 --> 01:43:25,600
posibil.

2589
01:43:23,760 --> 01:43:27,199
Deci acestea sunt lucruri pe care le vom învăța pe măsură ce mergem

2590
01:43:25,600 --> 01:43:29,679
de-a lungul. Încerc doar să intru

2591
01:43:27,199 --> 01:43:31,600
mintea ta un pic devreme aici. Nume

2592
01:43:29,679 --> 01:43:35,040
lucrurile în mod corespunzător este principalul dintre

2593
01:43:31,600 --> 01:43:36,639
principalele sfaturi pe care le pot da aici.

2594
01:43:35,040 --> 01:43:39,520
Hm

2595
01:43:36,639 --> 01:43:40,719
deci următorul sfat este să organizezi lucrurile.

2596
01:43:39,520 --> 01:43:43,119
Acest lucru merge împreună cu evitarea

2597
01:43:40,719 --> 01:43:45,040
repetare. Așa că organizează-te

2598
01:43:43,119 --> 01:43:46,800
hai să punem lucrurile în funcții.

2599
01:43:45,040 --> 01:43:48,320
Să punem lucrurile în obiecte acolo unde sunt

2600
01:43:46,800 --> 01:43:51,280
are sens. Dacă știm că o vom face

2601
01:43:48,320 --> 01:43:52,400
refolosește-l um hai să-l punem într-o

2602
01:43:51,280 --> 01:43:55,280
funcția. Și așa vom învăța

2603
01:43:52,400 --> 01:43:58,480
despre cum să faci asta. Dar în general asta

2604
01:43:55,280 --> 01:44:02,880
este o practică bună dacă te regăsești

2605
01:43:58,480 --> 01:44:06,480
scriind cod pentru a face ceva și

2606
01:44:02,880 --> 01:44:08,639
se dovedește a fi um

2607
01:44:06,480 --> 01:44:10,639
se dovedește a fi ceva ce știi

2608
01:44:08,639 --> 01:44:14,159
vei reutiliza sau se dovedește că

2609
01:44:10,639 --> 01:44:15,600
să fie mai mult decât o mână de linii de cod.

2610
01:44:14,159 --> 01:44:19,360
În general, doriți să organizați asta în

2611
01:44:15,600 --> 01:44:21,119
o funcție astfel încât să fie clar

2612
01:44:19,360 --> 01:44:24,560
asta face acest cod. Aceasta este

2613
01:44:21,119 --> 01:44:27,360
de ce este responsabil. este evident

2614
01:44:24,560 --> 01:44:32,000
știi că este organizat în

2615
01:44:27,360 --> 01:44:34,159
în acea unitate de lucru în esență.

2616
01:44:32,000 --> 01:44:35,520
Deci vom practica asta. Aceasta

2617
01:44:34,159 --> 01:44:37,440
este ceva la care vom deveni buni

2618
01:44:35,520 --> 01:44:40,239
Cred că pe măsură ce mergem, pentru că suntem

2619
01:44:37,440 --> 01:44:42,880
mergând să favorizeze organizația acolo unde aceasta

2620
01:44:40,239 --> 01:44:44,560
are sens.

2621
01:44:42,880 --> 01:44:46,800
Bine.

2622
01:44:44,560 --> 01:44:48,480
Deci lizibilitate. Unul dintre lucruri este

2623
01:44:46,800 --> 01:44:50,239
folosind nume semnificative. eu cam

2624
01:44:48,480 --> 01:44:52,080
am menționat deja că. Celălalt lucru

2625
01:44:50,239 --> 01:44:54,239
folosește comentarii bune. Deci, mergem

2626
01:44:52,080 --> 01:44:56,239
pentru a învăța probabil astăzi cum să faci

2627
01:44:54,239 --> 01:44:58,639
comentarii în codul nostru Python, care este

2628
01:44:56,239 --> 01:45:01,679
va fi de ajutor pentru a vă orienta

2629
01:44:58,639 --> 01:45:03,360
sau alt cititor al lui să, hei, asta este

2630
01:45:01,679 --> 01:45:06,239
ce face această funcție. Aceasta este ceea ce

2631
01:45:03,360 --> 01:45:07,440
această linie de cod face. Nu pot

2632
01:45:06,239 --> 01:45:09,600
să-ți spun de câte ori, știi,

2633
01:45:07,440 --> 01:45:12,080
oamenii scriu cod și apoi ei

2634
01:45:09,600 --> 01:45:15,040
ei înșiși revin la asta o săptămână mai târziu

2635
01:45:12,080 --> 01:45:16,719
și habar n-ai ce face. Asta

2636
01:45:15,040 --> 01:45:20,080
se întâmplă tot timpul. Chiar s-a întâmplat

2637
01:45:16,719 --> 01:45:22,000
la mine. Deci, uh, comentariile sunt prietenele tale

2638
01:45:20,080 --> 01:45:23,920
în acest sens. și că ei nu

2639
01:45:22,000 --> 01:45:27,600
chiar te-a costat orice sa pui comentarii

2640
01:45:23,920 --> 01:45:30,000
acolo um to say to to a fel de

2641
01:45:27,600 --> 01:45:32,320
evidențiați acest lucru este ceea ce această bucată de

2642
01:45:30,000 --> 01:45:34,480
codul se desfășoară și puteți face o notă

2643
01:45:32,320 --> 01:45:36,560
chiar în cod. Asta e

2644
01:45:34,480 --> 01:45:40,480
ce comentarii sunt. Practic sunt

2645
01:45:36,560 --> 01:45:41,600
note pentru tine. Hm

2646
01:45:40,480 --> 01:45:43,840
așa că vom învăța despre asta

2647
01:45:41,600 --> 01:45:46,560
azi. Cum se scrie comentarii și și

2648
01:45:43,840 --> 01:45:48,000
cum arată în cod. The

2649
01:45:46,560 --> 01:45:50,880
alt lucru este indentarea. stii tu,

2650
01:45:48,000 --> 01:45:52,560
Python acceptă uh indent așa cum ați făcut-o

2651
01:45:50,880 --> 01:45:54,880
a indenta. Deci, asta nu prea merge

2652
01:45:52,560 --> 01:45:56,239
să fie o problemă. Unele limbi nu

2653
01:45:54,880 --> 01:45:58,320
susține cu adevărat asta, în special

2654
01:45:56,239 --> 01:46:00,960
cele compilate. Ei nu impun

2655
01:45:58,320 --> 01:46:03,600
strict indentare. Ei impun altele

2656
01:46:00,960 --> 01:46:07,360
lucruri precum acolade și și punct și virgulă

2657
01:46:03,600 --> 01:46:10,400
și așa, dar codul nostru Python

2658
01:46:07,360 --> 01:46:12,239
va fi indentat corect de

2659
01:46:10,400 --> 01:46:13,920
necesitate pentru că altfel nu va fi

2660
01:46:12,239 --> 01:46:16,480
munca. Deci, um, asta e ceva ce suntem

2661
01:46:13,920 --> 01:46:19,840
vom învăța și astăzi despre asta

2662
01:46:16,480 --> 01:46:23,040
indentarea lucrurilor și de ce contează.

2663
01:46:19,840 --> 01:46:24,639
Vom vorbi despre asta.

2664
01:46:23,040 --> 01:46:26,480
um,

2665
01:46:24,639 --> 01:46:28,159
Văd o întrebare de la Sherry. Este Python

2666
01:46:26,480 --> 01:46:32,239
un program cu care se poate programa

2667
01:46:28,159 --> 01:46:35,920
limbaj simplu? Da, este foarte ușor

2668
01:46:32,239 --> 01:46:38,880
Python este foarte natural

2669
01:46:35,920 --> 01:46:41,920
limba în care să programați pentru că da

2670
01:46:38,880 --> 01:46:44,320
sunt limbaje foarte simple uh simple

2671
01:46:41,920 --> 01:46:46,000
folosit peste tot. Cred că este

2672
01:46:44,320 --> 01:46:47,840
va fi foarte ușor de învățat. eu

2673
01:46:46,000 --> 01:46:49,440
cred că va fi foarte ușor de luat.

2674
01:46:47,840 --> 01:46:52,480
Cel puțin asta e speranța mea și o cred

2675
01:46:49,440 --> 01:46:54,480
din experienta mea este. Cum am spus eu

2676
01:46:52,480 --> 01:46:57,280
a fost cineva care a făcut asta și am muncit

2677
01:46:54,480 --> 01:47:00,560
cu mulți cursanți care au făcut același lucru.

2678
01:46:57,280 --> 01:47:04,719
Deci da, cred că va fi destul de ușor

2679
01:47:00,560 --> 01:47:08,000
ridica, foarte simplu.

2680
01:47:04,719 --> 01:47:10,239
Um, și apoi celălalt lucru este că putem

2681
01:47:08,000 --> 01:47:11,679
nu putem găsi erorile noastre foarte

2682
01:47:10,239 --> 01:47:13,760
repede. Acum, pentru că acesta este un

2683
01:47:11,679 --> 01:47:15,600
limbaj interpretat, putem conduce lucrurile

2684
01:47:13,760 --> 01:47:18,080
câte un rând și vom face

2685
01:47:15,600 --> 01:47:20,239
a lovit rapid erorile

2686
01:47:18,080 --> 01:47:22,480
uh la începutul codului nostru, dacă avem

2687
01:47:20,239 --> 01:47:25,840
ei. Deci asta va fi frumos și Python

2688
01:47:22,480 --> 01:47:28,480
oferă mesaje de eroare foarte bune

2689
01:47:25,840 --> 01:47:31,040
um să spun hei, așa că asta este ceea ce este în neregulă

2690
01:47:28,480 --> 01:47:34,080
cu codul dvs. ar trebui să remediați acest lucru

2691
01:47:31,040 --> 01:47:37,199
fel, în esență, ca să-ți dau o

2692
01:47:34,080 --> 01:47:40,480
indiciu a ceea ce trebuie remediat. Um asa

2693
01:47:37,199 --> 01:47:42,880
deci asta e ceva ce vom face

2694
01:47:40,480 --> 01:47:45,280
exersarea cu pe măsură ce mergem este oarecum

2695
01:47:42,880 --> 01:47:48,159
um găsirea erorilor și ce să faci

2696
01:47:45,280 --> 01:47:50,000
ei. Hm, dar pentru că este interpretat,

2697
01:47:48,159 --> 01:47:52,000
le vom întâlni foarte repede.

2698
01:47:50,000 --> 01:47:53,679
Spre deosebire de limbajul compilat, care este

2699
01:47:52,000 --> 01:47:56,000
mai greu de depanat pentru că practic tu

2700
01:47:53,679 --> 01:47:58,560
trebuie să compileze totul, sper că

2701
01:47:56,000 --> 01:48:01,199
compilează. Dacă o face, atunci trebuie

2702
01:47:58,560 --> 01:48:03,760
conduce lucrurile. Hm, pur și simplu durează mai mult

2703
01:48:01,199 --> 01:48:05,760
treceți prin acea fază de depanare. Dar

2704
01:48:03,760 --> 01:48:08,239
cu Python, este foarte rapid.

2705
01:48:05,760 --> 01:48:10,960
Primiți o buclă de feedback foarte rapidă despre if

2706
01:48:08,239 --> 01:48:14,480
codul tău funcționează sau nu, adică

2707
01:48:10,960 --> 01:48:17,280
frumos. Foarte multe voturi pentru C. Sunt de acord. AC

2708
01:48:14,480 --> 01:48:20,800
este raspunsul corect aici. Deci

2709
01:48:17,280 --> 01:48:23,280
interpretul este lucrul care va

2710
01:48:20,800 --> 01:48:25,119
executa codul linie cu linie. Deci

2711
01:48:23,280 --> 01:48:29,679
nu face totul deodată. Ea

2712
01:48:25,119 --> 01:48:32,320
de fapt merge linie cu linie, motiv pentru care

2713
01:48:29,679 --> 01:48:35,679
te poți împiedica rapid de erorile tale

2714
01:48:32,320 --> 01:48:37,600
pentru că dacă mergi rând cu rând

2715
01:48:35,679 --> 01:48:39,199
um și ai mai întâi o eroare la asta

2716
01:48:37,600 --> 01:48:40,639
linie, nu vei ajunge niciodată la acestea

2717
01:48:39,199 --> 01:48:42,239
alte linii, nu? Tu ești doar

2718
01:48:40,639 --> 01:48:44,880
o să-ți arăt că aici ești

2719
01:48:42,239 --> 01:48:47,760
eroarea este. este pe linia 101 sau orice altceva

2720
01:48:44,880 --> 01:48:49,600
este și știi că se va arăta

2721
01:48:47,760 --> 01:48:53,760
tu unde este eroarea. Deci va fi

2722
01:48:49,600 --> 01:48:56,159
mergeți pe rând și executați-le. Hm

2723
01:48:53,760 --> 01:48:58,000
nu va converti codul în

2724
01:48:56,159 --> 01:49:00,159
limbajul mașinii. Asta este un compilat

2725
01:48:58,000 --> 01:49:05,040
limbajul ar face, nu o interpretare

2726
01:49:00,159 --> 01:49:07,119
unul. Ei au nevoie de un

2727
01:49:05,040 --> 01:49:08,719
interpret. Deci D este complet

2728
01:49:07,119 --> 01:49:10,320
greșit. Este opusul. Ea

2729
01:49:08,719 --> 01:49:13,840
o cere. Deci interpretul este

2730
01:49:10,320 --> 01:49:16,960
lucrul care execută codul uh

2731
01:49:13,840 --> 01:49:20,239
rând cu rând. Deci, în ce este Python

2732
01:49:16,960 --> 01:49:23,119
special? Deci este așa cum am făcut-o deja

2733
01:49:20,239 --> 01:49:25,360
văzut un sens interpretat de limbaj

2734
01:49:23,119 --> 01:49:26,560
că are nevoie de un interpret

2735
01:49:25,360 --> 01:49:29,920
executa-l. Va fi executat

2736
01:49:26,560 --> 01:49:32,000
rând cu rând de către acel interpret. Um asta

2737
01:49:29,920 --> 01:49:34,960
are capacitatea de a fi orientat pe obiecte. Ea

2738
01:49:32,000 --> 01:49:37,840
are, de asemenea, capacitatea de a fi scriptat.

2739
01:49:34,960 --> 01:49:41,360
um care este doar în relație cu cum este

2740
01:49:37,840 --> 01:49:45,360
organizat. Unul dintre lucrurile cu adevărat frumoase

2741
01:49:41,360 --> 01:49:48,239
este ceea ce numim tipărit dinamic

2742
01:49:45,360 --> 01:49:51,199
sau ce ai spune semantica dinamica.

2743
01:49:48,239 --> 01:49:53,440
Vom vedea ce înseamnă asta dar

2744
01:49:51,199 --> 01:49:56,800
practic înseamnă că nu trebuie

2745
01:49:53,440 --> 01:49:59,119
declara ce fiecare bucată de uh ce

2746
01:49:56,800 --> 01:50:00,800
fiecare variabilă sau fiecare dată este

2747
01:49:59,119 --> 01:50:03,840
în interiorul lui Python. Putem lăsa

2748
01:50:00,800 --> 01:50:05,760
interpretul interpretează ceea ce este

2749
01:50:03,840 --> 01:50:07,440
frumos. Face lucrurile cu adevărat ușor

2750
01:50:05,760 --> 01:50:08,880
lucra cu. Nu trebuie să spunem bine

2751
01:50:07,440 --> 01:50:10,960
acesta este un număr întreg. Acesta este un

2752
01:50:08,880 --> 01:50:14,080
număr flotant. Aceasta este o matrice.

2753
01:50:10,960 --> 01:50:15,679
Asta știi cu o mulțime de programe

2754
01:50:14,080 --> 01:50:18,320
mai ales limbaje compilate

2755
01:50:15,679 --> 01:50:20,080
limbaje de programare pe care trebuie să le faci

2756
01:50:18,320 --> 01:50:23,520
asta pentru ca trebuie sa-i spui

2757
01:50:20,080 --> 01:50:25,679
compilator asta este această bucată de date

2758
01:50:23,520 --> 01:50:28,480
este. Dar cu un interpret

2759
01:50:25,679 --> 01:50:30,880
interpretul poate, după cum sugerează numele

2760
01:50:28,480 --> 01:50:33,280
interpreta asta. Nu trebuie să știe

2761
01:50:30,880 --> 01:50:35,360
ce este totul în ceea ce privește datele sale

2762
01:50:33,280 --> 01:50:39,119
tip, ceea ce îl face cu adevărat

2763
01:50:35,360 --> 01:50:41,840
ușor de codificat. Din dezavantaj, asta

2764
01:50:39,119 --> 01:50:44,880
îl poate face mai predispus la erori deoarece

2765
01:50:41,840 --> 01:50:46,719
chiar nu impuneți tipuri. Deci,

2766
01:50:44,880 --> 01:50:49,440
există oarecum un compromis acolo.

2767
01:50:46,719 --> 01:50:52,880
Dar pentru scopurile noastre dinamica

2768
01:50:49,440 --> 01:50:55,600
semantica face să fie astfel încât um the

2769
01:50:52,880 --> 01:50:59,440
interpretul poate înțelege dinamic

2770
01:50:55,600 --> 01:51:02,080
ce date sunt în funcție de modul în care sunt

2771
01:50:59,440 --> 01:51:04,080
folosit, ceea ce este grozav pentru că ne place

2772
01:51:02,080 --> 01:51:06,080
face să se ridice mai repede și

2773
01:51:04,080 --> 01:51:08,480
alergând și început și și lucrând cu

2774
01:51:06,080 --> 01:51:12,480
date. Nu trebuie să declarăm ce este

2775
01:51:08,480 --> 01:51:16,639
tipul este care este um semantică statică.

2776
01:51:12,480 --> 01:51:18,400
Hm, acum Python în sine o programare uimitoare

2777
01:51:16,639 --> 01:51:20,880
limbaj care este folosit în multe

2778
01:51:18,400 --> 01:51:23,040
aplicații diferite, cum ar fi datele

2779
01:51:20,880 --> 01:51:27,119
știință, automatizare, învățare automată,

2780
01:51:23,040 --> 01:51:29,840
AI. De asemenea, este folosit pentru a construi software

2781
01:51:27,119 --> 01:51:32,080
chiar nu sunt sigur dacă știți asta

2782
01:51:29,840 --> 01:51:35,840
dar sunt unele cu adevărat celebre

2783
01:51:32,080 --> 01:51:38,400
software care este scris în Python. um,

2784
01:51:35,840 --> 01:51:41,119
una dintre cele mai cunoscute este Instagram la

2785
01:51:38,400 --> 01:51:43,360
Meta este complet codificat în Python,

2786
01:51:41,119 --> 01:51:46,719
adică peste 20.000 de linii de

2787
01:51:43,360 --> 01:51:51,520
Cod Python, care este destul de uimitor.

2788
01:51:46,719 --> 01:51:53,599
Dar bineînțeles că a fost cu adevărat

2789
01:51:51,520 --> 01:51:56,000
foarte utilizat în AI și învățarea automată

2790
01:51:53,599 --> 01:51:58,159
și așa, dar este și ca o programare

2791
01:51:56,000 --> 01:52:00,639
limbajul a fost folosit pentru alte lucruri precum

2792
01:51:58,159 --> 01:52:02,800
aplicații software mai pure care este

2793
01:52:00,639 --> 01:52:06,159
ceea ce îl face pe Python cu adevărat drăguț este că este așa

2794
01:52:02,800 --> 01:52:10,400
simplu atât de ușor de învățat. Um deci pentru asta

2795
01:52:06,159 --> 01:52:11,760
motiv pentru care va fi grozav pentru noi

2796
01:52:10,400 --> 01:52:13,760
pentru a începe, mai ales dacă ești

2797
01:52:11,760 --> 01:52:16,480
vine practic fără programare

2798
01:52:13,760 --> 01:52:20,000
experiență. Un alt lucru despre Python

2799
01:52:16,480 --> 01:52:22,560
are uh așa cum am spus mai devreme ca un

2800
01:52:20,000 --> 01:52:25,360
ecosistem foarte mare, adică asta

2801
01:52:22,560 --> 01:52:28,800
există multe pachete diferite și

2802
01:52:25,360 --> 01:52:31,920
module din acele pachete de pachete

2803
01:52:28,800 --> 01:52:33,599
care fac deja lucruri. Deci nu o facem

2804
01:52:31,920 --> 01:52:36,639
ceea ce este grozav la Python este că nu o vom face

2805
01:52:33,599 --> 01:52:38,080
trebuie să reinventăm roata pe atât de multe

2806
01:52:36,639 --> 01:52:41,679
lucruri diferite, cum ar fi dacă avem nevoie

2807
01:52:38,080 --> 01:52:44,639
construim un complot dacă trebuie să pregătim un model

2808
01:52:41,679 --> 01:52:47,760
și și folosiți un anumit tip de model

2809
01:52:44,639 --> 01:52:50,080
care probabil există deja într-un pachet

2810
01:52:47,760 --> 01:52:52,320
undeva. Și ce este grozav este că sunt

2811
01:52:50,080 --> 01:52:54,159
aproape întotdeauna open source adică noi

2812
01:52:52,320 --> 01:52:56,719
nu trebuie să plătești pentru nimic. Puteți

2813
01:52:54,159 --> 01:52:59,760
Folosește-l doar din cutie, care este

2814
01:52:56,719 --> 01:53:01,520
fantastic. Deci există în Python

2815
01:52:59,760 --> 01:53:02,800
sunt atât de multe moduri de a face lucrurile

2816
01:53:01,520 --> 01:53:05,679
mai ales în AI și mașină

2817
01:53:02,800 --> 01:53:08,800
lumea de învățare pe care doar o vom împrumuta

2818
01:53:05,679 --> 01:53:12,639
acelea și le folosim în propriul nostru cod

2819
01:53:08,800 --> 01:53:14,159
ceea ce vă ajută să știți să obțineți

2820
01:53:12,639 --> 01:53:16,080
in functiune foarte repede. Noi nu

2821
01:53:14,159 --> 01:53:19,119
trebuie să reinventăm lucrurile. Putem folosi doar

2822
01:53:16,080 --> 01:53:22,080
lucruri care există deja um care este

2823
01:53:19,119 --> 01:53:26,719
fantastic. Deci acel ecosistem într-adevăr

2824
01:53:22,080 --> 01:53:28,800
beneficiază de IA pentru învățarea automată. Hm pentru că

2825
01:53:26,719 --> 01:53:30,960
ele există deja. Nu avem nevoie

2826
01:53:28,800 --> 01:53:34,239
să ne petrecem timpul rescriind toate acestea

2827
01:53:30,960 --> 01:53:35,760
lucruri. Hm și deci asta suntem

2828
01:53:34,239 --> 01:53:38,080
să învățăm pe măsură ce mergem mai departe este ca

2829
01:53:35,760 --> 01:53:40,800
cum se instalează, cum se importă

2830
01:53:38,080 --> 01:53:44,080
acelea, cum să le folosim în propriul nostru cod,

2831
01:53:40,800 --> 01:53:46,159
acele pachete care deja fac

2832
01:53:44,080 --> 01:53:48,800
ceva pentru noi. Deci nu avem nevoie

2833
01:53:46,159 --> 01:53:51,679
venim cu ea singuri. doar avem nevoie

2834
01:53:48,800 --> 01:53:54,080
pentru a-l folosi corect. Bine, deci există o

2835
01:53:51,679 --> 01:53:57,040
putina istorie. Python a fost primul

2836
01:53:54,080 --> 01:54:01,840
inventat la sfârșitul anilor 1980 de un tip

2837
01:53:57,040 --> 01:54:04,560
pe nume Guido Van Rossom la Amsterdam. um,

2838
01:54:01,840 --> 01:54:05,840
de unde își trage numele este după vechiul

2839
01:54:04,560 --> 01:54:07,199
serial de comedie, ați putea fi

2840
01:54:05,840 --> 01:54:11,280
familiarizat cu el, Monty Python

2841
01:54:07,199 --> 01:54:14,400
Spectacol de circ zburător. Hm, și așa e

2842
01:54:11,280 --> 01:54:16,800
de unde își trage numele. um tu o stii

2843
01:54:14,400 --> 01:54:20,159
a fost creat pentru prima dată atunci, dar a fost de atunci

2844
01:54:16,800 --> 01:54:22,000
a luat un rol cu adevărat important în

2845
01:54:20,159 --> 01:54:25,199
mai ales știi că tot spun în

2846
01:54:22,000 --> 01:54:27,679
Comunitatea AI atât de mult încât are ea

2847
01:54:25,199 --> 01:54:29,599
propria fundație de software așa ceva este

2848
01:54:27,679 --> 01:54:33,199
răspunzătoare de menținerea acesteia se întâlnesc

2849
01:54:29,599 --> 01:54:35,119
în mod regulat ei vin cu îmbunătățiri

2850
01:54:33,199 --> 01:54:36,719
ei vin cu noi versiuni ale

2851
01:54:35,119 --> 01:54:40,800
Python

2852
01:54:36,719 --> 01:54:44,560
uh, de exemplu, Python 3.14 tocmai a fost lansat

2853
01:54:40,800 --> 01:54:47,840
în octombrie, care este o lansare majoră. Uh

2854
01:54:44,560 --> 01:54:50,960
nu mai avuseseră una de ceva vreme şi asta

2855
01:54:47,840 --> 01:54:52,719
unul este uh 3.14. Deci este cam cunoscut ca

2856
01:54:50,960 --> 01:54:56,560
Python.

2857
01:54:52,719 --> 01:54:58,560
Hm, care a fost o mare piatră de hotar. Hm, dar tu

2858
01:54:56,560 --> 01:55:00,000
știu că au, au avut multe

2859
01:54:58,560 --> 01:55:01,520
diferite versiuni de-a lungul anilor. Este

2860
01:55:00,000 --> 01:55:06,080
fost întreținut și dezvoltat prin aceasta

2861
01:55:01,520 --> 01:55:09,040
fundație software. Hm și oamenii sunt

2862
01:55:06,080 --> 01:55:11,599
lucrând activ la el la multe mari

2863
01:55:09,040 --> 01:55:14,320
companiilor. Deci, de exemplu, Meta are un

2864
01:55:11,599 --> 01:55:17,440
grup mare care lucrează la um Python

2865
01:55:14,320 --> 01:55:19,360
îmbunătățiri. Microsoft la fel, um

2866
01:55:17,440 --> 01:55:20,880
Google, toți tipii ăștia au grupuri

2867
01:55:19,360 --> 01:55:22,960
de lucru pentru a îmbunătăți Python

2868
01:55:20,880 --> 01:55:25,520
pentru că toți îl folosesc. Și așa ce

2869
01:55:22,960 --> 01:55:27,199
ei fac de obicei este să lucreze la el, deschis

2870
01:55:25,520 --> 01:55:29,760
sursă, și apoi comunitatea primește

2871
01:55:27,199 --> 01:55:32,639
să folosească acele instrumente, acele pachete,

2872
01:55:29,760 --> 01:55:35,760
acele instrumente, acele îmbunătățiri. Um asa

2873
01:55:32,639 --> 01:55:37,920
este folosit în mod activ peste tot

2874
01:55:35,760 --> 01:55:40,639
multe companii mari în mod activ uh

2875
01:55:37,920 --> 01:55:43,760
întreţinute de aceştia sau la care contribuie

2876
01:55:40,639 --> 01:55:46,000
ei. Deci asta e cu adevărat grozav. Hm

2877
01:55:43,760 --> 01:55:51,360
știi că Python a fost derivat inițial

2878
01:55:46,000 --> 01:55:54,080
din altă limbă um alte limbi

2879
01:55:51,360 --> 01:55:56,560
ca un fel de încercare de a găsi ca o

2880
01:55:54,080 --> 01:56:00,560
amestec de unele dintre cele mai bune dintre toate

2881
01:55:56,560 --> 01:56:02,960
lumi. Dar principalul e ca forță motrice

2882
01:56:00,560 --> 01:56:05,040
în de ce Python a venit la existenţă din

2883
01:56:02,960 --> 01:56:07,119
aceste alte limbi sunt doar ale sale

2884
01:56:05,040 --> 01:56:08,800
ușurință de utilizare. Oamenii și-au dorit cu adevărat

2885
01:56:07,119 --> 01:56:11,440
ceva de genul super ușor de ridicat și

2886
01:56:08,800 --> 01:56:14,000
alergare și ceva cu adevărat natural.

2887
01:56:11,440 --> 01:56:16,159
Um și așa vom face pe măsură ce începem să învățăm

2888
01:56:14,000 --> 01:56:18,719
Sintaxa ei cred că o veți face

2889
01:56:16,159 --> 01:56:19,920
înțelege de ce este atât de ușor. Dar um

2890
01:56:18,719 --> 01:56:21,360
asta a dus la

2891
01:56:19,920 --> 01:56:23,920
inspirația este doar oamenii doriti

2892
01:56:21,360 --> 01:56:26,480
ceva mai ușor de lucrat nu ca nu

2893
01:56:23,920 --> 01:56:28,880
ca uh obositor să se cam ridice și

2894
01:56:26,480 --> 01:56:28,880
alergând.

2895
01:56:29,360 --> 01:56:34,080
Ce licență open source este? um,

2896
01:56:32,400 --> 01:56:36,400
asta e o intrebare buna. Cred că este

2897
01:56:34,080 --> 01:56:37,920
Licență MIT, dar aș putea greși

2898
01:56:36,400 --> 01:56:39,199
că.

2899
01:56:37,920 --> 01:56:41,920
Ai putea să-l cauți. Dacă te duci la

2900
01:56:39,199 --> 01:56:43,599
python.org.

2901
01:56:41,920 --> 01:56:46,639
Da, dacă mergi pe python.org, cred

2902
01:56:43,599 --> 01:56:48,719
s-ar putea să vorbească mai mult despre ce ai

2903
01:56:46,639 --> 01:56:52,159
structura licenței este acolo. vreau

2904
01:56:48,719 --> 01:56:57,280
spune că e licență deschisă MIT, dar

2905
01:56:52,159 --> 01:56:59,119
Chiar nu sunt 100% sigur de asta.

2906
01:56:57,280 --> 01:57:00,560
Bine. Deci, care sunt unele dintre beneficii

2907
01:56:59,119 --> 01:57:02,239
de lucru cu Python? Și acestea sunt

2908
01:57:00,560 --> 01:57:04,639
lucruri pe care le vei experimenta pe măsură ce mergem

2909
01:57:02,239 --> 01:57:07,760
împreună, dar am vrut doar să-i chem afară.

2910
01:57:04,639 --> 01:57:09,199
Um, flexibilitatea ei. După cum am spus, asta

2911
01:57:07,760 --> 01:57:11,679
poate fi într-adevăr organizat în

2912
01:57:09,199 --> 01:57:14,080
orientat pe obiect sau poate fi vag

2913
01:57:11,679 --> 01:57:17,199
organizate în scripturi. Deci, asta

2914
01:57:14,080 --> 01:57:20,000
Doar flexibilitatea este cu adevărat minunată. um

2915
01:57:17,199 --> 01:57:22,639
ceea ce i-a permis să alimenteze pe mulți

2916
01:57:20,000 --> 01:57:24,480
lucruri diferite, cum ar fi API-uri, web

2917
01:57:22,639 --> 01:57:29,360
pagini, aplicații complete precum

2918
01:57:24,480 --> 01:57:32,000
Instagram, chat, GPT-uri, ca de fapt

2919
01:57:29,360 --> 01:57:35,040
AI, LLM.

2920
01:57:32,000 --> 01:57:36,719
Știi, are atât de multă flexibilitate

2921
01:57:35,040 --> 01:57:38,239
acolo pentru a alimenta atât de multe diferite

2922
01:57:36,719 --> 01:57:40,480
aplicatii.

2923
01:57:38,239 --> 01:57:43,440
Probabil cel mai mare beneficiu,

2924
01:57:40,480 --> 01:57:45,760
în special pentru noi, este ușurința în utilizare.

2925
01:57:43,440 --> 01:57:48,239
um,

2926
01:57:45,760 --> 01:57:50,000
uh,

2927
01:57:48,239 --> 01:57:53,040
o, mulțumesc. Unele Tim tocmai l-au postat.

2928
01:57:50,000 --> 01:57:57,080
Este GNU,

2929
01:57:53,040 --> 01:57:57,080
uh, licență publică. Da.

2930
01:57:58,560 --> 01:58:02,960
Oh, nu contează. Este un software Python.

2931
01:58:00,400 --> 01:58:04,719
Are propriile sale. Bine, perfect. Multumesc

2932
01:58:02,960 --> 01:58:06,480
pentru împărtășirea asta. Mulțumesc pentru distribuire

2933
01:58:04,719 --> 01:58:09,119
că. Da, nu eram complet sigur

2934
01:58:06,480 --> 01:58:12,480
care ce licență a fost, dar este

2935
01:58:09,119 --> 01:58:16,239
sursă deschisă. Um, și oamenii fac

2936
01:58:12,480 --> 01:58:17,679
propriul lor fel de derivări ale lui Python.

2937
01:58:16,239 --> 01:58:20,400
Dar, așa cum spuneam, unul dintre beneficii

2938
01:58:17,679 --> 01:58:22,400
de Python este cât de ușor este de învățat. eu

2939
01:58:20,400 --> 01:58:24,560
continua sa subliniezi asta pentru ca este adevarat.

2940
01:58:22,400 --> 01:58:26,400
Odată ce vom intra în ea, veți vedea asta.

2941
01:58:24,560 --> 01:58:30,480
Promit că va fi ușor de învățat, ușor

2942
01:58:26,400 --> 01:58:32,480
a ridica. Hm, și este proiectat în

2943
01:58:30,480 --> 01:58:35,119
asa. Conceput pentru a fi foarte minimalist

2944
01:58:32,480 --> 01:58:38,239
ca limbaj, ceea ce este grozav.

2945
01:58:35,119 --> 01:58:41,040
um, are o mulțime de lucruri care vin cu

2946
01:58:38,239 --> 01:58:43,280
acesta și este oarecum încorporat în Python, a

2947
01:58:41,040 --> 01:58:45,119
multă capacitate. Deci noi numim asta

2948
01:58:43,280 --> 01:58:46,960
bibliotecă standard. Sunt doar lucrurile

2949
01:58:45,119 --> 01:58:50,000
încorporat în Python. Are o mulțime de

2950
01:58:46,960 --> 01:58:51,360
capacitate din cutie. Hm, știi,

2951
01:58:50,000 --> 01:58:52,880
nu numai atât, dar are o mare

2952
01:58:51,360 --> 01:58:54,719
comunitate care s-a dezvoltat atât de multe

2953
01:58:52,880 --> 01:58:57,599
diferite pachete care fac lucruri pentru

2954
01:58:54,719 --> 01:58:59,199
noi, mai ales în lumea AI. Deci

2955
01:58:57,599 --> 01:59:01,760
acesta este un alt lucru grozav, un fel de a

2956
01:58:59,199 --> 01:59:05,599
comunitate robustă care le dezvoltă

2957
01:59:01,760 --> 01:59:08,960
pachete care ne ajută să ducem lucrurile la bun sfârșit.

2958
01:59:05,599 --> 01:59:11,280
Um, lizibilitate. Deci pentru că codul este

2959
01:59:08,960 --> 01:59:13,360
atât de simplu, este și ușor de citit. Deci

2960
01:59:11,280 --> 01:59:15,920
de obicei puteți citi alt cod Python

2961
01:59:13,360 --> 01:59:20,239
și înțelege rapid ce face

2962
01:59:15,920 --> 01:59:21,760
ceea ce știi că face ușor, um ușor

2963
01:59:20,239 --> 01:59:23,440
înțelegerea codului altor persoane

2964
01:59:21,760 --> 01:59:26,000
înțelegere ușoară a codului în

2965
01:59:23,440 --> 01:59:28,480
comunitate și cam așa cum este

2966
01:59:26,000 --> 01:59:32,159
autodocumentarea pentru că este atât de ușor

2967
01:59:28,480 --> 01:59:35,119
citeste. Pentru ca acea simplitate să uşureze

2968
01:59:32,159 --> 01:59:37,360
de utilizare se pretează bine să fie cu adevărat

2969
01:59:35,119 --> 01:59:39,199
lizibil. De obicei, puteți lua doar un

2970
01:59:37,360 --> 01:59:41,760
uită-te la cod, citește-l ușor,

2971
01:59:39,199 --> 01:59:44,239
înțelege ce face, adică

2972
01:59:41,760 --> 01:59:46,159
grozav, parcă grozav pentru voi băieți care învățați,

2973
01:59:44,239 --> 01:59:48,159
grozav pentru a arunca o privire la demonstrații și

2974
01:59:46,159 --> 01:59:51,159
exemple pe care le vom face. Sunt foarte

2975
01:59:48,159 --> 01:59:51,159
lizibil.

2976
01:59:56,800 --> 02:00:04,080
Bine. Deci de ce a dominat Python cu adevărat

2977
02:00:02,080 --> 02:00:06,080
AI? Deci aceasta este o întrebare validă, cum ar fi

2978
02:00:04,080 --> 02:00:07,440
chiar și așa este folosit pentru multe diferite

2979
02:00:06,080 --> 02:00:09,360
lucruri. Este un limbaj de programare. Deci

2980
02:00:07,440 --> 02:00:10,960
se poate construi aplicație și am dat

2981
02:00:09,360 --> 02:00:14,320
tu exemplul Instagram și există

2982
02:00:10,960 --> 02:00:19,360
multe altele, care sunt construite din

2983
02:00:14,320 --> 02:00:21,840
Cod Python. De ce este atât de util pentru AI

2984
02:00:19,360 --> 02:00:23,360
în special?

2985
02:00:21,840 --> 02:00:25,920
în principal

2986
02:00:23,360 --> 02:00:28,560
uh unele dintre motivele pe care le avem deja

2987
02:00:25,920 --> 02:00:32,880
a vorbit în principal despre cât de ușor este

2988
02:00:28,560 --> 02:00:35,040
utilizarea se pretează bine pentru AI pentru că um

2989
02:00:32,880 --> 02:00:36,880
care le-a permis oamenilor să facă

2990
02:00:35,040 --> 02:00:40,159
pornește rapid și testează

2991
02:00:36,880 --> 02:00:42,400
algoritmii lor, testează modelele lor

2992
02:00:40,159 --> 02:00:46,560
doar foarte repede cu Python. Asta e

2993
02:00:42,400 --> 02:00:50,239
mare. Celelalte lucruri enumerate aici

2994
02:00:46,560 --> 02:00:54,080
sunt cu siguranță și motive mari. Aşa

2995
02:00:50,239 --> 02:00:58,159
de exemplu, are atât de multe comunități

2996
02:00:54,080 --> 02:01:03,360
biblioteci, acele pachete care um

2997
02:00:58,159 --> 02:01:05,920
avem modele AI și instrumente AI pe care le putem

2998
02:01:03,360 --> 02:01:08,960
reutilizarea pe care oamenii le-au construit

2999
02:01:05,920 --> 02:01:11,840
peste ani si ani si ani. Um asa

3000
02:01:08,960 --> 02:01:13,440
este în beneficiul nostru să le refolosim pe acelea și

3001
02:01:11,840 --> 02:01:14,880
nu trebuie să reinventăm totul și noi

3002
02:01:13,440 --> 02:01:17,040
se poate pune rapid în funcțiune cu

3003
02:01:14,880 --> 02:01:18,639
cele care ar fi grozave.

3004
02:01:17,040 --> 02:01:20,639
Celălalt lucru este Python, care împrumută

3005
02:01:18,639 --> 02:01:23,440
în sine foarte foarte bine pentru a lucra cu

3006
02:01:20,639 --> 02:01:24,960
date în general. Foarte ușor de lucrat

3007
02:01:23,440 --> 02:01:27,840
date, foarte ușor să le încărcați

3008
02:01:24,960 --> 02:01:31,599
surse externe, interogați-l, lucrați cu

3009
02:01:27,840 --> 02:01:34,000
el, vizualizează-l. Python este atât de priceput la

3010
02:01:31,599 --> 02:01:35,679
că. Um, deci asta este ceea ce face cu adevărat

3011
02:01:34,000 --> 02:01:37,920
bun la învățarea automată și AI

3012
02:01:35,679 --> 02:01:41,679
pentru că atât de mult este manipulator

3013
02:01:37,920 --> 02:01:43,840
date. Deci, doar din acest motiv,

3014
02:01:41,679 --> 02:01:45,679
Python este atât de popular în comunitatea AI

3015
02:01:43,840 --> 02:01:47,760
doar datorită capacității sale de a lucra cu

3016
02:01:45,679 --> 02:01:49,520
date. Este atât de ușor. Acesta este ceva

3017
02:01:47,760 --> 02:01:51,119
ne vom concentra cu adevărat pe like

3018
02:01:49,520 --> 02:01:53,199
în următorul nostru curs când vorbim despre

3019
02:01:51,119 --> 02:01:55,760
știința datelor.

3020
02:01:53,199 --> 02:01:58,159
Dar, um,

3021
02:01:55,760 --> 02:02:00,239
doar capacitatea și puterea de a

3022
02:01:58,159 --> 02:02:03,679
lucrul cu date face se pretează bine

3023
02:02:00,239 --> 02:02:05,679
la AI uh, capabilități.

3024
02:02:03,679 --> 02:02:07,679
Um, celălalt lucru este că am menționat

3025
02:02:05,679 --> 02:02:09,599
prototipare rapidă. Puteți construi rapid

3026
02:02:07,679 --> 02:02:11,760
un model în Python pentru că codul este așa

3027
02:02:09,599 --> 02:02:15,840
usor. Deci, și există atât de multe biblioteci

3028
02:02:11,760 --> 02:02:18,080
deja poate prototip rapid. um,

3029
02:02:15,840 --> 02:02:20,239
are evident o comunitate mare în jur

3030
02:02:18,080 --> 02:02:22,480
asta construiește aceste pachete,

3031
02:02:20,239 --> 02:02:25,199
redactarea documentatiei, intretinerea acesteia

3032
02:02:22,480 --> 02:02:27,679
de la un nivel open source. Deci, asta e

3033
02:02:25,199 --> 02:02:29,360
un alt motiv pentru care este foarte popular. um,

3034
02:02:27,679 --> 02:02:32,080
Python este folosit și cu altele

3035
02:02:29,360 --> 02:02:34,320
tehnologii. Deci, are

3036
02:02:32,080 --> 02:02:36,560
capacitatea de a se integra cu altele

3037
02:02:34,320 --> 02:02:38,239
limbi. Deci, de exemplu, Python poate

3038
02:02:36,560 --> 02:02:41,119
una dintre cele mai populare integrări este

3039
02:02:38,239 --> 02:02:43,840
Python poate lucra cu C și C. Deci

3040
02:02:41,119 --> 02:02:47,199
uneori este necesar să se integreze

3041
02:02:43,840 --> 02:02:49,360
cu aceia să facă anumite lucruri. Um asa

3042
02:02:47,199 --> 02:02:51,599
Python a fost extins pentru a lucra cu

3043
02:02:49,360 --> 02:02:55,040
alte limbi. Deci uneori există

3044
02:02:51,599 --> 02:02:56,560
alt sprijin necesar din partea altora

3045
02:02:55,040 --> 02:02:59,760
ca lucrurile în alte limbi care sunt

3046
02:02:56,560 --> 02:03:03,280
necesar pentru a alimenta ceva în AI. um

3047
02:02:59,760 --> 02:03:07,360
de exemplu lucrul cu GPU-uri

3048
02:03:03,280 --> 02:03:09,199
și a face lucruri în deep learning. Hm

3049
02:03:07,360 --> 02:03:12,639
a fost multă integrare cu

3050
02:03:09,199 --> 02:03:15,360
lucrez cu instrumente C. Acum vom face

3051
02:03:12,639 --> 02:03:19,599
face asta? Nu, s-a făcut deja pentru

3052
02:03:15,360 --> 02:03:22,719
noi și unele dintre aceste pachete. Dar um

3053
02:03:19,599 --> 02:03:24,400
capacitatea pură a lui Python de a face asta este

3054
02:03:22,719 --> 02:03:26,080
cu adevărat puternic și este luat pentru

3055
02:03:24,400 --> 02:03:28,239
acordat sincer pentru ca nu vezi

3056
02:03:26,080 --> 02:03:29,679
că e sub capotă și este

3057
02:03:28,239 --> 02:03:32,159
abstras de tine când lucrezi

3058
02:03:29,679 --> 02:03:33,679
cu acele pachete Python. Dar acolo

3059
02:03:32,159 --> 02:03:35,760
a fost o mulțime de muncă care a intrat în asta

3060
02:03:33,679 --> 02:03:39,239
integrați-l cu alte tipuri de altele

3061
02:03:35,760 --> 02:03:39,239
limbaje de programare.

3062
02:03:39,840 --> 02:03:43,440
Bine.

3063
02:03:41,520 --> 02:03:45,840
Deci, ca exemplu cum am menționat

3064
02:03:43,440 --> 02:03:48,400
unul de Instagram. Deci Netflix, de exemplu,

3065
02:03:45,840 --> 02:03:51,040
toate recomandările lor sunt alimentate

3066
02:03:48,400 --> 02:03:54,320
de Python. Deci, când deschideți Netflix

3067
02:03:51,040 --> 02:03:56,800
sau într-adevăr orice serviciu de streaming pentru asta

3068
02:03:54,320 --> 02:03:58,320
contează, vor folosi Python pentru

3069
02:03:56,800 --> 02:03:59,599
transmite acele recomandări și

3070
02:03:58,320 --> 02:04:02,320
produce cele personalizate

3071
02:03:59,599 --> 02:04:05,920
recomandări. Um Spotify la fel pentru

3072
02:04:02,320 --> 02:04:08,800
ca muzica. Aproape toată recomandarea

3073
02:04:05,920 --> 02:04:11,599
algoritmii sunt scrisi in Python.

3074
02:04:08,800 --> 02:04:13,520
Și în acest program, suntem de fapt

3075
02:04:11,599 --> 02:04:16,159
voi afla despre recomandare

3076
02:04:13,520 --> 02:04:17,440
sisteme. Deci va fi un mod destul de distractiv

3077
02:04:16,159 --> 02:04:19,520
pe drum când intrăm în mașină

3078
02:04:17,440 --> 02:04:22,000
învăţarea. Vom vorbi despre cum facem

3079
02:04:19,520 --> 02:04:25,760
construi un motor de recomandare,

3080
02:04:22,000 --> 02:04:28,560
dar toate s-au terminat prin Python

3081
02:04:25,760 --> 02:04:31,960
de exemplu. Deci foarte tare uh folosește

3082
02:04:28,560 --> 02:04:31,960
cazuri acolo.

3083
02:04:32,400 --> 02:04:39,360
Deci unul dintre lucrurile pe care am vrut să le abordez

3084
02:04:34,560 --> 02:04:41,440
este modul în care AI în sine schimbă codificarea. Deci

3085
02:04:39,360 --> 02:04:45,440
s-ar putea să fiți conștienți de asta, dar

3086
02:04:41,440 --> 02:04:48,320
evident că a existat un fel de uriaș

3087
02:04:45,440 --> 02:04:50,880
explozie a instrumentelor AI generative care

3088
02:04:48,320 --> 02:04:52,719
poate ajuta la scrierea documentelor și la scriere

3089
02:04:50,880 --> 02:04:54,480
e-mailuri și scrie text și toate astea

3090
02:04:52,719 --> 02:04:58,239
lucruri. Unul dintre lucrurile pe care le pot face este

3091
02:04:54,480 --> 02:05:00,239
scrie codul. Deci una dintre zonele mari

3092
02:04:58,239 --> 02:05:04,639
unde AI schimbă codificarea este un

3093
02:05:00,239 --> 02:05:07,360
capacitatea sa de a genera cod pentru noi. Şi

3094
02:05:04,639 --> 02:05:10,239
deci pe tot parcursul acestui program ca noi

3095
02:05:07,360 --> 02:05:13,760
nu se va sfii de asta neapărat

3096
02:05:10,239 --> 02:05:16,159
și vă încurajez să folosiți instrumente AI

3097
02:05:13,760 --> 02:05:17,360
după cum credeți de cuviință să vă ajutați pe ai dvs

3098
02:05:16,159 --> 02:05:20,159
înțelegându-l și ajută-l pe al tău

3099
02:05:17,360 --> 02:05:22,080
productivitatea. Hm

3100
02:05:20,159 --> 02:05:24,719
știi că încă vom trece prin

3101
02:05:22,080 --> 02:05:27,280
fundamentale astfel încât să le puteți înțelege

3102
02:05:24,719 --> 02:05:31,040
dar instrumentele AI pot fi cu siguranță a

3103
02:05:27,280 --> 02:05:32,880
supliment pentru a ajuta. Hm, doar că eu

3104
02:05:31,040 --> 02:05:34,880
credeți că veți înțelege mai bine

3105
02:05:32,880 --> 02:05:37,760
parcurgând exemplele pe care le facem noi

3106
02:05:34,880 --> 02:05:39,760
face împreună și astfel încât atunci când AI

3107
02:05:37,760 --> 02:05:41,920
generează cod pe care îl vei putea

3108
02:05:39,760 --> 02:05:43,520
înțelegeți-l și, de asemenea, să puteți depana

3109
02:05:41,920 --> 02:05:45,679
este corect pentru că nu merge întotdeauna

3110
02:05:43,520 --> 02:05:48,000
a fi perfect. Deci asta este întotdeauna

3111
02:05:45,679 --> 02:05:50,639
prind cu AI este că știi asta

3112
02:05:48,000 --> 02:05:53,440
nu produce întotdeauna răspunsuri perfecte.

3113
02:05:50,639 --> 02:05:56,159
Hm, dar cel puțin vom fi

3114
02:05:53,440 --> 02:05:59,360
capabil să știi să depanezi lucruri și

3115
02:05:56,159 --> 02:06:01,840
înțelegem lucrurile mai bine, astfel încât noi

3116
02:05:59,360 --> 02:06:05,520
poate prinde acele erori.

3117
02:06:01,840 --> 02:06:07,040
Um, evident, așa cum este și AI

3118
02:06:05,520 --> 02:06:10,719
generându-l, de asemenea, este

3119
02:06:07,040 --> 02:06:12,639
sugerând ce ar trebui să fie acolo. Deci, uh,

3120
02:06:10,719 --> 02:06:15,920
unii dintre editorii de cod chiar fac a

3121
02:06:12,639 --> 02:06:17,840
Bună treabă la asta, sugerând lucruri, um,

3122
02:06:15,920 --> 02:06:20,800
ridicând ceea ce ar trebui să produci

3123
02:06:17,840 --> 02:06:23,440
în continuare. Asta va fi, um, foarte

3124
02:06:20,800 --> 02:06:25,199
interesant pe măsură ce intrăm în, uh, unele dintre

3125
02:06:23,440 --> 02:06:27,360
platformele pe care le veți funcționa

3126
02:06:25,199 --> 02:06:32,239
cu pentru a vă scrie codul Python. Ei

3127
02:06:27,360 --> 02:06:35,599
va avea acea capacitate. Um, deci, uh,

3128
02:06:32,239 --> 02:06:39,199
altceva este ca și cum ar fi un nor

3129
02:06:35,599 --> 02:06:41,040
instrumente care, um, nu necesită scris

3130
02:06:39,199 --> 02:06:42,719
mult cod și pot face

3131
02:06:41,040 --> 02:06:44,480
lucruri. Deci, cu alte cuvinte, poți

3132
02:06:42,719 --> 02:06:45,760
alimentați-le prin solicitări. Nu ești cu adevărat

3133
02:06:44,480 --> 02:06:47,760
scrierea codului. Doar scrii

3134
02:06:45,760 --> 02:06:50,800
limbajul natural și apoi o fac

3135
02:06:47,760 --> 02:06:52,159
ceva. Ei generează codul în

3136
02:06:50,800 --> 02:06:55,040
fundalul și execută

3137
02:06:52,159 --> 02:06:57,840
ceva. Vom afla despre acestea

3138
02:06:55,040 --> 02:06:59,920
lucruri mai târziu în program

3139
02:06:57,840 --> 02:07:03,280
mai ales că vom acoperi

3140
02:06:59,920 --> 02:07:05,840
IA generativă în viitor

3141
02:07:03,280 --> 02:07:07,040
um spre sfârșitul programului nostru. Deci dacă

3142
02:07:05,840 --> 02:07:09,520
te întrebi cum o să facem

3143
02:07:07,040 --> 02:07:12,320
acoperă LLM-uri? Vom acoperi cum

3144
02:07:09,520 --> 02:07:17,239
aceste lucruri sunt generate? Da. Doar

3145
02:07:12,320 --> 02:07:17,239
va fi mai târziu în program.

3146
02:07:18,079 --> 02:07:22,480
Bine. Multe voturi pentru B.

3147
02:07:20,639 --> 02:07:23,920
Da, destul de unanim pe B. Cred că

3148
02:07:22,480 --> 02:07:25,360
de acord cu el. Da, B este cu siguranță

3149
02:07:23,920 --> 02:07:27,599
raspuns corect. Deci, toate

3150
02:07:25,360 --> 02:07:30,320
sisteme de recomandare pe care le vom face

3151
02:07:27,599 --> 02:07:36,159
să învățăm cum să ne construim pe noi înșine mai târziu

3152
02:07:30,320 --> 02:07:37,920
sunt scrise în Python și sunt

3153
02:07:36,159 --> 02:07:39,280
modele de învățare automată care fac

3154
02:07:37,920 --> 02:07:43,199
recomandări și acea mașină

3155
02:07:39,280 --> 02:07:46,239
învățarea este condusă de date și tot

3156
02:07:43,199 --> 02:07:49,760
acele date sunt manipulate în Python

3157
02:07:46,239 --> 02:07:51,040
și obișnuia să antreneze modele care fac

3158
02:07:49,760 --> 02:07:54,520
recomandările. Asta-i tot

3159
02:07:51,040 --> 02:07:54,520
care se întâmplă în Python.

3160
02:07:54,800 --> 02:07:59,760
Deci, vom vorbi despre obținerea

3161
02:07:56,639 --> 02:08:02,000
voi, băieți, instalați pe propria mașină și

3162
02:07:59,760 --> 02:08:04,639
vorbind despre dezvoltarea diferită

3163
02:08:02,000 --> 02:08:08,079
medii pe care le putem folosi pentru a lucra efectiv

3164
02:08:04,639 --> 02:08:09,520
cu cod Python. Înainte să intrăm

3165
02:08:08,079 --> 02:08:12,960
asta, orice întrebări despre orice am

3166
02:08:09,520 --> 02:08:15,440
acoperit până acum?

3167
02:08:12,960 --> 02:08:17,199
Totul e bine până acum. Da. Iar tu

3168
02:08:15,440 --> 02:08:18,800
știi din nou dacă ai experiență în

3169
02:08:17,199 --> 02:08:21,199
Python recunosc că se va întâmpla

3170
02:08:18,800 --> 02:08:24,239
fii puțin lent la început. Hm, este

3171
02:08:21,199 --> 02:08:26,400
mai ales pentru a ne orienta cu adevărat către unele

3172
02:08:24,239 --> 02:08:29,920
fundal în jurul Python și pregătiți-ne

3173
02:08:26,400 --> 02:08:33,360
sus și apoi vom face să știi uh

3174
02:08:29,920 --> 02:08:36,480
intrând în sintaxă și toate astea

3175
02:08:33,360 --> 02:08:38,639
apar în scurt timp. Deci vom face de fapt

3176
02:08:36,480 --> 02:08:41,920
să înveți specificul Python care urmează

3177
02:08:38,639 --> 02:08:45,599
în curând. Dar știi că vom primi

3178
02:08:41,920 --> 02:08:45,599
totul a fost pus la punct mai întâi.

3179
02:08:45,920 --> 02:08:50,480
În regulă. Deci, să continuăm atunci.

3180
02:08:47,920 --> 02:08:53,760
Vă mulțumesc băieți pentru asta.

3181
02:08:50,480 --> 02:08:56,719
Deci, se dovedește că sunt multe

3182
02:08:53,760 --> 02:08:59,360
instrumente în comunitate pentru dezvoltare

3183
02:08:56,719 --> 02:09:02,400
Cod Python. Și așa, s-ar putea să auzi

3184
02:08:59,360 --> 02:09:04,800
acest cuvânt ID. Este prescurtarea de la integrat

3185
02:09:02,400 --> 02:09:08,719
mediu de dezvoltare. Aceasta este o bucată

3186
02:09:04,800 --> 02:09:12,159
de software care te ajută să scrii și

3187
02:09:08,719 --> 02:09:14,239
testează codul Python. Deci, și sunt multe

3188
02:09:12,159 --> 02:09:18,639
acolo afară. Există o grămadă pe această listă.

3189
02:09:14,239 --> 02:09:20,079
Ne vom concentra pe câteva opțiuni.

3190
02:09:18,639 --> 02:09:22,159
Există chiar mai mult decât ceea ce este pe asta

3191
02:09:20,079 --> 02:09:24,159
listă, dar ne vom concentra pe câteva

3192
02:09:22,159 --> 02:09:26,800
opțiuni. Aceste ID-uri sunt concepute pentru

3193
02:09:24,159 --> 02:09:29,440
te ajută cu adevărat să scrii Python. Ei

3194
02:09:26,800 --> 02:09:31,440
oferă multe instrumente în fundal

3195
02:09:29,440 --> 02:09:33,599
care îți fac viața mai ușoară când ești

3196
02:09:31,440 --> 02:09:36,320
lucrul cu Python. Deci, de exemplu,

3197
02:09:33,599 --> 02:09:38,800
ele pot oferi evidențierea sintaxei.

3198
02:09:36,320 --> 02:09:41,679
Ei vă pot spune când aveți o sintaxă

3199
02:09:38,800 --> 02:09:43,280
eroare. Aproape ca o verificare ortografică pentru

3200
02:09:41,679 --> 02:09:45,520
Python.

3201
02:09:43,280 --> 02:09:48,639
Ei te pot ajuta să rulezi cod Python

3202
02:09:45,520 --> 02:09:50,960
chiar în fereastră. Ei pot

3203
02:09:48,639 --> 02:09:53,199
vă ajută să vă organizați proiectele. Uh,

3204
02:09:50,960 --> 02:09:55,840
pot face o mulțime de lucruri diferite.

3205
02:09:53,199 --> 02:09:58,079
Hm, și deci există multe instrumente acolo

3206
02:09:55,840 --> 02:10:00,400
asta o poate face, și este într-adevăr un

3207
02:09:58,079 --> 02:10:02,320
preferința personală pe care o folosiți,

3208
02:10:00,400 --> 02:10:05,199
dar în acest program, chiar mergem

3209
02:10:02,320 --> 02:10:06,639
să se concentreze asupra câtorva dintre ele să se prezinte

3210
02:10:05,199 --> 02:10:11,119
acele opțiuni pentru că sunt foarte

3211
02:10:06,639 --> 02:10:13,280
opțiuni populare. Um, și apoi, uh, permite

3212
02:10:11,119 --> 02:10:15,599
voi, băieți, flexibilitatea de a alege care

3213
02:10:13,280 --> 02:10:19,199
opțiunea are cea mai bună sens pentru tine. Deci,

3214
02:10:15,599 --> 02:10:20,719
în general, acesta va fi în mare parte un a

3215
02:10:19,199 --> 02:10:23,440
preferinta.

3216
02:10:20,719 --> 02:10:25,360
um mai ales o preferință cu privire la care

3217
02:10:23,440 --> 02:10:28,480
ești cel mai confortabil cu tine, dar eu

3218
02:10:25,360 --> 02:10:30,480
Vreau să vă dau opțiunea să uh

3219
02:10:28,480 --> 02:10:34,920
explora

3220
02:10:30,480 --> 02:10:34,920
diferitele opțiuni disponibile.

3221
02:10:36,639 --> 02:10:41,520
Roberto, există unul care iese în evidență

3222
02:10:38,400 --> 02:10:45,199
ca standard industrial? Hm, există o

3223
02:10:41,520 --> 02:10:48,239
cuplu pe care îl vezi ca sincer

3224
02:10:45,199 --> 02:10:50,560
două dintre ele pe care le vom studia

3225
02:10:48,239 --> 02:10:51,920
acest lucru va apărea în următoarele câteva diapozitive

3226
02:10:50,560 --> 02:10:54,960
sunt standardul industriei care sunt

3227
02:10:51,920 --> 02:11:00,000
va fi codul VS codul Microsoft VS

3228
02:10:54,960 --> 02:11:03,760
iar apoi caietele Jupyter. Deci ăștia doi

3229
02:11:00,000 --> 02:11:07,040
vor fi cei pe care le vom face

3230
02:11:03,760 --> 02:11:10,040
studiază în special și folosește pe tot parcursul.

3231
02:11:07,040 --> 02:11:10,040
Hm

3232
02:11:10,480 --> 02:11:16,480
așa că da, acestea vor fi industrie

3233
02:11:13,440 --> 02:11:18,400
standardele. PyCharm este, de asemenea, foarte popular.

3234
02:11:16,480 --> 02:11:21,199
Deci nu vreau să exclud PyCharm.

3235
02:11:18,400 --> 02:11:23,599
Cunosc o mulțime de oameni care îl folosesc. Deci um

3236
02:11:21,199 --> 02:11:25,760
V-aș încuraja să explorați PyCharm

3237
02:11:23,599 --> 02:11:28,719
la fel de bine dacă vrei, dar noi nu suntem

3238
02:11:25,760 --> 02:11:32,480
o să fac asta în aceste diapozitive

3239
02:11:28,719 --> 02:11:35,840
dar l-aș verifica și aș vedea dacă

3240
02:11:32,480 --> 02:11:37,679
iti place. Hm, este un altul care sunt

3241
02:11:35,840 --> 02:11:40,880
punând un asterisc lângă el pentru că

3242
02:11:37,679 --> 02:11:43,199
Cred că este una dintre cele mai populare

3243
02:11:40,880 --> 02:11:45,040
uh da uh da o să facem

3244
02:11:43,199 --> 02:11:48,159
descrieri.

3245
02:11:45,040 --> 02:11:49,920
um cerințe, uh, voi face tot posibilul

3246
02:11:48,159 --> 02:11:54,560
da-le, dar sincer cerințele

3247
02:11:49,920 --> 02:11:56,320
va fi dat când le instalați. Hm

3248
02:11:54,560 --> 02:11:58,079
deci celălalt lucru pe care vreau să-l spun este noi

3249
02:11:56,320 --> 02:12:00,639
va avea câteva opțiuni care nu

3250
02:11:58,079 --> 02:12:03,119
cere să instalați orice. Deci sunt

3251
02:12:00,639 --> 02:12:05,760
le va prezenta și pe acestea. Aşa

3252
02:12:03,119 --> 02:12:07,360
Există câteva opțiuni care suntem noi

3253
02:12:05,760 --> 02:12:09,920
nu va trebui să instaleze nimic pentru că

3254
02:12:07,360 --> 02:12:14,920
vor fi bazate pe cloud.

3255
02:12:09,920 --> 02:12:14,920
Bine, ți le arăt.

3256
02:12:16,639 --> 02:12:21,119
Bine. Deci, dar da, VS Code, cred că VS

3257
02:12:18,800 --> 02:12:23,599
Caietele cu cod și Jupyter sunt sunt

3258
02:12:21,119 --> 02:12:27,440
probabil cel mai mare standard al industriei

3259
02:12:23,599 --> 02:12:30,400
idei populare.

3260
02:12:27,440 --> 02:12:32,400
Bine. Deci, ceea ce am recomanda în

3261
02:12:30,400 --> 02:12:35,360
acest program și cele pe care le vom face

3262
02:12:32,400 --> 02:12:37,520
folosiți cel mai mult pe tot parcursul

3263
02:12:35,360 --> 02:12:40,960
fie aceştia trei. Visual Studio Code, de asemenea

3264
02:12:37,520 --> 02:12:43,760
cunoscut sub numele de VS Code, Jupyter Notebooks și

3265
02:12:40,960 --> 02:12:45,360
Google Collab, care este Google

3266
02:12:43,760 --> 02:12:48,719
găzduit

3267
02:12:45,360 --> 02:12:52,560
um versiunea găzduită de Google a notebook-urilor

3268
02:12:48,719 --> 02:12:54,960
în esență. Um asa

3269
02:12:52,560 --> 02:12:56,800
Voi prezenta fiecare dintre acestea și

3270
02:12:54,960 --> 02:12:59,679
dați câteva exemple despre cum să o setați

3271
02:12:56,800 --> 02:13:01,119
sus și exemple despre cum să lucrezi cu el.

3272
02:12:59,679 --> 02:13:03,440
Hm, și asta vom face peste

3273
02:13:01,119 --> 02:13:06,000
cursul următoarelor câteva diapozitive și

3274
02:13:03,440 --> 02:13:07,360
Următoarea perioadă de timp o să plec

3275
02:13:06,000 --> 02:13:08,800
prin fiecare dintre acestea și fel de

3276
02:13:07,360 --> 02:13:15,040
să-ți arate ce ar trebui să faci

3277
02:13:08,800 --> 02:13:18,320
pune-l la punct. Um, acum acestea fiind spuse,

3278
02:13:15,040 --> 02:13:20,880
scuză-mă, acestea două sunt cele pe care tu

3279
02:13:18,320 --> 02:13:23,599
se va instala.

3280
02:13:20,880 --> 02:13:26,560
Pe acestea două le-ați instala local

3281
02:13:23,599 --> 02:13:32,639
esti pe propria ta masina.

3282
02:13:26,560 --> 02:13:36,000
Și acesta este găzduit în cloud

3283
02:13:32,639 --> 02:13:40,400
de Google și este gratuit. Hm toate astea

3284
02:13:36,000 --> 02:13:42,000
sunt gratuite, dar primele două coduri VS

3285
02:13:40,400 --> 02:13:43,920
și notebook-ul Jupyter pe care l-ați instala

3286
02:13:42,000 --> 02:13:45,679
pe propria ta mașină. Colaborare ai face

3287
02:13:43,920 --> 02:13:47,599
accesați doar prin browserul dvs. web. Ea

3288
02:13:45,679 --> 02:13:48,639
este găzduit de Google. Deci asta este un

3289
02:13:47,599 --> 02:13:51,040
avantaj. Chiar nu ai nevoie

3290
02:13:48,639 --> 02:13:53,840
instala orice. Și din acest motiv um

3291
02:13:51,040 --> 02:13:55,920
uneori vom favoriza Collab. Uh și

3292
02:13:53,840 --> 02:13:57,599
si din alte motive. Colab are unele

3293
02:13:55,920 --> 02:14:03,679
caracteristici foarte bune dacă nu ați făcut-o niciodată

3294
02:13:57,599 --> 02:14:06,159
l-a folosit. Hm, dar caiete, um, Jupyter

3295
02:14:03,679 --> 02:14:08,320
Notebook și Colab sunt foarte asemănătoare.

3296
02:14:06,159 --> 02:14:11,920
Sunt foarte asemănătoare. Colab doar are

3297
02:14:08,320 --> 02:14:14,000
propriul său spin-off pe notebook, um,

3298
02:14:11,920 --> 02:14:16,719
tipul de fișier cu care funcționează Jupyter Notebooks

3299
02:14:14,000 --> 02:14:18,719
cu. Și este, așa cum am spus, un fel

3300
02:14:16,719 --> 02:14:21,520
cloud găzduit. Deci, mă duc la mă duc

3301
02:14:18,719 --> 02:14:24,079
să ne plimbe prin fiecare dintre acestea și

3302
02:14:21,520 --> 02:14:26,800
să-ți explice ce fac, ce fac

3303
02:14:24,079 --> 02:14:28,960
arăta, și apoi vom stabili

3304
02:14:26,800 --> 02:14:34,719
pe fiecare dintre ei uh cam într-un live

3305
02:14:28,960 --> 02:14:37,520
demo ca să vedeți. Hm, dar noi

3306
02:14:34,719 --> 02:14:39,280
pe tot parcursul programului, chiar va fi

3307
02:14:37,520 --> 02:14:41,679
depinde de tine care dintre acestea vrei

3308
02:14:39,280 --> 02:14:43,679
a folosi. Nu există nicio cerință dificilă

3309
02:14:41,679 --> 02:14:46,000
folosiți oricare dintre ele. Chiar merge

3310
02:14:43,679 --> 02:14:47,679
pentru a fi preferința dvs. care dintre acestea

3311
02:14:46,000 --> 02:14:49,679
instrumentele pe care doriți să le utilizați pentru a lucra

3312
02:14:47,679 --> 02:14:51,360
Python. Orice simți

3313
02:14:49,679 --> 02:14:53,280
să lucrezi confortabil, asta este

3314
02:14:51,360 --> 02:14:55,040
ar trebui să folosești.

3315
02:14:53,280 --> 02:14:56,960
Toate trei sunt foarte populare în

3316
02:14:55,040 --> 02:14:59,840
industria. Deci, nu ratați

3317
02:14:56,960 --> 02:15:02,560
prin folosirea unuia față de celălalt. um,

3318
02:14:59,840 --> 02:15:04,239
toate sunt foarte populare. Chiar și Colab, I

3319
02:15:02,560 --> 02:15:06,320
Știu că nu era pe ecran, dar este

3320
02:15:04,239 --> 02:15:09,320
utilizat pe scară largă în în comunitate și în

3321
02:15:06,320 --> 02:15:09,320
industrie.

3322
02:15:10,000 --> 02:15:13,840
Nu recomandări de sistem pentru

3323
02:15:11,679 --> 02:15:15,920
formarea LLM-urilor. Nu, pentru că noi nu

3324
02:15:13,840 --> 02:15:17,599
nu ne vom concentra cu adevărat asupra asta până când

3325
02:15:15,920 --> 02:15:21,360
sfârşitul. Când ajungem când intrăm în

3326
02:15:17,599 --> 02:15:22,880
AI generativ, vom vorbi despre asta.

3327
02:15:21,360 --> 02:15:26,199
Când intrăm în IA generativă, o vom face

3328
02:15:22,880 --> 02:15:26,199
vorbi despre asta.

3329
02:15:28,800 --> 02:15:33,040
Deci, da, nu suntem, nu ne concentrăm

3330
02:15:30,480 --> 02:15:36,719
pe LM la început. Asta este un

3331
02:15:33,040 --> 02:15:40,320
subiect avansat pentru noi.

3332
02:15:36,719 --> 02:15:43,520
Care este preferința mea personală? Hm, eu

3333
02:15:40,320 --> 02:15:45,599
precum Visual Studio Code. Um, personal

3334
02:15:43,520 --> 02:15:48,480
Eu asta e ceea ce folosesc pentru ziua mea de zi cu zi

3335
02:15:45,599 --> 02:15:50,800
munca este codul Visual Studio. imi place

3336
02:15:48,480 --> 02:15:54,480
Visual Studio Code și îmi place Collab a

3337
02:15:50,800 --> 02:15:56,159
lot. Așa că știi, vom vorbi despre

3338
02:15:54,480 --> 02:15:58,960
asta, dar unul dintre avantajele

3339
02:15:56,159 --> 02:16:02,079
Colaborarea este că are acces gratuit la

3340
02:15:58,960 --> 02:16:06,800
GPU, care este uriaș pentru a face lucruri

3341
02:16:02,079 --> 02:16:10,960
ca uh rețele neuronale. Hm, deci ne vom sprijini

3342
02:16:06,800 --> 02:16:15,599
în colaborare ceva mai târziu

3343
02:16:10,960 --> 02:16:17,360
uh mai târziu când ajungem de fapt la

3344
02:16:15,599 --> 02:16:20,000
învăţare profundă şi reţele neuronale. Vom face

3345
02:16:17,360 --> 02:16:22,560
deoarece colaborarea are acces gratuit la GPU-uri.

3346
02:16:20,000 --> 02:16:24,159
O să ne arăt asta. Este cu adevărat

3347
02:16:22,560 --> 02:16:25,520
frumos.

3348
02:16:24,159 --> 02:16:27,199
Și când faci ceva cu neural

3349
02:16:25,520 --> 02:16:30,719
plase, de obicei vă avantajează să aveți o

3350
02:16:27,199 --> 02:16:33,840
Acces GPU. Hm

3351
02:16:30,719 --> 02:16:36,399
deci va fi frumos. Dar de obicei o fac

3352
02:16:33,840 --> 02:16:40,760
majoritatea codurilor Python din VS Code. Ea

3353
02:16:36,399 --> 02:16:40,760
suportă destul de bine Python.

3354
02:16:42,960 --> 02:16:46,960
Ce este mai frecvent folosit în

3355
02:16:44,399 --> 02:16:49,280
industrie? um,

3356
02:16:46,960 --> 02:16:51,200
cele două cele mai populare sunt Visual Studio

3357
02:16:49,280 --> 02:16:52,960
Cod și și Caiete. Jupiter

3358
02:16:51,200 --> 02:16:54,880
caiete.

3359
02:16:52,960 --> 02:16:58,240
Amândoi parcă nu poți greși

3360
02:16:54,880 --> 02:17:01,120
cu oricare dintre ele.

3361
02:16:58,240 --> 02:17:02,639
Aceia

3362
02:17:01,120 --> 02:17:04,399
două sunt cu adevărat populare. Jupyter

3363
02:17:02,639 --> 02:17:07,519
notebook-urile și Visual Studio Code sunt

3364
02:17:04,399 --> 02:17:10,319
cu adevărat popular. Există amândoi

3365
02:17:07,519 --> 02:17:12,080
cei cu care ai fi bine. Oricum

3366
02:17:10,319 --> 02:17:13,599
unul.

3367
02:17:12,080 --> 02:17:18,479
Permiteți-mi să încep cu Visual Stu Studio

3368
02:17:13,599 --> 02:17:22,880
Cod. Deci, acum Visual Studio Code

3369
02:17:18,479 --> 02:17:25,359
este un editor de cod mai general. Deci, este

3370
02:17:22,880 --> 02:17:29,040
de fapt, puteți edita o mulțime de diferite

3371
02:17:25,359 --> 02:17:31,359
limbi din interiorul VS Code. Um, deci tu

3372
02:17:29,040 --> 02:17:35,519
ai putea face Java, ai putea face C, ai putea

3373
02:17:31,359 --> 02:17:37,439
face Scala, poți face Go, poți face totul

3374
02:17:35,519 --> 02:17:39,040
în interior sunt acceptate tipuri de limbi

3375
02:17:37,439 --> 02:17:41,519
a Codului Visual Studio. Deci este cu adevărat

3376
02:17:39,040 --> 02:17:44,719
produs fantastic pentru programare

3377
02:17:41,519 --> 02:17:47,679
general, nu doar Python. Hm, a avut

3378
02:17:44,719 --> 02:17:50,319
suport terminal încorporat. Are

3379
02:17:47,679 --> 02:17:53,519
copilot integrat în acesta, adică

3380
02:17:50,319 --> 02:17:55,760
frumos pentru AI, ca AI generativ

3381
02:17:53,519 --> 02:17:58,800
asistență pentru lucrul cu codul dvs., care

3382
02:17:55,760 --> 02:18:00,479
este frumos. Bineînțeles că suportă

3383
02:17:58,800 --> 02:18:04,160
Python, care este ceea ce ne interesează

3384
02:18:00,479 --> 02:18:06,479
in. Hm, are instrumente Python. eu

3385
02:18:04,160 --> 02:18:09,439
ne va arăta care ar trebui

3386
02:18:06,479 --> 02:18:11,439
instalați ca parte a VS Code, astfel încât noi

3387
02:18:09,439 --> 02:18:15,760
poate lucra cu fișiere Python și

3388
02:18:11,439 --> 02:18:17,760
caiete. Um, deci este chiar un

3389
02:18:15,760 --> 02:18:20,960
excelent editor de cod în general, care este

3390
02:18:17,760 --> 02:18:22,080
de ce îmi place să-l folosesc. Hm, dar în

3391
02:18:20,960 --> 02:18:24,399
în special, este destul de bun la lucru

3392
02:18:22,080 --> 02:18:28,000
cu Python. acesta acceptă Python

3393
02:18:24,399 --> 02:18:32,080
destul de profund. Așa și pentru asta

3394
02:18:28,000 --> 02:18:33,519
motiv pentru care codul VS este foarte popular.

3395
02:18:32,080 --> 02:18:35,359
Dar țineți minte că de fapt puteți

3396
02:18:33,519 --> 02:18:39,679
utilizați-l pentru multe tipuri diferite de cod

3397
02:18:35,359 --> 02:18:42,080
că uh că oamenii scriu uh JavaScript

3398
02:18:39,679 --> 02:18:43,920
um Java, așa cum am spus, ca multe limbi

3399
02:18:42,080 --> 02:18:46,319
sunt acceptate în interiorul Visual Studio

3400
02:18:43,920 --> 02:18:48,880
Cod. Deci este un cod mai general

3401
02:18:46,319 --> 02:18:52,719
editor. Se întâmplă să fie cu adevărat grozav la

3402
02:18:48,880 --> 02:18:53,920
lucrând cu Python totuși.

3403
02:18:52,719 --> 02:18:57,920
În regulă. Deci, am să ne arăt un

3404
02:18:53,920 --> 02:19:01,040
demonstrație despre configurarea VS Code. Acum, suntem

3405
02:18:57,920 --> 02:19:03,280
va face asta pentru fiecare dintre acestea.

3406
02:19:01,040 --> 02:19:07,040
Pentru Jupiter și pentru Collab, o voi face

3407
02:19:03,280 --> 02:19:09,120
O să fac demonstrații similare. Deci, um

3408
02:19:07,040 --> 02:19:11,120
nu-ți face griji, vom ajunge la acestea, dar eu

3409
02:19:09,120 --> 02:19:13,040
vreau să încep cu VS Code pentru a vă arăta

3410
02:19:11,120 --> 02:19:16,880
cum să se configureze și ce

3411
02:19:13,040 --> 02:19:19,120
se pare ca. Hm, deci unde poți găsi

3412
02:19:16,880 --> 02:19:23,200
acest demo

3413
02:19:19,120 --> 02:19:24,960
se află în demo-urile pe care le-am menționat

3414
02:19:23,200 --> 02:19:27,599
mai devreme în materialul de referinţă. Deci

3415
02:19:24,960 --> 02:19:31,559
Mă duc la o să sar peste

3416
02:19:27,599 --> 02:19:31,559
că. Lasă-mă să vă arăt băieți.

3417
02:19:32,559 --> 02:19:37,040
Așa că m-am întors în LMS. Voi o veți face

3418
02:19:35,280 --> 02:19:39,040
doriți să descărcați demo-urile. cred eu

3419
02:19:37,040 --> 02:19:40,399
cineva a legat-o mai devreme în cazul în care asta

3420
02:19:39,040 --> 02:19:42,080
nu a apărut pentru tine, dar mergem

3421
02:19:40,399 --> 02:19:45,679
să fim în demo și suntem

3422
02:19:42,080 --> 02:19:47,599
voi face o demonstrație pentru lecția unu. Noi

3423
02:19:45,679 --> 02:19:51,359
face lecția unu, demo one, care merge

3424
02:19:47,599 --> 02:19:53,280
să fie demonstrația VS Code.

3425
02:19:51,359 --> 02:19:57,120
Deci, pașii principali pe care îi vom urma

3426
02:19:53,280 --> 02:19:59,920
do va fi doar să te îndrept spre

3427
02:19:57,120 --> 02:20:02,240
unde se instalează Visual Studio Code. Deci,

3428
02:19:59,920 --> 02:20:03,920
este o este o aplicație este gratuită

3429
02:20:02,240 --> 02:20:07,760
aplicație pe care o puteți instala pe dvs

3430
02:20:03,920 --> 02:20:10,479
mașină. Um, deci,

3431
02:20:07,760 --> 02:20:12,399
uh, veți dori să urmați acest link

3432
02:20:10,479 --> 02:20:14,080
care se află în fișierul demo, asta

3433
02:20:12,399 --> 02:20:16,399
code.vvisualstudio.com/d

3434
02:20:14,080 --> 02:20:17,840
descărcați și descărcați-l pentru dvs

3435
02:20:16,399 --> 02:20:20,640
o anumită platformă. Deci, dacă ești pe

3436
02:20:17,840 --> 02:20:24,880
Windows, evident, alegeți Windows.

3437
02:20:20,640 --> 02:20:27,520
Dacă sunteți pe un Mac, alegeți Mac și

3438
02:20:24,880 --> 02:20:28,960
asigurați-vă că alegeți corect, unul

3439
02:20:27,520 --> 02:20:30,720
dintre precauții este de a alege

3440
02:20:28,960 --> 02:20:34,399
platforma Mac corectă. Deci, dacă ai like

3441
02:20:30,720 --> 02:20:36,160
un Mac M1, 2, M3, M4, alege Apple

3442
02:20:34,399 --> 02:20:39,680
Siliciu

3443
02:20:36,160 --> 02:20:41,680
um buton. Dacă ești pe un Mac mai vechi, um

3444
02:20:39,680 --> 02:20:45,040
atunci veți dori să utilizați cipul Intel

3445
02:20:41,680 --> 02:20:47,359
unul. Hm

3446
02:20:45,040 --> 02:20:50,000
uh, dacă ești pe, dacă se întâmplă să fii pe

3447
02:20:47,359 --> 02:20:52,399
Linux, pe care probabil că nu îl cunosc cel mai mult

3448
02:20:50,000 --> 02:20:55,600
nu ești, dar dacă ești, vrei

3449
02:20:52,399 --> 02:20:57,359
pentru a descărca distribuția corectă uh

3450
02:20:55,600 --> 02:20:59,359
versiunea.

3451
02:20:57,359 --> 02:21:01,359
Dar, uh, urmați mai întâi acest link. Deci

3452
02:20:59,359 --> 02:21:03,280
asta e primul pas. Pas foarte usor.

3453
02:21:01,359 --> 02:21:06,640
Doar mergeți pe acel site, alegeți-vă dreapta

3454
02:21:03,280 --> 02:21:10,240
platformă și mergeți mai departe și descărcați

3455
02:21:06,640 --> 02:21:12,000
instalatorul. Și mai ales vom fi

3456
02:21:10,240 --> 02:21:15,840
mergând prin treptele din

3457
02:21:12,000 --> 02:21:18,399
instalator. Și apoi ne voi arăta

3458
02:21:15,840 --> 02:21:20,160
cum arată odată ce este instalat

3459
02:21:18,399 --> 02:21:21,680
și apoi vă arătați câteva în plus

3460
02:21:20,160 --> 02:21:23,920
pași care de fapt nu sunt menționați în

3461
02:21:21,680 --> 02:21:27,720
acest fișier care cred că merită făcut

3462
02:21:23,920 --> 02:21:27,720
pentru a te pune la punct.

3463
02:21:29,040 --> 02:21:34,160
Da, în continuare vom face Jupiter.

3464
02:21:31,600 --> 02:21:36,960
Da, vom acoperi

3465
02:21:34,160 --> 02:21:41,240
VS Code, Jupiter și Colab. eu merg

3466
02:21:36,960 --> 02:21:41,240
pentru a ne arăta exemple din toate acestea.

3467
02:21:46,960 --> 02:21:50,319
Bine, lasă-mă să vă întreb. Ați fost băieți

3468
02:21:48,479 --> 02:21:52,800
capabil să ajungă la pagina de descărcare și

3469
02:21:50,319 --> 02:21:56,000
începe descărcarea și instalarea

3470
02:21:52,800 --> 02:21:58,720
Cod VS?

3471
02:21:56,000 --> 02:22:02,520
capabil să facă asta.

3472
02:21:58,720 --> 02:22:02,520
Ceva probleme cu asta?

3473
02:22:05,280 --> 02:22:12,560
Bine. Da, este ca oricare

3474
02:22:08,960 --> 02:22:15,560
totuși iubesc, iubesc optimismul

3475
02:22:12,560 --> 02:22:15,560
încă.

3476
02:22:16,880 --> 02:22:20,399
Aveți deja pe amândouă

3477
02:22:18,399 --> 02:22:21,520
instalat. Bine. Da. Nu, dacă tu

3478
02:22:20,399 --> 02:22:23,760
l-am instalat deja, vreau să spun,

3479
02:22:21,520 --> 02:22:25,840
grozav. Îți voi arăta, dacă tu

3480
02:22:23,760 --> 02:22:29,600
au deja instalat VS Code, grozav.

3481
02:22:25,840 --> 02:22:31,520
Poți sta bine. Îți voi arăta a

3482
02:22:29,600 --> 02:22:34,479
câteva extensii pe care le veți dori

3483
02:22:31,520 --> 02:22:37,120
adăugați pentru suport Python

3484
02:22:34,479 --> 02:22:39,280
daca il ai deja instalat. eu voi

3485
02:22:37,120 --> 02:22:41,359
arată-ne cum îl poți folosi cu Python

3486
02:22:39,280 --> 02:22:44,359
în special.

3487
02:22:41,359 --> 02:22:44,359
Bine.

3488
02:22:44,479 --> 02:22:47,439
Dacă îl aveți deja instalat,

3489
02:22:45,760 --> 02:22:50,439
perfect. Se pare că o ai

3490
02:22:47,439 --> 02:22:50,439
lansat.

3491
02:22:51,040 --> 02:22:57,920
Încă lucrez la el. Bine. Deci, acestea

3492
02:22:54,000 --> 02:22:59,439
aceste instrucțiuni arată un exemplu

3493
02:22:57,920 --> 02:23:03,600
de cineva care ar fi pe un Microsoft

3494
02:22:59,439 --> 02:23:06,600
platforma um mers prin

3495
02:23:03,600 --> 02:23:06,600
instalare.

3496
02:23:07,040 --> 02:23:11,920
Dacă ești pe Windows, probabil că

3497
02:23:10,080 --> 02:23:16,040
doriți să creați o pictogramă pe desktop. tu

3498
02:23:11,920 --> 02:23:16,040
cu siguranță vrei să-l adaugi în calea ta.

3499
02:23:21,840 --> 02:23:24,720
Și asta arată doar ce este

3500
02:23:23,280 --> 02:23:27,600
instalat. Deci asta este tot instalarea

3501
02:23:24,720 --> 02:23:30,880
expert pe Windows. Nimic atât de interesant

3502
02:23:27,600 --> 02:23:32,399
acolo. Deci asta dacă urmați toate acestea

3503
02:23:30,880 --> 02:23:34,800
pași, îl veți avea instalat. eu

3504
02:23:32,399 --> 02:23:37,680
sper că aveți suficient spațiu pe disc. Uh eu

3505
02:23:34,800 --> 02:23:39,520
sa nu crezi ca e prea mare.

3506
02:23:37,680 --> 02:23:40,960
Nu cred că este prea masiv. eu

3507
02:23:39,520 --> 02:23:44,439
uita de cât spațiu ia. Eu nu

3508
02:23:40,960 --> 02:23:44,439
cred că este atât de mult.

3509
02:23:45,520 --> 02:23:51,439
Nu cred că este atât de mult. Dar um

3510
02:23:47,920 --> 02:23:54,800
da, sper sa ai destul.

3511
02:23:51,439 --> 02:23:57,439
Deci, dacă nu o faci

3512
02:23:54,800 --> 02:23:59,760
uh, dacă nu aveți suficient spațiu pe disc

3513
02:23:57,439 --> 02:24:01,439
nu-ți face griji pentru că o să facem

3514
02:23:59,760 --> 02:24:03,439
colaborare care nu are nevoie de tine

3515
02:24:01,439 --> 02:24:06,800
instalând orice. Deci poți întotdeauna

3516
02:24:03,439 --> 02:24:08,800
utilizați acea opțiune. În regulă. Deci dacă dacă pentru

3517
02:24:06,800 --> 02:24:10,720
unii mă lasă-mă să spun și asta

3518
02:24:08,800 --> 02:24:13,600
chiar dacă dacă nu este o problemă de distanță dacă

3519
02:24:10,720 --> 02:24:16,720
aveți o problemă de instalare

3520
02:24:13,600 --> 02:24:18,640
nu vă faceți griji pentru că vom lucra cu

3521
02:24:16,720 --> 02:24:20,240
colaborare și Google care va fi

3522
02:24:18,640 --> 02:24:22,800
cloud găzduit de care nu aveți nevoie

3523
02:24:20,240 --> 02:24:24,720
instalați orice aveți nevoie doar de un Google

3524
02:24:22,800 --> 02:24:27,600
cont

3525
02:24:24,720 --> 02:24:30,640
bine un cont Google gratuit

3526
02:24:27,600 --> 02:24:33,760
deci nu-ți face griji dacă nu poți

3527
02:24:30,640 --> 02:24:36,560
instalați oricare dintre aceste lucruri

3528
02:24:33,760 --> 02:24:41,000
care vor fi Jupiter și

3529
02:24:36,560 --> 02:24:41,000
Jupiter și VS Code.

3530
02:24:41,040 --> 02:24:44,560
Unde mergem? Nu am spus încă. Ea

3531
02:24:42,960 --> 02:24:46,399
doar că mă asigur că este instalat

3532
02:24:44,560 --> 02:24:47,760
pentru oameni buni.

3533
02:24:46,399 --> 02:24:50,160
Mă duc să trec la asta

3534
02:24:47,760 --> 02:24:52,399
într-o secundă, dar am primit-o în general

3535
02:24:50,160 --> 02:24:55,040
instalat si il ai deschis? Deci,

3536
02:24:52,399 --> 02:24:57,680
dacă odată ce l-ai instalat,

3537
02:24:55,040 --> 02:25:00,680
uh, odată ce l-ați instalat, apoi deschideți

3538
02:24:57,680 --> 02:25:00,680
ea.

3539
02:25:04,800 --> 02:25:09,280
Da, trebuie să-l instalezi. Uh,

3540
02:25:07,520 --> 02:25:12,760
ar trebui să fie asta primul. Ar trebui să fie

3541
02:25:09,280 --> 02:25:12,760
acest link aici.

3542
02:25:13,040 --> 02:25:17,399
Urmați acest link pentru a-l instala.

3543
02:25:20,080 --> 02:25:24,680
Hopa, am inserat linkul greșit.

3544
02:25:37,680 --> 02:25:41,359
Lasă-mă să găsesc că o să copiez și să lipesc

3545
02:25:39,439 --> 02:25:44,160
link. Dar da, ia-ți un moment

3546
02:25:41,359 --> 02:25:47,399
deschide-l. Odată ce l-ai deschis, doar

3547
02:25:44,160 --> 02:25:47,399
stai bine

3548
02:25:47,840 --> 02:25:53,880
dacă vrei.

3549
02:25:50,319 --> 02:25:53,880
Ce spune?

3550
02:25:54,880 --> 02:26:00,800
Da, simte. Deci, pentru voi băieți care vedeți

3551
02:25:57,280 --> 02:26:03,439
caracteristici de copilot, um,

3552
02:26:00,800 --> 02:26:06,160
faceți clic pe folosiți funcțiile AI. cred eu

3553
02:26:03,439 --> 02:26:09,280
e în regulă. Da. Hm, o vei face

3554
02:26:06,160 --> 02:26:14,040
probabil vreau copilot. Da.

3555
02:26:09,280 --> 02:26:14,040
Faceți clic pe OK pe asta.

3556
02:26:17,439 --> 02:26:21,359
Acesta este linkul, apropo, pentru

3557
02:26:19,280 --> 02:26:26,560
descărcare

3558
02:26:21,359 --> 02:26:26,560
în cazul în care trebuia să ajungem la el.

3559
02:26:30,319 --> 02:26:36,160
Bine.

3560
02:26:32,720 --> 02:26:38,880
Deci, voi trece la VS Code

3561
02:26:36,160 --> 02:26:41,880
și să-ți arăt cum arată pe uh my

3562
02:26:38,880 --> 02:26:41,880
sfârşitul.

3563
02:26:43,439 --> 02:26:47,920
Bine. Deci, ar trebui să ai ceva care

3564
02:26:44,800 --> 02:26:49,840
arata cam asa. nu am

3565
02:26:47,920 --> 02:26:52,080
orice deschis. Nu am niciun fișier

3566
02:26:49,840 --> 02:26:55,760
deschis. Uh doar am un fel de gol

3567
02:26:52,080 --> 02:26:58,399
ecran aici. Hm, dar dacă ai face-o

3568
02:26:55,760 --> 02:27:01,359
recomandăm să folosiți funcțiile AI dacă

3569
02:26:58,399 --> 02:27:04,560
poti. Hm, cred că asta va intra

3570
02:27:01,359 --> 02:27:07,200
la îndemână mai târziu.

3571
02:27:04,560 --> 02:27:09,840
Hm, suntem

3572
02:27:07,200 --> 02:27:11,920
confortabil uh să mergi înainte? vreau

3573
02:27:09,840 --> 02:27:14,880
arata-ne extensiile care suporta

3574
02:27:11,920 --> 02:27:18,560
Python. Deci, chiar acum, când ești prima dată

3575
02:27:14,880 --> 02:27:20,640
când instalați pentru prima dată acest lucru, nu o face

3576
02:27:18,560 --> 02:27:23,040
lucrați cu Python din cutie. Avem

3577
02:27:20,640 --> 02:27:25,200
pentru a instala câteva extensii în interiorul

3578
02:27:23,040 --> 02:27:29,160
aici pentru a-l face să funcționeze cu Python. eu sunt

3579
02:27:25,200 --> 02:27:29,160
ne va arăta cum să facem asta.

3580
02:27:30,720 --> 02:27:34,640
Nu vă faceți griji cu privire la reglarea niciunei setări.

3581
02:27:32,880 --> 02:27:37,120
Nu, nu-ți face griji că faci nimic din toate astea

3582
02:27:34,640 --> 02:27:40,160
în această etapă. Nu trebuie neapărat să acordați

3583
02:27:37,120 --> 02:27:43,160
orice. Trebuie doar să luăm Python

3584
02:27:40,160 --> 02:27:43,160
sprijin.

3585
02:27:47,840 --> 02:27:54,439
Bine.

3586
02:27:49,439 --> 02:27:54,439
Deci, băieți, sunteți alături de mine pe această pagină principală?

3587
02:27:58,880 --> 02:28:02,560
Puteți folosi compania dvs. Sigur. Sigur.

3588
02:28:00,560 --> 02:28:04,000
Da, poți dacă o ai. Dacă tu

3589
02:28:02,560 --> 02:28:05,280
aveți copilot și doriți să vă folosiți

3590
02:28:04,000 --> 02:28:08,080
corporative, puteți folosi asta. Asta e

3591
02:28:05,280 --> 02:28:09,439
amenda.

3592
02:28:08,080 --> 02:28:12,399
Dar voi sunteți cu mine în principal

3593
02:28:09,439 --> 02:28:14,240
pagina pentru că sunt pe cale să ne arăt eu

3594
02:28:12,399 --> 02:28:17,680
pe cale să ne arate extensiile de care avem nevoie

3595
02:28:14,240 --> 02:28:20,319
pentru a instala pentru a lucra cu Python.

3596
02:28:17,680 --> 02:28:25,479
Bine, foarte important pentru că asta

3597
02:28:20,319 --> 02:28:25,479
nu este asta nu este în documentație.

3598
02:28:34,880 --> 02:28:41,760
Nu, nu este nevoie să reinstalezi. Um, tu

3599
02:28:39,120 --> 02:28:43,760
pot să-ți arăt cum să adaugi asta

3600
02:28:41,760 --> 02:28:46,240
prin extensii. Nu e nevoie

3601
02:28:43,760 --> 02:28:51,640
reinstala.

3602
02:28:46,240 --> 02:28:51,640
Îl puteți adăuga ca extensie. Da.

3603
02:28:52,479 --> 02:28:58,240
Bine.

3604
02:28:54,080 --> 02:29:01,720
Deci, permiteți-mi să vă întreb, băieți din stânga,

3605
02:28:58,240 --> 02:29:01,720
vezi

3606
02:29:01,920 --> 02:29:08,080
aceasta

3607
02:29:03,520 --> 02:29:11,960
pictogramă cutie mică pe care dacă treci cu mouse-ul peste

3608
02:29:08,080 --> 02:29:11,960
scrie extensii?

3609
02:29:12,000 --> 02:29:17,120
Vezi asta? tu. Pot fi altele

3610
02:29:14,160 --> 02:29:20,600
lucruri și aici, dar cel puțin acela

3611
02:29:17,120 --> 02:29:20,600
cu extensiile.

3612
02:29:26,160 --> 02:29:31,160
Bine, deci îl vedem pe acela. bine,

3613
02:29:32,800 --> 02:29:36,840
deci ce vrem sa facem,

3614
02:29:38,160 --> 02:29:42,560
nu, nu aș dezinstala.

3615
02:29:40,560 --> 02:29:45,120
E în regulă pentru că de fapt o vom face

3616
02:29:42,560 --> 02:29:46,960
instalați Anaconda pentru a obține Jupiter. eu

3617
02:29:45,120 --> 02:29:48,399
nu aș anula

3618
02:29:46,960 --> 02:29:51,359
că dacă poți pentru că o să faci

3619
02:29:48,399 --> 02:29:54,560
vreau asta și pentru Jupiter. eu

3620
02:29:51,359 --> 02:29:56,080
nu ar dezinstala Anaconda.

3621
02:29:54,560 --> 02:29:57,439
Nu as dezinstala. Dar vreau să spun, dacă

3622
02:29:56,080 --> 02:29:59,280
deja merge dacă merge deja

3623
02:29:57,439 --> 02:30:01,520
asta, e în regulă. Îl vom reinstala

3624
02:29:59,280 --> 02:30:03,120
mai târziu. În regulă. Deci, înapoi la

3625
02:30:01,520 --> 02:30:06,120
extensii. Deci, să facem clic pe

3626
02:30:03,120 --> 02:30:06,120
extensii.

3627
02:30:09,359 --> 02:30:16,439
Bine. Deci, vedem așa ceva

3628
02:30:11,760 --> 02:30:16,439
care are o bară de căutare pentru extensii?

3629
02:30:16,479 --> 02:30:21,200
Vedem bara de căutare pentru

3630
02:30:18,319 --> 02:30:23,520
extensii?

3631
02:30:21,200 --> 02:30:26,479
Bine. Ce crezi? Vom merge

3632
02:30:23,520 --> 02:30:28,960
cauta

3633
02:30:26,479 --> 02:30:30,720
Python.

3634
02:30:28,960 --> 02:30:33,520
Piton.

3635
02:30:30,720 --> 02:30:36,880
Vom căuta Python. Da.

3636
02:30:33,520 --> 02:30:39,200
Deci, veți dori să instalați

3637
02:30:36,880 --> 02:30:41,600
extensia oficială Python de la

3638
02:30:39,200 --> 02:30:45,439
Microsoft. Acesta este cel care are

3639
02:30:41,600 --> 02:30:49,120
bifa albastră de lângă Python.

3640
02:30:45,439 --> 02:30:50,800
Uh, deci acum sunt altele

3641
02:30:49,120 --> 02:30:53,040
aici,

3642
02:30:50,800 --> 02:30:55,439
dar o vrem doar pe cea care spune

3643
02:30:53,040 --> 02:30:57,760
Python

3644
02:30:55,439 --> 02:31:00,080
de la Microsoft. Vedem acea extensie

3645
02:30:57,760 --> 02:31:02,640
când tastați în Python? Vedem asta

3646
02:31:00,080 --> 02:31:05,280
unul?

3647
02:31:02,640 --> 02:31:07,600
Așa că ar trebui să spună doar Python. Ea

3648
02:31:05,280 --> 02:31:10,000
ar trebui să fie Microsoft.

3649
02:31:07,600 --> 02:31:13,120
Uh, este foarte popular. Are o mulțime de

3650
02:31:10,000 --> 02:31:15,359
descărcări. Peste 192 de milioane de descărcări ca

3651
02:31:13,120 --> 02:31:18,560
o extensie.

3652
02:31:15,359 --> 02:31:21,520
Este de la Microsoft.

3653
02:31:18,560 --> 02:31:24,080
Bine. Faceți clic pe asta.

3654
02:31:21,520 --> 02:31:26,319
Faceți clic pe asta.

3655
02:31:24,080 --> 02:31:28,000
Și apoi ar trebui să vedeți o instalare

3656
02:31:26,319 --> 02:31:29,760
butonul. Deja l-am instalat.

3657
02:31:28,000 --> 02:31:32,640
Deci scrie dezinstalat. Chiar aici, acolo

3658
02:31:29,760 --> 02:31:35,920
ar trebui să fie un buton de instalare. Instalați

3659
02:31:32,640 --> 02:31:39,760
Extensie Python.

3660
02:31:35,920 --> 02:31:43,560
Deci, din 192 de milioane de instalări,

3661
02:31:39,760 --> 02:31:43,560
extensie cu adevărat populară.

3662
02:31:44,080 --> 02:31:50,240
Sunteți capabili să-l instalați?

3663
02:31:47,680 --> 02:31:53,479
Vrei să instalezi asta? Ar trebui să fie

3664
02:31:50,240 --> 02:31:53,479
destul de repede.

3665
02:31:55,840 --> 02:32:01,720
Ar trebui să fie destul de rapid. Nu este asta

3666
02:31:57,359 --> 02:32:01,720
mare de extensie.

3667
02:32:02,960 --> 02:32:09,680
Deci, ceea ce face asta este

3668
02:32:07,520 --> 02:32:11,520
doar Python Sherry. Este doar o

3669
02:32:09,680 --> 02:32:14,000
Python unu. Dacă intri în

3670
02:32:11,520 --> 02:32:15,760
extensii și apoi căutați Python,

3671
02:32:14,000 --> 02:32:17,600
este doar acela. Este doar acesta

3672
02:32:15,760 --> 02:32:19,520
care spune Python și este de la

3673
02:32:17,600 --> 02:32:22,880
Microsoft.

3674
02:32:19,520 --> 02:32:25,600
Bifa albastră Python Microsoft.

3675
02:32:22,880 --> 02:32:27,520
Îl vrei pe acela.

3676
02:32:25,600 --> 02:32:31,560
Și apoi doriți să faceți clic pe acesta

3677
02:32:27,520 --> 02:32:31,560
și apoi apăsați instalarea.

3678
02:32:43,520 --> 02:32:49,080
Hm, Roberto, asta e pentru un copilot?

3679
02:32:51,200 --> 02:32:57,680
Este pentru un copilot? eu

3680
02:32:54,880 --> 02:32:59,920
Poate incearca sa-l inchizi si sa-l redeschizi.

3681
02:32:57,680 --> 02:33:03,640
Încercați să închideți VS Code, să redeschideți și

3682
02:32:59,920 --> 02:33:03,640
reîncercând instalarea.

3683
02:33:08,240 --> 02:33:12,160
Nu, nu deschidem niciun folder

3684
02:33:10,240 --> 02:33:14,399
chiar acum. Nu o deschidem. Suntem

3685
02:33:12,160 --> 02:33:15,840
doar instalând extensia.

3686
02:33:14,399 --> 02:33:18,640
Asta e tot. Tocmai instalăm

3687
02:33:15,840 --> 02:33:22,160
extensie.

3688
02:33:18,640 --> 02:33:25,920
Nu deschidem niciun folder de proiect.

3689
02:33:22,160 --> 02:33:30,280
doar instalând extensia.

3690
02:33:25,920 --> 02:33:30,280
Am putut să instalăm asta?

3691
02:33:46,880 --> 02:33:50,560
Știu că există multe de la Microsoft, dar

3692
02:33:48,560 --> 02:33:53,359
ar trebui să existe doar unul care să spună

3693
02:33:50,560 --> 02:33:53,359
Python.

3694
02:33:54,479 --> 02:33:59,840
Acolo. Așa că vezi cum este numele acesta

3695
02:33:57,120 --> 02:34:01,920
Numele este acest nume aici este o nădejde. Aceasta

3696
02:33:59,840 --> 02:34:04,720
numele este Python debugger. Acesta este

3697
02:34:01,920 --> 02:34:09,160
pilance.

3698
02:34:04,720 --> 02:34:09,160
Doar cea pe care scrie Python.

3699
02:34:10,479 --> 02:34:14,640
Doar acela.

3700
02:34:12,800 --> 02:34:17,880
Asta e cea pe care o dorim. Doar acela

3701
02:34:14,640 --> 02:34:17,880
chiar acum.

3702
02:34:19,439 --> 02:34:26,760
Bine. Perfect. Perfect.

3703
02:34:22,720 --> 02:34:26,760
Bine, grozav.

3704
02:34:29,840 --> 02:34:34,319
Bine, deci încă o extensie pentru tine

3705
02:34:32,000 --> 02:34:35,840
baieti. Așa că, odată ce îl instalezi, eu

3706
02:34:34,319 --> 02:34:38,399
mai ai unul pentru tine pe care ți-o dorești

3707
02:34:35,840 --> 02:34:41,439
instalați.

3708
02:34:38,399 --> 02:34:44,680
Suntem pregătiți pentru asta? Încă unul noi

3709
02:34:41,439 --> 02:34:44,680
doriți să instalați.

3710
02:34:45,920 --> 02:34:51,359
Bine, suntem pregătiți pentru următorul. Deci,

3711
02:34:48,800 --> 02:34:57,240
următorul pe care doriți să îl instalați

3712
02:34:51,359 --> 02:34:57,240
este extensia Jupiter,

3713
02:34:58,000 --> 02:35:03,200
care este Jupiter.

3714
02:35:01,600 --> 02:35:05,040
Acesta este. Este chiar primul

3715
02:35:03,200 --> 02:35:06,640
aici pe ecranul meu. Deci, se spune

3716
02:35:05,040 --> 02:35:10,359
Jupiter

3717
02:35:06,640 --> 02:35:10,359
și este de la Microsoft.

3718
02:35:11,520 --> 02:35:17,760
Bine, vrem să-l instalăm.

3719
02:35:14,720 --> 02:35:21,120
Jupiter și este de la Microsoft. vreau să

3720
02:35:17,760 --> 02:35:26,000
instaleaza-l pe acela.

3721
02:35:21,120 --> 02:35:29,760
Deci, acesta are 98 de milioane de instalări.

3722
02:35:26,000 --> 02:35:31,439
Doriți să îl instalați pe acesta.

3723
02:35:29,760 --> 02:35:34,960
L-ați găsit pe acela? Deci, vrei

3724
02:35:31,439 --> 02:35:39,920
să tastați Jupy

3725
02:35:34,960 --> 02:35:42,319
Ter și ar trebui să fie Jupiter

3726
02:35:39,920 --> 02:35:46,160
extensie aici

3727
02:35:42,319 --> 02:35:50,359
asta e de la Microsoft.

3728
02:35:46,160 --> 02:35:50,359
Deci vrei să-l instalezi.

3729
02:35:51,120 --> 02:35:55,920
Mare.

3730
02:35:53,200 --> 02:36:00,319
Acum ce face acesta? Aceasta

3731
02:35:55,920 --> 02:36:03,840
extensia vă va permite să lucrați cu

3732
02:36:00,319 --> 02:36:06,000
Notebook-uri Jupiter în interiorul VS Code dacă

3733
02:36:03,840 --> 02:36:10,080
vrei sa.

3734
02:36:06,000 --> 02:36:11,920
Deci, caietul tău Jupiter are propriul său

3735
02:36:10,080 --> 02:36:14,640
program independent pe care îl vom analiza

3736
02:36:11,920 --> 02:36:17,120
în continuare.

3737
02:36:14,640 --> 02:36:19,359
Dar le poți deschide, le poți avea

3738
02:36:17,120 --> 02:36:21,520
fișiere, acele fișiere de notebook Jupyter să fie

3739
02:36:19,359 --> 02:36:23,680
compatibil cu VS Code și deschideți-le

3740
02:36:21,520 --> 02:36:27,439
și editați-le și rulați-le în interiorul VS

3741
02:36:23,680 --> 02:36:29,040
Codați dacă doriți. Deci această extensie

3742
02:36:27,439 --> 02:36:31,280
vă oferă flexibilitatea de a lucra cu

3743
02:36:29,040 --> 02:36:32,720
notebook-uri în interiorul VS Code. Deci tu

3744
02:36:31,280 --> 02:36:35,920
nu trebuie să părăsiți niciodată VS Code dacă doriți

3745
02:36:32,720 --> 02:36:38,000
a lucra cu caiete. um,

3746
02:36:35,920 --> 02:36:39,439
deci aceasta este o extensie bună dacă

3747
02:36:38,000 --> 02:36:43,720
chiar vreau să lucrez cu notebook-uri și

3748
02:36:39,439 --> 02:36:43,720
rămâneți în interiorul VS Code.

3749
02:36:48,640 --> 02:36:53,520
Da. Uh când tu Da. Când instalați

3750
02:36:51,600 --> 02:36:55,439
instalați o extensie, s-ar putea

3751
02:36:53,520 --> 02:36:57,680
instalați o altă dependență

3752
02:36:55,439 --> 02:37:01,520
extensii. Da. Dar asta e în regulă. Aceia

3753
02:36:57,680 --> 02:37:05,640
sunt necesare. E în regulă.

3754
02:37:01,520 --> 02:37:05,640
Asta e în regulă.

3755
02:37:07,520 --> 02:37:12,240
În regulă. Cum ne simțim? Bun. A făcut

3756
02:37:09,920 --> 02:37:13,760
le instalăm?

3757
02:37:12,240 --> 02:37:16,240
Am făcut dacă am reușit să le obținem

3758
02:37:13,760 --> 02:37:20,240
instalat?

3759
02:37:16,240 --> 02:37:22,560
Bine, iată cum îl vom testa

3760
02:37:20,240 --> 02:37:25,760
toate au lucrat. Deci, o să facem

3761
02:37:22,560 --> 02:37:30,160
ceva cu adevărat simplu.

3762
02:37:25,760 --> 02:37:32,560
Iată cum vom testa dacă a funcționat.

3763
02:37:30,160 --> 02:37:35,560
Lasă-mă să plec de aici și să mă întorc la noi

3764
02:37:32,560 --> 02:37:35,560
fișiere.

3765
02:37:35,600 --> 02:37:39,280
Deci, din extensii, tocmai am plecat

3766
02:37:37,439 --> 02:37:46,160
la butonul de sus unde este micul

3767
02:37:39,280 --> 02:37:47,920
file um icon și um mă duc la

3768
02:37:46,160 --> 02:37:50,640
um

3769
02:37:47,920 --> 02:37:53,040
urcă până în vârf, unde este

3770
02:37:50,640 --> 02:37:55,680
așa că vedeți în fereastra voastră VS Code

3771
02:37:53,040 --> 02:38:00,479
unde scrie fișier, editare, selecție,

3772
02:37:55,680 --> 02:38:04,399
vedere. Am de gând să creez eu

3773
02:38:00,479 --> 02:38:07,800
Am de gând să creez un nou

3774
02:38:04,399 --> 02:38:07,800
fișier nou.

3775
02:38:08,000 --> 02:38:12,240
Deci, băieți, vedeți acolo unde sunteți?

3776
02:38:09,600 --> 02:38:17,240
spuneți vizualizarea selecției de editare a fișierului? Faceți clic pe

3777
02:38:12,240 --> 02:38:17,240
fișier și apoi faceți clic pe fișier nou.

3778
02:38:19,280 --> 02:38:24,280
Ar trebui să vezi ce văd pe acest ecran

3779
02:38:21,040 --> 02:38:24,280
chiar aici.

3780
02:38:25,760 --> 02:38:31,680
Dacă vezi

3781
02:38:28,960 --> 02:38:33,040
dacă vedeți caietul Python și Jupyter

3782
02:38:31,680 --> 02:38:34,560
atunci știi că acestea sunt instalate

3783
02:38:33,040 --> 02:38:36,960
corect.

3784
02:38:34,560 --> 02:38:40,920
Vedeți textul acestor opțiuni

3785
02:38:36,960 --> 02:38:40,920
Caietul Python și Jupyter?

3786
02:38:42,560 --> 02:38:47,120
Mare. Deci ceea ce înseamnă că putem

3787
02:38:44,880 --> 02:38:50,240
acum creați astfel de fișiere în

3788
02:38:47,120 --> 02:38:52,640
viitor. Putem crea caiete. poti

3789
02:38:50,240 --> 02:38:56,280
creați fișiere Python și VS Code va fi

3790
02:38:52,640 --> 02:38:56,280
capabil să lucreze cu acestea.

3791
02:38:57,520 --> 02:39:03,040
Dacă nu vedeți Python, înseamnă că dvs

3792
02:38:59,600 --> 02:39:04,960
Extensia Python nu s-a instalat încă sau

3793
02:39:03,040 --> 02:39:08,000
nu l-ai instalat. Deci, vrei

3794
02:39:04,960 --> 02:39:09,840
întoarce-te la tine vrei să te întorci la tine

3795
02:39:08,000 --> 02:39:11,359
extensii și asigurați-vă că ați instalat

3796
02:39:09,840 --> 02:39:13,520
Python.

3797
02:39:11,359 --> 02:39:16,760
Deci, du-te la acest buton de aici,

3798
02:39:13,520 --> 02:39:16,760
extensiile,

3799
02:39:17,439 --> 02:39:21,399
tastați în Python,

3800
02:39:21,760 --> 02:39:27,000
și apoi asigurați-vă că instalați acest lucru

3801
02:39:23,520 --> 02:39:27,000
Extensie Python.

3802
02:39:29,920 --> 02:39:35,200
Bine. Deci, veți instala

3803
02:39:32,720 --> 02:39:39,800
Extensia Python și o veți face

3804
02:39:35,200 --> 02:39:39,800
instalați extensia Jupiter,

3805
02:39:40,160 --> 02:39:44,960
care este aceasta și instalați ambele

3806
02:39:42,960 --> 02:39:46,560
acelea.

3807
02:39:44,960 --> 02:39:48,160
Asigurați-vă că acestea sunt instalate. Dacă

3808
02:39:46,560 --> 02:39:51,120
sunt instalate și tu încă nu

3809
02:39:48,160 --> 02:39:53,359
vezi asta când te-ai dus să depună um nou

3810
02:39:51,120 --> 02:39:58,000
dosar,

3811
02:39:53,359 --> 02:40:02,080
dacă nu le vezi, atunci încearcă

3812
02:39:58,000 --> 02:40:04,880
ieșirea din VS Code și relansarea acestuia.

3813
02:40:02,080 --> 02:40:06,479
Bine? Încercați să părăsiți VS Code și să redeschideți

3814
02:40:04,880 --> 02:40:09,479
și să văd dacă poți face un nou

3815
02:40:06,479 --> 02:40:09,479
dosar.

3816
02:40:11,920 --> 02:40:19,520
Bine? Dar ar trebui să fie sub uh la

3817
02:40:14,720 --> 02:40:21,359
fișierul de sus și apoi fișierul nou

3818
02:40:19,520 --> 02:40:25,080
și atunci ar trebui să vedeți acele opțiuni

3819
02:40:21,359 --> 02:40:25,080
Python și Jupiter.

3820
02:40:25,280 --> 02:40:29,439
Odată ce ați instalat aceste extensii,

3821
02:40:26,880 --> 02:40:33,399
poate fi necesar să închideți VS Code și

3822
02:40:29,439 --> 02:40:33,399
redeschide-l ca să vezi asta.

3823
02:40:40,720 --> 02:40:44,720
Bine, perfect. după ce ai relansat.

3824
02:40:42,800 --> 02:40:47,760
Bine, perfect. Da, poate ai nevoie

3825
02:40:44,720 --> 02:40:51,240
relansați astfel încât să arate că poate

3826
02:40:47,760 --> 02:40:51,240
arata extensiile.

3827
02:40:51,439 --> 02:40:57,080
Da,

3828
02:40:54,080 --> 02:40:57,080
perfect.

3829
02:40:57,439 --> 02:41:02,160
Bine, perfect. Deci, asta este configurat pentru tine

3830
02:40:59,520 --> 02:41:05,600
baieti. Deci, perfect. Este pregătit pentru

3831
02:41:02,160 --> 02:41:07,280
voi băieți. Vom lucra cu el în

3832
02:41:05,600 --> 02:41:09,600
viitor, dar am vrut doar să mă asigur

3833
02:41:07,280 --> 02:41:12,000
a fost instalat și configurat. Odată ce începem

3834
02:41:09,600 --> 02:41:15,439
lucrând cu Python, vă voi arăta

3835
02:41:12,000 --> 02:41:19,640
baieti cum sa lucrez cu el. Hm dar

3836
02:41:15,439 --> 02:41:19,640
ma bucur ca a fost pus la punct deocamdata.

3837
02:41:23,120 --> 02:41:29,920
Ce problemă ai, Romero?

3838
02:41:28,160 --> 02:41:31,600
Nu se vede? Nu se vede

3839
02:41:29,920 --> 02:41:34,319
Python sau Jupiter pentru tine când o faci

3840
02:41:31,600 --> 02:41:37,600
înregistrează un fișier nou.

3841
02:41:34,319 --> 02:41:40,240
Nu le arată.

3842
02:41:37,600 --> 02:41:43,240
Poate fi necesar să părăsiți VS Code și să redeschideți

3843
02:41:40,240 --> 02:41:43,240
ea.

3844
02:41:48,800 --> 02:41:52,960
Tu uh Sil, da, poți să faci

3845
02:41:51,600 --> 02:41:56,240
unul. Nu vom face nimic cu

3846
02:41:52,960 --> 02:41:57,600
chiar acum.

3847
02:41:56,240 --> 02:42:02,600
Nu are de gând să nu faci

3848
02:41:57,600 --> 02:42:02,600
orice cu ea acum, dar um

3849
02:42:06,399 --> 02:42:14,319
este să te asiguri că o cauți

3850
02:42:08,240 --> 02:42:16,399
cu un Y. Este J U P Y T E R.

3851
02:42:14,319 --> 02:42:19,840
Trebuie să cauți. Trebuie să Deci când

3852
02:42:16,399 --> 02:42:23,200
te duci când dai clic pe extensie,

3853
02:42:19,840 --> 02:42:25,280
caută JUP

3854
02:42:23,200 --> 02:42:29,600
Y. Ar trebui să fie primul lucru care

3855
02:42:25,280 --> 02:42:33,880
apare cu Jupy Ter.

3856
02:42:29,600 --> 02:42:33,880
Acesta este Jupiter de la Microsoft.

3857
02:42:36,160 --> 02:42:41,680
Am nucleu Voi Deci, lasă-mă să ne arăt

3858
02:42:39,120 --> 02:42:43,840
ne arăt asta mai târziu. Miezul tu

3859
02:42:41,680 --> 02:42:46,240
trebuie să ai un Python

3860
02:42:43,840 --> 02:42:48,399
interpret.

3861
02:42:46,240 --> 02:42:50,720
Deci, poate fi necesar să instalați un Python

3862
02:42:48,399 --> 02:42:54,080
interpret pentru a putea rula

3863
02:42:50,720 --> 02:42:55,600
miez. Deci, trebuie să ne arăt asta. um,

3864
02:42:54,080 --> 02:42:58,840
dar eu nu vreau să intru în asta

3865
02:42:55,600 --> 02:42:58,840
chiar acum.

3866
02:43:02,479 --> 02:43:06,120
Salvează ce să

3867
02:43:10,960 --> 02:43:15,520
Oh, oriunde vrei tu. Oriunde vrei tu

3868
02:43:13,040 --> 02:43:17,120
pe propria ta mașină. Depinde de tine. Ea

3869
02:43:15,520 --> 02:43:20,120
chiar nu conteaza. Doar oriunde ai tu

3870
02:43:17,120 --> 02:43:20,120
vreau.

3871
02:43:26,640 --> 02:43:33,920
Nu contează. Depinde de tine.

3872
02:43:29,840 --> 02:43:36,880
În regulă. Deci, ceea ce vreau să fac este eu

3873
02:43:33,920 --> 02:43:39,120
vreau să iau o pauză. Hm pentru că acum,

3874
02:43:36,880 --> 02:43:43,680
Știi, am spus după două ore, vom face

3875
02:43:39,120 --> 02:43:47,200
ia o pauză mai lungă. Ei bine, o vom face acum

3876
02:43:43,680 --> 02:43:49,680
vom face o pauză de 10 minute. Acum, dacă

3877
02:43:47,200 --> 02:43:51,920
încă mai ai probleme, um noi

3878
02:43:49,680 --> 02:43:54,880
pot încerca să vă configureze la sfârșitul

3879
02:43:51,920 --> 02:43:56,720
clasa. Hm, dar ne vom instala.

3880
02:43:54,880 --> 02:43:57,920
Deci, venind după pauză, suntem

3881
02:43:56,720 --> 02:44:00,080
va face o pauză de 10 minute. Vine

3882
02:43:57,920 --> 02:44:03,120
sus după aceea, vom merge și

3883
02:44:00,080 --> 02:44:05,439
instalați Jupyter Notebook. Și apoi după

3884
02:44:03,120 --> 02:44:07,040
asta, ne vom uita la Collab. Deci, ești

3885
02:44:05,439 --> 02:44:09,040
va avea mai multe opțiuni de rulat

3886
02:44:07,040 --> 02:44:11,520
Python. Nu așa, dacă asta nu a funcționat

3887
02:44:09,040 --> 02:44:13,359
pentru tine, e în regulă. Vom încerca o

3888
02:44:11,520 --> 02:44:16,399
traseu diferit.

3889
02:44:13,359 --> 02:44:18,640
Bine? Voi încerca un alt traseu. Hm eu

3890
02:44:16,399 --> 02:44:21,760
Știu că Colab va funcționa pentru tine pentru că

3891
02:44:18,640 --> 02:44:23,520
care este găzduit de Google și foarte ușor

3892
02:44:21,760 --> 02:44:25,840
pentru a începe lucrul cu. Deci în cel mai rău caz

3893
02:44:23,520 --> 02:44:28,399
scenariu de caz, Colab va funcționa pentru dvs.

3894
02:44:25,840 --> 02:44:30,240
Știu. Hm, dar vom încerca să ajungem

3895
02:44:28,399 --> 02:44:31,439
Jupyter Notebooks instalat pentru tine ca

3896
02:44:30,240 --> 02:44:33,520
bine. Dar dacă ai probleme cu

3897
02:44:31,439 --> 02:44:35,920
VS Code, anunțați-mă la sfârșitul

3898
02:44:33,520 --> 02:44:37,439
clasa. Vom încerca să vă punem la punct,

3899
02:44:35,920 --> 02:44:41,399
bine?

3900
02:44:37,439 --> 02:44:41,399
Încă mai ai probleme cu el.

3901
02:44:42,560 --> 02:44:48,279
Dar ce vom face acum

3902
02:44:43,920 --> 02:44:48,279
este să ia o pauză de 10 minute.

3903
02:44:48,479 --> 02:44:56,560
Așa că hai să încercăm să ne întoarcem

3904
02:44:52,720 --> 02:45:00,600
10 minute. Să-i spunem un um par

3905
02:44:56,560 --> 02:45:00,600
să-i spunem un par

3906
02:45:01,359 --> 02:45:05,439
ce vom acoperi? Hm

3907
02:45:03,200 --> 02:45:07,920
instalarea celuilalt instalarea

3908
02:45:05,439 --> 02:45:10,080
alte configurații Python. Deci Jupyter

3909
02:45:07,920 --> 02:45:11,600
notebook și lucrul cu colab. Şi

3910
02:45:10,080 --> 02:45:13,600
apoi vom intra în elementele de bază ale

3911
02:45:11,600 --> 02:45:16,640
Python este sintaxa. Deci vom merge

3912
02:45:13,600 --> 02:45:18,640
vorbim despre indentare, identificatori, um

3913
02:45:16,640 --> 02:45:20,720
poate dacă avem timp, variabilă de bază

3914
02:45:18,640 --> 02:45:22,560
tipuri, tipuri de date. Da. Deci vom primi

3915
02:45:20,720 --> 02:45:25,439
în Python.

3916
02:45:22,560 --> 02:45:28,399
Vom intra în Python astăzi.

3917
02:45:25,439 --> 02:45:32,240
În regulă. Deci, să sărim peste

3918
02:45:28,399 --> 02:45:35,200
caiete Jupiter. Deci ce e așa

3919
02:45:32,240 --> 02:45:39,920
special despre Jupiter?

3920
02:45:35,200 --> 02:45:42,080
Ei bine, se pare că Jupiter este un

3921
02:45:39,920 --> 02:45:44,160
platformă pentru rularea a ceea ce se numesc

3922
02:45:42,080 --> 02:45:46,399
fisiere de notebook. Deci, evident, doar

3923
02:45:44,160 --> 02:45:48,479
instalat extensia Jupiter în VS

3924
02:45:46,399 --> 02:45:52,160
Cod care ne va permite să rulăm

3925
02:45:48,479 --> 02:45:54,479
notebook-uri în codul VS, dar Jupiter are

3926
02:45:52,160 --> 02:45:58,720
propria platformă de notebook și asta este

3927
02:45:54,479 --> 02:46:01,760
veți instala în această setare. um,

3928
02:45:58,720 --> 02:46:06,240
caietele sunt speciale. Ei sunt um

3929
02:46:01,760 --> 02:46:09,200
foarte grozav um fișierele de cod Python care

3930
02:46:06,240 --> 02:46:13,040
dă-ne capacitatea de a executa izolat

3931
02:46:09,200 --> 02:46:16,240
ceea ce se numește celule de cod. Deci putem

3932
02:46:13,040 --> 02:46:19,040
rulați câte o celulă și testați și

3933
02:46:16,240 --> 02:46:21,120
depanați execuția acelei celule unice

3934
02:46:19,040 --> 02:46:26,319
fără a afecta nici unul din celălalt

3935
02:46:21,120 --> 02:46:29,040
celule. Deci, um, caietele sunt grozave pentru,

3936
02:46:26,319 --> 02:46:31,439
uh, rulează cod live și interactiv.

3937
02:46:29,040 --> 02:46:33,520
Când facem multe demo-uri în asta

3938
02:46:31,439 --> 02:46:36,319
program, vor intra cu toții

3939
02:46:33,520 --> 02:46:41,439
caiete. Um, ca să putem cam

3940
02:46:36,319 --> 02:46:42,960
rulați lucrurile câte o celulă. um,

3941
02:46:41,439 --> 02:46:45,760
uh,

3942
02:46:42,960 --> 02:46:49,439
nu. Deci fără caiete fie ai

3943
02:46:45,760 --> 02:46:54,000
pentru a rula rulați ca un script Python, cum ar fi

3944
02:46:49,439 --> 02:46:55,600
un fișier Python um care este un fișier py și

3945
02:46:54,000 --> 02:46:58,720
de obicei, trebuie fie să rulezi asta

3946
02:46:55,600 --> 02:47:01,120
printr-un depanator sau rulați întregul

3947
02:46:58,720 --> 02:47:03,840
scenariu deodată. Nu prea înțelegi

3948
02:47:01,120 --> 02:47:06,240
cod izolat în celule individuale

3949
02:47:03,840 --> 02:47:08,160
ceea ce este foarte frumos cu caiete. The

3950
02:47:06,240 --> 02:47:10,160
alt lucru este caietele sunt ușor

3951
02:47:08,160 --> 02:47:12,240
partajabil.

3952
02:47:10,160 --> 02:47:13,920
Deci, puteți partaja un caiet cu

3953
02:47:12,240 --> 02:47:16,000
altcineva și îl pot deschide și

3954
02:47:13,920 --> 02:47:17,600
vedeți toate intrările și ieșirile dvs. în

3955
02:47:16,000 --> 02:47:20,640
caietul care este foarte frumos ca

3956
02:47:17,600 --> 02:47:25,279
toate ieșirile sunt salvate în

3957
02:47:20,640 --> 02:47:28,160
caietul. Hm, ceea ce este frumos. Deci și

3958
02:47:25,279 --> 02:47:30,240
caiete mai ales în Jupiter

3959
02:47:28,160 --> 02:47:32,720
platforma va avea toate datele

3960
02:47:30,240 --> 02:47:34,640
bibliotecile științifice la îndemâna lor. Deci,

3961
02:47:32,720 --> 02:47:38,319
uh, dacă ești, oamenilor le place de obicei să facă

3962
02:47:34,640 --> 02:47:40,319
caiete pentru lucrul cu date, um,

3963
02:47:38,319 --> 02:47:42,080
foarte ușor de lucrat cu date din interior

3964
02:47:40,319 --> 02:47:45,840
caiete și și construi lucruri precum

3965
02:47:42,080 --> 02:47:48,800
parcele. Puteți afișa dvs.,

3966
02:47:45,840 --> 02:47:50,640
Uh, vă puteți afișa graficele cu adevărat

3967
02:47:48,800 --> 02:47:52,399
cu ușurință în interiorul caietului și apoi

3968
02:47:50,640 --> 02:47:55,279
partajați caietul dvs. pentru ca și alți oameni să poată

3969
02:47:52,399 --> 02:47:57,200
vezi graficele tale. Um, așa sunt caietele

3970
02:47:55,279 --> 02:48:01,600
cu adevărat minunat ca interactiv

3971
02:47:57,200 --> 02:48:04,720
medii pentru rularea codului. Hm și noi

3972
02:48:01,600 --> 02:48:06,080
va favoriza caietele noastre ca principale

3973
02:48:04,720 --> 02:48:08,640
mod de a rula codul pe tot parcursul

3974
02:48:06,080 --> 02:48:11,120
program. Acum, unde le deschideți

3975
02:48:08,640 --> 02:48:12,880
caietele depinde de tine. Puteți deschide

3976
02:48:11,120 --> 02:48:16,720
le în VS Code. Le poți deschide înăuntru

3977
02:48:12,880 --> 02:48:19,920
platforma de notebook-uri Jupyter. Uh

3978
02:48:16,720 --> 02:48:23,760
le poți deschide în interiorul Collab și

3979
02:48:19,920 --> 02:48:27,720
rulați notebook-uri în Collab. Uh caiete

3980
02:48:23,760 --> 02:48:27,720
sunt foarte foarte populare.

3981
02:48:28,399 --> 02:48:32,160
De ce nu rulează în notebook-uri

3982
02:48:29,920 --> 02:48:34,479
implicit? Este pentru că nu tot codul

3983
02:48:32,160 --> 02:48:36,080
rulează în interiorul celulelor. Ca aplicațiile

3984
02:48:34,479 --> 02:48:39,279
nu vor fi prea potrivite pentru

3985
02:48:36,080 --> 02:48:41,920
caiete. Ca și cum Instagram nu rulează

3986
02:48:39,279 --> 02:48:45,680
într-un caiet. E mai structurat

3987
02:48:41,920 --> 02:48:47,680
în fișiere Python reale și reale uh

3988
02:48:45,680 --> 02:48:51,680
programe mai structurate vor fi

3989
02:48:47,680 --> 02:48:55,600
nu într-un caiet. Notebook este mai mult pentru

3990
02:48:51,680 --> 02:48:58,080
prototipare și depanare și uh

3991
02:48:55,600 --> 02:49:00,080
executând bucăți mici de cod pentru a testa

3992
02:48:58,080 --> 02:49:03,600
ea afară. Nu este pentru a scrie mai mare

3993
02:49:00,080 --> 02:49:06,240
programe ca un like a

3994
02:49:03,600 --> 02:49:08,479
o aplicație LLM ca un chatbot

3995
02:49:06,240 --> 02:49:12,439
în general, nu într-un caiet. Ar fi

3996
02:49:08,479 --> 02:49:12,439
fi ca un fișier Python.

3997
02:49:15,040 --> 02:49:22,240
Uh celule versus obiecte de clasă. Deci celule

3998
02:49:17,600 --> 02:49:24,640
sunt doar mici, gândește-te la ei ca fiind mici

3999
02:49:22,240 --> 02:49:27,200
mici medii pentru a executa codul nostru.

4000
02:49:24,640 --> 02:49:29,200
Obiectele de clasă um sunt bucăți reale de

4001
02:49:27,200 --> 02:49:32,760
cod care definește un obiect. Ei sunt

4002
02:49:29,200 --> 02:49:32,760
sunt lucruri diferite.

4003
02:49:34,319 --> 02:49:38,319
Da, lucruri diferite. Vom facem

4004
02:49:35,760 --> 02:49:40,240
învață despre obiecte. Hm și vom face

4005
02:49:38,319 --> 02:49:41,120
cu siguranță vedem ce celule sunt pe măsură ce mergem

4006
02:49:40,240 --> 02:49:43,279
prin. Am de gând să-ți arăt un

4007
02:49:41,120 --> 02:49:45,200
exemplu de celulă care apare când noi

4008
02:49:43,279 --> 02:49:48,240
instalați Jupiter.

4009
02:49:45,200 --> 02:49:50,160
Dar hai să vorbim despre hai să mergem

4010
02:49:48,240 --> 02:49:52,560
prin instalarea lui Jupyter

4011
02:49:50,160 --> 02:49:54,720
caiet ca să poți vedea ce este un caiet

4012
02:49:52,560 --> 02:49:58,040
arata ca. Cred că asta va fi de ajutor

4013
02:49:54,720 --> 02:49:58,040
a se orienta.

4014
02:49:58,800 --> 02:50:04,399
Deci, să trecem la acel demo. Deci asta

4015
02:50:01,680 --> 02:50:09,120
va fi demo-ul doi

4016
02:50:04,399 --> 02:50:13,080
uh demonstrația doi în interiorul uh uh lecția unu.

4017
02:50:09,120 --> 02:50:13,080
Deci vom trece la asta.

4018
02:50:17,279 --> 02:50:20,720
Toată lumea o are pe asta. Bine, perfect.

4019
02:50:19,439 --> 02:50:22,479
Bine, deci vei urma asta

4020
02:50:20,720 --> 02:50:25,760
instrucție. Acum, la ce se întâmplă asta

4021
02:50:22,479 --> 02:50:27,680
a face este primul

4022
02:50:25,760 --> 02:50:29,600
um

4023
02:50:27,680 --> 02:50:31,040
Nu, asta nu a făcut asta nu va fi

4024
02:50:29,600 --> 02:50:32,479
orice are de-a face cu VS Code. Aceasta este

4025
02:50:31,040 --> 02:50:35,880
va fi o platformă diferită. Aceasta

4026
02:50:32,479 --> 02:50:35,880
va fi Jupiter.

4027
02:50:36,160 --> 02:50:41,600
Unde este asta? Acesta este

4028
02:50:38,960 --> 02:50:44,479
Acesta este demo-ul.

4029
02:50:41,600 --> 02:50:48,000
Acesta este demo-ul doi în cadrul acelui demo

4030
02:50:44,479 --> 02:50:52,560
dosar despre care am spus uh

4031
02:50:48,000 --> 02:50:56,040
pentru a lua toate demo-urile

4032
02:50:52,560 --> 02:50:56,040
din LMS-ul dvs.

4033
02:50:56,160 --> 02:51:01,439
Are cineva acel PDF demo 2

4034
02:50:59,680 --> 02:51:02,880
pot încărca? Cred că cineva

4035
02:51:01,439 --> 02:51:05,840
le-ai încărcat pe toate mai devreme, dar dacă tu

4036
02:51:02,880 --> 02:51:09,960
am două demonstrații, vreau să o încarc real

4037
02:51:05,840 --> 02:51:09,960
repede? Nu am PDF-urile.

4038
02:51:11,920 --> 02:51:18,880
dacă cineva vrea să împărtășească asta.

4039
02:51:15,439 --> 02:51:21,279
Deci sunt diferiți. Um VS Deci

4040
02:51:18,880 --> 02:51:23,680
ceea ce spuneam este că poți deschide

4041
02:51:21,279 --> 02:51:25,359
caietele din interiorul VS Code și

4042
02:51:23,680 --> 02:51:28,160
lucru care vă permite să deschideți caiete

4043
02:51:25,359 --> 02:51:29,439
în VS Code este extensia.

4044
02:51:28,160 --> 02:51:30,880
Deci da, dacă ai de gând să lucrezi cu

4045
02:51:29,439 --> 02:51:34,160
notebook-uri în VS Code, aveți nevoie de

4046
02:51:30,880 --> 02:51:37,359
extensia instalată. Dar poți folosi

4047
02:51:34,160 --> 02:51:40,160
platformă autonomă Jupiter

4048
02:51:37,359 --> 02:51:43,120
a lucra cu caiete. Depinde de tine.

4049
02:51:40,160 --> 02:51:45,359
Dacă vă place să utilizați VS Code,

4050
02:51:43,120 --> 02:51:48,880
um, dacă vă place să utilizați VS Code, puteți face

4051
02:51:45,359 --> 02:51:51,600
e asa. Dacă îți place Jupiterul

4052
02:51:48,880 --> 02:51:54,319
platformă, o poți face așa. Sale

4053
02:51:51,600 --> 02:51:57,200
depinde de tine. Este doar o preferință. Im

4054
02:51:54,319 --> 02:51:59,359
oferindu-vă opțiuni. Acesta este scopul meu

4055
02:51:57,200 --> 02:52:00,640
este să vă ofer opțiuni și să vă permit

4056
02:51:59,359 --> 02:52:03,520
alege ceea ce ești cel mai confortabil

4057
02:52:00,640 --> 02:52:03,520
cu.

4058
02:52:04,080 --> 02:52:08,960
Bine. Și suntem și ne luăm timp

4059
02:52:06,800 --> 02:52:10,560
fă asta acum la începutul

4060
02:52:08,960 --> 02:52:12,319
program, nu? Pentru că o să facem

4061
02:52:10,560 --> 02:52:15,359
face o mulțime de exemple Python care urmează

4062
02:52:12,319 --> 02:52:17,840
pe măsură ce începem să învățăm Python. Deci, este

4063
02:52:15,359 --> 02:52:21,120
este valoros să petreci acel timp acum. eu

4064
02:52:17,840 --> 02:52:22,720
Știu că poate părea puțin lent, dar eu

4065
02:52:21,120 --> 02:52:24,319
promite că va merita ca tu

4066
02:52:22,720 --> 02:52:27,880
băieții au opțiuni pentru a vă rula

4067
02:52:24,319 --> 02:52:27,880
rulează codul tău.

4068
02:52:29,040 --> 02:52:34,160
Da. Vă mulțumesc băieți pentru că le-ați încărcat.

4069
02:52:31,200 --> 02:52:38,080
apreciez-o. Acestea sunt demonstrațiile dvs

4070
02:52:34,160 --> 02:52:40,160
vreau să urmăresc împreună cu.

4071
02:52:38,080 --> 02:52:43,520
Bine, deci primul pas aici va fi

4072
02:52:40,160 --> 02:52:44,960
fie pentru a instala Anaconda. Acum, s-ar putea să fii

4073
02:52:43,520 --> 02:52:47,200
întrebându-mă, ce este Anaconda? m-am gândit

4074
02:52:44,960 --> 02:52:51,439
vorbeam despre Jupiter și

4075
02:52:47,200 --> 02:52:55,279
asta e o intrebare valabila. Anaconda este o

4076
02:52:51,439 --> 02:52:59,840
ceea ce se numește o distribuție a Python.

4077
02:52:55,279 --> 02:53:02,160
Deci Anaconda este un program un software a

4078
02:52:59,840 --> 02:53:05,840
colecţie de programe software care

4079
02:53:02,160 --> 02:53:08,080
vă oferă o versiune de Python cu a

4080
02:53:05,840 --> 02:53:11,359
grămadă de pachete

4081
02:53:08,080 --> 02:53:13,200
cu o grămadă de pachete deja

4082
02:53:11,359 --> 02:53:17,680
instalat.

4083
02:53:13,200 --> 02:53:21,120
Hm și apoi

4084
02:53:17,680 --> 02:53:24,240
Unul dintre acestea este pachetul Jupiter

4085
02:53:21,120 --> 02:53:28,319
astfel încât să puteți rula notebook-uri Jupyter.

4086
02:53:24,240 --> 02:53:32,240
Și care vor fi caietele Jupyter

4087
02:53:28,319 --> 02:53:37,040
este practic un browser web

4088
02:53:32,240 --> 02:53:40,319
aplicație care va deschide un notebook

4089
02:53:37,040 --> 02:53:42,240
editor în browserul dvs. web. Deci asta e

4090
02:53:40,319 --> 02:53:44,720
în cele din urmă ce vom face, dar

4091
02:53:42,240 --> 02:53:47,040
îl vom instala prin intermediul

4092
02:53:44,720 --> 02:53:50,000
Distribuție Anaconda

4093
02:53:47,040 --> 02:53:51,600
uh prin distribuția Anaconda a

4094
02:53:50,000 --> 02:53:53,040
Python.

4095
02:53:51,600 --> 02:53:58,880
Deci de aici vom începe

4096
02:53:53,040 --> 02:54:01,040
cu descărcarea inițială a Anaconda.

4097
02:53:58,880 --> 02:54:04,640
Oh, nu este o înregistrare omisă.

4098
02:54:01,040 --> 02:54:06,319
Bine, lasă-mă să deschid linkul.

4099
02:54:04,640 --> 02:54:07,760
Cred că acolo, cred că există o modalitate de a

4100
02:54:06,319 --> 02:54:10,640
găsiți-l fără a fi nevoie să faceți

4101
02:54:07,760 --> 02:54:10,640
înregistrare.

4102
02:54:11,520 --> 02:54:14,880
Există o modalitate de a ajunge la ea fără

4103
02:54:12,800 --> 02:54:18,120
trebuind sa faca asta. O să-l găsesc

4104
02:54:14,880 --> 02:54:18,120
foarte repede.

4105
02:54:21,359 --> 02:54:24,960
Oh, nu poți. Bine. Deci, dacă nu poți

4106
02:54:22,880 --> 02:54:27,680
instalați-l, e în regulă. Vom putea

4107
02:54:24,960 --> 02:54:29,359
să lucrez cu caietele în colaborare și cu tine

4108
02:54:27,680 --> 02:54:33,319
poate lucra cu notebook-uri în interiorul VS

4109
02:54:29,359 --> 02:54:33,319
Cod. E bine și asta.

4110
02:54:38,160 --> 02:54:42,560
Da, înțeleg prin care trec

4111
02:54:40,000 --> 02:54:46,520
procesul de înregistrare ca să pot eu

4112
02:54:42,560 --> 02:54:46,520
vă poate arăta instalarea.

4113
02:54:46,800 --> 02:54:52,960
Bine, lasă-mă să-mi partajez ecranul.

4114
02:54:50,319 --> 02:54:55,520
Ați ajuns la o dată ce ați trecut

4115
02:54:52,960 --> 02:54:59,000
cum ar fi configurarea contului, nu?

4116
02:54:55,520 --> 02:54:59,000
ajunge la această pagină?

4117
02:55:00,000 --> 02:55:04,080
Ați ajuns la această pagină pentru cei dintre voi

4118
02:55:02,800 --> 02:55:08,920
trece prin? Da, pare corect

4119
02:55:04,080 --> 02:55:08,920
pentru tine, Ashish. Asta pare corect.

4120
02:55:11,520 --> 02:55:16,560
Băieți, ajungeți la această pagină, totuși când?

4121
02:55:13,600 --> 02:55:18,319
reușiți să vă configurați contul similar?

4122
02:55:16,560 --> 02:55:21,760
Bine, ai ajuns la această pagină. Bine, deci

4123
02:55:18,319 --> 02:55:23,840
apoi alegeți Windows sau Mac corect

4124
02:55:21,760 --> 02:55:25,680
jos. Vrei să fii aici pe

4125
02:55:23,840 --> 02:55:27,680
stânga. Vrei să faci Anaconda

4126
02:55:25,680 --> 02:55:30,240
distributie.

4127
02:55:27,680 --> 02:55:31,920
Aceasta este ceea ce vrei să faci. Deci, alege

4128
02:55:30,240 --> 02:55:35,279
cel potrivit. Și dacă ești pe un M1,

4129
02:55:31,920 --> 02:55:37,279
M2, M3, vei face siliciul.

4130
02:55:35,279 --> 02:55:39,439
Dacă ești pe un Mac mai vechi, vei merge

4131
02:55:37,279 --> 02:55:40,560
sa faca 64. Si apoi evident, daca

4132
02:55:39,439 --> 02:55:43,040
ești pe un Windows, ar trebui să fii

4133
02:55:40,560 --> 02:55:44,479
dând clic aici pentru a face Windows. Dar

4134
02:55:43,040 --> 02:55:47,680
vrei să faci Anaconda

4135
02:55:44,479 --> 02:55:51,120
distribuție, nu Minion. Bine. Deci,

4136
02:55:47,680 --> 02:55:54,120
faceți clic pe programul de instalare pentru Anaconda

4137
02:55:51,120 --> 02:55:54,120
distributie.

4138
02:55:56,960 --> 02:56:02,080
Bine? Și apoi lăsați-l să se instaleze. Acum

4139
02:56:00,479 --> 02:56:05,279
în timp ce se instalează, permiteți-mi să vă explic

4140
02:56:02,080 --> 02:56:07,439
ceva despre diferența dintre

4141
02:56:05,279 --> 02:56:11,600
uh, cred că a fost întrebat mai devreme ce este

4142
02:56:07,439 --> 02:56:16,399
diferența dintre um Anaconda

4143
02:56:11,600 --> 02:56:19,600
uh ca Python implicit. Deci Anaconda

4144
02:56:16,399 --> 02:56:22,479
după cum spuneam mai devreme este o versiune a

4145
02:56:19,600 --> 02:56:24,560
Python care are o grămadă de știință a datelor

4146
02:56:22,479 --> 02:56:29,200
și pachete de învățare automată deja

4147
02:56:24,560 --> 02:56:31,200
instalat pentru tine. Deci vine cu o

4148
02:56:29,200 --> 02:56:35,760
o grămadă de pachete care sunt deja

4149
02:56:31,200 --> 02:56:38,160
instalat. Deci, dacă utilizați acel Python

4150
02:56:35,760 --> 02:56:39,680
um că Python are o grămadă de pachete

4151
02:56:38,160 --> 02:56:42,240
încorporat cu el pe care nu aveți nevoie

4152
02:56:39,680 --> 02:56:45,359
ieși și instalează. Deci, Anaconda este un

4153
02:56:42,240 --> 02:56:46,880
versiune foarte populară a Python pentru

4154
02:56:45,359 --> 02:56:50,160
oameni pe care să-l instaleze în care lucrează

4155
02:56:46,880 --> 02:56:52,160
știința datelor, AI, ML. Foarte popular

4156
02:56:50,160 --> 02:56:54,399
versiune deoarece vine deja cu un

4157
02:56:52,160 --> 02:56:57,279
o grămadă de pachete pe care le-ai folosi

4158
02:56:54,399 --> 02:57:00,720
manipularea datelor pentru a face mașină

4159
02:56:57,279 --> 02:57:02,960
să înveți sau să faci orice în AI. Aşa,

4160
02:57:00,720 --> 02:57:06,000
este un foarte popular

4161
02:57:02,960 --> 02:57:09,520
distributie. Vine si cu

4162
02:57:06,000 --> 02:57:11,520
Jupiter, motiv pentru care am vrut să folosim

4163
02:57:09,520 --> 02:57:15,640
pentru că vine cu caietul

4164
02:57:11,520 --> 02:57:15,640
capacitate din cutie.

4165
02:57:16,560 --> 02:57:22,000
Bine. Deci, am de gând să lansez. Deci, când

4166
02:57:19,840 --> 02:57:25,439
asta s-a terminat instalarea, vrei

4167
02:57:22,000 --> 02:57:29,359
lansați programul care se instalează

4168
02:57:25,439 --> 02:57:31,279
numit uh Anaconda Navigator.

4169
02:57:29,359 --> 02:57:33,680
Deci, ar trebui să instaleze un program pe dvs

4170
02:57:31,279 --> 02:57:35,520
mașină numită Anaconda Navigator.

4171
02:57:33,680 --> 02:57:38,000
Aveți asta? A primit cineva

4172
02:57:35,520 --> 02:57:41,120
prin și și aveți acel program?

4173
02:57:38,000 --> 02:57:43,520
Navigatorul Anaconda.

4174
02:57:41,120 --> 02:57:47,439
Nu aveți nevoie de cele avansate. tu

4175
02:57:43,520 --> 02:57:49,520
nu au nevoie de opțiuni avansate.

4176
02:57:47,439 --> 02:57:51,120
Doar cele implicite. Toate

4177
02:57:49,520 --> 02:57:54,600
implicite

4178
02:57:51,120 --> 02:57:54,600
ar trebui să fie bun.

4179
02:57:57,120 --> 02:58:00,720
Încă se descarcă. Bine. ma duc

4180
02:57:58,640 --> 02:58:02,240
iti arata

4181
02:58:00,720 --> 02:58:06,640
Am să vă arăt ce este navigatorul

4182
02:58:02,240 --> 02:58:07,840
arata ca odata ce o ai.

4183
02:58:06,640 --> 02:58:09,680
E în regulă dacă durează puțin

4184
02:58:07,840 --> 02:58:12,000
timpul pentru descărcare. E în regulă. um,

4185
02:58:09,680 --> 02:58:13,439
practic, odată ce îl descarci, um, tu

4186
02:58:12,000 --> 02:58:17,399
trebuie doar să faceți clic pe alte câteva butoane

4187
02:58:13,439 --> 02:58:17,399
și apoi poți accesa Jupiter.

4188
02:58:17,439 --> 02:58:23,200
Bine, lasă-mă să-mi partajez ecranul și să arăt

4189
02:58:20,319 --> 02:58:24,479
tu ce iti place. Odată ce se instalează,

4190
02:58:23,200 --> 02:58:25,760
asa ar trebui sa arate. Este

4191
02:58:24,479 --> 02:58:27,680
bine dacă durează puțin

4192
02:58:25,760 --> 02:58:30,160
timp.

4193
02:58:27,680 --> 02:58:32,880
Ar trebui să ai ceva de genul ăsta

4194
02:58:30,160 --> 02:58:35,520
arată așa, care este um

4195
02:58:32,880 --> 02:58:39,359
tabloul de bord care are diferit

4196
02:58:35,520 --> 02:58:41,840
programele disponibile pentru dvs.

4197
02:58:39,359 --> 02:58:44,080
Hm

4198
02:58:41,840 --> 02:58:47,200
băieți, vedeți așa ceva? Dacă

4199
02:58:44,080 --> 02:58:51,160
ai navigatorul,

4200
02:58:47,200 --> 02:58:51,160
vezi asa ceva?

4201
02:58:52,240 --> 02:58:56,479
care este care este ca atunci când tu

4202
02:58:54,479 --> 02:58:58,080
deschideți programul de navigare, ar trebui

4203
02:58:56,479 --> 02:59:01,880
vezi așa ceva care are o grămadă

4204
02:58:58,080 --> 02:59:01,880
de diferit um

4205
02:59:04,479 --> 02:59:08,880
tu faci. Bine.

4206
02:59:07,279 --> 02:59:11,200
Este dacă durează puțin timp

4207
02:59:08,880 --> 02:59:13,680
e în regulă.

4208
02:59:11,200 --> 02:59:17,120
Da. Na Anaconda Navigator este așa cum tu

4209
02:59:13,680 --> 02:59:19,200
lansează Da.

4210
02:59:17,120 --> 02:59:21,439
Anaconda Navigator este modul în care îl lansați.

4211
02:59:19,200 --> 02:59:24,800
Deci da, vrei să deschizi asta. Acum, cel

4212
02:59:21,439 --> 02:59:28,800
tot motivul pentru a veni aici

4213
02:59:24,800 --> 02:59:33,040
este astfel încât să putem lansa notebook-uri Jupiter.

4214
02:59:28,800 --> 02:59:34,880
Deci putem lansa notebook-uri Jupyter. Hm

4215
02:59:33,040 --> 02:59:38,160
acesta este programul pe care îl dorim până la urmă

4216
02:59:34,880 --> 02:59:41,840
a lansa. Acest lucru va fi

4217
02:59:38,160 --> 02:59:44,960
Permiteți-ne să deschidem fișiere notebook, să edităm

4218
02:59:41,840 --> 02:59:47,439
ei, rulați celule de cod. Îți voi arăta ce

4219
02:59:44,960 --> 02:59:51,520
un caiet arată ca într-o secundă. Dar

4220
02:59:47,439 --> 02:59:54,640
dar odată ce ai instalat Anaconda,

4221
02:59:51,520 --> 02:59:56,960
deschideți navigatorul și apoi lansați

4222
02:59:54,640 --> 03:00:00,800
Caietul Jupiter. Este doar un plus

4223
02:59:56,960 --> 03:00:04,800
pas. Lansați caietul Jupiter.

4224
03:00:00,800 --> 03:00:06,960
Ceea ce ar trebui să facă este să lanseze aplicația

4225
03:00:04,800 --> 03:00:11,439
caietul.

4226
03:00:06,960 --> 03:00:12,960
Ar trebui să lanseze browserul web al

4227
03:00:11,439 --> 03:00:14,960
iti place orice ai ca tau

4228
03:00:12,960 --> 03:00:17,040
browser web implicit. Ar trebui să deschidă

4229
03:00:14,960 --> 03:00:19,120
programul notebook în fiecare site-ul dvs

4230
03:00:17,040 --> 03:00:21,920
browser. Deci, dacă este Chrome, Firefox,

4231
03:00:19,120 --> 03:00:23,200
Edge, indiferent de browserul dvs. implicit,

4232
03:00:21,920 --> 03:00:27,080
va lansa notebook-ul

4233
03:00:23,200 --> 03:00:27,080
programul din browser.

4234
03:00:27,359 --> 03:00:30,359
Bine.

4235
03:00:31,040 --> 03:00:35,760
Deci, o voi lansa și apoi o voi face

4236
03:00:34,080 --> 03:00:36,960
arata cum arata. Din nou, dacă

4237
03:00:35,760 --> 03:00:41,359
iti ia putin timp,

4238
03:00:36,960 --> 03:00:43,040
e în regulă. Ori de câte ori se termină,

4239
03:00:41,359 --> 03:00:44,800
cum am ajuns la aceste pictograme? Doar

4240
03:00:43,040 --> 03:00:46,880
lansare. Ai Anaconda?

4241
03:00:44,800 --> 03:00:48,160
Programul Navigator?

4242
03:00:46,880 --> 03:00:49,840
Ar fi trebuit să fie

4243
03:00:48,160 --> 03:00:53,760
instalat.

4244
03:00:49,840 --> 03:00:54,960
Deschideți programul Anaconda Navigator.

4245
03:00:53,760 --> 03:00:58,840
Ar fi trebuit instalat cu

4246
03:00:54,960 --> 03:00:58,840
Instalare Anaconda.

4247
03:01:05,200 --> 03:01:09,600
În regulă. A putut cineva să ajungă

4248
03:01:06,720 --> 03:01:13,040
acesta este Jupiter asta? Deci, ar trebui

4249
03:01:09,600 --> 03:01:16,479
lansați în browserul dvs. Cineva

4250
03:01:13,040 --> 03:01:18,479
reuși să ajungi la asta?

4251
03:01:16,479 --> 03:01:20,479
Fantastic. Fantastic. Mă bucur că unele dintre ele

4252
03:01:18,479 --> 03:01:22,000
sunteți capabili să ajungeți la el. Și dacă

4253
03:01:20,479 --> 03:01:23,200
nu este încă, e în regulă.

4254
03:01:22,000 --> 03:01:26,399
Amintiți-vă, când se termină instalarea,

4255
03:01:23,200 --> 03:01:28,399
vei merge la Anaconda Navigator

4256
03:01:26,399 --> 03:01:32,000
si apoi

4257
03:01:28,399 --> 03:01:34,319
lansează Jupiter Notebook. Asta e

4258
03:01:32,000 --> 03:01:37,120
Asta ai de gând să faci.

4259
03:01:34,319 --> 03:01:39,520
E în regulă, Roberto. E în regulă.

4260
03:01:37,120 --> 03:01:42,080
În regulă. Vreau, vreau să arăt

4261
03:01:39,520 --> 03:01:44,399
voi băieți un caiet. Vreau doar să arăt

4262
03:01:42,080 --> 03:01:48,399
tu cum arată. Ce mă duc

4263
03:01:44,399 --> 03:01:52,880
să fac este să mă duc

4264
03:01:48,399 --> 03:01:55,840
um deschide un caiet mergând la nou și

4265
03:01:52,880 --> 03:01:57,520
apoi caietul Python 3. Deci poți deschide

4266
03:01:55,840 --> 03:01:59,200
un folder, poți deschide un terminal, tu

4267
03:01:57,520 --> 03:02:02,240
poate deschide un fișier text. Am de gând să deschid

4268
03:01:59,200 --> 03:02:04,319
un Python 3 care este un notebook. Tu asa

4269
03:02:02,240 --> 03:02:06,479
este un este un notebook alimentat de

4270
03:02:04,319 --> 03:02:09,439
Python.

4271
03:02:06,479 --> 03:02:14,960
Așa că voi face clic pe ceea ce va

4272
03:02:09,439 --> 03:02:17,600
lansați un nou notebook într-o filă nouă.

4273
03:02:14,960 --> 03:02:20,319
Și iată-mă în editorul de notebook. Deci

4274
03:02:17,600 --> 03:02:23,359
acum sunt într-un ecran de editor de notebook. Deci

4275
03:02:20,319 --> 03:02:26,640
dacă te duci când lansezi pentru prima dată Jupiter

4276
03:02:23,359 --> 03:02:28,560
poți naviga pentru a observa că asta

4277
03:02:26,640 --> 03:02:30,640
caietul a fost creat aici unde am

4278
03:02:28,560 --> 03:02:33,439
momentan sunt pe aparatul meu. as putea

4279
03:02:30,640 --> 03:02:37,520
naviga spre as putea naviga

4280
03:02:33,439 --> 03:02:39,439
documente și apoi aș putea, știi

4281
03:02:37,520 --> 03:02:42,479
creați un fișier nou acolo sau aș putea face

4282
03:02:39,439 --> 03:02:49,359
un folder nou aici și și fă asta

4283
03:02:42,479 --> 03:02:51,600
cale. Um, dar eu doar editez asta

4284
03:02:49,359 --> 03:02:55,800
caietul chiar aici, în acest um

4285
03:02:51,600 --> 03:02:55,800
folderul curent în care mă aflu.

4286
03:02:58,240 --> 03:03:02,960
Bine. Deci, băieți, vă amintiți când eu

4287
03:03:00,080 --> 03:03:05,760
a spus că codul este executat într-un

4288
03:03:02,960 --> 03:03:08,240
celula izolata?

4289
03:03:05,760 --> 03:03:09,760
Îți amintești asta?

4290
03:03:08,240 --> 03:03:13,040
um,

4291
03:03:09,760 --> 03:03:15,120
asa arata o celula. Iar tu

4292
03:03:13,040 --> 03:03:17,359
poate crea celule noi apăsând acest plus

4293
03:03:15,120 --> 03:03:19,200
butonul.

4294
03:03:17,359 --> 03:03:23,439
Deci, apăsați acest buton plus de aici,

4295
03:03:19,200 --> 03:03:25,040
puteți face celule noi. Deci, dacă ai lovit

4296
03:03:23,439 --> 03:03:27,439
plus,

4297
03:03:25,040 --> 03:03:30,160
Fac o grămadă de celule.

4298
03:03:27,439 --> 03:03:32,080
Acum, ce este cu adevărat cool la celule?

4299
03:03:30,160 --> 03:03:34,000
Da, Tim tocmai a descoperit asta. Ce este

4300
03:03:32,080 --> 03:03:38,160
foarte tare despre celule este că poți

4301
03:03:34,000 --> 03:03:41,359
schimbați-le în text sau cod. Deci, dacă

4302
03:03:38,160 --> 03:03:44,720
îl schimbi în reducere,

4303
03:03:41,359 --> 03:03:48,160
Pot să scriu un text de reducere aici pentru a spune

4304
03:03:44,720 --> 03:03:52,240
acesta este caietul meu. Și apoi dacă fug

4305
03:03:48,160 --> 03:03:56,479
aceasta, va fi afișată ca text.

4306
03:03:52,240 --> 03:04:00,720
Așa că dacă conduc celula aceea când sunt

4307
03:03:56,479 --> 03:04:03,920
Editând-o, pot face clic pe Run și va fi

4308
03:04:00,720 --> 03:04:06,960
redați asta ca text pentru că m-am schimbat

4309
03:04:03,920 --> 03:04:11,760
tipul de celulă la reducere. Markdown este

4310
03:04:06,960 --> 03:04:14,479
doar o aromă de stil de text.

4311
03:04:11,760 --> 03:04:16,720
Deci altfel putem scrie ceva Python

4312
03:04:14,479 --> 03:04:19,359
cod. Acum, ce vreau să tastați,

4313
03:04:16,720 --> 03:04:21,120
Voi scrie asta în chat pentru a verifica

4314
03:04:19,359 --> 03:04:24,640
totul funcționează, vreau ca tu

4315
03:04:21,120 --> 03:04:27,680
tip print

4316
03:04:24,640 --> 03:04:30,720
salut lume.

4317
03:04:27,680 --> 03:04:34,520
Vreau să tastați asta

4318
03:04:30,720 --> 03:04:34,520
în interiorul unei celule

4319
03:04:35,600 --> 03:04:42,040
si apoi

4320
03:04:37,840 --> 03:04:42,040
și apoi apăsați Run.

4321
03:04:43,840 --> 03:04:49,120
Și ar trebui să ruleze acel cod.

4322
03:04:47,040 --> 03:04:55,160
Și ar trebui să vezi că ar trebui să poți

4323
03:04:49,120 --> 03:04:55,160
vezi, ar trebui să poți vedea asta

4324
03:04:58,080 --> 03:05:01,439
Shift enter. Da. Poți oricând

4325
03:04:59,840 --> 03:05:05,399
ești într-o celulă, poți apăsa shift

4326
03:05:01,439 --> 03:05:05,399
intra. Va conduce celula.

4327
03:05:11,040 --> 03:05:15,200
Poți. E în regulă. Tu poți mereu

4328
03:05:12,880 --> 03:05:16,960
puteți reveni și viziona videoclipul. Deci,

4329
03:05:15,200 --> 03:05:19,520
aceasta se inregistreaza. Poți să te întorci

4330
03:05:16,960 --> 03:05:20,399
și urmăriți videoclipul. Știu că este o

4331
03:05:19,520 --> 03:05:23,120
putin frustrant. Este încă

4332
03:05:20,399 --> 03:05:24,479
instalând pentru tine, dar du-te înapoi și

4333
03:05:23,120 --> 03:05:26,720
urmăriți videoclipul. Și eu cu siguranță

4334
03:05:24,479 --> 03:05:30,319
încurajați odată ce este instalat să reveniți

4335
03:05:26,720 --> 03:05:33,600
și încearcă asta, care ar fi drept

4336
03:05:30,319 --> 03:05:37,640
lansând Anaconda Navigator

4337
03:05:33,600 --> 03:05:37,640
iar apoi lansând Jupiter.

4338
03:05:41,439 --> 03:05:48,240
Dacă nu ai, apropo, dacă tu

4339
03:05:43,439 --> 03:05:53,200
nu ai Python 3, poate ai nevoie

4340
03:05:48,240 --> 03:05:55,040
ieși din navigator și redeschide-l.

4341
03:05:53,200 --> 03:05:56,800
Bine, poate fi necesar să părăsiți dvs

4342
03:05:55,040 --> 03:06:00,680
navigator, redeschide-l ca să poți

4343
03:05:56,800 --> 03:06:00,680
lansează din nou Jupiter.

4344
03:06:05,520 --> 03:06:08,720
Ați fost capabili să rulați asta într-un

4345
03:06:07,120 --> 03:06:12,840
celula? Pentru cei dintre voi care îl aveți pe Jupiter

4346
03:06:08,720 --> 03:06:12,840
alergând, ai fost capabil să rulezi asta?

4347
03:06:14,640 --> 03:06:19,600
Frumos. Și a funcționat pentru tine. bine,

4348
03:06:16,479 --> 03:06:22,800
perfect. Perfect.

4349
03:06:19,600 --> 03:06:24,960
Deci asta este ceea ce am vrut să spun prin asta este un

4350
03:06:22,800 --> 03:06:26,640
celulă izolată. Așa că observă că putem alerga

4351
03:06:24,960 --> 03:06:30,240
aceasta

4352
03:06:26,640 --> 03:06:32,560
si nu afecteaza

4353
03:06:30,240 --> 03:06:34,720
um

4354
03:06:32,560 --> 03:06:38,319
Sigur. Sigur. te aud. eu te aud.

4355
03:06:34,720 --> 03:06:42,399
Actualizați documentul. Uh pot Ce zici eu

4356
03:06:38,319 --> 03:06:44,240
să-l postezi pe canalul nostru Slack? De către

4357
03:06:42,399 --> 03:06:48,040
Apropo, băieți, aveți acces la

4358
03:06:44,240 --> 03:06:48,040
pe canalul Slack?

4359
03:06:51,840 --> 03:06:57,880
Bine, o pot posta acolo. pot posta

4360
03:06:53,840 --> 03:06:57,880
instrucțiunile pentru a ajunge acolo.

4361
03:06:59,200 --> 03:07:05,640
Bine, îl pot posta în uh-ul nostru

4362
03:07:01,760 --> 03:07:05,640
canalul uh al cohortei.

4363
03:07:05,760 --> 03:07:11,800
te aud. Nu vrei să cauți

4364
03:07:07,359 --> 03:07:11,800
videoclipul nostru. eu te aud.

4365
03:07:16,560 --> 03:07:22,399
Nu am linkul la îndemână, dar

4366
03:07:19,439 --> 03:07:27,040
puteți ajunge la el prin LMS.

4367
03:07:22,399 --> 03:07:31,359
Deci, dacă mergi la LMS și mergi la

4368
03:07:27,040 --> 03:07:33,600
ar trebui să existe

4369
03:07:31,359 --> 03:07:35,680
um

4370
03:07:33,600 --> 03:07:38,319
ar trebui să existe un link pentru a ajunge la el

4371
03:07:35,680 --> 03:07:41,880
acolo înăuntru. Ar trebui să se termine

4372
03:07:38,319 --> 03:07:41,880
aici in dreapta.

4373
03:07:43,439 --> 03:07:49,479
Nu am linkul, nu am

4374
03:07:45,120 --> 03:07:49,479
leagă la el din mână. Da,

4375
03:07:51,200 --> 03:07:56,960
dar ar trebui să existe o modalitate de a ajunge la el

4376
03:07:53,680 --> 03:07:59,840
din LMS.

4377
03:07:56,960 --> 03:08:01,520
Da, ar trebui să fie un banner aici. eu

4378
03:07:59,840 --> 03:08:04,840
nu știu de ce nu o am, dar

4379
03:08:01,520 --> 03:08:04,840
ar trebui să fie acolo.

4380
03:08:05,760 --> 03:08:11,520
Bine. Deci, dacă doar primești lucruri

4381
03:08:08,000 --> 03:08:15,680
instalat, cum ajungi aici? um,

4382
03:08:11,520 --> 03:08:18,880
deschideți navigatorul.

4383
03:08:15,680 --> 03:08:22,479
Deschideți navigatorul.

4384
03:08:18,880 --> 03:08:26,000
Sintaxa este salut lume.

4385
03:08:22,479 --> 03:08:29,319
Este doar în interiorul ei, doar acea amprentă

4386
03:08:26,000 --> 03:08:29,319
salut lume.

4387
03:08:30,399 --> 03:08:34,520
Hm, deschide navigatorul.

4388
03:08:34,720 --> 03:08:38,479
Deschideți navigatorul care arată ca

4389
03:08:36,240 --> 03:08:42,120
aceasta.

4390
03:08:38,479 --> 03:08:42,120
Lasă-mă să-mi partajez ecranul.

4391
03:08:44,640 --> 03:08:48,880
Bine. Deschideți Anaconda Navigator care

4392
03:08:47,040 --> 03:08:52,319
s-a instalat.

4393
03:08:48,880 --> 03:08:54,800
Apoi faceți clic pe Lansare pe Jupyter

4394
03:08:52,319 --> 03:08:57,920
program pentru notebook. Deci ar trebui să fii

4395
03:08:54,800 --> 03:09:01,279
asta cel putin. Poate ai si altele.

4396
03:08:57,920 --> 03:09:04,640
Faceți clic pe această lansare. Da click pe asta

4397
03:09:01,279 --> 03:09:08,359
lansați și apoi puteți lansa uh

4398
03:09:04,640 --> 03:09:08,359
Anaconda Navigator.

4399
03:09:14,560 --> 03:09:17,760
Bine.

4400
03:09:16,240 --> 03:09:19,680
Dacă este puțin blocat, așa este

4401
03:09:17,760 --> 03:09:21,279
bine. Vom merge mai departe. Suntem

4402
03:09:19,680 --> 03:09:23,680
mergi la Collab, care poate rula

4403
03:09:21,279 --> 03:09:26,240
caiete de asemenea. Deci, dacă pare a

4404
03:09:23,680 --> 03:09:28,800
puțin blocat, e în regulă. voi posta

4405
03:09:26,240 --> 03:09:31,680
în instrucțiunile noastre Slack despre cum să rulați

4406
03:09:28,800 --> 03:09:35,000
aceasta.

4407
03:09:31,680 --> 03:09:35,000
E în regulă.

4408
03:09:36,399 --> 03:09:41,120
În regulă. Dar ce am vrut să fac,

4409
03:09:39,520 --> 03:09:43,680
ceea ce am vrut să fac înainte să trecem la

4410
03:09:41,120 --> 03:09:45,200
colaborarea este că am vrut doar să-ți arăt eu

4411
03:09:43,680 --> 03:09:47,439
am vrut să spun câteva lucruri despre

4412
03:09:45,200 --> 03:09:49,040
caiete.

4413
03:09:47,439 --> 03:09:52,000
Hm

4414
03:09:49,040 --> 03:09:54,240
este despre câteva lucruri

4415
03:09:52,000 --> 03:09:56,240
caiete. Unul este că observați că acestea

4416
03:09:54,240 --> 03:09:57,840
celulele sunt foarte izolate. Orice as pune

4417
03:09:56,240 --> 03:10:01,439
aici

4418
03:09:57,840 --> 03:10:04,240
nu afectează ceea ce aveam înainte. Deci

4419
03:10:01,439 --> 03:10:07,520
Pot adăuga numere așa și se poate

4420
03:10:04,240 --> 03:10:09,600
um calculează asta și asta nu afectează

4421
03:10:07,520 --> 03:10:12,160
aceasta. Deci, de aceea, caietele sunt așa

4422
03:10:09,600 --> 03:10:16,080
grozav este că poți documenta caietele

4423
03:10:12,160 --> 03:10:19,840
cu amestecarea textului și a codului

4424
03:10:16,080 --> 03:10:21,760
facem aici. Poți rula cod în el

4425
03:10:19,840 --> 03:10:24,560
celule proprii.

4426
03:10:21,760 --> 03:10:26,880
uh puteți rula cod în propriile celule și

4427
03:10:24,560 --> 03:10:28,319
atunci poți avea asta foarte izolat.

4428
03:10:26,880 --> 03:10:30,880
Așa că aș putea să sară aici jos și să fug

4429
03:10:28,319 --> 03:10:32,640
ceva și asta nu contează

4430
03:10:30,880 --> 03:10:36,080
nu e nimic aici ca nu

4431
03:10:32,640 --> 03:10:38,800
trebuie să fie în ordine. Pot, știi că eu

4432
03:10:36,080 --> 03:10:41,800
pot epuiza chestii din pot suprascrie

4433
03:10:38,800 --> 03:10:41,800
aceasta

4434
03:10:42,000 --> 03:10:48,080
um și rulați asta și produce

4435
03:10:44,160 --> 03:10:53,200
ieșire. Uh

4436
03:10:48,080 --> 03:10:54,720
așa că știi multe lucruri pe care le-am putea face

4437
03:10:53,200 --> 03:10:57,279
în interiorul caietelor care sunt cu adevărat

4438
03:10:54,720 --> 03:11:00,160
fantastic pentru prototipuri rapide

4439
03:10:57,279 --> 03:11:03,040
și rulează cod Python în interiorul celulelor.

4440
03:11:00,160 --> 03:11:04,399
Deci e foarte frumos așa. Deci caiete

4441
03:11:03,040 --> 03:11:07,600
caietele sunt chiar drăguțe. Poți

4442
03:11:04,399 --> 03:11:10,960
de asemenea, aș putea partaja acest fișier. Deci

4443
03:11:07,600 --> 03:11:13,920
aceasta produce un fișier pe mașina mea. Uh

4444
03:11:10,960 --> 03:11:15,600
dacă mă întorc la navigator

4445
03:11:13,920 --> 03:11:18,479
um

4446
03:11:15,600 --> 03:11:21,479
Navigatorul Anaconda Jerry Anaconda

4447
03:11:18,479 --> 03:11:21,479
navigator

4448
03:11:22,160 --> 03:11:26,560
um

4449
03:11:24,960 --> 03:11:29,600
puteți citi valoarea variabilelor din

4450
03:11:26,560 --> 03:11:31,840
altă celulă? Trebuie să depozitezi

4451
03:11:29,600 --> 03:11:36,160
le în variabile. Așa că aș putea

4452
03:11:31,840 --> 03:11:39,600
numi asta uh x

4453
03:11:36,160 --> 03:11:40,720
și apoi m-aș putea referi la x mai târziu.

4454
03:11:39,600 --> 03:11:44,200
Vom învăța despre asta. Vom învăța

4455
03:11:40,720 --> 03:11:44,200
despre asta cu variabile.

4456
03:11:44,479 --> 03:11:49,640
Dar da, poți să faci asta

4457
03:11:46,640 --> 03:11:49,640
variabile.

4458
03:11:53,680 --> 03:11:59,640
În regulă.

4459
03:11:56,640 --> 03:11:59,640
um,

4460
03:12:02,960 --> 03:12:09,680
dupa ce numerele?

4461
03:12:07,520 --> 03:12:12,680
Ce numere? acestea cele din

4462
03:12:09,680 --> 03:12:12,680
paranteze.

4463
03:12:16,720 --> 03:12:23,760
Oh, așa că acelea sunt celulele pe care le avem

4464
03:12:20,479 --> 03:12:26,640
executat. Așa că am executat-o ​​mai întâi pe aceasta.

4465
03:12:23,760 --> 03:12:29,760
Deci este numărul unu. Și apoi eu

4466
03:12:26,640 --> 03:12:32,560
executat um

4467
03:12:29,760 --> 03:12:34,399
uh asta, cred că am făcut asta secundă. Deci

4468
03:12:32,560 --> 03:12:37,920
este text. Nu prea primește unul dintre

4469
03:12:34,399 --> 03:12:41,359
acelea. Și apoi am făcut asta o treime.

4470
03:12:37,920 --> 03:12:43,359
Și apoi am făcut-o, cred că am făcut-o pe asta

4471
03:12:41,359 --> 03:12:45,439
al patrulea și apoi a fost suprascris cu

4472
03:12:43,359 --> 03:12:47,439
al cincilea. Deci îți spune doar cum

4473
03:12:45,439 --> 03:12:49,600
multe execuții pe care le-ați făcut și ce este

4474
03:12:47,439 --> 03:12:51,920
ce număr de execuție a fost. Apoi eu

4475
03:12:49,600 --> 03:12:55,920
a făcut asta al șaselea.

4476
03:12:51,920 --> 03:12:58,080
Pur și simplu ține evidența execuțiilor tale.

4477
03:12:55,920 --> 03:13:06,240
Bine. Așa că cineva a întrebat despre un nucleu.

4478
03:12:58,080 --> 03:13:09,200
Ce este un nucleu? Deci nucleul este um

4479
03:13:06,240 --> 03:13:11,600
nucleul este practic interpretul.

4480
03:13:09,200 --> 03:13:16,080
Deci este chestia că nucleul

4481
03:13:11,600 --> 03:13:18,160
este doar o copie a interpretului

4482
03:13:16,080 --> 03:13:21,520
la care se atașează caietul în

4483
03:13:18,160 --> 03:13:24,160
pentru a alerga. Deci notebook-ul nu poate rula

4484
03:13:21,520 --> 03:13:25,840
orice pentru că amintește-ți un pi Python

4485
03:13:24,160 --> 03:13:29,200
nevoi

4486
03:13:25,840 --> 03:13:33,200
Python are nevoie de un interpret pentru a-l rula

4487
03:13:29,200 --> 03:13:35,439
cod. Deci în caiete noi practic

4488
03:13:33,200 --> 03:13:38,399
creați ca o copie virtuală a

4489
03:13:35,439 --> 03:13:41,439
interpret numit nucleu. Hm și tu

4490
03:13:38,399 --> 03:13:45,120
poate avea de fapt multe nuclee bazate pe

4491
03:13:41,439 --> 03:13:49,200
ești interpretul tău de bază. Deci ce este

4492
03:13:45,120 --> 03:13:53,680
drăguță este Anaconda

4493
03:13:49,200 --> 03:13:57,279
um Anaconda vine cu

4494
03:13:53,680 --> 03:13:59,760
un interpret pentru tine și apoi pentru tine

4495
03:13:57,279 --> 03:14:03,520
creați nuclee care sunt copii virtuale

4496
03:13:59,760 --> 03:14:05,920
ale acelui um care sunt copii virtuale ale

4497
03:14:03,520 --> 03:14:08,319
acel interpret, ca să poți fugi

4498
03:14:05,920 --> 03:14:11,120
codul tău Python împotriva acestuia. Ține minte

4499
03:14:08,319 --> 03:14:14,000
ai nevoie de un interpret, dar de caiete

4500
03:14:11,120 --> 03:14:16,239
atașați la sâmburi. Sâmburii sunt ca

4501
03:14:14,000 --> 03:14:18,479
interpreți virtuali.

4502
03:14:16,239 --> 03:14:21,040
Um, și puteți avea multe nuclee bazate

4503
03:14:18,479 --> 03:14:23,040
pe interpretul original. Deci

4504
03:14:21,040 --> 03:14:25,040
kernel-ul este literalmente doar gândește-te la el

4505
03:14:23,040 --> 03:14:27,279
ca computerul care alimentează

4506
03:14:25,040 --> 03:14:29,840
caietul. Asta e tot. Este doar

4507
03:14:27,279 --> 03:14:32,560
motor de calcul care vă permite

4508
03:14:29,840 --> 03:14:36,800
executați codul dvs. Python. Deci fiecare

4509
03:14:32,560 --> 03:14:38,880
notebook-ul are un nucleu asociat.

4510
03:14:36,800 --> 03:14:41,359
Și ce este interesant este dacă reporniți

4511
03:14:38,880 --> 03:14:44,960
nucleul dvs., vă pierdeți toate datele. Deci

4512
03:14:41,359 --> 03:14:48,319
toate aceste rezultate pe care le avem, tu

4513
03:14:44,960 --> 03:14:52,720
ar pierde dacă ai reporni nucleul.

4514
03:14:48,319 --> 03:14:54,239
Deci dacă repornesc acum îmi place de când am

4515
03:14:52,720 --> 03:14:57,680
repornit acest lucru nu va ști ce

4516
03:14:54,239 --> 03:14:58,960
x este. Deci, dacă încerc să printez din nou x, este

4517
03:14:57,680 --> 03:15:01,120
am să spun că nu știu ce este x

4518
03:14:58,960 --> 03:15:04,520
pentru că mi-am repornit nucleul. am pierdut

4519
03:15:01,120 --> 03:15:04,520
toate acele date.

4520
03:15:05,200 --> 03:15:10,000
Dar o pot redefini. Și apoi acolo

4521
03:15:08,000 --> 03:15:12,399
este. Și observați că iterațiile mele

4522
03:15:10,000 --> 03:15:15,200
reporniți

4523
03:15:12,399 --> 03:15:17,600
iterațiile mele reîncep când eu

4524
03:15:15,200 --> 03:15:20,399
reporniți nucleul meu. Deci dacă dacă mă întorc

4525
03:15:17,600 --> 03:15:23,040
și reporniți din nou nucleul

4526
03:15:20,399 --> 03:15:25,439
și acum dacă voi rula asta, asta va fi

4527
03:15:23,040 --> 03:15:28,239
mai întâi. Așa că observați cum repornește

4528
03:15:25,439 --> 03:15:31,239
mai întâi. Acesta va fi al doilea. Acesta va fi

4529
03:15:28,239 --> 03:15:31,239
al treilea.

4530
03:15:31,680 --> 03:15:35,359
Încercați să reporniți. Nu stiu ce aia

4531
03:15:33,840 --> 03:15:39,080
este.

4532
03:15:35,359 --> 03:15:39,080
Nu știu de ce asta

4533
03:15:40,239 --> 03:15:45,120
Da, alege Anaconda. Oricare.

4534
03:15:42,800 --> 03:15:46,399
Alege. Doriți să utilizați Anaconda ca dvs

4535
03:15:45,120 --> 03:15:48,800
Dar ceea ce spune asta este ce faci

4536
03:15:46,399 --> 03:15:51,359
vrei să folosești ca interpret pentru a

4537
03:15:48,800 --> 03:15:54,000
construiește-ți nucleele. Deci, alege unul dintre

4538
03:15:51,359 --> 03:15:56,160
acelea. Asta e bine.

4539
03:15:54,000 --> 03:15:58,640
Deci, da, cerințele Anaconda, laptop

4540
03:15:56,160 --> 03:16:00,720
cerințe. um,

4541
03:15:58,640 --> 03:16:04,560
ai nevoie de un pic de ai nevoie de a

4542
03:16:00,720 --> 03:16:07,680
putina memorie RAM. Ai nevoie de puțin

4543
03:16:04,560 --> 03:16:10,560
un pic de RAM pentru a rula notebook-urile deoarece

4544
03:16:07,680 --> 03:16:12,319
ai nevoie de putina memorie. Nu ai nevoie

4545
03:16:10,560 --> 03:16:13,920
mult totusi. Aș fi surprins dacă

4546
03:16:12,319 --> 03:16:17,520
nu ati indeplinit cerintele. Sale

4547
03:16:13,920 --> 03:16:20,160
nu atât de mult, dar ai nevoie de ceva.

4548
03:16:17,520 --> 03:16:24,080
Nu sunt sigur de exact. Ar trebui să mă uit

4549
03:16:20,160 --> 03:16:26,319
asta pe site-ul Anaconda.

4550
03:16:24,080 --> 03:16:28,720
Oh, trebuie să fi fost plin pentru început

4551
03:16:26,319 --> 03:16:33,040
sau destul de plin. Aș fi Asta nu ia

4552
03:16:28,720 --> 03:16:33,040
atât de mult spațiu, nu cred.

4553
03:16:33,760 --> 03:16:38,640
A fost destul de plin de la început?

4554
03:16:36,720 --> 03:16:42,160
aș presupune. Nu cred că asta necesită

4555
03:16:38,640 --> 03:16:44,560
până atât de mult spațiu.

4556
03:16:42,160 --> 03:16:46,720
Uh, ce vreau să fac atunci, vreau să plec

4557
03:16:44,560 --> 03:16:48,800
la colaborare. Bine. Cum ne simțim

4558
03:16:46,720 --> 03:16:50,239
despre caiete? Poate dacă este

4559
03:16:48,800 --> 03:16:52,000
încă se instalează pentru tine, dă-i un

4560
03:16:50,239 --> 03:16:54,080
putin timp. Deschideți deschiderea

4561
03:16:52,000 --> 03:16:56,319
navigator.

4562
03:16:54,080 --> 03:16:58,160
Să încercăm Coll. Vă garantez Colab

4563
03:16:56,319 --> 03:16:59,840
va funcționa pentru tine dacă mai ai

4564
03:16:58,160 --> 03:17:01,520
probleme cu dacă ai probleme cu

4565
03:16:59,840 --> 03:17:03,520
Jupiter.

4566
03:17:01,520 --> 03:17:06,000
Nu vă faceți griji. Să încercăm doar să colaborăm. eu

4567
03:17:03,520 --> 03:17:08,560
promit că va fi mult mai ușor, fii a

4568
03:17:06,000 --> 03:17:11,680
de milioane de ori mai ușor, cred, decât

4569
03:17:08,560 --> 03:17:15,560
lucrând cu Jupiter. Bine, grozav. Deci,

4570
03:17:11,680 --> 03:17:15,560
vom continua atunci.

4571
03:17:16,160 --> 03:17:21,840
Bine, lasă-mă să sar la noi

4572
03:17:20,239 --> 03:17:23,840
finală

4573
03:17:21,840 --> 03:17:26,800
um

4574
03:17:23,840 --> 03:17:28,880
demonstrație cu configurarea unui notebook de colaborare.

4575
03:17:26,800 --> 03:17:31,680
Așa că o să trec doar să fac

4576
03:17:28,880 --> 03:17:34,680
asta în interesul timpului.

4577
03:17:31,680 --> 03:17:34,680
Uh

4578
03:17:34,960 --> 03:17:37,960
deci

4579
03:17:38,160 --> 03:17:42,800
ai lua suplimentar

4580
03:17:39,439 --> 03:17:45,520
sesiuni prea altele decât uh, deci suntem eu

4581
03:17:42,800 --> 03:17:48,239
va fi instructor pentru toate

4582
03:17:45,520 --> 03:17:50,800
cursurile din acest program. Deci ești

4583
03:17:48,239 --> 03:17:53,680
esti blocat cu mine

4584
03:17:50,800 --> 03:17:57,040
pentru toate acestea. Are sens?

4585
03:17:53,680 --> 03:18:01,720
ca toate uh AI

4586
03:17:57,040 --> 03:18:01,720
cursuri de program de inginer.

4587
03:18:04,000 --> 03:18:10,640
Da. Da. Blocat sau fii entuziasmat. Este

4588
03:18:08,640 --> 03:18:13,920
va fi unul sau altul. probabil

4589
03:18:10,640 --> 03:18:16,880
nu un sentiment intermediar.

4590
03:18:13,920 --> 03:18:19,840
Să sperăm. Rece. Să sperăm. Să sperăm

4591
03:18:16,880 --> 03:18:24,080
bine. Da. După cum am spus, am predat

4592
03:18:19,840 --> 03:18:26,880
asta de multe ori. Uh, cred că ar fi

4593
03:18:24,080 --> 03:18:28,160
eu cred ca va fi bine.

4594
03:18:26,880 --> 03:18:30,560
Ești blocat. Bine. Ei bine, mergem

4595
03:18:28,160 --> 03:18:33,040
pentru a te debloca cu Colab. aș face-o

4596
03:18:30,560 --> 03:18:34,560
nu vă faceți griji pentru configurarea lui Jupiter.

4597
03:18:33,040 --> 03:18:35,840
Dacă nu funcționează pentru tine, mergem

4598
03:18:34,560 --> 03:18:38,000
să-l renunțăm și o vom folosi

4599
03:18:35,840 --> 03:18:40,160
altceva care funcționează. promit

4600
03:18:38,000 --> 03:18:42,880
nu este un promit că așezat pe Jupiter

4601
03:18:40,160 --> 03:18:44,560
up nu este atât de important în raport cu

4602
03:18:42,880 --> 03:18:47,120
obțineți cel puțin una dintre aceste opțiuni

4603
03:18:44,560 --> 03:18:50,399
care funcționează.

4604
03:18:47,120 --> 03:18:52,560
Deci, dacă nu funcționează pe Jupiter,

4605
03:18:50,399 --> 03:18:53,760
Nu sunt deloc îngrijorat de

4606
03:18:52,560 --> 03:18:56,160
pentru că vor fi multe

4607
03:18:53,760 --> 03:18:58,640
opțiuni pentru a rula codul Python. De fapt,

4608
03:18:56,160 --> 03:19:02,640
vom face unul în continuare care este

4609
03:18:58,640 --> 03:19:07,920
o să fiu cu colab. Aşa,

4610
03:19:02,640 --> 03:19:11,920
asta vom face. Da, lasă-mă să intru

4611
03:19:07,920 --> 03:19:14,920
că. Lasă-mă să-mi partajez ecranul aici.

4612
03:19:11,920 --> 03:19:14,920
Unul,

4613
03:19:20,080 --> 03:19:26,520
învăţând deja multe. Mare. Asta e

4614
03:19:21,520 --> 03:19:26,520
mare. Mă bucur să aud asta. Multumesc.

4615
03:19:26,560 --> 03:19:31,920
Bine.

4616
03:19:29,120 --> 03:19:35,200
Vă mulțumesc băieți. Apreciază.

4617
03:19:31,920 --> 03:19:37,520
În regulă. Lasă-mă să merg la demo. Demo

4618
03:19:35,200 --> 03:19:39,920
trei.

4619
03:19:37,520 --> 03:19:43,279
În regulă. Deci, ce vrei să faci

4620
03:19:39,920 --> 03:19:46,880
în esență este să mergi pe acest site,

4621
03:19:43,279 --> 03:19:50,319
um, pe care îl am aici. Mă duc să, uh,

4622
03:19:46,880 --> 03:19:52,560
lipiți-l în chat. Um, deci ce tu

4623
03:19:50,319 --> 03:19:57,120
vrei să faci este să mergi pe site-ul Google pentru

4624
03:19:52,560 --> 03:20:02,080
platforma lor Colab, uh, care este, deci

4625
03:19:57,120 --> 03:20:04,160
Colab este o, um, platformă de notebook care

4626
03:20:02,080 --> 03:20:05,680
Google găzduiește. Deci, nu trebuie

4627
03:20:04,160 --> 03:20:08,319
instala orice. Doar intri acolo

4628
03:20:05,680 --> 03:20:10,000
browserul dvs. web preferat, conectați-vă cu

4629
03:20:08,319 --> 03:20:12,160
contul dvs. Google. De fapt, nu

4630
03:20:10,000 --> 03:20:14,560
chiar cred că trebuie să fii neapărat

4631
03:20:12,160 --> 03:20:16,880
autentificat. Puteți pentru a salva

4632
03:20:14,560 --> 03:20:20,800
notebook-uri pe drive-ul tău,

4633
03:20:16,880 --> 03:20:22,319
dar mergi acolo și practic tu

4634
03:20:20,800 --> 03:20:26,239
deschide un caiet și începe să lucrezi

4635
03:20:22,319 --> 03:20:29,040
cu ea imediat. Și este fantastic.

4636
03:20:26,239 --> 03:20:32,720
Mediul lor de notebook are deja un

4637
03:20:29,040 --> 03:20:34,960
o mulțime de pachete instalate în el pentru AI

4638
03:20:32,720 --> 03:20:38,239
și învățarea automată. Deci asta e

4639
03:20:34,960 --> 03:20:41,520
cu adevărat grozav. Hm

4640
03:20:38,239 --> 03:20:43,680
uh, odată ce ajungi la pagină, tu

4641
03:20:41,520 --> 03:20:46,160
ar trebui să vă conectați totuși dacă aveți un

4642
03:20:43,680 --> 03:20:48,000
cont Google. Singurul motiv pentru care spun asta

4643
03:20:46,160 --> 03:20:50,239
este pentru că vă va salva caietele

4644
03:20:48,000 --> 03:20:51,680
la unitatea ta în mod automat, astfel încât tu

4645
03:20:50,239 --> 03:20:53,279
vă va salva automat

4646
03:20:51,680 --> 03:20:56,319
caiete ca și cum ai lucra

4647
03:20:53,279 --> 03:20:58,000
într-un document Google. Deci e grozav. Deci

4648
03:20:56,319 --> 03:20:59,600
că um, îți salvează munca

4649
03:20:58,000 --> 03:21:01,840
automat.

4650
03:20:59,600 --> 03:21:03,040
Um, așa că te rog, știi, aș face-o

4651
03:21:01,840 --> 03:21:05,200
recomand să obțineți un cont Google dacă

4652
03:21:03,040 --> 03:21:08,319
nu ai unul gratis. Conectare

4653
03:21:05,200 --> 03:21:12,239
utilizarea Collab este complet gratuită.

4654
03:21:08,319 --> 03:21:14,399
Hm, deci este o platformă fantastică. um,

4655
03:21:12,239 --> 03:21:16,560
când mergi pe acel site, presupunând

4656
03:21:14,399 --> 03:21:18,720
te-ai autentificat, vrei să dai clic pe

4657
03:21:16,560 --> 03:21:20,239
acel butonul albastru din stânga jos unde este

4658
03:21:18,720 --> 03:21:23,200
spune caietul nou. Îl poți vedea în

4659
03:21:20,239 --> 03:21:26,080
această captură de ecran. Și voi deschide unul

4660
03:21:23,200 --> 03:21:28,399
într-o clipă pe ecranul meu. Dar tu

4661
03:21:26,080 --> 03:21:31,040
Băieții văd acest ecran chiar aici

4662
03:21:28,399 --> 03:21:32,960
în această captură de ecran care are noul

4663
03:21:31,040 --> 03:21:35,960
caiet pe jos în jos

4664
03:21:32,960 --> 03:21:35,960
plecat?

4665
03:21:36,080 --> 03:21:41,640
Nu. De pe acel site, ce vezi?

4666
03:21:45,359 --> 03:21:48,960
Oh, deci ești deja într-un caiet. Ea

4667
03:21:47,520 --> 03:21:52,000
ești deja într-un caiet. Îmi place

4668
03:21:48,960 --> 03:21:53,600
spune: „Bine ați venit la Colab.

4669
03:21:52,000 --> 03:21:55,520
Oh, bine. Deci, a deschis deja

4670
03:21:53,600 --> 03:21:58,640
caiet pentru tine. Bine, asta e

4671
03:21:55,520 --> 03:22:00,720
bine. E bine. Îți voi arăta uh, o voi face

4672
03:21:58,640 --> 03:22:02,319
să-ți arăt cum arată. Asta e nu

4673
03:22:00,720 --> 03:22:05,120
problema. Asta înseamnă că ești deja

4674
03:22:02,319 --> 03:22:08,120
în interiorul acestuia.

4675
03:22:05,120 --> 03:22:08,120
Bine.

4676
03:22:08,720 --> 03:22:12,000
Bine. Deci, atunci suntem aproape în

4677
03:22:10,239 --> 03:22:14,239
mediul notebook și putem începe

4678
03:22:12,000 --> 03:22:16,000
cod de rulare. Lasă-mă să sar

4679
03:22:14,239 --> 03:22:17,439
Colaborați și arătați-vă băieți cum arată

4680
03:22:16,000 --> 03:22:19,439
ca.

4681
03:22:17,439 --> 03:22:21,120
Lasă-mă să nu mai împărtășesc asta și să sar peste

4682
03:22:19,439 --> 03:22:24,760
la

4683
03:22:21,120 --> 03:22:24,760
colaborați aici.

4684
03:22:32,399 --> 03:22:36,960
Bine.

4685
03:22:34,160 --> 03:22:40,000
Deci, dacă ești binevenit să colaborezi,

4686
03:22:36,960 --> 03:22:41,680
e bine sau poți începe unul nou

4687
03:22:40,000 --> 03:22:43,520
caietul. Lasă-mă să presupun că am făcut-o

4688
03:22:41,680 --> 03:22:45,359
deschis bun venit la colaborare. Deci, ești

4689
03:22:43,520 --> 03:22:47,279
în acest ecran. Ce vrei să faci dacă

4690
03:22:45,359 --> 03:22:52,000
sunteți în acest ecran este doar du-te pentru a pleca

4691
03:22:47,279 --> 03:22:54,720
până la dosar și face caiet nou.

4692
03:22:52,000 --> 03:22:59,560
Doar du-te la fișier, notebook nou în drive.

4693
03:22:54,720 --> 03:22:59,560
Doar fă asta. Înregistrați un caiet nou

4694
03:23:00,160 --> 03:23:04,800
iar aceasta va crea un nou blocnotes pentru

4695
03:23:02,479 --> 03:23:06,880
tu care va începe proaspăt un gol

4696
03:23:04,800 --> 03:23:09,760
caietul.

4697
03:23:06,880 --> 03:23:13,040
Bine.

4698
03:23:09,760 --> 03:23:16,080
Ai fost în stare să faci asta? Dacă voi băieți

4699
03:23:13,040 --> 03:23:18,319
au putut oamenii să ajungă aici la asta

4700
03:23:16,080 --> 03:23:19,760
caiet gol

4701
03:23:18,319 --> 03:23:21,840
într-un fel sau altul, ați făcut clic pe

4702
03:23:19,760 --> 03:23:25,920
butonul albastru pentru a apăsa pe unul nou sau ai plecat

4703
03:23:21,840 --> 03:23:28,160
până la dosar și a făcut caiet nou.

4704
03:23:25,920 --> 03:23:30,640
Da. Bine.

4705
03:23:28,160 --> 03:23:32,399
Deci, iată-ne. Fără a face toate

4706
03:23:30,640 --> 03:23:34,800
Pașii de instalare a lui Jupiter, suntem într-o

4707
03:23:32,399 --> 03:23:37,760
caietul. Uite cât de ușor a fost, nu?

4708
03:23:34,800 --> 03:23:39,279
Deci, de ce nu am început cu asta?

4709
03:23:37,760 --> 03:23:42,160
Hm

4710
03:23:39,279 --> 03:23:44,640
deci da, deci suntem în blocnotesul Google

4711
03:23:42,160 --> 03:23:47,040
platforma uh, ceea ce este fantastic

4712
03:23:44,640 --> 03:23:50,319
platformă și ce e grozav la asta

4713
03:23:47,040 --> 03:23:52,479
le puteți exporta acum, acestea sunt

4714
03:23:50,319 --> 03:23:54,479
pyb care este care este uh dacă ești

4715
03:23:52,479 --> 03:23:58,000
curios ce înseamnă acea extensie

4716
03:23:54,479 --> 03:24:00,800
prescurtare pentru notebook interactiv Python

4717
03:23:58,000 --> 03:24:02,960
bine IPIB

4718
03:24:00,800 --> 03:24:05,920
deci acestea sunt fișierele pe care le puteți deschide

4719
03:24:02,960 --> 03:24:07,600
în Jupiter dacă ai uh dacă observi

4720
03:24:05,920 --> 03:24:10,880
când deschideți caietul Jupyter

4721
03:24:07,600 --> 03:24:13,600
mai devreme a fost un IP YMBB

4722
03:24:10,880 --> 03:24:17,439
în interiorul codului VS când lucrezi cu

4723
03:24:13,600 --> 03:24:20,560
notebook-urile sunt IP YMBB, deci IPMBB este un

4724
03:24:17,439 --> 03:24:22,880
fișier caiet și poate fi deschis în

4725
03:24:20,560 --> 03:24:26,880
oricare dintre aceste trei platforme corect

4726
03:24:22,880 --> 03:24:30,399
Jupiter din Anaconda codul uh VS

4727
03:24:26,880 --> 03:24:32,399
poate deschide IPMB și puteți încărca

4728
03:24:30,399 --> 03:24:34,880
propriile dvs. caiete aici dacă le aveți

4729
03:24:32,399 --> 03:24:37,760
pe propria ta mașină, mergi la dosar

4730
03:24:34,880 --> 03:24:39,520
încărcați caietul și Și apoi va fi

4731
03:24:37,760 --> 03:24:41,840
deschide o casetă în care poți alege care

4732
03:24:39,520 --> 03:24:43,600
fișier pe aparat pentru a încărca. Deci tu

4733
03:24:41,840 --> 03:24:46,319
vă puteți încărca propriile caiete, care

4734
03:24:43,600 --> 03:24:48,960
va fi grozav când vom intra în um

4735
03:24:46,319 --> 03:24:50,239
demonstrații. Avem caiete demo pentru tine

4736
03:24:48,960 --> 03:24:52,880
băieți pe care îi vom rezolva cu noi

4737
03:24:50,239 --> 03:24:54,960
cod. Le puteți încărca în Collab

4738
03:24:52,880 --> 03:24:56,800
și lucrează cu ei direct în interiorul

4739
03:24:54,960 --> 03:24:59,120
aici.

4740
03:24:56,800 --> 03:25:01,920
Deci hai să încercăm să rulăm ceva. Să facem

4741
03:24:59,120 --> 03:25:05,200
imprimarea

4742
03:25:01,920 --> 03:25:08,399
salut lume.

4743
03:25:05,200 --> 03:25:11,279
Deci, um, vrei să tastați asta și eu

4744
03:25:08,399 --> 03:25:13,040
îl pot lipi în chat pentru voi

4745
03:25:11,279 --> 03:25:15,680
și apoi vrei să vrei să lovești

4746
03:25:13,040 --> 03:25:19,479
fie shift enter sau acest buton de redare

4747
03:25:15,680 --> 03:25:19,479
chiar lângă celulă.

4748
03:25:21,200 --> 03:25:25,920
Bine, deci ar putea dura un moment

4749
03:25:23,279 --> 03:25:27,680
pentru că pornește

4750
03:25:25,920 --> 03:25:29,279
miez.

4751
03:25:27,680 --> 03:25:30,880
Uh, dar apoi ar trebui să ruleze și tu

4752
03:25:29,279 --> 03:25:32,399
ar trebui să vadă rezultatul. Acum, aceasta este

4753
03:25:30,880 --> 03:25:36,000
va arăta foarte asemănător cu Jupiter,

4754
03:25:32,399 --> 03:25:38,880
doar puțin diferit.

4755
03:25:36,000 --> 03:25:42,800
Suntem în interiorul Collab

4756
03:25:38,880 --> 03:25:44,399
și am început un nou caiet.

4757
03:25:42,800 --> 03:25:47,200
Suntem doar într-un caiet gol

4758
03:25:44,399 --> 03:25:50,960
deocamdată. Și noi suntem doar în asta

4759
03:25:47,200 --> 03:25:54,840
prima celulă și eu fac salut lume.

4760
03:25:50,960 --> 03:25:54,840
Ați fost capabili să conduceți asta?

4761
03:26:00,479 --> 03:26:05,279
Noi nu am făcut-o. Dar am putea deschide o

4762
03:26:03,359 --> 03:26:08,160
notebook în VS Code pentru că am instalat

4763
03:26:05,279 --> 03:26:10,560
extensia. Noi am făcut asta. Ține minte noi

4764
03:26:08,160 --> 03:26:12,479
instalat extensia Jupiter. Deci noi

4765
03:26:10,560 --> 03:26:14,560
putem deschide notebook-uri în VS Code și putem

4766
03:26:12,479 --> 03:26:17,439
conduce-le acolo. Doar că nu am arătat asta

4767
03:26:14,560 --> 03:26:19,520
la noi. S-ar putea să facem asta mai târziu

4768
03:26:17,439 --> 03:26:22,080
drumul, dar ai asta

4769
03:26:19,520 --> 03:26:25,239
flexibilitate de a rula lucrurile acolo dacă tu

4770
03:26:22,080 --> 03:26:25,239
vreau să.

4771
03:26:26,319 --> 03:26:33,359
Bine. Un lucru vreau să vă arăt băieți

4772
03:26:29,040 --> 03:26:34,800
asta e chiar misto. Deci, um, un lucru eu

4773
03:26:33,359 --> 03:26:36,319
vreau să-ți arăt dacă mergi până la

4774
03:26:34,800 --> 03:26:40,000
timpul de rulare

4775
03:26:36,319 --> 03:26:41,840
apoi mergeți în jos pentru a schimba tipul de rulare.

4776
03:26:40,000 --> 03:26:44,479
Aveți asta, băieți? Schimba

4777
03:26:41,840 --> 03:26:46,000
tipul de rulare. Deci, dacă dați clic pe

4778
03:26:44,479 --> 03:26:49,680
timpul de rulare

4779
03:26:46,000 --> 03:26:53,120
și apoi schimbați tipul de rulare.

4780
03:26:49,680 --> 03:26:56,479
Avem asta? Faceți clic pe asta. Faceți clic pe

4781
03:26:53,120 --> 03:26:58,960
schimba tipul de rulare.

4782
03:26:56,479 --> 03:27:03,560
Și uită-te la opțiunile noastre. Putem alege o

4783
03:26:58,960 --> 03:27:03,560
GPU gratuit.

4784
03:27:03,600 --> 03:27:08,960
Deci putem trece la un nucleu GPU

4785
03:27:06,399 --> 03:27:11,120
ceea ce este fantastic pentru antrenament profund

4786
03:27:08,960 --> 03:27:13,520
modele de învățare și putem folosi acel GPU

4787
03:27:11,120 --> 03:27:17,680
gratuit. Acesta este unul dintre motive

4788
03:27:13,520 --> 03:27:21,040
că uh, Colab este atât de uimitor

4789
03:27:17,680 --> 03:27:24,560
oferiți acces gratuit la un GPU. Deci dacă tu

4790
03:27:21,040 --> 03:27:26,960
nu ai unul pe mașina ta, um

4791
03:27:24,560 --> 03:27:28,640
puteți folosi GPU-urile de la Collab pentru

4792
03:27:26,960 --> 03:27:30,080
gratuit.

4793
03:27:28,640 --> 03:27:32,720
Da, haide. Adică, nu există

4794
03:27:30,080 --> 03:27:35,840
nimic în neregulă cu asta. Deci, ce este

4795
03:27:32,720 --> 03:27:37,520
să-ți cer să faci este, uh, să reziliezi

4796
03:27:35,840 --> 03:27:40,160
nucleul tău actual pentru că ești

4797
03:27:37,520 --> 03:27:41,920
conectat la un nucleu de bază al procesorului. Ea

4798
03:27:40,160 --> 03:27:44,640
vrea să dezactivați asta pentru a putea

4799
03:27:41,920 --> 03:27:47,640
schimbați GPU-ul. Faceți clic pe OK. Asta e

4800
03:27:44,640 --> 03:27:47,640
bine.

4801
03:27:48,080 --> 03:27:53,520
În regulă. Și atunci suntem acum um, noi

4802
03:27:50,800 --> 03:27:57,040
faceți clic pe salvare. Și asta ne va schimba

4803
03:27:53,520 --> 03:27:58,880
și să ne conecteze la un GPU. Deci, dacă tu cum

4804
03:27:57,040 --> 03:28:03,040
știi că ești conectat la un GPU

4805
03:27:58,880 --> 03:28:05,600
este dacă te duci la um

4806
03:28:03,040 --> 03:28:07,600
dacă te duci la această casetă din dreapta.

4807
03:28:05,600 --> 03:28:12,000
O vedeți pe aia unde scrie

4808
03:28:07,600 --> 03:28:14,239
RAM și disc? Dacă facem clic pe asta,

4809
03:28:12,000 --> 03:28:16,800
ne va arăta resursa noastră de resurse

4810
03:28:14,239 --> 03:28:20,160
utilizare. Și ar trebui să vedeți RAM GPU

4811
03:28:16,800 --> 03:28:22,720
disponibil de 15 concerte.

4812
03:28:20,160 --> 03:28:25,439
Deci, aveți 15 gigaocteți de memorie RAM GPU

4813
03:28:22,720 --> 03:28:28,640
disponibil pe care îl puteți folosi.

4814
03:28:25,439 --> 03:28:31,359
Așa că nu uitați, faceți clic pe această memorie RAM

4815
03:28:28,640 --> 03:28:35,279
um

4816
03:28:31,359 --> 03:28:36,960
ar trebui să dai clic pe această memorie RAM uh

4817
03:28:35,279 --> 03:28:40,920
uh

4818
03:28:36,960 --> 03:28:40,920
scuze RAM și disc.

4819
03:28:44,160 --> 03:28:47,520
Roberto, ai schimbat timpul de rulare

4820
03:28:46,000 --> 03:28:51,680
la

4821
03:28:47,520 --> 03:28:55,640
Da, ar trebui să apară. Bine, atunci

4822
03:28:51,680 --> 03:28:55,640
ar trebui să puteți face clic pe aceasta

4823
03:28:57,520 --> 03:29:01,359
Da, poate dura ceva timp pentru a conecta

4824
03:28:59,279 --> 03:29:04,399
la unul pentru că ceea ce trebuie să facă Google

4825
03:29:01,359 --> 03:29:06,479
alocă-ți unul și apoi are

4826
03:29:04,399 --> 03:29:08,160
ca să-l conectezi peste nor. Ea

4827
03:29:06,479 --> 03:29:10,880
poate dura un minut. Da, poate dura o

4828
03:29:08,160 --> 03:29:12,960
minut. Trebuie să vă aloce unul.

4829
03:29:10,880 --> 03:29:14,479
Deci, întrebarea este care dintre ele este mai bună?

4830
03:29:12,960 --> 03:29:17,680
um,

4831
03:29:14,479 --> 03:29:20,800
deci pentru marea majoritate a lucrurilor,

4832
03:29:17,680 --> 03:29:22,479
CPU, timpul de rulare standard al CPU, care

4833
03:29:20,800 --> 03:29:24,720
este implicit, va fi mai bine

4834
03:29:22,479 --> 03:29:26,800
pentru marea majoritate a lucrurilor. The

4835
03:29:24,720 --> 03:29:28,720
singura dată când GPU-ul va fi cu adevărat

4836
03:29:26,800 --> 03:29:31,279
benefic este atunci când începem să facem profund

4837
03:29:28,720 --> 03:29:34,800
învățarea și formarea rețelelor neuronale,

4838
03:29:31,279 --> 03:29:37,680
atunci GPU-ul va fi cu adevărat benefic.

4839
03:29:34,800 --> 03:29:40,080
Va accelera timpul de antrenament cu a

4840
03:29:37,680 --> 03:29:43,279
cantitate semnificativă.

4841
03:29:40,080 --> 03:29:46,000
Vă pot spune ca și cum m-am antrenat un uh

4842
03:29:43,279 --> 03:29:50,000
rețea neuronală pentru imagini pentru imagine

4843
03:29:46,000 --> 03:29:52,720
recunoaștere. Uh, mi-a luat doi

4844
03:29:50,000 --> 03:29:54,560
ore pe procesor și apoi când am schimbat

4845
03:29:52,720 --> 03:29:57,120
la GPU a durat mai puțin de a

4846
03:29:54,560 --> 03:29:58,960
minut

4847
03:29:57,120 --> 03:30:03,239
a durat mai puțin de un minut și a fost

4848
03:29:58,960 --> 03:30:03,239
durează două ore pe procesor.

4849
03:30:03,279 --> 03:30:09,760
Deci da, antrenând rețele neuronale pe un GPU

4850
03:30:07,120 --> 03:30:12,239
când vom ajunge la asta va fi

4851
03:30:09,760 --> 03:30:14,880
benefic. Deci, dacă nu folosiți

4852
03:30:12,239 --> 03:30:16,080
Colaborați acum, e în regulă, dar în

4853
03:30:14,880 --> 03:30:17,279
viitorul când intrăm în adâncime

4854
03:30:16,080 --> 03:30:20,560
învățând, probabil că veți dori

4855
03:30:17,279 --> 03:30:22,080
utilizați Colab pentru a comuta la GPU pentru

4856
03:30:20,560 --> 03:30:26,319
gratuit.

4857
03:30:22,080 --> 03:30:28,960
Acum, ei vă limitează rata,

4858
03:30:26,319 --> 03:30:31,359
deci este gratuit, dar îl puteți maximiza

4859
03:30:28,960 --> 03:30:34,800
o zi și apoi te răcoresc timp de 24

4860
03:30:31,359 --> 03:30:37,920
ore pe care le am, le-am făcut, uh,

4861
03:30:34,800 --> 03:30:40,960
din pacate. Deci, cum ar fi, dacă vă depășiți maxim

4862
03:30:37,920 --> 03:30:44,080
acea RAM și o folosești prea mult într-o

4863
03:30:40,960 --> 03:30:46,000
Perioada de 24 de ore, nu vor permite

4864
03:30:44,080 --> 03:30:48,800
tu să te conectezi la un GPU gratuit pentru altul

4865
03:30:46,000 --> 03:30:51,120
24 de ore.

4866
03:30:48,800 --> 03:30:53,760
Deci, mă îndoiesc că vei întâlni asta

4867
03:30:51,120 --> 03:30:56,319
situație, dar am avut înainte

4868
03:30:53,760 --> 03:30:59,720
dacă ești doar dacă doar îl folosești

4869
03:30:56,319 --> 03:30:59,720
atât de mult.

4870
03:31:02,080 --> 03:31:08,279
Nu. Deci, din păcate,

4871
03:31:04,960 --> 03:31:08,279
uh, nu.

4872
03:31:09,439 --> 03:31:14,399
Deci, din păcate, nu. Nu poți, um,

4873
03:31:12,640 --> 03:31:16,640
Colaborarea nu se conectează la localul dvs

4874
03:31:14,399 --> 03:31:18,720
resurse. Numai că face nor

4875
03:31:16,640 --> 03:31:20,960
Resursele cloud ale Google. Deci nu, tu

4876
03:31:18,720 --> 03:31:23,600
nu vă puteți folosi propria prin colaborare. Dar

4877
03:31:20,960 --> 03:31:25,439
da, ai putea folosi propriul GPU

4878
03:31:23,600 --> 03:31:28,880
Cod VS. O să ne arăt cum să facem asta

4879
03:31:25,439 --> 03:31:32,760
mai târziu când intrăm în deep learning.

4880
03:31:28,880 --> 03:31:32,760
Îți voi arăta asta mai târziu.

4881
03:31:32,800 --> 03:31:37,120
Nu va trebui să ne facem griji pentru asta

4882
03:31:34,319 --> 03:31:40,120
acum, dar mai târziu, da, așa va fi

4883
03:31:37,120 --> 03:31:40,120
important.

4884
03:31:42,479 --> 03:31:47,600
Nu arată GPU. Asigurați-vă că

4885
03:31:44,640 --> 03:31:51,760
schimbă timpul de execuție pentru a trece la schimbare

4886
03:31:47,600 --> 03:31:55,880
tipul de rulare și asigurați-vă că alegeți GPU.

4887
03:31:51,760 --> 03:31:55,880
Asigurați-vă că plecați de la

4888
03:31:56,960 --> 03:32:01,040
Nu, ar trebui să folosești Colab. nu aș face-o

4889
03:31:58,800 --> 03:32:05,040
Nu trebuie să cumpărați nimic. Tu doar

4890
03:32:01,040 --> 03:32:07,359
utilizați Colab. Folosește Collab cu siguranță.

4891
03:32:05,040 --> 03:32:11,720
Colaborarea este gratuită. Face tot ce ești

4892
03:32:07,359 --> 03:32:11,720
va avea nevoie pentru clasă.

4893
03:32:12,239 --> 03:32:17,760
Da, susțin foarte mult pentru colaborare. Ea

4894
03:32:15,359 --> 03:32:20,319
Deci, apropo, dacă ești curios, cumva

4895
03:32:17,760 --> 03:32:22,479
Colaborarea a apărut pentru că a vrut Google

4896
03:32:20,319 --> 03:32:25,040
cercetarea învățării automate

4897
03:32:22,479 --> 03:32:28,880
comunitatea pentru a avea acces la GPU-uri pentru

4898
03:32:25,040 --> 03:32:33,279
liber să vă dezvoltați ca învățarea automată

4899
03:32:28,880 --> 03:32:35,279
și modele de învățare profundă. Deci, e

4900
03:32:33,279 --> 03:32:38,720
exista de ceva vreme. Îmi amintesc

4901
03:32:35,279 --> 03:32:43,760
folosind Collab um probabil aproape 10 ani

4902
03:32:38,720 --> 03:32:46,319
în urmă și odinioară a fost odinioară foarte

4903
03:32:43,760 --> 03:32:48,399
noroc dacă ai un GPU. Ți-a plăcut

4904
03:32:46,319 --> 03:32:50,319
trebuia să dai clic și apoi să speri

4905
03:32:48,399 --> 03:32:52,479
că ți-ar fi alocat unul și

4906
03:32:50,319 --> 03:32:54,479
uneori nu ai face și eu stăteam

4907
03:32:52,479 --> 03:32:57,120
acolo și trebuie să se reîmprospăteze și să încerce

4908
03:32:54,479 --> 03:32:59,200
sper că voi obține un GPU, dar acum este

4909
03:32:57,120 --> 03:33:02,200
este ca ușor disponibil care este

4910
03:32:59,200 --> 03:33:02,200
fantastic.

4911
03:33:03,359 --> 03:33:06,880
Nu, sunteți, dar vă alăturați la a

4912
03:33:04,880 --> 03:33:10,160
timp bun pentru că îți spun că

4913
03:33:06,880 --> 03:33:12,720
GPU a fost foarte greu de obținut. aș face-o

4914
03:33:10,160 --> 03:33:16,840
încerc mereu să trec la asta și eu

4915
03:33:12,720 --> 03:33:16,840
rareori ar putea.

4916
03:33:18,000 --> 03:33:21,000
Deci,

4917
03:33:22,720 --> 03:33:28,399
destul de bine. Dar cum am spus, parcă

4918
03:33:25,439 --> 03:33:30,399
procesorul este perfect pentru orice

4919
03:33:28,399 --> 03:33:31,680
vom face, cu excepția cazului în care vom ajunge

4920
03:33:30,399 --> 03:33:34,399
în învățare profundă, vei dori

4921
03:33:31,680 --> 03:33:36,080
pentru a schimba asta pe GPU. Dar asta e

4922
03:33:34,399 --> 03:33:38,239
va fi pentru că mai avem ceva timp până când vom

4923
03:33:36,080 --> 03:33:40,399
ajunge la învățare profundă.

4924
03:33:38,239 --> 03:33:43,399
Avem multe de învățat de acum încolo

4925
03:33:40,399 --> 03:33:43,399
apoi.

4926
03:33:45,040 --> 03:33:50,399
Bine.

4927
03:33:47,600 --> 03:33:51,840
Ce credem? Ne place colaborarea?

4928
03:33:50,399 --> 03:33:53,920
Ne simțim confortabil cu el. Simțiți-vă liber să

4929
03:33:51,840 --> 03:33:56,000
foloseste-l. Simțiți-vă liber să utilizați VS Code. Simte

4930
03:33:53,920 --> 03:34:00,239
liber să folosească Jupiter. Orice vrei tu

4931
03:33:56,000 --> 03:34:02,239
de folosit, bine? Există opțiuni, nu? eu

4932
03:34:00,239 --> 03:34:05,920
sper că aveți opțiuni pentru care funcționează

4933
03:34:02,239 --> 03:34:08,319
tu. Hm, toate sunt folosite în

4934
03:34:05,920 --> 03:34:11,760
industrie. Deci nu ratați

4935
03:34:08,319 --> 03:34:15,040
dacă orice ai folosi, oamenii îl folosesc

4936
03:34:11,760 --> 03:34:20,760
aceste trei persoane le folosesc pe toate.

4937
03:34:15,040 --> 03:34:20,760
Așa că nu ezitați să utilizați ceea ce este mai ușor.

4938
03:34:22,880 --> 03:34:27,720
Da, pot să arăt asta foarte repede. Da,

4939
03:34:28,000 --> 03:34:32,640
lasă-mă să mă întorc la el.

4940
03:34:31,439 --> 03:34:33,840
O să fiu foarte rapid cu asta, totuși

4941
03:34:32,640 --> 03:34:37,640
pentru că vreau să mă asigur că trecem peste

4942
03:34:33,840 --> 03:34:37,640
la celălalt material al nostru.

4943
03:34:44,560 --> 03:34:48,160
Bine, lasă-mă să-ți arăt cum poți rula a

4944
03:34:46,239 --> 03:34:50,000
caietul. Permiteți-mi să vă arăt cum să rulați a

4945
03:34:48,160 --> 03:34:55,880
caietul. Așa că mă duc la dosar,

4946
03:34:50,000 --> 03:34:55,880
fișier nou și deschideți un blocnotes Jupyter.

4947
03:34:56,640 --> 03:35:02,960
Bine. Deci se va deschide un nou. Acum observați

4948
03:34:59,520 --> 03:35:05,120
observați prelungirea acestuia

4949
03:35:02,960 --> 03:35:07,600
este

4950
03:35:05,120 --> 03:35:10,640
MB. Nu ar trebui să fie o surpriză. Adică

4951
03:35:07,600 --> 03:35:12,880
tipul universal de Python interactiv

4952
03:35:10,640 --> 03:35:15,840
dosar caiet.

4953
03:35:12,880 --> 03:35:18,560
Bine. Deci cel mai mare lucru pe care trebuie să-l faci

4954
03:35:15,840 --> 03:35:21,439
faceți când deschideți un blocnotes în VS Code

4955
03:35:18,560 --> 03:35:25,040
trebuie

4956
03:35:21,439 --> 03:35:27,760
spune-i la ce nucleu să se conecteze. Deci

4957
03:35:25,040 --> 03:35:31,120
trebuie să mergeți la selectarea nucleului

4958
03:35:27,760 --> 03:35:34,160
și atunci ceea ce trebuie să selectați este

4959
03:35:31,120 --> 03:35:36,239
Mediul Python. Și din fericire dacă tu

4960
03:35:34,160 --> 03:35:39,120
instalat Anaconda

4961
03:35:36,239 --> 03:35:42,560
aveți un mediu Python încorporat

4962
03:35:39,120 --> 03:35:47,040
care va fi ta, care este

4963
03:35:42,560 --> 03:35:49,120
va fi um the

4964
03:35:47,040 --> 03:35:51,920
știi care va fi uh

4965
03:35:49,120 --> 03:35:55,279
Anaconda pe care ai instalat-o.

4966
03:35:51,920 --> 03:35:58,319
Deci am Anaconda aici. Acum am o

4967
03:35:55,279 --> 03:36:04,160
multe altele, dar

4968
03:35:58,319 --> 03:36:04,160
Anaconda este aici. Spune că acesta este.

4969
03:36:08,399 --> 03:36:15,800
Așa face când tu

4970
03:36:11,760 --> 03:36:15,800
când tu uh

4971
03:36:16,000 --> 03:36:21,439
Da, trebuie să instalezi

4972
03:36:18,080 --> 03:36:23,760
instalați un mediu Python. Da. Deci

4973
03:36:21,439 --> 03:36:25,600
vrei să instalezi mai întâi Anaconda și

4974
03:36:23,760 --> 03:36:28,840
atunci poti alerga atunci poti alerga

4975
03:36:25,600 --> 03:36:28,840
caietele tale.

4976
03:36:33,760 --> 03:36:39,160
Și apoi pur și simplu rulați codul ca

4977
03:36:36,160 --> 03:36:39,160
de obicei

4978
03:36:40,960 --> 03:36:47,760
și apoi putem rula asta.

4979
03:36:44,319 --> 03:36:49,840
Da, dar parcă funcționează ca și cum tu

4980
03:36:47,760 --> 03:36:52,239
știm același tip de caiet ca și noi

4981
03:36:49,840 --> 03:36:56,120
au în interiorul Collab, același tip de

4982
03:36:52,239 --> 03:36:56,120
caiet pe care îl avem în Jupiter.

4983
03:36:57,920 --> 03:37:02,720
Trebuie să aveți un Python instalat

4984
03:37:00,160 --> 03:37:06,200
pentru ca asta să funcționeze. Deci te duci la tu mergi la

4985
03:37:02,720 --> 03:37:06,200
Medii Python

4986
03:37:06,239 --> 03:37:12,479
și apoi alegeți un mediu Python.

4987
03:37:10,239 --> 03:37:14,239
Ai putea încerca să creezi unul. nu sunt

4988
03:37:12,479 --> 03:37:16,239
sigur dacă asta va funcționa pentru tine. Creați

4989
03:37:14,239 --> 03:37:19,239
Mediul Python. Ai putea să încerci asta,

4990
03:37:16,239 --> 03:37:19,239
de asemenea.

4991
03:37:21,279 --> 03:37:27,920
Da, e bine. Oricine va lucra.

4992
03:37:26,239 --> 03:37:32,760
Orice Python va funcționa. Trebuie doar să

4993
03:37:27,920 --> 03:37:32,760
alege un Python. Oricine va lucra.

4994
03:38:02,560 --> 03:38:07,840
Bine. Da, dacă a fost implicit la ceva

4995
03:38:04,399 --> 03:38:12,120
e bine si asta.

4996
03:38:07,840 --> 03:38:12,120
Și apoi putem genera mai multe celule

4997
03:38:14,000 --> 03:38:17,399
și rulați celulele.

4998
03:38:19,520 --> 03:38:22,960
Dar da, asta e că ești tu

4999
03:38:20,800 --> 03:38:25,359
voi dori să instalez Anaconda

5000
03:38:22,960 --> 03:38:28,239
cel mai probabil pentru că aveți nevoie de un Python

5001
03:38:25,359 --> 03:38:31,880
versiunea instalată pe mașina dvs. în

5002
03:38:28,239 --> 03:38:31,880
pentru a rula asta.

5003
03:38:37,760 --> 03:38:40,760
Perfect.

5004
03:38:42,080 --> 03:38:45,840
Bine.

5005
03:38:44,479 --> 03:38:47,200
În regulă. Deci, ceea ce vreau să fac este să sară

5006
03:38:45,840 --> 03:38:50,479
înapoi la notele noastre ca să putem

5007
03:38:47,200 --> 03:38:52,399
continua. Um din nou, simțiți-vă liber

5008
03:38:50,479 --> 03:38:55,279
folosește orice

5009
03:38:52,399 --> 03:38:57,680
platforma funcționează pentru tine. colaborare,

5010
03:38:55,279 --> 03:39:00,080
a face caiete în VS Code, a face

5011
03:38:57,680 --> 03:39:03,120
Caiete Jupiter, indiferent pentru care funcționează

5012
03:39:00,080 --> 03:39:06,080
you, please feel free to use that. Acolo

5013
03:39:03,120 --> 03:39:07,920
nu este o modalitate greșită de a-l folosi. Oricare ar fi

5014
03:39:06,080 --> 03:39:10,800
cel mai potrivit pentru tine și ești cel mai

5015
03:39:07,920 --> 03:39:13,800
comfortable with, please use that

5016
03:39:10,800 --> 03:39:13,800
opțiunea.

5017
03:39:14,960 --> 03:39:22,880
Uh, este P minuscul. De aceea

5018
03:39:19,439 --> 03:39:24,880
lowercase P. Capital P is not a function

5019
03:39:22,880 --> 03:39:27,880
în Python.

5020
03:39:24,880 --> 03:39:27,880
Scăderea.

5021
03:39:28,239 --> 03:39:32,080
Da, mergi cu Colab. Da, dacă ești dacă

5022
03:39:30,399 --> 03:39:34,399
you're on a machine, you can't install

5023
03:39:32,080 --> 03:39:38,319
anything, go with Collab. Asta e total

5024
03:39:34,399 --> 03:39:40,239
bine. De aceea există pentru,

5025
03:39:38,319 --> 03:39:42,000
știi, un tip convenabil de nor

5026
03:39:40,239 --> 03:39:43,680
aspect la acesta.

5027
03:39:42,000 --> 03:39:45,520
um,

5028
03:39:43,680 --> 03:39:48,239
nu ezitați să colaborați pentru orice.

5029
03:39:45,520 --> 03:39:50,080
Asta e în regulă.

5030
03:39:48,239 --> 03:39:53,080
Voi folosi colaborarea din când în când ca

5031
03:39:50,080 --> 03:39:53,080
bine.

5032
03:39:55,760 --> 03:40:02,920
Bine, lasă-mă să mă întorc la noi

5033
03:39:59,359 --> 03:40:02,920
note atunci

5034
03:40:05,760 --> 03:40:10,960
și preluați din sintaxa uh. Deci, sunt

5035
03:40:09,359 --> 03:40:15,720
mă voi întoarce la Lasă-mă să-mi împărtășesc

5036
03:40:10,960 --> 03:40:15,720
ecran. Du-te înapoi la

5037
03:40:16,239 --> 03:40:21,200
Puteți folosi Colab pe telefonul dvs.? am

5038
03:40:18,000 --> 03:40:23,359
nu am încercat niciodată. aș fi surprins.

5039
03:40:21,200 --> 03:40:25,439
Poate un iPad.

5040
03:40:23,359 --> 03:40:27,600
Poate ca o tabletă. Ar putea funcționa

5041
03:40:25,439 --> 03:40:31,720
destul de bine.

5042
03:40:27,600 --> 03:40:31,720
Telefon. Nu sunt atât de sigur.

5043
03:40:37,520 --> 03:40:42,520
Da. Daţi-i drumul. Încearcă și anunță-mă

5044
03:40:39,200 --> 03:40:42,520
cum funcționează.

5045
03:40:45,120 --> 03:40:53,279
Încearcă și anunță-mă. Eu chiar nu

5046
03:40:47,840 --> 03:40:54,880
stiu. Sunt curios acum să încerc asta.

5047
03:40:53,279 --> 03:40:56,800
În regulă. Deci, mă întorc peste

5048
03:40:54,880 --> 03:40:59,600
note. O să terminăm azi

5049
03:40:56,800 --> 03:41:03,680
prin ce timp ne mai rămâne de trecut

5050
03:40:59,600 --> 03:41:07,520
ceva sintaxă. Deci cu adevărat uh

5051
03:41:03,680 --> 03:41:10,319
intr-adevar intru in um in Python ca

5052
03:41:07,520 --> 03:41:12,000
codul real al acestuia, astfel încât să putem obține

5053
03:41:10,319 --> 03:41:14,720
am început cu asta și începem să lucrăm

5054
03:41:12,000 --> 03:41:17,760
drum prin ea.

5055
03:41:14,720 --> 03:41:22,479
Uh diferența deci diferența

5056
03:41:17,760 --> 03:41:25,840
este um, vei executa fișiere py

5057
03:41:22,479 --> 03:41:28,479
cu interiorul terminalului. Deci vei face

5058
03:41:25,840 --> 03:41:30,640
să ruleze fișiere Python în loc de celule

5059
03:41:28,479 --> 03:41:34,160
într-un caiet. doar esti tu

5060
03:41:30,640 --> 03:41:38,520
rulând un rulați un script Python

5061
03:41:34,160 --> 03:41:38,520
mai degrabă decât celule individuale.

5062
03:41:39,920 --> 03:41:45,760
Bine, deci este o diferență acolo.

5063
03:41:44,160 --> 03:41:48,160
Și motivul pentru care alegem

5064
03:41:45,760 --> 03:41:50,160
notebook-uri este să ruleze celule individuale.

5065
03:41:48,160 --> 03:41:52,720
Doar că e mai ușor.

5066
03:41:50,160 --> 03:41:54,399
Aceeași sintaxă,

5067
03:41:52,720 --> 03:41:58,200
aceeași sintaxă. Doar codul nu este

5068
03:41:54,399 --> 03:41:58,200
izolate în celule.

5069
03:42:00,720 --> 03:42:04,040
tot Python.

5070
03:42:05,840 --> 03:42:08,920
În regulă.

5071
03:42:08,960 --> 03:42:15,840
Hai să mergem mai departe în sintaxă,

5072
03:42:13,040 --> 03:42:18,399
începe să înveți despre asta.

5073
03:42:15,840 --> 03:42:21,520
În regulă. Deci, trebuie să facem ceva

5074
03:42:18,399 --> 03:42:24,640
a afla despre cum scriem corect

5075
03:42:21,520 --> 03:42:26,000
Cod Python? Care este sintaxa acestuia?

5076
03:42:24,640 --> 03:42:29,760
Deci, o să avem nevoie de unele lucruri

5077
03:42:26,000 --> 03:42:32,080
Aflați despre cum să scrieți corect

5078
03:42:29,760 --> 03:42:33,600
identificatori, care sunt nume.

5079
03:42:32,080 --> 03:42:36,560
Identificatorii sunt doar nume pentru

5080
03:42:33,600 --> 03:42:38,880
variabile. Deci, trebuie să știm ce este

5081
03:42:36,560 --> 03:42:40,720
permis, ceea ce nu este permis. Trebuie

5082
03:42:38,880 --> 03:42:43,439
vorbiți despre ce înseamnă indentarea

5083
03:42:40,720 --> 03:42:45,279
și de ce avem nevoie de el în Python. vreau

5084
03:42:43,439 --> 03:42:46,880
pentru a vă arăta cum să scrieți comentarii

5085
03:42:45,279 --> 03:42:49,200
pentru că asta este foarte important

5086
03:42:46,880 --> 03:42:52,319
lăsând note pentru tine sau pentru alții

5087
03:42:49,200 --> 03:42:54,479
despre cod și apoi vorbim despre um

5088
03:42:52,319 --> 03:42:58,399
în general, cum producem rezultate și cum

5089
03:42:54,479 --> 03:43:01,600
putem accepta intrarea um de la un utilizator sau

5090
03:42:58,399 --> 03:43:02,880
cineva care interacționează cu codul nostru. eu

5091
03:43:01,600 --> 03:43:04,319
vreau să vorbim despre toate aceste lucruri.

5092
03:43:02,880 --> 03:43:07,319
Vom vedea cât de mult din ceea ce primim

5093
03:43:04,319 --> 03:43:07,319
la.

5094
03:43:07,520 --> 03:43:12,720
Dar să începem cu identificatorul. Deci

5095
03:43:10,080 --> 03:43:14,319
ce este un identificator în programare?

5096
03:43:12,720 --> 03:43:18,080
Acest lucru este cu adevărat pentru orice programare

5097
03:43:14,319 --> 03:43:21,359
limbaj. Un identificator este doar un nume

5098
03:43:18,080 --> 03:43:23,600
dăm ceva în interiorul codului nostru.

5099
03:43:21,359 --> 03:43:25,520
Deci este un nume pe care îl dăm unei variabile, a

5100
03:43:23,600 --> 03:43:30,000
nume pe care îl dăm unei funcții, un nume noi

5101
03:43:25,520 --> 03:43:31,840
da unui obiect. Hm deci orice nume am

5102
03:43:30,000 --> 03:43:35,520
da la ceva din codul nostru, cum ar fi când

5103
03:43:31,840 --> 03:43:41,520
setăm ceva egal cu x, ca x

5104
03:43:35,520 --> 03:43:44,319
este egal cu 3 3. um acel lucru x este

5105
03:43:41,520 --> 03:43:48,000
nume pe care îl dăm sau îi atribuim unui

5106
03:43:44,319 --> 03:43:52,239
rezultat sau o variabilă sau un obiect. Deci

5107
03:43:48,000 --> 03:43:54,880
oricând notăm un nume în codul nostru

5108
03:43:52,239 --> 03:43:57,120
de ceva există anumite reguli

5109
03:43:54,880 --> 03:43:59,760
că acele nume trebuie să urmeze şi

5110
03:43:57,120 --> 03:44:02,160
acestea sunt ceva ce vom ridica

5111
03:43:59,760 --> 03:44:06,640
pe măsură ce mergem, dar am vrut să-i numesc

5112
03:44:02,160 --> 03:44:08,160
aici afară. Deci, atunci când numim ceva

5113
03:44:06,640 --> 03:44:10,560
Python

5114
03:44:08,160 --> 03:44:13,199
în general, ei trebuie să urmeze acest set

5115
03:44:10,560 --> 03:44:16,560
de reguli, ceea ce înseamnă că trebuie să fie un combo

5116
03:44:13,199 --> 03:44:19,040
fie de litere mici sau mari

5117
03:44:16,560 --> 03:44:21,920
este permis poate fi chiar o

5118
03:44:19,040 --> 03:44:24,960
amestec de litere mici și mari

5119
03:44:21,920 --> 03:44:27,359
în nume sunt permise cifre numerice

5120
03:44:24,960 --> 03:44:32,479
este în regulă orice cifră de la 0 la nouă este

5121
03:44:27,359 --> 03:44:36,640
bine și sublinierea sunt în regulă

5122
03:44:32,479 --> 03:44:40,399
sublinierea sunt în regulă. Și nu există uh

5123
03:44:36,640 --> 03:44:41,920
lungime minimă sau maximă. Deci numele pot

5124
03:44:40,399 --> 03:44:45,680
fi cu adevărat lungi, pot fi cu adevărat

5125
03:44:41,920 --> 03:44:49,040
scurt. Bineînțeles că ar trebui să fie

5126
03:44:45,680 --> 03:44:51,359
semnificative. Deci, când numim ceva,

5127
03:44:49,040 --> 03:44:53,680
nu ar trebui să-și amintească că vrem să amam

5128
03:44:51,359 --> 03:44:58,080
de a scăpa de a numi totul X sau

5129
03:44:53,680 --> 03:45:00,479
Y sau A sau B um pentru că acele nume pot

5130
03:44:58,080 --> 03:45:02,800
nu înseamnă mare lucru când ne uităm înapoi la

5131
03:45:00,479 --> 03:45:05,600
cod. Deci, chiar dacă acestea sunt valabile

5132
03:45:02,800 --> 03:45:07,120
nume din perspectiva identificatorului, noi

5133
03:45:05,600 --> 03:45:09,120
vrem să fim cu adevărat semnificativi când noi

5134
03:45:07,120 --> 03:45:13,520
numeste ceva. Numim o variabilă, nume

5135
03:45:09,120 --> 03:45:16,319
o funcție, denumește un obiect. um,

5136
03:45:13,520 --> 03:45:20,399
iată o captură.

5137
03:45:16,319 --> 03:45:23,600
Numele nu poate începe cu un număr. Deci

5138
03:45:20,399 --> 03:45:27,279
Nu pot numi ceva, uh doar

5139
03:45:23,600 --> 03:45:29,120
numărul zero sau numărul unu um pentru că

5140
03:45:27,279 --> 03:45:31,120
Nu pot începe cu asta. Acum, se poate

5141
03:45:29,120 --> 03:45:34,640
include asta.

5142
03:45:31,120 --> 03:45:37,359
Deci, dacă trebuie să includ un număr în

5143
03:45:34,640 --> 03:45:40,800
nume, atâta timp cât nu începe cu

5144
03:45:37,359 --> 03:45:42,720
asta, e în regulă. Dar numele nu pot începe

5145
03:45:40,800 --> 03:45:45,840
cu o cifră. Aceasta este doar o regulă a

5146
03:45:42,720 --> 03:45:47,680
Python. Orice alocați a

5147
03:45:45,840 --> 03:45:50,319
nume la,

5148
03:45:47,680 --> 03:45:52,319
ca o variabilă, funcție, orice,

5149
03:45:50,319 --> 03:45:54,160
nu poate începe cu un număr, altfel va începe

5150
03:45:52,319 --> 03:45:56,080
fi invalid.

5151
03:45:54,160 --> 03:45:59,040
Bine?

5152
03:45:56,080 --> 03:46:00,960
Așa că ne voi arăta exemple în acest sens mai târziu.

5153
03:45:59,040 --> 03:46:03,359
Da, pot începe cu caractere de subliniere.

5154
03:46:00,960 --> 03:46:05,199
Da, e în regulă. Se poate începe cu

5155
03:46:03,359 --> 03:46:07,840
subliniază. Desigur, poate fi mai mic,

5156
03:46:05,199 --> 03:46:10,080
majuscule. Poate începe cu Nu poate

5157
03:46:07,840 --> 03:46:12,640
începe cu o cifră. Poate avea cifre.

5158
03:46:10,080 --> 03:46:15,680
Pur și simplu nu pot fi primul personaj

5159
03:46:12,640 --> 03:46:17,279
a numelui.

5160
03:46:15,680 --> 03:46:20,399
Da.

5161
03:46:17,279 --> 03:46:22,640
Hm, acum simbolurile speciale nu pot fi folosite

5162
03:46:20,399 --> 03:46:24,640
în nume. Deci nu poți avea un

5163
03:46:22,640 --> 03:46:27,120
procent, semn dolar, exclamație

5164
03:46:24,640 --> 03:46:30,399
punct, cratima,

5165
03:46:27,120 --> 03:46:33,199
simbolul lire sterline, la simbolul amperand, la

5166
03:46:30,399 --> 03:46:35,040
simbol. Niciuna dintre acestea nu poate fi folosită în

5167
03:46:33,199 --> 03:46:36,800
nume. Deci acele simboluri nu sunt

5168
03:46:35,040 --> 03:46:38,560
recunoscut.

5169
03:46:36,800 --> 03:46:40,560
Deci, dacă încercați să le includeți în

5170
03:46:38,560 --> 03:46:43,760
numele a ceva,

5171
03:46:40,560 --> 03:46:45,760
care va produce o eroare. Deci nu o facem

5172
03:46:43,760 --> 03:46:49,120
vreau sa fac asta. Celălalt lucru pe care îl dorim

5173
03:46:45,760 --> 03:46:52,319
a evita înseamnă a numi ceva în același

5174
03:46:49,120 --> 03:46:54,880
nume ca ceva care există deja

5175
03:46:52,319 --> 03:46:57,520
intern pentru Python. Deci acele lucruri sunt

5176
03:46:54,880 --> 03:47:00,239
numite cuvinte cheie. Deci sunt sigure

5177
03:46:57,520 --> 03:47:03,359
cuvinte cheie care au un sens în Python.

5178
03:47:00,239 --> 03:47:05,520
Ele sunt încorporate în limbaj. Noi

5179
03:47:03,359 --> 03:47:09,760
nu le pot reutiliza. Practic sunt

5180
03:47:05,520 --> 03:47:11,760
rezervat. Um deci ceva de genul clasei este

5181
03:47:09,760 --> 03:47:13,520
rezervat pentru că înseamnă ceva. Ea

5182
03:47:11,760 --> 03:47:14,960
înseamnă că declari o clasă. Bine

5183
03:47:13,520 --> 03:47:17,520
vedea. Vom vorbi despre ce înseamnă asta

5184
03:47:14,960 --> 03:47:19,920
mai târziu. Sau ceva de genul global nu poate

5185
03:47:17,520 --> 03:47:22,960
fi folosit deoarece declară ceva ca

5186
03:47:19,920 --> 03:47:24,560
globală. um,

5187
03:47:22,960 --> 03:47:26,399
deci

5188
03:47:24,560 --> 03:47:28,960
știi, vom afla ce unele dintre acestea

5189
03:47:26,399 --> 03:47:31,439
cuvintele cheie sunt. Există o listă cu ele

5190
03:47:28,960 --> 03:47:34,800
care sunt în documentația Python,

5191
03:47:31,439 --> 03:47:36,560
dar vrem să evităm să numim lucruri după

5192
03:47:34,800 --> 03:47:41,359
încorporat

5193
03:47:36,560 --> 03:47:45,359
uh uh funcții sau cuvinte cheie încorporate. Hm

5194
03:47:41,359 --> 03:47:47,279
deci, de fapt, am folosit deja unul

5195
03:47:45,359 --> 03:47:50,319
care este funcția de imprimare. Ştii

5196
03:47:47,279 --> 03:47:52,720
când am tipări Hello world am face

5197
03:47:50,319 --> 03:47:55,439
vrei să eviți să denumești ceva tipărit

5198
03:47:52,720 --> 03:47:58,239
pentru că imprimarea înseamnă ceva. Ea există

5199
03:47:55,439 --> 03:48:00,239
ca functie. Nu vrem să numim

5200
03:47:58,239 --> 03:48:02,319
ceva imprimat

5201
03:48:00,239 --> 03:48:03,920
corect că ar produce-o

5202
03:48:02,319 --> 03:48:05,680
deoarece ar produce confuzie. The

5203
03:48:03,920 --> 03:48:07,199
interpretul ar vedea asta și ar spune oh fă

5204
03:48:05,680 --> 03:48:09,040
te referi la funcția print sau tu

5205
03:48:07,199 --> 03:48:12,080
încerci să numești ceva tipărit? ea

5206
03:48:09,040 --> 03:48:14,640
nu ar sti. Deci, vrem să evităm

5207
03:48:12,080 --> 03:48:17,600
denumind ceva care există deja

5208
03:48:14,640 --> 03:48:23,479
în interiorul Python, ca tipărire sau ca

5209
03:48:17,600 --> 03:48:23,479
clasa globala. Sunt multe altele.

5210
03:48:26,399 --> 03:48:31,600
Bine. În sfârșit, și acesta aruncă mereu

5211
03:48:29,120 --> 03:48:36,319
oameni off, atunci când numim

5212
03:48:31,600 --> 03:48:39,120
ceva care este sensibil la majuscule. Deci,

5213
03:48:36,319 --> 03:48:41,359
dacă numești ceva A cu minuscule, asta

5214
03:48:39,120 --> 03:48:42,880
este o variabilă complet diferită sau

5215
03:48:41,359 --> 03:48:45,840
cu totul altă funcție decât dacă am

5216
03:48:42,880 --> 03:48:47,040
ar fi să numească ceva A cu majuscule. Acestea

5217
03:48:45,840 --> 03:48:50,479
sunt diferite. Sunt tratați

5218
03:48:47,040 --> 03:48:54,160
diferit. Deci, Python va crede asta

5219
03:48:50,479 --> 03:48:56,880
acestea sunt două obiecte diferite sau

5220
03:48:54,160 --> 03:48:59,520
variabile sau orice ar fi cazul. Așa să fie

5221
03:48:56,880 --> 03:49:03,199
foarte atent cu sensibilitatea majusculelor.

5222
03:48:59,520 --> 03:49:05,359
Python este sensibil la majuscule.

5223
03:49:03,199 --> 03:49:07,680
Literele mici A nu vor fi tratate la fel

5224
03:49:05,359 --> 03:49:10,479
ca A majusculă. Și ori de câte ori dai nume

5225
03:49:07,680 --> 03:49:14,399
ceva, deci dacă am o variabilă și eu

5226
03:49:10,479 --> 03:49:19,920
I Am stabilit A minuscul egal cu cinci și

5227
03:49:14,399 --> 03:49:23,760
apoi am stabilit că capitalul A este egal cu 10.

5228
03:49:19,920 --> 03:49:25,359
Atunci, dacă aș imprima A, asta ar produce

5229
03:49:23,760 --> 03:49:27,840
cinci.

5230
03:49:25,359 --> 03:49:31,359
Dar dacă imprim A majusculă, așa va fi

5231
03:49:27,840 --> 03:49:33,279
produce 10. Nu este la fel. Așa este

5232
03:49:31,359 --> 03:49:35,120
sensibil la majuscule.

5233
03:49:33,279 --> 03:49:39,319
Acestea ar fi două nume diferite.

5234
03:49:35,120 --> 03:49:39,319
Scăderea A și capitalul A.

5235
03:49:40,399 --> 03:49:44,640
Bine.

5236
03:49:42,800 --> 03:49:47,760
Deci, vom face exemple cu

5237
03:49:44,640 --> 03:49:50,640
acestea, dar acestea sunt doar câteva reguli noi

5238
03:49:47,760 --> 03:49:53,120
trebuie să respectăm în sintaxă dacă suntem

5239
03:49:50,640 --> 03:49:54,880
denumind orice ca numirea noastră

5240
03:49:53,120 --> 03:49:57,439
variabile, denumirea funcțiilor noastre, denumirea

5241
03:49:54,880 --> 03:50:00,080
obiectele noastre pe măsură ce mergem în

5242
03:49:57,439 --> 03:50:02,080
desigur, nu? Pur și simplu nu putem Principalul

5243
03:50:00,080 --> 03:50:05,520
una care îi împiedică pe oameni este că nu putem

5244
03:50:02,080 --> 03:50:11,000
începe cu o cifră și nu putem folosi

5245
03:50:05,520 --> 03:50:11,000
cuvinte care există deja ca tiparul.

5246
03:50:11,840 --> 03:50:16,520
Oh, videoclipul meu este blocat pentru oameni?

5247
03:50:17,279 --> 03:50:22,239
S-a blocat?

5248
03:50:19,439 --> 03:50:24,720
Oh, bine. Anunță-mă mereu pentru că asta

5249
03:50:22,239 --> 03:50:26,560
ar putea fi.

5250
03:50:24,720 --> 03:50:29,279
Anunță-mă mereu pentru că cu siguranță

5251
03:50:26,560 --> 03:50:32,680
ar putea fi. Deci, este mai bine să știi decât

5252
03:50:29,279 --> 03:50:32,680
sa nu stiu.

5253
03:50:36,160 --> 03:50:39,680
Bine.

5254
03:50:37,680 --> 03:50:43,680
Oh, fără griji. Așa cum am spus, întotdeauna

5255
03:50:39,680 --> 03:50:46,000
nu ezitați întotdeauna să ne anunțați pentru că

5256
03:50:43,680 --> 03:50:49,760
um ar fi dacă este, atunci este bine să

5257
03:50:46,000 --> 03:50:52,560
strigă-l. Deci, nu vă faceți griji în privința asta.

5258
03:50:49,760 --> 03:50:55,120
Aveți întrebări despre aceste nume? Nu face

5259
03:50:52,560 --> 03:50:57,279
are sens cum numim

5260
03:50:55,120 --> 03:51:00,160
lucrurile contează și doar există

5261
03:50:57,279 --> 03:51:03,279
anumite reguli pe care trebuie să le respectăm. Hm

5262
03:51:00,160 --> 03:51:06,720
vrem să evităm aceste simboluri ciudate.

5263
03:51:03,279 --> 03:51:08,640
Um, știi, vrem să evităm denumirea

5264
03:51:06,720 --> 03:51:11,120
lucruri care există deja. Vrem

5265
03:51:08,640 --> 03:51:13,040
evitați să începeți cu o cifră. Altfel,

5266
03:51:11,120 --> 03:51:16,160
va fi un standard destul de asemănător

5267
03:51:13,040 --> 03:51:18,080
amestec cu litere mici, majuscule,

5268
03:51:16,160 --> 03:51:22,479
poate ocazional cu subliniere

5269
03:51:18,080 --> 03:51:23,840
amestecat acolo. Hm, sau sau cifre chiar.

5270
03:51:22,479 --> 03:51:27,080
Atâta timp cât nu începem cu unul,

5271
03:51:23,840 --> 03:51:27,080
e în regulă.

5272
03:51:30,640 --> 03:51:35,680
Da, Tim, asta e o referință bună. cel

5273
03:51:32,560 --> 03:51:38,800
PEP. Deci PEP

5274
03:51:35,680 --> 03:51:41,199
sunt setul de linii directoare care um the

5275
03:51:38,800 --> 03:51:45,359
Fundația Python a cam fost de acord

5276
03:51:41,199 --> 03:51:48,080
pe as um, iată cum ar trebui să folosești

5277
03:51:45,359 --> 03:51:49,920
ghidul tău de stil. Iată ce este aici

5278
03:51:48,080 --> 03:51:52,399
ceea ce comunitatea crede că este cel mai bun

5279
03:51:49,920 --> 03:51:55,399
stil pentru Python. Acestea sunt bune să

5280
03:51:52,399 --> 03:51:55,399
citeste.

5281
03:51:56,080 --> 03:52:00,479
Da, astea sunt bune

5282
03:51:57,760 --> 03:52:03,520
referințe pentru formatare

5283
03:52:00,479 --> 03:52:05,120
și să-ți stilizezi codul Python

5284
03:52:03,520 --> 03:52:09,000
fi în conformitate cu un fel de ceea ce

5285
03:52:05,120 --> 03:52:09,000
se așteaptă comunitatea.

5286
03:52:10,800 --> 03:52:13,800
Bine.

5287
03:52:16,960 --> 03:52:21,279
Bine. Deci, permiteți-mi să vă dau câteva exemple.

5288
03:52:19,199 --> 03:52:23,520
Ei bine, cei din stânga o vor face

5289
03:52:21,279 --> 03:52:26,960
fi valabil. Deci, putem numi ceva al meu

5290
03:52:23,520 --> 03:52:29,040
clasa. Putem numi ceva var_1

5291
03:52:26,960 --> 03:52:30,560
e în regulă.

5292
03:52:29,040 --> 03:52:34,160
numără

5293
03:52:30,560 --> 03:52:37,359
e bine. Uh

5294
03:52:34,160 --> 03:52:39,359
dar dacă avem

5295
03:52:37,359 --> 03:52:41,359
um ca în dreapta dacă avem

5296
03:52:39,359 --> 03:52:44,319
ceva care începe cu o cifră care

5297
03:52:41,359 --> 03:52:47,120
ar fi rau. Deci, acesta nu este bun

5298
03:52:44,319 --> 03:52:50,640
pentru că începe cu acest număr.

5299
03:52:47,120 --> 03:52:53,680
Asta nu e bine. Numele asta are asta

5300
03:52:50,640 --> 03:52:55,439
ciudat la simbolul din el. asta nu e bine.

5301
03:52:53,680 --> 03:52:57,840
Deci, acesta ar fi un nume prost pentru

5302
03:52:55,439 --> 03:53:00,239
ceva care ar produce o eroare.

5303
03:52:57,840 --> 03:53:02,960
Amintiți-vă, interpretul o va face

5304
03:53:00,239 --> 03:53:05,359
vezi asta și respinge-l în esență și

5305
03:53:02,960 --> 03:53:08,160
spune: „Nu poți numi ceva asta.

5306
03:53:05,359 --> 03:53:09,760
Nu este valabil.” Um, același lucru cu

5307
03:53:08,160 --> 03:53:11,840
încercând să numesc ceva global. Aceasta este

5308
03:53:09,760 --> 03:53:13,520
un cuvânt cheie care există deja în

5309
03:53:11,840 --> 03:53:15,439
limbaj. Se duce interpretul

5310
03:53:13,520 --> 03:53:16,960
vezi asta și încurcă-te. Nu este

5311
03:53:15,439 --> 03:53:19,359
o să știi dacă vorbești despre

5312
03:53:16,960 --> 03:53:21,359
cuvântul cheie care este încorporat sau sunteți

5313
03:53:19,359 --> 03:53:22,640
încercând să găsești propriul tău nume.

5314
03:53:21,359 --> 03:53:24,880
Nu se va ști. Deci, este doar

5315
03:53:22,640 --> 03:53:27,920
va arunca o eroare.

5316
03:53:24,880 --> 03:53:30,239
Um, așa că din nou, vrem să vrem să păstrăm

5317
03:53:27,920 --> 03:53:32,479
lucruri simple. Vrem să folosim

5318
03:53:30,239 --> 03:53:35,439
subliniază acolo unde are sens. Noi noi

5319
03:53:32,479 --> 03:53:36,880
nu vreau să încep cu cifre. Hm, noi

5320
03:53:35,439 --> 03:53:39,840
poate folosi un amestec de litere mici și

5321
03:53:36,880 --> 03:53:43,279
majuscule. Asta e bine.

5322
03:53:39,840 --> 03:53:46,640
Hm, acesta este mai degrabă un nume bun de variabilă

5323
03:53:43,279 --> 03:53:49,520
decât dacă aș suna ceva X.

5324
03:53:46,640 --> 03:53:51,520
Din nou, încercăm să evităm asta

5325
03:53:49,520 --> 03:53:52,800
ceva ce văd mereu la început.

5326
03:53:51,520 --> 03:53:54,000
Cred că este în regulă la început, dar

5327
03:53:52,800 --> 03:53:57,359
este ceva ce ne dorim cu adevărat să fim

5328
03:53:54,000 --> 03:53:59,439
conștient este denumirea variabilelor noastre

5329
03:53:57,359 --> 03:54:01,279
foarte semnificativ.

5330
03:53:59,439 --> 03:54:03,279
Ca și cum numărul va fi mai mult

5331
03:54:01,279 --> 03:54:06,000
semnificativ dacă ținem evidența unui

5332
03:54:03,279 --> 03:54:09,040
număr de ceva. Prefer să sunăm

5333
03:54:06,000 --> 03:54:11,920
asta contează decât dacă doar dacă aș sunat

5334
03:54:09,040 --> 03:54:14,640
este X. Pentru că dacă citești codul,

5335
03:54:11,920 --> 03:54:16,080
ce ma credeti? Ca atunci când

5336
03:54:14,640 --> 03:54:19,359
vezi, cam știi exact

5337
03:54:16,080 --> 03:54:22,239
ce înseamnă. X sau numără? Ce facem

5338
03:54:19,359 --> 03:54:22,239
crezi?

5339
03:54:22,880 --> 03:54:26,479
Care dintre ele ca are mai mult sens

5340
03:54:24,720 --> 03:54:30,399
cand il vezi? Știi exact ce

5341
03:54:26,479 --> 03:54:32,640
ține evidența. X sau numără?

5342
03:54:30,399 --> 03:54:36,160
Da, numără.

5343
03:54:32,640 --> 03:54:37,920
Aș fi de acord cu asta. Conta. Da.

5344
03:54:36,160 --> 03:54:41,520
Deci, este doar un ca acesta este doar un

5345
03:54:37,920 --> 03:54:44,080
un singur exemplu de încercare de a ține evidența

5346
03:54:41,520 --> 03:54:46,800
a lucrurilor într-un mod semnificativ. Asta este o

5347
03:54:44,080 --> 03:54:49,199
nume bun de dat unei variabile. Asta

5348
03:54:46,800 --> 03:54:53,720
ar fi să știi să ții evidența

5349
03:54:49,199 --> 03:54:53,720
ceva contează ceva

5350
03:54:54,399 --> 03:55:00,040
mai degrabă decât dacă l-am numi doar x sau y

5351
03:54:56,319 --> 03:55:00,040
sau a sau b.

5352
03:55:02,880 --> 03:55:09,199
Bine, vreau să vorbesc cu voi

5353
03:55:05,279 --> 03:55:11,359
despre indentare în continuare. Deci acum știm

5354
03:55:09,199 --> 03:55:12,960
trebuie să denumim lucrurile în mod corespunzător și

5355
03:55:11,359 --> 03:55:15,600
interpretul ne va da o eroare dacă

5356
03:55:12,960 --> 03:55:19,960
nu denumim lucrurile în mod corespunzător.

5357
03:55:15,600 --> 03:55:19,960
Ce zici de indentare?

5358
03:55:20,160 --> 03:55:26,640
Deci indentare

5359
03:55:22,720 --> 03:55:30,160
este o modalitate prin care Python poate înțelege ce

5360
03:55:26,640 --> 03:55:31,760
codul este executat împreună.

5361
03:55:30,160 --> 03:55:33,279
Bine.

5362
03:55:31,760 --> 03:55:38,319
Deci

5363
03:55:33,279 --> 03:55:41,279
și indică, de asemenea, că sunt

5364
03:55:38,319 --> 03:55:43,840
ruperea fluxului codului de la unul

5365
03:55:41,279 --> 03:55:46,319
secțiune la următoarea. Deci indentarea

5366
03:55:43,840 --> 03:55:49,600
este cu adevărat important să se însemne pentru

5367
03:55:46,319 --> 03:55:52,319
interpret există o nouă secțiune de

5368
03:55:49,600 --> 03:55:57,279
cod care trebuie luat în considerare

5369
03:55:52,319 --> 03:56:00,800
înainte să merg mai departe. Deci ar trebui

5370
03:55:57,279 --> 03:56:05,600
folosiți întotdeauna indentarea

5371
03:56:00,800 --> 03:56:08,560
ori de câte ori ai un colon așa cum vedem noi un

5372
03:56:05,600 --> 03:56:09,680
două puncte aici cu declarațiile if else. Acum

5373
03:56:08,560 --> 03:56:12,560
nu am aflat despre altceva

5374
03:56:09,680 --> 03:56:15,199
declarații dar vom face. Dar observați cum

5375
03:56:12,560 --> 03:56:18,239
avem colonul acolo și

5376
03:56:15,199 --> 03:56:20,319
interpretul ar fi de acord cu asta.

5377
03:56:18,239 --> 03:56:22,080
Acest lucru ar funcționa.

5378
03:56:20,319 --> 03:56:24,160
bine,

5379
03:56:22,080 --> 03:56:27,040
care este o simplă afirmație de a spune este

5380
03:56:24,160 --> 03:56:30,560
cinci mai mari decât doi? Da. Deci, în

5381
03:56:27,040 --> 03:56:32,640
În cazul în care este, să rulăm acest cod.

5382
03:56:30,560 --> 03:56:34,560
Dar o putem rula doar pentru că

5383
03:56:32,640 --> 03:56:36,319
interpretul recunoaște că este

5384
03:56:34,560 --> 03:56:38,319
indentat.

5385
03:56:36,319 --> 03:56:41,199
Deci indentarea este cu adevărat

5386
03:56:38,319 --> 03:56:44,640
critic pe măsură ce îl face pe interpret

5387
03:56:41,199 --> 03:56:46,560
înțelege ce ar trebui să urmeze. The

5388
03:56:44,640 --> 03:56:51,840
interpretul înțelege ce ar trebui să fie

5389
03:56:46,560 --> 03:56:56,399
următorul după această declarație. Um ca un dacă

5390
03:56:51,840 --> 03:56:59,120
instrucțiune sau o instrucțiune buclă. Hm noi

5391
03:56:56,399 --> 03:57:01,680
va avea întotdeauna indentare. Deci asta

5392
03:56:59,120 --> 03:57:04,640
ar arunca de fapt o eroare pentru că

5393
03:57:01,680 --> 03:57:08,000
există asta nu este indentat. Aceasta este la

5394
03:57:04,640 --> 03:57:11,600
același nivel și dacă ai colaborare

5395
03:57:08,000 --> 03:57:13,920
deschis, ai putea încerca asta pentru tine.

5396
03:57:11,600 --> 03:57:16,720
Dacă ai avea colaborare, ai putea să-l deschizi

5397
03:57:13,920 --> 03:57:19,279
Încercați-l singur este așa

5398
03:57:16,720 --> 03:57:21,840
acest lucru ar arunca o eroare acolo unde scrie

5399
03:57:19,279 --> 03:57:25,560
Mă aștept la indentare, dar tu ai făcut-o

5400
03:57:21,840 --> 03:57:25,560
nu am avea niciuna.

5401
03:57:27,840 --> 03:57:34,560
Contează câte spații?

5402
03:57:30,479 --> 03:57:39,399
Da, vrei să folosești patru spații.

5403
03:57:34,560 --> 03:57:39,399
Ar trebui să fie patru spații aici.

5404
03:57:39,439 --> 03:57:45,920
Spații sau file?

5405
03:57:41,840 --> 03:57:50,000
Râd doar pentru că este o

5406
03:57:45,920 --> 03:57:53,359
este un fel de întrebare controversată

5407
03:57:50,000 --> 03:57:55,439
în comunitate. Unii oameni devin cu adevărat

5408
03:57:53,359 --> 03:57:57,439
supărat peste

5409
03:57:55,439 --> 03:58:00,080
una sau alta. Eu nu sunt unul dintre aceia

5410
03:57:57,439 --> 03:58:02,640
oameni. chiar nu-mi pasă. ei asa

5411
03:58:00,080 --> 03:58:08,800
majoritatea editorilor de cod

5412
03:58:02,640 --> 03:58:12,000
setează automat fila la patru

5413
03:58:08,800 --> 03:58:14,640
spatii. Deci o filă va face același lucru

5414
03:58:12,000 --> 03:58:17,680
de parcă ai făcut manual doar patru spații.

5415
03:58:14,640 --> 03:58:21,399
Nu prea contează în acest caz.

5416
03:58:17,680 --> 03:58:21,399
Deci oricum,

5417
03:58:23,840 --> 03:58:29,120
da, ești așa că ide va face asta pentru

5418
03:58:26,560 --> 03:58:30,640
tu. În general, ID-urile vor face asta pentru

5419
03:58:29,120 --> 03:58:34,040
tu pentru că ei știu că ar trebui să continue

5420
03:58:30,640 --> 03:58:34,040
aceeași linie.

5421
03:58:35,600 --> 03:58:42,960
Ar funcționa ca pe aceeași linie? Da,

5422
03:58:39,600 --> 03:58:46,080
în unele cazuri va fi, dar nu toate. Ea

5423
03:58:42,960 --> 03:58:49,840
depinde cat de complex este. Dar ce

5424
03:58:46,080 --> 03:58:51,920
crezi că este mai ușor de citit

5425
03:58:49,840 --> 03:58:54,920
din perspectiva lizibilității? Care este

5426
03:58:51,920 --> 03:58:54,920
mai usor

5427
03:58:55,600 --> 03:59:00,160
dacă totul este într-o singură linie sau este mai mult

5428
03:58:57,920 --> 03:59:03,160
lizibil și mai ușor de urmărit dacă este

5429
03:59:00,160 --> 03:59:03,160
indentat?

5430
03:59:08,160 --> 03:59:14,560
Da, acesta este scopul. Deci da, eu

5431
03:59:12,160 --> 03:59:18,399
sunt de acord. indentat face mai ușor să

5432
03:59:14,560 --> 03:59:20,640
citeste. Deci, acesta este un alt motiv pentru Python

5433
03:59:18,399 --> 03:59:22,479
într-adevăr impune indentarea este a face

5434
03:59:20,640 --> 03:59:27,040
este mai ușor de citit. Există un motiv pentru ei

5435
03:59:22,479 --> 03:59:28,880
face asta. Este pentru a fi mai ușor de citit.

5436
03:59:27,040 --> 03:59:30,479
Bine?

5437
03:59:28,880 --> 03:59:32,720
Și acesta este unul dintre cele mai vândute

5438
03:59:30,479 --> 03:59:34,479
puncte de Python este cât de ușor este

5439
03:59:32,720 --> 03:59:38,080
citește și lucrează cu. Indentarea

5440
03:59:34,479 --> 03:59:40,880
chiar ajuta. Deci, pentru a rezuma acest lucru, noi

5441
03:59:38,080 --> 03:59:43,920
va trebui să folosească indentarea.

5442
03:59:40,880 --> 03:59:47,199
Oricând avem

5443
03:59:43,920 --> 03:59:48,479
o declarație cu două puncte. Oricând noi

5444
03:59:47,199 --> 03:59:50,000
avem o declarație cu două puncte, suntem

5445
03:59:48,479 --> 03:59:52,160
va trebui să aibă o indentare

5446
03:59:50,000 --> 03:59:53,840
urmează-l imediat. Și există

5447
03:59:52,160 --> 03:59:59,120
anumite afirmații care au două puncte

5448
03:59:53,840 --> 04:00:01,120
like if, else, else if și orice buclă,

5449
03:59:59,120 --> 04:00:02,640
orice declarație în buclă. Acum, toate acestea

5450
04:00:01,120 --> 04:00:05,120
lucruri despre care vom învăța, vom învăța

5451
04:00:02,640 --> 04:00:08,239
aflați despre asta în următoarea noastră lecție.

5452
04:00:05,120 --> 04:00:10,479
Dar oricând avem colon, acesta este

5453
04:00:08,239 --> 04:00:13,199
semnalând interpretului, bine, acolo

5454
04:00:10,479 --> 04:00:15,760
trebuie să fie un bloc de cod care urmează

5455
04:00:13,199 --> 04:00:18,560
asta, care este, da, cum spui tu,

5456
04:00:15,760 --> 04:00:20,800
Romero, este ca o ierarhie. Da,

5457
04:00:18,560 --> 04:00:23,199
este un mod grozav de a gândi.

5458
04:00:20,800 --> 04:00:26,640
Se spune, bine, ar trebui să verific asta,

5459
04:00:23,199 --> 04:00:28,800
atunci fă asta dacă este adevărat.

5460
04:00:26,640 --> 04:00:30,479
care îi spune interpretului doar asta

5461
04:00:28,800 --> 04:00:32,560
urmând a fi executat în cazul în care

5462
04:00:30,479 --> 04:00:35,960
acest lucru este de fapt adevărat. Altfel, sunt

5463
04:00:32,560 --> 04:00:35,960
va continua.

5464
04:00:42,000 --> 04:00:45,520
Bine.

5465
04:00:44,160 --> 04:00:46,880
În regulă. Orice întrebări despre

5466
04:00:45,520 --> 04:00:48,239
indentare? Acesta este ceva ce suntem

5467
04:00:46,880 --> 04:00:50,160
vom afla mai multe pe măsură ce mergem

5468
04:00:48,239 --> 04:00:51,680
de-a lungul. Când folosim indentarea și

5469
04:00:50,160 --> 04:00:53,680
cand nu facem? O să învățăm

5470
04:00:51,680 --> 04:00:57,600
despre asta când intrăm în if else

5471
04:00:53,680 --> 04:00:59,680
și buclele pe care le vom studia.

5472
04:00:57,600 --> 04:01:03,279
Dar dacă facem, mă lăsam să vă întreb

5473
04:00:59,680 --> 04:01:07,399
aceasta. Înțelegem ideea sau

5474
04:01:03,279 --> 04:01:07,399
intenția din spatele indentării?

5475
04:01:07,520 --> 04:01:12,800
Avem aproximativ ideea asta? Noi nu noi

5476
04:01:10,640 --> 04:01:15,439
nu stiu inca cand sa o folosesc. primesc

5477
04:01:12,800 --> 04:01:18,640
că. Dar mai mult intenția sau scopul

5478
04:01:15,439 --> 04:01:21,040
de a-l folosi este să-ți placă cu adevărat secțiunea

5479
04:01:18,640 --> 04:01:23,920
lucrurile sunt oprite.

5480
04:01:21,040 --> 04:01:26,640
Da.

5481
04:01:23,920 --> 04:01:30,520
Bine. Bun. Bun. Bun. Bun. Mă bucur să

5482
04:01:26,640 --> 04:01:30,520
auzi asta. Bine.

5483
04:01:36,640 --> 04:01:40,080
Bine.

5484
04:01:38,160 --> 04:01:43,680
Să încheiem astăzi vorbind despre

5485
04:01:40,080 --> 04:01:47,199
comentarii. Deci, ce sunt comentariile?

5486
04:01:43,680 --> 04:01:52,000
Acestea sunt ca adnotări sau note pentru

5487
04:01:47,199 --> 04:01:53,920
tine care sunt complet ignorat de

5488
04:01:52,000 --> 04:01:56,479
interpretul.

5489
04:01:53,920 --> 04:01:59,359
Deci, atunci când codul dvs. este executat,

5490
04:01:56,479 --> 04:02:00,960
comentariul nu joacă niciun rol în ce

5491
04:01:59,359 --> 04:02:02,640
este executat. Interpretul va

5492
04:02:00,960 --> 04:02:04,880
de fapt, ignora-l complet. The

5493
04:02:02,640 --> 04:02:07,279
în momentul în care vede comentariul, o va face

5494
04:02:04,880 --> 04:02:10,399
ignorați-l și treceți la linia următoare.

5495
04:02:07,279 --> 04:02:12,640
Deci scopul este ca oamenii să o facă

5496
04:02:10,399 --> 04:02:16,479
lăsați o notă celorlalți oameni care citesc

5497
04:02:12,640 --> 04:02:18,880
cod și care este foarte puternic este să fie

5498
04:02:16,479 --> 04:02:22,239
capabil să le citească pentru a le lăsa pe acelea

5499
04:02:18,880 --> 04:02:25,600
note și să nu afecteze actualul

5500
04:02:22,239 --> 04:02:28,239
cod care este de fapt executat.

5501
04:02:25,600 --> 04:02:30,960
Deci, există mai multe moduri de a face

5502
04:02:28,239 --> 04:02:34,640
comentarii în interiorul Python. Cel mai mult

5503
04:02:30,960 --> 04:02:36,800
de bază este să folosiți simbolul lire sterline. Deci

5504
04:02:34,640 --> 04:02:38,800
amintiți-vă că nu putem folosi simbolurile lire sterline pentru

5505
04:02:36,800 --> 04:02:41,120
numesc orice.

5506
04:02:38,800 --> 04:02:44,560
Acesta este motivul pentru că simbolul liră este

5507
04:02:41,120 --> 04:02:47,279
este rezervat pentru a face comentarii. Deci tu

5508
04:02:44,560 --> 04:02:50,960
tu când ai simbolul lirei ca

5509
04:02:47,279 --> 04:02:53,120
asta uh care semnalează imediat către

5510
04:02:50,960 --> 04:02:56,319
interpretează tot ce urmează

5511
04:02:53,120 --> 04:02:58,640
că pe această linie este un comentariu. Oricare

5512
04:02:56,319 --> 04:03:00,960
alt text care urmează că pe asta

5513
04:02:58,640 --> 04:03:05,279
linia este un comentariu. Și de obicei a ta

5514
04:03:00,960 --> 04:03:08,399
editor precum VS Code, Jupiter, Collab

5515
04:03:05,279 --> 04:03:10,640
o va colora diferit, poate ca

5516
04:03:08,399 --> 04:03:12,399
un like pe care îl puteți vedea aici, acesta este un

5517
04:03:10,640 --> 04:03:14,800
Exemplu de Jupiter. Puteți vedea că este amabil

5518
04:03:12,399 --> 04:03:16,880
de un gri deschis,

5519
04:03:14,800 --> 04:03:21,439
gri verzui

5520
04:03:16,880 --> 04:03:23,120
um să semnalez că acesta este un comentariu. Hm

5521
04:03:21,439 --> 04:03:25,920
acum poate te întrebi de ce am avea

5522
04:03:23,120 --> 04:03:29,600
comentarii? Din nou, o să te uiți

5523
04:03:25,920 --> 04:03:30,960
înapoi la cod săptămâni mai târziu,

5524
04:03:29,600 --> 04:03:32,800
mai ales in acest program. Te duci

5525
04:03:30,960 --> 04:03:36,080
să te uiți la cod în revizuire și să fii ca,

5526
04:03:32,800 --> 04:03:38,479
ce făceam acolo? Dacă tu

5527
04:03:36,080 --> 04:03:40,640
lasa un comentariu, iti vei aminti ce

5528
04:03:38,479 --> 04:03:43,760
făceai acolo, de ce ai avut asta

5529
04:03:40,640 --> 04:03:45,439
linie. Hm, și nu numai atât, ca și când

5530
04:03:43,760 --> 04:03:47,520
îți partajezi codul altora, care

5531
04:03:45,439 --> 04:03:50,720
în lumea reală ai face,

5532
04:03:47,520 --> 04:03:52,560
colaborarea cu alții, nu? Adăugând

5533
04:03:50,720 --> 04:03:55,760
în aceste comentarii poate fi cu adevărat

5534
04:03:52,560 --> 04:03:58,160
benefic de făcut. Deci

5535
04:03:55,760 --> 04:04:00,000
mă vei vedea

5536
04:03:58,160 --> 04:04:02,720
pe tot parcursul programului. ma duc

5537
04:04:00,000 --> 04:04:04,720
lăsați o mulțime de comentarii la demonstrațiile noastre și

5538
04:04:02,720 --> 04:04:06,399
caietele noastre la care lucrăm împreună

5539
04:04:04,720 --> 04:04:09,120
în sesiunile live. voi pleca

5540
04:04:06,399 --> 04:04:11,520
comentarii în principal pentru a striga anumite

5541
04:04:09,120 --> 04:04:14,479
lucruri ca să spun că asta este cu adevărat

5542
04:04:11,520 --> 04:04:17,279
pas important sau facem asta

5543
04:04:14,479 --> 04:04:18,880
pentru că voi lăsa multe comentarii

5544
04:04:17,279 --> 04:04:22,080
și vă încurajez să faceți la fel

5545
04:04:18,880 --> 04:04:24,239
în propriul cod. Amintește-ți că sunt

5546
04:04:22,080 --> 04:04:26,319
gratuit. Sunt ignorați de către

5547
04:04:24,239 --> 04:04:29,120
interpret. Ele nu afectează nimic.

5548
04:04:26,319 --> 04:04:32,880
Sunt note pentru tine. Deci, folosește-le

5549
04:04:29,120 --> 04:04:34,239
în consecință. Hm, și știi, există

5550
04:04:32,880 --> 04:04:36,319
de fapt, mai multe moduri de a pleca

5551
04:04:34,239 --> 04:04:39,920
comentarii, dar acesta este, le voi arăta

5552
04:04:36,319 --> 04:04:42,399
pe măsură ce mergem. Dar acesta este cel mai mult

5553
04:04:39,920 --> 04:04:44,000
de bază este tu doar tu introdu a

5554
04:04:42,399 --> 04:04:49,560
simbolul lire sterline și apoi orice altceva

5555
04:04:44,000 --> 04:04:49,560
Urmează că este comentariul tău.

5556
04:04:50,000 --> 04:04:55,040
Bine.

5557
04:04:52,000 --> 04:04:57,600
Bine, băieți. Asta e pentru azi.

5558
04:04:55,040 --> 04:04:58,880
Um, ce prima sesiune grozavă. Multumesc

5559
04:04:57,600 --> 04:05:01,040
voi băieți. Vă mulțumesc băieți pentru că sunteți

5560
04:04:58,880 --> 04:05:02,960
pacient. trec prin configurarea

5561
04:05:01,040 --> 04:05:06,720
unele dintre acele instrumente. Sper că ai aterizat

5562
04:05:02,960 --> 04:05:08,560
pe unul care a funcționat pentru tine. Hm, știi,

5563
04:05:06,720 --> 04:05:10,800
folosește-l pe acesta înainte, te rog. Dacă

5564
04:05:08,560 --> 04:05:13,600
este o colaborare, folosește asta. Jupiter, folosește

5565
04:05:10,800 --> 04:05:15,439
că. VS Code, folosește asta. Orice ai tu

5566
04:05:13,600 --> 04:05:17,840
te simți cel mai confortabil cu,

5567
04:05:15,439 --> 04:05:20,560
te rog foloseste asta. Avem multe de făcut

5568
04:05:17,840 --> 04:05:24,560
acoperi încă. Știi, mergem la um

5569
04:05:20,560 --> 04:05:26,960
continua miercuri. Eram noi

5570
04:05:24,560 --> 04:05:28,640
Vom continua să vorbim despre Python.

5571
04:05:26,960 --> 04:05:31,520
Ne udăm puțin picioarele

5572
04:05:28,640 --> 04:05:33,600
mai departe pe Python. Mult mai mult de acoperit.

5573
04:05:31,520 --> 04:05:35,439
Vom intra în mai mult

5574
04:05:33,600 --> 04:05:39,199
detaliul codului. Deci, va fi

5575
04:05:35,439 --> 04:05:40,800
cu adevărat distractiv. Vom acoperi dacă altfel se face bucle,

5576
04:05:39,199 --> 04:05:44,640
um cum să controlăm fluxul nostru

5577
04:05:40,800 --> 04:05:47,040
program. O să facem asta. Aceasta este

5578
04:05:44,640 --> 04:05:49,520
unde am rămas a fost să scriem comentarii

5579
04:05:47,040 --> 04:05:52,239
în codul Python, ceea ce am vrut

5580
04:05:49,520 --> 04:05:56,160
reamintește-ne cum să facem asta. se duce

5581
04:05:52,239 --> 04:05:58,399
să folosești simbolul liră uh pentru a

5582
04:05:56,160 --> 04:05:59,920
initiaza un comentariu. Și practic cel

5583
04:05:58,399 --> 04:06:03,199
Interpretul Python va ignora

5584
04:05:59,920 --> 04:06:05,840
orice altceva de pe acea linie. Uh e

5585
04:06:03,199 --> 04:06:08,720
tratează tot acel text ca pe un comentariu.

5586
04:06:05,840 --> 04:06:10,319
Și din nou comentariile like sunt gratuite. Tu

5587
04:06:08,720 --> 04:06:12,560
ar putea la fel de bine să le folosească în avantajul tău

5588
04:06:10,319 --> 04:06:15,920
să-ți lași o notă

5589
04:06:12,560 --> 04:06:17,439
de hei, asta este ceea ce face acest cod.

5590
04:06:15,920 --> 04:06:20,640
Așa că atunci când te întorci și citești

5591
04:06:17,439 --> 04:06:24,399
uh poti sa intelegi mai bine. Deci eu

5592
04:06:20,640 --> 04:06:27,520
Vă încurajăm, băieți, ca atunci când facem demonstrații

5593
04:06:24,399 --> 04:06:30,720
și vom face o mulțime de demonstrații

5594
04:06:27,520 --> 04:06:34,000
mai ales azi lasa comentarii stii

5595
04:06:30,720 --> 04:06:36,000
pune comentarii acolo ca să poți face

5596
04:06:34,000 --> 04:06:40,000
o notă pentru tine care este acest cod

5597
04:06:36,000 --> 04:06:41,439
făcându-mi, așa că vei primi, cred că o va face

5598
04:06:40,000 --> 04:06:44,399
fii bine să prinzi obiceiul de a pleca

5599
04:06:41,439 --> 04:06:47,439
comentarii pentru a marca codul

5600
04:06:44,399 --> 04:06:49,840
pentru a-ți aminti într-un fel oh asta este

5601
04:06:47,439 --> 04:06:52,880
ce făcea când te uiți înapoi la

5602
04:06:49,840 --> 04:06:56,880
uh in viitor.

5603
04:06:52,880 --> 04:06:59,040
Bine. Așa că am încheiat cu asta.

5604
04:06:56,880 --> 04:07:02,160
Ceea ce am vrut să fac a fost să trec mai departe în

5605
04:06:59,040 --> 04:07:05,120
următorul diapozitiv. Deci, vorbește despre um

5606
04:07:02,160 --> 04:07:06,640
cum afișăm rezultatul pe ecran

5607
04:07:05,120 --> 04:07:08,399
despre care am văzut deja un exemplu

5608
04:07:06,640 --> 04:07:11,279
când am făcut lumea bună care este

5609
04:07:08,399 --> 04:07:14,880
funcția de imprimare în partea dreaptă. Deci asta este

5610
04:07:11,279 --> 04:07:18,239
a apropo, aceasta este o funcție Python

5611
04:07:14,880 --> 04:07:21,520
și știi că este o funcție pentru că

5612
04:07:18,239 --> 04:07:23,840
dintre aceste paranteze. Deci astea

5613
04:07:21,520 --> 04:07:25,840
semnal din paranteză că acesta este a

5614
04:07:23,840 --> 04:07:28,160
funcția deoarece se așteaptă la un fel de

5615
04:07:25,840 --> 04:07:30,239
intrare pentru a intra în acele paranteze.

5616
04:07:28,160 --> 04:07:34,080
Și și intrarea care ar intra înăuntru

5617
04:07:30,239 --> 04:07:36,960
de acolo va fi text ca unele

5618
04:07:34,080 --> 04:07:39,439
un fel de text care

5619
04:07:36,960 --> 04:07:43,520
face parte din ghilimele. si orice

5620
04:07:39,439 --> 04:07:45,520
am pus acolo um va afișa pe

5621
04:07:43,520 --> 04:07:47,520
ecran. Deci, este util să ne placă

5622
04:07:45,520 --> 04:07:49,920
afișează informații

5623
04:07:47,520 --> 04:07:53,199
um print am spune că tipărim

5624
04:07:49,920 --> 04:07:55,120
transmite informațiile pe ecran. Hm, dacă

5625
04:07:53,199 --> 04:07:57,120
vrem să știm valoarea unei variabile

5626
04:07:55,120 --> 04:08:00,399
sau valoarea a ceva ce suntem

5627
04:07:57,120 --> 04:08:02,960
făcând un calcul cu sau știi

5628
04:08:00,399 --> 04:08:05,600
Verificăm ceva în codul nostru noi

5629
04:08:02,960 --> 04:08:07,680
îl pot imprima care ar fi folosit

5630
04:08:05,600 --> 04:08:10,640
funcția de imprimare și se va afișa

5631
04:08:07,680 --> 04:08:14,000
acea valoare pe ecran. Deci vom face

5632
04:08:10,640 --> 04:08:15,120
folosește destul de mult funcția de imprimare. Hm

5633
04:08:14,000 --> 04:08:18,319
știi că nu am învățat ce

5634
04:08:15,120 --> 04:08:22,399
funcțiile nu sunt decât funcții în Python

5635
04:08:18,319 --> 04:08:25,760
știi că ești conceput să fie niște bucăți

5636
04:08:22,399 --> 04:08:28,000
de cod care execută și face ceva

5637
04:08:25,760 --> 04:08:29,359
și ei iau argumente și tu știi asta

5638
04:08:28,000 --> 04:08:31,920
ia o ceartă din cauza

5639
04:08:29,359 --> 04:08:33,600
paranteză care semnalează că

5640
04:08:31,920 --> 04:08:36,000
ar trebui să fie ceva înăuntru

5641
04:08:33,600 --> 04:08:38,479
această paranteză aici care urmează să

5642
04:08:36,000 --> 04:08:40,800
fi uh text. Deci orice text doriți

5643
04:08:38,479 --> 04:08:43,840
afișare sau poate vreo variabilă pe care o doriți

5644
04:08:40,800 --> 04:08:45,439
pentru a afișa um care ar intra înăuntru

5645
04:08:43,840 --> 04:08:47,920
acolo. Deci ne vom apuca de folosire

5646
04:08:45,439 --> 04:08:49,359
funcția de imprimare pe măsură ce mergem mai departe dar

5647
04:08:47,920 --> 04:08:52,560
am vrut doar să strig asta e

5648
04:08:49,359 --> 04:08:54,239
metodologia primară de tip um

5649
04:08:52,560 --> 04:08:58,080
afișând ceva pe ecran dacă noi

5650
04:08:54,239 --> 04:09:03,120
doriți să imprimați. Hm acum

5651
04:08:58,080 --> 04:09:05,920
invers este să ceri unui utilizator să facă

5652
04:09:03,120 --> 04:09:09,680
uh introduce niște date. Deci asta ar fi

5653
04:09:05,920 --> 04:09:12,160
această funcție de intrare și asta este

5654
04:09:09,680 --> 04:09:15,439
ceva care uh după cum puteți vedea un

5655
04:09:12,160 --> 04:09:17,680
exemplul de mai jos este că putem pune ceva text

5656
04:09:15,439 --> 04:09:19,520
în interiorul acestei paranteze. Deci din nou a

5657
04:09:17,680 --> 04:09:23,520
functie are acele paranteze care

5658
04:09:19,520 --> 04:09:25,920
semnalează că este o funcție. um,

5659
04:09:23,520 --> 04:09:29,600
și putem pune ceva text acolo care

5660
04:09:25,920 --> 04:09:33,199
ar fi un fel de ceea ce se afișează în

5661
04:09:29,600 --> 04:09:35,680
utilizator ca un fel de prompt ca aici. Uh,

5662
04:09:33,199 --> 04:09:37,439
introduceți-vă numele și se va afișa

5663
04:09:35,680 --> 04:09:39,600
pe ecran și apoi ar fi un

5664
04:09:37,439 --> 04:09:41,199
cutie de lângă ea. Am să ne arăt

5665
04:09:39,600 --> 04:09:44,319
aceasta. Chiar o să conduc asta

5666
04:09:41,199 --> 04:09:46,800
în interiorul unui caiet într-un minut. Dar

5667
04:09:44,319 --> 04:09:50,239
atunci ar exista o casetă care se afișează

5668
04:09:46,800 --> 04:09:52,399
că asta ar spune um hei, știi

5669
04:09:50,239 --> 04:09:55,600
introduceți-vă numele și apoi puteți introduce

5670
04:09:52,399 --> 04:09:58,479
introduceți uh și apoi când loviți

5671
04:09:55,600 --> 04:10:01,600
introduceți-l va salva acea intrare în

5672
04:09:58,479 --> 04:10:04,880
această variabilă numită nume. Deci um și

5673
04:10:01,600 --> 04:10:08,800
amintiți-vă numele acesta este un identificator valid

5674
04:10:04,880 --> 04:10:11,920
deoarece începe cu minuscule n um

5675
04:10:08,800 --> 04:10:13,680
care este în regulă și are totul valabil

5676
04:10:11,920 --> 04:10:17,040
personaje. Nu are nicio nebunie,

5677
04:10:13,680 --> 04:10:19,680
știi, uh, simbolul lirei sau la sau

5678
04:10:17,040 --> 04:10:22,399
orice nebunie. Deci, este decent

5679
04:10:19,680 --> 04:10:25,840
identificator. um,

5680
04:10:22,399 --> 04:10:28,239
deci numele nume ar fi ok. Și astfel de intrare

5681
04:10:25,840 --> 04:10:30,160
este oricând vrei să obții oricând

5682
04:10:28,239 --> 04:10:32,479
doresc să permită utilizatorului să introducă

5683
04:10:30,160 --> 04:10:35,760
ceva de genul va aduce o casetă de text

5684
04:10:32,479 --> 04:10:38,319
și pot introduce unele date. Hm, și

5685
04:10:35,760 --> 04:10:40,399
care va fi mântuit în aceasta orice

5686
04:10:38,319 --> 04:10:44,080
variabila pe care o numești pe aceasta, ai setat-o egală cu

5687
04:10:40,399 --> 04:10:45,760
intrare. Um, și apoi poți vedea ca

5688
04:10:44,080 --> 04:10:48,720
de îndată ce punem asta, imediat

5689
04:10:45,760 --> 04:10:50,960
de aceea îl putem afișa. Așa că imprimăm

5690
04:10:48,720 --> 04:10:53,040
salut si apoi virgula nume care

5691
04:10:50,960 --> 04:10:54,560
face referire la orice am stocat

5692
04:10:53,040 --> 04:10:57,760
introducerea utilizatorului acolo. Așa că mă duc

5693
04:10:54,560 --> 04:11:01,520
pentru a ne arăta un exemplu în acest sens. Hm, dar

5694
04:10:57,760 --> 04:11:04,319
input este ceea ce get este calea noastră principală

5695
04:11:01,520 --> 04:11:07,279
obținerea de informații de la utilizator

5696
04:11:04,319 --> 04:11:08,720
într-o casetă de text, astfel încât să putem folosi acele date în

5697
04:11:07,279 --> 04:11:11,680
programul nostru.

5698
04:11:08,720 --> 04:11:13,840
Imprimarea este modalitatea noastră principală de afișare

5699
04:11:11,680 --> 04:11:16,319
date pe care le avem deja în codul nostru.

5700
04:11:13,840 --> 04:11:17,920
Îl putem imprima, care îl va afișa.

5701
04:11:16,319 --> 04:11:19,439
Hm

5702
04:11:17,920 --> 04:11:20,880
așa că vom vedea multe exemple de

5703
04:11:19,439 --> 04:11:24,319
acestea ca de-a lungul dar am vrut doar să sun

5704
04:11:20,880 --> 04:11:26,960
afară cei doi. Acestea

5705
04:11:24,319 --> 04:11:29,680
funcțiile de altfel sunt încorporate

5706
04:11:26,960 --> 04:11:31,680
Python. Deci nu trebuie să le creăm

5707
04:11:29,680 --> 04:11:34,319
noi înșine. Ele există deja. Ei sunt

5708
04:11:31,680 --> 04:11:36,000
deja încorporat în Python. Hm nimic

5709
04:11:34,319 --> 04:11:38,000
special pe care trebuie să le facem pentru a le folosi. Noi

5710
04:11:36,000 --> 04:11:39,920
le puteți folosi imediat din cutie.

5711
04:11:38,000 --> 04:11:41,199
Deci, din nou, vom vedea acest lucru în nostru în nostru

5712
04:11:39,920 --> 04:11:44,359
exemple de cod pe care le vom face

5713
04:11:41,199 --> 04:11:44,359
un minut.

5714
04:11:45,439 --> 04:11:51,760
Hm, unde ar fi mai exact un utilizator final?

5715
04:11:47,520 --> 04:11:53,920
Așa că poate le cerem o contribuție. um,

5716
04:11:51,760 --> 04:11:57,600
și apoi facem place așa că le cerem

5717
04:11:53,920 --> 04:12:00,160
unora le place numele lor, adresa de e-mail, lor

5718
04:11:57,600 --> 04:12:01,680
uh data nașterii, astfel de lucruri.

5719
04:12:00,160 --> 04:12:03,680
Putem întreba în intrare și apoi noi

5720
04:12:01,680 --> 04:12:05,760
poate le stocăm într-o bază de date sau noi

5721
04:12:03,680 --> 04:12:09,840
face ceva cu el în codul Python.

5722
04:12:05,760 --> 04:12:11,680
Deci ori de câte ori doriți să acceptați intrarea

5723
04:12:09,840 --> 04:12:14,319
de la un utilizator final, atunci ai face-o

5724
04:12:11,680 --> 04:12:17,040
utilizați această intrare.

5725
04:12:14,319 --> 04:12:18,720
Depinde doar de aplicație

5726
04:12:17,040 --> 04:12:20,800
direct pe aplicație cum ar fi ce fel

5727
04:12:18,720 --> 04:12:25,160
de date de intrare pe care doriți să le acceptați

5728
04:12:20,800 --> 04:12:25,160
de la utilizator.

5729
04:12:27,600 --> 04:12:31,720
Bine. Bine. Deci, am să ne arăt

5730
04:12:28,720 --> 04:12:31,720
aceasta.

5731
04:12:33,520 --> 04:12:38,479
Înainte să facem demonstrația,

5732
04:12:36,239 --> 04:12:40,960
um, permiteți-mi să vă întreb, băieți, care dintre ele

5733
04:12:38,479 --> 04:12:43,279
urmatoarele ne amintim de luni?

5734
04:12:40,960 --> 04:12:46,080
Care dintre următoarele nume de identificare

5735
04:12:43,279 --> 04:12:50,720
urmează regulile lui Python

5736
04:12:46,080 --> 04:12:52,560
și cele mai bune practici pentru lizibilitate?

5737
04:12:50,720 --> 04:12:54,239
Deci nu numai așa ar trebui să cauți

5738
04:12:52,560 --> 04:13:00,720
alegerea de răspuns aici care urmează

5739
04:12:54,239 --> 04:13:04,399
reguli, dar este și un nume cu sens.

5740
04:13:00,720 --> 04:13:06,640
O mulțime de alegeri diferite. Bine.

5741
04:13:04,399 --> 04:13:08,640
Apropo,

5742
04:13:06,640 --> 04:13:10,000
care ma lasa sa intreb lasa-ma ca ma voi intoarce

5743
04:13:08,640 --> 04:13:11,680
la răspunsul la întrebarea inițială,

5744
04:13:10,000 --> 04:13:14,080
dar permiteți-mi să întreb această alternativă

5745
04:13:11,680 --> 04:13:17,199
întrebare. Care dintre acestea nu este

5746
04:13:14,080 --> 04:13:20,080
valabil? Înseamnă că ar fi Python

5747
04:13:17,199 --> 04:13:22,319
aruncă o eroare cum îl folosești.

5748
04:13:20,080 --> 04:13:25,199
În care dintre acestea nu este valabilă

5749
04:13:22,319 --> 04:13:27,040
general?

5750
04:13:25,199 --> 04:13:28,960
Rece. Mare. Este C. Voi ați fost

5751
04:13:27,040 --> 04:13:31,439
chiar deasupra. Foarte bun. Deci C este

5752
04:13:28,960 --> 04:13:35,439
nu este valabil. Numele lucrurilor nu pot

5753
04:13:31,439 --> 04:13:37,520
începe cu un număr. Deci, asta e C

5754
04:13:35,439 --> 04:13:41,520
este complet invalidă în general şi

5755
04:13:37,520 --> 04:13:43,120
asta ar produce o eroare.

5756
04:13:41,520 --> 04:13:46,080
Corect. Începe cu un număr. Exact.

5757
04:13:43,120 --> 04:13:49,439
Ceea ce nu putem face. Acum, începând cu un

5758
04:13:46,080 --> 04:13:51,840
sublinierea este în regulă. asta e permis. Deci

5759
04:13:49,439 --> 04:13:55,199
asta nu este o problemă. Și având un număr

5760
04:13:51,840 --> 04:13:59,520
fii al doilea după ce sublinierea este în regulă

5761
04:13:55,199 --> 04:14:01,439
de asemenea. Deci, din punct de vedere tehnic, A și B ar fi

5762
04:13:59,520 --> 04:14:06,159
urmați regulile. Deci acelea cu siguranță

5763
04:14:01,439 --> 04:14:10,399
urmați regulile. Ei acum sunt

5764
04:14:06,159 --> 04:14:15,359
lizibilă și semnificativă este întrebarea.

5765
04:14:10,399 --> 04:14:18,080
Aș susține că, probabil, nu. Var 123

5766
04:14:15,359 --> 04:14:20,000
este destul de generic. Aș argumenta că

5767
04:14:18,080 --> 04:14:22,399
chiar dacă este valid, ca Python

5768
04:14:20,000 --> 04:14:24,720
nu ar avea nicio eroare cu asta

5769
04:14:22,399 --> 04:14:26,560
numele variabilei, nu prea are sens.

5770
04:14:24,720 --> 04:14:28,319
Este prea generic. E aproape ca și cum noi

5771
04:14:26,560 --> 04:14:32,720
Tocmai am sunat ceva X. Tocmai am sunat

5772
04:14:28,319 --> 04:14:34,880
ceva var 23, probabil că nu este

5773
04:14:32,720 --> 04:14:36,319
va fi semnificativ pentru noi și suntem

5774
04:14:34,880 --> 04:14:37,439
nu o să înțeleg de fapt ce anume

5775
04:14:36,319 --> 04:14:41,120
reprezintă. Dacă ar veni cineva

5776
04:14:37,439 --> 04:14:43,199
împreună și citiți-l și vedeți VAR 123,

5777
04:14:41,120 --> 04:14:45,359
probabil că nu este atât de grozav

5778
04:14:43,199 --> 04:14:49,680
nume. Nu ne spune exact ce

5779
04:14:45,359 --> 04:14:52,560
care reprezintă. Deci, aș spune că A este

5780
04:14:49,680 --> 04:14:56,159
probabil nu um

5781
04:14:52,560 --> 04:14:57,840
A nu este probabil o alegere bună și C

5782
04:14:56,159 --> 04:15:00,159
știm că este invalid. Deci, chiar cred

5783
04:14:57,840 --> 04:15:02,880
singurele două opțiuni pe care le poți argumenta sunt

5784
04:15:00,159 --> 04:15:07,120
B și D. Cred că D este foarte bun

5785
04:15:02,880 --> 04:15:09,359
răspuns. Ea respectă regulile.

5786
04:15:07,120 --> 04:15:13,199
Uh, sublinierea sunt în regulă. Totul este

5787
04:15:09,359 --> 04:15:15,920
litere mici. Asta e bine. Hm, deci este valabil

5788
04:15:13,199 --> 04:15:19,840
dar are și semnificație ca nume

5789
04:15:15,920 --> 04:15:21,600
corect, deci valoarea rezultatului final um noi

5790
04:15:19,840 --> 04:15:22,960
ar trebui probabil ca în codul nostru noi

5791
04:15:21,600 --> 04:15:25,520
ar avea context am ști ce

5792
04:15:22,960 --> 04:15:27,359
asta înseamnă bine, acesta este rezultatul nostru final

5793
04:15:25,520 --> 04:15:32,800
deci ăsta e un nume destul de bun

5794
04:15:27,359 --> 04:15:35,920
pentru ceva um știi că acesta este

5795
04:15:32,800 --> 04:15:40,239
bine, pur și simplu nu este atât de lizibil 321

5796
04:15:35,920 --> 04:15:42,720
Tabel DB detalii client este în regulă I

5797
04:15:40,239 --> 04:15:46,399
nu crede că nu e cel mai rău.

5798
04:15:42,720 --> 04:15:48,479
Cu siguranță ar funcționa, dar este um

5799
04:15:46,399 --> 04:15:50,399
un fel de nume greoi. Sunt sigur că am putea

5800
04:15:48,479 --> 04:15:52,640
veni cu ceva mai bun, dar asta

5801
04:15:50,399 --> 04:15:55,600
ar funcționa tehnic. Nu ar fi

5802
04:15:52,640 --> 04:15:58,159
probleme cu el.

5803
04:15:55,600 --> 04:16:00,000
Bine. Deci, cred că D este probabil cel mai bun

5804
04:15:58,159 --> 04:16:01,920
alegere, dar și B este valabil. cred ca B

5805
04:16:00,000 --> 04:16:05,159
ar putea lucra pentru asta. D și B, cred,

5806
04:16:01,920 --> 04:16:05,159
sunt bine.

5807
04:16:05,920 --> 04:16:08,880
Bine. Bun. Bun. Aveți dreptate băieți

5808
04:16:07,439 --> 04:16:11,760
pe deasupra. ai un bun cred ca tu

5809
04:16:08,880 --> 04:16:15,359
au o senzație bună pentru ceea ce este permis

5810
04:16:11,760 --> 04:16:17,760
Numele lucrurilor sunt ceea ce este bine.

5811
04:16:15,359 --> 04:16:19,760
Bine.

5812
04:16:17,760 --> 04:16:22,640
Hm

5813
04:16:19,760 --> 04:16:26,479
Apoi voi trece la asta

5814
04:16:22,640 --> 04:16:29,120
demonstrație. Deci, băieți, ar trebui să aveți uh

5815
04:16:26,479 --> 04:16:31,199
demos um și am cam trecut prin

5816
04:16:29,120 --> 04:16:34,319
unele dintre cele primele câteva ultima dată pentru a obţine

5817
04:16:31,199 --> 04:16:39,120
te-ai instalat pe Cola și Jupiter și VS

5818
04:16:34,319 --> 04:16:42,159
Cod. Um, voi folosi Collab

5819
04:16:39,120 --> 04:16:43,520
pentru majoritatea acestora, dar nu ezitați să le utilizați

5820
04:16:42,159 --> 04:16:45,920
orice vrei să folosești. Dacă vrei

5821
04:16:43,520 --> 04:16:47,359
utilizați Jupiter, dacă doriți să utilizați VS Code

5822
04:16:45,920 --> 04:16:49,199
și rulați-vă caietele pe cont propriu

5823
04:16:47,359 --> 04:16:50,560
mașină, simțiți-vă liber să utilizați orice aveți

5824
04:16:49,199 --> 04:16:54,159
vrei sa folosesti. O să folosesc

5825
04:16:50,560 --> 04:16:57,359
Colaborați doar pentru simplitate.

5826
04:16:54,159 --> 04:17:00,000
Um, deci, acest demo ne va ajuta

5827
04:16:57,359 --> 04:17:02,159
prin, um, deschiderea unei noi colaborari

5828
04:17:00,000 --> 04:17:04,560
notebook și apoi rulează acele intrări

5829
04:17:02,159 --> 04:17:06,960
și tipăriți. Deci, câteva exemple cu intrare

5830
04:17:04,560 --> 04:17:12,199
și tipăriți. Um, deci vom face asta

5831
04:17:06,960 --> 04:17:12,199
împreună. Lasă-mă să trec la acel demo.

5832
04:17:13,600 --> 04:17:20,239
Așadar, dacă ne urmărești, noi suntem

5833
04:17:15,279 --> 04:17:25,479
o să fac demo 4. Deci, asta

5834
04:17:20,239 --> 04:17:25,479
ar trebui să fie lecția unu, demonstrația 4.

5835
04:17:27,199 --> 04:17:32,319
Băieți, aveți asta? Dă-ți o

5836
04:17:30,399 --> 04:17:35,120
moment pentru a trage asta în sus. Lecția unu,

5837
04:17:32,319 --> 04:17:37,680
demonstrație 4.

5838
04:17:35,120 --> 04:17:39,760
Aveți acces la acesta. Deci, noi

5839
04:17:37,680 --> 04:17:41,439
am făcut unul, doi și trei

5840
04:17:39,760 --> 04:17:45,199
Luni, care tocmai le primeau

5841
04:17:41,439 --> 04:17:48,239
medii configurate. Deci, acesta este demonstrația 4.

5842
04:17:45,199 --> 04:17:50,319
Um, ceea ce din nou, știu că primul pas spune

5843
04:17:48,239 --> 04:17:52,159
colaborare deschisă. Simte-te liber să-l deschizi pe al tău

5844
04:17:50,319 --> 04:17:53,600
notebook-ul în VS Code sau deschide-l pe al tău

5845
04:17:52,159 --> 04:17:57,040
caiet și în Jupiter, indiferent

5846
04:17:53,600 --> 04:17:58,880
te simți cel mai confortabil. um,

5847
04:17:57,040 --> 04:18:01,199
Voi folosi colaborarea pentru a

5848
04:17:58,880 --> 04:18:03,199
faceți asta, dar simțiți-vă liber să utilizați orice

5849
04:18:01,199 --> 04:18:05,840
lucrări. Tu ești, chiar avem nevoie de un

5850
04:18:03,199 --> 04:18:07,439
notebook pentru a putea rula acest cod.

5851
04:18:05,840 --> 04:18:09,840
Deci, oricum ai rula notebook-uri,

5852
04:18:07,439 --> 04:18:13,760
fie că este în VS Code sau Jupiter sau

5853
04:18:09,840 --> 04:18:15,680
Colaborare, eu oricare dintre acestea, oricare dintre ele este uh

5854
04:18:13,760 --> 04:18:18,000
perfect bine.

5855
04:18:15,680 --> 04:18:19,840
Deci, primul pas este să deschideți a

5856
04:18:18,000 --> 04:18:22,800
caietul. O voi face în Collab,

5857
04:18:19,840 --> 04:18:24,800
ceea ce spune asta. Hm, și apoi

5858
04:18:22,800 --> 04:18:26,640
poți să faci un caiet nou și apoi

5859
04:18:24,800 --> 04:18:30,800
redenumiți-l la primul meu program. eu merg

5860
04:18:26,640 --> 04:18:32,159
să faci asta într-o secundă. Și apoi, um, așa

5861
04:18:30,800 --> 04:18:33,680
O să trec prin acest live cu

5862
04:18:32,159 --> 04:18:36,640
tu, dar doar îți arăt câteva dintre ele

5863
04:18:33,680 --> 04:18:38,640
pașii pe care îi vom face. Um, primul

5864
04:18:36,640 --> 04:18:40,960
ceea ce vom face este doar

5865
04:18:38,640 --> 04:18:44,880
exersați să faceți print Hello World

5866
04:18:40,960 --> 04:18:47,520
din nou, astfel încât să putem executa o imprimare

5867
04:18:44,880 --> 04:18:51,600
declarație. Deci, vom practica asta.

5868
04:18:47,520 --> 04:18:55,040
Vom face o a doua celulă. um,

5869
04:18:51,600 --> 04:18:56,800
ceea ce putem face în Collab sau VS Code sau

5870
04:18:55,040 --> 04:18:59,120
Jupiter apăsând butonul plus.

5871
04:18:56,800 --> 04:19:02,000
De obicei există un plus. Uh, poți vedea

5872
04:18:59,120 --> 04:19:03,760
e aici. Uh, în mai multe locuri în

5873
04:19:02,000 --> 04:19:06,239
Colaborare, o puteți face chiar sub an

5874
04:19:03,760 --> 04:19:08,080
celulă existentă sau există întotdeauna un plus

5875
04:19:06,239 --> 04:19:09,760
cod aici, care este cam ceea ce dvs

5876
04:19:08,080 --> 04:19:12,239
au în Jupiter. De obicei, în Jupiter, tu

5877
04:19:09,760 --> 04:19:13,920
au un buton plus. Deci, poți doar lovi

5878
04:19:12,239 --> 04:19:17,600
apăsați butonul plus, va face un nou

5879
04:19:13,920 --> 04:19:21,040
celulă. Um, și așa vom face o nouă celulă

5880
04:19:17,600 --> 04:19:22,560
ca să putem scrie mai mult cod.

5881
04:19:21,040 --> 04:19:24,560
um,

5882
04:19:22,560 --> 04:19:27,359
si apoi in aceasta noua, mergem

5883
04:19:24,560 --> 04:19:28,479
să exersăm să faci niște comentarii.

5884
04:19:27,359 --> 04:19:32,479
Vom exersa să facem câteva

5885
04:19:28,479 --> 04:19:36,000
comentarii și apoi vedem cum putem face

5886
04:19:32,479 --> 04:19:37,199
mai multe declarații tipărite. Bine, deci

5887
04:19:36,000 --> 04:19:39,120
hai sa facem asta. Lasă-mă să sar peste

5888
04:19:37,199 --> 04:19:43,439
Colaborare. Să trecem prin acestea mai întâi

5889
04:19:39,120 --> 04:19:45,279
câțiva pași împreună. Um, și apoi uh

5890
04:19:43,439 --> 04:19:46,640
vom reveni la asta și vom termina

5891
04:19:45,279 --> 04:19:48,000
restul pașilor pentru că și noi suntem

5892
04:19:46,640 --> 04:19:51,040
va face intrare. Așa că o să arăt

5893
04:19:48,000 --> 04:19:53,199
tu cum să faci aceste uh input care va

5894
04:19:51,040 --> 04:19:56,479
puteți vedea aici ca și cum merge intrarea

5895
04:19:53,199 --> 04:19:58,720
pentru a crea o casetă de text în care puteți pune

5896
04:19:56,479 --> 04:20:01,920
intrare și va apăsați pe enter va

5897
04:19:58,720 --> 04:20:04,560
păstrează-l pentru tine. Deci intrarea vă permite

5898
04:20:01,920 --> 04:20:08,319
obțineți intrare de la tastatură

5899
04:20:04,560 --> 04:20:10,319
și salvați-o într-o variabilă pentru a o folosi

5900
04:20:08,319 --> 04:20:15,359
mai târziu.

5901
04:20:10,319 --> 04:20:18,800
Bine. Deci, să sărim peste

5902
04:20:15,359 --> 04:20:20,159
hai să sărim peste

5903
04:20:18,800 --> 04:20:22,560
O să ne arăt, o să ne arăt într-o secundă.

5904
04:20:20,159 --> 04:20:24,800
Cum îl redenumiți?

5905
04:20:22,560 --> 04:20:27,800
Îți voi arăta. Lasă-mă să sar peste

5906
04:20:24,800 --> 04:20:27,800
colaborare.

5907
04:20:28,640 --> 04:20:31,640
Hm

5908
04:20:36,239 --> 04:20:42,239
bine.

5909
04:20:37,840 --> 04:20:45,120
Deci, am terminat lecția unu, demonstrația 4. Da,

5910
04:20:42,239 --> 04:20:46,800
asta facem noi.

5911
04:20:45,120 --> 04:20:50,199
Bine. Deci, sunt în Colab. ma duc

5912
04:20:46,800 --> 04:20:50,199
începe un nou caiet.

5913
04:20:51,600 --> 04:20:54,960
Începeți un nou blocnotes în Colab. Uh, deci

5914
04:20:53,760 --> 04:20:57,760
acum sunt aici. Sunt doar pe un proaspăt

5915
04:20:54,960 --> 04:20:59,600
caietul. Hm, nimic atât de interesant

5916
04:20:57,760 --> 04:21:03,359
merge mai departe. Iată cum îl redenumiți. doar

5917
04:20:59,600 --> 04:21:06,560
du-te la această casetă din stânga

5918
04:21:03,359 --> 04:21:10,080
și aproape ca un document Google doar

5919
04:21:06,560 --> 04:21:12,479
uh faceți clic pe acel nume și apoi începeți

5920
04:21:10,080 --> 04:21:14,319
tastând pentru a-l șterge. Așa că vezi cum sunt

5921
04:21:12,479 --> 04:21:16,399
trecând peste acest nume și apoi sunt

5922
04:21:14,319 --> 04:21:18,560
dând clic pe el și apoi pot începe

5923
04:21:16,399 --> 04:21:20,399
tastând pentru a-l șterge. Așa că pot să putem numi

5924
04:21:18,560 --> 04:21:23,600
asta al meu

5925
04:21:20,399 --> 04:21:25,279
primul program

5926
04:21:23,600 --> 04:21:28,279
apoi apăsați enter și se va salva

5927
04:21:25,279 --> 04:21:28,279
că.

5928
04:21:33,920 --> 04:21:42,640
Oh da. Deci, dacă sunteți în VS Code, faceți

5929
04:21:37,840 --> 04:21:45,120
pentru a redenumi fișierul do și apoi salvați ca

5930
04:21:42,640 --> 04:21:49,239
și apoi îi poți da un nou nume.

5931
04:21:45,120 --> 04:21:49,239
fișier, salvați ca.

5932
04:21:49,680 --> 04:21:54,840
Bine, așa îl puteți redenumi în VS

5933
04:21:51,840 --> 04:21:54,840
Cod.

5934
04:21:58,479 --> 04:22:04,080
Bine, să facem, să facem primul

5935
04:22:01,359 --> 04:22:07,600
pas. Hm, hai să imprimăm. Deci, suntem

5936
04:22:04,080 --> 04:22:11,600
voi face tipărirea. Deci, tastați tipărit și

5937
04:22:07,600 --> 04:22:14,000
putem face o paranteză.

5938
04:22:11,600 --> 04:22:16,399
Um, amintiți-vă că aceasta este o funcție. Deci, noi

5939
04:22:14,000 --> 04:22:18,479
avem nevoie de paranteză

5940
04:22:16,399 --> 04:22:20,960
semnal că vrem să punem ceva text

5941
04:22:18,479 --> 04:22:24,399
în interiorul acestei funcții de imprimare. Și apoi

5942
04:22:20,960 --> 04:22:26,479
vrei să faci uh vrei să faci citate.

5943
04:22:24,399 --> 04:22:29,760
Vrei să faci ghilimele, ghilimele duble

5944
04:22:26,479 --> 04:22:32,080
acolo, pentru a ne permite să punem înăuntru

5945
04:22:29,760 --> 04:22:34,399
ceva text. Deci, Python va interpreta

5946
04:22:32,080 --> 04:22:37,840
ce se află în interiorul citatelor ca text și

5947
04:22:34,399 --> 04:22:43,120
va afișa acel text. Deci putem face

5948
04:22:37,840 --> 04:22:46,640
salut lume primul meu

5949
04:22:43,120 --> 04:22:49,680
Programul Python.

5950
04:22:46,640 --> 04:22:51,359
Bine. Și apoi îl putem rula. Deci simte

5951
04:22:49,680 --> 04:22:52,560
liber să puneți orice text aici. Ea

5952
04:22:51,359 --> 04:22:54,560
chiar nu contează exact ce anume

5953
04:22:52,560 --> 04:22:56,319
este, dar ai pus ceva text acolo

5954
04:22:54,560 --> 04:22:59,319
între paranteze și apoi lovit

5955
04:22:56,319 --> 04:22:59,319
alerga.

5956
04:23:01,680 --> 04:23:07,199
Și caietul va dura o secundă

5957
04:23:05,199 --> 04:23:09,760
conectați. Și apoi iată-l. Corect? Deci

5958
04:23:07,199 --> 04:23:12,239
apoi vedeți textul afișat

5959
04:23:09,760 --> 04:23:14,159
ecranul.

5960
04:23:12,239 --> 04:23:16,159
Încearcă asta. Sunteți capabili să alergați?

5961
04:23:14,159 --> 04:23:17,840
imprimarea

5962
04:23:16,159 --> 04:23:19,600
în Jupyter-ul tău, dacă este

5963
04:23:17,840 --> 04:23:21,199
Colaborare, fie că este vorba de Jupyter

5964
04:23:19,600 --> 04:23:24,600
notebook, fie că este vorba de VS Code. Poți

5965
04:23:21,199 --> 04:23:24,600
rulați imprimarea

5966
04:23:32,479 --> 04:23:38,479
instala?

5967
04:23:35,120 --> 04:23:42,600
Da, l-am instalat în VS Code.

5968
04:23:38,479 --> 04:23:42,600
Da. Încercați să instalați asta.

5969
04:23:48,479 --> 04:23:55,239
Bine, grozav. Voi ați putut să fugiți

5970
04:23:49,760 --> 04:23:55,239
că. Foarte bun. Foarte bun. Bine.

5971
04:23:57,920 --> 04:24:02,960
Nu, nu doriți să-l salvați ca JSON

5972
04:23:59,760 --> 04:24:05,920
dosar. Vrei să-l salvezi doar ca pyb

5973
04:24:02,960 --> 04:24:07,600
ca asta. Vezi cum este acesta IP

5974
04:24:05,920 --> 04:24:09,279
YMBB?

5975
04:24:07,600 --> 04:24:13,840
Acesta este formatul dorit. Ține minte

5976
04:24:09,279 --> 04:24:19,319
adică blocnotes Python interactiv.

5977
04:24:13,840 --> 04:24:19,319
Vrei acel fișier IPY MB.

5978
04:24:25,840 --> 04:24:30,680
Uh perfect. Da, ai înțeles

5979
04:24:27,680 --> 04:24:30,680
alerga.

5980
04:24:32,399 --> 04:24:36,080
Nu ai nicio extensie? Nu. Dacă

5981
04:24:34,080 --> 04:24:39,120
sunteți în VS Code, amintiți-vă de luni,

5982
04:24:36,080 --> 04:24:42,120
trebuie să instalați Jupiter

5983
04:24:39,120 --> 04:24:42,120
extensie.

5984
04:24:45,760 --> 04:24:50,920
Dacă sunteți în VS Code, trebuie să instalați

5985
04:24:47,279 --> 04:24:50,920
extensia Jupiter.

5986
04:24:57,359 --> 04:25:02,920
Trebuie să salvați manual, așa că manual

5987
04:24:59,920 --> 04:25:02,920
ea.

5988
04:25:03,120 --> 04:25:09,520
Îl poți salva ca pi. Aș face ipy

5989
04:25:06,800 --> 04:25:11,760
astfel încât să îl puteți deschide în colaborare.

5990
04:25:09,520 --> 04:25:14,399
Introduceți-l singur.

5991
04:25:11,760 --> 04:25:18,560
Tastați suprascrieți ceea ce există și introduceți-l.

5992
04:25:14,399 --> 04:25:20,640
Tastați în caietul meu, indiferent de nume

5993
04:25:18,560 --> 04:25:23,120
este.

5994
04:25:20,640 --> 04:25:26,080
Scrieți-l singur dacă puteți. ca

5995
04:25:23,120 --> 04:25:30,520
salvează ca și apoi

5996
04:25:26,080 --> 04:25:30,520
tastați singur numele complet al fișierului.

5997
04:25:32,800 --> 04:25:36,800
Acum să exersăm un comentariu. hai sa

5998
04:25:35,040 --> 04:25:40,159
exersează un comentariu. Deci hai să construim hai

5999
04:25:36,800 --> 04:25:42,000
faceți o nouă celulă de cod. Așa că am făcut o poti

6000
04:25:40,159 --> 04:25:44,080
fie fă-o aici. Dacă treci peste

6001
04:25:42,000 --> 04:25:46,560
celula ta, poți apăsa plus pentru a construi a

6002
04:25:44,080 --> 04:25:48,319
noua celulă de cod sau puteți apăsa plus aici

6003
04:25:46,560 --> 04:25:51,319
pentru a face o nouă celulă de cod. Deci hai să facem

6004
04:25:48,319 --> 04:25:51,319
că.

6005
04:25:56,399 --> 04:26:01,120
Ar trebui să economisiți.

6006
04:25:59,199 --> 04:26:04,239
Nu vă faceți griji pentru tip. Doar introduceți

6007
04:26:01,120 --> 04:26:07,239
numele imm. Nu cred că ai nevoie

6008
04:26:04,239 --> 04:26:07,239
la.

6009
04:26:08,479 --> 04:26:12,960
Sau ai putea lovi doar ce ai putea face

6010
04:26:09,760 --> 04:26:15,199
este că ai putea apăsa pe salvare și apoi să intri

6011
04:26:12,960 --> 04:26:17,040
exploratorul de fișiere pe care îl puteți redenumi

6012
04:26:15,199 --> 04:26:18,720
ea.

6013
04:26:17,040 --> 04:26:20,640
Deci, dacă doar salvați, îl va salva în

6014
04:26:18,720 --> 04:26:23,120
locația implicită și apoi doar și

6015
04:26:20,640 --> 04:26:24,880
apoi doar redenumiți-l.

6016
04:26:23,120 --> 04:26:30,000
Așa că poate încercați drumul acela. Doar fă

6017
04:26:24,880 --> 04:26:34,199
salva. Doar salvează-l. Și atunci ar trebui

6018
04:26:30,000 --> 04:26:34,199
ar trebui să încerce să-l salveze ca IPymbb.

6019
04:26:38,960 --> 04:26:43,600
Bine. Bine. Să exersăm. Hm, deci

6020
04:26:42,239 --> 04:26:46,640
următorul pas în demonstrație, dacă ești

6021
04:26:43,600 --> 04:26:49,520
urmând în documentul demonstrativ, it

6022
04:26:46,640 --> 04:26:55,080
vrea să facem, așa că am făcut imprimarea. Noi

6023
04:26:49,520 --> 04:26:55,080
vreau să exersez câteva comentarii.

6024
04:26:57,520 --> 04:27:02,640
>> Bine, perfect. Hai să exersăm câteva

6025
04:27:00,399 --> 04:27:04,640
comentarii. Deci, amintește-ți că ți-am spus

6026
04:27:02,640 --> 04:27:09,120
că putem face, uh, comentarii cu

6027
04:27:04,640 --> 04:27:11,279
suma de lire sterline. Deci, acesta este un

6028
04:27:09,120 --> 04:27:13,600
comenta. Așa că exersați să scrieți un comentariu.

6029
04:27:11,279 --> 04:27:16,000
Amintiți-vă că începeți un comentariu cu a

6030
04:27:13,600 --> 04:27:19,840
simbolul lire sterline.

6031
04:27:16,000 --> 04:27:23,199
Va fi ignorat

6032
04:27:19,840 --> 04:27:25,359
de către interpret

6033
04:27:23,199 --> 04:27:27,279
interpret. Așa că nu ezitați să introduceți

6034
04:27:25,359 --> 04:27:29,120
orice text vrei. doar sunt

6035
04:27:27,279 --> 04:27:32,640
amintindu-ne că oricare ar fi comentariul

6036
04:27:29,120 --> 04:27:34,720
va fi ignorat și putem

6037
04:27:32,640 --> 04:27:36,640
Avem orice cod de mai jos pe care noi

6038
04:27:34,720 --> 04:27:38,319
doresc să aibă și acel comentariu va primi

6039
04:27:36,640 --> 04:27:41,359
complet ignorat. Deci hai sa facem alta

6040
04:27:38,319 --> 04:27:44,159
imprimare. Deci scrie un comentariu,

6041
04:27:41,359 --> 04:27:48,479
apăsați enter. Imediat sub cel în a

6042
04:27:44,159 --> 04:27:50,800
linie nouă, să facem o altă imprimare.

6043
04:27:48,479 --> 04:27:54,520
Acest cod

6044
04:27:50,800 --> 04:27:54,520
este executat.

6045
04:27:54,640 --> 04:27:59,279
Deci știm că această declarație tipărită va merge

6046
04:27:56,880 --> 04:28:02,080
pentru a fi executat, dar acest comentariu este

6047
04:27:59,279 --> 04:28:04,880
va fi ignorat de interpret.

6048
04:28:02,080 --> 04:28:07,600
Deci hai să rulăm asta.

6049
04:28:04,880 --> 04:28:10,319
Deci acest cod este executat. Acest comentariu

6050
04:28:07,600 --> 04:28:11,760
este complet ignorat,

6051
04:28:10,319 --> 04:28:14,479
nu? Comentariul acela devine complet

6052
04:28:11,760 --> 04:28:15,680
ignorat, ceea ce este grozav. Încercați să scrieți a

6053
04:28:14,479 --> 04:28:17,279
comenta. Sunteți în stare să scrieți

6054
04:28:15,680 --> 04:28:19,279
comentarii?

6055
04:28:17,279 --> 04:28:22,159
Așa că scrieți un comentariu și apoi încercați să scrieți

6056
04:28:19,279 --> 04:28:24,000
o declarație tipărită imediat după ea.

6057
04:28:22,159 --> 04:28:25,680
Și nu ezitați să puneți orice text

6058
04:28:24,000 --> 04:28:28,920
vrei în comentariu. Și simți

6059
04:28:25,680 --> 04:28:28,920
liber să

6060
04:28:30,479 --> 04:28:34,000
uh pentru comentariu, este spațiul de după

6061
04:28:32,080 --> 04:28:36,880
simbolul lire sterline cerut? Nu, nu este.

6062
04:28:34,000 --> 04:28:39,920
Deci, l-am putea testa. Deci, am eliminat

6063
04:28:36,880 --> 04:28:42,080
spatiul. Nu contează. Este doar

6064
04:28:39,920 --> 04:28:44,399
pentru lizibilitate. De obicei îmi place să fac

6065
04:28:42,080 --> 04:28:46,000
asta ca sa am ceva spatiu dupa el.

6066
04:28:44,399 --> 04:28:47,600
Și acesta este puțin. Este doar puțin

6067
04:28:46,000 --> 04:28:50,920
ceva mai lizibil, nu? Nu este ca

6068
04:28:47,600 --> 04:28:50,920
amestecate între ele.

6069
04:28:52,640 --> 04:28:57,680
Este doar pentru lizibilitate.

6070
04:28:55,920 --> 04:28:59,120
Mare. Voi ați scris un comentariu. Bine.

6071
04:28:57,680 --> 04:29:02,720
Perfect. Perfect. Suntem capabili să scriem

6072
04:28:59,120 --> 04:29:05,720
comentarii. Chiar grozav. Bine.

6073
04:29:02,720 --> 04:29:05,720
Bine.

6074
04:29:06,800 --> 04:29:12,319
Dacă puneți mai multe linii de cod, facem noi

6075
04:29:09,520 --> 04:29:14,880
nevoie de vreun separator? Nu, ei doar

6076
04:29:12,319 --> 04:29:16,479
mergi pe linii noi. Deci, vrei să spui ca o

6077
04:29:14,880 --> 04:29:18,239
a doua declarație tipărită? Să putem

6078
04:29:16,479 --> 04:29:21,520
incearca asta. Să facem o imprimare secundară

6079
04:29:18,239 --> 04:29:28,080
declarație. Deci, putem imprima.

6080
04:29:21,520 --> 04:29:30,319
Um, acesta este pe linia următoare. Nu

6081
04:29:28,080 --> 04:29:33,120
separator

6082
04:29:30,319 --> 04:29:33,120
necesare.

6083
04:29:34,080 --> 04:29:38,000
Vezi asta? Vezi cum e pe ea

6084
04:29:35,840 --> 04:29:39,760
propriu? Am făcut o imprimare chiar sub aceasta

6085
04:29:38,000 --> 04:29:42,239
alt tipar. Și atâta timp cât sunt pornite

6086
04:29:39,760 --> 04:29:43,520
propria lor linie, e în regulă. Ei doar

6087
04:29:42,239 --> 04:29:46,960
trebuie să fie pe propriile linii. Ei

6088
04:29:43,520 --> 04:29:50,000
nu au nevoie de niciun separator.

6089
04:29:46,960 --> 04:29:51,840
Dacă rulăm asta, atunci acesta devine exe.

6090
04:29:50,000 --> 04:29:55,560
Apoi vedeți cum este imprimat acum

6091
04:29:51,840 --> 04:29:55,560
sub ea. Chiar acolo.

6092
04:29:58,560 --> 04:30:02,080
Există vreo limită de caractere pe

6093
04:29:59,920 --> 04:30:04,960
comentarii? Nu. Nu există caracter

6094
04:30:02,080 --> 04:30:06,800
limită. um,

6095
04:30:04,960 --> 04:30:08,479
dar

6096
04:30:06,800 --> 04:30:10,960
nu există limită de caractere, ci un bun

6097
04:30:08,479 --> 04:30:13,840
practica este să nu-ți placă nu vrei

6098
04:30:10,960 --> 04:30:15,199
asta să fie super lung și să preia

6099
04:30:13,840 --> 04:30:17,520
tot ecranul, nu? Pentru că atunci

6100
04:30:15,199 --> 04:30:19,439
nu este chiar lizibil.

6101
04:30:17,520 --> 04:30:22,159
Deci, nu există limită, dar nu vrei

6102
04:30:19,439 --> 04:30:24,080
a avea exagerat

6103
04:30:22,159 --> 04:30:26,720
comentarii lungi. Vrei să le păstrezi

6104
04:30:24,080 --> 04:30:28,479
cam concis și scurt.

6105
04:30:26,720 --> 04:30:32,680
Deci doar ca să le poți citi și sunt

6106
04:30:28,479 --> 04:30:32,680
nu ocupă mult spațiu.

6107
04:30:34,640 --> 04:30:40,319
Nu se poate adăuga declarația de tipărire mai jos.

6108
04:30:36,560 --> 04:30:42,159
De ce? De ce este asta?

6109
04:30:40,319 --> 04:30:44,479
Ar trebui să poți, ar trebui să poți

6110
04:30:42,159 --> 04:30:46,800
aveți o imprimare chiar sub această imprimare.

6111
04:30:44,479 --> 04:30:48,960
Nu ar trebui să fie ceva care să te asigure

6112
04:30:46,800 --> 04:30:53,520
închideți această paranteză. Asigurați-vă că fiecare

6113
04:30:48,960 --> 04:30:55,680
imprimarea trebuie să închidă paranteza

6114
04:30:53,520 --> 04:30:58,960
și toate de care aveți nevoie pentru a închide

6115
04:30:55,680 --> 04:31:02,399
citate. Deci, închideți acest citat, închideți asta

6116
04:30:58,960 --> 04:31:06,080
citați în interiorul tipăritului

6117
04:31:02,399 --> 04:31:08,640
asta trebuie făcut. Deci ar trebui să fii

6118
04:31:06,080 --> 04:31:13,319
capabil să ruleze, voi lipi asta pentru voi băieți

6119
04:31:08,640 --> 04:31:13,319
în chat. Ar trebui să poată rula asta

6120
04:31:19,120 --> 04:31:22,960
În regulă. Un lucru vreau să-ți arăt

6121
04:31:20,880 --> 04:31:25,760
Guys este exact așa cum spune demonstrația în

6122
04:31:22,960 --> 04:31:28,159
document Word, poți face mai multe linii

6123
04:31:25,760 --> 04:31:31,520
comentarii. Deci, dacă trebuie să faci multe

6124
04:31:28,159 --> 04:31:34,880
comentarii, tot ce trebuie să faceți este triplu

6125
04:31:31,520 --> 04:31:38,000
citate. Deci ghilimele triple,

6126
04:31:34,880 --> 04:31:41,720
apoi ghilimele triple și apoi

6127
04:31:38,000 --> 04:31:41,720
totul între ele.

6128
04:31:44,960 --> 04:31:50,720
E interesant că a făcut asta.

6129
04:31:47,120 --> 04:31:55,439
Da. Deci, putem face un simbol liră,

6130
04:31:50,720 --> 04:31:57,199
simbol liră, simbol liră,

6131
04:31:55,439 --> 04:32:01,159
simbolul lire sterline și că asta ar trebui să fie totul

6132
04:31:57,199 --> 04:32:01,159
munca. Deci, putem face asta.

6133
04:32:01,600 --> 04:32:05,920
Da, cred că este o chestie de colaborare, dar

6134
04:32:03,600 --> 04:32:08,000
în mod normal în ca Jupiter sau în

6135
04:32:05,920 --> 04:32:10,479
Python, va funcționa bine. Dar

6136
04:32:08,000 --> 04:32:12,479
ca în colaborare, cred că nu le place

6137
04:32:10,479 --> 04:32:14,080
ghilimelele triple.

6138
04:32:12,479 --> 04:32:15,840
Dar da, vedeți, băieți

6139
04:32:14,080 --> 04:32:19,279
vezi cum am făcut-o așa cu

6140
04:32:15,840 --> 04:32:23,359
simboluri lire sterline? E în regulă și asta.

6141
04:32:19,279 --> 04:32:26,560
Totul dintre acestea

6142
04:32:23,359 --> 04:32:28,080
uh simboluri lire sterline este un comentariu și este

6143
04:32:26,560 --> 04:32:30,159
ignorat. Deci acum ar trebui să putem alerga

6144
04:32:28,080 --> 04:32:32,720
că. Deci iată-ne. Totul devine

6145
04:32:30,159 --> 04:32:37,080
ignorat acolo. Are sens să

6146
04:32:32,720 --> 04:32:37,080
noi? Comentează simbolul lire sterline

6147
04:32:41,279 --> 04:32:45,920
nu folosește lira

6148
04:32:43,359 --> 04:32:48,000
simboluri. Așa că observați cum folosim asta pentru a face

6149
04:32:45,920 --> 04:32:50,720
mai multe rânduri de comentarii. Așa am făcut

6150
04:32:48,000 --> 04:32:53,520
unul aici, noi am făcut unul aici. Putem avea

6151
04:32:50,720 --> 04:32:56,239
cat mai multe putem avea

6152
04:32:53,520 --> 04:32:59,680
um cat mai multi

6153
04:32:56,239 --> 04:33:03,560
uh rânduri de comentarii cum vrem noi și ei

6154
04:32:59,680 --> 04:33:03,560
toate vor fi ignorate.

6155
04:33:10,080 --> 04:33:13,600
Ce sunt alea? Ar trebui să fie

6156
04:33:11,680 --> 04:33:17,199
comentarii pe mai multe rânduri, dar din anumite motive

6157
04:33:13,600 --> 04:33:19,520
nu merge. Um, așa este

6158
04:33:17,199 --> 04:33:21,039
ghilimele triple ar trebui să fie ca

6159
04:33:19,520 --> 04:33:24,600
reprezentând că poți avea un întreg

6160
04:33:21,039 --> 04:33:24,600
bloc de comentarii.

6161
04:33:25,039 --> 04:33:30,119
Nu știu de ce nu funcționează

6162
04:33:26,400 --> 04:33:30,119
colaborare pentru mine.

6163
04:33:31,199 --> 04:33:36,279
Funcționează pentru tine. Bine. Bine. eu

6164
04:33:32,561 --> 04:33:36,279
nu stiu de ce nu merge.

6165
04:33:42,799 --> 04:33:46,199
Un singur citat.

6166
04:33:55,760 --> 04:34:01,561
Încă se afișează aici, care

6167
04:33:57,680 --> 04:34:01,561
Nu înțeleg de ce se întâmplă asta.

6168
04:34:05,199 --> 04:34:09,160
E cam ciudat pentru mine.

6169
04:34:11,840 --> 04:34:15,680
Da, nu înțeleg de ce incoerență. Ea

6170
04:34:13,840 --> 04:34:19,320
de obicei, funcționează pentru mine. Eu nu

6171
04:34:15,680 --> 04:34:19,320
obține asta deloc.

6172
04:34:41,119 --> 04:34:46,279
Tot nu merge la mine. Eu nu

6173
04:34:42,799 --> 04:34:46,279
stiu de ce nu

6174
04:34:56,320 --> 04:34:59,439
Da.

6175
04:34:57,840 --> 04:35:02,240
Nu înțeleg de ce nu îmi place cu adevărat

6176
04:34:59,439 --> 04:35:05,119
acele ghilimele triple. Oh bine. Adică,

6177
04:35:02,240 --> 04:35:09,480
nu mare lucru. Putem doar să facem

6178
04:35:05,119 --> 04:35:09,480
Bine, putem face, putem încerca singur.

6179
04:35:12,879 --> 04:35:16,520
Încă nu funcționează.

6180
04:35:25,760 --> 04:35:31,760
Da. Ei bine, putem face un simbol liră.

6181
04:35:29,439 --> 04:35:34,080
Asta va funcționa întotdeauna. Simbolul lirei este

6182
04:35:31,760 --> 04:35:36,799
sincer mai popular oricum. Majoritatea codului

6183
04:35:34,080 --> 04:35:39,600
pe care îl vezi în sălbăticie va avea pound

6184
04:35:36,799 --> 04:35:42,000
simboluri oriunde ar face um

6185
04:35:39,600 --> 04:35:44,160
oriunde fac comentarii. Aşa

6186
04:35:42,000 --> 04:35:47,160
ca e bine. Folosește doar o vâslă pentru

6187
04:35:44,160 --> 04:35:47,160
acum.

6188
04:35:57,119 --> 04:36:02,000
Da, este corect. nu stiu

6189
04:35:59,039 --> 04:36:03,840
de ce asta e corect. Eu nu

6190
04:36:02,000 --> 04:36:06,400
știi de ce colaborarea nu pare să-i placă

6191
04:36:03,840 --> 04:36:09,039
că. Ar trebui ignorat

6192
04:36:06,400 --> 04:36:11,039
um, în general, cu ghilimele triple, dar

6193
04:36:09,039 --> 04:36:14,000
e bine. Nu sunt prea îngrijorat

6194
04:36:11,039 --> 04:36:15,520
despre asta pentru moment. Bănuiesc ce tu și

6195
04:36:14,000 --> 04:36:17,039
când fac comentarii, de obicei mergi

6196
04:36:15,520 --> 04:36:18,879
să mă vezi folosind simbolul lirei

6197
04:36:17,039 --> 04:36:23,000
oricum. Este foarte rar să aș face-o

6198
04:36:18,879 --> 04:36:23,000
trebuie să fac citate.

6199
04:36:27,760 --> 04:36:32,879
Da, e ciudat că colaborarea nu

6200
04:36:29,840 --> 04:36:36,080
lucrează foarte constant. E în regulă.

6201
04:36:32,879 --> 04:36:38,000
În regulă. Ceea ce vreau să ne arăt sunt eu

6202
04:36:36,080 --> 04:36:40,561
doriți să treceți la intrare. Deci, vreau

6203
04:36:38,000 --> 04:36:42,799
la vreau să vedeți

6204
04:36:40,561 --> 04:36:45,359
Vreau să introduceți acest cod

6205
04:36:42,799 --> 04:36:47,680
aici care va prelua intrarea dintr-un text

6206
04:36:45,359 --> 04:36:50,719
casetă și salvați-o într-o variabilă numită

6207
04:36:47,680 --> 04:36:52,320
nume. Deci, codul pe care îl vom face este

6208
04:36:50,719 --> 04:36:56,480
va fi asa. O să fie

6209
04:36:52,320 --> 04:37:00,320
numele este egal cu intrarea

6210
04:36:56,480 --> 04:37:04,840
și apoi punem um te rog

6211
04:37:00,320 --> 04:37:04,840
introduceți numele dvs.

6212
04:37:04,959 --> 04:37:09,520
Bine.

6213
04:37:06,879 --> 04:37:13,439
Deci asta, apropo, o voi face

6214
04:37:09,520 --> 04:37:15,760
comentați acest cod aici. Hm, acest cod

6215
04:37:13,439 --> 04:37:17,279
ar trebui

6216
04:37:15,760 --> 04:37:24,160
crea

6217
04:37:17,279 --> 04:37:26,000
o casetă de text pe care să o punem în numele nostru.

6218
04:37:24,160 --> 04:37:30,320
Bine, deci asta ar trebui să se întâmple. Deci

6219
04:37:26,000 --> 04:37:33,199
când rulăm asta, um, ar trebui să se deschidă

6220
04:37:30,320 --> 04:37:35,600
o casetă de text chiar sub aceasta. Și putem

6221
04:37:33,199 --> 04:37:38,000
introduceți numele nostru și apăsați enter. Și când

6222
04:37:35,600 --> 04:37:39,600
facem asta, va stoca acel rezultat în

6223
04:37:38,000 --> 04:37:42,959
această variabilă numită nume, ceea ce putem

6224
04:37:39,600 --> 04:37:45,840
folosiți oriunde vrem în cod.

6225
04:37:42,959 --> 04:37:48,240
Deci, dacă apăs pe Run, există caseta de text.

6226
04:37:45,840 --> 04:37:51,119
Vedeți asta băieți? Acolo este textul

6227
04:37:48,240 --> 04:37:53,279
cutie. Si vezi cum scrie, te rog intra

6228
04:37:51,119 --> 04:37:56,080
numele tau. Și astfel putem introduce în textul nostru

6229
04:37:53,279 --> 04:37:59,680
nume.

6230
04:37:56,080 --> 04:38:03,760
Și apăsăm enter. Și acolo este depozitat

6231
04:37:59,680 --> 04:38:07,359
în nume. Putem chiar să afișăm numele

6232
04:38:03,760 --> 04:38:10,480
făcând print și apoi numele care

6233
04:38:07,359 --> 04:38:12,959
va afișa numele pe care l-am stocat

6234
04:38:10,480 --> 04:38:16,400
când am făcut intrarea.

6235
04:38:12,959 --> 04:38:18,639
Deci, încercați-l pe acesta. Încercați acest cod

6236
04:38:16,400 --> 04:38:20,160
pentru tine. Încercați să introduceți intrare

6237
04:38:18,639 --> 04:38:21,439
paranteză

6238
04:38:20,160 --> 04:38:22,719
și apoi vrei să ai ceva text

6239
04:38:21,439 --> 04:38:24,561
acolo. Nu contează exact ce este

6240
04:38:22,719 --> 04:38:27,520
este, dar ceva de genul vă rugăm să introduceți

6241
04:38:24,561 --> 04:38:30,561
nume sau introduceți numele dvs.

6242
04:38:27,520 --> 04:38:32,080
Încearcă asta. Și apoi ar trebui să se depoziteze

6243
04:38:30,561 --> 04:38:34,080
ar trebui să poți introduce în casetă

6244
04:38:32,080 --> 04:38:36,799
care apare. Apăsați enter pe dvs

6245
04:38:34,080 --> 04:38:39,199
tastatura. Ar trebui să salveze asta. Și apoi

6246
04:38:36,799 --> 04:38:42,959
îl poți imprima. Puteți imprima

6247
04:38:39,199 --> 04:38:44,799
scoate acel nume care va um

6248
04:38:42,959 --> 04:38:47,799
afișează orice am introdus

6249
04:38:44,799 --> 04:38:47,799
înainte.

6250
04:38:52,480 --> 04:38:58,840
Cum arată, Roberto? Ce

6251
04:38:54,080 --> 04:38:58,840
arata ca? Au fost

6252
04:39:02,719 --> 04:39:08,160
tu Au fost alți oameni capabili să conducă asta?

6253
04:39:06,719 --> 04:39:11,199
Oh da. Mulțumesc, Melanie. Da, eu

6254
04:39:08,160 --> 04:39:15,160
vezi asta. Perfect.

6255
04:39:11,199 --> 04:39:15,160
Perfect. Asta mi se pare bine.

6256
04:39:20,799 --> 04:39:27,199
Nu ai nevoie de un spațiu. um doar

6257
04:39:24,561 --> 04:39:29,920
arata bine, nu? Așa că e bine

6258
04:39:27,199 --> 04:39:33,920
exersați să aveți spațiu astfel încât uh

6259
04:39:29,920 --> 04:39:38,279
acest cod este um uniform distanțat și el

6260
04:39:33,920 --> 04:39:38,279
arata mai frumos pe ecran.

6261
04:39:41,200 --> 04:39:48,680
Numele um este egal cu intrarea tipăriți salut

6262
04:39:45,440 --> 04:39:48,680
uh nume

6263
04:39:52,878 --> 04:39:58,560
Ai nevoie de Da. Deci, Roberto, ai nevoie

6264
04:39:55,840 --> 04:40:00,240
a ai nevoie de o virgulă după după

6265
04:39:58,560 --> 04:40:02,718
citate.

6266
04:40:00,240 --> 04:40:05,440
După ghilimele, aveți nevoie de o virgulă după

6267
04:40:02,718 --> 04:40:07,840
ghilimele pentru a-i semnala lui Python că

6268
04:40:05,440 --> 04:40:12,360
tu pui în ai ai ceva

6269
04:40:07,840 --> 04:40:12,360
text și apoi o intrare suplimentară.

6270
04:40:12,480 --> 04:40:17,680
Deci, trebuie să fie mai asemănător

6271
04:40:14,560 --> 04:40:19,840
trebuie să fie așa. imprimare. Bună

6272
04:40:17,680 --> 04:40:24,000
acolo.

6273
04:40:19,840 --> 04:40:25,920
Și apoi ai nevoie de o virgulă suplimentară.

6274
04:40:24,000 --> 04:40:29,958
Vezi cum am o virgulă în plus după

6275
04:40:25,920 --> 04:40:29,958
citat. Ai nevoie de asta.

6276
04:40:32,320 --> 04:40:40,878
Îmi pare rău. Acum, Roberto este Kiati.

6277
04:40:36,798 --> 04:40:42,638
Sper că pronunț corect.

6278
04:40:40,878 --> 04:40:45,360
Bine. Deci, ne simțim bine în ceea ce privește contribuția

6279
04:40:42,638 --> 04:40:47,760
si ce face?

6280
04:40:45,360 --> 04:40:49,920
Perfect. Ne simțim bine cu privire la input și

6281
04:40:47,760 --> 04:40:52,920
ce face? Acesta aduce un text

6282
04:40:49,920 --> 04:40:52,920
cutie.

6283
04:40:53,200 --> 04:40:57,440
Ai apăsat enter, Roberto? Să placă

6284
04:40:55,920 --> 04:40:59,200
Ai reușit să tastați ceva și

6285
04:40:57,440 --> 04:41:00,958
lovi O să alerge până vei lovi

6286
04:40:59,200 --> 04:41:02,798
intra.

6287
04:41:00,958 --> 04:41:06,760
Trebuie să tastați textul și apoi

6288
04:41:02,798 --> 04:41:06,760
apăsați enter în casetă.

6289
04:41:06,958 --> 04:41:12,958
Deci, lasă-mă să repet asta. Deci, vezi cum

6290
04:41:10,480 --> 04:41:15,680
mai merge? Vezi cum place asta

6291
04:41:12,958 --> 04:41:19,560
va continua să alerge pentru totdeauna până când

6292
04:41:15,680 --> 04:41:19,560
Scriu ceva

6293
04:41:21,040 --> 04:41:25,958
și atunci când apăs pe enter se va opri.

6294
04:41:28,560 --> 04:41:32,760
Cum arată codul tău?

6295
04:41:52,160 --> 04:41:55,958
Bine, pare corect.

6296
04:41:56,000 --> 04:42:01,320
Încercați să îl opriți și să îl reluați.

6297
04:42:03,520 --> 04:42:09,560
Încercați să apăsați butonul de oprire și apoi

6298
04:42:06,080 --> 04:42:09,560
reluați-l.

6299
04:42:18,480 --> 04:42:24,080
um ar trebui, așa că da, ar trebui să pui

6300
04:42:20,560 --> 04:42:25,840
că într-o celulă diferită. Deci dacă tu dacă

6301
04:42:24,080 --> 04:42:30,160
vă separați codul în individuale

6302
04:42:25,840 --> 04:42:32,958
celule ca să poți face așa cum ai putea

6303
04:42:30,160 --> 04:42:36,160
face nume. Deci am putea să ne despărțim

6304
04:42:32,958 --> 04:42:40,280
acest. Deci acest cod este singurul cod

6305
04:42:36,160 --> 04:42:40,280
care rulează în această celulă.

6306
04:42:49,520 --> 04:42:54,160
Asta nu are sens. Altceva

6307
04:42:52,480 --> 04:42:56,320
este

6308
04:42:54,160 --> 04:43:00,160
asta nu are sens pentru ca asta

6309
04:42:56,320 --> 04:43:02,718
fila de colaborare ocupă doar 235

6310
04:43:00,160 --> 04:43:05,280
megaocteți.

6311
04:43:02,718 --> 04:43:07,840
Deci ceva este

6312
04:43:05,280 --> 04:43:10,560
mestecându-ți memoria asta nu este cu adevărat

6313
04:43:07,840 --> 04:43:13,120
Eu nu-mi pot imagina. Folosești colaborarea?

6314
04:43:10,560 --> 04:43:15,280
Puteți vedea că nu folosește asta

6315
04:43:13,120 --> 04:43:17,680
mult. Doar 240

6316
04:43:15,280 --> 04:43:19,440
230ish.

6317
04:43:17,680 --> 04:43:21,840
Da, nu cred că nu cred că Colab

6318
04:43:19,440 --> 04:43:25,200
este vinovat dacă nu ai încărcat în unele

6319
04:43:21,840 --> 04:43:29,520
date cu adevărat masive sau așa ceva.

6320
04:43:25,200 --> 04:43:32,958
Nu-mi pot imagina că asta e problema.

6321
04:43:29,520 --> 04:43:34,560
Ai făcut-o. Ai încărcat date. Asta e

6322
04:43:32,958 --> 04:43:37,280
Adică Da. Apoi se duce la ea

6323
04:43:34,560 --> 04:43:40,280
urmează să ia în memorie. Oh, bine. Bine.

6324
04:43:37,280 --> 04:43:40,280
Bine.

6325
04:43:43,680 --> 04:43:49,160
MJ, cu ce faci? Ești activ

6326
04:43:49,280 --> 04:43:53,520
Da. Ai putea face o captură de ecran?

6327
04:43:52,000 --> 04:43:56,320
Dacă nu funcționează pentru tine, ai putea

6328
04:43:53,520 --> 04:43:59,760
încercați să colaborați? Dacă ai putea încerca doar să colaborezi

6329
04:43:56,320 --> 04:44:01,680
de dragul de a-l pune în funcțiune?

6330
04:43:59,760 --> 04:44:04,320
Lucrurile ar trebui să funcționeze destul de bine în Collab

6331
04:44:01,680 --> 04:44:05,680
cu ușurință.

6332
04:44:04,320 --> 04:44:07,680
Folosești Colab și nimic

6333
04:44:05,680 --> 04:44:12,120
de lucru. Uh, te asiguri că este a

6334
04:44:07,680 --> 04:44:12,120
celula de cod și nu o celulă text?

6335
04:44:12,798 --> 04:44:18,160
Nu este o celulă text ca aceasta,

6336
04:44:15,840 --> 04:44:22,120
care ar fi ca,

6337
04:44:18,160 --> 04:44:22,120
aici va fi albastru.

6338
04:44:29,360 --> 04:44:34,240
Ai avut asta? Trebuie să te asiguri

6339
04:44:30,958 --> 04:44:35,760
este codul. Da.

6340
04:44:34,240 --> 04:44:40,600
Și când voi rula asta, va fi

6341
04:44:35,760 --> 04:44:40,600
va afișa text. Da.

6342
04:44:41,920 --> 04:44:45,320
Bine. Mare.

6343
04:44:45,600 --> 04:44:49,798
Mă bucur că funcționează. Mare.

6344
04:44:49,840 --> 04:44:54,160
Bine.

6345
04:44:51,520 --> 04:44:56,240
Bine. încă unul. Uh încă unul

6346
04:44:54,160 --> 04:44:59,040
exemplu ceea ce vreau să vă arăt băieți este

6347
04:44:56,240 --> 04:45:01,040
cum să faci cum să includă numele într-un

6348
04:44:59,040 --> 04:45:06,160
tipărire declarație. Deci dacă facem ceva

6349
04:45:01,040 --> 04:45:10,798
ca tiparul. Deci, putem include

6350
04:45:06,160 --> 04:45:13,840
nume într-o declarație tipărită. Deci dacă o facem

6351
04:45:10,798 --> 04:45:18,240
ceva de genul print și apoi avem um

6352
04:45:13,840 --> 04:45:23,680
Bună ziua și apoi avem asta și

6353
04:45:18,240 --> 04:45:26,160
atunci avem bun venit la Python.

6354
04:45:23,680 --> 04:45:29,520
um asta vointa

6355
04:45:26,160 --> 04:45:32,160
asta va afișa toate astea

6356
04:45:29,520 --> 04:45:34,878
împreună. Așa că observați că putem avea ca

6357
04:45:32,160 --> 04:45:36,638
multe informații pe care noi

6358
04:45:34,878 --> 04:45:38,878
doresc să afișeze un fel de unul după

6359
04:45:36,638 --> 04:45:40,878
altele atâta timp cât sunt separate de

6360
04:45:38,878 --> 04:45:44,560
aceste virgule.

6361
04:45:40,878 --> 04:45:47,280
Deci avem acest text,

6362
04:45:44,560 --> 04:45:54,000
acest text deoarece textul este stocat în acesta

6363
04:45:47,280 --> 04:45:56,400
variabilă. Hm, apoi acest text și apoi noi

6364
04:45:54,000 --> 04:45:58,240
imprimați totul și putem avea asta

6365
04:45:56,400 --> 04:46:03,080
întreaga colecție de text afișată către

6366
04:45:58,240 --> 04:46:03,080
ecranul. Încearcă-l pe acela.

6367
04:46:11,680 --> 04:46:15,920
Oh, ei fac același lucru. Ei fac

6368
04:46:14,000 --> 04:46:17,680
acelasi lucru. Deci, virgula și Scuze.

6369
04:46:15,920 --> 04:46:20,000
Da, tocmai am observat că demonstrația face a

6370
04:46:17,680 --> 04:46:21,920
plus. Ei fac același lucru în Python.

6371
04:46:20,000 --> 04:46:24,080
Deci, putem schimba asta cu un plus.

6372
04:46:21,920 --> 04:46:25,920
Amândoi lucrează.

6373
04:46:24,080 --> 04:46:27,040
Au același lucru, nu ar trebui să spun că ei

6374
04:46:25,920 --> 04:46:29,040
fac același lucru, dar au

6375
04:46:27,040 --> 04:46:31,840
acelasi efect.

6376
04:46:29,040 --> 04:46:33,520
Au același efect.

6377
04:46:31,840 --> 04:46:35,360
De fapt, nu există. Ai nevoie de puțin

6378
04:46:33,520 --> 04:46:37,200
puțin mai mult spațiu aici. Deci, virgula

6379
04:46:35,360 --> 04:46:40,200
îți dă puțin mai bine uh

6380
04:46:37,200 --> 04:46:40,200
spaţiere.

6381
04:46:41,360 --> 04:46:46,560
Deci, lasă-mă să descompun asta.

6382
04:46:43,600 --> 04:46:51,360
ce plus

6383
04:46:46,560 --> 04:46:54,718
plus um adună împreună

6384
04:46:51,360 --> 04:46:56,560
uh text și deci ce facem aici

6385
04:46:54,718 --> 04:46:59,840
din punct de vedere tehnic, adăugăm tot textul nostru

6386
04:46:56,560 --> 04:47:03,920
împreună și apoi afișându-l. Um, deci

6387
04:46:59,840 --> 04:47:05,520
plus ca text împreună și apoi virgula

6388
04:47:03,920 --> 04:47:11,280
um,

6389
04:47:05,520 --> 04:47:13,920
uh, tipărește mai multe bucăți de text.

6390
04:47:11,280 --> 04:47:15,760
Deci au același efect, dar

6391
04:47:13,920 --> 04:47:18,760
da, poți folosi, poți folosi oricare

6392
04:47:15,760 --> 04:47:18,760
unul.

6393
04:47:25,280 --> 04:47:28,958
Bine.

6394
04:47:27,200 --> 04:47:31,520
Vroiam să vă arăt un lucru, băieți

6395
04:47:28,958 --> 04:47:34,400
de asemenea, apropo, în Colab, dacă ești

6396
04:47:31,520 --> 04:47:37,280
lucrând în cadrul Colab, vreau să faci

6397
04:47:34,400 --> 04:47:39,600
plasați cursorul peste variabila numele dvs.

6398
04:47:37,280 --> 04:47:42,160
Deci, dacă doar iei mouse-ul și

6399
04:47:39,600 --> 04:47:46,000
plutește peste asta,

6400
04:47:42,160 --> 04:47:49,840
vedeți ce scrie aici?

6401
04:47:46,000 --> 04:47:52,320
Vedeți cum scrie numele șirului și

6402
04:47:49,840 --> 04:47:54,320
atunci are valoarea aceia, care este

6403
04:47:52,320 --> 04:47:57,520
care este numele meu. Deci, asta e ceva

6404
04:47:54,320 --> 04:47:59,520
cool despre Colab este dacă treci cu mouse-ul peste

6405
04:47:57,520 --> 04:48:01,120
variabile, vă va spune care sunt

6406
04:47:59,520 --> 04:48:05,600
tipul este. Acum, nu am aflat despre

6407
04:48:01,120 --> 04:48:07,520
tipuri, dar orice text din ghilimele este

6408
04:48:05,600 --> 04:48:09,920
o sfoară. Este ceea ce am numi a

6409
04:48:07,520 --> 04:48:11,520
şir. O să învățăm despre asta.

6410
04:48:09,920 --> 04:48:13,120
Şi

6411
04:48:11,520 --> 04:48:15,680
um

6412
04:48:13,120 --> 04:48:17,760
ne afișează și ce date avem

6413
04:48:15,680 --> 04:48:19,680
au stocat în prezent în acea variabilă.

6414
04:48:17,760 --> 04:48:24,080
Deci tot ce trebuie să faci este să treci peste a

6415
04:48:19,680 --> 04:48:26,160
variabila um pentru a vedea care este valoarea.

6416
04:48:24,080 --> 04:48:30,400
Da, asta e da, este un fel de a

6417
04:48:26,160 --> 04:48:32,240
limitarea Codului VS. Este adevărat.

6418
04:48:30,400 --> 04:48:35,240
Nu vă arată imediat

6419
04:48:32,240 --> 04:48:35,240
plutind.

6420
04:48:47,280 --> 04:48:52,560
Nu vedeți valoarea la hovering. Deci, um,

6421
04:48:50,000 --> 04:48:55,680
faceți clic în celulă. Trebuie să faceți clic

6422
04:48:52,560 --> 04:48:57,600
în celulă și apoi treceți cu mouse-ul peste ea.

6423
04:48:55,680 --> 04:49:00,560
Faceți clic în celulă și apoi plasați cursorul peste

6424
04:48:57,600 --> 04:49:02,958
ea. Ar trebui să funcționeze. Da, tu

6425
04:49:00,560 --> 04:49:06,000
trebuie să faceți clic pe celulă sau orice altceva

6426
04:49:02,958 --> 04:49:09,718
celula în care ești și apoi treci peste

6427
04:49:06,000 --> 04:49:09,718
asta și ar trebui să funcționeze.

6428
04:49:10,638 --> 04:49:14,480
Uh, Mariel întreabă: „Cum ne integrăm

6429
04:49:12,480 --> 04:49:17,360
acel cod Python către o aplicație client

6430
04:49:14,480 --> 04:49:20,958
pentru ca un utilizator să introducă o valoare?

6431
04:49:17,360 --> 04:49:23,440
um, probabil că am avea un set diferit

6432
04:49:20,958 --> 04:49:26,638
de cod pentru a face asta. Um, există Python

6433
04:49:23,440 --> 04:49:30,240
cod care poate obține o interfață de utilizare și o vom face

6434
04:49:26,638 --> 04:49:32,000
vezi asta mai tarziu in similar

6435
04:49:30,240 --> 04:49:34,718
mult mai târziu spre sfârșitul

6436
04:49:32,000 --> 04:49:38,000
program. Vom vedea că putem, putem

6437
04:49:34,718 --> 04:49:41,520
scrie cod Python pentru a face o interfață de utilizare în esență

6438
04:49:38,000 --> 04:49:44,560
pentru a face ca o aproape ca o pagină web

6439
04:49:41,520 --> 04:49:47,120
pentru ca cineva să introducă o intrare. Vom face

6440
04:49:44,560 --> 04:49:48,560
vezi asta mult mai târziu. Deci, nu suntem

6441
04:49:47,120 --> 04:49:51,958
voi ajunge la asta chiar acum. Este

6442
04:49:48,560 --> 04:49:51,958
cu adevărat complex.

6443
04:49:55,920 --> 04:50:00,638
Hm care este scopul de a avea

6444
04:49:58,320 --> 04:50:02,560
mai multe celule? E ca să putem alerga

6445
04:50:00,638 --> 04:50:05,040
bucăți individuale de cod în cadrul acestora

6446
04:50:02,560 --> 04:50:07,920
celule. Ne permite să ne izolăm, nu?

6447
04:50:05,040 --> 04:50:09,920
Pentru că pot rula, pot rula cod în interior

6448
04:50:07,920 --> 04:50:12,958
dintre aceste celule și nu afectează niciuna

6449
04:50:09,920 --> 04:50:16,080
altă celulă. Deci, este doar pentru ca

6450
04:50:12,958 --> 04:50:17,520
depanare și izolare, ceea ce este frumos,

6451
04:50:16,080 --> 04:50:19,680
nu? Nu trebuie să-mi fac griji

6452
04:50:17,520 --> 04:50:23,240
rulând totul deodată. Pot să conduc unul

6453
04:50:19,680 --> 04:50:23,240
celulă la un moment dat.

6454
04:50:34,638 --> 04:50:38,440
Bine. Alte intrebari?

6455
04:50:44,080 --> 04:50:49,840
Hm, putem executa mai multe linii

6456
04:50:46,798 --> 04:50:51,600
împreună? Da, noi am făcut asta. Aici am avut

6457
04:50:49,840 --> 04:50:54,638
multiple. Așa că vă voi arăta din nou.

6458
04:50:51,600 --> 04:50:58,080
Pot să printez

6459
04:50:54,638 --> 04:51:02,878
um, aceasta este o afirmație

6460
04:50:58,080 --> 04:51:06,400
și apoi pot să cobor și să imprim

6461
04:51:02,878 --> 04:51:09,600
um, acesta este altul și atunci poate că pot

6462
04:51:06,400 --> 04:51:09,600
fa niste matematica.

6463
04:51:13,680 --> 04:51:17,280
Așa că poți avea tot atâtea rânduri ca tine

6464
04:51:15,760 --> 04:51:20,840
vreau

6465
04:51:17,280 --> 04:51:20,840
în interiorul unei celule.

6466
04:51:22,798 --> 04:51:27,878
Într-o celulă, puteți avea cât mai multe

6467
04:51:24,000 --> 04:51:27,878
linii de cod după cum doriți.

6468
04:51:34,320 --> 04:51:40,000
Există vreo modalitate de a-i spune ordinea

6469
04:51:36,320 --> 04:51:44,000
celulele se execută? Hm, tu nu, dacă tu dacă tu

6470
04:51:40,000 --> 04:51:45,760
du-te la um dacă te duci să alergi pe toate,

6471
04:51:44,000 --> 04:51:49,120
le va rula pe toate în ordine de la

6472
04:51:45,760 --> 04:51:51,920
de sus în jos. Uh, pentru a spune

6473
04:51:49,120 --> 04:51:54,638
ce celule să executați, puteți

6474
04:51:51,920 --> 04:51:56,400
rearanjați-le. Îți poate place întotdeauna

6475
04:51:54,638 --> 04:51:58,878
Aș putea rearanja aceste celule, după

6476
04:51:56,400 --> 04:52:00,638
de altfel, cred că există o modalitate de a o muta

6477
04:51:58,878 --> 04:52:03,040
jos.

6478
04:52:00,638 --> 04:52:05,920
Deci, o pot muta în jos. Deci acum sunt

6479
04:52:03,040 --> 04:52:07,840
rearanjarea. Deci puteți muta celulele. eu

6480
04:52:05,920 --> 04:52:09,680
credeți că le puteți chiar trage și plasați.

6481
04:52:07,840 --> 04:52:13,360
Așa că observați cum l-am luat pe cel care se află la

6482
04:52:09,680 --> 04:52:15,600
chiar sus și îl mut în jos.

6483
04:52:13,360 --> 04:52:17,760
Altfel, trebuie să dai clic, nu? tu

6484
04:52:15,600 --> 04:52:20,000
trebuie doar să-mi placă că le pot rula în oricare

6485
04:52:17,760 --> 04:52:21,760
comanda. Dacă dau clic doar ca dacă dau clic

6486
04:52:20,000 --> 04:52:24,400
aici, îl va rula primul. Daca eu

6487
04:52:21,760 --> 04:52:27,120
du-te înapoi aici, îl va rula pe acela

6488
04:52:24,400 --> 04:52:29,440
în continuare. Așa că faceți clic doar în jurul căruia

6489
04:52:27,120 --> 04:52:30,718
cele pe care vrei să le alergi. Face asta

6490
04:52:29,440 --> 04:52:32,560
sens?

6491
04:52:30,718 --> 04:52:34,320
Le pot rula în orice ordine atâta timp cât eu

6492
04:52:32,560 --> 04:52:37,320
faceți clic pe orice ordine pe care vreau să o fac

6493
04:52:34,320 --> 04:52:37,320
in.

6494
04:52:41,440 --> 04:52:45,440
Bine.

6495
04:52:43,760 --> 04:52:47,280
În regulă.

6496
04:52:45,440 --> 04:52:49,520
Perfect. Deci, asta încheie asta

6497
04:52:47,280 --> 04:52:51,920
demonstrație. Sper că a fost informativ. sper

6498
04:52:49,520 --> 04:52:53,520
ați văzut declarația de tipărire. Hm

6499
04:52:51,920 --> 04:52:56,878
o să vedem asta de multe ori. The

6500
04:52:53,520 --> 04:52:58,718
instrucțiunea de intrare. E destul de misto.

6501
04:52:56,878 --> 04:53:00,000
Hm și trebuie să fugi, trebuie să fugi

6502
04:52:58,718 --> 04:53:02,080
ceva Python. Deci, dacă este prima dată

6503
04:53:00,000 --> 04:53:04,000
făcând vreodată programare, felicitări.

6504
04:53:02,080 --> 04:53:07,360
Ai rulat niște cod Python. Asta este cu adevărat

6505
04:53:04,000 --> 04:53:13,958
incitant. Um, mă bucur că putem face asta.

6506
04:53:07,360 --> 04:53:13,958
Hm, să revenim la notițele noastre

6507
04:53:15,360 --> 04:53:22,680
și apoi vom um

6508
04:53:18,400 --> 04:53:22,680
lasă-mă să partajez ecranul.

6509
04:53:26,320 --> 04:53:32,080
Bine.

6510
04:53:28,240 --> 04:53:34,400
Deci următorul lucru pe agenda noastră este să

6511
04:53:32,080 --> 04:53:37,200
acoperă variabile și tipuri de date. Deci eu

6512
04:53:34,400 --> 04:53:38,718
doar spus ca textul este șirul de date

6513
04:53:37,200 --> 04:53:39,920
tastați, dar să învățăm despre toate

6514
04:53:38,718 --> 04:53:42,000
diferite tipuri de date care urmează să

6515
04:53:39,920 --> 04:53:44,320
să ne fie disponibil în interiorul Python și

6516
04:53:42,000 --> 04:53:47,520
hai sa vorbim despre variabile. Hm, este

6517
04:53:44,320 --> 04:53:48,798
va fi o discuție bună. Deci eu

6518
04:53:47,520 --> 04:53:51,280
gândește-te că ceea ce vom face este să luăm o

6519
04:53:48,798 --> 04:53:53,120
pauză de cinci minute acum și ne întoarcem

6520
04:53:51,280 --> 04:53:56,240
și putem începe această discuție

6521
04:53:53,120 --> 04:54:00,958
despre variabile și tipuri de date. Um, deci

6522
04:53:56,240 --> 04:54:06,878
hai să luăm o pauză de cinci minute.

6523
04:54:00,958 --> 04:54:10,520
Și deci hai să încercăm să ne întoarcem

6524
04:54:06,878 --> 04:54:10,520
8:30.

6525
04:54:13,200 --> 04:54:16,200
Bine.

6526
04:54:21,280 --> 04:54:25,480
Încearcă să te întorci în jurul orei 8 8:30.

6527
04:54:34,080 --> 04:54:40,240
Bine. Deci, ce sunt variabilele? Acestea sunt

6528
04:54:38,560 --> 04:54:43,360
um

6529
04:54:40,240 --> 04:54:45,520
practic modul nostru de stocare a datelor către

6530
04:54:43,360 --> 04:54:48,240
ușurează referirea lor și

6531
04:54:45,520 --> 04:54:49,840
manipulăm pe tot parcursul programului nostru.

6532
04:54:48,240 --> 04:54:52,400
Deci, am folosit deja un

6533
04:54:49,840 --> 04:54:54,320
variabilă. Am folosit unul în demonstrația noastră

6534
04:54:52,400 --> 04:54:58,400
tocmai am făcut acolo unde am numit intrarea

6535
04:54:54,320 --> 04:55:01,600
numele. Am stocat acea intrare într-un

6536
04:54:58,400 --> 04:55:05,360
variabilă numită nume. Și așa um

6537
04:55:01,600 --> 04:55:07,600
variabilele sunt într-adevăr o referință la

6538
04:55:05,360 --> 04:55:09,280
unele date. Atât sunt. Ei

6539
04:55:07,600 --> 04:55:11,520
permiteți-ne să facem referire la acele date

6540
04:55:09,280 --> 04:55:13,360
pe tot parcursul programului. Putem stoca

6541
04:55:11,520 --> 04:55:16,160
informația într-o variabilă și apoi

6542
04:55:13,360 --> 04:55:17,760
accesați-l prin codul nostru. Așa mai departe

6543
04:55:16,160 --> 04:55:20,560
acest ecran sunt câteva exemple de

6544
04:55:17,760 --> 04:55:23,520
variabile. Acum, variabilele au nume,

6545
04:55:20,560 --> 04:55:25,760
motiv pentru care am spus că de obicei vrem

6546
04:55:23,520 --> 04:55:28,080
acelea sa fie semnificative. Ca și cum X este a

6547
04:55:25,760 --> 04:55:30,160
nume valid, dar nu este asta

6548
04:55:28,080 --> 04:55:32,000
interesant al unui nume. Nu dă

6549
04:55:30,160 --> 04:55:33,920
ne aceste informații multe informații

6550
04:55:32,000 --> 04:55:37,520
despre ce înseamnă cu adevărat.

6551
04:55:33,920 --> 04:55:40,480
Deci, probabil că nu este cel mai bun nume. Hm, dar

6552
04:55:37,520 --> 04:55:43,200
avem lucruri de genul că putem, putem

6553
04:55:40,480 --> 04:55:44,878
stocați un text în interiorul acestei variabile

6554
04:55:43,200 --> 04:55:47,600
numit nume. Putem stoca un număr

6555
04:55:44,878 --> 04:55:50,718
în interiorul acestei variabile numită preț.

6556
04:55:47,600 --> 04:55:52,240
putem stoca o valoare adevărată sau falsă

6557
04:55:50,718 --> 04:55:54,560
în interiorul acestei variabile numite

6558
04:55:52,240 --> 04:55:58,560
este_activ.

6559
04:55:54,560 --> 04:56:01,840
Um și așa variabilele vor apărea toate

6560
04:55:58,560 --> 04:56:06,160
peste codul nostru și practic sunt

6561
04:56:01,840 --> 04:56:09,520
modul nostru de a face referire la unele valori. Acum

6562
04:56:06,160 --> 04:56:11,920
aceste lucruri de aici sunt practic

6563
04:56:09,520 --> 04:56:13,600
diferite tipuri de date de care avem nevoie

6564
04:56:11,920 --> 04:56:15,840
afla despre, nu? Deci trebuie să învățăm

6565
04:56:13,600 --> 04:56:17,360
despre ceea ce este un 10 față de ceea ce este în

6566
04:56:15,840 --> 04:56:19,680
ceva în ghilimele. este un

6567
04:56:17,360 --> 04:56:22,000
sfoară față de ceva care are

6568
04:56:19,680 --> 04:56:23,680
zecimale care este un număr flotant

6569
04:56:22,000 --> 04:56:25,680
față de ceva care este adevărat sau fals

6570
04:56:23,680 --> 04:56:28,480
care este o valoare booleană. Trebuie

6571
04:56:25,680 --> 04:56:31,680
aflați despre aceste tipuri de date. Dar observați

6572
04:56:28,480 --> 04:56:35,840
cum se face referire la toate acestea

6573
04:56:31,680 --> 04:56:38,798
a um printr-o variabilă care are un nume

6574
04:56:35,840 --> 04:56:42,000
ea. Bine. Deci variabila este acest tip.

6575
04:56:38,798 --> 04:56:45,280
Este referința noastră la acele date. Hm și

6576
04:56:42,000 --> 04:56:47,280
vom folosi variabile pe tot parcursul um deci

6577
04:56:45,280 --> 04:56:50,320
la care vă putem face referiri

6578
04:56:47,280 --> 04:56:54,080
informațiile din codul nostru.

6579
04:56:50,320 --> 04:56:56,320
Deci variabilele sunt fundamentale

6580
04:56:54,080 --> 04:56:58,560
lucrul cu Python.

6581
04:56:56,320 --> 04:57:00,320
Acum variabilele pot stoca diferite

6582
04:56:58,560 --> 04:57:02,798
tipuri de date. Așa că am făcut doar aluzie

6583
04:57:00,320 --> 04:57:04,560
că. Și astfel diferitele tipuri de date

6584
04:57:02,798 --> 04:57:06,958
disponibil pentru noi în Python un fel de toamnă

6585
04:57:04,560 --> 04:57:09,840
în aceste două categorii diferite. unul

6586
04:57:06,958 --> 04:57:12,560
fiind valori unice sau ceea ce sunt cunoscute ca

6587
04:57:09,840 --> 04:57:15,760
valori scalare. Deci astea sunt lucruri de genul

6588
04:57:12,560 --> 04:57:19,040
numere întregi. Deci numărul 10, numărul

6589
04:57:15,760 --> 04:57:22,400
1, numărul 2.323,

6590
04:57:19,040 --> 04:57:23,920
acestea sunt toate numere întregi. Hm

6591
04:57:22,400 --> 04:57:25,440
plutitoare, care sunt orice cu a

6592
04:57:23,920 --> 04:57:27,360
zecimală.

6593
04:57:25,440 --> 04:57:29,600
Deci 32.3,

6594
04:57:27,360 --> 04:57:32,798
3.14,

6595
04:57:29,600 --> 04:57:36,000
um 1.2, toate acestea sunt în virgulă mobilă

6596
04:57:32,798 --> 04:57:38,240
numere. Um, booleenii au doar două

6597
04:57:36,000 --> 04:57:41,840
opțiuni. Au doar adevărat sau fals.

6598
04:57:38,240 --> 04:57:46,400
Deci, ele reprezintă un fel de binar uh

6599
04:57:41,840 --> 04:57:50,718
valoarea um despre care spunem că este adevărată sau falsă.

6600
04:57:46,400 --> 04:57:53,200
Și atunci avem și un complex

6601
04:57:50,718 --> 04:57:55,360
numere care sunt care au imaginar

6602
04:57:53,200 --> 04:57:57,360
uh părți pentru ei. Nu vom fi cu adevărat

6603
04:57:55,360 --> 04:57:59,600
se ocupă prea mult de numere complexe

6604
04:57:57,360 --> 04:58:01,520
Nu mi-aș face griji pentru ei. Dar în

6605
04:57:59,600 --> 04:58:03,760
realitate, Python acceptă lucrul cu

6606
04:58:01,520 --> 04:58:06,958
numerele complexe și fac complex

6607
04:58:03,760 --> 04:58:08,480
matematica. Dar numere atât de complexe

6608
04:58:06,958 --> 04:58:11,200
au un fel de parte reală și o

6609
04:58:08,480 --> 04:58:12,400
parte imaginară pentru ei. Nu ar face-o

6610
04:58:11,200 --> 04:58:14,160
iti faci prea multe griji pentru asta. Din nou, suntem

6611
04:58:12,400 --> 04:58:15,600
nu o să lucrez niciodată cu aceia

6612
04:58:14,160 --> 04:58:18,958
pe tot parcursul programului, dar

6613
04:58:15,600 --> 04:58:22,080
chiar există. Python îl acceptă. Deci

6614
04:58:18,958 --> 04:58:24,240
date scalare, valori unice, gândește-te

6615
04:58:22,080 --> 04:58:27,120
numere, gândește-te la numere simple ca

6616
04:58:24,240 --> 04:58:30,480
plutește, gândește-te numere întregi, um singur uh

6617
04:58:27,120 --> 04:58:33,520
valori adevărate sau false. Deci aceste tipuri de

6618
04:58:30,480 --> 04:58:36,240
datele pot fi stocate în variabile.

6619
04:58:33,520 --> 04:58:39,200
La capătul opus al spectrului sunt

6620
04:58:36,240 --> 04:58:41,440
tipurile agregate pe care le stocăm

6621
04:58:39,200 --> 04:58:43,360
mai multe lucruri.

6622
04:58:41,440 --> 04:58:45,760
Așa că vom învăța despre toate

6623
04:58:43,360 --> 04:58:47,520
acelea, dar probabil cele mai comune

6624
04:58:45,760 --> 04:58:49,440
și unul cu care ne-am ocupat deja este

6625
04:58:47,520 --> 04:58:51,840
va fi o sfoară. Deci un șir este

6626
04:58:49,440 --> 04:58:54,798
din punct de vedere tehnic un tip agregat deoarece

6627
04:58:51,840 --> 04:58:57,760
are mai multe caractere care se formează,

6628
04:58:54,798 --> 04:59:00,400
știi, un șir general, care este

6629
04:58:57,760 --> 04:59:02,320
un șir este de obicei tu știi că este a

6630
04:59:00,400 --> 04:59:03,520
șir pentru că este între ghilimele,

6631
04:59:02,320 --> 04:59:07,120
corect? Este în interiorul acestor duble

6632
04:59:03,520 --> 04:59:09,120
ghilimele sau ghilimele simple. Hm, Python

6633
04:59:07,120 --> 04:59:10,958
de fapt nu-i pasă de citate

6634
04:59:09,120 --> 04:59:12,958
într-adevăr în ceea ce privește dacă este singur sau

6635
04:59:10,958 --> 04:59:15,360
dublu atâta timp cât ești consecvent cu

6636
04:59:12,958 --> 04:59:16,798
ea. Like dacă începi cu dublu

6637
04:59:15,360 --> 04:59:18,160
ghilimele, ar trebui să terminați cu dublu

6638
04:59:16,798 --> 04:59:20,480
citate. Dacă începi cu single, tu

6639
04:59:18,160 --> 04:59:25,040
ar trebui să se încheie cu single. Python nu

6640
04:59:20,480 --> 04:59:27,840
chiar pasă oricum. Um, deci șiruri

6641
04:59:25,040 --> 04:59:30,718
vor reprezenta um colecții de

6642
04:59:27,840 --> 04:59:33,760
personaje. O să vorbim

6643
04:59:30,718 --> 04:59:37,280
despre seturi care sunt practic ca tu an

6644
04:59:33,760 --> 04:59:39,760
serie de valori unice. Hm, deci vorbim

6645
04:59:37,280 --> 04:59:41,920
despre seturi vom vorbi despre liste care

6646
04:59:39,760 --> 04:59:44,160
sunt o structură cu adevărat importantă. Este

6647
04:59:41,920 --> 04:59:46,798
practic o matrice care poate ține multe

6648
04:59:44,160 --> 04:59:48,320
diferite tipuri de date. Hm, deci vom face

6649
04:59:46,798 --> 04:59:50,638
vorbim despre listă. Vom vorbi despre

6650
04:59:48,320 --> 04:59:54,240
tupilele. Deci tu dacă vezi acel cuvânt

6651
04:59:50,638 --> 04:59:56,560
tuple e care este um oameni unii oameni

6652
04:59:54,240 --> 04:59:59,760
pronunță-l tuplu. Îmi place să o numesc

6653
04:59:56,560 --> 05:00:01,600
tupol, dar asta va fi foarte

6654
04:59:59,760 --> 05:00:04,080
similar cu o matrice. Doar că va

6655
05:00:01,600 --> 05:00:06,080
au mici diferențe și dacă tu

6656
05:00:04,080 --> 05:00:07,920
se poate schimba sau nu. Te mulțumește

6657
05:00:06,080 --> 05:00:11,200
de fapt, nu se poate schimba odată ce creați

6658
05:00:07,920 --> 05:00:12,718
ea. Um versus listă poți modifica lista.

6659
05:00:11,200 --> 05:00:15,520
Puteți adăuga lucruri la el. Puteți elimina

6660
05:00:12,718 --> 05:00:16,638
lucruri din ea. Tupilele nu poti. Deci

6661
05:00:15,520 --> 05:00:18,480
vom afla despre acestea

6662
05:00:16,638 --> 05:00:19,680
diferențe pe măsură ce mergem și începem

6663
05:00:18,480 --> 05:00:21,280
lucrând cu aceste tipuri diferite de

6664
05:00:19,680 --> 05:00:23,360
date.

6665
05:00:21,280 --> 05:00:25,440
Hm, dar sunt concepute să reziste

6666
05:00:23,360 --> 05:00:27,920
valori multiple, nu? Deci poți vedea

6667
05:00:25,440 --> 05:00:29,760
în acel exemplu, lista are numere întregi,

6668
05:00:27,920 --> 05:00:32,160
are șiruri, poate, poate ține

6669
05:00:29,760 --> 05:00:34,160
mai multe tipuri, adică dacă vii

6670
05:00:32,160 --> 05:00:37,680
din alte limbi, în general, nu este

6671
05:00:34,160 --> 05:00:40,320
cazul. Um ca matrice în Java, matrice

6672
05:00:37,680 --> 05:00:42,000
în C, ele pot deține un singur tip de

6673
05:00:40,320 --> 05:00:43,760
date din matrice. Ei nu pot ține

6674
05:00:42,000 --> 05:00:45,280
multiple.

6675
05:00:43,760 --> 05:00:48,240
Hm

6676
05:00:45,280 --> 05:00:49,520
deci în sfârșit un dicționar. A

6677
05:00:48,240 --> 05:00:51,520
dicționarul este dacă vii de la

6678
05:00:49,520 --> 05:00:54,958
alte limbi, este ca o hartă, a

6679
05:00:51,520 --> 05:00:57,840
hashmap. Practic, vă permite să aveți

6680
05:00:54,958 --> 05:00:59,760
uh chei mapate la valori. Deci este o

6681
05:00:57,840 --> 05:01:02,560
într-adevăr dicționarele sunt foarte utile

6682
05:00:59,760 --> 05:01:06,000
pentru stocarea informațiilor acolo unde vrem

6683
05:01:02,560 --> 05:01:07,760
referință ca această valoare se potrivește cu aceasta

6684
05:01:06,000 --> 05:01:11,280
valoare. Deci, de exemplu, în asta

6685
05:01:07,760 --> 05:01:14,798
dicționar șirul a mapează la unul și

6686
05:01:11,280 --> 05:01:19,280
apoi șirul b se mapează la uh, știi

6687
05:01:14,798 --> 05:01:22,080
doi și sau orice se mapează. Și asta

6688
05:01:19,280 --> 05:01:23,520
ne va permite să căutăm valori în

6689
05:01:22,080 --> 05:01:25,760
dicţionar. Deci am putea privi în sus, hei,

6690
05:01:23,520 --> 05:01:28,638
care este valoarea stocată la cheia A sau

6691
05:01:25,760 --> 05:01:30,400
care este valoarea stocată la cheia B? Aceia

6692
05:01:28,638 --> 05:01:32,560
fel de lucruri. Dicționarele vor fi

6693
05:01:30,400 --> 05:01:34,878
incredibil de util. Vom merge

6694
05:01:32,560 --> 05:01:38,480
explorați toate acestea mai mult pe măsură ce mergem

6695
05:01:34,878 --> 05:01:40,400
în lecție, dar pentru moment, asta

6696
05:01:38,480 --> 05:01:42,320
ar trebui să aibă sens că există

6697
05:01:40,400 --> 05:01:45,680
unele tipuri de date care stochează mai multe

6698
05:01:42,320 --> 05:01:48,000
valori precum matrice sau scuze, liste, um

6699
05:01:45,680 --> 05:01:49,840
dicționar, șiruri de caractere și apoi sunt

6700
05:01:48,000 --> 05:01:52,000
unele tipuri de date care au doar un singur

6701
05:01:49,840 --> 05:01:55,600
valoare ca un singur număr ca un float,

6702
05:01:52,000 --> 05:01:57,120
întreg, um boolean.

6703
05:01:55,600 --> 05:01:58,798
Bine, deci mai multe vor veni la agregat

6704
05:01:57,120 --> 05:02:00,958
date. Vom lucra cu aceia,

6705
05:01:58,798 --> 05:02:02,320
învață despre diferențe, învață despre

6706
05:02:00,958 --> 05:02:05,360
cum arată în cod să funcționeze

6707
05:02:02,320 --> 05:02:08,400
cu setul, un dicționar, tupilul, lista,

6708
05:02:05,360 --> 05:02:12,400
dar acestea dețin în general mai multe valori

6709
05:02:08,400 --> 05:02:16,840
sau poate deține mai multe valori, în timp ce um

6710
05:02:12,400 --> 05:02:16,840
Datele scalare vor păstra doar unul.

6711
05:02:18,798 --> 05:02:21,798
Bine.

6712
05:02:22,878 --> 05:02:30,718
În regulă. Deci, așa cum am spus mai devreme

6713
05:02:27,920 --> 05:02:33,440
știi numere întregi, flotanți, booleeni,

6714
05:02:30,718 --> 05:02:35,520
dețin doar o singură valoare. Prin

6715
05:02:33,440 --> 05:02:38,000
așa, în interiorul Python, dacă vrei vreodată

6716
05:02:35,520 --> 05:02:39,840
pentru a vedea care este tipul unei variabile.

6717
05:02:38,000 --> 05:02:42,560
Deci, să presupunem că știm că avem o variabilă

6718
05:02:39,840 --> 05:02:45,200
numit nume. Putem verifica oricând

6719
05:02:42,560 --> 05:02:48,400
ce tip de date este prin utilizarea

6720
05:02:45,200 --> 05:02:51,920
funcția de tip încorporată. Deci putem folosi

6721
05:02:48,400 --> 05:02:54,878
tastați și apoi treceți acea variabilă

6722
05:02:51,920 --> 05:02:59,600
iar acest lucru va afișa ce tip de date îl

6723
05:02:54,878 --> 05:03:02,560
este. Deci dacă am stocat valoarea 42 in

6724
05:02:59,600 --> 05:03:06,240
o variabilă numită int, dacă um

6725
05:03:02,560 --> 05:03:09,600
afișat dacă am tastat um dacă am făcut-o

6726
05:03:06,240 --> 05:03:12,160
tipul asta ar produce int

6727
05:03:09,600 --> 05:03:15,760
ceea ce ar spune în regulă această valoare este o

6728
05:03:12,160 --> 05:03:19,520
întreg versus 3,14 care va fi a

6729
05:03:15,760 --> 05:03:24,798
float versus capital t adevărat că se întâmplă

6730
05:03:19,520 --> 05:03:24,798
pentru a fi uh tipul boolean bool.

6731
05:03:27,600 --> 05:03:33,040
Bine. Deci, avem numere întregi, avem

6732
05:03:30,560 --> 05:03:34,958
plutește, avem boolean, toate acestea

6733
05:03:33,040 --> 05:03:37,520
vom folosi pe tot parcursul și vom vedea

6734
05:03:34,958 --> 05:03:41,360
unde le vom folosi pe acelea față de

6735
05:03:37,520 --> 05:03:44,400
altele. Vom învăța despre asta.

6736
05:03:41,360 --> 05:03:46,160
Cum am spus, complex. Deci, uh doar

6737
05:03:44,400 --> 05:03:49,840
arătându-ți aici că acestea există

6738
05:03:46,160 --> 05:03:52,240
evident. Cum am spus, complexul are uh

6739
05:03:49,840 --> 05:03:54,320
o parte reală şi o parte imaginară care

6740
05:03:52,240 --> 05:03:57,520
poti accesa separat. Deci dacă tu

6741
05:03:54,320 --> 05:03:59,840
stocați o valoare ca un complex pe care îl puteți uh

6742
05:03:57,520 --> 05:04:01,920
accesează părțile sale reale și imaginare

6743
05:03:59,840 --> 05:04:04,798
separat, ceea ce poate fi necesar să le faceți

6744
05:04:01,920 --> 05:04:07,280
un fel de calcule.

6745
05:04:04,798 --> 05:04:09,360
Din nou, nu vom lucra cu adevărat

6746
05:04:07,280 --> 05:04:11,360
numere complexe din acest program. Deci

6747
05:04:09,360 --> 05:04:12,878
nu e mare lucru pentru noi, dar este

6748
05:04:11,360 --> 05:04:15,760
sprijinit

6749
05:04:12,878 --> 05:04:18,878
și știi multe de matematică

6750
05:04:15,760 --> 05:04:21,760
pachetele din Python vor folosi complex

6751
05:04:18,878 --> 05:04:24,240
numere dacă au nevoie, dar nu vom face

6752
05:04:21,760 --> 05:04:28,200
fă-o cu adevărat în acest program. Există

6753
05:04:24,240 --> 05:04:28,200
nu chiar este nevoie pentru noi.

6754
05:04:28,240 --> 05:04:34,240
În regulă. Deci avem date agregate

6755
05:04:32,080 --> 05:04:35,600
acele șiruri pe care le-am văzut deja.

6756
05:04:34,240 --> 05:04:37,920
Acestea sunt lucrurile din interiorul citatelor.

6757
05:04:35,600 --> 05:04:42,000
Avem seturi care vor fi

6758
05:04:37,920 --> 05:04:45,200
culegeri de date care sunt unice

6759
05:04:42,000 --> 05:04:46,718
practic, permițând doar o copie a uh

6760
05:04:45,200 --> 05:04:50,480
acele elemente din interiorul setului. Suntem

6761
05:04:46,718 --> 05:04:53,040
o să învețe despre asta. Um lista care

6762
05:04:50,480 --> 05:04:54,400
va fi o colecție de articole

6763
05:04:53,040 --> 05:04:56,718
pe care le putem schimba, putem adăuga lucruri

6764
05:04:54,400 --> 05:05:00,000
la ea, putem elimina. Listele sunt

6765
05:04:56,718 --> 05:05:02,718
structură cu adevărat minunată în Python.

6766
05:05:00,000 --> 05:05:05,520
Hm, ce vreau să vezi acum

6767
05:05:02,718 --> 05:05:07,360
deși poți începe să vezi

6768
05:05:05,520 --> 05:05:13,680
diferențe de sintaxă, nu? Deci, ca o

6769
05:05:07,360 --> 05:05:16,878
set, um, un set este locul în care avem, uh,

6770
05:05:13,680 --> 05:05:18,878
acest aparat dentar. Observați că este creat un set

6771
05:05:16,878 --> 05:05:20,958
cu o acoladă versus o listă care

6772
05:05:18,878 --> 05:05:23,840
este creat cu o paranteză. Deci, corect

6773
05:05:20,958 --> 05:05:25,920
departe, ca atunci când vezi un bretele, tu

6774
05:05:23,840 --> 05:05:27,280
ar trebui să se gândească fie la un set, fie

6775
05:05:25,920 --> 05:05:30,240
dicţionar. Acestea sunt cele două lucruri

6776
05:05:27,280 --> 05:05:31,680
care sunt create cu o acoladă. um,

6777
05:05:30,240 --> 05:05:33,760
și știi că este un dicționar pentru că a

6778
05:05:31,680 --> 05:05:35,280
dicţionarul va avea două puncte care

6779
05:05:33,760 --> 05:05:37,600
va hărți, vă voi arăta asta în continuare

6780
05:05:35,280 --> 05:05:40,400
ecran. Dar asta va mapa lucrurile din

6781
05:05:37,600 --> 05:05:43,760
cheia valorii. Hm, depinde dacă tu

6782
05:05:40,400 --> 05:05:45,680
cunosc stânga și dreapta colonului. um,

6783
05:05:43,760 --> 05:05:48,000
dar vedeți asta ca și sintaxa

6784
05:05:45,680 --> 05:05:52,000
diferenta de lista? O listă are un

6785
05:05:48,000 --> 05:05:53,440
setul de paranteze are o acoladă ondulată. um,

6786
05:05:52,000 --> 05:05:54,798
asta e doar o mica diferenta. tu

6787
05:05:53,440 --> 05:05:56,638
știi, vom învăța așa cum este

6788
05:05:54,798 --> 05:05:58,718
diferența reală dintre un set și

6789
05:05:56,638 --> 05:06:02,080
o listă, dar asta e doar una pe care o arăt

6790
05:05:58,718 --> 05:06:05,600
afară chiar acum.

6791
05:06:02,080 --> 05:06:08,480
Um, ce înseamnă mutabil? Deci, mutabil

6792
05:06:05,600 --> 05:06:12,000
înseamnă că o putem schimba. Este

6793
05:06:08,480 --> 05:06:16,440
se poate schimba. Deci, imuabil

6794
05:06:12,000 --> 05:06:16,440
ar fi că nu o putem schimba.

6795
05:06:17,520 --> 05:06:22,240
Da. Și un lucru despre o listă

6796
05:06:19,200 --> 05:06:24,718
asta e foarte frumos este că fiecare listă are un

6797
05:06:22,240 --> 05:06:27,280
ordonarea firească a acestuia care este de fapt

6798
05:06:24,718 --> 05:06:30,878
cu adevărat benefică. Deci o listă are un

6799
05:06:27,280 --> 05:06:33,280
notiunea de primul articol, de al doilea

6800
05:06:30,878 --> 05:06:35,200
item, al treilea articol, al patrulea. Asta e

6801
05:06:33,280 --> 05:06:39,120
foarte important pentru accesarea datelor

6802
05:06:35,200 --> 05:06:43,560
în cadrul listei. Bine. Deci listele sunt

6803
05:06:39,120 --> 05:06:43,560
cu adevărat puternic. Hm

6804
05:06:43,680 --> 05:06:48,160
da. Deci un set motivul pentru care arată

6805
05:06:46,240 --> 05:06:51,680
este într-o ordine diferită pentru că a

6806
05:06:48,160 --> 05:06:55,760
setul nu menține ordinea. Un set niciodată

6807
05:06:51,680 --> 05:07:00,400
menține ordinea pentru că este un set

6808
05:06:55,760 --> 05:07:02,160
nu, nu accesați articole prin comandă.

6809
05:07:00,400 --> 05:07:03,760
Deci este doar ceva unic pentru un set

6810
05:07:02,160 --> 05:07:05,280
este că nu are o ordine firească.

6811
05:07:03,760 --> 05:07:06,638
Deci, de fiecare dată când îl imprimați, va fi

6812
05:07:05,280 --> 05:07:08,638
afișare într-o ordine diferită.

6813
05:07:06,638 --> 05:07:11,040
Potenţial este aleatoriu. Este aleatoriu

6814
05:07:08,638 --> 05:07:13,280
comandați când îl afișați. A

6815
05:07:11,040 --> 05:07:15,440
setul este doar menit să fie un general

6816
05:07:13,280 --> 05:07:17,360
colectare. Gândește-te la asta ca la o găleată.

6817
05:07:15,440 --> 05:07:18,878
Ca aici este această găleată de articole pe care eu

6818
05:07:17,360 --> 05:07:21,920
au.

6819
05:07:18,878 --> 05:07:23,680
Este doar o colecție de articole. O listă

6820
05:07:21,920 --> 05:07:27,120
menține de fapt o ordine, a

6821
05:07:23,680 --> 05:07:30,000
ordinea consecventă a articolelor.

6822
05:07:27,120 --> 05:07:31,520
Acest lucru este diferit.

6823
05:07:30,000 --> 05:07:34,920
Așa că vom vorbi mai multe despre asta când vom

6824
05:07:31,520 --> 05:07:34,920
intra in acelea.

6825
05:07:45,920 --> 05:07:49,520
Bine.

6826
05:07:48,160 --> 05:07:51,280
În regulă. Așa că am vrut să vă arăt și vouă

6827
05:07:49,520 --> 05:07:53,120
tupolul în dicționar. Deci a

6828
05:07:51,280 --> 05:07:55,120
tupol

6829
05:07:53,120 --> 05:07:58,240
este, de asemenea, o colecție de articole. Acum, cel

6830
05:07:55,120 --> 05:08:02,798
tupilul este comandat. Deci este ca o listă.

6831
05:07:58,240 --> 05:08:04,560
Este ordonat dar este imuabil.

6832
05:08:02,798 --> 05:08:07,360
Înseamnă că nu poți schimba un tupol. Deci

6833
05:08:04,560 --> 05:08:09,200
odată ce ai creat un tupil nu poți

6834
05:08:07,360 --> 05:08:10,798
schimba-l sau vei primi o eroare.

6835
05:08:09,200 --> 05:08:13,040
Python vă va spune, hei, asta este

6836
05:08:10,798 --> 05:08:15,200
imuabil nu pot schimba asta. Deci dacă tu

6837
05:08:13,040 --> 05:08:17,520
încearcă să schimbi ființa dacă încerci să adaugi

6838
05:08:15,200 --> 05:08:19,360
ceva la tupil dacă încerci

6839
05:08:17,520 --> 05:08:21,840
modificați una dintre intrările din tupil

6840
05:08:19,360 --> 05:08:26,798
cum ar fi dacă încerc, dacă intru și încerc

6841
05:08:21,840 --> 05:08:28,638
schimba asta a um cu d

6842
05:08:26,798 --> 05:08:30,000
asta nu ar fi permis. Acest lucru ar fi

6843
05:08:28,638 --> 05:08:31,440
asta ar arunca o eroare. The

6844
05:08:30,000 --> 05:08:32,638
interpretul ar spune hei, încerci

6845
05:08:31,440 --> 05:08:36,240
a schimba ceva ce nu poate fi

6846
05:08:32,638 --> 05:08:38,400
schimbat. Deci tupilele sunt imuabile dar

6847
05:08:36,240 --> 05:08:41,440
au un beneficiu dincolo de un set de

6848
05:08:38,400 --> 05:08:43,520
fiind de fapt comandat. Deci acolo există

6849
05:08:41,440 --> 05:08:45,040
o ordonare naturală la un tupil unde aceasta

6850
05:08:43,520 --> 05:08:46,878
este primul articol, acesta este al doilea

6851
05:08:45,040 --> 05:08:48,560
articol, acesta este al treilea și de fiecare dată

6852
05:08:46,878 --> 05:08:52,638
afișați un tupil va fi într-o

6853
05:08:48,560 --> 05:08:55,760
ordine consistentă. Dar tupilele nu sunt

6854
05:08:52,638 --> 05:08:58,480
ca o listă. Nu o poți schimba. Deci

6855
05:08:55,760 --> 05:09:00,958
tupilele sunt utile pentru situaţiile în care

6856
05:08:58,480 --> 05:09:02,560
vrei sa comanzi, dar nu vrei

6857
05:09:00,958 --> 05:09:04,798
oricine să modifice oricare dintre acele date

6858
05:09:02,560 --> 05:09:06,798
asta e in tupil. Nu este

6859
05:09:04,798 --> 05:09:08,958
schimbătoare.

6860
05:09:06,798 --> 05:09:11,520
Mutabil, adică înseamnă doar schimbător

6861
05:09:08,958 --> 05:09:15,200
parca il poti modifica. Dacă dacă ceva

6862
05:09:11,520 --> 05:09:17,840
este mutabil, îl puteți modifica.

6863
05:09:15,200 --> 05:09:19,760
Imuabil ca un tupol este imuabil. Noi

6864
05:09:17,840 --> 05:09:23,120
nu îl putem modifica odată ce îl creăm.

6865
05:09:19,760 --> 05:09:26,120
Asta este.

6866
05:09:23,120 --> 05:09:26,120
Bine.

6867
05:09:26,958 --> 05:09:32,638
Da. Bine. Deci, în sfârșit, a

6868
05:09:29,040 --> 05:09:34,798
dicţionar. Acum, apropo, arăți

6869
05:09:32,638 --> 05:09:37,120
la tupol. Vezi cum este creat cu

6870
05:09:34,798 --> 05:09:38,638
o paranteză.

6871
05:09:37,120 --> 05:09:39,680
Deci este diferit de crețul

6872
05:09:38,638 --> 05:09:41,840
bretele. Asta e diferit de

6873
05:09:39,680 --> 05:09:44,000
paranteză. Corect? Deci un tupol știi

6874
05:09:41,840 --> 05:09:46,160
este un tupil din cauza parantezei

6875
05:09:44,000 --> 05:09:47,920
iar elementele sunt separate prin virgulă

6876
05:09:46,160 --> 05:09:51,520
cât de exact cum sunt într-un set și

6877
05:09:47,920 --> 05:09:53,680
exact cum sunt ei într-o listă. Hm

6878
05:09:51,520 --> 05:09:56,480
astfel încât paranteza îl dă departe

6879
05:09:53,680 --> 05:10:00,320
că e un tupol. Um acum uită-te la

6880
05:09:56,480 --> 05:10:03,200
dicționar și dicționarul este um a

6881
05:10:00,320 --> 05:10:05,360
colecție de perechi valori cheie. Deci asta

6882
05:10:03,200 --> 05:10:08,718
este o pereche cheie valoare. Aceasta este o valoare cheie

6883
05:10:05,360 --> 05:10:10,958
pereche. Um, aceasta este o pereche cheie valoare și mai departe

6884
05:10:08,718 --> 05:10:12,958
și mai departe. Putem avea câte vrem.

6885
05:10:10,958 --> 05:10:16,160
Și un lucru despre care vreau să observi

6886
05:10:12,958 --> 05:10:18,958
aceasta este că nu există nicio restricție asupra

6887
05:10:16,160 --> 05:10:22,160
tipurile de date ale cheilor și ale valorilor.

6888
05:10:18,958 --> 05:10:25,280
Deci cheile pot fi numere întregi, cheile pot fi

6889
05:10:22,160 --> 05:10:28,240
șiruri de caractere, valorile pot fi numere întregi, valori

6890
05:10:25,280 --> 05:10:31,760
pot fi șiruri de caractere, valorile pot fi float,

6891
05:10:28,240 --> 05:10:35,120
valorile ar putea fi chiar și alte dicționare

6892
05:10:31,760 --> 05:10:37,280
sau liste. Deci valoare cum am putea avea

6893
05:10:35,120 --> 05:10:39,840
ceea ce se numește un dicționar imbricat unde

6894
05:10:37,280 --> 05:10:42,798
de fapt avem ceva de cartografiere peste

6895
05:10:39,840 --> 05:10:45,200
la alt dicționar.

6896
05:10:42,798 --> 05:10:47,680
Acest lucru este total posibil în Python. Deci noi

6897
05:10:45,200 --> 05:10:49,760
poate avea dicționare acea parte a

6898
05:10:47,680 --> 05:10:52,240
valorile din interiorul dicționarului de fapt

6899
05:10:49,760 --> 05:10:54,798
au în sine dicţionarele noastre şi

6900
05:10:52,240 --> 05:10:57,600
care ar reprezenta un fel de imbricat

6901
05:10:54,798 --> 05:10:59,600
structura acolo. Deci de exemplu asta

6902
05:10:57,600 --> 05:11:03,120
numele ar putea mapa la un dicționar cu

6903
05:10:59,600 --> 05:11:07,840
numele tuturor în ea. Hm sau s-ar putea

6904
05:11:03,120 --> 05:11:09,120
mapa la o listă um știi

6905
05:11:07,840 --> 05:11:11,200
ar putea mapa la o listă la care se poate mapa

6906
05:11:09,120 --> 05:11:12,798
orice ar putea mapa la un tupol. Da

6907
05:11:11,200 --> 05:11:15,040
tu chiar nu există nicio restricție

6908
05:11:12,798 --> 05:11:18,040
la ce vor merge cheile și valorile

6909
05:11:15,040 --> 05:11:18,040
fii.

6910
05:11:18,560 --> 05:11:23,680
Uh Brent este mai eficient decât

6911
05:11:20,320 --> 05:11:25,200
altele uh este ce este mai eficient decât

6912
05:11:23,680 --> 05:11:29,958
alte metode? Vreau doar să vă clarific

6913
05:11:25,200 --> 05:11:29,958
intrebare asa ca am si raspund corect.

6914
05:11:35,680 --> 05:11:41,680
Tupolul versus utilizarea unui tablou.

6915
05:11:38,718 --> 05:11:46,560
Da. Da. Da. Deci astea sunt toate

6916
05:11:41,680 --> 05:11:49,920
intrebari bune. Deci tupolul

6917
05:11:46,560 --> 05:11:52,160
este garantat că nu va fi schimbat. Deci

6918
05:11:49,920 --> 05:11:53,920
este puțin mai rapid când căutăm

6919
05:11:52,160 --> 05:11:56,320
sus articole ca atunci când facem referințe

6920
05:11:53,920 --> 05:11:58,160
articole. Este puțin mai rapid pentru că

6921
05:11:56,320 --> 05:12:00,958
știm că nu va fi

6922
05:11:58,160 --> 05:12:03,680
modificat vreodată. Deci totul va merge

6923
05:12:00,958 --> 05:12:05,440
fii constant în același loc. Deci

6924
05:12:03,680 --> 05:12:06,798
ca și cum orice ar fi primul va rămâne

6925
05:12:05,440 --> 05:12:09,760
în primul rând, orice va fi al doilea

6926
05:12:06,798 --> 05:12:12,878
stai al doilea și mai departe. Deci tupilul este

6927
05:12:09,760 --> 05:12:15,360
este frumos in sensul asta. O listă poate fi

6928
05:12:12,878 --> 05:12:17,440
schimbat. Deci, orice este primul, poate să nu fie

6929
05:12:15,360 --> 05:12:19,840
garanția de a fi primul în viitor. Noi

6930
05:12:17,440 --> 05:12:22,080
poate modifica. Putem elimina lucruri. Noi

6931
05:12:19,840 --> 05:12:24,638
pot adăuga lucruri pe listă. Deci putem

6932
05:12:22,080 --> 05:12:28,000
extinde. Lista este foarte dinamică.

6933
05:12:24,638 --> 05:12:30,080
Lista. Deci lista este mai puțin eficientă

6934
05:12:28,000 --> 05:12:31,760
pentru că este mult mai dinamic. Face asta

6935
05:12:30,080 --> 05:12:34,000
are sens? Parcă s-ar putea schimba. Poți

6936
05:12:31,760 --> 05:12:35,760
adăugați, puteți continua să extindeți lista cu

6937
05:12:34,000 --> 05:12:38,400
adăugând lucruri la el. Puteți micșora

6938
05:12:35,760 --> 05:12:41,840
lista prin eliminarea lucrurilor din ea.

6939
05:12:38,400 --> 05:12:44,320
Deci lista este mult mai dinamică, ceea ce pentru a

6940
05:12:41,840 --> 05:12:45,840
multe scenarii sunt utile,

6941
05:12:44,320 --> 05:12:48,320
nu? Vrem să putem adăuga și

6942
05:12:45,840 --> 05:12:51,120
eliminați și modificați lucruri.

6943
05:12:48,320 --> 05:12:52,560
Hm, dar un tupol este mai rigid în

6944
05:12:51,120 --> 05:12:56,840
simți că odată ce l-ai creat, tu

6945
05:12:52,560 --> 05:12:56,840
nu pot schimba nimic la asta.

6946
05:13:00,798 --> 05:13:05,840
Da. Da. Deci un dicționar este bun pentru

6947
05:13:03,840 --> 05:13:08,240
Da. Ca și cum o carte de telefon ar fi bună

6948
05:13:05,840 --> 05:13:10,080
exemplu de dicționar pentru că tu cu

6949
05:13:08,240 --> 05:13:12,320
un dicționar pe care îl căutați de obicei

6950
05:13:10,080 --> 05:13:15,040
lucruri. Deci îți place atât de mult o dicție într-un

6951
05:13:12,320 --> 05:13:17,280
agenda telefonică la care aveți un nume pe care îl mapați

6952
05:13:15,040 --> 05:13:21,200
un număr de telefon.

6953
05:13:17,280 --> 05:13:23,680
Hm deci da ai o ai aia

6954
05:13:21,200 --> 05:13:25,200
dicționarul va mapa o cheie la o valoare

6955
05:13:23,680 --> 05:13:28,798
la fel cum un nume ar fi mapat la un

6956
05:13:25,200 --> 05:13:31,120
numărul de telefon. Deci da o carte de telefon face

6957
05:13:28,798 --> 05:13:34,120
mult sens.

6958
05:13:31,120 --> 05:13:34,120
um,

6959
05:13:34,320 --> 05:13:38,240
o listă, o listă este ca orice este ca a

6960
05:13:36,480 --> 05:13:39,920
normal, cum ar fi lista ta de cumpărături. Ca

6961
05:13:38,240 --> 05:13:41,760
puteți adăuga lucruri la el, puteți elimina

6962
05:13:39,920 --> 05:13:45,600
lucruri din ea, puteți schimba lucrurile

6963
05:13:41,760 --> 05:13:49,520
ea. Este foarte dinamic. Hm, un tupol este

6964
05:13:45,600 --> 05:13:52,638
un fel de set fix de date

6965
05:13:49,520 --> 05:13:55,360
asta este ordonat într-un fel. Deci poate

6966
05:13:52,638 --> 05:13:57,120
like um ce ai vedea pe a pe a

6967
05:13:55,360 --> 05:14:00,560
scrisoare ca și cum ai avea numele tău, ai

6968
05:13:57,120 --> 05:14:02,400
adresa ta, ai codul poștal,

6969
05:14:00,560 --> 05:14:04,240
ca și cum le-ai avea și asta

6970
05:14:02,400 --> 05:14:07,440
ar trebui să rămână așa pentru a trimite poștă

6971
05:14:04,240 --> 05:14:09,360
chestie de tip scrisoare.

6972
05:14:07,440 --> 05:14:11,680
Uh poți converti un tupil într-o listă?

6973
05:14:09,360 --> 05:14:13,360
Da, poți face și invers. Poți

6974
05:14:11,680 --> 05:14:15,600
converti un tupil într-o listă și poți

6975
05:14:13,360 --> 05:14:18,240
convert um poți converti o listă în a

6976
05:14:15,600 --> 05:14:20,560
tupol. Da, puteți converti între

6977
05:14:18,240 --> 05:14:24,920
ei.

6978
05:14:20,560 --> 05:14:24,920
O să ne arăt exemple în acest sens mai târziu.

6979
05:14:29,680 --> 05:14:38,000
Bine. Deci, ca să recapitulez,

6980
05:14:33,280 --> 05:14:40,718
tupilul nu este schimbător, dar are un

6981
05:14:38,000 --> 05:14:43,120
comanda. Deci, are o ordonare naturală

6982
05:14:40,718 --> 05:14:44,718
ea. Orice este primul este primul. Oricare ar fi

6983
05:14:43,120 --> 05:14:46,320
al doilea este al doilea, al treilea și al treilea. Deci,

6984
05:14:44,718 --> 05:14:48,160
puteți accesa lucruri pe baza lor

6985
05:14:46,320 --> 05:14:50,000
poziție în interiorul tupolului. Asta e

6986
05:14:48,160 --> 05:14:51,440
chiar frumos. Dar nu poți modifica

6987
05:14:50,000 --> 05:14:52,958
orice despre un tupil odată ce ai creat

6988
05:14:51,440 --> 05:14:57,040
ea.

6989
05:14:52,958 --> 05:14:58,320
Bine. O listă are o ordine. tu

6990
05:14:57,040 --> 05:15:01,120
pot accesa lucruri pe baza lor

6991
05:14:58,320 --> 05:15:03,440
poziție. Dar o listă este dinamică. Este

6992
05:15:01,120 --> 05:15:06,080
mutabil. Înseamnă că o poți schimba. tu

6993
05:15:03,440 --> 05:15:08,160
poate schimba valorile. Puteți adăuga lucruri la

6994
05:15:06,080 --> 05:15:10,878
ea. Puteți elimina lucruri din el. Bine?

6995
05:15:08,160 --> 05:15:14,560
Deci foarte dinamic. Asta este o listă.

6996
05:15:10,878 --> 05:15:16,240
Hm dicţionar. Mapează cheile la valori.

6997
05:15:14,560 --> 05:15:18,160
Fără restricții cu privire la ceea ce acele chei și

6998
05:15:16,240 --> 05:15:20,320
valorile pot fi.

6999
05:15:18,160 --> 05:15:22,240
În regulă. Și apoi un set. Un set este

7000
05:15:20,320 --> 05:15:25,120
gândește-te ca la o găleată. Doar că are

7001
05:15:22,240 --> 05:15:26,958
lucruri din el. Un set nu are ordine.

7002
05:15:25,120 --> 05:15:29,520
Deci nu puteți accesa lucruri bazate pe

7003
05:15:26,958 --> 05:15:31,200
ordinea lor. Și de fiecare dată când uh

7004
05:15:29,520 --> 05:15:34,000
afișați setul, puteți obține un alt

7005
05:15:31,200 --> 05:15:38,240
ordonând. Hm

7006
05:15:34,000 --> 05:15:40,480
dar numai un set este special prin aceea că

7007
05:15:38,240 --> 05:15:42,080
permite numai articole unice. Deci dacă încerci

7008
05:15:40,480 --> 05:15:43,520
a pune mai multe copii ale unei piese de

7009
05:15:42,080 --> 05:15:47,280
date, va păstra doar unul dintre

7010
05:15:43,520 --> 05:15:50,000
ei. Deci un set este ca o găleată cu

7011
05:15:47,280 --> 05:15:52,160
numai lucruri unice în ea.

7012
05:15:50,000 --> 05:15:54,400
Bine. Deci și uneori asta este cu adevărat

7013
05:15:52,160 --> 05:15:57,520
util este să știi care sunt

7014
05:15:54,400 --> 05:16:00,920
valori unice? Un set ne-ar ajuta

7015
05:15:57,520 --> 05:16:00,920
menține asta.

7016
05:16:02,240 --> 05:16:05,440
Aveți întrebări despre acestea? Știi, noi

7017
05:16:04,160 --> 05:16:07,360
trebuie să lucrăm cu asta și

7018
05:16:05,440 --> 05:16:09,120
vedeți asta în cod și vom face. Dar

7019
05:16:07,360 --> 05:16:10,480
doar orice întrebări în acest moment despre acestea

7020
05:16:09,120 --> 05:16:13,718
diferite tipuri de date pe care le avem

7021
05:16:10,480 --> 05:16:13,718
vorbind despre.

7022
05:16:21,680 --> 05:16:26,080
Bine.

7023
05:16:23,440 --> 05:16:28,080
Foarte bun.

7024
05:16:26,080 --> 05:16:31,920
În regulă. Să vorbim despre sarcină.

7025
05:16:28,080 --> 05:16:34,000
Deci, ceea ce înseamnă asta este um Oops. hai sa

7026
05:16:31,920 --> 05:16:38,080
vorbiți despre misiunea, ceea ce înseamnă că

7027
05:16:34,000 --> 05:16:40,560
vom lua un nume de variabilă și

7028
05:16:38,080 --> 05:16:42,480
atribuindu-i date. Acum am făcut-o deja

7029
05:16:40,560 --> 05:16:45,280
văzut asta. L-am văzut deja în demonstrația noastră

7030
05:16:42,480 --> 05:16:46,878
unde am introdus. Am făcut nume egali

7031
05:16:45,280 --> 05:16:51,360
intrare.

7032
05:16:46,878 --> 05:16:54,320
Deci simbolul egal este modul în care atribuim

7033
05:16:51,360 --> 05:16:56,798
valori la o variabilă.

7034
05:16:54,320 --> 05:16:58,638
Are sens, nu? Este foarte asemănător

7035
05:16:56,798 --> 05:17:02,160
se explică de la sine.

7036
05:16:58,638 --> 05:17:04,240
Dar la ce ar trebui să ne gândim cu a

7037
05:17:02,160 --> 05:17:09,200
variabilă este de fapt faptul că a

7038
05:17:04,240 --> 05:17:13,280
variabila este este o referire la acele date.

7039
05:17:09,200 --> 05:17:18,240
Bine. Deci, când spunem x= 34, suntem

7040
05:17:13,280 --> 05:17:21,440
atribuind 34 numelui x. Deci x devine

7041
05:17:18,240 --> 05:17:25,120
o variabilă care face referire la date

7042
05:17:21,440 --> 05:17:26,958
care este un număr întreg 34. Nu?

7043
05:17:25,120 --> 05:17:28,560
Ce este cu adevărat interesant în asta și

7044
05:17:26,958 --> 05:17:31,280
acesta este modul în care vă puteți testa

7045
05:17:28,560 --> 05:17:33,280
intuiția faptului că aceasta este a

7046
05:17:31,280 --> 05:17:36,798
referința este dacă venim și avem

7047
05:17:33,280 --> 05:17:38,560
alt nume Y și îl setăm egal cu

7048
05:17:36,798 --> 05:17:41,680
X.

7049
05:17:38,560 --> 05:17:43,920
Asta înseamnă doar că noi creăm

7050
05:17:41,680 --> 05:17:46,160
o altă referință care este egală cu

7051
05:17:43,920 --> 05:17:48,160
referință pe care o avem deja. Acum, de ce

7052
05:17:46,160 --> 05:17:50,400
am face asta vreodată? Probabil noi

7053
05:17:48,160 --> 05:17:52,798
nu ar fi. E oarecum redundant. Dar

7054
05:17:50,400 --> 05:17:56,400
asta demonstrează doar că sunt în cele din urmă

7055
05:17:52,798 --> 05:17:59,440
referințe pentru că atunci când afișăm x, noi

7056
05:17:56,400 --> 05:18:01,920
obțineți 34. Desigur, asta am stocat

7057
05:17:59,440 --> 05:18:04,480
valoarea 34

7058
05:18:01,920 --> 05:18:06,400
uh referit de x.

7059
05:18:04,480 --> 05:18:09,200
Și atunci când tipărim y, obținem

7060
05:18:06,400 --> 05:18:11,840
acelasi numar, nu? Primim 34. Și de ce

7061
05:18:09,200 --> 05:18:15,360
se intampla asa? Pentru că noi

7062
05:18:11,840 --> 05:18:17,840
literal declarat y egal cu x. Înțeles

7063
05:18:15,360 --> 05:18:21,760
y ar trebui să facă referire la aceleași date pe care x

7064
05:18:17,840 --> 05:18:25,840
face. Bine, deci ca variabile sunt

7065
05:18:21,760 --> 05:18:28,080
sens egal că um X este ființă

7066
05:18:25,840 --> 05:18:31,760
atribuit lui Y, adică Y ar trebui să facă referire

7067
05:18:28,080 --> 05:18:34,000
aceleași date pe care le face X. Deci ei ei

7068
05:18:31,760 --> 05:18:37,520
uh conțin aceleași date. Acum ce este

7069
05:18:34,000 --> 05:18:40,798
interesant este dacă imprimați ID-ul.

7070
05:18:37,520 --> 05:18:46,360
Deci ID-ul este intern

7071
05:18:40,798 --> 05:18:46,360
um adresa memoriei interne

7072
05:18:46,878 --> 05:18:51,600
de referință.

7073
05:18:49,600 --> 05:18:53,200
Acum, de obicei, nu ne pasă

7074
05:18:51,600 --> 05:18:55,040
asta, dar asta este doar pentru a dovedi ideea

7075
05:18:53,200 --> 05:18:57,760
este că poți vedea că acestea sunt la fel

7076
05:18:55,040 --> 05:19:00,000
adresa. Acestea sunt la fel. Asta prin

7077
05:18:57,760 --> 05:19:01,760
design pentru că spunem că bine am

7078
05:19:00,000 --> 05:19:03,920
această referință X care face referire

7079
05:19:01,760 --> 05:19:06,718
aceste date 34. sunt stocate la aceasta

7080
05:19:03,920 --> 05:19:10,160
adresa. Hm, și apoi când vin eu

7081
05:19:06,718 --> 05:19:12,400
și spuneți, bine, y este egal cu x, asta este

7082
05:19:10,160 --> 05:19:14,798
aceeași referință. Vezi tu cum e

7083
05:19:12,400 --> 05:19:16,878
aceeasi adresa exacta,

7084
05:19:14,798 --> 05:19:19,280
aceeași referință.

7085
05:19:16,878 --> 05:19:21,520
Deci, doar demonstrând că variabilele sunt

7086
05:19:19,280 --> 05:19:23,520
literalmente doar referiri la date. Ei

7087
05:19:21,520 --> 05:19:25,600
permiteți-ne să facem referire la acele date, care

7088
05:19:23,520 --> 05:19:28,240
este cu adevărat, într-adevăr, știi, drăguț. Deci,

7089
05:19:25,600 --> 05:19:30,240
putem reutiliza x în tot codul. um,

7090
05:19:28,240 --> 05:19:34,760
putem reutiliza numele. putem sa stii

7091
05:19:30,240 --> 05:19:34,760
orice am crea, putem reutiliza.

7092
05:19:35,040 --> 05:19:42,160
Hm, dacă te uiți în dreapta, avem

7093
05:19:38,878 --> 05:19:45,280
un exemplu alternativ care acum

7094
05:19:42,160 --> 05:19:47,280
resetează y pentru a stoca o nouă valoare. Deci

7095
05:19:45,280 --> 05:19:49,920
în loc să spunem y este egal cu x we

7096
05:19:47,280 --> 05:19:52,798
de fapt suprascrieți y și reatribuiți-l la

7097
05:19:49,920 --> 05:19:56,320
numărul întreg 78. Aceasta este o nouă bucată de

7098
05:19:52,798 --> 05:19:59,120
date corecte 78. Deci acum dacă te uiți la

7099
05:19:56,320 --> 05:20:02,000
sunt referințele lor, sunt

7100
05:19:59,120 --> 05:20:03,760
diferite. Acestea sunt diferite. Și asta

7101
05:20:02,000 --> 05:20:06,320
are sens pentru că acum arată cu degetul

7102
05:20:03,760 --> 05:20:09,280
la două date diferite,

7103
05:20:06,320 --> 05:20:12,080
nu? X arată spre 34. Y este

7104
05:20:09,280 --> 05:20:13,600
făcând referire la 78. Deci, desigur, sunt

7105
05:20:12,080 --> 05:20:16,080
va fi diferit uh diferit

7106
05:20:13,600 --> 05:20:19,840
adrese. Și aceasta este o greșeală de tipar.

7107
05:20:16,080 --> 05:20:21,680
Acesta ar trebui să spună ID-ul lui Y

7108
05:20:19,840 --> 05:20:24,320
pentru că suntem ref, vorbim despre Y.

7109
05:20:21,680 --> 05:20:27,440
E cam o greșeală de scriere acolo.

7110
05:20:24,320 --> 05:20:29,360
Bine, deci sperăm că acesta este acum acest exemplu

7111
05:20:27,440 --> 05:20:31,920
este doar pentru a întări faptul că atunci când

7112
05:20:29,360 --> 05:20:33,920
folosim semnul egal, stabilim

7113
05:20:31,920 --> 05:20:36,638
egal, setăm un nume de variabilă

7114
05:20:33,920 --> 05:20:38,480
egal cu o bucată de date, nu? Şi

7115
05:20:36,638 --> 05:20:40,480
care creează o referire la asta

7116
05:20:38,480 --> 05:20:41,760
bucată de date.

7117
05:20:40,480 --> 05:20:45,040
Atât suntem, asta e tot ce spunem

7118
05:20:41,760 --> 05:20:47,600
cu asta. Deci atribuim o piesă

7119
05:20:45,040 --> 05:20:51,080
de date la referința respectivă X sau Y sau

7120
05:20:47,600 --> 05:20:51,080
oricare ar fi.

7121
05:20:53,040 --> 05:20:56,040
Bine.

7122
05:20:56,480 --> 05:21:02,240
În regulă. Lasă-mă să vă întreb, băieți. Hm, ce

7123
05:20:59,920 --> 05:21:04,480
este tipul de date implicit al unei variabile

7124
05:21:02,240 --> 05:21:05,600
atribuit folosind funcția de intrare? Aceasta

7125
05:21:04,480 --> 05:21:06,718
este o intrebare interesanta. Noi nu am făcut-o

7126
05:21:05,600 --> 05:21:08,400
de fapt acoperă asta, așa că chiar sunt

7127
05:21:06,718 --> 05:21:11,400
curios să văd ce părere aveți

7128
05:21:08,400 --> 05:21:11,400
aceasta.

7129
05:21:24,320 --> 05:21:32,040
Multe voturi pentru șir.

7130
05:21:28,320 --> 05:21:32,040
Hai să mai luăm câteva.

7131
05:21:38,638 --> 05:21:44,400
Perfect. Da. Deci, chitanță voturi apă

7132
05:21:40,878 --> 05:21:47,760
este o sfoară. Deci, asta implora

7133
05:21:44,400 --> 05:21:49,680
întrebare precum ce se întâmplă dacă introducem a

7134
05:21:47,760 --> 05:21:53,520
număr? Ca ce se întâmplă dacă punem un

7135
05:21:49,680 --> 05:21:56,000
doi? Ce se întâmplă cu asta? Ştii asta

7136
05:21:53,520 --> 05:21:59,440
două vor fi de fapt citite ca

7137
05:21:56,000 --> 05:22:01,680
șirul doi. Așa ar fi Așa dacă am folosi

7138
05:21:59,440 --> 05:22:06,560
intrarea și noi trage în sus acel text

7139
05:22:01,680 --> 05:22:09,440
cutie și punem un număr ca doi

7140
05:22:06,560 --> 05:22:11,680
um și setăm asta egal cu variabila

7141
05:22:09,440 --> 05:22:14,638
x, indiferent cum numim acel nume x,

7142
05:22:11,680 --> 05:22:19,840
orice. Ceea ce înseamnă cu adevărat este x este

7143
05:22:14,638 --> 05:22:22,400
va fi um egal cu um x este

7144
05:22:19,840 --> 05:22:25,920
va fi egal cu

7145
05:22:22,400 --> 05:22:28,240
uh șirul 2. Deci asta trebuie să fie

7146
05:22:25,920 --> 05:22:30,240
precaut cu privire la intrare este

7147
05:22:28,240 --> 05:22:33,520
presupune întotdeauna că datele de intrare merg

7148
05:22:30,240 --> 05:22:37,040
a fi o sfoară. Deci, din fericire, există o cale

7149
05:22:33,520 --> 05:22:39,280
pentru a converti între șiruri și numere.

7150
05:22:37,040 --> 05:22:41,920
Deci, dacă am vrut să transformăm asta în

7151
05:22:39,280 --> 05:22:44,798
numărul real, ceea ce am face este să folosim

7152
05:22:41,920 --> 05:22:48,000
funcția de tip de date int, care

7153
05:22:44,798 --> 05:22:50,160
ar converti uh asta l-ar converti

7154
05:22:48,000 --> 05:22:52,160
la cei doi numerici. Ar fi

7155
05:22:50,160 --> 05:22:54,958
de fapt îl convertesc dintr-un șir într-un

7156
05:22:52,160 --> 05:22:56,798
întreg. Folosim doar int. Sau am putea

7157
05:22:54,958 --> 05:22:59,760
folosiți like if we if cineva a pus un

7158
05:22:56,798 --> 05:23:04,480
zecimală ca 2,5

7159
05:22:59,760 --> 05:23:06,480
atunci am putea face o plutire

7160
05:23:04,480 --> 05:23:09,520
de 2,5

7161
05:23:06,480 --> 05:23:12,958
și asta ar transforma asta în uh

7162
05:23:09,520 --> 05:23:15,120
numărul.

7163
05:23:12,958 --> 05:23:16,958
Bine, lasă-mă să vă arăt, băieți

7164
05:23:15,120 --> 05:23:18,240
aceasta. Lasă-mă să trec la Colab real

7165
05:23:16,958 --> 05:23:19,680
repede și vă arăt asta băieți. stiu

7166
05:23:18,240 --> 05:23:21,920
nu este într-un demo, dar cred că va fi

7167
05:23:19,680 --> 05:23:23,120
mai bine dacă îți arăt ce vreau să spun

7168
05:23:21,920 --> 05:23:26,360
asta pentru că acesta este un punct important

7169
05:23:23,120 --> 05:23:26,360
cu intrare.

7170
05:23:26,718 --> 05:23:32,878
Așa că, lasă-mă să nu mai trimit acolo. Lasă-mă

7171
05:23:30,160 --> 05:23:37,160
Treci la Collab pentru o secundă ca să pot

7172
05:23:32,878 --> 05:23:37,160
să-ți arăt literalmente ce înseamnă asta.

7173
05:23:38,798 --> 05:23:45,280
Deci, întoarceți-vă în caiet aici. Deci

7174
05:23:41,280 --> 05:23:47,920
ceea ce vreau să-ți arăt este că atunci când

7175
05:23:45,280 --> 05:23:51,040
facem intrare

7176
05:23:47,920 --> 05:23:53,040
tipul implicit

7177
05:23:51,040 --> 05:23:58,840
este sfoară.

7178
05:23:53,040 --> 05:23:58,840
Deci, de exemplu, când fac eu

7179
05:23:59,920 --> 05:24:10,680
când fac uh uh valoarea este egală cu intrarea

7180
05:24:05,120 --> 05:24:10,680
și hai să încercăm să introduceți vârsta dvs.

7181
05:24:12,718 --> 05:24:21,000
Hopa! Introduceți vârsta dvs.

7182
05:24:15,440 --> 05:24:21,000
Și apoi rulăm asta.

7183
05:24:21,520 --> 05:24:28,320
Așa că intrăm în vârstă. Acum asta merge

7184
05:24:24,320 --> 05:24:30,320
pentru a fi citit ca un șir. Deci chiar

7185
05:24:28,320 --> 05:24:31,520
deși pun un număr acolo, este

7186
05:24:30,320 --> 05:24:34,480
de fapt va fi citit ca a

7187
05:24:31,520 --> 05:24:39,520
sfoară. Deci acum

7188
05:24:34,480 --> 05:24:42,718
uite care este tipul de valoare.

7189
05:24:39,520 --> 05:24:45,200
Este o sfoară. Vedem asta? Deci

7190
05:24:42,718 --> 05:24:49,040
sfoară. Deci acest număr, chiar dacă noi

7191
05:24:45,200 --> 05:24:52,160
puneți un număr, acesta primește intrarea

7192
05:24:49,040 --> 05:24:53,760
funcția îl convertește întotdeauna într-un șir

7193
05:24:52,160 --> 05:24:56,878
indiferent ce punem acolo. Dacă punem un

7194
05:24:53,760 --> 05:24:58,480
zecimal dacă punem un număr mare este

7195
05:24:56,878 --> 05:25:01,280
întotdeauna o să presupun că este un este a

7196
05:24:58,480 --> 05:25:05,760
sfoară. Din fericire

7197
05:25:01,280 --> 05:25:09,840
um putem converti într-un număr întreg

7198
05:25:05,760 --> 05:25:12,958
folosind int funcția int.

7199
05:25:09,840 --> 05:25:14,560
Deci, putem imprima scuze, putem spune

7200
05:25:12,958 --> 05:25:18,400
valoare

7201
05:25:14,560 --> 05:25:23,120
uh sau putem face int value which

7202
05:25:18,400 --> 05:25:27,040
va converti acel șir de 32 pentru că

7203
05:25:23,120 --> 05:25:30,240
chiar acum, dacă ar fi să afișez

7204
05:25:27,040 --> 05:25:33,120
valoare este un șir 32. O puteți vedea

7205
05:25:30,240 --> 05:25:37,760
în interiorul ghilimelelor. Dar acum când o fac

7206
05:25:33,120 --> 05:25:40,080
asta uh și pot rula că acum este un

7207
05:25:37,760 --> 05:25:42,240
întreg. Vedem că acum este

7208
05:25:40,080 --> 05:25:43,840
de fapt un număr

7209
05:25:42,240 --> 05:25:45,120
ceea ce este grozav. Nu mai are acelea

7210
05:25:43,840 --> 05:25:47,040
citate. De fapt va fi

7211
05:25:45,120 --> 05:25:49,200
tratat ca un număr întreg real care

7212
05:25:47,040 --> 05:25:51,040
poate fi util pentru calcule sau

7213
05:25:49,200 --> 05:25:53,040
depozitându-l sau orice altceva avem nevoie

7214
05:25:51,040 --> 05:25:56,240
a face cu ea. Deci asta e doar o bucată

7215
05:25:53,040 --> 05:25:58,240
de precauție cu intrarea este dacă sunteți

7216
05:25:56,240 --> 05:26:00,160
lucrând cu date numerice se întâmplă

7217
05:25:58,240 --> 05:26:02,400
să-l trateze ca pe o sfoară. Trebuie

7218
05:26:00,160 --> 05:26:05,400
converti-l.

7219
05:26:02,400 --> 05:26:05,400
Bine

7220
05:26:05,440 --> 05:26:09,360
întrebări despre asta. Are sens?

7221
05:26:07,600 --> 05:26:12,000
la noi? cum ar fi întotdeauna intrarea

7222
05:26:09,360 --> 05:26:15,040
acceptă intrarea ca șir. Deci dacă noi

7223
05:26:12,000 --> 05:26:19,560
vrei să lucrezi cu el alternativ

7224
05:26:15,040 --> 05:26:19,560
ar trebui să-l convertim.

7225
05:26:20,560 --> 05:26:27,520
Uh, poți da așa cum ai putea

7226
05:26:23,360 --> 05:26:30,400
converti um dacă am făcut asta dacă am împachetat

7227
05:26:27,520 --> 05:26:32,560
asta în jur în funcția int care

7228
05:26:30,400 --> 05:26:34,718
ar fi automat

7229
05:26:32,560 --> 05:26:37,840
ia orice punem orice asta

7230
05:26:34,718 --> 05:26:41,120
returnările ar fi automat distribuite

7231
05:26:37,840 --> 05:26:43,120
peste un int. Deci am putea face asta. Deci

7232
05:26:41,120 --> 05:26:47,718
hai sa-ti arat asta. Deci când alerg

7233
05:26:43,120 --> 05:26:47,718
asta, pot pune 32

7234
05:26:48,400 --> 05:26:53,840
și este ca și cum ai merge automat

7235
05:26:51,280 --> 05:26:55,280
fi turnat într-un număr întreg. Deci acolo acum

7236
05:26:53,840 --> 05:26:57,360
este un număr întreg. Are sens?

7237
05:26:55,280 --> 05:26:59,520
Ca atunci când înfășuresc acest int în jurul

7238
05:26:57,360 --> 05:27:02,520
intrare, va fi automat

7239
05:26:59,520 --> 05:27:02,520
converti

7240
05:27:17,200 --> 05:27:22,400
Uh, ce ai pus în caseta de introducere?

7241
05:27:19,760 --> 05:27:24,958
Deci, da, veți primi o eroare dacă

7242
05:27:22,400 --> 05:27:28,080
nu introduceți un număr întreg valid.

7243
05:27:24,958 --> 05:27:30,320
Deci, hai să punem ca dacă mi-aș pune

7244
05:27:28,080 --> 05:27:31,840
nume,

7245
05:27:30,320 --> 05:27:34,480
asta va fi asta ar trebui să fie un

7246
05:27:31,840 --> 05:27:36,798
eroare pentru ca nu stiu cum

7247
05:27:34,480 --> 05:27:38,400
convertiți acest șir într-un număr. Ea

7248
05:27:36,798 --> 05:27:41,760
nu are sens să faci asta, nu?

7249
05:27:38,400 --> 05:27:41,760
Deci, aceasta ar trebui să fie o eroare.

7250
05:27:42,958 --> 05:27:47,878
Corect? Va fi o eroare pentru că

7251
05:27:44,480 --> 05:27:47,878
este o sfoară.

7252
05:27:53,600 --> 05:28:00,840
Deci de ce ai primit o eroare? Intrare

7253
05:27:55,680 --> 05:28:00,840
introduceți valoarea dvs. de vârstă int value.

7254
05:28:04,080 --> 05:28:08,798
A apărut caseta de text?

7255
05:28:06,958 --> 05:28:10,638
Poate încercați să o despărțiți în altele

7256
05:28:08,798 --> 05:28:12,718
celulă.

7257
05:28:10,638 --> 05:28:14,798
Încercați să puneți celelalte două rânduri în a

7258
05:28:12,718 --> 05:28:16,160
celulă diferită. Ai nevoie de text

7259
05:28:14,798 --> 05:28:18,958
caseta să apară și apoi trebuie

7260
05:28:16,160 --> 05:28:21,958
introduce ceva.

7261
05:28:18,958 --> 05:28:21,958
Da.

7262
05:28:22,400 --> 05:28:26,558
Bine.

7263
05:28:24,958 --> 05:28:28,958
În regulă. Are sens toate acestea? Oricare

7264
05:28:26,558 --> 05:28:31,958
intrebari despre asta? Despre intrare

7265
05:28:28,958 --> 05:28:31,958
funcția.

7266
05:28:33,120 --> 05:28:38,638
Bine.

7267
05:28:36,000 --> 05:28:42,040
Bun. Bine, lasă-mă să mă întorc la

7268
05:28:38,638 --> 05:28:42,040
note atunci.

7269
05:28:46,480 --> 05:28:49,480
Bine.

7270
05:28:53,120 --> 05:28:57,280
În regulă. Deci, avem o altă demonstrație.

7271
05:28:55,040 --> 05:28:59,120
Vom face asta acum. Uh, am fost doar un fel

7272
05:28:57,280 --> 05:29:01,840
făcând una, dar să revenim la

7273
05:28:59,120 --> 05:29:03,760
acesta va fi demonstrația cinci. Să facem asta.

7274
05:29:01,840 --> 05:29:06,400
Deci, vom exersa atribuirea

7275
05:29:03,760 --> 05:29:08,558
valori diferite um la variabile și

7276
05:29:06,400 --> 05:29:10,878
afișându-le doar ca să intri în

7277
05:29:08,558 --> 05:29:12,878
obiceiul de a-ți putea crea propriul tău

7278
05:29:10,878 --> 05:29:14,080
variabile și doar treceți prin acest tip

7279
05:29:12,878 --> 05:29:17,840
de încă o dată. Vom face asta

7280
05:29:14,080 --> 05:29:20,840
relativ repede și apoi mișcă-te

7281
05:29:17,840 --> 05:29:20,840
pe.

7282
05:29:20,958 --> 05:29:25,958
Deci, acesta va fi demonstrația cinci.

7283
05:29:29,280 --> 05:29:34,040
Deci, lasă-mă să o trag pe aia pentru tine

7284
05:29:31,040 --> 05:29:34,040
baieti.

7285
05:29:51,280 --> 05:29:55,240
Bine, lasă-mă să-mi partajez ecranul.

7286
05:29:57,840 --> 05:30:03,840
În regulă. Deci, acesta va fi o demonstrație

7287
05:29:59,920 --> 05:30:05,920
cinci. um,

7288
05:30:03,840 --> 05:30:07,680
acum, din nou, simțiți-vă liber să utilizați

7289
05:30:05,920 --> 05:30:09,760
indiferent de platforma pe care ai folosit-o.

7290
05:30:07,680 --> 05:30:11,200
Colab, Jupyter Notebook. Stiu asta

7291
05:30:09,760 --> 05:30:12,958
instrucțiunea spune că configurați un Jupyter

7292
05:30:11,200 --> 05:30:15,600
caietul. Simțiți-vă liber să folosiți orice aveți

7293
05:30:12,958 --> 05:30:17,920
vreau. Puteți folosi Colab. Hm, orice ar fi

7294
05:30:15,600 --> 05:30:20,160
am lucrat pentru tine pentru a-ți construi construcția

7295
05:30:17,920 --> 05:30:21,440
caietele tale. Deci, evident, asta

7296
05:30:20,160 --> 05:30:25,280
arată puțin diferit de colaborare, dar

7297
05:30:21,440 --> 05:30:27,680
este pentru că este Jupiter. Hm, deci noi

7298
05:30:25,280 --> 05:30:31,280
creați un caiet.

7299
05:30:27,680 --> 05:30:33,760
Acum ce vreau să vezi

7300
05:30:31,280 --> 05:30:37,440
este aceasta abordare a tuturor

7301
05:30:33,760 --> 05:30:41,600
tocmai am făcut-o. Lasă-mă să mă apropii de asta. Uh,

7302
05:30:37,440 --> 05:30:43,840
Știu că e puțin mic,

7303
05:30:41,600 --> 05:30:46,558
dar asta face tot ce facem noi

7304
05:30:43,840 --> 05:30:49,760
a spus că putem face acolo unde

7305
05:30:46,558 --> 05:30:52,638
um, în esență, ia

7306
05:30:49,760 --> 05:30:55,040
Deci, vreau doar să măresc pe asta. um,

7307
05:30:52,638 --> 05:31:00,000
observați că noi

7308
05:30:55,040 --> 05:31:01,920
uh luați intrarea um și asta va fi

7309
05:31:00,000 --> 05:31:03,680
salvat ca șir.

7310
05:31:01,920 --> 05:31:06,000
um,

7311
05:31:03,680 --> 05:31:08,878
deci aceasta va fi salvată ca șir și

7312
05:31:06,000 --> 05:31:11,040
aceasta va fi salvată în acest nume. Şi

7313
05:31:08,878 --> 05:31:12,638
de exemplu, aceasta va fi salvată ca a

7314
05:31:11,040 --> 05:31:14,798
șir, dar îl convertim într-un

7315
05:31:12,638 --> 05:31:17,200
int, care este exact genul de

7316
05:31:14,798 --> 05:31:21,040
exemplu tocmai l-am făcut, nu? Unde ducem

7317
05:31:17,200 --> 05:31:24,200
luăm o intrare, o convertim în

7318
05:31:21,040 --> 05:31:24,200
uh int.

7319
05:31:24,798 --> 05:31:29,280
Are cineva Da. Oare cineva

7320
05:31:26,558 --> 05:31:30,718
ai demo-urile disponibile? parcă dacă

7321
05:31:29,280 --> 05:31:33,760
pe cineva nu se deranjează să le împartă

7322
05:31:30,718 --> 05:31:35,600
chatul. Din nou, nu am PDF-urile.

7323
05:31:33,760 --> 05:31:37,280
Ar trebui să fie din LMS-ul dvs. Ei

7324
05:31:35,600 --> 05:31:39,120
ar trebui să fie în materialul de referință.

7325
05:31:37,280 --> 05:31:41,760
Ar trebui să existe un folder demo-uri pe care dvs

7326
05:31:39,120 --> 05:31:45,440
poate descărca. Dacă cineva are acelea și

7327
05:31:41,760 --> 05:31:47,200
nu-i deranjează să le împărtășească.

7328
05:31:45,440 --> 05:31:51,400
Au acel dosar cu ele, ca un

7329
05:31:47,200 --> 05:31:51,400
dosar zip al acestora, ar fi fantastic.

7330
05:31:54,798 --> 05:32:01,920
Da. Mulţumesc. Mulţumesc. Acesta este Acesta este

7331
05:31:58,000 --> 05:32:04,958
demo-ul prin care trecem în prezent.

7332
05:32:01,920 --> 05:32:07,360
Perfect. Deci, pentru voi băieți care aveți probleme

7333
05:32:04,958 --> 05:32:10,480
navigând în demonstrații, vă rugăm să descărcați

7334
05:32:07,360 --> 05:32:13,120
acest folder zip.

7335
05:32:10,480 --> 05:32:14,958
Descărcați folderul zip că acestea

7336
05:32:13,120 --> 05:32:16,558
baietii incarca. Multumesc mult.

7337
05:32:14,958 --> 05:32:18,240
Descărcați folderul zip ca să aveți tot

7338
05:32:16,558 --> 05:32:22,440
dintre ei.

7339
05:32:18,240 --> 05:32:22,440
Vă rugăm să luați un moment pentru a face asta.

7340
05:32:25,360 --> 05:32:29,878
Bine.

7341
05:32:26,878 --> 05:32:29,878
Uh,

7342
05:32:36,558 --> 05:32:40,320
copiați codul și am primit o eroare la înălțime

7343
05:32:38,240 --> 05:32:42,958
valoare. Folosește picior, nu metru. Sunt serios

7344
05:32:40,320 --> 05:32:44,798
nu ar trebui să conteze. Ea, știi, tu

7345
05:32:42,958 --> 05:32:48,440
ar trebui să fie doar scopul acela

7346
05:32:44,798 --> 05:32:48,440
a pune o zecimală.

7347
05:32:50,240 --> 05:32:56,040
Cum se creează un fișier nou. Hm, ce

7348
05:32:52,160 --> 05:32:56,040
pe platforma esti? Colaborare.

7349
05:32:56,320 --> 05:33:01,520
Nu știu pe ce platformă ești.

7350
05:32:58,558 --> 05:33:03,280
Colaborare. Uh, du-te la dosar, nou

7351
05:33:01,520 --> 05:33:05,120
caietul.

7352
05:33:03,280 --> 05:33:08,280
Notebook nou în drive, cred că este ceea ce

7353
05:33:05,120 --> 05:33:08,280
se numeste.

7354
05:33:13,920 --> 05:33:16,718
Vezi asta? Ar trebui să fie așa

7355
05:33:15,440 --> 05:33:20,680
ar trebui să fie în vârf. Ar trebui să existe o

7356
05:33:16,718 --> 05:33:20,680
fișier și apoi caiet nou.

7357
05:33:22,638 --> 05:33:29,080
Lasă-mă să trec la asta.

7358
05:33:26,080 --> 05:33:29,080
Uh,

7359
05:33:30,400 --> 05:33:36,958
acesta. Nu vezi asta

7360
05:33:34,558 --> 05:33:41,760
dosar. Este în vârf. Partea de sus a

7361
05:33:36,958 --> 05:33:45,638
caietul. Faceți fișierul și apoi caietul nou.

7362
05:33:41,760 --> 05:33:45,638
Nu vezi caietul nou.

7363
05:33:56,400 --> 05:34:01,360
Dacă nu vezi asta, du-te

7364
05:33:58,558 --> 05:34:05,200
la o filă nouă. Doar accesați o filă nouă și

7365
05:34:01,360 --> 05:34:07,360
accesați Google Colab.

7366
05:34:05,200 --> 05:34:10,160
Poți oricând să faci asta. Doar du-te la doar

7367
05:34:07,360 --> 05:34:12,000
începe un nou um, mergi la Google Colab

7368
05:34:10,160 --> 05:34:13,920
și apoi vă va permite să lansați un

7369
05:34:12,000 --> 05:34:17,680
caiet nou. Așa că doar fă asta. Doar

7370
05:34:13,920 --> 05:34:17,680
faceți o filă nouă dacă nu funcționează.

7371
05:34:22,558 --> 05:34:26,160
Bine.

7372
05:34:24,480 --> 05:34:28,480
Deci, apropo, unul dintre acele exemple

7373
05:34:26,160 --> 05:34:31,840
intra într-un flotor. Deci, părea amabil

7374
05:34:28,480 --> 05:34:36,718
de ca asta. Deci am avut al nostru

7375
05:34:31,840 --> 05:34:41,680
înălțimea este egală cu plutirea și apoi am avut

7376
05:34:36,718 --> 05:34:47,200
uh introduceți și apoi am pus um să vă introduceți

7377
05:34:41,680 --> 05:34:49,440
înălțimea și apoi asta a fost un fel

7378
05:34:47,200 --> 05:34:54,718
de uh asta ar trebui să fie un fel de

7379
05:34:49,440 --> 05:34:57,520
valoare zecimală. Deci, să spunem că sunt eu

7380
05:34:54,718 --> 05:35:00,878
nu stiu uh 5.7

7381
05:34:57,520 --> 05:35:04,638
orice ar fi, uh picioare, nu este

7382
05:35:00,878 --> 05:35:07,280
doar niște zecimale și apoi lovim uh

7383
05:35:04,638 --> 05:35:10,400
apăsăm enter care va stoca înălțimea

7384
05:35:07,280 --> 05:35:13,440
ca un plutitor astfel încât atunci când vom afișa

7385
05:35:10,400 --> 05:35:15,120
înălțimea uh va fi redată ca a

7386
05:35:13,440 --> 05:35:19,400
plutește în mod corespunzător, asta este

7387
05:35:15,120 --> 05:35:19,400
că asta ar trebui să se întâmple

7388
05:35:20,080 --> 05:35:25,638
acesta este scopul de care are nevoie doar

7389
05:35:21,280 --> 05:35:25,638
să fie o zecimală. Ar trebui să funcționeze.

7390
05:35:31,600 --> 05:35:37,160
Bine, lasă-mă să mă întorc la demonstrație

7391
05:35:34,160 --> 05:35:37,160
document.

7392
05:35:38,878 --> 05:35:42,240
În regulă, ați fost capabili să fugiți

7393
05:35:40,240 --> 05:35:44,638
unele dintre acestea? Cum ar fi, ai putut

7394
05:35:42,240 --> 05:35:46,320
rulați unele dintre intrări și schimbați-le?

7395
05:35:44,638 --> 05:35:48,878
Deci, încercați-le pe cont propriu

7396
05:35:46,320 --> 05:35:52,160
repede. cum ar fi încercați să faceți int și apoi introduceți

7397
05:35:48,878 --> 05:35:54,558
pentru a introduce vârsta ta. Ar trebui să se convertească

7398
05:35:52,160 --> 05:35:56,638
că. Ar trebui să pui un număr

7399
05:35:54,558 --> 05:36:00,520
sau vei primi o eroare și asta

7400
05:35:56,638 --> 05:36:00,520
ar trebui să transforme asta.

7401
05:36:04,480 --> 05:36:08,878
Apropo, nu mi-aș face griji pentru asta

7402
05:36:06,320 --> 05:36:11,280
ultima pentru că nu am învățat

7403
05:36:08,878 --> 05:36:13,760
despre operatorul de comparație încă care

7404
05:36:11,280 --> 05:36:15,600
acesta este egal egal. Așa că vom învăța

7405
05:36:13,760 --> 05:36:17,200
despre asta într-un pic în câteva

7406
05:36:15,600 --> 05:36:18,958
minute. Deci, nu-ți face griji pentru asta

7407
05:36:17,200 --> 05:36:21,440
prea mult acum. Dar măcar acestea

7408
05:36:18,958 --> 05:36:25,000
primele câteva ar trebui să aibă sens și noi

7409
05:36:21,440 --> 05:36:25,000
ar trebui să poată face.

7410
05:36:25,280 --> 05:36:32,160
Ați fost capabili să conduceți unul dintre acestea

7411
05:36:27,840 --> 05:36:36,240
și convertiți peste float sau int

7412
05:36:32,160 --> 05:36:39,958
și faceți intrarea și convertiți-o?

7413
05:36:36,240 --> 05:36:39,958
A funcționat pentru tine?

7414
05:36:41,760 --> 05:36:45,240
Încearcă.

7415
05:36:54,798 --> 05:37:00,680
Lasă-mă să clarific asta. Orice întrebări despre

7416
05:36:57,680 --> 05:37:00,680
asta?

7417
05:37:05,440 --> 05:37:09,400
Ar trebui să arate așa ceva.

7418
05:37:10,000 --> 05:37:14,160
Bun. Ne pricepem bine la asta la conversie

7419
05:37:11,600 --> 05:37:15,920
peste intrare. Bine, perfect. Sunete

7420
05:37:14,160 --> 05:37:20,120
Se pare că suntem capabili să facem asta

7421
05:37:15,920 --> 05:37:20,120
și a fost în regulă.

7422
05:37:23,840 --> 05:37:28,280
Ce intri pentru picioare?

7423
05:37:28,400 --> 05:37:32,798
Ca, intri literalmente ca

7424
05:37:30,638 --> 05:37:34,240
citate?

7425
05:37:32,798 --> 05:37:37,680
Da, asta nu va funcționa când tu

7426
05:37:34,240 --> 05:37:39,760
fă asta pentru că va fi

7427
05:37:37,680 --> 05:37:40,958
un șir f, există un caracter acolo.

7428
05:37:39,760 --> 05:37:42,798
nu se va putea converti

7429
05:37:40,958 --> 05:37:46,480
peste la.

7430
05:37:42,798 --> 05:37:48,320
Deci, dacă ai face dacă ai face 6.4, asta ar fi

7431
05:37:46,480 --> 05:37:50,798
munca.

7432
05:37:48,320 --> 05:37:54,160
Orice zecimală ar trebui să funcționeze. Dar la fel ca f

7433
05:37:50,798 --> 05:37:57,920
este un personaj. Deci, plutitorul nu

7434
05:37:54,160 --> 05:38:00,558
știi să transformi un personaj,

7435
05:37:57,920 --> 05:38:03,520
nu? Da. Deci nu se va întâmpla

7436
05:38:00,558 --> 05:38:07,200
munca. Trebuie să introduceți o zecimală până la to

7437
05:38:03,520 --> 05:38:09,680
să poată converti în număr.

7438
05:38:07,200 --> 05:38:12,878
Bine.

7439
05:38:09,680 --> 05:38:18,200
Foarte bun. Foarte bun. Să ne întoarcem

7440
05:38:12,878 --> 05:38:18,200
la notele noastre ca să putem continua.

7441
05:38:29,040 --> 05:38:36,480
1.7. Da. Dacă ai, dacă ai

7442
05:38:33,040 --> 05:38:37,760
orice personaj, nu va funcționa.

7443
05:38:36,480 --> 05:38:43,400
Nu va merge. Trebuie să pui

7444
05:38:37,760 --> 05:38:43,400
în trebuie să introduceți o zecimală.

7445
05:38:44,160 --> 05:38:48,958
Bine, să vorbim despre operatori.

7446
05:38:47,840 --> 05:38:52,760
Deci, acestea vor fi cu adevărat

7447
05:38:48,958 --> 05:38:52,760
important. um,

7448
05:38:54,718 --> 05:39:00,558
să vorbim despre operatori ca noi

7449
05:38:57,440 --> 05:39:03,200
poate uh

7450
05:39:00,558 --> 05:39:06,240
să fii capabil să compari lucrurile și să lucrezi

7451
05:39:03,200 --> 05:39:08,958
cu lucruri. Hm, hai să vorbim

7452
05:39:06,240 --> 05:39:10,958
despre operatorii Python.

7453
05:39:08,958 --> 05:39:13,200
Deci, ce sunt operatorii? Ce vrem să spunem

7454
05:39:10,958 --> 05:39:16,000
prin asta? În Python, operatorii sunt

7455
05:39:13,200 --> 05:39:18,320
simboluri speciale sau cuvinte cheie care efectuează

7456
05:39:16,000 --> 05:39:21,760
operațiuni. Deci, după cum sugerează și numele,

7457
05:39:18,320 --> 05:39:24,000
efectuează un anumit nivel de operare.

7458
05:39:21,760 --> 05:39:25,680
Hm, ceea ce înseamnă că interpretul

7459
05:39:24,000 --> 05:39:27,920
ar trebui să facă un fel de logic

7460
05:39:25,680 --> 05:39:30,000
operație, operație matematică,

7461
05:39:27,920 --> 05:39:33,120
operație relațională pentru a produce a

7462
05:39:30,000 --> 05:39:35,200
rezultat. Um, de obicei asta înseamnă

7463
05:39:33,120 --> 05:39:36,958
vor fi mai multe variabile

7464
05:39:35,200 --> 05:39:39,280
care vor fi folosite pentru a face unele

7465
05:39:36,958 --> 05:39:41,200
operațiune între. Deci un exemplu de an

7466
05:39:39,280 --> 05:39:42,878
operațiunea ar fi ca și cum ați adăuga,

7467
05:39:41,200 --> 05:39:45,280
scăderea, înmulțirea. Asta e un

7468
05:39:42,878 --> 05:39:49,200
operare. Dar putem avea logica

7469
05:39:45,280 --> 05:39:51,600
operațiuni precum luarea um logică

7470
05:39:49,200 --> 05:39:54,958
şi sau logic sau a lucrurilor. Vom vedea

7471
05:39:51,600 --> 05:39:56,718
ce înseamnă asta. Dar în Python,

7472
05:39:54,958 --> 05:39:59,200
sunt multe situații în care ne dorim

7473
05:39:56,718 --> 05:40:01,360
vrem să putem face operațiuni

7474
05:39:59,200 --> 05:40:03,200
între variabile. Fie că e simplu

7475
05:40:01,360 --> 05:40:06,638
matematică sau poate un fel de

7476
05:40:03,200 --> 05:40:09,760
relațional ca testarea dacă o valoare este în

7477
05:40:06,638 --> 05:40:13,440
o listă. Este o operațiune importantă.

7478
05:40:09,760 --> 05:40:15,600
Este 10 în lista mea? Sunt cinci în lista mea? Hm

7479
05:40:13,440 --> 05:40:17,200
sunt operațiuni importante. Deci noi

7480
05:40:15,600 --> 05:40:18,558
doresc să afle despre acești operatori și

7481
05:40:17,200 --> 05:40:21,200
vor fi cu adevărat importante pentru

7482
05:40:18,558 --> 05:40:24,160
noi mergem înainte este pentru că aceștia vor

7483
05:40:21,200 --> 05:40:27,760
fi foarte standard. lucruri pe care le vom folosi

7484
05:40:24,160 --> 05:40:30,638
pe măsură ce mergem. Deci vom merge

7485
05:40:27,760 --> 05:40:33,520
petrece ceva timp vorbind despre operatori.

7486
05:40:30,638 --> 05:40:35,600
Deci se pare că în Python poți

7487
05:40:33,520 --> 05:40:38,320
un fel de grup de operatori în multe

7488
05:40:35,600 --> 05:40:40,400
diferite categorii. Um, se duce

7489
05:40:38,320 --> 05:40:41,920
să fie operatori aritmetici standard.

7490
05:40:40,400 --> 05:40:44,080
Acestea sunt lucrurile tale de zi cu zi

7491
05:40:41,920 --> 05:40:46,400
plus, minus, um diviziune,

7492
05:40:44,080 --> 05:40:48,080
înmulțire. Hm, sarcina

7493
05:40:46,400 --> 05:40:50,080
operatori, pe care i-am văzut deja, este

7494
05:40:48,080 --> 05:40:52,240
lucruri precum egali, unde ne stabilim

7495
05:40:50,080 --> 05:40:54,400
o referință egală cu ceva. Noi am

7496
05:40:52,240 --> 05:40:56,160
deja văzut asta. Asta e o misiune.

7497
05:40:54,400 --> 05:40:58,480
Comparația, care este lucruri ca mai mari

7498
05:40:56,160 --> 05:41:00,798
decât sau mai puțin decât. Acestea sunt importante

7499
05:40:58,480 --> 05:41:03,440
pentru compararea valorilor, compararea

7500
05:41:00,798 --> 05:41:06,000
variabile. Operatorii logici sunt

7501
05:41:03,440 --> 05:41:08,878
va fi ceva de genul și și sau,

7502
05:41:06,000 --> 05:41:11,520
care va face o operație logică

7503
05:41:08,878 --> 05:41:13,520
între două două valori booleene. Asta va

7504
05:41:11,520 --> 05:41:15,680
fi important. Și apoi avem un

7505
05:41:13,520 --> 05:41:17,600
colecție de operatori diverși.

7506
05:41:15,680 --> 05:41:20,718
Acestea vor fi lucruri așa cum sunt

7507
05:41:17,600 --> 05:41:23,520
ceva dintr-o colecție ca este cinci

7508
05:41:20,718 --> 05:41:24,798
intr-o lista? Acesta este un operator. Deci vom face

7509
05:41:23,520 --> 05:41:26,400
vorbim vom vorbi despre toate

7510
05:41:24,798 --> 05:41:28,000
acestea, dar doar subliniind că există

7511
05:41:26,400 --> 05:41:31,240
multe categorii diferite de operatori

7512
05:41:28,000 --> 05:41:31,240
în Python.

7513
05:41:35,360 --> 05:41:39,120
Bine, să vorbim mai întâi despre

7514
05:41:36,878 --> 05:41:42,798
operatori aritmetici. Deci astea merg

7515
05:41:39,120 --> 05:41:45,520
să fie standardul tău în fiecare zi

7516
05:41:42,798 --> 05:41:47,360
operatii intre numere. Deci dacă noi

7517
05:41:45,520 --> 05:41:49,360
au valori numerice precum numere întregi sau

7518
05:41:47,360 --> 05:41:50,878
plutește, putem face matematică între ei.

7519
05:41:49,360 --> 05:41:52,558
Asta are sens. Așa ar trebui să fie o

7520
05:41:50,878 --> 05:41:55,440
capacitatea Python și cu siguranță

7521
05:41:52,558 --> 05:41:57,040
este. Putem adăuga lucruri, putem scădea

7522
05:41:55,440 --> 05:42:01,280
lucruri, putem înmulți lucrurile, putem

7523
05:41:57,040 --> 05:42:03,600
împărțiți lucrurile. Deci aici sunt toate acestea

7524
05:42:01,280 --> 05:42:06,718
operatori. Avem plus minus

7525
05:42:03,600 --> 05:42:09,600
asteriscul este o înmulțire. Deci x

7526
05:42:06,718 --> 05:42:11,200
asteriscul y le va înmulți împreună.

7527
05:42:09,600 --> 05:42:14,638
Deci, dacă avem două variabile, una dintre ele

7528
05:42:11,200 --> 05:42:16,400
este 50, unul dintre ei este patru, facem x

7529
05:42:14,638 --> 05:42:18,638
asterisc y, asta se va înmulți

7530
05:42:16,400 --> 05:42:21,520
ei împreună pentru a obține 200. Destul de drăguță

7531
05:42:18,638 --> 05:42:22,878
direct. Hm

7532
05:42:21,520 --> 05:42:24,878
diviziunea este cea care ar trebui să fim

7533
05:42:22,878 --> 05:42:28,080
atent la. Desigur, ca și cum noi nu

7534
05:42:24,878 --> 05:42:32,320
vrei să împarți la zero. Deci dacă tu eu dacă

7535
05:42:28,080 --> 05:42:34,718
uh această valoare secundară pe care o punem capăt

7536
05:42:32,320 --> 05:42:36,958
Împărțirea cu este zero, asta ne va da

7537
05:42:34,718 --> 05:42:38,480
o eroare. Um, interpretul va spune,

7538
05:42:36,958 --> 05:42:40,958
— Hei, încerci să împărți la zero.

7539
05:42:38,480 --> 05:42:42,320
Nu putem face asta. Va produce o

7540
05:42:40,958 --> 05:42:43,920
eroare. Deci asta e singurul lucru pe care îl avem

7541
05:42:42,320 --> 05:42:46,798
să fii în căutare cu diviziune.

7542
05:42:43,920 --> 05:42:48,558
Doar nu vreau să împart la zero.

7543
05:42:46,798 --> 05:42:50,240
Hm

7544
05:42:48,558 --> 05:42:52,798
deci toate acestea sunt destul de standard. eu

7545
05:42:50,240 --> 05:42:54,160
cred că toate au sens.

7546
05:42:52,798 --> 05:42:55,680
Sper să vă facă. cred eu

7547
05:42:54,160 --> 05:42:57,120
toate sunt destul de standard. stii tu,

7548
05:42:55,680 --> 05:42:59,680
genul de lucruri pe care le-ai vedea pe a pe a

7549
05:42:57,120 --> 05:43:02,320
calculator de bază. Toate au sens.

7550
05:42:59,680 --> 05:43:05,120
Ar trebui să existe. Acum, iată mai multe

7551
05:43:02,320 --> 05:43:07,200
cele exotice. Hm, nu știu dacă tu

7552
05:43:05,120 --> 05:43:10,080
baietii au vazut vreodata modulul

7553
05:43:07,200 --> 05:43:13,040
operator, cunoscut și sub numele de modulo. Aceasta este

7554
05:43:10,080 --> 05:43:15,840
unul care returnează restul a

7555
05:43:13,040 --> 05:43:18,718
diviziune. Bine? Deci procentul

7556
05:43:15,840 --> 05:43:21,600
semnul este o operație matematică între

7557
05:43:18,718 --> 05:43:23,520
două numere care returnează nu

7558
05:43:21,600 --> 05:43:27,280
coeficient ca nu împărțirea reală

7559
05:43:23,520 --> 05:43:29,200
rezultat dar restul. Deci 50 împărțit

7560
05:43:27,280 --> 05:43:34,320
cu patru

7561
05:43:29,200 --> 05:43:38,400
um știi că patru intră în 50 um merge

7562
05:43:34,320 --> 05:43:41,200
acolo uh uh de 12 ori uniform, dar asta

7563
05:43:38,400 --> 05:43:44,558
are două rămase peste dreapta. Deci acolo

7564
05:43:41,200 --> 05:43:48,638
restul sunt doua. Deci rezultatul

7565
05:43:44,558 --> 05:43:53,040
x mod am citi asta ca x mod y sau

7566
05:43:48,638 --> 05:43:54,240
modulo y um returnează două. Deci dacă ești dacă

7567
05:43:53,040 --> 05:43:55,840
nu ești familiarizat cu modulo

7568
05:43:54,240 --> 05:43:58,718
operație care pare puțin bizară

7569
05:43:55,840 --> 05:44:01,200
că iei aceste două numere

7570
05:43:58,718 --> 05:44:02,958
um hopa, pare puțin bizar că

7571
05:44:01,200 --> 05:44:06,080
iei aceste două numere și îți plac

7572
05:44:02,958 --> 05:44:07,600
faceți această operație și obțineți a

7573
05:44:06,080 --> 05:44:11,200
rezultatul rămas, dar este de fapt un

7574
05:44:07,600 --> 05:44:13,280
operare foarte puternica. Um motivul

7575
05:44:11,200 --> 05:44:14,718
ființa este că uneori vrem să știm

7576
05:44:13,280 --> 05:44:16,240
restul este mai mult decât ne dorim

7577
05:44:14,718 --> 05:44:18,080
pentru a ști care este coeficientul. Pentru

7578
05:44:16,240 --> 05:44:21,440
de exemplu, lucruri care seamănă foarte mult

7579
05:44:18,080 --> 05:44:24,080
de natură ciclică. Hm, deci poate mergem cu bicicleta

7580
05:44:21,440 --> 05:44:26,240
printr-o colecție și vrem să știm

7581
05:44:24,080 --> 05:44:28,400
cum ar fi de câte ori trecem pe bicicletă

7582
05:44:26,240 --> 05:44:31,280
și atunci ne-a mai rămas ceva

7583
05:44:28,400 --> 05:44:33,680
care este restul. Um deci modulo

7584
05:44:31,280 --> 05:44:35,440
operatia este destul de utila. Ai putea

7585
05:44:33,680 --> 05:44:38,240
de asemenea, verificați ca dacă un număr este par sau

7586
05:44:35,440 --> 05:44:40,638
ciudat folosind asta. Așa dacă ai modul de

7587
05:44:38,240 --> 05:44:42,240
doi și returnează zero, asta înseamnă că este

7588
05:44:40,638 --> 05:44:44,080
chiar, nu? Pentru că asta înseamnă că există

7589
05:44:42,240 --> 05:44:46,400
nu mai rămâne nimic când împart

7590
05:44:44,080 --> 05:44:50,480
cu doi. Așadar, modulo este un fel de mod plăcut

7591
05:44:46,400 --> 05:44:53,280
pentru a verifica dacă un număr este par sau impar. Hm

7592
05:44:50,480 --> 05:44:55,920
deci modulo este o operațiune destul de frumoasă.

7593
05:44:53,280 --> 05:44:59,040
Îl vom folosi din când în când. Uh dar

7594
05:44:55,920 --> 05:45:01,040
acesta este operatorul procentual. Deci x

7595
05:44:59,040 --> 05:45:05,920
la sută y va căuta acel rest

7596
05:45:01,040 --> 05:45:08,558
a diviziunii. Hm acum există și un

7597
05:45:05,920 --> 05:45:11,120
operator dublu oblic care este

7598
05:45:08,558 --> 05:45:14,480
operator de diviziune întreagă. Acesta este amabil

7599
05:45:11,120 --> 05:45:17,840
a inversului modulo. Este nevoie de

7600
05:45:14,480 --> 05:45:20,080
cel mai mare coeficient întreg care uh noi

7601
05:45:17,840 --> 05:45:23,520
poate face din perspectiva diviziunii. Deci

7602
05:45:20,080 --> 05:45:27,040
Amintește-ți că am spus 50 / 4. Putem împărți 4

7603
05:45:23,520 --> 05:45:29,840
în 50 de 12 ori în mod egal și avem două

7604
05:45:27,040 --> 05:45:32,878
rămase. Deci diviziunea întregului va

7605
05:45:29,840 --> 05:45:35,440
întoarce-ne întotdeauna un număr întreg

7606
05:45:32,878 --> 05:45:38,240
care va fi acel coeficient.

7607
05:45:35,440 --> 05:45:41,920
Deci acesta este coeficientul

7608
05:45:38,240 --> 05:45:45,200
și acesta este restul de 50 /

7609
05:45:41,920 --> 05:45:47,680
4. Deci diviziunea întregului revine la

7610
05:45:45,200 --> 05:45:50,000
tu acel număr întreg ca cel mai mare

7611
05:45:47,680 --> 05:45:53,120
de câte ori trece acel număr

7612
05:45:50,000 --> 05:45:55,920
în celălalt. Deci de 12 ori uniform

7613
05:45:53,120 --> 05:45:59,440
evident că există un rest acolo dar

7614
05:45:55,920 --> 05:46:01,440
um, dar da, atât de diviziune întreagă că

7615
05:45:59,440 --> 05:46:03,760
e util dacă vrem să știm cum

7616
05:46:01,440 --> 05:46:06,160
de multe ori pot încadra o valoare în

7617
05:46:03,760 --> 05:46:07,920
altă valoare de un număr întreg de ori

7618
05:46:06,160 --> 05:46:11,440
si asta se intampla din cand in cand

7619
05:46:07,920 --> 05:46:15,440
poate trebuie să știm asta.

7620
05:46:11,440 --> 05:46:18,480
Bine, ultima operație aici este exponent. Deci

7621
05:46:15,440 --> 05:46:23,520
exponentul este asteriscul asterisc

7622
05:46:18,480 --> 05:46:27,840
operator. Deci asta ridică un număr la

7623
05:46:23,520 --> 05:46:30,878
o putere. Um, de exemplu, ca x stea

7624
05:46:27,840 --> 05:46:33,120
y sau asteris y ar însemna că suntem

7625
05:46:30,878 --> 05:46:37,360
făcând o operație de genul 5 la a 4-a

7626
05:46:33,120 --> 05:46:39,600
puterea um care este 625.

7627
05:46:37,360 --> 05:46:41,360
Bine. Deci asteriscul destul de util. Ca

7628
05:46:39,600 --> 05:46:43,840
probabil cel mai frecvent asterisc ar fi

7629
05:46:41,360 --> 05:46:47,680
fie la pătrat ceva care ar fi x

7630
05:46:43,840 --> 05:46:50,878
um steaua 2 care ar fi

7631
05:46:47,680 --> 05:46:52,558
fie um x pătrat. Deci vreau să spun că este o

7632
05:46:50,878 --> 05:46:54,320
operațiune destul de comună există

7633
05:46:52,558 --> 05:46:56,160
ridica ceva la a doua putere

7634
05:46:54,320 --> 05:47:00,798
poate al treilea ridicând ceva la

7635
05:46:56,160 --> 05:47:03,920
a patra probabil mai puțin frecventă, dar um

7636
05:47:00,798 --> 05:47:07,360
operatorul asterisc asterisc este este cum

7637
05:47:03,920 --> 05:47:08,958
facem exponenți în Python.

7638
05:47:07,360 --> 05:47:11,760
bine,

7639
05:47:08,958 --> 05:47:13,600
deci toate acestea sunt aritmetice de bază

7640
05:47:11,760 --> 05:47:17,600
operații pe care le putem face între variabile

7641
05:47:13,600 --> 05:47:19,520
în Python. În regulă, orice întrebare

7642
05:47:17,600 --> 05:47:23,760
alea? Au sens pentru noi

7643
05:47:19,520 --> 05:47:25,200
din punct de vedere al sintaxei?

7644
05:47:23,760 --> 05:47:27,920
Destul de simplu, cred.

7645
05:47:25,200 --> 05:47:29,840
Sper să nu fie nimic surprinzător acolo.

7646
05:47:27,920 --> 05:47:31,040
um,

7647
05:47:29,840 --> 05:47:34,558
ai folosit modulul tot timpul

7648
05:47:31,040 --> 05:47:36,718
pentru calculul datei? Da. Da.

7649
05:47:34,558 --> 05:47:38,958
ca atunci când afli câte like

7650
05:47:36,718 --> 05:47:41,680
zile câte săptămâni sau unde vă aflați

7651
05:47:38,958 --> 05:47:44,558
săptămâna, mergi ca uh

7652
05:47:41,680 --> 05:47:47,958
modulo 7 sau ceva.

7653
05:47:44,558 --> 05:47:47,958
Asta are sens?

7654
05:47:52,718 --> 05:47:56,558
bine,

7655
05:47:54,400 --> 05:47:58,400
foarte bine.

7656
05:47:56,558 --> 05:48:00,320
Bine, vreau să vorbesc despre misiune

7657
05:47:58,400 --> 05:48:04,160
operatori acum. Acum am văzut deja

7658
05:48:00,320 --> 05:48:07,280
acesta care este semnul egal de bază că

7659
05:48:04,160 --> 05:48:10,240
este un operator de atribuire a datelor chiar așa

7660
05:48:07,280 --> 05:48:12,718
asta înseamnă că stabilim o valoare

7661
05:48:10,240 --> 05:48:15,760
egal cu o referință, așa că stocăm

7662
05:48:12,718 --> 05:48:18,160
date din interiorul acestei variabile de referință a

7663
05:48:15,760 --> 05:48:20,878
folosim semnul egal de bază ca al nostru

7664
05:48:18,160 --> 05:48:23,280
operator de atribuire astfel încât semnul egal

7665
05:48:20,878 --> 05:48:26,480
acum este numit operator de atribuire

7666
05:48:23,280 --> 05:48:28,400
ceea ce este cu adevărat minunat este că putem combina

7667
05:48:26,480 --> 05:48:33,120
acest operator de atribuire de bază cu nostru

7668
05:48:28,400 --> 05:48:37,120
cele aritmetice pentru actualizarea valorilor

7669
05:48:33,120 --> 05:48:40,400
um și modifică-le ca un fel de a

7670
05:48:37,120 --> 05:48:43,520
scurtătură pentru a spune uh așa, de exemplu

7671
05:48:40,400 --> 05:48:47,920
ca un plus= 5 reprezintă într-adevăr

7672
05:48:43,520 --> 05:48:52,080
faptul că vreau să reatribuiesc un la

7673
05:48:47,920 --> 05:48:54,638
rezultat al unui 5. Deci aceasta înseamnă a lua

7674
05:48:52,080 --> 05:48:57,840
orice ar fi adaugă cinci la el şi

7675
05:48:54,638 --> 05:49:00,558
reatribuiți-o la valoarea a. Deci asta

7676
05:48:57,840 --> 05:49:02,638
este același lucru ca și cum am fi doar scurtături

7677
05:49:00,558 --> 05:49:07,200
în și Python va recunoaște dacă o facem

7678
05:49:02,638 --> 05:49:09,360
plus este egal cu 5 este același lucru. Deci

7679
05:49:07,200 --> 05:49:11,600
și de fapt putem face asta cu oricare dintre

7680
05:49:09,360 --> 05:49:14,080
aceşti operatori aritmetici. Deci dacă noi

7681
05:49:11,600 --> 05:49:16,638
vrei să ia o variabilă înmulțită cu

7682
05:49:14,080 --> 05:49:21,680
doi și reatribuiți-l acelei variabile noi

7683
05:49:16,638 --> 05:49:25,440
pot folosi stele egale. Deci ca un asterisc

7684
05:49:21,680 --> 05:49:30,958
egal cu 2 este același lucru ca și cum am fi

7685
05:49:25,440 --> 05:49:33,680
pentru a reatribui a valorii lui a * 2.

7686
05:49:30,958 --> 05:49:35,920
Are sens pe

7687
05:49:33,680 --> 05:49:39,440
parte de realocare din asta? Deci plus

7688
05:49:35,920 --> 05:49:41,760
egal împărți egal modulo egal stea

7689
05:49:39,440 --> 05:49:45,280
steaua egală ar exponenți ceva și

7690
05:49:41,760 --> 05:49:48,080
resetați-l înapoi la variabilă.

7691
05:49:45,280 --> 05:49:51,200
um minus egal vom scădea și

7692
05:49:48,080 --> 05:49:54,400
reatribuiți-l înapoi variabilei. Deci

7693
05:49:51,200 --> 05:49:56,638
știi că x minus equ= 3 vom scădea

7694
05:49:54,400 --> 05:50:01,280
trei de la x și re și practic actualizați

7695
05:49:56,638 --> 05:50:03,600
este corect reatribuiți-l înapoi la x.

7696
05:50:01,280 --> 05:50:07,280
Deci, este destul de util ca oricând

7697
05:50:03,600 --> 05:50:11,360
trebuie să facem o operație și să adăugăm like

7698
05:50:07,280 --> 05:50:13,440
um știi un foarte tipic

7699
05:50:11,360 --> 05:50:16,160
reatribuirea este a face ca un plus egal

7700
05:50:13,440 --> 05:50:16,160
1

7701
05:50:16,240 --> 05:50:21,680
Este o redistribuire foarte tipică

7702
05:50:18,000 --> 05:50:25,040
pentru că ceea ce este la fel ca este a

7703
05:50:21,680 --> 05:50:26,958
este egal cu unul. Deci este ca un single

7704
05:50:25,040 --> 05:50:29,040
increment de a. Tocmai îl actualizăm

7705
05:50:26,958 --> 05:50:31,040
de unul.

7706
05:50:29,040 --> 05:50:33,600
Deci plus este egal cu 1. Putem vedea că din

7707
05:50:31,040 --> 05:50:35,680
din când în când.

7708
05:50:33,600 --> 05:50:38,000
Se apropie o buclă. Da. Da. Acestea sunt

7709
05:50:35,680 --> 05:50:41,040
folosit în bucle like while. Da. Ca tine

7710
05:50:38,000 --> 05:50:43,120
face plus egal și îl crești

7711
05:50:41,040 --> 05:50:44,480
până ajungi la o anumită condiție.

7712
05:50:43,120 --> 05:50:45,680
Da.

7713
05:50:44,480 --> 05:50:47,360
Acum, dacă vii din altcineva

7714
05:50:45,680 --> 05:50:48,320
limbi, dacă aveți programare

7715
05:50:47,360 --> 05:50:50,320
experiență de programare, vii

7716
05:50:48,320 --> 05:50:54,240
din alte limbi, Python nu

7717
05:50:50,320 --> 05:50:56,400
au un operator de increment ca plus . eu

7718
05:50:54,240 --> 05:50:59,680
mi-ar fi dorit, dar nu. Deci, ca mine

7719
05:50:56,400 --> 05:51:03,840
știu în Java și cred că au C

7720
05:50:59,680 --> 05:51:06,958
um poți face ca un plus sau

7721
05:51:03,840 --> 05:51:09,280
de fapt invers poti face plus un dar

7722
05:51:06,958 --> 05:51:11,360
um care nu există în Python

7723
05:51:09,280 --> 05:51:13,600
din pacate. Trebuie să faci plus

7724
05:51:11,360 --> 05:51:15,680
este egal cu reatribuire. Deci nu au

7725
05:51:13,600 --> 05:51:18,638
un operator de increment. Ar trebui

7726
05:51:15,680 --> 05:51:21,760
ar trebui să faci doar plus egal unu la

7727
05:51:18,638 --> 05:51:23,600
face același efect ca plus .

7728
05:51:21,760 --> 05:51:28,040
Deci știu că unii oameni întreabă despre asta,

7729
05:51:23,600 --> 05:51:28,040
dar da, nu exista din pacate.

7730
05:51:29,120 --> 05:51:32,160
În regulă. Orice întrebări despre

7731
05:51:30,320 --> 05:51:34,798
sarcina? Este cu adevărat egalul

7732
05:51:32,160 --> 05:51:37,040
semn și putem aborda aritmetica

7733
05:51:34,798 --> 05:51:39,600
să facă un fel de matematică de bază și

7734
05:51:37,040 --> 05:51:41,360
reatribuie variabilei.

7735
05:51:39,600 --> 05:51:43,920
Sperăm că faptul că folosim un

7736
05:51:41,360 --> 05:51:46,240
un singur egal are sens. Unde oamenii

7737
05:51:43,920 --> 05:51:47,920
a fi confuz tot timpul este

7738
05:51:46,240 --> 05:51:50,558
diferența dintre un singur semn egal

7739
05:51:47,920 --> 05:51:52,558
şi multi şi două semne egale care

7740
05:51:50,558 --> 05:51:54,240
o să vedem. Două semne egale

7741
05:51:52,558 --> 05:51:57,120
înseamnă cu totul altceva

7742
05:51:54,240 --> 05:52:00,638
decât un singur semn egal. Singur egal

7743
05:51:57,120 --> 05:52:02,638
semnul este o misiune. Luăm

7744
05:52:00,638 --> 05:52:04,480
date și stocarea lor într-o referință

7745
05:52:02,638 --> 05:52:06,000
variabila,

7746
05:52:04,480 --> 05:52:07,520
nu?

7747
05:52:06,000 --> 05:52:08,718
Dar mai multe semne egale, vom face

7748
05:52:07,520 --> 05:52:10,638
afla ce înseamnă asta. Asta e

7749
05:52:08,718 --> 05:52:13,120
de fapt o comparație.

7750
05:52:10,638 --> 05:52:14,718
Este ceva diferit.

7751
05:52:13,120 --> 05:52:17,600
Bine, vom continua. Multumesc

7752
05:52:14,718 --> 05:52:20,400
baieti. Bine, deci vorbim despre

7753
05:52:17,600 --> 05:52:22,240
uh comparatie. Deci, uh, o să facem

7754
05:52:20,400 --> 05:52:24,240
vorbim despre câțiva operatori care ne permit

7755
05:52:22,240 --> 05:52:26,240
pentru a compara două valori. Acum, aceasta este

7756
05:52:24,240 --> 05:52:27,920
va fi util pe măsură ce mergem înainte

7757
05:52:26,240 --> 05:52:29,840
pentru că uneori vrem să știm când

7758
05:52:27,920 --> 05:52:31,440
este o valoare mai mare decât ceva sau mai puțin

7759
05:52:29,840 --> 05:52:33,200
decât ceva sau egal cu ceva,

7760
05:52:31,440 --> 05:52:35,920
nu este egal cu ceva. Aceia

7761
05:52:33,200 --> 05:52:38,718
comparațiile vor fi utile.

7762
05:52:35,920 --> 05:52:41,840
um și avem o colecție de operatori

7763
05:52:38,718 --> 05:52:43,840
să facă asta pentru noi. Deci, din nou, unul pe care eu

7764
05:52:41,840 --> 05:52:47,680
cred că mulți oameni se confundă cu privire la asta

7765
05:52:43,840 --> 05:52:52,718
um este egal cu operatorul de comparație care

7766
05:52:47,680 --> 05:52:54,000
este simbolul dublu egal. Deci multe

7767
05:52:52,718 --> 05:52:55,760
dintre oameni se confundă cu asta. Ce este

7768
05:52:54,000 --> 05:52:58,480
diferența dintre un singur egal

7769
05:52:55,760 --> 05:53:02,080
semn și un dublu? Acest dublu egal

7770
05:52:58,480 --> 05:53:03,520
semnul verifică dacă două valori sunt

7771
05:53:02,080 --> 05:53:05,440
egale.

7772
05:53:03,520 --> 05:53:08,480
Hm

7773
05:53:05,440 --> 05:53:10,638
deci, de exemplu, le avem pe acestea două

7774
05:53:08,480 --> 05:53:13,920
numerele x și y sunt ambele numere întregi

7775
05:53:10,638 --> 05:53:18,798
care sunt 20. Verificăm dacă x este egal este

7776
05:53:13,920 --> 05:53:20,718
la y și asta revine adevărat deoarece

7777
05:53:18,798 --> 05:53:23,680
uh aceste două valori sunt aceleași. Ei

7778
05:53:20,718 --> 05:53:26,320
ambele sunt egale cu 20. Deci, când x este egal cu y

7779
05:53:23,680 --> 05:53:27,760
asta este o afirmatie adevarata. Deci astea

7780
05:53:26,320 --> 05:53:29,840
este ceva de realizat este că

7781
05:53:27,760 --> 05:53:32,480
aceste comparații sunt lucruri care revin

7782
05:53:29,840 --> 05:53:34,480
booleani adevărat sau fals deoarece un număr

7783
05:53:32,480 --> 05:53:38,080
va fi mai mare decât un alt da

7784
05:53:34,480 --> 05:53:40,878
știi adevărat sau fals ei sunt un a

7785
05:53:38,080 --> 05:53:44,480
uh comparație care ne oferă un fel de a

7786
05:53:40,878 --> 05:53:46,718
răspunsul da sau nu. Hm

7787
05:53:44,480 --> 05:53:50,080
deci equals equals verifică dacă doi

7788
05:53:46,718 --> 05:53:52,878
valorile sunt aceleași și apoi nu

7789
05:53:50,080 --> 05:53:55,600
este egal cu operatorul care este uh an

7790
05:53:52,878 --> 05:53:57,200
semn de exclamare cu un egal cu um

7791
05:53:55,600 --> 05:54:00,000
verifică dacă există două valori

7792
05:53:57,200 --> 05:54:04,638
diferite. Deci nu sunt egali. Deci pentru

7793
05:54:00,000 --> 05:54:07,200
de exemplu, dacă am avea um uh 45 și 24 noi am

7794
05:54:04,638 --> 05:54:08,958
uh face x nu este egal cu y care ar reveni

7795
05:54:07,200 --> 05:54:11,840
adevărat.

7796
05:54:08,958 --> 05:54:14,160
Hm acum dacă am avea aceste două valori ca

7797
05:54:11,840 --> 05:54:18,000
înainte și am verificat aici x nu este egal

7798
05:54:14,160 --> 05:54:21,680
pentru tine acest lucru ar fi fals pentru că ei

7799
05:54:18,000 --> 05:54:24,400
sunt drepte egale deci um

7800
05:54:21,680 --> 05:54:26,638
nu este egal cu verifică dacă valorile sunt

7801
05:54:24,400 --> 05:54:29,920
diferit, deci asta e o comparație simplă

7802
05:54:26,638 --> 05:54:32,480
nu sunt ele egale, așa e în acest caz

7803
05:54:29,920 --> 05:54:34,240
care ar reveni adevărat

7804
05:54:32,480 --> 05:54:36,000
deci acestea sunt destul de utile dacă vrem

7805
05:54:34,240 --> 05:54:38,798
compara direct este o valoare egală cu

7806
05:54:36,000 --> 05:54:40,160
altul folosim equals equals If

7807
05:54:38,798 --> 05:54:42,240
sunt diferite, noi folosim nu

7808
05:54:40,160 --> 05:54:43,600
egală. Și o să avem

7809
05:54:42,240 --> 05:54:45,680
diferite scenarii în care vom folosi

7810
05:54:43,600 --> 05:54:48,480
acelea.

7811
05:54:45,680 --> 05:54:50,638
De asemenea, vreau să spun elementul de bază, tu

7812
05:54:48,480 --> 05:54:52,160
știu, mai mare decât și mai puțin decât. Deci

7813
05:54:50,638 --> 05:54:54,958
acesta primul este mai mic decât

7814
05:54:52,160 --> 05:54:56,798
operator. Va fi evident

7815
05:54:54,958 --> 05:54:59,920
returnează adevărat când un număr este mai mic

7816
05:54:56,798 --> 05:55:04,240
decât un alt număr. Deci când avem

7817
05:54:59,920 --> 05:55:06,480
lucruri precum 20 și 30, asta x mai puțin

7818
05:55:04,240 --> 05:55:08,400
decât y ar returna adevărat pentru că 20 este

7819
05:55:06,480 --> 05:55:11,600
cu siguranta mai mic de 30. Deci asta

7820
05:55:08,400 --> 05:55:13,920
returnează adevărat. Hm

7821
05:55:11,600 --> 05:55:15,360
și apoi mai mare decât verifică dacă un număr

7822
05:55:13,920 --> 05:55:18,000
este mai mare decât alta. Așa că

7823
05:55:15,360 --> 05:55:21,120
comparație uh x mai mare decât y în asta

7824
05:55:18,000 --> 05:55:23,600
cazul ar reveni adevărat ca a

7825
05:55:21,120 --> 05:55:26,958
comparatie. Deci, din nou, acestea sunt toate

7826
05:55:23,600 --> 05:55:30,400
operatori care verifică comparația

7827
05:55:26,958 --> 05:55:32,878
între două numere care vor fi uh

7828
05:55:30,400 --> 05:55:35,200
foarte util pe măsură ce mergem înainte și începem

7829
05:55:32,878 --> 05:55:36,878
să lucrăm cu date și numere și facem

7830
05:55:35,200 --> 05:55:38,878
comparatii.

7831
05:55:36,878 --> 05:55:41,878
le vom face tot timpul mai târziu

7832
05:55:38,878 --> 05:55:41,878
pe.

7833
05:55:42,160 --> 05:55:46,400
Acum există și scenarii când noi

7834
05:55:44,080 --> 05:55:49,280
vreau să știu dacă este mai mic sau egal

7835
05:55:46,400 --> 05:55:52,400
la. Așa că acel operator doar prinde un

7836
05:55:49,280 --> 05:55:55,120
semn egal. Deci mai puțin decât egal

7837
05:55:52,400 --> 05:55:57,360
este mai mic sau egal cu operatorul.

7838
05:55:55,120 --> 05:56:00,480
Deci, de exemplu, 10 mai puțin sau egal cu

7839
05:55:57,360 --> 05:56:03,600
30 este adevărat pentru că 10 este

7840
05:56:00,480 --> 05:56:06,160
cu siguranță mai mic de 30. Dar um it

7841
05:56:03,600 --> 05:56:10,160
ar fi fost adevărat chiar dacă x ar fi fost 30.

7842
05:56:06,160 --> 05:56:14,558
Ar fi adevărat și pentru că 30 uh 30

7843
05:56:10,160 --> 05:56:16,638
egal cu um 30 ar fi egal cu 30. Asta

7844
05:56:14,558 --> 05:56:19,760
ar fi o afirmație adevărată.

7845
05:56:16,638 --> 05:56:21,040
Mai mare sau egal cu aceeași

7846
05:56:19,760 --> 05:56:22,240
scenariu. Avem o mai mare decât și

7847
05:56:21,040 --> 05:56:24,480
atunci avem un semn egal imediat după

7848
05:56:22,240 --> 05:56:27,120
ea. Acest lucru revine adevărat dacă ceva este

7849
05:56:24,480 --> 05:56:29,280
mai mare sau egal cu un alt număr.

7850
05:56:27,120 --> 05:56:31,920
Deci iată una interesantă. Facem 30

7851
05:56:29,280 --> 05:56:34,558
mai mare sau egal cu 30. Asta revine

7852
05:56:31,920 --> 05:56:36,718
adevărat pentru că 30 este egal cu 30. Că asta

7853
05:56:34,558 --> 05:56:38,480
are sens. Deci mai mic sau egal cu

7854
05:56:36,718 --> 05:56:42,200
mai mare sau egal cu ce putem face

7855
05:56:38,480 --> 05:56:42,200
cu acești operatori simpli.

7856
05:56:42,558 --> 05:56:47,680
Uh este mai mare decât mai mare decât similar

7857
05:56:44,320 --> 05:56:49,840
la utilizarea parantezelor? Nu.

7858
05:56:47,680 --> 05:56:54,558
Uh, atât de mai mare decât sau mai mare decât este

7859
05:56:49,840 --> 05:56:57,360
ceea ce se numește un operator un pic de schimbare.

7860
05:56:54,558 --> 05:57:00,080
Este puțin diferit. Eu eu

7861
05:56:57,360 --> 05:57:02,000
aș salva orice explicație

7862
05:57:00,080 --> 05:57:05,760
asta doar uita-te la aia

7863
05:57:02,000 --> 05:57:10,240
am sa spun. Îi place un pic, un pic

7864
05:57:05,760 --> 05:57:12,718
manipulare care este un pic cam puțin

7865
05:57:10,240 --> 05:57:14,320
de o bătaie de cap, dar noi nu vom face

7866
05:57:12,718 --> 05:57:16,320
folosim vreodată mai mare decât sau nu vom folosi vreodată

7867
05:57:14,320 --> 05:57:18,798
utilizați mai mare decât mai mare decât. este tot

7868
05:57:16,320 --> 05:57:21,200
face un fel de operație de schimbare

7869
05:57:18,798 --> 05:57:24,520
ca un pic de matematică pe care noi nu o facem

7870
05:57:21,200 --> 05:57:24,520
trebuie să faci.

7871
05:57:29,200 --> 05:57:35,040
Bine. Deci astea sunt comparații. Hai să

7872
05:57:32,798 --> 05:57:36,558
uită-te la operatorii noștri logici. Deci acum

7873
05:57:35,040 --> 05:57:38,798
acestea vor fi cu adevărat cu adevărat

7874
05:57:36,558 --> 05:57:42,480
interesant și util când intrăm în

7875
05:57:38,798 --> 05:57:44,878
controlând fluxul programului nostru. Hm

7876
05:57:42,480 --> 05:57:47,280
deci se folosesc operatori logici pentru

7877
05:57:44,878 --> 05:57:49,280
combinând enunţuri condiţionale. Deci

7878
05:57:47,280 --> 05:57:52,400
enunţurile condiţionale sunt lucruri care

7879
05:57:49,280 --> 05:57:54,718
return acestea sunt declarații care revin

7880
05:57:52,400 --> 05:57:57,360
um adevărat sau fals. Așa că se întorc a

7881
05:57:54,718 --> 05:58:00,798
boolean și putem, este așa cum suntem

7882
05:57:57,360 --> 05:58:02,558
combinându-le împreună în anumite moduri.

7883
05:58:00,798 --> 05:58:06,400
bine,

7884
05:58:02,558 --> 05:58:08,400
deci operatorul și, să ne uităm la asta

7885
05:58:06,400 --> 05:58:11,280
unul primul, care în Python este

7886
05:58:08,400 --> 05:58:14,958
cuvânt literal și. Deci e foarte frumos.

7887
05:58:11,280 --> 05:58:18,000
Este literalmente cuvântul cheie și.

7888
05:58:14,958 --> 05:58:20,878
Um, și ceea ce face asta este că ia

7889
05:58:18,000 --> 05:58:22,958
rezultat al unor comparații booleene și

7890
05:58:20,878 --> 05:58:26,240
altă comparație booleană și

7891
05:58:22,958 --> 05:58:30,160
returnează adevărat dacă ambele sunt adevărate.

7892
05:58:26,240 --> 05:58:32,320
Deci și va reveni doar adevărat ca a

7893
05:58:30,160 --> 05:58:34,080
combinație dacă ambele individuale

7894
05:58:32,320 --> 05:58:36,480
afirmatiile sunt adevarate. Amândoi trebuie

7895
05:58:34,080 --> 05:58:38,958
fi adevărat. Momentul în care unul dintre ele este fals

7896
05:58:36,480 --> 05:58:41,680
și se va întoarce false.

7897
05:58:38,958 --> 05:58:43,360
Deci, acest lucru este util pentru a face a

7898
05:58:41,680 --> 05:58:47,040
combinație de lucruri acolo unde ne dorim

7899
05:58:43,360 --> 05:58:50,000
fiecare lucru individual să fie adevărat. Deci a=

7900
05:58:47,040 --> 05:58:52,958
1. Aceasta este o afirmație adevărată deoarece a

7901
05:58:50,000 --> 05:58:54,798
este egal cu 1 și atunci b= 2 este adevărat

7902
05:58:52,958 --> 05:58:57,520
declarație. Deci ambele ar fi

7903
05:58:54,798 --> 05:59:00,718
adevărat. Deci, atunci când le combinăm

7904
05:58:57,520 --> 05:59:02,558
cu şi această combinaţie generală este

7905
05:59:00,718 --> 05:59:05,120
adevărat.

7906
05:59:02,558 --> 05:59:09,040
Așa că ține cont de asta. Acești operatori

7907
05:59:05,120 --> 05:59:11,600
sunt cele care combină logica individuală

7908
05:59:09,040 --> 05:59:13,200
enunţuri sau enunţuri condiţionale.

7909
05:59:11,600 --> 05:59:16,400
Corect?

7910
05:59:13,200 --> 05:59:19,920
Bine. Acum cel care este mai puțin

7911
05:59:16,400 --> 05:59:24,798
restrictiv decât și este afirmația sau

7912
05:59:19,920 --> 05:59:27,120
care um este folosit când vrei doar la

7913
05:59:24,798 --> 05:59:28,558
cel puțin una dintre afirmații să fie adevărată.

7914
05:59:27,120 --> 05:59:31,280
Deci, dacă vrem să combinăm aceste lucruri

7915
05:59:28,558 --> 05:59:34,718
și necesită doar cel puțin un minim de

7916
05:59:31,280 --> 05:59:39,600
pentru a fi adevărat, folosim afirmația sau.

7917
05:59:34,718 --> 05:59:42,160
Deci, de exemplu, a= 1 este adevărat deoarece a=

7918
05:59:39,600 --> 05:59:45,360
1. Deci este adevărat. și atunci B este egal

7919
05:59:42,160 --> 05:59:47,920
egal cu 2 este fals. Deci acesta este

7920
05:59:45,360 --> 05:59:49,440
fals. Dar asta nu contează din

7921
05:59:47,920 --> 05:59:51,040
perspectiva sau pentru că avem o

7922
05:59:49,440 --> 05:59:53,760
minim una dintre aceste afirmații fiind

7923
05:59:51,040 --> 05:59:57,280
adevărat. Deci sau când folosim logica

7924
05:59:53,760 --> 06:00:01,280
combinație de sau um avem nevoie doar de oricare

7925
05:59:57,280 --> 06:00:04,000
sau să fie adevărat. Deci a= 1 este adevărat. Deci asta

7926
06:00:01,280 --> 06:00:06,000
per ansamblu returnează adevărat.

7927
06:00:04,000 --> 06:00:08,558
Deci sau este ceva care se va combina

7928
06:00:06,000 --> 06:00:11,280
declarații condiționate și returnează uh

7929
06:00:08,558 --> 06:00:13,760
returnează adevărat dacă cel puțin unul dintre ele este

7930
06:00:11,280 --> 06:00:15,440
adevărat. Dacă toate sunt false sau asta

7931
06:00:13,760 --> 06:00:19,480
ar reveni fals pentru că niciunul dintre ei

7932
06:00:15,440 --> 06:00:19,480
nici una dintre ele nu ar fi adevărată.

7933
06:00:20,080 --> 06:00:26,558
Bine. Deci avem și avem sau și apoi

7934
06:00:23,360 --> 06:00:31,200
noi nu avem. Deci nu este interesant

7935
06:00:26,558 --> 06:00:33,680
unul. Nu inversează în esență un boolean.

7936
06:00:31,200 --> 06:00:35,840
Deci, dacă avem o declarație, aceasta este

7937
06:00:33,680 --> 06:00:38,480
în mod inerent adevărat și punem un nu

7938
06:00:35,840 --> 06:00:40,798
în fața ei, se va inversa

7939
06:00:38,480 --> 06:00:42,480
fals. Dacă noi dacă avem ceva care

7940
06:00:40,798 --> 06:00:45,760
este fals si punem un nu in fata

7941
06:00:42,480 --> 06:00:47,760
asta, se va întoarce uh adevărat.

7942
06:00:45,760 --> 06:00:49,920
Unul dintre exemplele interesante din

7943
06:00:47,760 --> 06:00:54,480
Python și asta provoacă oamenii pe toți

7944
06:00:49,920 --> 06:00:58,320
timpul este faptul că Python tratează zero

7945
06:00:54,480 --> 06:00:59,840
foarte special. Deci întregul zero

7946
06:00:58,320 --> 06:01:02,958
este

7947
06:00:59,840 --> 06:01:06,878
hopa, întregul zero este inerent

7948
06:01:02,958 --> 06:01:10,240
tratat de Python ca fiind fals.

7949
06:01:06,878 --> 06:01:12,878
Deci, Python tratează zero ca fals și apoi

7950
06:01:10,240 --> 06:01:15,920
orice alt întreg ca adevărat. Practic

7951
06:01:12,878 --> 06:01:19,040
a fi Python indică faptul că este

7952
06:01:15,920 --> 06:01:22,638
ceva ce nu este zero. uh orice.

7953
06:01:19,040 --> 06:01:25,440
Așa cum ar fi um B egal cu unu

7954
06:01:22,638 --> 06:01:28,400
tratat ca adevărat pentru că este atât de lung cât

7955
06:01:25,440 --> 06:01:32,240
este ceva ce nu este zero

7956
06:01:28,400 --> 06:01:36,400
apoi Python tratează acel număr întreg ca a

7957
06:01:32,240 --> 06:01:38,718
boolean adevărat în esență. Hm de ce

7958
06:01:36,400 --> 06:01:40,638
asta e interesant este dacă pui un nu

7959
06:01:38,718 --> 06:01:44,080
în fața acestui lucru ar fi de fapt

7960
06:01:40,638 --> 06:01:46,958
returnează adevărat pentru că nu este fals ceea ce este

7961
06:01:44,080 --> 06:01:51,040
opusul falsului? Este adevărat nu?

7962
06:01:46,958 --> 06:01:54,400
Deci nu este fals, ar reveni adevărat. Deci noi

7963
06:01:51,040 --> 06:01:56,718
nu vom vedea din când în când. Uh

7964
06:01:54,400 --> 06:01:59,600
nu apare când vrem să negăm

7965
06:01:56,718 --> 06:02:02,400
ceva. Deci, atunci când te cunoști

7966
06:01:59,600 --> 06:02:05,280
știi că poate avem o iterație și

7967
06:02:02,400 --> 06:02:08,000
buclă iterativă și spunem în timp ce nu

7968
06:02:05,280 --> 06:02:10,080
terminat și noi știi că atunci vom face

7969
06:02:08,000 --> 06:02:12,480
executăm o grămadă de declarații în timp ce noi

7970
06:02:10,080 --> 06:02:14,558
continuă să nu fie terminat și apoi

7971
06:02:12,480 --> 06:02:17,360
momentul în care se termină atunci

7972
06:02:14,558 --> 06:02:20,400
atunci bucla s-ar fi terminat. Deci nu este

7973
06:02:17,360 --> 06:02:23,120
puternic pentru a inversa uh trus la

7974
06:02:20,400 --> 06:02:25,040
fals și fals la adevărat.

7975
06:02:23,120 --> 06:02:28,638
Hm, deci poate vrem să verificăm dacă

7976
06:02:25,040 --> 06:02:30,958
ceva nu este gol. Înseamnă că um

7977
06:02:28,638 --> 06:02:32,878
daca este gol

7978
06:02:30,958 --> 06:02:36,638
Dacă nu e gol, ar fi

7979
06:02:32,878 --> 06:02:39,520
fals. Nu gol, știi, poate

7980
06:02:36,638 --> 06:02:42,000
ar reveni adevărat. Deci nu este ceva

7981
06:02:39,520 --> 06:02:47,280
vom vedea din când în când ca a

7982
06:02:42,000 --> 06:02:47,280
operator de negaţie negaţie logică.

7983
06:02:48,080 --> 06:02:52,400
Bine.

7984
06:02:50,160 --> 06:02:56,480
Orice întrebări despre

7985
06:02:52,400 --> 06:02:58,480
Ai întrebări despre acești operatori?

7986
06:02:56,480 --> 06:03:00,558
Acestea acum acestea le vom folosi

7987
06:02:58,480 --> 06:03:03,558
în controlul fluxului nostru

7988
06:03:00,558 --> 06:03:03,558
program.

7989
06:03:05,200 --> 06:03:09,440
Încă un exemplu pentru nu. Da. Deci a

7990
06:03:07,360 --> 06:03:12,878
cazul destul de tipic pentru nu ar fi

7991
06:03:09,440 --> 06:03:16,400
ceva de genul acesta unde um

7992
06:03:12,878 --> 06:03:18,798
uh, poate avem niște coduri, hopa, eu întotdeauna

7993
06:03:16,400 --> 06:03:20,718
uitați să treceți la asta, poate noi

7994
06:03:18,798 --> 06:03:23,040
avem un cod care verifică, deci dacă avem

7995
06:03:20,718 --> 06:03:27,360
o listă

7996
06:03:23,040 --> 06:03:29,360
dacă avem o listă și e goală

7997
06:03:27,360 --> 06:03:30,958
bine și nu are nimic în el să spunem

7998
06:03:29,360 --> 06:03:35,840
nu are nimic din ce am putea

7999
06:03:30,958 --> 06:03:38,240
au un cod care spune like if um if

8000
06:03:35,840 --> 06:03:41,520
nu

8001
06:03:38,240 --> 06:03:47,200
uh lista

8002
06:03:41,520 --> 06:03:50,400
atunci facem ceva. Deci atunci dacă

8003
06:03:47,200 --> 06:03:52,798
nu listează, adică nu este gol

8004
06:03:50,400 --> 06:03:54,480
apoi verificați apoi luați prima valoare.

8005
06:03:52,798 --> 06:03:58,400
Să spunem că luați prima valoare. Deci

8006
06:03:54,480 --> 06:04:01,840
am avea un cod ca acesta. Deci uh

8007
06:03:58,400 --> 06:04:03,600
acest lucru nu este obișnuit cum putem

8008
06:04:01,840 --> 06:04:06,958
nega faptul că asta va fi

8009
06:04:03,600 --> 06:04:08,718
gol și atunci asta ar fi adevărat și

8010
06:04:06,958 --> 06:04:11,040
atunci putem continua să accesăm ceva

8011
06:04:08,718 --> 06:04:15,120
pentru că asta ar însemna că nu este gol.

8012
06:04:11,040 --> 06:04:16,798
Deci nu gol este o utilizare destul de standard

8013
06:04:15,120 --> 06:04:20,680
caz pentru a nu-mi place să verific asta

8014
06:04:16,798 --> 06:04:20,680
ceva nu este gol.

8015
06:04:22,718 --> 06:04:26,240
Putem folosi și nu pentru verificare

8016
06:04:24,558 --> 06:04:28,320
valoare din listă? Da, asta e

8017
06:04:26,240 --> 06:04:31,718
ceea ce facem aici ca să spunem așa

8018
06:04:28,320 --> 06:04:31,718
nu este gol?

8019
06:04:42,320 --> 06:04:45,320
Bine.

8020
06:04:47,360 --> 06:04:51,520
În regulă.

8021
06:04:49,040 --> 06:04:54,160
Să trecem la unele diverse

8022
06:04:51,520 --> 06:04:56,480
operatori. Deci avem acum câteva dintre acestea

8023
06:04:54,160 --> 06:05:00,638
vor fi incredibil de utile. The

8024
06:04:56,480 --> 06:05:03,280
unul de pe această pagină nu este atât de util. Este

8025
06:05:00,638 --> 06:05:07,120
în principal pentru că este foarte rar ca noi

8026
06:05:03,280 --> 06:05:10,320
ar trebui să le verificăm. Deci

8027
06:05:07,120 --> 06:05:12,798
este ceea ce numim operator de identitate

8028
06:05:10,320 --> 06:05:16,638
și asta e ceva la care verific

8029
06:05:12,798 --> 06:05:20,320
vezi dacă două referințe sunt la fel.

8030
06:05:16,638 --> 06:05:21,680
Bine, două referințe sunt aceleași. um

8031
06:05:20,320 --> 06:05:26,400
ceea ce înseamnă că se referă la

8032
06:05:21,680 --> 06:05:28,400
aceeași bucată de date. Hm, deci acum acesta este un

8033
06:05:26,400 --> 06:05:32,240
caz foarte interesant în care avem o

8034
06:05:28,400 --> 06:05:35,600
egal cu o listă b egal cu listă.

8035
06:05:32,240 --> 06:05:37,200
Cu toate acestea, atunci când punem întrebarea a este b

8036
06:05:35,600 --> 06:05:39,040
acest lucru ar reveni de fapt fals. Acum

8037
06:05:37,200 --> 06:05:41,520
care pare foarte contraintuitiv, dar

8038
06:05:39,040 --> 06:05:44,240
motivul pentru care acesta este cazul este pentru că suntem

8039
06:05:41,520 --> 06:05:47,200
creând două referințe diferite. Suntem

8040
06:05:44,240 --> 06:05:49,360
spunând A este egal cu această listă, B este egal

8041
06:05:47,200 --> 06:05:51,680
la această listă, care este o piesă cu totul nouă

8042
06:05:49,360 --> 06:05:53,120
de date.

8043
06:05:51,680 --> 06:05:54,878
Este o nouă bucată de date. Deci

8044
06:05:53,120 --> 06:05:56,400
prin urmare, nu putem pretinde că sunt

8045
06:05:54,878 --> 06:06:00,080
aceeași referință chiar dacă sunt

8046
06:05:56,400 --> 06:06:04,000
Acum ceea ce ar fi adevărat este A egal

8047
06:06:00,080 --> 06:06:06,958
este egal cu B deoarece datele lor sunt aceleași.

8048
06:06:04,000 --> 06:06:09,200
Ar fi adevărat, dar al lor

8049
06:06:06,958 --> 06:06:10,958
referințele sunt diferite pentru că sunt

8050
06:06:09,200 --> 06:06:12,878
variabile diferite, nu? A și B sunt

8051
06:06:10,958 --> 06:06:14,878
variabile diferite.

8052
06:06:12,878 --> 06:06:18,558
Locație de memorie diferită. Exact.

8053
06:06:14,878 --> 06:06:23,440
Referințe diferite. Deci A și A este B este

8054
06:06:18,558 --> 06:06:26,480
la fel cu verificarea um dacă ID A este egal

8055
06:06:23,440 --> 06:06:29,680
este egală cu IDB. Are sens? Asta e

8056
06:06:26,480 --> 06:06:32,080
practic, verificând că logic

8057
06:06:29,680 --> 06:06:35,200
comparație dacă adresele lor sunt cele

8058
06:06:32,080 --> 06:06:39,280
la fel. Este aceeași verificare. Așa este

8059
06:06:35,200 --> 06:06:41,200
practic o scurtătură pentru a face asta.

8060
06:06:39,280 --> 06:06:42,160
Și așa ar fi false pentru că

8061
06:06:41,200 --> 06:06:45,760
vor fi doi diferiți

8062
06:06:42,160 --> 06:06:49,200
referințe, A și B.

8063
06:06:45,760 --> 06:06:51,840
Hm, totuși, ne putem folosi de nu. Deci A este

8064
06:06:49,200 --> 06:06:54,878
nu B. Asta este de fapt adevărat pentru că este

8065
06:06:51,840 --> 06:06:56,958
inversul lui este, nu? Așa că asta

8066
06:06:54,878 --> 06:07:01,958
de fapt ar inversa falsul și asta

8067
06:06:56,958 --> 06:07:01,958
ar fi adevărat. A nu este B. Este adevărat.

8068
06:07:02,638 --> 06:07:06,160
În culise, da, cum ar fi

8069
06:07:04,240 --> 06:07:08,000
memorie, da, locația din

8070
06:07:06,160 --> 06:07:09,760
memoria computerului este diferită. Da,

8071
06:07:08,000 --> 06:07:13,080
deoarece sunt variabile diferite,

8072
06:07:09,760 --> 06:07:13,080
referințe diferite.

8073
06:07:15,120 --> 06:07:20,798
Da, datele sunt egale. Datele sunt

8074
06:07:17,840 --> 06:07:23,120
egale, dar referințele sunt diferite,

8075
06:07:20,798 --> 06:07:25,200
ceea ce verifică aceasta. Știi, noi

8076
06:07:23,120 --> 06:07:27,760
au două nume diferite, A și B. Acelea

8077
06:07:25,200 --> 06:07:29,680
sunt diferite.

8078
06:07:27,760 --> 06:07:32,958
Acum, aruncați o privire la acest ultim exemplu.

8079
06:07:29,680 --> 06:07:35,280
Aceasta înseamnă că A este o listă. B este egal cu

8080
06:07:32,958 --> 06:07:38,400
A. Acum, vă amintiți ce înseamnă asta? Adică

8081
06:07:35,280 --> 06:07:40,958
atribuirea lui spunem că B este

8082
06:07:38,400 --> 06:07:44,798
aceeași referință ca și A. Asta este

8083
06:07:40,958 --> 06:07:47,520
face aici. Aceeași referință. La fel și

8084
06:07:44,798 --> 06:07:50,798
are sens pentru noi că atunci când întrebăm acum

8085
06:07:47,520 --> 06:07:56,000
A este B. Acest lucru ar trebui să fie adevărat. Și este

8086
06:07:50,798 --> 06:07:57,920
ca asta e adevarat pentru ca um

8087
06:07:56,000 --> 06:07:59,440
acest lucru este adevărat pentru că sunt la propriu

8088
06:07:57,920 --> 06:08:03,120
aceeași referință. Setăm B

8089
06:07:59,440 --> 06:08:05,360
egal cu A. Deci se referă la

8090
06:08:03,120 --> 06:08:08,000
aceleasi date. Acum

8091
06:08:05,360 --> 06:08:09,920
în termeni de referință variabilă ei

8092
06:08:08,000 --> 06:08:12,000
deci acum id-urile lor sunt aceleași

8093
06:08:09,920 --> 06:08:15,160
în esență, locațiile lor de memorie sunt

8094
06:08:12,000 --> 06:08:15,160
la fel.

8095
06:08:15,920 --> 06:08:20,718
Dacă vrei să compari doar date, atunci uh

8096
06:08:19,040 --> 06:08:22,958
ce operatori ne-am uitat la asta

8097
06:08:20,718 --> 06:08:24,480
sunt comparație

8098
06:08:22,958 --> 06:08:26,558
ar trebui să ne gândim la asta, adică noi

8099
06:08:24,480 --> 06:08:28,320
Am văzut dacă ne întoarcem câteva diapozitive

8100
06:08:26,558 --> 06:08:31,200
avem o grămadă de operatori de comparat

8101
06:08:28,320 --> 06:08:35,520
date care sunt acești tipi drept egali

8102
06:08:31,200 --> 06:08:38,320
este egal mai mare decât mai puțin decât ceea ce noi

8103
06:08:35,520 --> 06:08:39,920
ar putea face este să spunem dacă datele sunt egale cu

8104
06:08:38,320 --> 06:08:42,878
alte date care ar fi ceva de genul

8105
06:08:39,920 --> 06:08:45,200
acesta este equals equals operator

8106
06:08:42,878 --> 06:08:47,680
când două valori sunt egale nu

8107
06:08:45,200 --> 06:08:49,920
referință ES. Are sens? Aceasta

8108
06:08:47,680 --> 06:08:52,718
equals equals se verifică dacă două valori

8109
06:08:49,920 --> 06:08:57,160
sunt aceleași, care sunt datele, nu

8110
06:08:52,718 --> 06:08:57,160
nu referința.

8111
06:09:02,240 --> 06:09:05,240
Bine.

8112
06:09:05,600 --> 06:09:11,360
Acum vreau să vă arăt un cu adevărat puternic

8113
06:09:08,718 --> 06:09:14,320
Vreau să-ți arăt un cu adevărat puternic

8114
06:09:11,360 --> 06:09:18,480
operator divers care urmează să

8115
06:09:14,320 --> 06:09:21,360
fi uh care va fi in sau

8116
06:09:18,480 --> 06:09:25,120
ceea ce se numește operatorul de membru.

8117
06:09:21,360 --> 06:09:29,520
Deci acesta este un operator care verifică dacă a

8118
06:09:25,120 --> 06:09:33,040
value este membru al unei colecții.

8119
06:09:29,520 --> 06:09:38,240
Deci asta ar putea fi așa cum ar putea fi

8120
06:09:33,040 --> 06:09:40,958
ca um știi unde avem o listă, a

8121
06:09:38,240 --> 06:09:44,320
tupil, un dicționar, doar o colecție

8122
06:09:40,958 --> 06:09:46,080
de date și dorim să știm este o valoare a

8123
06:09:44,320 --> 06:09:49,040
membru al acelei colecţii care este

8124
06:09:46,080 --> 06:09:51,360
cu adevărat util pentru testare, știți că noi

8125
06:09:49,040 --> 06:09:54,160
au apartenența la ceva în interior

8126
06:09:51,360 --> 06:09:57,120
altceva. Deci, de exemplu, hai

8127
06:09:54,160 --> 06:09:59,280
spunem că avem o listă și avem o listă A

8128
06:09:57,120 --> 06:10:01,680
este egal și atunci avem 20 45 și 10

8129
06:09:59,280 --> 06:10:03,360
în interiorul acelei liste. Deci, dacă îl întrebăm pe

8130
06:10:01,680 --> 06:10:06,240
întrebare

8131
06:10:03,360 --> 06:10:09,360
10 în A, acest lucru ar reveni de fapt adevărat

8132
06:10:06,240 --> 06:10:12,160
deoarece 10 este membru al lui A. 10 este a

8133
06:10:09,360 --> 06:10:15,200
membru al acelei liste. Deci este adevărat.

8134
06:10:12,160 --> 06:10:18,160
Acum este util de știut. Deci, N

8135
06:10:15,200 --> 06:10:20,480
operatorul este foarte puternic

8136
06:10:18,160 --> 06:10:23,040
operator puternic.

8137
06:10:20,480 --> 06:10:27,040
Um, același lucru cu nu. Deci, putem

8138
06:10:23,040 --> 06:10:28,798
Așadar, 10 nu NA ar fi fals

8139
06:10:27,040 --> 06:10:31,680
pentru că acolo este. Știm că este o

8140
06:10:28,798 --> 06:10:33,280
membru al A. Deci, ar fi fals. De

8141
06:10:31,680 --> 06:10:36,240
desigur, este NA. O putem vedea corect

8142
06:10:33,280 --> 06:10:38,320
acolo. Este un membru al listei respective.

8143
06:10:36,240 --> 06:10:40,558
Hm, dar dacă verificăm valoarea diferită

8144
06:10:38,320 --> 06:10:42,958
asta nu este complet în interiorul unui, 30,

8145
06:10:40,558 --> 06:10:46,240
nu NA, asta ar reveni adevărat pentru că

8146
06:10:42,958 --> 06:10:49,280
30 nu este membru al listei respective. Și prin

8147
06:10:46,240 --> 06:10:50,798
felul în care, acest operator în funcționează pentru toți

8148
06:10:49,280 --> 06:10:53,280
feluri de colecții. Deci ar funcționa

8149
06:10:50,798 --> 06:10:56,080
pentru un tupol, ar funcționa pentru un set,

8150
06:10:53,280 --> 06:10:59,360
ar funcționa pentru un dicționar.

8151
06:10:56,080 --> 06:11:02,760
Um, ar funcționa, ar funcționa pentru toți

8152
06:10:59,360 --> 06:11:02,760
feluri de colecții.

8153
06:11:03,680 --> 06:11:09,520
Da, Roberto. Hm, este faptul că

8154
06:11:06,480 --> 06:11:11,120
sunt variabile diferite. Deci putem

8155
06:11:09,520 --> 06:11:14,638
uneori are sens să aibă

8156
06:11:11,120 --> 06:11:16,400
variabile diferite care sunt poate

8157
06:11:14,638 --> 06:11:18,160
au aceeași valoare, dar sunt

8158
06:11:16,400 --> 06:11:20,080
variabile diferite cu totul diferite

8159
06:11:18,160 --> 06:11:21,840
referințe

8160
06:11:20,080 --> 06:11:25,360
iar motivul este pentru că poate

8161
06:11:21,840 --> 06:11:28,320
avem o copie a acestor date și apoi

8162
06:11:25,360 --> 06:11:30,638
poate îl manipulăm pe acesta. Poate

8163
06:11:28,320 --> 06:11:33,200
aceasta este o copie a ei și manipulăm

8164
06:11:30,638 --> 06:11:37,480
acest tip și îl lăsăm pe acesta la fel

8165
06:11:33,200 --> 06:11:37,480
pentru a verifica diferențele mai târziu.

8166
06:11:38,958 --> 06:11:45,200
Da, referințele sunt legate de variabilă

8167
06:11:41,280 --> 06:11:46,878
cum A este o referință, B este o referință

8168
06:11:45,200 --> 06:11:50,718
chiar dacă datele lor că sunt

8169
06:11:46,878 --> 06:11:53,040
indicat este aceeași valoare.

8170
06:11:50,718 --> 06:11:57,400
Poate avem doar o copie a ei și

8171
06:11:53,040 --> 06:11:57,400
manipulăm una dintre acele copii.

8172
06:11:59,760 --> 06:12:03,558
Da, de aceea

8173
06:12:12,320 --> 06:12:17,200
Care este motivul pentru a verifica pentru ce? Dacă

8174
06:12:14,558 --> 06:12:20,200
sunt egali, ca referințe, A este

8175
06:12:17,200 --> 06:12:20,200
B.

8176
06:12:21,600 --> 06:12:26,240
Sincer, nu sunt multe motive bune.

8177
06:12:24,000 --> 06:12:27,920
Hm, poate dacă vrei să știi dacă

8178
06:12:26,240 --> 06:12:29,680
ceva este o copie a altceva,

8179
06:12:27,920 --> 06:12:31,280
parcă vrei să știi asta, cum ar fi haideți

8180
06:12:29,680 --> 06:12:32,798
spuneți că verificați mai târziu codul

8181
06:12:31,280 --> 06:12:34,638
si ai un A si un B si vrei

8182
06:12:32,798 --> 06:12:35,920
pentru a ști dacă unul este o copie a celuilalt,

8183
06:12:34,638 --> 06:12:37,840
poți verifica și vezi dacă sunt

8184
06:12:35,920 --> 06:12:39,200
aceeași referință.

8185
06:12:37,840 --> 06:12:42,798
Acesta este singurul motiv la care m-am putut gândi

8186
06:12:39,200 --> 06:12:44,958
de ce ai face asta. Este rar folosit.

8187
06:12:42,798 --> 06:12:46,958
Foarte rar folosit, dar este un operator care

8188
06:12:44,958 --> 06:12:49,120
Am vrut să-ți arăt în caz că o faci

8189
06:12:46,958 --> 06:12:50,480
dau peste el undeva si

8190
06:12:49,120 --> 06:12:54,200
citești despre Python sau ceva

8191
06:12:50,480 --> 06:12:54,200
și vezi este

8192
06:12:54,400 --> 06:12:57,600
De parcă acesta este singurul motiv pentru care pot cu adevărat

8193
06:12:55,920 --> 06:12:59,520
gandeste-te este sa verifici daca ceva este a

8194
06:12:57,600 --> 06:13:02,160
copie a altui sens este la fel

8195
06:12:59,520 --> 06:13:04,240
de parcă poate că e la fel

8196
06:13:02,160 --> 06:13:06,878
referință

8197
06:13:04,240 --> 06:13:08,798
B este egal cu A, atunci am putea verifica că A este B

8198
06:13:06,878 --> 06:13:11,200
și știm că atunci sunt la fel

8199
06:13:08,798 --> 06:13:12,638
referință.

8200
06:13:11,200 --> 06:13:14,798
Da, operatorul is compară

8201
06:13:12,638 --> 06:13:18,360
referințele nu exacte nu valorile.

8202
06:13:14,798 --> 06:13:18,360
Da, este adevărat.

8203
06:13:23,440 --> 06:13:28,160
În regulă. Cum ne simțim despre asta în

8204
06:13:25,920 --> 06:13:30,558
operator? Ca și calitatea de membru

8205
06:13:28,160 --> 06:13:33,920
operator. Are sens? Dacă

8206
06:13:30,558 --> 06:13:36,638
verificați dacă o valoare este a

8207
06:13:33,920 --> 06:13:38,878
membru al unei colecții,

8208
06:13:36,638 --> 06:13:41,920
asta va fi foarte util mai târziu

8209
06:13:38,878 --> 06:13:43,920
pe. Foarte util. Acesta îl vom folosi

8210
06:13:41,920 --> 06:13:46,718
destul de putin. Probabil o vom face

8211
06:13:43,920 --> 06:13:50,440
îl folosim rar, dar acesta îl folosim

8212
06:13:46,718 --> 06:13:50,440
va folosi cu siguranta.

8213
06:13:57,440 --> 06:14:02,798
Bine. Așa că am vrut să vă interoghez, băieți. um,

8214
06:14:01,360 --> 06:14:06,080
care este principala diferență între

8215
06:14:02,798 --> 06:14:08,878
equals equals și operatorul is? Ce

8216
06:14:06,080 --> 06:14:10,798
este principala diferenta?

8217
06:14:08,878 --> 06:14:14,718
Tocmai am discutat despre asta,

8218
06:14:10,798 --> 06:14:18,600
așa că sperăm că acesta este ușor. fost

8219
06:14:14,718 --> 06:14:18,600
discutand destul de mult.

8220
06:14:33,760 --> 06:14:37,600
Da, Roberto, acum știi

8221
06:14:35,600 --> 06:14:39,920
răspuns. Perfect. Da, este B. Voi toți

8222
06:14:37,600 --> 06:14:41,440
băieți care răspund B. Perfect. Este B. Bine

8223
06:14:39,920 --> 06:14:43,120
job. Voi sunteți chiar pe deasupra.

8224
06:14:41,440 --> 06:14:44,798
Loc de muncă bun. Deci, am vrut doar să subliniez asta

8225
06:14:43,120 --> 06:14:48,480
afară. Like equals equals compară

8226
06:14:44,798 --> 06:14:51,280
valorile. Facem o comparație. Hm este

8227
06:14:48,480 --> 06:14:53,760
verifică dacă referințele sunt aceleași,

8228
06:14:51,280 --> 06:14:57,400
care este referința variabilă precum

8229
06:14:53,760 --> 06:14:57,400
locația de memorie.

8230
06:14:58,160 --> 06:15:02,160
Da, este. Identitatea este aceeași cu Da,

8231
06:15:00,400 --> 06:15:05,400
asta ne referim. Referințele sunt

8232
06:15:02,160 --> 06:15:05,400
la fel.

8233
06:15:06,320 --> 06:15:11,760
În regulă. Deci, am vrut să fac o scurtă demonstrație

8234
06:15:08,320 --> 06:15:14,320
asupra operatorilor la comparație etc.

8235
06:15:11,760 --> 06:15:16,320
Am vrut să arăt demonstrația aia

8236
06:15:14,320 --> 06:15:18,958
poți vedea și exersa cu ea a

8237
06:15:16,320 --> 06:15:22,878
putin. Uh, hai să trecem la

8238
06:15:18,958 --> 06:15:26,600
demonstrația șase în interiorul lecției unu. eu sunt

8239
06:15:22,878 --> 06:15:26,600
mergi la asta.

8240
06:15:30,160 --> 06:15:33,360
care va fi ultimul lucru pe care îl vom face

8241
06:15:32,080 --> 06:15:36,680
în lecția unu și vom trece la

8242
06:15:33,360 --> 06:15:36,680
lecția a doua.

8243
06:15:36,798 --> 06:15:41,958
Hm, lasă-mă să trag demo șase aici.

8244
06:15:44,480 --> 06:15:48,040
Dă-mi o clipă.

8245
06:15:49,760 --> 06:15:51,760
Toate

8246
06:16:01,920 --> 06:16:04,920
corect,

8247
06:16:05,040 --> 06:16:08,680
lasă-mă să-mi partajez ecranul.

8248
06:16:13,920 --> 06:16:17,520
În regulă, deci demo șase. Să sperăm

8249
06:16:16,080 --> 06:16:20,240
voi băieți aveți acces la asta. Aceasta este

8250
06:16:17,520 --> 06:16:23,280
ultimul din cadrul lecției unu. um,

8251
06:16:20,240 --> 06:16:25,840
acum din nou, acesta spune că încercați să utilizați VS

8252
06:16:23,280 --> 06:16:28,000
Cod. Poți dacă vrei. Din nou, Colab

8253
06:16:25,840 --> 06:16:30,480
functioneaza bine. Puteți folosi orice aveți

8254
06:16:28,000 --> 06:16:32,718
folosit, Jupiter, Colab, VS Code,

8255
06:16:30,480 --> 06:16:36,280
orice funcționează pentru tine. Nu e mare lucru

8256
06:16:32,718 --> 06:16:36,280
pe care îl folosești.

8257
06:16:37,520 --> 06:16:42,200
Deci, nu vă faceți griji pentru nimic din toate acestea.

8258
06:16:48,160 --> 06:16:55,280
Oh da. Deci, um, F este Deci, da, asta

8259
06:16:53,040 --> 06:16:59,280
asta e o intrebare buna. Ce este F? Deci, F

8260
06:16:55,280 --> 06:17:02,558
îi spune lui Python să formateze. F este prescurtarea pentru

8261
06:16:59,280 --> 06:17:04,638
format. Practic este formatul

8262
06:17:02,558 --> 06:17:06,958
șir prin care vom tipări

8263
06:17:04,638 --> 06:17:09,360
având niște substituenți.

8264
06:17:06,958 --> 06:17:12,480
Și um

8265
06:17:09,360 --> 06:17:14,320
avem variabile numite A și B. Și

8266
06:17:12,480 --> 06:17:16,080
aceasta umple spațiul liber dintre acestea

8267
06:17:14,320 --> 06:17:19,520
substituenți cu oricare ar fi valorile

8268
06:17:16,080 --> 06:17:22,480
A și B sunt. Deci F doar ne permite

8269
06:17:19,520 --> 06:17:24,320
formatați și completați spațiile libere. Face asta

8270
06:17:22,480 --> 06:17:26,240
are sens? Ca oriunde acestea um

8271
06:17:24,320 --> 06:17:29,920
bretele sunt, avem un nume de variabilă

8272
06:17:26,240 --> 06:17:32,000
înăuntrul lui A și B. Și noi suntem um

8273
06:17:29,920 --> 06:17:37,760
urmând să completez spațiile libere ale acelor A

8274
06:17:32,000 --> 06:17:39,920
și B um cu uh știi doar prin

8275
06:17:37,760 --> 06:17:42,920
înlocuindu-le ori de câte ori facem imprimarea

8276
06:17:39,920 --> 06:17:42,920
funcția.

8277
06:17:42,958 --> 06:17:47,600
Deci, gândiți-vă că F este prescurtarea pentru

8278
06:17:45,840 --> 06:17:49,760
format.

8279
06:17:47,600 --> 06:17:51,520
și avem câțiva substituenți și

8280
06:17:49,760 --> 06:17:54,920
acestea vor fi completate de variabilele noastre

8281
06:17:51,520 --> 06:17:54,920
A și B.

8282
06:17:55,680 --> 06:18:01,360
Bine, deci acest demo face o grămadă de lucruri

8283
06:17:59,440 --> 06:18:04,240
operatori. Deci va face o grămadă

8284
06:18:01,360 --> 06:18:06,320
de comparații în care introducem un număr

8285
06:18:04,240 --> 06:18:08,000
și transformăm asta într-un număr întreg. Intrare

8286
06:18:06,320 --> 06:18:09,280
alt număr, transformă-l într-un

8287
06:18:08,000 --> 06:18:10,400
întreg, apoi faceți o grămadă de

8288
06:18:09,280 --> 06:18:12,878
comparatii. Așa că am să sar peste

8289
06:18:10,400 --> 06:18:15,120
la caiet. Voi face asta pentru noi

8290
06:18:12,878 --> 06:18:17,360
pentru a arăta asta. Dar asta e tot ce suntem

8291
06:18:15,120 --> 06:18:23,280
făcând în într-adevăr la începutul lui

8292
06:18:17,360 --> 06:18:25,440
acest demo. Hm, lasă-mă să sar

8293
06:18:23,280 --> 06:18:28,600
caietul și arată-l ca să putem

8294
06:18:25,440 --> 06:18:28,600
vezi

8295
06:18:30,080 --> 06:18:32,878
dar ar trebui să fie simplu

8296
06:18:31,520 --> 06:18:35,878
urmează pentru că am făcut multe din asta

8297
06:18:32,878 --> 06:18:35,878
deja.

8298
06:18:38,958 --> 06:18:41,920
Bine. Așa că trec la caiet. Din nou

8299
06:18:40,798 --> 06:18:45,840
simțiți-vă liber să folosiți orice doriți

8300
06:18:41,920 --> 06:18:47,440
folosi. Poți folosi colaborarea, poți folosi um

8301
06:18:45,840 --> 06:18:50,558
Jupiter, poți folosi VS Code,

8302
06:18:47,440 --> 06:18:52,798
orice ai folosi. Hai să stocăm a

8303
06:18:50,558 --> 06:18:54,480
variabilă ca a și să-l facem an

8304
06:18:52,798 --> 06:18:59,760
întreg

8305
06:18:54,480 --> 06:19:03,520
și să introducem primul tău număr.

8306
06:18:59,760 --> 06:19:05,600
Deci vom face asta.

8307
06:19:03,520 --> 06:19:07,920
Să rulăm asta. Deci, să intrăm pe primul nostru

8308
06:19:05,600 --> 06:19:10,480
număr. Hai să punem 10 sau orice altceva

8309
06:19:07,920 --> 06:19:13,440
vreau cu adevărat, dar o să pun 10.

8310
06:19:10,480 --> 06:19:17,680
Deci, acesta este stocat ca a. Acum să facem a

8311
06:19:13,440 --> 06:19:23,958
al doilea număr și să facem int

8312
06:19:17,680 --> 06:19:23,958
introduceți um introduceți al doilea număr

8313
06:19:24,160 --> 06:19:28,520
și să introducem asta.

8314
06:19:28,638 --> 06:19:34,120
Așa că acum voi pune o secundă

8315
06:19:30,080 --> 06:19:34,120
număr. Să facem 20.

8316
06:19:35,600 --> 06:19:42,400
Deci acum avem a și b. Acum hai să facem

8317
06:19:38,240 --> 06:19:46,400
niste comparatii. Deci hai să imprimăm.

8318
06:19:42,400 --> 06:19:48,798
Hm, atunci putem face uh hai să facem f

8319
06:19:46,400 --> 06:19:51,120
formatează așa cum aveau acolo. Acum

8320
06:19:48,798 --> 06:19:54,320
ceea ce va fi asta este să mergem

8321
06:19:51,120 --> 06:19:56,718
a verifica a

8322
06:19:54,320 --> 06:20:00,000
um mai mare decât sau să facem, da, să facem

8323
06:19:56,718 --> 06:20:02,160
face mai mult decât b

8324
06:20:00,000 --> 06:20:06,320
um este

8325
06:20:02,160 --> 06:20:08,240
și apoi să facem uh virgulă mai mare

8326
06:20:06,320 --> 06:20:10,958
decât b.

8327
06:20:08,240 --> 06:20:13,360
Să comparăm cele două numere. Deci acum

8328
06:20:10,958 --> 06:20:15,200
asta face comparația. Un mai mare

8329
06:20:13,360 --> 06:20:18,798
decât b le va compara pe cele două

8330
06:20:15,200 --> 06:20:21,760
numere întregi. Ce ar trebui să returneze acest lucru? Ce

8331
06:20:18,798 --> 06:20:25,798
ar trebui să revină a mai mare decât b? Ar trebui

8332
06:20:21,760 --> 06:20:25,798
sa fie adevarat sau ar trebui sa fie fals?

8333
06:20:27,360 --> 06:20:35,480
Ar trebui să fie fals. Corect? Deci ar trebui să facem

8334
06:20:30,160 --> 06:20:35,480
ar trebui să fie false aici.

8335
06:20:36,160 --> 06:20:41,120
Și asta este. 10 mai mare decât

8336
06:20:38,080 --> 06:20:44,000
20 este fals.

8337
06:20:41,120 --> 06:20:47,440
Bine, deci este fals.

8338
06:20:44,000 --> 06:20:50,878
Hai să facem altul.

8339
06:20:47,440 --> 06:20:54,558
Să facem um să încercăm egale egale. Deci

8340
06:20:50,878 --> 06:20:58,878
să spunem um a

8341
06:20:54,558 --> 06:21:02,680
egal egal cu b este acum ce facem

8342
06:20:58,878 --> 06:21:02,680
crezi că acesta va fi?

8343
06:21:03,360 --> 06:21:10,320
a este egal cu b.

8344
06:21:06,718 --> 06:21:14,320
Care ar trebui să fie acesta?

8345
06:21:10,320 --> 06:21:17,320
Da, foarte bine. Ar trebui să fie și acesta

8346
06:21:14,320 --> 06:21:17,320
fals.

8347
06:21:18,558 --> 06:21:26,440
Să rulăm asta.

8348
06:21:20,718 --> 06:21:26,440
Și acesta va fi fals. Foarte bun.

8349
06:21:26,878 --> 06:21:29,920
Bine.

8350
06:21:28,400 --> 06:21:31,760
Deci, cred că înțelegem asta. Lasă-mă să-ți dau

8351
06:21:29,920 --> 06:21:34,240
băieți a Lasă-mă să vă arăt ceva

8352
06:21:31,760 --> 06:21:36,718
interesant. Lasă-mă să plec puțin

8353
06:21:34,240 --> 06:21:40,240
scriptul din acel document demonstrativ și haideți

8354
06:21:36,718 --> 06:21:43,120
introduceți un al treilea număr numit C. Să

8355
06:21:40,240 --> 06:21:47,680
face un al treilea număr întreg.

8356
06:21:43,120 --> 06:21:51,480
Așa că introduceți al treilea număr.

8357
06:21:47,680 --> 06:21:51,480
Să facem un al treilea număr.

8358
06:21:52,638 --> 06:21:59,798
Să introducem o altă valoare de 10.

8359
06:22:03,600 --> 06:22:12,718
Bine. Deci, avem un alt număr de 10.

8360
06:22:07,840 --> 06:22:16,080
Acum, ceea ce vreau să fac este să facem

8361
06:22:12,718 --> 06:22:21,120
uh comparații multiple și face o logică

8362
06:22:16,080 --> 06:22:24,240
operator între ei. Deci hai să facem um a

8363
06:22:21,120 --> 06:22:27,120
nu este egal cu b

8364
06:22:24,240 --> 06:22:31,760
şi

8365
06:22:27,120 --> 06:22:33,920
a mai puțin de c

8366
06:22:31,760 --> 06:22:37,440
sau scuze b

8367
06:22:33,920 --> 06:22:38,638
mai putin de c.

8368
06:22:37,440 --> 06:22:39,920
La ce credem că se va întâmpla asta

8369
06:22:38,638 --> 06:22:41,280
intoarcerea? Acest lucru poate fi puțin

8370
06:22:39,920 --> 06:22:44,520
provocatoare. Ce crezi că este asta

8371
06:22:41,280 --> 06:22:44,520
se va intoarce?

8372
06:23:01,040 --> 06:23:05,280
Ar trebui să folosim F. Putem. Doar că nu sunt

8373
06:23:03,440 --> 06:23:07,120
imprimare. Doar mă duc la Sunt doar

8374
06:23:05,280 --> 06:23:08,718
mergând să conducă celula. Sunt eu sunt cam

8375
06:23:07,120 --> 06:23:10,000
făcând o comandă rapidă și doar tipăriți. nu sunt

8376
06:23:08,718 --> 06:23:11,520
merg la tipărire. Eu doar o să fug

8377
06:23:10,000 --> 06:23:12,798
celula și ar trebui să afișeze ceea ce ea

8378
06:23:11,520 --> 06:23:14,558
este.

8379
06:23:12,798 --> 06:23:17,760
Credem că va fi fals?

8380
06:23:14,558 --> 06:23:20,320
Da, băieți, sunteți chiar deasupra.

8381
06:23:17,760 --> 06:23:22,638
Ar trebui să fie fals. Acum, hai să rupem asta

8382
06:23:20,320 --> 06:23:25,680
jos. De ce este fals? Deci, A nu este egal

8383
06:23:22,638 --> 06:23:27,920
la B se verifică dacă A nu este egal cu B,

8384
06:23:25,680 --> 06:23:32,400
ceea ce este adevărat.

8385
06:23:27,920 --> 06:23:35,200
A are valoarea 10.

8386
06:23:32,400 --> 06:23:39,040
Deci, A are o valoare de 10. Deci, 10 nu este

8387
06:23:35,200 --> 06:23:43,280
egal cu 20. Asta are sens. Dar 20 este

8388
06:23:39,040 --> 06:23:46,000
nu mai puțin de 10. Deci această parte este falsă.

8389
06:23:43,280 --> 06:23:50,320
Deci haideți să facem un comentariu.

8390
06:23:46,000 --> 06:23:58,320
Deci motivul pentru care acest lucru este fals

8391
06:23:50,320 --> 06:24:00,798
este pentru că B nu este mai mic decât C. Deci şi

8392
06:23:58,320 --> 06:24:04,320
returnează false.

8393
06:24:00,798 --> 06:24:06,000
Da. Foarte bun.

8394
06:24:04,320 --> 06:24:10,440
Acum,

8395
06:24:06,000 --> 06:24:10,440
ce se întâmplă dacă iau acest cod

8396
06:24:10,878 --> 06:24:15,718
si faci asta?

8397
06:24:16,320 --> 06:24:19,638
Ce-i asta?

8398
06:24:26,400 --> 06:24:31,520
Perfect. Da, băieți, sunteți în top

8399
06:24:28,080 --> 06:24:34,400
din ea. Acest lucru ar trebui să fie adevărat. Și este.

8400
06:24:31,520 --> 06:24:38,638
Acum asta pentru că momentul pe care îl avem la

8401
06:24:34,400 --> 06:24:41,280
cel puțin unul adevărat care va fi acesta

8402
06:24:38,638 --> 06:24:44,440
asta are sens corect

8403
06:24:41,280 --> 06:24:44,440
fi adevărat.

8404
06:24:54,240 --> 06:25:00,558
Bine, încă unul și apoi putem încheia

8405
06:24:57,200 --> 06:25:02,320
acest demo. Așa că vreau să fac o listă.

8406
06:25:00,558 --> 06:25:07,878
O să-i spun X și o voi face

8407
06:25:02,320 --> 06:25:07,878
creați o listă de trei numere 10 20 30.

8408
06:25:08,878 --> 06:25:14,558
Bine. Acum, ce crezi tu asta

8409
06:25:12,558 --> 06:25:18,600
rezultatul este?

8410
06:25:14,558 --> 06:25:18,600
Ce ar trebui să fie asta?

8411
06:25:23,040 --> 06:25:29,480
Ar trebui să fie adevărat.

8412
06:25:25,360 --> 06:25:29,480
Foarte bun. Ar trebui să fie adevărat.

8413
06:25:32,080 --> 06:25:37,480
Acum ce ar trebui să fie asta?

8414
06:25:41,600 --> 06:25:45,840
Acest lucru este, de asemenea, adevărat. Foarte bun. Aceasta

8415
06:25:43,600 --> 06:25:48,798
ar trebui să fie adevărat pentru că asta

8416
06:25:45,840 --> 06:25:52,718
nu va fi în listă.

8417
06:25:48,798 --> 06:25:54,480
Deci asta are sens. Nu este adevărat.

8418
06:25:52,718 --> 06:25:55,920
Acum, ceea ce vreau să observi este nimic

8419
06:25:54,480 --> 06:25:57,760
se va schimba dacă schimb asta în a

8420
06:25:55,920 --> 06:26:00,320
tupol.

8421
06:25:57,760 --> 06:26:03,440
Nimic nu se va schimba. Mai putem verifica.

8422
06:26:00,320 --> 06:26:04,798
Deci încă putem verifica dacă 10 este a

8423
06:26:03,440 --> 06:26:06,638
membru al acestui tupol și mai putem

8424
06:26:04,798 --> 06:26:08,638
verificați dacă 40 nu este membru al acestuia

8425
06:26:06,638 --> 06:26:11,680
tupol. Deci nimic nu se schimbă cu adevărat,

8426
06:26:08,638 --> 06:26:14,798
corect? Este încă în operator de membru

8427
06:26:11,680 --> 06:26:17,798
în cecuri este membru al vreunuia

8428
06:26:14,798 --> 06:26:17,798
colectie?

8429
06:26:19,360 --> 06:26:23,840
bine,

8430
06:26:21,520 --> 06:26:25,440
foarte bine. Orice întrebări despre acestea

8431
06:26:23,840 --> 06:26:28,000
exemple?

8432
06:26:25,440 --> 06:26:29,600
Aveți întrebări? Ne simțim confortabil

8433
06:26:28,000 --> 06:26:30,718
cu unii dintre acești operatori? Voi băieți

8434
06:26:29,600 --> 06:26:32,400
erau chiar deasupra. A fost foarte

8435
06:26:30,718 --> 06:26:35,400
impresionant. Băieți, ați avut dreptate

8436
06:26:32,400 --> 06:26:35,400
departe.

8437
06:26:35,920 --> 06:26:44,480
Uh, schimbi tipăritul

8438
06:26:39,760 --> 06:26:46,000
a= b și a este b. Și am intrat patru ambele

8439
06:26:44,480 --> 06:26:51,000
ori

8440
06:26:46,000 --> 06:26:51,000
si am obtinut acelasi rezultat. Adevărat.

8441
06:26:53,040 --> 06:26:59,680
Deci ai avut A și B. Deci tu

8442
06:26:56,878 --> 06:27:02,638
ai avut um

8443
06:26:59,680 --> 06:27:06,638
ai avut A egal cu 4

8444
06:27:02,638 --> 06:27:10,360
iar B este egal cu 4 și ai verificat

8445
06:27:06,638 --> 06:27:10,360
ai verificat asta.

8446
06:27:16,478 --> 06:27:19,478
Da.

8447
06:27:20,558 --> 06:27:25,680
Da. Deci este puțin confuz și

8448
06:27:23,680 --> 06:27:28,160
Pot să înțeleg de ce. Deci motivul asta

8449
06:27:25,680 --> 06:27:32,878
ajunge să fie adevărat pentru că aceasta este o

8450
06:27:28,160 --> 06:27:35,680
date scalare. Deci, pentru datele scalare este

8451
06:27:32,878 --> 06:27:39,440
se va optimiza în memorie la punct

8452
06:27:35,680 --> 06:27:43,120
deoarece patru ocupă întregul patru

8453
06:27:39,440 --> 06:27:45,120
aceeași adresă de memorie întotdeauna. Dar când

8454
06:27:43,120 --> 06:27:49,840
creăm o matrice, când creăm un

8455
06:27:45,120 --> 06:27:51,840
listă, adică un obiect nou.

8456
06:27:49,840 --> 06:27:54,400
Deci da, e puțin confuz,

8457
06:27:51,840 --> 06:27:57,200
dar este doar pentru că asta este

8458
06:27:54,400 --> 06:28:01,680
date scalare care sunt Python

8459
06:27:57,200 --> 06:28:05,120
știe, bine, patru este la fel

8460
06:28:01,680 --> 06:28:07,040
întreg în mine în memorie întotdeauna

8461
06:28:05,120 --> 06:28:09,280
indiferent dacă ne referim la el

8462
06:28:07,040 --> 06:28:12,958
din aceasta din două variabile diferite.

8463
06:28:09,280 --> 06:28:15,040
Acesta este motivul pentru care eu da

8464
06:28:12,958 --> 06:28:18,558
am uitat să menționez acel exemplu, dar este

8465
06:28:15,040 --> 06:28:20,080
pur și simplu motivul pentru care acest lucru este adevărat este

8466
06:28:18,558 --> 06:28:25,920
pentru că

8467
06:28:20,080 --> 06:28:29,040
acest lucru este adevărat din cauza scalarului

8468
06:28:25,920 --> 06:28:31,520
optimizarea datelor. În esență, este

8469
06:28:29,040 --> 06:28:33,920
nu va irosi creând un nou obiect

8470
06:28:31,520 --> 06:28:35,920
când este doar un singur număr întreg patru. ea

8471
06:28:33,920 --> 06:28:37,440
practic ocupă aceeași memorie

8472
06:28:35,920 --> 06:28:42,000
adresa

8473
06:28:37,440 --> 06:28:44,000
uh ca referință.

8474
06:28:42,000 --> 06:28:47,240
Dar când construim o astfel de listă este un

8475
06:28:44,000 --> 06:28:47,240
obiect diferit.

8476
06:28:52,080 --> 06:28:57,638
Bine.

8477
06:28:54,320 --> 06:28:57,638
Foarte bun.

8478
06:28:58,638 --> 06:29:05,040
În regulă. Deci,

8479
06:29:00,958 --> 06:29:07,760
um, asta va încheia lecția unu. Ce

8480
06:29:05,040 --> 06:29:09,360
O să fac este să intru în lecția a doua.

8481
06:29:07,760 --> 06:29:11,600
Am de gând să renunț la lecția a doua

8482
06:29:09,360 --> 06:29:14,320
note, diapozitivele pentru lecția a doua. Deci, dacă

8483
06:29:11,600 --> 06:29:16,000
le ai, hai să le ridicăm. um,

8484
06:29:14,320 --> 06:29:17,840
Vă încurajez acum, există o

8485
06:29:16,000 --> 06:29:21,040
practică ghidată la sfârșitul lecției

8486
06:29:17,840 --> 06:29:22,558
unul, și acesta este pentru tine însuți. eu

8487
06:29:21,040 --> 06:29:24,320
te-ar încuraja ca un fel de

8488
06:29:22,558 --> 06:29:27,680
teme pentru acasă de acum și până la următorul

8489
06:29:24,320 --> 06:29:30,080
când ne întâlnim pentru a face ghidul

8490
06:29:27,680 --> 06:29:32,878
practică pentru lecția unu. Încearcă asta

8491
06:29:30,080 --> 06:29:34,478
a ta. Este um, băieți, ar trebui să aveți

8492
06:29:32,878 --> 06:29:36,240
accesul la acesta din LMS-ul dvs. și

8493
06:29:34,478 --> 06:29:40,160
materiale de referință. Există un ghid

8494
06:29:36,240 --> 06:29:41,760
practica. Încearcă asta. Încercați-le. Bine?

8495
06:29:40,160 --> 06:29:44,718
Încercați practica ghidată pentru lecție

8496
06:29:41,760 --> 06:29:49,080
unul. Doar că este doar ceva suplimentar

8497
06:29:44,718 --> 06:29:49,080
practica lucrurilor pe care tocmai le-am acoperit.

8498
06:29:49,360 --> 06:29:53,120
Bine?

8499
06:29:50,718 --> 06:29:55,760
Lasă-mă să deschid

8500
06:29:53,120 --> 06:29:59,160
um

8501
06:29:55,760 --> 06:29:59,160
lecția a doua.

8502
06:30:04,320 --> 06:30:07,958
Dă-mi un moment aici.

8503
06:30:10,718 --> 06:30:16,200
Bine.

8504
06:30:12,478 --> 06:30:16,200
Deci, permiteți-mi să-mi partajez ecranul.

8505
06:30:24,798 --> 06:30:29,440
Bine, deci acum vom trece la

8506
06:30:27,600 --> 06:30:31,440
privind mai atent acele lucruri

8507
06:30:29,440 --> 06:30:33,040
cum ar fi liste, tupiluri, dicționare și

8508
06:30:31,440 --> 06:30:35,040
apoi privind fluxul de control cu

8509
06:30:33,040 --> 06:30:37,120
instrucțiuni și bucle condiționate. Deci

8510
06:30:35,040 --> 06:30:39,440
vom intra în lucrurile distractive, eu

8511
06:30:37,120 --> 06:30:43,000
aș crede că ați putea

8512
06:30:39,440 --> 06:30:43,000
au așteptat.

8513
06:30:43,040 --> 06:30:46,798
Bine, deci am vorbit despre noi

8514
06:30:45,200 --> 06:30:48,558
am terminat de vorbit despre lecția unu unde

8515
06:30:46,798 --> 06:30:50,718
știm că Python este cu adevărat

8516
06:30:48,558 --> 06:30:52,160
lucru important de învățat și de studiat

8517
06:30:50,718 --> 06:30:54,878
pentru că este folosit peste tot

8518
06:30:52,160 --> 06:30:56,558
cu știința datelor și un IML. Deci unul dintre

8519
06:30:54,878 --> 06:30:59,280
lucrurile sunt că trebuie să continuăm

8520
06:30:56,558 --> 06:31:01,360
învățând despre asta cu lucruri precum bucle

8521
06:30:59,280 --> 06:31:04,160
lucruri precum if else declarații să

8522
06:31:01,360 --> 06:31:08,120
controlează fluxul programelor noastre și

8523
06:31:04,160 --> 06:31:08,120
aceste structuri de date de bază.

8524
06:31:08,160 --> 06:31:13,120
Să continuăm înainte. Hm deci asta

8525
06:31:11,120 --> 06:31:15,920
lecția despre care vom vorbi lista

8526
06:31:13,120 --> 06:31:18,080
seturi de dicționar tupils uh vom merge la

8527
06:31:15,920 --> 06:31:20,000
știi să vorbești despre diferențe cum

8528
06:31:18,080 --> 06:31:22,878
putem accesa date în lucruri precum

8529
06:31:20,000 --> 06:31:24,478
enumerați cum le putem modifica

8530
06:31:22,878 --> 06:31:26,718
pot accesa lucruri de la tupili ceea ce sunt

8531
06:31:24,478 --> 06:31:29,680
diferențele vom analiza toate acestea

8532
06:31:26,718 --> 06:31:32,478
unul dintre marile subiecte va fi la

8533
06:31:29,680 --> 06:31:34,558
Uite cum putem controla fluxul

8534
06:31:32,478 --> 06:31:37,440
ceea ce înseamnă controlul fluxului folosește ca

8535
06:31:34,558 --> 06:31:39,840
logica deciziei ca dacă acest lucru este adevărat atunci

8536
06:31:37,440 --> 06:31:41,440
fă asta altfel fă asta despre care vom vorbi

8537
06:31:39,840 --> 06:31:44,000
astfel de afirmații. Vom vorbi

8538
06:31:41,440 --> 06:31:47,040
despre iterație. Deci, cum putem face bucle

8539
06:31:44,000 --> 06:31:49,600
pentru a repeta um declarații de cod pe care noi

8540
06:31:47,040 --> 06:31:51,360
vreau sa fac. O să vorbim și despre

8541
06:31:49,600 --> 06:31:53,760
organizându-ne un pic codul în

8542
06:31:51,360 --> 06:31:55,440
funcții. Um care va fi

8543
06:31:53,760 --> 06:31:57,680
cu adevărat util pentru a noastră

8544
06:31:55,440 --> 06:32:00,680
organizare şi reutilizare şi

8545
06:31:57,680 --> 06:32:00,680
mentenabilitatea.

8546
06:32:02,478 --> 06:32:08,240
Bine.

8547
06:32:05,280 --> 06:32:11,760
Așa că să sărim în el. Să vorbim despre

8548
06:32:08,240 --> 06:32:13,360
unele dintre aceste structuri de date.

8549
06:32:11,760 --> 06:32:17,120
Deci, am vorbit deja despre asta

8550
06:32:13,360 --> 06:32:19,920
aceste structuri de date agregate există

8551
06:32:17,120 --> 06:32:22,240
și ne permit să manipulăm datele

8552
06:32:19,920 --> 06:32:23,440
în interiorul lui Python. Liste, tupil, seturi,

8553
06:32:22,240 --> 06:32:26,798
dicţionarele sunt principalele noi

8554
06:32:23,440 --> 06:32:28,638
urmează să se concentreze asupra.

8555
06:32:26,798 --> 06:32:30,400
Să începem cu liste. Si cred

8556
06:32:28,638 --> 06:32:33,280
listele vor fi ceva ce suntem

8557
06:32:30,400 --> 06:32:34,878
va folosi destul de mult pe tot parcursul.

8558
06:32:33,280 --> 06:32:36,638
Deci, vor fi foarte bune

8559
06:32:34,878 --> 06:32:38,878
loc cu care să începeți. Sunt super

8560
06:32:36,638 --> 06:32:41,520
popular în Python. O mulțime de oameni um

8561
06:32:38,878 --> 06:32:45,280
folosiți-le pentru a lucra cu date. Ei

8562
06:32:41,520 --> 06:32:46,958
sunt un fel de date de bază um cele mai multe

8563
06:32:45,280 --> 06:32:50,000
structură de date de bază și utilă care

8564
06:32:46,958 --> 06:32:53,680
acolo există.

8565
06:32:50,000 --> 06:32:56,240
Deci, ce este o listă? O listă este un an

8566
06:32:53,680 --> 06:32:59,280
ordonat mutabil sensul poate fi

8567
06:32:56,240 --> 06:33:00,958
structura de date modificată care poate ține

8568
06:32:59,280 --> 06:33:04,240
elemente de diferite tipuri de date. Deci

8569
06:33:00,958 --> 06:33:06,000
este o colecție de date și nu există

8570
06:33:04,240 --> 06:33:07,760
cerința ca toți membrii

8571
06:33:06,000 --> 06:33:09,200
lista să fie de același tip. De fapt, poți

8572
06:33:07,760 --> 06:33:10,958
au diferite tipuri. Poți avea

8573
06:33:09,200 --> 06:33:12,718
numere întregi, puteți avea flotoare, puteți

8574
06:33:10,958 --> 06:33:14,400
au siruri,

8575
06:33:12,718 --> 06:33:18,478
um, poți avea și mai abstract

8576
06:33:14,400 --> 06:33:20,478
obiectele să fie membri ai unei liste. Hm deci orice

8577
06:33:18,478 --> 06:33:23,680
tip de date pot locui într-o listă. Dar

8578
06:33:20,478 --> 06:33:26,320
mare lucru este că este modificabil.

8579
06:33:23,680 --> 06:33:27,840
Este dinamic. Poți schimba, poți adăuga

8580
06:33:26,320 --> 06:33:31,200
lucruri la el. Poți să eliminați

8581
06:33:27,840 --> 06:33:33,200
schimba lucrurile. Hm și are un inerent

8582
06:33:31,200 --> 06:33:36,160
comanda, ceea ce este frumos. Deci poți tu

8583
06:33:33,200 --> 06:33:39,440
poate fi asigurat că există unele

8584
06:33:36,160 --> 06:33:41,760
poziţia inerentă a elementelor şi va

8585
06:33:39,440 --> 06:33:43,280
mentine acea ordine. Deci putem accesa

8586
06:33:41,760 --> 06:33:45,760
lucruri bazate pe ordine cum putem

8587
06:33:43,280 --> 06:33:48,320
acces primul poate accesa ultimul noi

8588
06:33:45,760 --> 06:33:52,160
poate accesa orice între ele.

8589
06:33:48,320 --> 06:33:55,680
Deci e frumos. Um deci care sunt unele cheie

8590
06:33:52,160 --> 06:33:57,200
caracteristici? Deci asistență pentru liste

8591
06:33:55,680 --> 06:33:58,558
mai multe tipuri de date. Am vorbit despre

8592
06:33:57,200 --> 06:33:59,840
că. Nu există nicio cerință ca

8593
06:33:58,558 --> 06:34:03,600
toate sunt la fel. Ei pot avea

8594
06:33:59,840 --> 06:34:05,760
multiple. Ele permit indexarea, care

8595
06:34:03,600 --> 06:34:08,240
vom vorbi despre. Aceasta înseamnă

8596
06:34:05,760 --> 06:34:10,160
că putem accesa lucruri pe baza lor

8597
06:34:08,240 --> 06:34:12,478
index, care este poziția lor în interior

8598
06:34:10,160 --> 06:34:14,400
lista. Deci, putem accesa oricând

8599
06:34:12,478 --> 06:34:17,520
primul lucru, ultimul lucru, orice în

8600
06:34:14,400 --> 06:34:21,040
între, pe baza poziției sale. Asta e

8601
06:34:17,520 --> 06:34:24,080
un alt cuvânt pentru uh index pentru că liste

8602
06:34:21,040 --> 06:34:27,760
au o ordonare firească pentru ei care este

8603
06:34:24,080 --> 06:34:30,400
um foarte puternic pentru a asigura asta

8604
06:34:27,760 --> 06:34:34,000
există unul despre care știi că este o premieră

8605
06:34:30,400 --> 06:34:36,798
poziționați a doua poziție a treia etc. Deci

8606
06:34:34,000 --> 06:34:38,478
listele sunt foarte frumoase pentru asta.

8607
06:34:36,798 --> 06:34:41,200
Hm

8608
06:34:38,478 --> 06:34:43,040
uh sunt modificabile, ceea ce este într-adevăr

8609
06:34:41,200 --> 06:34:44,958
frumos. Deci putem adăuga lucruri în

8610
06:34:43,040 --> 06:34:46,878
lista. Este foarte dinamic. Deci odată noi

8611
06:34:44,958 --> 06:34:48,718
creați o listă, putem pe tot parcursul nostru

8612
06:34:46,878 --> 06:34:51,360
program, putem adăuga date la el, putem

8613
06:34:48,718 --> 06:34:53,360
eliminați-l, îl putem schimba. Hm, listele de asemenea

8614
06:34:51,360 --> 06:34:55,760
permite dubluri, care pot fi

8615
06:34:53,360 --> 06:34:57,600
de dorit. De parcă poate adăugăm ceva

8616
06:34:55,760 --> 06:35:00,240
în lista noastră care există deja.

8617
06:34:57,600 --> 06:35:03,040
E în regulă. Lista permite duplicate. Aceasta

8618
06:35:00,240 --> 06:35:05,360
va fi diferit de seturile. Seturi

8619
06:35:03,040 --> 06:35:08,558
nu permiteți duplicate. Seturile sunt doar un

8620
06:35:05,360 --> 06:35:10,638
găleată de lucruri unice. Deci dacă am adăugat

8621
06:35:08,558 --> 06:35:13,520
un duplicat într-un set, ar respinge

8622
06:35:10,638 --> 06:35:16,400
ea. nu am avea erori, dar asta

8623
06:35:13,520 --> 06:35:18,240
pur și simplu nu ar apărea ca o copie. Noi

8624
06:35:16,400 --> 06:35:21,040
ar avea doar un set este doar de gând să

8625
06:35:18,240 --> 06:35:23,920
păstrați o copie a unui articol. Doar asta

8626
06:35:21,040 --> 06:35:25,520
permite articole unice. Listele vă permit

8627
06:35:23,920 --> 06:35:28,798
aveți câte copii de date doriți

8628
06:35:25,520 --> 06:35:30,958
în interiorul unei liste. Hm, deci permite

8629
06:35:28,798 --> 06:35:33,280
duplicate.

8630
06:35:30,958 --> 06:35:37,040
Acum, am văzut deja în termeni de sintaxă,

8631
06:35:33,280 --> 06:35:39,680
listele sunt definite prin paranteze. Deci

8632
06:35:37,040 --> 06:35:41,600
când vezi acele paranteze

8633
06:35:39,680 --> 06:35:45,280
definește o listă și articolele acesteia sunt

8634
06:35:41,600 --> 06:35:47,600
separate prin virgule.

8635
06:35:45,280 --> 06:35:52,280
Deci

8636
06:35:47,600 --> 06:35:52,280
putem avea o listă care să arate așa.

8637
06:35:53,200 --> 06:35:56,958
Da, voiam să explic felia. Noi

8638
06:35:54,878 --> 06:35:59,040
au câteva diapozitive despre feliere

8639
06:35:56,958 --> 06:36:02,080
vine, dar tăierea înseamnă doar asta

8640
06:35:59,040 --> 06:36:04,160
putem tăia înseamnă că putem apuca a

8641
06:36:02,080 --> 06:36:08,080
secţiune de elemente la un moment dat de la a

8642
06:36:04,160 --> 06:36:10,320
lista. Deci, de exemplu, putem de fapt

8643
06:36:08,080 --> 06:36:12,798
permiteți-mi să folosesc acest exemplu de aici. A

8644
06:36:10,320 --> 06:36:16,958
felie ar însemna că putem lua așa

8645
06:36:12,798 --> 06:36:19,600
primele trei felii ale listei sau

8646
06:36:16,958 --> 06:36:22,160
putem apuca ultimele cinci elemente sau

8647
06:36:19,600 --> 06:36:25,200
orice ca asta este o felie. Este doar

8648
06:36:22,160 --> 06:36:27,040
un subset al listei pe care îl putem lua

8649
06:36:25,200 --> 06:36:31,200
putem accesa.

8650
06:36:27,040 --> 06:36:34,478
Deci tăierea înseamnă doar luarea unui subset,

8651
06:36:31,200 --> 06:36:36,240
luând o secţiune mai mică a listei şi

8652
06:36:34,478 --> 06:36:38,160
putem prinde toate acele elemente la a

8653
06:36:36,240 --> 06:36:41,160
timp. Și ceea ce se numește asta se află într-un

8654
06:36:38,160 --> 06:36:41,160
felie.

8655
06:36:42,798 --> 06:36:45,680
Da, ca o felie de pizza. Suntem

8656
06:36:44,400 --> 06:36:49,638
luăm toată treaba și luăm

8657
06:36:45,680 --> 06:36:49,638
o mică secțiune din ea.

8658
06:36:50,878 --> 06:36:56,000
Deci asta și de fapt asta se va întâmpla

8659
06:36:53,200 --> 06:36:59,878
fi posibil deoarece lista are un

8660
06:36:56,000 --> 06:36:59,878
ordine firească a acestuia.

8661
06:37:01,520 --> 06:37:05,200
Datele trebuie să fie secvenţiale? nu,

8662
06:37:03,360 --> 06:37:08,558
nu trebuie să fie. De fapt, tu

8663
06:37:05,200 --> 06:37:10,320
pot fi complet diferite tipuri.

8664
06:37:08,558 --> 06:37:12,320
Are sens? Ca asa uite

8665
06:37:10,320 --> 06:37:16,000
acest exemplu de aici. Parcă avem 10

8666
06:37:12,320 --> 06:37:17,440
2 5 salut. Asta e o listă valabilă. Poți

8667
06:37:16,000 --> 06:37:21,638
au diferite tipuri de date acolo

8668
06:37:17,440 --> 06:37:21,638
care nu este deloc secvenţial

8669
06:37:29,920 --> 06:37:34,240
într-o felie. Nu, nu trebuie să fie.

8670
06:37:32,000 --> 06:37:38,638
Deci poți avea așa cum poți avea un

8671
06:37:34,240 --> 06:37:42,080
felie care alege fiecare al treilea element

8672
06:37:38,638 --> 06:37:45,440
uh orice alt element. Da, asta

8673
06:37:42,080 --> 06:37:48,760
nu trebuie să fie secvenţial. Nu, asta

8674
06:37:45,440 --> 06:37:48,760
poate fi personalizat.

8675
06:37:49,440 --> 06:37:52,718
Ceea ce este, de asemenea, frumos este din care poți tăia

8676
06:37:51,360 --> 06:37:54,638
începutul sau puteți tăia din

8677
06:37:52,718 --> 06:37:58,400
sfârşitul de asemenea. Așa că poți, poți pleca de la

8678
06:37:54,638 --> 06:37:59,680
capătul și feliați înapoi. Hm sau tu

8679
06:37:58,400 --> 06:38:01,600
poate merge de la început și felia

8680
06:37:59,680 --> 06:38:03,120
înainte. Deci poți să apuci ca fiecare

8681
06:38:01,600 --> 06:38:04,798
alt element de la început. tu

8682
06:38:03,120 --> 06:38:06,958
poate lua orice alt element din

8683
06:38:04,798 --> 06:38:10,160
înapoi și mergeți înainte și opriți-vă

8684
06:38:06,958 --> 06:38:12,160
la un moment dat.

8685
06:38:10,160 --> 06:38:15,878
Tăierea este foarte bună. Da. Deci, sunt

8686
06:38:12,160 --> 06:38:15,878
ne va arăta cum să facem asta.

8687
06:38:16,558 --> 06:38:21,558
Poți să tai la mijloc? Da, tu

8688
06:38:17,760 --> 06:38:21,558
poate tăia oriunde doriți.

8689
06:38:21,840 --> 06:38:26,558
Poți să feli o pizza în mijloc?

8690
06:38:23,440 --> 06:38:28,320
Sigur. Ai face asta? Poate că nu. Dar

8691
06:38:26,558 --> 06:38:32,840
da, poți tăia oriunde în

8692
06:38:28,320 --> 06:38:32,840
lista. Puteți tăia.

8693
06:38:37,440 --> 06:38:42,878
Tăierea modifică lista originală?

8694
06:38:39,600 --> 06:38:45,680
Nu, este doar selecția unui subset.

8695
06:38:42,878 --> 06:38:47,840
Nu, doar extrage elemente.

8696
06:38:45,680 --> 06:38:51,360
Nu-i place să-l schimbe definitiv

8697
06:38:47,840 --> 06:38:53,120
orice fel. Îți oferă doar o vedere. Gândește-te

8698
06:38:51,360 --> 06:38:56,120
ca și cum ți-ar oferi o viziune despre asta

8699
06:38:53,120 --> 06:38:56,120
subset.

8700
06:39:00,718 --> 06:39:06,638
Bine, deci s-ar putea să vă întrebați când ar face asta

8701
06:39:03,520 --> 06:39:09,520
Am folosit vreodată lista? Deci, în mod normal, folosești

8702
06:39:06,638 --> 06:39:12,478
liste ori de câte ori doriți o comandă

8703
06:39:09,520 --> 06:39:15,920
colecție care este dinamică, adică

8704
06:39:12,478 --> 06:39:19,600
poate doriți să adăugați lucruri din el.

8705
06:39:15,920 --> 06:39:22,400
Poate vrem să modificăm lucrurile din ea

8706
06:39:19,600 --> 06:39:24,718
frecvent. Hm, dar vrem ceva

8707
06:39:22,400 --> 06:39:26,878
care este dinamic și are o ordonare să

8708
06:39:24,718 --> 06:39:29,200
ea. Listele sunt perfecte din acest motiv.

8709
06:39:26,878 --> 06:39:32,320
Deci ele pot conține date pe care le putem adăuga

8710
06:39:29,200 --> 06:39:34,878
a scoate din schimbare. Deci listele sunt foarte

8711
06:39:32,320 --> 06:39:36,638
versatil. Cred că majoritatea cazurilor de utilizare cu

8712
06:39:34,878 --> 06:39:39,200
manipuland

8713
06:39:36,638 --> 06:39:41,200
ar cădea o colecție de articole

8714
06:39:39,200 --> 06:39:45,718
sub o listă. O listă ar fi foarte

8715
06:39:41,200 --> 06:39:45,718
alegere buna. Hm

8716
06:39:46,080 --> 06:39:51,280
putem tăia elemente și le putem folosi.

8717
06:39:48,478 --> 06:39:54,000
Da. Da. Puteți felia pe care o puteți păstra

8718
06:39:51,280 --> 06:39:57,600
o felie în interiorul unei variabile și folosiți utilizarea

8719
06:39:54,000 --> 06:40:00,840
utilizarea acelei variabile rezultate. Da,

8720
06:39:57,600 --> 06:40:00,840
cu siguranta.

8721
06:40:11,840 --> 06:40:16,040
informații de comandă precum

8722
06:40:16,718 --> 06:40:22,080
Da. Da, acesta este un exemplu bun. Da,

8723
06:40:18,798 --> 06:40:23,680
comanda precum colectarea comenzilor

8724
06:40:22,080 --> 06:40:26,798
ar fi probabil într-o listă pentru că

8725
06:40:23,680 --> 06:40:29,280
se poate schimba. Hm, dar prețurile ar fi

8726
06:40:26,798 --> 06:40:32,558
probabil static. Deci, asta ar fi mai mult

8727
06:40:29,280 --> 06:40:34,400
uh potrivit pentru un tupol. Da, un tupol

8728
06:40:32,558 --> 06:40:35,680
sau poate un dicționar. Un dicționar este

8729
06:40:34,400 --> 06:40:38,160
probabil mai bine pentru că poți avea

8730
06:40:35,680 --> 06:40:40,638
cum ar fi un ID de produs sau un nume care se mapează la

8731
06:40:38,160 --> 06:40:43,600
un pret. Probabil ar fi un dicționar

8732
06:40:40,638 --> 06:40:48,440
mai potrivit pentru o listă de prețuri. Dar

8733
06:40:43,600 --> 06:40:48,440
dar da, poate și tupole are sens.

8734
06:40:51,440 --> 06:40:55,280
Apropo, uită-te la această listă. tu

8735
06:40:52,958 --> 06:40:57,920
băieții văd cum are diferite tipuri de

8736
06:40:55,280 --> 06:40:59,840
date din el, nu? Are atât de asemănător

8737
06:40:57,920 --> 06:41:02,320
primul element este un întreg, următorul este

8738
06:40:59,840 --> 06:41:04,958
o sfoară, următorul este un plutitor, ultimul

8739
06:41:02,320 --> 06:41:07,760
este un boolean. Asta e total valabil în

8740
06:41:04,958 --> 06:41:09,920
Python, care este oarecum unic pentru

8741
06:41:07,760 --> 06:41:13,600
Python. Așa cum multe limbi nu fac

8742
06:41:09,920 --> 06:41:15,440
susține asta. O matrice de tip mixt.

8743
06:41:13,600 --> 06:41:19,000
Nu-i așa că ei chiar nu au asta

8744
06:41:15,440 --> 06:41:19,000
noțiunea de asta.

8745
06:41:26,320 --> 06:41:31,680
În regulă. Deci, la ce am vrut să ajung

8746
06:41:28,558 --> 06:41:33,920
au fost pozitiile. Deci, asta se va întâmpla

8747
06:41:31,680 --> 06:41:35,840
fie că acest lucru este cu adevărat important de plătit

8748
06:41:33,920 --> 06:41:38,400
atenție pentru că asta va fi

8749
06:41:35,840 --> 06:41:41,680
ceva pe care îl vom folosi

8750
06:41:38,400 --> 06:41:44,478
pe tot parcursul programului este modul de acces

8751
06:41:41,680 --> 06:41:46,160
date după poziția sa.

8752
06:41:44,478 --> 06:41:48,240
Bine, pentru care există un alt cuvânt

8753
06:41:46,160 --> 06:41:51,520
că. Poziția pe care o vei avea uneori

8754
06:41:48,240 --> 06:41:54,160
auzi numit index. Deci indexul în

8755
06:41:51,520 --> 06:41:56,958
lista unde acestea sunt date

8756
06:41:54,160 --> 06:42:00,320
membrii în direct este ordinea lor ca și a lor

8757
06:41:56,958 --> 06:42:04,400
poziție printre listă.

8758
06:42:00,320 --> 06:42:08,718
Deci, ceea ce este special la Python este că

8759
06:42:04,400 --> 06:42:13,120
are prima pozitie

8760
06:42:08,718 --> 06:42:17,040
este indicele zero, care împinge oamenii pe toți

8761
06:42:13,120 --> 06:42:20,718
timpul. Excursia foarte clasică a

8762
06:42:17,040 --> 06:42:23,760
Python este că primul element al lui a

8763
06:42:20,718 --> 06:42:26,000
lista este la poziția zero. Următorul

8764
06:42:23,760 --> 06:42:28,240
elementul este în poziția unu. Următorul

8765
06:42:26,000 --> 06:42:32,558
elementul este în poziţia doi. În continuare

8766
06:42:28,240 --> 06:42:38,320
și mai departe. Ultimul element este pe poziție

8767
06:42:32,558 --> 06:42:41,120
n minus unu unde n este dimensiunea

8768
06:42:38,320 --> 06:42:43,760
um dimensiunea listei. Deci, oricât de multe

8769
06:42:41,120 --> 06:42:45,680
elementele pe care le avem în lista noastră.

8770
06:42:43,760 --> 06:42:47,680
um,

8771
06:42:45,680 --> 06:42:49,840
deci

8772
06:42:47,680 --> 06:42:51,520
dacă doriți să accesați primul element,

8773
06:42:49,840 --> 06:42:54,320
ai căuta elementul

8774
06:42:51,520 --> 06:42:56,718
asta e in pozitia zero. Dacă vrei

8775
06:42:54,320 --> 06:42:59,600
accesați al doilea element, asta este

8776
06:42:56,718 --> 06:43:02,718
acest nume Bob, care este la poziție

8777
06:42:59,600 --> 06:43:04,558
numărul unu sau indicele unu. Deci asta e

8778
06:43:02,718 --> 06:43:08,000
ceva care împiedică oamenii este că

8779
06:43:04,558 --> 06:43:11,040
chiar incepe

8780
06:43:08,000 --> 06:43:12,958
începe de la zero

8781
06:43:11,040 --> 06:43:18,040
ceea ce este cu adevărat important de înțeles

8782
06:43:12,958 --> 06:43:18,040
este că pozițiile încep de la zero.

8783
06:43:18,558 --> 06:43:23,680
De ce este asta? E o întrebare bună.

8784
06:43:21,920 --> 06:43:26,160
Adică

8785
06:43:23,680 --> 06:43:29,920
diferite atât de atât de diferite limbi

8786
06:43:26,160 --> 06:43:32,160
trata asta diferit. um,

8787
06:43:29,920 --> 06:43:36,798
sunt mai multe motive istorice ca a fost

8788
06:43:32,160 --> 06:43:40,240
creat astfel. Uh, dar cred că este

8789
06:43:36,798 --> 06:43:42,878
pe baza ta

8790
06:43:40,240 --> 06:43:44,718
Gândiți-vă la asta ca la cât de departe în

8791
06:43:42,878 --> 06:43:46,400
lista esti. Deci, dacă ești în

8792
06:43:44,718 --> 06:43:49,280
început, asta înseamnă că practic ești

8793
06:43:46,400 --> 06:43:50,400
la um poziţia zero pentru că tu

8794
06:43:49,280 --> 06:43:53,200
nu am făcut niciun progres ca

8795
06:43:50,400 --> 06:43:56,360
parcurgând lista. Cred că asta a fost

8796
06:43:53,200 --> 06:43:56,360
intuitia.

8797
06:43:57,040 --> 06:44:01,200
Oh da. care este cam ceea ce spune Tim

8798
06:43:58,878 --> 06:44:02,878
este ca da dacă ești chiar la capăt

8799
06:44:01,200 --> 06:44:04,638
începutul listei în care vă aflați

8800
06:44:02,878 --> 06:44:06,240
zero pentru că nu ai făcut niciun tu

8801
06:44:04,638 --> 06:44:08,638
nu au făcut niciun progres înainte în

8802
06:44:06,240 --> 06:44:12,520
traversând deci parcă ai fi la pas

8803
06:44:08,638 --> 06:44:12,520
zero esti la inceput

8804
06:44:17,120 --> 06:44:22,718
bine, dar bine, în afară de motivul pentru care a fost

8805
06:44:20,638 --> 06:44:26,080
asa are sens ca asta

8806
06:44:22,718 --> 06:44:27,920
primul ca ceea ce spun este

8807
06:44:26,080 --> 06:44:29,680
pozitia zero este primul element,

8808
06:44:27,920 --> 06:44:31,360
poziția unu este al doilea element,

8809
06:44:29,680 --> 06:44:33,520
poziția doi este al treilea element și

8810
06:44:31,360 --> 06:44:37,120
mai departe și mai departe.

8811
06:44:33,520 --> 06:44:39,120
Așa funcționează în Python.

8812
06:44:37,120 --> 06:44:40,638
Bine.

8813
06:44:39,120 --> 06:44:43,200
Acum,

8814
06:44:40,638 --> 06:44:45,280
ceea ce vă spun sunt poziţiile dacă

8815
06:44:43,200 --> 06:44:47,280
trebuia să-l vezi mergând de la stânga la dreapta.

8816
06:44:45,280 --> 06:44:49,840
Deci, cu alte cuvinte, în înainte

8817
06:44:47,280 --> 06:44:52,878
direcție, pornim de la zero și urcăm

8818
06:44:49,840 --> 06:44:55,760
la la n minus unu în termeni de

8819
06:44:52,878 --> 06:44:58,478
pozitia. Acum, ce este de fapt

8820
06:44:55,760 --> 06:45:02,320
convenabil este și pozițiile pot fi

8821
06:44:58,478 --> 06:45:05,760
indexate din spate în față, adică ei

8822
06:45:02,320 --> 06:45:08,718
poate fi, de asemenea, indexat mergând în acest fel.

8823
06:45:05,760 --> 06:45:14,400
Și ceea ce este cu adevărat frumos este ultimul

8824
06:45:08,718 --> 06:45:16,478
elementul începe la poziția minus unu.

8825
06:45:14,400 --> 06:45:19,040
Ultimul element din dreapta

8826
06:45:16,478 --> 06:45:22,080
începe la minus1 și apoi merge tot

8827
06:45:19,040 --> 06:45:24,478
drum până la minus n.

8828
06:45:22,080 --> 06:45:26,400
Bine, acum e chiar convenabil

8829
06:45:24,478 --> 06:45:28,718
pentru că dacă vrem să accesăm foarte

8830
06:45:26,400 --> 06:45:30,798
ultimul element, nu trebuie să știu cum

8831
06:45:28,718 --> 06:45:34,958
mare este lista. Trebuie doar să accesez

8832
06:45:30,798 --> 06:45:38,638
pozitia minus unu. Asta garantează

8833
06:45:34,958 --> 06:45:40,958
pentru a accesa chiar ultimul element. The

8834
06:45:38,638 --> 06:45:42,958
minus o poziție este ultima

8835
06:45:40,958 --> 06:45:45,360
element.

8836
06:45:42,958 --> 06:45:48,320
Și apoi, așa că acesta este ultimul

8837
06:45:45,360 --> 06:45:51,200
element. Acesta este penul ultimul,

8838
06:45:48,320 --> 06:45:53,280
a treia până la ultimul, a patra până la ultimul, și mai departe

8839
06:45:51,200 --> 06:45:57,920
și mai departe. Și atunci când ajungi

8840
06:45:53,280 --> 06:45:59,600
partea din față, este minus n, care este ca

8841
06:45:57,920 --> 06:46:03,360
cel

8842
06:45:59,600 --> 06:46:05,280
uh numărul de elemente din listă minus.

8843
06:46:03,360 --> 06:46:06,958
Deci, în acest caz, minus 6 este exact

8844
06:46:05,280 --> 06:46:08,478
începutul.

8845
06:46:06,958 --> 06:46:10,000
Acum, de ce naiba ne pasă

8846
06:46:08,478 --> 06:46:11,360
despre poziția negativă? E pentru asta

8847
06:46:10,000 --> 06:46:14,400
motivul exact.

8848
06:46:11,360 --> 06:46:17,200
putem um ne putem gândi la

8849
06:46:14,400 --> 06:46:19,440
pozițiile de la sfârșitul listei mergând

8850
06:46:17,200 --> 06:46:21,600
înapoi care este foarte puternic ca și cum

8851
06:46:19,440 --> 06:46:23,840
Vreau să accesez lucrurile chiar de la început

8852
06:46:21,600 --> 06:46:25,440
sfârşit, nu trebuie să ştiu exact cum

8853
06:46:23,840 --> 06:46:27,680
multe sunt pe care trebuie doar să le știu minus

8854
06:46:25,440 --> 06:46:31,600
unul este sfârșitul minus doi este al doilea

8855
06:46:27,680 --> 06:46:35,400
to last minus3 este al treilea din ultimul um

8856
06:46:31,600 --> 06:46:35,400
ceea ce este destul de convenabil

8857
06:46:36,638 --> 06:46:40,160
bine

8858
06:46:38,240 --> 06:46:43,360
la fel și asta are sens în ceea ce privește negativ

8859
06:46:40,160 --> 06:46:46,160
index index. Este indicele negativ

8860
06:46:43,360 --> 06:46:49,600
mergând de la dreapta la stânga. Este de la

8861
06:46:46,160 --> 06:46:51,520
înapoi în față. Minus unu este ultimul

8862
06:46:49,600 --> 06:46:53,920
element.

8863
06:46:51,520 --> 06:46:57,440
Și apoi treci pen-ultimul, al treilea

8864
06:46:53,920 --> 06:47:00,440
ultimul, nu? Și asta este minus 2, -3,

8865
06:46:57,440 --> 06:47:00,440
-4.

8866
06:47:06,160 --> 06:47:10,240
Deci de la dreapta la stânga. Da. Corect.

8867
06:47:08,160 --> 06:47:12,240
De la dreapta la stânga. minus 6 este de fapt

8868
06:47:10,240 --> 06:47:14,958
primul element

8869
06:47:12,240 --> 06:47:16,798
pentru că e şase înapoi de la capăt care

8870
06:47:14,958 --> 06:47:20,200
este f care este partea din față. Există

8871
06:47:16,798 --> 06:47:20,200
doar șase elemente.

8872
06:47:22,478 --> 06:47:25,478
Da.

8873
06:47:28,718 --> 06:47:33,120
Deci, există vreo întrebare despre asta

8874
06:47:30,558 --> 06:47:35,360
foarte important să înțelegi cu adevărat

8875
06:47:33,120 --> 06:47:37,840
important de înțeles pentru că asta este

8876
06:47:35,360 --> 06:47:42,120
cum o să tăiem și să accesăm

8877
06:47:37,840 --> 06:47:42,120
datele se bazează pe aceste poziții.

8878
06:47:45,840 --> 06:47:49,440
Există o sintaxă pentru a obține numărul de

8879
06:47:47,360 --> 06:47:55,760
elemente dintr-o listă? Da, este lungimea

8880
06:47:49,440 --> 06:47:58,478
functie care este len. Deci lungimea listei

8881
06:47:55,760 --> 06:48:01,280
ți-ar da numărul de elemente

8882
06:47:58,478 --> 06:48:03,600
care în acest caz este șase. Deci în

8883
06:48:01,280 --> 06:48:06,400
funcția de lungime vă oferă câte

8884
06:48:03,600 --> 06:48:11,040
elementele sunt în listă.

8885
06:48:06,400 --> 06:48:14,040
len sau lungime. Deci tipul asta

8886
06:48:11,040 --> 06:48:14,040
funcția.

8887
06:48:17,200 --> 06:48:22,080
Uh, când numărați înapoi?

8888
06:48:19,520 --> 06:48:24,160
De obicei numărați înapoi când

8889
06:48:22,080 --> 06:48:26,798
vrei să știi ce este la sfârșit

8890
06:48:24,160 --> 06:48:29,280
lista. Deci când îți pasă doar ce are

8891
06:48:26,798 --> 06:48:31,040
a fost adăugat la sfârșit și doriți

8892
06:48:29,280 --> 06:48:32,878
poate vrei să iei ultimele cinci

8893
06:48:31,040 --> 06:48:35,680
elemente.

8894
06:48:32,878 --> 06:48:37,520
Deci tăiați înapoi de la

8895
06:48:35,680 --> 06:48:39,600
sfârşitul.

8896
06:48:37,520 --> 06:48:42,160
Asta poate fi de folos ca și tu

8897
06:48:39,600 --> 06:48:44,718
Vreau să știu așa cum imaginează-ți o listă

8898
06:48:42,160 --> 06:48:47,360
ținând ordinele tale

8899
06:48:44,718 --> 06:48:49,440
și așa vrei ultimele cinci comenzi. Deci

8900
06:48:47,360 --> 06:48:52,958
poți doar să mergi din spate și să pleci

8901
06:48:49,440 --> 06:48:55,520
spre fata. Min -1, -2, -3, -4,

8902
06:48:52,958 --> 06:48:58,400
-5

8903
06:48:55,520 --> 06:48:59,920
ar fi ultimele cinci comenzi. Există

8904
06:48:58,400 --> 06:49:02,638
vor fi multe scenarii unde ne dorim

8905
06:48:59,920 --> 06:49:05,760
a socoti de la sfarsit.

8906
06:49:02,638 --> 06:49:07,360
atunci când manipulăm datele

8907
06:49:05,760 --> 06:49:10,958
mai târziu când suntem când lucrăm

8908
06:49:07,360 --> 06:49:13,520
cu seturi mai mari de date

8909
06:49:10,958 --> 06:49:15,520
ceva ca o matrice, este

8910
06:49:13,520 --> 06:49:19,040
va fi util de apucat ca ultimul

8911
06:49:15,520 --> 06:49:21,680
cinci rânduri, ultimele 10 rânduri.

8912
06:49:19,040 --> 06:49:23,840
Deci a merge de la final are mai mult sens.

8913
06:49:21,680 --> 06:49:27,600
Deci vă imaginați dacă avem ca un mai mare

8914
06:49:23,840 --> 06:49:30,478
matrice de date um poate vrem să tăiem

8915
06:49:27,600 --> 06:49:32,558
scoatem aceste ultime 10 rânduri, caz în care noi

8916
06:49:30,478 --> 06:49:35,040
vrei să numere de la minus ca

8917
06:49:32,558 --> 06:49:39,320
ultimul rând este minus unu și vrem să mergem

8918
06:49:35,040 --> 06:49:39,320
înapoi spre față.

8919
06:49:43,120 --> 06:49:47,760
Poți sorta? Da, poți sorta. Uh eu

8920
06:49:46,400 --> 06:49:50,878
Voi avea un exemplu în acest sens într-un

8921
06:49:47,760 --> 06:49:53,040
al doilea. Da, poți sorta.

8922
06:49:50,878 --> 06:49:54,958
Există o funcție de sortare încorporată

8923
06:49:53,040 --> 06:49:57,840
Python care vă va permite să sortați

8924
06:49:54,958 --> 06:50:02,120
date dintr-o listă. Da,

8925
06:49:57,840 --> 06:50:02,120
există o funcție încorporată pentru asta.

8926
06:50:07,760 --> 06:50:13,920
Bine. Ceea ce am vrut să fac este să-ți arăt

8927
06:50:11,680 --> 06:50:18,160
baieti un exemplu de accesare a elementelor

8928
06:50:13,920 --> 06:50:20,638
din lista. Deci, presupunând că știm

8929
06:50:18,160 --> 06:50:24,958
poziție care este acel indice tot ce avem

8930
06:50:20,638 --> 06:50:26,718
de făcut este să folosiți paranteze pentru a accesa elementele din

8931
06:50:24,958 --> 06:50:29,280
o listă. Deci imaginați-vă că avem această listă

8932
06:50:26,718 --> 06:50:33,200
numite fructe care are niste snur in

8933
06:50:29,280 --> 06:50:36,478
măr banană cireș mango și vrem

8934
06:50:33,200 --> 06:50:40,478
pentru a accesa primul element. Deci asta este

8935
06:50:36,478 --> 06:50:43,280
doar acest cod aici fructe paranteză zero.

8936
06:50:40,478 --> 06:50:45,040
Deci paranteza îi spune interpretului:

8937
06:50:43,280 --> 06:50:47,520
Hei, vreau să accesez ceva în interior

8938
06:50:45,040 --> 06:50:49,520
această listă. Și atunci tot ce trebuie să facem este

8939
06:50:47,520 --> 06:50:53,200
da-i pozitia pe care o dorim

8940
06:50:49,520 --> 06:50:54,718
accesul. Deci aceasta este poziția zero, care

8941
06:50:53,200 --> 06:50:58,798
va fi primul element. Aceasta

8942
06:50:54,718 --> 06:51:02,638
ar recupera primul element. Acum,

8943
06:50:58,798 --> 06:51:05,120
nu îl îndepărtează. Este doar

8944
06:51:02,638 --> 06:51:07,760
accesând-o astfel încât să putem vedea ce anume

8945
06:51:05,120 --> 06:51:10,478
este. Deci, de fapt ne va oferi o

8946
06:51:07,760 --> 06:51:12,478
copie a valorii respective sub

8947
06:51:10,478 --> 06:51:13,600
glugă. Practic, o copie a acestuia. Nu este

8948
06:51:12,478 --> 06:51:16,240
mergi la permanent. Nu se va întâmpla

8949
06:51:13,600 --> 06:51:19,360
șterge-l. Nu o va elimina.

8950
06:51:16,240 --> 06:51:22,080
Ne va da o

8951
06:51:19,360 --> 06:51:24,400
copie a ceea ce este în poziţia zero. În

8952
06:51:22,080 --> 06:51:27,120
cazul acesta, măr.

8953
06:51:24,400 --> 06:51:29,440
Acum, dacă punem pe poziţia doi în asta

8954
06:51:27,120 --> 06:51:34,718
paranteză care ar trebui să fie amintiți-vă

8955
06:51:29,440 --> 06:51:37,120
indexarea este 0 1 2 3

8956
06:51:34,718 --> 06:51:40,400
pentru că sunt patru articole. Deci ultimul

8957
06:51:37,120 --> 06:51:43,280
elementul este n minus unu care este trei.

8958
06:51:40,400 --> 06:51:45,120
Deci elementul care se află în poziția a doua este

8959
06:51:43,280 --> 06:51:48,718
va fi cireș. Deci asta ar trebui

8960
06:51:45,120 --> 06:51:52,320
returnează șirul de cireș.

8961
06:51:48,718 --> 06:51:55,040
Bine. Deci folosim folosim întotdeauna acest tip

8962
06:51:52,320 --> 06:51:57,120
de sintaxă

8963
06:51:55,040 --> 06:52:00,798
poziție

8964
06:51:57,120 --> 06:52:03,520
pentru a accesa elementul care se află la acel

8965
06:52:00,798 --> 06:52:06,798
poziție.

8966
06:52:03,520 --> 06:52:09,360
Bine, destul de simplu. Și ce este cu adevărat

8967
06:52:06,798 --> 06:52:12,878
frumos apropo despre asta este

8968
06:52:09,360 --> 06:52:15,600
exact același lucru funcționează pentru tupili

8969
06:52:12,878 --> 06:52:16,798
pentru că și tupilele sunt comandate. Deci

8970
06:52:15,600 --> 06:52:19,120
o să vedem asta când vom intra

8971
06:52:16,798 --> 06:52:21,120
tupilele. Dar exact aceleași lucruri funcționează

8972
06:52:19,120 --> 06:52:22,798
unde un tupol are un prim element, a

8973
06:52:21,120 --> 06:52:25,840
al doilea articol, al treilea care sunt index

8974
06:52:22,798 --> 06:52:27,600
zero, 1, doi, trei. Și putem accesa

8975
06:52:25,840 --> 06:52:31,760
lucrurile exact în același mod. Deci putem

8976
06:52:27,600 --> 06:52:36,478
accesează un tupol și prin poziția sa.

8977
06:52:31,760 --> 06:52:38,638
Exact același lucru se va întâmpla în poziție.

8978
06:52:36,478 --> 06:52:42,400
Deci putem obține primul articol al unui tupol

8979
06:52:38,638 --> 06:52:45,600
cu uh făcând um zero și putem

8980
06:52:42,400 --> 06:52:49,240
obține ultimul făcând minus unu.

8981
06:52:45,600 --> 06:52:49,240
și mai departe și mai departe.

8982
06:52:55,040 --> 06:52:59,240
Aveți întrebări despre accesare?

8983
06:53:01,600 --> 06:53:06,638
Putem obține o poziție bazată pe valoare? Da.

8984
06:53:04,400 --> 06:53:08,958
Deci aceasta este o funcție specială numită

8985
06:53:06,638 --> 06:53:16,400
index.

8986
06:53:08,958 --> 06:53:21,320
Deci, dacă vă place indexul de puncte din listă

8987
06:53:16,400 --> 06:53:21,320
și apoi treci o valoare ca mărul,

8988
06:53:21,920 --> 06:53:26,638
aceasta v-ar returna indexul de

8989
06:53:24,080 --> 06:53:28,478
prima apariție. Nu fiecare

8990
06:53:26,638 --> 06:53:30,638
apariția, dar doar prima. Asa ca

8991
06:53:28,478 --> 06:53:33,280
pentru că am putea avea mai multe copii ale

8992
06:53:30,638 --> 06:53:35,840
Apple în lista noastră, dar prima dată am

8993
06:53:33,280 --> 06:53:39,840
dau peste Apple, asta se va întoarce

8994
06:53:35,840 --> 06:53:43,760
acest lucru ar returna uh zero pentru că Apple

8995
06:53:39,840 --> 06:53:46,798
apare la indicele zero.

8996
06:53:43,760 --> 06:53:50,878
Deci funcția index

8997
06:53:46,798 --> 06:53:52,400
uh ar returna indexul

8998
06:53:50,878 --> 06:53:55,400
care este care este același cuvânt ca

8999
06:53:52,400 --> 06:53:55,400
poziție.

9000
06:53:58,000 --> 06:54:01,000
Bine.

9001
06:54:01,040 --> 06:54:05,760
În regulă. Alte intrebari? Putem

9002
06:54:03,360 --> 06:54:07,040
Cred că ceea ce vom face este să putem lua

9003
06:54:05,760 --> 06:54:08,400
dacă dacă nu există alte întrebări noi

9004
06:54:07,040 --> 06:54:11,200
pot lua o scurtă pauză și apoi veni

9005
06:54:08,400 --> 06:54:15,320
înapoi și continuă.

9006
06:54:11,200 --> 06:54:15,320
Vreau să vorbesc despre feliere.

9007
06:54:22,878 --> 06:54:29,798
Nu, nu ar returna niciunul. Ar fi

9008
06:54:25,280 --> 06:54:29,798
returnează nul. Practic nici unul

9009
06:54:36,958 --> 06:54:42,478
deoarece bretele de închidere cu deschidere sunt pătrate

9010
06:54:40,240 --> 06:54:44,958
dacă este o listă. Nu, este de fapt

9011
06:54:42,478 --> 06:54:47,920
la fel ca un tupol. În ceea ce privește

9012
06:54:44,958 --> 06:54:50,920
accesarea e la fel

9013
06:54:47,920 --> 06:54:50,920
uh

9014
06:54:51,040 --> 06:54:56,638
este în ceea ce privește accesul este

9015
06:54:52,958 --> 06:54:59,760
la fel. Hm, pentru crearea unei liste, da, asta

9016
06:54:56,638 --> 06:55:02,400
este paranteze pătrate. Aceasta creează o listă.

9017
06:54:59,760 --> 06:55:04,478
Parantezele creează întotdeauna o listă. Pentru

9018
06:55:02,400 --> 06:55:07,200
elemente de acces, aceasta este la fel ca

9019
06:55:04,478 --> 06:55:09,040
un tupol. Parantezele pătrate pentru

9020
06:55:07,200 --> 06:55:12,000
accesând.

9021
06:55:09,040 --> 06:55:15,200
De fapt, în majoritatea lucrurilor din Python, este

9022
06:55:12,000 --> 06:55:18,080
la fel și în cazul în care accesăm date folosind

9023
06:55:15,200 --> 06:55:21,600
parantezele pătrate. Un dicționar, la fel

9024
06:55:18,080 --> 06:55:23,440
lucru. Accesăm cheile utilizând

9025
06:55:21,600 --> 06:55:25,760
paranteze pătrate.

9026
06:55:23,440 --> 06:55:30,120
Deci parantezele pătrate în Python sunt este

9027
06:55:25,760 --> 06:55:30,120
practic ca un operator de acces.

9028
06:55:31,680 --> 06:55:36,638
Nu, așa că list.index nu funcționează doar

9029
06:55:34,718 --> 06:55:38,958
pentru primul articol. Ceea ce spun eu este

9030
06:55:36,638 --> 06:55:41,120
puteți avea liste care au mai multe

9031
06:55:38,958 --> 06:55:42,638
Eu zic că se întoarce la tine prima

9032
06:55:41,120 --> 06:55:44,478
apariție,

9033
06:55:42,638 --> 06:55:46,958
indicele primei apariții

9034
06:55:44,478 --> 06:55:49,840
pentru că am putea avea o copie a Apple

9035
06:55:46,958 --> 06:55:51,200
mai târziu în listă, nu? Deci există

9036
06:55:49,840 --> 06:55:53,440
nimic care să ne împiedice să avem o

9037
06:55:51,200 --> 06:55:55,680
duplicat. Deci, am putea avea altul

9038
06:55:53,440 --> 06:55:57,920
măr aici jos. Să zicem că am avut

9039
06:55:55,680 --> 06:56:00,478
încă un măr la sfârșitul listei. Dacă

9040
06:55:57,920 --> 06:56:03,120
Am făcut list.index Apple, doar merge

9041
06:56:00,478 --> 06:56:04,878
să-mi întoarcă chiar și pe acesta primul

9042
06:56:03,120 --> 06:56:07,760
deși există o altă copie a acestuia în

9043
06:56:04,878 --> 06:56:09,600
lista.

9044
06:56:07,760 --> 06:56:12,080
Deci, se întoarce la tine doar primul

9045
06:56:09,600 --> 06:56:13,280
apariția.

9046
06:56:12,080 --> 06:56:15,520
Dar, știi, nimic nu se oprește

9047
06:56:13,280 --> 06:56:18,080
eu din doing list.index de banane sau

9048
06:56:15,520 --> 06:56:20,478
cireș sau orice altceva.

9049
06:56:18,080 --> 06:56:23,200
Există tipuri de date pentru toți

9050
06:56:20,478 --> 06:56:25,200
Caractere Unicode? Hm, cred că există

9051
06:56:23,200 --> 06:56:28,798
Da, cred că există șiruri speciale

9052
06:56:25,200 --> 06:56:32,080
poți face ca asta să facă Unicode,

9053
06:56:28,798 --> 06:56:35,680
dar sincer nu sunt 100% sigur.

9054
06:56:32,080 --> 06:56:37,600
Aș cerceta asta. Eu chiar nu

9055
06:56:35,680 --> 06:56:39,600
stiu. Cred că poți face asta cu

9056
06:56:37,600 --> 06:56:42,798
corzi,

9057
06:56:39,600 --> 06:56:43,840
corzi speciale.

9058
06:56:42,798 --> 06:56:44,958
Da, nu cred că există nimic

9059
06:56:43,840 --> 06:56:48,638
parcă nu cred că există nimic

9060
06:56:44,958 --> 06:56:51,120
inerent special în privința că Python

9061
06:56:48,638 --> 06:56:54,478
nu se poate descurca. Doar tu ești uneori

9062
06:56:51,120 --> 06:56:56,320
trebuie să-i placă personajele de evadare

9063
06:56:54,478 --> 06:57:00,240
uh

9064
06:56:56,320 --> 06:57:02,638
pentru a le distinge. Dar

9065
06:57:00,240 --> 06:57:07,200
da.

9066
06:57:02,638 --> 06:57:12,400
În regulă. Revenind la exemplul nostru,

9067
06:57:07,200 --> 06:57:14,718
um, ne-am întors la asta

9068
06:57:12,400 --> 06:57:16,718
lista de fructe.

9069
06:57:14,718 --> 06:57:18,320
Putem accesa lucrurile de la final. Deci

9070
06:57:16,718 --> 06:57:21,040
iată un exemplu în care folosim

9071
06:57:18,320 --> 06:57:24,718
indice negativ, nu? Deci minus unu

9072
06:57:21,040 --> 06:57:26,718
apucă elementul care este la ultimul uh

9073
06:57:24,718 --> 06:57:29,440
acesta este ultimul membru al listei. Deci

9074
06:57:26,718 --> 06:57:32,798
mango minus3

9075
06:57:29,440 --> 06:57:35,280
um ar fi al treilea din ultimul,

9076
06:57:32,798 --> 06:57:39,360
care va fi banana.

9077
06:57:35,280 --> 06:57:42,400
Deci indice negativ foarte la îndemână de accesat

9078
06:57:39,360 --> 06:57:45,760
de la sfârșitul listei mergând înapoi.

9079
06:57:42,400 --> 06:57:49,798
Hm destul de util acolo.

9080
06:57:45,760 --> 06:57:49,798
Există un exemplu în acest sens.

9081
06:57:51,840 --> 06:57:54,840
În regulă.

9082
06:57:56,798 --> 06:58:00,638
În regulă. Să vorbim despre feliere.

9083
06:57:58,478 --> 06:58:04,478
Bine. Să vorbim despre feliere. Deci,

9084
06:58:00,638 --> 06:58:08,080
tăierea ne permite să extragem un subset de

9085
06:58:04,478 --> 06:58:11,840
elemente dintr-o listă folosind un interval specific

9086
06:58:08,080 --> 06:58:13,360
a indicilor. Și astfel sintaxa de făcut

9087
06:58:11,840 --> 06:58:16,798
felierea

9088
06:58:13,360 --> 06:58:22,798
va folosi din nou parantezele noastre,

9089
06:58:16,798 --> 06:58:24,798
dar folosim două puncte pentru a specifica unde

9090
06:58:22,798 --> 06:58:27,680
începem și ne oprim

9091
06:58:24,798 --> 06:58:30,798
pozitii. Și nu numai atât, ci și noi

9092
06:58:27,680 --> 06:58:33,440
folosiți și două puncte pentru a semnala câți

9093
06:58:30,798 --> 06:58:35,680
vrem să trecem pe lângă. Așa vrem să facem

9094
06:58:33,440 --> 06:58:37,920
fiecare altul, caz în care am păși

9095
06:58:35,680 --> 06:58:41,120
cu doi. Vrei să faci fiecare treime

9096
06:58:37,920 --> 06:58:44,478
element care ar fi pas cu trei? Deci

9097
06:58:41,120 --> 06:58:48,000
cele mai multe feliere va urma asta

9098
06:58:44,478 --> 06:58:52,160
un fel de sintaxă în care facem o listă și

9099
06:58:48,000 --> 06:58:54,878
apoi facem ca un index de start și apoi

9100
06:58:52,160 --> 06:58:57,760
facem colon

9101
06:58:54,878 --> 06:59:02,558
și apoi oprim indexul

9102
06:58:57,760 --> 06:59:06,160
și apoi facem un pas de colon. Acum

9103
06:59:02,558 --> 06:59:09,120
ceea ce vei vedea este că pasul

9104
06:59:06,160 --> 06:59:11,840
implicit la o dimensiune a pasului de un sens

9105
06:59:09,120 --> 06:59:15,440
luăm fiecare element între ele

9106
06:59:11,840 --> 06:59:18,320
pornirea si oprirea. Hm, deci dimensiunea pasului

9107
06:59:15,440 --> 06:59:20,958
unul este implicit. Deci noi de fapt

9108
06:59:18,320 --> 06:59:23,760
de obicei, nu va include dimensiunea pasului

9109
06:59:20,958 --> 06:59:25,760
cu excepția cazului în care vrem în mod special să obținem fiecare

9110
06:59:23,760 --> 06:59:27,840
altele, care ar fi un pas de doi

9111
06:59:25,760 --> 06:59:31,280
sau la fiecare treime sau la fiecare patra sau fiecare

9112
06:59:27,840 --> 06:59:33,600
al cincilea. Hm, de obicei omitem asta

9113
06:59:31,280 --> 06:59:35,280
dimensiunea pasului și doar avem doar o

9114
06:59:33,600 --> 06:59:39,680
pornire și o oprire ca parte a noastră

9115
06:59:35,280 --> 06:59:43,040
felie. Hm și ce face asta este

9116
06:59:39,680 --> 06:59:47,600
îi spune interpretului să acceseze

9117
06:59:43,040 --> 06:59:51,920
totul între acest început și oprire.

9118
06:59:47,600 --> 06:59:54,160
Deci cu o captură care este foarte

9119
06:59:51,920 --> 06:59:57,840
captură importantă care împiedică pe toată lumea

9120
06:59:54,160 --> 07:00:01,600
care este că Python um este foarte enervant

9121
06:59:57,840 --> 07:00:04,160
și că atunci când îl tăiați

9122
07:00:01,600 --> 07:00:09,040
vă permite să includeți începutul

9123
07:00:04,160 --> 07:00:10,958
index. Deci dacă începem de undeva

9124
07:00:09,040 --> 07:00:14,798
va garanta că felia va

9125
07:00:10,958 --> 07:00:17,280
include asta, dar nu va include

9126
07:00:14,798 --> 07:00:20,718
indice de oprire. va face totul

9127
07:00:17,280 --> 07:00:23,280
între acolo până la indicele stop dar

9128
07:00:20,718 --> 07:00:26,000
fără a include de fapt ceea ce este vorba

9129
07:00:23,280 --> 07:00:28,798
pozitia de oprire.

9130
07:00:26,000 --> 07:00:33,280
Deci, de exemplu,

9131
07:00:28,798 --> 07:00:36,878
această felie pe care o vezi pe ecran

9132
07:00:33,280 --> 07:00:39,600
este o felie care ar începe de la

9133
07:00:36,878 --> 07:00:42,160
pozitia doi

9134
07:00:39,600 --> 07:00:44,798
pentru că ține minte, lasă-mă să desenez asta

9135
07:00:42,160 --> 07:00:47,040
afară. Aceasta este poziția zero. Aceasta este

9136
07:00:44,798 --> 07:00:51,520
pozitia unu, pozitia a doua, pozitia

9137
07:00:47,040 --> 07:00:54,718
trei, pozițiile patru, cinci și șase. Şi

9138
07:00:51,520 --> 07:00:56,798
deci aceasta este o felie care ar începe de la

9139
07:00:54,718 --> 07:00:59,840
pozitia doi

9140
07:00:56,798 --> 07:01:02,160
este începutul nostru.

9141
07:00:59,840 --> 07:01:04,798
Și înseamnă că suntem garantați să obținem 34

9142
07:01:02,160 --> 07:01:08,240
pentru că de acolo începem. Dar cel

9143
07:01:04,798 --> 07:01:12,478
oprire pentru că această felie ar trebui să fie

9144
07:01:08,240 --> 07:01:16,320
aici. Aceasta este oprirea noastră pentru că suntem

9145
07:01:12,478 --> 07:01:19,120
va include totul între ele

9146
07:01:16,320 --> 07:01:23,280
acolo. Vom include toate

9147
07:01:19,120 --> 07:01:27,200
aceasta această felie ca parte a uh nostru

9148
07:01:23,280 --> 07:01:29,520
la ce putem accesa. Așa ar fi

9149
07:01:27,200 --> 07:01:33,440
pozițiile 2, trei și patru. Deci asta

9150
07:01:29,520 --> 07:01:37,120
felia ar fi, practic, așa

9151
07:01:33,440 --> 07:01:39,680
lista. Începea la două și mergea la

9152
07:01:37,120 --> 07:01:41,840
cinci.

9153
07:01:39,680 --> 07:01:43,440
Și atunci din punct de vedere tehnic ar fi un pas

9154
07:01:41,840 --> 07:01:45,440
mărimea unuia, dar nu uitați că nu

9155
07:01:43,440 --> 07:01:51,718
chiar trebuie să includ asta. Deci asta

9156
07:01:45,440 --> 07:01:51,718
ar fi cu adevărat lista um doi până la cinci.

9157
07:01:53,760 --> 07:01:58,320
Asta se simte enervant. Da, este

9158
07:01:55,840 --> 07:02:01,360
pentru că ei trebuie să știi unde

9159
07:01:58,320 --> 07:02:06,638
porniți și opriți. Și așa au ales Python

9160
07:02:01,360 --> 07:02:09,840
alege să fie um să nu includă

9161
07:02:06,638 --> 07:02:14,000
indicele de oprire, dar acesta include

9162
07:02:09,840 --> 07:02:15,600
indice de pornire. Hm și și asta e doar un

9163
07:02:14,000 --> 07:02:18,600
alegere. Aceasta este o alegere de design a

9164
07:02:15,600 --> 07:02:18,600
Python.

9165
07:02:19,360 --> 07:02:29,920
Bine. Deci colonul ne oferă felia.

9166
07:02:22,718 --> 07:02:31,920
Um, deci dacă vezi dacă vezi uh uh dacă

9167
07:02:29,920 --> 07:02:35,200
vezi tu

9168
07:02:31,920 --> 07:02:37,280
un colon între paranteze, că

9169
07:02:35,200 --> 07:02:40,080
semnale de care prindeți o colecție

9170
07:02:37,280 --> 07:02:43,280
articole. Deci noi Deci asta de fapt

9171
07:02:40,080 --> 07:02:49,040
returnează o listă mai mică. Aceasta returnează a

9172
07:02:43,280 --> 07:02:51,280
lista cu 34, 20 și 80. Deci, este un

9173
07:02:49,040 --> 07:02:53,680
slice înseamnă că obținem mai multe articole

9174
07:02:51,280 --> 07:02:56,920
mai degrabă decât doar un singur articol de la

9175
07:02:53,680 --> 07:02:56,920
selecția.

9176
07:02:57,360 --> 07:03:01,440
Nu, 54 nu ar face limita. 67

9177
07:02:59,600 --> 07:03:03,440
nici nu face tăietură pentru că

9178
07:03:01,440 --> 07:03:06,440
amintiți-vă că nu includem oprirea

9179
07:03:03,440 --> 07:03:06,440
index.

9180
07:03:08,878 --> 07:03:12,798
Poți face doi până la patru plus unu? Da,

9181
07:03:11,040 --> 07:03:14,798
poti face aritmetica acolo si

9182
07:03:12,798 --> 07:03:17,920
Python va evalua aritmetica

9183
07:03:14,798 --> 07:03:20,878
mai întâi. Deci va face 4 1 mai întâi și

9184
07:03:17,920 --> 07:03:24,600
stabiliți că este cinci.

9185
07:03:20,878 --> 07:03:24,600
Da, poți face asta.

9186
07:03:31,680 --> 07:03:39,600
Bine. Deci înainte

9187
07:03:34,878 --> 07:03:42,240
înainte să merg mai departe, uh face felierea

9188
07:03:39,600 --> 07:03:45,120
ideea are sens? Se apucă o

9189
07:03:42,240 --> 07:03:49,558
colecție de articole din lista mai mare

9190
07:03:45,120 --> 07:03:49,558
și l-am configurat cu această sintaxă.

9191
07:03:52,000 --> 07:03:55,440
Ce crezi? ce crezi

9192
07:03:53,440 --> 07:03:58,600
0 până la șase s-ar întoarce? Ce ar fi

9193
07:03:55,440 --> 07:03:58,600
presupunerea ta?

9194
07:04:09,440 --> 07:04:16,080
Totuși, ce este inclus în felie?

9195
07:04:11,120 --> 07:04:17,920
Nu este doar 67. Dacă mergi de la 0 la șase,

9196
07:04:16,080 --> 07:04:20,320
cati? Ca, ar trebui să primești

9197
07:04:17,920 --> 07:04:22,878
mai mult decât atât. Da, ar trebui să primești

9198
07:04:20,320 --> 07:04:26,320
totul, nu? Exact. Ar trebui

9199
07:04:22,878 --> 07:04:29,520
obține toate aceste numere până la

9200
07:04:26,320 --> 07:04:32,400
uh 54. Nu ai include 54. Deci tu

9201
07:04:29,520 --> 07:04:36,280
ai obține 76, ai obține 12, ai obține 34,

9202
07:04:32,400 --> 07:04:36,280
20, 80 și 67.

9203
07:04:41,360 --> 07:04:45,320
Da, este adevărat.

9204
07:04:49,680 --> 07:04:57,440
Da. Da. Deci relevanța pasului este

9205
07:04:52,798 --> 07:05:00,958
ca putem asa din felia noastra sa putem

9206
07:04:57,440 --> 07:05:04,000
alegeți dimensiunea pasului nostru de câte

9207
07:05:00,958 --> 07:05:06,878
element precum cât de mult vrem să sărim

9208
07:05:04,000 --> 07:05:09,120
poziții în acea felie. Deci pas de

9209
07:05:06,878 --> 07:05:13,840
unul care este implicit înseamnă că obținem

9210
07:05:09,120 --> 07:05:15,600
fiecare poziție în care mergem creștem cu unul

9211
07:05:13,840 --> 07:05:19,280
o poziție la alta la alta la

9212
07:05:15,600 --> 07:05:21,040
următorul. Un pas de doi

9213
07:05:19,280 --> 07:05:25,040
uh

9214
07:05:21,040 --> 07:05:27,600
un pas de doi ar fi că eu mă duc

9215
07:05:25,040 --> 07:05:31,680
pentru a lua orice alt element din

9216
07:05:27,600 --> 07:05:33,680
începe. Deci un pas de doi ca și cum aș tăia felii

9217
07:05:31,680 --> 07:05:36,878
aceasta

9218
07:05:33,680 --> 07:05:39,840
și am schimbat acest lucru la un pas de doi,

9219
07:05:36,878 --> 07:05:41,920
atunci asta ar apuca doar asta și asta

9220
07:05:39,840 --> 07:05:43,920
pentru că asta ar trece peste. Ar fi

9221
07:05:41,920 --> 07:05:47,520
fă doi pași pentru a ajunge la următorul

9222
07:05:43,920 --> 07:05:49,520
element al feliei.

9223
07:05:47,520 --> 07:05:52,840
În timp ce o mărime de pas de unul va

9224
07:05:49,520 --> 07:05:52,840
apuca totul

9225
07:05:53,040 --> 07:05:57,440
pentru că va merge un index la

9226
07:05:54,638 --> 07:06:01,798
următorul. Deci, gândiți-vă la dimensiunea pasului ca

9227
07:05:57,440 --> 07:06:01,798
cate posturi crestem?

9228
07:06:05,920 --> 07:06:10,718
Da. 2 până la 7 ar include 54. Da,

9229
07:06:08,400 --> 07:06:14,680
asa e.

9230
07:06:10,718 --> 07:06:14,680
2 până la 7 ar include 54.

9231
07:06:20,240 --> 07:06:23,240
Bine.

9232
07:06:23,360 --> 07:06:30,718
În regulă. Să mai vedem câteva exemple.

9233
07:06:27,200 --> 07:06:34,160
Deci dacă avem o listă ca aceasta și noi

9234
07:06:30,718 --> 07:06:38,240
tăiați-l de la 1 la 4, rezultatul este

9235
07:06:34,160 --> 07:06:42,080
va începe cu indexul unu

9236
07:06:38,240 --> 07:06:46,478
și mergi până la indicele 4, dar nu

9237
07:06:42,080 --> 07:06:48,878
include patru. Deci indicele 4 este acest tip și

9238
07:06:46,478 --> 07:06:52,558
nu va include asta. Deci este

9239
07:06:48,878 --> 07:06:55,120
vor fi aceste trei elemente aici

9240
07:06:52,558 --> 07:06:58,958
ar fi felia noastră. Da. 20 30 40. Foarte

9241
07:06:55,120 --> 07:07:01,360
bine. Cam asta ar fi.

9242
07:06:58,958 --> 07:07:03,200
Deci este destul de util

9243
07:07:01,360 --> 07:07:06,520
pentru a putea felia. Lasă-mă să-ți arăt

9244
07:07:03,200 --> 07:07:06,520
un alt exemplu.

9245
07:07:08,558 --> 07:07:13,638
Hopa, nu ai altul. Lasă-mă să plec

9246
07:07:10,638 --> 07:07:13,638
înapoi.

9247
07:07:13,920 --> 07:07:20,320
Permiteți-mi să vă arăt un alt exemplu cu

9248
07:07:15,280 --> 07:07:25,120
aceasta. Um, deci ceea ce putem face este să putem

9249
07:07:20,320 --> 07:07:26,798
de fapt, feliați înapoi. Aşa,

9250
07:07:25,120 --> 07:07:31,400
ce faceți să vă întreb asta, băieți.

9251
07:07:26,798 --> 07:07:31,400
Ce crezi că ar fi această felie?

9252
07:07:38,400 --> 07:07:42,320
De fapt, lasă-mă să șterg asta. Lasă-mă să fac

9253
07:07:40,320 --> 07:07:45,320
minus

9254
07:07:42,320 --> 07:07:45,320
sau

9255
07:07:47,840 --> 07:07:53,440
ce crezi ca ar reveni asta?

9256
07:07:51,120 --> 07:07:56,558
Putem folosi indicele negativ uh

9257
07:07:53,440 --> 07:08:00,520
indici în feliile noastre.

9258
07:07:56,558 --> 07:08:00,520
Ce crezi că ar fi?

9259
07:08:04,160 --> 07:08:11,520
Foarte bun. 30 40 50. Deci va fi

9260
07:08:07,920 --> 07:08:13,520
du-te. Deci, amintiți-vă -4 este al patrulea din

9261
07:08:11,520 --> 07:08:15,840
ultimul. Deci asta va fi

9262
07:08:13,520 --> 07:08:19,200
minus4

9263
07:08:15,840 --> 07:08:21,200
și atunci acesta este minus unu. Deci nu suntem

9264
07:08:19,200 --> 07:08:24,400
va include minus unu. Deci ar trebui

9265
07:08:21,200 --> 07:08:26,798
fac această felie aici.

9266
07:08:24,400 --> 07:08:29,680
Asta ar trebui să fie felia. 30 40 50 ar

9267
07:08:26,798 --> 07:08:32,558
fie asta.

9268
07:08:29,680 --> 07:08:36,400
Bine. Un altul alte câteva exemple

9269
07:08:32,558 --> 07:08:38,718
Am vrut să-ți ofer că poți acționa

9270
07:08:36,400 --> 07:08:42,080
în anumite cazuri speciale poți

9271
07:08:38,718 --> 07:08:43,600
lasă de fapt de la început şi

9272
07:08:42,080 --> 07:08:45,200
opriți. Și ce ar semnala asta

9273
07:08:43,600 --> 07:08:47,920
interpret este că vrei să mergi toate

9274
07:08:45,200 --> 07:08:50,320
drumul până la capăt sau începe până la capăt

9275
07:08:47,920 --> 07:08:52,798
de la început. Deci, dacă o faci

9276
07:08:50,320 --> 07:08:54,320
ceva de genul asta,

9277
07:08:52,798 --> 07:08:57,360
hai sa-ti arat un exemplu. Dacă o faci

9278
07:08:54,320 --> 07:09:01,680
asa ceva si tu nu

9279
07:08:57,360 --> 07:09:03,280
includeți, lăsați începutul necompletat.

9280
07:09:01,680 --> 07:09:05,840
Lăsați începutul necompletat și mergeți totul

9281
07:09:03,280 --> 07:09:09,040
drumul până la minus unu. Ce ar fi asta

9282
07:09:05,840 --> 07:09:11,360
semnalul către interpret este implicit

9283
07:09:09,040 --> 07:09:14,478
um începe de la început. Deci începe de la

9284
07:09:11,360 --> 07:09:17,360
zero. În esență, începe de la zero. Dacă tu

9285
07:09:14,478 --> 07:09:19,840
lasa o felie

9286
07:09:17,360 --> 07:09:21,280
uh ca început că interpretul

9287
07:09:19,840 --> 07:09:23,200
presupune că doriți să începeți de la

9288
07:09:21,280 --> 07:09:25,280
începutul.

9289
07:09:23,200 --> 07:09:28,680
Deci, ce crezi că ar fi această felie

9290
07:09:25,280 --> 07:09:28,680
stiind asta?

9291
07:09:32,000 --> 07:09:35,840
Da, exact. Voi sunteți

9292
07:09:33,760 --> 07:09:37,520
chiar deasupra ei. 10 la 50. Perfect.

9293
07:09:35,840 --> 07:09:39,040
Deci va fi totul, în afară de

9294
07:09:37,520 --> 07:09:40,320
ultimul

9295
07:09:39,040 --> 07:09:43,760
totul, în afară de ultimul, ar fi

9296
07:09:40,320 --> 07:09:47,200
incluse în acea felie.

9297
07:09:43,760 --> 07:09:49,600
Perfect. Și celălalt lucru suntem noi

9298
07:09:47,200 --> 07:09:50,958
poate opri sfârșitul care ar semnala

9299
07:09:49,600 --> 07:09:53,200
că vrem să mergem până la

9300
07:09:50,958 --> 07:09:56,440
sfârşitul. Deci ce credeți că este asta

9301
07:09:53,200 --> 07:09:56,440
va fi?

9302
07:10:00,478 --> 07:10:04,040
Care ar fi asta?

9303
07:10:10,080 --> 07:10:15,360
Da. Deci asta este Deci asta este de fapt

9304
07:10:12,558 --> 07:10:16,718
urmând să includă sfârșitul. Așa că știu

9305
07:10:15,360 --> 07:10:18,718
asta e puțin contraintuitiv, dar

9306
07:10:16,718 --> 07:10:22,320
de fapt, asta ne garantează

9307
07:10:18,718 --> 07:10:23,680
include sfârșitul. Deci, dacă este gol, este

9308
07:10:22,320 --> 07:10:26,638
va merge până la capăt,

9309
07:10:23,680 --> 07:10:28,320
inclusiv sfârșitul. Știu că asta e

9310
07:10:26,638 --> 07:10:31,040
enervant. Nu te condamn că te gândești

9311
07:10:28,320 --> 07:10:34,000
ar trebui să fie 50,

9312
07:10:31,040 --> 07:10:36,160
dar practic merge la n. Practic

9313
07:10:34,000 --> 07:10:38,240
merge la n, ceea ce ar însemna că noi

9314
07:10:36,160 --> 07:10:40,320
amintiți-vă că indicele este n minus unul este

9315
07:10:38,240 --> 07:10:43,120
ultimul indice.

9316
07:10:40,320 --> 07:10:47,760
Deci, dacă este gol, înseamnă că noi

9317
07:10:43,120 --> 07:10:49,840
ar trebui să mergem ar trebui să terminăm la n

9318
07:10:47,760 --> 07:10:52,400
care este lungimea sensului listei

9319
07:10:49,840 --> 07:10:54,400
că um ultimul element este la n minus

9320
07:10:52,400 --> 07:11:00,360
unul. Deci ar trebui să includem n minus

9321
07:10:54,400 --> 07:11:00,360
unul. Deci da, ar fi 20 până la 60

9322
07:11:00,798 --> 07:11:06,718
de fapt îmi pare rău de la 30 la 60 pentru că noi uh

9323
07:11:03,280 --> 07:11:09,920
indicele doi este 30. Deci ar fi Așa

9324
07:11:06,718 --> 07:11:13,240
felia aceea ar fi aceasta până la capăt

9325
07:11:09,920 --> 07:11:13,240
până la capăt.

9326
07:11:13,600 --> 07:11:17,440
Bun. Mai am un exemplu pentru tine

9327
07:11:16,160 --> 07:11:20,478
asta chiar te va arunca pentru a

9328
07:11:17,440 --> 07:11:23,360
bucla este aceasta. Deci, ce se întâmplă dacă noi

9329
07:11:20,478 --> 07:11:26,760
au

9330
07:11:23,360 --> 07:11:26,760
acest caz?

9331
07:11:31,360 --> 07:11:36,638
Probabil că nu va fi în buclă, dar o voi face

9332
07:11:32,878 --> 07:11:36,638
mai au unul după asta.

9333
07:11:37,680 --> 07:11:42,160
Toate da, 10 până la 60 totul. Perfect.

9334
07:11:41,120 --> 07:11:44,718
Voi sunteți chiar pe deasupra

9335
07:11:42,160 --> 07:11:46,080
pentru că lăsăm golul de început

9336
07:11:44,718 --> 07:11:48,000
ceea ce înseamnă că ar trebui să începem de la

9337
07:11:46,080 --> 07:11:49,040
fata. Lăsăm finalul gol

9338
07:11:48,000 --> 07:11:50,638
ceea ce înseamnă că ar trebui să mergem până la

9339
07:11:49,040 --> 07:11:53,040
sfârşitul. Deci asta ar fi totul

9340
07:11:50,638 --> 07:11:55,280
totul între ele. Deci în acel moment

9341
07:11:53,040 --> 07:11:56,718
chiar nu feliem nimic,

9342
07:11:55,280 --> 07:11:59,760
nu? Nu feliem prea mult.

9343
07:11:56,718 --> 07:12:03,680
Doar luăm toată lista.

9344
07:11:59,760 --> 07:12:06,160
Acum, un exemplu vreau să vă dau

9345
07:12:03,680 --> 07:12:11,000
este

9346
07:12:06,160 --> 07:12:11,000
ce dacă am feliat

9347
07:12:13,520 --> 07:12:21,478
și am avut o dimensiune a pasului

9348
07:12:17,760 --> 07:12:21,478
de minus unu.

9349
07:12:22,878 --> 07:12:27,080
Ai vreo idee ce ar face asta?

9350
07:12:27,840 --> 07:12:30,958
Ce face asta?

9351
07:12:32,320 --> 07:12:39,440
Care este dimensiunea unui pas de minus unu?

9352
07:12:36,638 --> 07:12:41,600
Deci indicele minus negativ merge de la

9353
07:12:39,440 --> 07:12:44,878
înapoi, nu?

9354
07:12:41,600 --> 07:12:49,000
Deci, dacă avem un pas minus unu, ce

9355
07:12:44,878 --> 07:12:49,000
ar trebui să facem eficient?

9356
07:12:53,120 --> 07:12:57,840
Deci, asta ne semnalează practic

9357
07:12:54,878 --> 07:13:01,240
vreau să am întreaga listă, dar pas cu pas

9358
07:12:57,840 --> 07:13:01,240
minus unu.

9359
07:13:04,320 --> 07:13:10,280
Da. Deci asta ar fi invers.

9360
07:13:13,040 --> 07:13:18,958
Deci aceasta ar fi lista inversă. Deci, eu

9361
07:13:17,040 --> 07:13:21,360
Știu că pare ciudat, dar asta de fapt

9362
07:13:18,958 --> 07:13:24,478
este o modalitate de a inversa în mod valid o listă în

9363
07:13:21,360 --> 07:13:26,878
Python este să indexeze dimensiunea pasului cu minus

9364
07:13:24,478 --> 07:13:29,440
unul. Pentru că ceea ce înseamnă asta este că ești

9365
07:13:26,878 --> 07:13:34,160
tăind întreaga matrice, dar ești

9366
07:13:29,440 --> 07:13:38,638
pas cu minus unu. Știm minus unu

9367
07:13:34,160 --> 07:13:40,400
știm că minus one merge

9368
07:13:38,638 --> 07:13:42,798
înapoi, nu? Efectiv, pentru că

9369
07:13:40,400 --> 07:13:45,680
incepe de la sfarsit. Deci, dimensiunea pasului cu

9370
07:13:42,798 --> 07:13:48,400
minus unul ar fi întoarcerea pe aici.

9371
07:13:45,680 --> 07:13:49,920
fiecare element mergând înapoi în acest fel. Deci

9372
07:13:48,400 --> 07:13:53,478
asta ar fi efectiv

9373
07:13:49,920 --> 07:13:53,478
inversează lista.

9374
07:13:54,400 --> 07:14:00,878
Da, acum există un revers

9375
07:13:57,200 --> 07:14:04,000
funcția. O listă are o funcție inversă.

9376
07:14:00,878 --> 07:14:07,120
Deci asta este in engleza. Dar asta e ca

9377
07:14:04,000 --> 07:14:09,280
aceasta este o alternativă la inversare

9378
07:14:07,120 --> 07:14:13,320
minus unu

9379
07:14:09,280 --> 07:14:13,320
dimensiunea pasului de minus unu.

9380
07:14:17,040 --> 07:14:22,878
Uh, nu, Roberto, nu sunt chiar așa

9381
07:14:19,760 --> 07:14:25,280
la fel pentru că amintește-ți când faci două

9382
07:14:22,878 --> 07:14:26,798
colon și apoi lăsați deoparte spațiul liber,

9383
07:14:25,280 --> 07:14:28,718
asta înseamnă că te duci la toate

9384
07:14:26,798 --> 07:14:30,798
drum până la sfârșit, inclusiv golul,

9385
07:14:28,718 --> 07:14:33,520
inclusiv sfârșitul.

9386
07:14:30,798 --> 07:14:35,600
Deci, de la -4 la minus unu ar fi la fel ca

9387
07:14:33,520 --> 07:14:40,718
2 la

9388
07:14:35,600 --> 07:14:44,360
2 la șase sau 2 la 7. Doi la șase.

9389
07:14:40,718 --> 07:14:44,360
Îmi pare rău. Doi până la șase.

9390
07:14:45,440 --> 07:14:50,000
60 la 10. Da. Ar fi asta. Deci asta

9391
07:14:47,760 --> 07:14:54,558
îl inversează. Înseamnă că asta ar fi asta

9392
07:14:50,000 --> 07:14:57,520
ar reveni la 60 apoi 50 apoi 40. Este

9393
07:14:54,558 --> 07:15:01,240
reversul listei când pășiți

9394
07:14:57,520 --> 07:15:01,240
dimensiunea cu minus unu.

9395
07:15:18,558 --> 07:15:26,040
Sunt sigur.

9396
07:15:21,440 --> 07:15:26,040
Ce zici de o felie din poziția unu?

9397
07:15:26,080 --> 07:15:31,360
Tăiați din poziția unu la secundă până la

9398
07:15:27,760 --> 07:15:34,718
ultima și inversează-l.

9399
07:15:31,360 --> 07:15:36,638
Ce crezi că ar fi?

9400
07:15:34,718 --> 07:15:39,760
Începi de la unu la secundă

9401
07:15:36,638 --> 07:15:41,360
a dura.

9402
07:15:39,760 --> 07:15:43,680
Și apoi reverie așa cum știm deja

9403
07:15:41,360 --> 07:15:47,320
ceea ce se inversează este dimensiunea pasului minus unu

9404
07:15:43,680 --> 07:15:47,320
care se va inversa mereu.

9405
07:15:52,798 --> 07:15:56,840
Ce este colonul?

9406
07:15:57,680 --> 07:16:03,040
Colon este faptul că plecăm

9407
07:16:01,440 --> 07:16:04,478
colon colon nu este nimic special.

9408
07:16:03,040 --> 07:16:06,000
Este faptul că părăsim

9409
07:16:04,478 --> 07:16:09,040
pornind. Este doar sintaxa lui

9410
07:16:06,000 --> 07:16:11,600
feliere, nu? colon colon este pentru că

9411
07:16:09,040 --> 07:16:13,600
suntem plecăm de la start și

9412
07:16:11,600 --> 07:16:15,280
oprindu-se în gol

9413
07:16:13,600 --> 07:16:16,878
ceea ce putem face. Avem voie să intrăm

9414
07:16:15,280 --> 07:16:18,400
felierea. Deci asta ar semnala că suntem

9415
07:16:16,878 --> 07:16:21,958
facem totul, dar facem un pas

9416
07:16:18,400 --> 07:16:21,958
dimensiunea minus unu.

9417
07:16:25,840 --> 07:16:28,840
Da.

9418
07:16:30,958 --> 07:16:36,920
Bine.

9419
07:16:33,920 --> 07:16:36,920
Oricare

9420
07:16:38,160 --> 07:16:42,200
alte alte intrebari?

9421
07:16:43,680 --> 07:16:48,878
Cum ne simțim despre feliere? tu

9422
07:16:45,920 --> 07:16:50,478
te simți în regulă? Mergem să fim

9423
07:16:48,878 --> 07:16:52,798
o vom exersa mai mult pe măsură ce mergem

9424
07:16:50,478 --> 07:16:54,400
împreună? Pentru că o să folosim

9425
07:16:52,798 --> 07:16:57,200
feliind destul de puțin când lucrăm cu

9426
07:16:54,400 --> 07:16:59,200
date, dar face conceptul de tăiere

9427
07:16:57,200 --> 07:17:01,040
are sens? Da, ai nevoie, ai nevoie de mai mult

9428
07:16:59,200 --> 07:17:05,120
p Vom face mai mult. O să facem

9429
07:17:01,040 --> 07:17:05,120
feliere pe tot parcursul programului.

9430
07:17:07,680 --> 07:17:12,240
Da, vom face mai multe dimensiuni

9431
07:17:10,240 --> 07:17:14,320
următorul nostru curs.

9432
07:17:12,240 --> 07:17:15,360
Nu chiar acum, ci în datele noastre

9433
07:17:14,320 --> 07:17:18,360
curs de știință, vom face

9434
07:17:15,360 --> 07:17:18,360
multidimensională.

9435
07:17:32,718 --> 07:17:35,958
acel ajutor?

9436
07:17:37,680 --> 07:17:42,080
Da. Pasul poate fi foarte Da, sigur.

9437
07:17:40,000 --> 07:17:44,240
Sigur. Deci, nu există nimic care să fie

9438
07:17:42,080 --> 07:17:45,520
să te oprească, știi, există

9439
07:17:44,240 --> 07:17:49,120
nimic care să te împiedice să faci

9440
07:17:45,520 --> 07:17:52,240
ca să spunem că x este doi și apoi facem

9441
07:17:49,120 --> 07:17:58,000
um numere

9442
07:17:52,240 --> 07:18:01,200
numere și apoi avem uh doi to to

9443
07:17:58,000 --> 07:18:03,360
șase și apoi x

9444
07:18:01,200 --> 07:18:07,240
Da, e bine. Nu e nimic asta

9445
07:18:03,360 --> 07:18:07,240
ne-ar împiedica să facem asta.

9446
07:18:07,840 --> 07:18:12,798
Vrei să spui că eu cred că sunt eu

9447
07:18:10,160 --> 07:18:16,440
cred că e bine. Acolo ar fi

9448
07:18:12,798 --> 07:18:16,440
nimic în neregulă cu asta.

9449
07:18:16,718 --> 07:18:19,760
Dar ai dreptate că ar trebui să fie un

9450
07:18:18,000 --> 07:18:22,160
întreg. Dacă este ca un plutitor,

9451
07:18:19,760 --> 07:18:24,558
Python se va plânge. Trebuie să fie un

9452
07:18:22,160 --> 07:18:26,798
dimensiunea pasului întreg și trebuie să fie

9453
07:18:24,558 --> 07:18:28,798
trebuie să fie uh

9454
07:18:26,798 --> 07:18:30,320
pentru a obține orice date semnificative.

9455
07:18:28,798 --> 07:18:32,638
Nu ne-am dori să fie dimensiunea aceea a pasului

9456
07:18:30,320 --> 07:18:34,798
prea mare sau ne place, știi, dacă alegem

9457
07:18:32,638 --> 07:18:36,000
să fie ca 20 și sunt doar cinci

9458
07:18:34,798 --> 07:18:38,558
elemente, asta nu va face niciuna

9459
07:18:36,000 --> 07:18:41,558
sens. Dimensiunea pasului trebuie să fie

9460
07:18:38,558 --> 07:18:41,558
rezonabil.

9461
07:18:44,638 --> 07:18:52,400
În regulă. Deci, ceea ce vreau să fac este să arăt

9462
07:18:48,558 --> 07:18:54,400
tu câteva funcții pe care le au listele. Deci

9463
07:18:52,400 --> 07:18:56,958
probabil una dintre cele mai utile

9464
07:18:54,400 --> 07:19:00,240
funcțiile pe care le are o listă este capacitatea de a

9465
07:18:56,958 --> 07:19:03,200
adăugați elemente la listă. Acum asta va

9466
07:19:00,240 --> 07:19:06,878
adăugați articole la listă și în special

9467
07:19:03,200 --> 07:19:08,558
îl va adăuga la sfârșit. Deci asta este

9468
07:19:06,878 --> 07:19:11,040
acesta este ceva ce vom folosi destul de a

9469
07:19:08,558 --> 07:19:12,718
bit este lista.append

9470
07:19:11,040 --> 07:19:17,280
funcția.

9471
07:19:12,718 --> 07:19:20,798
Deci asta va adăuga acest testament

9472
07:19:17,280 --> 07:19:23,920
modificați lista și adăugați un nou element la

9473
07:19:20,798 --> 07:19:26,718
sfârşitul. Așa că append se adaugă întotdeauna la

9474
07:19:23,920 --> 07:19:31,520
sfârşitul. Hm

9475
07:19:26,718 --> 07:19:34,558
și asta ne va permite să luăm

9476
07:19:31,520 --> 07:19:36,798
asta acest cireș și acum când

9477
07:19:34,558 --> 07:19:39,920
Adăugăm această listă acum

9478
07:19:36,798 --> 07:19:42,798
a fost schimbat permanent pentru a avea cireșe

9479
07:19:39,920 --> 07:19:45,760
chiar la sfârşit. Deci iată. Este

9480
07:19:42,798 --> 07:19:49,200
acum la capătul listei și este

9481
07:19:45,760 --> 07:19:52,400
este acum în genul de poziție finală când

9482
07:19:49,200 --> 07:19:55,200
anexăm. Deci aici vezi lista

9483
07:19:52,400 --> 07:19:57,280
fiind cu adevărat dinamic permițându-ne să adăugăm

9484
07:19:55,200 --> 07:20:00,280
elementele acestuia prin acest anexă

9485
07:19:57,280 --> 07:20:00,280
funcția.

9486
07:20:02,478 --> 07:20:08,878
Așa că adăugați cu adevărat util ne permite

9487
07:20:05,680 --> 07:20:11,520
to to add we just pass in we pass in an

9488
07:20:08,878 --> 07:20:14,240
element din interiorul funcției append uh

9489
07:20:11,520 --> 07:20:16,240
aici pe care vrem să-l adăugăm pe listă și

9490
07:20:14,240 --> 07:20:19,240
va merge în spatele

9491
07:20:16,240 --> 07:20:19,240
lista.

9492
07:20:23,920 --> 07:20:33,040
Um, listele au și o funcție pop

9493
07:20:28,638 --> 07:20:35,920
um, pe care îl treci într-o poziție și ea

9494
07:20:33,040 --> 07:20:38,080
va elimina acel element care este acolo

9495
07:20:35,920 --> 07:20:40,240
poziție. Și nu numai că va fi

9496
07:20:38,080 --> 07:20:42,958
elimina definitiv elementul care se află la

9497
07:20:40,240 --> 07:20:46,160
acea poziție, dar o va returna

9498
07:20:42,958 --> 07:20:50,160
înapoi la tine. Deci, pop este cu adevărat util dacă

9499
07:20:46,160 --> 07:20:54,080
vrei să elimini lucrurile um din

9500
07:20:50,160 --> 07:20:56,400
din lista. um dacă nu furnizați un

9501
07:20:54,080 --> 07:20:58,080
poziție. Deci, dacă nu furnizați niciunul

9502
07:20:56,400 --> 07:21:02,160
indexul pe care doriți să îl eliminați din și

9503
07:20:58,080 --> 07:21:05,520
faci doar dacă faci doar um pop

9504
07:21:02,160 --> 07:21:08,718
fără nimic acolo înăuntru care să fie

9505
07:21:05,520 --> 07:21:11,200
eliminați întotdeauna ultimul element de

9506
07:21:08,718 --> 07:21:15,878
implicit. Așa că întotdeauna așa dacă noi

9507
07:21:11,200 --> 07:21:15,878
făcând asta, ar elimina cele 40.

9508
07:21:18,638 --> 07:21:24,558
Putem atașa într-o anumită poziție?

9509
07:21:21,360 --> 07:21:26,798
Hm, da. Veți folosi inserția

9510
07:21:24,558 --> 07:21:29,680
funcția și apoi dați-i indexul dvs

9511
07:21:26,798 --> 07:21:34,080
doresc să se introducă în. Aşa,

9512
07:21:29,680 --> 07:21:36,798
ar fi uh fiecare listă are o inserție

9513
07:21:34,080 --> 07:21:40,558
funcția to to și apoi introduceți a

9514
07:21:36,798 --> 07:21:42,320
poziția în care doriți să o adăugați.

9515
07:21:40,558 --> 07:21:45,200
Este o utilizare obișnuită pentru adăugarea și eliminarea

9516
07:21:42,320 --> 07:21:47,520
in timpul? Da. Deci, anexarea este foarte comună

9517
07:21:45,200 --> 07:21:49,600
pentru a adăuga lucruri noi la listă care

9518
07:21:47,520 --> 07:21:51,200
poate facem cum ar fi agregarea datelor.

9519
07:21:49,600 --> 07:21:53,760
Vrem să adăugăm lucruri la o listă și apoi

9520
07:21:51,200 --> 07:21:57,520
luați media listei. Asta e

9521
07:21:53,760 --> 07:21:59,040
foarte frecvente. Îndepărtează. Da. Poate că suntem

9522
07:21:57,520 --> 07:22:00,798
făcându-ne drum printr-o colecție de

9523
07:21:59,040 --> 07:22:03,440
lucruri și când le procesăm vrem

9524
07:22:00,798 --> 07:22:05,840
îndepărtați-l. Așa că putem face pop pentru a-l elimina

9525
07:22:03,440 --> 07:22:08,840
din lista.

9526
07:22:05,840 --> 07:22:08,840
Da.

9527
07:22:12,798 --> 07:22:20,558
Da. Așa că atunci când da, când îl vom pune

9528
07:22:16,478 --> 07:22:22,878
afectează permanent lista. Deci um

9529
07:22:20,558 --> 07:22:24,718
totul se schimbă. Da. Toate lor

9530
07:22:22,878 --> 07:22:28,320
pozițiile se schimbă în funcție de ce

9531
07:22:24,718 --> 07:22:34,478
am scos. Deci, ca în acest exemplu, um

9532
07:22:28,320 --> 07:22:38,240
30 este uh 30 este indexul doi, dar când noi

9533
07:22:34,478 --> 07:22:40,718
pop, acum devine ultimul element.

9534
07:22:38,240 --> 07:22:44,160
Deci ar fi acum eligibil să fie index

9535
07:22:40,718 --> 07:22:48,878
minus unu, nu? Pentru că atunci când scoatem 40,

9536
07:22:44,160 --> 07:22:51,958
30 este acum sfârșitul listei. um,

9537
07:22:48,878 --> 07:22:51,958
de exemplu,

9538
07:22:54,240 --> 07:23:01,120
deci da, totul se schimbă

9539
07:22:57,920 --> 07:23:04,000
și știi acest exemplu, aici um

9540
07:23:01,120 --> 07:23:07,040
iese din indexul doi. Deci am merge la

9541
07:23:04,000 --> 07:23:11,920
indice doi, care este 30, și eliminați-l.

9542
07:23:07,040 --> 07:23:16,760
Și astfel 40 se schimbă acum pentru a fi la indicele 2

9543
07:23:11,920 --> 07:23:16,760
în timp ce anterior era la indicele 3.

9544
07:23:19,920 --> 07:23:25,798
Inserați de asemenea. Da. Când introduceți

9545
07:23:21,840 --> 07:23:25,798
totul se schimbă. Da.

9546
07:23:29,040 --> 07:23:34,160
Bine. Iată un aici este un cu adevărat util

9547
07:23:31,040 --> 07:23:35,760
functioneaza de asemenea. Deci avem extinderea

9548
07:23:34,160 --> 07:23:38,878
funcția

9549
07:23:35,760 --> 07:23:40,798
um, care ne-ar permite să adăugăm

9550
07:23:38,878 --> 07:23:43,680
elemente multiple. Deci asta este la fel

9551
07:23:40,798 --> 07:23:47,040
ca și cum am atașat fiecare articol individual

9552
07:23:43,680 --> 07:23:51,120
în această colecție la listă. Aşa

9553
07:23:47,040 --> 07:23:54,160
extinde ia o listă și o adaugă

9554
07:23:51,120 --> 07:23:56,958
elemente la cealaltă listă. Așa că observați

9555
07:23:54,160 --> 07:23:59,520
că avem um

9556
07:23:56,958 --> 07:24:02,718
avem aici o listă de culori, roșu și

9557
07:23:59,520 --> 07:24:05,360
albastru și îl extindem cu o listă

9558
07:24:02,718 --> 07:24:08,400
de verde și galben, care va rezulta

9559
07:24:05,360 --> 07:24:10,958
în lista de culori având acum toate

9560
07:24:08,400 --> 07:24:12,878
acele elemente. Deci extinde este cu adevărat

9561
07:24:10,958 --> 07:24:17,478
util dacă dorim să adăugăm mai multe

9562
07:24:12,878 --> 07:24:17,478
date la o listă existentă.

9563
07:24:21,120 --> 07:24:25,520
o mulțime de întrebări. Hm, putem obține

9564
07:24:23,280 --> 07:24:28,400
index și valori cu o comandă de imprimare?

9565
07:24:25,520 --> 07:24:30,798
Uh, da.

9566
07:24:28,400 --> 07:24:35,400
Da. Adică, poți folosi un nu sunt sigur

9567
07:24:30,798 --> 07:24:35,400
ce exemplu ai in vedere, dar da.

9568
07:24:37,360 --> 07:24:42,558
Da. Adăugați este un articol. Extinde este este

9569
07:24:39,760 --> 07:24:45,920
luând o listă întreagă și adăugând toate

9570
07:24:42,558 --> 07:24:48,000
a acestor elemente la lista existentă.

9571
07:24:45,920 --> 07:24:51,200
Da. Adăugare este pentru o singură valoare la a

9572
07:24:48,000 --> 07:24:53,840
timp. Da. Extindeți este atunci când adăugați

9573
07:24:51,200 --> 07:24:59,478
valori multiple.

9574
07:24:53,840 --> 07:24:59,478
Adăugare este o valoare la un moment dat. Da.

9575
07:25:10,558 --> 07:25:15,280
Bine. Așa că permiteți-mi să vă întreb ce faceți

9576
07:25:12,400 --> 07:25:17,120
te gandesti la asta? um,

9577
07:25:15,280 --> 07:25:21,478
care dintre următoarele metode adaugă a

9578
07:25:17,120 --> 07:25:21,478
un singur element la sfârșitul listei?

9579
07:25:23,120 --> 07:25:28,520
Deci, adăugând un singur element la sfârșit

9580
07:25:25,280 --> 07:25:28,520
a listei.

9581
07:25:42,320 --> 07:25:47,840
Foarte bun. Ar trebui să fie un Da, noi

9582
07:25:44,718 --> 07:25:51,478
anexează. Adăugați adaugări și adăugați întotdeauna

9583
07:25:47,840 --> 07:25:51,478
adaugă la final.

9584
07:25:53,920 --> 07:25:57,240
Foarte bun.

9585
07:25:59,600 --> 07:26:06,958
Bine. Deci, acum vom avea un

9586
07:26:02,558 --> 07:26:10,718
demonstrație. Um, și apropo, acesta este um

9587
07:26:06,958 --> 07:26:14,000
acesta este un demo care există

9588
07:26:10,718 --> 07:26:15,760
caietul. Deci, um, ce ai vrea să faci

9589
07:26:14,000 --> 07:26:18,320
face este, mai ales dacă lucrezi în

9590
07:26:15,760 --> 07:26:20,080
colaborare, este să ia caietul. Acum, asta

9591
07:26:18,320 --> 07:26:22,558
este în cadrul lecției a doua. Deci, vom merge

9592
07:26:20,080 --> 07:26:23,920
faceți demonstrația unu și lecția a doua. Ai vrea

9593
07:26:22,558 --> 07:26:26,718
vrei să iei caietul ăla dacă ești

9594
07:26:23,920 --> 07:26:28,878
lucrând în Colab și încărcați-l. Bolnav

9595
07:26:26,718 --> 07:26:30,558
să-ți arăt cum să faci asta, dar mergem

9596
07:26:28,878 --> 07:26:33,440
pentru a face vom face demo care este

9597
07:26:30,558 --> 07:26:36,320
în interiorul uh primul demo în interiorul

9598
07:26:33,440 --> 07:26:39,320
lecția a doua.

9599
07:26:36,320 --> 07:26:39,320
um,

9600
07:26:44,478 --> 07:26:48,360
așa că lasă-mă să-mi partajez ecranul.

9601
07:26:51,280 --> 07:26:55,600
Bine. Deci, dacă te afli în Collab,

9602
07:26:53,600 --> 07:26:58,478
ceea ce o să vrei să faci este să mergi la

9603
07:26:55,600 --> 07:26:59,600
fișier și apoi încărcați blocnotesul. Deci,

9604
07:26:58,478 --> 07:27:03,360
o să vrei să mergi la încărcare

9605
07:26:59,600 --> 07:27:05,440
caiet și apoi alege-l cu speranța

9606
07:27:03,360 --> 07:27:08,000
ai descărcat demo-urile în care

9607
07:27:05,440 --> 07:27:10,240
in cazul in care ai caietul de la

9608
07:27:08,000 --> 07:27:14,638
lecția a doua. Există o grămadă de caiete

9609
07:27:10,240 --> 07:27:18,240
fișiere, YMB-urile IP. Doriți să încărcați

9610
07:27:14,638 --> 07:27:19,840
um acele demo acele caiete demo.

9611
07:27:18,240 --> 07:27:22,240
Bine. Dacă lucrezi în colaborare, dacă

9612
07:27:19,840 --> 07:27:24,240
lucrezi în Jupiter, um, sau ești

9613
07:27:22,240 --> 07:27:27,440
lucrând în, uh, VS Code, poți pur și simplu

9614
07:27:24,240 --> 07:27:30,320
deschide acel fișier, uh, în VS Code sau

9615
07:27:27,440 --> 07:27:32,798
Jupiter, um,

9616
07:27:30,320 --> 07:27:34,798
și, uh, ar trebui să fii bine să pleci

9617
07:27:32,798 --> 07:27:38,000
acolo. Deci, am, am terminat deja

9618
07:27:34,798 --> 07:27:39,600
că. Acesta este unul demo din interior

9619
07:27:38,000 --> 07:27:42,000
lecția a doua. Aveți acces la

9620
07:27:39,600 --> 07:27:46,120
caietul acela?

9621
07:27:42,000 --> 07:27:46,120
Demo unu și lecția a doua.

9622
07:27:47,840 --> 07:27:51,600
Ar trebui să existe lecția a doua are o grămadă

9623
07:27:50,160 --> 07:27:56,040
de caiete pe care le vom lucra

9624
07:27:51,600 --> 07:27:56,040
prin. um,

9625
07:27:57,040 --> 07:28:01,360
bine.

9626
07:27:58,878 --> 07:28:04,958
Foarte bun.

9627
07:28:01,360 --> 07:28:08,000
Deci, dacă alergăm dacă rulăm această bucată de

9628
07:28:04,958 --> 07:28:11,280
cod um care este în acest prim set sau

9629
07:28:08,000 --> 07:28:13,520
Îmi pare rău, prima celulă, va merge

9630
07:28:11,280 --> 07:28:16,878
creați această listă care are un amestec diferit

9631
07:28:13,520 --> 07:28:20,798
tipuri. Deci această listă are numere întregi, are

9632
07:28:16,878 --> 07:28:23,920
corzi, are flotoare, dar putem

9633
07:28:20,798 --> 07:28:26,798
creați această listă. Dacă doar lovim alerga,

9634
07:28:23,920 --> 07:28:29,280
um, acum avem o listă. Și ce vreau

9635
07:28:26,798 --> 07:28:32,478
pentru a vă arăta este dacă ar fi să verificăm

9636
07:28:29,280 --> 07:28:37,398
tip de asta lista mea, um, desigur,

9637
07:28:32,478 --> 07:28:37,398
aceasta ar trebui să fie o listă, ceea ce este.

9638
07:28:38,878 --> 07:28:44,320
Bine. Mulțumesc că ai încărcat asta.

9639
07:28:41,440 --> 07:28:48,798
Perfect.

9640
07:28:44,320 --> 07:28:50,958
Bine. Deci hai să mergem mai departe și să accesăm câteva

9641
07:28:48,798 --> 07:28:53,520
elemente. Deci putem accesa primul

9642
07:28:50,958 --> 07:28:55,120
element aici. Putem accesa elementul

9643
07:28:53,520 --> 07:28:57,600
al patrulea care ar fi pe poziție

9644
07:28:55,120 --> 07:29:00,240
trei și apoi al șaptelea care ar

9645
07:28:57,600 --> 07:29:01,920
fi pe poziția șase. Putem accesa toate

9646
07:29:00,240 --> 07:29:05,040
acelea

9647
07:29:01,920 --> 07:29:06,958
și le-am pus într-o nouă listă aici

9648
07:29:05,040 --> 07:29:08,558
punându-le în interiorul parantezelor. Deci

9649
07:29:06,958 --> 07:29:11,360
asta înseamnă că accesăm

9650
07:29:08,558 --> 07:29:13,200
aceasta prima. Acesta este primul element

9651
07:29:11,360 --> 07:29:17,520
din această listă pe care o creăm. Sale

9652
07:29:13,200 --> 07:29:18,798
25, care este aici.

9653
07:29:17,520 --> 07:29:20,798
Apropo, ce părere aveți

9654
07:29:18,798 --> 07:29:25,440
se întâmplă dacă încercăm dacă încercăm să folosim un

9655
07:29:20,798 --> 07:29:27,520
index care este prea mare pentru această listă?

9656
07:29:25,440 --> 07:29:30,478
Ce crezi că s-ar întâmpla? Ca dacă

9657
07:29:27,520 --> 07:29:34,478
noi dacă am încercat să facem dacă am încercat să folosim

9658
07:29:30,478 --> 07:29:37,360
cod care ar fi ca um lista mea și

9659
07:29:34,478 --> 07:29:40,240
apoi punem in index ca 20. Ce

9660
07:29:37,360 --> 07:29:41,920
crezi ca s-ar intampla?

9661
07:29:40,240 --> 07:29:45,200
pentru că cu siguranță nu sunt 20 de articole

9662
07:29:41,920 --> 07:29:46,798
în această listă.

9663
07:29:45,200 --> 07:29:49,120
Da, va fi o eroare. Deci, hai să încercăm

9664
07:29:46,798 --> 07:29:52,798
rulând asta. Acest lucru îmi va da o eroare

9665
07:29:49,120 --> 07:29:54,240
care spune că este în afara intervalului. Da, an

9666
07:29:52,798 --> 07:29:56,638
excepție, nu? Ar fi o

9667
07:29:54,240 --> 07:29:58,798
excepție, care ar spune, uh, avem

9668
07:29:56,638 --> 07:30:01,840
o eroare de index. Hm, încercăm să folosim

9669
07:29:58,798 --> 07:30:04,840
un index prea mare pentru lista noastră

9670
07:30:01,840 --> 07:30:04,840
în esență.

9671
07:30:05,840 --> 07:30:10,080
Deci, doar subliniind asta. Hm, lasă-mă

9672
07:30:07,680 --> 07:30:13,120
face un comentariu acolo.

9673
07:30:10,080 --> 07:30:20,200
Um, asta

9674
07:30:13,120 --> 07:30:20,200
uh indexul este în afara intervalului pentru lista noastră.

9675
07:30:21,600 --> 07:30:28,080
Deci, ar trebui să primim o eroare.

9676
07:30:25,920 --> 07:30:30,240
Vezi cum fac un comentariu? Realizarea unui

9677
07:30:28,080 --> 07:30:33,280
comentează acolo pentru a-mi aminti de ce am

9678
07:30:30,240 --> 07:30:36,680
am primit aceasta eroare. Deci, amintiți-vă, comentarii

9679
07:30:33,280 --> 07:30:36,680
sunt utile.

9680
07:30:38,398 --> 07:30:44,558
În regulă. Deci, accesăm lucruri și noi

9681
07:30:42,478 --> 07:30:46,398
le poți pune într-o listă. Acum,

9682
07:30:44,558 --> 07:30:48,398
hai sa facem index negativ. Deci, știm

9683
07:30:46,398 --> 07:30:50,558
negativ -1 ar trebui să ne dea articolul

9684
07:30:48,398 --> 07:30:54,398
asta e la finalul listei,

9685
07:30:50,558 --> 07:30:56,478
care ar fi aceasta 2.718.

9686
07:30:54,398 --> 07:30:58,798
Um, așa că ar trebui să fie acolo. Și apoi

9687
07:30:56,478 --> 07:31:02,160
minus 4 ar fi al patrulea din spate.

9688
07:30:58,798 --> 07:31:04,798
Minus 7 ar fi al șaptelea din spate.

9689
07:31:02,160 --> 07:31:06,320
Deci, putem obține acele valori. Nu prea

9690
07:31:04,798 --> 07:31:10,160
rău.

9691
07:31:06,320 --> 07:31:13,760
Apoi avem un exemplu de feliere.

9692
07:31:10,160 --> 07:31:18,080
Deci 2 până la 7 îl cunoaștem ca o felie. Aceasta

9693
07:31:13,760 --> 07:31:23,360
ar trebui să fie o felie pe care o felie

9694
07:31:18,080 --> 07:31:31,280
care începe de la indexul 2 și merge la index

9695
07:31:23,360 --> 07:31:34,798
7, dar nu include indicele 7.

9696
07:31:31,280 --> 07:31:38,320
nu? Deci asta ar trebui să fie felia. um,

9697
07:31:34,798 --> 07:31:40,798
deci dacă rulăm acest cod, asta ar fi

9698
07:31:38,320 --> 07:31:42,718
extrage totul începând de la poziție

9699
07:31:40,798 --> 07:31:45,120
doi, care ar trebui să fie al treilea articol al

9700
07:31:42,718 --> 07:31:48,478
lista, până la, uh,

9701
07:31:45,120 --> 07:31:50,958
pozitia 7.

9702
07:31:48,478 --> 07:31:53,600
Și încă un lucru pe care voiam să-ți arăt

9703
07:31:50,958 --> 07:31:55,440
este că putem extrage câte elemente sunt

9704
07:31:53,600 --> 07:31:58,878
în listă.

9705
07:31:55,440 --> 07:32:03,840
Așa că am vrut să vă arăt că asta

9706
07:31:58,878 --> 07:32:07,120
codul ne spune lungimea listei

9707
07:32:03,840 --> 07:32:08,638
care ar fi dacă am face lungimea mea

9708
07:32:07,120 --> 07:32:11,360
lista.

9709
07:32:08,638 --> 07:32:14,398
Da. Len. Deci trecem asta în

9710
07:32:11,360 --> 07:32:16,718
functie de lungime. Trecem în lista mea, um

9711
07:32:14,398 --> 07:32:20,760
care ar trebui să ne dea 10. Deci sunt 10

9712
07:32:16,718 --> 07:32:20,760
articole din această listă.

9713
07:32:25,920 --> 07:32:30,240
Așa că am vrut doar să spun că există

9714
07:32:28,478 --> 07:32:33,398
această funcție de lungime pe care o putem face

9715
07:32:30,240 --> 07:32:33,398
lista.

9716
07:32:35,840 --> 07:32:41,320
Puteți afișa numerele de index de tipărire pentru

9717
07:32:38,160 --> 07:32:41,320
lista?

9718
07:32:43,040 --> 07:32:49,160
Cum vrei să spui un uh fiecare număr în

9719
07:32:45,920 --> 07:32:49,160
indicele lui?

9720
07:32:50,320 --> 07:32:54,958
Vrei să spui că fiecare număr și ei

9721
07:32:52,638 --> 07:32:57,920
index? Da. Deci codul care face asta

9722
07:32:54,958 --> 07:33:00,878
este funcția de enumerare și noi noi

9723
07:32:57,920 --> 07:33:04,398
ar folosi o buclă. Așa ar fi

9724
07:33:00,878 --> 07:33:08,558
ceva de genul pentru index

9725
07:33:04,398 --> 07:33:14,398
um valoare în enumerare

9726
07:33:08,558 --> 07:33:16,558
uh lista mea și apoi am putea tipări

9727
07:33:14,398 --> 07:33:20,040
uh index

9728
07:33:16,558 --> 07:33:20,040
și valoare

9729
07:33:24,718 --> 07:33:29,360
asa

9730
07:33:27,600 --> 07:33:30,638
știi că nu am învățat acest Noi

9731
07:33:29,360 --> 07:33:33,680
nu am învățat încă nimic din toate acestea, dar

9732
07:33:30,638 --> 07:33:36,680
asta e ceea ce face.

9733
07:33:33,680 --> 07:33:36,680
Da.

9734
07:33:50,000 --> 07:33:57,600
bine,

9735
07:33:52,558 --> 07:34:00,478
misto. Hai să vedem. Deci, în sfârșit, ce am

9736
07:33:57,600 --> 07:34:03,840
am vrut să arătăm este că putem adăuga. Deci

9737
07:34:00,478 --> 07:34:05,920
dacă ne luăm lista, asta este

9738
07:34:03,840 --> 07:34:08,398
în prezent este

9739
07:34:05,920 --> 07:34:09,920
și apoi anexăm un element nou pe care îl putem

9740
07:34:08,398 --> 07:34:12,000
tipăriți lista și puteți vedea cum

9741
07:34:09,920 --> 07:34:14,160
ajunge la final. Deci luăm asta

9742
07:34:12,000 --> 07:34:18,398
lista originală și doar adăugăm una nouă

9743
07:34:14,160 --> 07:34:20,398
element la sfârșit. Hm și apoi asta de

9744
07:34:18,398 --> 07:34:24,878
așa cum nu am făcut-o, nu ne-am explicat

9745
07:34:20,398 --> 07:34:28,240
acest lucru, dar eliminați va găsi acea valoare

9746
07:34:24,878 --> 07:34:31,200
găsiți valoarea 100 și eliminați-o din

9747
07:34:28,240 --> 07:34:33,120
lista. Îl va găsi pe primul

9748
07:34:31,200 --> 07:34:36,320
apariția.

9749
07:34:33,120 --> 07:34:39,760
Da. Deci, eliminați va găsi primul

9750
07:34:36,320 --> 07:34:44,000
apariția acestei valori. Pop este index

9751
07:34:39,760 --> 07:34:47,440
bazat. Eliminarea se bazează pe valoare. Deci eliminați

9752
07:34:44,000 --> 07:34:52,320
va căuta cei 100 și ia asta

9753
07:34:47,440 --> 07:34:56,798
din listă. Dar pop va fi

9754
07:34:52,320 --> 07:35:02,000
bazat pe index. Deci dacă facem, um

9755
07:34:56,798 --> 07:35:05,600
dacă facem acest lucru, pop se bazează pe index. Deci noi

9756
07:35:02,000 --> 07:35:09,200
mi-ar putea face lista.pop

9757
07:35:05,600 --> 07:35:13,040
pop și am putea trece într-un zero care

9758
07:35:09,200 --> 07:35:15,840
ar trebui să elimine um acest lucru va elimina

9759
07:35:13,040 --> 07:35:21,478
primul element

9760
07:35:15,840 --> 07:35:21,478
și apoi putem tipări lista mea.

9761
07:35:21,520 --> 07:35:25,558
Deci, a eliminat cele 25.

9762
07:35:30,958 --> 07:35:35,760
Îndepărtează totul? Nu, cred că este doar

9763
07:35:33,360 --> 07:35:36,878
prima apariție.

9764
07:35:35,760 --> 07:35:38,160
Aceasta este prima apariție. Ai fi avut

9765
07:35:36,878 --> 07:35:41,160
să o faci de mai multe ori dacă ai

9766
07:35:38,160 --> 07:35:41,160
duplicate.

9767
07:35:42,398 --> 07:35:48,360
Cred că trebuie să verific asta, dar

9768
07:35:44,398 --> 07:35:48,360
Cred că este doar prima apariție.

9769
07:35:52,478 --> 07:35:56,000
Bine. În regulă. Deci, știu că suntem un

9770
07:35:54,160 --> 07:35:59,040
minut peste.

9771
07:35:56,000 --> 07:36:01,280
Vă mulțumesc mult, băieți. Ce grozav

9772
07:35:59,040 --> 07:36:03,680
primele două sesiuni. Hm, cred

9773
07:36:01,280 --> 07:36:05,840
înțelegem asta foarte bine. Deci

9774
07:36:03,680 --> 07:36:08,398
treaba foarte buna. O mulțime de întrebări grozave,

9775
07:36:05,840 --> 07:36:09,920
foarte bine, înainte și înapoi. Deci eu

9776
07:36:08,398 --> 07:36:12,240
apreciez asta. Sper că sunteți

9777
07:36:09,920 --> 07:36:14,718
învățând și ridicând acest Python ca

9778
07:36:12,240 --> 07:36:18,240
mergem împreună. Mai avem mult de făcut

9779
07:36:14,718 --> 07:36:21,040
acoperire. Deci știi data viitoare când ne întâlnim

9780
07:36:18,240 --> 07:36:22,478
știi că vom continua să vorbim

9781
07:36:21,040 --> 07:36:24,558
despre celelalte structuri de date. Deci noi

9782
07:36:22,478 --> 07:36:26,478
trebuie să vorbesc despre seturi, tupile,

9783
07:36:24,558 --> 07:36:30,478
dicționare și apoi trebuie să obținem

9784
07:36:26,478 --> 07:36:32,080
în bucle uh și declarații if else și

9785
07:36:30,478 --> 07:36:34,398
apoi ne vom strădui până la urmă

9786
07:36:32,080 --> 07:36:38,320
funcții. Deci, mult mai mult de acoperit, dar

9787
07:36:34,398 --> 07:36:40,240
vom ajunge acolo. Hm, și dar sperăm

9788
07:36:38,320 --> 07:36:42,718
voi învățați multe. Oricare

9789
07:36:40,240 --> 07:36:45,200
teme de facut? Nu formal, dar eu

9790
07:36:42,718 --> 07:36:48,398
v-ar cere să lucrați la

9791
07:36:45,200 --> 07:36:51,440
practică ghidată pentru lecția unu. Lucrați la

9792
07:36:48,398 --> 07:36:53,120
practica ghidată pentru lecția unu dacă

9793
07:36:51,440 --> 07:36:55,040
poti.

9794
07:36:53,120 --> 07:36:58,240
Bine? Deci, intrați în referința dvs

9795
07:36:55,040 --> 07:37:00,398
materiale, găsiți practicile ghidate,

9796
07:36:58,240 --> 07:37:02,718
lucrați la lecția unu practică ghidată

9797
07:37:00,398 --> 07:37:04,798
între acum și următoarea noastră sesiune.

9798
07:37:02,718 --> 07:37:06,478
Vă mulțumesc băieți. Multumesc mult. Uh

9799
07:37:04,798 --> 07:37:08,638
multumesc pentru ca stiu aceste 4 ore

9800
07:37:06,478 --> 07:37:11,440
sesiunile sunt multe. Apreciază-ți

9801
07:37:08,638 --> 07:37:13,680
rabdare. Multumesc mult.

9802
07:37:11,440 --> 07:37:15,600
Să aveți un rest minunat al săptămânii.

9803
07:37:13,680 --> 07:37:17,360
>> Deci s-ar putea să vă întrebați ce s-a schimbat

9804
07:37:15,600 --> 07:37:19,760
în învățarea automată și de ce este

9805
07:37:17,360 --> 07:37:22,080
cel mai bun moment pentru a intra acum. Ei bine,

9806
07:37:19,760 --> 07:37:23,760
să ne întoarcem câțiva ani. În trecut,

9807
07:37:22,080 --> 07:37:26,398
Învățarea automată a fost mai mult despre construirea

9808
07:37:23,760 --> 07:37:28,240
modele bazate pe date istorice. A fost

9809
07:37:26,398 --> 07:37:30,160
despre antrenamentul algoritmilor pentru a prezice

9810
07:37:28,240 --> 07:37:32,478
rezultate specifice, cum ar fi clasificarea

9811
07:37:30,160 --> 07:37:34,558
e-mailuri, spam sau nu spam, prezicerea

9812
07:37:32,478 --> 07:37:37,280
prețurile caselor pe baza datelor anterioare. Dar

9813
07:37:34,558 --> 07:37:39,520
înainte rapid până în 2026 și peisaj

9814
07:37:37,280 --> 07:37:40,798
s-a schimbat dramatic. Astăzi, mașină

9815
07:37:39,520 --> 07:37:42,638
învățarea nu înseamnă doar a face

9816
07:37:40,798 --> 07:37:44,878
previziuni. Este vorba despre sisteme de construcție

9817
07:37:42,638 --> 07:37:46,558
care poate învăța, adapta și îmbunătăți

9818
07:37:44,878 --> 07:37:48,320
timp. Nu mai creăm

9819
07:37:46,558 --> 07:37:50,878
algoritmi pentru a rula doar experimente

9820
07:37:48,320 --> 07:37:52,398
offline. Acum, sisteme de învățare automată

9821
07:37:50,878 --> 07:37:54,558
sunt integrate în lumea reală

9822
07:37:52,398 --> 07:37:56,320
operațiuni și sunt capabile să facă

9823
07:37:54,558 --> 07:37:58,638
decizii care afectează afacerea

9824
07:37:56,320 --> 07:38:00,958
imediat. Iată un exemplu de făcut

9825
07:37:58,638 --> 07:38:02,718
este mai clar. În trecut, un e-commerce

9826
07:38:00,958 --> 07:38:04,638
site-ul web ar putea folosi învățarea automată pentru

9827
07:38:02,718 --> 07:38:07,200
preziceți ce produse ar putea un client

9828
07:38:04,638 --> 07:38:09,360
doresc pe baza achizițiilor lor anterioare. Acum,

9829
07:38:07,200 --> 07:38:11,680
sistemele pot învăța în mod constant de la

9830
07:38:09,360 --> 07:38:13,600
date noi despre clienți, rafinare continuă

9831
07:38:11,680 --> 07:38:15,920
acele previziuni în timp real ca

9832
07:38:13,600 --> 07:38:17,600
preferințele clienților se schimbă. The

9833
07:38:15,920 --> 07:38:19,760
lumea învățării automate a evoluat

9834
07:38:17,600 --> 07:38:21,280
de la teorie la practică și aceasta are

9835
07:38:19,760 --> 07:38:23,120
a creat o cerere uriașă pentru mașini

9836
07:38:21,280 --> 07:38:25,120
învăţând ingineri care pot construi

9837
07:38:23,120 --> 07:38:27,280
sisteme scalabile și să le facă să funcționeze

9838
07:38:25,120 --> 07:38:29,280
medii din lumea reală. Impactul de

9839
07:38:27,280 --> 07:38:31,200
Învățarea automată este acum direct legată de

9840
07:38:29,280 --> 07:38:32,718
rezultatele afacerii și învățarea automată

9841
07:38:31,200 --> 07:38:35,120
inginerii sunt în centrul acestui lucru

9842
07:38:32,718 --> 07:38:36,878
transformare. S-ar putea să te gândești

9843
07:38:35,120 --> 07:38:39,040
bine, înțeleg, învățarea automată este

9844
07:38:36,878 --> 07:38:40,798
de impact, dar ce înseamnă exact a

9845
07:38:39,040 --> 07:38:42,478
inginer de învățare automată face în comparație cu

9846
07:38:40,798 --> 07:38:44,320
alte roluri în tehnologie? E grozav

9847
07:38:42,478 --> 07:38:46,080
întrebare. În lumea mașinilor

9848
07:38:44,320 --> 07:38:48,718
învățând, veți auzi despre câteva chei

9849
07:38:46,080 --> 07:38:50,798
roluri cum ar fi data scientist, mașină

9850
07:38:48,718 --> 07:38:52,558
învățare și inginer AI. Hai să ne spargem

9851
07:38:50,798 --> 07:38:54,878
jos, astfel încât să știi exact unde ești

9852
07:38:52,558 --> 07:38:57,040
se potrivesc. Oamenii de știință de date sunt ca

9853
07:38:54,878 --> 07:38:59,520
detectivi de date. Ei își petrec

9854
07:38:57,040 --> 07:39:01,440
timp analiza seturi mari de date, găsirea

9855
07:38:59,520 --> 07:39:04,160
tendințe și încercând să extragă sens

9856
07:39:01,440 --> 07:39:05,840
perspective. Ei construiesc modele, dar lor

9857
07:39:04,160 --> 07:39:07,680
accentul principal este de obicei pe date

9858
07:39:05,840 --> 07:39:09,840
explorare și experimentare

9859
07:39:07,680 --> 07:39:12,000
diverși algoritmi. De obicei, nu

9860
07:39:09,840 --> 07:39:13,680
concentrați-vă pe implementarea acelor modele în

9861
07:39:12,000 --> 07:39:15,840
medii de producție. Masina

9862
07:39:13,680 --> 07:39:17,840
inginerii de învăţare, pe de altă parte

9863
07:39:15,840 --> 07:39:19,760
aceștia sunt arhitecți. Ei iau

9864
07:39:17,840 --> 07:39:22,398
modele construite de oamenii de știință ai datelor și

9865
07:39:19,760 --> 07:39:24,320
construiți sisteme implementabile scalabile. Ei

9866
07:39:22,398 --> 07:39:26,638
lucrează la crearea de soluții care nu vor

9867
07:39:24,320 --> 07:39:28,558
funcționează doar pe termen scurt, dar poate și

9868
07:39:26,638 --> 07:39:30,478
scala pentru a gestiona datele din lumea reală

9869
07:39:28,558 --> 07:39:32,478
volume masive. Învățarea automată

9870
07:39:30,478 --> 07:39:34,240
inginerul este responsabil pentru asigurarea

9871
07:39:32,478 --> 07:39:36,558
că sistemele de învățare automată sunt

9872
07:39:34,240 --> 07:39:38,638
integrate în afaceri care pot funcționa

9873
07:39:36,558 --> 07:39:40,558
perfect cu tehnologiile existente.

9874
07:39:38,638 --> 07:39:42,558
Inginerii AI se concentrează mai mult pe

9875
07:39:40,558 --> 07:39:45,040
partea aplicativă a lucrurilor. Ei construiesc

9876
07:39:42,558 --> 07:39:47,520
Produse bazate pe inteligență artificială, cum ar fi chatbot, voce

9877
07:39:45,040 --> 07:39:49,440
asistenți și sisteme în timp real. în timp ce

9878
07:39:47,520 --> 07:39:51,280
munca lor se suprapune adesea cu ML

9879
07:39:49,440 --> 07:39:53,280
ingineri, de obicei sunt mai mulți

9880
07:39:51,280 --> 07:39:55,280
concentrat pe produsul orientat spre utilizator și

9881
07:39:53,280 --> 07:39:57,600
cum se încadrează învățarea automată în ea. Ca un

9882
07:39:55,280 --> 07:39:59,440
Inginer ML, obiectivul tău principal este să

9883
07:39:57,600 --> 07:40:01,360
luați modele și transformați-le în

9884
07:39:59,440 --> 07:40:03,680
soluții acționabile care sunt implementate

9885
07:40:01,360 --> 07:40:05,760
în sistemele lumii reale. Acum ne vom muta

9886
07:40:03,680 --> 07:40:07,760
de ce 2026 este momentul potrivit

9887
07:40:05,760 --> 07:40:09,520
intra în învățarea automată. Acum că tu

9888
07:40:07,760 --> 07:40:11,760
cunoaștem rolul unui inginer ML, haideți

9889
07:40:09,520 --> 07:40:14,080
vorbiți despre de ce 2026 este momentul perfect

9890
07:40:11,760 --> 07:40:15,760
pentru ca tu să sari pe teren. Ai

9891
07:40:14,080 --> 07:40:17,760
probabil am auzit că învățarea automată este

9892
07:40:15,760 --> 07:40:19,440
un subiect fierbinte, dar pentru ce înseamnă asta

9893
07:40:17,760 --> 07:40:21,360
tu ca cineva care a început în asta

9894
07:40:19,440 --> 07:40:23,840
domeniu? Deci, te voi ajuta să descompaniezi asta

9895
07:40:21,360 --> 07:40:26,080
pentru tine. În primul rând, cererea de ML

9896
07:40:23,840 --> 07:40:28,478
inginerii a crescut vertiginos. Lumea este

9897
07:40:26,080 --> 07:40:30,240
plin de probleme care trebuie rezolvate și

9898
07:40:28,478 --> 07:40:32,320
învățarea automată s-a dovedit a fi una dintre

9899
07:40:30,240 --> 07:40:34,718
cele mai eficiente instrumente pentru a le rezolva.

9900
07:40:32,320 --> 07:40:36,638
De la prezicerea preferințelor clienților până la

9901
07:40:34,718 --> 07:40:38,080
automatizarea funcțiilor critice de afaceri,

9902
07:40:36,638 --> 07:40:40,478
învățarea automată schimbă modul în care

9903
07:40:38,080 --> 07:40:42,080
afacerile operează. În al doilea rând, instrumentele

9904
07:40:40,478 --> 07:40:44,718
folosit pentru a construi sisteme de învățare automată

9905
07:40:42,080 --> 07:40:46,718
sunt mai accesibile decât oricând. În

9906
07:40:44,718 --> 07:40:48,478
în trecut, învățarea automată era privită ca

9907
07:40:46,718 --> 07:40:50,558
ceva experimental, ceva care

9908
07:40:48,478 --> 07:40:52,478
a necesitat mult efort doar pentru a se instala.

9909
07:40:50,558 --> 07:40:54,958
Dar astăzi platformele de învățare automată și

9910
07:40:52,478 --> 07:40:56,558
cadre precum TensorFlow, PyTorch

9911
07:40:54,958 --> 07:40:58,798
și Scikitlearn s-au maturizat

9912
07:40:56,558 --> 07:41:00,878
semnificativ. Aceste instrumente o fac

9913
07:40:58,798 --> 07:41:03,040
mai ușor de construit și implementat modele care

9914
07:41:00,878 --> 07:41:04,798
poate scala pentru a gestiona datele din lumea reală. Noi

9915
07:41:03,040 --> 07:41:06,320
Vom trece acum la de ce este acesta

9916
07:41:04,798 --> 07:41:08,478
momentul potrivit pentru a începe ca

9917
07:41:06,320 --> 07:41:10,558
un inginer de învățare automată. Deci cum

9918
07:41:08,478 --> 07:41:12,398
ai inceput? Primul pas este să

9919
07:41:10,558 --> 07:41:14,320
construi o fundație puternică. S-ar putea să fii

9920
07:41:12,398 --> 07:41:16,398
încântat să înceapă construirea modelelor și

9921
07:41:14,320 --> 07:41:18,000
scufundarea în algoritmi. Dar înainte de asta

9922
07:41:16,398 --> 07:41:19,520
trebuie să înțelegeți conceptele de bază

9923
07:41:18,000 --> 07:41:22,558
care conduc toată învățarea automată

9924
07:41:19,520 --> 07:41:24,878
sisteme. Acestea includ matematica,

9925
07:41:22,558 --> 07:41:26,398
programare și manipulare a datelor. Tu nu

9926
07:41:24,878 --> 07:41:28,080
trebuie să fii un expert în toate acestea

9927
07:41:26,398 --> 07:41:29,600
zone, dar trebuie să înțelegeți

9928
07:41:28,080 --> 07:41:31,120
elementele de bază. Gândiți-vă la acestea ca la o clădire

9929
07:41:29,600 --> 07:41:32,718
blocuri din tot ceea ce veți avea nevoie

9930
07:41:31,120 --> 07:41:34,718
pentru a învăța învățarea automată. Să începem

9931
07:41:32,718 --> 07:41:36,478
cu matematica. Nu trebuie să fii un

9932
07:41:34,718 --> 07:41:38,798
geniu în matematică, dar trebuie

9933
07:41:36,478 --> 07:41:40,798
înțelege elementele de bază. Sunt trei

9934
07:41:38,798 --> 07:41:42,958
principalele domenii ale matematicii care te vor ajuta

9935
07:41:40,798 --> 07:41:45,680
începeți ca inginer ML și

9936
07:41:42,958 --> 07:41:47,920
acestea sunt algebră liniară. Acesta este

9937
07:41:45,680 --> 07:41:50,320
studiul vectorilor şi matricelor care sunt

9938
07:41:47,920 --> 07:41:52,320
folosit pentru a manipula și prelucra date în

9939
07:41:50,320 --> 07:41:54,240
modele de învățare automată. Dacă ai

9940
07:41:52,320 --> 07:41:56,958
au auzit termeni precum vectori caracteristici sau

9941
07:41:54,240 --> 07:41:59,040
operații cu matrice, adică algebră liniară

9942
07:41:56,958 --> 07:42:01,280
joacă. Acesta este miezul modului în care mașina

9943
07:41:59,040 --> 07:42:03,520
funcţionează algoritmii de învăţare. Acesta este

9944
07:42:01,280 --> 07:42:05,760
matematică în spatele modelelor de optimizare. Vei

9945
07:42:03,520 --> 07:42:08,240
utilizați calculul pentru a ajusta parametrii

9946
07:42:05,760 --> 07:42:10,000
modele de învățare automată și minimizați

9947
07:42:08,240 --> 07:42:12,638
eroare între prezis și real

9948
07:42:10,000 --> 07:42:14,558
valorile. Mai exact, derivatele sunt

9949
07:42:12,638 --> 07:42:16,958
folosit pentru a găsi cea mai bună modalitate de a se potrivi unui model

9950
07:42:14,558 --> 07:42:18,558
în date. Statistici. Masina

9951
07:42:16,958 --> 07:42:20,798
învățarea înseamnă lucrul cu

9952
07:42:18,558 --> 07:42:22,240
incertitudinea, iar statisticile vor ajuta

9953
07:42:20,798 --> 07:42:23,920
ii dai sens. Fie că ești

9954
07:42:22,240 --> 07:42:26,478
care se ocupă de distribuțiile de probabilitate

9955
07:42:23,920 --> 07:42:28,798
sau testarea ipotezelor, statisticile pot

9956
07:42:26,478 --> 07:42:30,398
vă ajută să înțelegeți tiparele în date și

9957
07:42:28,798 --> 07:42:32,718
ia decizii cu incertitudine

9958
07:42:30,398 --> 07:42:34,638
informaţii. Aceste concepte matematice

9959
07:42:32,718 --> 07:42:37,200
vă va ajuta să construiți o imagine mai precisă

9960
07:42:34,638 --> 07:42:39,200
modelați și optimizați-l eficient. hai sa

9961
07:42:37,200 --> 07:42:41,600
treceți la stiva de programare. Dacă ești

9962
07:42:39,200 --> 07:42:43,200
nou în programare, nu vă faceți griji. Python

9963
07:42:41,600 --> 07:42:45,120
este limba pe care o vei dori

9964
07:42:43,200 --> 07:42:47,280
învăţa. Este simplu să începeți

9965
07:42:45,120 --> 07:42:48,718
și are un ecosistem imens de biblioteci

9966
07:42:47,280 --> 07:42:50,478
special conceput pentru mașină

9967
07:42:48,718 --> 07:42:53,360
învăţarea. Bibliotecile cheie pe care le aveți

9968
07:42:50,478 --> 07:42:55,600
va trebui să stăpânească include NumPy. Aceasta

9969
07:42:53,360 --> 07:42:57,840
biblioteca este folosită pentru a gestiona matrice mari

9970
07:42:55,600 --> 07:42:59,360
de matrici și date care este

9971
07:42:57,840 --> 07:43:01,520
coloana vertebrală a majorității învățării automate

9972
07:42:59,360 --> 07:43:03,840
algoritmi. Dacă intenționați să lucrați cu

9973
07:43:01,520 --> 07:43:06,398
seturi mari de date, veți folosi NumPy a

9974
07:43:03,840 --> 07:43:08,878
lot. panda. Această bibliotecă este grozavă pentru

9975
07:43:06,398 --> 07:43:11,120
manipularea și analiza datelor. Vei

9976
07:43:08,878 --> 07:43:12,878
folosește panda pentru a curăța, a organiza și

9977
07:43:11,120 --> 07:43:15,360
transforma datele, pregătindu-le pentru

9978
07:43:12,878 --> 07:43:17,680
modele de învățare automată. Scikitlearn.

9979
07:43:15,360 --> 07:43:19,440
Această bibliotecă oferă simplu, ușor de utilizat

9980
07:43:17,680 --> 07:43:21,920
utilizați instrumente pentru construirea învățării automate

9981
07:43:19,440 --> 07:43:24,240
modele. Acoperă totul, de la date

9982
07:43:21,920 --> 07:43:26,240
modele de procesare pregătitoare precum regresia

9983
07:43:24,240 --> 07:43:27,840
si clasificare. Odată ce ești

9984
07:43:26,240 --> 07:43:29,440
confortabil cu aceste instrumente, vei fi

9985
07:43:27,840 --> 07:43:31,760
capabil să înceapă să construiască învățarea automată

9986
07:43:29,440 --> 07:43:33,840
modele și lucrul cu date din lumea reală.

9987
07:43:31,760 --> 07:43:36,240
Următorul este SQL, care înseamnă

9988
07:43:33,840 --> 07:43:38,160
limbaj de interogare structurat. Ca ML

9989
07:43:36,240 --> 07:43:40,638
inginer, vei lucra la multe

9990
07:43:38,160 --> 07:43:42,558
date, iar SQL vă va ajuta să interogați

9991
07:43:40,638 --> 07:43:44,718
baze de date pentru a prelua informații care

9992
07:43:42,558 --> 07:43:46,798
ai nevoie. Veți folosi SQL pentru a extrage

9993
07:43:44,718 --> 07:43:48,718
date, filtrează-le și unește tabele

9994
07:43:46,798 --> 07:43:50,958
împreună, asigurându-vă că aveți

9995
07:43:48,718 --> 07:43:52,638
date corecte modelelor dvs. Odată ce ai

9996
07:43:50,958 --> 07:43:55,040
datele dvs., următorul pas sunt datele

9997
07:43:52,638 --> 07:43:56,958
ceartă. Conflictul de date este o parte importantă

9998
07:43:55,040 --> 07:43:58,320
de meseria ta, iar dacă o stăpânești, ea

9999
07:43:56,958 --> 07:44:00,478
vă va economisi mult timp și

10000
07:43:58,320 --> 07:44:02,240
frustrare în timp ce construiesc modele. Noi

10001
07:44:00,478 --> 07:44:04,240
va trece acum la tipurile de mașini

10002
07:44:02,240 --> 07:44:05,920
învăţarea. Să vorbim despre diferit

10003
07:44:04,240 --> 07:44:07,680
tipuri de învățare automată. Există

10004
07:44:05,920 --> 07:44:09,680
trei categorii principale care sunt

10005
07:44:07,680 --> 07:44:11,840
învăţare supravegheată, nesupravegheată

10006
07:44:09,680 --> 07:44:14,080
învăţare şi învăţare prin întărire.

10007
07:44:11,840 --> 07:44:16,320
Apropo de învățare supravegheată, asta este

10008
07:44:14,080 --> 07:44:18,478
când aveți date de etichetă. Îți antrenezi

10009
07:44:16,320 --> 07:44:20,958
model pe date unde sunt răspunsurile

10010
07:44:18,478 --> 07:44:22,878
deja cunoscute. Scopul este pentru model

10011
07:44:20,958 --> 07:44:24,718
pentru a învăța relația dintre intrări

10012
07:44:22,878 --> 07:44:27,520
și ieșiri astfel încât să poată prezice viitorul

10013
07:44:24,718 --> 07:44:29,280
rezultate. Învățare nesupravegheată. In aceasta

10014
07:44:27,520 --> 07:44:31,200
caz, modelul funcționează cu neetichetat

10015
07:44:29,280 --> 07:44:33,600
date și încearcă să găsească ascunse

10016
07:44:31,200 --> 07:44:35,680
modele și grupări în date. Aceasta

10017
07:44:33,600 --> 07:44:37,680
este util pentru sarcini precum gruparea sau

10018
07:44:35,680 --> 07:44:39,760
detectarea anomaliilor. Întărire

10019
07:44:37,680 --> 07:44:42,160
învăţarea. Acest tip de învățare implică

10020
07:44:39,760 --> 07:44:43,920
instruirea unui agent pentru a lua decizii prin

10021
07:44:42,160 --> 07:44:46,160
interacționând cu mediul său și

10022
07:44:43,920 --> 07:44:48,558
primirea de recompense sau penalități pe baza

10023
07:44:46,160 --> 07:44:51,120
acțiunile sale. Acesta este adesea folosit în joc

10024
07:44:48,558 --> 07:44:53,200
AI sau robotică. Acum vom trece la

10025
07:44:51,120 --> 07:44:55,040
inginerie și evaluare a caracteristicilor.

10026
07:44:53,200 --> 07:44:57,120
După curățarea datelor, următorul pas

10027
07:44:55,040 --> 07:44:59,120
este ingineria caracteristicilor. Acesta este

10028
07:44:57,120 --> 07:45:01,040
procesul de transformare a datelor brute în

10029
07:44:59,120 --> 07:45:03,200
caracteristici semnificative care vă ajută modelul

10030
07:45:01,040 --> 07:45:05,120
face previziuni mai bune. Odată ce ai făcut-o

10031
07:45:03,200 --> 07:45:07,440
ți-ai proiectat caracteristicile, este timpul să

10032
07:45:05,120 --> 07:45:10,320
evalua modelul. Veți folosi valori

10033
07:45:07,440 --> 07:45:12,478
cum ar fi acuratețea, precizia și amintirea

10034
07:45:10,320 --> 07:45:14,320
vezi cât de bine funcționează modelul tău.

10035
07:45:12,478 --> 07:45:15,840
Evaluarea corectă asigură că dvs

10036
07:45:14,320 --> 07:45:18,080
modelul este pregătit pentru lumea reală

10037
07:45:15,840 --> 07:45:20,080
aplicații și că poate gestiona date

10038
07:45:18,080 --> 07:45:21,760
in productie. Acum vom trece la

10039
07:45:20,080 --> 07:45:24,638
planul de șase luni de învățare pentru a

10040
07:45:21,760 --> 07:45:26,478
deveni inginer ML în 2026. Deci, cum

10041
07:45:24,638 --> 07:45:28,080
chiar ai inceput? Aici e al tău

10042
07:45:26,478 --> 07:45:30,478
plan de învățare de șase luni pentru a vă ghida

10043
07:45:28,080 --> 07:45:33,440
călătorie. În primul rând, concentrați-vă pe învățare

10044
07:45:30,478 --> 07:45:35,440
Python, matematică și SQL. Scufundă-te în

10045
07:45:33,440 --> 07:45:37,920
algoritmi de învățare automată și practică

10046
07:45:35,440 --> 07:45:39,840
proiecte. Apoi, învață învățarea profundă și

10047
07:45:37,920 --> 07:45:42,398
lucrați cu cadre precum TensorFlow sau

10048
07:45:39,840 --> 07:45:44,320
PyTorch. Până în luna a șasea, poți

10049
07:45:42,398 --> 07:45:46,080
lucrați la un proiect capstone care acoperă

10050
07:45:44,320 --> 07:45:48,718
întregul canal de colectare a datelor

10051
07:45:46,080 --> 07:45:51,440
la desfășurare. Vom vorbi acum despre

10052
07:45:48,718 --> 07:45:52,878
stiva de instrumente ML Engineer. Deci haideți

10053
07:45:51,440 --> 07:45:54,958
vorbește despre instrumentele de care vei avea nevoie

10054
07:45:52,878 --> 07:45:56,718
ca inginer de învățare automată. Trebuie

10055
07:45:54,958 --> 07:45:58,320
mă întreb ce instrumente ar trebui să fiu

10056
07:45:56,718 --> 07:46:00,958
învăţând să devii un ML de succes

10057
07:45:58,320 --> 07:46:03,120
inginer în 2026. Deci să simplificăm

10058
07:46:00,958 --> 07:46:05,120
aceasta. Git și GitHub sunt primele

10059
07:46:03,120 --> 07:46:06,638
lucruri de pe lista ta. La prima vedere,

10060
07:46:05,120 --> 07:46:08,320
controlul versiunilor ar putea părea

10061
07:46:06,638 --> 07:46:10,478
ceva de care doar codificatorii trebuie să-și facă griji

10062
07:46:08,320 --> 07:46:13,280
despre. Cu toate acestea, poate fi cu adevărat

10063
07:46:10,478 --> 07:46:15,120
crucial. De ce? Pentru că controlul versiunilor

10064
07:46:13,280 --> 07:46:17,280
vă permite să urmăriți fiecare modificare care

10065
07:46:15,120 --> 07:46:19,440
faceți la codul dvs., colaborați cu

10066
07:46:17,280 --> 07:46:21,280
echipe și anulați modificările dacă

10067
07:46:19,440 --> 07:46:22,958
ceva nu merge bine. Imaginează-ți că ești

10068
07:46:21,280 --> 07:46:25,200
lucrezi la un proiect uriaș și te încurci

10069
07:46:22,958 --> 07:46:27,840
ceva în sus. Fără controlul versiunii,

10070
07:46:25,200 --> 07:46:29,680
ai putea pierde ore de muncă. Dar cu

10071
07:46:27,840 --> 07:46:32,398
Git și GitHub, ai putea să te întorci și

10072
07:46:29,680 --> 07:46:34,160
reparați în orice moment și moment. S-ar putea să fii

10073
07:46:32,398 --> 07:46:35,760
gândindu-mă, bine, înțeleg că Git este

10074
07:46:34,160 --> 07:46:37,520
util, dar cum rămâne cu instrumentele care

10075
07:46:35,760 --> 07:46:39,760
chiar mă poate ajuta să construiesc și să implementez

10076
07:46:37,520 --> 07:46:41,760
modele de învățare automată? Acum, asta este un

10077
07:46:39,760 --> 07:46:44,240
mare intrebare. Deci hai să vorbim despre

10078
07:46:41,760 --> 07:46:46,558
platforme cloud precum AWS, Google Cloud,

10079
07:46:44,240 --> 07:46:48,798
și Azure. În trecut, învățarea automată

10080
07:46:46,558 --> 07:46:51,040
modelele au fost adesea construite și testate

10081
07:46:48,798 --> 07:46:53,280
mașini locale, dar ne-am dat repede seama

10082
07:46:51,040 --> 07:46:55,520
că nu era scalabil. Aceste nor

10083
07:46:53,280 --> 07:46:57,440
platformele vă oferă capacitatea de a gestiona

10084
07:46:55,520 --> 07:46:59,920
seturi mari de date, rulați modele

10085
07:46:57,440 --> 07:47:02,240
servere superioare și scalați-le ca

10086
07:46:59,920 --> 07:47:04,000
proiectele tale cresc. În loc să te bazezi

10087
07:47:02,240 --> 07:47:05,920
pe laptopul dvs. personal pentru a face toate

10088
07:47:04,000 --> 07:47:08,240
ridicare grele, puteți profita de

10089
07:47:05,920 --> 07:47:09,840
cloud pentru a antrena modele mult mai rapid și

10090
07:47:08,240 --> 07:47:12,080
gestionează seturi masive de date fără

10091
07:47:09,840 --> 07:47:13,600
îngrijorarea cu privire la limitările de memorie. Noi

10092
07:47:12,080 --> 07:47:16,160
va trece acum la subiectul următor

10093
07:47:13,600 --> 07:47:18,558
care se află pe ciclul de viață MLOps. ai

10094
07:47:16,160 --> 07:47:20,320
acum ai toate instrumentele la locul tău. Dar

10095
07:47:18,558 --> 07:47:22,798
cum treci de la toate aceste instrumente

10096
07:47:20,320 --> 07:47:24,878
reunindu-se în ciclul de viață MLOps.

10097
07:47:22,798 --> 07:47:26,878
Deci trebuie să vă întrebați ce face totul

10098
07:47:24,878 --> 07:47:29,120
dintre instrumentele ciclului de viață MLOps chiar arată

10099
07:47:26,878 --> 07:47:31,520
like și cum gestionez procesul

10100
07:47:29,120 --> 07:47:33,840
de la inceput pana la sfarsit? Ei bine, iată

10101
07:47:31,520 --> 07:47:36,000
chestia. MLOps este ca un bine uns

10102
07:47:33,840 --> 07:47:37,840
mașină. Ea presupune o serie de etape

10103
07:47:36,000 --> 07:47:40,558
care vă asigură că modelele dvs. rămân

10104
07:47:37,840 --> 07:47:42,878
fiabil, scalabil și adaptabil la nou

10105
07:47:40,558 --> 07:47:45,440
date de-a lungul timpului. Gândește-te la asta ca la o mașină

10106
07:47:42,878 --> 07:47:47,120
linie de asamblare. În primul rând, antrenezi mașina

10107
07:47:45,440 --> 07:47:49,120
și apoi îl implementezi în real

10108
07:47:47,120 --> 07:47:51,280
lume. După aceea, trebuie să monitorizați

10109
07:47:49,120 --> 07:47:52,718
și vezi dacă merge bine. Dacă este

10110
07:47:51,280 --> 07:47:55,200
se defectează, va trebui să vă reantrenați

10111
07:47:52,718 --> 07:47:57,280
ea. Să o împărțim în pași cheie.

10112
07:47:55,200 --> 07:47:59,040
Antrenează-ți modelul. Aici este locul în care tu

10113
07:47:57,280 --> 07:48:01,520
creați modelul folosind antrenamentul dvs

10114
07:47:59,040 --> 07:48:03,440
date. Aceasta este o fază foarte experimentală

10115
07:48:01,520 --> 07:48:05,760
unde încerci diferiți algoritmi,

10116
07:48:03,440 --> 07:48:08,320
ajustați parametrii și optimizați modelul

10117
07:48:05,760 --> 07:48:10,478
pentru o performanță mai bună. Implementându-l la

10118
07:48:08,320 --> 07:48:12,958
producție. Acum că modelul tău este

10119
07:48:10,478 --> 07:48:15,040
gata, este timpul să-l puneți în acțiune.

10120
07:48:12,958 --> 07:48:17,520
Aceasta înseamnă punerea la dispoziție a modelului

10121
07:48:15,040 --> 07:48:19,840
utilizatori sau clienți. Fie că este într-un

10122
07:48:17,520 --> 07:48:22,240
aplicație mobilă sau un serviciu web, implementare

10123
07:48:19,840 --> 07:48:24,638
este locul unde se întâmplă magia. Monitorizare

10124
07:48:22,240 --> 07:48:26,320
performanta. Odată ce modelul tău este live,

10125
07:48:24,638 --> 07:48:28,080
nu poți pur și simplu să uiți de asta. Este

10126
07:48:26,320 --> 07:48:30,160
cum ar fi verificarea presiunii în pneurile mașinii

10127
07:48:28,080 --> 07:48:32,160
după ce a fost pe drum de ceva vreme.

10128
07:48:30,160 --> 07:48:34,320
Trebuie să urmăriți continuu cât de bine

10129
07:48:32,160 --> 07:48:36,398
modelul tău merge. Dacă începe să

10130
07:48:34,320 --> 07:48:39,040
alunecare sau subperformanță, este timpul pentru

10131
07:48:36,398 --> 07:48:41,600
ajustări și ajustări. În cele din urmă, avem

10132
07:48:39,040 --> 07:48:43,600
recalificare. În timp, modelul dvs. poate

10133
07:48:41,600 --> 07:48:45,840
trebuie să fie reinstruit cu date noi pentru

10134
07:48:43,600 --> 07:48:47,760
rămâne precis. Acest lucru este mai ales adevărat

10135
07:48:45,840 --> 07:48:50,398
în industriile în care mediul este

10136
07:48:47,760 --> 07:48:52,558
în continuă schimbare precum comerțul electronic sau

10137
07:48:50,398 --> 07:48:54,718
finante. Reținerea asigură că

10138
07:48:52,558 --> 07:48:57,040
modelul rămâne relevant și continuă

10139
07:48:54,718 --> 07:48:59,040
oferi valoare. S-ar putea să vă întrebați asta

10140
07:48:57,040 --> 07:49:01,360
asta sună a multă muncă și

10141
07:48:59,040 --> 07:49:03,280
este adevărat. Aici instrumentele MLOps

10142
07:49:01,360 --> 07:49:06,000
precum MLS vă ajută să simplificați acest lucru

10143
07:49:03,280 --> 07:49:08,000
proces. Prin automatizarea și gestionarea acestui lucru

10144
07:49:06,000 --> 07:49:09,680
ciclului de viață, puteți petrece mai puțin timp

10145
07:49:08,000 --> 07:49:11,120
de-a face cu back-end-ul și mai mult timp

10146
07:49:09,680 --> 07:49:13,120
concentrându-se pe construirea inovatoare

10147
07:49:11,120 --> 07:49:15,520
solutii. Acum vom trece la

10148
07:49:13,120 --> 07:49:17,120
urmărirea experimentului. Pe măsură ce te scufunzi mai adânc

10149
07:49:15,520 --> 07:49:19,120
în învățarea automată, veți ajunge rapid

10150
07:49:17,120 --> 07:49:21,520
realizați cât de important este să urmăriți

10151
07:49:19,120 --> 07:49:23,760
experimentele tale. La început, acest lucru ar putea

10152
07:49:21,520 --> 07:49:25,840
par un pic copleșitor. S-ar putea să fii

10153
07:49:23,760 --> 07:49:28,160
gândindu-mă, nu pot doar să conduc un model și

10154
07:49:25,840 --> 07:49:29,920
sper la bine, nu? Dar crede-ma,

10155
07:49:28,160 --> 07:49:31,680
urmărirea experimentelor dvs. este una dintre cele

10156
07:49:29,920 --> 07:49:33,760
cele mai bune obiceiuri pe care le poți dezvolta devreme

10157
07:49:31,680 --> 07:49:35,600
pe. Gândiți-vă la asta ca la înregistrarea dvs

10158
07:49:33,760 --> 07:49:37,280
progresul antrenamentului. Chiar dacă nu o faci

10159
07:49:35,600 --> 07:49:39,200
urmăriți rezultatele, de unde veți ști

10160
07:49:37,280 --> 07:49:41,360
daca te imbunatatesti sau nu? The

10161
07:49:39,200 --> 07:49:43,440
același lucru este valabil și pentru învățarea automată. Prin utilizarea

10162
07:49:41,360 --> 07:49:45,600
fluxul de instrumente de urmărire a experimentelor și

10163
07:49:43,440 --> 07:49:47,840
ponderi și părtiniri, puteți păstra a

10164
07:49:45,600 --> 07:49:50,080
înregistrarea detaliată a fiecărui model și a fiecărui model

10165
07:49:47,840 --> 07:49:52,320
hiperparametru și fiecare evaluare

10166
07:49:50,080 --> 07:49:54,080
metrica. Acum imaginați-vă că construiți un

10167
07:49:52,320 --> 07:49:56,478
sistem de recomandare pentru un online

10168
07:49:54,080 --> 07:49:59,040
magazin. Încercați diferite ajustări,

10169
07:49:56,478 --> 07:50:01,040
algoritmi și obțineți rezultate diferite.

10170
07:49:59,040 --> 07:50:03,360
Cu urmărirea experimentului, puteți cu ușurință

10171
07:50:01,040 --> 07:50:04,878
comparați configurațiile care funcționează cel mai bine.

10172
07:50:03,360 --> 07:50:06,958
Puteți compara cu ușurință care

10173
07:50:04,878 --> 07:50:09,120
configurațiile funcționează cel mai bine și învață din

10174
07:50:06,958 --> 07:50:10,638
greșelile din trecut. Vei ști mereu

10175
07:50:09,120 --> 07:50:12,718
care experiment vă oferă cel mai bun

10176
07:50:10,638 --> 07:50:14,558
rezultate și care necesită ajustări.

10177
07:50:12,718 --> 07:50:16,398
Urmărirea experimentelor ajută și la

10178
07:50:14,558 --> 07:50:18,478
colaborare. Dacă lucrezi cu

10179
07:50:16,398 --> 07:50:20,478
echipa, putând să le vadă pe ale tuturor

10180
07:50:18,478 --> 07:50:22,398
experimentele într-un singur loc facilitează

10181
07:50:20,478 --> 07:50:24,320
pentru a le înțelege abordarea și a construi

10182
07:50:22,398 --> 07:50:26,718
asupra muncii celuilalt. Acum ne vom muta

10183
07:50:24,320 --> 07:50:28,478
la proiecte și portofoliu. Acum că

10184
07:50:26,718 --> 07:50:30,558
ai instrumentele și fluxul de lucru

10185
07:50:28,478 --> 07:50:32,878
loc, este timpul să ne concentrăm pe construirea unui

10186
07:50:30,558 --> 07:50:34,878
portofoliu puternic. S-ar putea să te gândești,

10187
07:50:32,878 --> 07:50:37,120
cum îmi fac portofoliul în evidență

10188
07:50:34,878 --> 07:50:39,600
potenţiali angajaţi? E grozav

10189
07:50:37,120 --> 07:50:42,080
întrebare. Răspunsul este simplu. Real

10190
07:50:39,600 --> 07:50:44,240
proiecte mondiale. Gândește-te la asta.

10191
07:50:42,080 --> 07:50:46,160
Angajatorii vor să vadă ce puteți face

10192
07:50:44,240 --> 07:50:47,760
practica. Ei nu vor doar să vadă

10193
07:50:46,160 --> 07:50:49,760
cunoștințe teoretice. Vor să vadă

10194
07:50:47,760 --> 07:50:51,280
pe care le poți rezolva probleme și construi

10195
07:50:49,760 --> 07:50:53,920
sisteme de lucru care pot face a

10196
07:50:51,280 --> 07:50:56,320
diferenta. Deci, din acest motiv, avem

10197
07:50:53,920 --> 07:50:57,840
exemple de mini proiecte. În acest moment,

10198
07:50:56,320 --> 07:51:00,320
probabil că ai mâncărime să începi

10199
07:50:57,840 --> 07:51:02,080
construind singur ceva. Ei bine,

10200
07:51:00,320 --> 07:51:04,320
proiectele practice sunt cea mai bună modalitate de a

10201
07:51:02,080 --> 07:51:06,558
consolidați ceea ce ați învățat deja.

10202
07:51:04,320 --> 07:51:09,040
De exemplu, puteți crea un client

10203
07:51:06,558 --> 07:51:11,760
model de predicție a abandonului sau o fraudă

10204
07:51:09,040 --> 07:51:13,440
sistem de detectare. Acestea sunt practice

10205
07:51:11,760 --> 07:51:15,760
proiecte din lumea reală care demonstrează

10206
07:51:13,440 --> 07:51:18,558
capacitatea ta de a construi soluții din

10207
07:51:15,760 --> 07:51:20,878
începe până la sfârșit. Asigurați-vă că vă documentați

10208
07:51:18,558 --> 07:51:23,120
proiectele tale în mod clar pe GitHub și

10209
07:51:20,878 --> 07:51:25,680
includeți întotdeauna o explicație detaliată a

10210
07:51:23,120 --> 07:51:27,760
abordarea, provocările și rezultatele dvs.

10211
07:51:25,680 --> 07:51:29,600
Ține minte, scopul este să arăți că tu

10212
07:51:27,760 --> 07:51:31,520
înțelegeți problema și construiți a

10213
07:51:29,600 --> 07:51:34,240
solutie de lucru. Acum vom trece la

10214
07:51:31,520 --> 07:51:36,080
Kaggle și open source. Pe măsură ce continui

10215
07:51:34,240 --> 07:51:37,680
pentru a-ți construi portofoliul, am foarte mult

10216
07:51:36,080 --> 07:51:39,680
recomandăm scufundarea în Kaggle

10217
07:51:37,680 --> 07:51:42,160
concursuri și contribuind la deschidere

10218
07:51:39,680 --> 07:51:43,840
proiecte sursă. Kaggle este uimitor

10219
07:51:42,160 --> 07:51:46,080
platformă unde poți lucra pe real

10220
07:51:43,840 --> 07:51:48,080
seturi de date mondiale și rezolva probleme care

10221
07:51:46,080 --> 07:51:50,478
companiile şi instituţiile de cercetare sunt

10222
07:51:48,080 --> 07:51:52,240
cu fața. Nu numai că vă veți îmbunătăți

10223
07:51:50,478 --> 07:51:53,920
abilități, dar vei avea și

10224
07:51:52,240 --> 07:51:55,200
oportunitate de a vedea cum datele de top

10225
07:51:53,920 --> 07:51:57,440
oamenii de știință și învățarea automată

10226
07:51:55,200 --> 07:51:59,600
inginerii abordează probleme similare.

10227
07:51:57,440 --> 07:52:01,440
Contribuția la proiecte open-source este

10228
07:51:59,600 --> 07:52:03,760
un alt mod excelent de a vă prezenta

10229
07:52:01,440 --> 07:52:05,760
aptitudini. Arată că poți lucra bine

10230
07:52:03,760 --> 07:52:08,320
cu alții înțelegând existența

10231
07:52:05,760 --> 07:52:09,840
sisteme și contribuie la comunitate.

10232
07:52:08,320 --> 07:52:11,600
În plus, este o modalitate grozavă de a câștiga

10233
07:52:09,840 --> 07:52:13,680
vizibilitate și face legături cu

10234
07:52:11,600 --> 07:52:15,760
alti ingineri. Vom vorbi acum

10235
07:52:13,680 --> 07:52:17,680
despre CV-urile care funcționează pentru dvs.

10236
07:52:15,760 --> 07:52:19,200
Vorbind despre CV-ul tău, când acesta

10237
07:52:17,680 --> 07:52:21,360
ajunge să obțină un loc de muncă ca mașină

10238
07:52:19,200 --> 07:52:23,440
inginer de învățare, CV-ul dvs. trebuie

10239
07:52:21,360 --> 07:52:26,000
să fie concentrat pe proiecte din lumea reală și

10240
07:52:23,440 --> 07:52:27,360
experiență practică. Deci, asigurați-vă că

10241
07:52:26,000 --> 07:52:29,520
evidențiați proiectele pe care le aveți

10242
07:52:27,360 --> 07:52:31,360
la care ați lucrat, instrumentele pe care le-ați folosit și

10243
07:52:29,520 --> 07:52:33,280
cel mai important, impactul pe care dvs

10244
07:52:31,360 --> 07:52:35,040
munca a avut. Dacă construiți un

10245
07:52:33,280 --> 07:52:37,520
motor de recomandare care a sporit

10246
07:52:35,040 --> 07:52:39,680
vânzările de produse cu 20%, asigurați-vă că dvs

10247
07:52:37,520 --> 07:52:41,440
include asta. Angajatorii vor să vadă cum

10248
07:52:39,680 --> 07:52:43,440
munca ta contribuie la rezolvarea reală

10249
07:52:41,440 --> 07:52:45,440
probleme de afaceri. Nu uita

10250
07:52:43,440 --> 07:52:47,200
include link-uri către profilul Kaggle sau oricare

10251
07:52:45,440 --> 07:52:50,000
alte contribuții open source pe care dvs

10252
07:52:47,200 --> 07:52:51,760
au făcut. Angajatorilor le place să vadă codul

10253
07:52:50,000 --> 07:52:53,760
și să le arăți proiectele tale este

10254
07:52:51,760 --> 07:52:55,760
cel mai bun mod de a ieși în evidență. Vom face acum

10255
07:52:53,760 --> 07:52:58,638
vorbiți despre ceea ce intervievatorii testează

10256
07:52:55,760 --> 07:53:00,958
2026. Până acum trebuie să vă întrebați ce

10257
07:52:58,638 --> 07:53:03,920
caută de fapt angajatorii într-un ML

10258
07:53:00,958 --> 07:53:05,680
inginer. Deci în 2026 interviurile nu sunt

10259
07:53:03,920 --> 07:53:07,440
doar despre cunoștințe tehnice.

10260
07:53:05,680 --> 07:53:09,280
Angajatorii vor doar să vadă cât de bine ești

10261
07:53:07,440 --> 07:53:11,680
vă poate comunica procesul de gândire și

10262
07:53:09,280 --> 07:53:13,520
probleme din lumea reală. Probabil te vei confrunta

10263
07:53:11,680 --> 07:53:16,000
teste practice care te provoacă

10264
07:53:13,520 --> 07:53:18,398
construiți un model sau analizați datele în realitate

10265
07:53:16,000 --> 07:53:20,398
timp. De asemenea, veți fi testat cât de bine

10266
07:53:18,398 --> 07:53:22,558
explicați abordarea dvs. și justificați

10267
07:53:20,398 --> 07:53:25,200
deciziile pe care le-ați luat în timpul

10268
07:53:22,558 --> 07:53:27,280
proiect. Pregătiți-vă să discutați lucruri precum

10269
07:53:25,200 --> 07:53:30,320
de ce alegeți un anumit algoritm pentru

10270
07:53:27,280 --> 07:53:33,600
o problemă sau modul în care gestionați probleme precum

10271
07:53:30,320 --> 07:53:35,760
dezechilibru sau supraadaptare a datelor împreună cu

10272
07:53:33,600 --> 07:53:38,160
ce valori folosiți pentru a vă evalua

10273
07:53:35,760 --> 07:53:40,558
performanța modelului. Fiind capabil

10274
07:53:38,160 --> 07:53:42,398
comunicați clar procesul dvs. și cum

10275
07:53:40,558 --> 07:53:43,760
ai ajuns la soluția ta este o abilitate

10276
07:53:42,398 --> 07:53:46,080
care te va deosebi de ceilalți

10277
07:53:43,760 --> 07:53:48,240
candidaţilor. Vom vorbi acum despre

10278
07:53:46,080 --> 07:53:50,240
Tendințele ML pe care va trebui să le urmați.

10279
07:53:48,240 --> 07:53:52,398
Învățarea automată evoluează rapid și

10280
07:53:50,240 --> 07:53:54,638
a rămâne la curent este cheia pentru a rămâne

10281
07:53:52,398 --> 07:53:57,760
relevante în acest domeniu. Deci iată o

10282
07:53:54,638 --> 07:54:00,160
câteva tendințe de urmărit în 2026.

10283
07:53:57,760 --> 07:54:02,398
Modele generative. Aceste modele pot

10284
07:54:00,160 --> 07:54:04,398
generează date noi pe baza modelelor pe care le au

10285
07:54:02,398 --> 07:54:06,958
învață și sunt folosiți pentru lucruri precum

10286
07:54:04,398 --> 07:54:10,320
generarea de text, crearea de imagini și

10287
07:54:06,958 --> 07:54:11,840
chiar și compoziție muzicală. AutoML automatizat

10288
07:54:10,320 --> 07:54:13,920
instrumentele de învățare automată o fac

10289
07:54:11,840 --> 07:54:16,478
mai ușor pentru neexperți să construiască mașini

10290
07:54:13,920 --> 07:54:18,160
modele de învățare. Ca rezultat, mai mult

10291
07:54:16,478 --> 07:54:19,760
oamenii vor putea contribui la

10292
07:54:18,160 --> 07:54:22,320
acest domeniu fără a fi nevoie să devină

10293
07:54:19,760 --> 07:54:24,320
experți. Modelele de confidențialitate în primul rând. Ca

10294
07:54:22,320 --> 07:54:26,000
preocupările legate de confidențialitate cresc, învățarea automată

10295
07:54:24,320 --> 07:54:28,638
modelele sunt proiectate pentru a funcționa

10296
07:54:26,000 --> 07:54:31,440
în mod sigur și etic, iar acestea nu

10297
07:54:28,638 --> 07:54:33,360
compromiterea confidențialității utilizatorilor. Rămâi mai departe

10298
07:54:31,440 --> 07:54:35,360
topul acestor tendințe vă va ajuta să rămâneți

10299
07:54:33,360 --> 07:54:38,080
competitiv și inovator în veci

10300
07:54:35,360 --> 07:54:40,478
domeniu în evoluție al învățării automate. Deci

10301
07:54:38,080 --> 07:54:42,718
în concluzie, voi spune că consistența este

10302
07:54:40,478 --> 07:54:44,478
cheie în învățarea automată. Nu ai nevoie

10303
07:54:42,718 --> 07:54:46,240
să știi totul imediat, dar tu

10304
07:54:44,478 --> 07:54:48,240
trebuie să rămână dedicat învățării și

10305
07:54:46,240 --> 07:54:50,558
clădire. Începe cu mic, păstrează

10306
07:54:48,240 --> 07:54:52,080
experimentează și continuă să te îmbunătățești. The

10307
07:54:50,558 --> 07:54:53,840
drumul spre a deveni un machine learning

10308
07:54:52,080 --> 07:54:55,840
inginer poate părea lung, dar cu

10309
07:54:53,840 --> 07:54:57,680
instrumentele și mentalitatea potrivite, puteți obține

10310
07:54:55,840 --> 07:54:59,040
acolo. Mulțumesc pentru vizionare și o voi face

10311
07:54:57,680 --> 07:55:00,478
ne vedem in urmatoarea. Multumesc pentru

10312
07:54:59,040 --> 07:55:02,878
urmărind inginerul de învățare automată

10313
07:55:00,478 --> 07:55:04,558
foaie de parcurs pentru 2026. Sperăm că aceasta

10314
07:55:02,878 --> 07:55:07,040
videoclipul ți-a oferit o cale clară spre a deveni

10315
07:55:04,558 --> 07:55:09,040
un inginer ML de succes. Gata de luat

10316
07:55:07,040 --> 07:55:10,718
următorul pas? Explorați Simply Lance

10317
07:55:09,040 --> 07:55:12,080
certificat profesional în IA și

10318
07:55:10,718 --> 07:55:14,000
machine learning în parteneriat cu

10319
07:55:12,080 --> 07:55:15,680
Universitatea Purdue. Câștigă hands-on

10320
07:55:14,000 --> 07:55:17,360
experiență și industrie recunoscute

10321
07:55:15,680 --> 07:55:20,638
acreditări pentru a vă stimula cariera.

10322
07:55:17,360 --> 07:55:22,798
>> Învățarea automată este un subset al

10323
07:55:20,638 --> 07:55:26,478
inteligenta artificiala, nu? Asta e

10324
07:55:22,798 --> 07:55:28,080
practic, mașinile care învață de la

10325
07:55:26,478 --> 07:55:30,878
date

10326
07:55:28,080 --> 07:55:34,080
pentru a lua decizii

10327
07:55:30,878 --> 07:55:37,360
în esență. Um, deci asta a fost mare

10328
07:55:34,080 --> 07:55:39,680
abatere de la sistemele bazate pe reguli

10329
07:55:37,360 --> 07:55:42,080
la acea vreme, corect, asta erau în mod explicit

10330
07:55:39,680 --> 07:55:45,440
programat pentru a lua decizii. Deci doar

10331
07:55:42,080 --> 07:55:47,520
Gândește-te la un exemplu ca unul cu adevărat mare

10332
07:55:45,440 --> 07:55:50,160
cam dacă asta, atunci aia, atunci aia,

10333
07:55:47,520 --> 07:55:52,798
apoi asta, și altfel dacă asta, asta,

10334
07:55:50,160 --> 07:55:56,080
asta, nu? Deci o grămadă de reguli care aveau

10335
07:55:52,798 --> 07:55:58,878
să fie preprogramat pentru a veni

10336
07:55:56,080 --> 07:56:00,080
afară cu un răspuns final. Uh, cu

10337
07:55:58,878 --> 07:56:01,680
machine learning, este exact

10338
07:56:00,080 --> 07:56:03,760
opusul acela. suntem de fapt

10339
07:56:01,680 --> 07:56:06,958
antrenând ceva din exemple din

10340
07:56:03,760 --> 07:56:10,000
datele existente pentru a prezice

10341
07:56:06,958 --> 07:56:12,638
ceva sau um

10342
07:56:10,000 --> 07:56:14,320
ia un fel de decizie. Uh și așa

10343
07:56:12,638 --> 07:56:16,240
vom învăța despre diverse

10344
07:56:14,320 --> 07:56:18,798
moduri în care putem face învățarea automată. Dar dacă

10345
07:56:16,240 --> 07:56:20,638
voi băieți vă amintiți de noi

10346
07:56:18,798 --> 07:56:23,680
am vorbit despre unele dintre acestea, cum ar fi

10347
07:56:20,638 --> 07:56:26,000
diferențe și practic

10348
07:56:23,680 --> 07:56:30,160
abordări bazate pe reguli pentru a învăța din

10349
07:56:26,000 --> 07:56:32,558
abordarea datelor. Hm și în inclus în

10350
07:56:30,160 --> 07:56:34,160
asta va fi complex

10351
07:56:32,558 --> 07:56:37,120
date nestructurate. Deci lucruri de genul

10352
07:56:34,160 --> 07:56:40,478
imagini, text, audio. Ce se ocupă de acestea

10353
07:56:37,120 --> 07:56:43,840
foarte bine este învățarea profundă pe care noi

10354
07:56:40,478 --> 07:56:46,798
va ajunge la curs după aceasta.

10355
07:56:43,840 --> 07:56:51,360
Dar aia sunt cu siguranță acolo ca

10356
07:56:46,798 --> 07:56:53,760
învățând din date chiar și date complexe.

10357
07:56:51,360 --> 07:56:55,280
Deci am avut această poză și cred

10358
07:56:53,760 --> 07:56:59,840
asta e cam de unde am plecat

10359
07:56:55,280 --> 07:57:01,280
data trecută a fost doar o distincție

10360
07:56:59,840 --> 07:57:03,120
între cei trei termeni. Vedem noi

10361
07:57:01,280 --> 07:57:04,478
inteligență artificială, învățare profundă

10362
07:57:03,120 --> 07:57:05,840
iar învățarea automată este folosită

10363
07:57:04,478 --> 07:57:08,000
interschimbabil, dar chiar așa este

10364
07:57:05,840 --> 07:57:11,600
se potrivesc. Inteligenţa artificială este

10365
07:57:08,000 --> 07:57:15,280
un fel de ceva larg care imită umanul

10366
07:57:11,600 --> 07:57:17,760
inteligență. Hm, care nu trebuie

10367
07:57:15,280 --> 07:57:20,240
să înveți din date, dar mașină

10368
07:57:17,760 --> 07:57:22,160
învățarea face parte din asta. Și apoi um

10369
07:57:20,240 --> 07:57:24,478
o modalitate de a realiza învățarea automată

10370
07:57:22,160 --> 07:57:28,160
este de a folosi rețele neuronale care este punctul central

10371
07:57:24,478 --> 07:57:29,760
de învățare profundă. Hm și atât de adânc

10372
07:57:28,160 --> 07:57:32,798
învățarea a fost găsită o mulțime de

10373
07:57:29,760 --> 07:57:35,360
succes mai ales recent cu uh

10374
07:57:32,798 --> 07:57:38,240
acele tipuri de date complexe, cum ar fi imaginile,

10375
07:57:35,360 --> 07:57:40,398
vorbire, text, nu? Atât de învățare profundă

10376
07:57:38,240 --> 07:57:43,520
folosit peste tot. Chiar și în um

10377
07:57:40,398 --> 07:57:46,558
modern precum IA generativă, vedem profund

10378
07:57:43,520 --> 07:57:49,520
învăţarea folosită destul de mult. Um, chiar

10379
07:57:46,558 --> 07:57:52,000
orice folosește rețele neuronale este uh

10380
07:57:49,520 --> 07:57:53,520
va fi o învățare profundă.

10381
07:57:52,000 --> 07:57:56,000
Hm

10382
07:57:53,520 --> 07:57:57,120
și din nou ne vom concentra asupra asta mai târziu, dar

10383
07:57:56,000 --> 07:57:59,200
ne vom concentra în principal asupra

10384
07:57:57,120 --> 07:58:01,120
învățarea automată pentru acest curs

10385
07:57:59,200 --> 07:58:04,080
în primul rând învățarea automată care nu

10386
07:58:01,120 --> 07:58:07,840
utilizați rețele neuronale. Bine, doar modele

10387
07:58:04,080 --> 07:58:11,240
care nu sunt neapărat rețele neuronale

10388
07:58:07,840 --> 07:58:11,240
fii focusul nostru.

10389
07:58:11,680 --> 07:58:19,360
Deci, în învățarea automată, am avut un exemplu

10390
07:58:14,080 --> 07:58:23,760
a unui joc, în esență, învăț

10391
07:58:19,360 --> 07:58:26,398
ce decizii să iau pe baza

10392
07:58:23,760 --> 07:58:29,520
uh, un fel de stare actuală a

10393
07:58:26,398 --> 07:58:32,798
bord. Acesta ar putea fi un um, știi

10394
07:58:29,520 --> 07:58:35,600
exemplu de învățare automată pe care îl învață

10395
07:58:32,798 --> 07:58:38,000
din multe exemple anterioare. Deci multe

10396
07:58:35,600 --> 07:58:42,000
datele din jurul acestor jocuri sunt folosite pentru

10397
07:58:38,000 --> 07:58:43,840
antrenează astfel de roboți care pot

10398
07:58:42,000 --> 07:58:46,398
jucați aceste jocuri și jucați-le într-un mod foarte

10399
07:58:43,840 --> 07:58:48,718
nivel înalt. Deci au fost multe

10400
07:58:46,398 --> 07:58:51,840
succese de fapt în învățarea automată

10401
07:58:48,718 --> 07:58:56,240
și învățarea profundă în jur

10402
07:58:51,840 --> 07:58:58,320
uh jucând jocuri precum șah sau go

10403
07:58:56,240 --> 07:59:01,120
um folosind algoritmi de învățare automată. Deci

10404
07:58:58,320 --> 07:59:02,240
destul de misto.

10405
07:59:01,120 --> 07:59:03,600
În regulă. Deci cred că aici este locul în care noi

10406
07:59:02,240 --> 07:59:05,680
s-a încheiat. Ultima dată când am spus că există o

10407
07:59:03,600 --> 07:59:08,798
o mulțime de cazuri de utilizare diferite pentru mașină

10408
07:59:05,680 --> 07:59:10,080
învăţarea. Deci sistemul de recomandare este

10409
07:59:08,798 --> 07:59:12,878
va fi unul mare și vom face

10410
07:59:10,080 --> 07:59:15,920
de fapt studiază asta într-unul dintre noi

10411
07:59:12,878 --> 07:59:18,160
lecțiile finale ale acestui curs. Um chat

10412
07:59:15,920 --> 07:59:20,398
roboților le place AI generativ care face sentimente

10413
07:59:18,160 --> 07:59:22,558
analiză chat bot-i vom studia mai târziu dar

10414
07:59:20,398 --> 07:59:25,920
acestea sunt cu siguranță o aplicație a

10415
07:59:22,558 --> 07:59:28,160
învățând din date pentru a uh

10416
07:59:25,920 --> 07:59:30,878
generați răspunsuri la solicitările text

10417
07:59:28,160 --> 07:59:33,520
corect. Filtrarea spam-ului e bună

10418
07:59:30,878 --> 07:59:37,280
exemplu, cum ar fi clasificarea unui e-mail ca

10419
07:59:33,520 --> 07:59:40,478
spam sau nu spam. Hm, asta devine

10420
07:59:37,280 --> 07:59:44,000
instruit din exemple și învățare

10421
07:59:40,478 --> 07:59:46,798
din date precum e-mailurile anterioare. Hm

10422
07:59:44,000 --> 07:59:52,478
analiza postărilor din rețelele sociale este alta

10423
07:59:46,798 --> 07:59:54,958
un fel de date text, un caz de utilizare, dar tu

10424
07:59:52,478 --> 07:59:58,160
poti face multe cu acel text ca si tine

10425
07:59:54,958 --> 08:00:01,680
preziceți sentimentul pe care îl puteți prezice

10426
07:59:58,160 --> 08:00:04,478
uh categoria a ceea ce este postul

10427
08:00:01,680 --> 08:00:07,280
vorbind despre astfel de lucruri

10428
08:00:04,478 --> 08:00:09,200
totul se poate face cu machine learning

10429
08:00:07,280 --> 08:00:11,840
>> și multe alte cazuri de utilizare care nu se referă la asta

10430
08:00:09,200 --> 08:00:16,360
lista pe care o vom acoperi

10431
08:00:11,840 --> 08:00:16,360
>> știi cum noi, pe măsură ce mergem mai departe.

10432
08:00:22,478 --> 08:00:28,398
Bine, deci aici am plecat

10433
08:00:24,798 --> 08:00:31,040
oprit. Um, deci ce face atât de greu

10434
08:00:28,398 --> 08:00:32,878
munca aici este

10435
08:00:31,040 --> 08:00:36,160
>> uh algoritmi de învățare automată. Deci astea

10436
08:00:32,878 --> 08:00:39,360
sunt lucruri care vor um acestea sunt lucruri

10437
08:00:36,160 --> 08:00:44,080
care va învăța din date. Deci ei

10438
08:00:39,360 --> 08:00:48,160
sunt uh ei sunt practic um

10439
08:00:44,080 --> 08:00:49,680
algoritmi sau seturi de reguli care uh sau

10440
08:00:48,160 --> 08:00:51,360
reguli matematice ar trebui să spun că nu

10441
08:00:49,680 --> 08:00:54,638
reguli formale ca în sensul de

10442
08:00:51,360 --> 08:00:57,760
un sistem de reguli dar matematic um

10443
08:00:54,638 --> 08:01:01,200
formule și reguli matematice

10444
08:00:57,760 --> 08:01:03,760
în esență, care ne ajută să învățăm din

10445
08:01:01,200 --> 08:01:06,320
date. Deci corelează datele cu unele

10446
08:01:03,760 --> 08:01:09,040
tip de rezultat. Deci un fel de

10447
08:01:06,320 --> 08:01:10,718
prezice uh dacă asta va fi

10448
08:01:09,040 --> 08:01:13,120
după cum vom vedea dacă asta ar putea fi

10449
08:01:10,718 --> 08:01:16,320
ca un număr așa cum prezicem a

10450
08:01:13,120 --> 08:01:18,718
preț sau cerere sau vânzări

10451
08:01:16,320 --> 08:01:21,680
um sau ar putea fi o categorie ca este

10452
08:01:18,718 --> 08:01:23,520
această tranzacție fraudă sau nu fraudă sau

10453
08:01:21,680 --> 08:01:27,280
care este probabilitatea ca asta să fie

10454
08:01:23,520 --> 08:01:28,558
fraudă, deci avem diferite tipuri de

10455
08:01:27,280 --> 08:01:30,160
predicții pe care le putem face cu mașina

10456
08:01:28,558 --> 08:01:31,680
învăţarea.

10457
08:01:30,160 --> 08:01:34,320
Hm

10458
08:01:31,680 --> 08:01:37,760
dar vom studia tipul de

10459
08:01:34,320 --> 08:01:39,600
diferențele dintre cele care apar. Hm dar

10460
08:01:37,760 --> 08:01:41,680
algoritmii de învățare automată sunt cu adevărat

10461
08:01:39,600 --> 08:01:42,958
ce putere sunt modelele,

10462
08:01:41,680 --> 08:01:46,240
nu? Ele sunt modelele care ajută

10463
08:01:42,958 --> 08:01:48,320
puterea uh machine learning să de fapt

10464
08:01:46,240 --> 08:01:50,240
invata din date.

10465
08:01:48,320 --> 08:01:53,040
Deci vom petrece mult timp în

10466
08:01:50,240 --> 08:01:54,798
acest curs studiind acei algoritmi

10467
08:01:53,040 --> 08:01:56,958
ca diferitele modele pe care le putem

10468
08:01:54,798 --> 08:01:58,240
construi și care sunt diferențele lor,

10469
08:01:56,958 --> 08:02:00,718
care sunt punctele lor forte, care sunt

10470
08:01:58,240 --> 08:02:03,878
punctele slabe sunt. vom învăța multe

10471
08:02:00,718 --> 08:02:03,878
despre acelea.

10472
08:02:04,638 --> 08:02:09,360
Bine. Deci, cred că vă puteți imagina

10473
08:02:06,558 --> 08:02:12,398
totul este atât de dependent de date, nu?

10474
08:02:09,360 --> 08:02:14,878
Învățăm din date. Deci, uh

10475
08:02:12,398 --> 08:02:16,798
are sens că calitatea datelor

10476
08:02:14,878 --> 08:02:19,680
chiar contează aici

10477
08:02:16,798 --> 08:02:22,958
determinând cât de puternic poate fi modelul.

10478
08:02:19,680 --> 08:02:27,440
Așa că vezi acest grafic aici grafic

10479
08:02:22,958 --> 08:02:31,520
un fel de date de înaltă calitate um

10480
08:02:27,440 --> 08:02:34,240
față de orice date vechi, dar decente

10481
08:02:31,520 --> 08:02:36,398
cantitate suficientă din ea. Poți să vezi

10482
08:02:34,240 --> 08:02:40,240
that performance and the performance is

10483
08:02:36,398 --> 08:02:42,958
measured by some evaluation metric. um,

10484
08:02:40,240 --> 08:02:44,638
so think of it as uh something like an

10485
08:02:42,958 --> 08:02:47,440
precizie. Like if we were predicting

10486
08:02:44,638 --> 08:02:50,878
fraud or not fraud, how accurate can our

10487
08:02:47,440 --> 08:02:53,680
model get at actually detecting fraud

10488
08:02:50,878 --> 08:02:56,398
um it gets better and better and better

10489
08:02:53,680 --> 08:02:59,040
the graph shows that the higher quality

10490
08:02:56,398 --> 08:03:00,798
a datelor pe care le avem. Deci există un fel de

10491
08:02:59,040 --> 08:03:03,840
that there's a there's a saying in

10492
08:03:00,798 --> 08:03:06,160
machine learning um called garbage in

10493
08:03:03,840 --> 08:03:08,478
gunoiul afară. Ceea ce înseamnă asta este dacă tu

10494
08:03:06,160 --> 08:03:11,280
au date slabe, chiar și cel mai bun model din

10495
08:03:08,478 --> 08:03:13,680
lumea, datele slabe nu vor

10496
08:03:11,280 --> 08:03:16,718
rezultă în a avea un model bun care poate

10497
08:03:13,680 --> 08:03:20,000
să fie precis și să funcționeze bine. Um, asa e

10498
08:03:16,718 --> 08:03:21,760
trebuie să fie de înaltă calitate, adică um

10499
08:03:20,000 --> 08:03:24,558
trebuie să existe o cantitate decentă

10500
08:03:21,760 --> 08:03:27,360
și trebuie să fie etichetat corespunzător

10501
08:03:24,558 --> 08:03:30,638
despre care vom vorbi

10502
08:03:27,360 --> 08:03:32,558
și trebuie să nu aibă niciunul, tu

10503
08:03:30,638 --> 08:03:35,440
știu, valori aberante semnificative. trebuie

10504
08:03:32,558 --> 08:03:38,240
fii curat, nu ai acele valori lipsă,

10505
08:03:35,440 --> 08:03:40,320
toate aceste lucruri. Hm, poți tu

10506
08:03:38,240 --> 08:03:44,558
au șanse mari să obțină bine

10507
08:03:40,320 --> 08:03:48,440
predicții din date de calitate superioară

10508
08:03:44,558 --> 08:03:48,440
așa cum arată acest gen.

10509
08:03:49,840 --> 08:03:54,320
Bine.

10510
08:03:52,080 --> 08:03:56,798
Deci, un lucru o să învățăm

10511
08:03:54,320 --> 08:03:58,718
mergem împreună este

10512
08:03:56,798 --> 08:04:01,520
conteaza si cantitatea. Deci, nu numai

10513
08:03:58,718 --> 08:04:02,718
calitate, dar o cantitate decentă din ea. Şi

10514
08:04:01,520 --> 08:04:04,878
um, vom învăța așa ceva

10515
08:04:02,718 --> 08:04:08,478
reguli de bază, cum ar fi câte date am

10516
08:04:04,878 --> 08:04:11,760
nevoie de anumiți algoritmi. Unul

10517
08:04:08,478 --> 08:04:13,440
lucru pe care îl vom vedea este că uh the

10518
08:04:11,760 --> 08:04:16,478
modelele de bază de învățare automată care

10519
08:04:13,440 --> 08:04:19,280
vom studia nu au nevoie de atât de mult ca a

10520
08:04:16,478 --> 08:04:22,638
rețeaua neuronală ar. Știi neural

10521
08:04:19,280 --> 08:04:25,200
rețelele vor necesita mult mai mult

10522
08:04:22,638 --> 08:04:28,000
decât un model de bază de învățare automată

10523
08:04:25,200 --> 08:04:30,478
model de învățare. Deci asta e ceva

10524
08:04:28,000 --> 08:04:32,000
vom vedea pe măsură ce mergem. Dar asta

10525
08:04:30,478 --> 08:04:34,080
este ceva despre care vom vorbi și

10526
08:04:32,000 --> 08:04:36,000
discutăm cu fiecare model pe care îl studiem este

10527
08:04:34,080 --> 08:04:42,040
cam câte date avem de fapt

10528
08:04:36,000 --> 08:04:42,040
trebuie să producă un model de înaltă calitate.

10529
08:04:44,160 --> 08:04:50,440
Bine, vreo întrebare până acum?

10530
08:04:54,798 --> 08:04:59,360
Bine, hai să vorbim despre diferit

10531
08:04:57,440 --> 08:05:01,520
tipuri de învățare automată pe care le avem

10532
08:04:59,360 --> 08:05:03,680
merg sa discutam. Prim, se întâmplă

10533
08:05:01,520 --> 08:05:06,080
fie două primare pe care le vom studia

10534
08:05:03,680 --> 08:05:07,440
în acest curs și apoi încă câteva

10535
08:05:06,080 --> 08:05:10,080
asta va fi un pic mai avansat

10536
08:05:07,440 --> 08:05:11,840
la care nu vom ajunge, dar merită să știm

10537
08:05:10,080 --> 08:05:14,958
despre. Um, deci vor fi patru

10538
08:05:11,840 --> 08:05:18,080
total despre care vom studia sau vorbim și

10539
08:05:14,958 --> 08:05:20,558
vor fi pe această listă aici, adică

10540
08:05:18,080 --> 08:05:23,600
învățarea supravegheată și nesupravegheată

10541
08:05:20,558 --> 08:05:26,638
învăţarea. Acum, aș spune că majoritatea

10542
08:05:23,600 --> 08:05:28,160
concentrarea noastră se va concentra probabil pe supraveghere

10543
08:05:26,638 --> 08:05:32,000
învăţând şi vom vorbi despre ce anume

10544
08:05:28,160 --> 08:05:34,240
înseamnă, dar vom acoperi și nesupravegheat

10545
08:05:32,000 --> 08:05:36,718
învăţarea de asemenea. Și așa, ne vom uita

10546
08:05:34,240 --> 08:05:39,840
cele mai populare tehnici în fiecare dintre

10547
08:05:36,718 --> 08:05:41,600
aceste tipuri de învățare automată.

10548
08:05:39,840 --> 08:05:43,920
um,

10549
08:05:41,600 --> 08:05:45,360
și apoi vom vorbi despre acestea două, dar

10550
08:05:43,920 --> 08:05:48,320
nu le studiezi cu adevărat pentru că sunt

10551
08:05:45,360 --> 08:05:50,718
subiecte mai avansate. Um, asta va fi

10552
08:05:48,320 --> 08:05:54,798
fi dincolo de scopul a ceea ce vom face.

10553
08:05:50,718 --> 08:05:58,160
Dar astea vor fi um

10554
08:05:54,798 --> 08:06:02,080
diferite stiluri de învățare automată

10555
08:05:58,160 --> 08:06:03,680
care vor fi caracterizate de um

10556
08:06:02,080 --> 08:06:06,798
ce fel de predicții fac,

10557
08:06:03,680 --> 08:06:10,478
ce fel de date au nevoie și au nevoie.

10558
08:06:06,798 --> 08:06:14,958
Um și ce fel de rezultate sunt

10559
08:06:10,478 --> 08:06:17,360
producand efectiv. Hm, deci haideți

10560
08:06:14,958 --> 08:06:18,958
intra în fiecare dintre acestea, dar uh the

10561
08:06:17,360 --> 08:06:20,398
unul pe care probabil îl vom petrece

10562
08:06:18,958 --> 08:06:23,280
majoritatea timpului nostru va fi

10563
08:06:20,398 --> 08:06:25,200
învăţare supravegheată, dar vom studia

10564
08:06:23,280 --> 08:06:26,478
învățarea nesupravegheată de asemenea. Vom face

10565
08:06:25,200 --> 08:06:28,638
studiază pe amândouă și vom vorbi despre

10566
08:06:26,478 --> 08:06:31,280
le vom defini pe amândouă

10567
08:06:28,638 --> 08:06:32,638
venind. Și din nou, acestea vor fi a

10568
08:06:31,280 --> 08:06:35,280
subiecte puțin mai avansate decât noi

10569
08:06:32,638 --> 08:06:37,680
nu va petrece prea mult timp.

10570
08:06:35,280 --> 08:06:41,040
Hm, dar vom discuta despre ele

10571
08:06:37,680 --> 08:06:45,240
relevanța în învățarea automată. Hm, și

10572
08:06:41,040 --> 08:06:45,240
da-i o definitie buna.

10573
08:06:48,638 --> 08:06:51,638
Bine.

10574
08:06:51,840 --> 08:06:57,840
În regulă. Să începem cu supravegheat

10575
08:06:54,080 --> 08:07:01,440
învăţarea. Acum asta va fi uh a

10576
08:06:57,840 --> 08:07:06,558
termen la care se referă cu adevărat

10577
08:07:01,440 --> 08:07:10,478
folosind exemple. Deci folosind etichetat

10578
08:07:06,558 --> 08:07:14,638
exemple. Deci aici spunem date etichetate la

10579
08:07:10,478 --> 08:07:18,320
ajută-ne să antreneze modelul. Cu alte cuvinte,

10580
08:07:14,638 --> 08:07:21,680
ajuta modelul nostru să poată prezice ghidat

10581
08:07:18,320 --> 08:07:23,920
prin perechi de intrare-ieșiri specifice. Deci

10582
08:07:21,680 --> 08:07:29,840
supravegheat se referă într-adevăr la fapt

10583
08:07:23,920 --> 08:07:32,558
că avem răspunsuri. Avem exemple.

10584
08:07:29,840 --> 08:07:35,120
Avem răspunsuri cu acelea și folosim

10585
08:07:32,558 --> 08:07:39,040
acea colecție de date pentru a ne construi

10586
08:07:35,120 --> 08:07:42,878
modelați astfel încât să putem prezice

10587
08:07:39,040 --> 08:07:47,040
um genul ăsta de lucruri, cum ar fi un preț,

10588
08:07:42,878 --> 08:07:49,280
ca o categorie, ca un spam, nu spam.

10589
08:07:47,040 --> 08:07:52,000
în acest diapozitiv așa cum am fi noi

10590
08:07:49,280 --> 08:07:54,240
prezicerea dacă această formă este un pătrat, a

10591
08:07:52,000 --> 08:07:58,558
triunghi sau un cerc.

10592
08:07:54,240 --> 08:08:02,798
Hm, dar când construim un model pentru

10593
08:07:58,558 --> 08:08:04,240
că, avem date care au un răspuns

10594
08:08:02,798 --> 08:08:05,360
atasat de el, nu? Am vorbit

10595
08:08:04,240 --> 08:08:10,240
despre asta înainte un pic cu

10596
08:08:05,360 --> 08:08:12,398
etichete. Deci există un ghid acolo

10597
08:08:10,240 --> 08:08:15,440
ne poate ghida spre construirea modelului nostru.

10598
08:08:12,398 --> 08:08:18,478
există un real pentru fiecare exemplu

10599
08:08:15,440 --> 08:08:21,840
are un răspuns și acel răspuns este cu adevărat

10600
08:08:18,478 --> 08:08:26,718
esențial pentru a ajuta la construirea modelului nostru.

10601
08:08:21,840 --> 08:08:31,440
Deci, e aproape ca și tu

10602
08:08:26,718 --> 08:08:33,680
ai o grămadă de exerciții

10603
08:08:31,440 --> 08:08:35,360
în să spunem ca un manual de matematică. tu

10604
08:08:33,680 --> 08:08:38,000
ai o grămadă de exerciții și ai

10605
08:08:35,360 --> 08:08:40,558
răspunsurile și așa poți cam

10606
08:08:38,000 --> 08:08:44,240
verifica-ti munca. te gandesti la model

10607
08:08:40,558 --> 08:08:46,080
antrenament um asta este cu adevărat o mulțime de

10608
08:08:44,240 --> 08:08:49,200
acel proces de antrenament model așa cum suntem noi

10609
08:08:46,080 --> 08:08:51,920
mergi să descoperi este, practic

10610
08:08:49,200 --> 08:08:55,120
verificându-ne munca în raport cu aceste răspunsuri

10611
08:08:51,920 --> 08:08:58,878
în datele noastre în datele noastre de antrenament.

10612
08:08:55,120 --> 08:09:01,120
Bine. Deci, învățarea supravegheată este de orice tip

10613
08:08:58,878 --> 08:09:03,920
de învățare automată care implică

10614
08:09:01,120 --> 08:09:06,878
învăţând din datele etichetate pentru a

10615
08:09:03,920 --> 08:09:09,440
prezice rezultate. Bine. Prezice rezultatele

10616
08:09:06,878 --> 08:09:12,478
ca acum rezultatele pot fi

10617
08:09:09,440 --> 08:09:15,840
numerice. Pot fi ca un preț,

10618
08:09:12,478 --> 08:09:17,920
temperatură, cerere, vânzări, venituri.

10619
08:09:15,840 --> 08:09:20,080
Ele pot fi numerice, dar pot și

10620
08:09:17,920 --> 08:09:22,320
fi categoric. Deci pot fi ca spam-ul

10621
08:09:20,080 --> 08:09:27,200
nu spam, fraudă, nu fraudă, cancer, nu

10622
08:09:22,320 --> 08:09:30,160
cancer. Câine, pisică, girafă, așa ceva

10623
08:09:27,200 --> 08:09:32,558
de categorii. Am putea prezice

10624
08:09:30,160 --> 08:09:34,638
acelea. Este un fel de rezultat. bine,

10625
08:09:32,558 --> 08:09:38,240
un anumit tip de rezultat. Cheia este că suntem

10626
08:09:34,638 --> 08:09:40,798
folosind exemple etichetate pentru a ne ghida

10627
08:09:38,240 --> 08:09:42,958
construirea de modele. De aceea se numește

10628
08:09:40,798 --> 08:09:46,478
învăţare supravegheată.

10629
08:09:42,958 --> 08:09:48,000
Deci știm că în datele noastre știm ce

10630
08:09:46,478 --> 08:09:49,840
intrările sunt. Bineînțeles, acelea merg

10631
08:09:48,000 --> 08:09:53,920
pentru a fi gândit la intrări ca la toate

10632
08:09:49,840 --> 08:09:55,920
coloanele noastre și apoi avem o specială

10633
08:09:53,920 --> 08:09:57,040
coloană etichetă care reprezintă rezultatul

10634
08:09:55,920 --> 08:10:00,160
încercăm să prevedem. Deci dacă te gândești

10635
08:09:57,040 --> 08:10:02,080
despre acele date despre prețul locuințelor, eticheta

10636
08:10:00,160 --> 08:10:04,558
ar putea fi pretul. Și asta e ceva

10637
08:10:02,080 --> 08:10:07,600
am construi un model de prezis, dar

10638
08:10:04,558 --> 08:10:10,240
avem răspunsuri pentru toate exemplele noastre

10639
08:10:07,600 --> 08:10:12,718
în rândurile noastre. Avem răspunsuri de ajutor

10640
08:10:10,240 --> 08:10:14,718
ne ghidează construirea modelului.

10641
08:10:12,718 --> 08:10:17,920
Ele ajută la ajustarea modelului nostru pentru că noi

10642
08:10:14,718 --> 08:10:19,760
știi răspunsul dinainte. Deci

10643
08:10:17,920 --> 08:10:23,638
sunt chiar exemple bune pentru care

10644
08:10:19,760 --> 08:10:23,638
construim modelul nostru din.

10645
08:10:23,680 --> 08:10:28,680
Bine. Deci asta este supravegheat

10646
08:10:25,680 --> 08:10:28,680
învăţarea.

10647
08:10:32,718 --> 08:10:36,718
În acest exemplu, este cerc nu în

10648
08:10:34,638 --> 08:10:38,160
predicție pentru că nu face parte din

10649
08:10:36,718 --> 08:10:40,558
datele de testare chiar dacă sunt în

10650
08:10:38,160 --> 08:10:43,520
date etichetate?

10651
08:10:40,558 --> 08:10:47,200
Nu, pur și simplu nu neapărat. Doar

10652
08:10:43,520 --> 08:10:50,080
înseamnă că așa cum învățăm împotriva tuturor

10653
08:10:47,200 --> 08:10:53,360
aceste exemple care au aceste răspunsuri

10654
08:10:50,080 --> 08:10:55,120
și atunci când observăm exemple noi um

10655
08:10:53,360 --> 08:10:58,398
putem încerca să prezicem ce ar fi acestea

10656
08:10:55,120 --> 08:11:00,320
să se bazeze pe ceea ce am văzut înainte. Deci eu

10657
08:10:58,398 --> 08:11:02,718
dacă a existat o știi că este doar o

10658
08:11:00,320 --> 08:11:04,798
coincidenta avem doar doi doi

10659
08:11:02,718 --> 08:11:06,320
exemple în datele noastre de testare așa cum am putea

10660
08:11:04,798 --> 08:11:08,558
avem un cerc aici, caz în care noi

10661
08:11:06,320 --> 08:11:10,798
ar prezice cerc

10662
08:11:08,558 --> 08:11:12,320
e bine sau cel puțin am spera

10663
08:11:10,798 --> 08:11:14,160
modelul nostru ar prezice cerc dreapta

10664
08:11:12,320 --> 08:11:16,478
asta sperăm că poate sau nu

10665
08:11:14,160 --> 08:11:21,040
face bine

10666
08:11:16,478 --> 08:11:23,200
um, dar doar că nu este acolo pentru că

10667
08:11:21,040 --> 08:11:24,878
ne place doar să presupunem că noi

10668
08:11:23,200 --> 08:11:26,958
avem doar două exemple pe care le testăm

10669
08:11:24,878 --> 08:11:29,200
împotrivă, dar în realitate am fi probabil

10670
08:11:26,958 --> 08:11:30,798
face mult mai mult de două.

10671
08:11:29,200 --> 08:11:33,798
Doar că este doar o coincidență

10672
08:11:30,798 --> 08:11:33,798
într-adevăr.

10673
08:11:37,680 --> 08:11:41,440
În realitate, am testa foarte multe

10674
08:11:39,440 --> 08:11:44,478
mai multe date. Și de fapt o vom face

10675
08:11:41,440 --> 08:11:48,000
vezi de ce am face asta. Cum ar fi de ce

10676
08:11:44,478 --> 08:11:52,320
ne antrenăm modelul și apoi tipul de utilizare

10677
08:11:48,000 --> 08:11:53,920
date suplimentare pentru a o evalua?

10678
08:11:52,320 --> 08:11:56,240
De fapt, este foarte important ca noi

10679
08:11:53,920 --> 08:11:58,160
fă acel pas pentru a-ți da seama cât de bine

10680
08:11:56,240 --> 08:12:01,440
modelul nostru este înainte de a-l scoate

10681
08:11:58,160 --> 08:12:05,600
lumea reală. Deci dacă aplicăm modelul nostru

10682
08:12:01,440 --> 08:12:09,040
pe care le construim pe datele noastre de etichetă

10683
08:12:05,600 --> 08:12:12,000
um acest tip de set de date de testare pe care noi

10684
08:12:09,040 --> 08:12:14,000
nu au fost expuse înainte. Ajută

10685
08:12:12,000 --> 08:12:17,120
dă-ne un sentiment cât de bun este al nostru

10686
08:12:14,000 --> 08:12:20,120
model. Deci testul este de obicei folosit pentru

10687
08:12:17,120 --> 08:12:20,120
evaluarea.

10688
08:12:20,398 --> 08:12:24,478
Deci asta e ceva care este ceva

10689
08:12:21,600 --> 08:12:26,958
vom studia.

10690
08:12:24,478 --> 08:12:31,760
Cum ne antrenăm? Uh, depinde de

10691
08:12:26,958 --> 08:12:34,160
model. Deci antrenamentul va fi un sens

10692
08:12:31,760 --> 08:12:36,398
va fi un algoritm care va um

10693
08:12:34,160 --> 08:12:39,280
practic actualizați modelul conform

10694
08:12:36,398 --> 08:12:40,878
datele. Aceste exemple etichetate. Hm

10695
08:12:39,280 --> 08:12:44,320
fiecare model va fi diferit

10696
08:12:40,878 --> 08:12:45,520
exact cum se antrenează. Deci vom merge

10697
08:12:44,320 --> 08:12:47,280
vom vorbi despre asta când vom

10698
08:12:45,520 --> 08:12:49,200
ajunge la modelele individuale pe care le vom

10699
08:12:47,280 --> 08:12:51,600
studiul.

10700
08:12:49,200 --> 08:12:54,958
Dar vorbind vag, ei pleacă

10701
08:12:51,600 --> 08:12:57,120
să folosească datele pentru a se ajusta. Ca

10702
08:12:54,958 --> 08:13:00,798
imaginați-vă reglați ca reglajul o grămadă de

10703
08:12:57,120 --> 08:13:03,440
butoane. Um, ca cel mai bun exemplu pe care pot

10704
08:13:00,798 --> 08:13:04,958
da-ți este noi, cred că am făcut asta

10705
08:13:03,440 --> 08:13:06,638
saptamana trecuta unde ai un fel de a

10706
08:13:04,958 --> 08:13:09,920
funcția

10707
08:13:06,638 --> 08:13:11,760
care prezice prețul și să spunem

10708
08:13:09,920 --> 08:13:14,478
are

10709
08:13:11,760 --> 08:13:18,558
um greutăți ca greutatea una cu caracteristică

10710
08:13:14,478 --> 08:13:20,958
unu, greutate doi cu caracteristica doi,

10711
08:13:18,558 --> 08:13:22,878
greutatea trei cu caracteristica trei. Deci

10712
08:13:20,958 --> 08:13:25,520
imaginați-vă că aveam trei caracteristici de intrare și

10713
08:13:22,878 --> 08:13:27,680
am construit un răspuns în funcție de asta.

10714
08:13:25,520 --> 08:13:32,000
În esență, ce am face pentru a ne antrena

10715
08:13:27,680 --> 08:13:35,600
modelul este ajustarea acestora

10716
08:13:32,000 --> 08:13:39,760
um, pentru a obține acest lucru corect pe baza

10717
08:13:35,600 --> 08:13:41,280
exemplele noastre etichetate.

10718
08:13:39,760 --> 08:13:42,478
Bine.

10719
08:13:41,280 --> 08:13:44,320
Deci asta e ceva ce vom învăța

10720
08:13:42,478 --> 08:13:45,840
despre venirea în scurt timp când noi când noi

10721
08:13:44,320 --> 08:13:47,040
de fapt scufundă-te în model. Fiecare model este

10722
08:13:45,840 --> 08:13:49,280
va fi ușor diferit în ceea ce privește modul

10723
08:13:47,040 --> 08:13:53,040
trenuri, dar la un nivel înalt merge

10724
08:13:49,280 --> 08:13:55,600
pentru a utiliza datele de antrenament cu acelea

10725
08:13:53,040 --> 08:13:58,878
exemple, nu? exemplele etichetate la

10726
08:13:55,600 --> 08:14:02,240
ajuta la ghidarea formulei în esență către

10727
08:13:58,878 --> 08:14:05,040
ajustați pentru a genera tipul potrivit de

10728
08:14:02,240 --> 08:14:08,718
model aici. Aceste lucruri merg

10729
08:14:05,040 --> 08:14:12,558
să fie ajustate în funcție de date

10730
08:14:08,718 --> 08:14:14,478
pentru a produce rezultatul corect.

10731
08:14:12,558 --> 08:14:17,478
Așa că gândește-te la acestea ca la butoane care vor

10732
08:14:14,478 --> 08:14:17,478
întoarce.

10733
08:14:19,360 --> 08:14:22,360
Bine.

10734
08:14:22,478 --> 08:14:26,638
Ce tip de învățare automată este

10735
08:14:23,920 --> 08:14:28,080
folosit? Probabil a supravegheat, care este

10736
08:14:26,638 --> 08:14:29,840
despre ce vorbim acum. Deci

10737
08:14:28,080 --> 08:14:31,840
probabil supravegheat pentru că majoritatea oamenilor

10738
08:14:29,840 --> 08:14:34,638
vreau să

10739
08:14:31,840 --> 08:14:38,878
um construi un tip de model pentru a prezice

10740
08:14:34,638 --> 08:14:41,878
ceva. Da, aș spune că aș spune

10741
08:14:38,878 --> 08:14:41,878
supraveghează.

10742
08:14:44,958 --> 08:14:48,558
Da, suntem cu siguranță mergem

10743
08:14:46,320 --> 08:14:51,680
pentru a învăța să te antrenezi. Da, vom vedea.

10744
08:14:48,558 --> 08:14:53,600
Vom face codul. Um, o să-ți spun

10745
08:14:51,680 --> 08:14:54,798
despre cum se face. Da, suntem

10746
08:14:53,600 --> 08:14:56,798
cu siguranță o să-l învețe. Dar ce eu

10747
08:14:54,798 --> 08:14:58,638
spunea că este cam pe un model de

10748
08:14:56,798 --> 08:15:00,558
baza modelului.

10749
08:14:58,638 --> 08:15:01,920
Așa că vreau să aștept până intrăm în

10750
08:15:00,558 --> 08:15:04,160
modele individuale, apoi vom vorbi despre

10751
08:15:01,920 --> 08:15:05,760
cum sunt antrenati.

10752
08:15:04,160 --> 08:15:08,760
Dar da, vom învăța cum să facem

10753
08:15:05,760 --> 08:15:08,760
că.

10754
08:15:12,398 --> 08:15:17,840
Dar da, supervizorul este folosit peste tot

10755
08:15:13,920 --> 08:15:19,840
locul. Chiar și pentru generativ

10756
08:15:17,840 --> 08:15:23,600
modele, folosesc învățarea supravegheată

10757
08:15:19,840 --> 08:15:26,718
pentru că um ca un LLM

10758
08:15:23,600 --> 08:15:29,520
va folosi exemple etichetate în

10759
08:15:26,718 --> 08:15:32,000
pentru a te antrena, nu? Pentru a se antrena

10760
08:15:29,520 --> 08:15:35,680
modul de a genera răspunsuri conform

10761
08:15:32,000 --> 08:15:38,240
solicitări. Trebuie să învețe împotriva unui

10762
08:15:35,680 --> 08:15:41,120
multe exemple de text.

10763
08:15:38,240 --> 08:15:44,080
Deci, acea învățare supravegheată este ceea ce

10764
08:15:41,120 --> 08:15:45,840
rezultă în acel model,

10765
08:15:44,080 --> 08:15:48,840
corect? Învățând de la cei etichetați

10766
08:15:45,840 --> 08:15:48,840
exemple.

10767
08:15:56,000 --> 08:15:59,000
Bine.

10768
08:16:02,478 --> 08:16:08,638
Este da imagine imagine uh o mulțime de um

10769
08:16:07,040 --> 08:16:11,840
da, o mulțime de procesare a imaginilor este

10770
08:16:08,638 --> 08:16:14,398
supravegheat ca detectarea obiectelor. Deci

10771
08:16:11,840 --> 08:16:17,120
modelul yolo este un model de detectare a obiectelor.

10772
08:16:14,398 --> 08:16:20,638
Da. Pentru că trebuie antrenat

10773
08:16:17,120 --> 08:16:24,000
corect, trebuie să fie antrenat pe uh, are

10774
08:16:20,638 --> 08:16:26,638
a fi instruit pe imagini

10775
08:16:24,000 --> 08:16:29,120
cu etichete ca acesta este obiectul

10776
08:16:26,638 --> 08:16:31,280
este în această imagine. Aceasta este cutia din jur

10777
08:16:29,120 --> 08:16:35,440
obiectul.

10778
08:16:31,280 --> 08:16:38,798
Hm da. Deci dacă dacă este dacă folosește vreodată

10779
08:16:35,440 --> 08:16:41,120
etichetați datele pentru a antrena și a construi modelul,

10780
08:16:38,798 --> 08:16:44,398
este supravegheat. Deci YOLO este cu siguranță

10781
08:16:41,120 --> 08:16:46,798
supravegheat și de fapt vom face noi

10782
08:16:44,398 --> 08:16:49,040
va acoperi modelul YOLO mai târziu în

10783
08:16:46,798 --> 08:16:51,600
cursul nostru de deep learning. Vorbim despre

10784
08:16:49,040 --> 08:16:54,558
detectarea obiectelor.

10785
08:16:51,600 --> 08:16:58,200
Deci, vom studia asta.

10786
08:16:54,558 --> 08:16:58,200
Dar da, este supravegheat

10787
08:17:04,958 --> 08:17:10,718
Bine. Deci, pe slide avem câteva

10788
08:17:08,240 --> 08:17:13,440
algoritmi comuni de învățare supravegheată

10789
08:17:10,718 --> 08:17:15,680
adica vom studia. Deci toate astea

10790
08:17:13,440 --> 08:17:18,000
vom studia și vom înțelege ce au

10791
08:17:15,680 --> 08:17:20,478
fac și cum funcționează, dar doar îți oferă

10792
08:17:18,000 --> 08:17:22,558
unii pentru a le numi. regresia liniară este

10793
08:17:20,478 --> 08:17:26,000
un fel de cel pe care tocmai l-am desenat care este

10794
08:17:22,558 --> 08:17:28,080
um, acesta este prototipul

10795
08:17:26,000 --> 08:17:31,120
cel mai ușor de înțeles model care este amabil

10796
08:17:28,080 --> 08:17:34,478
de um exact așa unde noi

10797
08:17:31,120 --> 08:17:37,440
au o greutate ori o caracteristică um a

10798
08:17:34,478 --> 08:17:39,600
greutatea înmulțită de o caracteristică și apoi de o greutate

10799
08:17:37,440 --> 08:17:41,280
ori o caracteristică

10800
08:17:39,600 --> 08:17:43,280
și mai departe și mai departe. Poți avea ca

10801
08:17:41,280 --> 08:17:46,558
multe câte vrei.

10802
08:17:43,280 --> 08:17:49,040
um, aceasta este o regresie liniară. Și așa

10803
08:17:46,558 --> 08:17:52,878
asta e un model supravegheat

10804
08:17:49,040 --> 08:17:56,240
pentru că avem nevoie de această valoare aici și noi

10805
08:17:52,878 --> 08:17:58,398
am nevoie de toate contribuțiile noastre pentru a putea

10806
08:17:56,240 --> 08:18:00,320
antrenează de fapt acest model și generează

10807
08:17:58,398 --> 08:18:05,040
toate acele greutăți

10808
08:18:00,320 --> 08:18:07,920
um că asta este uh care folosește um etichetat

10809
08:18:05,040 --> 08:18:09,600
exemple pentru a ajuta la reglarea tuturor acelor butoane.

10810
08:18:07,920 --> 08:18:10,638
La fel cu toate celelalte modele. Deci,

10811
08:18:09,600 --> 08:18:11,440
vom vorbi despre decizie

10812
08:18:10,638 --> 08:18:13,600
copaci. Vom vorbi despre

10813
08:18:11,440 --> 08:18:15,840
regresia logistică și și SVM-uri, care

10814
08:18:13,600 --> 08:18:17,200
sunt mașini vector suport. Vom vorbi

10815
08:18:15,840 --> 08:18:19,760
despre toate acestea, dar sunt toate

10816
08:18:17,200 --> 08:18:21,680
exemple de supravegheat uh supravegheat

10817
08:18:19,760 --> 08:18:25,360
învăţarea.

10818
08:18:21,680 --> 08:18:28,160
Bine, vom vorbi despre toate acestea.

10819
08:18:25,360 --> 08:18:30,558
Toți sunt supravegheați pentru că toți

10820
08:18:28,160 --> 08:18:33,360
necesită exemple etichetate pentru a

10821
08:18:30,558 --> 08:18:37,398
antrenează-le și apoi folosește-le ulterior

10822
08:18:33,360 --> 08:18:37,398
ei. Bine.

10823
08:18:45,120 --> 08:18:49,040
Bine. Deci, care sunt unele cazuri de utilizare

10824
08:18:46,718 --> 08:18:50,798
exemple? Deci, de exemplu, în uh

10825
08:18:49,040 --> 08:18:53,120
învățarea supravegheată pe care o putem prezice

10826
08:18:50,798 --> 08:18:56,000
temperatura bazată pe temperatura anuală

10827
08:18:53,120 --> 08:18:59,920
tendinte. Deci am avea asta anual

10828
08:18:56,000 --> 08:19:02,240
date ca um ca exemplele noastre etichetate

10829
08:18:59,920 --> 08:19:04,878
iar aceia ar supraveghea învăţarea

10830
08:19:02,240 --> 08:19:06,718
a unui model care prezice temperatura.

10831
08:19:04,878 --> 08:19:10,240
Același lucru cu prognoza recoltei

10832
08:19:06,718 --> 08:19:11,760
randamentul bazat pe calitatea recoltei sezoniere

10833
08:19:10,240 --> 08:19:14,798
schimbari. Deci poate avem o grămadă de

10834
08:19:11,760 --> 08:19:18,558
caracteristici legate de calitatea recoltei. Noi

10835
08:19:14,798 --> 08:19:21,280
ar putea prezice randamentul culturii. Hm, am face-o

10836
08:19:18,558 --> 08:19:23,520
am nevoie doar de exemple istorice cu acelea

10837
08:19:21,280 --> 08:19:27,600
etichete, nu? Care este randamentul culturii

10838
08:19:23,520 --> 08:19:29,520
pentru fiecare perioadă de timp. Să zicem că am face-o

10839
08:19:27,600 --> 08:19:32,160
am nevoie doar de acele exemple supravegheate

10840
08:19:29,520 --> 08:19:33,520
și am putea construi cu ușurință un model

10841
08:19:32,160 --> 08:19:35,200
ea.

10842
08:19:33,520 --> 08:19:37,680
Hm

10843
08:19:35,200 --> 08:19:39,280
uh, acesta din urmă sortând deșeurile

10844
08:19:37,680 --> 08:19:42,240
pe baza deșeurilor cunoscute și a acestora

10845
08:19:39,280 --> 08:19:44,080
tipurile de deșeuri corespunzătoare. Hm asta e

10846
08:19:42,240 --> 08:19:47,040
un fel de spam. Este ca și filtrarea

10847
08:19:44,080 --> 08:19:49,760
practic ca o filtrare de spam. Um asa

10848
08:19:47,040 --> 08:19:52,398
Gândește-te la asta ca la exemplul formelor.

10849
08:19:49,760 --> 08:19:54,798
Sortăm lucrurile în pătrate, cercuri,

10850
08:19:52,398 --> 08:19:56,638
triunghiuri. Um, același tip de idee aici

10851
08:19:54,798 --> 08:20:00,320
unde avem o grămadă de exemple

10852
08:19:56,638 --> 08:20:03,600
ce acelea um ce acele articole de deșeuri

10853
08:20:00,320 --> 08:20:04,958
ar trebui să aparțină, cum ar fi

10854
08:20:03,600 --> 08:20:09,840
coșurile de gunoi la care ar merge, pentru

10855
08:20:04,958 --> 08:20:13,200
exemplu. Um, și acestea ar putea fi etichetate

10856
08:20:09,840 --> 08:20:15,120
și prin urmare am putea um

10857
08:20:13,200 --> 08:20:17,280
să înțeleagă ce categorie de deșeuri au

10858
08:20:15,120 --> 08:20:19,840
aparțin.

10859
08:20:17,280 --> 08:20:22,080
Um, același lucru cu spam-ul. ceva este

10860
08:20:19,840 --> 08:20:23,600
fraudă sau nu fraudă, spam sau nu spam,

10861
08:20:22,080 --> 08:20:25,680
cancer sau nu cancer. Toate acestea sunt

10862
08:20:23,600 --> 08:20:27,520
vor fi exemple de învățare supravegheate

10863
08:20:25,680 --> 08:20:29,440
pentru că vor cere înăuntru

10864
08:20:27,520 --> 08:20:32,398
pentru a-i antrena, vor face

10865
08:20:29,440 --> 08:20:35,760
necesită date care au acele etichete.

10866
08:20:32,398 --> 08:20:39,040
Bine? Deci, orice are etichete este

10867
08:20:35,760 --> 08:20:42,958
va fi învățare supravegheată.

10868
08:20:39,040 --> 08:20:46,080
Deci, din nou, aici vom cheltui

10869
08:20:42,958 --> 08:20:48,958
probabil cea mai mare parte a timpului nostru este

10870
08:20:46,080 --> 08:20:51,440
realizarea problemelor de învățare supravegheată. cele

10871
08:20:48,958 --> 08:20:52,558
că avem date etichetate. Suntem

10872
08:20:51,440 --> 08:20:55,680
construim un model și vom face

10873
08:20:52,558 --> 08:20:58,680
prezice acele etichete

10874
08:20:55,680 --> 08:20:58,680
în esență.

10875
08:21:04,240 --> 08:21:12,040
Bine, înainte de a merge la nesupravegheat, oricare

10876
08:21:07,360 --> 08:21:12,040
întrebări despre uh supravegheat

10877
08:21:24,080 --> 08:21:27,080
Bine.

10878
08:21:27,200 --> 08:21:31,440
În regulă. Deci, supravegheat necesită

10879
08:21:29,760 --> 08:21:34,478
etichete

10880
08:21:31,440 --> 08:21:36,878
pentru a avea un exemplu din care să plece

10881
08:21:34,478 --> 08:21:39,600
pentru a vă construi modelul. Și asta pentru că

10882
08:21:36,878 --> 08:21:41,440
tu prezici astfel de rezultate

10883
08:21:39,600 --> 08:21:45,120
ca spam sau nu spam, cancerul nu

10884
08:21:41,440 --> 08:21:48,080
cancer. Acum, învățarea nesupravegheată este

10885
08:21:45,120 --> 08:21:52,320
complet diferit. Este opusul.

10886
08:21:48,080 --> 08:21:55,520
Deci, învățarea nesupravegheată este locul în care facem

10887
08:21:52,320 --> 08:21:58,080
nu folosiți etichete. Deci nu suntem

10888
08:21:55,520 --> 08:22:00,160
folosind orice etichetă. Deci este tot

10889
08:21:58,080 --> 08:22:02,320
poate fi complet neetichetat sau chiar dacă

10890
08:22:00,160 --> 08:22:05,280
este etichetat, nu folosim etichete

10891
08:22:02,320 --> 08:22:08,638
orice fel. Dar am spune în primul rând

10892
08:22:05,280 --> 08:22:10,320
sunt date neetichetate. Nu avem nicio îndrumare

10893
08:22:08,638 --> 08:22:14,240
pentru că nu folosim etichetele în

10894
08:22:10,320 --> 08:22:16,080
orice fel. nu avem nicio îndrumare pentru um

10895
08:22:14,240 --> 08:22:17,440
prezice orice, dar asta pentru că

10896
08:22:16,080 --> 08:22:19,440
nu prea prezicem nimic

10897
08:22:17,440 --> 08:22:21,120
învăţare nesupravegheată. În general ce

10898
08:22:19,440 --> 08:22:23,760
facem este să căutăm unele

10899
08:22:21,120 --> 08:22:25,360
structura sau modelul.

10900
08:22:23,760 --> 08:22:27,760
Bine, cu învățare nesupravegheată suntem

10901
08:22:25,360 --> 08:22:32,638
căutând o structură sau un model.

10902
08:22:27,760 --> 08:22:34,320
Deci un tip de exemplu este foarte

10903
08:22:32,638 --> 08:22:37,360
foarte popular va fi acest al doilea

10904
08:22:34,320 --> 08:22:40,160
una care este identificarea

10905
08:22:37,360 --> 08:22:42,638
identificarea grupurilor de utilizatori pe baza

10906
08:22:40,160 --> 08:22:45,520
asemănări sau puncte comune. Acum asta

10907
08:22:42,638 --> 08:22:48,760
va fi o problemă cunoscută în principiu

10908
08:22:45,520 --> 08:22:48,760
ca grupare

10909
08:22:49,360 --> 08:22:53,200
și este o problemă pe care o vom studia destul de a

10910
08:22:51,280 --> 08:22:55,040
pic. Se va dovedi a fi

10911
08:22:53,200 --> 08:22:57,440
o mulțime de algoritmi diferiți care pot

10912
08:22:55,040 --> 08:22:59,440
realiza clustering. Deci ce

10913
08:22:57,440 --> 08:23:02,878
gruparea încercărilor de a face este practic

10914
08:22:59,440 --> 08:23:06,160
spune că avem date care sunt așa și

10915
08:23:02,878 --> 08:23:08,398
apoi date aici și apoi date peste

10916
08:23:06,160 --> 08:23:10,240
aici. Să le grupăm împreună.

10917
08:23:08,398 --> 08:23:11,680
Deci, așa ar trebui să fie un singur grup. Aceasta

10918
08:23:10,240 --> 08:23:14,398
ar trebui să fie un singur grup și acesta ar trebui să fie

10919
08:23:11,680 --> 08:23:17,120
un grup. Și le putem găsi

10920
08:23:14,398 --> 08:23:19,920
structuri și spuneți bine, acesta este un grup

10921
08:23:17,120 --> 08:23:22,000
unul, acesta este grupul doi și acesta este grupul

10922
08:23:19,920 --> 08:23:26,160
trei.

10923
08:23:22,000 --> 08:23:29,520
Unul 2 3. Și practic putem construi ce

10924
08:23:26,160 --> 08:23:32,080
am numi clustere de date bazate pe um

10925
08:23:29,520 --> 08:23:34,398
despre cât de apropiate sunt punctele

10926
08:23:32,080 --> 08:23:38,478
oarecum situat în acest tip de cluster

10927
08:23:34,398 --> 08:23:40,718
zone ca aceste casete pe care le-am desenat.

10928
08:23:38,478 --> 08:23:42,558
Bine. Acum, asta nu necesită nicio etichetă

10929
08:23:40,718 --> 08:23:44,958
a face ceea ce este cu adevărat fascinant. Deci

10930
08:23:42,558 --> 08:23:47,920
nesupravegheat nu ai nevoie de nicio etichetă la

10931
08:23:44,958 --> 08:23:50,798
totul pentru a realiza algoritmul. Um asa

10932
08:23:47,920 --> 08:23:52,958
gruparea este un exemplu bun. Hm

10933
08:23:50,798 --> 08:23:54,718
găsirea unor valori aberante sau anomalii este

10934
08:23:52,958 --> 08:23:57,200
alta. Deci nu avem neapărat

10935
08:23:54,718 --> 08:24:00,240
orice etichetă a ceea ce este un outlier sau ce

10936
08:23:57,200 --> 08:24:02,878
este o anomalie. Deducem asta din

10937
08:24:00,240 --> 08:24:05,520
numai caracteristicile. Nu există îndrumare.

10938
08:24:02,878 --> 08:24:08,958
Nu există nicio etichetă pentru a face like

10939
08:24:05,520 --> 08:24:10,798
detectarea valorii aberante sau detectarea anomaliilor.

10940
08:24:08,958 --> 08:24:15,120
Bine. Deci, acesta este un alt exemplu bun.

10941
08:24:10,798 --> 08:24:16,958
Una care nu este listată aici, dar este

10942
08:24:15,120 --> 08:24:19,360
de asemenea foarte important că vom studia

10943
08:24:16,958 --> 08:24:21,360
este ceva cunoscut sub numele de dimensionalitate

10944
08:24:19,360 --> 08:24:25,200
reducerea.

10945
08:24:21,360 --> 08:24:28,638
Atât de slabă reducere și ce asta

10946
08:24:25,200 --> 08:24:31,760
se concentrează pe este practic comprimarea

10947
08:24:28,638 --> 08:24:34,878
set de date un pic. Așa că ne luăm datele și

10948
08:24:31,760 --> 08:24:37,600
practic comprima-l. Hm, deci, dar noi

10949
08:24:34,878 --> 08:24:40,638
faceți-o în așa fel încât să reținem ca

10950
08:24:37,600 --> 08:24:43,200
cât de multe informații putem. Este foarte

10951
08:24:40,638 --> 08:24:46,320
cum ar fi compresia inteligentă și ce face

10952
08:24:43,200 --> 08:24:48,638
este scade dimensiunea.

10953
08:24:46,320 --> 08:24:52,160
um dimensiune. Gândiți-vă la dimensiune ca

10954
08:24:48,638 --> 08:24:54,320
ca număr de coloane.

10955
08:24:52,160 --> 08:24:57,200
Numărul de coloane.

10956
08:24:54,320 --> 08:24:58,798
Așa că imaginați-vă că avem 100 de coloane într-o dată

10957
08:24:57,200 --> 08:25:02,558
cadru. Ceea ce am putea face este de fapt

10958
08:24:58,798 --> 08:25:06,878
reduceți-l la 10. Deci cam 10% din

10959
08:25:02,558 --> 08:25:09,440
că. Așa că o reducem la 10. Și um

10960
08:25:06,878 --> 08:25:14,080
dar cei 10 sunt, nu e ca noi

10961
08:25:09,440 --> 08:25:15,920
a tăiat alte 90 de coloane. noi um

10962
08:25:14,080 --> 08:25:19,680
inteligent cam comprimat toate astea

10963
08:25:15,920 --> 08:25:21,760
informații în aceste 10 noi coloane um

10964
08:25:19,680 --> 08:25:24,798
care sunt versiuni comprimate ale

10965
08:25:21,760 --> 08:25:26,878
o sută pe care o aveam noi. Um asa

10966
08:25:24,798 --> 08:25:28,878
reducerea dimensionalității este alta

10967
08:25:26,878 --> 08:25:33,520
tehnică nesupravegheată. Este nevoie de nr

10968
08:25:28,878 --> 08:25:35,520
îndrumări, nicio etichetă de făcut, dar este um a

10969
08:25:33,520 --> 08:25:37,360
tehnică cu adevărat utilă pentru a reduce

10970
08:25:35,520 --> 08:25:40,320
dimensiunea datelor tale dacă faci lucruri

10971
08:25:37,360 --> 08:25:43,040
cu ea. Hm, deci acesta este altul care

10972
08:25:40,320 --> 08:25:44,478
vom studia cum să o facem și

10973
08:25:43,040 --> 08:25:46,558
practic mai multe detalii în spatele lui ce

10974
08:25:44,478 --> 08:25:49,840
algoritmii sunt.

10975
08:25:46,558 --> 08:25:51,360
Probabil că îi vom intra pe cei doi

10976
08:25:49,840 --> 08:25:53,200
nesupravegheat va cheltui cea mai mare sumă

10977
08:25:51,360 --> 08:25:56,200
de timp pe clustering și dimensionalitate

10978
08:25:53,200 --> 08:25:56,200
reducerea.

10979
08:26:02,000 --> 08:26:06,398
Uh și supravegheat dacă unele date sunt

10980
08:26:03,760 --> 08:26:09,200
prezent, dar nu am etichetat înseamnă în

10981
08:26:06,398 --> 08:26:13,558
exemplu, am avut cerc triunghi pătrat în

10982
08:26:09,200 --> 08:26:13,558
datele de antrenament le adăugăm pentagon

10983
08:26:18,798 --> 08:26:23,798
dar nu am etichetat asta în acest caz.

10984
08:26:23,920 --> 08:26:30,000
Da. Deci fiecare um este supravegheat

10985
08:26:27,120 --> 08:26:32,638
învățarea, fiecare rând, gândește-te la asta ca

10986
08:26:30,000 --> 08:26:34,718
ca fiecare rând din cadrul nostru de date are nevoie

10987
08:26:32,638 --> 08:26:36,798
să aibă o etichetă

10988
08:26:34,718 --> 08:26:41,558
asociat cu el. Trebuie să aibă un

10989
08:26:36,798 --> 08:26:41,558
o coloană care reprezintă eticheta.

10990
08:26:41,600 --> 08:26:47,478
Deci, dacă nu am mai văzut niciodată Pentagonul,

10991
08:26:43,440 --> 08:26:47,478
Nu pot folosi asta ca etichetă.

10992
08:26:48,958 --> 08:26:54,958
Deci trebuie să existe pentagonul

10993
08:26:52,080 --> 08:26:58,280
în date. dacă o să pot

10994
08:26:54,958 --> 08:26:58,280
prezice,

10995
08:27:01,120 --> 08:27:05,280
nu? Deci, nu se poate prezice, nu? Dacă

10996
08:27:03,040 --> 08:27:07,040
nu l-am mai văzut până acum, nu avem

10997
08:27:05,280 --> 08:27:09,840
exemple pentru a merge. Nu avem nicio îndrumare.

10998
08:27:07,040 --> 08:27:14,280
Deci, cum am putea prezice asta?

10999
08:27:09,840 --> 08:27:14,280
Corect? Nu o putem prezice

11000
08:27:25,360 --> 08:27:31,120
dacă este dacă este acolo. Deci dacă dacă noi

11001
08:27:28,160 --> 08:27:33,600
au etichete ale Pentagonului, să spunem, atunci

11002
08:27:31,120 --> 08:27:36,840
Da, am putea prezice Pentagonul.

11003
08:27:33,600 --> 08:27:36,840
Am putea

11004
08:27:49,040 --> 08:27:53,080
îndepărtați. Elimina ce?

11005
08:27:56,160 --> 08:27:59,600
Nu am face-o dacă ar fi vorba despre

11006
08:27:57,440 --> 08:28:02,478
Pentagon, nu am elimina asta. nu,

11007
08:27:59,600 --> 08:28:06,080
lasă-mă să mă întorc la pagina respectivă. Noi nu am face-o

11008
08:28:02,478 --> 08:28:07,520
îndepărtați-l. Hm, este doar dacă nu este înăuntru

11009
08:28:06,080 --> 08:28:10,718
etichetele noastre, nu vom putea

11010
08:28:07,520 --> 08:28:15,360
să o prezic. Deci, Pentagonul e bun

11011
08:28:10,718 --> 08:28:18,318
exemplu aici. Uh, Pentagonul nu este unul dintre

11012
08:28:15,360 --> 08:28:20,558
etichetele noastre. Deci, în prezent nu este în

11013
08:28:18,318 --> 08:28:22,318
setul nostru de date ca una dintre etichete. Noi

11014
08:28:20,558 --> 08:28:24,240
au doar date care sunt fie un triunghi,

11015
08:28:22,318 --> 08:28:27,200
cerc, sau

11016
08:28:24,240 --> 08:28:30,240
pătrat. Nu avem pentagon. Deci, eu

11017
08:28:27,200 --> 08:28:31,760
nu ar putea niciodată să prezică pentagonul.

11018
08:28:30,240 --> 08:28:35,200
Nu voi putea niciodată să fac asta dacă eu

11019
08:28:31,760 --> 08:28:37,760
nu am văzut exemple în acest sens până acum.

11020
08:28:35,200 --> 08:28:39,440
Bine. Dar să presupunem că am avut asta în

11021
08:28:37,760 --> 08:28:43,080
acolo.

11022
08:28:39,440 --> 08:28:43,080
Deci, am avut Pentagonul.

11023
08:28:44,798 --> 08:28:52,200
Deci dacă am avea Pentagon, am putea avea

11024
08:28:47,760 --> 08:28:52,200
un exemplu în etichetele noastre

11025
08:28:56,878 --> 08:29:02,280
și apoi Da, noi am putea fi atunci noi

11026
08:28:58,798 --> 08:29:02,280
putea să o prezică.

11027
08:29:06,398 --> 08:29:10,878
Da. Da. Nu vă faceți griji

11028
08:29:08,558 --> 08:29:13,040
nu vă faceți griji pentru datele de testare. Deci

11029
08:29:10,878 --> 08:29:15,440
datele de testare spun doar că iată o nouă

11030
08:29:13,040 --> 08:29:17,920
iată o formă ce este în regulă că este a

11031
08:29:15,440 --> 08:29:19,760
pătrat aici este o formă ce este în regulă

11032
08:29:17,920 --> 08:29:21,760
acela este un triunghi și am putea avea ca

11033
08:29:19,760 --> 08:29:24,318
multe dintre acele exemple pe care le dorim în noi

11034
08:29:21,760 --> 08:29:29,318
date de testare ca să putem avea un cerc și

11035
08:29:24,318 --> 08:29:29,318
spune bine ce ar trebui să fie cerc

11036
08:29:29,520 --> 08:29:33,520
corect datele de testare pot fi orice ar fi

11037
08:29:31,680 --> 08:29:34,878
orice vrea, dar da, dacă am făcut-o

11038
08:29:33,520 --> 08:29:37,760
nu am văzut niciodată pentagon înainte de a fi niciodată

11039
08:29:34,878 --> 08:29:37,760
va putea prezice

11040
08:29:45,760 --> 08:29:51,200
Acestea sunt datele și etichetele etichetei

11041
08:29:48,878 --> 08:29:54,798
practic vorbesc despre același lucru

11042
08:29:51,200 --> 08:29:56,318
lucru. Etichetele înseamnă doar care sunt

11043
08:29:54,798 --> 08:30:00,000
categorii

11044
08:29:56,318 --> 08:30:01,840
care sunt prezente în datele noastre. Deci in asta

11045
08:30:00,000 --> 08:30:04,840
date avem doar trei etichete care sunt

11046
08:30:01,840 --> 08:30:04,840
prezent.

11047
08:30:08,638 --> 08:30:14,638
Deci etichetele sunt relativ la noi

11048
08:30:11,280 --> 08:30:17,878
date de etichetă, nu? Se spune

11049
08:30:14,638 --> 08:30:17,878
ce etichete,

11050
08:30:18,398 --> 08:30:25,520
scuză-mă, ce etichete avem

11051
08:30:23,360 --> 08:30:28,398
în datele noastre și avem doar acele trei

11052
08:30:25,520 --> 08:30:30,000
cerc, triunghi, pătrat. Deci așa și Pentagonul

11053
08:30:28,398 --> 08:30:33,718
nu ar face parte din acele etichete. Noi

11054
08:30:30,000 --> 08:30:33,718
nu puteam prezice.

11055
08:30:44,318 --> 08:30:49,600
Nu. Deci nesupravegheat nu va face

11056
08:30:47,520 --> 08:30:51,360
o previziune. Asta e marea diferenta

11057
08:30:49,600 --> 08:30:54,558
cu nesupravegheat. Nu o vor face

11058
08:30:51,360 --> 08:30:56,240
faceți o astfel de predicție. Um asa

11059
08:30:54,558 --> 08:30:57,760
nesupravegheat nu va face a

11060
08:30:56,240 --> 08:31:00,478
predictie. O să facă ceva

11061
08:30:57,760 --> 08:31:02,318
diferit ca um practic spune ca

11062
08:31:00,478 --> 08:31:04,878
băieții ăștia sunt asemănători, ăștia sunt

11063
08:31:02,318 --> 08:31:06,478
similare, acestea sunt similare, aceasta este a

11064
08:31:04,878 --> 08:31:09,920
cluster, acesta este un cluster, acesta este un

11065
08:31:06,478 --> 08:31:12,000
cluster. Nu va face un

11066
08:31:09,920 --> 08:31:15,398
predictie. Asta a supravegheat

11067
08:31:12,000 --> 08:31:15,398
învăţarea face.

11068
08:31:16,638 --> 08:31:21,840
Clustering, da, care este nesupravegheat.

11069
08:31:19,120 --> 08:31:23,600
Da, gruparea nu necesită niciuna

11070
08:31:21,840 --> 08:31:25,360
etichete. Nesupravegheat înseamnă doar că nu

11071
08:31:23,600 --> 08:31:28,000
au orice etichetă. Nu avem nevoie de niciunul

11072
08:31:25,360 --> 08:31:28,000
etichete.

11073
08:31:43,920 --> 08:31:49,040
Deci celălalt lucru nesupravegheat ar putea face

11074
08:31:46,080 --> 08:31:51,680
s-ar putea spune

11075
08:31:49,040 --> 08:31:55,040
și din nou fără etichete s-ar putea

11076
08:31:51,680 --> 08:31:55,040
spuneți că acesta este o situație anormală.

11077
08:31:56,398 --> 08:32:00,240
s-ar putea spune că acest tip este un outlier

11078
08:31:58,478 --> 08:32:02,798
pentru că există doar, există doar unul dintre

11079
08:32:00,240 --> 08:32:05,200
acelea și nu sunt ca celelalte. Deci

11080
08:32:02,798 --> 08:32:10,520
că asta e ceva ce e

11081
08:32:05,200 --> 08:32:10,520
ceva ce ar putea face nesupravegheat.

11082
08:32:14,878 --> 08:32:23,440
Da și nu. E un fel de etichete

11083
08:32:19,440 --> 08:32:25,840
un grup în sensul că um ar fi

11084
08:32:23,440 --> 08:32:28,798
practic, atribuiți-i un număr ca

11085
08:32:25,840 --> 08:32:33,840
acesta este clusterul unu, acesta este clusterul

11086
08:32:28,798 --> 08:32:35,680
doi, acesta este grupul trei.

11087
08:32:33,840 --> 08:32:37,680
Îi va atribui un număr, dar este

11088
08:32:35,680 --> 08:32:40,080
nu prea semnificativ pe care nu îl atribuie

11089
08:32:37,680 --> 08:32:42,798
ca o etichetă de predicție în

11090
08:32:40,080 --> 08:32:44,878
sensul tradițional al unei etichete.

11091
08:32:42,798 --> 08:32:46,798
Oferă ca un index numeric

11092
08:32:44,878 --> 08:32:49,360
pentru cluster pentru ca ceea ce vrem

11093
08:32:46,798 --> 08:32:51,360
a ști este ca în regulă tipul ăsta are

11094
08:32:49,360 --> 08:32:53,040
cluster de unul. Acest tip îi aparține

11095
08:32:51,360 --> 08:32:55,200
cluster unu. Tipul ăsta aparține grupului

11096
08:32:53,040 --> 08:32:57,280
unul. Tipul ăsta aparține grupului doi.

11097
08:32:55,200 --> 08:32:58,558
Tipul ăsta aparține grupului doi. Face

11098
08:32:57,280 --> 08:33:00,798
asta are sens? Deci trebuie să existe

11099
08:32:58,558 --> 08:33:03,360
unele ca index al grupului de tine

11100
08:33:00,798 --> 08:33:06,080
aparțin.

11101
08:33:03,360 --> 08:33:10,600
Deci este un fel ca o etichetă, dar nu în interior

11102
08:33:06,080 --> 08:33:10,600
sensul tradițional de predicție similară.

11103
08:33:24,478 --> 08:33:27,478
Bine.

11104
08:33:35,280 --> 08:33:42,240
Foarte bun. Deci, din nou, nesupravegheat, nu

11105
08:33:38,638 --> 08:33:44,558
etichete. Faci lucruri de genul

11106
08:33:42,240 --> 08:33:47,280
identificarea clusterelor,

11107
08:33:44,558 --> 08:33:49,200
um identificând valori aberante, fac

11108
08:33:47,280 --> 08:33:52,000
reducerea dimensionalității. Acestea sunt toate

11109
08:33:49,200 --> 08:33:54,638
orientat spre structură și model

11110
08:33:52,000 --> 08:33:57,440
lucruri. Nu sunt predicții pentru a

11111
08:33:54,638 --> 08:34:02,040
eticheta. Bine? Nu sunt ceea ce

11112
08:33:57,440 --> 08:34:02,040
am vedea în învăţarea supravegheată.

11113
08:34:06,160 --> 08:34:13,520
Bine. Deci un exemplu ar fi că noi

11114
08:34:09,200 --> 08:34:17,360
luăm, punem datele pe care le putem grupa

11115
08:34:13,520 --> 08:34:20,000
împreună uh date cum ar fi imagini în

11116
08:34:17,360 --> 08:34:21,840
categorii bazate pe asemănări um

11117
08:34:20,000 --> 08:34:24,240
care ar fi ca acele clustere. Deci

11118
08:34:21,840 --> 08:34:26,000
nu există aceste grupuri ar fi noi

11119
08:34:24,240 --> 08:34:27,680
nu au nicio etichetă în avans

11120
08:34:26,000 --> 08:34:29,600
parcă nu avem, nu spunem asta

11121
08:34:27,680 --> 08:34:32,000
această imagine ar trebui să aparțină acestui lucru

11122
08:34:29,600 --> 08:34:34,160
imaginea ar trebui să aparțină acestui lucru pe care îl derivăm

11123
08:34:32,000 --> 08:34:38,398
că din caracteristicile celui

11124
08:34:34,160 --> 08:34:41,680
date. Gândește-te așa cum este un exemplu bun

11125
08:34:38,398 --> 08:34:44,398
um grupuri de clienți. Deci ne-am identifica

11126
08:34:41,680 --> 08:34:46,958
clienții se bazează pe cum bine fac

11127
08:34:44,398 --> 08:34:49,360
au niveluri similare de cheltuieli? Câte

11128
08:34:46,958 --> 08:34:51,600
zile merg la cumpărături într-o săptămână? Cum

11129
08:34:49,360 --> 08:34:53,440
multi bani cheltuiesc? Și putem

11130
08:34:51,600 --> 08:34:56,080
un fel de grupare pe bază de clienți

11131
08:34:53,440 --> 08:34:58,558
pe calități similare.

11132
08:34:56,080 --> 08:35:00,958
Clustering va găsi acele grupuri care

11133
08:34:58,558 --> 08:35:03,120
ar trebui să existe.

11134
08:35:00,958 --> 08:35:07,520
um va descoperi acele grupuri bazate

11135
08:35:03,120 --> 08:35:09,760
pe um asemănările în date, dar

11136
08:35:07,520 --> 08:35:12,478
nu există etichete care să spună ca

11137
08:35:09,760 --> 08:35:14,318
această persoană ar trebui să fie în acest grup,

11138
08:35:12,478 --> 08:35:16,958
această persoană ar trebui să fie în asta înaintea

11139
08:35:14,318 --> 08:35:18,958
timp. Nu există etichete pentru asta. Se ajunge

11140
08:35:16,958 --> 08:35:21,958
derivate în timpul algoritmului. Este

11141
08:35:18,958 --> 08:35:21,958
nesupravegheat,

11142
08:35:22,478 --> 08:35:27,280
nu? Nu există cu adevărat nesupravegheat

11143
08:35:24,558 --> 08:35:29,200
literal înseamnă nicio îndrumare. Nu există

11144
08:35:27,280 --> 08:35:31,040
îndrumare pentru a o face. Doar deducem

11145
08:35:29,200 --> 08:35:34,520
că din structura datelor

11146
08:35:31,040 --> 08:35:34,520
care sunt asemănările.

11147
08:35:47,760 --> 08:35:50,760
Bine.

11148
08:35:53,520 --> 08:35:59,760
În regulă. Deci,

11149
08:35:56,558 --> 08:36:04,798
încă câteva pentru tine. Deci am avut um

11150
08:35:59,760 --> 08:36:07,360
supravegheat care folosește etichetele. Noi

11151
08:36:04,798 --> 08:36:09,600
au nesupravegheat care nu folosește etichete

11152
08:36:07,360 --> 08:36:12,558
cautand structura. Și apoi avem

11153
08:36:09,600 --> 08:36:16,318
ceva care este cam la mijloc

11154
08:36:12,558 --> 08:36:19,280
care este um ceea ce este cunoscut ca

11155
08:36:16,318 --> 08:36:23,040
învăţare semisupravegheată. Și aceasta este

11156
08:36:19,280 --> 08:36:25,760
unde folosești o combinație de puțin

11157
08:36:23,040 --> 08:36:29,120
un pic de date de etichetă, dar majoritatea datelor dvs

11158
08:36:25,760 --> 08:36:32,478
sunt de fapt date neetichetate. Hm, și tu

11159
08:36:29,120 --> 08:36:37,120
încercați să profitați de acea etichetă

11160
08:36:32,478 --> 08:36:42,318
date pentru a construi un model din

11161
08:36:37,120 --> 08:36:46,638
ea. Și așa, uh, folosește, um, folosește

11162
08:36:42,318 --> 08:36:49,360
acele date etichetează, um, în general

11163
08:36:46,638 --> 08:36:51,040
oferiți niște îndrumări despre ce de obicei

11164
08:36:49,360 --> 08:36:54,478
se întâmplă cu învăţarea semi-supravegheată este

11165
08:36:51,040 --> 08:36:57,280
folosiți datele dvs. de etichetă într-un fel

11166
08:36:54,478 --> 08:36:59,280
preziceți care ar trebui să fie eticheta pentru

11167
08:36:57,280 --> 08:37:01,840
date neetichetate și apoi puteți merge de la

11168
08:36:59,280 --> 08:37:05,120
acolo. Deci puteți crea artificiale

11169
08:37:01,840 --> 08:37:07,360
etichete pe aceste date neetichetate și apoi

11170
08:37:05,120 --> 08:37:09,200
le poți folosi pe toate odată ce totul a fost

11171
08:37:07,360 --> 08:37:12,558
etichetat cam ca un supravegheat

11172
08:37:09,200 --> 08:37:14,318
învățarea uh abordare. Deci dar dar asta este

11173
08:37:12,558 --> 08:37:17,440
semisupravegheat se referă practic la

11174
08:37:14,318 --> 08:37:20,000
faptul că începi cu majoritatea

11175
08:37:17,440 --> 08:37:23,120
datele tale nu sunt etichetate, dar o faci

11176
08:37:20,000 --> 08:37:25,360
au câteva exemple etichetate și ce tu

11177
08:37:23,120 --> 08:37:28,798
poate face este practic să le extrapolăm

11178
08:37:25,360 --> 08:37:32,478
etichete în setul de date neetichetat și

11179
08:37:28,798 --> 08:37:34,080
apoi furnizați niște etichete artificiale și

11180
08:37:32,478 --> 08:37:36,718
apoi acum totul are o etichetă pe care o poți

11181
08:37:34,080 --> 08:37:40,638
face invatare supravegheata.

11182
08:37:36,718 --> 08:37:43,120
Bine. Deci, se încadrează oarecum între um

11183
08:37:40,638 --> 08:37:46,558
supravegheat și și nesupravegheat.

11184
08:37:43,120 --> 08:37:48,638
Uh și acolo Deci, asta este un fel

11185
08:37:46,558 --> 08:37:50,080
rare. De cele mai multe ori nu mergi

11186
08:37:48,638 --> 08:37:53,840
a face asta. De fapt, doar mergi

11187
08:37:50,080 --> 08:37:55,280
eu prefer să începem cu toate

11188
08:37:53,840 --> 08:37:57,120
date de etichetă. Acesta este de obicei preferatul

11189
08:37:55,280 --> 08:37:58,798
abordare. De cele mai multe ori vei

11190
08:37:57,120 --> 08:38:01,360
de fapt, să fie doar supravegheat

11191
08:37:58,798 --> 08:38:07,000
învăţare, nu chiar semi-supravegheată

11192
08:38:01,360 --> 08:38:07,000
învăţarea. Deci, este destul de rar, dar um

11193
08:38:09,600 --> 08:38:14,398
ar putea să-ți placă dacă Da, ar putea dacă

11194
08:38:12,240 --> 08:38:16,478
dacă am avea o mulțime de exemple de

11195
08:38:14,398 --> 08:38:18,718
Pentagonul și noi am vrut și așa au fost

11196
08:38:16,478 --> 08:38:21,920
neetichetat și apoi am încercat să ghicim

11197
08:38:18,718 --> 08:38:25,840
ce fel de formă erau um şi

11198
08:38:21,920 --> 08:38:27,600
oferiți o etichetă artificială și apoi

11199
08:38:25,840 --> 08:38:29,760
um apoi folosește întregul set de date pentru a construi

11200
08:38:27,600 --> 08:38:34,120
un model de atunci, da, s-ar putea

11201
08:38:29,760 --> 08:38:34,120
ar putea intra în această categorie. Bine.

11202
08:38:38,638 --> 08:38:41,600
Ei Oh, revenind la întrebare,

11203
08:38:40,240 --> 08:38:44,718
încă folosesc un fel de date de etichetă

11204
08:38:41,600 --> 08:38:46,478
precum vârsta, sexul. Ei folosesc asta

11205
08:38:44,718 --> 08:38:48,878
acestea nu sunt, nu sunt chiar etichete.

11206
08:38:46,478 --> 08:38:52,000
Acestea sunt caracteristicile. Deci, da, ei

11207
08:38:48,878 --> 08:38:54,240
utilizați în continuare caracteristicile de bază ale datelor.

11208
08:38:52,000 --> 08:38:56,718
Pur și simplu nu au nicio etichetă similară

11209
08:38:54,240 --> 08:38:58,958
sensul tradițional al unei etichete. Ca

11210
08:38:56,718 --> 08:39:01,200
ar trebui să te gândești la o etichetă ca la ceva

11211
08:38:58,958 --> 08:39:03,280
încercăm să prevedem.

11212
08:39:01,200 --> 08:39:05,840
Deci, dacă acesta este un preț, dacă

11213
08:39:03,280 --> 08:39:07,920
este ca o categorie ca spam, nu

11214
08:39:05,840 --> 08:39:09,440
spam, cancer, nu cancer, e ceva

11215
08:39:07,920 --> 08:39:12,798
ne-ar interesa un fel de

11216
08:39:09,440 --> 08:39:15,120
prezicerea. Și așa în datele noastre, noi

11217
08:39:12,798 --> 08:39:16,558
ar avea un răspuns pentru fiecare rând. Am vrea

11218
08:39:15,120 --> 08:39:19,120
a avea una dintre coloanele noastre ar fi ca

11219
08:39:16,558 --> 08:39:21,120
rezultatul ca și răspunsul rezultat

11220
08:39:19,120 --> 08:39:23,360
pe care încercăm să-l prevedem. Asta este

11221
08:39:21,120 --> 08:39:25,520
eticheta.

11222
08:39:23,360 --> 08:39:27,280
Deci, în nesupravegheat, nu avem nimic

11223
08:39:25,520 --> 08:39:29,360
etichetele.

11224
08:39:27,280 --> 08:39:33,280
Avem doar caracteristicile obișnuite

11225
08:39:29,360 --> 08:39:36,280
cum ar fi sexul, vârsta, venitul, pătratul

11226
08:39:33,280 --> 08:39:36,280
filmare,

11227
08:39:37,440 --> 08:39:41,798
dormitoare, băi, toate acele lucruri.

11228
08:39:44,558 --> 08:39:47,558
Bine.

11229
08:39:48,478 --> 08:39:52,318
Deci, avem semi-supravegheat că cade

11230
08:39:50,398 --> 08:39:54,958
între supravegheat. Acum, motivul

11231
08:39:52,318 --> 08:39:57,280
se încadrează între este fi este pentru că

11232
08:39:54,958 --> 08:39:59,600
există o cantitate decentă de date

11233
08:39:57,280 --> 08:40:03,200
neetichetat. De fapt, majoritatea

11234
08:39:59,600 --> 08:40:05,680
neetichetat. Dar ceea ce putem face este să încercăm

11235
08:40:03,200 --> 08:40:08,318
etichetați-l. Putem încerca să luăm ceea ce avem

11236
08:40:05,680 --> 08:40:11,760
știi din etichetele noastre existente și

11237
08:40:08,318 --> 08:40:14,240
prezice o etichetă artificială și apoi folosește

11238
08:40:11,760 --> 08:40:16,558
toate acele date împreună într-un fel de a

11239
08:40:14,240 --> 08:40:19,558
moda supravegheată pentru un model de jos

11240
08:40:16,558 --> 08:40:19,558
drum.

11241
08:40:22,000 --> 08:40:28,000
Deci cam asta e imaginea asta

11242
08:40:24,080 --> 08:40:30,878
spune că putem încerca să ne luăm, știi

11243
08:40:28,000 --> 08:40:33,920
poate încercăm să deducem niște etichete pe baza

11244
08:40:30,878 --> 08:40:36,798
pe avem câteva date etichetate aici.

11245
08:40:33,920 --> 08:40:40,000
Avem majoritatea datelor noastre neetichetate

11246
08:40:36,798 --> 08:40:42,478
și încercăm să-i furnizăm niște etichete.

11247
08:40:40,000 --> 08:40:47,440
Poate că avem categoria unui copil

11248
08:40:42,478 --> 08:40:51,360
de adolescenți, un preadolescent, uh, știi tinerețe și

11249
08:40:47,440 --> 08:40:55,280
adulți. Hm și apoi încercăm, așa că noi

11250
08:40:51,360 --> 08:40:57,680
luăm etichetele noastre și încercăm

11251
08:40:55,280 --> 08:40:59,600
extrapolați-le în etichete artificiale

11252
08:40:57,680 --> 08:41:02,080
pentru aceste date neetichetate ca să putem

11253
08:40:59,600 --> 08:41:04,638
folosește-l acum pentru că atunci totul are o

11254
08:41:02,080 --> 08:41:06,398
etichetați în acest moment și apoi putem doar

11255
08:41:04,638 --> 08:41:09,398
mergeți mai departe și învățați supravegheat de la

11256
08:41:06,398 --> 08:41:09,398
acolo.

11257
08:41:11,920 --> 08:41:15,440
Deci putem face supravegheat de acolo. Ce

11258
08:41:13,840 --> 08:41:17,680
am prefera să facem și ce vom face

11259
08:41:15,440 --> 08:41:20,000
in acest curs

11260
08:41:17,680 --> 08:41:22,080
um este doar începe cu supravegheat. Vom face

11261
08:41:20,000 --> 08:41:24,718
începe doar cu etichetele. Nu vom încerca

11262
08:41:22,080 --> 08:41:28,840
pentru a deriva de obicei etichete artificiale.

11263
08:41:24,718 --> 08:41:28,840
Vom începe doar cu etichetele.

11264
08:41:35,600 --> 08:41:42,318
Deci un exemplu în lumea reală este

11265
08:41:38,558 --> 08:41:44,318
ceva de genul Google Photos care um

11266
08:41:42,318 --> 08:41:48,798
ori de câte ori faci o poză se poate

11267
08:41:44,318 --> 08:41:52,160
furnizați etichete bazate pe anterioare

11268
08:41:48,798 --> 08:41:56,878
uh imagini din biblioteca ta. Deci se poate

11269
08:41:52,160 --> 08:41:58,878
poate produce etichete sau etichete pe acestea.

11270
08:41:56,878 --> 08:42:01,120
Uh, în general, când faci acea poză

11271
08:41:58,878 --> 08:42:03,840
este oarecum neetichetat dacă nu intri

11272
08:42:01,120 --> 08:42:06,638
și să furnizeze în mod specific niște etichete și

11273
08:42:03,840 --> 08:42:11,040
unele etichete. Dar dacă nu faci asta

11274
08:42:06,638 --> 08:42:12,958
încă mai poate, încă mai poate face

11275
08:42:11,040 --> 08:42:15,360
crea artificial una dintre cele bazate

11276
08:42:12,958 --> 08:42:17,200
pe celelalte date de etichetă pe care le aveți deja

11277
08:42:15,360 --> 08:42:20,160
au.

11278
08:42:17,200 --> 08:42:23,638
Deci asta e um

11279
08:42:20,160 --> 08:42:23,638
asta e un exemplu.

11280
08:42:28,638 --> 08:42:31,638
Bine.

11281
08:42:32,000 --> 08:42:38,240
În regulă. Ultimul din punct de vedere al mașinii

11282
08:42:34,718 --> 08:42:39,840
învăţarea. Deci am supravegheat, avem

11283
08:42:38,240 --> 08:42:42,000
nesupravegheat.

11284
08:42:39,840 --> 08:42:43,760
Atunci am fost semi-supervizați, adică

11285
08:42:42,000 --> 08:42:46,718
undeva la mijloc un amestec de a avea

11286
08:42:43,760 --> 08:42:47,600
unele date neetichetate și date etichetate. Hm

11287
08:42:46,718 --> 08:42:49,120
acum vom vorbi despre

11288
08:42:47,600 --> 08:42:52,398
învăţarea prin întărire care este

11289
08:42:49,120 --> 08:42:53,520
complet diferit. Ea este

11290
08:42:52,398 --> 08:42:55,840
complet diferit de celălalt

11291
08:42:53,520 --> 08:42:58,878
trei. Este un tip de învățare automată

11292
08:42:55,840 --> 08:43:01,680
de unde învățăm practic

11293
08:42:58,878 --> 08:43:04,160
interacțiunea cu mediul. Şi

11294
08:43:01,680 --> 08:43:08,240
ați putea întreba ce învățăm? Noi

11295
08:43:04,160 --> 08:43:11,040
învață ce acțiuni să întreprindă în

11296
08:43:08,240 --> 08:43:13,280
mediu. Hm și felul în care facem asta

11297
08:43:11,040 --> 08:43:16,080
este prin întărire

11298
08:43:13,280 --> 08:43:20,398
acțiuni pozitive care conduc la o a

11299
08:43:16,080 --> 08:43:22,318
recompensă. Um, deci acolo este cuvântul

11300
08:43:20,398 --> 08:43:25,280
întărirea vine de la noi

11301
08:43:22,318 --> 08:43:27,440
în principiu, imaginează-ți ca un copil

11302
08:43:25,280 --> 08:43:28,958
asta înseamnă, știi, să înveți din proces

11303
08:43:27,440 --> 08:43:30,478
si eroare. De parcă ar încerca să se târască,

11304
08:43:28,958 --> 08:43:33,200
încearcă să meargă și țin

11305
08:43:30,478 --> 08:43:35,760
căzând jos. ei în cele din urmă învață

11306
08:43:33,200 --> 08:43:38,080
cum să o faci prin încercare și eroare și

11307
08:43:35,760 --> 08:43:41,040
ar putea primi o recompensă

11308
08:43:38,080 --> 08:43:43,520
sau ar putea consolida unele dintre acestea

11309
08:43:41,040 --> 08:43:48,000
mişcări pozitive care îi conduc la

11310
08:43:43,520 --> 08:43:49,440
mergi sau târâi sau ar putea învăța

11311
08:43:48,000 --> 08:43:53,440
din penalty, nu? S-ar putea

11312
08:43:49,440 --> 08:43:55,200
Învățați de la un fel de feedback. Deci

11313
08:43:53,440 --> 08:43:57,440
s-ar putea să învețe din cădere ca,

11314
08:43:55,200 --> 08:43:58,878
„Oh, asta doare. Ar trebui să susțin

11315
08:43:57,440 --> 08:44:02,240
eu un pic mai bine, nu?" Sau

11316
08:43:58,878 --> 08:44:04,478
fii putin mai coordonat. Hm

11317
08:44:02,240 --> 08:44:06,160
și astfel ei învață din aceștia

11318
08:44:04,478 --> 08:44:09,120
acțiunile și interacțiunea lor cu

11319
08:44:06,160 --> 08:44:15,280
mediu. Hm

11320
08:44:09,120 --> 08:44:19,280
deci acesta este un algoritm complex

11321
08:44:15,280 --> 08:44:22,000
în esență, se ocupă de multe

11322
08:44:19,280 --> 08:44:24,398
um din nou luând măsuri. De obicei când

11323
08:44:22,000 --> 08:44:28,080
faci o acțiune în care ceva se schimbă

11324
08:44:24,398 --> 08:44:30,398
mediul, atunci tu cam

11325
08:44:28,080 --> 08:44:33,760
observați un fel de feedback. Deci, gandeste-te

11326
08:44:30,398 --> 08:44:35,600
cam ca un joc de societate unde te afli

11327
08:44:33,760 --> 08:44:37,520
încercând să-mi dau seama ce te mișcă

11328
08:44:35,600 --> 08:44:40,398
ar trebui să facă. Sau un alt exemplu bun este

11329
08:44:37,520 --> 08:44:42,878
ca cu un robot care încearcă să navigheze

11330
08:44:40,398 --> 08:44:44,398
un labirint. Deci, cum ar fi ce traseu ar trebui

11331
08:44:42,878 --> 08:44:45,920
ia? Ar trebui să meargă înainte? Ar trebui

11332
08:44:44,398 --> 08:44:47,840
mișcă înapoi? Ar trebui să se miște la stânga sau

11333
08:44:45,920 --> 08:44:50,718
nu? Acestea sunt acțiuni diferite

11334
08:44:47,840 --> 08:44:52,558
poate lua. De asemenea, ca o mașină care se conduce singur,

11335
08:44:50,718 --> 08:44:54,240
ar trebui sa se intoarca? Ar trebui

11336
08:44:52,558 --> 08:44:56,638
accelera? Ar trebui să încetinească? Acestea sunt

11337
08:44:54,240 --> 08:44:58,080
toate exemple bune de lucruri care au

11338
08:44:56,638 --> 08:45:00,878
fost antrenat din întărire

11339
08:44:58,080 --> 08:45:00,878
învăţarea.

11340
08:45:05,280 --> 08:45:10,958
Da. Deci exemplele din lumea reală ar fi

11341
08:45:08,000 --> 08:45:14,718
ca într-un joc de societate, o recompensă

11342
08:45:10,958 --> 08:45:17,200
ar fi ca și cum ai câștiga jocul. Hm sau

11343
08:45:14,718 --> 08:45:20,080
dacă vă place să capturați o piesă ca în

11344
08:45:17,200 --> 08:45:21,680
dame sau șah, asta e o recompensă. A

11345
08:45:20,080 --> 08:45:23,680
pedeapsa ar fi ca dacă pierzi

11346
08:45:21,680 --> 08:45:26,638
joc sau pierzi una dintre piesele tale, asta

11347
08:45:23,680 --> 08:45:31,040
ar putea fi o penalizare.

11348
08:45:26,638 --> 08:45:33,920
într-un joc de societate sau îmi pare rău într-un a

11349
08:45:31,040 --> 08:45:36,878
sarcină de navigare robot, ar putea ajunge

11350
08:45:33,920 --> 08:45:38,478
recompense pentru că te-ai mutat în dreapta

11351
08:45:36,878 --> 08:45:41,200
direcție

11352
08:45:38,478 --> 08:45:42,798
um spre ieșire sau like când vrea

11353
08:45:41,200 --> 08:45:45,040
să presupunem că ai vrut să antrenezi un robot

11354
08:45:42,798 --> 08:45:47,360
cum să deschizi ușa și să navighezi a

11355
08:45:45,040 --> 08:45:49,760
camera. Ai sancționa pentru asta

11356
08:45:47,360 --> 08:45:54,680
lovindu-se de perete.

11357
08:45:49,760 --> 08:45:54,680
Ai da o recompensă pentru mutare

11358
08:45:57,360 --> 08:46:02,080
de obicei oh ca oh algoritmul

11359
08:45:59,920 --> 08:46:04,958
ei înșiși, de obicei, este ca un pas

11360
08:46:02,080 --> 08:46:07,200
funcția um de obicei este ca o

11361
08:46:04,958 --> 08:46:10,558
funcția discretă pe care se bazează

11362
08:46:07,200 --> 08:46:13,840
asupra statului deci răsplata ar putea fi

11363
08:46:10,558 --> 08:46:15,600
ca um ca depinde de let's

11364
08:46:13,840 --> 08:46:18,558
să revenim la exemplul jocului de masă

11365
08:46:15,600 --> 08:46:20,878
ca și cum recompensa ar putea fi ca sau chiar

11366
08:46:18,558 --> 08:46:22,718
labirintul să spunem ca un navigator

11367
08:46:20,878 --> 08:46:25,040
labirint ca să ajungi la asta hai să spunem asta

11368
08:46:22,718 --> 08:46:28,920
a fost ieșirea

11369
08:46:25,040 --> 08:46:28,920
și asta era intrarea.

11370
08:46:29,200 --> 08:46:33,200
Apoi, dacă ajung aici, primesc un

11371
08:46:31,680 --> 08:46:34,798
numeric ca dacă ar ajunge la

11372
08:46:33,200 --> 08:46:37,440
ieșire, ei primesc o recompensă numerică de

11373
08:46:34,798 --> 08:46:41,760
ca plus 100, să zicem. Deci este doar o

11374
08:46:37,440 --> 08:46:43,440
număr. Și apoi dacă le place dacă le-ar plăcea

11375
08:46:41,760 --> 08:46:45,200
bump dacă intră aici, de genul hai

11376
08:46:43,440 --> 08:46:47,600
spune că asta e ca o capcană mortală sau

11377
08:46:45,200 --> 08:46:50,798
ca o groapă, asta ar fi ca o

11378
08:46:47,600 --> 08:46:53,360
minus 100. Deci ar putea fi ca discret

11379
08:46:50,798 --> 08:46:54,718
valorile numerice ar putea fi recompensa. Dacă

11380
08:46:53,360 --> 08:46:56,080
se mișcă în direcția corectă

11381
08:46:54,718 --> 08:46:57,760
ca să zicem că vrem să încurajăm

11382
08:46:56,080 --> 08:46:59,600
mergând în acest fel atunci am putea da

11383
08:46:57,760 --> 08:47:01,520
recompense intermediare mai mici ca aceasta

11384
08:46:59,600 --> 08:47:04,398
ar trebui să fie un plus ca dacă te muți

11385
08:47:01,520 --> 08:47:07,280
înainte acesta este un plus cinci acesta este un

11386
08:47:04,398 --> 08:47:09,040
plus 10, acesta este un plus 15 dacă ești

11387
08:47:07,280 --> 08:47:12,080
deplasându-se în direcția greșită departe de

11388
08:47:09,040 --> 08:47:15,040
iesirea. Ar fi ca un minus5

11389
08:47:12,080 --> 08:47:17,840
sau un minus 10. Are sens? Aşa

11390
08:47:15,040 --> 08:47:19,520
sunt de natură numerică și

11391
08:47:17,840 --> 08:47:21,760
ceea ce încerci să faci este să colectezi

11392
08:47:19,520 --> 08:47:25,280
cea mai mare recompensă. Încercați să obțineți

11393
08:47:21,760 --> 08:47:27,520
cea mai mare recompensă pe care o puteți prin încercare și

11394
08:47:25,280 --> 08:47:30,638
eroare. Așa că încerci asta multe

11395
08:47:27,520 --> 08:47:32,878
de multe ori. Practic simulezi

11396
08:47:30,638 --> 08:47:36,160
alergând prin acest labirint multe multe

11397
08:47:32,878 --> 08:47:39,120
ori. Și ce o dictează ce

11398
08:47:36,160 --> 08:47:41,040
dictează cum ar fi locul unde ar trebui să merg

11399
08:47:39,120 --> 08:47:42,638
pe ceea ce am observat în trecut. Este

11400
08:47:41,040 --> 08:47:44,638
aproape ca și cum ai fi un copil care își amintește

11401
08:47:42,638 --> 08:47:47,520
cum ar fi, bine, din ce mișcare ar trebui să fac

11402
08:47:44,638 --> 08:47:49,360
acest spatiu? De exemplu, dacă sunt aici, dacă sunt

11403
08:47:47,520 --> 08:47:51,120
aici, pe ce drum ar trebui să merg? Ar trebui să merg

11404
08:47:49,360 --> 08:47:53,600
jos? Ar trebui să merg corect? Ar trebui să merg

11405
08:47:51,120 --> 08:47:55,200
plecat? Cam știi asta de la

11406
08:47:53,600 --> 08:47:56,558
experiență.

11407
08:47:55,200 --> 08:47:58,958
Are sens? Pe baza

11408
08:47:56,558 --> 08:48:00,638
recompensă pe care am văzut-o în trecut, cum ar fi

11409
08:47:58,958 --> 08:48:04,160
când m-am mutat în jos, am primit un

11410
08:48:00,638 --> 08:48:05,440
recompensă mai mare decât deplasarea la stânga sau la dreapta.

11411
08:48:04,160 --> 08:48:08,718
Are sens? Deci, da, este

11412
08:48:05,440 --> 08:48:11,920
este o valoare numerică

11413
08:48:08,718 --> 08:48:11,920
drept recompensă.

11414
08:48:17,200 --> 08:48:21,840
Da, e o întrebare grozavă. Cum

11415
08:48:20,160 --> 08:48:25,120
diferențiază recompensele în funcție de

11416
08:48:21,840 --> 08:48:27,520
câștig și pierdere, adică șah? Deci este un

11417
08:48:25,120 --> 08:48:32,000
foarte comp complicat uh răspuns dar

11418
08:48:27,520 --> 08:48:34,638
în esență, din fiecare dată pe tabla de șah

11419
08:48:32,000 --> 08:48:37,120
te poți gândi la tablă ca la fiecare

11420
08:48:34,638 --> 08:48:41,360
fiecare um

11421
08:48:37,120 --> 08:48:43,440
spațiul este o stare.

11422
08:48:41,360 --> 08:48:46,318
Așa că aș putea fi în această stare în care aș putea fi

11423
08:48:43,440 --> 08:48:48,958
în această stare și atunci nu este numai

11424
08:48:46,318 --> 08:48:50,958
este fiecare fiecare uh spațiu, dar unde toate

11425
08:48:48,958 --> 08:48:53,200
celelalte piese sunt. Deci sunt multe

11426
08:48:50,958 --> 08:48:55,920
state care sunt posibile.

11427
08:48:53,200 --> 08:48:59,120
Um, deci

11428
08:48:55,920 --> 08:49:03,200
felul în care există o modalitate de a cuantifica

11429
08:48:59,120 --> 08:49:04,798
în esență, care este valoarea luării unui

11430
08:49:03,200 --> 08:49:07,760
anumite acțiuni, cum ar fi mutarea piesei mele

11431
08:49:04,798 --> 08:49:11,520
stânga, mutându-l la dreapta, mutându-l în sus sau

11432
08:49:07,760 --> 08:49:12,718
jos um dat fiind restul statului. Deci

11433
08:49:11,520 --> 08:49:16,080
ai dreptate, poate fi

11434
08:49:12,718 --> 08:49:18,398
benefic de sacrificat. Hm, dar noi

11435
08:49:16,080 --> 08:49:20,638
ar învăţa că prin experienţă că

11436
08:49:18,398 --> 08:49:22,478
bine, cea mai bună mișcare în această situație este

11437
08:49:20,638 --> 08:49:24,080
a se sacrifica.

11438
08:49:22,478 --> 08:49:25,840
Ar trebui să învățăm asta

11439
08:49:24,080 --> 08:49:28,558
prin încercare și eroare multe multe multe

11440
08:49:25,840 --> 08:49:31,840
ori, adică în regulă dacă sunt

11441
08:49:28,558 --> 08:49:33,840
în această stare actuală a dreptului mondial

11442
08:49:31,840 --> 08:49:36,718
toate aceste piese sunt distribuite în aceasta

11443
08:49:33,840 --> 08:49:40,558
modul cea mai bună mișcare pentru mine în acest moment

11444
08:49:36,718 --> 08:49:42,318
pe termen lung pentru a obține cea mai mare recompensă

11445
08:49:40,558 --> 08:49:44,478
pe termen lung este să-mi sacrific de fapt

11446
08:49:42,318 --> 08:49:47,520
piesa si mutati-o dreapta mutati-o in

11447
08:49:44,478 --> 08:49:49,360
ca o poziţie proastă teoretic dar noi

11448
08:49:47,520 --> 08:49:51,120
știi din experiență că asta este de fapt

11449
08:49:49,360 --> 08:49:52,000
cea mai mare recompensă pe termen lung este din asta

11450
08:49:51,120 --> 08:49:54,478
poziție

11451
08:49:52,000 --> 08:49:58,080
ca și cum să-l miști corect poate fi cel mai bun

11452
08:49:54,478 --> 08:50:00,558
acțiune pentru mine. Deci ceea ce înveți este cum

11453
08:49:58,080 --> 08:50:03,280
să întreprindă acțiuni

11454
08:50:00,558 --> 08:50:05,360
și acțiunile sunt de obicei ca deplasarea la dreapta,

11455
08:50:03,280 --> 08:50:07,520
misca la stanga, misca in sus, misca in jos. crezi tu

11456
08:50:05,360 --> 08:50:09,920
cam ca o mașină care se conduce singur, totuși,

11457
08:50:07,520 --> 08:50:13,680
asta va fi ca o încetinire, viteză

11458
08:50:09,920 --> 08:50:18,200
sus, rotiți roata cu 10°,

11459
08:50:13,680 --> 08:50:18,200
um genul ăsta de acțiuni.

11460
08:50:19,280 --> 08:50:26,318
Deci răspunsul scurt este că există

11461
08:50:22,000 --> 08:50:30,240
un calcul acolo că înveți ce

11462
08:50:26,318 --> 08:50:32,958
valoarea pe termen lung a fiecărei stări este

11463
08:50:30,240 --> 08:50:35,120
fiecare stare unică

11464
08:50:32,958 --> 08:50:37,440
și apoi încerci să spui practic

11465
08:50:35,120 --> 08:50:40,798
ce masuri ar trebui sa iau din asta

11466
08:50:37,440 --> 08:50:43,798
stare având în vedere că starea actuală a

11467
08:50:40,798 --> 08:50:43,798
lume.

11468
08:50:49,840 --> 08:50:53,840
Bine.

11469
08:50:51,680 --> 08:50:55,760
Și chiar îmi place foarte mult întărirea

11470
08:50:53,840 --> 08:50:57,840
învăţarea. De fapt, este probabil al meu

11471
08:50:55,760 --> 08:51:00,318
domeniul preferat al învățării automate.

11472
08:50:57,840 --> 08:51:03,120
Din păcate, nu o vom acoperi

11473
08:51:00,318 --> 08:51:05,200
în cursul nostru principal. Avem

11474
08:51:03,120 --> 08:51:07,760
a oferit cursuri opționale

11475
08:51:05,200 --> 08:51:09,360
învăţarea prin consolidare în trecut. Deci,

11476
08:51:07,760 --> 08:51:11,680
um fii pe fază. Poate când ajungem la

11477
08:51:09,360 --> 08:51:13,520
La sfârșitul acestui program, uh, vom oferi un

11478
08:51:11,680 --> 08:51:17,360
electiv pe el și dacă semnează destui oameni

11479
08:51:13,520 --> 08:51:19,120
pentru asta, o vom rula. Dar, um

11480
08:51:17,360 --> 08:51:20,478
noi nu face parte din noi nu facem cu adevărat

11481
08:51:19,120 --> 08:51:23,200
acoperă învățarea prin consolidare ca parte a

11482
08:51:20,478 --> 08:51:25,520
subiectele noastre principale. Este un avansat

11483
08:51:23,200 --> 08:51:28,398
uh subiect mai avansat decât ce

11484
08:51:25,520 --> 08:51:32,600
vom acoperi. Dar, um, chiar îmi place

11485
08:51:28,398 --> 08:51:32,600
ea. Găsiți-l foarte fascinant.

11486
08:51:37,600 --> 08:51:42,318
Bine. Deci, toate acestea sunt un fel de um

11487
08:51:40,080 --> 08:51:45,040
ilustrând ceea ce spuneam, adică

11488
08:51:42,318 --> 08:51:46,878
um, te gândești la chestia asta

11489
08:51:45,040 --> 08:51:50,318
interacționând în mediu precum

11490
08:51:46,878 --> 08:51:54,000
robotul sau mașina sau omul care se mișcă a

11491
08:51:50,318 --> 08:51:55,840
piesa de piept este cunoscută ca agent. Este

11492
08:51:54,000 --> 08:51:58,958
interacționând cu mediul prin

11493
08:51:55,840 --> 08:52:01,200
întreprinderea de acțiuni care actualizează starea

11494
08:51:58,958 --> 08:52:03,280
um de a mediului. Deci asta e

11495
08:52:01,200 --> 08:52:05,200
de aceea vezi acest cuvânt stare aici.

11496
08:52:03,280 --> 08:52:07,920
Acesta este actualizat constant de fiecare dată

11497
08:52:05,200 --> 08:52:09,520
faci o acțiune. În cele din urmă, ce

11498
08:52:07,920 --> 08:52:12,718
Învățarea prin întărire încearcă să facă

11499
08:52:09,520 --> 08:52:16,398
este să înveți cea mai bună acțiune cum ar fi

11500
08:52:12,718 --> 08:52:18,398
fi cea mai bună acțiune de luat. Hm

11501
08:52:16,398 --> 08:52:21,360
și cea mai bună acțiune este aceea care

11502
08:52:18,398 --> 08:52:24,718
duce la cea mai lungă recompensă.

11503
08:52:21,360 --> 08:52:29,200
Asta e cea mai bună acțiune. Um, deci ai

11504
08:52:24,718 --> 08:52:31,840
ca trebuie să înveți ceea ce știi

11505
08:52:29,200 --> 08:52:33,920
ceea ce duce la o recompensă bună prin fel de

11506
08:52:31,840 --> 08:52:36,318
trăind asta din nou și din nou și din nou

11507
08:52:33,920 --> 08:52:38,958
prin încercare și eroare. Deci există o

11508
08:52:36,318 --> 08:52:42,318
o mulțime de fel de simulare sau închiriere

11509
08:52:38,958 --> 08:52:44,000
robotul încearcă mult ceva

11510
08:52:42,318 --> 08:52:46,000
pentru a învăța cumva ce este plin de satisfacții

11511
08:52:44,000 --> 08:52:47,680
si ce nu este. Gândește-te din nou

11512
08:52:46,000 --> 08:52:49,520
parcă cred că un exemplu bun este ca cu

11513
08:52:47,680 --> 08:52:52,240
copii, nu? cam trebuie să lași

11514
08:52:49,520 --> 08:52:54,718
ei încearcă lucruri până învață mai departe

11515
08:52:52,240 --> 08:52:56,958
ale lor ce e ce pot face și

11516
08:52:54,718 --> 08:53:00,878
ce nu pot face

11517
08:52:56,958 --> 08:53:03,120
care sunt cele mai bune acțiuni corecte

11518
08:53:00,878 --> 08:53:05,840
deci învăţarea prin întărire şi-a făcut

11519
08:53:03,120 --> 08:53:08,638
drum în alte locuri, așa că am spus ca a

11520
08:53:05,840 --> 08:53:10,080
un bun exemplu sunt mașinile cu conducere autonomă sau ro

11521
08:53:08,638 --> 08:53:11,920
robotica întărește mult

11522
08:53:10,080 --> 08:53:14,558
învățarea prin întărire este folosită acolo

11523
08:53:11,920 --> 08:53:17,200
locul în care și-a găsit drumul recent

11524
08:53:14,558 --> 08:53:18,240
este un fel de sisteme de recomandare

11525
08:53:17,200 --> 08:53:23,040
fuzionat cu învăţarea prin întărire

11526
08:53:18,240 --> 08:53:25,120
învăţarea. Hm, și asta pentru că tu

11527
08:53:23,040 --> 08:53:28,398
vă puteți imagina că există un fel de a

11528
08:53:25,120 --> 08:53:31,200
recompensă încorporată pentru dvs. făcând clic pe a

11529
08:53:28,398 --> 08:53:33,840
video și cum îl vizionați.

11530
08:53:31,200 --> 08:53:37,760
Um, așa că asta întărește asta

11531
08:53:33,840 --> 08:53:40,718
recomandare și apoi uh, acolo

11532
08:53:37,760 --> 08:53:42,718
um, atunci poți să recomanzi un fel de a

11533
08:53:40,718 --> 08:53:45,200
ceva asemanator si vezi daca e asa

11534
08:53:42,718 --> 08:53:47,680
recompensând și generează un clic sau

11535
08:53:45,200 --> 08:53:50,318
generează un timp de vizionare sau un timp de vizionare

11536
08:53:47,680 --> 08:53:52,318
sau orice altceva. Hm, deci întărire

11537
08:53:50,318 --> 08:53:55,280
învăţarea şi-a găsit drumul într-o mulţime de

11538
08:53:52,318 --> 08:53:57,920
zone. Recomandările fiind una dintre

11539
08:53:55,280 --> 08:54:00,718
pentru că este pur și simplu firesc pentru

11540
08:53:57,920 --> 08:54:03,520
idee de like ce ar trebui să recomand

11541
08:54:00,718 --> 08:54:04,718
alături de a genera cea mai mare recompensă. În

11542
08:54:03,520 --> 08:54:06,718
în acest caz recompensa este oarecum

11543
08:54:04,718 --> 08:54:09,920
corelat cu au făcut clic pe el sau

11544
08:54:06,718 --> 08:54:12,318
nu sau au făcut cât timp s-au uitat

11545
08:54:09,920 --> 08:54:15,840
pentru mai mult timp este mai plină de satisfacții.

11546
08:54:12,318 --> 08:54:17,680
genul ăsta de lucruri, dar locul

11547
08:54:15,840 --> 08:54:21,120
locuri în care învățarea prin întărire au

11548
08:54:17,680 --> 08:54:24,878
fost folosit, am spus mașini autonome um

11549
08:54:21,120 --> 08:54:26,718
jocuri deci unul dintre cele mai faimoase

11550
08:54:24,878 --> 08:54:31,600
exemple dacă vrei să-l cauți

11551
08:54:26,718 --> 08:54:34,958
um Alph Go asta a fost în 2016 um the

11552
08:54:31,600 --> 08:54:38,318
Algoritmul Alph Go uh a fost o întărire

11553
08:54:34,958 --> 08:54:41,280
bot de învățare care a învins unele dintre ele

11554
08:54:38,318 --> 08:54:44,080
cei mai buni jucători de Go din lume care merg dacă

11555
08:54:41,280 --> 08:54:45,680
nu ești familiar. Go este o placă

11556
08:54:44,080 --> 08:54:48,958
joc

11557
08:54:45,680 --> 08:54:52,398
asta e un pic mai complex

11558
08:54:48,958 --> 08:54:57,120
decât șahul. Are mai multe uh este a

11559
08:54:52,398 --> 08:54:58,958
placă mai mare um mai multe piese la ea. Hm

11560
08:54:57,120 --> 08:55:01,520
dar ei au existat o întărire

11561
08:54:58,958 --> 08:55:03,680
bot alimentat de învățare care de fapt um

11562
08:55:01,520 --> 08:55:06,080
a învățat cum să joci așa

11563
08:55:03,680 --> 08:55:08,958
eficient ar putea învinge un fel de lume

11564
08:55:06,080 --> 08:55:11,200
Masters la jocuri a fost destul de uimitor.

11565
08:55:08,958 --> 08:55:15,680
Um, asta e alpha go și asta a trecut

11566
08:55:11,200 --> 08:55:17,040
deep mind Google și deep mind în 2016.

11567
08:55:15,680 --> 08:55:19,680
A fost frumos, a fost doar în 10

11568
08:55:17,040 --> 08:55:24,398
cu ani în urmă nu atât de mult.

11569
08:55:19,680 --> 08:55:27,600
Um atât de sigur că am spus recomandare

11570
08:55:24,398 --> 08:55:30,558
uh, chiar și autocorectarea învățând să

11571
08:55:27,600 --> 08:55:32,398
preziceți cum ar fi cea mai bună corecție

11572
08:55:30,558 --> 08:55:34,798
uh pentru a genera o recompensă care ar fi

11573
08:55:32,398 --> 08:55:37,520
ca și cum ai accepta acea corectare sau tu

11574
08:55:34,798 --> 08:55:40,000
respingerea ar fi o penalizare. Um asa

11575
08:55:37,520 --> 08:55:41,760
învăţarea consolidată a fost adaptată la

11576
08:55:40,000 --> 08:55:44,080
acest gen de probleme foarte

11577
08:55:41,760 --> 08:55:47,200
cu succes. Să aruncăm o privire la

11578
08:55:44,080 --> 08:55:50,798
pachete pe care le vom folosi pe tot parcursul. Deci

11579
08:55:47,200 --> 08:55:53,360
Bineînțeles că ne vom baza pe acești trei

11580
08:55:50,798 --> 08:55:56,398
pe care ne-am bazat deja pentru a face a

11581
08:55:53,360 --> 08:55:59,440
multe lucruri precum numpy de făcut numeric

11582
08:55:56,398 --> 08:56:02,160
manipulări și calcule.

11583
08:55:59,440 --> 08:56:05,120
Uh mapplot lib pentru a face orice complot și

11584
08:56:02,160 --> 08:56:08,878
nu numai map, dar poate și pe mare.

11585
08:56:05,120 --> 08:56:11,440
amândoi să comploteze. Um, panda

11586
08:56:08,878 --> 08:56:12,958
este una mare pentru că

11587
08:56:11,440 --> 08:56:15,120
acolo vor merge toate datele noastre

11588
08:56:12,958 --> 08:56:17,200
fi manipulat și pregătit înaintea acestuia

11589
08:56:15,120 --> 08:56:19,120
intră în modelare.

11590
08:56:17,200 --> 08:56:21,680
Deci, toate acele lucruri din care am învățat

11591
08:56:19,120 --> 08:56:24,878
Pandis va fi cu siguranță aplicat

11592
08:56:21,680 --> 08:56:27,360
aici, în acest curs, așa cum noi de fapt

11593
08:56:24,878 --> 08:56:29,040
construi modele. Um, desigur ca

11594
08:56:27,360 --> 08:56:31,760
aceste vechi pe care le-am lucrat

11595
08:56:29,040 --> 08:56:35,760
cu destul de mult um va mai fi

11596
08:56:31,760 --> 08:56:37,200
util aici în etapa de modelare. um,

11597
08:56:35,760 --> 08:56:40,240
totuși, în principal din motive diferite,

11598
08:56:37,200 --> 08:56:41,840
mai ales pentru a pregăti datele noastre

11599
08:56:40,240 --> 08:56:43,920
un fel de modelare sau poate să

11600
08:56:41,840 --> 08:56:46,000
vizualizați-l înainte de a face modelarea

11601
08:56:43,920 --> 08:56:48,958
ai o idee despre cum arată, acelea

11602
08:56:46,000 --> 08:56:50,958
fel de lucruri.

11603
08:56:48,958 --> 08:56:55,840
um,

11604
08:56:50,958 --> 08:56:58,080
sci este uneori util pentru anumite uh

11605
08:56:55,840 --> 08:56:59,600
um procesare ca în nesupravegheat

11606
08:56:58,080 --> 08:57:01,520
învăţarea. De fapt, vom folosi scyp a

11607
08:56:59,600 --> 08:57:04,638
puțin pentru a face dimensionalitate

11608
08:57:01,520 --> 08:57:07,120
reducere sau ajutați-ne să facem asta. Um asa

11609
08:57:04,638 --> 08:57:08,958
scypi va fi folosit ici și colo și

11610
08:57:07,120 --> 08:57:11,840
am mai văzut-o cu ipoteze

11611
08:57:08,958 --> 08:57:14,638
testarea folosim scypi ca testul și z

11612
08:57:11,840 --> 08:57:16,240
testul a venit de acolo. Hm unele dintre

11613
08:57:14,638 --> 08:57:19,280
vor veni lucruri de învățare nesupravegheate

11614
08:57:16,240 --> 08:57:22,798
de acolo, dar pachetul pe care îl vom folosi

11615
08:57:19,280 --> 08:57:25,840
de departe, cel mai mult din acest curs merge

11616
08:57:22,798 --> 08:57:29,680
a fi scikitlearn

11617
08:57:25,840 --> 08:57:31,920
care este aici. Hm și am văzut deja

11618
08:57:29,680 --> 08:57:35,280
puțin despre scikitlearn în termeni

11619
08:57:31,920 --> 08:57:38,318
de capacitatea sa de pre-procesare. Deci noi

11620
08:57:35,280 --> 08:57:40,318
utilizați uh minmax scaler și

11621
08:57:38,318 --> 08:57:43,040
scaler standard de acolo de la

11622
08:57:40,318 --> 08:57:47,280
modul de preprocesare în scikitlearn.

11623
08:57:43,040 --> 08:57:50,718
Dar are multe modele diferite

11624
08:57:47,280 --> 08:57:54,318
încorporat în el pe care îl putem folosi pentru a ajuta uh

11625
08:57:50,718 --> 08:57:56,558
faceți antrenamentul și previziunile noastre. Um asa

11626
08:57:54,318 --> 08:57:58,318
este o mașină incredibil de utilă

11627
08:57:56,558 --> 08:58:01,920
biblioteca de invatare. Este industria

11628
08:57:58,318 --> 08:58:03,440
bibliotecă standard de învățare automată. Hm dacă

11629
08:58:01,920 --> 08:58:05,920
vei face orice în mașină

11630
08:58:03,440 --> 08:58:08,160
învăţând, ar fi de aşteptat ca tu

11631
08:58:05,920 --> 08:58:10,318
știi cum să folosești scikitlearn.

11632
08:58:08,160 --> 08:58:13,200
Acum, ceea ce este cu adevărat norocos la asta este

11633
08:58:10,318 --> 08:58:15,680
că scikitlearn este foarte ușor

11634
08:58:13,200 --> 08:58:17,280
pachet cu care să te obișnuiești. Aproape

11635
08:58:15,680 --> 08:58:20,318
tot ceea ce facem în scikitlearn va fi

11636
08:58:17,280 --> 08:58:22,398
de cele mai multe ori urmează același model și așa

11637
08:58:20,318 --> 08:58:24,478
codul va fi extrem de simplu. Ei

11638
08:58:22,398 --> 08:58:26,398
a făcut o treabă grozavă cu acel pachet de

11639
08:58:24,478 --> 08:58:29,360
face lucrurile cu adevărat ușor de utilizat,

11640
08:58:26,398 --> 08:58:30,798
chiar simplu. Hm, este cu adevărat

11641
08:58:29,360 --> 08:58:33,120
pachet fantastic și vom primi

11642
08:58:30,798 --> 08:58:34,798
multă practică cu ea pe măsură ce mergem

11643
08:58:33,120 --> 08:58:37,680
de-a lungul. Fiecare model pe care îl construim va fi

11644
08:58:34,798 --> 08:58:40,240
în esență să fie de la scikitlearn

11645
08:58:37,680 --> 08:58:41,360
și nu doar ca modelele dar um

11646
08:58:40,240 --> 08:58:43,520
a face antrenamentul, a face

11647
08:58:41,360 --> 08:58:45,840
predicții și apoi făcând

11648
08:58:43,520 --> 08:58:49,840
evaluarea va veni toate din diferite

11649
08:58:45,840 --> 08:58:52,000
uh scikitlearn u module. Așa va fi

11650
08:58:49,840 --> 08:58:53,840
foarte drăguț și vom fi bine

11651
08:58:52,000 --> 08:58:56,638
expunerea la acel pachet pe tot parcursul

11652
08:58:53,840 --> 08:59:01,280
desigur. Deci, dacă ceva va veni

11653
08:58:56,638 --> 08:59:04,798
de la acest curs ca um scikitlearn uh uh

11654
08:59:01,280 --> 08:59:06,958
experți care vor fi foarte drăguți. Deci asta este

11655
08:59:04,798 --> 08:59:11,638
acesta va fi cel nou pentru noi să învățăm

11656
08:59:06,958 --> 08:59:11,638
dar vom avea multă practică cu el.

11657
08:59:12,000 --> 08:59:15,000
Bine.

11658
08:59:16,080 --> 08:59:21,120
În regulă. Așa că doar pentru a recapitula acea lecție

11659
08:59:18,958 --> 08:59:22,318
înainte de a trece la lecția trei. Hm noi

11660
08:59:21,120 --> 08:59:25,840
a vorbit despre învățarea automată ca

11661
08:59:22,318 --> 08:59:28,798
învățarea din datele um care sunt incluse

11662
08:59:25,840 --> 08:59:30,558
sub umbrela AI, dar adânc

11663
08:59:28,798 --> 08:59:31,440
învățarea este, de asemenea, inclusă în mașină

11664
08:59:30,558 --> 08:59:34,080
învăț pentru că încă se învață

11665
08:59:31,440 --> 08:59:35,600
din date, dar se învață folosind neuronale

11666
08:59:34,080 --> 08:59:37,440
retelelor.

11667
08:59:35,600 --> 08:59:38,638
Am vorbit despre cele patru diferite

11668
08:59:37,440 --> 08:59:41,520
tipuri de învățare automată. Am avut

11669
08:59:38,638 --> 08:59:44,240
supravegheat, nesupravegheat,

11670
08:59:41,520 --> 08:59:45,760
semisupravegheata si intarire. Deci

11671
08:59:44,240 --> 08:59:48,478
acestea sunt diferitele tipuri de

11672
08:59:45,760 --> 08:59:49,920
învățarea automată care există. Hm

11673
08:59:48,478 --> 08:59:53,600
și apoi am vorbit despre unii dintre pi

11674
08:59:49,920 --> 08:59:55,760
Pachetele Python pe care le vom folosi. The

11675
08:59:53,600 --> 08:59:57,680
principalul fiind scikitlearn și bineînțeles

11676
08:59:55,760 --> 08:59:59,840
ne vom folosi bătrânii ca panda

11677
08:59:57,680 --> 09:00:02,878
manipulați datele noastre și treceți-le

11678
08:59:59,840 --> 09:00:06,558
în antrenamentul nostru model etc. Dar

11679
09:00:02,878 --> 09:00:10,080
scikitlearn va fi goto-ul nostru

11680
09:00:06,558 --> 09:00:11,840
orice învățare automată.

11681
09:00:10,080 --> 09:00:14,958
În regulă. Deci, am câteva întrebări pentru

11682
09:00:11,840 --> 09:00:16,558
voi băieți, niște verificări.

11683
09:00:14,958 --> 09:00:19,280
Deci, anunță-mă în chat. ce faci

11684
09:00:16,558 --> 09:00:24,360
băieții cred? Uh, care dintre următoarele

11685
09:00:19,280 --> 09:00:24,360
descrie cel mai bine învățarea automată?

11686
09:00:26,958 --> 09:00:33,478
Care alegere crezi că este cea mai bună

11687
09:00:29,600 --> 09:00:33,478
este cel mai bun pentru asta?

11688
09:01:12,160 --> 09:01:16,718
Foarte bun. Foarte bun. Văd că văd multe

11689
09:01:14,318 --> 09:01:19,680
de opțiuni pentru A și A ar fi

11690
09:01:16,718 --> 09:01:23,840
alegere corectă. Deci învățarea automată este

11691
09:01:19,680 --> 09:01:25,760
cu siguranță un subset de AI. Este

11692
09:01:23,840 --> 09:01:27,360
sub acea umbrelă AI, dar de

11693
09:01:25,760 --> 09:01:28,958
bineînțeles că învățăm din experiență

11694
09:01:27,360 --> 09:01:32,160
și desigur că această experiență este

11695
09:01:28,958 --> 09:01:34,638
înregistrate în datele um fără a fi

11696
09:01:32,160 --> 09:01:36,240
programat în mod explicit. Uh, deci este

11697
09:01:34,638 --> 09:01:38,240
exact opusul BNC. Cu siguranță suntem

11698
09:01:36,240 --> 09:01:40,718
nu invata din reguli si este

11699
09:01:38,240 --> 09:01:42,718
cu siguranță nu folosit doar pentru imagine și

11700
09:01:40,718 --> 09:01:46,000
recunoașterea vorbirii. Poate fi

11701
09:01:42,718 --> 09:01:49,200
folosit pentru multe alte lucruri dincolo de acestea.

11702
09:01:46,000 --> 09:01:52,760
Deci da, A este cea mai bună alegere acolo.

11703
09:01:49,200 --> 09:01:52,760
Ce spunem noi aici?

11704
09:01:53,600 --> 09:01:57,280
Bine. Ce părere aveți despre asta?

11705
09:01:55,120 --> 09:01:58,718
Care exemplu ilustrează utilizarea

11706
09:01:57,280 --> 09:02:03,958
învățare automată pentru a îmbunătăți clientul

11707
09:01:58,718 --> 09:02:03,958
experiență într-o companie de comerț electronic?

11708
09:02:13,360 --> 09:02:17,760
Cu alte cuvinte, ce ar fi ceva ce

11709
09:02:14,798 --> 09:02:21,080
ar fi niște uh cazuri de utilizare tipice ale

11710
09:02:17,760 --> 09:02:21,080
învățare automată?

11711
09:02:45,760 --> 09:02:51,200
Bun. Deci cred că uh C va fi

11712
09:02:48,478 --> 09:02:54,318
cel mai bun raspuns aici. Categoric C. Deci este

11713
09:02:51,200 --> 09:02:56,398
folosind învățarea automată pentru a face fraudă

11714
09:02:54,318 --> 09:02:58,080
tranzacții. Deci asta ar fi o

11715
09:02:56,398 --> 09:03:00,398
predicție probabil un supravegheat

11716
09:02:58,080 --> 09:03:03,600
invata, nu? Dacă dacă aceasta este fraudă sau

11717
09:03:00,398 --> 09:03:06,318
nu fraudă. Hm, și apoi poate unii

11718
09:03:03,600 --> 09:03:08,478
comportamentul clientului, asta ar putea fi

11719
09:03:06,318 --> 09:03:10,878
nesupravegheat. Deci, poate gruparea împreună

11720
09:03:08,478 --> 09:03:13,280
clienții grupându-i pe baza

11721
09:03:10,878 --> 09:03:16,878
datele lor precum comportamentul lor de cumpărături

11722
09:03:13,280 --> 09:03:18,558
si caracteristici. Hm că asta ar putea

11723
09:03:16,878 --> 09:03:21,040
fi nesupravegheat, dar oricum e

11724
09:03:18,558 --> 09:03:24,040
învățarea automată.

11725
09:03:21,040 --> 09:03:24,040
Bine.

11726
09:03:26,718 --> 09:03:30,878
Bine. Cel final. Ceea ce distinge adânc

11727
09:03:28,958 --> 09:03:32,240
învățarea din învățarea automată în

11728
09:03:30,878 --> 09:03:35,440
inteligență artificială? Deci ce este

11729
09:03:32,240 --> 09:03:35,440
unic în ceea ce privește învățarea profundă?

11730
09:04:03,600 --> 09:04:09,120
Oh, foarte bine. Da. Deci, învățare profundă

11731
09:04:05,440 --> 09:04:10,718
folosește rețele neuronale așa cum sunteți voi

11732
09:04:09,120 --> 09:04:12,240
chiar deasupra. Adanc neuronal

11733
09:04:10,718 --> 09:04:14,958
învățarea folosește rețele neuronale. Asta este

11734
09:04:12,240 --> 09:04:17,040
îl face unic. Deci, învățarea automată

11735
09:04:14,958 --> 09:04:18,718
ar fi partea A. Învățarea automată este

11736
09:04:17,040 --> 09:04:20,958
concentrat pe învăţarea din date.

11737
09:04:18,718 --> 09:04:23,600
Sub asta se află învățarea din date

11738
09:04:20,958 --> 09:04:27,040
folosind rețele neuronale care este ceea ce uh

11739
09:04:23,600 --> 09:04:30,318
învăţarea profundă este.

11740
09:04:27,040 --> 09:04:34,638
Foarte bun.

11741
09:04:30,318 --> 09:04:36,958
În regulă. Să trecem la lecția trei.

11742
09:04:34,638 --> 09:04:40,080
Și lecția 3 are două caiete. Suntem

11743
09:04:36,958 --> 09:04:41,520
va începe cu 3.1.

11744
09:04:40,080 --> 09:04:43,040
Deci, veți dori să deschideți asta

11745
09:04:41,520 --> 09:04:47,718
caietul. Am de gând să trec la el

11746
09:04:43,040 --> 09:04:47,718
acum. Oferă-ți un moment pentru a deschide asta.

11747
09:04:52,958 --> 09:04:57,680
Deci, vom deschide versiunea 3.1

11748
09:04:54,798 --> 09:04:59,120
caietul. Hm, sunt doi. Vom face

11749
09:04:57,680 --> 09:05:02,240
vedem cât de departe putem ajunge în

11750
09:04:59,120 --> 09:05:04,478
a doua azi. probabil va.

11751
09:05:02,240 --> 09:05:06,398
Hm, dar vom face ceea ce suntem

11752
09:05:04,478 --> 09:05:08,240
va începe cu notebook-ul 3.1. tu

11753
09:05:06,398 --> 09:05:13,200
baieti au acest caiet? Ar trebui să fie în

11754
09:05:08,240 --> 09:05:14,478
materialele dvs. pentru acest curs.

11755
09:05:13,200 --> 09:05:17,478
Permiteți-mi să vă acord un moment pentru a deschide asta

11756
09:05:14,478 --> 09:05:17,478
unul.

11757
09:05:30,718 --> 09:05:34,280
Voi îl aveți?

11758
09:05:44,558 --> 09:05:50,080
Bine.

11759
09:05:46,878 --> 09:05:54,638
În regulă. Deci, vom începe cu

11760
09:05:50,080 --> 09:05:56,718
vorbesc despre învățarea supravegheată.

11761
09:05:54,638 --> 09:05:58,080
în călătoria noastră de învățare automată. Deci

11762
09:05:56,718 --> 09:06:00,798
amintiți-vă că vom vorbi despre uh

11763
09:05:58,080 --> 09:06:02,318
supravegheat și nesupravegheat după ce o facem

11764
09:06:00,798 --> 09:06:03,760
supravegheat

11765
09:06:02,318 --> 09:06:07,360
um și vor fi multe de făcut

11766
09:06:03,760 --> 09:06:09,918
acoperi cu supravegheat în principal pentru că um

11767
09:06:07,360 --> 09:06:13,040
există două tipuri diferite de

11768
09:06:09,918 --> 09:06:14,238
problemele pe care le putem rezolva, care vor fi

11769
09:06:13,040 --> 09:06:17,200
uh, vom vorbi peste un moment

11770
09:06:14,238 --> 09:06:18,878
prezice diferite tipuri de valori. Hm

11771
09:06:17,200 --> 09:06:21,438
dar să vorbim despre felul de ce

11772
09:06:18,878 --> 09:06:22,640
sperăm să aflăm aici care este um

11773
09:06:21,438 --> 09:06:24,160
vorbesc despre diferitele tipuri de

11774
09:06:22,640 --> 09:06:26,000
problemele pe care le vom studia care sunt

11775
09:06:24,160 --> 09:06:28,480
acestea aceste categorii de supravegheat

11776
09:06:26,000 --> 09:06:29,680
învăţarea. Sunt acele două categorii

11777
09:06:28,480 --> 09:06:31,122
urmând a fi numită clasificare și

11778
09:06:29,680 --> 09:06:33,040
regresie. Vom vorbi despre acestea și

11779
09:06:31,122 --> 09:06:36,558
diferențele lor și apoi vorbesc despre

11780
09:06:33,040 --> 09:06:38,238
unele aplicații și câteva exemple

11781
09:06:36,558 --> 09:06:40,558
algoritmi

11782
09:06:38,238 --> 09:06:44,078
și asta se află doar în acest caiet. Hm

11783
09:06:40,558 --> 09:06:48,480
3.2 doi vom intra în regresie

11784
09:06:44,078 --> 09:06:50,398
special um care va fi uh foarte foarte

11785
09:06:48,480 --> 09:06:51,918
interesant. Bine. Deci asta va fi al nostru

11786
09:06:50,398 --> 09:06:55,398
primele modele pe care le vom construi vor fi

11787
09:06:51,918 --> 09:06:55,398
acolo în 3.2.

11788
09:06:56,000 --> 09:07:00,078
Bine. Deci, dacă vă amintiți, băieți

11789
09:06:58,398 --> 09:07:03,200
învățarea supravegheată este locul în care învățăm

11790
09:07:00,078 --> 09:07:07,438
din datele etichetate. Deci avem intrare și

11791
09:07:03,200 --> 09:07:10,480
ieșiri în setul nostru de date. Hm și

11792
09:07:07,438 --> 09:07:13,040
deci antrenezi un model pe aceste date care

11793
09:07:10,480 --> 09:07:16,878
include caracteristici de intrare și

11794
09:07:13,040 --> 09:07:21,040
ieşirile corespunzătoare care sunt care sunt

11795
09:07:16,878 --> 09:07:24,000
etichetele, nu? Deci scopul este să

11796
09:07:21,040 --> 09:07:25,680
învață o relație între intrare

11797
09:07:24,000 --> 09:07:28,878
și ieșirea. Desigur, asta este

11798
09:07:25,680 --> 09:07:32,320
orice model încearcă să facă. Hm, și ce

11799
09:07:28,878 --> 09:07:34,480
asta ne permite să facem este apoi să luăm asta

11800
09:07:32,320 --> 09:07:36,480
modelați și utilizați-l pentru a face predicții asupra

11801
09:07:34,480 --> 09:07:39,360
neprevăzut niciodată

11802
09:07:36,480 --> 09:07:41,438
uh date. Corect? Deci atunci avem un

11803
09:07:39,360 --> 09:07:46,078
model predictiv din ceea ce putem

11804
09:07:41,438 --> 09:07:47,598
folosește-te în continuare cu exemple noi. Hm

11805
09:07:46,078 --> 09:07:50,480
deci

11806
09:07:47,598 --> 09:07:52,960
amintiți-vă că vom avea în datele noastre a

11807
09:07:50,480 --> 09:07:54,800
o grămadă de caracteristici care sunt coloane și

11808
09:07:52,960 --> 09:07:56,480
atunci, în general, una dintre acele coloane va

11809
09:07:54,800 --> 09:07:58,078
să fie eticheta pe care încercăm să o facem

11810
09:07:56,480 --> 09:08:00,558
prezice.

11811
09:07:58,078 --> 09:08:02,160
Și modelul nostru va încerca să învețe

11812
09:08:00,558 --> 09:08:05,840
un fel de relație între aceștia

11813
09:08:02,160 --> 09:08:07,598
intrări și eticheta de ieșire. Deci

11814
09:08:05,840 --> 09:08:11,360
eticheta de ieșire ar putea fi ca o fraudă nu

11815
09:08:07,598 --> 09:08:15,480
fraudă, cancer, nu cancer, un preț, a

11816
09:08:11,360 --> 09:08:15,480
temperatura, astfel de lucruri.

11817
09:08:15,520 --> 09:08:19,918
Deci hai să vorbim despre asta. înăuntrul lui

11818
09:08:18,398 --> 09:08:23,040
învățarea supravegheată sunt două

11819
09:08:19,918 --> 09:08:26,558
diferite tipuri de învățare pe care le putem

11820
09:08:23,040 --> 09:08:29,040
fac și se bazează într-adevăr pe etichetă

11821
09:08:26,558 --> 09:08:32,320
sau uneori acea etichetă este cunoscută sub numele de

11822
09:08:29,040 --> 09:08:35,200
ținta pe care încercăm să o prevedem. Hm

11823
09:08:32,320 --> 09:08:36,878
și în funcție de tipul respectiv le obținem

11824
09:08:35,200 --> 09:08:39,200
două categorii diferite de învăţare sau

11825
09:08:36,878 --> 09:08:42,160
două tipuri diferite de învăţare. Unul este

11826
09:08:39,200 --> 09:08:44,960
cunoscut sub numele de regresie. Deci asta e in general

11827
09:08:42,160 --> 09:08:47,122
când prezicem ceva care este

11828
09:08:44,960 --> 09:08:49,840
continuu sau ceva care este a

11829
09:08:47,122 --> 09:08:52,000
numerice.

11830
09:08:49,840 --> 09:08:55,278
Deci numeric

11831
09:08:52,000 --> 09:08:57,758
valoare numerică. Deci gândește-te la preț,

11832
09:08:55,278 --> 09:08:59,520
gândiți-vă la temperatură, gândiți-vă la venituri.

11833
09:08:57,758 --> 09:09:02,718
Încercăm să prezicem ceva de genul

11834
09:08:59,520 --> 09:09:05,360
că. Um față de ceva care este

11835
09:09:02,718 --> 09:09:06,800
categoric. Deci prezicerea

11836
09:09:05,360 --> 09:09:09,758
ceva categoric ar fi ca

11837
09:09:06,800 --> 09:09:13,200
fraudă, nu fraudă, spam, nu spam. um

11838
09:09:09,758 --> 09:09:15,680
acestea sunt categorii discrete și

11839
09:09:13,200 --> 09:09:19,122
problema prezicerii categoriilor este este

11840
09:09:15,680 --> 09:09:22,718
cunoscut sub numele de clasificare pentru că suntem

11841
09:09:19,122 --> 09:09:26,558
încercând să clasifice exemplele ca aparținând

11842
09:09:22,718 --> 09:09:29,438
la o categorie sau alta.

11843
09:09:26,558 --> 09:09:31,520
Deci avem aceste două tipuri principale de

11844
09:09:29,438 --> 09:09:33,598
probleme de învățare supravegheată. avem

11845
09:09:31,520 --> 09:09:36,000
regresie și avem clasificare

11846
09:09:33,598 --> 09:09:39,918
și vor fi manipulate ușor

11847
09:09:36,000 --> 09:09:42,480
diferit um din multe motive că

11848
09:09:39,918 --> 09:09:45,122
vom descoperi. Unul dintre

11849
09:09:42,480 --> 09:09:47,040
motivul principal este că, desigur, suntem

11850
09:09:45,122 --> 09:09:48,800
prezice ceva care este continuu

11851
09:09:47,040 --> 09:09:50,960
în cazul regresiei versus ceva

11852
09:09:48,800 --> 09:09:53,278
discret. Deci modelele trebuie să fie

11853
09:09:50,960 --> 09:09:57,520
ușor diferit pentru a explica asta.

11854
09:09:53,278 --> 09:10:00,718
Hm, dar apoi un pas dincolo de asta este

11855
09:09:57,520 --> 09:10:02,078
evaluarea trebuie să fie și ea diferită. Hm eu

11856
09:10:00,718 --> 09:10:03,438
cam făcut aluzie la asta săptămâna trecută, dar

11857
09:10:02,078 --> 09:10:05,840
când prezici o regresie,

11858
09:10:03,438 --> 09:10:11,520
este foarte foarte dificil să obții

11859
09:10:05,840 --> 09:10:15,918
răspuns numeric exact. Deci, în general

11860
09:10:11,520 --> 09:10:18,398
nu ne pasă de asta. Hm, în general

11861
09:10:15,918 --> 09:10:20,320
nu ne interesează să-l obținem exact

11862
09:10:18,398 --> 09:10:22,000
nu ne interesează să-l primim

11863
09:10:20,320 --> 09:10:25,122
exact corect.

11864
09:10:22,000 --> 09:10:26,960
ne pasă doar să-l luăm

11865
09:10:25,122 --> 09:10:30,558
doar ne pasă să-l obținem

11866
09:10:26,960 --> 09:10:33,200
aproape, apropiindu-l suficient. Hm

11867
09:10:30,558 --> 09:10:34,640
în timp ce clasificare, ne pasă

11868
09:10:33,200 --> 09:10:36,878
obținerea corectă pentru că este o

11869
09:10:34,640 --> 09:10:38,398
categorie discretă. Deci vom fi

11870
09:10:36,878 --> 09:10:40,558
capabil să evalueze puțin asta

11871
09:10:38,398 --> 09:10:42,160
altfel să spunem că am primit răspunsul

11872
09:10:40,558 --> 09:10:45,758
corect sau greșit. Regresia va fi

11873
09:10:42,160 --> 09:10:46,800
fi ne-am apropiat? Hm pentru că suntem noi

11874
09:10:45,758 --> 09:10:49,122
presupun că va fi aproape

11875
09:10:46,800 --> 09:10:54,238
imposibil de prezis un continuu

11876
09:10:49,122 --> 09:10:56,000
număr. E foarte greu de făcut.

11877
09:10:54,238 --> 09:10:58,800
Bine.

11878
09:10:56,000 --> 09:11:02,040
Deci, orice întrebări despre

11879
09:10:58,800 --> 09:11:02,040
uh asta?

11880
09:11:04,800 --> 09:11:07,438
Aveți întrebări despre aceste două diferențe?

11881
09:11:06,238 --> 09:11:11,122
Permiteți-mi să vă dau câteva exemple. Poate

11882
09:11:07,438 --> 09:11:12,800
va ajuta și el.

11883
09:11:11,122 --> 09:11:14,960
Deci, din nou, clasificarea merge

11884
09:11:12,800 --> 09:11:17,040
să prezic ceva care este

11885
09:11:14,960 --> 09:11:22,200
categoric. regresia va fi

11886
09:11:17,040 --> 09:11:22,200
prezice ceva care este continuu.

11887
09:11:24,160 --> 09:11:27,840
Deci gândește-te să încerci să prezici

11888
09:11:26,160 --> 09:11:29,360
prețul unei case pe baza celorlalte

11889
09:11:27,840 --> 09:11:32,160
caracteristici despre care am vorbit înainte ca

11890
09:11:29,360 --> 09:11:34,000
mp, dormitoare, bai, toate

11891
09:11:32,160 --> 09:11:35,840
dintre aceste lucruri prezicem prețul.

11892
09:11:34,000 --> 09:11:39,680
Asta ar fi o problemă de regresie

11893
09:11:35,840 --> 09:11:42,160
deoarece prețul este o valoare continuă.

11894
09:11:39,680 --> 09:11:46,238
Să aruncăm o privire la un exemplu aici.

11895
09:11:42,160 --> 09:11:49,278
Hm, imaginează-ți că am încercat să prezicem

11896
09:11:46,238 --> 09:11:51,438
temperatura de maine. Asta merge

11897
09:11:49,278 --> 09:11:53,360
a fi o problemă de regresie, o a

11898
09:11:51,438 --> 09:11:55,840
tip de regresie de învățare supravegheată

11899
09:11:53,360 --> 09:11:59,278
problemă pentru că încercăm să prevedem

11900
09:11:55,840 --> 09:12:03,758
o temperatură numerică.

11901
09:11:59,278 --> 09:12:05,438
Bine? Și față de o categorie ca a

11902
09:12:03,758 --> 09:12:07,040
categorie discretă ar fi aceasta ar fi

11903
09:12:05,438 --> 09:12:09,200
o clasificare. Deci acesta este un

11904
09:12:07,040 --> 09:12:11,840
regresie la stânga. Acesta este un

11905
09:12:09,200 --> 09:12:16,800
clasificare

11906
09:12:11,840 --> 09:12:21,040
pe dreapta. Clasificare

11907
09:12:16,800 --> 09:12:23,278
um pentru că um prezicem unul dintre

11908
09:12:21,040 --> 09:12:25,360
doua categorii. Este doar cald sau rece?

11909
09:12:23,278 --> 09:12:27,840
Acum, nu spunem exact unde

11910
09:12:25,360 --> 09:12:29,840
pragul este pe ceea ce este cald sau rece. Asta

11911
09:12:27,840 --> 09:12:32,000
ar fi o decizie asupra a ceea ce ne dorim

11912
09:12:29,840 --> 09:12:33,598
la ceea ce categoriile noastre discrete de fapt

11913
09:12:32,000 --> 09:12:37,122
înseamnă.

11914
09:12:33,598 --> 09:12:38,800
Dar avem doar două variante, fierbinte sau

11915
09:12:37,122 --> 09:12:41,360
rece.

11916
09:12:38,800 --> 09:12:44,558
versus prezicerea întregii temperaturi

11917
09:12:41,360 --> 09:12:48,800
care ar fi o predicție numerică

11918
09:12:44,558 --> 09:12:50,718
de un număr exact. Corect? Așa ar fi

11919
09:12:48,800 --> 09:12:52,640
fie o regresie și apoi pe dreapta

11920
09:12:50,718 --> 09:12:55,278
ar fi o clasificare.

11921
09:12:52,640 --> 09:12:56,640
Acum, din nou, de ce este asta atât de diferit?

11922
09:12:55,278 --> 09:12:57,918
Puteți vedea tipurile de predicții

11923
09:12:56,640 --> 09:13:00,238
facem că sunt complet diferite.

11924
09:12:57,918 --> 09:13:03,360
Unul este un număr, unul este o categorie. Dar

11925
09:13:00,238 --> 09:13:06,078
iar cu evaluarea parca

11926
09:13:03,360 --> 09:13:07,840
dacă răspunsul adevărat din etichetele noastre a fost

11927
09:13:06,078 --> 09:13:10,960
84

11928
09:13:07,840 --> 09:13:13,122
și am prezis 83 care este destul de bun

11929
09:13:10,960 --> 09:13:14,878
rezultat. Asta e încă destul de aproape.

11930
09:13:13,122 --> 09:13:17,200
E destul de aproape de asta. Deci dintr-o

11931
09:13:14,878 --> 09:13:20,160
perspectiva evaluării este frumoasă

11932
09:13:17,200 --> 09:13:22,640
bine. Hm, în timp ce parcă aș fi prezis

11933
09:13:20,160 --> 09:13:25,598
frig și de fapt e cald, atât

11934
09:13:22,640 --> 09:13:27,918
un raspuns gresit. Deci sunt evaluați

11935
09:13:25,598 --> 09:13:30,000
usor diferit.

11936
09:13:27,918 --> 09:13:33,520
Hm, și asta e ceva la care vom merge

11937
09:13:30,000 --> 09:13:35,918
vezi când vorbim despre evaluarea noastră

11938
09:13:33,520 --> 09:13:37,360
modelele odată ce le construim depinde

11939
09:13:35,918 --> 09:13:38,398
pe dacă este regresie de clasificare,

11940
09:13:37,360 --> 09:13:41,918
vor exista moduri diferite de

11941
09:13:38,398 --> 09:13:43,360
evaluându-le.

11942
09:13:41,918 --> 09:13:46,320
Poți să vezi de ce este foarte

11943
09:13:43,360 --> 09:13:50,078
greu de spus, bine, am ajuns exact

11944
09:13:46,320 --> 09:13:51,520
84 când ar putea fi orice număr. Al nostru

11945
09:13:50,078 --> 09:13:54,398
modelul va prezice a

11946
09:13:51,520 --> 09:13:56,800
număr. Este foarte greu de stabilit

11947
09:13:54,398 --> 09:13:58,878
un număr exact flotant. Deci,

11948
09:13:56,800 --> 09:14:00,640
Cel mai bine putem face este să spunem cât de aproape

11949
09:13:58,878 --> 09:14:02,078
am primit? Ca, asta ar fi mai rău

11950
09:14:00,640 --> 09:14:04,320
răspuns. Dacă am primit ceva până la capăt

11951
09:14:02,078 --> 09:14:06,960
aici jos, asta e o distanță foarte lungă

11952
09:14:04,320 --> 09:14:08,160
până aici. Asta e rău. Asta e un rău

11953
09:14:06,960 --> 09:14:11,278
predictie. Dar dacă primesc ceva

11954
09:14:08,160 --> 09:14:13,040
foarte aproape, e mai bine, nu?

11955
09:14:11,278 --> 09:14:15,278
Este o predicție decentă pentru că este

11956
09:14:13,040 --> 09:14:17,438
destul de aproape,

11957
09:14:15,278 --> 09:14:18,718
nu?

11958
09:14:17,438 --> 09:14:20,800
Desigur, a fi perfect ar fi

11959
09:14:18,718 --> 09:14:24,758
ajunge exact, dar asta ar fi

11960
09:14:20,800 --> 09:14:24,758
aproape imposibil de făcut.

11961
09:14:33,598 --> 09:14:36,598
Bine.

11962
09:14:38,238 --> 09:14:43,040
În regulă. Aveți întrebări despre asta?

11963
09:14:41,278 --> 09:14:44,640
Are sens asupra regresiei versus

11964
09:14:43,040 --> 09:14:47,278
clasificare? O să le folosim

11965
09:14:44,640 --> 09:14:48,960
cuvinte destul de mult pe măsură ce mergem. Deci,

11966
09:14:47,278 --> 09:14:51,598
regresia care prezice continuu

11967
09:14:48,960 --> 09:14:54,320
valoare. Predicția de clasificare a

11968
09:14:51,598 --> 09:14:56,320
categorie.

11969
09:14:54,320 --> 09:15:00,122
Și vor fi diferiți

11970
09:14:56,320 --> 09:15:00,122
modele care fac asta

11971
09:15:01,438 --> 09:15:04,480
diferite modele fiind folosite pentru

11972
09:15:02,878 --> 09:15:07,800
regresia versus diferite modele fiind

11973
09:15:04,480 --> 09:15:07,800
folosit pentru clasificare.

11974
09:15:12,800 --> 09:15:18,718
Bine, hai să vorbim despre supravegheat

11975
09:15:15,360 --> 09:15:22,000
învăț aplicații uh aici. Deci doar

11976
09:15:18,718 --> 09:15:23,598
pentru a numi câteva, avem operațiuni de HR. este

11977
09:15:22,000 --> 09:15:26,320
recrutor imaginar însărcinat să găsească

11978
09:15:23,598 --> 09:15:29,438
cei mai buni candidați. Atat de supravegheat

11979
09:15:26,320 --> 09:15:30,800
învăţarea poate ajuta prin respingerea sau

11980
09:15:29,438 --> 09:15:32,878
acceptarea candidaților. Acum asta este

11981
09:15:30,800 --> 09:15:37,918
ceva care se întâmplă destul de puțin chiar

11982
09:15:32,878 --> 09:15:40,238
azi. Hm și că este un fel ca uh

11983
09:15:37,918 --> 09:15:42,558
cum se întâmplă astfel de recomandări

11984
09:15:40,238 --> 09:15:45,122
acest CV ar trebui recomandat

11985
09:15:42,558 --> 09:15:49,200
asta nu ar trebui să fie dintr-un întreg grup de

11986
09:15:45,122 --> 09:15:52,878
aplicatii. Deci există genul ăsta

11987
09:15:49,200 --> 09:15:54,078
de cazuri de utilizare a de um prezicerea a

11988
09:15:52,878 --> 09:15:56,000
categorie care ar fi ca o

11989
09:15:54,078 --> 09:15:59,122
clasificare. Ar trebui să facem

11990
09:15:56,000 --> 09:16:01,520
accept sau respinge candidatul?

11991
09:15:59,122 --> 09:16:04,000
Finanțe, vezi asta tot timpul

11992
09:16:01,520 --> 09:16:05,520
cu lucruri precum riscul și împrumutul

11993
09:16:04,000 --> 09:16:09,598
aprobări.

11994
09:16:05,520 --> 09:16:12,320
Poți să prezici

11995
09:16:09,598 --> 09:16:14,000
categorie de like if the if the credit if

11996
09:16:12,320 --> 09:16:15,680
ar trebui să acceptăm sau să respingem împrumutul

11997
09:16:14,000 --> 09:16:17,680
aplicarea.

11998
09:16:15,680 --> 09:16:19,278
um știi că ar fi un

11999
09:16:17,680 --> 09:16:21,360
clasificare.

12000
09:16:19,278 --> 09:16:23,520
Ce este interesant

12001
09:16:21,360 --> 09:16:26,078
clasificări de altfel, așa se spune

12002
09:16:23,520 --> 09:16:28,878
aici ca și cum am putea prezice probabilitatea

12003
09:16:26,078 --> 09:16:33,758
a unui împrumut în curs de rambursare

12004
09:16:28,878 --> 09:16:36,320
um este o mulțime de clasificări um noi

12005
09:16:33,758 --> 09:16:38,398
spun că ei prezic o categorie dar

12006
09:16:36,320 --> 09:16:40,238
sub capotă ei pot prezice de fapt

12007
09:16:38,398 --> 09:16:45,758
o probabilitate și o întoarcem

12008
09:16:40,238 --> 09:16:47,840
probabilitatea într-o categorie. Deci, um, tu

12009
09:16:45,758 --> 09:16:49,200
Știi, de parcă am putea spune ce am putea

12010
09:16:47,840 --> 09:16:51,438
spune probabilitatea ca împrumutul ei să fie

12011
09:16:49,200 --> 09:16:54,878
rambursat este foarte mic. Să zicem că este mai puțin

12012
09:16:51,438 --> 09:16:57,918
probabilitate de peste 50%. Hm, atunci am putea

12013
09:16:54,878 --> 09:16:59,200
etichetați acest lucru drept respingere,

12014
09:16:57,918 --> 09:17:03,278
nu? Am putea eticheta asta drept a

12015
09:16:59,200 --> 09:17:06,480
respingere. Hm, dacă este mai mare de 50%.

12016
09:17:03,278 --> 09:17:09,040
Atunci am putea eticheta asta ca accept. Deci

12017
09:17:06,480 --> 09:17:12,078
putem stabili un prag acolo

12018
09:17:09,040 --> 09:17:14,160
și spuneți bine, cu adevărat, prezicem a

12019
09:17:12,078 --> 09:17:16,960
probabil ca modelul nostru scuipa a

12020
09:17:14,160 --> 09:17:19,360
probabilitate, dar o transformăm într-o

12021
09:17:16,960 --> 09:17:22,160
categorie spunând ar trebui să acceptăm dacă

12022
09:17:19,360 --> 09:17:25,200
este mai puțin de 50% ar trebui să respingem dacă

12023
09:17:22,160 --> 09:17:26,558
este mai mare decât ar trebui să acceptăm.

12024
09:17:25,200 --> 09:17:28,000
Bine, deci asta e ceva ce vom vedea

12025
09:17:26,558 --> 09:17:30,480
cu unele dintre modelele noastre de clasificare

12026
09:17:28,000 --> 09:17:32,558
este că produc de fapt o

12027
09:17:30,480 --> 09:17:36,078
probabilitate și întoarcem acea probabilitate

12028
09:17:32,558 --> 09:17:38,078
într-o etichetă de categorie

12029
09:17:36,078 --> 09:17:41,278
um făcând ceva simplu de genul

12030
09:17:38,078 --> 09:17:44,840
asta pune un prag pe ea um pt

12031
09:17:41,278 --> 09:17:44,840
pentru categorie.

12032
09:17:45,758 --> 09:17:49,360
Deci finanțele sunt folosite peste tot.

12033
09:17:47,680 --> 09:17:50,878
Nu doar împrumuturi precum frauda, noi

12034
09:17:49,360 --> 09:17:52,878
a vorbit despre fraudă, nu despre fraudă. Asta

12035
09:17:50,878 --> 09:17:56,480
ar fi o clasificare.

12036
09:17:52,878 --> 09:17:58,800
Hm prezicerea veniturilor din vânzări, așa ar fi

12037
09:17:56,480 --> 09:18:00,718
fi o regresie, nu? Ce este

12038
09:17:58,800 --> 09:18:02,640
veniturile vor fi în următoarele două

12039
09:18:00,718 --> 09:18:05,122
sferturi? Asta va fi o

12040
09:18:02,640 --> 09:18:07,840
problema de regresie.

12041
09:18:05,122 --> 09:18:10,000
E-mailuri ca spam, nu spam, asta e

12042
09:18:07,840 --> 09:18:12,000
va fi o clasificare.

12043
09:18:10,000 --> 09:18:14,878
um asta va opera pe asta

12044
09:18:12,000 --> 09:18:18,160
va prelua textul introdus și va prezice

12045
09:18:14,878 --> 09:18:20,878
dacă acest e-mail este spam sau nu este spam.

12046
09:18:18,160 --> 09:18:22,640
Va fi supravegheat

12047
09:18:20,878 --> 09:18:25,520
problemă de învățare, dar va fi a

12048
09:18:22,640 --> 09:18:28,398
problema de clasificare,

12049
09:18:25,520 --> 09:18:31,122
nu? Uh, producția este supravegheată

12050
09:18:28,398 --> 09:18:32,640
Învățarea este folosită pentru a inspecta și uh

12051
09:18:31,122 --> 09:18:34,160
calitatea si clasificarea produselor in

12052
09:18:32,640 --> 09:18:36,160
grade diferite. De exemplu, o fabrică

12053
09:18:34,160 --> 09:18:37,438
ar putea folosi un model pentru a verifica defecte.

12054
09:18:36,160 --> 09:18:39,918
Deci, acesta de fapt ceva care se întâmplă

12055
09:18:37,438 --> 09:18:42,160
te uiți la imagini cu produse ca

12056
09:18:39,918 --> 09:18:43,758
trec prin linia de asamblare şi

12057
09:18:42,160 --> 09:18:45,758
poți arunca o privire la acele imagini și

12058
09:18:43,758 --> 09:18:48,800
preziceți dacă este o calitate înaltă, scăzută

12059
09:18:45,758 --> 09:18:50,718
calitate, calitate medie. Ei să poată

12060
09:18:48,800 --> 09:18:52,320
fie aceasta este o clasificare, nu?

12061
09:18:50,718 --> 09:18:55,918
Ei intră în diferite categorii

12062
09:18:52,320 --> 09:18:58,878
de calitate. Hm, deci seamănă mult cu a

12063
09:18:55,918 --> 09:19:04,480
intervenție manuală a unora

12064
09:18:58,878 --> 09:19:08,438
QA sau controlul calității, specialist.

12065
09:19:04,480 --> 09:19:08,438
Bine. Dar asta e o clasificare.

12066
09:19:10,960 --> 09:19:15,360
Deci în industria maritimă, supravegheat

12067
09:19:13,200 --> 09:19:17,520
învățarea poate fi folosită pentru a prezice curentul,

12068
09:19:15,360 --> 09:19:20,560
deci nivelul actual

12069
09:19:17,520 --> 09:19:23,276
și asta poate fi folosit pentru a prognoza uh

12070
09:19:20,560 --> 09:19:26,880
cererea si oferta. Aşa ar fi

12071
09:19:23,276 --> 09:19:28,960
ca modelele de regresie care sunt obișnuite

12072
09:19:26,880 --> 09:19:33,320
prezice un fel de temperatură, dar

12073
09:19:28,960 --> 09:19:33,320
în acest caz ca nivelurile de titlu.

12074
09:19:34,080 --> 09:19:38,000
Am vorbit deja despre fraudă, așa că asta e

12075
09:19:36,000 --> 09:19:41,000
acolo. Um, asta ar fi o

12076
09:19:38,000 --> 09:19:41,000
clasificare.

12077
09:19:43,596 --> 09:19:50,800
bine,

12078
09:19:46,480 --> 09:19:53,916
vreo întrebare despre aceste exemple?

12079
09:19:50,800 --> 09:19:56,320
Desigur, mai sunt multe. Hm

12080
09:19:53,916 --> 09:19:59,436
recomandarea este un fel de a

12081
09:19:56,320 --> 09:20:01,200
problemă de învățare supravegheată, unde ești

12082
09:19:59,436 --> 09:20:03,360
sunt

12083
09:20:01,200 --> 09:20:06,080
luând exemple de lucruri pe care oamenii

12084
09:20:03,360 --> 09:20:08,640
au văzut în trecut sau sau au revizuit

12085
09:20:06,080 --> 09:20:10,560
în trecut și folosind asta pentru a prezice

12086
09:20:08,640 --> 09:20:14,080
ce ar dori să urmărească în

12087
09:20:10,560 --> 09:20:18,160
viitor. Așa este recomandarea

12088
09:20:14,080 --> 09:20:20,240
învăţare supravegheată. Hm și este ca o

12089
09:20:18,160 --> 09:20:23,840
clasificare, știi, încercând

12090
09:20:20,240 --> 09:20:27,436
prezice umh un anumit număr de

12091
09:20:23,840 --> 09:20:31,520
categorii de emisiuni sau filme care

12092
09:20:27,436 --> 09:20:33,436
ai vrea sa te uiti. Hm

12093
09:20:31,520 --> 09:20:35,120
și asta e ceva pe care îl vom studia

12094
09:20:33,436 --> 09:20:36,400
în viitor. Recomand noi vom face

12095
09:20:35,120 --> 09:20:40,276
au o întreagă lecție dedicată

12096
09:20:36,400 --> 09:20:40,276
recomandare de asemenea.

12097
09:20:41,520 --> 09:20:48,240
În regulă.

12098
09:20:43,756 --> 09:20:50,160
Deci, când vine vorba de real

12099
09:20:48,240 --> 09:20:51,756
modelele în sine, așa că există de gând

12100
09:20:50,160 --> 09:20:55,840
fi o mulțime de modele diferite care suntem

12101
09:20:51,756 --> 09:20:58,400
mergând să acopere. Hm și ei pleacă

12102
09:20:55,840 --> 09:21:01,040
să fie diferiţi în scopul lor şi

12103
09:20:58,400 --> 09:21:06,400
ce fel de probleme au

12104
09:21:01,040 --> 09:21:08,320
sunt folosite pentru. Au lor

12105
09:21:06,400 --> 09:21:11,596
cum va fi de fapt ei antrenamente

12106
09:21:08,320 --> 09:21:13,520
diferite. Hm, dar la un nivel înalt,

12107
09:21:11,596 --> 09:21:15,436
toți încearcă să facă același lucru,

12108
09:21:13,520 --> 09:21:17,840
care înseamnă să înveți un fel de relație

12109
09:21:15,436 --> 09:21:19,596
între datele de intrare și și

12110
09:21:17,840 --> 09:21:20,640
eticheta, nu? Chiar asta sunt

12111
09:21:19,596 --> 09:21:22,640
încearcă să facă pentru că sunt toți

12112
09:21:20,640 --> 09:21:24,480
supravegheat. Ei au acelea

12113
09:21:22,640 --> 09:21:27,040
etichete, încercând să construiesc câteva

12114
09:21:24,480 --> 09:21:29,040
relație acolo. Ei doar o fac

12115
09:21:27,040 --> 09:21:31,360
diferit.

12116
09:21:29,040 --> 09:21:33,200
Și ceea ce vom studia este

12117
09:21:31,360 --> 09:21:34,800
avantaje și dezavantaje ale multor dintre aceste modele,

12118
09:21:33,200 --> 09:21:37,360
cum ar fi când aș folosi una dintre ele, când

12119
09:21:34,800 --> 09:21:40,000
as folosi alta. Hm, așa că vom încerca

12120
09:21:37,360 --> 09:21:42,880
vorbim despre asta pe măsură ce mergem. Hm, dar

12121
09:21:40,000 --> 09:21:44,880
toți încearcă să învețe ceva

12122
09:21:42,880 --> 09:21:47,360
relația dintre caracteristicile de intrare

12123
09:21:44,880 --> 09:21:49,520
și ieșirea, nu? Deci trebuie

12124
09:21:47,360 --> 09:21:51,756
tine cont de asta. Ei încearcă

12125
09:21:49,520 --> 09:21:53,916
modelează acea relație. Ei doar o fac

12126
09:21:51,756 --> 09:21:57,040
în moduri diferite. Bine? Deci, pe măsură ce mergem

12127
09:21:53,916 --> 09:21:58,560
împreună și aflați despre modele noi, um, noi

12128
09:21:57,040 --> 09:22:02,160
va afla detaliile. va învăța

12129
09:21:58,560 --> 09:22:04,560
dezavantaje și avantaje și dezavantaje,

12130
09:22:02,160 --> 09:22:06,320
dar sunt indiferent ce, sunt toate

12131
09:22:04,560 --> 09:22:08,560
încercând să

12132
09:22:06,320 --> 09:22:13,680
Învață relația asta, nu? Şi

12133
09:22:08,560 --> 09:22:15,520
să poată face predicții asupra datelor noi.

12134
09:22:13,680 --> 09:22:18,400
bine,

12135
09:22:15,520 --> 09:22:22,480
așa că iată o listă de modele pe care le vom face

12136
09:22:18,400 --> 09:22:24,240
acoperiți și lucrați pe tot parcursul uh the

12137
09:22:22,480 --> 09:22:26,320
sesiunile pe care le avem.

12138
09:22:24,240 --> 09:22:28,720
nu le vom face pe toate într-unul singur

12139
09:22:26,320 --> 09:22:30,160
unul așezat, dar primul care

12140
09:22:28,720 --> 09:22:32,160
vom începe cu și asta vom face

12141
09:22:30,160 --> 09:22:33,840
acoperirea de astăzi va fi liniară

12142
09:22:32,160 --> 09:22:35,916
regresie.

12143
09:22:33,840 --> 09:22:38,640
Deci vom acoperi regresia liniară și

12144
09:22:35,916 --> 09:22:41,360
apoi îi vom acoperi pe restul acestor tipi

12145
09:22:38,640 --> 09:22:42,960
mai ales în contextul uh

12146
09:22:41,360 --> 09:22:46,000
clasificare.

12147
09:22:42,960 --> 09:22:48,720
Deci, um, ceea ce este interesant este o parte din

12148
09:22:46,000 --> 09:22:50,480
acești tipi pot fi folosiți pentru ambele

12149
09:22:48,720 --> 09:22:53,120
regresie şi clasificare atâta timp cât

12150
09:22:50,480 --> 09:22:56,000
le faci, um, anumite ajustări

12151
09:22:53,120 --> 09:22:58,720
ei. Au variații care pot fi

12152
09:22:56,000 --> 09:23:02,320
folosit pentru a face clasificare și regresie

12153
09:22:58,720 --> 09:23:05,120
este foarte interesant. Hm, dar mergem

12154
09:23:02,320 --> 09:23:07,360
pentru a începe cu regresia liniară astăzi

12155
09:23:05,120 --> 09:23:09,596
și apoi ne facem drum prin restul

12156
09:23:07,360 --> 09:23:11,596
dintre aceste modele când facem, um, suntem

12157
09:23:09,596 --> 09:23:13,276
voi face o lecție separată a patru despre

12158
09:23:11,596 --> 09:23:17,640
clasificare. Și așa toate acestea

12159
09:23:13,276 --> 09:23:17,640
băieții vor veni de la lecția a patra.

12160
09:23:18,960 --> 09:23:26,000
Um și apoi uh îl vom face pe tipul ăsta

12161
09:23:23,276 --> 09:23:30,276
lecția trei în caietul 3.2. Vom face

12162
09:23:26,000 --> 09:23:30,276
face totul despre regresia liniară.

12163
09:23:30,320 --> 09:23:35,680
Da. Deci regresia logistică este o

12164
09:23:32,800 --> 09:23:37,916
clasificare. Um, care este un fel

12165
09:23:35,680 --> 09:23:40,640
ciudat că numele lui este regresie dar

12166
09:23:37,916 --> 09:23:42,960
face o clasificare. Dar cel

12167
09:23:40,640 --> 09:23:46,560
motivul este că regresia logistică

12168
09:23:42,960 --> 09:23:49,276
um calculează o probabilitate. Deci face o

12169
09:23:46,560 --> 09:23:51,276
regresie pentru a prezice un număr dar că

12170
09:23:49,276 --> 09:23:54,320
numărul este de fapt o probabilitate. Deci

12171
09:23:51,276 --> 09:23:58,720
produce un rezultat care este între el

12172
09:23:54,320 --> 09:24:03,160
produce o probabilitate care este între um

12173
09:23:58,720 --> 09:24:03,160
evident, zero și unu.

12174
09:24:03,596 --> 09:24:07,120
Deci uh și apoi luăm asta

12175
09:24:05,680 --> 09:24:09,040
probabilitate și o transformăm în a

12176
09:24:07,120 --> 09:24:12,720
categorie

12177
09:24:09,040 --> 09:24:14,800
ca un spam, nu fraudă spam, nu fraudă.

12178
09:24:12,720 --> 09:24:16,960
Hm, dar deci regresia logistică este bună

12179
09:24:14,800 --> 09:24:18,640
de special. Este un fel ca o

12180
09:24:16,960 --> 09:24:20,320
regresie dar prezice o foarte

12181
09:24:18,640 --> 09:24:23,120
tip specific de valoare care este a

12182
09:24:20,320 --> 09:24:28,520
probabilitate. Deci din acest motiv este

12183
09:24:23,120 --> 09:24:28,520
un algoritm de clasificare în primul rând.

12184
09:24:32,640 --> 09:24:37,680
Așa că îl vom studia pe acesta în lecția a patra.

12185
09:24:35,360 --> 09:24:39,360
Uh, dar da, de aceea este

12186
09:24:37,680 --> 09:24:40,960
sub genul acela de umbrelă de

12187
09:24:39,360 --> 09:24:42,640
clasificarea este pentru că este

12188
09:24:40,960 --> 09:24:46,000
producând o probabilitate ca principală

12189
09:24:42,640 --> 09:24:48,240
ieșire pe care apoi o putem transforma într-o

12190
09:24:46,000 --> 09:24:52,160
categorie atâta timp cât interpretăm asta

12191
09:24:48,240 --> 09:24:54,000
probabilitatea ca um în modul corect. Uh

12192
09:24:52,160 --> 09:24:57,880
cum ar fi probabilitatea de spam,

12193
09:24:54,000 --> 09:24:57,880
probabilitatea de a nu face spam.

12194
09:25:00,400 --> 09:25:03,400
Bine.

12195
09:25:03,916 --> 09:25:09,360
Bine. Deci, lasă-mă să mă concentrez pe um

12196
09:25:07,680 --> 09:25:10,640
permiteți-mi să mă concentrez pe regresia liniară. eu sunt

12197
09:25:09,360 --> 09:25:12,640
nu o să trec prin toate astea

12198
09:25:10,640 --> 09:25:16,080
alte cazuri de utilizare pentru că noi nu am

12199
09:25:12,640 --> 09:25:19,276
am învățat încă aceste modele. Hăi, eu nu

12200
09:25:16,080 --> 09:25:21,276
cred ca sunt buni. Nu cred

12201
09:25:19,276 --> 09:25:23,916
e bine să citești încă despre ele până când

12202
09:25:21,276 --> 09:25:25,840
le-am acoperit. Deci, odată ce acoperim

12203
09:25:23,916 --> 09:25:28,080
ei în lecția a patra, mă voi întoarce și

12204
09:25:25,840 --> 09:25:30,080
descrieți-vă aceste exemple și

12205
09:25:28,080 --> 09:25:32,960
vom vedea de ce are sens. Dar eu

12206
09:25:30,080 --> 09:25:34,880
Gândiți-vă la regresia liniară um care este

12207
09:25:32,960 --> 09:25:36,960
despre ce vom trata în continuare, lasă-mă să vorbesc

12208
09:25:34,880 --> 09:25:38,880
acel exemplu. Deci un exemplu prototip

12209
09:25:36,960 --> 09:25:40,880
ar fi ca și cum ai prezice casa

12210
09:25:38,880 --> 09:25:42,800
prețurile pe care le-am văzut în acea casă

12211
09:25:40,880 --> 09:25:47,360
set de date de preț.

12212
09:25:42,800 --> 09:25:50,720
Deci dacă am fi vrut, dacă am vrea

12213
09:25:47,360 --> 09:25:55,160
prezicem dacă am vrut să estimăm

12214
09:25:50,720 --> 09:25:55,160
valoarea de piata a unei case deci pretul

12215
09:25:55,276 --> 09:25:59,916
am putea face asta folosind

12216
09:25:57,916 --> 09:26:02,080
caracteristici precum numărul de dormitoare,

12217
09:25:59,916 --> 09:26:06,160
metru pătrat, locație, vechime

12218
09:26:02,080 --> 09:26:08,640
proprietate. Hm și știi atunci când a

12219
09:26:06,160 --> 09:26:10,640
nou atunci când o casă nouă apare pe piață

12220
09:26:08,640 --> 09:26:14,000
am putea estima ce preț ar trebui

12221
09:26:10,640 --> 09:26:16,240
să se bazeze pe acele caracteristici. Atât de liniară

12222
09:26:14,000 --> 09:26:19,520
regresia este una bună pentru a prezice

12223
09:26:16,240 --> 09:26:22,000
preț ca prețul unei locuințe. Hm și vom face

12224
09:26:19,520 --> 09:26:25,000
de fapt practică asta în următorul uh

12225
09:26:22,000 --> 09:26:25,000
caietul.

12226
09:26:25,840 --> 09:26:30,080
Deci vom face uh și apoi toate astea

12227
09:26:28,480 --> 09:26:31,276
alte acum există descrieri ale acestora

12228
09:26:30,080 --> 09:26:32,880
alte modele, dar din nou nu avem

12229
09:26:31,276 --> 09:26:35,040
i-a acoperit pe acești tipi. Deci nu vreau

12230
09:26:32,880 --> 09:26:37,120
să trecem cu adevărat prin acelea până ajungem

12231
09:26:35,040 --> 09:26:40,560
la acele modele. Așa că ajungem la cele pe care le voi

12232
09:26:37,120 --> 09:26:43,276
reveniți și menționați exemplul.

12233
09:26:40,560 --> 09:26:46,960
Uh pot fi folosite K și N pentru grupare?

12234
09:26:43,276 --> 09:26:49,436
Nu. Deci modelul de grupare merge

12235
09:26:46,960 --> 09:26:51,120
a fi diferit. Va fi uh K

12236
09:26:49,436 --> 09:26:53,436
înseamnă

12237
09:26:51,120 --> 09:26:56,640
K înseamnă că aceasta este gruparea primară

12238
09:26:53,436 --> 09:26:59,360
model. Nu K vecini cei mai apropiați. K

12239
09:26:56,640 --> 09:27:00,560
cei mai apropiați vecini este folosit pentru uh se poate

12240
09:26:59,360 --> 09:27:03,596
fi folosit pentru regresie. Poate fi folosit

12241
09:27:00,560 --> 09:27:03,596
pentru clasificare.

12242
09:27:04,560 --> 09:27:08,800
Deci vom vorbi despre K și N care

12243
09:27:06,640 --> 09:27:11,680
este K cei mai apropiați vecini din lecție

12244
09:27:08,800 --> 09:27:13,840
patru.

12245
09:27:11,680 --> 09:27:16,000
Sună într-adevăr similar. Da, asta

12246
09:27:13,840 --> 09:27:17,436
sună foarte asemănător, dar K înseamnă a

12247
09:27:16,000 --> 09:27:19,756
algoritmul de grupare care este

12248
09:27:17,436 --> 09:27:22,320
usor diferit

12249
09:27:19,756 --> 09:27:25,916
diferit, nu se folosesc etichete

12250
09:27:22,320 --> 09:27:28,400
toate. Acest K vecini cei mai apropiați este a is a

12251
09:27:25,916 --> 09:27:31,560
algoritm de învățare supravegheată. Se foloseste

12252
09:27:28,400 --> 09:27:31,560
etichete.

12253
09:27:38,240 --> 09:27:43,240
Bun. Alte întrebări până acum?

12254
09:27:56,240 --> 09:28:01,276
Bine.

12255
09:27:58,160 --> 09:28:04,720
Așa că acestea fiind spuse, să trecem la

12256
09:28:01,276 --> 09:28:07,276
3.2 notebook.

12257
09:28:04,720 --> 09:28:11,200
Să trecem la ceea ce va fi al nostru

12258
09:28:07,276 --> 09:28:14,160
prima discuție despre uh

12259
09:28:11,200 --> 09:28:16,480
regresie. Deci intrând în supravegheat

12260
09:28:14,160 --> 09:28:19,360
învăţare şi regresie. Ofer-o baieti

12261
09:28:16,480 --> 09:28:21,120
momentul să trag acest caiet.

12262
09:28:19,360 --> 09:28:23,916
Dar da, vrei să ridici 3.2.

12263
09:28:21,120 --> 09:28:26,080
Vom face asta în continuare. Deci ne vom concentra

12264
09:28:23,916 --> 09:28:28,080
Deci planul nostru este să facem regresie

12265
09:28:26,080 --> 09:28:32,436
mai întâi și apoi vom vorbi despre

12266
09:28:28,080 --> 09:28:32,436
clasificare în lecția a patra

12267
09:28:35,520 --> 09:28:39,916
pe care le vom acoperi pe toate celelalte

12268
09:28:37,276 --> 09:28:42,480
modele pe care le-ai putea folosi

12269
09:28:39,916 --> 09:28:43,520
clasificare pe acea listă. Dar apoi

12270
09:28:42,480 --> 09:28:47,640
vom vorbi despre liniar

12271
09:28:43,520 --> 09:28:47,640
regresie mai întâi.

12272
09:28:53,360 --> 09:28:58,880
În regulă. Deci avem o agendă mare.

12273
09:28:56,160 --> 09:29:02,320
Acesta este un caiet mare de parcurs

12274
09:28:58,880 --> 09:29:04,080
mult material aici înconjurător

12275
09:29:02,320 --> 09:29:07,200
regresie. Deci vom merge

12276
09:29:04,080 --> 09:29:10,080
începe cu regresia liniară și vezi um

12277
09:29:07,200 --> 09:29:13,276
cum o facem de fapt, ce asta

12278
09:29:10,080 --> 09:29:14,880
modelul merge. Hm, pe care îl avem

12279
09:29:13,276 --> 09:29:16,480
am văzut puțin ideea

12280
09:29:14,880 --> 09:29:19,276
deja, așa că ar trebui să fie oarecum

12281
09:29:16,480 --> 09:29:22,720
familiar. Hm și apoi vom vorbi despre

12282
09:29:19,276 --> 09:29:26,320
cum să adaptăm ideea de regresie liniară

12283
09:29:22,720 --> 09:29:27,916
să um neliniar ceea ce se numește neliniar

12284
09:29:26,320 --> 09:29:31,040
regresie care va fi folosită

12285
09:29:27,916 --> 09:29:34,240
ca trăsături polomiale. Vom vorbi

12286
09:29:31,040 --> 09:29:36,640
despre cum să faci asta. Hm și apoi un mare

12287
09:29:34,240 --> 09:29:39,200
mare mare subiect pentru noi va fi

12288
09:29:36,640 --> 09:29:41,756
evaluarea modelului. Așa va fi așa

12289
09:29:39,200 --> 09:29:43,680
fi destul de ușor să-l construiești efectiv.

12290
09:29:41,756 --> 09:29:46,960
construirea modelului va fi foarte ușoară

12291
09:29:43,680 --> 09:29:50,800
dar evaluând şi interpretând că

12292
09:29:46,960 --> 09:29:53,840
va fi o mulțime de muncă interesantă

12293
09:29:50,800 --> 09:29:55,916
acolo pentru că vrem să știm ce

12294
09:29:53,840 --> 09:29:57,840
performanța acelui model este odată ce noi

12295
09:29:55,916 --> 09:30:00,400
am construit-o corect, vrem să știm cum

12296
09:29:57,840 --> 09:30:02,720
Un model bun este că merită folosit

12297
09:30:00,400 --> 09:30:05,120
sau trebuie să-l reeducam sau să ne facem noi

12298
09:30:02,720 --> 09:30:07,360
date sau schimba modelul pana sa vorbesc

12299
09:30:05,120 --> 09:30:10,080
despre asta, um, cum determini ce

12300
09:30:07,360 --> 09:30:13,120
de făcut pe baza acelei performanțe

12301
09:30:10,080 --> 09:30:14,880
um și apoi vom vorbi despre aici

12302
09:30:13,120 --> 09:30:17,520
um câteva lucruri. S-ar putea să nu ajungem

12303
09:30:14,880 --> 09:30:19,756
asta azi, dar regularizare

12304
09:30:17,520 --> 09:30:23,520
care este folosit pentru a spori performanța

12305
09:30:19,756 --> 09:30:27,200
în anumite situații, ori de câte ori

12306
09:30:23,520 --> 09:30:28,880
modelul are performanțe slabe

12307
09:30:27,200 --> 09:30:31,680
împotriva datelor de testare, chiar dacă aceasta

12308
09:30:28,880 --> 09:30:34,080
funcționează destul de bine pe datele de antrenament.

12309
09:30:31,680 --> 09:30:36,320
În acest scenariu, puteți folosi ramuri

12310
09:30:34,080 --> 09:30:38,080
de regresie liniară care fac ceva uh

12311
09:30:36,320 --> 09:30:39,840
ceea ce se numește regularizare. Vom vorbi

12312
09:30:38,080 --> 09:30:41,276
despre asta.

12313
09:30:39,840 --> 09:30:44,560
Hm, și apoi vom vorbi despre

12314
09:30:41,276 --> 09:30:46,480
reglare hiperparametrică, în general, ca

12315
09:30:44,560 --> 09:30:47,840
o strategie, care este ceva pentru tine

12316
09:30:46,480 --> 09:30:51,520
în general, vrei să faci când ești

12317
09:30:47,840 --> 09:30:53,436
antrenarea modelelor de învățare automată. Um, deci

12318
09:30:51,520 --> 09:30:57,436
din nou, s-ar putea să nu ajungem la acestea două

12319
09:30:53,436 --> 09:31:00,080
azi, dar destul de multe de primit

12320
09:30:57,436 --> 09:31:03,200
să fie anterior celui centrat în principal

12321
09:31:00,080 --> 09:31:05,120
în jurul evaluării și construcției liniare

12322
09:31:03,200 --> 09:31:07,436
regresie.

12323
09:31:05,120 --> 09:31:09,200
Bine, foarte tare. vom ajunge la noi

12324
09:31:07,436 --> 09:31:10,880
primul tip de model aici. Acest liniar

12325
09:31:09,200 --> 09:31:14,436
regresie

12326
09:31:10,880 --> 09:31:14,436
pentru a începe cu.

12327
09:31:14,960 --> 09:31:19,596
bine,

12328
09:31:16,480 --> 09:31:24,480
deci să începem cu regresia liniară

12329
09:31:19,596 --> 09:31:28,080
aici. Hm, și într-adevăr ce liniar

12330
09:31:24,480 --> 09:31:31,840
regresia încearcă să facă și eu

12331
09:31:28,080 --> 09:31:34,560
vreau să vă arăt acest lucru în această imagine este

12332
09:31:31,840 --> 09:31:37,756
trage această linie uneori ceea ce se știe

12333
09:31:34,560 --> 09:31:40,400
ca linie de cea mai bună potrivire. Deci acesta este al nostru

12334
09:31:37,756 --> 09:31:44,960
model care trece prin date

12335
09:31:40,400 --> 09:31:50,240
și, în general, este un bun predictor

12336
09:31:44,960 --> 09:31:53,200
pentru că dacă îmi dai caracteristici

12337
09:31:50,240 --> 09:31:55,520
dacă îmi oferi funcții noi și hai

12338
09:31:53,200 --> 09:31:57,916
spune că sunt hai să spunem că îmi dai o

12339
09:31:55,520 --> 09:31:59,436
caracteristică care este chiar aici.

12340
09:31:57,916 --> 09:32:02,880
Deci spui, bine, am o caracteristică

12341
09:31:59,436 --> 09:32:05,276
aceasta este valoarea pe axa x. Apoi eu

12342
09:32:02,880 --> 09:32:09,120
Știu că tot ce trebuie să fac este să-l conectez la

12343
09:32:05,276 --> 09:32:12,400
ecuația mea de linie și voi genera a

12344
09:32:09,120 --> 09:32:14,640
o valoare care este ca aici.

12345
09:32:12,400 --> 09:32:17,040
Bine, ce frumos este pe acea linie

12346
09:32:14,640 --> 09:32:19,360
la acea intrare. Și asta va fi al meu

12347
09:32:17,040 --> 09:32:20,480
predicție pentru ce variabila de ieșire

12348
09:32:19,360 --> 09:32:23,916
ar trebui să fie. Doar va fi

12349
09:32:20,480 --> 09:32:27,120
ceva pe acea linie. Și ce poți

12350
09:32:23,916 --> 09:32:30,240
vezi dacă această linie este o estimare decentă

12351
09:32:27,120 --> 09:32:32,960
pentru aceste date pentru că se tranșează

12352
09:32:30,240 --> 09:32:36,080
asta destul de uniform. Deci este o presupunere bună

12353
09:32:32,960 --> 09:32:38,240
în ceea ce privește rezultatul care trebuie dat

12354
09:32:36,080 --> 09:32:41,756
oricare dintre aceste intrări. Este un este o

12355
09:32:38,240 --> 09:32:43,596
bun estimator această linie. Și așa a noastră

12356
09:32:41,756 --> 09:32:46,400
Scopul construirii unei regresii liniare este de a

12357
09:32:43,596 --> 09:32:50,080
un fel de a construi ecuația acestei linii.

12358
09:32:46,400 --> 09:32:54,720
Deci vrem această ecuație.

12359
09:32:50,080 --> 09:32:59,240
Ecuația acestei linii

12360
09:32:54,720 --> 09:32:59,240
va fi modelul nostru.

12361
09:33:01,520 --> 09:33:05,596
Da, va arăta exact așa.

12362
09:33:03,360 --> 09:33:08,240
MX plus B sau da, MX plus C. Merge

12363
09:33:05,596 --> 09:33:12,400
sa arate exact asa. uh, cu excepția

12364
09:33:08,240 --> 09:33:16,080
că va fi mai mult decât doar MX

12365
09:33:12,400 --> 09:33:17,756
pentru că avem în general mai mult decât

12366
09:33:16,080 --> 09:33:20,720
o caracteristică. Deci te gândești la X ca la a

12367
09:33:17,756 --> 09:33:23,276
caracteristică um va fi mai mult decât doar MX.

12368
09:33:20,720 --> 09:33:27,000
În general, va fi așa cum va fi

12369
09:33:23,276 --> 09:33:27,000
in general arata asa

12370
09:33:30,720 --> 09:33:36,800
și apoi plus poate ceva părtinire aici plus

12371
09:33:34,160 --> 09:33:38,400
o interceptare. Da, în general va arăta

12372
09:33:36,800 --> 09:33:41,200
asa. Deci, da, ești exact

12373
09:33:38,400 --> 09:33:44,000
corect. MX plus B este ideea potrivită.

12374
09:33:41,200 --> 09:33:47,880
Exact corect.

12375
09:33:44,000 --> 09:33:47,880
În general, va arăta așa.

12376
09:33:48,640 --> 09:33:52,960
Neliniar, poate fi adaptat

12377
09:33:50,240 --> 09:33:54,320
neliniar. Da. Dacă ne transformăm, suntem

12378
09:33:52,960 --> 09:33:56,480
o sa vorbesc despre asta. Dacă noi

12379
09:33:54,320 --> 09:33:59,596
transforma toate caracteristicile noastre într-un

12380
09:33:56,480 --> 09:34:01,840
mod neliniar, um putem aplica liniar

12381
09:33:59,596 --> 09:34:05,120
regresie la acesta. Da. Și și asta

12382
09:34:01,840 --> 09:34:08,640
ar fi o regresie neliniară. Deci da,

12383
09:34:05,120 --> 09:34:12,276
putem face și lucruri neliniare.

12384
09:34:08,640 --> 09:34:12,276
Vom vorbi despre asta.

12385
09:34:18,640 --> 09:34:24,320
Bine. Deci regresia liniară este din nou

12386
09:34:21,756 --> 09:34:26,880
artă sau știință ar trebui să spun că nu chiar

12387
09:34:24,320 --> 09:34:29,120
artă dar este o știință exactă a

12388
09:34:26,880 --> 09:34:32,800
găsind ecuaţia acestei drepte care

12389
09:34:29,120 --> 09:34:34,320
se potrivește prin aceste date. Acum de ce unul

12390
09:34:32,800 --> 09:34:38,080
lucru la care ar trebui să te gândești este

12391
09:34:34,320 --> 09:34:40,480
de ce această linie este un bun predictor și

12392
09:34:38,080 --> 09:34:42,640
argumentul este că dacă arunci o privire

12393
09:34:40,480 --> 09:34:44,240
la această distanţă de aceste puncte albastre

12394
09:34:42,640 --> 09:34:48,560
deci să spunem că aceste puncte albastre sunt

12395
09:34:44,240 --> 09:34:52,400
punctele de date reale către care urmează această linie

12396
09:34:48,560 --> 09:34:54,320
fi găsit astfel încât să minimizeze acest lucru

12397
09:34:52,400 --> 09:34:57,120
distanta

12398
09:34:54,320 --> 09:34:59,520
de la puncte la de fapt ar trebui

12399
09:34:57,120 --> 09:35:04,800
trageți-o astfel de la puncte la

12400
09:34:59,520 --> 09:35:06,880
linia. Deci, vrem ca această distanță să fie um

12401
09:35:04,800 --> 09:35:09,756
de fapt ar trebui să-l desenez așa. Acest

12402
09:35:06,880 --> 09:35:12,560
mod. Vrem ca această distanță să fie un fel

12403
09:35:09,756 --> 09:35:14,320
la minim. Deci, ar fi rău să

12404
09:35:12,560 --> 09:35:16,240
trage o linie până aici pentru că

12405
09:35:14,320 --> 09:35:18,960
atunci e multă distanță, nu?

12406
09:35:16,240 --> 09:35:20,800
Deci, și asta ar fi o mulțime de erori

12407
09:35:18,960 --> 09:35:22,720
a contribuit din a nu putea

12408
09:35:20,800 --> 09:35:25,120
preziceți acele puncte din setul nostru de date

12409
09:35:22,720 --> 09:35:27,200
foarte bine. Hm, care este antrenamentul nostru

12410
09:35:25,120 --> 09:35:29,120
date. De aceea avem etichete, nu?

12411
09:35:27,200 --> 09:35:32,320
care ne ghidează în construirea asta

12412
09:35:29,120 --> 09:35:36,800
linie. Deci scopul nostru este să construim asta

12413
09:35:32,320 --> 09:35:39,916
linie mai ales ca aceasta eroare sau

12414
09:35:36,800 --> 09:35:42,400
această distanţă poate fi minimă ca

12415
09:35:39,916 --> 09:35:45,040
posibil. Corect? Care sunt toate acestea

12416
09:35:42,400 --> 09:35:48,000
distanțe de la aceste puncte la linie.

12417
09:35:45,040 --> 09:35:50,640
Vrem ca acestea să fie cât mai minime

12418
09:35:48,000 --> 09:35:52,720
posibil. Deci scopul nostru este să găsim asta

12419
09:35:50,640 --> 09:35:54,160
ecuație.

12420
09:35:52,720 --> 09:35:57,800
Deci vom construi un model care să fie

12421
09:35:54,160 --> 09:35:57,800
vom găsi această ecuație.

12422
09:35:58,880 --> 09:36:06,000
a liniei

12423
09:36:01,596 --> 09:36:09,480
um astfel încât eroarea noastră

12424
09:36:06,000 --> 09:36:09,480
este minimă.

12425
09:36:09,916 --> 09:36:15,000
Si care este eroarea? Eroarea este

12426
09:36:12,000 --> 09:36:15,000
distanta

12427
09:36:16,080 --> 09:36:20,360
a punctelor noastre de date

12428
09:36:22,480 --> 09:36:25,560
spre a

12429
09:36:26,480 --> 09:36:30,880
linia pe care o construim. Deci, în esență

12430
09:36:28,640 --> 09:36:33,916
ce vom face pentru a antrena asta

12431
09:36:30,880 --> 09:36:36,000
va fi ajustarea parametrilor sau

12432
09:36:33,916 --> 09:36:38,480
sau în asta cred că este foarte bun

12433
09:36:36,000 --> 09:36:41,360
ai adus în discuție MX plus C. Practic

12434
09:36:38,480 --> 09:36:44,400
M și C se vor ajusta. Deci noi

12435
09:36:41,360 --> 09:36:48,480
ajustați-le în consecință pentru a face acest lucru

12436
09:36:44,400 --> 09:36:50,480
distanta cat mai mica.

12437
09:36:48,480 --> 09:36:53,720
Bine? Pentru a minimiza la fel de mult distanța

12438
09:36:50,480 --> 09:36:53,720
pe cât posibil.

12439
09:36:59,520 --> 09:37:05,756
Bine.

12440
09:37:01,596 --> 09:37:07,436
Deci unde se folosește regresia? Noi am

12441
09:37:05,756 --> 09:37:10,160
am vazut deja cateva exemple. Iată câteva

12442
09:37:07,436 --> 09:37:15,200
mai multă publicitate, cum ar fi prezicerea

12443
09:37:10,160 --> 09:37:17,120
vânzări, prezicând ulei și ulei

12444
09:37:15,200 --> 09:37:20,000
producție și cerere. Acestea sunt ca

12445
09:37:17,120 --> 09:37:22,560
previz că acestea sunt probleme de regresie.

12446
09:37:20,000 --> 09:37:27,200
Um retail ca prognoza cererii pentru

12447
09:37:22,560 --> 09:37:32,000
inventar. Asistența medicală prezice um

12448
09:37:27,200 --> 09:37:34,800
uh nivelurile anumitor um uh sânge

12449
09:37:32,000 --> 09:37:37,840
markere sau știi așa ceva.

12450
09:37:34,800 --> 09:37:40,320
um, bazate pe predicții imobiliare

12451
09:37:37,840 --> 09:37:42,400
pe acelea despre care s-a vorbit ca pătrat

12452
09:37:40,320 --> 09:37:44,480
filmări, dormitoare, băi, alea

12453
09:37:42,400 --> 09:37:46,640
lucruri. Deci regresia este folosită din nou

12454
09:37:44,480 --> 09:37:49,680
ori de câte ori dorim să prezicem un număr a

12455
09:37:46,640 --> 09:37:52,680
ieșire numerică este o regresie

12456
09:37:49,680 --> 09:37:52,680
problema.

12457
09:37:55,276 --> 09:38:01,200
Deci despre acest tip de regresie vorbim

12458
09:37:57,360 --> 09:38:05,596
despre aici este în general

12459
09:38:01,200 --> 09:38:08,080
um cunoscut sub numele de uh a când acea ecuație este

12460
09:38:05,596 --> 09:38:10,400
liniar care este cunoscut ca liniar

12461
09:38:08,080 --> 09:38:13,436
regresie. Deci, întoarce-te la acea poză

12462
09:38:10,400 --> 09:38:16,880
când avem un când acea ecuație a

12463
09:38:13,436 --> 09:38:20,080
linia pe care o găsim este o ecuație liniară

12464
09:38:16,880 --> 09:38:22,000
adică este exact forma pe care o am

12465
09:38:20,080 --> 09:38:26,880
ti-am spus. Deci e ceva

12466
09:38:22,000 --> 09:38:29,756
cum ar fi funcția de timp de greutate

12467
09:38:26,880 --> 09:38:33,596
plus caracteristica greutate-timpul

12468
09:38:29,756 --> 09:38:37,040
plus caracteristica greutate-timpul

12469
09:38:33,596 --> 09:38:40,000
și apoi poate un termen de interceptare

12470
09:38:37,040 --> 09:38:44,000
ca niște termeni de părtinire acolo.

12471
09:38:40,000 --> 09:38:47,040
Hm, aceasta este o ecuație liniară pentru că toate

12472
09:38:44,000 --> 09:38:49,276
dintre caracteristici sunt la puterea unică.

12473
09:38:47,040 --> 09:38:52,080
Deci este o putere liniară și aceasta este o

12474
09:38:49,276 --> 09:38:54,320
combinație liniară de caracteristici cu cu

12475
09:38:52,080 --> 09:38:56,640
acele greutăți diferite. Deci acesta este un

12476
09:38:54,320 --> 09:39:00,000
model liniar

12477
09:38:56,640 --> 09:39:03,200
pentru că este uh, este ceea ce în matematică

12478
09:39:00,000 --> 09:39:05,360
ar numi aceasta o ecuație liniară corectă

12479
09:39:03,200 --> 09:39:07,916
totul este la prima putere. Ea

12480
09:39:05,360 --> 09:39:13,360
seamana cu mx plus b. Este un liniar

12481
09:39:07,916 --> 09:39:16,160
ecuație sau model liniar. Hm, atunci când noi

12482
09:39:13,360 --> 09:39:17,916
vorbim despre regresia liniară care este a

12483
09:39:16,160 --> 09:39:21,436
model de regresie, așa că anticipăm

12484
09:39:17,916 --> 09:39:25,040
vreo ţintă continuă care presupune noi

12485
09:39:21,436 --> 09:39:28,560
sunt model modelul nostru este format din aceasta

12486
09:39:25,040 --> 09:39:31,840
fel de ecuație o ecuație liniară.

12487
09:39:28,560 --> 09:39:33,840
Deci acesta va fi modelul nostru pentru

12488
09:39:31,840 --> 09:39:37,160
un liniar

12489
09:39:33,840 --> 09:39:37,160
uh regresie.

12490
09:39:37,276 --> 09:39:42,960
Bine.

12491
09:39:40,240 --> 09:39:45,436
Și așa atunci când antrenezi un liniar

12492
09:39:42,960 --> 09:39:49,916
regresie, scopul tău este să înveți acestea

12493
09:39:45,436 --> 09:39:52,160
greutăți, astfel încât să vă puteți conecta

12494
09:39:49,916 --> 09:39:56,320
poate conecta oricare dintre intrările tale

12495
09:39:52,160 --> 09:39:58,320
caracteristici și puteți genera un

12496
09:39:56,320 --> 09:40:00,560
predictie. Poți care va fi

12497
09:39:58,320 --> 09:40:02,160
ceva pe linia asta, nu? Este

12498
09:40:00,560 --> 09:40:04,640
va fi o valoare care sta aici

12499
09:40:02,160 --> 09:40:06,560
pe această linie.

12500
09:40:04,640 --> 09:40:10,560
Punem toate caracteristicile noastre și încheiem

12501
09:40:06,560 --> 09:40:13,800
acolo undeva pe acea linie.

12502
09:40:10,560 --> 09:40:13,800
Această ieșire.

12503
09:40:14,160 --> 09:40:17,160
Bine.

12504
09:40:25,596 --> 09:40:32,800
Bine. Lasă-mă să mă opresc acolo. Orice întrebări

12505
09:40:27,436 --> 09:40:36,916
pe modelul liniar aici sau de ce este

12506
09:40:32,800 --> 09:40:36,916
numită regresie liniară?

12507
09:40:47,840 --> 09:40:52,800
Bine. Și apropo, în aceste note

12508
09:40:51,040 --> 09:40:54,800
acest marcant indică aici unde spune asta

12509
09:40:52,800 --> 09:40:56,800
folosește criteriul celor mai mici pătrate pentru

12510
09:40:54,800 --> 09:40:58,560
estimaţi coeficienţii adică

12511
09:40:56,800 --> 09:41:00,400
exact ce am spus mai devreme cu

12512
09:40:58,560 --> 09:41:02,320
distanţă. Deci distanța se bazează pe

12513
09:41:00,400 --> 09:41:05,360
pătratul

12514
09:41:02,320 --> 09:41:07,840
de aceasta această cantitate ca cât de departe

12515
09:41:05,360 --> 09:41:11,276
ești din linie se bazează pe asta

12516
09:41:07,840 --> 09:41:14,320
distanță pătrată aici și aici și aici

12517
09:41:11,276 --> 09:41:18,720
si aici. Deci ceea ce încercăm să facem este

12518
09:41:14,320 --> 09:41:20,480
găsiți cea mai mică distanță sau cele mai mici pătrate

12519
09:41:18,720 --> 09:41:23,360
care este acea distanță minimă. Deci

12520
09:41:20,480 --> 09:41:25,840
așa găsim toate aceste greutăți

12521
09:41:23,360 --> 09:41:29,040
este de la minimizare. Practic le acordăm

12522
09:41:25,840 --> 09:41:32,400
suficient folosind etichetele noastre. Deci, iată-ne

12523
09:41:29,040 --> 09:41:34,720
etichetă care este y. Practic, conectam

12524
09:41:32,400 --> 09:41:36,800
în datele noastre și acordați-le suficient pentru

12525
09:41:34,720 --> 09:41:39,916
minimizați eroarea. Este un este un

12526
09:41:36,800 --> 09:41:44,560
problema de optimizare, nu? Noi suntem

12527
09:41:39,916 --> 09:41:50,120
încercând să găsească minimul din aceasta

12528
09:41:44,560 --> 09:41:50,120
cantitate care este cea mai potrivită linie.

12529
09:41:59,840 --> 09:42:04,720
Bine.

12530
09:42:01,520 --> 09:42:08,880
Deci avem regresie liniară

12531
09:42:04,720 --> 09:42:11,436
um și putem face un simplu liniar

12532
09:42:08,880 --> 09:42:13,436
regresie care are o singură caracteristică. Deci

12533
09:42:11,436 --> 09:42:16,400
dacă are o singură caracteristică, adică

12534
09:42:13,436 --> 09:42:19,520
exact așa dacă există o singură intrare

12535
09:42:16,400 --> 09:42:21,200
caracteristică uneori cunoscută sub numele de um

12536
09:42:19,520 --> 09:42:23,120
regresie simplă sau liniară simplă

12537
09:42:21,200 --> 09:42:24,480
regresie și există doar practic

12538
09:42:23,120 --> 09:42:28,560
există o singură caracteristică. Deci unul

12539
09:42:24,480 --> 09:42:31,680
variabila independentă este caracteristica.

12540
09:42:28,560 --> 09:42:36,080
Există o singură caracteristică. Și așa asta

12541
09:42:31,680 --> 09:42:38,000
ecuația seamănă cu

12542
09:42:36,080 --> 09:42:42,080
Ecuația exactă pe care tocmai ați introdus-o

12543
09:42:38,000 --> 09:42:45,276
acolo, care este um mx plus b,

12544
09:42:42,080 --> 09:42:46,960
nu? Seamănă exact cu asta. um

12545
09:42:45,276 --> 09:42:50,640
doar folosim simboluri diferite pentru

12546
09:42:46,960 --> 09:42:54,320
acelea ca beta beta 0 și beta 1 dar um

12547
09:42:50,640 --> 09:42:57,200
practic exact acea linie simplă

12548
09:42:54,320 --> 09:43:01,680
există o singură caracteristică. Deci si asta e

12549
09:42:57,200 --> 09:43:04,000
pentru că acea linie va face asta

12550
09:43:01,680 --> 09:43:05,840
linia va fi generată uh

12551
09:43:04,000 --> 09:43:08,320
conform acelei ecuații. Deci iată

12552
09:43:05,840 --> 09:43:10,320
cam cum arată.

12553
09:43:08,320 --> 09:43:12,560
Aceasta este linia cea mai potrivită prin toate

12554
09:43:10,320 --> 09:43:14,320
aceste puncte albastre. Acesta este ceva ce suntem

12555
09:43:12,560 --> 09:43:16,880
va putea construi. mergem

12556
09:43:14,320 --> 09:43:20,560
pentru a putea construi acea ecuație

12557
09:43:16,880 --> 09:43:22,880
destul de ușor în scikitlearn.

12558
09:43:20,560 --> 09:43:26,320
Deci vom putea găsi asta și asta

12559
09:43:22,880 --> 09:43:31,756
nu va fi prea greu. Deci această linie va fi

12560
09:43:26,320 --> 09:43:35,596
um y = beta 0 plus beta 1. Deci unii

12561
09:43:31,756 --> 09:43:37,680
greutate beta de 1 ori singura caracteristică pe care o avem

12562
09:43:35,596 --> 09:43:41,040
au x1.

12563
09:43:37,680 --> 09:43:43,916
Bine. Deci, în acest caz, am fi

12564
09:43:41,040 --> 09:43:45,916
prezicerea vânzărilor. Deci vânzările ar fi

12565
09:43:43,916 --> 09:43:48,720
prețuiesc practic eticheta pe care o suntem

12566
09:43:45,916 --> 09:43:53,916
încercând să prezică și caracteristica care

12567
09:43:48,720 --> 09:43:58,240
punem în ea, cred că este

12568
09:43:53,916 --> 09:43:59,916
numărul de cheltuieli TV. Da. Cheltuielile TV

12569
09:43:58,240 --> 09:44:06,840
care se află pe axa x. Deci există unul

12570
09:43:59,916 --> 09:44:06,840
caracteristică care este cheltuiala TV.

12571
09:44:08,000 --> 09:44:14,320
Deci, pe acest grafic, acesta ar fi acesta

12572
09:44:12,080 --> 09:44:16,400
ar fi modelul nostru.

12573
09:44:14,320 --> 09:44:20,080
Bine, acesta ar fi modelul nostru. Doar noi

12574
09:44:16,400 --> 09:44:22,880
au o caracteristică și le avem pe acestea

12575
09:44:20,080 --> 09:44:25,916
doua greutati. Avem o intersecție B 0

12576
09:44:22,880 --> 09:44:28,080
și sau beta 0 și apoi o greutate de o singură

12577
09:44:25,916 --> 09:44:31,680
care se aplică acelei caracteristici

12578
09:44:28,080 --> 09:44:33,680
beta 1. Și așa ar fi modelul nostru

12579
09:44:31,680 --> 09:44:36,080
o anumită valoare pentru beta 0 și o anumită

12580
09:44:33,680 --> 09:44:40,360
valoare pentru beta 1. Asta este ceea ce obține

12581
09:44:36,080 --> 09:44:40,360
tipii astia sunt invatati

12582
09:44:40,960 --> 09:44:47,120
învăţat în timpul

12583
09:44:44,640 --> 09:44:50,120
model

12584
09:44:47,120 --> 09:44:50,120
antrenament.

12585
09:44:53,200 --> 09:44:58,720
Bine. Deci astea sunt ceea ce se învață

12586
09:44:56,160 --> 09:45:01,436
în timpul antrenamentului nostru de model și primesc

12587
09:44:58,720 --> 09:45:03,436
învăţat de un a cel puţin ceea ce se numeşte a

12588
09:45:01,436 --> 09:45:05,596
algoritmul de închiriere pătrate care încearcă

12589
09:45:03,436 --> 09:45:08,800
pentru a minimiza acea distanta. Încearcă

12590
09:45:05,596 --> 09:45:11,596
ajustați beta 0 beta 1 pentru a minimiza acest lucru

12591
09:45:08,800 --> 09:45:13,596
distanța acestei linii

12592
09:45:11,596 --> 09:45:17,560
um această linie

12593
09:45:13,596 --> 09:45:17,560
la toate aceste puncte

12594
09:45:18,400 --> 09:45:24,800
încercând să minimizeze acest lucru.

12595
09:45:22,240 --> 09:45:28,000
Așa că imaginați-vă că luați o linie și un fel de

12596
09:45:24,800 --> 09:45:31,436
mișcându-l și întorcându-l pe ea

12597
09:45:28,000 --> 09:45:33,680
panta, unghiul ei um pentru a încerca să găsesc asta

12598
09:45:31,436 --> 09:45:35,916
cel mai potrivit,

12599
09:45:33,680 --> 09:45:39,960
care reduce acea eroare cel mai mult.

12600
09:45:35,916 --> 09:45:39,960
Corect? Cam asta facem.

12601
09:46:00,080 --> 09:46:08,320
Pot să explic? Da. Deci vânzările sunt

12602
09:46:04,000 --> 09:46:10,240
în dolari și și cheltuiala TV

12603
09:46:08,320 --> 09:46:12,080
um

12604
09:46:10,240 --> 09:46:13,840
uh

12605
09:46:12,080 --> 09:46:15,840
TV, de fapt, cred că e invers

12606
09:46:13,840 --> 09:46:18,800
în jur. Cred că vânzările sunt de fapt a

12607
09:46:15,840 --> 09:46:22,880
cantitate. Deci, acesta este numărul de vânzări

12608
09:46:18,800 --> 09:46:25,040
pe care îl avem și cheltuiala TV este eu

12609
09:46:22,880 --> 09:46:28,640
cred că e în dolari. Deci cum

12610
09:46:25,040 --> 09:46:31,120
mulți bani câte cheltuieli am făcut noi

12611
09:46:28,640 --> 09:46:33,680
introduse în produs și apoi

12612
09:46:31,120 --> 09:46:37,000
cam de câte vânzări am avut

12613
09:46:33,680 --> 09:46:37,000
acel produs.

12614
09:46:37,680 --> 09:46:41,800
Deci cred că e invers.

12615
09:46:44,720 --> 09:46:51,680
Dar ce arată acest grafic

12616
09:46:46,960 --> 09:46:54,480
punctele albastre sunt datele noastre reale

12617
09:46:51,680 --> 09:46:57,200
puncte. Bine. Deci avem o colecție

12618
09:46:54,480 --> 09:46:59,596
ca și cum am avea un cadru de date care are așa

12619
09:46:57,200 --> 09:47:02,080
imaginați-vă că avem un cadru de date care are

12620
09:46:59,596 --> 09:47:06,960
uh adevarate valori.

12621
09:47:02,080 --> 09:47:10,560
Deci are cheltuielile TV. Hm, a avut

12622
09:47:06,960 --> 09:47:13,276
puncte care sunt ca unul. Deci, are

12623
09:47:10,560 --> 09:47:16,880
puncte care sunt ca 120 și apoi

12624
09:47:13,276 --> 09:47:20,080
vânzările de vânzare ar putea fi de aproximativ 700

12625
09:47:16,880 --> 09:47:21,756
700 de unități, să zicem. Și apoi are um

12626
09:47:20,080 --> 09:47:23,200
deci acesta este doar setul nostru de date, nu?

12627
09:47:21,756 --> 09:47:26,400
Acest lucru ar fi ca într-un cadru de date care

12628
09:47:23,200 --> 09:47:30,160
avem. Și apoi am avut unele care au fost

12629
09:47:26,400 --> 09:47:33,596
um 50 și atunci asta ar putea fi um asta

12630
09:47:30,160 --> 09:47:36,160
ar putea fi 400, să zicem. Și mai departe

12631
09:47:33,596 --> 09:47:38,720
si mai departe, nu? Deci acestea sunt datele noastre și

12632
09:47:36,160 --> 09:47:41,520
aceste date sunt reprezentate în albastru. Deci

12633
09:47:38,720 --> 09:47:43,840
acestea sunt aceste puncte albastre aici,

12634
09:47:41,520 --> 09:47:47,436
nu? Deci acestea sunt punctele albastre aici

12635
09:47:43,840 --> 09:47:50,720
iar punctele roșii sunt modelul nostru. Deci

12636
09:47:47,436 --> 09:47:53,200
am construit un model de regresie liniară

12637
09:47:50,720 --> 09:47:56,560
unde punem niște valori.

12638
09:47:53,200 --> 09:47:58,640
Introducem niște valori false x x

12639
09:47:56,560 --> 09:48:01,120
aici și generând niște predicții

12640
09:47:58,640 --> 09:48:04,080
care este această linie

12641
09:48:01,120 --> 09:48:07,596
această linie de regresie liniară uh.

12642
09:48:04,080 --> 09:48:10,480
Corect? Și acea linie este derivată din

12643
09:48:07,596 --> 09:48:15,040
aceste date. Corect? Se învață de la

12644
09:48:10,480 --> 09:48:17,360
aceasta a supravegheat uh exemple.

12645
09:48:15,040 --> 09:48:20,000
Are sens?

12646
09:48:17,360 --> 09:48:23,276
Acea linie este derivată din date. Este

12647
09:48:20,000 --> 09:48:29,160
de fapt, am învățat de la linia similară

12648
09:48:23,276 --> 09:48:29,160
cea mai bună potrivire se învață din acele date

12649
09:48:30,880 --> 09:48:35,756
iar datele reale sunt în albastru.

12650
09:48:34,240 --> 09:48:37,756
Deci puteți vedea că încercăm să construim

12651
09:48:35,756 --> 09:48:39,916
asta astfel încât această distanță este un fel

12652
09:48:37,756 --> 09:48:44,120
un minim.

12653
09:48:39,916 --> 09:48:44,120
Deci este o potrivire optimă

12654
09:48:44,240 --> 09:48:48,360
pentru a echilibra aceste distante.

12655
09:48:54,000 --> 09:48:57,040
Deci este doar un complot. Deci este doar

12656
09:48:55,756 --> 09:48:59,120
construirea acelei relații între

12657
09:48:57,040 --> 09:49:01,840
intrare și ieșire. ca atunci când atunci când

12658
09:48:59,120 --> 09:49:05,160
cheltuielile sunt mai mari, se pare că avem

12659
09:49:01,840 --> 09:49:05,160
mai multe vanzari.

12660
09:49:30,400 --> 09:49:34,240
Ce e perpendiculară ca

12661
09:49:32,000 --> 09:49:35,680
distanta? Asta ar trebui să fie așa ar trebui să fie

12662
09:49:34,240 --> 09:49:38,680
perpendicular pentru ca este o distanta

12663
09:49:35,680 --> 09:49:38,680
aici.

12664
09:49:39,520 --> 09:49:42,320
Asta vrei să spui? Ca și distanța

12665
09:49:40,800 --> 09:49:44,560
de la punctele reale la linie. Da,

12666
09:49:42,320 --> 09:49:46,400
care ar trebui să fie perpendicular

12667
09:49:44,560 --> 09:49:49,400
pentru că este o distanță

12668
09:49:46,400 --> 09:49:49,400
formula.

12669
09:50:06,640 --> 09:50:09,640
Bine.

12670
09:50:10,720 --> 09:50:17,840
În regulă. Deci, mai general, acum faceți

12671
09:50:14,080 --> 09:50:21,680
de obicei avem o caracteristică? Nu. Deci

12672
09:50:17,840 --> 09:50:24,080
în general extindem acest lucru la mai mult

12673
09:50:21,680 --> 09:50:26,480
caz general în care avem mai mult de unul

12674
09:50:24,080 --> 09:50:28,560
caracteristică ca ceea ce vedem în carcasă

12675
09:50:26,480 --> 09:50:30,480
date exact acolo unde am putea prezice a

12676
09:50:28,560 --> 09:50:33,276
preț, dar avem multe intrări diferite

12677
09:50:30,480 --> 09:50:35,916
cum ar fi dormitoare, băi, metru pătrat

12678
09:50:33,276 --> 09:50:39,520
etc.

12679
09:50:35,916 --> 09:50:42,320
Deci mai larg

12680
09:50:39,520 --> 09:50:44,560
în loc de regresie liniară simplă noi

12681
09:50:42,320 --> 09:50:46,240
au ceea ce se numește liniar multiplu

12682
09:50:44,560 --> 09:50:49,520
regresie liniară ceea ce înseamnă că avem

12683
09:50:46,240 --> 09:50:52,800
variabile multiple sau caracteristici multiple.

12684
09:50:49,520 --> 09:50:56,160
Deci aceasta este exact ecuația pe care o am

12685
09:50:52,800 --> 09:50:59,680
despre care am vorbit. Așa că doar extindem

12686
09:50:56,160 --> 09:51:02,480
că acela în multe caracteristici. Deci

12687
09:50:59,680 --> 09:51:06,880
care este cazul acesta și apoi o interceptare

12688
09:51:02,480 --> 09:51:10,400
termen care este acolo ca uneori

12689
09:51:06,880 --> 09:51:12,640
cunoscut sub numele de părtinire. Hm

12690
09:51:10,400 --> 09:51:14,800
dar acesta este termenul de interceptare a tipului

12691
09:51:12,640 --> 09:51:20,720
de orientare a liniei pentru a începe în

12692
09:51:14,800 --> 09:51:23,520
locul potrivit. Um și uh, dar acesta este

12693
09:51:20,720 --> 09:51:25,520
um, aceasta este ecuația pe care am fi

12694
09:51:23,520 --> 09:51:26,640
construirea modelului. Acesta este modelul nostru

12695
09:51:25,520 --> 09:51:29,520
in esenta, nu? Aceasta este ecuația

12696
09:51:26,640 --> 09:51:31,200
am invata.

12697
09:51:29,520 --> 09:51:33,916
Interceptarea este ca o constantă. Da. Deci

12698
09:51:31,200 --> 09:51:36,400
dacă dacă toate caracteristicile ar fi zero, um

12699
09:51:33,916 --> 09:51:38,000
acestea ar fi datele noastre. Aceasta

12700
09:51:36,400 --> 09:51:39,756
acesta ar fi rezultatul nostru. Dacă

12701
09:51:38,000 --> 09:51:42,320
practic, dacă acesta era zero, acesta era

12702
09:51:39,756 --> 09:51:44,960
zero, acesta era zero, s-ar reduce la

12703
09:51:42,320 --> 09:51:49,320
asta ca predictie. Da. Este ca

12704
09:51:44,960 --> 09:51:49,320
o constantă. Da.

12705
09:51:53,840 --> 09:51:57,360
Deci, în geometrie, interceptarea este

12706
09:51:56,160 --> 09:51:59,520
de fapt foarte important pentru că asta

12707
09:51:57,360 --> 09:52:02,560
orientează unde ar trebui să înceapă linia dvs. Aşa

12708
09:51:59,520 --> 09:52:04,640
se orientează așa așa așa sunt aceste valori

12709
09:52:02,560 --> 09:52:07,120
cam ca panta. Ei orientează

12710
09:52:04,640 --> 09:52:09,596
înclinarea acestuia. Ca și cum ar trebui să fie înclinat

12711
09:52:07,120 --> 09:52:12,160
asa sau ar trebui sa fie mai inclinat?

12712
09:52:09,596 --> 09:52:14,400
Dar interceptarea o orientează unde este

12713
09:52:12,160 --> 09:52:16,080
ar trebui să înceapă așa cum ar trebui pe verticală

12714
09:52:14,400 --> 09:52:18,480
începe până aici? Ar trebui

12715
09:52:16,080 --> 09:52:21,040
începe mai mult aici?

12716
09:52:18,480 --> 09:52:24,276
Um, asta este interceptarea

12717
09:52:21,040 --> 09:52:24,276
ne spune.

12718
09:52:31,756 --> 09:52:35,596
Bine, deci aceasta este situația. Aceasta este

12719
09:52:34,160 --> 09:52:37,200
va fi modelul nostru de regresie liniară

12720
09:52:35,596 --> 09:52:39,520
că vom construi majoritatea

12721
09:52:37,200 --> 09:52:41,916
timp pentru că vom avea din nou acestea

12722
09:52:39,520 --> 09:52:45,200
toate vor fi caracteristici.

12723
09:52:41,916 --> 09:52:49,040
Deci aceasta este o caracteristică X-ul

12724
09:52:45,200 --> 09:52:53,040
unele caracteristici aceasta este o caracteristică

12725
09:52:49,040 --> 09:52:55,276
X1 etc. Acestea sunt toate caracteristicile și ce

12726
09:52:53,040 --> 09:52:56,960
se învață în timpul antrenamentului sunt

12727
09:52:55,276 --> 09:53:01,040
acești coeficienți. Deci toate astea

12728
09:52:56,960 --> 09:53:03,200
coeficienți inclusiv beta 0ero um

12729
09:53:01,040 --> 09:53:05,276
va fi invatat. Deci acestea vor primi

12730
09:53:03,200 --> 09:53:07,916
învăţat

12731
09:53:05,276 --> 09:53:11,120
um din datele noastre chiar au învățat

12732
09:53:07,916 --> 09:53:13,520
vor fi instruiți din datele noastre

12733
09:53:11,120 --> 09:53:16,080
comandă și cum se antrenează

12734
09:53:13,520 --> 09:53:18,880
este din reducerea acelei distanțe pe care încercăm

12735
09:53:16,080 --> 09:53:22,240
pentru a obține acea linie de cea mai bună potrivire prin ajustări

12736
09:53:18,880 --> 09:53:24,160
acele beta-uri suficiente pentru a ajunge până ajungem

12737
09:53:22,240 --> 09:53:26,960
o distanta minima dar exista

12738
09:53:24,160 --> 09:53:30,160
un algoritm în spatele acelui um că aia

12739
09:53:26,960 --> 09:53:33,200
scikitlearn va alerga ca să găsim asta

12740
09:53:30,160 --> 09:53:35,680
se potrivește cel mai bine, așa că nu trebuie să facem asta

12741
09:53:33,200 --> 09:53:38,000
manual, dar acesta este procesul

12742
09:53:35,680 --> 09:53:41,040
este practic ajustarea acestor greutăți la

12743
09:53:38,000 --> 09:53:43,360
ajunge cu acea linie de cea mai bună potrivire. Deci in

12744
09:53:41,040 --> 09:53:46,080
dimensiuni mai mari, în loc de linie,

12745
09:53:43,360 --> 09:53:48,880
primești mai mult din ceea ce se numește avion

12746
09:53:46,080 --> 09:53:51,916
aici. Hm, care arată așa.

12747
09:53:48,880 --> 09:53:54,880
Deci cel mai potrivit avion este de fapt acest avion

12748
09:53:51,916 --> 09:53:57,276
unde, um, cam disecă totul

12749
09:53:54,880 --> 09:53:59,840
aceste puncte exact așa, um, în

12750
09:53:57,276 --> 09:54:01,916
dimensiuni mai mari. Deci asta e în schimb

12751
09:53:59,840 --> 09:54:04,960
dintr-o linie în care primești asta în trei

12752
09:54:01,916 --> 09:54:07,200
dimensiunile ai acest avion astfel

12753
09:54:04,960 --> 09:54:09,120
dar tot e ca o linie de cele mai bune

12754
09:54:07,200 --> 09:54:12,560
este doar o linie mai generală a celor mai bune

12755
09:54:09,120 --> 09:54:15,360
potrivi. Este în continuare aceeași idee. Suntem

12756
09:54:12,560 --> 09:54:17,520
încă încerc să vin cu ce e mai bun

12757
09:54:15,360 --> 09:54:21,680
coeficienți pentru a minimiza această distanță

12758
09:54:17,520 --> 09:54:23,120
de la noastre de la punctele noastre la linie.

12759
09:54:21,680 --> 09:54:24,720
Deși în dimensiuni mai mari este nr

12760
09:54:23,120 --> 09:54:26,240
o linie mai lungă. Este mai mult ca un avion

12761
09:54:24,720 --> 09:54:28,000
ca asta. Deci încerci să minimizi

12762
09:54:26,240 --> 09:54:29,756
aceasta distanta de aici in jos pana la

12763
09:54:28,000 --> 09:54:32,080
avionul

12764
09:54:29,756 --> 09:54:34,880
aici până în avion

12765
09:54:32,080 --> 09:54:37,596
în dimensiuni superioare. Așa că vreau să faci

12766
09:54:34,880 --> 09:54:39,200
ține cont de ceea ce încercăm să facem

12767
09:54:37,596 --> 09:54:40,640
înainte de a intra în cod, deoarece

12768
09:54:39,200 --> 09:54:42,240
codul va face să pară cu adevărat

12769
09:54:40,640 --> 09:54:44,160
foarte simplu și asta pentru că

12770
09:54:42,240 --> 09:54:46,240
scikitlearn este grozav și asta este

12771
09:54:44,160 --> 09:54:47,756
face.

12772
09:54:46,240 --> 09:54:49,436
Dar ar trebui să ne dăm seama că există

12773
09:54:47,756 --> 09:54:53,520
ceva cu adevărat complex care se întâmplă

12774
09:54:49,436 --> 09:54:55,360
găsește din nou cea mai bună valoare dintre acestea

12775
09:54:53,520 --> 09:54:58,880
greutăți

12776
09:54:55,360 --> 09:55:02,560
care minimizează distanța acestei linii

12777
09:54:58,880 --> 09:55:04,480
la punctele de date pe care le avem. Deci

12778
09:55:02,560 --> 09:55:07,520
există un algoritm acolo care va

12779
09:55:04,480 --> 09:55:10,240
continua să încerci să faci ajustări la asta

12780
09:55:07,520 --> 09:55:12,240
pe baza acestor distante. Deci merge

12781
09:55:10,240 --> 09:55:16,400
pentru a folosi acele distante ca un ghid pentru

12782
09:55:12,240 --> 09:55:18,160
le cam modifică pentru a-l găsi pe cel care

12783
09:55:16,400 --> 09:55:19,756
rezultă cea mai mică cantitate de

12784
09:55:18,160 --> 09:55:21,840
distanta. Așa că continuăm să facem ajustări, continuă

12785
09:55:19,756 --> 09:55:24,960
făcând ajustări, continuă să faci ajustări și

12786
09:55:21,840 --> 09:55:26,720
în cele din urmă încercăm să găsim spre care convergem

12787
09:55:24,960 --> 09:55:30,320
setul de greutăți care ne oferă asta

12788
09:55:26,720 --> 09:55:33,360
cea mai potrivită linie. Hm și și există o

12789
09:55:30,320 --> 09:55:36,560
algoritmul care apare acolo. Acum, din fericire

12790
09:55:33,360 --> 09:55:38,480
care se abstrage pentru noi un pic în urmă

12791
09:55:36,560 --> 09:55:41,436
um scikitlearn

12792
09:55:38,480 --> 09:55:44,960
um găsirea cea mai potrivită. Deci va fi

12793
09:55:41,436 --> 09:55:46,720
o funcție pe care o folosim în scikitlearn

12794
09:55:44,960 --> 09:55:50,560
când construim modelul care va merge

12795
09:55:46,720 --> 09:55:53,276
înainte și găsiți cele mai bune greutăți pentru noi

12796
09:55:50,560 --> 09:55:55,360
și atunci avem acum optimul nostru

12797
09:55:53,276 --> 09:55:58,640
model corect pe care apoi îl putem conecta

12798
09:55:55,360 --> 09:56:01,360
în valori diferite ale acestor caracteristici

12799
09:55:58,640 --> 09:56:04,800
și generați o predicție care merge

12800
09:56:01,360 --> 09:56:07,916
să fie acest rezultat corect, așa că asta e

12801
09:56:04,800 --> 09:56:10,560
ceea ce încercăm în cele din urmă să facem este uh

12802
09:56:07,916 --> 09:56:13,916
antrenează modelul care va găsi tot

12803
09:56:10,560 --> 09:56:15,916
acele greutăți optime și apoi putem

12804
09:56:13,916 --> 09:56:18,560
prezice cu ea care ar fi conectarea

12805
09:56:15,916 --> 09:56:21,756
în diferite valori ale caracteristicilor to to

12806
09:56:18,560 --> 09:56:23,276
genera o predicție.

12807
09:56:21,756 --> 09:56:24,800
bine,

12808
09:56:23,276 --> 09:56:27,520
deci să vedem cum se întâmplă asta. Este

12809
09:56:24,800 --> 09:56:29,596
de fapt va fi foarte ușor cu

12810
09:56:27,520 --> 09:56:33,360
scikitlearn.

12811
09:56:29,596 --> 09:56:35,596
Deci, în acest scenariu avem um suntem

12812
09:56:33,360 --> 09:56:38,960
ne vom importa panda pentru că suntem

12813
09:56:35,596 --> 09:56:40,400
ne vom încărca datele din asta. Um, deci

12814
09:56:38,960 --> 09:56:42,080
bineînțeles că avem nevoie de niște date pentru a funcționa

12815
09:56:40,400 --> 09:56:43,756
cu. Deci o să încărcăm asta

12816
09:56:42,080 --> 09:56:46,880
CSV.

12817
09:56:43,756 --> 09:56:49,916
Hm, eu

12818
09:56:46,880 --> 09:56:52,160
deci nu am reușit să găsesc

12819
09:56:49,916 --> 09:56:53,680
acest CSV pentru acest exemplu, dar vreau să spun

12820
09:56:52,160 --> 09:56:55,520
e în regulă pentru că vom face ceva

12821
09:56:53,680 --> 09:56:58,720
faceți alte exemple cu care vom lucra

12822
09:56:55,520 --> 09:57:02,000
datele. Dacă se întâmplă să-l ai, um,

12823
09:56:58,720 --> 09:57:03,756
grozav. Nu l-am văzut în fișierele mele.

12824
09:57:02,000 --> 09:57:06,400
Așa că trebuie doar să crezi pe cuvânt

12825
09:57:03,756 --> 09:57:10,080
că acestea sunt asta este acel televizor și

12826
09:57:06,400 --> 09:57:11,916
coloanele de vânzări aici sunt din aceste date

12827
09:57:10,080 --> 09:57:17,276
set.

12828
09:57:11,916 --> 09:57:21,120
Bine. Um ca exemplu. Deci doar să

12829
09:57:17,276 --> 09:57:24,080
vezi cum se potrivește la ce vom merge

12830
09:57:21,120 --> 09:57:27,040
face și asta va fi foarte

12831
09:57:24,080 --> 09:57:29,276
proces standard pentru noi pentru construirea unui

12832
09:57:27,040 --> 09:57:31,596
model. Acești pași vor fi foarte

12833
09:57:29,276 --> 09:57:35,520
foarte standard pentru noi, ceea ce va fi

12834
09:57:31,596 --> 09:57:38,000
fie în primul rând împărțirea caracteristicilor

12835
09:57:35,520 --> 09:57:40,400
departe de etichetă. Asta e primul

12836
09:57:38,000 --> 09:57:43,040
pas pe care îl vom face mereu. Deci dacă tu

12837
09:57:40,400 --> 09:57:48,080
aruncați o privire la acest cod, este nevoie

12838
09:57:43,040 --> 09:57:50,000
toate rândurile, dar numai prima coloană.

12839
09:57:48,080 --> 09:57:52,960
Bine, deci extrage toate

12840
09:57:50,000 --> 09:57:55,520
caracteristici din cadrul de date um care

12841
09:57:52,960 --> 09:57:59,276
se întâmplă să fie care este doar primul

12842
09:57:55,520 --> 09:58:02,560
prima coloană uh care este televizorul uh

12843
09:57:59,276 --> 09:58:06,320
coloana din dreapta doar acea coloană de acolo și

12844
09:58:02,560 --> 09:58:10,240
variabila noastră țintă, care este eticheta noastră.

12845
09:58:06,320 --> 09:58:14,000
Deci variabila noastră țintă, eticheta um

12846
09:58:10,240 --> 09:58:17,200
este a doua coloană, nu? Asta este

12847
09:58:14,000 --> 09:58:21,200
acea coloană de vânzări.

12848
09:58:17,200 --> 09:58:24,960
Um și deci primul nostru pas aici, lasă-mă

12849
09:58:21,200 --> 09:58:28,240
suna asta aici. Primul pas este să

12850
09:58:24,960 --> 09:58:31,840
despărțit întotdeauna

12851
09:58:28,240 --> 09:58:34,640
caracteristici de la etichete.

12852
09:58:31,840 --> 09:58:37,436
Bine, așa că am pus toate aceste caracteristici

12853
09:58:34,640 --> 09:58:40,800
un cadru de date numit X și avem toate

12854
09:58:37,436 --> 09:58:44,080
etichetele noastre într-o serie tehnică dar

12855
09:58:40,800 --> 09:58:48,000
cam ca un cadru de date, nu? Hm

12856
09:58:44,080 --> 09:58:52,560
numit Y, care este doar um care este

12857
09:58:48,000 --> 09:58:55,120
doar etichetele uh uh. Deci doar asta

12858
09:58:52,560 --> 09:58:59,436
valorile TV. Hm, acum o să faci

12859
09:58:55,120 --> 09:59:02,480
vezi de ce facem asta. Pentru că avem nevoie

12860
09:58:59,436 --> 09:59:04,800
um, caracteristicile și etichetele noastre sunt împărțite

12861
09:59:02,480 --> 09:59:08,160
în afară de a le pune în model

12862
09:59:04,800 --> 09:59:10,720
functia de constructie. Ne așteaptă

12863
09:59:08,160 --> 09:59:14,000
variabile independente sau caracteristicile noastre la

12864
09:59:10,720 --> 09:59:17,520
fi separat de răspunsurile noastre sau ale noastre

12865
09:59:14,000 --> 09:59:18,800
etichete care ghidează construirea modelului.

12866
09:59:17,520 --> 09:59:20,880
Acesta este primul lucru pe care trebuie să-l faci

12867
09:59:18,800 --> 09:59:22,880
separă pe acelea.

12868
09:59:20,880 --> 09:59:26,400
Bine, deci acest cod le va separa pe acestea

12869
09:59:22,880 --> 09:59:27,840
într-un X majuscul și un Y minuscul.

12870
09:59:26,400 --> 09:59:30,800
Și asta este de fapt o industrie destul de bună

12871
09:59:27,840 --> 09:59:33,040
notație standard. Ori de câte ori te despărți

12872
09:59:30,800 --> 09:59:35,520
în afară de toate trăsăturile tale, de obicei le pui

12873
09:59:33,040 --> 09:59:38,560
le într-un cadru de date numit capital X

12874
09:59:35,520 --> 09:59:40,720
și apoi aveți un Y minuscul la

12875
09:59:38,560 --> 09:59:42,960
reprezentați etichetele dvs. Asta e de fapt

12876
09:59:40,720 --> 09:59:46,800
destul de standard.

12877
09:59:42,960 --> 09:59:49,120
Deci este destul de standard ca um X

12878
09:59:46,800 --> 09:59:50,960
reprezintă

12879
09:59:49,120 --> 09:59:52,480
caracteristici

12880
09:59:50,960 --> 09:59:57,360
şi

12881
09:59:52,480 --> 09:59:59,520
Y reprezintă etichete

12882
09:59:57,360 --> 10:00:01,360
coloana de etichete

12883
09:59:59,520 --> 10:00:04,480
oricare ar fi coloana noastră de etichete în aceasta

12884
10:00:01,360 --> 10:00:08,276
În cazul în care sunt vânzările pentru că mergem

12885
10:00:04,480 --> 10:00:08,276
să prezică vânzările

12886
10:00:09,680 --> 10:00:16,040
folosind coloana TV, TV quant uh

12887
10:00:12,640 --> 10:00:16,040
cantitatea de cheltuieli.

12888
10:00:19,916 --> 10:00:27,916
Da. Deci, care este însărcinarea

12889
10:00:23,276 --> 10:00:29,436
că suntem um misiunea este că noi

12890
10:00:27,916 --> 10:00:34,160
sunt

12891
10:00:29,436 --> 10:00:37,276
uh, ne împărțim datele.

12892
10:00:34,160 --> 10:00:40,720
Așa că atunci când citim pentru prima dată datele

12893
10:00:37,276 --> 10:00:44,480
um este un drept cadru de date care are două

12894
10:00:40,720 --> 10:00:48,720
coloane TV si vanzari.

12895
10:00:44,480 --> 10:00:52,880
Oh perfect, mulțumesc Tim. eu voi face

12896
10:00:48,720 --> 10:00:55,756
mergeți mai departe și deci dacă ne uităm la aceste date

12897
10:00:52,880 --> 10:00:59,040
are doar acele două coloane exact

12898
10:00:55,756 --> 10:01:02,640
are doar acele două coloane. Bine. Deci

12899
10:00:59,040 --> 10:01:04,800
ceea ce facem cu asta este că suntem

12900
10:01:02,640 --> 10:01:07,520
despărțindu-se

12901
10:01:04,800 --> 10:01:11,916
nostru variabila independentă nostru

12902
10:01:07,520 --> 10:01:15,480
Caracteristici. Deci acest X va conține

12903
10:01:11,916 --> 10:01:15,480
caracteristicile noastre

12904
10:01:15,840 --> 10:01:23,120
iar Y va conține

12905
10:01:19,756 --> 10:01:24,560
eticheta noastră.

12906
10:01:23,120 --> 10:01:26,480
Are sens? Ne despărțim

12907
10:01:24,560 --> 10:01:29,436
aceste date în afară. Deci, nu facem decât să apucăm

12908
10:01:26,480 --> 10:01:32,000
prima coloană aici să fie a noastră

12909
10:01:29,436 --> 10:01:33,680
caracteristici. Și apoi ne apucăm

12910
10:01:32,000 --> 10:01:34,960
a doua coloană, care este vânzările,

12911
10:01:33,680 --> 10:01:37,276
pentru că vom prezice

12912
10:01:34,960 --> 10:01:38,800
vânzări. Aceasta este eticheta noastră. Vom merge

12913
10:01:37,276 --> 10:01:43,520
vom construi un model pentru a prezice

12914
10:01:38,800 --> 10:01:46,480
vânzările având în vedere intrarea TV, cheltuielile TV

12915
10:01:43,520 --> 10:01:48,720
intrare. Deci, primul lucru pe care trebuie să-l facem

12916
10:01:46,480 --> 10:01:51,120
este împărțit între caracteristici și

12917
10:01:48,720 --> 10:01:52,880
eticheta.

12918
10:01:51,120 --> 10:01:55,756
Bine, acesta este primul pas pe care îl facem de obicei

12919
10:01:52,880 --> 10:01:58,880
va lua. Și motivul pentru care trebuie să facem

12920
10:01:55,756 --> 10:02:02,080
asta doar pentru a reitera motivul pentru care noi

12921
10:01:58,880 --> 10:02:05,200
trebuie să facem asta pentru că modelul nostru

12922
10:02:02,080 --> 10:02:07,436
ne vom aștepta ca funcțiile noastre de date să fie

12923
10:02:05,200 --> 10:02:10,160
separat de etichetă. Vom trece

12924
10:02:07,436 --> 10:02:14,000
cele din separat.

12925
10:02:10,160 --> 10:02:16,480
X este televizor. Este prima coloană

12926
10:02:14,000 --> 10:02:19,680
pentru că folosim corect. Este asta

12927
10:02:16,480 --> 10:02:23,160
toate rândurile, cu excepția primei coloane

12928
10:02:19,680 --> 10:02:23,160
care este televizorul.

12929
10:02:24,960 --> 10:02:28,960
De ce sunt vânzări? Asta suntem

12930
10:02:26,720 --> 10:02:32,160
prezicerea.

12931
10:02:28,960 --> 10:02:35,560
Previzăm vânzările având în vedere televizorul

12932
10:02:32,160 --> 10:02:35,560
valoarea de cheltuiala.

12933
10:02:37,120 --> 10:02:42,800
Da. De aceea l-am împărțit în So

12934
10:02:40,080 --> 10:02:46,596
aceasta este a doua coloană, nu? The

12935
10:02:42,800 --> 10:02:46,596
indexați o coloană.

12936
10:02:47,840 --> 10:02:52,080
Doar ai introdus CSV de citire și dai

12937
10:02:50,480 --> 10:02:54,480
URL-ul.

12938
10:02:52,080 --> 10:02:57,520
Deci ai putea Deci exact codul care

12939
10:02:54,480 --> 10:03:01,276
a crescut mai devreme de la temp

12940
10:02:57,520 --> 10:03:09,596
um doar faci asta

12941
10:03:01,276 --> 10:03:13,436
și apoi datele sunt egale cu ddread CSV URL.

12942
10:03:09,596 --> 10:03:15,756
Deci ne împărțim datele în X și Y aici.

12943
10:03:13,436 --> 10:03:18,000
În regulă. Acum, un alt pas

12944
10:03:15,756 --> 10:03:19,596
vom lua că este foarte foarte

12945
10:03:18,000 --> 10:03:23,200
pas critic și tu o să fim noi

12946
10:03:19,596 --> 10:03:25,596
mergând să văd acest pas iar și iar și

12947
10:03:23,200 --> 10:03:27,916
iar si iar. Deci, despărțirea

12948
10:03:25,596 --> 10:03:30,640
în X și Y vor deveni, vom face asta

12949
10:03:27,916 --> 10:03:34,320
iar si iar si iar si iar.

12950
10:03:30,640 --> 10:03:37,120
Nu numai atât, ci și făcând acest pas următor

12951
10:03:34,320 --> 10:03:39,360
care este ceea ce se numește un test de tren

12952
10:03:37,120 --> 10:03:44,640
despicat. Acum, lasă-mă să-ți arăt ce

12953
10:03:39,360 --> 10:03:47,200
tren test split face. Ne ia datele

12954
10:03:44,640 --> 10:03:50,000
Și ne va diviza datele

12955
10:03:47,200 --> 10:03:52,320
pe care le avem, datele noastre X și Y. Este

12956
10:03:50,000 --> 10:03:54,800
urmând să-l despart într-o

12957
10:03:52,320 --> 10:03:57,436
procentul care va fi folosit pentru antrenament

12958
10:03:54,800 --> 10:03:59,680
datele

12959
10:03:57,436 --> 10:04:02,480
iar apoi un procent care va fi folosit

12960
10:03:59,680 --> 10:04:05,040
a testa. Acum, de ce am vrea să facem

12961
10:04:02,480 --> 10:04:08,320
asta? Este în principal ca să putem face

12962
10:04:05,040 --> 10:04:11,596
evaluarea. Deci construim modelul peste

12963
10:04:08,320 --> 10:04:15,120
aici și apoi îl testăm pe date care

12964
10:04:11,596 --> 10:04:16,880
nu a mai văzut. Așa că ne rezervăm un

12965
10:04:15,120 --> 10:04:21,756
procentul de date pentru care trebuie utilizat

12966
10:04:16,880 --> 10:04:26,160
test. De obicei, aceste date sunt um

12967
10:04:21,756 --> 10:04:29,436
undeva între 20 și 30%.

12968
10:04:26,160 --> 10:04:31,840
Deci undeva între 20 și 30% din

12969
10:04:29,436 --> 10:04:34,080
date originale. Deci asta înseamnă

12970
10:04:31,840 --> 10:04:37,040
majoritatea este folosită pentru antrenament. Deci

12971
10:04:34,080 --> 10:04:42,596
cea mai mare parte a acestor X și Y peste

12972
10:04:37,040 --> 10:04:42,596
aici va fi între 70 și 80%.

12973
10:04:42,960 --> 10:04:50,160
Va fi folosit în general pentru pentru uh pentru

12974
10:04:47,120 --> 10:04:52,560
antrenament. Bine. Deci undeva intre 20

12975
10:04:50,160 --> 10:04:54,880
la 30 standardul industriei este ceva

12976
10:04:52,560 --> 10:04:56,960
oriunde între acolo. Hm multe

12977
10:04:54,880 --> 10:05:00,240
oamenilor le place să folosească 30%, unora le place

12978
10:04:56,960 --> 10:05:03,120
a folosi 20%. Orice în intervalul ăsta este

12979
10:05:00,240 --> 10:05:06,560
acceptabil. um vom crede că

12980
10:05:03,120 --> 10:05:11,200
în general, va favoriza aproximativ 30%.

12981
10:05:06,560 --> 10:05:13,756
Um pentru a fi folosit pentru testare, dar um the

12982
10:05:11,200 --> 10:05:15,360
Ideea este că nu vrem, nu vrem să amestecăm

12983
10:05:13,756 --> 10:05:20,160
cei împreună. Vrem ca acestea să fie

12984
10:05:15,360 --> 10:05:22,400
despărțiți ca să putem avea un târg

12985
10:05:20,160 --> 10:05:24,960
evaluare, nu? Vrem să ne antrenăm

12986
10:05:22,400 --> 10:05:28,800
datele despre acest antrenează modelul nostru în acest sens

12987
10:05:24,960 --> 10:05:30,720
date și apoi vedeți cât de bine funcționează

12988
10:05:28,800 --> 10:05:32,400
pe aceste date pe care nu le-a văzut niciodată

12989
10:05:30,720 --> 10:05:34,640
înainte.

12990
10:05:32,400 --> 10:05:35,916
Corect? Deci pentru a avea date este

12991
10:05:34,640 --> 10:05:37,596
nemaivăzut până acum, vom lua

12992
10:05:35,916 --> 10:05:41,200
X-ul nostru și Y-ul nostru și ne vom despărți

12993
10:05:37,596 --> 10:05:44,000
folosind această funcție numită testul trenului

12994
10:05:41,200 --> 10:05:47,756
split care va face acest tip de

12995
10:05:44,000 --> 10:05:50,240
împărțirea pentru noi. Bine. Deci scikitlearn

12996
10:05:47,756 --> 10:05:51,840
are o funcție numită tren test split

12997
10:05:50,240 --> 10:05:54,800
asta va merge înainte și vom merge

12998
10:05:51,840 --> 10:05:58,240
trece x-ul nostru și y-ul nostru și vom trece în a

12999
10:05:54,800 --> 10:06:00,720
procent de 30% pe care vrem să o facem

13000
10:05:58,240 --> 10:06:03,916
împărțit într-un set de testare și apoi în

13001
10:06:00,720 --> 10:06:07,680
restul de 70% vor fi utilizate

13002
10:06:03,916 --> 10:06:10,680
pentru antrenamentul modelului.

13003
10:06:07,680 --> 10:06:10,680
Bine.

13004
10:06:10,880 --> 10:06:15,040
Deci, ceea ce vom obține, lasă-mă să redesenez

13005
10:06:13,596 --> 10:06:17,360
că. Deci, din ce vom scoate

13006
10:06:15,040 --> 10:06:19,040
asta pentru împărțirea testului de tren este că suntem

13007
10:06:17,360 --> 10:06:22,320
mergând la vom avea un X și un

13008
10:06:19,040 --> 10:06:24,720
Y per

13009
10:06:22,320 --> 10:06:30,756
antrenament și testare. Deci, vom merge

13010
10:06:24,720 --> 10:06:30,756
ia acum, vom lua un tren X

13011
10:06:31,040 --> 10:06:36,960
și un tren Y.

13012
10:06:35,040 --> 10:06:39,436
Deci, vom obține funcții de antrenament

13013
10:06:36,960 --> 10:06:44,160
și etichete de formare. Și atunci suntem

13014
10:06:39,436 --> 10:06:47,756
va primi funcții de testare

13015
10:06:44,160 --> 10:06:52,160
pentru a conecta la modelul nostru și și a testa

13016
10:06:47,756 --> 10:06:54,480
răspunsuri sau etichete de test

13017
10:06:52,160 --> 10:06:56,240
să facem evaluare pentru că ceea ce ar trebui

13018
10:06:54,480 --> 10:06:58,720
a putea face este să construiască modelul peste

13019
10:06:56,240 --> 10:07:01,276
aici și apoi aplicați modelul pe aceasta

13020
10:06:58,720 --> 10:07:04,800
date. Înseamnă că putem lua aceste caracteristici

13021
10:07:01,276 --> 10:07:07,436
și conectați-l la modelul nostru și apoi vedeți

13022
10:07:04,800 --> 10:07:10,640
ce răspunsuri primim și le comparăm

13023
10:07:07,436 --> 10:07:12,800
răspunsuri la aceste date de testare. Corect? Noi

13024
10:07:10,640 --> 10:07:15,800
ar trebui să poată face asta pentru a genera un

13025
10:07:12,800 --> 10:07:15,800
evaluarea.

13026
10:07:16,480 --> 10:07:21,200
Bine? Acum s-ar putea să vă întrebați de ce facem noi

13027
10:07:19,276 --> 10:07:22,960
face ceva din asta? Care este scopul

13028
10:07:21,200 --> 10:07:26,720
asta?

13029
10:07:22,960 --> 10:07:30,880
Evaluarea lui pe aceste date de testare ne oferă

13030
10:07:26,720 --> 10:07:35,276
un bun simț al voinței modelul nostru

13031
10:07:30,880 --> 10:07:38,000
generalizați la noi exemple. Corect? Dacă este

13032
10:07:35,276 --> 10:07:39,596
funcționează destul de bine cu aceste date,

13033
10:07:38,000 --> 10:07:41,200
este un semnal bun ca atunci când este

13034
10:07:39,596 --> 10:07:44,080
performanță destul de bine pe datele sunt

13035
10:07:41,200 --> 10:07:45,840
nemaivăzut până acum, e bine

13036
10:07:44,080 --> 10:07:48,640
indicator că va funcționa

13037
10:07:45,840 --> 10:07:50,400
destul de bine când îl folosim pe nou-nouț

13038
10:07:48,640 --> 10:07:52,960
exemple

13039
10:07:50,400 --> 10:07:57,040
um în viitor.

13040
10:07:52,960 --> 10:08:00,560
Corect. Deci, de aceea facem asta

13041
10:07:57,040 --> 10:08:02,960
evaluare pe aceste date pe care nu o are

13042
10:08:00,560 --> 10:08:04,720
vazut inainte. O să vadă asta

13043
10:08:02,960 --> 10:08:07,756
date de antrenament, nu? Vom merge

13044
10:08:04,720 --> 10:08:09,520
antrenați modelul pe acele date. Dar asta

13045
10:08:07,756 --> 10:08:12,960
modelul nu va fi niciodată supus acestui test

13046
10:08:09,520 --> 10:08:15,840
date până când facem evaluarea

13047
10:08:12,960 --> 10:08:18,000
și și generați câteva valori pentru a vedea cum

13048
10:08:15,840 --> 10:08:19,680
bine este aceasta performanta

13049
10:08:18,000 --> 10:08:22,560
și are șanse mari să

13050
10:08:19,680 --> 10:08:24,560
generalizând la nemaivăzut până acum

13051
10:08:22,560 --> 10:08:25,916
exemple care este ceea ce vrem corect

13052
10:08:24,560 --> 10:08:28,160
pentru că vom folosi acest model în

13053
10:08:25,916 --> 10:08:30,720
lumea reală. O să fie

13054
10:08:28,160 --> 10:08:33,756
folosit pe exemple noi pe care nu le-a văzut

13055
10:08:30,720 --> 10:08:35,436
înainte. Ne dorim să funcționeze bine. Aşa,

13056
10:08:33,756 --> 10:08:38,436
acesta este un fel de test al nostru, al nostru

13057
10:08:35,436 --> 10:08:38,436
evaluarea.

13058
10:08:39,840 --> 10:08:44,480
Bine. Orice întrebări despre Mergem

13059
10:08:42,880 --> 10:08:47,120
pentru a face asta într-o clipă. Îți voi arăta

13060
10:08:44,480 --> 10:08:49,596
cum arată în cod, dar orice

13061
10:08:47,120 --> 10:08:52,240
conceptual, orice întrebări pe tren

13062
10:08:49,596 --> 10:08:57,120
testați ideea împărțirii? Este un foarte foarte

13063
10:08:52,240 --> 10:08:58,880
idee importantă pe care o folosim practic

13064
10:08:57,120 --> 10:09:01,360
o parte din date pentru a o instrui și apoi

13065
10:08:58,880 --> 10:09:03,436
o altă parte a acesteia de evaluat. Este

13066
10:09:01,360 --> 10:09:06,640
foarte important să facem asta. Apropo,

13067
10:09:03,436 --> 10:09:10,080
asta are un termen um asta în mașină

13068
10:09:06,640 --> 10:09:13,080
învățarea asta se numește cruce

13069
10:09:10,080 --> 10:09:13,080
validare

13070
10:09:14,880 --> 10:09:20,640
deoarece folosim un set de date pentru

13071
10:09:18,560 --> 10:09:23,120
antrenează modelul și apoi suntem încrucișați

13072
10:09:20,640 --> 10:09:26,160
peste noi trecem asta în

13073
10:09:23,120 --> 10:09:31,960
un alt set de date pentru a-l valida care este

13074
10:09:26,160 --> 10:09:31,960
uh, setul de testare.

13075
10:09:33,276 --> 10:09:37,200
Deci aceasta se numește validare încrucișată. Hm

13076
10:09:35,756 --> 10:09:38,400
de fapt, există multe moduri de a face cross

13077
10:09:37,200 --> 10:09:40,240
validare. Asta e ceva ce vom face

13078
10:09:38,400 --> 10:09:41,680
studiul. Acesta este un mod foarte simplu de

13079
10:09:40,240 --> 10:09:44,080
efectuând validare încrucișată. Mai sunt

13080
10:09:41,680 --> 10:09:46,080
moduri complexe. Vă puteți lua datele și

13081
10:09:44,080 --> 10:09:47,680
chiar îl poți împărți în multe

13082
10:09:46,080 --> 10:09:49,756
secțiuni

13083
10:09:47,680 --> 10:09:51,916
și, practic, îl antrenează împotriva celor mai multe

13084
10:09:49,756 --> 10:09:55,200
acestea și evaluați-l față de unul la a

13085
10:09:51,916 --> 10:09:56,720
timp și apoi rotiți. Deci asta e alta

13086
10:09:55,200 --> 10:09:59,840
modalitate de a face validarea încrucișată. Mergem

13087
10:09:56,720 --> 10:10:04,756
să studiez asta. Hm, dar acesta este asta

13088
10:09:59,840 --> 10:10:04,756
este cel mai simplu mod de a face asta aici.

13089
10:10:08,720 --> 10:10:12,720
Bine.

13090
10:10:11,276 --> 10:10:15,200
Așa că lasă-mă să-ți arăt ce primești când ești

13091
10:10:12,720 --> 10:10:18,160
folosiți diviziunea de testare a trenului. Deci mergem

13092
10:10:15,200 --> 10:10:20,720
a importa din sklearn.

13093
10:10:18,160 --> 10:10:23,040
Suntem din selecția modelului

13094
10:10:20,720 --> 10:10:24,480
modul. Acum nu am folosit asta înainte.

13095
10:10:23,040 --> 10:10:26,960
Este prima dată când îl folosim. Dar

13096
10:10:24,480 --> 10:10:30,480
iată selecția noastră de modele. Mergem

13097
10:10:26,960 --> 10:10:33,596
pentru a importa această funcție de împărțire a testului de tren

13098
10:10:30,480 --> 10:10:37,360
și îl vom folosi pe X și Y

13099
10:10:33,596 --> 10:10:40,800
și vom stabili o dimensiune de test de

13100
10:10:37,360 --> 10:10:42,960
30% care este care este.3. Deci testul nostru

13101
10:10:40,800 --> 10:10:45,596
dimensiune

13102
10:10:42,960 --> 10:10:48,880
este de 30%.

13103
10:10:45,596 --> 10:10:51,916
Convertit în zecimală

13104
10:10:48,880 --> 10:10:55,040
dreapta convertită în.3. Deci asta înseamnă

13105
10:10:51,916 --> 10:10:57,520
rezervăm 30% pentru acel set de testare.

13106
10:10:55,040 --> 10:11:00,000
Poți seta o stare aleatorie. Acum

13107
10:10:57,520 --> 10:11:02,320
asta este complet optional. Hăi

13108
10:11:00,000 --> 10:11:06,840
stare aleatorie

13109
10:11:02,320 --> 10:11:06,840
este pentru reproductibilitate

13110
10:11:10,000 --> 10:11:13,040
pentru că ceea ce este împărțirea testului de tren

13111
10:11:11,680 --> 10:11:16,240
o să faci este de fapt

13112
10:11:13,040 --> 10:11:18,320
amestecați datele și apoi împărțiți-le

13113
10:11:16,240 --> 10:11:21,916
în 7030.

13114
10:11:18,320 --> 10:11:24,640
Deci, da, sămânța. Exact. Este ca

13115
10:11:21,916 --> 10:11:26,560
o sămânță. Deci se spune ca atunci când

13116
10:11:24,640 --> 10:11:28,000
faci asta de fiecare dată când fug

13117
10:11:26,560 --> 10:11:30,000
acest caiet o să primesc la fel

13118
10:11:28,000 --> 10:11:31,596
rezultat, dar va fi aleatoriu

13119
10:11:30,000 --> 10:11:33,596
mai întâi va fi aleatoriu, dar eu sunt

13120
10:11:31,596 --> 10:11:38,000
va putea reproduce asta

13121
10:11:33,596 --> 10:11:41,720
aleatoriu cu acea stare aleatorie. Da,

13122
10:11:38,000 --> 10:11:41,720
este ca o sămânță.

13123
10:11:43,436 --> 10:11:49,756
Uh, poți alege orice număr să fie

13124
10:11:46,000 --> 10:11:51,596
ești um starea ta aleatorie. Este 42

13125
10:11:49,756 --> 10:11:53,436
nu este important. Ai putea alege zero.

13126
10:11:51,596 --> 10:11:57,360
Ai putea alege unul. Ai putea

13127
10:11:53,436 --> 10:12:01,436
alege orice număr întreg pozitiv. Hm, 42 este

13128
10:11:57,360 --> 10:12:03,520
cam ca standardul industriei.

13129
10:12:01,436 --> 10:12:07,120
Este că ar trebui să cauți de ce

13130
10:12:03,520 --> 10:12:10,000
este. Se pare că 42 este ceva special

13131
10:12:07,120 --> 10:12:12,000
număr. um,

13132
10:12:10,000 --> 10:12:14,160
în natura istoriei dezvoltării

13133
10:12:12,000 --> 10:12:16,080
din chestiile astea, nu există nimic cu adevărat

13134
10:12:14,160 --> 10:12:18,480
special despre 42. Ai putea alege o

13135
10:12:16,080 --> 10:12:21,756
aleatoriu ai putea alege o sămânță aleatorie

13136
10:12:18,480 --> 10:12:25,200
fi uh zero. Asta e bine. Nu este

13137
10:12:21,756 --> 10:12:27,596
chiar nu conteaza.

13138
10:12:25,200 --> 10:12:30,800
Vrei doar să-l alegi

13139
10:12:27,596 --> 10:12:32,960
fii unul, doi, trei. Ai putea

13140
10:12:30,800 --> 10:12:34,800
alege-l să fie 15. Îl poți alege să fie

13141
10:12:32,960 --> 10:12:37,680
fii orice vrei tu să fie. Este

13142
10:12:34,800 --> 10:12:39,436
într-adevăr, astfel încât amestecul tău este

13143
10:12:37,680 --> 10:12:41,120
consistent. De fiecare dată când rulezi asta

13144
10:12:39,436 --> 10:12:43,360
notebook, primești aceeași amestecare

13145
10:12:41,120 --> 10:12:48,200
rezultat. Așa că mereu voi obține

13146
10:12:43,360 --> 10:12:48,200
aceleași rânduri în aceste despărțiri.

13147
10:12:49,596 --> 10:12:54,200
Hitch. Acolo este. Știam că este de la

13148
10:12:51,200 --> 10:12:54,200
ceva.

13149
10:12:57,840 --> 10:13:06,640
Da. Deci 42 este un fel ca a

13150
10:13:02,640 --> 10:13:10,240
este doar folosit omniprezent

13151
10:13:06,640 --> 10:13:11,916
uh, știi ca un fel de a plăti

13152
10:13:10,240 --> 10:13:14,400
omagiu adus Ghidul autostopitului la

13153
10:13:11,916 --> 10:13:16,240
Galaxy, dar nu este, nu există nimic

13154
10:13:14,400 --> 10:13:18,000
aia speciala despre 42. Nu-i asa

13155
10:13:16,240 --> 10:13:19,360
nu ne vom schimba rezultatul sau

13156
10:13:18,000 --> 10:13:22,000
orice.

13157
10:13:19,360 --> 10:13:24,560
Doar pentru ca acest tren să se despartă

13158
10:13:22,000 --> 10:13:27,120
va amesteca datele noastre și va împărți

13159
10:13:24,560 --> 10:13:28,800
se desparte în 7030.

13160
10:13:27,120 --> 10:13:30,960
Vrei doar să setezi asta la ceva

13161
10:13:28,800 --> 10:13:33,200
ca să primești un minus de fiecare dată când alergăm

13162
10:13:30,960 --> 10:13:34,960
acest caiet, obținem o consecvență

13163
10:13:33,200 --> 10:13:38,320
amestecați.

13164
10:13:34,960 --> 10:13:43,800
Și astfel datele din aceste seturi

13165
10:13:38,320 --> 10:13:43,800
sunt consecvenți. Asta e tot.

13166
10:13:47,040 --> 10:13:53,520
Bine. Dar vedeți cum trecem înăuntru?

13167
10:13:50,000 --> 10:13:56,080
X-ul nostru și Y-ul nostru și generăm patru noi

13168
10:13:53,520 --> 10:13:58,800
generează patru date diferite

13169
10:13:56,080 --> 10:14:01,200
cantități aici pe care le generăm

13170
10:13:58,800 --> 10:14:03,840
caracteristici de antrenament, caracteristici de testare,

13171
10:14:01,200 --> 10:14:07,520
etichete de antrenament şi etichete de test pentru că

13172
10:14:03,840 --> 10:14:09,916
din nou le generăm aceste patru

13173
10:14:07,520 --> 10:14:13,436
diferit, generăm date despre acestea

13174
10:14:09,916 --> 10:14:17,520
două seturi diferite. Un set de antrenament și a

13175
10:14:13,436 --> 10:14:19,840
set de testare. Deci avem funcții de antrenament,

13176
10:14:17,520 --> 10:14:24,400
eticheta de formare,

13177
10:14:19,840 --> 10:14:27,200
și apoi testați caracteristicile, testați eticheta.

13178
10:14:24,400 --> 10:14:29,596
Bine, de aceea este atât de important să

13179
10:14:27,200 --> 10:14:32,640
împărțiți datele noastre în X și în

13180
10:14:29,596 --> 10:14:36,520
Y. Avem nevoie de cele împărțite în ordine

13181
10:14:32,640 --> 10:14:36,520
pentru ca această parte să funcționeze.

13182
10:14:36,560 --> 10:14:41,436
Deci, apropo, acești doi pași îi vom face

13183
10:14:38,480 --> 10:14:44,560
faceți întotdeauna pentru orice model pe care îl construim. Vom face

13184
10:14:41,436 --> 10:14:48,080
în general, faceți X și Y și apoi antrenați testul

13185
10:14:44,560 --> 10:14:52,436
split pentru a genera datele care

13186
10:14:48,080 --> 10:14:52,436
vom folosi pentru construirea modelului nostru.

13187
10:14:55,520 --> 10:15:00,560
Bine. Deci aceste date de aici vor merge

13188
10:14:58,000 --> 10:15:01,840
fie ceea ce folosim de fapt pentru a ghida

13189
10:15:00,560 --> 10:15:03,680
antrenamentul modelului nostru. Deci este

13190
10:15:01,840 --> 10:15:05,276
cu siguranță supravegheat, nu? Linear

13191
10:15:03,680 --> 10:15:10,436
regresie

13192
10:15:05,276 --> 10:15:10,436
um noi vom folosi asta

13193
10:15:15,120 --> 10:15:19,596
Bine, deci nu am construit încă modelul.

13194
10:15:17,276 --> 10:15:21,916
Doar ne împărțim datele

13195
10:15:19,596 --> 10:15:24,400
și gata de antrenament. Nu am făcut-o

13196
10:15:21,916 --> 10:15:27,596
chiar am construit modelul nostru încă, nu?

13197
10:15:24,400 --> 10:15:29,520
Asta va apărea într-o clipă.

13198
10:15:27,596 --> 10:15:31,756
Dar asta ne pregătește datele. Noi

13199
10:15:29,520 --> 10:15:36,240
a început cu cadrul nostru de date. L-am împărțit

13200
10:15:31,756 --> 10:15:42,320
separat în uh un x și un y. Și ne-am despărțit

13201
10:15:36,240 --> 10:15:45,120
asta într-o împărțire a testului de tren. Și tu

13202
10:15:42,320 --> 10:15:48,720
știi că atunci putem merge mai departe

13203
10:15:45,120 --> 10:15:52,436
și treci la antrenamentul nostru de model

13204
10:15:48,720 --> 10:15:52,436
ceea ce vom face într-o clipă.

13205
10:15:55,916 --> 10:16:00,080
E o întrebare bună. Ai putea

13206
10:15:57,756 --> 10:16:01,596
fugi, așa că ceea ce ai putea face este să poți

13207
10:16:00,080 --> 10:16:05,680
alerga

13208
10:16:01,596 --> 10:16:09,200
ar trebui să importam numpy? Să vedem.

13209
10:16:05,680 --> 10:16:14,800
Am făcut-o. Bine. Ai putea rula media

13210
10:16:09,200 --> 10:16:18,800
pe um ai putea verifica media MP

13211
10:16:14,800 --> 10:16:20,560
trenul X și vedeți cum se compară cu

13212
10:16:18,800 --> 10:16:24,680
um

13213
10:16:20,560 --> 10:16:24,680
vezi cum se compară cu X.

13214
10:16:25,360 --> 10:16:29,596
Deci ai putea să faci asta și să vezi

13215
10:16:26,880 --> 10:16:31,756
care este media acestei caracteristici

13216
10:16:29,596 --> 10:16:33,360
comparativ cu media originalului.

13217
10:16:31,756 --> 10:16:36,640
S-ar putea să nu fie perfecți pentru că suntem noi

13218
10:16:33,360 --> 10:16:38,480
luând o dimensiune redusă a setului de date. Deci eu

13219
10:16:36,640 --> 10:16:40,080
să nu crezi că există cu adevărat ceva bun

13220
10:16:38,480 --> 10:16:41,756
nu există ca o mărime unică pentru toate

13221
10:16:40,080 --> 10:16:44,080
validare pe care o putem face pentru că suntem

13222
10:16:41,756 --> 10:16:46,240
luând o amestecare aleatorie și luând o

13223
10:16:44,080 --> 10:16:48,640
la sută. Luăm 70% din date

13224
10:16:46,240 --> 10:16:50,800
afară. Deci nu avem garanția de a menține

13225
10:16:48,640 --> 10:16:52,800
aceleași statistici. Putem vedea dacă

13226
10:16:50,800 --> 10:16:54,560
sunt aproape.

13227
10:16:52,800 --> 10:16:56,080
Hm, dar are sens? Așa cum suntem

13228
10:16:54,560 --> 10:16:57,756
nu este garantat să obțineți aceleași statistici

13229
10:16:56,080 --> 10:17:00,240
pentru că luăm o felie din ea.

13230
10:16:57,756 --> 10:17:03,596
Luăm 70%.

13231
10:17:00,240 --> 10:17:08,596
Deci nu este garantat să to to

13232
10:17:03,596 --> 10:17:08,596
să fie cu adevărat aceeași distribuție.

13233
10:17:10,720 --> 10:17:17,040
Șterge asta.

13234
10:17:13,436 --> 10:17:20,240
E o practică bună? Da, este.

13235
10:17:17,040 --> 10:17:25,400
Este. 30% este standardul industriei.

13236
10:17:20,240 --> 10:17:25,400
Orice între 20 și 30. Deci 0.2.25.3

13237
10:17:25,680 --> 10:17:31,840
oricare dintre acestea este acceptabil. Este cu adevărat

13238
10:17:27,756 --> 10:17:34,880
depinde de tine. Um, văd în mare parte 30%.

13239
10:17:31,840 --> 10:17:37,520
Mo cred.3 este o bună practică

13240
10:17:34,880 --> 10:17:40,480
de folosit cu siguranță.

13241
10:17:37,520 --> 10:17:43,276
Am explicat starea aleatorie. Uh aleatoriu

13242
10:17:40,480 --> 10:17:46,400
starea este astfel încât să devii consecvent

13243
10:17:43,276 --> 10:17:48,480
amestecând. Poti seta asta la oricare

13244
10:17:46,400 --> 10:17:51,680
întreg care vrei să fie. Este

13245
10:17:48,480 --> 10:17:54,640
chiar nu conteaza. Poți să-l setezi

13246
10:17:51,680 --> 10:17:57,840
la uh 100, îl poți seta la 10, poți

13247
10:17:54,640 --> 10:18:00,240
setează-l la 15. Hm doar asigură pentru că

13248
10:17:57,840 --> 10:18:02,080
ceea ce va face această scindare este că va face

13249
10:18:00,240 --> 10:18:05,276
amestecați mai întâi datele. Se va amesteca

13250
10:18:02,080 --> 10:18:09,276
rândurile și apoi împărțiți-o în

13251
10:18:05,276 --> 10:18:11,120
în tren și seturi de testare. Deci tu

13252
10:18:09,276 --> 10:18:13,276
setați starea aleatorie astfel încât următoarea

13253
10:18:11,120 --> 10:18:15,436
când rulezi asta, primești același lucru

13254
10:18:13,276 --> 10:18:17,200
amestecare consistentă. Asta e singurul

13255
10:18:15,436 --> 10:18:20,320
asta e singurul lucru care te ajuta

13256
10:18:17,200 --> 10:18:23,520
cu pentru că este randomizat dar când

13257
10:18:20,320 --> 10:18:25,120
ai setat o stare aleatorie um e așa că

13258
10:18:23,520 --> 10:18:27,200
parcă dacă îl rulezi din nou vei primi

13259
10:18:25,120 --> 10:18:28,800
aceeași amestecare.

13260
10:18:27,200 --> 10:18:31,040
Veți obține același lucru la amestecare

13261
10:18:28,800 --> 10:18:35,400
contează pentru că asta dictează

13262
10:18:31,040 --> 10:18:35,400
ce ajunge în aceste seturi.

13263
10:18:39,200 --> 10:18:44,160
Bine.

13264
10:18:41,040 --> 10:18:46,160
În regulă. Așa că să vedem hai să facem hai

13265
10:18:44,160 --> 10:18:49,276
construiți modelul

13266
10:18:46,160 --> 10:18:50,880
și lasă-mă să-ți arăt cât de ușor este asta

13267
10:18:49,276 --> 10:18:53,436
va fi să construim modelul și asta

13268
10:18:50,880 --> 10:18:55,680
chiar așa va fi pentru fiecare

13269
10:18:53,436 --> 10:18:58,800
un singur model scikitlearn va practic

13270
10:18:55,680 --> 10:19:00,000
arata exact la fel pentru antrenament

13271
10:18:58,800 --> 10:19:02,160
care este ceea ce o va face cu adevărat

13272
10:19:00,000 --> 10:19:05,520
chiar frumos. Deci primul lucru pe care îl avem

13273
10:19:02,160 --> 10:19:07,276
de făcut este să importam modelul nostru. Deci de la

13274
10:19:05,520 --> 10:19:10,480
scikitlearn vom folosi un

13275
10:19:07,276 --> 10:19:13,756
liniar din pachetul model liniar sau

13276
10:19:10,480 --> 10:19:15,680
modulul model liniar ar trebui să spun

13277
10:19:13,756 --> 10:19:18,320
în sklearn vom fi

13278
10:19:15,680 --> 10:19:20,480
importând regresia liniară

13279
10:19:18,320 --> 10:19:23,360
și vom crea o instanță a

13280
10:19:20,480 --> 10:19:27,436
aici regresia liniară.

13281
10:19:23,360 --> 10:19:31,916
Bine, deci regresie liniară și uite cum

13282
10:19:27,436 --> 10:19:37,120
ușor asta va fi. Aproape toate

13283
10:19:31,916 --> 10:19:42,560
aproape toate modelele sklearn folosesc

13284
10:19:37,120 --> 10:19:44,960
funcția ffit pentru a antrena.

13285
10:19:42,560 --> 10:19:48,000
Deci fiecare dintre ei, indiferent care

13286
10:19:44,960 --> 10:19:52,160
unul pe care îl folosim, cum ar fi arborele de decizie, cum ar fi

13287
10:19:48,000 --> 10:19:53,596
regresia logistică, oricare dintre ele

13288
10:19:52,160 --> 10:19:55,436
cum folosim noi pentru clasificare care sunt

13289
10:19:53,596 --> 10:19:57,840
va apărea în lecția a patra,

13290
10:19:55,436 --> 10:20:00,880
toate vor arăta la fel

13291
10:19:57,840 --> 10:20:04,320
termenii că va rula.

13292
10:20:00,880 --> 10:20:06,880
Care este al lui scikitlearn

13293
10:20:04,320 --> 10:20:10,400
uh funcție generică pentru antrenamentul tău

13294
10:20:06,880 --> 10:20:13,596
model. Deci, aceasta va executa antrenamentul

13295
10:20:10,400 --> 10:20:15,756
odată ce rulăm acest cod. Și ce asta

13296
10:20:13,596 --> 10:20:18,880
iar antrenamentul de regresie liniară este

13297
10:20:15,756 --> 10:20:22,720
va face distanța aceea cu cele mai mici pătrate

13298
10:20:18,880 --> 10:20:25,120
procedură sau algoritm pentru a încerca să găsească

13299
10:20:22,720 --> 10:20:27,276
greutățile potrivite. Încearcă să găsească

13300
10:20:25,120 --> 10:20:30,560
acele greutăți care minimizează acel pătrat

13301
10:20:27,276 --> 10:20:33,596
distanță uh de linia noastră că este

13302
10:20:30,560 --> 10:20:36,000
încercând să construiască pe date.

13303
10:20:33,596 --> 10:20:39,276
Și ceea ce vreau să observați este ceea ce noi

13304
10:20:36,000 --> 10:20:40,720
pus în ffit. Vezi cum punem în

13305
10:20:39,276 --> 10:20:43,200
datele de antrenament unde am pus în

13306
10:20:40,720 --> 10:20:46,960
caracteristici de antrenament și am pus în

13307
10:20:43,200 --> 10:20:50,480
etichete de antrenament. Acum acest lucru este supravegheat.

13308
10:20:46,960 --> 10:20:53,360
Deci, bineînțeles, punem etichetele,

13309
10:20:50,480 --> 10:20:55,436
nu? Bineînțeles că punem aceste etichete

13310
10:20:53,360 --> 10:20:58,720
aici și bineînțeles că punem în nostru

13311
10:20:55,436 --> 10:21:03,276
caracteristici aici. Deci punem toate

13312
10:20:58,720 --> 10:21:06,640
din exemplele noastre din diviziunea noastră de formare

13313
10:21:03,276 --> 10:21:10,160
în acest ffit care se va antrena

13314
10:21:06,640 --> 10:21:12,560
modelul uh ca să putem să îl folosim

13315
10:21:10,160 --> 10:21:15,276
ea pentru predicție.

13316
10:21:12,560 --> 10:21:18,240
Bine, este foarte rapid. Dacă rulez asta,

13317
10:21:15,276 --> 10:21:20,000
va fi aproape instantaneu.

13318
10:21:18,240 --> 10:21:21,840
Aproape instantaneu se antrenează.

13319
10:21:20,000 --> 10:21:23,840
Și puteți vedea aici că acum avem un

13320
10:21:21,840 --> 10:21:26,720
regresie liniară. poti vedea in asta

13321
10:21:23,840 --> 10:21:28,160
cutie mică. Hm, și asta și asta

13322
10:21:26,720 --> 10:21:30,960
informația spune că a fost

13323
10:21:28,160 --> 10:21:33,276
montat. Deci, acum este gata de utilizare,

13324
10:21:30,960 --> 10:21:36,000
nu? Deci, noi acum asta este. Noi am

13325
10:21:33,276 --> 10:21:38,640
ne-am antrenat modelul. Noi tr Asa este de usor

13326
10:21:36,000 --> 10:21:41,120
asta a fost. Ne-am potrivit. Acum, ce noi

13327
10:21:38,640 --> 10:21:44,800
ar trebui să realizeze că este mult de lucru

13328
10:21:41,120 --> 10:21:46,880
se desfășoară în culisele acestui ffit.

13329
10:21:44,800 --> 10:21:50,240
Bine, se lucrează mult

13330
10:21:46,880 --> 10:21:53,360
acolo pentru a face algoritmul celor mai mici pătrate

13331
10:21:50,240 --> 10:21:56,480
și găsiți acele greutăți și creați

13332
10:21:53,360 --> 10:21:57,840
acea linie cea mai potrivită. Corect? Deci acolo

13333
10:21:56,480 --> 10:21:59,680
se lucrează mult

13334
10:21:57,840 --> 10:22:02,160
acolo care se întâmplă acolo în spatele

13335
10:21:59,680 --> 10:22:04,640
scene, dar scikitlearn face abstractie

13336
10:22:02,160 --> 10:22:08,800
este departe pentru noi. Corect? Și tot ce avem

13337
10:22:04,640 --> 10:22:12,560
să facem este potrivit când folosim acest cod.

13338
10:22:08,800 --> 10:22:14,160
Chiar ușor. Chiar ușor. Fit. Și acolo

13339
10:22:12,560 --> 10:22:17,640
mergem. Ne-am antrenat liniarul

13340
10:22:14,160 --> 10:22:17,640
model de regresie.

13341
10:22:18,160 --> 10:22:23,120
Și apropo, dacă vrei să vezi ce

13342
10:22:20,960 --> 10:22:25,276
coeficienții sunt, poți de fapt

13343
10:22:23,120 --> 10:22:28,960
extrage-le dacă faci asta dacă iei

13344
10:22:25,276 --> 10:22:32,320
regresia ta lin și faci um

13345
10:22:28,960 --> 10:22:36,560
coeficienți ca acesta

13346
10:22:32,320 --> 10:22:39,520
coeff cu a cu subliniere. Deci asta

13347
10:22:36,560 --> 10:22:43,276
ne oferă cei instruiți

13348
10:22:39,520 --> 10:22:46,240
coeficienții de ponderi

13349
10:22:43,276 --> 10:22:48,960
cunoscut și sub denumirea de drept coeficienți.

13350
10:22:46,240 --> 10:22:53,596
Hm, deci dacă rulezi asta poți vedea uh

13351
10:22:48,960 --> 10:22:55,756
chiar acum avem acest coeficient aici

13352
10:22:53,596 --> 10:22:58,320
um care este singurul coeficient pe care l-am avut

13353
10:22:55,756 --> 10:23:02,436
pe caracteristica noastră. Deci am avut doar unul

13354
10:22:58,320 --> 10:23:02,436
coeficientul de caracteristică acolo.

13355
10:23:11,040 --> 10:23:15,160
Și putem arunca o privire la interceptarea noastră

13356
10:23:17,756 --> 10:23:23,520
care este aceasta.

13357
10:23:20,480 --> 10:23:25,840
Deci asta ne oferă greutățile trenului

13358
10:23:23,520 --> 10:23:30,000
și astfel ne putem uita la interceptarea noi

13359
10:23:25,840 --> 10:23:31,840
se poate uita la coeficientul. Hm

13360
10:23:30,000 --> 10:23:34,400
deci evident dacă avem mai multe

13361
10:23:31,840 --> 10:23:36,240
caracteristici modelul nostru are multe caracteristici

13362
10:23:34,400 --> 10:23:38,240
va avea mai multe valori în asta

13363
10:23:36,240 --> 10:23:41,680
coeficient, dar interceptarea este justă

13364
10:23:38,240 --> 10:23:45,040
valoarea unică 7,23

13365
10:23:41,680 --> 10:23:48,720
iar apoi coeficientul

13366
10:23:45,040 --> 10:23:51,720
este 0,046. Deci asta e greutatea care primește

13367
10:23:48,720 --> 10:23:51,720
învăţat.

13368
10:23:52,160 --> 10:23:57,520
Există o limită de dimensiune? Nu, nu chiar.

13369
10:23:54,240 --> 10:23:59,436
Nu există limită de dimensiune. um,

13370
10:23:57,520 --> 10:24:01,040
nu, poți folosi la fel de multe date ca tine

13371
10:23:59,436 --> 10:24:03,120
vreau.

13372
10:24:01,040 --> 10:24:07,480
Nu există într-adevăr nicio limită de dimensiune în afară de

13373
10:24:03,120 --> 10:24:07,480
ce-i place ce poti incapea in memorie.

13374
10:24:08,160 --> 10:24:11,276
Aș spune că asta este singura limită

13375
10:24:09,520 --> 10:24:14,756
practic care este cantitatea de date care

13376
10:24:11,276 --> 10:24:14,756
poate incapea in memorie.

13377
10:24:19,916 --> 10:24:23,520
Bine.

13378
10:24:22,240 --> 10:24:24,800
În regulă. Ați fost capabili să alergați

13379
10:24:23,520 --> 10:24:28,840
asta? Ați fost capabili să conduceți

13380
10:24:24,800 --> 10:24:28,840
regresie liniară ffit?

13381
10:24:28,960 --> 10:24:32,360
Bine, perfect.

13382
10:24:36,320 --> 10:24:44,480
Perfect. Ești bine, grozav. Mare.

13383
10:24:41,200 --> 10:24:46,960
Deci, avem un model și îl putem folosi

13384
10:24:44,480 --> 10:24:49,040
prezice. Hm, și asta este de fapt ceea ce

13385
10:24:46,960 --> 10:24:51,916
vom face mai departe. Dacă coborâm

13386
10:24:49,040 --> 10:24:55,360
aici, um, vom avea o funcție

13387
10:24:51,916 --> 10:24:58,960
asta va construi o diagramă de dispersie

13388
10:24:55,360 --> 10:25:01,276
din datele noastre de testare originale.

13389
10:24:58,960 --> 10:25:03,756
Deci vom avea datele noastre de testare

13390
10:25:01,276 --> 10:25:05,756
aici.

13391
10:25:03,756 --> 10:25:08,720
um,

13392
10:25:05,756 --> 10:25:10,960
iar apoi ne vom lua

13393
10:25:08,720 --> 10:25:14,480
ne vom lua datele de antrenament

13394
10:25:10,960 --> 10:25:18,560
și complot că vom folosi asta

13395
10:25:14,480 --> 10:25:20,000
date versus previziunile noastre de vânzări. Deci

13396
10:25:18,560 --> 10:25:22,480
poți vedea că mergem la tine asta este

13397
10:25:20,000 --> 10:25:25,520
cum apropo, așa folosești

13398
10:25:22,480 --> 10:25:28,080
model scikitlearn pentru a prezice. Ai o

13399
10:25:25,520 --> 10:25:29,840
apt să-l antreneze și să privească funcția

13400
10:25:28,080 --> 10:25:33,040
folositi pentru a prezice. Este la propriu doar

13401
10:25:29,840 --> 10:25:35,120
numit prezice. Așa este de ușor.

13402
10:25:33,040 --> 10:25:37,436
și transmiteți datele dvs., toate

13403
10:25:35,120 --> 10:25:40,960
caracteristici în acest prezice și ea

13404
10:25:37,436 --> 10:25:43,520
generează o predicție pentru fiecare rând. Deci

13405
10:25:40,960 --> 10:25:47,680
fiecare rând din aceste caracteristici din aceste date

13406
10:25:43,520 --> 10:25:49,916
frame um va sfârși cu o predicție

13407
10:25:47,680 --> 10:25:54,400
folosind modelul nostru. Deci la ce vom merge

13408
10:25:49,916 --> 10:25:58,000
este să ne complotăm data antrenamentului uh caracteristicile

13409
10:25:54,400 --> 10:26:01,040
față de vânzările prevăzute pentru a vedea cum

13410
10:25:58,000 --> 10:26:06,436
o potrivire bună care a fost cu adevărat.

13411
10:26:01,040 --> 10:26:06,436
Bine. pentru a vedea pentru a vedea regresia potrivită.

13412
10:26:08,880 --> 10:26:14,160
Bine. Și deci există potrivirea regresiei.

13413
10:26:12,160 --> 10:26:16,800
Avem toate datele noastre de testare aici

13414
10:26:14,160 --> 10:26:20,640
trasate în verde. Avem albastrul nostru,

13415
10:26:16,800 --> 10:26:24,400
care este um nostru, avem albastrul nostru,

13416
10:26:20,640 --> 10:26:26,560
care este linia noastră de date de antrenament

13417
10:26:24,400 --> 10:26:29,916
pe care ne-am construit modelul. Deci asta este un

13418
10:26:26,560 --> 10:26:32,240
potrivire destul de decentă. Um, și apoi testul nostru

13419
10:26:29,916 --> 10:26:34,240
datele sunt aici. Tocmai am complotat în

13420
10:26:32,240 --> 10:26:37,276
împrăștiere verde. Dar lucrul pe care te vreau

13421
10:26:34,240 --> 10:26:39,276
pentru a vedea este această predicție, nu? Noi noi

13422
10:26:37,276 --> 10:26:43,040
au putut genera unele predicții

13423
10:26:39,276 --> 10:26:44,800
pe acel antrenament um rulând nostru

13424
10:26:43,040 --> 10:26:47,120
funcția de predicție cu modelul nostru. Acum,

13425
10:26:44,800 --> 10:26:49,916
acest model a fost antrenat. Deci, am

13426
10:26:47,120 --> 10:26:51,916
se potrivește deja și acum îl folosim

13427
10:26:49,916 --> 10:26:54,400
prezice, nu? Și așa, prevăzăm

13428
10:26:51,916 --> 10:26:56,000
vânzările și complotarea că pe

13429
10:26:54,400 --> 10:26:57,840
axa y.

13430
10:26:56,000 --> 10:26:59,840
Deci, vânzările sunt noi folosim

13431
10:26:57,840 --> 10:27:04,320
vânzări prezise acolo, care este albastrul nostru

13432
10:26:59,840 --> 10:27:09,480
linie. Deci aceasta este linia noastră cea mai potrivită.

13433
10:27:04,320 --> 10:27:09,480
Deci aceasta este predicția modelului nostru.

13434
10:27:12,560 --> 10:27:17,916
Acestea sunt predicțiile modelului nostru. Corect?

13435
10:27:16,240 --> 10:27:19,840
Puteți vedea că este destul de decent

13436
10:27:17,916 --> 10:27:23,680
linie, nu? Linie destul de decentă de best

13437
10:27:19,840 --> 10:27:25,840
potrivi. Desigur, există o eroare aici

13438
10:27:23,680 --> 10:27:28,560
ca acolo, știi, nu e perfect,

13439
10:27:25,840 --> 10:27:32,276
dar face o treabă decentă de a fi un

13440
10:27:28,560 --> 10:27:32,276
linia cea mai potrivită.

13441
10:27:43,120 --> 10:27:50,400
Bine, așa că uite cât de ușor a fost

13442
10:27:47,436 --> 10:27:52,640
doar pentru a recapitula asta pentru a se potrivi cu modelul nostru a fost

13443
10:27:50,400 --> 10:27:55,120
o regresie liniară.potrivire. Si bineinteles,

13444
10:27:52,640 --> 10:27:57,596
vom face mai multe exemple. Deci nu

13445
10:27:55,120 --> 10:27:59,756
face griji pentru asta. O să vedem

13446
10:27:57,596 --> 10:28:02,080
de multe ori de multe ori pe tot parcursul

13447
10:27:59,756 --> 10:28:05,756
acest caiet. Dar avem liniară

13448
10:28:02,080 --> 10:28:08,080
regresie.apt să-l antreneze. Și apoi noi

13449
10:28:05,756 --> 10:28:10,720
au regresie liniară.predic

13450
10:28:08,080 --> 10:28:13,276
la și trecem în trăsăturile noastre și că

13451
10:28:10,720 --> 10:28:17,200
generează o ieșire estimată.

13452
10:28:13,276 --> 10:28:22,276
Corect. Deci ceea ce face asta de fapt este

13453
10:28:17,200 --> 10:28:22,276
calculează această cantitate.

13454
10:28:32,240 --> 10:28:39,200
Am putea face oricare.

13455
10:28:34,480 --> 10:28:42,560
Am putea face oricare. Um, ca să putem face,

13456
10:28:39,200 --> 10:28:44,800
deci un lucru pe care l-am putea face este să complotăm

13457
10:28:42,560 --> 10:28:46,560
l-am putea schimba. Noi, am putea face

13458
10:28:44,800 --> 10:28:48,080
fie unul. Nu, nu este mare

13459
10:28:46,560 --> 10:28:51,596
se ocupa de a face setul de antrenament. Am putea

13460
10:28:48,080 --> 10:28:56,200
faceți, astfel încât să putem trasa testul X și apoi noi

13461
10:28:51,596 --> 10:28:56,200
ar putea reprezenta un grafic de regresie liniară X test.

13462
10:29:02,560 --> 10:29:08,640
Deci este o linie similară. Hm, este

13463
10:29:06,800 --> 10:29:11,276
doar diferite caracteristici de intrare, dar

13464
10:29:08,640 --> 10:29:13,276
linia va fi aceeași. Doar

13465
10:29:11,276 --> 10:29:14,880
intrări diferite,

13466
10:29:13,276 --> 10:29:16,880
dar coeficienții sunt aceiași,

13467
10:29:14,880 --> 10:29:20,520
nu? Este aceeași linie. Suntem doar noi

13468
10:29:16,880 --> 10:29:20,520
generează rezultate diferite.

13469
10:29:22,560 --> 10:29:28,640
Deci da, ai putea face oricare dintre ele.

13470
10:29:26,080 --> 10:29:30,240
Asta este, asta este sincer asta

13471
10:29:28,640 --> 10:29:31,520
probabil mai bine. Văd ce ești

13472
10:29:30,240 --> 10:29:34,000
spunând. Acest lucru este probabil mai bine pentru că

13473
10:29:31,520 --> 10:29:36,800
aceasta este linia care se potrivește cel mai bine

13474
10:29:34,000 --> 10:29:40,480
aceste date. Deci, probabil că are sens

13475
10:29:36,800 --> 10:29:43,040
a face pentru a face prezice pe setul de testare.

13476
10:29:40,480 --> 10:29:46,276
De acord cu asta. Probabil face despre

13477
10:29:43,040 --> 10:29:46,276
cel mai bun sens.

13478
10:29:50,240 --> 10:29:54,120
Dar ai putea face oricare dintre ele.

13479
10:30:02,400 --> 10:30:05,840
Da, cred că asta ar fi cel mai mult

13480
10:30:04,160 --> 10:30:07,756
cred că este cel mai logic pentru

13481
10:30:05,840 --> 10:30:09,916
sa fie pe aceeasi doar sa

13482
10:30:07,756 --> 10:30:12,720
valida. Așa cum am putea face, am putea

13483
10:30:09,916 --> 10:30:15,200
face antrenament aici și apoi antrenează-te și

13484
10:30:12,720 --> 10:30:16,720
Antrenează-te doar pentru a vedea cum se îndreaptă acele date

13485
10:30:15,200 --> 10:30:18,560
sus.

13486
10:30:16,720 --> 10:30:20,880
Într-adevăr, ceea ce încercăm să facem este să avem

13487
10:30:18,560 --> 10:30:23,520
datele noastre împrăștiate și apoi linia noastră de

13488
10:30:20,880 --> 10:30:25,756
se potrivește cel mai bine pe aceeași parcelă. Asta-i tot

13489
10:30:23,520 --> 10:30:30,040
încercăm să facem, nu? Deci, da, eu

13490
10:30:25,756 --> 10:30:30,040
cred că ar trebui să fie la fel.

13491
10:30:30,240 --> 10:30:33,960
Cred că are sens.

13492
10:30:34,800 --> 10:30:42,040
Aceste valori

13493
10:30:37,756 --> 10:30:42,040
sau ce valori vrei sa vezi?

13494
10:30:44,080 --> 10:30:49,680
Da, am putea genera

13495
10:30:46,000 --> 10:30:53,916
alea dacă le facem, hai să coborâm

13496
10:30:49,680 --> 10:30:57,436
aici. Deci valorile liniei

13497
10:30:53,916 --> 10:31:03,120
um vor fi uh predicția.

13498
10:30:57,436 --> 10:31:05,360
Deci, um testul uh

13499
10:31:03,120 --> 10:31:09,640
previziuni

13500
10:31:05,360 --> 10:31:09,640
este egal cu um

13501
10:31:10,320 --> 10:31:14,480
predicțiile testului sunt egale cu liniar

13502
10:31:12,000 --> 10:31:17,756
regresie.predicti testul x si apoi noi

13503
10:31:14,480 --> 10:31:20,756
am putea imprima testul

13504
10:31:17,756 --> 10:31:20,756
previziuni.

13505
10:31:21,276 --> 10:31:27,520
Da. Deci, putem vedea care sunt cele reale

13506
10:31:23,200 --> 10:31:30,520
valorile sunt pe setul de testare.

13507
10:31:27,520 --> 10:31:30,520
Da.

13508
10:31:37,840 --> 10:31:41,120
Um, asta vom face. Da. Deci, tu

13509
10:31:39,916 --> 10:31:43,040
credeam că verificăm cât de bine

13510
10:31:41,120 --> 10:31:44,880
datele au fost instruite. Vom face asta. Da.

13511
10:31:43,040 --> 10:31:46,720
Nu am învățat cum să evaluăm asta

13512
10:31:44,880 --> 10:31:49,596
încă. Vom vorbi despre asta

13513
10:31:46,720 --> 10:31:51,200
urmand. Da. Vom face asta.

13514
10:31:49,596 --> 10:31:53,200
Doar că nu am învățat cum să facem cum trebuie

13515
10:31:51,200 --> 10:31:55,916
evaluarea

13516
10:31:53,200 --> 10:31:57,360
a unui model de regresie.

13517
10:31:55,916 --> 10:31:59,596
Dar da, este ceva ce vom face

13518
10:31:57,360 --> 10:32:03,960
vorbesc despre sigur

13519
10:31:59,596 --> 10:32:03,960
și vezi cum să faci în codul nostru.

13520
10:32:06,320 --> 10:32:09,320
Bine.

13521
10:32:09,680 --> 10:32:15,320
În regulă. Orice alte întrebări despre

13522
10:32:12,000 --> 10:32:15,320
acest exemplu?

13523
10:32:18,960 --> 10:32:26,240
Din nou mari la pachet

13524
10:32:21,840 --> 10:32:28,320
apt să-l antreneze și apoi să prezice să-l folosească

13525
10:32:26,240 --> 10:32:31,520
ea

13526
10:32:28,320 --> 10:32:35,960
preziceți asupra caracteristicilor pentru a utiliza modelul

13527
10:32:31,520 --> 10:32:35,960
și faceți predicții cu el.

13528
10:32:36,000 --> 10:32:39,756
Deci, iată un exemplu pe care l-am făcut pe toate

13529
10:32:38,480 --> 10:32:42,240
previziuni. Acestea sunt toate

13530
10:32:39,756 --> 10:32:44,000
valorile care se află pe acea linie.

13531
10:32:42,240 --> 10:32:45,840
Acestea sunt toate previziunile și notificările noastre

13532
10:32:44,000 --> 10:32:48,720
ei aceasta este o regresie cu adevărat, nu?

13533
10:32:45,840 --> 10:32:50,800
Toate acestea sunt valori flotante. um,

13534
10:32:48,720 --> 10:32:53,800
deci aceasta este cu siguranță o regresie,

13535
10:32:50,800 --> 10:32:53,800
nu?

13536
10:33:02,880 --> 10:33:05,880
Bine.

13537
10:33:10,640 --> 10:33:18,480
E o întrebare bună. um,

13538
10:33:14,560 --> 10:33:22,200
Nu sunt sigur dacă există

13539
10:33:18,480 --> 10:33:22,200
Dacă există ca un verboz

13540
10:33:22,960 --> 10:33:26,720
nu există cu adevărat, nu există cu adevărat

13541
10:33:24,960 --> 10:33:28,400
un verboz la care poți, vreau să spun că te poți uita

13542
10:33:26,720 --> 10:33:31,360
codul sursă dacă chiar vrei

13543
10:33:28,400 --> 10:33:34,560
vezi, poți vedea codul sursă pentru a vedea

13544
10:33:31,360 --> 10:33:37,360
um cum s-a făcut, pot să vă spun, vreau să spun

13545
10:33:34,560 --> 10:33:40,960
deci în general se face regresia liniară

13546
10:33:37,360 --> 10:33:44,400
în două moduri fie folosești o formulă um

13547
10:33:40,960 --> 10:33:47,596
pentru a rezolva problema de optimizare a

13548
10:33:44,400 --> 10:33:51,840
minimizând astfel această distanță de

13549
10:33:47,596 --> 10:33:53,756
punctele către linie. um,

13550
10:33:51,840 --> 10:33:55,596
sau folosești ceva numit gradient

13551
10:33:53,756 --> 10:33:59,120
coborâre, care este cât de multe dintre acestea

13552
10:33:55,596 --> 10:34:00,720
lucrurile fac asta este ei repetă prin a

13553
10:33:59,120 --> 10:34:04,560
o grămadă de iterații diferite în care acestea

13554
10:34:00,720 --> 10:34:08,400
actualizați aceste ponderi conform um a

13555
10:34:04,560 --> 10:34:10,800
anumite uh practic un gradient al

13556
10:34:08,400 --> 10:34:13,040
funcția de eroare. Funcția de eroare

13557
10:34:10,800 --> 10:34:19,040
în acest caz este pătratul

13558
10:34:13,040 --> 10:34:20,960
distanta de la linie la uh to to

13559
10:34:19,040 --> 10:34:23,756
punctele.

13560
10:34:20,960 --> 10:34:26,160
Deci putem calcula gradientul de

13561
10:34:23,756 --> 10:34:28,000
asta și faceți o coborâre în gradient. Deci dacă

13562
10:34:26,160 --> 10:34:30,160
chiar vrei să te uiți la asta, aș vrea

13563
10:34:28,000 --> 10:34:32,960
faceți câteva cercetări pe liniare similară

13564
10:34:30,160 --> 10:34:35,040
coborâre a gradientului de regresie.

13565
10:34:32,960 --> 10:34:37,680
Bine, coborâre gradient de regresie liniară

13566
10:34:35,040 --> 10:34:41,360
să văd cum e așa

13567
10:34:37,680 --> 10:34:45,200
gata. Da, este destul de simplu

13568
10:34:41,360 --> 10:34:48,480
procedura. Hm, din nou, ai

13569
10:34:45,200 --> 10:34:52,480
ideea este că doriți să minimizați

13570
10:34:48,480 --> 10:34:54,320
minimizați pierderea sau eroarea. Uh, în

13571
10:34:52,480 --> 10:34:58,320
în acest caz, pierderea este pătratul

13572
10:34:54,320 --> 10:35:01,040
distanta. Deci, e ca și cum ar fi

13573
10:34:58,320 --> 10:35:04,080
a este o formulă. Este ca o sumă de a

13574
10:35:01,040 --> 10:35:07,840
distanță pătrată față de predicția dvs

13575
10:35:04,080 --> 10:35:13,520
um sau eticheta ta imi pare rau pentru modelul tau

13576
10:35:07,840 --> 10:35:16,480
care este beta 0 um plus beta 1 x1

13577
10:35:13,520 --> 10:35:19,596
plus beta 2 x2

13578
10:35:16,480 --> 10:35:21,276
etc ca modelul tău și apoi pătrat. Deci

13579
10:35:19,596 --> 10:35:24,560
acest pătrat acesta este pătratul

13580
10:35:21,276 --> 10:35:27,276
distanță aici și minimizați acest lucru

13581
10:35:24,560 --> 10:35:30,160
tip care este ca o problemă de calcul.

13582
10:35:27,276 --> 10:35:32,160
Găsești că practic găsești asta

13583
10:35:30,160 --> 10:35:34,000
este asta am ajuns atât de departe în

13584
10:35:32,160 --> 10:35:37,200
buruieni de asta, dar aceasta este ca o

13585
10:35:34,000 --> 10:35:39,200
parabolă și tu mergi cum vrei Nu, nu,

13586
10:35:37,200 --> 10:35:42,320
esti bun. Este un bun

13587
10:35:39,200 --> 10:35:44,560
întrebare. Um, mergi până la

13588
10:35:42,320 --> 10:35:46,480
minimul acestuia. Are sens?

13589
10:35:44,560 --> 10:35:48,560
De parcă ai fi făcut drumul aici jos

13590
10:35:46,480 --> 10:35:51,680
și faci asta printr-o coborâre

13591
10:35:48,560 --> 10:35:53,276
proces, ca o iterație de coborâre.

13592
10:35:51,680 --> 10:35:54,880
Hm

13593
10:35:53,276 --> 10:35:57,120
deci

13594
10:35:54,880 --> 10:36:01,120
asa se gasesc astea.

13595
10:35:57,120 --> 10:36:02,800
Hm, dar nu vezi că se întâmplă asta în

13596
10:36:01,120 --> 10:36:04,320
fundalul. Dar dacă te uiți la

13597
10:36:02,800 --> 10:36:06,080
cod sursă, vă garantez că ar fi

13598
10:36:04,320 --> 10:36:07,916
fie că va fi asta sau

13599
10:36:06,080 --> 10:36:11,276
ei vor folosi ei merg

13600
10:36:07,916 --> 10:36:16,840
pentru a utiliza o formulă a a matricei pentru a practic

13601
10:36:11,276 --> 10:36:16,840
rezolvați o ecuație um care implică acest lucru

13602
10:36:17,120 --> 10:36:22,000
practic derivata acestei multimi

13603
10:36:19,120 --> 10:36:23,596
egal cu zero și găsești minimul.

13604
10:36:22,000 --> 10:36:26,756
Oricum, găsești minimul

13605
10:36:23,596 --> 10:36:26,756
din aceasta.

13606
10:36:28,960 --> 10:36:34,800
Bine. Dar da, nu cred că Psycharn

13607
10:36:31,916 --> 10:36:38,560
are ca un uh poate există un fel de

13608
10:36:34,800 --> 10:36:40,960
steag verbor pe care îl puteți căuta.

13609
10:36:38,560 --> 10:36:44,360
Nu cred că au așa ceva. Nu

13610
10:36:40,960 --> 10:36:44,360
pe care l-am văzut.

13611
10:36:51,200 --> 10:36:57,200
În regulă.

13612
10:36:53,040 --> 10:37:00,320
Deci am un concept important

13613
10:36:57,200 --> 10:37:03,120
vorbește despre următoarea care va fi uh

13614
10:37:00,320 --> 10:37:05,680
numite supraajustare și subadaptare

13615
10:37:03,120 --> 10:37:08,640
um, care este un concept cu adevărat important

13616
10:37:05,680 --> 10:37:11,120
asta este legat de antrenament și test

13617
10:37:08,640 --> 10:37:13,276
date pe care tocmai le împărțim pentru a le face

13618
10:37:11,120 --> 10:37:16,480
evaluarea.

13619
10:37:13,276 --> 10:37:18,160
Și, în esență, problema cu

13620
10:37:16,480 --> 10:37:20,640
învățarea automată este că nu este

13621
10:37:18,160 --> 10:37:23,276
perfect și se poate lupta în diferite

13622
10:37:20,640 --> 10:37:24,960
moduri. Și cele două moduri în care în primul rând

13623
10:37:23,276 --> 10:37:28,880
luptele va fi supraadaptată și

13624
10:37:24,960 --> 10:37:33,120
submontare. Deci supraajustarea este o

13625
10:37:28,880 --> 10:37:36,800
situație în care modelul practic

13626
10:37:33,120 --> 10:37:40,000
memorează atât de bine datele de antrenament încât

13627
10:37:36,800 --> 10:37:41,916
este că nu reușește să generalizeze la nou

13628
10:37:40,000 --> 10:37:45,200
exemple. Deci cu ce vedem

13629
10:37:41,916 --> 10:37:47,276
supraadaptarea este exact acest semn aici

13630
10:37:45,200 --> 10:37:49,200
unde avem performanțe foarte bune

13631
10:37:47,276 --> 10:37:51,680
datele de antrenament. Așa că atunci când da, când o facem

13632
10:37:49,200 --> 10:37:56,560
acea împărțire a testului de tren vedem o cu adevărat

13633
10:37:51,680 --> 10:38:00,080
precizie bună sau eroare foarte mică pe

13634
10:37:56,560 --> 10:38:02,400
date de antrenament dar nu funcționează

13635
10:38:00,080 --> 10:38:05,436
oriunde aproape de cea din acele date de testare

13636
10:38:02,400 --> 10:38:08,160
despicat. Deci ceea ce înseamnă este că

13637
10:38:05,436 --> 10:38:11,360
modelul este supraadaptat la antrenament

13638
10:38:08,160 --> 10:38:15,916
date. practic este să-l memoreze și

13639
10:38:11,360 --> 10:38:18,800
nu se poate generaliza prea bine.

13640
10:38:15,916 --> 10:38:21,200
Acum, de ce se întâmplă asta? De obicei este

13641
10:38:18,800 --> 10:38:24,720
deoarece modelul este mult prea complex.

13642
10:38:21,200 --> 10:38:27,756
Și asta înseamnă că, în general, trebuie să faci

13643
10:38:24,720 --> 10:38:30,720
ceva care să reducă complexitatea.

13644
10:38:27,756 --> 10:38:32,720
Fie trebuie să utilizați un model mai simplu

13645
10:38:30,720 --> 10:38:35,040
sau trebuie să utilizați un tip de

13646
10:38:32,720 --> 10:38:37,200
tehnică de atenuare a supraadaptarii. Şi

13647
10:38:35,040 --> 10:38:38,720
vom studia câteva

13648
10:38:37,200 --> 10:38:40,720
din acele tehnici care apar în aceasta

13649
10:38:38,720 --> 10:38:42,640
caietul. S-ar putea să nu ajungem la asta

13650
10:38:40,720 --> 10:38:44,400
azi, dar vom studia

13651
10:38:42,640 --> 10:38:46,160
în special ce putem face pentru a preveni

13652
10:38:44,400 --> 10:38:48,320
supraajustarea deoarece supraadaptarea este

13653
10:38:46,160 --> 10:38:52,080
problemă mai frecventă cu învățarea automată

13654
10:38:48,320 --> 10:38:54,560
modele. Au tendința să se descurce atât de bine la

13655
10:38:52,080 --> 10:38:57,200
învăţând din datele pe care le preiau

13656
10:38:54,560 --> 10:38:58,800
mici detalii și modele în

13657
10:38:57,200 --> 10:39:01,756
exemple de antrenament pe care le sunt expuse

13658
10:38:58,800 --> 10:39:03,840
la. Ei nu fac o treabă grozavă la

13659
10:39:01,756 --> 10:39:06,080
generalizarea la noi exemple. pot

13660
10:39:03,840 --> 10:39:09,120
lupta cu asta. Deci asta e

13661
10:39:06,080 --> 10:39:11,120
supraajustarea se chinuie să se generalizeze

13662
10:39:09,120 --> 10:39:13,360
la exemple noi, dar te descurci foarte bine

13663
10:39:11,120 --> 10:39:16,080
pe datele dvs. de antrenament. Deci se pare

13664
10:39:13,360 --> 10:39:17,916
parca ai avea un model bun, dar asa este

13665
10:39:16,080 --> 10:39:20,400
incapabil să meargă și să facă predicții despre

13666
10:39:17,916 --> 10:39:21,756
date de testare foarte bine, ceea ce înseamnă că noi

13667
10:39:20,400 --> 10:39:24,160
nu ar dori să folosească acel model în

13668
10:39:21,756 --> 10:39:26,240
lumea reală, nu? Pentru că nu este capabil

13669
10:39:24,160 --> 10:39:28,000
a generaliza în afara a ceea ce este

13670
10:39:26,240 --> 10:39:29,840
deja văzut. Și asta nu e bine

13671
10:39:28,000 --> 10:39:32,320
lucru dacă încercăm să-l folosim cu adevărat

13672
10:39:29,840 --> 10:39:35,916
exemple din lume, nu?

13673
10:39:32,320 --> 10:39:37,756
Deci supraadaptarea este o problemă reală. Um tu

13674
10:39:35,916 --> 10:39:39,520
vezi tot timpul. Am văzut-o multe

13675
10:39:37,756 --> 10:39:42,720
de multe ori în lumea reală, reală

13676
10:39:39,520 --> 10:39:44,880
industria uh munca pe care am făcut-o.

13677
10:39:42,720 --> 10:39:46,800
Suprafitting este o provocare pentru a

13678
10:39:44,880 --> 10:39:49,520
multe modele de învățare automată. Și așa

13679
10:39:46,800 --> 10:39:51,040
avem nevoie de niște tehnici de depășit

13680
10:39:49,520 --> 10:39:55,040
supraadaptare și mergem să studiem

13681
10:39:51,040 --> 10:39:58,880
unele dintre ele vor apărea în curând.

13682
10:39:55,040 --> 10:40:00,640
Unul dintre lucrurile pe care le putem face,

13683
10:39:58,880 --> 10:40:03,520
unul dintre lucrurile pe care le putem

13684
10:40:00,640 --> 10:40:06,640
face pentru a detecta supraadaptarea este exact ceea ce

13685
10:40:03,520 --> 10:40:08,720
tocmai am făcut-o, adică te-ai despărțit

13686
10:40:06,640 --> 10:40:10,240
datele dvs. în instruire și testare astfel

13687
10:40:08,720 --> 10:40:12,320
că ai șansa să faci o

13688
10:40:10,240 --> 10:40:14,400
evaluare pentru a vedea dacă ești egal

13689
10:40:12,320 --> 10:40:17,840
supraadaptarea în primul rând. Tu vrei

13690
10:40:14,400 --> 10:40:20,320
pentru a vedea că performanța este consistentă

13691
10:40:17,840 --> 10:40:22,480
de la tren la test, nu? Tu vrei

13692
10:40:20,320 --> 10:40:25,276
vezi consistenta. Ceea ce nu vrei

13693
10:40:22,480 --> 10:40:28,000
vezi este performanța care scade pe

13694
10:40:25,276 --> 10:40:30,080
date de testare. E mult mai rău. Tu nu

13695
10:40:28,000 --> 10:40:32,800
vreau sa vad asta. Asta înseamnă că dvs

13696
10:40:30,080 --> 10:40:34,480
modelul este supraadaptat la antrenamentul tău

13697
10:40:32,800 --> 10:40:37,120
date și nu va funcționa bine

13698
10:40:34,480 --> 10:40:38,720
în lumea reală.

13699
10:40:37,120 --> 10:40:42,080
Bine. Deci, vom avea un cuplu

13700
10:40:38,720 --> 10:40:45,360
modalități de a depăși asta. Vorbește despre

13701
10:40:42,080 --> 10:40:47,120
că. Acum, opusul poate de fapt

13702
10:40:45,360 --> 10:40:48,640
se întâmplă și, care se numește

13703
10:40:47,120 --> 10:40:50,560
submontare.

13704
10:40:48,640 --> 10:40:53,756
Și subadaptare

13705
10:40:50,560 --> 10:40:57,040
se referă la faptul că un model este de asemenea

13706
10:40:53,756 --> 10:40:59,840
simplu și de fapt pur și simplu funcționează

13707
10:40:57,040 --> 10:41:04,000
prost peste tot. Deci dacă vedem

13708
10:40:59,840 --> 10:41:06,800
performanţă slabă la antrenament şi

13709
10:41:04,000 --> 10:41:10,320
date de testare, acesta este un semnal bun că

13710
10:41:06,800 --> 10:41:12,400
modelul nu este potrivit și asta înseamnă că este

13711
10:41:10,320 --> 10:41:15,276
prea simplu de obicei și ar trebui să încerci

13712
10:41:12,400 --> 10:41:17,680
folosind ceva mai complex. Hm, deci

13713
10:41:15,276 --> 10:41:21,276
cel mai bun mod de a combate subadaptarea este să

13714
10:41:17,680 --> 10:41:23,756
utilizați un model mai complex. Și pe măsură ce mergem

13715
10:41:21,276 --> 10:41:24,880
prin și să învețe despre modele,

13716
10:41:23,756 --> 10:41:26,800
vom afla despre care dintre ele

13717
10:41:24,880 --> 10:41:29,360
sunt simple și care sunt complexe.

13718
10:41:26,800 --> 10:41:31,680
Deci vom avea o scară de fel

13719
10:41:29,360 --> 10:41:33,436
de complexitate. Și dacă ești

13720
10:41:31,680 --> 10:41:36,080
underfitting, vrei să treci până la

13721
10:41:33,436 --> 10:41:38,320
la un model mai complex. Dacă ești dacă

13722
10:41:36,080 --> 10:41:40,240
ești supraadaptat, un mod de a lupta

13723
10:41:38,320 --> 10:41:42,640
adică să cobori de fapt la ceva

13724
10:41:40,240 --> 10:41:44,720
mai simplu. Mergi pe sens invers

13725
10:41:42,640 --> 10:41:46,000
ceva mai simplu. Deci trebuie să învățăm

13726
10:41:44,720 --> 10:41:47,596
acum am învățat doar liniar

13727
10:41:46,000 --> 10:41:49,840
regresie

13728
10:41:47,596 --> 10:41:52,480
dar vom învăța și alte modele pe care le cunoașteți

13729
10:41:49,840 --> 10:41:53,916
în viitor și despre care vom vorbi

13730
10:41:52,480 --> 10:41:56,160
uh complexitatea lor și cum sunt

13731
10:41:53,916 --> 10:41:58,640
legate între ele.

13732
10:41:56,160 --> 10:42:01,276
Bine, dar acestea sunt două probleme pe care le vedem

13733
10:41:58,640 --> 10:42:03,120
doar pentru a scoate asta din nou este dacă noi

13734
10:42:01,276 --> 10:42:06,240
avem o divizare de test de tren acolo unde avem

13735
10:42:03,120 --> 10:42:08,880
7030 split să spunem și facem

13736
10:42:06,240 --> 10:42:11,596
foarte bine aici, dar mergem să aplicăm

13737
10:42:08,880 --> 10:42:14,080
acel model de aici și nu reușește este

13738
10:42:11,596 --> 10:42:15,916
precizia scade semnificativ mai mult

13739
10:42:14,080 --> 10:42:20,320
eroare asta e cu siguranta

13740
10:42:15,916 --> 10:42:22,800
supraadaptare care nu este bună

13741
10:42:20,320 --> 10:42:24,720
corect și apoi underfitting pur și simplu nu este

13742
10:42:22,800 --> 10:42:26,400
performând bine în ambele cazuri deci chiar

13743
10:42:24,720 --> 10:42:28,400
pe datele de antrenament în sine

13744
10:42:26,400 --> 10:42:31,276
acuratețea ta nu este foarte bună. Deci

13745
10:42:28,400 --> 10:42:34,800
nu înveți cu adevărat eficient.

13746
10:42:31,276 --> 10:42:40,040
Nu-ți adaptezi modelul. Deci

13747
10:42:34,800 --> 10:42:40,040
asta e cazul nepotrivit.

13748
10:42:41,756 --> 10:42:44,756
Bine.

13749
10:42:46,720 --> 10:42:52,160
În regulă. Acum problema este că se poate

13750
10:42:49,520 --> 10:42:53,756
fi foarte dificil să echilibrezi aceste două

13751
10:42:52,160 --> 10:42:54,880
si corecteaza-l. Asta face

13752
10:42:53,756 --> 10:42:57,756
un pic de învățare automată

13753
10:42:54,880 --> 10:43:01,200
provocator este obținerea acestui echilibru

13754
10:42:57,756 --> 10:43:03,436
corect de simplitate și complexitate. Deci

13755
10:43:01,200 --> 10:43:05,436
nu vrei să fii prea complex

13756
10:43:03,436 --> 10:43:08,640
te antrenezi prea mult, dar nu vrei să fii

13757
10:43:05,436 --> 10:43:11,276
exagerat de simplu că nu te potrivești și

13758
10:43:08,640 --> 10:43:12,960
nu ești capabil să înveți eficient. Deci

13759
10:43:11,276 --> 10:43:14,960
există un pic de compromis acolo. Şi

13760
10:43:12,960 --> 10:43:18,240
acest compromis este de obicei cunoscut în

13761
10:43:14,960 --> 10:43:20,960
comunitatea ca schimb de variație de părtinire. Hm

13762
10:43:18,240 --> 10:43:22,880
în acest caz, e practic ca o

13763
10:43:20,960 --> 10:43:25,916
complexitate simplitate compromis. Este

13764
10:43:22,880 --> 10:43:30,400
un alt cuvânt pentru asta. um,

13765
10:43:25,916 --> 10:43:35,360
și așa, uh, se crede că, um,

13766
10:43:30,400 --> 10:43:36,640
dacă tu, uh, dacă ai foarte, um, dacă tu

13767
10:43:35,360 --> 10:43:39,200
ai o situație în care poți

13768
10:43:36,640 --> 10:43:42,000
se potrivesc foarte bine cu datele de antrenament, tu

13769
10:43:39,200 --> 10:43:44,240
riscul de a nu putea generaliza. În

13770
10:43:42,000 --> 10:43:48,160
cu alte cuvinte, riști să te supraajustezi și

13771
10:43:44,240 --> 10:43:53,200
e greu de um, e greu de combatut

13772
10:43:48,160 --> 10:43:54,720
că într-un fel. Um, și um, pe

13773
10:43:53,200 --> 10:43:58,080
reversul, dacă ai ceva

13774
10:43:54,720 --> 10:44:00,640
foarte simplu, um, riști să nu înveți

13775
10:43:58,080 --> 10:44:03,520
suficient. Chiar dacă încerci să lupți

13776
10:44:00,640 --> 10:44:05,040
acea supraadaptare, riști să nu înveți

13777
10:44:03,520 --> 10:44:07,596
suficient și modelul tău pur și simplu nu

13778
10:44:05,040 --> 10:44:09,756
performează cât de bine ar putea. So, there's

13779
10:44:07,596 --> 10:44:11,596
un pic de compromis acolo de a încerca

13780
10:44:09,756 --> 10:44:14,400
găsi echilibrul potrivit între ceva

13781
10:44:11,596 --> 10:44:17,916
destul de complex pentru a învăța, dar ceva

13782
10:44:14,400 --> 10:44:21,360
nu prea complex pentru care va fi

13783
10:44:17,916 --> 10:44:24,880
nu generalizați la date noi. Asta este

13784
10:44:21,360 --> 10:44:28,160
provocare. Cum am spus, mergem

13785
10:44:24,880 --> 10:44:30,480
să aibă tehnici pentru a depăși acest lucru. Deci

13786
10:44:28,160 --> 10:44:34,960
din fericire, există lucruri de practic

13787
10:44:30,480 --> 10:44:36,960
depășește acest compromis și um și ajută

13788
10:44:34,960 --> 10:44:38,560
noi pe parcurs ca să nu facem

13789
10:44:36,960 --> 10:44:40,080
supraadaptare. Ele practic previn

13790
10:44:38,560 --> 10:44:42,880
supraadaptare

13791
10:44:40,080 --> 10:44:47,436
și permiteți-ne să folosim suficient de complex

13792
10:44:42,880 --> 10:44:51,756
modele um că asta nu va fi supraadaptat.

13793
10:44:47,436 --> 10:44:54,160
Acesta este în um, asta a fost în uh-ul nostru

13794
10:44:51,756 --> 10:44:55,436
caietul lecția 3.2. Deci vrei să tragi

13795
10:44:54,160 --> 10:44:56,960
ăla înapoi. Lucram la

13796
10:44:55,436 --> 10:44:59,840
luni.

13797
10:44:56,960 --> 10:45:02,080
Um, și doar ca să recapitulez puțin,

13798
10:44:59,840 --> 10:45:04,640
amintiți-vă că construiam un liniar

13799
10:45:02,080 --> 10:45:08,080
regresie, am vrut să recapitulez câteva dintre ele

13800
10:45:04,640 --> 10:45:10,080
pașii pe care i-am făcut acolo, um, că noi

13801
10:45:08,080 --> 10:45:12,960
va face din nou și din nou. Şi

13802
10:45:10,080 --> 10:45:15,520
într-adevăr același tip de pași, uh, că

13803
10:45:12,960 --> 10:45:17,276
facem aici, vom face în multe dintre noi

13804
10:45:15,520 --> 10:45:19,360
construirea de modele. Aproape toate ale noastre

13805
10:45:17,276 --> 10:45:21,200
construirea de modele, asta facem, fie

13806
10:45:19,360 --> 10:45:23,840
este regresie sau clasificare,

13807
10:45:21,200 --> 10:45:27,520
chiar nu conteaza. um tot vom fi

13808
10:45:23,840 --> 10:45:29,520
făcând mulți dintre acești pași care sunt um

13809
10:45:27,520 --> 10:45:33,520
amintiți-vă mai întâi că ne-am împărțit datele

13810
10:45:29,520 --> 10:45:36,080
într-un fel de caracteristici și etichetă

13811
10:45:33,520 --> 10:45:39,040
uh x și y și motivul asta

13812
10:45:36,080 --> 10:45:43,040
important este pentru că um modelul

13813
10:45:39,040 --> 10:45:46,080
antrenamentul folosește caracteristicile și eticheta

13814
10:45:43,040 --> 10:45:48,960
pentru a ajuta la antrenarea modelului corect

13815
10:45:46,080 --> 10:45:50,960
le folosim separat, așa că vrem

13816
10:45:48,960 --> 10:45:53,360
împărțiți-i pe aceștia de câte ori putem și așa

13817
10:45:50,960 --> 10:45:56,400
de obicei, este o practică bună

13818
10:45:53,360 --> 10:45:59,840
pentru a numi caracteristicile tale capitală X și ta

13819
10:45:56,400 --> 10:46:02,960
etichetează cu minuscul Y. Și cu ce facem

13820
10:45:59,840 --> 10:46:05,040
adică amintiți-vă că ne-am despărțit imediat

13821
10:46:02,960 --> 10:46:07,916
că în ceea ce am numit un antrenament și

13822
10:46:05,040 --> 10:46:11,756
un set de testare. Și poza pe care o aveam pentru

13823
10:46:07,916 --> 10:46:15,756
a fost ceva de genul asta

13824
10:46:11,756 --> 10:46:18,480
unde aveam aproximativ 70% din date

13825
10:46:15,756 --> 10:46:21,596
obișnuiam să antrenăm modelul împotriva și

13826
10:46:18,480 --> 10:46:24,240
apoi celelalte 30% din datele pe care le folosim

13827
10:46:21,596 --> 10:46:27,040
testați modelul împotriva. Adică noi

13828
10:46:24,240 --> 10:46:30,160
construiește un model aici și îl aplicăm

13829
10:46:27,040 --> 10:46:32,560
la acest set de aici um să fac

13830
10:46:30,160 --> 10:46:33,916
previziuni. Și apoi acolo este

13831
10:46:32,560 --> 10:46:37,120
învățarea supravegheată chiar vine

13832
10:46:33,916 --> 10:46:39,596
în joc, nu? este pe acest set de testare.

13833
10:46:37,120 --> 10:46:41,756
Avem deja răspunsurile. Noi deja

13834
10:46:39,596 --> 10:46:44,320
au eticheta. Și astfel ne putem aplica

13835
10:46:41,756 --> 10:46:47,276
model la aceasta la caracteristicile de aici.

13836
10:46:44,320 --> 10:46:50,240
Prezice care ar trebui să fie eticheta

13837
10:46:47,276 --> 10:46:53,200
si compara asta. Putem obține o metrică,

13838
10:46:50,240 --> 10:46:56,480
corect, asta compară cât de aproape suntem

13839
10:46:53,200 --> 10:46:58,240
predicția noastră la valorile reale. Hm

13840
10:46:56,480 --> 10:47:00,560
și asta a fost o parte din performanța noastră

13841
10:46:58,240 --> 10:47:02,640
metrici. O să recapitulez câteva dintre acestea

13842
10:47:00,560 --> 10:47:05,520
un fel de măsurare a acelei distanțe

13843
10:47:02,640 --> 10:47:09,200
predicțiile noastre la ceea ce eticheta reală

13844
10:47:05,520 --> 10:47:12,080
este. Hm, dar amintește-ți că aveam acest tren

13845
10:47:09,200 --> 10:47:15,520
funcția de testare a împărțirii, care ne ajută să divizăm

13846
10:47:12,080 --> 10:47:18,320
în afară de caracteristicile și etichetele noastre

13847
10:47:15,520 --> 10:47:20,400
aceste patru seturi de date. Deci avem

13848
10:47:18,320 --> 10:47:22,400
caracteristicile noastre de antrenament, testarea noastră

13849
10:47:20,400 --> 10:47:24,880
funcțiile și apoi etichetele noastre de antrenament

13850
10:47:22,400 --> 10:47:27,756
și etichetele noastre de testare. Deci avem pe toate

13851
10:47:24,880 --> 10:47:30,480
dintre aceștia și chiar acești doi tipi

13852
10:47:27,756 --> 10:47:32,080
vor fi folosite pentru a antrena modelul.

13853
10:47:30,480 --> 10:47:33,520
De aceea se numesc subliniere

13854
10:47:32,080 --> 10:47:35,840
tren. Vor fi folosiți pentru antrenament

13855
10:47:33,520 --> 10:47:39,120
acel model și apoi mergem

13856
10:47:35,840 --> 10:47:41,360
pentru a prezice asupra acestor set de caracteristici și

13857
10:47:39,120 --> 10:47:44,320
atunci com folosește acele predicții pentru a

13858
10:47:41,360 --> 10:47:47,596
comparați corect cu acest set de etichete

13859
10:47:44,320 --> 10:47:50,800
asta e pe setul de testare. Hm și tu

13860
10:47:47,596 --> 10:47:52,880
observați aici dimensiunea testului nostru este setată la 30%.

13861
10:47:50,800 --> 10:47:54,960
E un număr destul de standard.

13862
10:47:52,880 --> 10:47:57,680
Oriunde între 20 și 30% este

13863
10:47:54,960 --> 10:48:00,960
destul de standard. Um, de obicei

13864
10:47:57,680 --> 10:48:04,000
use.3, dar ar putea fi 02. Oriunde în

13865
10:48:00,960 --> 10:48:06,960
intre e bine.

13866
10:48:04,000 --> 10:48:09,360
Bine, deci am avut asta. Să sperăm că uh

13867
10:48:06,960 --> 10:48:11,680
ne amintim că de luni.

13868
10:48:09,360 --> 10:48:13,436
Deci am avut un tren și un set de testare. Şi

13869
10:48:11,680 --> 10:48:15,200
atunci construirea modelului a fost de fapt

13870
10:48:13,436 --> 10:48:17,596
chiar foarte usor. Odată ce le ai

13871
10:48:15,200 --> 10:48:20,720
tren și seturi de testare, um, doar importăm

13872
10:48:17,596 --> 10:48:22,560
obiectul nostru model. Deci de la uh scikitlearn

13873
10:48:20,720 --> 10:48:25,756
sklearn

13874
10:48:22,560 --> 10:48:27,840
um model liniar uh modul de la asta

13875
10:48:25,756 --> 10:48:31,120
pachetul importăm regresia liniară

13876
10:48:27,840 --> 10:48:32,640
model și apoi facem um liniar

13877
10:48:31,120 --> 10:48:34,560
regresie.potrivire

13878
10:48:32,640 --> 10:48:37,436
și trecem în trăsăturile noastre și ale noastre

13879
10:48:34,560 --> 10:48:38,720
etichete și aici este din nou aici

13880
10:48:37,436 --> 10:48:41,276
că învățarea supravegheată este într-adevăr

13881
10:48:38,720 --> 10:48:43,436
intrând în joc pentru că trecem

13882
10:48:41,276 --> 10:48:44,720
în aceste etichete.

13883
10:48:43,436 --> 10:48:46,400
Acesta este cu adevărat ceea ce face ca acest lucru să funcționeze,

13884
10:48:44,720 --> 10:48:48,880
nu? Avem nevoie de acele etichete pentru a ajuta

13885
10:48:46,400 --> 10:48:51,840
ghidați modelul pentru a face acele actualizări.

13886
10:48:48,880 --> 10:48:55,800
Dacă vă amintiți, modelul este

13887
10:48:51,840 --> 10:48:55,800
ceva care arată așa.

13888
10:48:57,680 --> 10:49:01,840
Deci, acesta a fost o grămadă de diferite

13889
10:49:00,000 --> 10:49:04,720
coeficienți

13890
10:49:01,840 --> 10:49:09,276
um ori caracteristicile,

13891
10:49:04,720 --> 10:49:11,680
oricat de multi avem. Hm, și deci acestea

13892
10:49:09,276 --> 10:49:15,916
etichetele iau cu adevărat locul

13893
10:49:11,680 --> 10:49:17,840
asta și ne ajută să facem

13894
10:49:15,916 --> 10:49:20,000
actualizări corecte ale acestora la acestea

13895
10:49:17,840 --> 10:49:25,520
coeficienți sau uneori îi numim

13896
10:49:20,000 --> 10:49:27,436
greutăți. Hm, aceste B 0, B1, B2. Hm, noi

13897
10:49:25,520 --> 10:49:29,596
afla care este cea optimă pentru a obține

13898
10:49:27,436 --> 10:49:33,520
cea mai potrivită, nu? Pentru a obține linia de

13899
10:49:29,596 --> 10:49:35,596
cel mai potrivit. Um, asta este modelul

13900
10:49:33,520 --> 10:49:36,960
antrenament atunci când numim acest lucru potrivire. Asta e

13901
10:49:35,596 --> 10:49:38,800
cu adevărat ce face în fundal

13902
10:49:36,960 --> 10:49:40,720
este găsirea tuturor acelor coeficienți,

13903
10:49:38,800 --> 10:49:45,320
corect, pentru a ajunge la linia celor mai buni

13904
10:49:40,720 --> 10:49:45,320
potrivire care are cea mai mică eroare.

13905
10:49:46,080 --> 10:49:51,276
Bine, așa că sperăm că are sens.

13906
10:49:48,000 --> 10:49:53,840
E doar o potrivire pentru a ne antrena

13907
10:49:51,276 --> 10:49:56,080
modele. Și asta chiar va fi um

13908
10:49:53,840 --> 10:49:59,120
cazul pentru

13909
10:49:56,080 --> 10:50:01,840
cam fiecare model

13910
10:49:59,120 --> 10:50:03,840
ne antrenăm cu scikitlearn. Este

13911
10:50:01,840 --> 10:50:06,000
aproape va fi o potrivire. trecem

13912
10:50:03,840 --> 10:50:09,240
în antrenamentul nostru uh caracteristicile și noastre

13913
10:50:06,000 --> 10:50:09,240
etichete de antrenament.

13914
10:50:09,680 --> 10:50:14,800
Bine, deci am avut asta și asta a fost

13915
10:50:12,480 --> 10:50:17,200
vizualizarea aceluia în care aveam noi

13916
10:50:14,800 --> 10:50:19,040
punctele de testare cam împrăștiate și vedem

13917
10:50:17,200 --> 10:50:21,756
linia noastră cea mai potrivită este cea care

13918
10:50:19,040 --> 10:50:25,120
trece prin acolo cu acel minim

13919
10:50:21,756 --> 10:50:29,000
eroare. Acesta este tot scopul.

13920
10:50:25,120 --> 10:50:29,000
Predictor destul de decent.

13921
10:50:30,800 --> 10:50:34,800
Bine. Și apoi am vorbit despre

13922
10:50:32,960 --> 10:50:37,040
supraadaptare, subadaptare. Deci doar să

13923
10:50:34,800 --> 10:50:39,436
recapitulați acest lucru, conceptul este supraadaptarea

13924
10:50:37,040 --> 10:50:41,436
a modelului nostru practic memorând noastre

13925
10:50:39,436 --> 10:50:44,160
date de antrenament. Funcționează foarte bine

13926
10:50:41,436 --> 10:50:47,040
pe acel set de antrenament, dar nu este capabil

13927
10:50:44,160 --> 10:50:49,756
a generaliza în afara asta. Deci

13928
10:50:47,040 --> 10:50:52,800
funcţionează slab la setul de testare sau datele

13929
10:50:49,756 --> 10:50:56,000
că nu s-a mai văzut niciodată. Hm, și

13930
10:50:52,800 --> 10:50:58,240
asta e supraadaptare. Deci motivul pentru care

13931
10:50:56,000 --> 10:51:01,840
se supraajustează este în general modelul este

13932
10:50:58,240 --> 10:51:04,640
prea complex și trebuie să fie

13933
10:51:01,840 --> 10:51:06,400
trebuie simplificat putin. Și unul dintre

13934
10:51:04,640 --> 10:51:08,640
lucrurile pe care le vom face astăzi sunt

13935
10:51:06,400 --> 10:51:11,680
vedem câteva moduri în care putem modifica

13936
10:51:08,640 --> 10:51:15,276
model de regresie liniară um dacă suntem

13937
10:51:11,680 --> 10:51:17,276
supramontare pentru a preveni supraadaptarea. Hm

13938
10:51:15,276 --> 10:51:19,840
așa că vor exista modalități de a gestiona

13939
10:51:17,276 --> 10:51:22,240
aceasta. Um și așa vom explora

13940
10:51:19,840 --> 10:51:24,080
unii dintre cei de azi.

13941
10:51:22,240 --> 10:51:26,000
Uh, underfitting este cam invers

13942
10:51:24,080 --> 10:51:27,596
de aceea. Amintiți-vă că acolo este modelul

13943
10:51:26,000 --> 10:51:29,756
nu învață suficient. Deci

13944
10:51:27,596 --> 10:51:32,320
performanța este slabă chiar și la antrenament

13945
10:51:29,756 --> 10:51:35,840
date. Nu e bine cu datele de testare

13946
10:51:32,320 --> 10:51:38,000
fie. Hm, acesta este un semn că modelul

13947
10:51:35,840 --> 10:51:40,240
este probabil prea simplu și poate noi

13948
10:51:38,000 --> 10:51:42,400
ar trebui să folosească ceva mai complex, cum ar fi

13949
10:51:40,240 --> 10:51:45,520
trece de la o regresie liniară poate folosi a

13950
10:51:42,400 --> 10:51:48,160
regresie polomială. Um sau poate folosi un

13951
10:51:45,520 --> 10:51:49,756
cu totul alt model. um,

13952
10:51:48,160 --> 10:51:52,000
dacă suntem subadaptați, performanța noastră

13953
10:51:49,756 --> 10:51:55,916
este slab, este un semnal bun

13954
10:51:52,000 --> 10:51:57,680
incearca altceva. um,

13955
10:51:55,916 --> 10:52:01,040
bine.

13956
10:51:57,680 --> 10:52:02,880
Deci, am vorbit despre acestea

13957
10:52:01,040 --> 10:52:05,436
și unul dintre lucrurile pe care le-am vorbit și noi

13958
10:52:02,880 --> 10:52:07,040
despre a fost evaluări. Dacă voi băieți

13959
10:52:05,436 --> 10:52:10,320
Amintiți-vă, am avut diferite valori care

13960
10:52:07,040 --> 10:52:12,640
am putea calcula pentru a obține un indicator al cum

13961
10:52:10,320 --> 10:52:15,200
bine modelul nostru este de fapt performant.

13962
10:52:12,640 --> 10:52:17,756
Um, unul dintre aceștia a fost MSE, care este acesta

13963
10:52:15,200 --> 10:52:19,756
funcția de eroare medie pătrată. Hm, deci noi

13964
10:52:17,756 --> 10:52:24,720
a făcut acest exemplu în timpul orei ultima dată

13965
10:52:19,756 --> 10:52:27,840
Luni, unde am putut

13966
10:52:24,720 --> 10:52:29,756
generează eroarea pătratică medie. Asta e

13967
10:52:27,840 --> 10:52:32,000
una dintre valorile noastre. Și putem vedea ce

13968
10:52:29,756 --> 10:52:33,596
eroarea pătratică medie este pe

13969
10:52:32,000 --> 10:52:37,040
set de antrenament și vezi ce este pe

13970
10:52:33,596 --> 10:52:38,880
test stabilit de um tocmai ce trece în um

13971
10:52:37,040 --> 10:52:41,360
previziunile de antrenament și antrenamentul nostru

13972
10:52:38,880 --> 10:52:43,436
etichetele, predicțiile noastre de testare și

13973
10:52:41,360 --> 10:52:45,596
etichete de testare. trece-le în acest mijloc

13974
10:52:43,436 --> 10:52:47,756
funcția de eroare pătrat și calculează

13975
10:52:45,596 --> 10:52:50,880
MSE și asta este un ajutor

13976
10:52:47,756 --> 10:52:55,840
funcția din metrica scikitlearn

13977
10:52:50,880 --> 10:52:58,640
um pachet um sau modul ar trebui să spun și

13978
10:52:55,840 --> 10:53:00,880
vom folosi asta destul de mult pentru a face

13979
10:52:58,640 --> 10:53:02,560
știi evaluarea de mai ales a

13980
10:53:00,880 --> 10:53:06,000
regresie dreapta medie pătrată eroare este

13981
10:53:02,560 --> 10:53:08,320
drăguță este probabil cea mai comună uh

13982
10:53:06,000 --> 10:53:10,080
metrica de performanță putem avea și dacă

13983
10:53:08,320 --> 10:53:12,320
Vă amintiți ce face cu adevărat

13984
10:53:10,080 --> 10:53:13,756
este măsurarea acestor distanțe

13985
10:53:12,320 --> 10:53:16,400
eroarea pătrată este un fel ca

13986
10:53:13,756 --> 10:53:19,756
distanta medie de la noi

13987
10:53:16,400 --> 10:53:21,916
indică um real la

13988
10:53:19,756 --> 10:53:25,120
predicții care sunt predicțiile

13989
10:53:21,916 --> 10:53:27,436
toate pe această linie. Um deci parcă

13990
10:53:25,120 --> 10:53:30,160
măsurând în medie câtă eroare

13991
10:53:27,436 --> 10:53:33,680
avem in medie nu? Hm, și

13992
10:53:30,160 --> 10:53:35,680
ideea este cu cât mai aproape de zero, cu atât mai bine.

13993
10:53:33,680 --> 10:53:37,840
În general, înseamnă că distanța

13994
10:53:35,680 --> 10:53:40,160
de la predicția noastră până la punctele noastre este

13995
10:53:37,840 --> 10:53:43,040
destul de jos. Cu cât este mai aproape de zero.

13996
10:53:40,160 --> 10:53:45,360
Hm, ceea ce este destul de dezirabil.

13997
10:53:43,040 --> 10:53:47,840
Deci un MSE scăzut este cam ceea ce suntem

13998
10:53:45,360 --> 10:53:51,840
cautand. Um, mai aproape de zero

13999
10:53:47,840 --> 10:53:56,560
mai bine. Și așa, um, dacă un model are dacă

14000
10:53:51,840 --> 10:53:58,560
un model are un MSE mai mic decât

14001
10:53:56,560 --> 10:54:02,596
alta, este o performanță mai bună

14002
10:53:58,560 --> 10:54:02,596
model, nu? Are mai puține erori.

14003
10:54:02,720 --> 10:54:08,880
Bine. Și apoi ne-am uitat și la R R

14004
10:54:05,596 --> 10:54:12,720
pătrat sau uneori cunoscut ca R2 um

14005
10:54:08,880 --> 10:54:15,120
scor. Aceasta este o altă măsurătoare pe care noi

14006
10:54:12,720 --> 10:54:16,720
ar putea folosi că măsoară

14007
10:54:15,120 --> 10:54:21,120
variabilitate

14008
10:54:16,720 --> 10:54:23,520
um de uh previziunile și dacă noastre

14009
10:54:21,120 --> 10:54:27,276
modelul surprinde acea variabilitate

14010
10:54:23,520 --> 10:54:29,916
Ei bine, um și deci R squ are un interval de 0

14011
10:54:27,276 --> 10:54:32,640
la unul este mai bine, asta înseamnă

14012
10:54:29,916 --> 10:54:36,160
modelul surprinde schimbările în în

14013
10:54:32,640 --> 10:54:38,720
ieșirea um um predicțiile noastre

14014
10:54:36,160 --> 10:54:41,840
urmează aceleași schimbări

14015
10:54:38,720 --> 10:54:45,120
deci sunt destul de aproape, atât de aproape

14016
10:54:41,840 --> 10:54:47,116
unul ar fi un scor mai bun. Deci avem

14017
10:54:45,120 --> 10:54:50,640
genul ăsta de metrici. Deci ca pe asta

14018
10:54:47,116 --> 10:54:52,560
date um acest lucru ar arăta că

14019
10:54:50,640 --> 10:54:54,480
acest model nu a fost potrivit

14020
10:54:52,560 --> 10:54:58,240
deoarece aceasta

14021
10:54:54,480 --> 10:54:59,840
înseamnă că acest MSE a fost rău și acest MSE a fost

14022
10:54:58,240 --> 10:55:02,800
rău.

14023
10:54:59,840 --> 10:55:06,880
Hm și ce ar trebui să ne gândim despre acestea

14024
10:55:02,800 --> 10:55:08,960
unitățile a ceea ce sunt etichetele noastre. um

14025
10:55:06,880 --> 10:55:11,276
mai ales dacă luăm rădăcina pătrată a

14026
10:55:08,960 --> 10:55:14,320
acesta este RMSSE care a fost o altă măsurătoare

14027
10:55:11,276 --> 10:55:17,756
am avut um rădăcina pătrată a acesteia este

14028
10:55:14,320 --> 10:55:20,800
de fapt în unitățile exacte pe care noi um

14029
10:55:17,756 --> 10:55:24,720
au pentru etichetele noastre. Deci în asta

14030
10:55:20,800 --> 10:55:27,596
exemplu, acesta a fost um, acesta a fost

14031
10:55:24,720 --> 10:55:31,360
unități sau vânzări față de televizor

14032
10:55:27,596 --> 10:55:33,360
produse, nu? Um și așa ar fi

14033
10:55:31,360 --> 10:55:35,916
indică faptul că, în medie, dacă luăm

14034
10:55:33,360 --> 10:55:40,560
rădăcina pătrată a acestui um

14035
10:55:35,916 --> 10:55:44,080
în rădăcina pătrată a acestui um avem uh

14036
10:55:40,560 --> 10:55:45,916
Suntem în medie aproximativ 11 unități de vânzare

14037
10:55:44,080 --> 10:55:47,756
off pătrat. Deci dacă luăm pătratul

14038
10:55:45,916 --> 10:55:51,116
Roo of that um, este undeva pe la 3

14039
10:55:47,756 --> 10:55:54,960
la patru um undeva între trei

14040
10:55:51,116 --> 10:55:57,596
și patru unități oprite. Și asta este la fel.

14041
10:55:54,960 --> 10:55:59,756
Hm, și pentru că ambele sunt încă

14042
10:55:57,596 --> 10:56:02,480
nu aproape de zero, asta ar fi

14043
10:55:59,756 --> 10:56:04,160
sub potrivire. Și asta arată și asta.

14044
10:56:02,480 --> 10:56:06,960
Acesta nu este atât de aproape de unul. Este

14045
10:56:04,160 --> 10:56:08,720
decent, dar nu e atât de aproape

14046
10:56:06,960 --> 10:56:11,360
la unul. Deci, am spune, și

14047
10:56:08,720 --> 10:56:13,680
performanţa este slabă atât la antrenament cât şi

14048
10:56:11,360 --> 10:56:18,680
seturi de testare. Acesta este indicatorul cheie al

14049
10:56:13,680 --> 10:56:18,680
submontare. E slab la ambele.

14050
10:56:20,960 --> 10:56:25,756
Da, exact. MSE ridicat se corelează cu

14051
10:56:23,276 --> 10:56:29,916
submontare. Da. Da. Și ce este

14052
10:56:25,756 --> 10:56:33,116
cheia este că este MSE mare pe ambele

14053
10:56:29,916 --> 10:56:35,436
antrenament și seturile de testare.

14054
10:56:33,116 --> 10:56:37,680
Dacă aveți un MSE mare pe setul dvs. de testare

14055
10:56:35,436 --> 10:56:40,640
dar un MSE scăzut pe setul tău de antrenament,

14056
10:56:37,680 --> 10:56:42,720
e supraadaptat, nu? Unde este

14057
10:56:40,640 --> 10:56:44,800
negeneralizand din setul de antrenament

14058
10:56:42,720 --> 10:56:47,276
la datele de testare pe care nu le-a văzut

14059
10:56:44,800 --> 10:56:52,040
înainte. Asta e supraadaptare. Deci cheia

14060
10:56:47,276 --> 10:56:52,040
este MSE mare pe ambele seturi.

14061
10:56:52,880 --> 10:56:58,480
În regulă. Deci am vorbit despre asta. Hm

14062
10:56:55,436 --> 10:57:02,000
am făcut regresia polomială data trecută. Deci

14063
10:56:58,480 --> 10:57:06,560
asta făcea eu

14064
10:57:02,000 --> 10:57:08,480
asta făcea un grafic curbat

14065
10:57:06,560 --> 10:57:09,680
transformând trăsăturile în polomial

14066
10:57:08,480 --> 10:57:11,040
caracteristici și apoi făcând liniar

14067
10:57:09,680 --> 10:57:14,320
regresie cu asta. Deci voi băieți

14068
10:57:11,040 --> 10:57:17,756
aminteste-ti de luni am facut asta unde

14069
10:57:14,320 --> 10:57:19,276
ne-am luat trăsăturile și uh

14070
10:57:17,756 --> 10:57:22,000
le-a transformat după aceasta

14071
10:57:19,276 --> 10:57:23,680
caracteristici polomiale de la scikitlearn. Deci

14072
10:57:22,000 --> 10:57:25,436
putem merge până la grad

14073
10:57:23,680 --> 10:57:26,800
orice grad ne dorim. Așa că am băgat

14074
10:57:25,436 --> 10:57:28,560
patru aici, dar nu e nimic special

14075
10:57:26,800 --> 10:57:31,596
vreo patru într-adevăr. Aceasta este doar o testare

14076
10:57:28,560 --> 10:57:34,400
ea afară. um și generăm

14077
10:57:31,596 --> 10:57:36,560
trăsături polomiale și ne putem potrivi a

14078
10:57:34,400 --> 10:57:39,360
regresie liniară asupra celor polomiale

14079
10:57:36,560 --> 10:57:42,560
caracteristici și obținem un pic mai bun

14080
10:57:39,360 --> 10:57:43,916
model, nu? Hm, se potrivește cu datele a

14081
10:57:42,560 --> 10:57:48,080
puțin mai bine decât o chintă

14082
10:57:43,916 --> 10:57:49,840
linie. Această linie curbată cu polomiul

14083
10:57:48,080 --> 10:57:51,520
caracteristici um funcționează puțin mai bine

14084
10:57:49,840 --> 10:57:53,276
și am putut vedea că cu MSE,

14085
10:57:51,520 --> 10:57:57,436
nu? sau am putea evalua MSE de

14086
10:57:53,276 --> 10:57:58,880
asta um și ar fi mai jos.

14087
10:57:57,436 --> 10:58:01,840
Ar fi mai jos decât linia curbă.

14088
10:57:58,880 --> 10:58:03,916
Și asta e ceva ce am putea face. Hm

14089
10:58:01,840 --> 10:58:05,200
ar trebui doar să trecem aceste teste

14090
10:58:03,916 --> 10:58:07,916
previziunile, previziunile de antrenament

14091
10:58:05,200 --> 10:58:09,360
și apoi etichetele de testare și

14092
10:58:07,916 --> 10:58:10,720
etichetele de antrenament și treceți-le în

14093
10:58:09,360 --> 10:58:12,800
funcția de eroare medie pătrată și am putea

14094
10:58:10,720 --> 10:58:15,800
calculează asta, nu? Nu ar fi greu

14095
10:58:12,800 --> 10:58:15,800
face.

14096
10:58:16,720 --> 10:58:21,840
În regulă. Și apoi, în sfârșit, unde suntem

14097
10:58:18,320 --> 10:58:23,276
a lăsat um știi că este pe nostru

14098
10:58:21,840 --> 10:58:25,360
metrici de performanță. Deci am vorbit despre

14099
10:58:23,276 --> 10:58:28,480
eroare pătrată medie. Asta e media

14100
10:58:25,360 --> 10:58:31,040
distanta de la etichete la noi

14101
10:58:28,480 --> 10:58:33,200
previziuni. Hm și luăm pătratul

14102
10:58:31,040 --> 10:58:35,040
rădăcina asta. Este practic

14103
10:58:33,200 --> 10:58:37,436
măsurând același lucru, dar este

14104
10:58:35,040 --> 10:58:38,880
rădăcina pătrată a acestuia este um mai mult

14105
10:58:37,436 --> 10:58:41,680
interpretabil pentru că este în același

14106
10:58:38,880 --> 10:58:45,276
unități ca etichetă noastră.

14107
10:58:41,680 --> 10:58:47,116
um eroare absolută medie este este media

14108
10:58:45,276 --> 10:58:49,596
distanța valorii absolute. Deci este

14109
10:58:47,116 --> 10:58:52,320
nu formula distanței la pătrat ca a

14110
10:58:49,596 --> 10:58:54,800
distanța uklidiană dar este un absolut

14111
10:58:52,320 --> 10:58:56,400
valoare. Deci este un pic mai puțin

14112
10:58:54,800 --> 10:59:00,880
sensibile la valori aberante. Ei nu primesc

14113
10:58:56,400 --> 10:59:03,756
mărită la fel de mult. Hm, dar nu este

14114
10:59:00,880 --> 10:59:05,756
folosit de obicei la fel de mult ca un pătrat mediu

14115
10:59:03,756 --> 10:59:08,160
eroarea ar fi cu regresie. um noi

14116
10:59:05,756 --> 10:59:11,276
am vorbit despre ultima dată pentru că um

14117
10:59:08,160 --> 10:59:13,436
formula distanței sau acea distanță este

14118
10:59:11,276 --> 10:59:17,200
de fapt ce este folosit pentru a antrena modelul.

14119
10:59:13,436 --> 10:59:21,320
Deci, este o potrivire mai naturală pentru a

14120
10:59:17,200 --> 10:59:21,320
metrica de performanță pentru aceasta.

14121
10:59:22,240 --> 10:59:25,200
În regulă. Și apoi am avut R pătrat. Noi

14122
10:59:23,520 --> 10:59:28,080
tocmai am vorbit despre asta mai aproape de zero

14123
10:59:25,200 --> 10:59:30,400
ar fi mai rău. Mai aproape de unul ar fi

14124
10:59:28,080 --> 10:59:33,436
fii mai bun. Asta înseamnă că modelul

14125
10:59:30,400 --> 10:59:36,640
explică um toată variabilitatea în

14126
10:59:33,436 --> 10:59:41,040
în previziuni. Uh le surprinde pe acelea

14127
10:59:36,640 --> 10:59:46,240
predicțiile sunt aproape de etichete

14128
10:59:41,040 --> 10:59:49,520
um foarte bine. Deci unul ar fi mai bine.

14129
10:59:46,240 --> 10:59:51,520
Mai aproape de unul ar fi mai bine.

14130
10:59:49,520 --> 10:59:53,756
În regulă. Deci de aici am plecat.

14131
10:59:51,520 --> 10:59:56,000
O să luăm de acolo cu

14132
10:59:53,756 --> 10:59:58,000
validare încrucișată. um, de fapt

14133
10:59:56,000 --> 11:00:00,320
am văzut deja o metodă de cruce

14134
10:59:58,000 --> 11:00:01,756
validare. Deci vom studia

14135
11:00:00,320 --> 11:00:04,400
o să recapitulăm într-un fel și

14136
11:00:01,756 --> 11:00:08,080
și apoi vorbim despre validarea încrucișată

14137
11:00:04,400 --> 11:00:10,880
în general um și uită-te la unele mai multe

14138
11:00:08,080 --> 11:00:13,520
tehnici sofisticate ale ei um vin

14139
11:00:10,880 --> 11:00:16,160
mai departe. Dar înainte să fac asta, orice

14140
11:00:13,520 --> 11:00:19,360
întrebări despre orice am acoperit

14141
11:00:16,160 --> 11:00:22,080
um până în acest punct în recapitulare sau

14142
11:00:19,360 --> 11:00:24,640
ceva de luni? Orice întrebări despre

14143
11:00:22,080 --> 11:00:27,520
asta?

14144
11:00:24,640 --> 11:00:32,160
În regulă. Deci hai să vorbim despre cruce

14145
11:00:27,520 --> 11:00:36,240
validare. Hm acum acest termen cruce

14146
11:00:32,160 --> 11:00:39,436
validarea se referă la o tehnică care

14147
11:00:36,240 --> 11:00:43,116
evaluează performanța. Și ce face

14148
11:00:39,436 --> 11:00:45,436
este împarte datele noastre în esență

14149
11:00:43,116 --> 11:00:47,436
um seturi de antrenament și de testare pe care le avem

14150
11:00:45,436 --> 11:00:50,240
cam văzut deja. Și atunci suntem

14151
11:00:47,436 --> 11:00:52,560
capabil să antreneze un model cu privire la antrenament

14152
11:00:50,240 --> 11:00:53,840
set, evaluați-l pe setul de testare. Şi

14153
11:00:52,560 --> 11:00:56,400
de acolo obținem

14154
11:00:53,840 --> 11:00:58,320
validarea încrucișată a numelui pentru că suntem

14155
11:00:56,400 --> 11:01:01,520
trecerea peste modelul nostru dintr-un singur lot

14156
11:00:58,320 --> 11:01:03,436
de date folosite pentru a-l antrena către altul

14157
11:01:01,520 --> 11:01:06,800
set de date utilizate pentru validarea acestora

14158
11:01:03,436 --> 11:01:08,720
previziuni. Um, și există de fapt

14159
11:01:06,800 --> 11:01:10,240
moduri diferite de a face validarea încrucișată.

14160
11:01:08,720 --> 11:01:12,080
Deci validarea încrucișată este un pic

14161
11:01:10,240 --> 11:01:14,160
termen umbrelă pentru mai multe moduri de a face

14162
11:01:12,080 --> 11:01:16,560
că. Am văzut deja o modalitate de

14163
11:01:14,160 --> 11:01:21,116
făcând asta pe care o voi derula

14164
11:01:16,560 --> 11:01:23,596
până la este cunoscută sub numele de cruce

14165
11:01:21,116 --> 11:01:26,320
validare. Deci asta am fost

14166
11:01:23,596 --> 11:01:30,000
făcând până acum. Deci asta este doar um

14167
11:01:26,320 --> 11:01:33,200
generând un tren și un set de testare

14168
11:01:30,000 --> 11:01:36,320
antrenează-te.

14169
11:01:33,200 --> 11:01:39,520
Hm, asta e ceea ce este cunoscut sub numele de

14170
11:01:36,320 --> 11:01:41,360
menține metoda de validare încrucișată. Hm și

14171
11:01:39,520 --> 11:01:43,840
și asta este exact ceea ce am fost

14172
11:01:41,360 --> 11:01:46,480
faceți până acum, care este vă împărțiți

14173
11:01:43,840 --> 11:01:48,160
date într-un anumit tip de împărțire, de obicei

14174
11:01:46,480 --> 11:01:51,116
7030,

14175
11:01:48,160 --> 11:01:54,160
un tren și un test

14176
11:01:51,116 --> 11:01:56,800
și apoi um um antrena modelul dvs. despre asta

14177
11:01:54,160 --> 11:01:59,680
secțiunea de date și apoi aplicați-o

14178
11:01:56,800 --> 11:02:01,436
asta pentru a evalua performanța. Corect? Deci

14179
11:01:59,680 --> 11:02:06,400
asta e ceea ce se numește hold

14180
11:02:01,436 --> 11:02:08,880
metoda out. Uh, e uh, știi

14181
11:02:06,400 --> 11:02:13,200
relativ simplu. Este destul de rapid să

14182
11:02:08,880 --> 11:02:16,000
face. Hm, dar există modalități mai robuste

14183
11:02:13,200 --> 11:02:19,116
să încercăm să ne împărțim puțin datele

14184
11:02:16,000 --> 11:02:21,200
ceva mai uniform. În loc de doar

14185
11:02:19,116 --> 11:02:24,720
având o divizare, chiar putem face

14186
11:02:21,200 --> 11:02:26,160
multe împărțiri, care este ideea um the

14187
11:02:24,720 --> 11:02:29,276
următorul tip de validare încrucișată o voi face

14188
11:02:26,160 --> 11:02:30,880
acoperire. Dar metoda rezistă este una care

14189
11:02:29,276 --> 11:02:33,116
noi deja am studiat. Este cel mai mult

14190
11:02:30,880 --> 11:02:36,560
tip de bază de validare încrucișată pe care o puteți

14191
11:02:33,116 --> 11:02:38,240
au. Așa că ține, asta este cel mai mult

14192
11:02:36,560 --> 11:02:41,200
de bază

14193
11:02:38,240 --> 11:02:46,320
și noi am fost deja am fost deja

14194
11:02:41,200 --> 11:02:48,000
am lucrat cu acest tip. Bine.

14195
11:02:46,320 --> 11:02:51,520
Deci am văzut deja rezistând

14196
11:02:48,000 --> 11:02:53,276
metoda. Lasă-mă să-ți explic mai multe

14197
11:02:51,520 --> 11:02:56,080
metodă sofisticată un pic mai mult

14198
11:02:53,276 --> 11:02:59,520
avansat de o validare încrucișată um care

14199
11:02:56,080 --> 11:03:02,160
este cunoscută ca validare încrucișată Kfold. Deci

14200
11:02:59,520 --> 11:03:04,960
asta va fi un pic mai mult

14201
11:03:02,160 --> 11:03:07,596
avansat de o tehnică, dar acesta este

14202
11:03:04,960 --> 11:03:09,116
ideea de kfold este că îți iei datele

14203
11:03:07,596 --> 11:03:14,240
set

14204
11:03:09,116 --> 11:03:17,200
și îl împărțiți în k număr de ce

14205
11:03:14,240 --> 11:03:19,040
se numesc despicaturi sau pliuri. Deci iei

14206
11:03:17,200 --> 11:03:22,160
datele tale și să zicem că a fost let's

14207
11:03:19,040 --> 11:03:25,160
spunem k este 5. Deci avem cinci împărțiri

14208
11:03:22,160 --> 11:03:25,160
aici.

14209
11:03:25,360 --> 11:03:33,040
Bine. Deci, să presupunem că k este egal cu 5. Avem

14210
11:03:28,000 --> 11:03:35,276
cinci despărțiri. Deci ce vom face

14211
11:03:33,040 --> 11:03:39,200
o să ne antrenăm

14212
11:03:35,276 --> 11:03:42,320
modelul nostru pe K minus unul dintre acele pliuri.

14213
11:03:39,200 --> 11:03:44,720
Deci, dacă K avea cinci, aveam cinci împărțiri.

14214
11:03:42,320 --> 11:03:48,160
Ne vom lua modelul și ne vom antrena

14215
11:03:44,720 --> 11:03:52,240
pe patru din cinci dintre acestea uh

14216
11:03:48,160 --> 11:03:56,436
despica. Deci, să spunem că sunt acești patru.

14217
11:03:52,240 --> 11:03:56,436
Îl vom antrena pe aceste patru.

14218
11:03:56,800 --> 11:04:03,040
Bine. Și atunci ceea ce facem este acela

14219
11:03:59,840 --> 11:04:05,436
despărțire care a mai rămas, vom face

14220
11:04:03,040 --> 11:04:10,000
testați modelul nostru împotriva acelei diviziuni. Deci

14221
11:04:05,436 --> 11:04:12,640
vom testa aici.

14222
11:04:10,000 --> 11:04:14,160
Bine. Acum, asta sună foarte asemănător cu

14223
11:04:12,640 --> 11:04:16,560
metoda hold out în care facem a

14224
11:04:14,160 --> 11:04:18,640
Proba trenului împărțit, dar este puțin

14225
11:04:16,560 --> 11:04:20,560
această validare încrucișată kful puțin

14226
11:04:18,640 --> 11:04:23,436
mai sofisticat pentru că repetăm

14227
11:04:20,560 --> 11:04:25,840
acest proces pe care tocmai l-am menționat

14228
11:04:23,436 --> 11:04:28,560
și peste pentru toate combinațiile de

14229
11:04:25,840 --> 11:04:33,040
despica. Deci, ce vom face, asta este

14230
11:04:28,560 --> 11:04:36,320
doar o încercare că o vom face din nou,

14231
11:04:33,040 --> 11:04:39,276
dar de data asta vom alege patru

14232
11:04:36,320 --> 11:04:41,276
despărțiri diferite. Deci, de data aceasta am putea

14233
11:04:39,276 --> 11:04:44,000
alege,

14234
11:04:41,276 --> 11:04:47,596
lasă-mă să fac albastru. De data asta s-ar putea să alegem

14235
11:04:44,000 --> 11:04:49,680
acesta, acesta,

14236
11:04:47,596 --> 11:04:51,840
um,

14237
11:04:49,680 --> 11:04:55,116
acesta,

14238
11:04:51,840 --> 11:04:57,360
iar acesta.

14239
11:04:55,116 --> 11:04:59,680
Și apoi cei patru îi vom antrena pe noștri

14240
11:04:57,360 --> 11:05:02,800
date despre. Și apoi vom testa împotriva

14241
11:04:59,680 --> 11:05:05,520
acesta. Bine. Și vom face, vom face

14242
11:05:02,800 --> 11:05:12,360
repeta asta

14243
11:05:05,520 --> 11:05:12,360
repetați pentru toate combinațiile de pliuri.

14244
11:05:15,680 --> 11:05:19,680
Bine. Așa că vom repeta asta. Deci

14245
11:05:17,916 --> 11:05:22,000
în esență, ceea ce facem este să ne rotim

14246
11:05:19,680 --> 11:05:23,840
prin. De fiecare dată când ne întoarcem

14247
11:05:22,000 --> 11:05:27,436
unul dintre pliuri va fi lăsat afară

14248
11:05:23,840 --> 11:05:29,360
ca set de testare. Acum asta e un pic

14249
11:05:27,436 --> 11:05:32,560
mai robust decât un simplu test de tren

14250
11:05:29,360 --> 11:05:35,436
împărțit, nu? pentru că expunem

14251
11:05:32,560 --> 11:05:37,116
modelul nostru la mai multe date din în

14252
11:05:35,436 --> 11:05:39,916
fac asta, nu? Pentru că mergem

14253
11:05:37,116 --> 11:05:42,080
pentru a o împărți uniform în cinci sau 10

14254
11:05:39,916 --> 11:05:45,680
despica. Acestea sunt destul de comune um

14255
11:05:42,080 --> 11:05:47,520
numărul de pliuri de utilizat. 10 sau cinci. Hm

14256
11:05:45,680 --> 11:05:52,160
acestea sunt cele pe care le am cel mai frecvent

14257
11:05:47,520 --> 11:05:53,756
văzut. Hm, dar o vom face prin rotire

14258
11:05:52,160 --> 11:05:56,160
prin care se folosesc pliuri pentru

14259
11:05:53,756 --> 11:05:59,116
antrenament, care fiind omise. um

14260
11:05:56,160 --> 11:06:00,880
ne expunem modelul nostru la mai multe

14261
11:05:59,116 --> 11:06:04,160
datele în acest fel decât doar a face a

14262
11:06:00,880 --> 11:06:07,040
divizarea testului unui singur tren. Corect? Deci acum

14263
11:06:04,160 --> 11:06:10,240
ce facem cu rezultatele este

14264
11:06:07,040 --> 11:06:12,400
de fiecare dată când facem asta, generăm um

14265
11:06:10,240 --> 11:06:14,240
un MSE să spunem sau un fel de

14266
11:06:12,400 --> 11:06:17,520
metrica de performanță. Deci să spunem noi

14267
11:06:14,240 --> 11:06:20,560
generați un MSE de la acest tip

14268
11:06:17,520 --> 11:06:24,240
generăm un MSE din această versiune și

14269
11:06:20,560 --> 11:06:27,200
generăm un MSE pentru toate combo-urile.

14270
11:06:24,240 --> 11:06:30,160
fiecare combo generăm MSE și apoi ce

14271
11:06:27,200 --> 11:06:33,520
facem este medie

14272
11:06:30,160 --> 11:06:36,160
metricile

14273
11:06:33,520 --> 11:06:39,040
sau în acest caz uh dacă folosim MSE noi

14274
11:06:36,160 --> 11:06:41,116
le-ar media pe cei împreună. Deci fiecare

14275
11:06:39,040 --> 11:06:42,960
timp facem o combinatie fold si noi

14276
11:06:41,116 --> 11:06:45,040
păstrați patru dintre ei pentru antrenament, unul pentru

14277
11:06:42,960 --> 11:06:47,276
testăm și ne rotim prin toate acestea

14278
11:06:45,040 --> 11:06:50,480
combinații, vom genera

14279
11:06:47,276 --> 11:06:52,000
un MSE pentru fiecare combinație

14280
11:06:50,480 --> 11:06:56,800
atunci vom face doar o medie a acestora

14281
11:06:52,000 --> 11:07:00,400
MSSE pentru a obține o finală. Deci MSE final

14282
11:06:56,800 --> 11:07:03,520
de cruce val a acestui K-fold.

14283
11:07:00,400 --> 11:07:06,800
Deci metrica finală

14284
11:07:03,520 --> 11:07:08,560
este doar media uh

14285
11:07:06,800 --> 11:07:12,160
performanță pe toate pliurile

14286
11:07:08,560 --> 11:07:14,080
combinatii. Bine. Deci finalul nostru MSE, noi

14287
11:07:12,160 --> 11:07:16,720
doar media tuturor celor MSE din toate

14288
11:07:14,080 --> 11:07:18,560
combinațiile noastre.

14289
11:07:16,720 --> 11:07:21,116
Bine.

14290
11:07:18,560 --> 11:07:24,560
Acum, care este avantajul de a face asta?

14291
11:07:21,116 --> 11:07:26,800
Este mult mai robustă ca o estimare a

14292
11:07:24,560 --> 11:07:29,116
a performanței modelului

14293
11:07:26,800 --> 11:07:31,436
pentru că o expunem tuturor

14294
11:07:29,116 --> 11:07:32,800
practic toate datele noastre, nu? Suntem

14295
11:07:31,436 --> 11:07:35,840
a avea o idee a modului în care funcționează

14296
11:07:32,800 --> 11:07:37,916
peste toate aceste pliuri diferite. Hm

14297
11:07:35,840 --> 11:07:40,240
mai degrabă decât să faci un singur tren

14298
11:07:37,916 --> 11:07:42,880
diviziunea de testare, care este puțin de bază,

14299
11:07:40,240 --> 11:07:46,000
funcționează, dar e puțin de bază. Um asa

14300
11:07:42,880 --> 11:07:47,840
aceasta este o estimare mai robustă a

14301
11:07:46,000 --> 11:07:50,160
performanta.

14302
11:07:47,840 --> 11:07:52,240
Acum, care este dezavantajul să faci asta

14303
11:07:50,160 --> 11:07:54,160
este că este mai intens. Deci, dacă tu

14304
11:07:52,240 --> 11:07:55,840
au o mulțime de date, asta va fi

14305
11:07:54,160 --> 11:07:57,436
destul de scump de făcut pentru că ești

14306
11:07:55,840 --> 11:07:58,880
va trebui mai ales tu ai o

14307
11:07:57,436 --> 11:08:01,360
număr mare de pliuri, nu? Tu esti

14308
11:07:58,880 --> 11:08:03,116
va trebui să vă împărțiți datele în k

14309
11:08:01,360 --> 11:08:05,680
număr de pliuri și vei avea

14310
11:08:03,116 --> 11:08:07,680
să facă asta din nou și din nou. Hm, și

14311
11:08:05,680 --> 11:08:09,520
dacă este un set mare de date, ar putea dura

14312
11:08:07,680 --> 11:08:12,320
modelul tău mult timp să te antrenezi. Este

14313
11:08:09,520 --> 11:08:15,040
va fi un pic mai mult uh

14314
11:08:12,320 --> 11:08:17,276
intens computațional decât dacă am fi doar

14315
11:08:15,040 --> 11:08:19,520
a făcut un test de tren.

14316
11:08:17,276 --> 11:08:22,000
Bine, tocmai am făcut un single ca 7030

14317
11:08:19,520 --> 11:08:24,480
despicat. Facem asta o singură dată. Doar noi

14318
11:08:22,000 --> 11:08:28,160
antrenează modelul o dată, nu? Îl antrenăm

14319
11:08:24,480 --> 11:08:31,200
pe 70, aplicați-l la datele de testare de 30%.

14320
11:08:28,160 --> 11:08:33,916
și evaluează performanța în acest fel. um,

14321
11:08:31,200 --> 11:08:36,000
așa că folosim cu adevărat doar modelul și

14322
11:08:33,916 --> 11:08:38,880
antrenând modelul o dată, dar în asta

14323
11:08:36,000 --> 11:08:42,960
kfold, o vom face um, tu

14324
11:08:38,880 --> 11:08:44,560
Știu, de k de ori în esență

14325
11:08:42,960 --> 11:08:46,880
sau ar trebui să spun unul pentru fiecare

14326
11:08:44,560 --> 11:08:50,680
combinație prin care trebuie să lucrăm

14327
11:08:46,880 --> 11:08:50,680
dintre toate pliurile.

14328
11:08:52,640 --> 11:08:58,480
Bine.

14329
11:08:55,276 --> 11:09:01,360
În regulă. Are sens? Orice oricare

14330
11:08:58,480 --> 11:09:05,276
întrebări despre validarea încrucișată kf fold?

14331
11:09:01,360 --> 11:09:08,240
Deci k K este un număr important aici.

14332
11:09:05,276 --> 11:09:10,640
Este câte pliuri câte despărțiri

14333
11:09:08,240 --> 11:09:14,240
ai? O valoare tipică pentru K este

14334
11:09:10,640 --> 11:09:17,040
va fi undeva la cinci sau zece.

14335
11:09:14,240 --> 11:09:20,756
Deci 10 ori cinci ori. Acestea sunt

14336
11:09:17,040 --> 11:09:20,756
destul de standard

14337
11:09:21,360 --> 11:09:25,480
din ce din ce am vazut.

14338
11:09:25,596 --> 11:09:29,276
Dar are sensul conceptul?

14339
11:09:27,360 --> 11:09:31,200
sau există întrebări despre el în

14340
11:09:29,276 --> 11:09:33,200
în termeni de um, vei pleca mereu

14341
11:09:31,200 --> 11:09:35,596
unul pliabil. Îl vei împărți

14342
11:09:33,200 --> 11:09:38,000
până în K număr de pliuri. Pleacă mereu

14343
11:09:35,596 --> 11:09:39,756
unul afară. Antrenează-te pe restul.

14344
11:09:38,000 --> 11:09:41,840
Evaluează-l pe cel care este lăsat afară

14345
11:09:39,756 --> 11:09:42,880
și apoi rotiți-le prin. Şi

14346
11:09:41,840 --> 11:09:44,880
vei face asta pentru fiecare

14347
11:09:42,880 --> 11:09:47,880
combinație și medie toate acestea

14348
11:09:44,880 --> 11:09:47,880
metrici.

14349
11:09:52,000 --> 11:09:56,080
Și apropo, va exista o

14350
11:09:53,680 --> 11:09:58,800
funcție ușoară în scikitlearn care va

14351
11:09:56,080 --> 11:10:01,040
fă asta pentru noi. Deci gestionând toate acestea

14352
11:09:58,800 --> 11:10:03,436
combinațiile vor fi foarte ușoare. Este

14353
11:10:01,040 --> 11:10:06,320
de fapt, doar încorporat în scikitlearn. Deci

14354
11:10:03,436 --> 11:10:08,800
nu trebuie, nu trebuie să facem

14355
11:10:06,320 --> 11:10:10,480
asta totul cu mana. Bine, asta va fi în

14356
11:10:08,800 --> 11:10:13,116
scikitlearn. Se va ocupa de a face totul

14357
11:10:10,480 --> 11:10:15,756
aceste combinaţii de pliuri pentru noi şi

14358
11:10:13,116 --> 11:10:19,200
calcularea valorii medii va fi

14359
11:10:15,756 --> 11:10:20,560
foarte usor. Deci um

14360
11:10:19,200 --> 11:10:21,916
nu trebuie să ne facem griji pentru asta. Suntem

14361
11:10:20,560 --> 11:10:23,840
voi vedea un exemplu al acestei veniri

14362
11:10:21,916 --> 11:10:28,160
sus in scurt timp.

14363
11:10:23,840 --> 11:10:30,080
În regulă, de validare încrucișată kfold,

14364
11:10:28,160 --> 11:10:32,000
dar acesta este un lucru cu adevărat pe scară largă

14365
11:10:30,080 --> 11:10:33,520
tehnica folosita. Și din nou, ca

14366
11:10:32,000 --> 11:10:35,040
scop, s-ar putea să vă întrebați cum ar fi

14367
11:10:33,520 --> 11:10:37,596
care este scopul până la urmă de a face

14368
11:10:35,040 --> 11:10:39,840
asta? Este pentru a avea o idee dacă a noastră

14369
11:10:37,596 --> 11:10:41,680
modelul va funcționa bine pe noi

14370
11:10:39,840 --> 11:10:43,276
date. Chiar asta ne dorim

14371
11:10:41,680 --> 11:10:45,436
stiu. Așa cum va funcționa modelul

14372
11:10:43,276 --> 11:10:48,640
bine când încep să-l folosesc pe date noi

14373
11:10:45,436 --> 11:10:52,320
ca nu s-a mai vazut pana acum? Și asta

14374
11:10:48,640 --> 11:10:55,596
kffold este un indicator decent al acestui lucru

14375
11:10:52,320 --> 11:10:58,880
pentru că variam ce date

14376
11:10:55,596 --> 11:11:02,160
vede prin multe pliuri diferite. Corect?

14377
11:10:58,880 --> 11:11:05,040
Deci, este un fel de proxy um bun

14378
11:11:02,160 --> 11:11:07,276
la expunerea la diferite tipuri de

14379
11:11:05,040 --> 11:11:09,116
date de fiecare dată și văzând cum

14380
11:11:07,276 --> 11:11:10,240
execută.

14381
11:11:09,116 --> 11:11:11,840
În regulă? Pentru că lucrăm în felul nostru

14382
11:11:10,240 --> 11:11:13,756
prin fiecare dintre pliuri. Există

14383
11:11:11,840 --> 11:11:15,200
intotdeauna va fi omisa.

14384
11:11:13,756 --> 11:11:18,960
Vom schimba ce fold primește

14385
11:11:15,200 --> 11:11:20,800
omis de fiecare dată. Și așa e

14386
11:11:18,960 --> 11:11:22,640
de a mima ideea că vom merge

14387
11:11:20,800 --> 11:11:26,000
aplicați modelul nostru la date noi și vedeți cum

14388
11:11:22,640 --> 11:11:29,400
efectuează. Și sunt date noi

14389
11:11:26,000 --> 11:11:29,400
fiecare pliu.

14390
11:11:45,680 --> 11:11:52,160
de unde știm care model se potrivește cel mai bine

14391
11:11:49,520 --> 11:11:54,720
pentru care scenariu pentru că avem Da,

14392
11:11:52,160 --> 11:11:57,680
asta e o intrebare buna. um,

14393
11:11:54,720 --> 11:11:59,040
așa că o să învățăm asta pe măsură ce mergem

14394
11:11:57,680 --> 11:12:02,880
de-a lungul pentru că nu am acoperit toate

14395
11:11:59,040 --> 11:12:05,916
modele încă, dar în general cele mai bune

14396
11:12:02,880 --> 11:12:09,116
sfatul pe care îl pot da în acest sens

14397
11:12:05,916 --> 11:12:11,436
tu în general vrei să începi ca

14398
11:12:09,116 --> 11:12:13,756
cât de simplu poți obține și apoi dacă este

14399
11:12:11,436 --> 11:12:16,240
nu funcționează bine, atunci lucrează în felul tău

14400
11:12:13,756 --> 11:12:18,640
până la ceva mai complex.

14401
11:12:16,240 --> 11:12:19,840
Deci vom avea modele care sunt

14402
11:12:18,640 --> 11:12:22,400
mai simplu. Vom avea modele așa

14403
11:12:19,840 --> 11:12:24,800
sunt mai complexe. Regula de bază este

14404
11:12:22,400 --> 11:12:26,960
pentru a începe cu cel mai simplu model care

14405
11:12:24,800 --> 11:12:30,000
lucrări.

14406
11:12:26,960 --> 11:12:31,840
Deci, de obicei, vei avea la fel

14407
11:12:30,000 --> 11:12:34,880
cele pe care le vei încerca în

14408
11:12:31,840 --> 11:12:36,560
începutul. Și regresia liniară este a

14409
11:12:34,880 --> 11:12:38,160
model foarte simplu. De obicei este

14410
11:12:36,560 --> 11:12:40,400
primul pe care vrei să-l încerci pentru regresie

14411
11:12:38,160 --> 11:12:42,400
pentru ca este cel mai simplu.

14412
11:12:40,400 --> 11:12:44,800
Hm, și pentru clasificare, mergem

14413
11:12:42,400 --> 11:12:46,880
pentru a avea o logistică similară

14414
11:12:44,800 --> 11:12:49,040
regresia este cel mai simplu tip de

14415
11:12:46,880 --> 11:12:51,116
model de clasificare pe care l-am putea avea. Deci

14416
11:12:49,040 --> 11:12:54,080
de obicei vreau să încep cu asta și apoi

14417
11:12:51,116 --> 11:12:56,960
dacă nu se potrivește ca dacă vedem că este

14418
11:12:54,080 --> 11:12:59,520
producând multe erori, atunci lucrăm

14419
11:12:56,960 --> 11:13:01,276
drumul nostru până la unul mai sofisticat

14420
11:12:59,520 --> 11:13:05,040
model.

14421
11:13:01,276 --> 11:13:07,360
Deci așa e noi așa e

14422
11:13:05,040 --> 11:13:09,840
ar trebui să meargă de obicei este simplu

14423
11:13:07,360 --> 11:13:11,916
complexează-l pe baza performanței lor.

14424
11:13:09,840 --> 11:13:13,840
Așa că o evaluăm și apoi putem repeta

14425
11:13:11,916 --> 11:13:15,360
procesul. Dacă nu funcționează bine

14426
11:13:13,840 --> 11:13:19,800
putem încerca ceva diferit, adică

14427
11:13:15,360 --> 11:13:19,800
mai complex dacă este insuficient.

14428
11:13:24,960 --> 11:13:28,960
Uh, aceasta este o întrebare bună. Face un model

14429
11:13:26,720 --> 11:13:31,916
resetați după antrenament fiecare K minus unu

14430
11:13:28,960 --> 11:13:35,520
pliază? Da, în esență este ca o

14431
11:13:31,916 --> 11:13:38,880
model gol de fiecare dată, uh, fiecare pliu. Aşa

14432
11:13:35,520 --> 11:13:42,000
um ne imaginăm ca și cum ai avea un brand

14433
11:13:38,880 --> 11:13:46,276
au un model nou la fiecare um k minus unu

14434
11:13:42,000 --> 11:13:46,276
combinație. Da.

14435
11:13:50,240 --> 11:13:55,756
Și motivul pentru care trebuie să fie

14436
11:13:52,080 --> 11:13:59,680
așa este pentru că nu vrei

14437
11:13:55,756 --> 11:14:02,080
alte pliuri influenţând modelul care

14438
11:13:59,680 --> 11:14:03,596
ca la următoarea combinație. tu

14439
11:14:02,080 --> 11:14:05,596
nu vreau ca combinația anterioară

14440
11:14:03,596 --> 11:14:08,720
influența rezultatele asupra următoarei,

14441
11:14:05,596 --> 11:14:11,200
nu? Vrei să fie proaspăt

14442
11:14:08,720 --> 11:14:14,200
evaluare pe fiecare combinație de

14443
11:14:11,200 --> 11:14:14,200
pliuri.

14444
11:14:30,480 --> 11:14:35,360
Bine.

14445
11:14:32,320 --> 11:14:38,160
În regulă. Deci, permiteți-mi să vă descriu a

14446
11:14:35,360 --> 11:14:40,400
variație a ceea ce tocmai am vorbit

14447
11:14:38,160 --> 11:14:42,720
cam cu K-fold. Deci, există

14448
11:14:40,400 --> 11:14:46,160
o altă validare încrucișată cunoscută ca

14449
11:14:42,720 --> 11:14:49,200
K-fold stratificat. Și acesta este

14450
11:14:46,160 --> 11:14:51,276
aceeași procedură exactă ca și k-fold, cu excepția

14451
11:14:49,200 --> 11:14:52,800
că atunci când noi aceasta este folosită pentru

14452
11:14:51,276 --> 11:14:55,756
clasificare.

14453
11:14:52,800 --> 11:14:57,360
Atunci când facem clasificare

14454
11:14:55,756 --> 11:15:00,720
uh vrem să ne asigurăm că

14455
11:14:57,360 --> 11:15:03,116
diferite categorii vor fi um

14456
11:15:00,720 --> 11:15:05,520
împărțit între acele pliuri într-o

14457
11:15:03,116 --> 11:15:08,720
mod proporțional. Deci nu facem ceea ce facem

14458
11:15:05,520 --> 11:15:10,800
nu vreau să se întâmple atunci când ne despărțim

14459
11:15:08,720 --> 11:15:13,276
în afară de date. Deci, să spunem că avem

14460
11:15:10,800 --> 11:15:15,916
să presupunem că nu anticipăm spam

14461
11:15:13,276 --> 11:15:18,640
spam. Ceea ce nu vrem să se întâmple

14462
11:15:15,916 --> 11:15:21,756
când ne despărțim este că nu vrem

14463
11:15:18,640 --> 11:15:24,640
pentru ca toate spamurile să ajungă într-unul singur

14464
11:15:21,756 --> 11:15:28,000
pliază și apoi fiecare altă faldă are nr

14465
11:15:24,640 --> 11:15:31,116
spam, fără spam, fără spam, fără spam, nu?

14466
11:15:28,000 --> 11:15:33,360
Asta nu e foarte bine. Hm pentru că dacă noi

14467
11:15:31,116 --> 11:15:35,916
dacă ne antrenăm împotriva tuturor acestor tipi, noi

14468
11:15:33,360 --> 11:15:38,560
nu au nicio șansă să prezică spam-ul când

14469
11:15:35,916 --> 11:15:40,800
nu au mai văzut niciodată spam. Deci

14470
11:15:38,560 --> 11:15:42,960
stratify kffold este folosit în

14471
11:15:40,800 --> 11:15:46,960
clasificare

14472
11:15:42,960 --> 11:15:49,276
și este pentru a ne despărți

14473
11:15:46,960 --> 11:15:51,916
asigurați-vă că au practic a

14474
11:15:49,276 --> 11:15:54,480
număr echilibrat de categorii pentru fiecare

14475
11:15:51,916 --> 11:15:57,040
despicat. Ca să nu ajungem cu noi

14476
11:15:54,480 --> 11:16:00,160
anumite divizări cu mult mai multe spam-uri decât

14477
11:15:57,040 --> 11:16:02,560
nu spam-uri. Așa că facem cum se numește

14478
11:16:00,160 --> 11:16:05,360
stratificând acolo unde ne asigurăm că

14479
11:16:02,560 --> 11:16:07,680
proporțiile sunt echilibrate în fiecare uh

14480
11:16:05,360 --> 11:16:10,080
despicat. Deci, acest lucru este cu adevărat util doar în

14481
11:16:07,680 --> 11:16:11,520
clasificare, nu chiar necesară în

14482
11:16:10,080 --> 11:16:13,520
regresie deoarece prezicem a

14483
11:16:11,520 --> 11:16:15,436
valoare. Dar dacă am prezice o

14484
11:16:13,520 --> 11:16:18,080
categorie,

14485
11:16:15,436 --> 11:16:20,240
ca în clasificare ca fraudă, nu

14486
11:16:18,080 --> 11:16:23,116
fraudă, nu vrem să facem despărțirea și

14487
11:16:20,240 --> 11:16:25,680
au fiecare exemplu de fraudă

14488
11:16:23,116 --> 11:16:29,040
ghinion în amestecul nostru și despicat

14489
11:16:25,680 --> 11:16:31,596
până într-o împărțire și fiecare alta um fiecare

14490
11:16:29,040 --> 11:16:32,960
altă diviziune nu are exemple de fraudă.

14491
11:16:31,596 --> 11:16:35,520
Corect? Corect. Deci vrem să stratificăm

14492
11:16:32,960 --> 11:16:40,560
asta pentru a răspândi acele fraude

14493
11:16:35,520 --> 11:16:42,480
împotriva tuturor celorlalte scindări. Um asa uh

14494
11:16:40,560 --> 11:16:44,800
iar scikitlearn va avea grijă

14495
11:16:42,480 --> 11:16:46,560
asta pentru tine. Hm, dar dacă faci

14496
11:16:44,800 --> 11:16:49,596
clasificare și aveți o

14497
11:16:46,560 --> 11:16:52,480
set de date dezechilibrat, tu chiar

14498
11:16:49,596 --> 11:16:56,800
vreau să vă asigurați că stratificați kfold. um

14499
11:16:52,480 --> 11:16:58,240
dezechilibrat însemnând că ai un a um

14500
11:16:56,800 --> 11:17:00,240
număr diferit. Ca dacă faci

14501
11:16:58,240 --> 11:17:02,960
fraudă, nu fraudă, ai mult mai multe nu

14502
11:17:00,240 --> 11:17:05,360
fraude decât fraude. Hm, când unde

14503
11:17:02,960 --> 11:17:06,640
categoria este dezechilibrata,

14504
11:17:05,360 --> 11:17:09,756
vrei să te asiguri că este echilibrat

14505
11:17:06,640 --> 11:17:12,000
peste toate diviziunile tale.

14506
11:17:09,756 --> 11:17:13,436
Um, deci asta este util în

14507
11:17:12,000 --> 11:17:14,720
doar clasificare, nu chiar

14508
11:17:13,436 --> 11:17:17,436
regresie, despre care vorbim

14509
11:17:14,720 --> 11:17:19,276
cam acum. Hm, dar este doar o

14510
11:17:17,436 --> 11:17:22,240
variaţie asupra acestui lucru care asigură când noi

14511
11:17:19,276 --> 11:17:24,320
face acele pliuri um datele sunt

14512
11:17:22,240 --> 11:17:26,480
distribuite uniform între aceste pliuri

14513
11:17:24,320 --> 11:17:28,800
cât putem. Etichetele sunt I

14514
11:17:26,480 --> 11:17:32,000
ar trebui să spună.

14515
11:17:28,800 --> 11:17:34,480
Bine. Deci este kfold stratificat. Este

14516
11:17:32,000 --> 11:17:35,916
aceeași procedură odată ce avem

14517
11:17:34,480 --> 11:17:38,640
despica. Este la fel unde facem k

14518
11:17:35,916 --> 11:17:42,560
minus unul dintre ei. Antrenăm testul pentru asta

14519
11:17:38,640 --> 11:17:44,480
ultima pliere um și apoi rotiți prin toate

14520
11:17:42,560 --> 11:17:46,720
pliurile și și medie toate cele

14521
11:17:44,480 --> 11:17:49,680
metrici. exact aceeași procedură. Este

14522
11:17:46,720 --> 11:17:54,040
doar despărțirea în sine urmează

14523
11:17:49,680 --> 11:17:54,040
să fie echilibrat într-un kfold stratificat.

14524
11:17:55,116 --> 11:17:59,840
Bine, așa că nu, am vorbit deja

14525
11:17:56,800 --> 11:18:02,000
despre um face doar un singur tren

14526
11:17:59,840 --> 11:18:03,916
divizarea testului. Am vorbit despre asta. Unul

14527
11:18:02,000 --> 11:18:06,560
mai multă variație care este un pic

14528
11:18:03,916 --> 11:18:08,400
versiunea extremă a lui Kfold. Deci este

14529
11:18:06,560 --> 11:18:12,880
de fapt același proces ca Kfold, dar

14530
11:18:08,400 --> 11:18:14,720
este o versiune extremă dacă setați K

14531
11:18:12,880 --> 11:18:17,596
egal cu numărul de puncte de date. Deci

14532
11:18:14,720 --> 11:18:20,400
practic ești, asta este cu adevărat

14533
11:18:17,596 --> 11:18:23,680
cu adevărat extreme kfold unde um

14534
11:18:20,400 --> 11:18:26,640
practic sunt de formare pe toate datele.

14535
11:18:23,680 --> 11:18:29,916
Deci te antrenezi cu toate datele

14536
11:18:26,640 --> 11:18:33,040
cu excepția unui punct și apoi testezi

14537
11:18:29,916 --> 11:18:36,240
împotriva aceluia punct. Hm acum de ce ar face-o

14538
11:18:33,040 --> 11:18:40,560
faci asta vreodata? Hm, în principal așa este pentru

14539
11:18:36,240 --> 11:18:42,320
acest motiv aici. este pentru a maximiza

14540
11:18:40,560 --> 11:18:44,560
cantitatea de date de antrenament pe care dvs

14541
11:18:42,320 --> 11:18:46,480
modelul este expus pentru că în loc de

14542
11:18:44,560 --> 11:18:48,400
doar fac în loc să faci doar cinci

14543
11:18:46,480 --> 11:18:51,360
despica

14544
11:18:48,400 --> 11:18:53,116
um care ar fi ca

14545
11:18:51,360 --> 11:18:55,840
știi că aceste patru pliuri se vor face

14546
11:18:53,116 --> 11:18:59,116
fie folosit și apoi testăm împotriva unuia

14547
11:18:55,840 --> 11:19:02,400
fold um, în esență, vom folosi

14548
11:18:59,116 --> 11:19:05,360
99% din date merg într-un singur punct

14549
11:19:02,400 --> 11:19:08,000
pentru a fi lăsat afară 99% din date sunt utilizate

14550
11:19:05,360 --> 11:19:10,000
să-l antrenez și apoi mergem mereu

14551
11:19:08,000 --> 11:19:11,756
a omite un punct și și problema

14552
11:19:10,000 --> 11:19:13,756
este de fapt o să facem asta

14553
11:19:11,756 --> 11:19:16,000
iar iar și iar și rotiți asta

14554
11:19:13,756 --> 11:19:19,360
un punct pentru a acoperi întregul set de date.

14555
11:19:16,000 --> 11:19:21,680
Așa că ne vom antrena cu 99% lăsați unul

14556
11:19:19,360 --> 11:19:23,680
acela un punct

14557
11:19:21,680 --> 11:19:25,680
și apoi rotiți prin fiecare

14558
11:19:23,680 --> 11:19:28,000
combinație de puncte până când plecăm

14559
11:19:25,680 --> 11:19:30,560
scoateți fiecare punct și apoi media

14560
11:19:28,000 --> 11:19:33,680
toți cei împreună. Hm, deci acesta este un asta

14561
11:19:30,560 --> 11:19:35,200
este un kffold extrem. Din nou numărul

14562
11:19:33,680 --> 11:19:37,680
de pliuri este de fapt egal cu numărul

14563
11:19:35,200 --> 11:19:40,320
de puncte de date în acest caz. Deci avem

14564
11:19:37,680 --> 11:19:43,840
fiecare punct este propriul său fald și ne antrenăm

14565
11:19:40,320 --> 11:19:46,560
pe tot, cu excepția unui test pe acela.

14566
11:19:43,840 --> 11:19:48,480
Acest lucru vă obține dimensiunea maximă a dvs

14567
11:19:46,560 --> 11:19:50,320
date de antrenament pentru că practic ești

14568
11:19:48,480 --> 11:19:52,320
va avea toate punctele în afară de unul folosit

14569
11:19:50,320 --> 11:19:54,560
în antrenament.

14570
11:19:52,320 --> 11:19:58,560
Acest lucru vă obține dimensiunea maximă. Cu toate acestea,

14571
11:19:54,560 --> 11:20:00,240
îți aduce cheltuiala maximă

14572
11:19:58,560 --> 11:20:01,916
mai ales pentru seturi mari de date. Aceasta este

14573
11:20:00,240 --> 11:20:04,800
va fi, de obicei, nu vei face

14574
11:20:01,916 --> 11:20:08,080
utilizați acest lucru în special pentru date mari

14575
11:20:04,800 --> 11:20:09,680
setează pentru că este prea extrem. Este

14576
11:20:08,080 --> 11:20:12,080
iti va lua foarte mult timp

14577
11:20:09,680 --> 11:20:15,116
lucrează prin fiecare punct de ființă

14578
11:20:12,080 --> 11:20:17,116
lăsat afară. Um, va dura doar o

14579
11:20:15,116 --> 11:20:20,400
în timp ce să facă.

14580
11:20:17,116 --> 11:20:21,840
Deci, din acest motiv, lăsați-l afară

14581
11:20:20,400 --> 11:20:24,000
că de aceea se numește lasă unul

14582
11:20:21,840 --> 11:20:27,916
afară pentru că lași unul afară

14583
11:20:24,000 --> 11:20:30,640
de fiecare dată. Um este rar folosit. eu

14584
11:20:27,916 --> 11:20:33,116
Nu văd că este folosit atât de des,

14585
11:20:30,640 --> 11:20:36,360
dar este o versiune extremă a K-fold

14586
11:20:33,116 --> 11:20:36,360
validare încrucișată.

14587
11:20:36,480 --> 11:20:40,640
Bine. Dar foarte rar folosit. eu

14588
11:20:38,800 --> 11:20:42,480
cred că cei care se obișnuiesc

14589
11:20:40,640 --> 11:20:45,276
cele mai multe sunt cu siguranță metoda hold out

14590
11:20:42,480 --> 11:20:47,276
doar cu o divizare obișnuită de testare a trenului. Hm

14591
11:20:45,276 --> 11:20:50,400
și apoi celălalt care se obișnuiește

14592
11:20:47,276 --> 11:20:52,320
destul de mult este Kfold

14593
11:20:50,400 --> 11:20:54,800
sau stratificat K-fold dacă ești dacă ești

14594
11:20:52,320 --> 11:20:58,480
făcând clasificare, dar cu siguranță

14595
11:20:54,800 --> 11:21:01,480
K-fold într-un caz de regresie.

14596
11:20:58,480 --> 11:21:01,480
Bine.

14597
11:21:02,960 --> 11:21:07,276
În regulă. Um, vom face o

14598
11:21:05,116 --> 11:21:09,680
exemplu cu tipii astia. Deci, vom face

14599
11:21:07,276 --> 11:21:14,320
că în continuare. Hm, cu cu diferit

14600
11:21:09,680 --> 11:21:17,436
tehnici de validare încrucișată. Hm, dar oricare

14601
11:21:14,320 --> 11:21:19,596
întrebări despre ceea ce fac

14602
11:21:17,436 --> 11:21:22,840
conceptual înainte de a face efectiv

14603
11:21:19,596 --> 11:21:22,840
exemplu de cod?

14604
11:21:36,000 --> 11:21:42,116
bine,

14605
11:21:38,720 --> 11:21:42,116
foarte bine.

14606
11:21:44,960 --> 11:21:51,916
Bine, deci să vedem câteva exemple.

14607
11:21:47,756 --> 11:21:54,400
Hai să intrăm în codul nostru și să construim un

14608
11:21:51,916 --> 11:21:57,116
modelați și faceți crucea diferită

14609
11:21:54,400 --> 11:21:58,160
tehnici de validare pe acesta. Ești

14610
11:21:57,116 --> 11:22:00,640
să văd că de fapt va fi

14611
11:21:58,160 --> 11:22:03,200
foarte ușor de făcut și sună

14612
11:22:00,640 --> 11:22:05,520
complex ca a face kfold și a pleca

14613
11:22:03,200 --> 11:22:07,436
unul afară și testarea ei sună cam

14614
11:22:05,520 --> 11:22:11,436
complex dar îți promit scikitlearn

14615
11:22:07,436 --> 11:22:14,880
face cu adevărat ușor de făcut. Hm

14616
11:22:11,436 --> 11:22:17,276
și deci nu va trebui să facem prea multe

14617
11:22:14,880 --> 11:22:19,436
în plus, folosește instrumentele potrivite de la

14618
11:22:17,276 --> 11:22:21,840
scikitlearn. Uh, deci mergem să fim

14619
11:22:19,436 --> 11:22:25,520
merg sa vad asta. Um deci aici avem

14620
11:22:21,840 --> 11:22:27,200
unele importuri. Chestia principală

14621
11:22:25,520 --> 11:22:30,160
asta e puțin nou pentru noi

14622
11:22:27,200 --> 11:22:31,596
să fie aceste um diferite feluri de cruce

14623
11:22:30,160 --> 11:22:33,436
tehnici de validare. Deci avem

14624
11:22:31,596 --> 11:22:35,756
kfold, avem kfoldul nostru stratificat,

14625
11:22:33,436 --> 11:22:38,000
lăsați unul afară, care sunt acelea

14626
11:22:35,756 --> 11:22:40,320
diferite tehnici de validare încrucișată.

14627
11:22:38,000 --> 11:22:45,276
Acestea vor fi folosite

14628
11:22:40,320 --> 11:22:47,436
combinație cu acest scor încrucișat

14629
11:22:45,276 --> 11:22:49,840
care va ține evidența

14630
11:22:47,436 --> 11:22:51,680
diferite um metrici și apoi medie

14631
11:22:49,840 --> 11:22:55,276
ei

14632
11:22:51,680 --> 11:22:58,240
uh, în timp ce facem una dintre aceste um cruce

14633
11:22:55,276 --> 11:23:01,916
tehnici de validare. Deci tipul ăsta primește

14634
11:22:58,240 --> 11:23:04,240
folosit în combinație cu unul dintre acestea pentru a

14635
11:23:01,916 --> 11:23:07,680
așa cum vom vedea în cod

14636
11:23:04,240 --> 11:23:09,520
uh, pentru a face o medie a acestor valori. um face

14637
11:23:07,680 --> 11:23:10,880
diferitele pliuri, nu? Efectuează

14638
11:23:09,520 --> 11:23:13,360
făcând performanță împotriva diferiților

14639
11:23:10,880 --> 11:23:15,200
pliuri. Bine. Și atunci bineînțeles că avem nevoie

14640
11:23:13,360 --> 11:23:16,960
un model

14641
11:23:15,200 --> 11:23:20,000
folosind regresia liniară. Asta este

14642
11:23:16,960 --> 11:23:22,000
cel pe care l-am studiat până acum. Hm și

14643
11:23:20,000 --> 11:23:25,436
atunci avem doar o măsurătoare obișnuită dacă

14644
11:23:22,000 --> 11:23:28,880
vrem să le calculăm. Folosind poate

14645
11:23:25,436 --> 11:23:30,480
doar stai, nu? Și ține um

14646
11:23:28,880 --> 11:23:32,640
care este doar un test obișnuit de tren

14647
11:23:30,480 --> 11:23:34,720
despicat. Ne-am putea folosi pe tipii ăștia

14648
11:23:32,640 --> 11:23:37,520
evalua performanta.

14649
11:23:34,720 --> 11:23:39,520
Dar într-un stil K-fold mai sofisticat

14650
11:23:37,520 --> 11:23:44,040
de audiție încrucișată, vom folosi

14651
11:23:39,520 --> 11:23:44,040
aceasta pentru a evalua performanța.

14652
11:23:45,276 --> 11:23:50,000
Bine, să vedem.

14653
11:23:48,400 --> 11:23:53,436
Deci, vom lucra cu asta

14654
11:23:50,000 --> 11:23:58,480
locuințe cu date de proximitate oceanului. um,

14655
11:23:53,436 --> 11:24:00,080
voi băieți ar trebui să aveți asta. Uh, deci

14656
11:23:58,480 --> 11:24:01,680
voi băieți ar trebui să aveți asta. Deci, dacă

14657
11:24:00,080 --> 11:24:06,240
vrei să-l urmărești și să-l rulezi

14658
11:24:01,680 --> 11:24:11,276
tu însuți, um, îl poți încărca pe acela.

14659
11:24:06,240 --> 11:24:12,720
Vreau să mă asigur că o am.

14660
11:24:11,276 --> 11:24:16,116
Lasă-mă să-l trag pe acela. Deci, ar trebui

14661
11:24:12,720 --> 11:24:16,116
fii acest tip.

14662
11:24:23,596 --> 11:24:28,720
O să-l încarc ca să pot face

14663
11:24:25,040 --> 11:24:31,720
sigur că o conduc cu voi băieți.

14664
11:24:28,720 --> 11:24:31,720
um,

14665
11:24:37,520 --> 11:24:41,160
așa că lasă-mă să execut asta.

14666
11:24:41,756 --> 11:24:48,560
Aveți acele date?

14667
11:24:44,640 --> 11:24:50,640
Locuinta cu apropierea oceanului?

14668
11:24:48,560 --> 11:24:53,596
Este un alt, este o altă dată de locuințe

14669
11:24:50,640 --> 11:24:55,276
set. um,

14670
11:24:53,596 --> 11:24:58,480
dar este puțin diferit de

14671
11:24:55,276 --> 11:25:00,640
cele pe care le-am mai văzut. Are un a

14672
11:24:58,480 --> 11:25:05,640
caracteristică specială pentru cât de aproape este

14673
11:25:00,640 --> 11:25:05,640
oceanul, diferitele locații.

14674
11:25:10,400 --> 11:25:14,080
Deci, arată cam așa. Dacă noi

14675
11:25:12,000 --> 11:25:17,680
încărcați-l și faceți-ne capul, adică

14676
11:25:14,080 --> 11:25:19,840
de obicei, ceea ce facem, corect, putem vedea

14677
11:25:17,680 --> 11:25:23,360
putem vedea că are aceste caracteristici.

14678
11:25:19,840 --> 11:25:25,040
Deci, are dormitoare, în total

14679
11:25:23,360 --> 11:25:28,560
camere,

14680
11:25:25,040 --> 11:25:30,640
um, are vârsta medie. Acum, aceasta este

14681
11:25:28,560 --> 11:25:35,360
asta pare putin ciudat in totalitate

14682
11:25:30,640 --> 11:25:39,276
camere și dormitoare și populație,

14683
11:25:35,360 --> 11:25:42,640
etc., dar este um

14684
11:25:39,276 --> 11:25:44,480
este că are acelea uh, are alea

14685
11:25:42,640 --> 11:25:46,800
pentru că reprezintă un întreg

14686
11:25:44,480 --> 11:25:49,040
cartier. Deci, este un întreg

14687
11:25:46,800 --> 11:25:50,080
cartier și ne uităm la asta

14688
11:25:49,040 --> 11:25:52,480
um, acesta va fi de fapt al nostru

14689
11:25:50,080 --> 11:25:54,480
eticheta este această valoare medie a casei pentru

14690
11:25:52,480 --> 11:25:58,080
întreg cartierul. Deci, ce este asta

14691
11:25:54,480 --> 11:26:00,400
valoarea mediană în cartier? Şi

14692
11:25:58,080 --> 11:26:03,680
acesta este numărul total de dormitoare,

14693
11:26:00,400 --> 11:26:06,080
numărul total de camere, um populație,

14694
11:26:03,680 --> 11:26:08,880
gospodăriilor. Deci, câte case sunt

14695
11:26:06,080 --> 11:26:11,916
acolo? Venitul mediu. Si bineinteles,

14696
11:26:08,880 --> 11:26:16,000
acestea sunt scalate. Deci acestea sunt probabile

14697
11:26:11,916 --> 11:26:18,720
ori știi de mii

14698
11:26:16,000 --> 11:26:22,720
um

14699
11:26:18,720 --> 11:26:26,116
dar astea sunt datele noastre. Am putea

14700
11:26:22,720 --> 11:26:26,116
descrie-l.

14701
11:26:27,756 --> 11:26:33,840
Deci putem vedea vârsta medie a vârstei

14702
11:26:31,200 --> 11:26:36,160
um, ceea ce sună puțin ciudat, dar

14703
11:26:33,840 --> 11:26:40,880
asta pentru că din nou acesta este

14704
11:26:36,160 --> 11:26:43,840
mediană a datelor într-un cartier. Hm

14705
11:26:40,880 --> 11:26:47,840
deci media acestora este de aproximativ 28 sau

14706
11:26:43,840 --> 11:26:50,840
29. Avem

14707
11:26:47,840 --> 11:26:50,840
u

14708
11:26:51,436 --> 11:26:56,160
total dormitoare. Ne putem uita la

14709
11:26:53,680 --> 11:26:58,320
min. Sunt câteva date care doar au

14710
11:26:56,160 --> 11:27:01,680
unul. Deci este probabil doar o casă înăuntru

14711
11:26:58,320 --> 11:27:03,596
acolo. Hm, ceea ce reprezintă asta.

14712
11:27:01,680 --> 11:27:05,680
Există o singură casă. Deci acolo

14713
11:27:03,596 --> 11:27:10,880
este un cartier care are doar unul

14714
11:27:05,680 --> 11:27:13,596
casa. Um, și vedem mediana, um, noi

14715
11:27:10,880 --> 11:27:16,720
vezi valorile minime, medii ale casei

14716
11:27:13,596 --> 11:27:20,596
acolo. Și apoi maximul aici jos,

14717
11:27:16,720 --> 11:27:20,596
um, este un număr destul de mare.

14718
11:27:21,436 --> 11:27:25,200
6.000 de gospodării este cea mai mare pe care o avem

14719
11:27:23,756 --> 11:27:27,520
au în oricare dintre acestea

14720
11:27:25,200 --> 11:27:29,276
cartiere.

14721
11:27:27,520 --> 11:27:33,000
Bine. Deci, doar un pic de

14722
11:27:29,276 --> 11:27:33,000
descrierea datelor.

14723
11:27:45,596 --> 11:27:50,080
Bine. Atunci putem rula.info. Deci asta

14724
11:27:47,840 --> 11:27:54,916
lasă-mă să vă întreb, băieți, dacă ați putut

14725
11:27:50,080 --> 11:27:54,916
sa incarci asta? Ai fost capabil să rulezi asta?

14726
11:27:56,480 --> 11:27:59,360
Dacă te urmărești, ai putut

14727
11:27:57,840 --> 11:28:03,960
la

14728
11:27:59,360 --> 11:28:03,960
încărcați-l și aruncați o privire la capul punctului.

14729
11:28:09,680 --> 11:28:15,116
Bine, grozav. Mare.

14730
11:28:12,400 --> 11:28:20,000
Bine, deci putem să încărcăm asta și

14731
11:28:15,116 --> 11:28:22,080
apoi uită-te la capul punctului. Perfect. Hm

14732
11:28:20,000 --> 11:28:25,040
bine.

14733
11:28:22,080 --> 11:28:27,360
Um și apoi alergăm descrieți care dă

14734
11:28:25,040 --> 11:28:30,000
noi că uh obișnuit fel de statistică

14735
11:28:27,360 --> 11:28:34,040
descriere. Ca să putem vedea câteva

14736
11:28:30,000 --> 11:28:34,040
statistici interesante despre acestea.

14737
11:28:37,840 --> 11:28:41,916
Ce observați băieți despre informații?

14738
11:28:40,400 --> 11:28:44,916
Orice interesant din care vedem

14739
11:28:41,916 --> 11:28:44,916
Acolo?

14740
11:28:56,720 --> 11:29:01,400
Lipsesc date?

14741
11:29:01,840 --> 11:29:07,116
Ceva caracteristici care au date lipsă? Can

14742
11:29:04,800 --> 11:29:09,520
vedem noi

14743
11:29:07,116 --> 11:29:11,680
obiect? Da, tipul de obiect este de obicei

14744
11:29:09,520 --> 11:29:14,480
şir. Dacă este un tip de obiect, asta

14745
11:29:11,680 --> 11:29:16,480
de obicei înseamnă șir. Python când noi

14746
11:29:14,480 --> 11:29:19,116
citește-l în panda, de obicei este doar un

14747
11:29:16,480 --> 11:29:20,800
şir.

14748
11:29:19,116 --> 11:29:22,960
Pentru ca asta să aibă sens ca și noi

14749
11:29:20,800 --> 11:29:25,680
mai ales caracteristici numerice dar apoi noi

14750
11:29:22,960 --> 11:29:28,680
au o această apropiere de ocean care este o

14751
11:29:25,680 --> 11:29:28,680
şir.

14752
11:29:34,560 --> 11:29:38,560
Da. Total dormitoare are nles. Asta e

14753
11:29:36,480 --> 11:29:41,360
corect. Pentru că aici puteți vedea asta

14754
11:29:38,560 --> 11:29:42,960
nu este egal cu numărul de rânduri uh

14755
11:29:41,360 --> 11:29:44,480
pe care o avem. Deci, acesta este numărul de

14756
11:29:42,960 --> 11:29:47,200
rânduri. Sunt aproximativ 20.000 de rânduri. Asta e

14757
11:29:44,480 --> 11:29:49,756
un set de date de dimensiuni bune, nu? 20.000

14758
11:29:47,200 --> 11:29:52,160
rânduri. Asta e decent. Hm, suntem

14759
11:29:49,756 --> 11:29:54,960
cu siguranță lipsesc câteva date aici pt

14760
11:29:52,160 --> 11:29:58,080
sigur. Am putea număra cât suntem

14761
11:29:54,960 --> 11:30:00,640
lipsind exact prin conducerea asta este NATO

14762
11:29:58,080 --> 11:30:02,720
suma. um,

14763
11:30:00,640 --> 11:30:06,560
și așa vedem că totalul dormitoare este

14764
11:30:02,720 --> 11:30:11,480
lipsesc aproximativ 200 uh 200 de rânduri sunt

14765
11:30:06,560 --> 11:30:11,480
lipsește valoarea totală a dormitorului.

14766
11:30:12,000 --> 11:30:16,800
Bine. Și apoi un lucru mi-am dorit

14767
11:30:14,400 --> 11:30:18,560
Uită-te la este da, acesta este un șir. Aşa

14768
11:30:16,800 --> 11:30:20,800
ce ne amintim ce putem face cu acestea?

14769
11:30:18,560 --> 11:30:25,320
Asta e categoric.

14770
11:30:20,800 --> 11:30:25,320
Deci apropierea oceanului

14771
11:30:26,160 --> 11:30:30,800
este un categoric

14772
11:30:28,960 --> 11:30:33,360
sfoară

14773
11:30:30,800 --> 11:30:35,360
caracteristică.

14774
11:30:33,360 --> 11:30:37,360
Deci putem arunca o privire asupra valorii sale

14775
11:30:35,360 --> 11:30:40,640
contează, ceea ce este de obicei o idee bună

14776
11:30:37,360 --> 11:30:43,360
aruncați o privire și vedeți ce valori posibile

14777
11:30:40,640 --> 11:30:45,680
acea caracteristică ar putea fi. Deci dacă ne uităm la

14778
11:30:43,360 --> 11:30:47,840
noastre

14779
11:30:45,680 --> 11:30:50,840
um cum numim asta? Locuințe

14780
11:30:47,840 --> 11:30:50,840
date.

14781
11:30:51,040 --> 11:30:56,640
Date despre locuințe

14782
11:30:54,000 --> 11:30:59,640
ocean

14783
11:30:56,640 --> 11:30:59,640
apropierea

14784
11:31:01,276 --> 11:31:05,320
valoarea punctului contează.

14785
11:31:09,360 --> 11:31:12,960
Deci, iată diferitele tipuri de asta

14786
11:31:11,200 --> 11:31:14,560
unul poate fi. Deci sunt unele

14787
11:31:12,960 --> 11:31:16,560
cartiere care au mai puțin de 1 oră

14788
11:31:14,560 --> 11:31:18,640
din ocean. Sunt unele care sunt

14789
11:31:16,560 --> 11:31:21,200
în interior. Sunt unele care sunt aproape de

14790
11:31:18,640 --> 11:31:22,960
ocean. Sunt unele care sunt lângă un golf.

14791
11:31:21,200 --> 11:31:25,596
Există chiar și cinci dintre ei care sunt pe un

14792
11:31:22,960 --> 11:31:28,240
insula. Deci, acestea sunt diferite

14793
11:31:25,596 --> 11:31:29,596
valorile apropierii oceanului. Deci,

14794
11:31:28,240 --> 11:31:32,000
amintește-ți, poți oricând să faci asta. Dacă tu

14795
11:31:29,596 --> 11:31:34,640
vezi o caracteristică șir, poți oricând

14796
11:31:32,000 --> 11:31:37,360
uitați-vă la ce categorii sunt

14797
11:31:34,640 --> 11:31:38,640
sunt. Și se pare că majoritatea lucrurilor sunt

14798
11:31:37,360 --> 11:31:42,160
la mai puțin de 1 oră de ocean, dar

14799
11:31:38,640 --> 11:31:44,960
este cam uniform distribuit aici. Hm

14800
11:31:42,160 --> 11:31:48,680
altfel

14801
11:31:44,960 --> 11:31:48,680
foarte putine insule.

14802
11:31:52,880 --> 11:31:56,480
Dar după cum vă puteți imagina, ca această caracteristică

14803
11:31:54,560 --> 11:32:00,560
probabil va fi important pentru

14804
11:31:56,480 --> 11:32:04,276
determinând care este valoarea, nu?

14805
11:32:00,560 --> 11:32:04,276
Probabil va fi important.

14806
11:32:07,520 --> 11:32:12,960
Bine. Deci, trebuie să ne ocupăm de acestea

14807
11:32:10,880 --> 11:32:14,960
NLES. Dacă vom construi un model,

14808
11:32:12,960 --> 11:32:17,436
nu? Deci, um, asta este tot al nostru

14809
11:32:14,960 --> 11:32:18,560
pregătirea tipică a datelor Dacă vrem să construim un

14810
11:32:17,436 --> 11:32:20,720
model, va trebui să ne ocupăm

14811
11:32:18,560 --> 11:32:22,960
aceste NLES. Ce credeți că noi

14812
11:32:20,720 --> 11:32:24,880
ar trebui să faci cu NLES? Ce ai vrea

14813
11:32:22,960 --> 11:32:26,640
ce parere aveti despre dormitoarele totale?

14814
11:32:24,880 --> 11:32:31,916
Care crezi că este o strategie bună

14815
11:32:26,640 --> 11:32:35,520
face? Rețineți că avem 20.000 de puncte,

14816
11:32:31,916 --> 11:32:40,000
20.000 de rânduri ar trebui să spun și aproximativ 200

14817
11:32:35,520 --> 11:32:40,000
dintre ele sunt nule.

14818
11:32:42,880 --> 11:32:48,160
Corect. Deci aproximativ 200 sunt nule. Hm, ce

14819
11:32:47,040 --> 11:32:49,756
faceți ce credeți că ar fi

14820
11:32:48,160 --> 11:32:53,480
ca o strategie bună pentru a face față acestora

14821
11:32:49,756 --> 11:32:53,480
nles în acest caz?

14822
11:33:10,880 --> 11:33:17,916
medie. Nu-l putem ignora pentru că noi

14823
11:33:14,880 --> 11:33:20,640
nu pot ignora acea coloană.

14824
11:33:17,916 --> 11:33:24,596
Nu putem ignora întreaga coloană. Deci,

14825
11:33:20,640 --> 11:33:24,596
ceva trebuie să meargă acolo.

14826
11:33:29,200 --> 11:33:34,240
Probabil că nu vreau să o fac zero.

14827
11:33:31,680 --> 11:33:36,640
Cred că medie este o medie decentă este a

14828
11:33:34,240 --> 11:33:39,436
idee decenta. Probabil că nu vreau să fac

14829
11:33:36,640 --> 11:33:41,680
este zero pentru că asta ar indica

14830
11:33:39,436 --> 11:33:43,840
că nu există dormitoare și totuși noi

14831
11:33:41,680 --> 11:33:45,200
mai au o grămadă de camere totale. Deci,

14832
11:33:43,840 --> 11:33:48,200
probabil că nu are sens să faci

14833
11:33:45,200 --> 11:33:48,200
zero.

14834
11:33:50,720 --> 11:33:54,320
Medie, cred că medie ar putea fi a

14835
11:33:52,480 --> 11:33:56,800
unul decent.

14836
11:33:54,320 --> 11:34:01,276
Acum, în acest exemplu, ceea ce suntem

14837
11:33:56,800 --> 11:34:03,116
de fapt o să facem noi

14838
11:34:01,276 --> 11:34:04,880
rânduri.

14839
11:34:03,116 --> 11:34:06,800
De fapt, vom renunța la rândurile al

14840
11:34:04,880 --> 11:34:10,080
împreună. Acum, de ce facem asta?

14841
11:34:06,800 --> 11:34:14,000
Pentru că avem atât de multe date și

14842
11:34:10,080 --> 11:34:16,320
doar 200 dintre ele sunt nule.

14843
11:34:14,000 --> 11:34:17,840
Bine, doar 200 dintre ele sunt nule. Aşa,

14844
11:34:16,320 --> 11:34:22,240
de fapt o să renunțăm la

14845
11:34:17,840 --> 11:34:25,276
rânduri. Acum, asta e o alegere.

14846
11:34:22,240 --> 11:34:26,960
E o alegere, nu? Este noi

14847
11:34:25,276 --> 11:34:29,040
ar putea completa cu media ca tine

14848
11:34:26,960 --> 11:34:31,436
băieții sugerează. Ceea ce suntem de fapt

14849
11:34:29,040 --> 11:34:35,276
trebuie doar să aruncați rândurile. It It

14850
11:34:31,436 --> 11:34:38,160
constituie mai putin. Reprezintă aproximativ 1% din

14851
11:34:35,276 --> 11:34:41,680
toate datele. Deci nu este atât de mult

14852
11:34:38,160 --> 11:34:42,800
lipseste. Putem renunța la acele rânduri.

14853
11:34:41,680 --> 11:34:46,000
Deci, de fapt, asta vom face

14854
11:34:42,800 --> 11:34:48,640
face aici este să eliminăm toate rolurile cu

14855
11:34:46,000 --> 11:34:51,520
NLES făcând drop NA. Deci asta doar

14856
11:34:48,640 --> 11:34:57,040
le scapă. Deci acele rânduri sunt tăiate.

14857
11:34:51,520 --> 11:34:58,640
Hm, este discutabil că am putea înlocui

14858
11:34:57,040 --> 11:35:00,480
este discutabil că am putea doar înlocui

14859
11:34:58,640 --> 11:35:02,640
cu ceva și cred că voi băieți

14860
11:35:00,480 --> 11:35:04,880
ai ganduri bune care este media

14861
11:35:02,640 --> 11:35:07,756
un implicit

14862
11:35:04,880 --> 11:35:10,880
presupunem total dormitoare. Am putea

14863
11:35:07,756 --> 11:35:13,116
putea incerca asta. Da.

14864
11:35:10,880 --> 11:35:14,800
Atribuiți o valoare pe baza unei case comparabile

14865
11:35:13,116 --> 11:35:17,276
valoare. Da, ai putea să faci și asta.

14866
11:35:14,800 --> 11:35:19,040
Aceasta este o strategie bună este să te uiți la

14867
11:35:17,276 --> 11:35:22,400
alte rânduri care îi sunt asemănătoare și

14868
11:35:19,040 --> 11:35:24,320
completați o valoare. Este absolut corect.

14869
11:35:22,400 --> 11:35:28,916
Hm, în acest exemplu, suntem de fapt doar

14870
11:35:24,320 --> 11:35:28,916
o să renunț la rândurile respective,

14871
11:35:28,960 --> 11:35:33,436
dar cred că asta e total um total

14872
11:35:31,756 --> 11:35:36,000
valabil.

14873
11:35:33,436 --> 11:35:42,640
Aceasta este o alegere.

14874
11:35:36,000 --> 11:35:45,840
Am putea umple NA cu valori diferite

14875
11:35:42,640 --> 11:35:49,276
cum ar fi media,

14876
11:35:45,840 --> 11:35:53,840
total dormitoare,

14877
11:35:49,276 --> 11:35:55,520
um, deducem o valoare etc. Deci, am putea

14878
11:35:53,840 --> 11:35:57,276
derivă ceva, despre care cred că Brent,

14879
11:35:55,520 --> 11:35:59,756
ai o sugestie buna. Asta este o

14880
11:35:57,276 --> 11:36:01,840
buna sugestie. Am putea deduce

14881
11:35:59,756 --> 11:36:03,360
așa ceva, uh, și completați

14882
11:36:01,840 --> 11:36:06,560
gol, și asta cred că este complet

14883
11:36:03,360 --> 11:36:10,800
valabil. Am putea lua media

14884
11:36:06,560 --> 11:36:13,596
dormitoarele um. Mă refeream la totalul camerelor

14885
11:36:10,800 --> 11:36:15,680
aici. Ne pare rău, total de camere. Am putea

14886
11:36:13,596 --> 11:36:18,880
complet am putea completa cu

14887
11:36:15,680 --> 11:36:23,040
total camere pentru acea categorie um sau pt

14888
11:36:18,880 --> 11:36:24,880
acel rând. Hm, multe opțiuni. In aceasta

14889
11:36:23,040 --> 11:36:27,116
În cazul în care, de fapt, vom scăpa

14890
11:36:24,880 --> 11:36:30,160
acele rânduri pentru că ele alcătuiesc astfel de

14891
11:36:27,116 --> 11:36:33,680
procent mic față de cei 20.000

14892
11:36:30,160 --> 11:36:37,200
rânduri pe care le avem. Este cam 1%, nu?

14893
11:36:33,680 --> 11:36:39,520
200 de rânduri reprezintă aproximativ 1% din 20.000.

14894
11:36:37,200 --> 11:36:41,520
Deci, o să le scăpăm. Dar

14895
11:36:39,520 --> 11:36:43,840
asta e o alegere. Nu trebuie să cădem

14896
11:36:41,520 --> 11:36:46,400
ei. Am putea completa cu ceva.

14897
11:36:43,840 --> 11:36:52,200
Hm, și dacă am face asta, am folosi

14898
11:36:46,400 --> 11:36:52,200
umple na mai degrabă decât să arunce NA, nu?

14899
11:37:02,320 --> 11:37:08,320
După ce ai lăsat rândurile, câte? Deci

14900
11:37:05,200 --> 11:37:09,756
este așa după ce scăpăm rândurile, um

14901
11:37:08,320 --> 11:37:12,880
după ce scăpăm rândurile, pur și simplu merge

14902
11:37:09,756 --> 11:37:14,640
pentru a fi mai avem toate celelalte rânduri

14903
11:37:12,880 --> 11:37:17,640
sunt intacte, nu? Deci, dacă ne uităm la asta

14904
11:37:14,640 --> 11:37:17,640
acum,

14905
11:37:22,880 --> 11:37:28,960
acum avem um puțin uh puțin mai puțin

14906
11:37:26,960 --> 11:37:32,160
intrări.

14907
11:37:28,960 --> 11:37:36,000
Deci acum avem atât de multe, mai degrabă

14908
11:37:32,160 --> 11:37:39,960
decât atât de mulți,

14909
11:37:36,000 --> 11:37:39,960
nu? Am scăpat cei 200

14910
11:37:45,596 --> 11:37:48,800
Dar toate sunt completate. Da, sunt

14911
11:37:47,200 --> 11:37:50,400
Deci toate celelalte coloane sunt nemișcate

14912
11:37:48,800 --> 11:37:52,160
completat. Suntem doar noi suntem

14913
11:37:50,400 --> 11:37:54,960
decupând întregul rând. Deci dacă tu

14914
11:37:52,160 --> 11:37:58,400
Gândește-te la setul nostru de date, le avem pe toate

14915
11:37:54,960 --> 11:38:00,160
aceste rânduri și toate aceste coloane. Ce

14916
11:37:58,400 --> 11:38:02,560
facem este ca și cum ar fi un nul

14917
11:38:00,160 --> 11:38:05,116
aici, doar că tocmai scăpăm

14918
11:38:02,560 --> 11:38:09,320
a întregului rând, nu? Și așa noi

14919
11:38:05,116 --> 11:38:09,320
au încă toate celelalte rânduri intacte.

14920
11:38:14,240 --> 11:38:20,756
Uh, le putem scăpa pentru că avem o

14921
11:38:16,560 --> 11:38:20,756
dimensiune bună a eșantionului. Da,

14922
11:38:22,640 --> 11:38:25,756
este exact, Ronald. Da, noi

14923
11:38:24,240 --> 11:38:28,640
le putem renunța pentru că avem avem

14924
11:38:25,756 --> 11:38:33,400
20.000 de rânduri și doar 200 lipsesc

14925
11:38:28,640 --> 11:38:33,400
valorile. Deci, e perfect.

14926
11:38:35,596 --> 11:38:40,320
Uh, drop a elimină toate rândurile care au vreuna

14927
11:38:37,596 --> 11:38:42,160
nulă. Da, este adevărat. Se va duce

14928
11:38:40,320 --> 11:38:44,560
înainte și aruncați orice rând unde

14929
11:38:42,160 --> 11:38:48,360
există orice nul, indiferent de ce coloană

14930
11:38:44,560 --> 11:38:48,360
este înăuntru. Da,

14931
11:38:55,840 --> 11:39:03,040
index. Da, indexul nu ajunge

14932
11:38:57,596 --> 11:39:05,520
resetare. E adevărat. Deci ce noi

14933
11:39:03,040 --> 11:39:08,640
ceea ce poți face întotdeauna este să poți reseta

14934
11:39:05,520 --> 11:39:10,400
indicele. Deci, um, dacă vrei, este

14935
11:39:08,640 --> 11:39:12,320
opțional. Noi chiar nu o să facem

14936
11:39:10,400 --> 11:39:14,240
folosiți indexul pentru orice

14937
11:39:12,320 --> 11:39:19,520
important, nu? Dar ce am putea face

14938
11:39:14,240 --> 11:39:21,040
este, uh, resetarea indexului.

14939
11:39:19,520 --> 11:39:22,640
Uh,

14940
11:39:21,040 --> 11:39:26,040
am putea face asta, nu? Ceea ce va

14941
11:39:22,640 --> 11:39:26,040
reseta-l.

14942
11:39:36,960 --> 11:39:41,160
Așa că acum este resetat.

14943
11:39:56,480 --> 11:40:01,200
Dar lasă-mă, de fapt, nu, nu

14944
11:39:59,200 --> 11:40:05,000
chiar vreau să fac asta. ma duc

14945
11:40:01,200 --> 11:40:05,000
resetați acest lucru.

14946
11:40:08,240 --> 11:40:11,240
um,

14947
11:40:16,880 --> 11:40:20,596
da, am putea face asta.

14948
11:40:38,560 --> 11:40:43,040
Bine.

14949
11:40:40,240 --> 11:40:45,116
Deci, acum important ar trebui să existe uh nu

14950
11:40:43,040 --> 11:40:46,880
lipsesc date despre aceasta din nou

14951
11:40:45,116 --> 11:40:49,436
unde am aruncat NAS-ul corect. Deci acum

14952
11:40:46,880 --> 11:40:51,276
asta e bine. Dacă tu acum motivul pentru care noi

14953
11:40:49,436 --> 11:40:53,840
a trebuit să facem asta pentru că dacă încercăm

14954
11:40:51,276 --> 11:40:57,756
construim o regresie liniară și avem

14955
11:40:53,840 --> 11:40:59,916
nu există acolo, problema este ca

14956
11:40:57,756 --> 11:41:03,560
cum construiești un model acolo unde ai

14957
11:40:59,916 --> 11:41:03,560
ceva de genul acesta

14958
11:41:08,320 --> 11:41:14,240
și acestea sunt nule, cum ar fi ceea ce faci

14959
11:41:10,960 --> 11:41:17,840
inmultiti un numar cu un nul?

14960
11:41:14,240 --> 11:41:23,320
Nu putem face asta, nu?

14961
11:41:17,840 --> 11:41:23,320
Nu putem face asta cu adevărat. Deci, um,

14962
11:41:27,116 --> 11:41:32,320
deci, uh, trebuie să scăpăm de

14963
11:41:30,000 --> 11:41:35,200
NLES ca nulul nu este chiar

14964
11:41:32,320 --> 11:41:37,040
mergi să lucrez acolo. Deci, avem nevoie

14965
11:41:35,200 --> 11:41:38,720
pentru a scăpa de ele pentru regresia liniară

14966
11:41:37,040 --> 11:41:40,880
pentru a avea cu adevărat șansa de a lucra,

14967
11:41:38,720 --> 11:41:42,400
corect? Pentru a-l antrena și a putea folosi

14968
11:41:40,880 --> 11:41:46,360
ea.

14969
11:41:42,400 --> 11:41:46,360
Trebuie să scapi de acele nles.

14970
11:41:50,560 --> 11:41:54,240
În regulă,

14971
11:41:52,960 --> 11:41:55,680
vreo intrebare pana acum? Deci, nu am făcut-o

14972
11:41:54,240 --> 11:41:57,756
a făcut vreo modelare încă. Facem ceva

14973
11:41:55,680 --> 11:41:59,276
Facem ceva pregătiri de date înainte

14974
11:41:57,756 --> 11:42:00,960
ajungem la modelare. Și nu am făcut-o

14975
11:41:59,276 --> 11:42:02,400
a făcut încă vreo validare încrucișată. Noi

14976
11:42:00,960 --> 11:42:04,320
nu am setat asta. Doar facem

14977
11:42:02,400 --> 11:42:06,960
pregătirea datelor noastre înainte de a ajunge la

14978
11:42:04,320 --> 11:42:10,480
modelarea. Corect. Deci, am scăpat

14979
11:42:06,960 --> 11:42:12,560
unele NAS. L-am verificat. Hm, suntem

14980
11:42:10,480 --> 11:42:16,880
o să mai fac un pas de pregătire, adică

14981
11:42:12,560 --> 11:42:18,800
să schimbi acea apropiere a oceanului

14982
11:42:16,880 --> 11:42:20,800
caracteristică în ceva numeric deoarece

14983
11:42:18,800 --> 11:42:23,040
din nou, cum construiești un model unde

14984
11:42:20,800 --> 11:42:25,520
inserezi un șir în acelea

14985
11:42:23,040 --> 11:42:27,276
ca beta 1, beta 2, beta de 3 ori de

14986
11:42:25,520 --> 11:42:30,480
caracteristici? Chiar nu poți face asta când

14987
11:42:27,276 --> 11:42:32,480
este o sfoară. Hm, deci ce mergem

14988
11:42:30,480 --> 11:42:33,756
de făcut și o să scap de asta

14989
11:42:32,480 --> 11:42:38,720
pentru că nu cred că avem nevoie

14990
11:42:33,756 --> 11:42:42,640
că. um este că vom conduce asta

14991
11:42:38,720 --> 11:42:46,400
Obține funcția manechine care este um nostru

14992
11:42:42,640 --> 11:42:48,960
Obține funcția manechine este cea obișnuită

14993
11:42:46,400 --> 11:42:51,840
uh, unul dintre manechinele noastre git este cel obișnuit

14994
11:42:48,960 --> 11:42:55,200
la um

14995
11:42:51,840 --> 11:42:59,880
uh, obțineți singura noastră codificare fierbinte. Deci asta este

14996
11:42:55,200 --> 11:42:59,880
codificarea noastră fierbinte aici.

14997
11:43:02,640 --> 11:43:08,000
Acum vom avea date care sunt

14998
11:43:05,680 --> 11:43:10,800
asa, nu? Deci avem ocean. Deci

14999
11:43:08,000 --> 11:43:14,080
Deci, apropo, acest prefix

15000
11:43:10,800 --> 11:43:16,800
um, acest prefix este OP, care este

15001
11:43:14,080 --> 11:43:19,520
prescurtare pentru apropierea oceanului, nu? Deci noi

15002
11:43:16,800 --> 11:43:22,080
au apropierea oceanului mai puțin de 1 oră

15003
11:43:19,520 --> 11:43:24,720
de la ocean, apropierea oceanului în interior,

15004
11:43:22,080 --> 11:43:27,200
insulă aproape de ocean, lângă golf, aproape

15005
11:43:24,720 --> 11:43:30,160
ocean. Deci primele cinci rânduri sunt aproape

15006
11:43:27,200 --> 11:43:32,560
golful. Deci au unul acolo și

15007
11:43:30,160 --> 11:43:35,040
un zero în celelalte locuri. Deci asta este

15008
11:43:32,560 --> 11:43:39,680
bine. Acesta codifică această caracteristică

15009
11:43:35,040 --> 11:43:41,596
în aceste valori numerice uh,

15010
11:43:39,680 --> 11:43:43,916
nu?

15011
11:43:41,596 --> 11:43:47,160
Ați fost capabili să o conduceți? The

15012
11:43:43,916 --> 11:43:47,160
obține manechine

15013
11:43:51,276 --> 11:43:54,960
Deci motivul pentru care Da, este grozav

15014
11:43:53,116 --> 11:43:58,640
întrebare. Cum a mers în apropierea oceanului?

15015
11:43:54,960 --> 11:44:01,116
Pentru că asta e singurul

15016
11:43:58,640 --> 11:44:03,116
caracteristica șir pe care o avem. Asta e singurul

15017
11:44:01,116 --> 11:44:05,520
una pe care o avem. Deci o să arate

15018
11:44:03,116 --> 11:44:07,520
pentru orice non-numerice și unul fierbinte

15019
11:44:05,520 --> 11:44:10,960
codifica pe acelea oricat de multe oricat de multe

15020
11:44:07,520 --> 11:44:12,560
există. Deci orice obiecte avem

15021
11:44:10,960 --> 11:44:17,000
care sunt șiruri, va fi

15022
11:44:12,560 --> 11:44:17,000
automat oneh fierbinte le codifică.

15023
11:44:23,276 --> 11:44:27,520
Da, am putea avea dreptul

15024
11:44:24,880 --> 11:44:30,960
a mers aici și a făcut bine. Am putea avea

15025
11:44:27,520 --> 11:44:33,680
făcut ocean

15026
11:44:30,960 --> 11:44:36,960
apropiere,

15027
11:44:33,680 --> 11:44:38,480
dar avem doar una dintre aceste caracteristici.

15028
11:44:36,960 --> 11:44:40,640
Deci, o să facă asta

15029
11:44:38,480 --> 11:44:43,200
întreg cadrul de date

15030
11:44:40,640 --> 11:44:46,640
pe acea caracteristică. Deci, ceea ce suntem

15031
11:44:43,200 --> 11:44:50,720
o să faci este să mergi înainte și să-l împarte

15032
11:44:46,640 --> 11:44:54,000
într-un X și un Y um care este X

15033
11:44:50,720 --> 11:44:55,680
întotdeauna ceea ce include caracteristicile noastre. Y

15034
11:44:54,000 --> 11:44:59,916
este ceea ce încercăm să prevedem, care

15035
11:44:55,680 --> 11:45:01,520
este eticheta. Acum, um, pentru a

15036
11:44:59,916 --> 11:45:04,320
separă-le, ceea ce vom face

15037
11:45:01,520 --> 11:45:08,720
do este alocarea lui X pentru a fi variabila care

15038
11:45:04,320 --> 11:45:10,640
este, um, cadrul nostru de date minus această mediană

15039
11:45:08,720 --> 11:45:14,960
coloana valorii casei. Deci ce este asta

15040
11:45:10,640 --> 11:45:17,436
a face este um uh nu este permanent

15041
11:45:14,960 --> 11:45:21,200
scăpăm pentru că nu scăpăm

15042
11:45:17,436 --> 11:45:24,320
este pe loc, dar ne întoarce a

15043
11:45:21,200 --> 11:45:26,720
copie a cadrului de date cu mediana

15044
11:45:24,320 --> 11:45:29,200
coloana valoarea casei stânga afară dreapta este

15045
11:45:26,720 --> 11:45:31,276
scăpat. Deci asta e ceva

15046
11:45:29,200 --> 11:45:33,840
vrem să facem pentru că asta va fi restul

15047
11:45:31,276 --> 11:45:38,800
din el va conține caracteristicile noastre, nu?

15048
11:45:33,840 --> 11:45:44,480
Deci asta se va întâmpla temporar sau ar trebui

15049
11:45:38,800 --> 11:45:48,560
spuneți să returnați o copie a DF cu um

15050
11:45:44,480 --> 11:45:50,880
valoarea medie a casei

15051
11:45:48,560 --> 11:45:53,756
a scapat,

15052
11:45:50,880 --> 11:45:57,040
nu? Valoarea medie a casei a scăzut. Um asa

15053
11:45:53,756 --> 11:45:58,800
mergem înainte și renunțăm la asta. Acum

15054
11:45:57,040 --> 11:46:01,116
amintiți-vă că nu este permanent. Este doar

15055
11:45:58,800 --> 11:46:04,320
dându-ne uh restul care

15056
11:46:01,116 --> 11:46:06,640
datele despre locuințe scad acest lucru și

15057
11:46:04,320 --> 11:46:08,960
se atribuie asta lui x și apoi suntem

15058
11:46:06,640 --> 11:46:11,840
luând valoarea medie reală a casei

15059
11:46:08,960 --> 11:46:13,756
coloană din datele originale și

15060
11:46:11,840 --> 11:46:17,276
atribuindu-l lui y. Deci asta se va întâmpla

15061
11:46:13,756 --> 11:46:22,240
fie etichetele noastre

15062
11:46:17,276 --> 11:46:25,116
corect. Deci asta este ceea ce încercăm

15063
11:46:22,240 --> 11:46:27,200
prezice.

15064
11:46:25,116 --> 11:46:29,840
Bine, deci acesta este Y-ul nostru și așa este întotdeauna

15065
11:46:27,200 --> 11:46:32,400
cum este. X este caracteristicile noastre, Y este a noastră

15066
11:46:29,840 --> 11:46:35,116
etichete. Hm, sperăm că are sens.

15067
11:46:32,400 --> 11:46:37,436
Ceea ce face acest lucru este asta

15068
11:46:35,116 --> 11:46:39,596
scapa de coloana aceea de etichete si

15069
11:46:37,436 --> 11:46:41,840
orice altceva vor fi caracteristicile noastre.

15070
11:46:39,596 --> 11:46:46,160
Și atunci aceasta va scăpa de această voință

15071
11:46:41,840 --> 11:46:48,880
doar atribuiți coloana de etichete lui Y.

15072
11:46:46,160 --> 11:46:51,840
În regulă. Și atunci ceea ce putem face este

15073
11:46:48,880 --> 11:46:54,320
treceți X și Y în diviziunea noastră de testare a trenului

15074
11:46:51,840 --> 11:46:56,400
funcția. Și aceasta va genera

15075
11:46:54,320 --> 11:46:58,880
ține set. Deci, dacă vrem să facem

15076
11:46:56,400 --> 11:47:01,116
Țineți validarea încrucișată, așa este

15077
11:46:58,880 --> 11:47:04,800
am face-o este am împărți

15078
11:47:01,116 --> 11:47:08,000
date în raze X, test X, tren Y, test Y

15079
11:47:04,800 --> 11:47:10,960
um folosind diviziunea de testare a trenului. Deci asta este

15080
11:47:08,000 --> 11:47:15,756
ce am facut ultima data. Asta ar fi

15081
11:47:10,960 --> 11:47:18,560
asta ar fi pentru ține cruce

15082
11:47:15,756 --> 11:47:22,960
validare,

15083
11:47:18,560 --> 11:47:25,840
nu? unde suntem uh uh am doar asta

15084
11:47:22,960 --> 11:47:28,480
unul un set pentru testare si unul pt

15085
11:47:25,840 --> 11:47:31,436
un set pentru antrenament un test un set

15086
11:47:28,480 --> 11:47:33,916
pentru testare ar trebui să spun corect așadar asta

15087
11:47:31,436 --> 11:47:36,560
este un test de tren destul de standard

15088
11:47:33,916 --> 11:47:39,436
trecem în acel x trecem în y we

15089
11:47:36,560 --> 11:47:41,276
utilizarea unei dimensiuni de test de 30% este destul de standard

15090
11:47:39,436 --> 11:47:43,116
și stare aleatorie astfel încât să obținem

15091
11:47:41,276 --> 11:47:46,800
amestecare consistentă dacă ar fi să alergăm

15092
11:47:43,116 --> 11:47:49,840
de mai multe ori primim asta

15093
11:47:46,800 --> 11:47:49,840
randomizare consistentă

15094
11:47:50,080 --> 11:47:55,916
bine,

15095
11:47:51,680 --> 11:47:59,596
deci avem asta și acum trenul nostru X

15096
11:47:55,916 --> 11:48:04,320
este un procentaj um din cadrul de date al

15097
11:47:59,596 --> 11:48:06,800
cele 20.000 de rânduri și testul X este uh

15098
11:48:04,320 --> 11:48:08,800
30% din asta. Deci sunt doar aproximativ 6.000

15099
11:48:06,800 --> 11:48:11,800
rânduri care este forma aia

15100
11:48:08,800 --> 11:48:11,800
este.

15101
11:48:12,000 --> 11:48:17,360
Da. X și X sunt caracteristicile noastre. Deci suntem

15102
11:48:15,040 --> 11:48:21,040
punem toate datele noastre în asta

15103
11:48:17,360 --> 11:48:24,880
caracteristicile noastre în X. Și astfel, um

15104
11:48:21,040 --> 11:48:26,720
cel mai eficient mod de a face asta este um

15105
11:48:24,880 --> 11:48:28,320
cel mai eficient mod de a face asta este

15106
11:48:26,720 --> 11:48:31,916
la

15107
11:48:28,320 --> 11:48:33,520
luați-ne datele și aruncați

15108
11:48:31,916 --> 11:48:36,080
coloana cu valoarea medie a casei pentru că asta este

15109
11:48:33,520 --> 11:48:38,240
coloana noastră de etichete. Deci doar scoatem

15110
11:48:36,080 --> 11:48:40,400
că. Restul datelor sunt ale noastre

15111
11:48:38,240 --> 11:48:42,080
caracteristici. Deci asta este ceea ce

15112
11:48:40,400 --> 11:48:44,640
acest X este, nu? Este totul al nostru

15113
11:48:42,080 --> 11:48:46,880
date caracteristice. Toate coloanele noastre, adică

15114
11:48:44,640 --> 11:48:49,916
nu coloana etichetă este în esență ceea ce

15115
11:48:46,880 --> 11:48:54,320
asta face. Și apoi Y este eticheta noastră

15116
11:48:49,916 --> 11:48:58,000
coloană din datele noastre originale.

15117
11:48:54,320 --> 11:49:00,880
Corect? Y este coloana noastră de etichete. Și așa

15118
11:48:58,000 --> 11:49:04,320
acest lucru va conține toate noastre

15119
11:49:00,880 --> 11:49:07,840
etichete care este valoarea mediană a casei.

15120
11:49:04,320 --> 11:49:10,960
X X X conține fiecare coloană, cu excepția uneia

15121
11:49:07,840 --> 11:49:15,840
o să ne hotărâm în cele din urmă

15122
11:49:10,960 --> 11:49:18,400
că dar X conține um X este totul

15123
11:49:15,840 --> 11:49:20,800
aceasta nu este variabila noastră dependentă care

15124
11:49:18,400 --> 11:49:22,720
este ceea ce prezicem noi. Deci suntem

15125
11:49:20,800 --> 11:49:25,520
eliminând ceea ce încercăm să prezicem

15126
11:49:22,720 --> 11:49:27,680
de la X. X ar trebui să fie orice altceva.

15127
11:49:25,520 --> 11:49:29,916
Așa va fi întotdeauna. X este

15128
11:49:27,680 --> 11:49:32,480
X va fi întotdeauna toate acestea

15129
11:49:29,916 --> 11:49:36,640
variabile independente pe care le folosim

15130
11:49:32,480 --> 11:49:38,480
pentru a prezice valoarea medie a casei. Deci noi

15131
11:49:36,640 --> 11:49:42,000
urmează să prezică casa mediană

15132
11:49:38,480 --> 11:49:44,320
valoare. Trebuie să-l eliminăm din X.

15133
11:49:42,000 --> 11:49:47,960
Deci luăm totul, dar

15134
11:49:44,320 --> 11:49:47,960
acea coloană.

15135
11:49:49,756 --> 11:49:54,960
Deci este întregul cadru de date. Este

15136
11:49:52,000 --> 11:49:59,560
întreg cadrul de date minus această coloană

15137
11:49:54,960 --> 11:49:59,560
doar cu variabila dependentă. Corect.

15138
11:49:59,596 --> 11:50:01,916
Exact corect. Înlăturarea dependentului

15139
11:50:00,960 --> 11:50:04,560
variabilă și păstrând toate cele

15140
11:50:01,916 --> 11:50:07,360
independenta. Este exact.

15141
11:50:04,560 --> 11:50:08,960
Exact corect. Deci gândește-te la asta

15142
11:50:07,360 --> 11:50:10,480
termenii modelului. Să ne întoarcem la

15143
11:50:08,960 --> 11:50:13,680
caracteristici. Corect. Gândește-te la asta în termeni

15144
11:50:10,480 --> 11:50:16,880
a modelului. Încercăm să anticipăm

15145
11:50:13,680 --> 11:50:19,840
aceasta aceasta valoare. Construim un model

15146
11:50:16,880 --> 11:50:24,000
pentru a încerca să prezic asta. Deci mergem

15147
11:50:19,840 --> 11:50:27,276
pentru a te asigura că X este totul, în afară de asta

15148
11:50:24,000 --> 11:50:29,680
corect. Deci acesta este de fapt doar Y.

15149
11:50:27,276 --> 11:50:32,480
Asta e eticheta noastră. Asta e dependenta noastră

15150
11:50:29,680 --> 11:50:35,840
variabilă. Corect? Acesta este Y. Totul

15151
11:50:32,480 --> 11:50:41,080
else is apartine lui X. Orice altceva

15152
11:50:35,840 --> 11:50:41,080
aparține lui X, inclusiv toate acestea.

15153
11:50:42,640 --> 11:50:45,916
Corect? Îl alegem pe acesta să fie Y

15154
11:50:44,640 --> 11:50:49,596
pentru că construim un model pentru

15155
11:50:45,916 --> 11:50:52,240
prezice asta. Asta e eticheta noastră.

15156
11:50:49,596 --> 11:50:54,560
În regulă. Deci, avem noi folosim X și

15157
11:50:52,240 --> 11:50:57,360
Y pentru a face testul de tren. Deci, noi

15158
11:50:54,560 --> 11:50:58,720
au caracteristicile noastre de antrenament și ale noastre

15159
11:50:57,360 --> 11:51:01,916
funcțiile de testare și apoi antrenamentul nostru

15160
11:50:58,720 --> 11:51:04,480
etichetă și etichete de testare aici. Um, drăguță

15161
11:51:01,916 --> 11:51:06,960
standard acolo.

15162
11:51:04,480 --> 11:51:10,080
Bine. Deci, asta este noutatea dacă

15163
11:51:06,960 --> 11:51:12,640
vrem să facem validarea K-fold, ce

15164
11:51:10,080 --> 11:51:14,800
vom face este să creăm un kfold

15165
11:51:12,640 --> 11:51:17,360
obiect. Deci, avem acest kffold de la

15166
11:51:14,800 --> 11:51:22,000
scikitlearn pe care l-am importat deja. noi

15167
11:51:17,360 --> 11:51:24,240
vom crea un kfold um unde noi

15168
11:51:22,000 --> 11:51:27,200
vom specifica câte pliuri avem

15169
11:51:24,240 --> 11:51:30,880
vreau. Deci asta este in uh inslits

15170
11:51:27,200 --> 11:51:34,080
parametru așa cum spune asta, asta merge

15171
11:51:30,880 --> 11:51:36,560
să fie uh uh în acest caz vom merge

15172
11:51:34,080 --> 11:51:38,800
face 10 pliuri. Asta e destul de standard. Deci

15173
11:51:36,560 --> 11:51:40,640
Cred că numărul tipic de pliuri care

15174
11:51:38,800 --> 11:51:44,160
Am văzut și am lucrat în interiorul meu

15175
11:51:40,640 --> 11:51:49,040
cariera mea este de obicei cinci sau zece.

15176
11:51:44,160 --> 11:51:51,360
Cinci sau 10 pliuri este standardul.

15177
11:51:49,040 --> 11:51:53,520
Bine. Deci, facem 10 falduri în asta

15178
11:51:51,360 --> 11:51:55,680
caz și setăm o stare aleatorie

15179
11:51:53,520 --> 11:51:57,276
pentru că o să facem amestecare. Deci,

15180
11:51:55,680 --> 11:51:58,960
pentru a produce acele pliuri, suntem

15181
11:51:57,276 --> 11:52:01,916
mergând să amestecați mai întâi datele și apoi

15182
11:51:58,960 --> 11:52:04,080
împărțiți-l în cinci ori, nu? Deci,

15183
11:52:01,916 --> 11:52:08,800
acest obiect kfold va fi

15184
11:52:04,080 --> 11:52:10,800
reușiți să creați aceste divizări pentru noi,

15185
11:52:08,800 --> 11:52:13,116
nu? Acestea chiar se despart. eu stiu eu

15186
11:52:10,800 --> 11:52:15,360
nici măcar nu l-am desenat, dar merge

15187
11:52:13,116 --> 11:52:17,040
să gestioneze aceste cinci pliuri pentru noi și

15188
11:52:15,360 --> 11:52:19,520
va amesteca datele și

15189
11:52:17,040 --> 11:52:21,360
atribuie-le acestor pliuri diferite și

15190
11:52:19,520 --> 11:52:24,320
suntem și atunci ceea ce vom face este

15191
11:52:21,360 --> 11:52:26,000
folosiți-le pentru a ne antrena. Suntem

15192
11:52:24,320 --> 11:52:29,680
urmează să execute validarea încrucișată

15193
11:52:26,000 --> 11:52:32,400
folosind acest obiect k-fold.

15194
11:52:29,680 --> 11:52:35,680
Bine, așa că creăm kffold

15195
11:52:32,400 --> 11:52:38,000
inițializam și modelul nostru. Deci,

15196
11:52:35,680 --> 11:52:39,840
desigur, pentru a antrena ceva

15197
11:52:38,000 --> 11:52:42,000
în Kfolds, vom avea nevoie de un

15198
11:52:39,840 --> 11:52:44,160
model. În acest caz, folosim liniar

15199
11:52:42,000 --> 11:52:46,400
regresie, nu? Care este care este

15200
11:52:44,160 --> 11:52:49,200
modelul pe care l-am studiat până acum. Deci,

15201
11:52:46,400 --> 11:52:51,680
ai o regresie liniară. Hm acum,

15202
11:52:49,200 --> 11:52:54,320
uite ce usor va fi in ordine

15203
11:52:51,680 --> 11:52:58,640
pentru a executa validarea încrucișată. Tot ce ne trebuie

15204
11:52:54,320 --> 11:53:02,000
a face este um tot ce trebuie să facem este să creăm

15205
11:52:58,640 --> 11:53:04,080
o funcție de scor încrucișat.

15206
11:53:02,000 --> 11:53:06,320
um sau ar trebui să spun că folosește crucea val

15207
11:53:04,080 --> 11:53:08,480
funcția de scor de la scikitlearn. Deci noi

15208
11:53:06,320 --> 11:53:11,756
folosiți asta cu modelul pe care vrem

15209
11:53:08,480 --> 11:53:14,080
tren. Deci modelul nostru merge primul. Deci

15210
11:53:11,756 --> 11:53:17,116
acesta este obiectul de regresie liniară.

15211
11:53:14,080 --> 11:53:20,160
Apoi datele noastre. Deci, caracteristicile noastre suplimentare

15212
11:53:17,116 --> 11:53:23,040
și eticheta noastră pentru formarea noastră.

15213
11:53:20,160 --> 11:53:24,880
Și apoi lasă-mă să trec peste asta pentru a

15214
11:53:23,040 --> 11:53:30,880
al doilea. Voi explica ce este asta într-un

15215
11:53:24,880 --> 11:53:33,436
al doilea. Hm, dar atunci folosim uh

15216
11:53:30,880 --> 11:53:35,200
tehnica de validare încrucișată este kfoldul nostru.

15217
11:53:33,436 --> 11:53:37,680
Așa că aici merge obiectul nostru k-fold

15218
11:53:35,200 --> 11:53:40,320
în parametrul CV care este cruce

15219
11:53:37,680 --> 11:53:42,000
validare. Deci ce validare încrucișată

15220
11:53:40,320 --> 11:53:44,720
strategie folosesti? Noi folosim

15221
11:53:42,000 --> 11:53:47,436
kfold și kfoldul pe care îl folosim este acesta

15222
11:53:44,720 --> 11:53:49,680
una pe care am definit-o aici sus KF. Deci suntem

15223
11:53:47,436 --> 11:53:54,000
punând asta chiar aici pentru asta. Şi

15224
11:53:49,680 --> 11:53:55,840
atunci um în locuri de muncă um ne permite

15225
11:53:54,000 --> 11:53:58,000
paralelizează acest lucru. Deci, dacă îl setăm

15226
11:53:55,840 --> 11:54:01,116
unul negativ, asta e asta

15227
11:53:58,000 --> 11:54:03,360
implicit. Um, o va face de fapt

15228
11:54:01,116 --> 11:54:06,320
antrenați-vă prin diferite combinații

15229
11:54:03,360 --> 11:54:07,840
în paralel. Hm, ceea ce o accelerează. Deci

15230
11:54:06,320 --> 11:54:12,560
vrei să vrei să păstrezi asta

15231
11:54:07,840 --> 11:54:15,116
unul negativ dacă poți. Deci acum lasă

15232
11:54:12,560 --> 11:54:20,000
descriu punctajul. Deci ce asta

15233
11:54:15,116 --> 11:54:23,116
înseamnă că am introdus în metrica noastră aici. Hm

15234
11:54:20,000 --> 11:54:25,916
și astfel puteți pune o eroare absolută,

15235
11:54:23,116 --> 11:54:29,200
puteți introduce o eroare pătrată medie. Hm

15236
11:54:25,916 --> 11:54:31,596
acestea sunt cele două pe care le putem folosi. Şi

15237
11:54:29,200 --> 11:54:34,960
um motivul pentru care are un negativ

15238
11:54:31,596 --> 11:54:38,880
în fața ei este pentru că vrem să găsim

15239
11:54:34,960 --> 11:54:41,360
cel care are cel mai mic punctaj.

15240
11:54:38,880 --> 11:54:43,840
Acesta va fi cel mai bun model al nostru este

15241
11:54:41,360 --> 11:54:46,640
unul care are cel mai mic punctaj. Deci noi

15242
11:54:43,840 --> 11:54:48,960
ia valoarea absolută.

15243
11:54:46,640 --> 11:54:52,960
Îmi pare rău. luăm abdomenul

15244
11:54:48,960 --> 11:54:56,240
metrică și luăm negativul lui um

15245
11:54:52,960 --> 11:54:59,680
pentru că merge cel mai mare scor

15246
11:54:56,240 --> 11:55:02,480
să fie cel mai aproape de zero. Um asa e

15247
11:54:59,680 --> 11:55:05,436
doar a folosim negativul de

15248
11:55:02,480 --> 11:55:08,720
a metricului um deoarece pe

15249
11:55:05,436 --> 11:55:12,400
linia numerică ca cea mai mare um

15250
11:55:08,720 --> 11:55:14,560
punctajul unu ar trebui să fie cel mai mic um sau I

15251
11:55:12,400 --> 11:55:16,240
ar trebui să spunem maximul negativ pe care noi

15252
11:55:14,560 --> 11:55:18,400
poate obține. asta va fi cel mai aproape de

15253
11:55:16,240 --> 11:55:22,400
asta la zero. Deci, dacă aici este zero, asta

15254
11:55:18,400 --> 11:55:25,840
ar fi ca și cum -1 este mai bun decât -10,

15255
11:55:22,400 --> 11:55:29,360
nu? Deci, ceva care marchează

15256
11:55:25,840 --> 11:55:32,160
maxim negativ uh eroare absolută ar

15257
11:55:29,360 --> 11:55:34,640
fi cel mai aproape de zero

15258
11:55:32,160 --> 11:55:37,040
și ceva care are mai mult se va întâmpla

15259
11:55:34,640 --> 11:55:39,360
fi de partea asta.

15260
11:55:37,040 --> 11:55:42,800
Deci acesta este doar motivul pentru care avem nevoie de asta

15261
11:55:39,360 --> 11:55:47,596
este doar pentru a ține evidența scorurilor

15262
11:55:42,800 --> 11:55:49,680
de fiecare individ um fold. Bine.

15263
11:55:47,596 --> 11:55:51,680
Deci, motivul pentru care putem face asta

15264
11:55:49,680 --> 11:55:55,360
este la sfârșit putem să vedem care

15265
11:55:51,680 --> 11:55:57,200
care combinație a funcționat cel mai bine. Hm

15266
11:55:55,360 --> 11:56:00,880
va fi cel care are

15267
11:55:57,200 --> 11:56:04,916
cea mai mare uh cea mai mare valoare a negativului

15268
11:56:00,880 --> 11:56:04,916
care este cel mai aproape de zero.

15269
11:56:08,640 --> 11:56:13,916
Asta e doar o convenție.

15270
11:56:11,276 --> 11:56:15,916
Da, doar pentru că este pentru că

15271
11:56:13,916 --> 11:56:18,080
validarea încrucișată urmărește

15272
11:56:15,916 --> 11:56:20,480
maximizați metrica. Deci, orice are

15273
11:56:18,080 --> 11:56:23,040
cel mai bun punctaj

15274
11:56:20,480 --> 11:56:25,840
oricine are cel mai bun punctaj este

15275
11:56:23,040 --> 11:56:28,960
considerată cea mai bună performanță. Hm

15276
11:56:25,840 --> 11:56:31,596
dar folosim ceva unde

15277
11:56:28,960 --> 11:56:33,436
mai jos este mai bine. Deci luăm

15278
11:56:31,596 --> 11:56:37,200
negativ și ca cel mai înalt

15279
11:56:33,436 --> 11:56:38,800
negativ ar fi cel mai aproape de zero,

15280
11:56:37,200 --> 11:56:42,520
nu? Cel mai mare negativ va fi

15281
11:56:38,800 --> 11:56:42,520
fi cel mai aproape de zero.

15282
11:56:42,800 --> 11:56:49,520
Așa că așa este, doar pentru că place

15283
11:56:45,200 --> 11:56:52,400
dorim ca scorul mai mic să fie cel mai bun.

15284
11:56:49,520 --> 11:56:56,560
Cel mai mic scor ar trebui să fie cel mai bun.

15285
11:56:52,400 --> 11:56:58,400
Deci luăm negativul. Hm și așa

15286
11:56:56,560 --> 11:57:03,720
ceva mai negativ se întâmplă

15287
11:56:58,400 --> 11:57:03,720
sa fie mai rau. Da, acesta este motivul.

15288
11:57:03,756 --> 11:57:11,040
Deci ceva care este în jos în acest fel este

15289
11:57:05,680 --> 11:57:13,200
va fi mai rau. Bine, deci rulează asta

15290
11:57:11,040 --> 11:57:15,276
și ceea ce puteți vedea este dacă noi de fapt

15291
11:57:13,200 --> 11:57:17,276
tipărim asta, dacă tipărim

15292
11:57:15,276 --> 11:57:20,596
Scoruri de k-fold, ceea ce ar trebui să obținem este 10

15293
11:57:17,276 --> 11:57:20,596
scoruri diferite.

15294
11:57:21,116 --> 11:57:27,040
Și puteți vedea că avem 10 diferite

15295
11:57:24,560 --> 11:57:28,640
uh scoruri aici care sunt toate negative

15296
11:57:27,040 --> 11:57:32,320
pentru că luăm negativul

15297
11:57:28,640 --> 11:57:37,200
absolut al erorii absolute medii. Hm

15298
11:57:32,320 --> 11:57:39,916
deci ceea ce am căuta aici este

15299
11:57:37,200 --> 11:57:42,080
um, vrem să luăm media acestora

15300
11:57:39,916 --> 11:57:44,560
scoruri dar iau valoarea absolută a

15301
11:57:42,080 --> 11:57:46,720
pentru a obține cele mai bune performanțe. Deci

15302
11:57:44,560 --> 11:57:49,276
aceasta este capturarea ca acesta este scorul

15303
11:57:46,720 --> 11:57:50,720
pe prima combinație de pliuri. Aceasta este

15304
11:57:49,276 --> 11:57:52,800
scorul de pe al doilea fold

15305
11:57:50,720 --> 11:57:55,436
combinație. Acesta este scorul pe

15306
11:57:52,800 --> 11:57:58,160
a treia combinație de ori și mai departe și mai departe și

15307
11:57:55,436 --> 11:58:02,240
pe. Și acestea sunt erorile absolute.

15308
11:57:58,160 --> 11:58:05,200
Bine, acestea sunt erorile absolute. Hm

15309
11:58:02,240 --> 11:58:07,040
deci dacă ne uităm la calculul uh

15310
11:58:05,200 --> 11:58:08,960
medie, care apropo, nu avem nevoie

15311
11:58:07,040 --> 11:58:12,640
acest import pentru că folosim

15312
11:58:08,960 --> 11:58:15,916
medie numpy. Deci e bine. um putem

15313
11:58:12,640 --> 11:58:20,480
ia valoarea absolută a acelor um și

15314
11:58:15,916 --> 11:58:24,160
aruncați o privire la MSE medie

15315
11:58:20,480 --> 11:58:27,276
sau scuze MAE. Acum vreau să te gândești

15316
11:58:24,160 --> 11:58:29,200
despre asta această performanță medie.

15317
11:58:27,276 --> 11:58:31,276
Deci aceasta este performanța noastră chiar aici

15318
11:58:29,200 --> 11:58:33,596
validarea încrucișată.

15319
11:58:31,276 --> 11:58:35,200
Aceasta este media noastră

15320
11:58:33,596 --> 11:58:37,436
MAE

15321
11:58:35,200 --> 11:58:38,960
în toate combinațiile noastre de pliuri. Deci

15322
11:58:37,436 --> 11:58:41,916
asta este un indicator al nostru

15323
11:58:38,960 --> 11:58:44,320
performanta, nu? um pentru cruce

15324
11:58:41,916 --> 11:58:49,040
validare.

15325
11:58:44,320 --> 11:58:53,596
Acum, care sunt unitățile originalului nostru

15326
11:58:49,040 --> 11:58:56,720
uh, valoarea mediană inițială? Ei sunt

15327
11:58:53,596 --> 11:58:59,916
deja în mii, nu? Deci, dacă

15328
11:58:56,720 --> 11:59:03,436
mergem la acea funcție, sunt deja

15329
11:58:59,916 --> 11:59:07,840
în aceste sute de mii. Deci, asta

15330
11:59:03,436 --> 11:59:10,080
nu este o eroare foarte bună. Este amabil

15331
11:59:07,840 --> 11:59:12,160
de mare, nu? pentru că este în aceasta este

15332
11:59:10,080 --> 11:59:15,276
49.000.

15333
11:59:12,160 --> 11:59:19,596
Um, atât de departe suntem

15334
11:59:15,276 --> 11:59:22,560
valoarea absolută în medie este de 49.000 USD

15335
11:59:19,596 --> 11:59:26,400
dolari pe valoarea mediană. Asta nu este

15336
11:59:22,560 --> 11:59:28,960
foarte bine. Deci acest scor

15337
11:59:26,400 --> 11:59:32,320
acest scor este

15338
11:59:28,960 --> 11:59:34,400
nu foarte bine. Deci acest model nu este

15339
11:59:32,320 --> 11:59:37,596
făcând atât de bine și putem vedea asta

15340
11:59:34,400 --> 11:59:42,240
comparând această eroare cu a noastră reală

15341
11:59:37,596 --> 11:59:45,596
date. Deci asta este în jur de 50.000

15342
11:59:42,240 --> 11:59:48,640
și valorile medii ale casei noastre sunt în

15343
11:59:45,596 --> 11:59:51,200
sutele de mii. Deci, în medie

15344
11:59:48,640 --> 11:59:54,480
avem 50.000 de reduceri când facem o

15345
11:59:51,200 --> 11:59:56,080
predictie. Aceasta este o sumă semnificativă,

15346
11:59:54,480 --> 11:59:59,436
nu? Este o cantitate semnificativă pe

15347
11:59:56,080 --> 12:00:03,436
medie, atunci când sunt datele noastre

15348
11:59:59,436 --> 12:00:06,240
despre sutele de mii de aici.

15349
12:00:03,436 --> 12:00:09,276
Deci suntem um avem un semnificativ

15350
12:00:06,240 --> 12:00:11,840
cantitatea de eroare 50.000 în raport cu h

15351
12:00:09,276 --> 12:00:14,480
la unitățile noastre în care se află datele noastre.

15352
12:00:11,840 --> 12:00:17,360
nu? Deci acest scor nu este foarte

15353
12:00:14,480 --> 12:00:18,960
bine. Hm

15354
12:00:17,360 --> 12:00:20,560
și așa vedem că de pe cruce

15355
12:00:18,960 --> 12:00:22,960
validare. Deci uite ce usoara este crucea

15356
12:00:20,560 --> 12:00:24,640
val este. Din nou facem doar cross val

15357
12:00:22,960 --> 12:00:27,916
scor. Am pus în modelul nostru. Am pus

15358
12:00:24,640 --> 12:00:30,800
datele noastre. Am introdus validarea încrucișată

15359
12:00:27,916 --> 12:00:32,880
uh strategie aici, care este k-fold și noi

15360
12:00:30,800 --> 12:00:35,200
poate genera aceste valori pentru toate

15361
12:00:32,880 --> 12:00:37,116
combinațiile de pliuri. Deci asta este

15362
12:00:35,200 --> 12:00:39,520
funcția se ocupă de rotație

15363
12:00:37,116 --> 12:00:42,400
acelea și făcând fiecare combo cu doar

15364
12:00:39,520 --> 12:00:44,880
cele 10 combinații diferite de aici

15365
12:00:42,400 --> 12:00:46,720
cel al pliurilor.

15366
12:00:44,880 --> 12:00:48,160
10 cazuri diferite în care aveți

15367
12:00:46,720 --> 12:00:50,800
știi că 10 pliuri diferite sunt cele

15368
12:00:48,160 --> 12:00:53,040
care sunt lăsate în afara evaluării.

15369
12:00:50,800 --> 12:00:55,840
Um, deci gestionează asta pentru noi

15370
12:00:53,040 --> 12:01:02,400
aceste date folosind aceste date de antrenament

15371
12:00:55,840 --> 12:01:06,116
aici. Um și noi uh le generăm

15372
12:01:02,400 --> 12:01:06,116
generează aceste scoruri.

15373
12:01:06,560 --> 12:01:12,720
Bine. Deci asta e kfold. Nu este greu să

15374
12:01:08,880 --> 12:01:14,640
face. Tot ce trebuie să faci este să folosești a

15375
12:01:12,720 --> 12:01:17,116
scorul încrucișat al fișierului. Și ne-am putea schimba

15376
12:01:14,640 --> 12:01:18,320
asta înseamnă o eroare pătrată. Ăsta ești tu

15377
12:01:17,116 --> 12:01:23,276
știm că am putea face și asta. Asta ar fi

15378
12:01:18,320 --> 12:01:24,960
destul de usor. Hm, deci nu ar fi nicio problemă.

15379
12:01:23,276 --> 12:01:27,116
Se întâmplă să folosim absolutul

15380
12:01:24,960 --> 12:01:29,436
eroare aici. Desigur, ne-ar putea folosi

15381
12:01:27,116 --> 12:01:31,916
eroare pătrată.

15382
12:01:29,436 --> 12:01:34,480
Ați reușit să faceți asta să ruleze

15383
12:01:31,916 --> 12:01:36,960
scoruri kfold?

15384
12:01:34,480 --> 12:01:38,880
Produce o matrice de 10 10 diferite

15385
12:01:36,960 --> 12:01:41,276
scoruri, care ar trebui să aibă sens deoarece

15386
12:01:38,880 --> 12:01:43,200
acestea sunt acestea sunt um noi suntem

15387
12:01:41,276 --> 12:01:45,200
împărțirea datelor noastre în 10 diferite

15388
12:01:43,200 --> 12:01:47,520
pliuri,

15389
12:01:45,200 --> 12:01:49,680
nu?

15390
12:01:47,520 --> 12:01:51,756
10 pliuri diferite și lăsând unul afară

15391
12:01:49,680 --> 12:01:53,360
pentru a ne face evaluarea. Deci cel care

15392
12:01:51,756 --> 12:01:55,680
este lăsat afară de fiecare dată este ceea ce este

15393
12:01:53,360 --> 12:01:57,200
producerea acestor scoruri. Deci este 10

15394
12:01:55,680 --> 12:02:01,080
diferiți sunt lăsați afară când noi

15395
12:01:57,200 --> 12:02:01,080
rotiți prin toate combinațiile.

15396
12:02:02,160 --> 12:02:06,596
Și astfel facem media acestor scoruri

15397
12:02:11,276 --> 12:02:17,840
și obținem această cantitate din care facem

15398
12:02:13,040 --> 12:02:17,840
50.000 de erori în medie.

15399
12:02:22,320 --> 12:02:25,436
Um, ce crezi că ar fi ceea ce faci

15400
12:02:24,160 --> 12:02:27,680
crezi ca ar fi acceptabil? Deci, dacă

15401
12:02:25,436 --> 12:02:29,276
dacă prezicem prețul, de exemplu

15402
12:02:27,680 --> 12:02:32,080
dacă suntem agent imobiliar și suntem

15403
12:02:29,276 --> 12:02:34,560
prezicerea acestor preţuri şi ele

15404
12:02:32,080 --> 12:02:36,000
de obicei sunt

15405
12:02:34,560 --> 12:02:38,320
Da, aproape de zero ar fi grozav.

15406
12:02:36,000 --> 12:02:40,160
Ar fi fantastic. Mai aproape de zero

15407
12:02:38,320 --> 12:02:43,160
ar fi mai bine. Media este um

15408
12:02:40,160 --> 12:02:43,160
206.000.

15409
12:02:43,596 --> 12:02:49,276
Deci 50.000 este un procent decent din

15410
12:02:46,240 --> 12:02:52,240
că. Ca să știi că o poți calcula

15411
12:02:49,276 --> 12:02:55,520
ca procent nu? Deci 50.000 este a

15412
12:02:52,240 --> 12:02:58,320
procent decent din asta. Hm, probabil

15413
12:02:55,520 --> 12:03:03,116
vrei ca acesta să fie mai mic de 20.000

15414
12:02:58,320 --> 12:03:07,840
ar fi o eroare de aproximativ 10%. 20.000

15415
12:03:03,116 --> 12:03:10,840
corect? Deci poate 30.000 undeva în

15416
12:03:07,840 --> 12:03:10,840
Acolo.

15417
12:03:12,160 --> 12:03:16,800
Da. 10% ar fi o eroare de 5%. 10.000

15418
12:03:15,040 --> 12:03:18,880
ar fi o eroare de 5%. Este adevărat. Asta e

15419
12:03:16,800 --> 12:03:20,800
adevărat. Deci asta ar fi asa

15420
12:03:18,880 --> 12:03:23,436
mult mai bine. Deci fiind mai aproape de zero,

15421
12:03:20,800 --> 12:03:26,720
desigur, cu cât este mai mic, cu atât mai bine.

15422
12:03:23,436 --> 12:03:28,320
Desigur. Hm, dar da, aș spune an

15423
12:03:26,720 --> 12:03:31,520
procentul acceptabil de eroare este

15424
12:03:28,320 --> 12:03:34,320
probabil 20%.

15425
12:03:31,520 --> 12:03:36,400
Probabil 20%, ceea ce ar fi

15426
12:03:34,320 --> 12:03:39,276
40.000 sau mai puțin ar fi probabil

15427
12:03:36,400 --> 12:03:41,200
acceptabil.

15428
12:03:39,276 --> 12:03:46,240
De obicei când noi de obicei când construiești

15429
12:03:41,200 --> 12:03:48,960
modelele um 80% precizie este de obicei uh

15430
12:03:46,240 --> 12:03:51,756
considerat decent.

15431
12:03:48,960 --> 12:03:55,596
De obicei considerat decent

15432
12:03:51,756 --> 12:03:58,916
80%. Deci, aș spune că ar fi 40.000 sau mai puțin

15433
12:03:55,596 --> 12:03:58,916
un fel de ideal.

15434
12:04:00,800 --> 12:04:05,276
Are sens să răspund la

15435
12:04:03,596 --> 12:04:06,640
intrebare?

15436
12:04:05,276 --> 12:04:09,276
E o întrebare bună. Ce valoare este

15437
12:04:06,640 --> 12:04:12,400
acceptabil? Cred că probabil mai puțin de

15438
12:04:09,276 --> 12:04:16,160
40.000 ar fi ideal. Așa este

15439
12:04:12,400 --> 12:04:19,360
eroare de aproximativ 20%.

15440
12:04:16,160 --> 12:04:21,520
Bine, deci asta e kfold. Hai să facem

15441
12:04:19,360 --> 12:04:23,520
doar o reținere obișnuită acum. Deci asta este

15442
12:04:21,520 --> 12:04:26,320
folosind doar datele noastre de instruire și testare.

15443
12:04:23,520 --> 12:04:29,360
Um facand model.pot si calculeaza an

15444
12:04:26,320 --> 12:04:32,160
MSE pe datele de testare. Deci asta este

15445
12:04:29,360 --> 12:04:35,436
doar um ține strategia aici unde

15446
12:04:32,160 --> 12:04:37,520
doar că asta este mai puțin robust, dar

15447
12:04:35,436 --> 12:04:41,840
este mult mai rapid de făcut și mai ușor de făcut

15448
12:04:37,520 --> 12:04:46,800
pus la punct. Corect? Deci, asta folosește

15449
12:04:41,840 --> 12:04:50,640
ține strategia. Deci doar un obișnuit

15450
12:04:46,800 --> 12:04:52,320
um test de tren împărțit.

15451
12:04:50,640 --> 12:04:54,640
Vom reconstrui modelul? nu,

15452
12:04:52,320 --> 12:04:58,000
nu neapărat. Sunt câteva lucruri noi

15453
12:04:54,640 --> 12:05:01,116
ar putea face cel mai probabil. Și ca un singur lucru

15454
12:04:58,000 --> 12:05:02,560
nu am făcut a fost să ne mărim caracteristicile.

15455
12:05:01,116 --> 12:05:05,276
Amintește-ți că am spus că e frumos

15456
12:05:02,560 --> 12:05:07,436
lucru important de făcut este să ne mărim

15457
12:05:05,276 --> 12:05:08,880
caracteristici. Noi nu am făcut asta. Așa că

15458
12:05:07,436 --> 12:05:10,800
ar fi o îmbunătățire a acestui fapt

15459
12:05:08,880 --> 12:05:13,520
vom merge la Deci chiar cred

15460
12:05:10,800 --> 12:05:14,880
o vom face mai târziu. Da. Deci cred ca noi

15461
12:05:13,520 --> 12:05:17,360
chiar o să fac asta acum că sunt

15462
12:05:14,880 --> 12:05:19,436
gândindu-mă la asta. Da. Unul dintre

15463
12:05:17,360 --> 12:05:21,360
ceea ce putem face este să scalam aceste caracteristici

15464
12:05:19,436 --> 12:05:23,596
folosind ca un scaler minmax, un standard

15465
12:05:21,360 --> 12:05:26,800
scaler. asta chiar ne va ajuta

15466
12:05:23,596 --> 12:05:29,800
asta ne va ajuta să facem mai bine

15467
12:05:26,800 --> 12:05:29,800
previziuni.

15468
12:05:30,720 --> 12:05:36,080
Așa că acesta este un lucru pe care l-am putea face. Hm

15469
12:05:33,436 --> 12:05:38,800
dar da, vom încerca să vedem dacă

15470
12:05:36,080 --> 12:05:40,640
poate deveni mai bine.

15471
12:05:38,800 --> 12:05:42,480
Ar trebui să-l ajute. Da, de obicei tu

15472
12:05:40,640 --> 12:05:43,916
vrei să scalați doriți să scalați

15473
12:05:42,480 --> 12:05:45,916
date. E ceva în care nu am făcut

15474
12:05:43,916 --> 12:05:47,680
pasul nostru de pregătire. Am făcut multe

15475
12:05:45,916 --> 12:05:49,916
lucrurile pe care ar trebui să le facem. Am eliminat nles

15476
12:05:47,680 --> 12:05:53,436
și am făcut o codificare fierbinte pentru

15477
12:05:49,916 --> 12:05:56,640
caracteristică de proximitate ca aceasta. Hm

15478
12:05:53,436 --> 12:05:58,480
acestea sunt bune de făcut, dar nu am scalat

15479
12:05:56,640 --> 12:06:00,400
pe oricare dintre acestea altele nu am scalat niciuna

15480
12:05:58,480 --> 12:06:04,000
dintre caracteristicile corecte nu le-am scalat

15481
12:06:00,400 --> 12:06:06,480
oricare dintre ei. Hm, tu va avea un

15482
12:06:04,000 --> 12:06:09,360
efect. De obicei, atunci când o scalam

15483
12:06:06,480 --> 12:06:11,520
va fi un model mai bun.

15484
12:06:09,360 --> 12:06:15,436
Va învăța puțin mai bine dacă

15485
12:06:11,520 --> 12:06:18,400
putem scala datele. Hm, așa

15486
12:06:15,436 --> 12:06:21,276
ca acestea

15487
12:06:18,400 --> 12:06:23,680
um parcă vârstele nu știi drastic

15488
12:06:21,276 --> 12:06:26,160
diferită decât ca la scară apoi totală

15489
12:06:23,680 --> 12:06:28,240
dormitoare sau venituri

15490
12:06:26,160 --> 12:06:30,080
uh genul ăsta de lucruri. Deci noi de obicei

15491
12:06:28,240 --> 12:06:33,080
doresc ca acestea să fie la o scară similară

15492
12:06:30,080 --> 12:06:33,080
interval.

15493
12:06:33,200 --> 12:06:38,400
Deci vom face, cred că vom scala

15494
12:06:35,520 --> 12:06:41,436
ele vin peste un pic și ar trebui

15495
12:06:38,400 --> 12:06:42,640
ajuta modelul.

15496
12:06:41,436 --> 12:06:44,880
Am mai vorbit despre asta, nu?

15497
12:06:42,640 --> 12:06:46,240
scalarea este de obicei o idee bună de făcut

15498
12:06:44,880 --> 12:06:49,240
când vă pregătiți datele pentru

15499
12:06:46,240 --> 12:06:49,240
modelare.

15500
12:06:49,436 --> 12:06:53,116
Nu, vrei să vrei să-ți scalezi

15501
12:06:51,276 --> 12:06:54,480
de asemenea, datele de testare. Ai de gând să faci

15502
12:06:53,116 --> 12:06:56,080
ambele. Îți vei scala

15503
12:06:54,480 --> 12:06:58,000
date de antrenament, le vei scala.

15504
12:06:56,080 --> 12:07:00,800
Deci, acesta este de fapt un punct bun pentru tine

15505
12:06:58,000 --> 12:07:02,960
aduceți în discuție orice transformări pe care le faceți

15506
12:07:00,800 --> 12:07:05,200
pe pregătirea dumneavoastră pentru a vă construi modelul,

15507
12:07:02,960 --> 12:07:07,840
ar trebui să faci, de asemenea, pe setul de testare așa

15508
12:07:05,200 --> 12:07:09,116
primești o comparație între mere și mere.

15509
12:07:07,840 --> 12:07:11,200
Ar trebui să faci mereu la fel

15510
12:07:09,116 --> 12:07:12,880
transformări.

15511
12:07:11,200 --> 12:07:14,880
Da.

15512
12:07:12,880 --> 12:07:16,960
Scalarea datelor l-ar afecta pe K? Da, asta

15513
12:07:14,880 --> 12:07:18,880
ar putea-o face mai bine. S-ar putea

15514
12:07:16,960 --> 12:07:20,800
da, ar trebui să-l afecteze. Ar trebui

15515
12:07:18,880 --> 12:07:22,000
obține un model mai bun. Deci, când facem

15516
12:07:20,800 --> 12:07:24,720
pliuri diferite, vom obține diferite

15517
12:07:22,000 --> 12:07:27,880
vom obține scoruri mai bune. Da, este

15518
12:07:24,720 --> 12:07:27,880
va avea impact

15519
12:07:28,640 --> 12:07:32,320
Da, dacă sunt așa, e bine

15520
12:07:31,276 --> 12:07:34,160
punct. Dacă vor folosi noastre

15521
12:07:32,320 --> 12:07:36,080
model, atunci da, trebuie să scala

15522
12:07:34,160 --> 12:07:37,680
date de asemenea. Dacă ei vor, dacă noi

15523
12:07:36,080 --> 12:07:40,960
construiți modelul pornind de la presupunerea că

15524
12:07:37,680 --> 12:07:42,720
intrarea este scalată, atunci da, au

15525
12:07:40,960 --> 12:07:48,040
pentru a-și scala și datele atunci când sunt

15526
12:07:42,720 --> 12:07:48,040
folosind-o cu modelul nostru. Este adevărat.

15527
12:07:49,520 --> 12:07:53,200
Adică, nu chiar. Îți voi arăta de ce.

15528
12:07:52,160 --> 12:07:56,240
Există ceva care se întâmplă de fapt

15529
12:07:53,200 --> 12:07:58,400
ca să fie mai ușor

15530
12:07:56,240 --> 12:07:59,916
automatizați realizarea scalării pentru ei. Deci,

15531
12:07:58,400 --> 12:08:02,400
ei nu ei nu trebuie să facă

15532
12:07:59,916 --> 12:08:04,000
scalare manuală. doar va fi

15533
12:08:02,400 --> 12:08:05,680
se întâmplă automat când folosesc

15534
12:08:04,000 --> 12:08:07,200
model. Am de gând să-ți arăt ceva

15535
12:08:05,680 --> 12:08:09,596
asta va automatiza ceea ce este

15536
12:08:07,200 --> 12:08:11,916
va fi numită conductă.

15537
12:08:09,596 --> 12:08:13,756
Deci acea parte va fi automatizată și ei

15538
12:08:11,916 --> 12:08:17,200
nu va trebui să facă asta. Deci nu va fi

15539
12:08:13,756 --> 12:08:18,800
grele pentru utilizator. Nu, în teorie este,

15540
12:08:17,200 --> 12:08:20,640
dar

15541
12:08:18,800 --> 12:08:22,720
are un instrument cu adevărat util pentru a o face

15542
12:08:20,640 --> 12:08:24,640
ușor să faci asta. Așa că mă duc la sunt

15543
12:08:22,720 --> 12:08:27,640
ne va arata ca mai tarziu in

15544
12:08:24,640 --> 12:08:27,640
caietul.

15545
12:08:27,680 --> 12:08:31,840
Nu, datele de date nu sunt pentru un singur

15546
12:08:29,680 --> 12:08:34,320
casa. Este ca un cartier. Deci

15547
12:08:31,840 --> 12:08:36,320
există un anumit număr de gospodării

15548
12:08:34,320 --> 12:08:38,240
în cartier și acesta este

15549
12:08:36,320 --> 12:08:41,040
prezicem valoarea medie a casei

15550
12:08:38,240 --> 12:08:42,400
din acel cartier.

15551
12:08:41,040 --> 12:08:43,596
Da. Deci, există o certitudine

15552
12:08:42,400 --> 12:08:46,560
numărul de gospodării. Există acolo

15553
12:08:43,596 --> 12:08:47,840
ca un venit mediu, o populație,

15554
12:08:46,560 --> 12:08:52,000
un anumit număr de oameni care trăiesc

15555
12:08:47,840 --> 12:08:54,080
acolo. Um apropierea în general de unde

15556
12:08:52,000 --> 12:08:57,320
acea locație este. Are și o latitudine

15557
12:08:54,080 --> 12:08:57,320
si longitudine.

15558
12:08:58,560 --> 12:09:03,360
Deci,

15559
12:09:01,116 --> 12:09:07,640
și o vârstă medie în acel cartier.

15560
12:09:03,360 --> 12:09:07,640
Deci, da, nu este doar o singură casă.

15561
12:09:14,720 --> 12:09:20,160
Bine, să ne întoarcem la asta a fost reținerea

15562
12:09:18,160 --> 12:09:22,240
out strategia. Deci, acest lucru este mult mai simplu.

15563
12:09:20,160 --> 12:09:25,360
Acesta este doar model.fit, nu? Aceasta este

15564
12:09:22,240 --> 12:09:27,756
doar model.potrivește pe datele de antrenament uh.

15565
12:09:25,360 --> 12:09:30,400
Și apoi putem prezice la test

15566
12:09:27,756 --> 12:09:32,320
caracteristici și generați predicții de testare.

15567
12:09:30,400 --> 12:09:34,960
Și apoi ne putem calcula eroarea

15568
12:09:32,320 --> 12:09:36,800
aceia um le putem calcula eroarea

15569
12:09:34,960 --> 12:09:40,960
printre predicțiile de testare și noastre

15570
12:09:36,800 --> 12:09:43,756
testează eticheta. Deci acesta este mijlocul nostru util

15571
12:09:40,960 --> 12:09:47,360
funcția de eroare pătrată, nu? Pentru a

15572
12:09:43,756 --> 12:09:53,040
calculați MSE. Hai să vedem ce

15573
12:09:47,360 --> 12:09:56,160
MSE este. Deci MSE este chiar aici.

15574
12:09:53,040 --> 12:09:58,160
Acum ceea ce putem face este să luăm

15575
12:09:56,160 --> 12:09:59,680
MSE

15576
12:09:58,160 --> 12:10:02,080
și putem lua rădăcina pătrată a acesteia.

15577
12:09:59,680 --> 12:10:05,596
Deci, să facem asta de fapt. Hai să facem

15578
12:10:02,080 --> 12:10:07,916
MP. rădăcină pătrată a

15579
12:10:05,596 --> 12:10:10,916
um test

15580
12:10:07,916 --> 12:10:10,916
MSE

15581
12:10:11,116 --> 12:10:19,436
și obținem 67 obținem 67.000.

15582
12:10:16,480 --> 12:10:21,040
Deci este destul de mare în acest sens. Deci când

15583
12:10:19,436 --> 12:10:23,360
abia acum ne uităm la diferența de

15584
12:10:21,040 --> 12:10:28,116
asta, nu? Când doar facem un tren

15585
12:10:23,360 --> 12:10:28,116
diviziunea de testare, um

15586
12:10:28,160 --> 12:10:32,480
când facem doar un test de tren, noi

15587
12:10:30,400 --> 12:10:34,160
obține un scor mai rău pentru că nu este ca

15588
12:10:32,480 --> 12:10:37,040
nu este la fel de robust, nu? Nu suntem

15589
12:10:34,160 --> 12:10:40,000
arătând asta multora dintre celelalte uh

15590
12:10:37,040 --> 12:10:43,360
pliuri. Deci primim mult mai multe erori

15591
12:10:40,000 --> 12:10:46,320
mod pe datele de testare.

15592
12:10:43,360 --> 12:10:50,160
Deci aceasta este o performanță mai proastă

15593
12:10:46,320 --> 12:10:50,160
doar făcând împărțirea testului de tren.

15594
12:10:50,720 --> 12:10:54,436
Aceasta este cu adevărat mai mare.

15595
12:11:02,880 --> 12:11:06,720
Da, putem. Putem. ma duc la sunt

15596
12:11:04,960 --> 12:11:10,800
ne va arăta cum se face scalarea

15597
12:11:06,720 --> 12:11:13,040
se va face automat. Da, putem.

15598
12:11:10,800 --> 12:11:17,080
Există un instrument foarte ușor de făcut

15599
12:11:13,040 --> 12:11:17,080
face asta o va scala automat.

15600
12:11:20,000 --> 12:11:25,000
Va fi mai târziu în acest caiet.

15601
12:11:21,520 --> 12:11:25,000
O să ni-l arăt.

15602
12:11:30,320 --> 12:11:34,720
În regulă. Deci, ca să recapitulez asta, asta

15603
12:11:32,080 --> 12:11:36,320
se potrivește modelului.

15604
12:11:34,720 --> 12:11:37,916
Acesta se potrivește modelului. Aceasta este

15605
12:11:36,320 --> 12:11:39,840
făcând predicții, nu?

15606
12:11:37,916 --> 12:11:41,756
Model.predic.

15607
12:11:39,840 --> 12:11:43,840
Deci, asta face previziunile. Şi

15608
12:11:41,756 --> 12:11:45,756
atunci aceasta este calcularea erorii,

15609
12:11:43,840 --> 12:11:47,360
eroare pătrată medie, care se uită la

15610
12:11:45,756 --> 12:11:49,276
etichetele noastre de testare versus testul nostru

15611
12:11:47,360 --> 12:11:51,840
previziuni, nu? Și aceasta este

15612
12:11:49,276 --> 12:11:54,160
calculând distanța, media

15613
12:11:51,840 --> 12:11:56,000
distanta de aceste valori la acestea

15614
12:11:54,160 --> 12:11:57,916
valori,

15615
12:11:56,000 --> 12:12:00,320
nu?

15616
12:11:57,916 --> 12:12:03,276
Și apoi putem calcula și R pătratul

15617
12:12:00,320 --> 12:12:06,640
R R 2 și vedem că nu este foarte

15618
12:12:03,276 --> 12:12:08,640
R pătrat bun. 65 nu este foarte

15619
12:12:06,640 --> 12:12:10,480
model grozav

15620
12:12:08,640 --> 12:12:12,960
um pentru că ar fi mai aproape de unul

15621
12:12:10,480 --> 12:12:14,720
mai bine. Deci asta este tot nu este

15622
12:12:12,960 --> 12:12:16,240
foarte bine.

15623
12:12:14,720 --> 12:12:18,720
Știm că știam asta de pe cruce

15624
12:12:16,240 --> 12:12:21,200
scorul fișierului. Dar asta doar face um

15625
12:12:18,720 --> 12:12:23,680
asta face doar o reținere uh unde

15626
12:12:21,200 --> 12:12:25,436
facem o divizare de tren și test, nu? Aşa

15627
12:12:23,680 --> 12:12:28,320
este un pic mai simplu, dar nu este

15628
12:12:25,436 --> 12:12:30,720
la fel de robust. Hm

15629
12:12:28,320 --> 12:12:34,080
nu este chiar la fel de robust ca crucea

15630
12:12:30,720 --> 12:12:37,200
supapă, dar funcționează. E, știi,

15631
12:12:34,080 --> 12:12:39,840
putem rezista. um,

15632
12:12:37,200 --> 12:12:42,320
putem rezista prea repede

15633
12:12:39,840 --> 12:12:44,320
evaluăm un model și vedem dacă trebuie

15634
12:12:42,320 --> 12:12:48,436
faceți orice ajustări.

15635
12:12:44,320 --> 12:12:48,436
Este puțin mai rapid de alergat.

15636
12:12:50,640 --> 12:12:53,756
Bine. Și vreo întrebare despre el? O face

15637
12:12:52,640 --> 12:12:57,756
ai sens ce facem aici?

15638
12:12:53,756 --> 12:13:00,240
Model.fit pentru a-l antrena prezice pentru a obține nostru

15639
12:12:57,756 --> 12:13:01,756
previziuni. Um, asta e frumos

15640
12:13:00,240 --> 12:13:03,840
standard, nu? A te antrena este

15641
12:13:01,756 --> 12:13:05,596
model.potriviți-l și apoi să folosiți modelul

15642
12:13:03,840 --> 12:13:07,116
a prezice. Noi prezicem la test

15643
12:13:05,596 --> 12:13:09,756
caracteristici.

15644
12:13:07,116 --> 12:13:13,756
Um, deci asta se transmite pe toate noastre

15645
12:13:09,756 --> 12:13:15,276
caracteristici în acest model pentru a genera

15646
12:13:13,756 --> 12:13:16,560
previziuni pentru fiecare rând. Asta e

15647
12:13:15,276 --> 12:13:18,640
ceva ce vreau să subliniez

15648
12:13:16,560 --> 12:13:22,720
poate fi un pic confuz este asta

15649
12:13:18,640 --> 12:13:24,800
un cadru de date. Deci trecem într-o

15650
12:13:22,720 --> 12:13:27,596
grămadă de rânduri de caracteristici cu coloane,

15651
12:13:24,800 --> 12:13:30,000
nu? Deci trecem într-o grămadă

15652
12:13:27,596 --> 12:13:32,400
de date care arată astfel. Și ce

15653
12:13:30,000 --> 12:13:34,800
facem este în esență să facem a

15654
12:13:32,400 --> 12:13:37,360
predicție pentru fiecare rând. Deci asta va

15655
12:13:34,800 --> 12:13:39,680
genera o predicție. Acest rând va

15656
12:13:37,360 --> 12:13:41,436
genera o predicție. Acest rând va

15657
12:13:39,680 --> 12:13:44,480
genera o predicție. Și mai departe și mai departe și

15658
12:13:41,436 --> 12:13:47,276
pe. Deci această predicție o va prezice

15659
12:13:44,480 --> 12:13:49,200
pentru fiecare rând. Și așa ajungem

15660
12:13:47,276 --> 12:13:52,000
această colecție de predicții aici pt

15661
12:13:49,200 --> 12:13:54,880
fiecare rând. Și le comparăm cu

15662
12:13:52,000 --> 12:13:57,436
etichetele pe care le avem pentru acele rânduri

15663
12:13:54,880 --> 12:13:59,756
din învățarea noastră supravegheată,

15664
12:13:57,436 --> 12:14:01,680
nu? Din setul nostru de date.

15665
12:13:59,756 --> 12:14:04,000
Deci, aceasta este o învățare cu adevărat supravegheată,

15666
12:14:01,680 --> 12:14:06,640
nu? Avem exemplele și suntem

15667
12:14:04,000 --> 12:14:11,880
comparându-le cu modelul nostru

15668
12:14:06,640 --> 12:14:11,880
prezicerea pentru a obține performanța noastră.

15669
12:14:16,880 --> 12:14:21,596
În regulă.

15670
12:14:18,560 --> 12:14:23,680
Deci hai să încercăm pe celălalt așa

15671
12:14:21,596 --> 12:14:25,520
o poti vedea. Pe cel lăsat afară. Acum

15672
12:14:23,680 --> 12:14:26,960
validarea încrucișată este exclusă

15673
12:14:25,520 --> 12:14:30,480
de fapt va funcționa în același mod

15674
12:14:26,960 --> 12:14:32,960
în cazul în care am pus în lăsați unul afară um

15675
12:14:30,480 --> 12:14:34,800
strategie în interiorul scorului de fișier încrucișat.

15676
12:14:32,960 --> 12:14:37,116
Acum, aici nu trebuie să specificăm cum

15677
12:14:34,800 --> 12:14:38,320
multe falduri există pentru că știm cum

15678
12:14:37,116 --> 12:14:41,116
vor fi multe. O să fie

15679
12:14:38,320 --> 12:14:42,240
numărul de puncte de date, nu? Aşa

15680
12:14:41,116 --> 12:14:45,520
care de fapt va fi destul de

15681
12:14:42,240 --> 12:14:48,160
mare pentru că sunt 20.000 de rânduri. Deci

15682
12:14:45,520 --> 12:14:53,276
asta va fi extrem de

15683
12:14:48,160 --> 12:14:57,680
extrem de intens pentru că suntem

15684
12:14:53,276 --> 12:15:00,640
făcând um știi 20.000 de exemple și

15685
12:14:57,680 --> 12:15:03,116
lăsând un exemplu să fie al nostru

15686
12:15:00,640 --> 12:15:06,880
validare și apoi face asta peste tot

15687
12:15:03,116 --> 12:15:08,720
la fiecare 20.000 de exemple.

15688
12:15:06,880 --> 12:15:10,960
Așa că am putea face asta, totuși, doar să vedem cum

15689
12:15:08,720 --> 12:15:12,880
funcționează. Avem din nou plecarea asta

15690
12:15:10,960 --> 12:15:16,000
unul afară. Noi generăm fișierul nostru încrucișat

15691
12:15:12,880 --> 12:15:18,480
scor din modelul nostru datele noastre și apoi

15692
12:15:16,000 --> 12:15:20,400
același punctaj pe care l-am avut înainte și dar

15693
12:15:18,480 --> 12:15:23,200
de data aceasta ne schimbăm fișierul încrucișat să fie

15694
12:15:20,400 --> 12:15:26,480
în loc de obiectul nostru k-fold avem nostru

15695
12:15:23,200 --> 12:15:29,116
omite un obiect care este acesta

15696
12:15:26,480 --> 12:15:32,880
și apoi am putea rula asta. Putem

15697
12:15:29,116 --> 12:15:34,720
calculăm media noastră uh la toate

15698
12:15:32,880 --> 12:15:36,320
pliurile. Acum asta va fi mult

15699
12:15:34,720 --> 12:15:39,116
mai mare dintr-o matrice. Va fi o

15700
12:15:36,320 --> 12:15:43,200
20.000 de dimensiuni și o vom face

15701
12:15:39,116 --> 12:15:45,276
calculați media peste el.

15702
12:15:43,200 --> 12:15:47,116
Deci, hai să facem asta. Va dura o

15703
12:15:45,276 --> 12:15:48,400
moment pentru că sunt multe. Deci, dacă tu

15704
12:15:47,116 --> 12:15:50,720
observă-l când alergi, se va întâmpla

15705
12:15:48,400 --> 12:15:53,916
ia-ți puțin timp să alergi pentru că

15706
12:15:50,720 --> 12:15:57,680
se desfășoară pe toate cele 20.000 de exemple

15707
12:15:53,916 --> 12:16:00,880
și lăsând unul afară. Deci, ai 20.000

15708
12:15:57,680 --> 12:16:03,116
și apoi unul lăsat să testeze

15709
12:16:00,880 --> 12:16:07,320
împotriva. Deci, este destul de intensiv. tu

15710
12:16:03,116 --> 12:16:07,320
pot vedea că durează mult mai mult timp.

15711
12:16:11,840 --> 12:16:17,320
Încă mai rulează. Durează ceva timp.

15712
12:16:23,756 --> 12:16:30,320
Bine, lasă-l să curgă. Încă aleargă.

15713
12:16:28,560 --> 12:16:31,596
Deci, dacă încercați să rulați asta, este

15714
12:16:30,320 --> 12:16:33,116
va dura puțin timp.

15715
12:16:31,596 --> 12:16:35,916
Sper că are sens de ce este

15716
12:16:33,116 --> 12:16:39,116
durează atât de mult, nu? Este pentru că este

15717
12:16:35,916 --> 12:16:41,520
în loc să faci 10 pliuri, este

15718
12:16:39,116 --> 12:16:43,756
punând fiecare punct de date, dar unul este

15719
12:16:41,520 --> 12:16:47,116
set de antrenament și apoi repetarea

15720
12:16:43,756 --> 12:16:51,160
toate cele 20.000 de puncte.

15721
12:16:47,116 --> 12:16:51,160
Acest lucru durează ceva timp.

15722
12:17:04,240 --> 12:17:08,200
Să vedem ce avem

15723
12:17:08,960 --> 12:17:14,756
RAM Memoria noastră este puțin crescută.

15724
12:17:20,080 --> 12:17:24,800
bine,

15725
12:17:22,400 --> 12:17:27,040
încă alergând. E în regulă. Îl voi lăsa

15726
12:17:24,800 --> 12:17:30,756
alerga.

15727
12:17:27,040 --> 12:17:30,756
Întoarce-te când s-a terminat.

15728
12:17:34,960 --> 12:17:38,800
Da, exact. Acesta este un Acest lucru este pentru

15729
12:17:37,276 --> 12:17:41,596
Acest lucru ne oferă o performanță

15730
12:17:38,800 --> 12:17:43,916
evaluarea. Aceasta este ca media

15731
12:17:41,596 --> 12:17:46,480
eroare în toate diferitele noastre uh

15732
12:17:43,916 --> 12:17:48,080
pliuri. Acum, acesta este cazul extrem

15733
12:17:46,480 --> 12:17:51,200
unde avem numărul de pliuri egal

15734
12:17:48,080 --> 12:17:53,200
numărul de puncte.

15735
12:17:51,200 --> 12:17:55,360
Corect? Deci este un caz extrem, dar da

15736
12:17:53,200 --> 12:17:59,080
este la fel ca kfold. Ne oferă

15737
12:17:55,360 --> 12:17:59,080
acea estimare a performanței.

15738
12:18:04,000 --> 12:18:10,320
Bine. Este cam acelasi drept. Aceasta este

15739
12:18:07,436 --> 12:18:12,640
încă în jur de 50.000.

15740
12:18:10,320 --> 12:18:15,040
Nu e mare diferență, nu? Inca drept

15741
12:18:12,640 --> 12:18:17,756
pe acolo. Dar uite cât mai mult

15742
12:18:15,040 --> 12:18:19,596
a luat. A durat 2 minute. The

15743
12:18:17,756 --> 12:18:22,800
celălalt a fost destul de instantaneu, nu? Deci

15744
12:18:19,596 --> 12:18:28,960
aceasta a durat aproximativ 2 minute pentru a rula.

15745
12:18:22,800 --> 12:18:31,756
Deci cu siguranță uh

15746
12:18:28,960 --> 12:18:34,240
da, cu siguranță nu vreau să rulez asta

15747
12:18:31,756 --> 12:18:36,240
uh prea des. Cred că este

15748
12:18:34,240 --> 12:18:37,756
în general a preferat să facă k-fold dacă

15749
12:18:36,240 --> 12:18:39,596
veți face validarea încrucișată.

15750
12:18:37,756 --> 12:18:42,560
În general, doriți să faceți k-fold sau doar

15751
12:18:39,596 --> 12:18:44,560
obișnuit să țină deoparte testul de tren. Uh

15752
12:18:42,560 --> 12:18:46,480
în general, mai bine decât să lași unul

15753
12:18:44,560 --> 12:18:49,200
afară. Doar că va dura prea mult

15754
12:18:46,480 --> 12:18:52,840
și um rezultă cam de același tip

15755
12:18:49,200 --> 12:18:52,840
de scor ca kfold.

15756
12:19:01,756 --> 12:19:07,520
bine,

15757
12:19:04,000 --> 12:19:11,640
orice întrebări despre cruce

15758
12:19:07,520 --> 12:19:11,640
validare pe care tocmai am făcut-o.

15759
12:19:28,000 --> 12:19:32,240
bine,

15760
12:19:29,916 --> 12:19:34,000
bine. Și așa cum se spune aici că

15761
12:19:32,240 --> 12:19:35,520
kfold stratificat este de obicei folosit pentru

15762
12:19:34,000 --> 12:19:36,960
clasificare. Din nou, nu facem

15763
12:19:35,520 --> 12:19:39,436
clasificare încă. Asta înseamnă a merge la

15764
12:19:36,960 --> 12:19:40,800
fi la lecția a patra. Deci, nu avem nevoie

15765
12:19:39,436 --> 12:19:43,596
iti faci prea multe griji pentru asta. Doar pentru

15766
12:19:40,800 --> 12:19:45,680
regresie, um kfold regulat este

15767
12:19:43,596 --> 12:19:48,160
preferat, nu? Pentru că nu avem nevoie

15768
12:19:45,680 --> 12:19:51,200
să vă faceți griji pentru distribuire

15769
12:19:48,160 --> 12:19:53,916
categorii dintre pliurile noastre uh în oricare

15770
12:19:51,200 --> 12:19:56,000
probleme de regresie.

15771
12:19:53,916 --> 12:19:57,756
Și după cum vedem, eroarea este cam mare.

15772
12:19:56,000 --> 12:20:00,400
Vor fi niște lucruri noi

15773
12:19:57,756 --> 12:20:02,160
pot face pentru a îmbunătăți ceea ce va fi uh

15774
12:20:00,400 --> 12:20:05,040
mai târziu vom afla mai multe

15775
12:20:02,160 --> 12:20:07,596
modele avansate. Acest lucru semnalează că

15776
12:20:05,040 --> 12:20:10,800
performanta este proasta. Probabil avem nevoie de o

15777
12:20:07,596 --> 12:20:12,800
model mai complex. Un lucru noi

15778
12:20:10,800 --> 12:20:15,040
am putea încerca înainte de a încerca un model complex

15779
12:20:12,800 --> 12:20:17,436
este să faci scalare. Vom încerca să facem

15780
12:20:15,040 --> 12:20:20,560
scalare. O să ne arăt cum putem

15781
12:20:17,436 --> 12:20:24,800
face asta urmând într-un frumos

15782
12:20:20,560 --> 12:20:26,320
modă simplificată. Hm, dar afară

15783
12:20:24,800 --> 12:20:27,756
de asta, dacă tot am avut rău

15784
12:20:26,320 --> 12:20:30,560
performanță, probabil că ar trebui să o folosim

15785
12:20:27,756 --> 12:20:33,200
un model mai avansat. Și vom învăța

15786
12:20:30,560 --> 12:20:35,520
despre modele mai avansate uh în

15787
12:20:33,200 --> 12:20:37,596
următoarea lecție. Și ceea ce este grozav este o parte

15788
12:20:35,520 --> 12:20:39,840
acele modele avansate pot fi de fapt

15789
12:20:37,596 --> 12:20:41,520
folosit pentru regresie. Deci au

15790
12:20:39,840 --> 12:20:43,200
variații care pot fi folosite pentru ambele

15791
12:20:41,520 --> 12:20:45,680
clasificare și regresie, care este

15792
12:20:43,200 --> 12:20:50,320
destul de misto. Așa că le voi sublinia

15793
12:20:45,680 --> 12:20:53,276
când ajungem la ei. Bine.

15794
12:20:50,320 --> 12:20:56,720
Deci despre ce vreau să vorbesc acum este a

15795
12:20:53,276 --> 12:20:58,480
felul în care putem combate supraadaptarea. Deci dacă noi

15796
12:20:56,720 --> 12:21:03,360
au supraajustare care nu uitați că este

15797
12:20:58,480 --> 12:21:05,520
cazul în care uh, vedem bine

15798
12:21:03,360 --> 12:21:07,756
performanţă pe datele de antrenament dar

15799
12:21:05,520 --> 12:21:09,756
atunci nu se generalizează la

15800
12:21:07,756 --> 12:21:12,560
datele de testare. Obținem performanțe slabe

15801
12:21:09,756 --> 12:21:15,596
pe datele testului. Um, există o

15802
12:21:12,560 --> 12:21:18,320
lasa acolo. Asta ar semnala

15803
12:21:15,596 --> 12:21:19,840
supraadaptare.

15804
12:21:18,320 --> 12:21:23,116
supraadaptare

15805
12:21:19,840 --> 12:21:26,320
și o modalitate de a combate supraadaptarea

15806
12:21:23,116 --> 12:21:29,436
este să faci ceva numit regularizare

15807
12:21:26,320 --> 12:21:33,200
despre care vom vorbi în continuare. Deci

15808
12:21:29,436 --> 12:21:35,756
ideea cheie în regularizare

15809
12:21:33,200 --> 12:21:39,520
este să

15810
12:21:35,756 --> 12:21:41,680
ne schimbăm uh schimbarea felului în care noi

15811
12:21:39,520 --> 12:21:46,880
tren. În esență, la ce vom merge

15812
12:21:41,680 --> 12:21:50,000
este să ne modifici antrenamentul

15813
12:21:46,880 --> 12:21:53,040
uh funcție de eroare sau uneori numită

15814
12:21:50,000 --> 12:21:56,000
funcţia obiectiv sau funcţia de pierdere.

15815
12:21:53,040 --> 12:22:00,480
Vom schimba asta pentru a adăuga un

15816
12:21:56,000 --> 12:22:03,520
penalizare pentru a penaliza complexul excesiv

15817
12:22:00,480 --> 12:22:05,596
complexitate. În esență, felul în care

15818
12:22:03,520 --> 12:22:08,000
vom penaliza este făcând

15819
12:22:05,596 --> 12:22:11,436
sigur marimea coeficientilor

15820
12:22:08,000 --> 12:22:14,480
nu crește prea mult ceea ce ar trebui

15821
12:22:11,436 --> 12:22:16,560
atenuează supraadaptarea deoarece amintiți-vă în

15822
12:22:14,480 --> 12:22:18,160
regresie liniară ceea ce învățăm

15823
12:22:16,560 --> 12:22:21,680
sunt coeficienții corecti

15824
12:22:18,160 --> 12:22:24,080
învăţarea beta 0 beta 1 beta

15825
12:22:21,680 --> 12:22:26,720
2 și mai departe și pe câte beta există

15826
12:22:24,080 --> 12:22:29,916
sunt beta și învățăm toate acestea

15827
12:22:26,720 --> 12:22:31,596
baieti um prin eroarea de regresie

15828
12:22:29,916 --> 12:22:33,756
funcție pe care încercăm să o minimizăm

15829
12:22:31,596 --> 12:22:36,000
funcția de eroare. Așa se antrenează. Noi

15830
12:22:33,756 --> 12:22:41,040
am vorbit despre asta luni.

15831
12:22:36,000 --> 12:22:44,240
Deci ceea ce vom face este

15832
12:22:41,040 --> 12:22:47,680
practic penalizează-i pe acești tipi

15833
12:22:44,240 --> 12:22:51,200
devenind prea mare și ne asigurăm că suntem amabili

15834
12:22:47,680 --> 12:22:54,160
de ține-le mici pentru ca nimeni

15835
12:22:51,200 --> 12:22:56,800
coeficientul are un efect dominant uh asupra

15836
12:22:54,160 --> 12:22:58,720
modelul. Și asta ar trebui să ajute

15837
12:22:56,800 --> 12:23:00,640
supraadaptare și complexitate. ar trebui să facă

15838
12:22:58,720 --> 12:23:02,400
modelul mai simplu deoarece toate cele

15839
12:23:00,640 --> 12:23:04,640
coeficienții vor fi încurajați

15840
12:23:02,400 --> 12:23:07,596
a fi mai mic. Nu vor crește

15841
12:23:04,640 --> 12:23:10,240
prea mare. Hm și asta are efectul

15842
12:23:07,596 --> 12:23:13,960
de a face modelul atât de practic

15843
12:23:10,240 --> 12:23:13,960
modelul mai simplu.

15844
12:23:14,640 --> 12:23:18,560
Faceți modelul mai simplu este ceea ce acestea

15845
12:23:17,200 --> 12:23:20,640
tehnicile de regularizare sunt

15846
12:23:18,560 --> 12:23:22,400
în esență, încercarea de a realiza este este

15847
12:23:20,640 --> 12:23:24,160
eliminați complexitatea, faceți-le puțin

15848
12:23:22,400 --> 12:23:26,960
puțin mai simplu, faceți acești coeficienți

15849
12:23:24,160 --> 12:23:30,000
mai mic ca sa poti generaliza putin

15850
12:23:26,960 --> 12:23:33,200
mai bine și și pentru a preveni supraadaptarea. Deci

15851
12:23:30,000 --> 12:23:35,520
vrem să prevenim

15852
12:23:33,200 --> 12:23:38,880
uh supraadaptare,

15853
12:23:35,520 --> 12:23:40,480
corect, este ceea ce vrem să facem. Um asa

15854
12:23:38,880 --> 12:23:42,160
va fi o penalizare și o voi face

15855
12:23:40,480 --> 12:23:44,320
vă arată unde se adaugă acea penalizare

15856
12:23:42,160 --> 12:23:48,080
și cam cum arată.

15857
12:23:44,320 --> 12:23:49,596
Hm, dar pentru a controla nivelul asta

15858
12:23:48,080 --> 12:23:52,880
pedeapsa la care mergem de fapt

15859
12:23:49,596 --> 12:23:55,436
introduceți un alt parametru modelului nostru

15860
12:23:52,880 --> 12:23:58,800
um numit alfa.

15861
12:23:55,436 --> 12:24:02,400
Alpha va mări pedeapsa. Deci

15862
12:23:58,800 --> 12:24:05,596
dacă alfa este cu adevărat mare, asta impune a

15863
12:24:02,400 --> 12:24:08,560
penalizare mai puternică asupra coeficienților um

15864
12:24:05,596 --> 12:24:10,880
ceea ce va face modelul mult mai simplu.

15865
12:24:08,560 --> 12:24:14,480
Deci, cu cât alfa este mai mare, cu atât este mai simplu

15866
12:24:10,880 --> 12:24:17,360
modelul pe care îl vom obține și noi riscul

15867
12:24:14,480 --> 12:24:20,480
cu asta suntem de fapt subadaptați. Deci dacă

15868
12:24:17,360 --> 12:24:22,560
alfa este prea mare, s-ar putea să nu se potrivească

15869
12:24:20,480 --> 12:24:24,640
date de antrenament

15870
12:24:22,560 --> 12:24:27,840
um puțin prea mult pentru că va face

15871
12:24:24,640 --> 12:24:28,880
modelul mult prea simplu. Hm și eu din nou

15872
12:24:27,840 --> 12:24:31,916
Îți voi arăta ce înseamnă asta

15873
12:24:28,880 --> 12:24:34,160
matematic într-o clipă. Hm, dar mai departe

15874
12:24:31,916 --> 12:24:37,360
pe de altă parte dacă avem un alfa mai mic

15875
12:24:34,160 --> 12:24:40,240
aceasta va avea o pedeapsă mai mică. este o

15876
12:24:37,360 --> 12:24:44,160
termen de pedeapsă mai slab și asta va duce la

15877
12:24:40,240 --> 12:24:47,680
un model care este ceva mai complex.

15878
12:24:44,160 --> 12:24:51,520
Hm care ar putea risca un anumit nivel de

15879
12:24:47,680 --> 12:24:53,116
supraadaptare. Așa că există așa că există

15880
12:24:51,520 --> 12:24:55,116
încă riscul de a se supraadapta dacă tu

15881
12:24:53,116 --> 12:24:56,960
au un alfa scăzut. Și desigur dacă alfa

15882
12:24:55,116 --> 12:24:59,116
merge până la zero, nu există

15883
12:24:56,960 --> 12:25:02,160
pedeapsa deloc. Deci te-ai întors la tine

15884
12:24:59,116 --> 12:25:04,960
regresie liniară inițială. Hm care

15885
12:25:02,160 --> 12:25:07,680
ar putea risca o supraadaptare,

15886
12:25:04,960 --> 12:25:10,320
nu? Deci, în general, doriți să alegeți

15887
12:25:07,680 --> 12:25:12,160
un alfa um efectiv și efectiv

15888
12:25:10,320 --> 12:25:14,400
vom vedea h care este cel mai bun mod

15889
12:25:12,160 --> 12:25:15,916
a alege alfa. De fapt, mergem

15890
12:25:14,400 --> 12:25:18,560
să înveți cum să faci asta. ma duc

15891
12:25:15,916 --> 12:25:23,040
arată-ne cum să faci câteva tehnici de reglare

15892
12:25:18,560 --> 12:25:25,596
pentru a alege ce ar trebui să fie alfa. Hm, dar um

15893
12:25:23,040 --> 12:25:28,480
un alfa destul de standard al industriei care

15894
12:25:25,596 --> 12:25:32,080
majoritatea oamenilor este implicit alfa egal

15895
12:25:28,480 --> 12:25:34,400
la unul. Deci doar unul care semnalează

15896
12:25:32,080 --> 12:25:35,916
că ar trebui să existe o pedeapsă. noi

15897
12:25:34,400 --> 12:25:37,916
doar ai alfa egal cu unu este a

15898
12:25:35,916 --> 12:25:39,276
pedeapsa standard. Nu vrem să fie

15899
12:25:37,916 --> 12:25:40,480
prea sus. Nu vrem să fie și așa

15900
12:25:39,276 --> 12:25:43,276
scăzută. De parcă nu vrem să fie un

15901
12:25:40,480 --> 12:25:47,040
fracție. Hm, dar o penalizare de unul este

15902
12:25:43,276 --> 12:25:49,116
de obicei destul de bun.

15903
12:25:47,040 --> 12:25:52,320
Bine, am să-ți arăt unde

15904
12:25:49,116 --> 12:25:54,560
intră în joc într-o clipă.

15905
12:25:52,320 --> 12:25:57,680
Hm, dar întregul scop de a face asta

15906
12:25:54,560 --> 12:26:00,320
este atenuarea suprainstalării, nu? Hm

15907
12:25:57,680 --> 12:26:03,116
asta e și și făcând această pedeapsă

15908
12:26:00,320 --> 12:26:05,200
se numește regularizare. Deci adăugând

15909
12:26:03,116 --> 12:26:07,840
deci trecând dincolo de liniare obișnuită

15910
12:26:05,200 --> 12:26:11,276
regresie adăugând această penalizare suplimentară la

15911
12:26:07,840 --> 12:26:14,560
la procesul de instruire um să penalizeze

15912
12:26:11,276 --> 12:26:18,240
greutăți mari coeficienți mari

15913
12:26:14,560 --> 12:26:21,840
um este cunoscut sub numele de regularizare.

15914
12:26:18,240 --> 12:26:23,916
Bine. Hm și sunt două comune

15915
12:26:21,840 --> 12:26:25,360
pedepsele care se adaugă. Hm, deci există

15916
12:26:23,916 --> 12:26:27,756
de fapt două variante diferite ale

15917
12:26:25,360 --> 12:26:30,080
pedeapsa. O să-i studiem pe amândoi

15918
12:26:27,756 --> 12:26:32,800
ei și ei sunt cunoscuți

15919
12:26:30,080 --> 12:26:34,880
laso. Deci, dacă luați regresia liniară

15920
12:26:32,800 --> 12:26:37,116
și adăugați un anumit tip de penalizare,

15921
12:26:34,880 --> 12:26:39,276
este cunoscut sub numele de lasso. Dacă adaugi altul

15922
12:26:37,116 --> 12:26:41,596
tip de pedeapsă, este cunoscută sub numele de creastă

15923
12:26:39,276 --> 12:26:43,520
regresie. O să-i studiem pe amândoi

15924
12:26:41,596 --> 12:26:46,240
acestea și care sunt diferențele lor.

15925
12:26:43,520 --> 12:26:49,040
Dar acestea sunt cele două principale

15926
12:26:46,240 --> 12:26:52,080
uh regularizare tech uh modele care

15927
12:26:49,040 --> 12:26:54,320
sunt folosite pentru a lua obișnuit ambele

15928
12:26:52,080 --> 12:26:57,200
acestea iau regresie liniară regulată și

15929
12:26:54,320 --> 12:26:59,116
doar modificați procesul de instruire a

15930
12:26:57,200 --> 12:27:03,680
puțin în moduri diferite. Doi

15931
12:26:59,116 --> 12:27:06,720
moduri diferite. um folosind acel alfa

15932
12:27:03,680 --> 12:27:08,480
um să penalizeze puțin termenii

15933
12:27:06,720 --> 12:27:09,916
diferite moduri matematice. Deci suntem

15934
12:27:08,480 --> 12:27:12,320
o să învețe despre acești doi tipi.

15935
12:27:09,916 --> 12:27:14,160
Regresia lasso acolo. Ambele

15936
12:27:12,320 --> 12:27:16,640
sunt doar ramuri ale regresiei liniare.

15937
12:27:14,160 --> 12:27:19,436
Deci modelul de bază este încă liniar

15938
12:27:16,640 --> 12:27:22,800
regresie. Doar adaugă diferite tipuri

15939
12:27:19,436 --> 12:27:24,960
de penalizări la procesul de instruire.

15940
12:27:22,800 --> 12:27:29,276
Deci ambii sunt încă în familie

15941
12:27:24,960 --> 12:27:31,520
de regresie liniară. De fapt, în um in

15942
12:27:29,276 --> 12:27:33,520
scikitlearn, amândoi provin de la ei

15943
12:27:31,520 --> 12:27:36,080
ambele sunt încă din modelul liniar

15944
12:27:33,520 --> 12:27:37,916
familie în interiorul modelului liniar

15945
12:27:36,080 --> 12:27:39,756
modul, care este locul unde regresia liniară

15946
12:27:37,916 --> 12:27:42,400
provine din. Deci există încă liniar

15947
12:27:39,756 --> 12:27:45,520
regresie. Au doar diferite

15948
12:27:42,400 --> 12:27:48,800
stiluri de penalități adăugate acestora. Hm

15949
12:27:45,520 --> 12:27:51,916
pe care o să-l vedem.

15950
12:27:48,800 --> 12:27:54,880
Bine, deci ca să recapitulez

15951
12:27:51,916 --> 12:27:58,000
regularizarea este procesul de adăugare

15952
12:27:54,880 --> 12:28:00,400
o penalizare la antrenament pentru a descuraja

15953
12:27:58,000 --> 12:28:04,640
complexitate. În acest caz, vom merge

15954
12:28:00,400 --> 12:28:07,116
descurajează coeficienții mari.

15955
12:28:04,640 --> 12:28:09,116
Și asta ar trebui să ajute la prevenire

15956
12:28:07,116 --> 12:28:12,400
supraadaptare.

15957
12:28:09,116 --> 12:28:13,756
Și așa că acestea ne vor conduce la

15958
12:28:12,400 --> 12:28:15,040
două ramuri diferite de liniare

15959
12:28:13,756 --> 12:28:16,560
regresie care au două diferite

15960
12:28:15,040 --> 12:28:18,880
pedepsele.

15961
12:28:16,560 --> 12:28:21,680
lasso și regresia crestei, ceea ce suntem

15962
12:28:18,880 --> 12:28:23,756
urmează să studiez,

15963
12:28:21,680 --> 12:28:26,000
dar ele funcționează la fel ca

15964
12:28:23,756 --> 12:28:28,080
regresie liniară. Doar vor avea

15965
12:28:26,000 --> 12:28:32,080
termene de penalizare diferite adăugate acestora

15966
12:28:28,080 --> 12:28:35,756
procesul de antrenament um să descurajeze

15967
12:28:32,080 --> 12:28:38,756
descurajați-i din nou pe cei mari

15968
12:28:35,756 --> 12:28:38,756
greutăți.

15969
12:28:40,560 --> 12:28:43,916
Bine, orice întrebări despre regularizare

15970
12:28:42,400 --> 12:28:47,116
înainte de a ne uita prima dată la noi mergem

15971
12:28:43,916 --> 12:28:48,800
să ne uităm la prima noastră variantă de pe on

15972
12:28:47,116 --> 12:28:52,320
prima noastră tehnică de regularizare care

15973
12:28:48,800 --> 12:28:52,320
se va numi regresie lazo.

15974
12:29:08,080 --> 12:29:13,116
Bine, să ne uităm la regresia lasso. Aşa

15975
12:29:10,800 --> 12:29:16,320
ce este regresia lasso? Este de fapt

15976
12:29:13,116 --> 12:29:18,000
lasso este scurt pentru cel puțin absolut

15977
12:29:16,320 --> 12:29:23,756
operator de contracție și selecție

15978
12:29:18,000 --> 12:29:27,200
regresie. Hm și asta va funcționa de

15979
12:29:23,756 --> 12:29:29,200
adăugarea unei anumite pedepse la

15980
12:29:27,200 --> 12:29:30,880
model de regresie liniară. Deci din nou este

15981
12:29:29,200 --> 12:29:33,276
bazată pe regresia liniară. Asta este

15982
12:29:30,880 --> 12:29:36,400
modelul de bază. Doar că în timpul

15983
12:29:33,276 --> 12:29:41,040
procesul de instruire la care mergem

15984
12:29:36,400 --> 12:29:43,360
adaugă o pedeapsă care are ca efect

15985
12:29:41,040 --> 12:29:45,436
micsorarea greutatilor. De aceea

15986
12:29:43,360 --> 12:29:48,560
se numește contracție. Încurajează

15987
12:29:45,436 --> 12:29:51,200
greutăţi mai mici prin acea pedeapsă şi

15988
12:29:48,560 --> 12:29:53,756
de asemenea, le va micșora atât de mult

15989
12:29:51,200 --> 12:29:56,400
că vor deveni zero și așa a fost

15990
12:29:53,756 --> 12:29:58,640
are un efect de fel de selecţie care

15991
12:29:56,400 --> 12:30:00,320
înseamnă că unii dintre ei sunt distruși

15992
12:29:58,640 --> 12:30:02,960
zero

15993
12:30:00,320 --> 12:30:05,756
iar asta înseamnă că orice a mai rămas

15994
12:30:02,960 --> 12:30:08,000
peste este un fel de ceea ce este selectat ca al nostru

15995
12:30:05,756 --> 12:30:10,320
caracteristici pentru că celelalte vor

15996
12:30:08,000 --> 12:30:14,720
li se aplică greutate zero. Deci

15997
12:30:10,320 --> 12:30:18,080
această penalizare va favoriza cu adevărat micii

15998
12:30:14,720 --> 12:30:20,320
cântărește um și penalizează foarte mare

15999
12:30:18,080 --> 12:30:22,400
greutăți. De fapt, va favoriza micii

16000
12:30:20,320 --> 12:30:26,160
cântărește atât de mult încât unii dintre ei o vor face

16001
12:30:22,400 --> 12:30:28,640
de fapt um fi micșorat la zero um în timpul

16002
12:30:26,160 --> 12:30:32,800
procesul de instruire. Și cei care

16003
12:30:28,640 --> 12:30:35,520
au rămas sunt cei care sunt

16004
12:30:32,800 --> 12:30:37,756
cele care sunt ceea ce numim selectate

16005
12:30:35,520 --> 12:30:40,400
pentru că ei sunt cei care rămân în

16006
12:30:37,756 --> 12:30:44,560
in antrenament um dupa ceilalti

16007
12:30:40,400 --> 12:30:46,880
obține uh coeficienți de zero. Hm acum când

16008
12:30:44,560 --> 12:30:48,960
faceți unii dintre coeficienți zero,

16009
12:30:46,880 --> 12:30:51,040
tu faci în mod inerent modelul

16010
12:30:48,960 --> 12:30:53,520
mai simplu, nu? Există mai puține caracteristici

16011
12:30:51,040 --> 12:30:55,116
implicat în predicția că sau mai puțin

16012
12:30:53,520 --> 12:30:57,680
caracteristici care au un efect asupra

16013
12:30:55,116 --> 12:31:00,720
predictie. Deci asta face cu siguranță

16014
12:30:57,680 --> 12:31:04,080
model mai simplu. Acest lasso, asta

16015
12:31:00,720 --> 12:31:08,720
contracția și selecția uh procesul face

16016
12:31:04,080 --> 12:31:10,240
face modelul mai simplu cu siguranță. Hm

16017
12:31:08,720 --> 12:31:11,840
iar asta ar trebui să se reducă

16018
12:31:10,240 --> 12:31:14,480
supraadaptare, nu? Dacă faci

16019
12:31:11,840 --> 12:31:16,160
model mai simplu, nu este la fel de complex. Ea

16020
12:31:14,480 --> 12:31:19,276
are mai puține șanse să memoreze

16021
12:31:16,160 --> 12:31:23,040
date de instruire și nu generalizarea peste

16022
12:31:19,276 --> 12:31:25,276
pentru a testa datele. Deci întregul nostru obiectiv cu uh

16023
12:31:23,040 --> 12:31:28,480
regularizarea este să ne facem modelul

16024
12:31:25,276 --> 12:31:30,400
mai bine la generalizare chiar la

16025
12:31:28,480 --> 12:31:32,240
date de testare din antrenamentul original

16026
12:31:30,400 --> 12:31:35,276
date.

16027
12:31:32,240 --> 12:31:38,320
Hm, deci cum se întâmplă asta? Trebuie

16028
12:31:35,276 --> 12:31:40,400
întoarce-te la

16029
12:31:38,320 --> 12:31:42,480
uh proces de antrenament. Dacă voi băieți

16030
12:31:40,400 --> 12:31:44,800
amintește-ți că am scris această ecuație a

16031
12:31:42,480 --> 12:31:46,880
puțin mai devreme care este

16032
12:31:44,800 --> 12:31:48,640
distanta. Aceasta este suma pătratului

16033
12:31:46,880 --> 12:31:50,160
distanța dintre etichetele noastre și ale noastre

16034
12:31:48,640 --> 12:31:52,640
predictie.

16035
12:31:50,160 --> 12:31:54,080
Aceasta este practic eroarea pătratică medie

16036
12:31:52,640 --> 12:31:56,480
uh calcul pe care încercăm

16037
12:31:54,080 --> 12:31:58,800
reduce atunci când construim modelul nostru folosind

16038
12:31:56,480 --> 12:32:01,276
date de antrenament. Hm, deci asta este doar în

16039
12:31:58,800 --> 12:32:05,680
regresie liniară standard. Acesta este

16040
12:32:01,276 --> 12:32:07,520
um uh suma de pătrate uh distanță dreapta

16041
12:32:05,680 --> 12:32:09,916
deci acesta este modelul

16042
12:32:07,520 --> 12:32:11,436
încercând să minimizeze atunci când le învață

16043
12:32:09,916 --> 12:32:13,680
coeficienți.

16044
12:32:11,436 --> 12:32:18,200
Deci, când învață acești coeficienți,

16045
12:32:13,680 --> 12:32:18,200
încearcă să-l minimizeze pe tipul ăsta.

16046
12:32:18,400 --> 12:32:23,756
Minimizați. Încearcă să găsească beta-urile

16047
12:32:21,116 --> 12:32:25,840
care minimizează această cantitate.

16048
12:32:23,756 --> 12:32:28,560
Din punct de vedere matematic, asta face.

16049
12:32:25,840 --> 12:32:30,960
Um, și există un algoritm care

16050
12:32:28,560 --> 12:32:32,480
va descoperi care sunt cele mai bune beta

16051
12:32:30,960 --> 12:32:34,560
care de fapt minimizează acest lucru. Asta dă

16052
12:32:32,480 --> 12:32:35,756
noi linia cea mai potrivită, nu? Asta e

16053
12:32:34,560 --> 12:32:37,756
despre ce am tot vorbit

16054
12:32:35,756 --> 12:32:41,116
regresie.

16055
12:32:37,756 --> 12:32:42,720
Acum în regularizare

16056
12:32:41,116 --> 12:32:44,720
apropo, aici este același lucru

16057
12:32:42,720 --> 12:32:47,916
lucru, dar tocmai am introdus modelul nostru

16058
12:32:44,720 --> 12:32:49,596
pentru previziuni. Acesta este modelul nostru

16059
12:32:47,916 --> 12:32:52,240
doar un mod fantezist de a-și scrie

16060
12:32:49,596 --> 12:32:58,560
model corect este beta 0 plus toate

16061
12:32:52,240 --> 12:33:01,756
aceste beta. Deci beta 1 x1 plus beta 2 x2

16062
12:32:58,560 --> 12:33:03,436
plus și mai departe și mai departe. Corect? Asta e

16063
12:33:01,756 --> 12:33:05,200
asta înseamnă asta dacă ești

16064
12:33:03,436 --> 12:33:07,276
nefamiliarizat cu notația sigma. Ea

16065
12:33:05,200 --> 12:33:12,080
înseamnă doar sumă. Deci este suma tuturor

16066
12:33:07,276 --> 12:33:14,240
acești băieți sau acest termen. Hm, deci asta este

16067
12:33:12,080 --> 12:33:17,240
acesta aici este doar un liniar obișnuit

16068
12:33:14,240 --> 12:33:17,240
regresie

16069
12:33:18,800 --> 12:33:24,880
uh antrenamentul regulat de regresie liniară

16070
12:33:21,520 --> 12:33:27,436
antrenament. Deci noi procesul de formare

16071
12:33:24,880 --> 12:33:29,756
rezolvă corect pentru acești parametri

16072
12:33:27,436 --> 12:33:31,436
rezolvă aceste greutăți. Descoperim

16073
12:33:29,756 --> 12:33:33,276
care sunt acestea minimizând acest lucru

16074
12:33:31,436 --> 12:33:37,840
cantitate. Asta e tot antrenamentul

16075
12:33:33,276 --> 12:33:43,116
proces. Hm, dar când facem lasso

16076
12:33:37,840 --> 12:33:47,000
adăugăm o penalizare care este aceasta

16077
12:33:43,116 --> 12:33:47,000
aici este pedeapsa noastră.

16078
12:33:47,520 --> 12:33:54,160
Deci, practic, luăm liniarul nostru

16079
12:33:51,200 --> 12:33:57,040
antrenament de regresie care este acesta și noi

16080
12:33:54,160 --> 12:34:00,080
adăugați o penalizare care este aceasta și dumneavoastră

16081
12:33:57,040 --> 12:34:03,040
pot vedea exact ce pedeapsă atunci când

16082
12:34:00,080 --> 12:34:05,276
când minimizi această penalizare este când

16083
12:34:03,040 --> 12:34:06,800
aceste greutăți sunt mici. Deci asta

16084
12:34:05,276 --> 12:34:10,080
încurajează

16085
12:34:06,800 --> 12:34:13,720
Deci minimizarea acestei cantități încurajează

16086
12:34:10,080 --> 12:34:13,720
greutăți mici

16087
12:34:13,756 --> 12:34:19,520
încurajează beta-urile mici

16088
12:34:17,200 --> 12:34:23,840
beta I

16089
12:34:19,520 --> 12:34:26,880
corect sau în acest caz beta j îmi pare rău

16090
12:34:23,840 --> 12:34:31,000
acest lucru încurajează beta mică js uh pentru că

16091
12:34:26,880 --> 12:34:31,000
vrem ca acest lucru să fie minimizat

16092
12:34:31,200 --> 12:34:36,160
minimiza

16093
12:34:33,916 --> 12:34:38,800
Deci, ce va face asta minim

16094
12:34:36,160 --> 12:34:40,640
este desigur linia cea mai potrivită și

16095
12:34:38,800 --> 12:34:43,840
greutăți mici corecte vor face

16096
12:34:40,640 --> 12:34:46,000
vor reduce această eroare

16097
12:34:43,840 --> 12:34:48,480
majoritatea.

16098
12:34:46,000 --> 12:34:51,200
Deci um și iată alfa noastră chiar aici

16099
12:34:48,480 --> 12:34:53,756
alfa noastră. Deci poți încuraja un superior

16100
12:34:51,200 --> 12:34:56,640
penalizare cu un alfa mai mare sau unul mai mic

16101
12:34:53,756 --> 12:34:59,116
pedeapsa. Dacă alfa este egal cu zero

16102
12:34:56,640 --> 12:35:01,360
ce se intampla cu acel termen? Doar merge

16103
12:34:59,116 --> 12:35:05,200
departe. Deci, dacă alfa este egal cu zero, există

16104
12:35:01,360 --> 12:35:09,840
nicio penalizare și ne-am întors

16105
12:35:05,200 --> 12:35:11,276
înapoi la regresia liniară obișnuită.

16106
12:35:09,840 --> 12:35:12,480
Avem doar o regresie liniară regulată

16107
12:35:11,276 --> 12:35:15,916
pentru că nu avem nicio penalizare în acel moment

16108
12:35:12,480 --> 12:35:19,200
când alfa este egal cu zero. Deci, cu cât este mai mic

16109
12:35:15,916 --> 12:35:22,960
alpha este, cu atât suntem mai puțin penalizați

16110
12:35:19,200 --> 12:35:24,640
impunerea în în regularizare.

16111
12:35:22,960 --> 12:35:27,200
Bine.

16112
12:35:24,640 --> 12:35:30,160
Acum, ceea ce se întâmplă este în realitate când tu

16113
12:35:27,200 --> 12:35:31,916
antrenează-te cu lazo. Deci, acesta este lasso

16114
12:35:30,160 --> 12:35:34,560
această pedeapsă specială. Aceasta se numește

16115
12:35:31,916 --> 12:35:37,756
pedeapsa cu lasso

16116
12:35:34,560 --> 12:35:39,680
sau uneori oamenii numesc asta L1

16117
12:35:37,756 --> 12:35:42,960
pedeapsa.

16118
12:35:39,680 --> 12:35:46,080
Um L1 vine doar din faptul că asta

16119
12:35:42,960 --> 12:35:48,160
este prima putere sau valoare absolută. Hm

16120
12:35:46,080 --> 12:35:51,436
deci nu este o penalizare la pătrat. Este o

16121
12:35:48,160 --> 12:35:55,756
o singură pedeapsă de putere

16122
12:35:51,436 --> 12:35:58,560
um acolo. Dar când adaugi acest lasso

16123
12:35:55,756 --> 12:36:00,400
pedeapsă, ce se poate întâmpla este că se întâmplă

16124
12:35:58,560 --> 12:36:02,800
pentru că pentru că minimizi

16125
12:36:00,400 --> 12:36:05,916
asta, încurajează unele dintre acestea

16126
12:36:02,800 --> 12:36:08,320
greutățile să devină zero.

16127
12:36:05,916 --> 12:36:11,596
Deci unele dacă chiar încerci să obții

16128
12:36:08,320 --> 12:36:14,560
cea mai mică cantitate din aceasta,

16129
12:36:11,596 --> 12:36:17,116
cu cât mai jos, cu atât mai bine.

16130
12:36:14,560 --> 12:36:18,480
Ceea ce face acest lucru mai jos este, desigur

16131
12:36:17,116 --> 12:36:21,200
dacă unele dintre acestea dispar. Dacă unele dintre

16132
12:36:18,480 --> 12:36:23,436
acestea merg la zero, apoi asta desigur

16133
12:36:21,200 --> 12:36:25,756
va coborî acest lucru la fel de mult ca noi la fel de mult ca

16134
12:36:23,436 --> 12:36:27,916
posibil. Corect? Deci, ce se întâmplă în timpul

16135
12:36:25,756 --> 12:36:29,916
instruirea este unele dintre acestea

16136
12:36:27,916 --> 12:36:32,560
coeficienți de fapt sunt încurajați

16137
12:36:29,916 --> 12:36:35,116
a fi mic din cauza acestei pedepse. Dar

16138
12:36:32,560 --> 12:36:38,240
unele dintre ele vor devine de fapt voință

16139
12:36:35,116 --> 12:36:40,880
deveni de fapt zero um pentru a obține

16140
12:36:38,240 --> 12:36:42,400
cel mai bun model cel mai potrivit. Unele dintre

16141
12:36:40,880 --> 12:36:44,960
acestea vor deveni de fapt atât de mici încât

16142
12:36:42,400 --> 12:36:47,756
practic vor deveni zero. Și asta

16143
12:36:44,960 --> 12:36:51,040
înseamnă că acea caracteristică practic

16144
12:36:47,756 --> 12:36:53,116
nu mai are efect. A fost

16145
12:36:51,040 --> 12:36:54,880
modelul a fost simplificat, nu?

16146
12:36:53,116 --> 12:36:57,880
Această caracteristică nu mai are cu adevărat un

16147
12:36:54,880 --> 12:36:57,880
efect.

16148
12:37:00,320 --> 12:37:06,240
Așa că doar să strig alfa din nou

16149
12:37:02,800 --> 12:37:08,320
dacă alfa zero unele co uh practic tu

16150
12:37:06,240 --> 12:37:10,320
ai regresia ta liniară te-ai întors

16151
12:37:08,320 --> 12:37:12,000
la regresie liniară deoarece alfa 0 este

16152
12:37:10,320 --> 12:37:14,960
doar șterg asta și te-ai întors la

16153
12:37:12,000 --> 12:37:16,960
regresie liniară. Hm, dacă alfa este

16154
12:37:14,960 --> 12:37:19,276
infinitul acum dacă alfa este infinit, adică

16155
12:37:16,960 --> 12:37:21,520
o extremă. Deci, dacă alfa este infinitul

16156
12:37:19,276 --> 12:37:23,840
singurul mod de a reduce acest lucru este dacă tot

16157
12:37:21,520 --> 12:37:25,756
coeficienții tăi sunt zero. Dacă fiecare

16158
12:37:23,840 --> 12:37:28,800
beta este zero, atunci aceasta va reduce valoarea

16159
12:37:25,756 --> 12:37:31,116
eroarea pe cat posibil. Deci tu

16160
12:37:28,800 --> 12:37:32,960
practic nu au model. Deci, dacă toate

16161
12:37:31,116 --> 12:37:35,916
coeficienții sunt zero, nu aveți model

16162
12:37:32,960 --> 12:37:37,916
si asta e inutil. Deci nu vrei

16163
12:37:35,916 --> 12:37:40,000
pedeapsa ta, nu vrei alfa

16164
12:37:37,916 --> 12:37:41,596
a fi uriaș este ceea ce se spune. Tu

16165
12:37:40,000 --> 12:37:42,640
de asemenea, nu vreau ca alfa să fie mic.

16166
12:37:41,596 --> 12:37:44,160
Practic te-ai întors la liniar

16167
12:37:42,640 --> 12:37:48,000
regresie. Deci vrei ceva înăuntru

16168
12:37:44,160 --> 12:37:51,680
intre. Hm și tipicul tipic

16169
12:37:48,000 --> 12:37:55,200
valoarea este alfa egal cu 1.

16170
12:37:51,680 --> 12:37:58,800
tipic este alfa egal cu 1

16171
12:37:55,200 --> 12:38:00,880
pentru a avea un anumit nivel de penalizare acolo. Deci

16172
12:37:58,800 --> 12:38:03,880
doar o pedeapsă obișnuită

16173
12:38:00,880 --> 12:38:03,880
termen.

16174
12:38:08,320 --> 12:38:12,480
Dar de fapt vom avea o cale

16175
12:38:10,160 --> 12:38:15,640
pentru a testa și a evalua care sunt alfa

16176
12:38:12,480 --> 12:38:15,640
cel mai bun.

16177
12:38:27,276 --> 12:38:31,840
um,

16178
12:38:28,800 --> 12:38:33,596
practic poți, da, poți avea o

16179
12:38:31,840 --> 12:38:36,080
poți avea un penalty care este aproape de

16180
12:38:33,596 --> 12:38:38,000
zero. Puteți scăpa de asta dacă doar a

16181
12:38:36,080 --> 12:38:40,400
regresia liniară regulată efectuează

16182
12:38:38,000 --> 12:38:42,880
destul de bine. Practic poți avea nu

16183
12:38:40,400 --> 12:38:46,160
pedeapsa in acest caz.

16184
12:38:42,880 --> 12:38:48,000
Da. Atât de aproape de zero sau așa cum ar putea fi

16185
12:38:46,160 --> 12:38:50,320
asta adăugând un pic de penalizare

16186
12:38:48,000 --> 12:38:52,320
ajută de fapt supraadaptarea și asta

16187
12:38:50,320 --> 12:38:54,480
ar putea fi chiar mic. Un lucru care

16188
12:38:52,320 --> 12:38:59,240
practic o să facem este să avem o

16189
12:38:54,480 --> 12:38:59,240
strategie de a încerca diferite alfa,

16190
12:39:00,480 --> 12:39:07,116
încercați diferite alfa

16191
12:39:03,116 --> 12:39:09,276
și evaluează performanța

16192
12:39:07,116 --> 12:39:11,116
și apoi putem decide care. Deci asta e

16193
12:39:09,276 --> 12:39:12,640
ceea ce vom face este să avem o

16194
12:39:11,116 --> 12:39:15,040
strategie de a conecta doar diferite

16195
12:39:12,640 --> 12:39:17,436
alphas, generați un antrenament similar

16196
12:39:15,040 --> 12:39:19,520
model, apoi vezi care este performanța

16197
12:39:17,436 --> 12:39:22,400
este și vezi dacă acele alfa sunt bune.

16198
12:39:19,520 --> 12:39:24,560
Care ce alfa este cel mai bun? Noi

16199
12:39:22,400 --> 12:39:26,320
poate evalua asta

16200
12:39:24,560 --> 12:39:30,116
pentru că putem antrena modelul și vedem

16201
12:39:26,320 --> 12:39:30,116
care este performanța,

16202
12:39:31,200 --> 12:39:35,756
nu?

16203
12:39:34,080 --> 12:39:39,080
Da. Da. Deci vom face asta. Vom face

16204
12:39:35,756 --> 12:39:39,080
practica asta.

16205
12:39:44,160 --> 12:39:48,720
Bine, grozav. Orice alte întrebări despre

16206
12:39:46,400 --> 12:39:50,640
această regresie lazo? Deci, amintiți-vă asta

16207
12:39:48,720 --> 12:39:52,880
este regresia liniară aici. Acesta este

16208
12:39:50,640 --> 12:39:55,756
așa te antrenezi pentru a găsi

16209
12:39:52,880 --> 12:40:00,080
beta în regresie liniară. Deci, aceasta este

16210
12:39:55,756 --> 12:40:02,080
doar regresie liniară uh um antrenament

16211
12:40:00,080 --> 12:40:04,320
functioneaza acolo.

16212
12:40:02,080 --> 12:40:07,116
Adăugăm o penalizare care este aceasta

16213
12:40:04,320 --> 12:40:09,360
pedeapsa cu lasso

16214
12:40:07,116 --> 12:40:12,880
pedeapsă cu lasso, chiar adăugăm

16215
12:40:09,360 --> 12:40:15,840
că aceasta este cunoscută sub denumirea de regularizare

16216
12:40:12,880 --> 12:40:18,080
iar scopul regularizării este de a

16217
12:40:15,840 --> 12:40:21,840
preveniți supraadaptarea, astfel încât adăugați o penalizare

16218
12:40:18,080 --> 12:40:23,360
aici acest lucru face modelul mai simplu care

16219
12:40:21,840 --> 12:40:29,240
previne supraadaptarea te ajuta

16220
12:40:23,360 --> 12:40:29,240
generalizează mai bine când e mai simplu Oricare

16221
12:40:36,640 --> 12:40:39,436
întrebări conceptuale despre asta? Suntem

16222
12:40:38,080 --> 12:40:45,000
voi face un exemplu de cod cu el

16223
12:40:39,436 --> 12:40:45,000
urmează, dar vreo întrebare despre asta?

16224
12:40:57,200 --> 12:41:01,276
Uh da, tu tu, așa că asta e chestia,

16225
12:40:59,520 --> 12:41:04,080
Ronald, ai putea fi dispus

16226
12:41:01,276 --> 12:41:06,720
sacrifica o oarecare precizie pentru a

16227
12:41:04,080 --> 12:41:08,400
generalizează la date nevăzute deoarece

16228
12:41:06,720 --> 12:41:10,960
amintiți-vă că asta încercăm cu adevărat

16229
12:41:08,400 --> 12:41:12,800
este posibil să fim dispuși

16230
12:41:10,960 --> 12:41:14,640
sacrifica o oarecare precizie pe acest antrenament

16231
12:41:12,800 --> 12:41:17,520
date pentru ca acestea să funcționeze mai bine

16232
12:41:14,640 --> 12:41:19,596
pe datele testului, nu? S-ar putea să fim

16233
12:41:17,520 --> 12:41:22,560
dispus să facă asta. Asta e vointa

16234
12:41:19,596 --> 12:41:24,960
este un sacrificiu ok

16235
12:41:22,560 --> 12:41:27,596
atâta timp ca dacă se generalizează

16236
12:41:24,960 --> 12:41:29,436
mai bine. Asta ne dorim. Asta este

16237
12:41:27,596 --> 12:41:33,200
noi încercăm să facem aici este să adăugăm o

16238
12:41:29,436 --> 12:41:36,960
penalizare, simplificați modelul și ajutați

16239
12:41:33,200 --> 12:41:39,840
se generalizează mai bine la nou și nevăzut

16240
12:41:36,960 --> 12:41:41,276
date. Corect?

16241
12:41:39,840 --> 12:41:45,040
Asta e poza cu care am folosit-o

16242
12:41:41,276 --> 12:41:47,520
cu trenul um și diviziunea de testare.

16243
12:41:45,040 --> 12:41:50,640
Unde este pătratul?

16244
12:41:47,520 --> 12:41:56,160
Deci în model nu există pătrat. Deci

16245
12:41:50,640 --> 12:41:58,640
rețineți că modelul este modelul acesta

16246
12:41:56,160 --> 12:42:03,756
um ecuație uh care nu are pătrate

16247
12:41:58,640 --> 12:42:09,916
ea. Corect? Este beta 0 plus beta 1 x1

16248
12:42:03,756 --> 12:42:11,916
plus beta 2 x2 plus beta n xn.

16249
12:42:09,916 --> 12:42:15,520
Aceasta este regresia liniară

16250
12:42:11,916 --> 12:42:18,000
model. Acesta este acum, acesta este

16251
12:42:15,520 --> 12:42:21,116
model dar aceasta este ecuația care

16252
12:42:18,000 --> 12:42:23,276
ne ajută să ne antrenăm și să găsim beta-urile. Aceasta

16253
12:42:21,116 --> 12:42:27,200
acesta este ceea ce găsim beta-urile

16254
12:42:23,276 --> 12:42:30,000
cu. Deci vom continua. Am fost

16255
12:42:27,200 --> 12:42:33,040
vorbind despre regresia lasso care

16256
12:42:30,000 --> 12:42:36,000
uh adaugă că este nevoie de regresie liniară corect

16257
12:42:33,040 --> 12:42:40,320
care este această optimizare și adaugă în a

16258
12:42:36,000 --> 12:42:43,436
pedeapsa um scalată de alfa. Hm, și

16259
12:42:40,320 --> 12:42:46,720
ce face asta pentru a minimiza acest lucru

16260
12:42:43,436 --> 12:42:49,840
întreg, încurajează acestea să fie

16261
12:42:46,720 --> 12:42:52,160
mic posibil. Hm, ceea ce face

16262
12:42:49,840 --> 12:42:55,200
modelul mai simplu, nu? Greutățile

16263
12:42:52,160 --> 12:42:57,276
nu devii prea mare și complex. um,

16264
12:42:55,200 --> 12:42:58,880
ei tind să rămână mici. De fapt,

16265
12:42:57,276 --> 12:43:01,200
unii dintre ei pot merge chiar până la

16266
12:42:58,880 --> 12:43:03,040
zero. Hm, ceea ce face modelul uniform

16267
12:43:01,200 --> 12:43:07,116
mai simplu,

16268
12:43:03,040 --> 12:43:08,640
nu? Um, deci haideți să exersăm folosirea lui

16269
12:43:07,116 --> 12:43:10,880
în cod. De fapt, este foarte ușor

16270
12:43:08,640 --> 12:43:14,880
folosi. Va fi în esență

16271
12:43:10,880 --> 12:43:17,840
același stil și cod ca liniar

16272
12:43:14,880 --> 12:43:21,756
regresie, doar că mergem

16273
12:43:17,840 --> 12:43:26,480
trebuie să punem parametrul nostru alfa

16274
12:43:21,756 --> 12:43:30,400
atunci când folosim lassoul. Deci iată-ne

16275
12:43:26,480 --> 12:43:31,840
um din familia modelului liniar dreapta

16276
12:43:30,400 --> 12:43:33,360
ceea ce are sens. Este un liniar

16277
12:43:31,840 --> 12:43:35,756
ram de regresie care are aceasta

16278
12:43:33,360 --> 12:43:38,960
penalizare în ea în timpul antrenamentului. um noi

16279
12:43:35,756 --> 12:43:42,400
ne apucă regresia lasso. Um asta

16280
12:43:38,960 --> 12:43:43,596
are de asemenea o versiune a lassoului care

16281
12:43:42,400 --> 12:43:46,160
vom arunca o privire la asta

16282
12:43:43,596 --> 12:43:49,276
folosit pentru validarea încrucișată care este

16283
12:43:46,160 --> 12:43:51,520
chiar e convenabil. Asa a fost

16284
12:43:49,276 --> 12:43:54,000
un lasso de validare încrucișată care este a

16285
12:43:51,520 --> 12:43:57,360
combinație cu adevărat convenabilă de

16286
12:43:54,000 --> 12:43:59,520
practic cross val scor și lasso um

16287
12:43:57,360 --> 12:44:02,400
toate într-una. Deci chiar este

16288
12:43:59,520 --> 12:44:05,436
placut sa folosesti asa. Hm, deci vom lua o

16289
12:44:02,400 --> 12:44:07,200
uita-te la acel exemplu. Hm, dar suntem

16290
12:44:05,436 --> 12:44:09,840
importând-o. Principalul lucru este să

16291
12:44:07,200 --> 12:44:11,360
fii modelul lasso aici. Hm, mergem

16292
12:44:09,840 --> 12:44:14,160
pentru a utiliza un set de date diferit

16293
12:44:11,360 --> 12:44:16,240
acesta. Deci, nu datele oceanului, dar

16294
12:44:14,160 --> 12:44:21,756
asta lovește date, care este o minge de baseball

16295
12:44:16,240 --> 12:44:23,520
set de date. Um, deci are 322 de rânduri cu

16296
12:44:21,756 --> 12:44:26,400
20 de coloane diferite și arată ca

16297
12:44:23,520 --> 12:44:28,320
aceasta. Deci, vrei să-l descarci.

16298
12:44:26,400 --> 12:44:31,276
Hm, sper că aveți acces la

16299
12:44:28,320 --> 12:44:33,360
acela.

16300
12:44:31,276 --> 12:44:36,640
um,

16301
12:44:33,360 --> 12:44:39,436
asa ca il voi incarca in

16302
12:44:36,640 --> 12:44:43,320
aceasta.

16303
12:44:39,436 --> 12:44:43,320
Așa că dă-mi un moment.

16304
12:44:45,520 --> 12:44:52,720
E asta. Și apoi putem rula asta.

16305
12:44:49,680 --> 12:44:56,000
Bine. Deci afișăm datele și

16306
12:44:52,720 --> 12:44:57,116
deci are numele lovitorilor și

16307
12:44:56,000 --> 12:44:58,720
apoi are o grămadă de diferite

16308
12:44:57,116 --> 12:45:00,000
statistici. Toate acestea sunt baseball

16309
12:44:58,720 --> 12:45:01,916
statistici.

16310
12:45:00,000 --> 12:45:04,160
Hm, dacă nu ești familiarizat cu ei,

16311
12:45:01,916 --> 12:45:09,000
e în regulă. Nu e mare lucru. um,

16312
12:45:04,160 --> 12:45:09,000
dar aici doar statistici de baseball diferite.

16313
12:45:09,200 --> 12:45:12,800
Bine. Ați reușit să încărcați asta?

16314
12:45:11,360 --> 12:45:14,240
Hm, dacă te urmărești, ai fost

16315
12:45:12,800 --> 12:45:18,480
reusesti sa incarci asta? Ar trebui să fii

16316
12:45:14,240 --> 12:45:19,596
acces la aceste date. Lovitorii CSV.

16317
12:45:18,480 --> 12:45:21,840
Acesta este cel pentru care vom folosi

16318
12:45:19,596 --> 12:45:25,960
modelul lasso

16319
12:45:21,840 --> 12:45:25,960
pentru a construi un model lasso.

16320
12:45:32,720 --> 12:45:35,720
Da.

16321
12:45:39,040 --> 12:45:45,436
Bine. Capabil să îl încarce pe acela. Perfect.

16322
12:45:42,640 --> 12:45:48,560
Bine. Deci, capabil să-l încărcați. Hm, și

16323
12:45:45,436 --> 12:45:51,680
ne uităm la cap. Um, deci

16324
12:45:48,560 --> 12:45:53,360
de fapt o să renunțăm la asta

16325
12:45:51,680 --> 12:45:55,436
coloană fără nume pentru că nu ne pasă

16326
12:45:53,360 --> 12:45:57,200
despre numele lor. este de fapt doar

16327
12:45:55,436 --> 12:46:00,640
numele batetorului, care nu va fi

16328
12:45:57,200 --> 12:46:03,916
util în modelare. Um, așa și amintește-ți

16329
12:46:00,640 --> 12:46:06,960
asta este în general adevărat ca un ID, un utilizator

16330
12:46:03,916 --> 12:46:08,560
ID, cum ar fi un ID de client, un nume, asta e

16331
12:46:06,960 --> 12:46:09,916
de obicei nu va fi de folos în niciuna

16332
12:46:08,560 --> 12:46:12,160
un fel de modelare. Deci suntem de fapt doar

16333
12:46:09,916 --> 12:46:14,640
o să aruncăm acea coloană și suntem

16334
12:46:12,160 --> 12:46:16,480
o să o facă pe loc.

16335
12:46:14,640 --> 12:46:19,596
Și accesul este egal cu 1 înseamnă că renunțăm

16336
12:46:16,480 --> 12:46:21,840
acea coloană. Um, deci vom renunța

16337
12:46:19,596 --> 12:46:23,596
asta și nu ar trebui să mai avem asta

16338
12:46:21,840 --> 12:46:25,680
coloana. Și îi avem pe toți acești tipi

16339
12:46:23,596 --> 12:46:30,080
acum. Deci vrei să rulezi asta. Aceasta va

16340
12:46:25,680 --> 12:46:33,916
arunca asta. Um asta va scădea picăturile

16341
12:46:30,080 --> 12:46:37,840
coloană pe loc.

16342
12:46:33,916 --> 12:46:41,596
Um și acum putem vedea că avem uh toți

16343
12:46:37,840 --> 12:46:44,320
avem aceste date unde avem asta

16344
12:46:41,596 --> 12:46:46,160
datele de unde sunt acum eliminate. Deci asta

16345
12:46:44,320 --> 12:46:50,000
acea coloană a dispărut și acum avem

16346
12:46:46,160 --> 12:46:52,640
tipii astia. Um, observi ceva

16347
12:46:50,000 --> 12:46:56,116
despre asta

16348
12:46:52,640 --> 12:46:56,116
din informatii?

16349
12:46:58,000 --> 12:47:02,400
Se pare că avem câteva categorice

16350
12:46:59,520 --> 12:47:04,800
caracteristici, câteva dintre ele, liga și

16351
12:47:02,400 --> 12:47:07,680
diviziune

16352
12:47:04,800 --> 12:47:10,680
și ligă nouă. Despre ce observi

16353
12:47:07,680 --> 12:47:10,680
asta?

16354
12:47:16,080 --> 12:47:20,320
Nolles. Da. Deci, cu siguranță există câteva

16355
12:47:17,840 --> 12:47:23,960
lipsesc date acolo că mergem

16356
12:47:20,320 --> 12:47:23,960
a avea de-a face.

16357
12:47:25,756 --> 12:47:31,040
Deci, se pare că există

16358
12:47:29,520 --> 12:47:35,116
59.

16359
12:47:31,040 --> 12:47:37,756
Sunt 59. Acum, am putea

16360
12:47:35,116 --> 12:47:39,680
alternativă pentru a face asta este că am putea uh

16361
12:47:37,756 --> 12:47:44,560
am putea folosi codul nostru obișnuit unde

16362
12:47:39,680 --> 12:47:49,200
facem df.is este uh este nul.

16363
12:47:44,560 --> 12:47:51,596
Um și apoi facem uh dot suma la total

16364
12:47:49,200 --> 12:47:54,480
cei de pe diferitele noastre coloane.

16365
12:47:51,596 --> 12:47:57,116
Și putem vedea că avem 59 de

16366
12:47:54,480 --> 12:47:58,720
cei din această coloană de salariu. Asta e

16367
12:47:57,116 --> 12:48:01,720
este modul standard de a face asta,

16368
12:47:58,720 --> 12:48:01,720
nu?

16369
12:48:02,000 --> 12:48:07,960
Mod standard de a face asta. Și avem

16370
12:48:03,680 --> 12:48:07,960
deci avem 59 dintre ele

16371
12:48:12,960 --> 12:48:19,960
59 dintre acestea. Deci, trebuie să ne ocupăm

16372
12:48:15,276 --> 12:48:19,960
ea. Aveți idei despre cum să o faceți?

16373
12:48:22,080 --> 12:48:28,080
Aveți idei despre cum să o faceți? Acest

16374
12:48:24,560 --> 12:48:29,756
este acum Acesta este 59 din 300.

16375
12:48:28,080 --> 12:48:31,040
Deci,

16376
12:48:29,756 --> 12:48:32,800
ce parere aveti despre asta? Este

16377
12:48:31,040 --> 12:48:36,080
puțin diferit de 200 din

16378
12:48:32,800 --> 12:48:40,680
20.000. Puțin diferit. Avem

16379
12:48:36,080 --> 12:48:40,680
Avem aproximativ 60 din 300.

16380
12:48:40,880 --> 12:48:44,596
Există o sumă decentă.

16381
12:48:45,116 --> 12:48:49,640
Aveți vreo idee despre cum să o gestionați?

16382
12:48:50,560 --> 12:48:55,596
Înlocui. Da, ar trebui să înlocuim. Ce să faci

16383
12:48:52,720 --> 12:48:58,320
crezi că ar trebui să înlocuim cu?

16384
12:48:55,596 --> 12:49:01,320
Este un plutitor. Este o virgulă flotantă

16385
12:48:58,320 --> 12:49:01,320
valoare.

16386
12:49:09,360 --> 12:49:12,720
Apropo, ceva unic în asta

16387
12:49:11,200 --> 12:49:16,720
asta e puțin diferit decât de obicei,

16388
12:49:12,720 --> 12:49:18,320
de asemenea, este că acesta este de fapt

16389
12:49:16,720 --> 12:49:19,916
coloana pe care o vom folosi ca etichetă.

16390
12:49:18,320 --> 12:49:24,400
Deci, de fapt, vom prezice

16391
12:49:19,916 --> 12:49:27,200
salariu bazat pe uh pe baza um

16392
12:49:24,400 --> 12:49:29,436
restul caracteristicilor. Deci, cu siguranță

16393
12:49:27,200 --> 12:49:30,880
trebuie să completați aceste nles, nu?

16394
12:49:29,436 --> 12:49:32,480
pentru că de fapt vor fi

16395
12:49:30,880 --> 12:49:34,880
etichete

16396
12:49:32,480 --> 12:49:37,436
și ne lipsesc niște etichete din noul nostru

16397
12:49:34,880 --> 12:49:39,040
date. Trebuie neapărat să le umplem

16398
12:49:37,436 --> 12:49:42,040
in. Da. Deci, vom înlocui

16399
12:49:39,040 --> 12:49:42,040
ei.

16400
12:49:49,040 --> 12:49:52,720
În regulă. Deci, vom înlocui

16401
12:49:51,200 --> 12:49:54,240
ei jos. Asta va fi

16402
12:49:52,720 --> 12:49:56,960
venind. Ne vom întoarce și

16403
12:49:54,240 --> 12:50:00,400
înlocuiți-le. înainte să le înlocuim,

16404
12:49:56,960 --> 12:50:02,800
de fapt o să ne luăm pe unul

16405
12:50:00,400 --> 12:50:09,520
codificări fierbinți pentru cele trei diferite

16406
12:50:02,800 --> 12:50:12,720
caracteristicile pe care le avem. Hm, deci primim

16407
12:50:09,520 --> 12:50:15,756
prosti cu asta. Acum, bineînțeles că noi

16408
12:50:12,720 --> 12:50:17,596
nu trebuie să facem asta dacă facem asta

16409
12:50:15,756 --> 12:50:21,360
cod pe care nu trebuie să-l facem dacă trecem

16410
12:50:17,596 --> 12:50:24,240
în dtype aici

16411
12:50:21,360 --> 12:50:28,160
um, care este uh, atunci nu trebuie să facem

16412
12:50:24,240 --> 12:50:31,040
aceasta. Deci putem comenta asta.

16413
12:50:28,160 --> 12:50:32,960
Acum, ce vreau să observați

16414
12:50:31,040 --> 12:50:35,840
aceasta este alternativa la ceea ce noi

16415
12:50:32,960 --> 12:50:37,756
am făcut înainte acolo unde suntem intenționat drepți

16416
12:50:35,840 --> 12:50:40,640
făcând aceste coloane nu toate datele

16417
12:50:37,756 --> 12:50:46,080
cadru dar doar făcând aceste coloane și

16418
12:50:40,640 --> 12:50:47,520
atunci putem um concatena aceste acestea

16419
12:50:46,080 --> 12:50:50,720
unul fierbinte codificări. Vom merge

16420
12:50:47,520 --> 12:50:53,276
se concatenează înapoi la cadrul de date.

16421
12:50:50,720 --> 12:50:56,160
Corect? Deci dacă ne facem manechinele și apoi

16422
12:50:53,276 --> 12:50:59,116
faceți informații despre dummies.info. Um, putem vedea

16423
12:50:56,160 --> 12:51:03,160
că ajungem cu șase coloane noi. Şi

16424
12:50:59,116 --> 12:51:03,160
de fapt, putem face manechine.head

16425
12:51:03,756 --> 12:51:08,080
și uită-te la care sunt acestea.

16426
12:51:05,756 --> 12:51:11,436
Corect? Deci, acestea sunt liga A, liga,

16427
12:51:08,080 --> 12:51:14,560
uh, N, divizia E, W, divizia W, nou

16428
12:51:11,436 --> 12:51:16,320
liga A, noua ligă N.

16429
12:51:14,560 --> 12:51:20,560
Bine.

16430
12:51:16,320 --> 12:51:22,400
Deci, acestea sunt uh, acestea sunt ale noastre

16431
12:51:20,560 --> 12:51:24,240
codificări fierbinți pentru aceste trei diferite

16432
12:51:22,400 --> 12:51:25,916
caracteristici care sunt șiruri, nu? Deci,

16433
12:51:24,240 --> 12:51:27,840
acele trăsături erau șiruri. Dacă

16434
12:51:25,916 --> 12:51:30,240
te duci înapoi, alea au fost singurele noastre

16435
12:51:27,840 --> 12:51:31,756
caracteristicile șirului pe care le aveam. Deci, avem unul

16436
12:51:30,240 --> 12:51:34,000
le-am codificat la cald, astfel încât să le putem folosi în

16437
12:51:31,756 --> 12:51:37,756
modelul nostru. Ceea ce trebuie să facem este doar

16438
12:51:34,000 --> 12:51:39,276
concatenați acest lucru înapoi la cadrul nostru de date.

16439
12:51:37,756 --> 12:51:43,080
Corect? Deci, trebuie doar să ne concatenăm

16440
12:51:39,276 --> 12:51:43,080
înapoi în datele noastre.

16441
12:51:48,000 --> 12:51:55,040
Bine. Deci, ceea ce vom face atunci este

16442
12:51:51,520 --> 12:51:57,360
o să ne apucăm

16443
12:51:55,040 --> 12:51:59,756
ia-l pe Y drept salariu. Si bineinteles,

16444
12:51:57,360 --> 12:52:01,916
vom completa nles pe acel Y

16445
12:51:59,756 --> 12:52:05,756
apar în scurt timp. Dar o să facem

16446
12:52:01,916 --> 12:52:08,400
luați Y ca salariu și X nou. Acum

16447
12:52:05,756 --> 12:52:11,360
înainte de a construi un X complet, vom merge

16448
12:52:08,400 --> 12:52:14,400
aruncați o privire la X numeric ca date noastre

16449
12:52:11,360 --> 12:52:17,040
cadru minus aceste coloane. Motivul

16450
12:52:14,400 --> 12:52:19,916
facem minus acelea pentru că noi

16451
12:52:17,040 --> 12:52:22,160
ne vor concatena manechinul

16452
12:52:19,916 --> 12:52:24,880
variabilele înapoi în asta care merg

16453
12:52:22,160 --> 12:52:26,880
pentru a-i înlocui pe acești tipi. Deci vom merge

16454
12:52:24,880 --> 12:52:29,360
înlocuiți-le oricum cu cea fierbinte

16455
12:52:26,880 --> 12:52:32,080
codificări. Nu vrem corzile. Aşa

16456
12:52:29,360 --> 12:52:33,276
o să scăpăm de acestea. Şi

16457
12:52:32,080 --> 12:52:34,960
vom scăpa și de

16458
12:52:33,276 --> 12:52:36,880
salariu pentru că asta va fi parte

16459
12:52:34,960 --> 12:52:38,960
al nostru asta este doar eticheta. Deci noi

16460
12:52:36,880 --> 12:52:41,960
nu vreau asta în X, eventualul

16461
12:52:38,960 --> 12:52:41,960
X.

16462
12:52:44,720 --> 12:52:50,400
Sunteți capabili să rulați asta?

16463
12:52:48,800 --> 12:52:52,880
Sper că nu merg prea repede. Voi băieți

16464
12:52:50,400 --> 12:52:54,480
capabil să ruleze asta? Și face

16465
12:52:52,880 --> 12:52:56,800
sens? Ceea ce facem este să punem

16466
12:52:54,480 --> 12:52:58,080
etichetele noastre în Y, care este ceea ce noi

16467
12:52:56,800 --> 12:53:00,000
de obicei fac. Deci vom prezice

16468
12:52:58,080 --> 12:53:02,080
salariul

16469
12:53:00,000 --> 12:53:04,400
și ne pregătim să construim X.

16470
12:53:02,080 --> 12:53:06,640
Dar înainte să vrem mai întâi să scăpăm de

16471
12:53:04,400 --> 12:53:09,040
acelea fierbinți la corzi. Aceasta este

16472
12:53:06,640 --> 12:53:11,360
scăpând de sfori

16473
12:53:09,040 --> 12:53:12,960
iar asta înseamnă a scăpa de etichetă şi

16474
12:53:11,360 --> 12:53:14,960
asta va face parte din caracteristicile noastre.

16475
12:53:12,960 --> 12:53:17,756
Ceea ce trebuie să facem este să construim finalul nostru X

16476
12:53:14,960 --> 12:53:19,520
prin concatenarea manechinelor noastre cu asta.

16477
12:53:17,756 --> 12:53:21,200
Vedeți asta băieți? Vom merge

16478
12:53:19,520 --> 12:53:23,916
concatenează manechinele noastre cu asta pentru a

16479
12:53:21,200 --> 12:53:26,160
construim finalul nostru X.

16480
12:53:23,916 --> 12:53:28,960
Dar înainte de a face asta, trebuie

16481
12:53:26,160 --> 12:53:31,756
scăpați de aceste coloane de șir aici. Deci

16482
12:53:28,960 --> 12:53:35,520
le scăpăm

16483
12:53:31,756 --> 12:53:38,640
aruncându-le din cadrul de date uh

16484
12:53:35,520 --> 12:53:40,240
și obținerea unui uh x numeric numeric

16485
12:53:38,640 --> 12:53:42,720
aici.

16486
12:53:40,240 --> 12:53:45,276
Puteți vedea că coloanele sunt doar

16487
12:53:42,720 --> 12:53:46,960
tipii astia de aici. Deci rezultatele noi

16488
12:53:45,276 --> 12:53:50,640
trebuie să ne concatenăm avem nevoie

16489
12:53:46,960 --> 12:53:52,640
concatena acest tip în asta și

16490
12:53:50,640 --> 12:53:55,640
atunci asta va fi deplinul nostru x tot al nostru

16491
12:53:52,640 --> 12:53:55,640
caracteristici.

16492
12:53:57,040 --> 12:54:02,240
Bine. Deci puteți vedea că x va fi

16493
12:54:00,160 --> 12:54:06,680
pd.con

16494
12:54:02,240 --> 12:54:06,680
de asta cu manechinele noastre.

16495
12:54:06,800 --> 12:54:13,116
Asta cu manechinele noastre. Și um

16496
12:54:11,116 --> 12:54:14,956
în loc să fac asta, de fapt sunt

16497
12:54:13,116 --> 12:54:18,800
o să fac manechinele complete. Noi nu

16498
12:54:14,956 --> 12:54:20,560
trebuie să alegeți doar câteva coloane.

16499
12:54:18,800 --> 12:54:24,800
De fapt, ne vom descurca din plin

16500
12:54:20,560 --> 12:54:28,640
manechine aici și um do x este egal cu 1. Acum,

16501
12:54:24,800 --> 12:54:32,480
motivul pentru care este cazul este pentru că um

16502
12:54:28,640 --> 12:54:35,756
aceasta va scăpa de o coloană pe

16503
12:54:32,480 --> 12:54:37,596
caracteristică și, practic, presupuneți că dacă dvs

16504
12:54:35,756 --> 12:54:39,520
ai un dacă ai zero, celălalt

16505
12:54:37,596 --> 12:54:42,800
ar trebui să fie unul. Dacă ai unul,

16506
12:54:39,520 --> 12:54:44,880
celălalt ar trebui să fie zero. Um asa e

16507
12:54:42,800 --> 12:54:47,916
practic face această presupunere pentru că

16508
12:54:44,880 --> 12:54:50,480
avem doar două dintre ele. Așa oricând

16509
12:54:47,916 --> 12:54:52,956
există unul, celălalt ar trebui să fie zero.

16510
12:54:50,480 --> 12:54:55,596
Um, ca să poți scăpa doar având

16511
12:54:52,956 --> 12:54:58,480
acestea trei, dar eu cred că face

16512
12:54:55,596 --> 12:55:00,880
mai logic să trebuie doar să ai tot

16513
12:54:58,480 --> 12:55:03,040
manechine,

16514
12:55:00,880 --> 12:55:04,560
dar prin procesul de eliminare, poți

16515
12:55:03,040 --> 12:55:06,956
scapă folosind doar două dintre ele

16516
12:55:04,560 --> 12:55:08,400
pentru că oricând ai un zero,

16517
12:55:06,956 --> 12:55:11,436
celălalt ar trebui să fie cealaltă caracteristică

16518
12:55:08,400 --> 12:55:13,596
ar fi fost ar fi fost unul,

16519
12:55:11,436 --> 12:55:14,880
nu? Și invers, când există o

16520
12:55:13,596 --> 12:55:17,880
una, cealaltă caracteristică ar fi fost a

16521
12:55:14,880 --> 12:55:17,880
zero.

16522
12:55:20,400 --> 12:55:24,756
Așa că o facem.

16523
12:55:31,436 --> 12:55:36,000
Și poți să vezi toate ale noastre uh toate ale noastre

16524
12:55:34,000 --> 12:55:39,000
o caracteristică de codificare fierbinte ajunge înapoi în

16525
12:55:36,000 --> 12:55:39,000
acolo.

16526
12:55:40,400 --> 12:55:45,040
Deci acesta este codul pe care îl vreau pe voi

16527
12:55:42,320 --> 12:55:47,756
a alerga. Cred că are mai mult sens. Ea

16528
12:55:45,040 --> 12:55:49,840
urmărește ceea ce am făcut.

16529
12:55:47,756 --> 12:55:52,560
um, care ne va concatena manechinele

16530
12:55:49,840 --> 12:55:54,640
înapoi la caracteristicile noastre aici pentru a construi

16531
12:55:52,560 --> 12:55:58,400
X-ul nostru complet. Deci acum X este tot al nostru

16532
12:55:54,640 --> 12:56:04,000
caracteristici. Amintește-ți X

16533
12:55:58,400 --> 12:56:05,840
X X conține toate caracteristicile noastre

16534
12:56:04,000 --> 12:56:09,200
acum.

16535
12:56:05,840 --> 12:56:13,956
Deci X conține toate caracteristicile noastre și așa

16536
12:56:09,200 --> 12:56:13,956
avem toate astea acum.

16537
12:56:15,916 --> 12:56:19,840
Bine. Ați fost capabili să conduceți asta

16538
12:56:17,276 --> 12:56:23,276
unul?

16539
12:56:19,840 --> 12:56:26,720
D. Avem y, avem x. Mai avem nevoie

16540
12:56:23,276 --> 12:56:30,840
să se ocupe de nles-ul din y. Așa că

16541
12:56:26,720 --> 12:56:30,840
ceva cu care mai trebuie să ne confruntăm.

16542
12:56:33,840 --> 12:56:38,040
Dar sper să ai asta. Acum

16543
12:56:38,800 --> 12:56:44,880
toate acestea sunt numerice.

16544
12:56:41,680 --> 12:56:47,436
Deci asta ar trebui să fie bine cu modelul.

16545
12:56:44,880 --> 12:56:51,116
Acesta este un lucru despre X este că ar trebui

16546
12:56:47,436 --> 12:56:53,040
tu X-ul nostru ar trebui să aibă toate cifrele

16547
12:56:51,116 --> 12:56:56,560
caracteristici, nu? Pentru că va fi

16548
12:56:53,040 --> 12:56:58,480
intră într-un model pentru a învăța acele beta.

16549
12:56:56,560 --> 12:57:00,800
Deci trebuie să aibă toate cifrele

16550
12:56:58,480 --> 12:57:01,680
caracteristici,

16551
12:57:00,800 --> 12:57:03,596
nu? Acestea vor fi toate

16552
12:57:01,680 --> 12:57:05,276
numeric, ceea ce are sens. Ne schimbam

16553
12:57:03,596 --> 12:57:08,916
am făcut o codificare fierbinte pentru a schimba totul

16554
12:57:05,276 --> 12:57:08,916
tipii ăia la numeric.

16555
12:57:15,520 --> 12:57:19,640
Îmi pare rău, derulez în jos.

16556
12:57:20,080 --> 12:57:25,560
Bine, completăm nator. Bine.

16557
12:57:33,596 --> 12:57:36,560
Bine.

16558
12:57:35,116 --> 12:57:37,840
Aveți întrebări până acum? Deci, suntem doar

16559
12:57:36,560 --> 12:57:39,520
pregătirea datelor noastre. Nu am făcut-o

16560
12:57:37,840 --> 12:57:42,720
am aplicat lasso-ul încă, dar suntem doar

16561
12:57:39,520 --> 12:57:45,436
făcând niște pregătiri. Acum, sper că voi băieți

16562
12:57:42,720 --> 12:57:48,160
recunoașteți că acestea sunt niște standarde

16563
12:57:45,436 --> 12:57:50,880
pașii pe care îi facem atunci când facem

16564
12:57:48,160 --> 12:57:53,840
modelare. Trebuie să pregătim aceste date

16565
12:57:50,880 --> 12:57:55,756
trepte. Sunt necesare. Și așa, dacă este

16566
12:57:53,840 --> 12:57:59,116
se pare că e multă muncă, asta e

16567
12:57:55,756 --> 12:58:01,116
pentru că este. Este munca pe care o faci

16568
12:57:59,116 --> 12:58:06,916
pregătiți-vă datele pentru a vă pregăti

16569
12:58:01,116 --> 12:58:06,916
modelare. Trebuie să faci asta. Bine.

16570
12:58:07,040 --> 12:58:12,480
Deci, facem asta aici. Hm, acum suntem

16571
12:58:10,560 --> 12:58:14,160
ne vom face testul de tren pentru că

16572
12:58:12,480 --> 12:58:16,640
doar o să facem, uh, o să facem

16573
12:58:14,160 --> 12:58:18,160
rezista aici. Deci, facem o

16574
12:58:16,640 --> 12:58:20,640
test tren împărțit cu aproximativ cu un test

16575
12:58:18,160 --> 12:58:24,000
dimensiunea de aproximativ 0,25. Deci, din nou, oriunde

16576
12:58:20,640 --> 12:58:29,520
intre 02 si.3 ar fi in regula.

16577
12:58:24,000 --> 12:58:31,520
Deci, e alegerea noastră. Am putea face

16578
12:58:29,520 --> 12:58:33,596
02. Am putea face 3. Am putea face oriunde

16579
12:58:31,520 --> 12:58:37,436
între acolo. Facem 0,25.

16580
12:58:33,596 --> 12:58:40,000
Asta e bine. E în regulă. Deci, noi noi

16581
12:58:37,436 --> 12:58:42,480
construiește-ne diviziunea de test de tren chiar acolo.

16582
12:58:40,000 --> 12:58:45,680
Um, atât de destul de simplu și am făcut-o

16583
12:58:42,480 --> 12:58:50,000
am văzut că de multe ori cu X-ul nostru

16584
12:58:45,680 --> 12:58:53,560
și cadrele noastre de date Y. Acolo avem noastre

16585
12:58:50,000 --> 12:58:53,560
împărțirea testului trenului.

16586
12:58:53,680 --> 12:58:58,720
Bine.

16587
12:58:55,520 --> 12:59:01,680
Hm, acum ceea ce vom face este să ne facem

16588
12:58:58,720 --> 12:59:02,956
scalarea noastră. Deci, noi nu am făcut asta

16589
12:59:01,680 --> 12:59:05,680
data trecută, dar vom face asta

16590
12:59:02,956 --> 12:59:10,080
acum ca uh pentru că ar trebui să intrăm în

16591
12:59:05,680 --> 12:59:13,840
obiceiul de a face asta. Um este um suntem

16592
12:59:10,080 --> 12:59:15,916
mergi să mergi mai departe și să ne scalăm

16593
12:59:13,840 --> 12:59:19,200
caracteristici și vom folosi

16594
12:59:15,916 --> 12:59:22,080
Scaler standard aici pentru a face asta

16595
12:59:19,200 --> 12:59:24,160
scalare. Bine. Acum, am putea folosi minmax

16596
12:59:22,080 --> 12:59:26,800
scaler, de asemenea, e bine. Doar suntem

16597
12:59:24,160 --> 12:59:31,276
voi folosi aici scalerul standard.

16598
12:59:26,800 --> 12:59:34,720
Um și amintiți-vă că vom face uh um

16599
12:59:31,276 --> 12:59:38,720
utilizați scalatorul standard de la sklearn și

16600
12:59:34,720 --> 12:59:43,596
ne vom transforma caracteristicile uh

16601
12:59:38,720 --> 12:59:47,200
uh conform nostru um conform nostru

16602
12:59:43,596 --> 12:59:49,756
date de antrenament. Deci avem

16603
12:59:47,200 --> 12:59:53,520
pre-procesare scaler standard aici. Deci

16604
12:59:49,756 --> 12:59:56,640
importăm acel tip și apoi construim

16605
12:59:53,520 --> 12:59:59,840
scalatorul nostru standard și montați-l pe

16606
12:59:56,640 --> 13:00:04,080
date de antrenament numai pe cifre

16607
12:59:59,840 --> 13:00:08,000
Caracteristici. Um deci asta va fi

16608
13:00:04,080 --> 13:00:10,400
fiți toți acești tipi. Așa facem

16609
13:00:08,000 --> 13:00:13,276
scalarea pe toți acești tipi. Acum,

16610
13:00:10,400 --> 13:00:16,000
ceva de remarcat este că nu suntem

16611
13:00:13,276 --> 13:00:18,400
scalarea tuturor acestor codificări fierbinți

16612
13:00:16,000 --> 13:00:20,880
în principal pentru că nu are sens să

16613
13:00:18,400 --> 13:00:23,520
scala-le cu adevărat. Sunt zero sau unu.

16614
13:00:20,880 --> 13:00:25,756
Nu trebuie să fie scalate, nu?

16615
13:00:23,520 --> 13:00:27,436
Sunt deja zero și unu. Deci,

16616
13:00:25,756 --> 13:00:29,520
ei nu trebuie să fie chiar dacă noi

16617
13:00:27,436 --> 13:00:30,956
făceam scalare minmax, va fi

16618
13:00:29,520 --> 13:00:33,360
pune-le intre zero si unu. Ea

16619
13:00:30,956 --> 13:00:35,360
nu l-ar afecta cu adevărat, nu? Deci,

16620
13:00:33,360 --> 13:00:36,560
aceste caracteristici fierbinți de codare, suntem

16621
13:00:35,360 --> 13:00:39,840
nu merg la scară pentru că sunt

16622
13:00:36,560 --> 13:00:42,000
ele vor fi întotdeauna zero sau unu.

16623
13:00:39,840 --> 13:00:44,000
Nu este nevoie să le scalați cu adevărat.

16624
13:00:42,000 --> 13:00:46,880
Hm, dar vom mări toate

16625
13:00:44,000 --> 13:00:50,240
alte caracteristici aici care sunt plutitoare.

16626
13:00:46,880 --> 13:00:53,040
Deci ăștia sunt tipii de aici. Acestea

16627
13:00:50,240 --> 13:00:54,800
caracteristicile numerice pe care le vom scala.

16628
13:00:53,040 --> 13:00:56,480
Bine.

16629
13:00:54,800 --> 13:00:58,560
Nu e nevoie, nu prea avem nevoie

16630
13:00:56,480 --> 13:01:02,200
scala cea mai caldă codificare. Uh, este

16631
13:00:58,560 --> 13:01:02,200
aproape deja scalat.

16632
13:01:05,916 --> 13:01:10,956
Oh, ar trebui să schimbi asta. Hm, du-te înapoi

16633
13:01:08,320 --> 13:01:13,116
și reluați înapoi și reluați acest lucru. Dar

16634
13:01:10,956 --> 13:01:15,360
asigurați-vă că aveți tipul de date ca int

16635
13:01:13,116 --> 13:01:17,116
aici.

16636
13:01:15,360 --> 13:01:19,756
Asigurați-vă că adăugați asta acolo

16637
13:01:17,116 --> 13:01:23,200
schimbați-l în întreg și rulați din nou

16638
13:01:19,756 --> 13:01:24,800
asta și apoi reluați reexecuția

16639
13:01:23,200 --> 13:01:27,520
concatenare.

16640
13:01:24,800 --> 13:01:29,840
Așa că asigură-te că rulezi asta

16641
13:01:27,520 --> 13:01:34,160
și apoi asigurați-vă că reluați acest lucru și

16642
13:01:29,840 --> 13:01:37,160
reluați partea de concatenare care este uh

16643
13:01:34,160 --> 13:01:37,160
aceasta

16644
13:01:47,680 --> 13:01:54,320
Bine. Așa că mergem înainte și ne potrivim

16645
13:01:52,160 --> 13:01:56,880
scalator la aceste date și apoi mergem

16646
13:01:54,320 --> 13:02:00,240
pentru a ne transforma caracteristicile de antrenament,

16647
13:01:56,880 --> 13:02:02,560
acele caracteristici numerice. Suntem și

16648
13:02:00,240 --> 13:02:05,916
atunci le vom transforma

16649
13:02:02,560 --> 13:02:08,000
caracteristici uh uh caracteristicile de testare din

16650
13:02:05,916 --> 13:02:10,320
la fel. Deci vom efectua

16651
13:02:08,000 --> 13:02:12,000
aceeași transformare de la scaler în continuare

16652
13:02:10,320 --> 13:02:13,756
datele de testare. Deci asta e ceva

16653
13:02:12,000 --> 13:02:19,200
foarte important vreau să remarc aici este

16654
13:02:13,756 --> 13:02:22,320
că scalam întotdeauna atât antrenamentul

16655
13:02:19,200 --> 13:02:23,276
și date de testare. Întotdeauna le mărim pe amândouă. De

16656
13:02:22,320 --> 13:02:27,200
desigur, vom antrena modelul

16657
13:02:23,276 --> 13:02:30,240
asupra datelor de antrenament. Hm, dar suntem

16658
13:02:27,200 --> 13:02:32,640
îl voi testa și la testare

16659
13:02:30,240 --> 13:02:34,640
date și trebuie, de asemenea, scalate

16660
13:02:32,640 --> 13:02:37,116
pentru că modelul nostru pe care îl construim merge

16661
13:02:34,640 --> 13:02:39,276
să-și asume caracteristici la scară. The

16662
13:02:37,116 --> 13:02:42,240
coeficienții pe care îi învață vor ajunge

16663
13:02:39,276 --> 13:02:46,560
să-și asume caracteristici la scară.

16664
13:02:42,240 --> 13:02:49,520
Așa că trebuie să ne mărim și datele de testare

16665
13:02:46,560 --> 13:02:52,520
in acelasi fel. Deci facem asta ca

16666
13:02:49,520 --> 13:02:52,520
bine.

16667
13:02:53,116 --> 13:02:58,720
Deci, am scala asta. Și acum avem a noastră

16668
13:02:56,640 --> 13:03:01,276
uh, funcțiile de antrenament și testare au

16669
13:02:58,720 --> 13:03:02,800
fost scalat.

16670
13:03:01,276 --> 13:03:05,200
Nu, nu am înlocuit. Vom merge

16671
13:03:02,800 --> 13:03:08,000
face asta. Încă nu am făcut-o. Vom merge

16672
13:03:05,200 --> 13:03:11,040
fă asta într-un minut. Da, noi

16673
13:03:08,000 --> 13:03:13,680
nu am facut asta. Hm, acesta este

16674
13:03:11,040 --> 13:03:15,116
eticheta. Neapărat trebuie să înlocuim

16675
13:03:13,680 --> 13:03:16,720
NLES. Doar că nu am făcut-o încă

16676
13:03:15,116 --> 13:03:18,880
pentru că nu este în caracteristici și

16677
13:03:16,720 --> 13:03:20,720
facem toate lucrurile noastre uh uh

16678
13:03:18,880 --> 13:03:23,880
pre-procesare la pre-procesarea noastră către

16679
13:03:20,720 --> 13:03:23,880
caracteristicile noastre.

16680
13:03:30,240 --> 13:03:36,200
Da. Deci, cu siguranță avem nevoie

16681
13:03:32,240 --> 13:03:36,200
mergem într-un minut.

16682
13:03:36,640 --> 13:03:40,240
Bine. Deci, dacă te uiți la date acum,

16683
13:03:38,320 --> 13:03:43,116
totul a fost scalat. Deci, acestea sunt toate

16684
13:03:40,240 --> 13:03:48,080
um zcore. Acestea sunt toate pe mult

16685
13:03:43,116 --> 13:03:49,756
scala mai bine acum. Hm, și aceștia suntem noi

16686
13:03:48,080 --> 13:03:53,916
încă mai avem caracteristicile noastre de codare fierbinți

16687
13:03:49,756 --> 13:03:56,400
care sunt zero sau unu. Deci scalarea asta

16688
13:03:53,916 --> 13:03:59,200
ar trebui să conducă la un model mai bun decât dacă am

16689
13:03:56,400 --> 13:04:03,400
nu a scalat. Deci scalarea este cu adevărat

16690
13:03:59,200 --> 13:04:03,400
important. Putem vedea asta aici.

16691
13:04:06,400 --> 13:04:10,880
Bine.

16692
13:04:08,240 --> 13:04:12,956
Acum, lasă-mă să vă întreb, băieți, ați fost

16693
13:04:10,880 --> 13:04:15,596
capabil să ruleze scalarea? Ești prins

16694
13:04:12,956 --> 13:04:19,480
pana aici? Dacă te urmărești,

16695
13:04:15,596 --> 13:04:19,480
ai reușit să rulezi scalarea?

16696
13:04:28,640 --> 13:04:32,756
Bine, grozav. Mare.

16697
13:04:36,720 --> 13:04:39,360
Minunat.

16698
13:04:39,596 --> 13:04:48,160
Bine. Deci, ce vom face acum

16699
13:04:42,720 --> 13:04:52,000
este înlocuiți valorile nule în uh înlocuiți nles

16700
13:04:48,160 --> 13:04:55,040
prin calcularea medianei datelor.

16701
13:04:52,000 --> 13:04:59,116
Deci, ceea ce vreau să observați este că noi

16702
13:04:55,040 --> 13:05:02,800
iau NLES acum, asta e asta

16703
13:04:59,116 --> 13:05:05,596
este intenționat este luăm intenționat

16704
13:05:02,800 --> 13:05:07,520
NLES um din mediană

16705
13:05:05,596 --> 13:05:09,520
calculul. Așa că omitem NLES

16706
13:05:07,520 --> 13:05:11,200
când calculăm mediana pentru că noi

16707
13:05:09,520 --> 13:05:13,116
nu vreau ca acele NLES să afecteze

16708
13:05:11,200 --> 13:05:16,640
calcul median.

16709
13:05:13,116 --> 13:05:19,200
Deci calculăm un salariu mediu aici

16710
13:05:16,640 --> 13:05:23,200
și apoi ne umplem NLES-ul cu

16711
13:05:19,200 --> 13:05:26,640
salariul mediu um din datele de formare.

16712
13:05:23,200 --> 13:05:30,400
Deci aceasta este alegerea noastră. Aceasta este o alegere

16713
13:05:26,640 --> 13:05:34,800
um să folosești mediana și este, de asemenea, a

16714
13:05:30,400 --> 13:05:38,480
alegerea de a utiliza mediana setului de antrenament

16715
13:05:34,800 --> 13:05:40,320
atât pentru tren cât și pentru test. Ce am putea

16716
13:05:38,480 --> 13:05:43,276
au făcut, aceasta este o alternativă care

16717
13:05:40,320 --> 13:05:48,000
am fi putut face este să folosim întregul

16718
13:05:43,276 --> 13:05:50,640
coloană și apoi um folosiți mediana tuturor

16719
13:05:48,000 --> 13:05:53,916
a datelor de înlocuit. Asta e cu adevărat

16720
13:05:50,640 --> 13:05:56,000
la noi. Hm, acesta este un mod de a face asta.

16721
13:05:53,916 --> 13:06:00,400
Am fi putut face înainte de a face

16722
13:05:56,000 --> 13:06:03,200
despicat. Am fi putut completa cu

16723
13:06:00,400 --> 13:06:05,360
mediana de mai devreme. Noi am ales să o facem

16724
13:06:03,200 --> 13:06:07,116
aici în principal pentru că nu afectează

16725
13:06:05,360 --> 13:06:09,276
caracteristicile. Deci, am fi putut face

16726
13:06:07,116 --> 13:06:12,400
asta mai devreme și am făcut-o înainte de noi

16727
13:06:09,276 --> 13:06:14,080
despărțit și umplut NAS. Hm, într-adevăr

16728
13:06:12,400 --> 13:06:17,360
nu-i așa că nu contează atât de mult

16729
13:06:14,080 --> 13:06:19,680
în ce fel o facem. Hm, dar avem nevoie

16730
13:06:17,360 --> 13:06:21,276
completați NLES. Nu putem avea ca acestea să fie

16731
13:06:19,680 --> 13:06:23,840
nul când noi când îl punem în nostru

16732
13:06:21,276 --> 13:06:27,116
model. Deci, într-un fel trebuie să completăm

16733
13:06:23,840 --> 13:06:30,720
NLES. Um și așa suntem în această strategie

16734
13:06:27,116 --> 13:06:32,800
completând trenul nostru Y um cu

16735
13:06:30,720 --> 13:06:34,956
salariul mediu din datele noastre de formare.

16736
13:06:32,800 --> 13:06:36,720
Și la fel cu asta completăm

16737
13:06:34,956 --> 13:06:39,840
salariul mediu al datelor de formare

16738
13:06:36,720 --> 13:06:43,360
de asemenea. Dar asta e o alegere dacă am putea

16739
13:06:39,840 --> 13:06:46,720
completați cu media cu media.

16740
13:06:43,360 --> 13:06:48,640
Am putea completa cu ceea ce am putea face

16741
13:06:46,720 --> 13:06:50,240
cu toate datele împreună înaintea noastră

16742
13:06:48,640 --> 13:06:52,400
împărțiți-l. am fi putut completa cu

16743
13:06:50,240 --> 13:06:55,680
toate mediana de-a lungul întregului

16744
13:06:52,400 --> 13:06:59,680
set de date. Hm, oricare dintre ele funcționează. Poți

16745
13:06:55,680 --> 13:07:01,520
fă-o oricum, dar noi am făcut-o

16746
13:06:59,680 --> 13:07:03,116
mai târziu aici pentru a arăta că nu

16747
13:07:01,520 --> 13:07:05,916
afectează cu adevărat caracteristicile. Deci, putem

16748
13:07:03,116 --> 13:07:08,160
alege când o facem, nu? Nu este

16749
13:07:05,916 --> 13:07:09,596
afectează deloc caracteristicile. Deci, putem

16750
13:07:08,160 --> 13:07:12,400
faceți toată preprocesarea noastră pe

16751
13:07:09,596 --> 13:07:18,680
caracteristici și apoi face eticheta noastră uh

16752
13:07:12,400 --> 13:07:18,680
umplere și nule um dacă dacă le avem.

16753
13:07:20,080 --> 13:07:27,400
uh x numeric. Asigură-te că ești

16754
13:07:23,276 --> 13:07:27,400
rulând asta

16755
13:07:27,680 --> 13:07:37,680
uh x numeric a fost definit aici

16756
13:07:32,640 --> 13:07:39,680
când îl despărțim de

16757
13:07:37,680 --> 13:07:41,116
când am lăsat aceste coloane aici.

16758
13:07:39,680 --> 13:07:43,520
Așa că asigură-te că rulezi asta. Aceasta

16759
13:07:41,116 --> 13:07:45,840
este x numeric

16760
13:07:43,520 --> 13:07:49,200
se definește acolo.

16761
13:07:45,840 --> 13:07:51,680
Deci, du-te înapoi în celula asta

16762
13:07:49,200 --> 13:07:55,680
unde despărțim yul și noi și noi

16763
13:07:51,680 --> 13:07:59,480
au x aici x numeric.

16764
13:07:55,680 --> 13:07:59,480
Asigurați-vă că rulați asta.

16765
13:08:04,240 --> 13:08:11,800
Asigurați-vă că rulați asta. Și atunci poți

16766
13:08:06,160 --> 13:08:11,800
rulează acestea. Apoi rulați asta pentru a construi x.

16767
13:08:19,436 --> 13:08:24,640
În regulă.

16768
13:08:21,276 --> 13:08:26,480
Suntem până aici cu această completare

16769
13:08:24,640 --> 13:08:29,040
etichetele?

16770
13:08:26,480 --> 13:08:30,956
Pentru că atunci ne putem construi modelul

16771
13:08:29,040 --> 13:08:34,800
odată ce ajungem până aici. Am scalat

16772
13:08:30,956 --> 13:08:38,916
totul. Am completat NLES-ul nostru.

16773
13:08:34,800 --> 13:08:38,916
Avem o codificare fierbinte.

16774
13:08:41,040 --> 13:08:45,360
Da, este. De aceea știi că asta e

16775
13:08:42,956 --> 13:08:47,596
de ce petrecem mult timp pe model

16776
13:08:45,360 --> 13:08:49,436
despre pregătirea datelor cu panda, nu?

16777
13:08:47,596 --> 13:08:51,756
De aceea am făcut toată treaba cu panda

16778
13:08:49,436 --> 13:08:54,400
cu siguranta. Da, este mult de lucru

16779
13:08:51,756 --> 13:08:57,200
înainte de a putea construi un model.

16780
13:08:54,400 --> 13:08:58,720
Da, băieți, observați asta

16781
13:08:57,200 --> 13:09:01,756
modelarea este relativ usoara. Sale

16782
13:08:58,720 --> 13:09:03,680
doar o potrivire si prezice. Modelarea este

16783
13:09:01,756 --> 13:09:07,520
de fapt foarte usor. Sunt toate celelalte

16784
13:09:03,680 --> 13:09:10,240
munca care este mai implicată, nu?

16785
13:09:07,520 --> 13:09:13,680
mai mult cod.

16786
13:09:10,240 --> 13:09:15,596
Modelarea în sine este foarte ușoară.

16787
13:09:13,680 --> 13:09:18,480
Doar că este doar o linie de like

16788
13:09:15,596 --> 13:09:22,916
ffit.

16789
13:09:18,480 --> 13:09:22,916
Da, destul de ușor de făcut.

16790
13:09:23,200 --> 13:09:29,080
Și apoi faci o evaluare care este a

16791
13:09:25,840 --> 13:09:29,080
cuplu de linii.

16792
13:09:47,596 --> 13:09:52,400
Da. Acestea sunt toate acestea sunt

16793
13:09:50,320 --> 13:09:54,480
pașii comuni. Toți acești pași suntem

16794
13:09:52,400 --> 13:09:57,200
a face sunt foarte foarte prototipice în

16795
13:09:54,480 --> 13:09:59,040
construirea modelului este să ne întoarcem

16796
13:09:57,200 --> 13:10:01,520
prin asta pentru a vedea ce am făcut bine

16797
13:09:59,040 --> 13:10:04,640
a importat datele noastre

16798
13:10:01,520 --> 13:10:06,720
um analizăm că am renunțat la această coloană de nume

16799
13:10:04,640 --> 13:10:10,880
pentru că nu ne este de folos deci noi

16800
13:10:06,720 --> 13:10:13,360
a scăpat că am completat nles-ul

16801
13:10:10,880 --> 13:10:14,956
în cele din urmă, dar știi dacă au existat

16802
13:10:13,360 --> 13:10:16,956
orice nles din caracteristicile noastre am avea

16803
13:10:14,956 --> 13:10:18,800
să se ocupe și de acestea prin înlocuire

16804
13:10:16,956 --> 13:10:21,756
le sau aruncând rândurile așa cum am făcut noi

16805
13:10:18,800 --> 13:10:24,160
mai devreme Um

16806
13:10:21,756 --> 13:10:25,680
și apoi facem o codificare fierbinte pentru că

16807
13:10:24,160 --> 13:10:27,200
bineînțeles că nu putem avea niciun șir

16808
13:10:25,680 --> 13:10:29,116
coloane care merg în modelele noastre. Avem un

16809
13:10:27,200 --> 13:10:33,276
o codificare fierbinte.

16810
13:10:29,116 --> 13:10:36,160
Atunci ne construim X și Y cu ajutorul

16811
13:10:33,276 --> 13:10:39,436
concatenând înapoi pe cel codificat la cald

16812
13:10:36,160 --> 13:10:41,916
la caracteristicile numerice.

16813
13:10:39,436 --> 13:10:43,596
Apoi antrenăm diviziunea de test. Corect? Asta e

16814
13:10:41,916 --> 13:10:46,956
destul de comun. Sau am putea face cruce

16815
13:10:43,596 --> 13:10:49,756
validare oricum. Hm, K plin

16816
13:10:46,956 --> 13:10:50,956
validare încrucișată. Apoi scalam. Deci, noi

16817
13:10:49,756 --> 13:10:52,080
nu am făcut asta ultima dată, dar asta este

16818
13:10:50,956 --> 13:10:55,680
ceva cu care ar trebui să ne obișnuim

16819
13:10:52,080 --> 13:10:58,880
ne extinde caracteristicile. Deci, facem

16820
13:10:55,680 --> 13:11:01,916
asta și acum suntem gata să modelăm. Deci,

16821
13:10:58,880 --> 13:11:04,320
acum suntem gata să modelăm. Aşa, asta e

16822
13:11:01,916 --> 13:11:07,840
această parte.

16823
13:11:04,320 --> 13:11:10,400
Bine. Deci, hai să facem modelul. Hăi

16824
13:11:07,840 --> 13:11:12,480
modelul este de fapt destul de ușor de făcut.

16825
13:11:10,400 --> 13:11:14,560
Deci, vom folosi un lasso. Deci, noi

16826
13:11:12,480 --> 13:11:16,400
au un model lasso aici. Observă ce

16827
13:11:14,560 --> 13:11:19,040
ne setăm alfa la. Deci marele

16828
13:11:16,400 --> 13:11:20,560
parametrul pe care trebuie să-l ignorăm

16829
13:11:19,040 --> 13:11:21,916
iterații. De fapt, nu prea

16830
13:11:20,560 --> 13:11:24,720
nevoie de noi nu avem nevoie de asta

16831
13:11:21,916 --> 13:11:26,400
parametrul. Um deci ignora-l pentru

16832
13:11:24,720 --> 13:11:29,276
moment. Dar cel mare care suntem

16833
13:11:26,400 --> 13:11:31,436
setarea aici este alfa. Deci când noi

16834
13:11:29,276 --> 13:11:33,360
am făcut regresie liniară, nu am avut nevoie

16835
13:11:31,436 --> 13:11:35,200
orice parametri să intre în interiorul liniarului

16836
13:11:33,360 --> 13:11:37,436
obiect de regresie. Nu aveam nevoie de niciunul

16837
13:11:35,200 --> 13:11:39,840
parametri, nu? Pentru că există

16838
13:11:37,436 --> 13:11:42,800
într-adevăr fără parametri ai acestuia. Dar pentru

16839
13:11:39,840 --> 13:11:44,800
lasso, cel important este alfa.

16840
13:11:42,800 --> 13:11:49,040
Și deci trebuie să știm ce să setăm alfa

16841
13:11:44,800 --> 13:11:51,360
la. Hm, să începem cu alfa egal cu 1.

16842
13:11:49,040 --> 13:11:55,040
Acesta este un bun loc de plecare. Deci a

16843
13:11:51,360 --> 13:11:58,240
punct de plecare tipic

16844
13:11:55,040 --> 13:12:03,436
pentru alfa

16845
13:11:58,240 --> 13:12:05,756
um este uh este unul. Deci este un tipic

16846
13:12:03,436 --> 13:12:08,800
punct de plecare. Și astfel putem seta alfa

16847
13:12:05,756 --> 13:12:11,360
egal cu unu. Această iterație maximă este

16848
13:12:08,800 --> 13:12:13,116
parametrul care guvernează

16849
13:12:11,360 --> 13:12:16,080
procesul de instruire pentru că este

16850
13:12:13,116 --> 13:12:18,880
iterativ. Deci dacă dintr-un motiv oarecare noi

16851
13:12:16,080 --> 13:12:21,596
nu poate converge către beta-urile potrivite și

16852
13:12:18,880 --> 13:12:24,560
l-am rulat timp de 10.000 de pași odată ce am

16853
13:12:21,596 --> 13:12:26,880
treci 10.000 de pași, se va opri și

16854
13:12:24,560 --> 13:12:29,040
doar dă-ne beta-urile în acel moment.

16855
13:12:26,880 --> 13:12:31,916
Dar probabil că nu va lovi niciodată asta

16856
13:12:29,040 --> 13:12:34,880
număr. Va converge înainte de atunci. Deci

16857
13:12:31,916 --> 13:12:36,240
nu trebuie să specificăm

16858
13:12:34,880 --> 13:12:38,480
ea. Deci, de fapt, voi primi

16859
13:12:36,240 --> 13:12:41,360
scapa de ea. Hm, nu e chiar mare

16860
13:12:38,480 --> 13:12:44,320
afacere. Ar trebui să converge înainte de atunci.

16861
13:12:41,360 --> 13:12:46,560
Hm, dar dacă vrem să setăm ca a

16862
13:12:44,320 --> 13:12:49,916
dimensiunea maximă a pasului în optimizare,

16863
13:12:46,560 --> 13:12:51,840
cu siguranță am putea acolo. Uh, dar nu

16864
13:12:49,916 --> 13:12:53,756
prea preocupat de asta. Dar

16865
13:12:51,840 --> 13:12:56,640
iată lasoul nostru. Și atunci suntem doar

16866
13:12:53,756 --> 13:12:58,240
vom face o potrivire pe datele noastre. Deci, uite

16867
13:12:56,640 --> 13:13:02,240
ce usor este. Exact ca un liniar

16868
13:12:58,240 --> 13:13:07,480
regresie. Lasso.fit,

16869
13:13:02,240 --> 13:13:07,480
nu? Deci, ne potrivim. um,

16870
13:13:10,640 --> 13:13:16,000
Oh, nu eu am condus asta. Îmi pare rău. am primit

16871
13:13:12,800 --> 13:13:17,596
pentru a rula asta. Bine. De fapt, asta este o

16872
13:13:16,000 --> 13:13:19,436
bun exemplu a ceea ce se întâmplă când tu

16873
13:13:17,596 --> 13:13:21,916
nu atunci când ai nuluri, nu? Deci, asta

16874
13:13:19,436 --> 13:13:24,000
spune că nulul nostru conține nan. Asta e

16875
13:13:21,916 --> 13:13:26,240
pentru că nu am condus asta. Dar acum, asta

16876
13:13:24,000 --> 13:13:28,956
ar trebui completat. Acum, ar trebui să fim

16877
13:13:26,240 --> 13:13:31,956
capabil să ruleze asta. Bine, perfect. Deci

16878
13:13:28,956 --> 13:13:31,956
aleargă.

16879
13:13:36,560 --> 13:13:40,720
Bine. Deci puteți vedea ce interceptare

16880
13:13:38,560 --> 13:13:43,200
este. Acesta este unul dintre coeficienții noștri,

16881
13:13:40,720 --> 13:13:44,640
nu? Interceptarea este 457. Și uite

16882
13:13:43,200 --> 13:13:47,756
acum ce este cu adevărat interesant la

16883
13:13:44,640 --> 13:13:49,916
coeficienți este uita-te la ceea ce unele dintre

16884
13:13:47,756 --> 13:13:53,596
coeficienţii sunt.

16885
13:13:49,916 --> 13:13:55,520
Unele dintre ele sunt de fapt zero, adică

16886
13:13:53,596 --> 13:13:58,080
într-adevăr Deci unii dintre ei au ajuns să fie la

16887
13:13:55,520 --> 13:14:02,000
zero, ceea ce este foarte foarte interesant.

16888
13:13:58,080 --> 13:14:03,596
asta înseamnă că acele caracteristici obțin

16889
13:14:02,000 --> 13:14:06,480
anulate și practic sunt

16890
13:14:03,596 --> 13:14:09,116
nu face parte din modelul care este cu adevărat

16891
13:14:06,480 --> 13:14:13,640
interesant. Deci avem toate astea

16892
13:14:09,116 --> 13:14:13,640
coeficienți și unii dintre ei sunt zero.

16893
13:14:16,640 --> 13:14:21,680
Da, negativ0 este doar din cauza

16894
13:14:19,680 --> 13:14:23,436
convergență așa cum au început

16895
13:14:21,680 --> 13:14:26,720
negativ și și-au făcut drum până la

16896
13:14:23,436 --> 13:14:29,116
zero. ea. Zero negativ chiar doar

16897
13:14:26,720 --> 13:14:31,596
înseamnă zero, dar tocmai veneau

16898
13:14:29,116 --> 13:14:34,240
din ele erau ca micile negative şi

16899
13:14:31,596 --> 13:14:36,320
a ajuns la zero

16900
13:14:34,240 --> 13:14:39,040
în timpul procesului de instruire. Au fost

16901
13:14:36,320 --> 13:14:40,640
negativ la un moment dat și a ajuns zero.

16902
13:14:39,040 --> 13:14:43,436
Hm

16903
13:14:40,640 --> 13:14:49,000
deci da, 0 negativ înseamnă evident

16904
13:14:43,436 --> 13:14:49,000
zero. E încă zero acolo.

16905
13:14:54,480 --> 13:14:59,596
Deci, ceea ce este interesant sunt unele dintre acestea

16906
13:14:56,320 --> 13:15:01,520
caracteristicile au ajuns să fie zero, ceea ce

16907
13:14:59,596 --> 13:15:03,596
de obicei nu vezi într-un liniar

16908
13:15:01,520 --> 13:15:05,276
regresie. Deci, dacă ar fi să antrenăm asta

16909
13:15:03,596 --> 13:15:07,756
folosind o regresie liniară am de obicei

16910
13:15:05,276 --> 13:15:10,320
nu ar vedea asta, dar unele dintre acestea se întorc

16911
13:15:07,756 --> 13:15:13,756
să fie zero pentru că din nou suntem

16912
13:15:10,320 --> 13:15:16,160
încurajând acele beta să fie mici.

16913
13:15:13,756 --> 13:15:20,800
îi încurajăm să fie mici

16914
13:15:16,160 --> 13:15:22,480
și deci știi ce se întâmplă este ceva

16915
13:15:20,800 --> 13:15:24,400
dintre ele pot fi micșorate până la capăt

16916
13:15:22,480 --> 13:15:26,956
la zero, ceea ce înseamnă că acele caracteristici nu

16917
13:15:24,400 --> 13:15:29,200
contribuie că este un model foarte simplu

16918
13:15:26,956 --> 13:15:32,240
în acel moment chiar așa am luat

16919
13:15:29,200 --> 13:15:34,160
ceva complex care include toate

16920
13:15:32,240 --> 13:15:36,080
aceste caracteristici și de fapt le-a redus

16921
13:15:34,160 --> 13:15:38,160
în ceva simplu care include doar

16922
13:15:36,080 --> 13:15:40,956
aceste caracteristici

16923
13:15:38,160 --> 13:15:44,560
corect

16924
13:15:40,956 --> 13:15:46,720
deci asta face, acum trebuie

16925
13:15:44,560 --> 13:15:49,040
evaluați acest lucru pentru a vedea cât de bun este un model

16926
13:15:46,720 --> 13:15:52,400
este. Dar asta se spune

16927
13:15:49,040 --> 13:15:54,480
aici în acest text este că um un pozitiv

16928
13:15:52,400 --> 13:15:56,640
coeficientul uh indică faptul că

16929
13:15:54,480 --> 13:15:58,640
variabila independenta creste

16930
13:15:56,640 --> 13:16:00,320
variabila dependenta creste si ea.

16931
13:15:58,640 --> 13:16:02,880
Coeficientul negativ înseamnă ca

16932
13:16:00,320 --> 13:16:04,800
variabila independenta creste dependenta

16933
13:16:02,880 --> 13:16:09,040
scade deoarece reduce

16934
13:16:04,800 --> 13:16:10,880
valoare. Um și lasso este cunoscut pentru caracteristică

16935
13:16:09,040 --> 13:16:13,200
selecție prin restrângerea unora dintre ele la

16936
13:16:10,880 --> 13:16:15,360
zero eliminând efectiv acelea

16937
13:16:13,200 --> 13:16:17,520
variabilele din modelul din

16938
13:16:15,360 --> 13:16:19,200
dreapta ecuației

16939
13:16:17,520 --> 13:16:23,000
um

16940
13:16:19,200 --> 13:16:23,000
deci asta se intampla

16941
13:16:23,680 --> 13:16:27,720
unele dintre ele ajung să fie zero

16942
13:16:27,756 --> 13:16:33,756
ați fost capabili să rulați asta

16943
13:16:30,400 --> 13:16:36,400
lasso uh fit care este antrenamentul

16944
13:16:33,756 --> 13:16:36,400
lasoul

16945
13:16:52,320 --> 13:16:56,560
Nu, nu asigură că nu există

16946
13:16:53,840 --> 13:16:58,320
supraadaptare, dar ajută la supraadaptare.

16947
13:16:56,560 --> 13:16:59,916
Ar trebui să ajute prin realizarea

16948
13:16:58,320 --> 13:17:02,000
model mai simplu. Și acesta este cu siguranță un

16949
13:16:59,916 --> 13:17:03,596
model mai simplu pentru că îndepărtează unele

16950
13:17:02,000 --> 13:17:05,840
a caracteristicilor din model

16951
13:17:03,596 --> 13:17:07,520
in esenta, nu? Pentru că unele dintre

16952
13:17:05,840 --> 13:17:09,916
caracteristicile nu vor contribui.

16953
13:17:07,520 --> 13:17:11,436
Este un model mai simplu.

16954
13:17:09,916 --> 13:17:13,520
Nu înseamnă că nu există

16955
13:17:11,436 --> 13:17:15,436
va fi orice supraadaptare, dar asta

16956
13:17:13,520 --> 13:17:19,756
ajută la prevenirea acestuia. Asta este

16957
13:17:15,436 --> 13:17:22,080
conceput pentru a face, ajuta la prevenirea acesteia.

16958
13:17:19,756 --> 13:17:24,480
Da. Deci, coeficient mai mare. Da. The

16959
13:17:22,080 --> 13:17:26,240
coeficient mai mare înseamnă că este mai mult

16960
13:17:24,480 --> 13:17:27,756
caracteristică importantă față de

16961
13:17:26,240 --> 13:17:30,160
predictie.

16962
13:17:27,756 --> 13:17:32,720
Da. Asta înseamnă cu siguranță. The

16963
13:17:30,160 --> 13:17:35,520
mai mare este mărimea, cu atât mai mult de a

16964
13:17:32,720 --> 13:17:39,080
contribuitor la această predicție. Uh

16965
13:17:35,520 --> 13:17:39,080
este. Da.

16966
13:17:43,436 --> 13:17:47,680
Și nu este doar că ar putea fi

16967
13:17:45,116 --> 13:17:50,240
mai mare pozitiv sau negativ acolo. Ca

16968
13:17:47,680 --> 13:17:52,080
un negativ mai mare este, de asemenea, destul de mare

16969
13:17:50,240 --> 13:17:53,756
factor,

16970
13:17:52,080 --> 13:17:57,800
nu? Deci, vrei să te gândești la asta

16971
13:17:53,756 --> 13:17:57,800
din punct de vedere al valorii absolute.

16972
13:18:01,840 --> 13:18:05,436
nu garanteaza dar ajuta. Da, asta

16973
13:18:03,680 --> 13:18:07,596
nu garanteaza dar este proiectat

16974
13:18:05,436 --> 13:18:11,080
pentru a ajuta la supraadaptare, ajuta la prevenirea acesteia.

16975
13:18:07,596 --> 13:18:11,080
Da, absolut.

16976
13:18:32,956 --> 13:18:38,880
Bine.

16977
13:18:35,116 --> 13:18:42,480
Deci haideți să facem o evaluare. Hm deci hai

16978
13:18:38,880 --> 13:18:45,480
face în acest caz vom face noastre

16979
13:18:42,480 --> 13:18:45,480
prezice

16980
13:19:02,720 --> 13:19:07,436
Oh, da. Nu sunt sigur de ce este asta

16981
13:19:05,520 --> 13:19:10,436
caz.

16982
13:19:07,436 --> 13:19:10,436
Interesant.

16983
13:19:27,840 --> 13:19:34,680
Am putea încerca să creștem um max

16984
13:19:31,680 --> 13:19:34,680
iterații.

16985
13:19:43,360 --> 13:19:47,680
Bine, de aceea. Da. Deci atunci primești

16986
13:19:45,436 --> 13:19:49,360
care rezultă cu cel mai mare max

16987
13:19:47,680 --> 13:19:53,360
iterații.

16988
13:19:49,360 --> 13:19:54,956
Acolo nu se taie.

16989
13:19:53,360 --> 13:19:57,116
Cred că de aceea probabil ai plecat

16990
13:19:54,956 --> 13:19:58,800
asta acolo,

16991
13:19:57,116 --> 13:20:01,800
ceea ce este bine. Primești cam la fel

16992
13:19:58,800 --> 13:20:01,800
numere.

16993
13:20:06,640 --> 13:20:09,640
Da.

16994
13:20:16,080 --> 13:20:19,596
În regulă. Să evaluăm asta. Deci,

16995
13:20:17,520 --> 13:20:21,360
vom face o evaluare. eu

16996
13:20:19,596 --> 13:20:24,400
Vreau să vedeți din nou, ar trebui

16997
13:20:21,360 --> 13:20:26,880
Obișnuiește-te să faci evaluare,

16998
13:20:24,400 --> 13:20:29,276
care ne ia modelul și prezice

16999
13:20:26,880 --> 13:20:31,360
asupra antrenamentului și prezicerea asupra

17000
13:20:29,276 --> 13:20:35,116
seturi de testare, nu? Așa că prezicem asupra

17001
13:20:31,360 --> 13:20:41,840
tren și calculați MSE-ul nostru

17002
13:20:35,116 --> 13:20:44,880
și calculăm scorul nostru R2 um sau R

17003
13:20:41,840 --> 13:20:46,560
scor pătrat ar trebui să spun. Dar din nou

17004
13:20:44,880 --> 13:20:50,000
MSE este cel la care ne vom duce cu adevărat

17005
13:20:46,560 --> 13:20:52,640
utilizați mai ales. Hm, dar calculăm așa facem

17006
13:20:50,000 --> 13:20:54,480
predicțiile noastre și apoi le comparăm

17007
13:20:52,640 --> 13:20:56,000
în eroarea noastră pătrată medie cu nostru

17008
13:20:54,480 --> 13:21:00,240
etichete

17009
13:20:56,000 --> 13:21:02,160
și mergem înainte și facem același lucru

17010
13:21:00,240 --> 13:21:04,160
cu testul. Corect? Așa că facem uh

17011
13:21:02,160 --> 13:21:07,276
laso.predic

17012
13:21:04,160 --> 13:21:10,880
pe funcțiile noastre de testare și mergem înainte și

17013
13:21:07,276 --> 13:21:12,800
comparați asta cu etichetele de testare. Şi

17014
13:21:10,880 --> 13:21:15,680
deci ceea ce facem acolo este generarea

17015
13:21:12,800 --> 13:21:18,080
MSE-ul nostru.

17016
13:21:15,680 --> 13:21:21,200
Așa că ne uităm la MSE-ul nostru și noi

17017
13:21:18,080 --> 13:21:25,360
primești 84.000

17018
13:21:21,200 --> 13:21:29,040
MSE. Um și desigur că am putea lua

17019
13:21:25,360 --> 13:21:34,240
ce am putea face cu asta este

17020
13:21:29,040 --> 13:21:39,360
aruncați o privire la um MSE pe uh noi

17021
13:21:34,240 --> 13:21:45,400
ar putea face um MP. Rădăcină pătrată

17022
13:21:39,360 --> 13:21:45,400
și faceți rădăcina pătrată a testului MSE.

17023
13:21:45,840 --> 13:21:51,756
și obținem 340. Deci asta ar fi în

17024
13:21:49,040 --> 13:21:54,640
unitățile etichetei noastre. Deci, dacă mergem

17025
13:21:51,756 --> 13:21:59,160
înapoi și uită-te la eticheta noastră pentru unii

17026
13:21:54,640 --> 13:21:59,160
dintre cei um

17027
13:22:08,640 --> 13:22:14,240
deci suntem în 300 de ani și datele noastre sunt

17028
13:22:12,400 --> 13:22:16,320
ca chiar în jurul anului 500. Deci, de

17029
13:22:14,240 --> 13:22:19,276
desigur, dacă am descrie asta am putea

17030
13:22:16,320 --> 13:22:21,200
vezi care sunt statisticile. Deci,

17031
13:22:19,276 --> 13:22:22,400
am putea face df.escribe descrie si

17032
13:22:21,200 --> 13:22:24,560
generează asta. Dar asta nu pare

17033
13:22:22,400 --> 13:22:27,596
ca o eroare foarte bună, nu? Dacă acestea

17034
13:22:24,560 --> 13:22:29,596
sunt în anii 400, um asta nu este a

17035
13:22:27,596 --> 13:22:32,240
eroare foarte buna.

17036
13:22:29,596 --> 13:22:33,840
Deci, din nou, nu este un model foarte grozav.

17037
13:22:32,240 --> 13:22:36,800
Dar un lucru pe care vreau să-l vezi este că

17038
13:22:33,840 --> 13:22:38,560
este că nu este supraadaptat.

17039
13:22:36,800 --> 13:22:41,040
Hm, dacă ceva, de fapt este

17040
13:22:38,560 --> 13:22:43,840
underfitting, ceea ce este acest tip de

17041
13:22:41,040 --> 13:22:48,880
um MSE sugerează, nu? deoarece noastre

17042
13:22:43,840 --> 13:22:51,880
eroare aici este 84, scuzați-mă, 84.000.

17043
13:22:48,880 --> 13:22:51,880
Hm

17044
13:22:54,000 --> 13:23:01,276
Zona noastră aici este de 84.000,

17045
13:22:58,080 --> 13:23:02,956
scuza-ma. Și pe setul de testare este

17046
13:23:01,276 --> 13:23:08,160
116.000.

17047
13:23:02,956 --> 13:23:10,880
Deci aceste două erori sunt ambele rele. Deci

17048
13:23:08,160 --> 13:23:13,040
nu este supraadaptat. Acesta este de fapt

17049
13:23:10,880 --> 13:23:16,240
submontare. Deci nu este prea potrivit,

17050
13:23:13,040 --> 13:23:17,840
de fapt este insuficient. Hm, și așa

17051
13:23:16,240 --> 13:23:20,480
asta e riscul cu ceva de genul

17052
13:23:17,840 --> 13:23:23,756
laso este că face modelul a

17053
13:23:20,480 --> 13:23:26,400
cam prea simplu și riscăm de fapt

17054
13:23:23,756 --> 13:23:29,520
underfitting, ceea ce se întâmplă. Noi

17055
13:23:26,400 --> 13:23:31,916
au prea multe erori în ambele

17056
13:23:29,520 --> 13:23:34,000
antrenament și setul de testare. Supramontare

17057
13:23:31,916 --> 13:23:36,000
atunci când facem, avem foarte bine

17058
13:23:34,000 --> 13:23:38,560
performanță pe platoul de antrenament, dar proastă

17059
13:23:36,000 --> 13:23:40,320
performanță pe setul de testare. Nu suntem

17060
13:23:38,560 --> 13:23:43,840
supraadaptare.

17061
13:23:40,320 --> 13:23:45,916
Suntem nepotriviți pentru că noi

17062
13:23:43,840 --> 13:23:48,480
performanța nu este bună în nici un caz. Chiar și

17063
13:23:45,916 --> 13:23:52,200
acest R pătrat este destul de scăzut. Nu este

17064
13:23:48,480 --> 13:23:52,200
chiar si la 50%.

17065
13:23:56,080 --> 13:24:00,800
Bine, așa că facem noi

17066
13:23:59,116 --> 13:24:03,360
evaluare și din nou evaluarea doar

17067
13:24:00,800 --> 13:24:05,276
se rezumă la a face previziuni şi

17068
13:24:03,360 --> 13:24:07,756
calculând eroarea noastră printre acestea

17069
13:24:05,276 --> 13:24:13,480
predicții pentru etichetele noastre. Asta e mereu

17070
13:24:07,756 --> 13:24:13,480
care va fi evaluarea

17071
13:24:14,320 --> 13:24:17,640
pentru MSE.

17072
13:24:17,756 --> 13:24:23,436
Care este MSE ideal? ce crezi

17073
13:24:20,560 --> 13:24:25,680
ar trebui sa fie? Ce este Deci, gândiți-vă

17074
13:24:23,436 --> 13:24:30,480
ca asta. MSE reprezintă

17075
13:24:25,680 --> 13:24:33,200
distanța medie dintre predicțiile noastre

17076
13:24:30,480 --> 13:24:36,080
si etichetele.

17077
13:24:33,200 --> 13:24:38,320
Deci, dacă înțelegem bine toate

17078
13:24:36,080 --> 13:24:40,320
timp, care va fi acea distanță

17079
13:24:38,320 --> 13:24:43,596
dacă avem întotdeauna dreptate? Ce este al nostru

17080
13:24:40,320 --> 13:24:46,000
distanta de la care este distanta noastra

17081
13:24:43,596 --> 13:24:49,596
previziunile noastre la etichetele noastre merg la

17082
13:24:46,000 --> 13:24:51,596
fie dacă întotdeauna înțelegem bine?

17083
13:24:49,596 --> 13:24:53,840
Zero. Da, nu va fi niciunul

17084
13:24:51,596 --> 13:24:55,596
distanta. O să fie corect. Este

17085
13:24:53,840 --> 13:24:57,360
va fi perfect aliniat, nu?

17086
13:24:55,596 --> 13:25:00,720
Nu va fi nicio distanţă acolo.

17087
13:24:57,360 --> 13:25:03,596
Deci, da, un MSE ideal este zero.

17088
13:25:00,720 --> 13:25:06,240
Acesta este un MSE ideal.

17089
13:25:03,596 --> 13:25:09,756
Deci, orice se apropie de cel mai mic

17090
13:25:06,240 --> 13:25:13,200
cu atât mai bine pentru MSE. Cu cât este mai mic

17091
13:25:09,756 --> 13:25:16,160
mai bine. Um, pentru acest R pătrat, uh, este

17092
13:25:13,200 --> 13:25:18,560
este o scară între 0 și unu unde unu

17093
13:25:16,160 --> 13:25:22,320
este cel mai bun. Deci, unul ar fi perfect

17094
13:25:18,560 --> 13:25:25,200
predicții aliniate. Um, deci și din nou,

17095
13:25:22,320 --> 13:25:26,956
aceasta este, de fapt, înmulțim cu 100

17096
13:25:25,200 --> 13:25:30,480
pentru a obține uh pentru că este un număr

17097
13:25:26,956 --> 13:25:34,040
intre 0 si unu. Deci obținem aproximativ 47%

17098
13:25:30,480 --> 13:25:34,040
ceea ce nu este bine.

17099
13:25:41,680 --> 13:25:44,680
Bine.

17100
13:25:56,480 --> 13:26:02,756
În regulă. Orice întrebări despre asta

17101
13:25:59,756 --> 13:26:02,756
evaluare?

17102
13:26:13,840 --> 13:26:18,800
În regulă. Vreau să-ți arăt ceva

17103
13:26:15,916 --> 13:26:21,200
care este

17104
13:26:18,800 --> 13:26:22,956
Da, asta e adevărat. amploarea acesteia

17105
13:26:21,200 --> 13:26:25,040
contează pe date pentru că ar trebui să fim

17106
13:26:22,956 --> 13:26:27,756
ar trebui să interpretați întotdeauna MSE în

17107
13:26:25,040 --> 13:26:32,080
scara de

17108
13:26:27,756 --> 13:26:34,800
um etichetele tale pentru că etichetele tale

17109
13:26:32,080 --> 13:26:37,756
ca în acest caz etichetele noastre, știți

17110
13:26:34,800 --> 13:26:39,916
am putea lua uh de exemplu am putea

17111
13:26:37,756 --> 13:26:42,320
ușor să facem de fapt asta hai să luăm

17112
13:26:39,916 --> 13:26:45,596
media

17113
13:26:42,320 --> 13:26:49,080
să luăm media etichetelor noastre

17114
13:26:45,596 --> 13:26:49,080
datele de antrenament

17115
13:26:49,596 --> 13:26:55,596
și și putem vedea care sunt acestea. um,

17116
13:26:52,560 --> 13:26:58,080
deci media este 500,

17117
13:26:55,596 --> 13:27:01,276
nu? Media este 500. Și uite

17118
13:26:58,080 --> 13:27:03,200
care este rădăcina noastră pătrată a MSE,

17119
13:27:01,276 --> 13:27:07,756
care se află în aceleași unități cu noi

17120
13:27:03,200 --> 13:27:10,800
original. Um, deci avem destul de mult

17121
13:27:07,756 --> 13:27:13,116
de eroare. 340 când unitățile noastre au dreptate

17122
13:27:10,800 --> 13:27:17,240
in jur de 500.

17123
13:27:13,116 --> 13:27:17,240
Deci este o eroare destul de mare.

17124
13:27:23,436 --> 13:27:29,840
Da, MSSE de zero înseamnă că suntem noi

17125
13:27:26,640 --> 13:27:33,756
previziunile sunt aproape identice cu cele ale

17126
13:27:29,840 --> 13:27:38,116
etichete de testare. Da, asta este MSSE

17127
13:27:33,756 --> 13:27:38,116
zero înseamnă. Există distanță zero.

17128
13:27:38,640 --> 13:27:43,000
Deci, mai aproape de zero, cu atât mai bine.

17129
13:27:47,436 --> 13:27:53,840
Dar am vorbit despre asta așa cum ești cu adevărat

17130
13:27:49,596 --> 13:27:57,520
deci regula de bază ar trebui să fie ceea ce este

17131
13:27:53,840 --> 13:28:00,240
RMSSE dvs. ca procent din dvs

17132
13:27:57,520 --> 13:28:05,680
valoare tipică. Deci valoarea ta tipică este

17133
13:28:00,240 --> 13:28:07,756
în anii 500. RMSSE este 340.

17134
13:28:05,680 --> 13:28:11,756
Este foarte mare. Asta sa terminat

17135
13:28:07,756 --> 13:28:14,240
cam 60% din acea valoare.

17136
13:28:11,756 --> 13:28:16,480
Deci sunt doar multe. E prea mult

17137
13:28:14,240 --> 13:28:20,240
eroare. Ce ne-ar plăcea acest RMSSE

17138
13:28:16,480 --> 13:28:25,596
be este sub 20% din valoarea tipică. Aşa

17139
13:28:20,240 --> 13:28:28,160
asta înseamnă că în medie suntem 20% sau mai puțin

17140
13:28:25,596 --> 13:28:30,240
off în predicția noastră. Asta ar fi

17141
13:28:28,160 --> 13:28:34,080
bine. Ar fi destul de bine. Asta

17142
13:28:30,240 --> 13:28:36,240
înseamnă că avem o precizie de 80%,

17143
13:28:34,080 --> 13:28:37,520
nu? Ar fi destul de ideal. Deci tu

17144
13:28:36,240 --> 13:28:40,560
trebuie să mă gândesc la asta în acest sens

17145
13:28:37,520 --> 13:28:43,436
RMSSE care este în aceleași unități cu dvs

17146
13:28:40,560 --> 13:28:46,916
etichete.

17147
13:28:43,436 --> 13:28:46,916
Acesta este

17148
13:28:47,680 --> 13:28:54,080
RMSSE

17149
13:28:50,000 --> 13:28:57,080
care este în aceleași unități ca și

17150
13:28:54,080 --> 13:28:57,080
etichete.

17151
13:28:57,276 --> 13:29:02,160
Deci și apoi pentru a interpreta asta avem

17152
13:29:00,080 --> 13:29:05,360
340

17153
13:29:02,160 --> 13:29:07,116
este comparat cu

17154
13:29:05,360 --> 13:29:11,840
tipic

17155
13:29:07,116 --> 13:29:15,436
unitatea salarială de 500

17156
13:29:11,840 --> 13:29:18,400
corect, deci acesta este uh destul de puțin când

17157
13:29:15,436 --> 13:29:21,520
valoarea tipică este 500 și suntem opriți

17158
13:29:18,400 --> 13:29:24,640
medie cu 340 de unități

17159
13:29:21,520 --> 13:29:26,240
este atât de mult relativ la tipic

17160
13:29:24,640 --> 13:29:28,640
valoare

17161
13:29:26,240 --> 13:29:31,040
doar asta e. Asta e multă eroare.

17162
13:29:28,640 --> 13:29:33,116
Nu este un model foarte bun, nu?

17163
13:29:31,040 --> 13:29:36,116
Este insuficient. Este cu siguranță

17164
13:29:33,116 --> 13:29:36,116
submontare.

17165
13:29:45,200 --> 13:29:49,436
Da. Deci, asta e o întrebare grozavă. Ce

17166
13:29:46,800 --> 13:29:52,756
ar trebui sa facem de aici? Deci, pentru că

17167
13:29:49,436 --> 13:29:52,756
suntem underfitting

17168
13:29:57,756 --> 13:30:04,956
ar trebui să folosim un model mai complex.

17169
13:30:02,640 --> 13:30:06,956
Deci vom învăța despre acestea

17170
13:30:04,956 --> 13:30:08,240
în lecția patru, dar ar trebui să folosim

17171
13:30:06,956 --> 13:30:10,160
ceva diferit. Acest liniar

17172
13:30:08,240 --> 13:30:15,240
regresia este încă prea elementară. Chiar și cu

17173
13:30:10,160 --> 13:30:15,240
lasso, e încă prea de bază.

17174
13:30:16,800 --> 13:30:20,560
Da, suntem nepotriviți pentru că noi Dar

17175
13:30:18,956 --> 13:30:22,240
s-ar putea, de asemenea, să fim nepotriviți

17176
13:30:20,560 --> 13:30:24,880
o regresie liniară regulată. Ar trebui

17177
13:30:22,240 --> 13:30:28,240
testa asta. Hm, și poate că ar fi

17178
13:30:24,880 --> 13:30:29,916
un exercițiu pentru voi, băieți, să testați asta

17179
13:30:28,240 --> 13:30:32,800
afară singur. Nu ar trebui să fie greu

17180
13:30:29,916 --> 13:30:35,596
face. Ai deja toate datele

17181
13:30:32,800 --> 13:30:36,956
scalat. Tu Deci, vezi cum ai face

17182
13:30:35,596 --> 13:30:38,560
face asta? Ai veni doar aici și

17183
13:30:36,956 --> 13:30:41,276
construiți o regresie liniară mai degrabă decât a

17184
13:30:38,560 --> 13:30:44,160
lasso si dofit. Și atunci ai face-o

17185
13:30:41,276 --> 13:30:46,480
evaluează-l în același mod cu o predicție.

17186
13:30:44,160 --> 13:30:51,116
Este foarte ușor să faci asta. Și apoi noi

17187
13:30:46,480 --> 13:30:52,560
pot compara asta cu asta. Ea

17188
13:30:51,116 --> 13:30:54,080
nu ar trebui să fie atât de greu să faci asta,

17189
13:30:52,560 --> 13:30:55,756
nu?

17190
13:30:54,080 --> 13:30:58,720
Și ceva pentru care ați putea face

17191
13:30:55,756 --> 13:31:00,880
sigur. um,

17192
13:30:58,720 --> 13:31:04,000
se construiește regresia liniară și

17193
13:31:00,880 --> 13:31:06,320
compara de fapt și vezi ce fel de

17194
13:31:04,000 --> 13:31:07,916
diferența pe care o face. Adică, noi sincer

17195
13:31:06,320 --> 13:31:12,160
am putea să o facem singuri. Am putea să o facem

17196
13:31:07,916 --> 13:31:16,000
chiar acum. Poate că merită să încerci asta.

17197
13:31:12,160 --> 13:31:19,480
Deci, să construim o regresie liniară

17198
13:31:16,000 --> 13:31:19,480
pentru comparație.

17199
13:31:20,320 --> 13:31:28,080
Deci avem regresia noastră liniară

17200
13:31:24,160 --> 13:31:32,160
uh este regresia liniară și apoi facem

17201
13:31:28,080 --> 13:31:35,840
ffit regresie liniară.fit fit

17202
13:31:32,160 --> 13:31:41,436
corect, așa că asta o va antrena um și

17203
13:31:35,840 --> 13:31:44,480
atunci îl putem evalua așa că lin mse este

17204
13:31:41,436 --> 13:31:47,596
eroare pătrată medie

17205
13:31:44,480 --> 13:31:52,240
și apoi putem face um, hai să facem nostru

17206
13:31:47,596 --> 13:31:54,800
antrenament hai sa facem antrenamentul si apoi

17207
13:31:52,240 --> 13:31:57,756
hai sa prezicem

17208
13:31:54,800 --> 13:32:00,800
de fapt, lasă-mă să fac asta aici

17209
13:31:57,756 --> 13:32:03,596
uh y predictie

17210
13:32:00,800 --> 13:32:05,596
tren

17211
13:32:03,596 --> 13:32:10,800
liniară

17212
13:32:05,596 --> 13:32:12,400
este egal cu um regresie liniară.predic

17213
13:32:10,800 --> 13:32:15,800
și apoi vom prezice asupra noastră

17214
13:32:12,400 --> 13:32:15,800
caracteristici de antrenament.

17215
13:32:17,596 --> 13:32:20,560
Bine, băieți, vedeți ce fac?

17216
13:32:18,800 --> 13:32:22,720
Construiesc o regresie liniară pentru

17217
13:32:20,560 --> 13:32:25,276
comparaţie.

17218
13:32:22,720 --> 13:32:26,720
Mă potrivesc aici să-l antrenez și apoi

17219
13:32:25,276 --> 13:32:29,200
Fac niște predicții asupra

17220
13:32:26,720 --> 13:32:30,720
set de antrenament și vom evalua

17221
13:32:29,200 --> 13:32:34,480
acelea. O să-l înlocuiesc aici

17222
13:32:30,720 --> 13:32:37,200
cu y prred

17223
13:32:34,480 --> 13:32:41,560
tren

17224
13:32:37,200 --> 13:32:41,560
liniară. Deci aceste previziuni

17225
13:33:02,160 --> 13:33:07,400
Bine. Deci, dacă doriți acest cod, eu

17226
13:33:03,916 --> 13:33:07,400
se poate lipi.

17227
13:33:15,436 --> 13:33:21,200
Deci, să vedem pentru ce RMSSE doar a

17228
13:33:18,160 --> 13:33:23,756
modelul liniar este.

17229
13:33:21,200 --> 13:33:26,320
Este un pic mai bine. E mai bine

17230
13:33:23,756 --> 13:33:30,160
cu siguranta.

17231
13:33:26,320 --> 13:33:33,680
Deci 289 este mai bun decât acest 340. Este

17232
13:33:30,160 --> 13:33:36,956
mai bine. Se apropie de zero.

17233
13:33:33,680 --> 13:33:38,240
Totuși, este încă insuficient,

17234
13:33:36,956 --> 13:33:41,116
corect? Și asta este doar la antrenament

17235
13:33:38,240 --> 13:33:44,916
set. Să ne uităm la Să facem la fel

17236
13:33:41,116 --> 13:33:44,916
lucru, dar pe

17237
13:33:45,200 --> 13:33:51,116
Să schimbăm asta. Să schimbăm asta

17238
13:33:47,116 --> 13:33:55,840
pentru um test

17239
13:33:51,116 --> 13:34:00,436
Și apoi să facem un test.

17240
13:33:55,840 --> 13:34:00,436
Și apoi să facem un test

17241
13:34:01,040 --> 13:34:04,040
test.

17242
13:34:04,400 --> 13:34:10,040
Și apoi

17243
13:34:06,956 --> 13:34:10,040
test de testare.

17244
13:34:17,916 --> 13:34:22,080
Bine. Bine, deci acesta este un test de producție

17245
13:34:19,360 --> 13:34:27,080
predicții pe setul de testare.

17246
13:34:22,080 --> 13:34:27,080
Generăm un test MSE

17247
13:34:27,276 --> 13:34:32,640
și apoi facem testul MSE

17248
13:34:30,720 --> 13:34:35,276
care folosește etichetele de testare și noastre

17249
13:34:32,640 --> 13:34:36,880
testăm predicțiile și apoi luăm

17250
13:34:35,276 --> 13:34:39,520
rădăcină pătrată a acesteia pentru RMSSE și apoi

17251
13:34:36,880 --> 13:34:41,116
vom genera asta. Deci este

17252
13:34:39,520 --> 13:34:44,720
încă sub formă. Adică asta este încă

17253
13:34:41,116 --> 13:34:46,560
înalt. Acest lucru este încă ridicat la test

17254
13:34:44,720 --> 13:34:49,040
set și versus pe setul de antrenament. Deci,

17255
13:34:46,560 --> 13:34:50,956
este încă destul de mare. Hm, chiar și

17256
13:34:49,040 --> 13:34:53,360
regresia liniară de bază este sub is

17257
13:34:50,956 --> 13:34:56,320
încă insuficient. Inca insuficient,

17258
13:34:53,360 --> 13:34:58,240
nu? Chiar și fără lasso,

17259
13:34:56,320 --> 13:34:59,916
care este lasso ar trebui să ajute

17260
13:34:58,240 --> 13:35:02,720
supraadaptare. Cu siguranță nu este

17261
13:34:59,916 --> 13:35:05,840
supraadaptare. Hm, cu siguranță este

17262
13:35:02,720 --> 13:35:07,200
underfitting, dar acesta este un semnal că

17263
13:35:05,840 --> 13:35:09,040
este un fel de supraadaptare pentru că asta este

17264
13:35:07,200 --> 13:35:13,040
performanțe mai bune la datele de antrenament

17265
13:35:09,040 --> 13:35:17,200
și apoi se înrăutățește pe datele testului.

17266
13:35:13,040 --> 13:35:17,200
Cu siguranță devine mai rău, nu?

17267
13:35:23,360 --> 13:35:26,840
Ați urmărit?

17268
13:35:27,680 --> 13:35:31,840
Doar rulez asta deasupra, alerg

17269
13:35:29,596 --> 13:35:33,756
asta deasupra asta. Nu contează unde

17270
13:35:31,840 --> 13:35:36,756
ai pus-o. Am putea să-l mutăm

17271
13:35:33,756 --> 13:35:36,756
jos.

17272
13:35:40,640 --> 13:35:46,160
Am putea să-l mutăm în jos, tocmai am alergat

17273
13:35:43,200 --> 13:35:48,000
tocmai am ales o celulă nouă chiar aici și

17274
13:35:46,160 --> 13:35:52,360
a alergat-o. Dar chiar l-am putea muta

17275
13:35:48,000 --> 13:35:52,360
hai sa facem asta. Să-l mutăm în jos

17276
13:35:53,360 --> 13:36:00,436
la

17277
13:35:56,320 --> 13:36:00,436
după evaluarea cu lazo.

17278
13:36:01,680 --> 13:36:07,436
Bine. Așa că tocmai l-am mutat acolo.

17279
13:36:04,560 --> 13:36:09,436
Și apoi să ne mișcăm

17280
13:36:07,436 --> 13:36:12,956
asta jos.

17281
13:36:09,436 --> 13:36:16,160
Așa că l-am pus aici după um după

17282
13:36:12,956 --> 13:36:19,040
aceasta. Deci acesta este um asta este

17283
13:36:16,160 --> 13:36:22,640
practic funcţia obiectivă drept

17284
13:36:19,040 --> 13:36:25,436
a procesului de instruire. Deci, în timpul

17285
13:36:22,640 --> 13:36:28,080
algoritm care rulează atunci când apelăm ffit in

17286
13:36:25,436 --> 13:36:30,720
scikitlearn le va găsi pe acestea

17287
13:36:28,080 --> 13:36:34,080
betas corect, de fapt o să învețe

17288
13:36:30,720 --> 13:36:36,080
care sunt aceste cele mai bune beta pentru modelul nostru.

17289
13:36:34,080 --> 13:36:37,916
Acesta este modelul nostru aici, nu? Este

17290
13:36:36,080 --> 13:36:42,320
combinația de beta ori a noastră

17291
13:36:37,916 --> 13:36:45,276
caracteristici um plus o interceptare beta. Uh

17292
13:36:42,320 --> 13:36:49,200
deci acesta este modelul nostru. Dar noi penalizăm

17293
13:36:45,276 --> 13:36:53,040
acele greutăți uh mari în valoare absolută

17294
13:36:49,200 --> 13:36:56,560
prin adăugarea unui termen de penalizare ca acesta

17295
13:36:53,040 --> 13:36:58,720
unde alfa este un anumit nivel de penalizare

17296
13:36:56,560 --> 13:37:01,040
pe care vrem să le oferim. De obicei alfa

17297
13:36:58,720 --> 13:37:02,800
egal cu 1 este în regulă. Dar de fapt ce

17298
13:37:01,040 --> 13:37:04,560
vom învăța să terminăm

17299
13:37:02,800 --> 13:37:06,240
această secțiune va fi o

17300
13:37:04,560 --> 13:37:09,436
mod sistematic prin care putem testa diferite

17301
13:37:06,240 --> 13:37:12,080
alphas um care reprezintă nivelul de

17302
13:37:09,436 --> 13:37:14,080
pedeapsa pe care vrem să o aplicăm lasso sau

17303
13:37:12,080 --> 13:37:17,756
chiar creasta

17304
13:37:14,080 --> 13:37:19,520
uh regresie. Deci ăsta era lassoul și

17305
13:37:17,756 --> 13:37:22,640
um, dacă vă amintiți că l-ați folosit

17306
13:37:19,520 --> 13:37:26,160
super usor. Am lucrat prin asta

17307
13:37:22,640 --> 13:37:29,520
problemă cu aceste date de baseball

17308
13:37:26,160 --> 13:37:31,916
și am avut uh

17309
13:37:29,520 --> 13:37:36,800
să vedem derulând în jos, ne despărțim

17310
13:37:31,916 --> 13:37:39,040
datele noastre numerice și am făcut una

17311
13:37:36,800 --> 13:37:41,116
hot a codificat datele noastre categorice

17312
13:37:39,040 --> 13:37:44,240
a combinat-o înapoi împreună. Să sperăm

17313
13:37:41,116 --> 13:37:46,400
că sună un sonerie acolo. Hm și noi

17314
13:37:44,240 --> 13:37:48,480
de fapt, am scalat datele noastre, ceea ce este frumos

17315
13:37:46,400 --> 13:37:50,560
standardul de făcut este să facem un fel de

17316
13:37:48,480 --> 13:37:52,800
scalarea la caracteristicile noastre în special ale noastre

17317
13:37:50,560 --> 13:37:54,320
caracteristicile numerice care doresc să fie scalate

17318
13:37:52,800 --> 13:37:57,360
acelea într-un fel fie că este minmax

17319
13:37:54,320 --> 13:37:59,840
scară sau scaler standard vreau să fac

17320
13:37:57,360 --> 13:38:04,240
asta și așa am făcut pentru acest exemplu

17321
13:37:59,840 --> 13:38:05,680
și apoi am rulat regresia lasso

17322
13:38:04,240 --> 13:38:07,520
care este destul de ușor de folosit. Tu doar

17323
13:38:05,680 --> 13:38:10,956
folosiți obiectul lasso și alegeți un

17324
13:38:07,520 --> 13:38:14,080
alfa aici. Um, din nou, vom face

17325
13:38:10,956 --> 13:38:16,640
au o modalitate de a testa diferite alfa

17326
13:38:14,080 --> 13:38:19,360
ar putea fi candidați și putem vedea

17327
13:38:16,640 --> 13:38:23,680
care este cel mai bun. Hm, deci plec

17328
13:38:19,360 --> 13:38:25,360
pentru a ne arăta că astăzi va apărea în curând.

17329
13:38:23,680 --> 13:38:28,240
Dar asta a fost lassoul. Dacă tu

17330
13:38:25,360 --> 13:38:30,240
Băieți țineți minte, noi am făcut asta. Um, asta e

17331
13:38:28,240 --> 13:38:32,080
am comparat asta cu un liniar de bază

17332
13:38:30,240 --> 13:38:34,320
regresie care este atât de frumoasă

17333
13:38:32,080 --> 13:38:35,840
simplu doar o potrivire si apoi

17334
13:38:34,320 --> 13:38:39,520
prezice și apoi putem genera medie

17335
13:38:35,840 --> 13:38:41,596
eroare squed. Hm, încă nu este foarte bun

17336
13:38:39,520 --> 13:38:44,956
eroare pătrată medie pe aceste date, este

17337
13:38:41,596 --> 13:38:46,956
încă destul de mare. Um, deci este încă

17338
13:38:44,956 --> 13:38:49,360
nu, indiferent de modelul pe care îl folosim, este

17339
13:38:46,956 --> 13:38:50,720
încă nu foarte bine, dar măcar putem

17340
13:38:49,360 --> 13:38:53,200
exersați să faceți acea comparație. Asta e

17341
13:38:50,720 --> 13:38:54,800
ce am facut ultima data. Am făcut asta pe

17342
13:38:53,200 --> 13:38:56,320
miercuri.

17343
13:38:54,800 --> 13:38:58,480
Hm

17344
13:38:56,320 --> 13:38:59,916
si apoi

17345
13:38:58,480 --> 13:39:03,680
am văzut că efectul diferit

17346
13:38:59,916 --> 13:39:06,160
alphas am avut un lasso um

17347
13:39:03,680 --> 13:39:08,400
am avut o validare încrucișată cu lasso

17348
13:39:06,160 --> 13:39:10,720
exemplu aici. Deci, dincolo de simpla folosire a unui

17349
13:39:08,400 --> 13:39:13,596
model obișnuit de lasso pe care um scikitlearn

17350
13:39:10,720 --> 13:39:16,160
are un cv lasso care vă permite să încercați

17351
13:39:13,596 --> 13:39:18,160
scoateți diferite alfa cu cruce

17352
13:39:16,160 --> 13:39:21,360
validare și dați seama ce

17353
13:39:18,160 --> 13:39:22,880
cel mai bun alfa este. Hm, acum suntem de fapt

17354
13:39:21,360 --> 13:39:24,956
va avea o strategie diferită

17355
13:39:22,880 --> 13:39:28,640
asta în loc de a alege la întâmplare

17356
13:39:24,956 --> 13:39:31,200
cele, putem de fapt să furnizăm mai multe

17357
13:39:28,640 --> 13:39:33,520
parametrii pe care poate dorim să-i testăm. um,

17358
13:39:31,200 --> 13:39:36,000
câte pot suporta modelele. Şi

17359
13:39:33,520 --> 13:39:38,000
în unele modele mai complexe, vom avea

17360
13:39:36,000 --> 13:39:41,360
mai mult de un parametru, cum ar fi doar lasso

17361
13:39:38,000 --> 13:39:43,040
are alfa. Hm, și tehnic

17362
13:39:41,360 --> 13:39:45,916
are acest maxim de iterații, dar într-adevăr

17363
13:39:43,040 --> 13:39:47,596
singurul care contează este acest alfa.

17364
13:39:45,916 --> 13:39:52,000
Alte modele au multe altele

17365
13:39:47,596 --> 13:39:54,320
hiperparametri pe care îi putem schimba

17366
13:39:52,000 --> 13:39:57,040
și așa vrem o modalitate de a sistematic

17367
13:39:54,320 --> 13:39:59,360
testați acele combinații diferite

17368
13:39:57,040 --> 13:40:01,680
și să vedem care dintre ele duce la cel mai bun

17369
13:39:59,360 --> 13:40:04,240
uh versiunea acelui model. Să spunem că

17370
13:40:01,680 --> 13:40:08,320
cele mai bune rezultate. Deci vom merge

17371
13:40:04,240 --> 13:40:10,080
explorează asta ce urmează. Deci am avut lasso.

17372
13:40:08,320 --> 13:40:12,880
Acum, aici ne-am încheiat ultima dată.

17373
13:40:10,080 --> 13:40:15,200
Am avut regresia crestei. Dacă voi băieți

17374
13:40:12,880 --> 13:40:18,160
amintiți-vă, acesta este doar puțin

17375
13:40:15,200 --> 13:40:21,520
pedeapsa diferita. um,

17376
13:40:18,160 --> 13:40:23,840
este nevoie de ce am desenat-o pentru noi. Ea

17377
13:40:21,520 --> 13:40:26,320
primește aceeași pedeapsă pe care o aveam înainte.

17378
13:40:23,840 --> 13:40:29,116
Deci, are acea sumă reziduală de

17379
13:40:26,320 --> 13:40:31,360
eroarea pătratelor, care este cea principală

17380
13:40:29,116 --> 13:40:33,756
se utilizează pentru regresia liniară, dar are a

17381
13:40:31,360 --> 13:40:37,756
penalizare cu un alfa. Și apoi are

17382
13:40:33,756 --> 13:40:42,480
suma pătratelor beta

17383
13:40:37,756 --> 13:40:44,560
beta i pătrate. Deci penalizeaza are a

17384
13:40:42,480 --> 13:40:46,400
penalizare dar penalizează ușor

17385
13:40:44,560 --> 13:40:48,560
diferit unde folosește pătratul nu

17386
13:40:46,400 --> 13:40:50,320
valoarea absolută. Asta e creasta

17387
13:40:48,560 --> 13:40:52,956
regresie. Și asta are similar

17388
13:40:50,320 --> 13:40:54,560
efectul dvs. nu pentru a minimiza

17389
13:40:52,956 --> 13:40:57,840
acest drept pentru că scopul nostru în antrenament

17390
13:40:54,560 --> 13:41:01,276
un model era să minimizeze acest lucru

17391
13:40:57,840 --> 13:41:04,560
minimizați această cantitate și găsiți

17392
13:41:01,276 --> 13:41:06,240
cele mai bune beta care minimizează acest lucru. Um asa

17393
13:41:04,560 --> 13:41:10,160
în general da vrei să încurajezi

17394
13:41:06,240 --> 13:41:12,160
valori mai mici, dar um odată ce obții

17395
13:41:10,160 --> 13:41:16,160
valori care sunt o fracție dacă pătrați

17396
13:41:12,160 --> 13:41:20,240
ei chiar devin mai mici. Um, deci,

17397
13:41:16,160 --> 13:41:22,720
uh, nu este, um, nu este

17398
13:41:20,240 --> 13:41:24,800
necesar să le micșorăm până la capăt

17399
13:41:22,720 --> 13:41:27,680
zero. Vor deveni mai mici de îndată ce

17400
13:41:24,800 --> 13:41:29,680
sunt cam sub unu. Um, deci ei

17401
13:41:27,680 --> 13:41:32,880
nu-l încurajați să meargă complet

17402
13:41:29,680 --> 13:41:33,756
departe, uh, așa cum o face valoarea absolută.

17403
13:41:32,880 --> 13:41:36,160
Este doar puțin diferit

17404
13:41:33,756 --> 13:41:38,560
minimizarea. Um, deci cu ce vedem

17405
13:41:36,160 --> 13:41:40,240
creasta este că nu vedem caracteristicile

17406
13:41:38,560 --> 13:41:42,240
să fii sters complet ca noi

17407
13:41:40,240 --> 13:41:45,116
face cu un lasso. și laso primesc

17408
13:41:42,240 --> 13:41:46,400
încurajat să fii pentru a deveni zero

17409
13:41:45,116 --> 13:41:48,640
pentru că asta e cam singura modalitate de a

17410
13:41:46,400 --> 13:41:50,160
minimizați o valoare absolută. Dar cu

17411
13:41:48,640 --> 13:41:54,000
pătrate pot deveni tot mai mici

17412
13:41:50,160 --> 13:41:56,640
și fracții um din ce în ce mai mici și

17413
13:41:54,000 --> 13:41:59,756
nu trebuie să devină zero. Nu este

17414
13:41:56,640 --> 13:42:05,840
ca aspru de o pedeapsă.

17415
13:41:59,756 --> 13:42:09,840
Um, uh, creasta a fost ușor de folosit

17416
13:42:05,840 --> 13:42:12,880
bine. Hm și are și un alfa care

17417
13:42:09,840 --> 13:42:15,436
putem seta. Deci, este literalmente la fel

17418
13:42:12,880 --> 13:42:17,680
cod exact, doar un alt model, doar

17419
13:42:15,436 --> 13:42:19,276
pedeapsă ușor diferită și asta

17420
13:42:17,680 --> 13:42:20,800
rezultă diferiți coeficienți. tu

17421
13:42:19,276 --> 13:42:22,560
observați că niciuna dintre ele nu este exact

17422
13:42:20,800 --> 13:42:25,116
zero. Ca și cu lassoul, poți obține

17423
13:42:22,560 --> 13:42:28,000
cele care sunt exact zero. Nu vedem

17424
13:42:25,116 --> 13:42:30,320
că cu creasta. Îți amintești asta.

17425
13:42:28,000 --> 13:42:31,840
Um, așa că am subliniat asta ultimul

17426
13:42:30,320 --> 13:42:34,720
timp. Observați că coeficienții nu sunt

17427
13:42:31,840 --> 13:42:37,756
zero. Hm, și apoi o putem evalua.

17428
13:42:34,720 --> 13:42:39,436
Așa că am făcut calculul MSE, care este a

17429
13:42:37,756 --> 13:42:41,680
lucru destul de standard în care ne folosim

17430
13:42:39,436 --> 13:42:45,360
model pentru a prezice pe un set de antrenament,

17431
13:42:41,680 --> 13:42:47,360
prezice pe un set de testare, evaluează-le um

17432
13:42:45,360 --> 13:42:49,596
calculând metrica ca media

17433
13:42:47,360 --> 13:42:51,276
eroare pătrată și putem vedea dacă suntem

17434
13:42:49,596 --> 13:42:53,116
supramontare underfitting. Aceasta este

17435
13:42:51,276 --> 13:42:54,400
cu siguranță același tip de poveste pe care o avem noi

17436
13:42:53,116 --> 13:42:56,240
vazut cu toate aceste modele este

17437
13:42:54,400 --> 13:42:58,640
insuficient pentru că eroarea este atât de mare

17438
13:42:56,240 --> 13:43:00,320
peste ambele seturi

17439
13:42:58,640 --> 13:43:02,400
pe parcursul antrenamentului și testării. Deci este

17440
13:43:00,320 --> 13:43:04,240
cu siguranță insuficientă.

17441
13:43:02,400 --> 13:43:06,160
Hm

17442
13:43:04,240 --> 13:43:09,756
și același lucru ca lasso, are o cruce

17443
13:43:06,160 --> 13:43:12,080
validare uh variație pe care

17444
13:43:09,756 --> 13:43:15,840
vă permite să încercați diferite alfa

17445
13:43:12,080 --> 13:43:19,840
și um face diferite pliuri. Deci 10 ori,

17446
13:43:15,840 --> 13:43:23,756
cinci ori, orice, și calculează um

17447
13:43:19,840 --> 13:43:26,756
încercați să găsiți cel mai bun alfa în acest fel.

17448
13:43:23,756 --> 13:43:26,756
Bine.

17449
13:43:27,436 --> 13:43:32,560
În regulă.

17450
13:43:29,436 --> 13:43:35,596
Orice întrebări pe această temă până acum sunt ultima

17451
13:43:32,560 --> 13:43:38,720
e timpul să o revizuiești puțin?

17452
13:43:35,596 --> 13:43:40,160
Sper să fie așa

17453
13:43:38,720 --> 13:43:43,840
să-ți faci jogging puțin memoria

17454
13:43:40,160 --> 13:43:45,680
creasta și laso. Știi unde suntem

17455
13:43:43,840 --> 13:43:49,436
să-l ridic astăzi este să termin

17456
13:43:45,680 --> 13:43:51,840
scoateți această lecție cu încă un model

17457
13:43:49,436 --> 13:43:54,320
care va fi o combinație de

17458
13:43:51,840 --> 13:43:56,880
creasta și laso. Deci chiar poți

17459
13:43:54,320 --> 13:44:00,480
combinați-le împreună

17460
13:43:56,880 --> 13:44:02,160
într-o manieră liniară acele sancțiuni.

17461
13:44:00,480 --> 13:44:04,720
Deci, puteți avea ambele penalități,

17462
13:44:02,160 --> 13:44:08,000
valoarea absolută și pătratul. Şi

17463
13:44:04,720 --> 13:44:11,436
când ai ambele penalizări, um asta este a

17464
13:44:08,000 --> 13:44:14,560
model special numit plasa elastică uh

17465
13:44:11,436 --> 13:44:18,080
regresia sau modelul net elastic. Um asa

17466
13:44:14,560 --> 13:44:20,320
aceasta este o combinație de lasso și creasta

17467
13:44:18,080 --> 13:44:21,840
împreună. Deci ai lasso, ai

17468
13:44:20,320 --> 13:44:24,560
creasta si apoi ai plasa elastica

17469
13:44:21,840 --> 13:44:28,400
care combină ambele pedepse.

17470
13:44:24,560 --> 13:44:33,276
Lasă-mă să-ți arăt ecuația.

17471
13:44:28,400 --> 13:44:35,756
Deci aici este uh, aici este

17472
13:44:33,276 --> 13:44:39,916
model. Acesta este același lucru pe care îl avem și noi

17473
13:44:35,756 --> 13:44:42,000
întotdeauna a avut. Acesta este modelul nostru obișnuit

17474
13:44:39,916 --> 13:44:44,956
potrivire pentru liniar. Acesta este un element de bază

17475
13:44:42,000 --> 13:44:46,240
regresie liniară um funcţie de pierdere sau

17476
13:44:44,956 --> 13:44:48,956
funcția obiectivă pe care încercăm să o facem

17477
13:44:46,240 --> 13:44:50,480
minimizați pentru a găsi beta-urile. Observați cum

17478
13:44:48,956 --> 13:44:52,000
avem totuși ambele penalizări

17479
13:44:50,480 --> 13:44:54,000
de data asta. Deci, în loc să ai doar unul

17480
13:44:52,000 --> 13:44:57,916
din penalități, de fapt le avem pe amândouă.

17481
13:44:54,000 --> 13:45:00,880
Deci avem penalty lasso

17482
13:44:57,916 --> 13:45:04,640
și apoi avem pedeapsa de creastă aici.

17483
13:45:00,880 --> 13:45:06,880
Deci, de fapt, le folosim pe amândouă și um

17484
13:45:04,640 --> 13:45:11,680
încercați să găsiți un echilibru de minimizare

17485
13:45:06,880 --> 13:45:13,360
acele două, acele două penalități.

17486
13:45:11,680 --> 13:45:14,956
Bine. Și observați cum ei în loc de

17487
13:45:13,360 --> 13:45:18,320
doar un singur alfa, avem într-un fel o

17488
13:45:14,956 --> 13:45:20,956
echilibru pe ambele.

17489
13:45:18,320 --> 13:45:23,276
Așadar, îl putem cântări efectiv pe lasso

17490
13:45:20,956 --> 13:45:27,040
mai mult. Putem cântări creasta încă una.

17491
13:45:23,276 --> 13:45:28,640
Le putem cântări la fel. Putem

17492
13:45:27,040 --> 13:45:29,756
schimbă asta la fel de mult ca noi

17493
13:45:28,640 --> 13:45:34,560
vreau. Deci, au două diferite

17494
13:45:29,756 --> 13:45:39,756
greutăți acolo că ar putea fi.

17495
13:45:34,560 --> 13:45:41,360
Acum, ceea ce se întâmplă în realitate este uh

17496
13:45:39,756 --> 13:45:44,720
vom vedea asta în modelul este

17497
13:45:41,360 --> 13:45:47,840
că de obicei, ceea ce se întâmplă sunt acestea

17498
13:45:44,720 --> 13:45:51,840
se combină într-o fracție. Deci există

17499
13:45:47,840 --> 13:45:54,956
de obicei un raport de lambda 1 la lambda 2

17500
13:45:51,840 --> 13:45:58,240
și aceasta este cunoscută sub numele de um asta este

17501
13:45:54,956 --> 13:46:00,720
cunoscut uneori ca raportul L1

17502
13:45:58,240 --> 13:46:02,480
și acesta este un parametru

17503
13:46:00,720 --> 13:46:05,360
în interiorul modelului pe care îl vom putea

17504
13:46:02,480 --> 13:46:07,116
setați împreună cu alfa. Deci vom fi

17505
13:46:05,360 --> 13:46:12,160
capabil să seteze un alfa și apoi asta

17506
13:46:07,116 --> 13:46:16,640
raport. Ideea este că um

17507
13:46:12,160 --> 13:46:19,200
raportul ne va permite să controlăm care

17508
13:46:16,640 --> 13:46:23,756
unul este mai dominant. Deci, dacă acest număr

17509
13:46:19,200 --> 13:46:26,480
este mai mare decât va face această penalizare cu lasso

17510
13:46:23,756 --> 13:46:28,880
va fi ponderat mai mult. Dacă acest raport este

17511
13:46:26,480 --> 13:46:31,756
mai mic dacă este mai mic de unul pt

17512
13:46:28,880 --> 13:46:36,000
exemplu care înseamnă că creasta um

17513
13:46:31,756 --> 13:46:38,720
regresia este mai dominantă. Hm dar

17514
13:46:36,000 --> 13:46:43,116
deci vom avea asta o să avem cu adevărat

17515
13:46:38,720 --> 13:46:46,000
asta si asta la dispozitia noastra si alfa

17516
13:46:43,116 --> 13:46:48,560
este um

17517
13:46:46,000 --> 13:46:53,596
alpha este un fel ca un a pe care îl poți gândi

17518
13:46:48,560 --> 13:46:57,520
din el ca o scară care este lambda 1

17519
13:46:53,596 --> 13:47:00,000
cam ca lambda 1 plus lambda 2 um

17520
13:46:57,520 --> 13:47:03,360
combinate pentru a egala alfa.

17521
13:47:00,000 --> 13:47:06,640
Deci este ca nivelul nostru total de penalizare

17522
13:47:03,360 --> 13:47:08,080
um nivelul nostru total de pedeapsă și putem

17523
13:47:06,640 --> 13:47:11,276
setați asta egal cu unu. O putem seta

17524
13:47:08,080 --> 13:47:13,116
egal cu orice ne dorim. Hm și așa

17525
13:47:11,276 --> 13:47:15,680
acestea vor fi în acest raport și acolo va fi

17526
13:47:13,116 --> 13:47:18,160
să fie un nivel total de penalizare pe care îl putem

17527
13:47:15,680 --> 13:47:20,800
aplica. Deci modelul va folosi efectiv

17528
13:47:18,160 --> 13:47:22,400
acești doi parametri atunci când facem

17529
13:47:20,800 --> 13:47:25,040
ea. Dar așa sunt ei așa sunt

17530
13:47:22,400 --> 13:47:28,560
toate sunt legate.

17531
13:47:25,040 --> 13:47:30,400
Bine. Deci Ridge folosește ambele penalizări.

17532
13:47:28,560 --> 13:47:32,240
Aceasta este singura diferență dintre lasso

17533
13:47:30,400 --> 13:47:35,276
sau scuze plasa elastica foloseste ambele

17534
13:47:32,240 --> 13:47:41,276
pedepsele. Un lucru vreau să faci

17535
13:47:35,276 --> 13:47:43,360
observația este că dacă vrem

17536
13:47:41,276 --> 13:47:45,360
ar putea seta acest raport L1 până la

17537
13:47:43,360 --> 13:47:50,000
zero

17538
13:47:45,360 --> 13:47:52,240
um care dacă facem asta um singurul

17539
13:47:50,000 --> 13:47:54,320
modul în care acest raport L1 ar putea fi zero ar fi

17540
13:47:52,240 --> 13:47:56,400
dacă lambda 1 este zero. Deci ar fi doar

17541
13:47:54,320 --> 13:47:59,040
reveniți la regresia crestei. Deci

17542
13:47:56,400 --> 13:48:00,880
complet dacă dacă aceasta este zero, aceasta va

17543
13:47:59,040 --> 13:48:05,840
ștergeți acest termen și vom reveni la

17544
13:48:00,880 --> 13:48:08,840
creastă dacă raportul L1 este zero.

17545
13:48:05,840 --> 13:48:08,840
Bine.

17546
13:48:10,800 --> 13:48:17,200
În regulă. Deci avem o plasă elastică

17547
13:48:13,680 --> 13:48:19,040
model. Acum este folosit exact la fel

17548
13:48:17,200 --> 13:48:23,596
așa cum am procedat cu celelalte modele din

17549
13:48:19,040 --> 13:48:26,160
cod. Deci avem plasă elastică um uh de la

17550
13:48:23,596 --> 13:48:29,360
familia de modele liniare scikitlearn doar

17551
13:48:26,160 --> 13:48:32,080
exact acolo unde am avut regresia liniară

17552
13:48:29,360 --> 13:48:35,116
creasta lassoului toate acestea au venit din asta

17553
13:48:32,080 --> 13:48:36,720
modelul liniar um plasă elastică vine și el

17554
13:48:35,116 --> 13:48:41,520
de acolo și apoi validarea încrucișată

17555
13:48:36,720 --> 13:48:43,756
versiunea vine și de acolo

17556
13:48:41,520 --> 13:48:46,320
să vedem atunci când ne construim modelul

17557
13:48:43,756 --> 13:48:48,000
va fi foarte foarte simplu

17558
13:48:46,320 --> 13:48:51,116
lucruri ușoare pentru că este același cod

17559
13:48:48,000 --> 13:48:54,480
că avem întotdeauna um doar folosim

17560
13:48:51,116 --> 13:48:56,956
plasă elastică. Am stabilit un alfa alfa

17561
13:48:54,480 --> 13:48:58,956
egal cu 1 este destul de standard, la fel ca

17562
13:48:56,956 --> 13:49:02,160
este în ultima creastă adică

17563
13:48:58,956 --> 13:49:04,320
standardul industriei este unul și apoi un L

17564
13:49:02,160 --> 13:49:05,756
Raportul L1 de.5

17565
13:49:04,320 --> 13:49:11,116
asta e si destul de standard. Ce

17566
13:49:05,756 --> 13:49:14,400
Raportul L1.5 este un fel de um

17567
13:49:11,116 --> 13:49:18,560
uh cam asta înseamnă că lambda

17568
13:49:14,400 --> 13:49:20,880
Raportul 1 la lambda 2 este 1/2. Um, deci

17569
13:49:18,560 --> 13:49:23,520
asta e un raport destul de standard

17570
13:49:20,880 --> 13:49:25,040
de asemenea, dar din nou, am putea seta asta

17571
13:49:23,520 --> 13:49:28,560
egale cu unu și ar fi oarecum

17572
13:49:25,040 --> 13:49:32,720
egal ponderate. Hm, raportul L1 de jumătate

17573
13:49:28,560 --> 13:49:34,400
înseamnă că creasta uh se referă la

17574
13:49:32,720 --> 13:49:39,200
Penalizarea creastă este puțin mai mare

17575
13:49:34,400 --> 13:49:40,956
ponderat în acea situație.

17576
13:49:39,200 --> 13:49:44,320
Bine.

17577
13:49:40,956 --> 13:49:46,560
Deci, odată ce avem acest model, putem

17578
13:49:44,320 --> 13:49:50,000
face ffit și putem rula asta pe nostru

17579
13:49:46,560 --> 13:49:51,840
date de antrenament și putem obține că putem

17580
13:49:50,000 --> 13:49:53,756
aflați cum sunt parametrii noștri

17581
13:49:51,840 --> 13:49:55,116
coeficienții noștri și interceptările noastre. Al nostru

17582
13:49:53,756 --> 13:49:56,400
modelul va avea asta, dar mai mult

17583
13:49:55,116 --> 13:49:58,240
important, putem folosi modelul nostru pentru

17584
13:49:56,400 --> 13:50:02,720
prezice corect, astfel încât să putem prezice asupra

17585
13:49:58,240 --> 13:50:06,840
set de testare. Lasă-mă să mă întorc și să ne încarc

17586
13:50:02,720 --> 13:50:06,840
date și chiar rulați acest lucru.

17587
13:50:06,956 --> 13:50:10,560
Deci, vom folosi același lucru

17588
13:50:08,240 --> 13:50:13,880
datele pentru care am făcut-o

17589
13:50:10,560 --> 13:50:13,880
lasso,

17590
13:50:14,240 --> 13:50:18,800
care este derularea înapoi în sus, așa că eu

17591
13:50:16,880 --> 13:50:21,800
îl pot încărca. Sunt datele de baseball

17592
13:50:18,800 --> 13:50:21,800
aici.

17593
13:50:22,160 --> 13:50:25,160
um,

17594
13:50:25,200 --> 13:50:30,000
pur și simplu rulează-l de acolo.

17595
13:50:27,680 --> 13:50:33,400
Acesta este hitters.csv. Deci, sper ca tu

17596
13:50:30,000 --> 13:50:33,400
au pe acela.

17597
13:50:42,000 --> 13:50:45,720
Lasă-mă să încarc asta.

17598
13:50:50,080 --> 13:50:54,560
Bine, așa că am încărcat asta și apoi asta

17599
13:50:52,000 --> 13:50:58,756
ar trebui să se încarce.

17600
13:50:54,560 --> 13:50:58,756
Aruncă acea coloană fără nume.

17601
13:51:01,680 --> 13:51:05,640
Ne vom lua manechinele

17602
13:51:10,640 --> 13:51:15,240
și apoi concatenează cele divizate

17603
13:51:15,916 --> 13:51:19,916
scara. Eu doar reluez lucrurile. Im

17604
13:51:18,400 --> 13:51:22,080
reluând lucrurile astfel încât să ne vedem modelul

17605
13:51:19,916 --> 13:51:23,916
încă o dată.

17606
13:51:22,080 --> 13:51:27,596
Așa că reluați asta. Aruncă o privire la asta. Asta

17607
13:51:23,916 --> 13:51:30,800
arata bine. si apoi

17608
13:51:27,596 --> 13:51:34,560
completați NLES pe acelea.

17609
13:51:30,800 --> 13:51:38,596
Bine. Deci, ar trebui să fim capabili să ne conducem

17610
13:51:34,560 --> 13:51:38,596
plasă elastică acum.

17611
13:51:43,200 --> 13:51:47,916
Bine. Deci, să importăm asta și apoi

17612
13:51:46,000 --> 13:51:51,276
hai să ne construim modelul. Deci, iată-ne.

17613
13:51:47,916 --> 13:51:53,116
Ne construim modelul și interceptarea este

17614
13:51:51,276 --> 13:51:57,640
că. Acum, desigur, ne putem uita la noi

17615
13:51:53,116 --> 13:51:57,640
coeficienți. Să ne uităm la asta.

17616
13:51:59,276 --> 13:52:03,840
Uită-te la coeficienții noștri. Deci amintiți-vă

17617
13:52:01,116 --> 13:52:06,480
coeficienții sunt uh beta. Aceste

17618
13:52:03,840 --> 13:52:08,880
sunt beta-urile noastre care sunt în modelul nostru. Hm

17619
13:52:06,480 --> 13:52:11,116
ca să le putem arunca o privire. Acum um

17620
13:52:08,880 --> 13:52:12,320
ei sunt undeva la mijloc. Este

17621
13:52:11,116 --> 13:52:14,320
nu un lasso plin unde vom merge

17622
13:52:12,320 --> 13:52:17,756
vezi ca unele dintre acestea sunt zero. Nu este o

17623
13:52:14,320 --> 13:52:19,116
creasta plină. Hm, deci coeficienții noi

17624
13:52:17,756 --> 13:52:21,276
get sunt diferite. Sunt undeva în

17625
13:52:19,116 --> 13:52:23,756
intre acolo. Acele două modele care

17626
13:52:21,276 --> 13:52:28,840
am construit deja. Deci nu chiar

17627
13:52:23,756 --> 13:52:28,840
aceeași um undeva la mijloc acolo.

17628
13:52:30,400 --> 13:52:35,840
Um și apoi ne putem folosi modelul pentru a face

17629
13:52:32,480 --> 13:52:38,080
predicții și și calculează MSE

17630
13:52:35,840 --> 13:52:39,840
uh sau RMSSE ar trebui să spun și eu. Deci

17631
13:52:38,080 --> 13:52:41,040
putem lua eroarea pătratică medie, trece

17632
13:52:39,840 --> 13:52:44,240
că în rădăcina pătrată și calculează

17633
13:52:41,040 --> 13:52:46,640
RMSSE. Deci încă destul de rău. Hm asta

17634
13:52:44,240 --> 13:52:48,720
este exact în jurul acelui interval de 300 de ce

17635
13:52:46,640 --> 13:52:50,956
am primit pentru celălalt RMSSE al nostru. Deci,

17636
13:52:48,720 --> 13:52:53,840
nu e ca și cum plasa elastică ar fi mai bună

17637
13:52:50,956 --> 13:52:56,400
decât cele altele ca liniare sau lasso sau

17638
13:52:53,840 --> 13:52:58,400
creasta. Și asta nu este surprinzător pentru că

17639
13:52:56,400 --> 13:53:00,000
este doar adăugarea acestor penalități suplimentare.

17640
13:52:58,400 --> 13:53:02,720
Nu ne așteptăm să ajungă magic

17641
13:53:00,000 --> 13:53:05,840
mai bine. De fapt, este ceva mai complex

17642
13:53:02,720 --> 13:53:07,360
atunci când le adăugăm când le adăugăm,

17643
13:53:05,840 --> 13:53:09,040
de fapt o reducem și o facem

17644
13:53:07,360 --> 13:53:11,276
mai simplu. Și mai avem nevoie de ceva

17645
13:53:09,040 --> 13:53:16,240
complex, ar trebui să spun. Deci, facem

17646
13:53:11,276 --> 13:53:18,720
este mai simplu um făcând penalizare

17647
13:53:16,240 --> 13:53:21,116
greutățile noastre un pic mai mult. Si asa,

17648
13:53:18,720 --> 13:53:23,040
încă nu se potrivește. Asta nu este

17649
13:53:21,116 --> 13:53:25,360
chiar surprinzător, nu? Încă nu este

17650
13:53:23,040 --> 13:53:27,116
într-adevăr o potrivire grozavă.

17651
13:53:25,360 --> 13:53:30,240
Și putem, putem chiar să verificăm

17652
13:53:27,116 --> 13:53:31,840
că. Știm că RMSSE nostru este destul de prost.

17653
13:53:30,240 --> 13:53:34,880
Hm, dar putem verifica cu asta

17654
13:53:31,840 --> 13:53:36,560
Scorul R2. Și, știi, încă nu este

17655
13:53:34,880 --> 13:53:38,560
bun. Amintiți-vă, unul ar fi cu adevărat

17656
13:53:36,560 --> 13:53:43,880
bine. Ar fi ca un liniar perfect

17657
13:53:38,560 --> 13:53:43,880
model. Asta e încă destul de rău.

17658
13:53:46,000 --> 13:53:51,040
Bine, așa cum am spus, controalele alfa

17659
13:53:48,640 --> 13:53:54,560
puterea generală. Hm, cu atât mai sus

17660
13:53:51,040 --> 13:53:57,276
alfa, cu atât mai multă penalizare generală

17661
13:53:54,560 --> 13:54:02,800
furnizăm, ceea ce face modelul

17662
13:53:57,276 --> 13:54:06,560
mai simplu. Um uh, dar raportul L1 um

17663
13:54:02,800 --> 13:54:09,916
determină amestecul sau acel raport al

17664
13:54:06,560 --> 13:54:14,400
lambdas, lasoul la creastă. Hm dacă

17665
13:54:09,916 --> 13:54:18,000
ai să fie exact zero, tu tu

17666
13:54:14,400 --> 13:54:20,400
reveniți la um dacă dacă

17667
13:54:18,000 --> 13:54:22,160
îl pui la zero, revii toate

17668
13:54:20,400 --> 13:54:23,680
drum înapoi spre creastă. Una ar fi toate

17669
13:54:22,160 --> 13:54:29,436
drum spre lassos pur. Undeva în

17670
13:54:23,680 --> 13:54:29,436
între, parcă o jumătate este e bună.

17671
13:54:35,040 --> 13:54:40,880
bine,

17672
13:54:37,520 --> 13:54:42,956
deci acesta este un alt exemplu de încercare

17673
13:54:40,880 --> 13:54:45,200
diferite valori ale alfa din CV la

17674
13:54:42,956 --> 13:54:46,720
vezi care funcționează. Acum, din nou, sunt

17675
13:54:45,200 --> 13:54:49,200
ne va arata intr-un minut a

17676
13:54:46,720 --> 13:54:51,276
modalitate sistematică de a face acest lucru, dar asta este

17677
13:54:49,200 --> 13:54:56,160
doar încercând diferite alfa

17678
13:54:51,276 --> 13:54:59,200
ne-am instalat în acest uh în acest um

17679
13:54:56,160 --> 13:55:02,240
uh gama. Deci avem valori diferite

17680
13:54:59,200 --> 13:55:03,916
între minus2 și două um

17681
13:55:02,240 --> 13:55:07,116
logaritmic.

17682
13:55:03,916 --> 13:55:09,360
Deci acestea sunt valori logaritmice

17683
13:55:07,116 --> 13:55:12,240
sunt între acesta între minus2 și doi

17684
13:55:09,360 --> 13:55:14,480
și alegem 100 de alfa diferite și

17685
13:55:12,240 --> 13:55:18,080
apoi alegem un 100 um L1 diferit

17686
13:55:14,480 --> 13:55:20,560
rapoarte intre 0,01 si unu si alergam

17687
13:55:18,080 --> 13:55:22,720
că rulăm această validare încrucișată

17688
13:55:20,560 --> 13:55:25,276
cu 10 ori. Deci asta este destul de puțin.

17689
13:55:22,720 --> 13:55:27,596
Deci, facem 10 falduri și suntem

17690
13:55:25,276 --> 13:55:30,160
încercând o sută de diferite um

17691
13:55:27,596 --> 13:55:31,916
opțiuni. De fiecare dată când facem o opțiune,

17692
13:55:30,160 --> 13:55:34,240
încercăm 10 ori pentru a evalua

17693
13:55:31,916 --> 13:55:37,240
ea. Deci, va dura un minut

17694
13:55:34,240 --> 13:55:37,240
alerga.

17695
13:55:46,800 --> 13:55:50,800
Încă mai rulează aici. Dar din nou, ce

17696
13:55:49,116 --> 13:55:54,240
acest lucru este a face este să încerce diferit

17697
13:55:50,800 --> 13:55:56,240
alphas și va face o cruce

17698
13:55:54,240 --> 13:55:58,800
validare. Și voi băieți țineți minte

17699
13:55:56,240 --> 13:56:03,360
validarea încrucișată t-fold este locul în care luăm

17700
13:55:58,800 --> 13:56:06,480
datele noastre și le împărțim în 10 ori

17701
13:56:03,360 --> 13:56:08,480
și apoi ne antrenăm pe nouă dintre acestea

17702
13:56:06,480 --> 13:56:11,200
și apoi testați pe pliul rămas și

17703
13:56:08,480 --> 13:56:14,240
apoi rotim toate pliurile de 10 ori.

17704
13:56:11,200 --> 13:56:18,720
și că facem o medie a celor pătrate medii

17705
13:56:14,240 --> 13:56:22,560
valorile de eroare împreună împotriva acestora

17706
13:56:18,720 --> 13:56:25,756
10 opțiuni de pliere diferite de generat

17707
13:56:22,560 --> 13:56:27,756
un practic ca o performanță medie

17708
13:56:25,756 --> 13:56:29,596
pentru acea valoare a alfa. Și facem

17709
13:56:27,756 --> 13:56:32,160
că de 100 de ori pentru toate acestea diferite

17710
13:56:29,596 --> 13:56:33,840
100 de alfa care există și 100

17711
13:56:32,160 --> 13:56:37,080
diferite rapoarte L1 pe care le încercăm

17712
13:56:33,840 --> 13:56:37,080
cu ei.

17713
13:56:39,756 --> 13:56:46,160
Deci este destul de puțină procesare, dar

17714
13:56:42,560 --> 13:56:48,240
uh s-a terminat.

17715
13:56:46,160 --> 13:56:50,320
Deci putem vedea care este cel mai bun alfa al nostru și

17716
13:56:48,240 --> 13:56:54,240
cel mai bun raport al nostru. Deci primim ce este mai bun

17717
13:56:50,320 --> 13:56:57,116
alfa este cel mai bun raport este acesta. Hm

17718
13:56:54,240 --> 13:56:59,840
și prin urmare putem construi un model

17719
13:56:57,116 --> 13:57:04,400
cu cei cu doar acești doi tipi ca

17720
13:56:59,840 --> 13:57:06,160
alfa și L1 și vezi cum asta

17721
13:57:04,400 --> 13:57:08,240
execută.

17722
13:57:06,160 --> 13:57:10,320
Construim acel model și apoi prezicem

17723
13:57:08,240 --> 13:57:12,560
pe setul de testare și generăm

17724
13:57:10,320 --> 13:57:14,240
RMSSE. E doar un pic mai bine.

17725
13:57:12,560 --> 13:57:16,240
Încă nu este. Este doar un pic

17726
13:57:14,240 --> 13:57:20,000
mai bine, dar tot nu e bine, nu?

17727
13:57:16,240 --> 13:57:23,596
Este încă 338. Este mult prea mare.

17728
13:57:20,000 --> 13:57:27,596
Amintiți-vă, acesta este RMSSE, deci este în

17729
13:57:23,596 --> 13:57:30,000
unități ale variabilei noastre țintă. Deci,

17730
13:57:27,596 --> 13:57:32,000
este în unitățile de dacă ne întoarcem la

17731
13:57:30,000 --> 13:57:34,160
datele noastre, de fapt, aș putea să printez

17732
13:57:32,000 --> 13:57:37,880
este aici.

17733
13:57:34,160 --> 13:57:37,880
um acest RMSSE.

17734
13:57:38,400 --> 13:57:42,640
Dacă fac asta, am putea arunca o privire

17735
13:57:40,160 --> 13:57:47,040
la um DF

17736
13:57:42,640 --> 13:57:48,560
sau aș putea să mă uit la testul Y

17737
13:57:47,040 --> 13:57:50,160
și puteți vedea unele dintre aceste valori.

17738
13:57:48,560 --> 13:57:51,840
Acestea sunt aceste valori salariale în

17739
13:57:50,160 --> 13:57:56,080
sute, nu? Unii dintre ei sunt în

17740
13:57:51,840 --> 13:57:58,240
mii. Hm, dar o eroare de genul 338

17741
13:57:56,080 --> 13:57:59,756
este prea mare. Asta e foarte mare

17742
13:57:58,240 --> 13:58:02,560
eroare. Asta înseamnă că ne-am stinge

17743
13:57:59,756 --> 13:58:06,000
medie de 300 când valorile noastre dacă noi

17744
13:58:02,560 --> 13:58:08,400
doar face răul

17745
13:58:06,000 --> 13:58:12,160
um

17746
13:58:08,400 --> 13:58:15,116
este doar 550 ca în medie este 550, dar noi

17747
13:58:12,160 --> 13:58:17,200
au această cantitate de eroare în medie um

17748
13:58:15,116 --> 13:58:19,200
deci este mult prea mare

17749
13:58:17,200 --> 13:58:21,916
proporția de eroare corectă nu este a

17750
13:58:19,200 --> 13:58:27,480
model foarte bun si din nou putem verifica

17751
13:58:21,916 --> 13:58:27,480
că uitându-se la acest R2 pentru.

17752
13:58:31,756 --> 13:58:35,640
Deci, dacă mergem aici,

17753
13:58:39,916 --> 13:58:45,276
inca nu foarte bine.

17754
13:58:43,520 --> 13:58:46,400
Iată câțiva dintre coeficienții noștri. Deci

17755
13:58:45,276 --> 13:58:48,240
amintiți-vă, puteți oricând să vă luați

17756
13:58:46,400 --> 13:58:51,436
coeficienți și aliniați-i la dvs

17757
13:58:48,240 --> 13:58:53,360
coloanele dvs. de date. Ca să poți

17758
13:58:51,436 --> 13:58:56,000
obțineți o idee despre ce coeficient îi aparține

17759
13:58:53,360 --> 13:58:57,520
cu ce caracteristică. Deci asta e tot ce suntem

17760
13:58:56,000 --> 13:58:59,200
a face aici este doar a crea o serie

17761
13:58:57,520 --> 13:59:00,560
unde acei coeficienți în loc de doar

17762
13:58:59,200 --> 13:59:02,800
imprimând coeficienții, suntem

17763
13:59:00,560 --> 13:59:05,200
aliniindu-le de fapt până la coloane.

17764
13:59:02,800 --> 13:59:07,520
Așa că asta ne spune că ne amintim mai mare

17765
13:59:05,200 --> 13:59:10,480
este cu atât mai multă influență are

17766
13:59:07,520 --> 13:59:12,640
pe pe rezultatul final. Hm fie

17767
13:59:10,480 --> 13:59:15,436
așa, așa că asta are un mare negativ

17768
13:59:12,640 --> 13:59:18,436
influență. um asta are un mare pozitiv

17769
13:59:15,436 --> 13:59:18,436
influență.

17770
13:59:22,320 --> 13:59:27,116
Bine, lasă-mă să mă opresc acolo. Orice întrebări

17771
13:59:25,200 --> 13:59:31,680
despre

17772
13:59:27,116 --> 13:59:33,680
model plasa elastica?

17773
13:59:31,680 --> 13:59:36,400
Acesta este un model cu adevărat

17774
13:59:33,680 --> 13:59:37,840
unul bun de folosit atunci când construiți un

17775
13:59:36,400 --> 13:59:40,080
regresia liniară și este performantă

17776
13:59:37,840 --> 13:59:41,680
bine, dar este prea potrivit. Acesta este un

17777
13:59:40,080 --> 13:59:43,596
unul foarte bun de folosit pentru că poți

17778
13:59:41,680 --> 13:59:45,360
echilibru

17779
13:59:43,596 --> 13:59:48,400
lasso și creasta de care poți obține tot ce este mai bun

17780
13:59:45,360 --> 13:59:51,436
ambele lumi. Deci strategia principală este

17781
13:59:48,400 --> 13:59:53,596
dacă utilizați o regresie liniară și

17782
13:59:51,436 --> 13:59:56,000
vezi supraadaptare

17783
13:59:53,596 --> 13:59:59,360
Adică, are performanțe decente

17784
13:59:56,000 --> 14:00:01,520
deci pe setul de antrenament

17785
13:59:59,360 --> 14:00:04,080
funcționează bine, dar apoi pe

17786
14:00:01,520 --> 14:00:05,520
set de testare ca și cum știi că nu este

17787
14:00:04,080 --> 14:00:07,360
submontare. se comporta destul de mult

17788
14:00:05,520 --> 14:00:11,360
bine pe platoul de antrenament, dar mai departe

17789
14:00:07,360 --> 14:00:14,080
setul de testare este um performanța este mult

17790
14:00:11,360 --> 14:00:15,596
mai rău. Asta e supraadaptare. Dacă ești

17791
14:00:14,080 --> 14:00:18,080
supraajustat, atunci acesta este un model grozav

17792
14:00:15,596 --> 14:00:20,080
să folosim pentru că putem încerca practic

17793
14:00:18,080 --> 14:00:23,436
prin rotirea prin diferite alfa și

17794
14:00:20,080 --> 14:00:26,320
diferite rapoarte L1, putem încerca

17795
14:00:23,436 --> 14:00:28,720
diferite forţe ale pedepsei şi

17796
14:00:26,320 --> 14:00:30,880
diferite variații pe lasso și creastă

17797
14:00:28,720 --> 14:00:33,680
împreună. Acesta este un model foarte bun

17798
14:00:30,880 --> 14:00:37,200
de folosit pentru acele cazuri supraadaptate în care

17799
14:00:33,680 --> 14:00:39,916
regresia liniară se descurcă decent. um,

17800
14:00:37,200 --> 14:00:42,800
dar este prea potrivit,

17801
14:00:39,916 --> 14:00:44,956
nu? Până acum, nu am derulat acest caz

17802
14:00:42,800 --> 14:00:48,240
pentru că până acum, indiferent de model

17803
14:00:44,956 --> 14:00:50,080
am folosit, este întotdeauna insuficient. Aşa,

17804
14:00:48,240 --> 14:00:53,040
oricând avem acelea underfitting

17805
14:00:50,080 --> 14:00:56,480
cazuri, semnalează că ar trebui probabil

17806
14:00:53,040 --> 14:00:58,800
folosește doar un model mai complex. Iar noi

17807
14:00:56,480 --> 14:01:02,480
nu am aflat încă despre acestea.

17808
14:00:58,800 --> 14:01:05,360
um, vom veni în lecția a patra, dar

17809
14:01:02,480 --> 14:01:06,560
um asta e pentru aceste date. Asta e ultim

17810
14:01:05,360 --> 14:01:08,160
în cele din urmă ceea ce am vrea să facem este

17811
14:01:06,560 --> 14:01:10,800
probabil folosiți un model mai avansat

17812
14:01:08,160 --> 14:01:12,480
pentru că nu se potrivește, doar folosind

17813
14:01:10,800 --> 14:01:14,720
o regresie liniară și apoi folosind

17814
14:01:12,480 --> 14:01:16,560
variațiile de supraadaptare ale liniare

17815
14:01:14,720 --> 14:01:19,560
regresie ca creasta lasso și elastic

17816
14:01:16,560 --> 14:01:19,560
net.

17817
14:01:22,956 --> 14:01:25,956
Bine.

17818
14:01:26,800 --> 14:01:32,360
Orice întrebări despre asta pe elastic atunci

17819
14:01:35,276 --> 14:01:41,320
televizorul? Da, noi Da, cred că am

17820
14:01:37,276 --> 14:01:41,320
ea. Îl pot împărtăși cu tine.

17821
14:01:44,320 --> 14:01:49,800
Am spus asta si acum nu il gasesc. eu

17822
14:01:46,320 --> 14:01:49,800
am crezut că am.

17823
14:01:55,596 --> 14:01:59,756
Nu-l am. Am crezut că am, dar

17824
14:01:57,840 --> 14:02:03,800
Eu nu.

17825
14:01:59,756 --> 14:02:03,800
Dacă cineva îl are pe acela.

17826
14:02:05,276 --> 14:02:11,240
Da, mă voi mai uita o dată. m-am gândit

17827
14:02:07,520 --> 14:02:11,240
Pe acela l-am avut.

17828
14:02:11,520 --> 14:02:14,520
Unul,

17829
14:02:17,360 --> 14:02:22,916
da, nu este acolo. l-am avut. Lasă

17830
14:02:19,756 --> 14:02:22,916
văd eu.

17831
14:02:32,000 --> 14:02:37,160
Da, nici eu nu-l am. m-am gândit

17832
14:02:33,520 --> 14:02:37,160
L-am avut aici.

17833
14:02:42,080 --> 14:02:46,040
Da, nu am pe acela.

17834
14:02:46,956 --> 14:02:50,800
Nu am pe acela. Va trebui să găsesc

17835
14:02:48,320 --> 14:02:54,000
ea. Am aceste date de marketing. eu

17836
14:02:50,800 --> 14:02:55,596
sa nu crezi ca acesta este acelasi.

17837
14:02:54,000 --> 14:02:56,880
Am aceste date de marketing. Eu nu

17838
14:02:55,596 --> 14:03:00,276
crezi că este cel potrivit, dar poți

17839
14:02:56,880 --> 14:03:00,276
arunca o privire la ea.

17840
14:03:01,436 --> 14:03:05,596
Nu, folosim Deci, pentru acest exemplu,

17841
14:03:03,596 --> 14:03:08,400
folosim același set de date pentru lovitori

17842
14:03:05,596 --> 14:03:12,596
pe care l-am folosit mai devreme pentru lasso.

17843
14:03:08,400 --> 14:03:12,596
Nu, asta e una mai devreme.

17844
14:03:14,720 --> 14:03:21,116
Asta chiar de la începutul

17845
14:03:18,000 --> 14:03:24,116
caietul. Deci asta e din asta

17846
14:03:21,116 --> 14:03:24,116
unul.

17847
14:03:25,756 --> 14:03:29,040
Oh, asta Oh, aici este locul. Îmi pare rău.

17848
14:03:27,840 --> 14:03:32,040
Aici este. Îl poți găsi

17849
14:03:29,040 --> 14:03:32,040
aici.

17850
14:03:34,000 --> 14:03:38,040
Asta e corect. Era de la o adresă URL.

17851
14:03:40,000 --> 14:03:43,596
A fost folosit chiar la începutul anului

17852
14:03:41,596 --> 14:03:47,680
caietul.

17853
14:03:43,596 --> 14:03:49,840
Și noi am făcut asta.

17854
14:03:47,680 --> 14:03:50,956
Bine.

17855
14:03:49,840 --> 14:03:54,116
Asta e corect. De aceea nu am avut

17856
14:03:50,956 --> 14:03:54,116
s-a descărcat.

17857
14:03:55,436 --> 14:03:58,436
Bine.

17858
14:03:59,596 --> 14:04:03,360
În regulă. Orice alte întrebări despre

17859
14:04:01,200 --> 14:04:07,756
elastic înainte de a mă mișca mă voi mișca

17860
14:04:03,360 --> 14:04:10,400
pentru a le găsi un mod sistematic

17861
14:04:07,756 --> 14:04:11,756
pentru a găsi cei mai buni hiperparametri.

17862
14:04:10,400 --> 14:04:14,160
Am să vă arăt câteva

17863
14:04:11,756 --> 14:04:16,640
strategii pentru a face asta. Hm, până acum

17864
14:04:14,160 --> 14:04:18,956
tocmai am rulat CV cu ceva aleatoriu

17865
14:04:16,640 --> 14:04:20,640
alegeri. Um, am să-ți arăt o

17866
14:04:18,956 --> 14:04:22,240
abordare mai bună, mai sistematică. Asta e

17867
14:04:20,640 --> 14:04:25,520
un fel de standard industrial pentru a face

17868
14:04:22,240 --> 14:04:26,956
acordarea. Hm, deci o să mă duc

17869
14:04:25,520 --> 14:04:30,680
îți arăt asta în continuare, dar orice întrebări

17870
14:04:26,956 --> 14:04:30,680
plasa elastica?

17871
14:04:33,200 --> 14:04:37,596
Bine. Și din nou, așa cum știți

17872
14:04:35,916 --> 14:04:39,116
scikitlearn vă face cu adevărat ușor

17873
14:04:37,596 --> 14:04:41,680
baieti

17874
14:04:39,116 --> 14:04:44,640
pentru că pur și simplu se comportă la fel ca

17875
14:04:41,680 --> 14:04:46,956
orice alt model. Folosești obiectul și

17876
14:04:44,640 --> 14:04:50,400
atunci faci ffit și prezici nu? Deci

17877
14:04:46,956 --> 14:04:52,400
ffit-ul o va antrena um și

17878
14:04:50,400 --> 14:04:54,640
predict vă va permite să utilizați

17879
14:04:52,400 --> 14:04:56,880
acel model de prezis. Este super

17880
14:04:54,640 --> 14:04:59,360
usor asa. Fiecare model scikitlearn

17881
14:04:56,880 --> 14:05:01,200
este așa dofitit și prezice. Deci

17882
14:04:59,360 --> 14:05:04,840
oferă o modalitate foarte simplă de utilizare

17883
14:05:01,200 --> 14:05:04,840
practic fiecare model.

17884
14:05:07,360 --> 14:05:11,040
bine,

17885
14:05:09,360 --> 14:05:14,480
hai să vorbim despre hai să terminăm asta

17886
14:05:11,040 --> 14:05:15,756
lecție cu câteva lucruri. Um, unul dintre

17887
14:05:14,480 --> 14:05:19,040
acele lucruri vor fi

17888
14:05:15,756 --> 14:05:21,840
reglare hiperparametrică. Deci ce este asta?

17889
14:05:19,040 --> 14:05:24,880
Reglajul hiperparametrului este a

17890
14:05:21,840 --> 14:05:28,240
modalitate sistematică de a găsi cele mai bune

17891
14:05:24,880 --> 14:05:30,800
parametrii într-un model de învățare automată.

17892
14:05:28,240 --> 14:05:33,116
Deci o mulțime de modele de învățare automată au

17893
14:05:30,800 --> 14:05:35,756
ceea ce se numesc hiperparametri.

17894
14:05:33,116 --> 14:05:37,756
Acestea nu sunt beta-urile pe care le învățăm

17895
14:05:35,756 --> 14:05:40,400
în timpul antrenamentului din care s-a învățat

17896
14:05:37,756 --> 14:05:43,360
datele. Acestea sunt setările pe care le setăm noi

17897
14:05:40,400 --> 14:05:45,916
dinainte ca alfa. Asta este o

17898
14:05:43,360 --> 14:05:48,400
exemplu perfect cum ar fi raportul alfa L1 în

17899
14:05:45,916 --> 14:05:50,240
în plasa elastică. Noi le-am instalat

17900
14:05:48,400 --> 14:05:51,756
din timp și în funcție de ceea ce noi

17901
14:05:50,240 --> 14:05:54,160
alegeți pentru cei pe care îi avem diferiți

17902
14:05:51,756 --> 14:05:57,680
performanta, nu? Și așa ce noi

17903
14:05:54,160 --> 14:06:00,160
nevoie cu adevărat este o modalitate sistematică de a găsi

17904
14:05:57,680 --> 14:06:02,800
cele mai bune setări pentru acestea

17905
14:06:00,160 --> 14:06:08,160
hiperparametrii pe măsură ce ne antrenăm

17906
14:06:02,800 --> 14:06:10,720
modele. Hm, ideea principală

17907
14:06:08,160 --> 14:06:14,320
în spatele acestui proces, totuși, se va

17908
14:06:10,720 --> 14:06:17,360
fie să încerce sistematic diferite

17909
14:06:14,320 --> 14:06:19,840
combinații câte vrem să încercăm.

17910
14:06:17,360 --> 14:06:22,800
Și așa vom face, practic

17911
14:06:19,840 --> 14:06:26,480
au o strategie de reglare care merge

17912
14:06:22,800 --> 14:06:28,800
să epuizeze toate combinaţiile celor

17913
14:06:26,480 --> 14:06:31,360
hiperparametrii pe care vrem să-i încercăm

17914
14:06:28,800 --> 14:06:34,720
până îl găsim pe cel care execută

17915
14:06:31,360 --> 14:06:39,116
cel mai bun. Hm și și acea strategie este cunoscută

17916
14:06:34,720 --> 14:06:42,800
ca căutare în grilă. Hm și în esență ce

17917
14:06:39,116 --> 14:06:45,436
face este că stabilește o grilă unde

17918
14:06:42,800 --> 14:06:47,200
care este practic ca o matrice de spus

17919
14:06:45,436 --> 14:06:50,720
bine ce parametri vrei

17920
14:06:47,200 --> 14:06:53,596
incerci? Vreau să încerc alpha și vreau

17921
14:06:50,720 --> 14:06:57,360
pentru a încerca raportul L1

17922
14:06:53,596 --> 14:06:59,680
um raportul L1 ca să zicem că vreau să încerc

17923
14:06:57,360 --> 14:07:01,276
aceşti doi. Așa că le-am configurat într-o grilă

17924
14:06:59,680 --> 14:07:02,880
unde spunem: „Bine, vreau să încerc asta

17925
14:07:01,276 --> 14:07:04,800
valoare. Vreau să încerc această valoare. vreau

17926
14:07:02,880 --> 14:07:06,880
pentru a încerca această valoare. Acesta, acesta,

17927
14:07:04,800 --> 14:07:09,520
acesta, și mai departe și câte vrem

17928
14:07:06,880 --> 14:07:12,640
să încerc”. Așa că am putea să le punem la punct

17929
14:07:09,520 --> 14:07:14,956
sistematic ca un um a liniar

17930
14:07:12,640 --> 14:07:18,720
distanțate liniar așa cum vreau să încerc fiecare

17931
14:07:14,956 --> 14:07:21,756
alfa între 0 și 10 distanță de

17932
14:07:18,720 --> 14:07:23,680
una um orice. Știi, ne putem configura

17933
14:07:21,756 --> 14:07:25,596
diferite game ale acestora, dar asta este

17934
14:07:23,680 --> 14:07:27,360
va fi în această grilă. Și apoi

17935
14:07:25,596 --> 14:07:28,720
Raportul L1, același lucru. Putem încerca

17936
14:07:27,360 --> 14:07:32,240
valori diferite ale acestora pe care le dorim

17937
14:07:28,720 --> 14:07:36,160
să încerce. Să spunem că sunt multe dintre acestea.

17938
14:07:32,240 --> 14:07:40,160
Poate la fiecare zecime între 0 și unu

17939
14:07:36,160 --> 14:07:41,520
Vreau să încerc. Așa că ai configurat-o

17940
14:07:40,160 --> 14:07:43,520
parametrii și puteți seta cât mai mulți

17941
14:07:41,520 --> 14:07:45,276
vrei în grilă. Și apoi

17942
14:07:43,520 --> 14:07:47,596
în esență, ceea ce ai de gând să faci

17943
14:07:45,276 --> 14:07:49,596
face căutarea în grilă este că vei lucra

17944
14:07:47,596 --> 14:07:50,880
drumul tău prin fiecare combinație de

17945
14:07:49,596 --> 14:07:53,276
acelea. Deci o să încerci asta

17946
14:07:50,880 --> 14:07:54,880
combo. Ai de gând să încerci asta

17947
14:07:53,276 --> 14:07:56,720
combo. Ai de gând să încerci asta

17948
14:07:54,880 --> 14:08:00,240
combo.

17949
14:07:56,720 --> 14:08:03,520
acest combo. Deci prima valoare a lui alfa

17950
14:08:00,240 --> 14:08:05,596
cu fiecare raport L1 posibil, apoi mergeți la

17951
14:08:03,520 --> 14:08:08,400
următorul, încercați următoarea valoare a

17952
14:08:05,596 --> 14:08:11,680
alfa cu fiecare raport L1, și mai departe

17953
14:08:08,400 --> 14:08:14,320
și mai departe. Deci o să încercăm

17954
14:08:11,680 --> 14:08:16,400
toate combo-urile

17955
14:08:14,320 --> 14:08:18,560
în grilă.

17956
14:08:16,400 --> 14:08:22,080
Vom încerca toate combo-urile și suntem

17957
14:08:18,560 --> 14:08:25,200
va găsi cel mai mic MSE

17958
14:08:22,080 --> 14:08:27,040
combinație. găsiți cel mai jos

17959
14:08:25,200 --> 14:08:28,720
MSE

17960
14:08:27,040 --> 14:08:31,360
combo.

17961
14:08:28,720 --> 14:08:34,320
Deci, orice duce la cel mai bun model este

17962
14:08:31,360 --> 14:08:36,640
vor fi parametrii um care sunt

17963
14:08:34,320 --> 14:08:40,080
care sunt considerate a fi cele mai bune. Iar cel

17964
14:08:36,640 --> 14:08:42,080
ideea este odată ce i-am găsit pe cei pe care îi cunoaștem

17965
14:08:40,080 --> 14:08:44,240
pe care îl putem folosi putem merge înainte și

17966
14:08:42,080 --> 14:08:48,596
antrenează un model cu cele mai bune alfa și

17967
14:08:44,240 --> 14:08:48,596
len ratio și mai departe și mai departe și mai departe.

17968
14:08:54,240 --> 14:08:59,436
Da, când primești un Deci asta se întoarce

17969
14:08:56,160 --> 14:09:01,040
la eroare. Amintiți-vă că pentru a

17970
14:08:59,436 --> 14:09:04,080
regresie,

17971
14:09:01,040 --> 14:09:06,080
eroarea este această măsurătoare a cât de departe

17972
14:09:04,080 --> 14:09:08,880
am plecat, nu? Deci dacă avem o grămadă

17973
14:09:06,080 --> 14:09:12,480
de puncte și tragem potrivim o linie

17974
14:09:08,880 --> 14:09:14,800
prin acolo, MSE-ul măsoară

17975
14:09:12,480 --> 14:09:16,800
distanta asta, nu? Deci ce faci

17976
14:09:14,800 --> 14:09:19,116
crezi că este o distanță bună? Ca și cum ai nostru

17977
14:09:16,800 --> 14:09:21,916
modelul este perfect,

17978
14:09:19,116 --> 14:09:25,276
care este cea mai bună distanță de la noi

17979
14:09:21,916 --> 14:09:29,040
previziuni la punctele reale? Zero.

17980
14:09:25,276 --> 14:09:32,956
Da. Deci, cu cât mai jos, cu atât mai bine. Mai jos

17981
14:09:29,040 --> 14:09:35,116
cu atât mai bine. Hm, pentru un R RMSSE,

17982
14:09:32,956 --> 14:09:39,756
mai mic cu cât mai aproape de zero, cu atât mai bine.

17983
14:09:35,116 --> 14:09:41,840
Cu toate acestea, RMSSE poate fi unitățile sale

17984
14:09:39,756 --> 14:09:43,436
sunt interpretate în unitățile noastre

17985
14:09:41,840 --> 14:09:46,720
tinta.

17986
14:09:43,436 --> 14:09:48,640
Deci ceea ce este considerat a fi bun este relativ

17987
14:09:46,720 --> 14:09:51,360
spre ținta noastră. Ca să spunem ținta noastră

17988
14:09:48,640 --> 14:09:54,800
este în mii. De parcă are o medie în

17989
14:09:51,360 --> 14:09:59,116
miile. Dacă producem un MSE de

17990
14:09:54,800 --> 14:10:01,756
50 sau scuze un RMSSE de 50, asta e

17991
14:09:59,116 --> 14:10:03,756
destul de bine, nu? Pentru că unitățile noastre

17992
14:10:01,756 --> 14:10:07,200
sunt în mii

17993
14:10:03,756 --> 14:10:09,436
și suntem doar în medie, ne-am îndepărtat

17994
14:10:07,200 --> 14:10:11,596
50 de unitati,

17995
14:10:09,436 --> 14:10:15,200
nu? Distanța noastră este de aproximativ 50

17996
14:10:11,596 --> 14:10:18,240
unitati. E destul de bine. Deci RMSSE

17997
14:10:15,200 --> 14:10:20,640
este relativ la variabila țintă.

17998
14:10:18,240 --> 14:10:22,320
Are sens? Da. Depinde

17999
14:10:20,640 --> 14:10:25,200
pe tinta. Depinde ce esti

18000
14:10:22,320 --> 14:10:27,520
încercând să prezică.

18001
14:10:25,200 --> 14:10:29,520
Deci, de aceea am primit RMSSE care erau în

18002
14:10:27,520 --> 14:10:31,756
anii 300 pentru acei lovitori, dar

18003
14:10:29,520 --> 14:10:35,360
media a fost media țintei

18004
14:10:31,756 --> 14:10:37,840
a fost în anii 500. Deci e foarte rău

18005
14:10:35,360 --> 14:10:41,360
proporția de eroare relativă la

18006
14:10:37,840 --> 14:10:43,916
valoarea țintă medie. Corect? Dacă noastre

18007
14:10:41,360 --> 14:10:47,520
RMSSE a fost 300,

18008
14:10:43,916 --> 14:10:50,240
dar ținta era în anii 500,

18009
14:10:47,520 --> 14:10:52,000
este prea multă eroare. Mult prea mult

18010
14:10:50,240 --> 14:10:56,000
eroare, nu? E prea mare

18011
14:10:52,000 --> 14:10:58,000
valoare. Hm, previziunile noastre sunt abia în dezactivare

18012
14:10:56,000 --> 14:10:59,916
mult prea mult

18013
14:10:58,000 --> 14:11:02,880
in ceea ce priveste distanta respectiva. Deci, asta

18014
14:10:59,916 --> 14:11:04,720
ar fi fost un model prost. A fost

18015
14:11:02,880 --> 14:11:07,116
underfit.

18016
14:11:04,720 --> 14:11:09,840
Știm asta de la RMSSE. Aşa

18017
14:11:07,116 --> 14:11:12,400
da, RMSSE mai aproape de zero, nu

18018
14:11:09,840 --> 14:11:16,560
contează ce este bine,

18019
14:11:12,400 --> 14:11:18,320
zero este a fi perfect. Hm, dar asta

18020
14:11:16,560 --> 14:11:20,956
știi ce e bine, trebuie să știi ce

18021
14:11:18,320 --> 14:11:23,756
ținta ta este în medie și apoi gândește-te

18022
14:11:20,956 --> 14:11:26,320
din aceasta ca un fel de raport cu aceea

18023
14:11:23,756 --> 14:11:30,360
tinta medie. Cred că asta e cel mai bun

18024
14:11:26,320 --> 14:11:30,360
mod de a gândi la asta.

18025
14:11:37,360 --> 14:11:44,880
Bine, deci revenirea la această idee de grilă este

18026
14:11:42,000 --> 14:11:48,480
deci grila este, practic, așezată

18027
14:11:44,880 --> 14:11:50,400
toate combinațiile de parametri posibile și

18028
14:11:48,480 --> 14:11:53,436
încercându-le pe toate prin potrivire şi

18029
14:11:50,400 --> 14:11:55,840
prezicerea până la și generarea unui a

18030
14:11:53,436 --> 14:11:58,320
metrica ca un MSE

18031
14:11:55,840 --> 14:12:02,160
până îl găsim pe cel cu cel mai mic

18032
14:11:58,320 --> 14:12:04,800
MSE. Așa că găsiți cea mai mică combinație MSE

18033
14:12:02,160 --> 14:12:07,276
si asta va fi cel mai bun

18034
14:12:04,800 --> 14:12:09,756
acesta va fi cel mai bun combo și apoi dacă

18035
14:12:07,276 --> 14:12:11,680
noi odată ce știm cea mai bună combinație pe care o putem

18036
14:12:09,756 --> 14:12:14,880
folosiți că putem folosi acel alfa pe care îl putem

18037
14:12:11,680 --> 14:12:16,640
folosește acel raport L1 și folosește acel model

18038
14:12:14,880 --> 14:12:20,400
de acum înainte putem, le putem folosi

18039
14:12:16,640 --> 14:12:24,000
parametrii din modelul nostru deci această strategie

18040
14:12:20,400 --> 14:12:26,800
are un nume cunoscut sub numele de căutare în grilă

18041
14:12:24,000 --> 14:12:30,956
deci este un proces de reglare hiperparametrică

18042
14:12:26,800 --> 14:12:34,956
care încearcă toate combinațiile S.

18043
14:12:30,956 --> 14:12:37,200
Deci, care este beneficiul U

18044
14:12:34,956 --> 14:12:38,720
asta este că putem testa o mulțime de

18045
14:12:37,200 --> 14:12:41,040
diferite combo combo ale acestora

18046
14:12:38,720 --> 14:12:43,680
parametri precum alfa și L1. Deci noi

18047
14:12:41,040 --> 14:12:46,000
pot fi siguri care este cel mai bun model,

18048
14:12:43,680 --> 14:12:47,596
nu? Deci putem alege alfa și L1

18049
14:12:46,000 --> 14:12:49,276
perfect pentru că încercăm o

18050
14:12:47,596 --> 14:12:52,480
o grămadă de combinații diferite pe

18051
14:12:49,276 --> 14:12:54,400
date pentru a vedea care este cel mai bun. Ce este

18052
14:12:52,480 --> 14:12:56,880
dezavantajul?

18053
14:12:54,400 --> 14:13:00,320
E scump, nu? Este o

18054
14:12:56,880 --> 14:13:03,520
căutare exhaustivă. Deci dacă ai multe

18055
14:13:00,320 --> 14:13:06,000
parametri diferiți și încerci

18056
14:13:03,520 --> 14:13:08,000
din multe combinații diferite, se poate

18057
14:13:06,000 --> 14:13:09,596
obține exponențial

18058
14:13:08,000 --> 14:13:12,956
scump

18059
14:13:09,596 --> 14:13:15,840
pentru a efectua această căutare. Bine, deci grilă

18060
14:13:12,956 --> 14:13:17,680
căutarea este grozavă cu excepția faptului că

18061
14:13:15,840 --> 14:13:20,080
poate fi scump dacă ai multe

18062
14:13:17,680 --> 14:13:21,840
parametrii cu intervale foarte largi

18063
14:13:20,080 --> 14:13:23,680
pe care cauți pentru că asta

18064
14:13:21,840 --> 14:13:26,400
sunt multe combinații pe care trebuie să le faci

18065
14:13:23,680 --> 14:13:28,720
test, nu? Și mai ales dacă ai

18066
14:13:26,400 --> 14:13:30,800
multe date, asta va fi

18067
14:13:28,720 --> 14:13:33,436
scump

18068
14:13:30,800 --> 14:13:35,596
um de făcut.

18069
14:13:33,436 --> 14:13:37,436
Deci, uh, vom exersa a face

18070
14:13:35,596 --> 14:13:38,880
căutare în grilă, dar acesta este pro

18071
14:13:37,436 --> 14:13:40,560
si con. Pro este că trebuie să încercăm

18072
14:13:38,880 --> 14:13:43,040
scoateți toate aceste combinații și vedeți care

18073
14:13:40,560 --> 14:13:44,720
unul e cel mai bun. Dezavantajul este că se poate

18074
14:13:43,040 --> 14:13:47,520
fi scump să faci asta dacă ai un

18075
14:13:44,720 --> 14:13:52,080
o mulțime de parametri pe care doriți

18076
14:13:47,520 --> 14:13:53,916
acordați-vă modelul și aveți foarte multe

18077
14:13:52,080 --> 14:13:56,880
uh, multe alegeri diferite pe care le ai

18078
14:13:53,916 --> 14:13:59,200
încercând să evalueze pentru acestea și doar

18079
14:13:56,880 --> 14:14:02,000
creează o colecție foarte mare de

18080
14:13:59,200 --> 14:14:05,360
combinații pe care trebuie să le încerci,

18081
14:14:02,000 --> 14:14:08,480
nu? Ăsta e singurul dezavantaj

18082
14:14:05,360 --> 14:14:10,480
căutare în grilă.

18083
14:14:08,480 --> 14:14:13,916
Acum la capătul opus al spectrului

18084
14:14:10,480 --> 14:14:17,916
din aceasta este o căutare aleatorie sau aleatorie

18085
14:14:13,916 --> 14:14:23,116
caută și asta va fi practic doar um

18086
14:14:17,916 --> 14:14:25,360
faceți o eșantionare a acelor parametri din

18087
14:14:23,116 --> 14:14:28,400
um fel de fix uh specificat

18088
14:14:25,360 --> 14:14:31,520
distributie. Deci, în esență, ceea ce faci

18089
14:14:28,400 --> 14:14:34,720
în mod similar, definiți gama dvs. Deci

18090
14:14:31,520 --> 14:14:38,000
spui că vreau să mă uit la alphas um

18091
14:14:34,720 --> 14:14:40,240
între zero scuze între să zicem

18092
14:14:38,000 --> 14:14:42,480
da, de la 0 la 10. Vreau să mă uit la o grămadă

18093
14:14:40,240 --> 14:14:45,680
de diferite alfa. Hm, și vreau

18094
14:14:42,480 --> 14:14:49,520
uită-te la o grămadă de rapoarte L1 diferite

18095
14:14:45,680 --> 14:14:53,360
care sunt intre 0ero la unu.

18096
14:14:49,520 --> 14:14:57,116
0 la unu. Și ce facem este să spunem,

18097
14:14:53,360 --> 14:14:59,520
bine, voi restricționa doar testarea

18098
14:14:57,116 --> 14:15:02,160
20, 30, 40 de ori. Nu am de gând să fac

18099
14:14:59,520 --> 14:15:04,480
toate combinațiile posibile. doar sunt

18100
14:15:02,160 --> 14:15:07,360
mergi să eșantionezi la întâmplare ceva în

18101
14:15:04,480 --> 14:15:10,480
acest interval și eșantionați la întâmplare ceva

18102
14:15:07,360 --> 14:15:12,800
în acest interval. Și așa și o să fac

18103
14:15:10,480 --> 14:15:16,080
efectuează acel experiment un număr fix

18104
14:15:12,800 --> 14:15:19,520
de ori. Deci, să presupunem că am setat uh

18105
14:15:16,080 --> 14:15:21,840
eșantionare în cazul în care voi face doar um

18106
14:15:19,520 --> 14:15:24,640
20 de evaluări.

18107
14:15:21,840 --> 14:15:28,240
Și așa că de 20 de ori vom alege un

18108
14:15:24,640 --> 14:15:32,916
combo la întâmplare. Așa că o să aleg un

18109
14:15:28,240 --> 14:15:32,916
alpha și voi alege un raport L1.

18110
14:15:33,840 --> 14:15:40,880
Raportul L1.

18111
14:15:36,160 --> 14:15:44,240
Și um suntem, doar mergem la uh

18112
14:15:40,880 --> 14:15:47,840
eșantionați aleatoriu din acest interval.

18113
14:15:44,240 --> 14:15:49,520
Hm și le vom folosi și le vom testa

18114
14:15:47,840 --> 14:15:50,956
alea afară și apoi este, dar altfel

18115
14:15:49,520 --> 14:15:53,596
este la fel cu căutarea în grilă. Oricare ar fi

18116
14:15:50,956 --> 14:15:56,080
este cel mai mic MSE

18117
14:15:53,596 --> 14:15:57,756
um deci orice este cel mai mic MSE este

18118
14:15:56,080 --> 14:16:00,480
cel mai bun.

18119
14:15:57,756 --> 14:16:03,040
Deci le evaluăm. Noi eșantionăm antrenăm

18120
14:16:00,480 --> 14:16:05,680
modelul. Evaluează-l. Oricare ar fi

18121
14:16:03,040 --> 14:16:09,680
cel mai mic MSE

18122
14:16:05,680 --> 14:16:12,800
este cel mai bun este cel mai bun combo. Acum,

18123
14:16:09,680 --> 14:16:16,400
care este beneficiul acestui lucru este că este a

18124
14:16:12,800 --> 14:16:18,956
experiment mult mai controlat în

18125
14:16:16,400 --> 14:16:20,800
simt că nu vom repeta

18126
14:16:18,956 --> 14:16:23,040
prin fiecare combinație posibilă în

18127
14:16:20,800 --> 14:16:24,880
grila. Practic, am înființat un

18128
14:16:23,040 --> 14:16:26,720
un număr fix de ori vom încerca

18129
14:16:24,880 --> 14:16:28,800
lucruri afară.

18130
14:16:26,720 --> 14:16:31,840
Riscul de a face asta este că ești

18131
14:16:28,800 --> 14:16:33,276
nu, nu le explorezi pe toate

18132
14:16:31,840 --> 14:16:36,480
combinatii, nu? Pentru că ești

18133
14:16:33,276 --> 14:16:39,680
eșantionare aleatorie, este posibil să aveți ghinion

18134
14:16:36,480 --> 14:16:42,320
și s-ar putea să nu te împiedici de cel mai bun.

18135
14:16:39,680 --> 14:16:43,596
Poți face mostre și figuri

18136
14:16:42,320 --> 14:16:46,640
afla ce este cel mai bun dintre voi

18137
14:16:43,596 --> 14:16:48,560
mostre, dar este posibil să nu acoperiți toate

18138
14:16:46,640 --> 14:16:50,640
combinatiile. Are sens?

18139
14:16:48,560 --> 14:16:53,680
Căutarea în grilă va încerca fiecare

18140
14:16:50,640 --> 14:16:56,560
combo. Căutarea aleatorie urmează

18141
14:16:53,680 --> 14:16:58,400
eșantionați aleatoriu aceste combo-uri.

18142
14:16:56,560 --> 14:17:00,320
Deci, nu va încerca fiecare

18143
14:16:58,400 --> 14:17:03,040
unul. Va încerca un număr limitat,

18144
14:17:00,320 --> 14:17:06,080
oricât de multe ai configura. Acum, dacă ai setat

18145
14:17:03,040 --> 14:17:07,680
acest număr foarte, foarte, foarte mare.

18146
14:17:06,080 --> 14:17:10,560
Acum, începi să te apropii de o grilă

18147
14:17:07,680 --> 14:17:12,480
caută pentru că acum eșantionezi așa

18148
14:17:10,560 --> 14:17:16,400
multe dintre acele combo-uri pe care le ai practic

18149
14:17:12,480 --> 14:17:20,560
le încerc pe toate în acel moment,

18150
14:17:16,400 --> 14:17:22,480
nu? um,

18151
14:17:20,560 --> 14:17:24,640
deci, așa este căutarea aleatorie.

18152
14:17:22,480 --> 14:17:27,360
Deci, apropo, ambele folosesc cruce

18153
14:17:24,640 --> 14:17:29,276
validare în sensul că atunci când tu

18154
14:17:27,360 --> 14:17:31,520
evalua cazarea, de fapt esti

18155
14:17:29,276 --> 14:17:34,000
făcând-o cu validare încrucișată. Deci când

18156
14:17:31,520 --> 14:17:36,080
faci o evaluare, vei face

18157
14:17:34,000 --> 14:17:39,520
probabil 10 sau cinci ori unde tu

18158
14:17:36,080 --> 14:17:41,756
împărțiți datele și apoi le testați

18159
14:17:39,520 --> 14:17:42,800
restul pliurilor si evalua sau

18160
14:17:41,756 --> 14:17:44,720
antrenează-l pe restul pliurilor,

18161
14:17:42,800 --> 14:17:49,200
evaluează-l pe una dintre ele și generează

18162
14:17:44,720 --> 14:17:51,116
un MSE mediu pentru a obține evaluarea dvs.

18163
14:17:49,200 --> 14:17:52,640
Deci, fiecare evaluare folosește cruce

18164
14:17:51,116 --> 14:17:54,880
validare.

18165
14:17:52,640 --> 14:17:56,720
De aceea, și sperăm că puteți

18166
14:17:54,880 --> 14:17:58,956
vezi de ce ar fi atât de scump pentru a

18167
14:17:56,720 --> 14:18:02,080
grila foarte mare, nu? Pentru că ești

18168
14:17:58,956 --> 14:18:04,480
încercând multe combinații diferite

18169
14:18:02,080 --> 14:18:07,116
și fiecare combinație va face a

18170
14:18:04,480 --> 14:18:10,240
procedura de validare încrucișată. Deci este

18171
14:18:07,116 --> 14:18:12,160
mergi să mă antrenez de 10 ori și să testezi împotriva

18172
14:18:10,240 --> 14:18:13,520
10 pliuri diferite și medii ale acestora

18173
14:18:12,160 --> 14:18:15,680
împreună. va fi frumos

18174
14:18:13,520 --> 14:18:18,320
operare costisitoare

18175
14:18:15,680 --> 14:18:19,840
pentru o grilă foarte mare, corect, de

18176
14:18:18,320 --> 14:18:21,596
parametrii.

18177
14:18:19,840 --> 14:18:24,640
Hm, dar acestea sunt cele două tipuri

18178
14:18:21,596 --> 14:18:27,520
abordări sistematice pe care le avem la încercare

18179
14:18:24,640 --> 14:18:28,720
scoateți diferiți hiperparametri. Ține minte

18180
14:18:27,520 --> 14:18:31,200
acele lucruri se numesc

18181
14:18:28,720 --> 14:18:34,480
hiperparametrii. Acestea sunt alegerile

18182
14:18:31,200 --> 14:18:36,800
pe care le avem înainte de a ne antrena modelul.

18183
14:18:34,480 --> 14:18:38,400
Hm, acele alegeri pe care le avem care le afectează

18184
14:18:36,800 --> 14:18:40,480
performanța modelului ca

18185
14:18:38,400 --> 14:18:43,276
alfa, rapoartele L1, genul ăsta de

18186
14:18:40,480 --> 14:18:44,640
lucruri. um, avem control asupra ce

18187
14:18:43,276 --> 14:18:46,880
vor fi. Acesta este un

18188
14:18:44,640 --> 14:18:48,880
abordare sistematică pentru a afla ce

18189
14:18:46,880 --> 14:18:51,436
cel mai bun

18190
14:18:48,880 --> 14:18:53,840
uh valoarea acelor parametri va ajunge

18191
14:18:51,436 --> 14:18:56,840
fiți pe datele noastre.

18192
14:18:53,840 --> 14:18:56,840
Corect?

18193
14:18:57,436 --> 14:19:01,040
Bine. Deci, înainte de a practica asta, suntem

18194
14:18:59,916 --> 14:19:04,000
mergi la exersare cu căutarea pe grilă

18195
14:19:01,040 --> 14:19:07,320
mai întâi. Hm

18196
14:19:04,000 --> 14:19:07,320
orice intrebari?

18197
14:19:14,080 --> 14:19:17,756
Nu știu dacă are încorporat

18198
14:19:16,000 --> 14:19:18,956
E o întrebare bună. Prin limita de timp, eu

18199
14:19:17,756 --> 14:19:20,720
nu stiu daca are un mod incorporat de

18200
14:19:18,956 --> 14:19:25,680
făcând-o, dar cu siguranță ai putea configura

18201
14:19:20,720 --> 14:19:26,956
ca o buclă um să-ți placă să înfășoare

18202
14:19:25,680 --> 14:19:28,320
în jur. Știi ce vreau să spun? Ca

18203
14:19:26,956 --> 14:19:31,360
ai putea configura o buclă în care să verifici

18204
14:19:28,320 --> 14:19:32,720
timpul dacă este dacă dacă timpul a trecut

18205
14:19:31,360 --> 14:19:35,596
în timp ce faci o căutare dacă timpul

18206
14:19:32,720 --> 14:19:38,320
scurs este mai mare decât timpul

18207
14:19:35,596 --> 14:19:40,560
limită, atunci poți să te oprești mai devreme.

18208
14:19:38,320 --> 14:19:42,000
Deci nu este greu să implementezi asta

18209
14:19:40,560 --> 14:19:44,956
dar nu stiu daca are asa construit

18210
14:19:42,000 --> 14:19:46,320
în. Nu cred că are

18211
14:19:44,956 --> 14:19:48,880
pentru că nu cred că îi pasă cu adevărat

18212
14:19:46,320 --> 14:19:50,560
cât durează fiecare evaluare. Este

18213
14:19:48,880 --> 14:19:53,116
doar o să le epuizez pe toate

18214
14:19:50,560 --> 14:19:56,480
mai ales într-o căutare în grilă.

18215
14:19:53,116 --> 14:19:58,800
Dar da, probabil că există o cale

18216
14:19:56,480 --> 14:20:01,800
setați manual un timp de timp

18217
14:19:58,800 --> 14:20:01,800
buclă.

18218
14:20:04,800 --> 14:20:11,916
Deci hiperparametrii sunt setări care

18219
14:20:08,956 --> 14:20:13,276
avem pe modelul în sine. Și a

18220
14:20:11,916 --> 14:20:15,916
un exemplu foarte bun în acest sens este ca

18221
14:20:13,276 --> 14:20:20,320
raportul alfa și L1 în elastic

18222
14:20:15,916 --> 14:20:22,240
net. Deci nu sunt lucruri pe care noi

18223
14:20:20,320 --> 14:20:24,320
învățați din date direct ca

18224
14:20:22,240 --> 14:20:28,080
beta în modelul ca acestea primesc

18225
14:20:24,320 --> 14:20:31,116
antrenat direct făcând um cel puțin

18226
14:20:28,080 --> 14:20:32,400
pătratele procesează corect, făcând asta

18227
14:20:31,116 --> 14:20:34,000
coborâre în gradient și toate astea

18228
14:20:32,400 --> 14:20:36,880
optimizare.

18229
14:20:34,000 --> 14:20:39,200
Deci astea nu se învață din asta.

18230
14:20:36,880 --> 14:20:42,400
Sunt de fapt setate din timp. Şi

18231
14:20:39,200 --> 14:20:44,480
deci ceea ce spunem este cel mai bun mod de a

18232
14:20:42,400 --> 14:20:46,320
înțelege efectele acestor este să

18233
14:20:44,480 --> 14:20:49,200
încercați diferite combinații ale acestora

18234
14:20:46,320 --> 14:20:51,756
până când ajungem pe cel mai bun. Corect? Deci

18235
14:20:49,200 --> 14:20:54,240
hiperparametrii sunt acele opțiuni noi

18236
14:20:51,756 --> 14:20:57,840
au în model ca alfa ca

18237
14:20:54,240 --> 14:21:01,756
raportul alfa și l1 în elasticul uh

18238
14:20:57,840 --> 14:21:03,436
net. Multe modele au hiperparametri.

18239
14:21:01,756 --> 14:21:05,596
De fapt, o să vedem asta în

18240
14:21:03,436 --> 14:21:07,276
în modelele viitoare pe care le studiem. ei

18241
14:21:05,596 --> 14:21:09,596
aveți opțiuni pe care le puteți seta

18242
14:21:07,276 --> 14:21:11,916
afectează performanța acestora.

18243
14:21:09,596 --> 14:21:13,756
Și, deci, aceasta este doar o strategie

18244
14:21:11,916 --> 14:21:17,480
evalua acele opțiuni diferite pentru a vedea

18245
14:21:13,756 --> 14:21:17,480
care este cel mai bun.

18246
14:21:25,596 --> 14:21:32,560
Da. Deci din nou, hiperparametrii, aceia

18247
14:21:28,160 --> 14:21:36,400
sunt setări pe modelul în sine, asta

18248
14:21:32,560 --> 14:21:36,400
afectează performanța acestuia.

18249
14:21:36,560 --> 14:21:40,320
Și, practic, le avem pe cele două

18250
14:21:38,240 --> 14:21:41,840
strategii aici. Putem configura un

18251
14:21:40,320 --> 14:21:44,640
grilă exhaustivă și căutați prin toate

18252
14:21:41,840 --> 14:21:48,480
dintre acestea până când găsim cel mai mic MSE uh

18253
14:21:44,640 --> 14:21:50,320
opțiune sau putem eșantiona aleatoriu

18254
14:21:48,480 --> 14:21:52,320
posibile opțiuni, încercați-le și vedeți

18255
14:21:50,320 --> 14:21:56,956
care este și cel mai jos. Și fă

18256
14:21:52,320 --> 14:21:58,640
că un număr fix de ori. Hm

18257
14:21:56,956 --> 14:22:02,240
un fel de număr fix de încercări

18258
14:21:58,640 --> 14:22:04,160
aproape. um care are riscul de a nu

18259
14:22:02,240 --> 14:22:06,800
încercând fiecare opțiune dar dar

18260
14:22:04,160 --> 14:22:09,116
sper să încerci suficient cât ai făcut

18261
14:22:06,800 --> 14:22:12,240
ai explorat puțin spațiul și obții

18262
14:22:09,116 --> 14:22:14,080
unele alegeri de calitate acolo, dar nu

18263
14:22:12,240 --> 14:22:15,756
garanții corecte nicio garanție că încercați

18264
14:22:14,080 --> 14:22:19,640
tot ceea ce este o căutare în grilă

18265
14:22:15,756 --> 14:22:19,640
o va face voi încerca totul

18266
14:22:20,956 --> 14:22:28,720
bine acum, din fericire, conform scikitlearn obișnuit

18267
14:22:26,160 --> 14:22:33,436
are pentru ce să gestioneze acest proces

18268
14:22:28,720 --> 14:22:36,320
noi în ceea ce privește căutarea în grilă. Um asa in

18269
14:22:33,436 --> 14:22:37,916
astfel nu va trebui să gestionăm asta

18270
14:22:36,320 --> 14:22:40,160
ne procesăm pe noi înșine. Ne putem baza doar pe

18271
14:22:37,916 --> 14:22:42,880
scikitlearn. Și așa dacă faci

18272
14:22:40,160 --> 14:22:45,680
reglarea hiperparametrului asta se întâmplă

18273
14:22:42,880 --> 14:22:48,080
să provină din modulul de selecție a modelului

18274
14:22:45,680 --> 14:22:50,000
în interiorul sklearn. Deci vom merge

18275
14:22:48,080 --> 14:22:52,560
import de la sklearn modelul

18276
14:22:50,000 --> 14:22:55,520
modul de selecție. Avem grila noastră

18277
14:22:52,560 --> 14:22:57,520
validarea încrucișată a căutării.

18278
14:22:55,520 --> 14:23:00,160
Bine, asta înseamnă CV-ul.

18279
14:22:57,520 --> 14:23:01,276
validarea încrucișată a căutării în grilă. Deci, asta

18280
14:23:00,160 --> 14:23:03,756
va face acea căutare în grilă

18281
14:23:01,276 --> 14:23:06,320
strategie. Um, o să o punem la punct

18282
14:23:03,756 --> 14:23:08,000
cu dicționarul nostru în esență de

18283
14:23:06,320 --> 14:23:09,436
alegeri. Deci, vom spune, hei,

18284
14:23:08,000 --> 14:23:12,240
iată alfa pe care vreau să le încerc. Iată

18285
14:23:09,436 --> 14:23:15,596
rapoartele L1 pe care vreau să le încerc. Hm, și

18286
14:23:12,240 --> 14:23:17,596
iată celelalte setări ale mele, cum ar fi uh cum

18287
14:23:15,596 --> 14:23:19,200
multe pliuri pe care vreau să le folosesc, ceea ce la întâmplare

18288
14:23:17,596 --> 14:23:22,400
starea este pentru amestecare. Deci, vom face

18289
14:23:19,200 --> 14:23:24,320
pune la punct toate astea. um,

18290
14:23:22,400 --> 14:23:26,640
și apoi vom rula căutarea în grilă.

18291
14:23:24,320 --> 14:23:29,040
Și atunci ceea ce ar trebui să iasă din asta este

18292
14:23:26,640 --> 14:23:31,436
cele mai bune opțiuni pentru parametrii noștri de la

18293
14:23:29,040 --> 14:23:34,000
grila și apoi le putem folosi pe cele care merg

18294
14:23:31,436 --> 14:23:37,116
înainte în putem construi un model cu

18295
14:23:34,000 --> 14:23:39,840
cele mai bune opțiuni corecte, așa că suntem cu adevărat

18296
14:23:37,116 --> 14:23:41,680
făcând aici o evaluare a ceea ce este

18297
14:23:39,840 --> 14:23:44,880
vor fi cei mai buni alfa cei mai buni

18298
14:23:41,680 --> 14:23:47,116
0 la 1 rapoarte pe setul nostru de date corect și

18299
14:23:44,880 --> 14:23:48,956
singura modalitate de a ști cu adevărat asta este să

18300
14:23:47,116 --> 14:23:51,436
evaluează-le pentru că nu sunt lucruri

18301
14:23:48,956 --> 14:23:53,276
care sunt învățate în timpul antrenamentului

18302
14:23:51,436 --> 14:23:55,520
sper că are sens, ei sunt

18303
14:23:53,276 --> 14:23:57,200
nu lucruri din care învățăm direct

18304
14:23:55,520 --> 14:23:59,436
antrenament. Sunt lucruri pe care le avem

18305
14:23:57,200 --> 14:24:03,160
a seta și apoi a evalua și a vedea

18306
14:23:59,436 --> 14:24:03,160
modul în care acestea afectează lucrurile.

18307
14:24:03,596 --> 14:24:08,956
Bine, deci avem un CV de căutare în grilă. Asta e

18308
14:24:05,680 --> 14:24:10,640
va fi instrumentul nostru principal de făcut

18309
14:24:08,956 --> 14:24:13,116
evaluările diferitelor

18310
14:24:10,640 --> 14:24:15,916
opțiuni de hiperparametru.

18311
14:24:13,116 --> 14:24:19,756
CV-ul de căutare în grilă. Um, ne vom instala

18312
14:24:15,916 --> 14:24:21,276
obiectul nostru de validare încrucișată aici. Acum

18313
14:24:19,756 --> 14:24:24,000
Vreau să fii atent la asta

18314
14:24:21,276 --> 14:24:26,080
că um este puțin diferit

18315
14:24:24,000 --> 14:24:27,916
versiune decât kfold pe care o aveam mai devreme.

18316
14:24:26,080 --> 14:24:29,436
Deci am mai folosit k-fold cu a

18317
14:24:27,916 --> 14:24:32,080
un anumit număr de pliuri. Asta ar fi

18318
14:24:29,436 --> 14:24:34,560
10 ori și putem seta o stare aleatorie

18319
14:24:32,080 --> 14:24:36,080
pentru amestecul um care se întâmplă în

18320
14:24:34,560 --> 14:24:37,520
pliuri.

18321
14:24:36,080 --> 14:24:39,756
Dar aceasta este de fapt un pic diferit

18322
14:24:37,520 --> 14:24:43,596
variație pe ea unde se repetă

18323
14:24:39,756 --> 14:24:46,720
kfold unde facem trei încercări repetate.

18324
14:24:43,596 --> 14:24:49,596
Acum de ce am face asta? Trebuie să fie

18325
14:24:46,720 --> 14:24:51,116
extra extra foarte atent cu

18326
14:24:49,596 --> 14:24:52,956
amestecând.

18327
14:24:51,116 --> 14:24:56,480
Deci asta înseamnă că facem trei

18328
14:24:52,956 --> 14:24:58,160
amestecuri diferite. Deci facem kfold, noi

18329
14:24:56,480 --> 14:24:59,596
repeta de fapt de trei ori cu

18330
14:24:58,160 --> 14:25:03,040
trei amestecuri diferite. Asta-i tot

18331
14:24:59,596 --> 14:25:06,160
asta înseamnă. Deci kfoldul repetat este

18332
14:25:03,040 --> 14:25:09,756
de fapt, puțin dincolo de baza

18333
14:25:06,160 --> 14:25:12,080
kfold. Ce va face kfold de bază va

18334
14:25:09,756 --> 14:25:14,480
vom amesteca și apoi vom face

18335
14:25:12,080 --> 14:25:16,800
se împarte în 10 secțiuni și apoi se antrenează mai departe

18336
14:25:14,480 --> 14:25:19,680
nouă dintre acestea. test pe celălalt şi

18337
14:25:16,800 --> 14:25:21,916
rotiți prin toate despărțirile.

18338
14:25:19,680 --> 14:25:24,080
De fapt, vom face acest proces

18339
14:25:21,916 --> 14:25:26,720
de trei ori diferite cu trei

18340
14:25:24,080 --> 14:25:29,360
amestecuri diferite. Deci asta și noi suntem

18341
14:25:26,720 --> 14:25:33,200
mergând la o medie de 30 de rezultate în loc de

18342
14:25:29,360 --> 14:25:36,160
doar 10. Deci kfold repetat tocmai merge

18343
14:25:33,200 --> 14:25:38,320
mai presus și dincolo de a face plus pentru a repeta

18344
14:25:36,160 --> 14:25:41,200
kfoldul de trei ori diferite. In aceasta

18345
14:25:38,320 --> 14:25:44,880
cazul doar trei. Am putea face mai mult,

18346
14:25:41,200 --> 14:25:47,680
dar acum este necesar de făcut? tu

18347
14:25:44,880 --> 14:25:50,560
ar putea argumenta nu neapărat. Hm, dar asta

18348
14:25:47,680 --> 14:25:53,596
oferă doar un plus de robustețe

18349
14:25:50,560 --> 14:25:55,840
dincolo de simpla noastră amestecare și

18350
14:25:53,596 --> 14:25:57,756
apoi împărțirea și apoi rotirea celor

18351
14:25:55,840 --> 14:26:00,480
pliuri, nu? O facem de fapt

18352
14:25:57,756 --> 14:26:03,116
trei amestecuri diferite. Hm, deci suntem

18353
14:26:00,480 --> 14:26:05,276
repetându-ne kfoldul de trei ori uh pt

18354
14:26:03,116 --> 14:26:07,840
de fiecare dată este lucrul pe care îl facem

18355
14:26:05,276 --> 14:26:09,276
asta pentru fiecare evaluare. Așa este

18356
14:26:07,840 --> 14:26:12,596
va fi mai scump decât doar o

18357
14:26:09,276 --> 14:26:12,596
K-fold de bază.

18358
14:26:25,840 --> 14:26:31,916
Deci avem trei teste diferite de K-fold

18359
14:26:28,560 --> 14:26:33,680
ceea ce facem în esență.

18360
14:26:31,916 --> 14:26:35,436
Bine, sper că are sens. Aceasta

18361
14:26:33,680 --> 14:26:36,560
este pliul K repetat. Nu am făcut-o

18362
14:26:35,436 --> 14:26:38,956
chiar am văzut asta înainte. avem doar

18363
14:26:36,560 --> 14:26:41,756
a lucrat cu Kfold, care ar primi

18364
14:26:38,956 --> 14:26:44,240
scăpa de această opțiune de repetă și doar au

18365
14:26:41,756 --> 14:26:46,080
uh 10 împărțiri într-o stare aleatorie pentru

18366
14:26:44,240 --> 14:26:48,880
pentru singura amestecare pe care o facem. Deci,

18367
14:26:46,080 --> 14:26:51,756
putem recrea aceeași amestecare

18368
14:26:48,880 --> 14:26:54,240
de fiecare dată. Hm, dar acum suntem de fapt

18369
14:26:51,756 --> 14:26:56,956
o să fac trei amestecări aleatorii, uh

18370
14:26:54,240 --> 14:26:58,240
trei încercări diferite. Deci, o singură amestecare

18371
14:26:56,956 --> 14:27:00,480
creează și apoi creează 10

18372
14:26:58,240 --> 14:27:03,840
se împarte, evaluează, apoi mergi înapoi și faci

18373
14:27:00,480 --> 14:27:06,640
încă o amestecare, alte 10 noi împărțiri.

18374
14:27:03,840 --> 14:27:09,756
Deci, un lucru care ar trebui să fie clar este

18375
14:27:06,640 --> 14:27:12,400
că de fiecare dată obținem diferite împărțiri

18376
14:27:09,756 --> 14:27:14,080
pentru că vom amesteca o dată,

18377
14:27:12,400 --> 14:27:16,480
nu? O să amestecăm o dată și

18378
14:27:14,080 --> 14:27:18,320
generează diviziunile noastre

18379
14:27:16,480 --> 14:27:19,840
și apoi vom amesteca din nou,

18380
14:27:18,320 --> 14:27:21,756
generează aceste divizări care urmează să

18381
14:27:19,840 --> 14:27:23,916
fi diferit și apoi amestecă încă unul

18382
14:27:21,756 --> 14:27:26,640
timp pentru trei timpi diferite,

18383
14:27:23,916 --> 14:27:28,400
nu? Și apoi obține aceste împărțiri și

18384
14:27:26,640 --> 14:27:30,956
atunci vom obține 10 metrici aici,

18385
14:27:28,400 --> 14:27:34,160
10 metrici aici, 10 metrici aici și

18386
14:27:30,956 --> 14:27:37,756
apoi media toate acestea împreună.

18387
14:27:34,160 --> 14:27:42,720
Deci, este puțin mai mult decât să urce în plus

18388
14:27:37,756 --> 14:27:44,880
mai presus și dincolo pentru o pliază în K. Bine.

18389
14:27:42,720 --> 14:27:48,720
În regulă. Deci, aici vine distracția

18390
14:27:44,880 --> 14:27:50,720
când faci căutare în grilă. Acum, grila

18391
14:27:48,720 --> 14:27:54,400
este de fapt doar un dicționar. Este o

18392
14:27:50,720 --> 14:27:55,916
Dicționar Python unde declari ce

18393
14:27:54,400 --> 14:27:58,880
parametrii tăi vor fi în interior

18394
14:27:55,916 --> 14:28:02,000
dicționarul și ai configurat o serie de

18395
14:27:58,880 --> 14:28:04,640
valorile pe care le duci sau o listă. Se poate

18396
14:28:02,000 --> 14:28:07,596
fi o listă. Poate fi o gamă

18397
14:28:04,640 --> 14:28:09,916
ci o declarație a ceea ce ești

18398
14:28:07,596 --> 14:28:12,800
mergi să testeze și să evalueze în interiorul

18399
14:28:09,916 --> 14:28:15,756
căutarea dvs. în grilă. Deci grila este

18400
14:28:12,800 --> 14:28:18,000
inițializat ca un dicționar gol.

18401
14:28:15,756 --> 14:28:20,320
Și atunci ceea ce facem este să spunem bine în mine

18402
14:28:18,000 --> 14:28:22,560
grilă Vreau să verific diferite alfa.

18403
14:28:20,320 --> 14:28:26,000
Deci vom adăuga o colecție de

18404
14:28:22,560 --> 14:28:30,320
alfa aici pe care le vom testa.

18405
14:28:26,000 --> 14:28:36,080
Așa că lasă-mă să fac un comentariu acolo. Adăugăm un

18406
14:28:30,320 --> 14:28:40,320
adăugați o serie de alfa pentru a testa. Și asta

18407
14:28:36,080 --> 14:28:43,360
intervalul este un acesta este la fel ca Python

18408
14:28:40,320 --> 14:28:46,800
interval. Hm

18409
14:28:43,360 --> 14:28:49,680
asta este la fel ca o gamă Python um uh

18410
14:28:46,800 --> 14:28:54,000
operator aici unde va fi aceasta

18411
14:28:49,680 --> 14:28:57,680
uh, de fiecare dată, așa că va fi fiecare

18412
14:28:54,000 --> 14:29:03,596
uh valoare între

18413
14:28:57,680 --> 14:29:05,200
zero și unu um uh pași cu un pas

18414
14:29:03,596 --> 14:29:09,520
dimensiune

18415
14:29:05,200 --> 14:29:13,116
de 0,1. Deci, va încerca o grămadă de

18416
14:29:09,520 --> 14:29:14,720
alfe diferite între uh zero și

18417
14:29:13,116 --> 14:29:16,720
0,1

18418
14:29:14,720 --> 14:29:18,880
scuze 0 și un pas cu 0.1. Deci,

18419
14:29:16,720 --> 14:29:22,320
va încerca zero.1

18420
14:29:18,880 --> 14:29:24,240
2.3 punctul 4.5 6 până la

18421
14:29:22,320 --> 14:29:25,840
unul.

18422
14:29:24,240 --> 14:29:27,916
Deci, asta va face. Și este o

18423
14:29:25,840 --> 14:29:31,200
interval numpy. Deci, sunt doar toate acestea

18424
14:29:27,916 --> 14:29:34,000
zecimale între 0 și unu.

18425
14:29:31,200 --> 14:29:36,400
Puteți folosi oricare dintre acestea este valid.

18426
14:29:34,000 --> 14:29:38,640
Da, poți să faci asta

18427
14:29:36,400 --> 14:29:41,840
creați un dicționar sau puteți utiliza

18428
14:29:38,640 --> 14:29:45,276
cuvânt cheie um dict. Puteți folosi oricare dintre ele.

18429
14:29:41,840 --> 14:29:46,880
Oricare funcționează.

18430
14:29:45,276 --> 14:29:49,360
Indiferent ce vrei să folosești.

18431
14:29:46,880 --> 14:29:52,880
Sunt la fel.

18432
14:29:49,360 --> 14:29:56,956
Da. Motivul pentru care oamenii preferă

18433
14:29:52,880 --> 14:29:59,680
dicționarul este pentru că um seturile sunt

18434
14:29:56,956 --> 14:30:01,520
creat cu aceleași bretele.

18435
14:29:59,680 --> 14:30:03,680
Deci, arată clar ce ești

18436
14:30:01,520 --> 14:30:06,080
creând ca dicționar. Dacă utilizați dacă

18437
14:30:03,680 --> 14:30:08,400
folosesti asta, acesta este singurul avantaj

18438
14:30:06,080 --> 14:30:10,640
este pur și simplu evident ceea ce ești

18439
14:30:08,400 --> 14:30:13,840
realizarea. Pentru că tehnic poți

18440
14:30:10,640 --> 14:30:16,840
face un set cu bretele ca

18441
14:30:13,840 --> 14:30:16,840
bine.

18442
14:30:18,956 --> 14:30:24,956
Da,

18443
14:30:21,840 --> 14:30:27,520
fara griji. Bine, deci avem al nostru

18444
14:30:24,956 --> 14:30:29,040
alfa aici. Deci ce vreau să faci

18445
14:30:27,520 --> 14:30:31,916
observația este că vom încerca

18446
14:30:29,040 --> 14:30:33,756
alfa diferite și suntem asta este

18447
14:30:31,916 --> 14:30:36,000
singurul parametru pe care vom încerca

18448
14:30:33,756 --> 14:30:38,400
regresia noastră de creastă. Deci vom merge

18449
14:30:36,000 --> 14:30:41,276
vom încerca Ridge, dar încercați

18450
14:30:38,400 --> 14:30:44,240
alfa diferite în acest interval um

18451
14:30:41,276 --> 14:30:47,360
în căutarea noastră în grilă. Deci căutarea în grilă

18452
14:30:44,240 --> 14:30:48,956
CV-ul preia un model. Ia în nostru

18453
14:30:47,360 --> 14:30:50,640
dicționar grid care este într-adevăr

18454
14:30:48,956 --> 14:30:53,840
critică. Avem nevoie de acel dicționar

18455
14:30:50,640 --> 14:30:56,720
declarăm ce vom încerca.

18456
14:30:53,840 --> 14:30:59,596
um avem nevoie de un punctaj de spus pentru a găsi

18457
14:30:56,720 --> 14:31:02,480
cel mai bun. Acum amintiți-vă că folosește negativul

18458
14:30:59,596 --> 14:31:06,080
pentru a găsi cel mai jos care va fi

18459
14:31:02,480 --> 14:31:09,520
cea mai puțin negativă opțiune.

18460
14:31:06,080 --> 14:31:11,040
Altfel nu s-ar baza doar

18461
14:31:09,520 --> 14:31:14,160
asupra optimizării pe care ar căuta-o

18462
14:31:11,040 --> 14:31:15,840
cea mai mare valoare. Um deci cel mai înalt

18463
14:31:14,160 --> 14:31:19,276
ar fi cel mai aproape de zero în acest sens

18464
14:31:15,840 --> 14:31:21,840
situatie. Hm, deci folosim negativ și

18465
14:31:19,276 --> 14:31:25,596
din nou am putea folosi eroarea pătrată. Este

18466
14:31:21,840 --> 14:31:29,200
folosind absolutul. Am putea folosi um pătrat

18467
14:31:25,596 --> 14:31:31,276
uh, fie unul funcționează.

18468
14:31:29,200 --> 14:31:35,276
Mai tipic ar fi probabil

18469
14:31:31,276 --> 14:31:37,116
eroare pătrată, dar absolut este bine.

18470
14:31:35,276 --> 14:31:40,160
Aici avem kfoldul nostru repetat.

18471
14:31:37,116 --> 14:31:42,800
Așa că transmitem în um nostru cum facem CV-ul.

18472
14:31:40,160 --> 14:31:44,000
Poate fi un obiect kfold. Ea

18473
14:31:42,800 --> 14:31:46,720
poate fi de fapt doar un număr întreg, care

18474
14:31:44,000 --> 14:31:49,840
este să spunem că vreau doar să fac 10 împărțiri sau

18475
14:31:46,720 --> 14:31:51,916
cinci împărțiri um to a face fiecare

18476
14:31:49,840 --> 14:31:53,520
evaluarea. Dar acestea sunt cele goale

18477
14:31:51,916 --> 14:31:57,200
minim de care ai nevoie. Doar cu adevărat

18478
14:31:53,520 --> 14:31:59,116
modelul și grila și CV-ul dvs. Hm ce

18479
14:31:57,200 --> 14:32:01,276
metrica pe care o utilizați pentru a evalua ce este

18480
14:31:59,116 --> 14:32:03,276
va fi cel mai bun. Și apoi acest sfârșit

18481
14:32:01,276 --> 14:32:04,720
locuri de muncă este să paralelizeze. Daca il ai

18482
14:32:03,276 --> 14:32:06,720
setat la minus unu, va fi

18483
14:32:04,720 --> 14:32:09,040
voi încerca toate opțiunile de grilă în

18484
14:32:06,720 --> 14:32:12,640
paralel. Hm, ceea ce este frumos. Merge

18485
14:32:09,040 --> 14:32:17,596
pentru a ajuta la accelerarea căutării generale.

18486
14:32:12,640 --> 14:32:21,596
Bine. Deci, permiteți-mi să notez asta ca n

18487
14:32:17,596 --> 14:32:26,560
locuri de muncă este egal cu minus unu.

18488
14:32:21,596 --> 14:32:28,720
încearcă combo-urile în paralel.

18489
14:32:26,560 --> 14:32:30,640
Deci, în această situație, de fapt nu o facem

18490
14:32:28,720 --> 14:32:32,640
au mai mult de un parametru. Doar noi

18491
14:32:30,640 --> 14:32:34,160
au alfa. Deci suntem cu adevărat doar

18492
14:32:32,640 --> 14:32:36,080
ne va lucra sistematic

18493
14:32:34,160 --> 14:32:39,360
drum prin fiecare alfa și evaluare

18494
14:32:36,080 --> 14:32:41,916
care este cel mai bun drept cu asta.

18495
14:32:39,360 --> 14:32:43,596
Și observați că pentru a utiliza acest lucru

18496
14:32:41,916 --> 14:32:46,956
căutare în grilă, tot ce trebuie să facem este să sunăm

18497
14:32:43,596 --> 14:32:49,520
căutare.potrivire. Deci funcționează cam ca

18498
14:32:46,956 --> 14:32:52,000
orice alt model o face, nu? Este

18499
14:32:49,520 --> 14:32:54,800
căutare grilă.potrivire.

18500
14:32:52,000 --> 14:32:58,560
Și transmitem datele noastre.

18501
14:32:54,800 --> 14:33:00,400
Și noi umm odată ce suntem odată acest tipărit

18502
14:32:58,560 --> 14:33:04,800
după rezultatele, obții rezultate

18503
14:33:00,400 --> 14:33:06,720
obiect um care are cel mai bun punctaj și

18504
14:33:04,800 --> 14:33:08,956
apoi un dicționar cu cele mai bune ale tale

18505
14:33:06,720 --> 14:33:12,400
parametrii. Deci, oricare ar fi cea mai bună grilă a ta

18506
14:33:08,956 --> 14:33:14,720
membru a fost sau membri grilă, um se tipărește

18507
14:33:12,400 --> 14:33:18,320
asta afară și poți Deci, căci din asta,

18508
14:33:14,720 --> 14:33:20,160
putem să luăm cel mai bun alfa al nostru, care

18509
14:33:18,320 --> 14:33:23,160
care să confirmăm la ce se ajunge

18510
14:33:20,160 --> 14:33:23,160
fiind.

18511
14:33:26,560 --> 14:33:32,596
Hopa! Trebuie să importăm kfold repetat.

18512
14:33:37,436 --> 14:33:41,240
Deci o vom importa.

18513
14:33:44,000 --> 14:33:50,756
Oh, nu am făcut-o. Să facem de la

18514
14:33:47,756 --> 14:33:50,756
sklearn.liniar

18515
14:33:52,320 --> 14:33:59,000
model import ridge.

18516
14:33:56,000 --> 14:33:59,000
Bine.

18517
14:34:04,080 --> 14:34:08,800
Bine. Deci, a finalizat căutarea și

18518
14:34:06,800 --> 14:34:12,240
ceea ce am găsit este că acesta este cel mai bun scor

18519
14:34:08,800 --> 14:34:16,560
este 238 pentru eroarea absolută medie și

18520
14:34:12,240 --> 14:34:19,116
cel mai bun alfa pe care l-am primit a fost 0,9. Deci,

18521
14:34:16,560 --> 14:34:21,360
cel mai bun alfa care a funcționat aici, acela

18522
14:34:19,116 --> 14:34:24,640
care ne-a dat cel mai bun punctaj a fost de fapt

18523
14:34:21,360 --> 14:34:27,436
0,9 ca alfa. Deci ceea ce a făcut este

18524
14:34:24,640 --> 14:34:30,320
a încercat totul între acest interval

18525
14:34:27,436 --> 14:34:33,360
iar 0,9 a fost cel mai bun. Deci s-a încrucișat

18526
14:34:30,320 --> 14:34:35,436
validare, a încercat fiecare combo

18527
14:34:33,360 --> 14:34:37,200
în grila noastră.

18528
14:34:35,436 --> 14:34:40,080
Deci, dacă vrem, am putea imprima

18529
14:34:37,200 --> 14:34:43,756
afară

18530
14:34:40,080 --> 14:34:47,800
tipăriți grila noastră ca să putem vedea

18531
14:34:43,756 --> 14:34:47,800
care au fost combinațiile noastre.

18532
14:34:49,200 --> 14:34:56,276
Deci, i-a încercat pe toți acești tipi și

18533
14:34:51,840 --> 14:34:56,276
cel mai bun pe care l-am avut a fost 0,9.

18534
14:35:00,720 --> 14:35:06,080
Bine, foarte frumos cum funcționează. Şi

18535
14:35:03,916 --> 14:35:08,400
dacă am avea alți parametri, ca dacă am avea

18536
14:35:06,080 --> 14:35:10,000
făceam o plasă elastică, am putea adăuga

18537
14:35:08,400 --> 14:35:13,436
acelea în dicționarul nostru și ar fi

18538
14:35:10,000 --> 14:35:16,000
faceți toate combinațiile dintre acestea. Deci dacă noi

18539
14:35:13,436 --> 14:35:18,560
am făcut-o, de exemplu, pentru a adăuga la noi

18540
14:35:16,000 --> 14:35:21,200
grid am putea face grid

18541
14:35:18,560 --> 14:35:22,640
um raportul L1

18542
14:35:21,200 --> 14:35:24,640
asta ar fi ca o plasă elastică

18543
14:35:22,640 --> 14:35:26,560
chiar acum regresia crestei de la sine

18544
14:35:24,640 --> 14:35:29,436
nu are un parametru de raport L1 dar

18545
14:35:26,560 --> 14:35:32,480
doar ca exemplu, am putea încerca

18546
14:35:29,436 --> 14:35:35,840
intervale diferite um interval similar

18547
14:35:32,480 --> 14:35:37,200
diferit, poate o listă exactă

18548
14:35:35,840 --> 14:35:38,560
orice vrem să facem. Deci asta merge

18549
14:35:37,200 --> 14:35:40,240
să încerce altele diferite între 0ero

18550
14:35:38,560 --> 14:35:42,720
la unul

18551
14:35:40,240 --> 14:35:45,436
de asemenea. Și așa va fi încercat

18552
14:35:42,720 --> 14:35:47,116
fiecare combinație a acestora din aceasta

18553
14:35:45,436 --> 14:35:49,680
grila.

18554
14:35:47,116 --> 14:35:52,160
Bine, dacă am făcut asta. Dar din nou, asta

18555
14:35:49,680 --> 14:35:55,756
regresia crestei nu are un L1

18556
14:35:52,160 --> 14:35:58,400
raport. Plasa elastica face. Astfel încât

18557
14:35:55,756 --> 14:36:00,640
regresia crestei are doar un alfa la as

18558
14:35:58,400 --> 14:36:04,040
un hiperparametru. Deci facem doar teste

18559
14:36:00,640 --> 14:36:04,040
afară acela.

18560
14:36:05,596 --> 14:36:11,276
Bine. Deci, acesta este CV-ul de căutare în grilă.

18561
14:36:09,200 --> 14:36:13,040
Destul de util. Acest lucru este destul de util în

18562
14:36:11,276 --> 14:36:15,116
făcând din nou reglajul parametrilor când tu

18563
14:36:13,040 --> 14:36:18,640
doresc să încerce game diferite

18564
14:36:15,116 --> 14:36:21,200
valorile și le puteți evalua pe cele pentru a le vedea

18565
14:36:18,640 --> 14:36:23,916
care este cel mai bun al tău și apoi putem

18566
14:36:21,200 --> 14:36:26,000
folosește cel mai bine în viitor. Deci putem

18567
14:36:23,916 --> 14:36:29,596
de exemplu, asta face acest cod

18568
14:36:26,000 --> 14:36:32,240
dedesubt se află cel mai bun. Um tu

18569
14:36:29,596 --> 14:36:34,880
o poti face in felul acesta sau o poti face um

18570
14:36:32,240 --> 14:36:37,880
alternativa este să faci rezultate.b cel mai bine

18571
14:36:34,880 --> 14:36:37,880
parametrii

18572
14:36:38,560 --> 14:36:42,880
și apoi o poți prinde așa

18573
14:36:41,276 --> 14:36:46,560
alfa.

18574
14:36:42,880 --> 14:36:48,880
În orice caz, puteți obține sau vă place asta

18575
14:36:46,560 --> 14:36:50,956
um și acesta este doar un dicționar,

18576
14:36:48,880 --> 14:36:53,916
nu? Și poți să-ți iei alfa. Deci

18577
14:36:50,956 --> 14:36:56,560
asta este 0,9 um și putem trece de asta

18578
14:36:53,916 --> 14:36:59,276
alfa în regresia crestei și du-te

18579
14:36:56,560 --> 14:37:01,520
înapoi și remontați-l la datele noastre um și

18580
14:36:59,276 --> 14:37:04,160
apoi folosiți acel model în continuare. Deci

18581
14:37:01,520 --> 14:37:06,320
căutarea în grilă doar evaluează

18582
14:37:04,160 --> 14:37:10,640
acele opțiuni diferite, vă spune

18583
14:37:06,320 --> 14:37:12,640
care este cel mai bun după acest scor,

18584
14:37:10,640 --> 14:37:14,160
nu?

18585
14:37:12,640 --> 14:37:16,720
Și ar trebui, apropo, ar trebui

18586
14:37:14,160 --> 14:37:19,116
interpretează acest scor în sens pozitiv

18587
14:37:16,720 --> 14:37:22,160
sens. Este doar negativ pentru că suntem

18588
14:37:19,116 --> 14:37:24,720
făcând intenționat negativ pentru a afla

18589
14:37:22,160 --> 14:37:26,800
care este cea mai mica varianta, nu?

18590
14:37:24,720 --> 14:37:28,720
Pentru că cu cât mai jos este cu atât mai bine. Deci noi

18591
14:37:26,800 --> 14:37:30,640
facem intenționat negativ să o facem

18592
14:37:28,720 --> 14:37:35,520
orice este cel mai puțin negativ este

18593
14:37:30,640 --> 14:37:39,040
învingător. Mai negativ este mai rău.

18594
14:37:35,520 --> 14:37:42,640
Deci este o versiune cu adevărat pozitivă

18595
14:37:39,040 --> 14:37:45,116
acesta este rezultatul adevărat pentru eroare. Hm

18596
14:37:42,640 --> 14:37:47,436
și sunt un instrument de la scikitlearn la

18597
14:37:45,116 --> 14:37:49,200
adunați modelul dvs. cu dvs

18598
14:37:47,436 --> 14:37:52,880
etapele de preprocesare. Deci ei cam

18599
14:37:49,200 --> 14:37:54,560
automatizați-vă împreună. Hm și ei

18600
14:37:52,880 --> 14:37:56,320
combina totul într-un fel de a

18601
14:37:54,560 --> 14:37:58,320
eficientizați procesul. Ai să vezi

18602
14:37:56,320 --> 14:38:02,560
cum arată, dar este cu adevărat

18603
14:37:58,320 --> 14:38:05,116
caracteristică bună a lui scikitlearn. De ce

18604
14:38:02,560 --> 14:38:08,320
ne-ar păsa de conducte? Ei ajută

18605
14:38:05,116 --> 14:38:10,160
organizăm codul nostru, astfel încât să ne asigurăm

18606
14:38:08,320 --> 14:38:12,400
că practic întotdeauna rulăm

18607
14:38:10,160 --> 14:38:15,916
pașii de preprocesare înainte de a ne antrena și

18608
14:38:12,400 --> 14:38:17,916
utilizați un model pentru cu predicțiile. um,

18609
14:38:15,916 --> 14:38:20,640
așa că adună acești pași împreună,

18610
14:38:17,916 --> 14:38:21,916
minimizează riscul de a uita un pas

18611
14:38:20,640 --> 14:38:24,160
pentru că unul dintre lucrurile care pot

18612
14:38:21,916 --> 14:38:25,680
se întâmplă atunci când faci preprocesare, dacă

18613
14:38:24,160 --> 14:38:27,756
o faci pe setul de antrenament, tu

18614
14:38:25,680 --> 14:38:29,276
trebuie să o facă și pe noi date de testare

18615
14:38:27,756 --> 14:38:30,956
când îl pui prin modelul tău

18616
14:38:29,276 --> 14:38:33,596
pentru că modelul tău se antrenează împotriva

18617
14:38:30,956 --> 14:38:35,596
acele date preprocesate.

18618
14:38:33,596 --> 14:38:37,360
Deci pentru a te asigura că niciodată

18619
14:38:35,596 --> 14:38:39,756
uitați asta, le puteți combina pe toate

18620
14:38:37,360 --> 14:38:42,640
împreună într-o conductă care urmează să

18621
14:38:39,756 --> 14:38:44,880
face lucrurile cu adevărat ușor de utilizat

18622
14:38:42,640 --> 14:38:49,276
și și asigurați-vă că acești pași

18623
14:38:44,880 --> 14:38:52,320
se întâmplă într-un mod repetabil. Hm și asta

18624
14:38:49,276 --> 14:38:54,400
face lucrurile mai ușor să implementezi asta

18625
14:38:52,320 --> 14:38:57,520
model la fel pentru că totul este

18626
14:38:54,400 --> 14:39:00,160
împreună într-o singură conductă. Deci în in

18627
14:38:57,520 --> 14:39:03,116
industria, am văzut asta de multe. Hm

18628
14:39:00,160 --> 14:39:05,520
știi, oamenii își vor face inițiala

18629
14:39:03,116 --> 14:39:07,436
etapele de explorare și modelul inițial

18630
14:39:05,520 --> 14:39:10,480
clădire. Ei nu pot folosi conducte

18631
14:39:07,436 --> 14:39:13,116
imediat, dar pe măsură ce le-au găsit

18632
14:39:10,480 --> 14:39:14,720
model, în general îl vor muta

18633
14:39:13,116 --> 14:39:16,956
o conductă și toți pașii lor în a

18634
14:39:14,720 --> 14:39:18,880
conductă, astfel încât să fie mai ușor de lucrat

18635
14:39:16,956 --> 14:39:22,800
cu um când ești când ești

18636
14:39:18,880 --> 14:39:25,840
implementându-l, de fapt folosindu-l în interior

18637
14:39:22,800 --> 14:39:27,360
lumea reală. Um, deci iată ce a

18638
14:39:25,840 --> 14:39:30,320
conducta arată în general ca. Este de la

18639
14:39:27,360 --> 14:39:33,276
scikitlearn. Este acest obiect de conductă.

18640
14:39:30,320 --> 14:39:35,116
Hm, iar conducta este alcătuită din trepte

18641
14:39:33,276 --> 14:39:40,080
că vom vedea că sunt

18642
14:39:35,116 --> 14:39:42,640
diverse um uh practic um feluri de

18643
14:39:40,080 --> 14:39:46,480
preprocesare pe care am mai văzut-o ca o

18644
14:39:42,640 --> 14:39:48,320
scaler sau um completând valorile lipsă.

18645
14:39:46,480 --> 14:39:51,276
Genul ăla de lucruri pe care le putem pune aici

18646
14:39:48,320 --> 14:39:53,040
pașii care este practic o listă. um

18647
14:39:51,276 --> 14:39:54,640
pașii va fi doar o listă de

18648
14:39:53,040 --> 14:39:58,320
funcții scikitlearn pe care le putem aplica

18649
14:39:54,640 --> 14:40:00,080
la date. Unul dintre acestea fiind model. Hm

18650
14:39:58,320 --> 14:40:02,800
și apoi ori de câte ori folosim conducta,

18651
14:40:00,080 --> 14:40:05,680
practic, știi, merge

18652
14:40:02,800 --> 14:40:07,596
a fi ceva de genul pipeline.fit

18653
14:40:05,680 --> 14:40:10,480
sau conductă.predic.

18654
14:40:07,596 --> 14:40:12,956
Deci conducta se comportă ca un

18655
14:40:10,480 --> 14:40:14,640
model. Doar că va conține multe

18656
14:40:12,956 --> 14:40:16,240
mai mulți pași decât atât ca

18657
14:40:14,640 --> 14:40:19,756
pașii de preprocesare cu care am lucrat

18658
14:40:16,240 --> 14:40:21,916
înainte. Hm, și are și câteva

18659
14:40:19,756 --> 14:40:24,080
capabilități de stocare în cache. Deci poți

18660
14:40:21,916 --> 14:40:26,640
cum ar fi stocarea în cache a unor date

18661
14:40:24,080 --> 14:40:29,276
memorie. Um, așa că dacă reutilizați

18662
14:40:26,640 --> 14:40:31,276
previziunile, merg mai repede.

18663
14:40:29,276 --> 14:40:33,200
Hm, deci există câteva opțiuni pentru asta

18664
14:40:31,276 --> 14:40:35,520
prea. Nu sunt prea îngrijorat de asta la

18665
14:40:33,200 --> 14:40:37,596
această etapă, dar principalul este să meargă

18666
14:40:35,520 --> 14:40:40,320
să ne umplem pașii și apoi

18667
14:40:37,596 --> 14:40:42,160
folosind conducta.

18668
14:40:40,320 --> 14:40:45,360
Bine.

18669
14:40:42,160 --> 14:40:46,956
Um, deci câteva fragmente importante din

18670
14:40:45,360 --> 14:40:48,640
informațiile despre conductă sunt că

18671
14:40:46,956 --> 14:40:51,360
va fi o secvență de date

18672
14:40:48,640 --> 14:40:53,916
transformări care vor avea la

18673
14:40:51,360 --> 14:40:55,520
chiar la capătul conductei modelul

18674
14:40:53,916 --> 14:40:58,640
pentru că bineînțeles că o să facem

18675
14:40:55,520 --> 14:41:03,040
transformări și apoi antrenează un model

18676
14:40:58,640 --> 14:41:06,800
sau prezice cu un model. Deci fiecare

18677
14:41:03,040 --> 14:41:08,160
Oh, mă auziți băieți? Bine,

18678
14:41:06,800 --> 14:41:09,596
neputând să mă audă. Mulțumesc că ai permis

18679
14:41:08,160 --> 14:41:12,956
eu stiu. Ați putut băieți

18680
14:41:09,596 --> 14:41:12,956
m-ai auzit pana acum?

18681
14:41:14,956 --> 14:41:20,000
Bine. Asigurați-vă că. Da, poate fi activat

18682
14:41:16,640 --> 14:41:24,240
Internetul tău sau ești. Da, asta

18683
14:41:20,000 --> 14:41:26,640
pare ca e bine. Deci,

18684
14:41:24,240 --> 14:41:28,320
nu, nu mă auzi. Verifică-ți

18685
14:41:26,640 --> 14:41:31,040
volum. Verifică-ți căștile dacă ești

18686
14:41:28,320 --> 14:41:32,880
purtând căști. Oh, fără probleme. bine,

18687
14:41:31,040 --> 14:41:37,200
perfect.

18688
14:41:32,880 --> 14:41:39,040
Bine. Da, problemă de internet local. Da.

18689
14:41:37,200 --> 14:41:40,240
Bine.

18690
14:41:39,040 --> 14:41:43,436
Anunță-mă mereu. anunta-ma mereu

18691
14:41:40,240 --> 14:41:46,640
pentru că ar putea fi cazul că sunt eu.

18692
14:41:43,436 --> 14:41:49,596
Deci, um, întotdeauna asigură-te că mă lași

18693
14:41:46,640 --> 14:41:52,800
stiu. Hm, dar se pare că da, poți

18694
14:41:49,596 --> 14:41:55,360
vreau să verific asta. Hm

18695
14:41:52,800 --> 14:41:57,840
deci, bine. Ceea ce spuneam este fiecare

18696
14:41:55,360 --> 14:41:59,680
conducta va avea o secvență

18697
14:41:57,840 --> 14:42:02,480
de pași care merg mai întâi și apoi cele

18698
14:41:59,680 --> 14:42:05,276
model la final. Hăi, ordinul

18699
14:42:02,480 --> 14:42:08,080
chiar contează. Hm

18700
14:42:05,276 --> 14:42:09,680
Deci ordinea contează în acest sens

18701
14:42:08,080 --> 14:42:12,000
că vrem ca transformările noastre să meargă

18702
14:42:09,680 --> 14:42:13,756
mai întâi. Lucruri precum scalarea, lucruri de genul

18703
14:42:12,000 --> 14:42:17,756
completând valorile lipsă, le vrem

18704
14:42:13,756 --> 14:42:19,756
să fim primii și apoi ne dorim

18705
14:42:17,756 --> 14:42:21,756
modelul să fie ultimul pentru că noi le vrem

18706
14:42:19,756 --> 14:42:24,800
transformări care să aibă loc înainte de

18707
14:42:21,756 --> 14:42:26,160
antrenament sau înainte de predicție. Deci

18708
14:42:24,800 --> 14:42:28,956
de obicei, ceea ce veți vedea în acestea

18709
14:42:26,160 --> 14:42:31,436
conductele este un model la sfârșit, nu?

18710
14:42:28,956 --> 14:42:34,400
un model care va fi la sfârșitul

18711
14:42:31,436 --> 14:42:36,400
conducta pentru că dorim practic

18712
14:42:34,400 --> 14:42:38,160
etapele noastre de procesare apoi formarea noastră

18713
14:42:36,400 --> 14:42:42,160
sau etapele noastre de procesare apoi ale noastre

18714
14:42:38,160 --> 14:42:43,520
previziuni. Hm, deci totul în

18715
14:42:42,160 --> 14:42:46,320
conducta totuși va fi de la

18716
14:42:43,520 --> 14:42:48,000
scikitlearn. Uh, așa se ajunge

18717
14:42:46,320 --> 14:42:49,360
automatizate în sensul că toate acestea

18718
14:42:48,000 --> 14:42:51,360
lucrurile vor fi potrivite şi

18719
14:42:49,360 --> 14:42:54,720
transforma funcțiile încorporate în ele astfel

18720
14:42:51,360 --> 14:42:56,880
conducta le poate folosi. Uh, și apoi

18721
14:42:54,720 --> 14:42:59,276
ultimul pas va fi un model

18722
14:42:56,880 --> 14:43:00,720
care are o potrivire și o previziune. Deci este

18723
14:42:59,276 --> 14:43:01,756
destul de standard că ultima parte a

18724
14:43:00,720 --> 14:43:05,200
conducta va fi doar a

18725
14:43:01,756 --> 14:43:06,720
model. um,

18726
14:43:05,200 --> 14:43:11,040
uh,

18727
14:43:06,720 --> 14:43:12,240
așa că putem, pe măsură ce facem mai multe modelări,

18728
14:43:11,040 --> 14:43:14,480
ne vom juca cu

18729
14:43:12,240 --> 14:43:15,916
conducte destul de puțin și vedem cum putem

18730
14:43:14,480 --> 14:43:18,640
modificați unii parametri. ca

18731
14:43:15,916 --> 14:43:20,480
dacă vrem să schimbăm parametrul unui model

18732
14:43:18,640 --> 14:43:22,720
um, de fapt, ne putem ajusta pentru a face

18733
14:43:20,480 --> 14:43:26,000
lucruri precum căutarea pe grilă sau încrucișarea

18734
14:43:22,720 --> 14:43:28,160
validare. Deci o să vedem

18735
14:43:26,000 --> 14:43:30,320
câteva exemple de unele conducte dar pt

18736
14:43:28,160 --> 14:43:32,640
acum, mai ales ceea ce vom vedea

18737
14:43:30,320 --> 14:43:35,040
este cum să construiești unul și apoi cum să folosești

18738
14:43:32,640 --> 14:43:37,276
unul. Și apoi, pe măsură ce intrăm în lecție

18739
14:43:35,040 --> 14:43:38,720
patru, vom avea mai multă practică

18740
14:43:37,276 --> 14:43:41,840
conducte pentru că vom începe să folosim

18741
14:43:38,720 --> 14:43:45,116
ei destul de uh pentru a ne construi modelele

18742
14:43:41,840 --> 14:43:47,040
mai degrabă decât să faci pași manuali

18743
14:43:45,116 --> 14:43:49,116
preprocesare manuală

18744
14:43:47,040 --> 14:43:51,596
și apoi construim un model

18745
14:43:49,116 --> 14:43:55,160
de acolo. Vom include doar totul

18746
14:43:51,596 --> 14:43:55,160
împreună într-o conductă.

18747
14:43:55,200 --> 14:43:59,116
Bine, deci exemplul pe care îl vom face

18748
14:43:56,720 --> 14:44:00,560
este cu această locuință cu ocean

18749
14:43:59,116 --> 14:44:05,276
apropierea. Deci ne-am uitat de fapt

18750
14:44:00,560 --> 14:44:07,756
acest set de date înainte. Deci avem uh

18751
14:44:05,276 --> 14:44:09,756
acest set de date de proximitate oceanului care are

18752
14:44:07,756 --> 14:44:11,916
caracteristica ca cât de aproape este de

18753
14:44:09,756 --> 14:44:14,800
oceanul ca golful sau mai puțin decât

18754
14:44:11,916 --> 14:44:16,480
1 oră. Amintiți-vă că am avut asta și a avut

18755
14:44:14,800 --> 14:44:18,480
valoarea medie a casei pentru diferite

18756
14:44:16,480 --> 14:44:20,240
cartiere. Deci mergem la lucru

18757
14:44:18,480 --> 14:44:24,000
cu aia din nou. Lasă-mă să mă asigur că eu

18758
14:44:20,240 --> 14:44:25,436
ai-l încărcat.

18759
14:44:24,000 --> 14:44:29,800
Ar trebui să aveți asta. Ar trebui

18760
14:44:25,436 --> 14:44:29,800
fi în seturile tale de date.

18761
14:44:29,840 --> 14:44:35,320
O să-l încarc aici în caz că

18762
14:44:31,596 --> 14:44:35,320
totusi nu il ai.

18763
14:44:42,560 --> 14:44:46,320
Acesta folosește multi-threading? cred eu

18764
14:44:44,080 --> 14:44:49,276
o face. Da, cred că pentru a o face

18765
14:44:46,320 --> 14:44:51,520
poate face uh um cred că poate face

18766
14:44:49,276 --> 14:44:54,880
procesare în paralel pentru unele dintre

18767
14:44:51,520 --> 14:44:57,680
trepte de conductă. Hm, acum folosește asta

18768
14:44:54,880 --> 14:44:59,840
tot timpul? Nu neapărat pentru că

18769
14:44:57,680 --> 14:45:01,756
unele dintre ele sunt de natură secvenţială unde

18770
14:44:59,840 --> 14:45:03,116
trebuie să faci un pas și apoi faci

18771
14:45:01,756 --> 14:45:04,720
următorul pas și apoi îl faci pe următorul

18772
14:45:03,116 --> 14:45:06,480
pas. Deci nu e ca și cum le poți face

18773
14:45:04,720 --> 14:45:08,480
în paralel.

18774
14:45:06,480 --> 14:45:10,800
În ceea ce privește lucrurile pe care trebuie să le știi

18775
14:45:08,480 --> 14:45:15,116
ieșirea unui pas pentru a calcula

18776
14:45:10,800 --> 14:45:18,480
rezultatul pasului următor. Um asa e

18777
14:45:15,116 --> 14:45:20,240
poate, dar nu se pretează întotdeauna

18778
14:45:18,480 --> 14:45:22,880
bine. Lucru care va folosi

18779
14:45:20,240 --> 14:45:25,596
multi-threading este ca antrenamentul

18780
14:45:22,880 --> 14:45:29,276
procesul ar putea fi paralelizat

18781
14:45:25,596 --> 14:45:34,436
cum pot fi potrivirea pentru unele modele

18782
14:45:29,276 --> 14:45:34,436
poate fi paralelizat nu orice model

18783
14:45:35,596 --> 14:45:40,320
este răspunsul atât de lung sau răspunsul scurt

18784
14:45:38,320 --> 14:45:41,520
este ca depinde

18785
14:45:40,320 --> 14:45:42,640
depinde de ce fel de transformări

18786
14:45:41,520 --> 14:45:44,320
faci si ce fel de model

18787
14:45:42,640 --> 14:45:46,880
utilizați dacă puteți lua cu adevărat

18788
14:45:44,320 --> 14:45:46,880
avantaj de

18789
14:45:50,880 --> 14:45:56,880
Bine. Deci, încărcăm datele noastre aici și luăm

18790
14:45:53,680 --> 14:45:58,480
o privire la asta. Ai, băieți

18791
14:45:56,880 --> 14:46:00,160
acest set de date? Poți să-l încarci

18792
14:45:58,480 --> 14:46:03,720
in? Dacă te urmărești, ești

18793
14:46:00,160 --> 14:46:03,720
reusesti sa il incarci?

18794
14:46:08,560 --> 14:46:11,680
Bine.

18795
14:46:10,160 --> 14:46:13,520
Și din nou, am lucrat cu asta

18796
14:46:11,680 --> 14:46:16,240
date înainte, așa că sperăm că este oarecum

18797
14:46:13,520 --> 14:46:17,916
familiar. Amintiți-vă, fiecare rând reprezintă

18798
14:46:16,240 --> 14:46:20,080
un cartier și are un noi mergem

18799
14:46:17,916 --> 14:46:24,000
pentru a ajunge să încerce să prezică această mediană

18800
14:46:20,080 --> 14:46:26,640
valoarea casei ca variabilă țintă,

18801
14:46:24,000 --> 14:46:28,640
variabila noastră dependentă. Hm și suntem

18802
14:46:26,640 --> 14:46:31,596
va folosi restul acestor caracteristici.

18803
14:46:28,640 --> 14:46:33,680
Amintiți-vă că această funcție este inclusă

18804
14:46:31,596 --> 14:46:35,520
special va trebui să fie unul fierbinte

18805
14:46:33,680 --> 14:46:37,276
codificat,

18806
14:46:35,520 --> 14:46:39,596
nu? Va fi unul codificat la cald

18807
14:46:37,276 --> 14:46:42,320
pentru că în prezent este un şir şi noi

18808
14:46:39,596 --> 14:46:43,916
trebuie să transformi asta într-un număr numeric

18809
14:46:42,320 --> 14:46:46,000
caracteristică care este cea codificată la cald

18810
14:46:43,916 --> 14:46:48,560
caracteristică. Deci va trebui să facem

18811
14:46:46,000 --> 14:46:50,640
asta, dar vom face asta ca parte

18812
14:46:48,560 --> 14:46:52,160
a conductei noastre.

18813
14:46:50,640 --> 14:46:55,040
Bine. Deci vom putea include asta

18814
14:46:52,160 --> 14:46:59,080
în conducta noastră pași uh pentru a face unul

18815
14:46:55,040 --> 14:46:59,080
codificare fierbinte, ceea ce este frumos.

18816
14:46:59,116 --> 14:47:04,160
În regulă. Deci ne vom despărți

18817
14:47:00,956 --> 14:47:08,000
datele noastre sunt așa cum facem în mod normal. Deci suntem

18818
14:47:04,160 --> 14:47:10,000
Vom crea caracteristica noastră, uh datele

18819
14:47:08,000 --> 14:47:12,160
cadru care este totul în afară de asta

18820
14:47:10,000 --> 14:47:14,480
valoarea medie a casei. Așa că mergem înainte și

18821
14:47:12,160 --> 14:47:16,560
aruncați acea coloană și apoi ținta noastră este

18822
14:47:14,480 --> 14:47:20,480
valoarea medie a casei. Deci este doar

18823
14:47:16,560 --> 14:47:23,040
acea coloană de aici. Destul de standard. Hm

18824
14:47:20,480 --> 14:47:27,360
și apoi vom antrena diviziunea de test

18825
14:47:23,040 --> 14:47:30,320
și împărțiți-l în 30%

18826
14:47:27,360 --> 14:47:31,520
uh date de testare. Și din nou arătați la întâmplare

18827
14:47:30,320 --> 14:47:34,480
poți alege orice vrei să fii. că

18828
14:47:31,520 --> 14:47:36,160
afectează doar amestecarea. Um, deci

18829
14:47:34,480 --> 14:47:37,596
orice nu contează cu adevărat ce este

18830
14:47:36,160 --> 14:47:39,680
este. Doar ca atunci când reluați

18831
14:47:37,596 --> 14:47:42,560
asta, obțineți același rezultat în in

18832
14:47:39,680 --> 14:47:47,080
amestecul.

18833
14:47:42,560 --> 14:47:47,080
Bine, deci avem trenul și testul nostru.

18834
14:47:47,360 --> 14:47:52,160
Deci vrei să te asiguri că le conduci.

18835
14:47:50,480 --> 14:47:54,956
Bine, deci ceea ce vom face este

18836
14:47:52,160 --> 14:47:58,640
aruncați o privire la datele noastre

18837
14:47:54,956 --> 14:48:01,040
și vedem dacă avem valori nule. Hm

18838
14:47:58,640 --> 14:48:02,480
dacă vă amintiți aceste date cu adevărat

18839
14:48:01,040 --> 14:48:05,840
avea valori nule. O poți vedea

18840
14:48:02,480 --> 14:48:08,800
aici în acest tip acest tip și exact cum

18841
14:48:05,840 --> 14:48:13,596
multe sunt din aceasta suma. Deci

18842
14:48:08,800 --> 14:48:15,200
avem um 162 nles în aceste date. Uh

18843
14:48:13,596 --> 14:48:17,276
și acestea sunt doar date de antrenament. Deci de

18844
14:48:15,200 --> 14:48:19,840
desigur, știți că datele de testare ar putea avea

18845
14:48:17,276 --> 14:48:21,520
că și acolo. Um deci asta e

18846
14:48:19,840 --> 14:48:23,520
ceva ce vom dori să facem

18847
14:48:21,520 --> 14:48:25,040
sigur că completăm spațiile libere pentru orice date

18848
14:48:23,520 --> 14:48:27,916
set pe care îl folosim indiferent dacă folosim

18849
14:48:25,040 --> 14:48:29,360
set de antrenament sau de testare. Um, parcă am fi

18850
14:48:27,916 --> 14:48:30,560
făcând antrenament, vrem să fim siguri

18851
14:48:29,360 --> 14:48:32,400
care se completează. Dacă o facem

18852
14:48:30,560 --> 14:48:35,916
predicții cu setul de testare, vreau să

18853
14:48:32,400 --> 14:48:41,360
asigură-te că se completează. Hm, deci noi

18854
14:48:35,916 --> 14:48:44,880
ar trebui să facem asta. Hm, acum

18855
14:48:41,360 --> 14:48:49,680
ceea ce vom face este să folosim aceste date

18856
14:48:44,880 --> 14:48:51,520
pentru a ne ajuta să ne antrenăm conducta sau să folosim

18857
14:48:49,680 --> 14:48:53,680
cu conducta noastră. Trebuie să construim

18858
14:48:51,520 --> 14:48:55,840
conducta noastră. Până acum, tocmai ne-am despărțit

18859
14:48:53,680 --> 14:48:57,916
în afară de datele noastre. Nu am făcut nimic

18860
14:48:55,840 --> 14:49:02,160
cu pașii noștri de procesare în modelul nostru

18861
14:48:57,916 --> 14:49:03,596
încă. Hm atât de aproximativ

18862
14:49:02,160 --> 14:49:05,436
acesta ar trebui să fie fluxul nostru

18863
14:49:03,596 --> 14:49:07,436
conductă. Ceea ce ar trebui să se întâmple suntem noi

18864
14:49:05,436 --> 14:49:08,956
ar trebui să facă un anumit tip de caracteristică

18865
14:49:07,436 --> 14:49:12,240
scalare

18866
14:49:08,956 --> 14:49:13,596
um, un tip de caracteristică um

18867
14:49:12,240 --> 14:49:17,436
manipulare. Deci asta ar putea fi

18868
14:49:13,596 --> 14:49:21,756
inginerie, asta ar putea fi

18869
14:49:17,436 --> 14:49:23,840
să faci cea mai caldă codificare. Um asa

18870
14:49:21,756 --> 14:49:26,160
extragerea de noi caracteristici ca una fierbinte

18871
14:49:23,840 --> 14:49:29,520
codificare,

18872
14:49:26,160 --> 14:49:31,200
o codificare fierbinte. O să fim

18873
14:49:29,520 --> 14:49:33,756
făcând asta și, apropo, asta este

18874
14:49:31,200 --> 14:49:36,000
împărțit în aceasta este atunci când folosim nostru

18875
14:49:33,756 --> 14:49:37,596
conductă pentru antrenament.

18876
14:49:36,000 --> 14:49:40,320
O să arate așa unde noi

18877
14:49:37,596 --> 14:49:43,436
facem scalarea noastră, facem o codificare fierbinte,

18878
14:49:40,320 --> 14:49:44,640
um, avem modelul nostru aici. Um, așa că

18879
14:49:43,436 --> 14:49:46,240
ar putea fi o regresie liniară, asta ar putea

18880
14:49:44,640 --> 14:49:48,320
fi un lasso, asta ar putea fi o creastă, ea

18881
14:49:46,240 --> 14:49:50,560
ar putea fi plasă elastică. Indiferent de modelul nostru

18882
14:49:48,320 --> 14:49:53,276
ajunge să folosești va fi ultimul în

18883
14:49:50,560 --> 14:49:55,840
conductă. Și vom rula asta

18884
14:49:53,276 --> 14:49:58,840
conductă. Până la urmă, o să alergăm

18885
14:49:55,840 --> 14:49:58,840
pipeline.fit,

18886
14:50:00,400 --> 14:50:04,956
nu? Vom rula o funcție de potrivire

18887
14:50:02,080 --> 14:50:07,116
și obținem un model potrivit ca rezultat

18888
14:50:04,956 --> 14:50:10,800
a acestei conducte.

18889
14:50:07,116 --> 14:50:14,276
Apoi când îl folosim când îl folosim

18890
14:50:10,800 --> 14:50:14,276
model pentru predicție,

18891
14:50:14,800 --> 14:50:19,756
folosim modelul nostru pentru predicție în acest sens

18892
14:50:16,560 --> 14:50:22,080
partea inferioară. Este aceeași conductă, aceeași

18893
14:50:19,756 --> 14:50:24,400
conducta exactă, dar este modelul acesta

18894
14:50:22,080 --> 14:50:26,956
acum a fost instruit.

18895
14:50:24,400 --> 14:50:28,800
Deci acum avem un model antrenat aici. Deci

18896
14:50:26,956 --> 14:50:30,956
mare lucru despre conductă este

18897
14:50:28,800 --> 14:50:33,276
este la fel, aceasta este aceeași conductă

18898
14:50:30,956 --> 14:50:35,520
pe care le folosim aici. Deci este doar

18899
14:50:33,276 --> 14:50:37,200
mergând la el le va repeta aceleași

18900
14:50:35,520 --> 14:50:39,200
transformări. O să ne facă

18901
14:50:37,200 --> 14:50:41,756
scalare. O să ne facă fierbinte

18902
14:50:39,200 --> 14:50:43,360
codificare. Va folosi modelul nostru

18903
14:50:41,756 --> 14:50:45,916
și va genera predicții

18904
14:50:43,360 --> 14:50:47,756
și generează uh putem, putem face

18905
14:50:45,916 --> 14:50:50,640
previziuni. Putem face evaluarea ca

18906
14:50:47,756 --> 14:50:54,800
într-o validare încrucișată. O putem folosi

18907
14:50:50,640 --> 14:50:57,276
oricum vrem să-l folosim. Dar observă

18908
14:50:54,800 --> 14:50:58,880
că conducta îl face consistent

18909
14:50:57,276 --> 14:51:01,596
între antrenament și test. Noi folosim

18910
14:50:58,880 --> 14:51:04,160
exact aceleasi transformari

18911
14:51:01,596 --> 14:51:05,840
iar modelul este ultimul. Este fie

18912
14:51:04,160 --> 14:51:07,680
fiind instruit sau pentru care este folosit

18913
14:51:05,840 --> 14:51:10,000
predicție, dar este ultima. Al nostru

18914
14:51:07,680 --> 14:51:11,840
transformările sunt inițiale, care sunt

18915
14:51:10,000 --> 14:51:14,800
lucruri precum scalarea noastră, lucruri precum noastre

18916
14:51:11,840 --> 14:51:17,360
o codificare fierbinte, nu? Acelea se întâmplă

18917
14:51:14,800 --> 14:51:19,276
mai întâi. Indiferent ce date punem

18918
14:51:17,360 --> 14:51:20,640
prin acolo, punem datele noastre de antrenament

18919
14:51:19,276 --> 14:51:21,840
prin acolo, am pus datele noastre de testare

18920
14:51:20,640 --> 14:51:25,276
prin acolo, vor trece

18921
14:51:21,840 --> 14:51:28,160
prin aceiași pași,

18922
14:51:25,276 --> 14:51:29,756
nu?

18923
14:51:28,160 --> 14:51:31,040
Deci acesta este designul

18924
14:51:29,756 --> 14:51:36,160
conductă. Asta ar trebui

18925
14:51:31,040 --> 14:51:38,160
face. Deci treaba noastră este să creăm acești pași.

18926
14:51:36,160 --> 14:51:40,480
Așa că trebuie să le creăm relevante

18927
14:51:38,160 --> 14:51:43,200
pași și apoi pune-le împreună în

18928
14:51:40,480 --> 14:51:44,720
această conductă. Bine. Deci asta se va întâmpla

18929
14:51:43,200 --> 14:51:47,040
fie codul pe care îl vom vedea să apară

18930
14:51:44,720 --> 14:51:48,956
vom construi acești pași

18931
14:51:47,040 --> 14:51:51,956
și apoi puneți-le împreună în

18932
14:51:48,956 --> 14:51:51,956
conductă.

18933
14:51:58,480 --> 14:52:02,080
Ai întrebări despre această diagramă? Face

18934
14:52:00,956 --> 14:52:04,000
are sens ceea ce încercăm să facem

18935
14:52:02,080 --> 14:52:06,480
cu conducta asta? Vrem să avem

18936
14:52:04,000 --> 14:52:09,360
pași repetabili în timpul antrenamentului,

18937
14:52:06,480 --> 14:52:12,360
în timpul unui proces de predicție.

18938
14:52:09,360 --> 14:52:12,360
Bine.

18939
14:52:15,680 --> 14:52:18,756
În regulă.

18940
14:52:21,756 --> 14:52:27,436
În regulă. Deci, um, câteva lucruri

18941
14:52:24,560 --> 14:52:29,360
vom avea nevoie este, uh, mai întâi de

18942
14:52:27,436 --> 14:52:30,956
toți, să notăm ce pași suntem

18943
14:52:29,360 --> 14:52:32,560
de fapt o să facă. Vom merge

18944
14:52:30,956 --> 14:52:33,756
trebuie să se ocupe de valorile lipsă. Deci,

18945
14:52:32,560 --> 14:52:36,080
o să completăm vom completa

18946
14:52:33,756 --> 14:52:39,116
nevoie de o pre-procesare pre-procesare

18947
14:52:36,080 --> 14:52:42,000
pas care completează orice valori nule. Noi mereu

18948
14:52:39,116 --> 14:52:44,560
am nevoie de asta, nu? Deci, dacă există nles,

18949
14:52:42,000 --> 14:52:46,480
le vom completa cumva.

18950
14:52:44,560 --> 14:52:50,240
Vom defini cum facem asta în

18951
14:52:46,480 --> 14:52:53,680
suntem în pasul nostru. Hm și trebuie și noi

18952
14:52:50,240 --> 14:52:56,080
o codificare fierbinte și trebuie să scalam

18953
14:52:53,680 --> 14:52:57,756
corect, aceștia sunt pași destul de standard

18954
14:52:56,080 --> 14:52:59,916
cu care ne-am ocupat oricând suntem

18955
14:52:57,756 --> 14:53:02,080
construind aceste modele așa de frumos

18956
14:52:59,916 --> 14:53:04,320
lucrurile standard umple nles one fierbinte

18957
14:53:02,080 --> 14:53:07,276
codifica orice date categorice

18958
14:53:04,320 --> 14:53:10,956
oricât avem și apoi mergem înainte

18959
14:53:07,276 --> 14:53:13,040
și um standardizați care este scalarea

18960
14:53:10,956 --> 14:53:15,840
deci acesta este doar același cuvânt pentru

18961
14:53:13,040 --> 14:53:18,796
scalarea caracteristicilor noastre numerice astfel încât să fim

18962
14:53:15,840 --> 14:53:21,276
mergem la vom defini Windows.

18963
14:53:18,796 --> 14:53:23,040
Um, de aceea vom merge

18964
14:53:21,276 --> 14:53:25,596
înainte și import din preprocesare.

18965
14:53:23,040 --> 14:53:27,436
Vom importa scalatorul nostru. um,

18966
14:53:25,596 --> 14:53:30,720
din nou, am putea folosi minmax scaler aici.

18967
14:53:27,436 --> 14:53:33,116
Vom folosi un scaler standard. um,

18968
14:53:30,720 --> 14:53:37,276
dar am putea folosi minmax. Avem al nostru

18969
14:53:33,116 --> 14:53:41,116
un codificator fierbinte aici. Acum, de obicei când

18970
14:53:37,276 --> 14:53:44,160
facem o codificare fierbinte, folosim pd.get

18971
14:53:41,116 --> 14:53:46,956
manechine. Aceasta face același lucru ca și

18972
14:53:44,160 --> 14:53:48,720
asta, ci pentru că vom fi

18973
14:53:46,956 --> 14:53:52,240
construirea unei conducte, de fapt ne dorim

18974
14:53:48,720 --> 14:53:54,240
versiunea scikitlearn a manechinelor git.

18975
14:53:52,240 --> 14:53:56,796
Deci aceasta este versiunea scikitlearn a

18976
14:53:54,240 --> 14:53:59,596
git dummies aici. Și asta și trebuie să facem

18977
14:53:56,796 --> 14:54:00,956
utilizați acea versiune în conductă pentru că

18978
14:53:59,596 --> 14:54:03,520
totul în conductă trebuie să fie

18979
14:54:00,956 --> 14:54:06,560
un obiect sklearn. Trebuie să fie un

18980
14:54:03,520 --> 14:54:09,680
instrument sau obiect sklearn.

18981
14:54:06,560 --> 14:54:11,200
Deci, în loc să folosești pandis get

18982
14:54:09,680 --> 14:54:15,276
dumimii, folosim un codificator fierbinte

18983
14:54:11,200 --> 14:54:18,240
care face același lucru. Bine. În

18984
14:54:15,276 --> 14:54:24,040
de fapt, doar asta practic doar folosește

18985
14:54:18,240 --> 14:54:24,040
pd.get dummies um sub capotă.

18986
14:54:24,560 --> 14:54:28,560
Bine. Deci folosește asta oricum.

18987
14:54:26,880 --> 14:54:30,320
Este doar un cod care se bazează pe baze

18988
14:54:28,560 --> 14:54:32,480
că.

18989
14:54:30,320 --> 14:54:35,040
Acum, ceea ce este cu adevărat frumos aici este că suntem

18990
14:54:32,480 --> 14:54:36,480
de asemenea, va folosi de la sklearn.impute

18991
14:54:35,040 --> 14:54:40,000
imputa. Vom folosi un simplu

18992
14:54:36,480 --> 14:54:42,080
imper acum ceea ce este acesta este un automat

18993
14:54:40,000 --> 14:54:45,680
modalitate de a completa valorile lipsă. Deci asta

18994
14:54:42,080 --> 14:54:48,956
este un mod elegant de a face practic

18995
14:54:45,680 --> 14:54:52,640
umplerea na pe un cadru de date. Atât de simplu

18996
14:54:48,956 --> 14:54:54,400
imputer um vom face practic

18997
14:54:52,640 --> 14:54:56,560
completați spațiile libere. La ce vom merge

18998
14:54:54,400 --> 14:54:58,720
facem când creăm acest obiect este să-l dăm

18999
14:54:56,560 --> 14:55:00,720
o strategie de completare a spațiilor libere.

19000
14:54:58,720 --> 14:55:02,720
Ar trebui să folosiți media? Ar trebui

19001
14:55:00,720 --> 14:55:04,000
folosiți mediana? Ar trebui să folosești maximul?

19002
14:55:02,720 --> 14:55:06,720
Ar trebui să folosești minul? ar trebui să folosească a

19003
14:55:04,000 --> 14:55:09,840
valoare implicită. O să o spunem

19004
14:55:06,720 --> 14:55:12,000
ce să faci în acest obiect.

19005
14:55:09,840 --> 14:55:14,560
Bine. Deci, vom fi așa că suntem

19006
14:55:12,000 --> 14:55:16,320
vom folosi acest lucru ca instrument automatizat

19007
14:55:14,560 --> 14:55:18,796
pentru completarea valorilor lipsă. Deci,

19008
14:55:16,320 --> 14:55:20,400
asta e chiar frumos. Are așa că asta este

19009
14:55:18,796 --> 14:55:23,520
va fi o parte critică a noastră

19010
14:55:20,400 --> 14:55:26,000
conductează un imputer care se va umple

19011
14:55:23,520 --> 14:55:29,640
în valorile lipsă.

19012
14:55:26,000 --> 14:55:29,640
Deci, avem asta.

19013
14:55:31,596 --> 14:55:36,956
Da. Codificare pentru a reduce codificarea. Exact.

19014
14:55:34,080 --> 14:55:38,400
Avem conducta noastră acum. Deci avem

19015
14:55:36,956 --> 14:55:39,840
conducta noastră. Deci conducta noastră merge

19016
14:55:38,400 --> 14:55:42,880
să țină totul. Deci avem nevoie de

19017
14:55:39,840 --> 14:55:45,756
obiectul conductei um să țină totul

19018
14:55:42,880 --> 14:55:47,680
și asta vine de la sklearn.pipeline.

19019
14:55:45,756 --> 14:55:49,520
Deci totul va merge de fapt

19020
14:55:47,680 --> 14:55:53,916
într-un obiect conductă. Vom merge

19021
14:55:49,520 --> 14:55:56,080
vezi cum arata. Hm și în sfârșit suntem

19022
14:55:53,916 --> 14:55:58,400
mergând la din skarn.compose mergem

19023
14:55:56,080 --> 14:56:01,276
pentru a folosi un transformator de coloană. Motivul

19024
14:55:58,400 --> 14:56:04,160
vom face asta pentru că suntem

19025
14:56:01,276 --> 14:56:06,320
voi specifica pentru unele coloane cum ar fi

19026
14:56:04,160 --> 14:56:07,840
caracteristicile numerice pe care ar trebui să le fim

19027
14:56:06,320 --> 14:56:10,320
scalare

19028
14:56:07,840 --> 14:56:13,200
pentru unele coloane ca categoria categorica

19029
14:56:10,320 --> 14:56:15,756
caracteristici ar trebui să fie o codificare fierbinte.

19030
14:56:13,200 --> 14:56:18,560
Așa că transformatorul de coloană ne va permite

19031
14:56:15,756 --> 14:56:20,640
pentru a mapa diferite transformări la

19032
14:56:18,560 --> 14:56:22,880
diferite secțiuni de coloane care este

19033
14:56:20,640 --> 14:56:25,200
cu adevărat util. Deci asta merge de fapt

19034
14:56:22,880 --> 14:56:27,756
pentru a fi o parte critică a conductei noastre către

19035
14:56:25,200 --> 14:56:30,640
aplicați pentru a ne asigura că aplicăm acest lucru numai pentru

19036
14:56:27,756 --> 14:56:33,916
caracteristici numerice și aplicați numai acest lucru

19037
14:56:30,640 --> 14:56:38,400
la trăsăturile categoriale. Corect? Deci asta

19038
14:56:33,916 --> 14:56:40,796
transformatorul de coloană ne va ajuta să facem

19039
14:56:38,400 --> 14:56:44,160
aplicați preprocesarea anumitor

19040
14:56:40,796 --> 14:56:46,560
coloane. Așa cum este apropierea oceanului

19041
14:56:44,160 --> 14:56:48,480
singurul care chiar are nevoie de asta dar

19042
14:56:46,560 --> 14:56:50,956
orice altă coloană va avea nevoie de asta

19043
14:56:48,480 --> 14:56:52,240
toate caracteristicile numerice.

19044
14:56:50,956 --> 14:56:53,916
Deci, vom folosi această coloană

19045
14:56:52,240 --> 14:56:56,160
transformator. Și din nou, vom merge

19046
14:56:53,916 --> 14:56:57,596
vezi cum arată asta, dar încerc doar

19047
14:56:56,160 --> 14:57:01,000
să vă dați o idee despre motivul pentru care importăm

19048
14:56:57,596 --> 14:57:01,000
toate aceste lucruri.

19049
14:57:03,040 --> 14:57:08,160
Bine. Deci, să le importăm.

19050
14:57:06,560 --> 14:57:10,080
Uh, aici se menționează despre coloană

19051
14:57:08,160 --> 14:57:13,040
transformator. Tocmai am vorbit despre asta. Ea

19052
14:57:10,080 --> 14:57:14,640
ne permite să avem o anumită coloană sau

19053
14:57:13,040 --> 14:57:17,680
grup de coloane ia dreapta

19054
14:57:14,640 --> 14:57:20,796
transformare. Deci din nou, uh, uitându-mă

19055
14:57:17,680 --> 14:57:21,916
înaintea conductei noastre, cea numerică

19056
14:57:20,796 --> 14:57:24,956
caracteristicile sunt cele care vor

19057
14:57:21,916 --> 14:57:26,000
nevoie de scalare, dar categoric

19058
14:57:24,956 --> 14:57:27,680
caracteristicile sunt cele care vor

19059
14:57:26,000 --> 14:57:29,276
nevoie de o codificare fierbinte. Oricum multe

19060
14:57:27,680 --> 14:57:30,640
categorice exista. In acest caz,

19061
14:57:29,276 --> 14:57:33,916
într-adevăr există doar unul, care este acela

19062
14:57:30,640 --> 14:57:36,160
apropierea oceanului. Reveniți la datele noastre.

19063
14:57:33,916 --> 14:57:38,560
Hm, poți vedea chiar asta în informații,

19064
14:57:36,160 --> 14:57:40,560
este doar acela. Hm, și vedem

19065
14:57:38,560 --> 14:57:42,480
asta aici, nu? Doar acest șir

19066
14:57:40,560 --> 14:57:45,116
coloană care ar trebui să fie una codificată la cald.

19067
14:57:42,480 --> 14:57:47,756
Toți acești tipi ar trebui să fie scalați.

19068
14:57:45,116 --> 14:57:49,596
Corect? Toate ar trebui să fie uh uh standard

19069
14:57:47,756 --> 14:57:52,240
scalat.

19070
14:57:49,596 --> 14:57:55,240
Deci, acest lucru ne va permite să le specificăm

19071
14:57:52,240 --> 14:57:55,240
distincții.

19072
14:57:56,560 --> 14:58:02,400
În regulă. Deci, să începem să construim

19073
14:58:01,200 --> 14:58:03,360
conducta noastră. Deci asta va fi

19074
14:58:02,400 --> 14:58:08,320
foarte tare. Vom construi

19075
14:58:03,360 --> 14:58:10,400
conducta. Hai să ne extragem

19076
14:58:08,320 --> 14:58:12,080
datele numerice și datele noastre categoriale.

19077
14:58:10,400 --> 14:58:13,520
Acum, acesta este un mod foarte frumos de a face

19078
14:58:12,080 --> 14:58:14,640
că nu sunt sigur că l-am văzut

19079
14:58:13,520 --> 14:58:18,640
înainte.

19080
14:58:14,640 --> 14:58:21,360
Hm, deci ceea ce face asta este că ne vom lua

19081
14:58:18,640 --> 14:58:26,000
cadrul de date, în special datele noastre de antrenament

19082
14:58:21,360 --> 14:58:28,240
încadrați și selectați datele noastre

19083
14:58:26,000 --> 14:58:31,840
asta face acest dtypes selectat

19084
14:58:28,240 --> 14:58:35,360
selectați date din el, care include

19085
14:58:31,840 --> 14:58:38,480
numai coloanele de tip obiect, deci numai

19086
14:58:35,360 --> 14:58:41,756
tipuri de obiecte. Acum ce este asta?

19087
14:58:38,480 --> 14:58:44,796
Tipul de obiect este șirul, nu? Deci

19088
14:58:41,756 --> 14:58:47,200
aceasta ar trebui să selecteze numai această coloană

19089
14:58:44,796 --> 14:58:50,320
pentru că este în include.

19090
14:58:47,200 --> 14:58:53,596
Aici includem numai tipuri de obiecte

19091
14:58:50,320 --> 14:58:56,160
rezultatul. Și așa ar trebui doar să aibă

19092
14:58:53,596 --> 14:58:59,520
singura noastră coloană categorică care este

19093
14:58:56,160 --> 14:59:03,360
apropierea oceanului. Deci, pisica de locuit este

19094
14:58:59,520 --> 14:59:05,436
Vom avea o referință la uh este

19095
14:59:03,360 --> 14:59:08,160
va fi o listă care are un a

19096
14:59:05,436 --> 14:59:11,276
practic, doar proximitatea noastră cu oceanul

19097
14:59:08,160 --> 14:59:15,276
caracteristică deoarece acest tip de selectare va

19098
14:59:11,276 --> 14:59:16,796
asigurați-vă că alegem doar tipuri de obiecte și

19099
14:59:15,276 --> 14:59:20,160
um

19100
14:59:16,796 --> 14:59:24,640
apuca acele coloane. Deci aceasta este o modalitate de a

19101
14:59:20,160 --> 14:59:28,000
prinde bine trăsăturile noastre categorice

19102
14:59:24,640 --> 14:59:30,560
aici prin includerea tipurilor de obiecte. Acum

19103
14:59:28,000 --> 14:59:32,480
pe reversul, putem exclude obiectul

19104
14:59:30,560 --> 14:59:35,276
tipări și obține orice altceva. Deci asta

19105
14:59:32,480 --> 14:59:38,320
va fi toate celelalte coloane care

19106
14:59:35,276 --> 14:59:41,596
exclude obiectul. Deci asta este

19107
14:59:38,320 --> 14:59:44,880
excluzând acest sens ar trebui să obținem tot

19108
14:59:41,596 --> 14:59:47,756
a caracteristicilor noastre numerice astfel. Deci

19109
14:59:44,880 --> 14:59:51,276
acestea vor fi toate cifrele noastre

19110
14:59:47,756 --> 14:59:54,000
prin excluderea tipului de obiect şi acesta

19111
14:59:51,276 --> 14:59:58,480
va fi numărul nostru de locuințe care este scurt

19112
14:59:54,000 --> 15:00:06,720
pentru numeric. Deci asta exclude

19113
14:59:58,480 --> 15:00:08,880
tipul de obiect uh înseamnă tot numeric

19114
15:00:06,720 --> 15:00:12,480
caracteristici

19115
15:00:08,880 --> 15:00:15,360
corect toate caracteristicile numerice acolo.

19116
15:00:12,480 --> 15:00:18,080
Bine.

19117
15:00:15,360 --> 15:00:19,596
Deci, dacă ar fi să uh, hai să verificăm

19118
15:00:18,080 --> 15:00:23,640
aceasta. Să verificăm asta. Dacă noi

19119
15:00:19,596 --> 15:00:23,640
trebuia să imprime carcasa

19120
15:00:23,756 --> 15:00:30,160
pisică, ăsta ar trebui să fie doar oceanul

19121
15:00:27,040 --> 15:00:32,160
caracteristica de proximitate, care este. Deci, doar

19122
15:00:30,160 --> 15:00:34,480
acela. Dacă ar fi să tipărim

19123
15:00:32,160 --> 15:00:37,116
numărul locuinței, acesta ar trebui să fie tot

19124
15:00:34,480 --> 15:00:39,520
caracteristici numerice, care sunt toate acestea

19125
15:00:37,116 --> 15:00:43,276
baieti. Deci este doar o referire la acestea

19126
15:00:39,520 --> 15:00:45,596
coloane ca să le putem folosi

19127
15:00:43,276 --> 15:00:47,360
mai târziu, când mapam asta

19128
15:00:45,596 --> 15:00:49,916
transform trebuie să meargă la această coloană

19129
15:00:47,360 --> 15:00:52,720
cum ar fi cea la care trebuie să meargă codificarea fierbinte

19130
15:00:49,916 --> 15:00:56,320
această coloană și scalarea trebuie să meargă

19131
15:00:52,720 --> 15:00:58,956
la aceste coloane chiar așa că le avem

19132
15:00:56,320 --> 15:01:03,956
uh, numele acelor coloane deja la noi

19133
15:00:58,956 --> 15:01:03,956
eliminarea. Deci, doar facem asta.

19134
15:01:04,000 --> 15:01:10,840
Și acesta este doar un

19135
15:01:07,276 --> 15:01:10,840
simpla verificare.

19136
15:01:11,680 --> 15:01:15,880
Uh, sunteți capabili să conduceți asta?

19137
15:01:16,956 --> 15:01:23,320
Dacă mă urmărești, lasă-mă să fac o pauză

19138
15:01:18,480 --> 15:01:23,320
acolo. Asigură-te că nu merg prea repede.

19139
15:01:26,480 --> 15:01:31,200
Uh, deci problema cu un anume

19140
15:01:29,436 --> 15:01:34,080
tipul de date ca acesta nu este niciunul dintre acestea

19141
15:01:31,200 --> 15:01:36,796
furnici. De fapt, toate sunt plutitoare. Deci noi

19142
15:01:34,080 --> 15:01:40,520
a plutit. Cred că ar trebui să funcționeze. Dar

19143
15:01:36,796 --> 15:01:40,520
da, asta e ideea.

19144
15:01:41,756 --> 15:01:47,956
Mare. Mă bucur să aud asta chiar acolo

19145
15:01:43,276 --> 15:01:47,956
cu mine. Mare. Mă bucur să aud asta.

19146
15:01:54,080 --> 15:01:59,756
Bine. Deci, avem coloanele alese

19147
15:01:56,080 --> 15:02:02,480
aici, pe care o vom folosi mai târziu.

19148
15:01:59,756 --> 15:02:06,080
Bine.

19149
15:02:02,480 --> 15:02:10,480
În regulă. Deci, hai să mergem înainte și să construim

19150
15:02:06,080 --> 15:02:15,360
parcurgeți pașii noștri pentru fiecare dintre aceste tipuri.

19151
15:02:10,480 --> 15:02:17,040
Deci, pentru caracteristicile noastre numerice, haideți

19152
15:02:15,360 --> 15:02:18,640
construiți etapele noastre de conductă. Deci ce

19153
15:02:17,040 --> 15:02:21,520
vom face este să construim o

19154
15:02:18,640 --> 15:02:25,040
conductă numerică. Și va fi

19155
15:02:21,520 --> 15:02:28,080
o conductă cu o listă

19156
15:02:25,040 --> 15:02:30,880
de tupilele. Și motivul pentru care acestea sunt

19157
15:02:28,080 --> 15:02:33,840
tupilele este pentru că fiecare tupil are o

19158
15:02:30,880 --> 15:02:35,916
nume. Deci, acesta este un nume pe care îl putem

19159
15:02:33,840 --> 15:02:38,240
poate fi orice ne dorim să fie. Deci

19160
15:02:35,916 --> 15:02:39,596
o numim imputer. Am putea suna

19161
15:02:38,240 --> 15:02:41,680
este orice ne dorim. L-am putea numi

19162
15:02:39,596 --> 15:02:45,200
completați spațiile libere. L-am putea numi

19163
15:02:41,680 --> 15:02:46,796
umplere nulă. Spune-i cum vrei.

19164
15:02:45,200 --> 15:02:50,080
Îi spunem imputer pentru că așa este

19165
15:02:46,796 --> 15:02:53,200
acesta este un nume destul de ușor pentru asta. An

19166
15:02:50,080 --> 15:02:55,916
nume exact la ceea ce face. Hm dar

19167
15:02:53,200 --> 15:02:59,040
important este după nume

19168
15:02:55,916 --> 15:03:01,436
dai, pui în scikitlearn

19169
15:02:59,040 --> 15:03:04,720
obiectul pe care îl veți folosi

19170
15:03:01,436 --> 15:03:08,720
operați asupra datelor dvs. Deci, în acest caz,

19171
15:03:04,720 --> 15:03:11,756
folosim un simplu impery

19172
15:03:08,720 --> 15:03:16,000
de mediană. Acum asta e o alegere. Am putea

19173
15:03:11,756 --> 15:03:18,640
utilizați o strategie de medie, max. Hm, noi

19174
15:03:16,000 --> 15:03:22,400
i-ar putea oferi o valoare implicită constantă

19175
15:03:18,640 --> 15:03:24,640
valoare. Dar ceea ce înseamnă asta este că suntem

19176
15:03:22,400 --> 15:03:27,116
vom completa orice spații libere în care găsim

19177
15:03:24,640 --> 15:03:29,276
acele coloane cu valoarea mediană de

19178
15:03:27,116 --> 15:03:31,200
acea coloană. Aceasta este strategia pentru

19179
15:03:29,276 --> 15:03:32,956
calculator. Deci e destul de misto. Aceasta este

19180
15:03:31,200 --> 15:03:37,200
un fel de mod automat de a completa

19181
15:03:32,956 --> 15:03:39,116
spații libere folosind pentru orice coloană folosind-o

19182
15:03:37,200 --> 15:03:40,956
mediană,

19183
15:03:39,116 --> 15:03:43,276
nu? Și așa am putea schimba asta. Noi

19184
15:03:40,956 --> 15:03:46,000
ar putea pune înseamnă aici sau max sau min sau

19185
15:03:43,276 --> 15:03:48,320
orice. Hm

19186
15:03:46,000 --> 15:03:51,596
dar completăm golul pe oricare

19187
15:03:48,320 --> 15:03:53,436
coloana cu mediana ei. Și motivul

19188
15:03:51,596 --> 15:03:55,680
acest lucru funcționează pentru că o vom face

19189
15:03:53,436 --> 15:03:59,276
aplicați această conductă numai la acestea

19190
15:03:55,680 --> 15:04:01,116
caracteristici numerice. Deci e bine.

19191
15:03:59,276 --> 15:04:02,796
Nu o vom aplica la

19192
15:04:01,116 --> 15:04:05,200
caracteristici categoriale. Vom merge

19193
15:04:02,796 --> 15:04:08,160
aplicați-l numai la acelea numerice. Deci

19194
15:04:05,200 --> 15:04:11,116
ar trebui să aibă o valoare mediană, nu? Deci

19195
15:04:08,160 --> 15:04:13,360
că e perfect. Deci mergem

19196
15:04:11,116 --> 15:04:16,796
să ne uităm acum la cum construim

19197
15:04:13,360 --> 15:04:19,360
treptele. Avem o listă cu tupilele.

19198
15:04:16,796 --> 15:04:22,560
Iată un tupol

19199
15:04:19,360 --> 15:04:25,840
care este imputerul cu un simplu imper

19200
15:04:22,560 --> 15:04:27,680
de strategie mediană. Și atunci putem avea

19201
15:04:25,840 --> 15:04:30,320
câte tupile vrem care

19202
15:04:27,680 --> 15:04:34,320
reprezintă etapele de prelucrare. Așa că fiecare lăsare

19203
15:04:30,320 --> 15:04:36,160
scriu asta. Fiecare tupil

19204
15:04:34,320 --> 15:04:38,640
reprezintă

19205
15:04:36,160 --> 15:04:42,560
o preprocesare

19206
15:04:38,640 --> 15:04:46,640
pășiți pe datele noastre.

19207
15:04:42,560 --> 15:04:49,520
Bine, deci avem un pas de calcul numit

19208
15:04:46,640 --> 15:04:51,276
imputer și motivul pentru care are un nume este

19209
15:04:49,520 --> 15:04:53,360
doar ca să-l poți face referire în

19210
15:04:51,276 --> 15:04:56,880
conductă dacă este necesar. Deci tu asa

19211
15:04:53,360 --> 15:04:59,360
are ca un nume de referință um că tu

19212
15:04:56,880 --> 15:05:01,756
da-i. Hm, dar asta este cu atât mai mult

19213
15:04:59,360 --> 15:05:04,400
parte importantă este scikitlearn-ul propriu-zis

19214
15:05:01,756 --> 15:05:06,320
obiectul care face procesarea. Deci

19215
15:05:04,400 --> 15:05:08,160
în acest caz un simplu computer dar

19216
15:05:06,320 --> 15:05:09,840
observați că avem un pas secundar

19217
15:05:08,160 --> 15:05:11,756
care este scalarea noastră. Acum asta face

19218
15:05:09,840 --> 15:05:14,000
sens. Acesta este ceva ce ar trebui să fim

19219
15:05:11,756 --> 15:05:17,276
a face cu trăsăturile noastre este că ar trebui să fim

19220
15:05:14,000 --> 15:05:20,560
scalandu-le. Deci aici spunem bine

19221
15:05:17,276 --> 15:05:23,116
să completăm mai întâi orice spații libere.

19222
15:05:20,560 --> 15:05:26,000
Apropo comanda

19223
15:05:23,116 --> 15:05:30,080
contează.

19224
15:05:26,000 --> 15:05:33,520
Deci, și ceea ce vreau să spun prin asta este

19225
15:05:30,080 --> 15:05:37,596
simplu imputer

19226
15:05:33,520 --> 15:05:40,080
este înaintea scalerului. Acum, asta e

19227
15:05:37,596 --> 15:05:42,240
important pentru că ceea ce înseamnă asta suntem noi

19228
15:05:40,080 --> 15:05:45,040
ar trebui să completeze orice spații libere înainte

19229
15:05:42,240 --> 15:05:47,596
încercăm să scalam.

19230
15:05:45,040 --> 15:05:50,400
Deci, acea ordine contează de fapt. Suntem

19231
15:05:47,596 --> 15:05:52,880
va completa mai întâi spațiile libere în aceasta

19232
15:05:50,400 --> 15:05:58,560
lista. Asta e primul. O să umplem

19233
15:05:52,880 --> 15:06:01,360
în spaţii libere. Apoi vom scala

19234
15:05:58,560 --> 15:06:03,916
chiar atunci scalam ceea ce are sens

19235
15:06:01,360 --> 15:06:05,840
corect, așa că mai întâi completăm spațiile libere

19236
15:06:03,916 --> 15:06:10,360
aplicăm scaler-ul pentru a ne scala

19237
15:06:05,840 --> 15:06:10,360
caracteristici, așa că aceștia sunt cei doi pași ai noștri

19238
15:06:10,796 --> 15:06:17,116
atât de simplu, construim

19239
15:06:14,480 --> 15:06:18,956
cei doi pași ai noștri acum, acesta este doar unul

19240
15:06:17,116 --> 15:06:21,756
piesa de puzzle pe care urmează să o punem

19241
15:06:18,956 --> 15:06:23,840
această conductă împreună cu cea fierbinte

19242
15:06:21,756 --> 15:06:27,436
codificarea care va apărea

19243
15:06:23,840 --> 15:06:30,640
în continuare și construim conducta noastră finală.

19244
15:06:27,436 --> 15:06:32,796
Dar aceasta este o conductă care are două

19245
15:06:30,640 --> 15:06:35,596
pași care vor fi de fapt utilizați cu a

19246
15:06:32,796 --> 15:06:37,520
o conductă mai mare vine acolo unde facem noi

19247
15:06:35,596 --> 15:06:40,080
o codificare fierbinte la categoriile noastre și

19248
15:06:37,520 --> 15:06:44,640
apoi punem un model acolo la final

19249
15:06:40,080 --> 15:06:48,000
pentru a antrena și și a utiliza pentru predicție. Deci

19250
15:06:44,640 --> 15:06:50,796
um conductele pot fi de fapt compuse este

19251
15:06:48,000 --> 15:06:53,276
este ceva de realizat că există asta

19252
15:06:50,796 --> 15:06:54,640
putem avea o conductă care conține a

19253
15:06:53,276 --> 15:06:56,000
câțiva pași. Putem avea o altă conductă

19254
15:06:54,640 --> 15:06:58,240
aici care conține câțiva pași și

19255
15:06:56,000 --> 15:07:00,640
le putem pune de fapt

19256
15:06:58,240 --> 15:07:02,956
împreună într-o conductă finală care are

19257
15:07:00,640 --> 15:07:05,680
ambele conducte au fuzionat

19258
15:07:02,956 --> 15:07:07,596
împreună. Bine. Deci o să vedem

19259
15:07:05,680 --> 15:07:09,680
care apare când ne construim

19260
15:07:07,596 --> 15:07:12,240
cel final. Ultimul nostru, după cum poți

19261
15:07:09,680 --> 15:07:13,916
imagina, trebuie să se ocupe de această cartografiere a

19262
15:07:12,240 --> 15:07:17,116
practic spunând, hai să facem una fierbinte

19263
15:07:13,916 --> 15:07:20,796
codificarea acestor tipi și apoi faceți asta

19264
15:07:17,116 --> 15:07:23,276
conductă aici la aceste numerice

19265
15:07:20,796 --> 15:07:25,276
caracteristici. Asta este conducta noastră finală

19266
15:07:23,276 --> 15:07:28,720
trebuie să se descurce. Și va fi. Suntem

19267
15:07:25,276 --> 15:07:32,320
o să construiască asta.

19268
15:07:28,720 --> 15:07:35,276
Dar lasă-mă să mă opresc aici. Ați fost, băieți

19269
15:07:32,320 --> 15:07:38,400
capabil să ruleze asta? Ești cu mine

19270
15:07:35,276 --> 15:07:40,400
aceasta conducta de aici?

19271
15:07:38,400 --> 15:07:44,160
Are sens? Acei doi pași

19272
15:07:40,400 --> 15:07:47,116
unul completează spațiile libere cu o mediană

19273
15:07:44,160 --> 15:07:50,000
orice coloană. Deci unde este asta

19274
15:07:47,116 --> 15:07:52,320
asta este ceea ce este atât de uimitor despre asta

19275
15:07:50,000 --> 15:07:56,400
aceasta va căuta automat

19276
15:07:52,320 --> 15:07:58,640
pentru nule si daca dai peste a

19277
15:07:56,400 --> 15:08:02,000
coloană cu un nul, va fi folosită

19278
15:07:58,640 --> 15:08:04,240
mediana acelei coloane

19279
15:08:02,000 --> 15:08:07,400
pentru a completa golul, nu? Pentru a completa

19280
15:08:04,240 --> 15:08:07,400
acele nles.

19281
15:08:18,720 --> 15:08:25,436
bine,

19282
15:08:21,040 --> 15:08:27,756
grozav. Mă bucur să aud. Mă bucur să aud.

19283
15:08:25,436 --> 15:08:32,956
Bine.

19284
15:08:27,756 --> 15:08:37,200
În regulă. Deci acum vom pune

19285
15:08:32,956 --> 15:08:40,400
aceasta împreună cu un transformator de coloană

19286
15:08:37,200 --> 15:08:44,080
pentru a spune practic ce pași urmează

19287
15:08:40,400 --> 15:08:47,436
fi mapat pe ce coloane.

19288
15:08:44,080 --> 15:08:49,436
Așa că acum poți vedea ce facem

19289
15:08:47,436 --> 15:08:51,596
aici se folosește transformatorul de coloană

19290
15:08:49,436 --> 15:08:55,520
care va fi o listă de tupili

19291
15:08:51,596 --> 15:08:57,436
din nou. Deci aceasta este o altă listă

19292
15:08:55,520 --> 15:09:01,680
tupilele.

19293
15:08:57,436 --> 15:09:04,000
Dar lucrul important este um

19294
15:09:01,680 --> 15:09:06,880
fiecare tupil

19295
15:09:04,000 --> 15:09:10,160
are un nume

19296
15:09:06,880 --> 15:09:12,240
urmat de deci are un nume uh care

19297
15:09:10,160 --> 15:09:14,000
din nou este generic. Poți spune

19298
15:09:12,240 --> 15:09:15,200
orice vrei tu să fie. Deci aici

19299
15:09:14,000 --> 15:09:16,480
scurtăm acest lucru la

19300
15:09:15,200 --> 15:09:18,956
numerice. Aceasta este prescurtarea pentru

19301
15:09:16,480 --> 15:09:23,200
categoric. Dar lucrul important este

19302
15:09:18,956 --> 15:09:26,200
este urmată de o conductă

19303
15:09:23,200 --> 15:09:26,200
slashstep

19304
15:09:26,320 --> 15:09:34,956
followed by a pipeline slashstep

19305
15:09:29,040 --> 15:09:39,596
um followed by a uh followed by a list

19306
15:09:34,956 --> 15:09:41,916
of columns that it applies to. Deci tu

19307
15:09:39,596 --> 15:09:44,320
pot vedea acest model aici. Ce suntem

19308
15:09:41,916 --> 15:09:46,796
a spune că vom aplica asta

19309
15:09:44,320 --> 15:09:48,880
numerical pipeline we just defined. Deci

19310
15:09:46,796 --> 15:09:51,916
aceasta este salvată într-o conductă numerică

19311
15:09:48,880 --> 15:09:54,720
object here. We're going to apply that

19312
15:09:51,916 --> 15:09:56,796
la acele caracteristici numerice. Deci asta este

19313
15:09:54,720 --> 15:09:59,680
that list

19314
15:09:56,796 --> 15:10:01,756
of numerical features here. Deci asta e

19315
15:09:59,680 --> 15:10:04,160
cum facem maparea. Avem un tupil

19316
15:10:01,756 --> 15:10:06,480
aici care spune bine, aplicați acești pași la

19317
15:10:04,160 --> 15:10:09,276
aceste coloane.

19318
15:10:06,480 --> 15:10:12,080
Alea merg împreună în acel tupil, nu?

19319
15:10:09,276 --> 15:10:15,360
Aplicați acești pași la acest lucru

19320
15:10:12,080 --> 15:10:17,916
coloane. Și apoi aplicați acest pas. Acum

19321
15:10:15,360 --> 15:10:19,436
care este pasul? Acesta este unul fierbinte

19322
15:10:17,916 --> 15:10:24,080
codificator

19323
15:10:19,436 --> 15:10:28,880
care va codifica acelea

19324
15:10:24,080 --> 15:10:31,436
caracteristici și va ignora um

19325
15:10:28,880 --> 15:10:36,080
practic nule pentru moment. Asta e o alegere

19326
15:10:31,436 --> 15:10:39,040
dar va ignora practic

19327
15:10:36,080 --> 15:10:42,880
ignorați nles și sări peste ele

19328
15:10:39,040 --> 15:10:45,116
deocamdată. Acum știm că nu există NLES

19329
15:10:42,880 --> 15:10:48,080
pentru că am făcut deja un is NA de la

19330
15:10:45,116 --> 15:10:49,840
înainte și știm că nu există niciun NLES

19331
15:10:48,080 --> 15:10:52,000
în acea apropiere a oceanului. Deci asta nu este

19332
15:10:49,840 --> 15:10:54,480
va fi o problemă. Dar asta este

19333
15:10:52,000 --> 15:10:57,520
asta ar face.

19334
15:10:54,480 --> 15:11:00,400
Dar avem aici un codificator fierbinte care

19335
15:10:57,520 --> 15:11:03,436
vom aplica la categoria noastră

19336
15:11:00,400 --> 15:11:05,916
caracteristici. Acum, desigur, asta este doar

19337
15:11:03,436 --> 15:11:07,680
caracteristica de apropiere a oceanului dar asta dar

19338
15:11:05,916 --> 15:11:10,400
din nou vezi modelul în tupol

19339
15:11:07,680 --> 15:11:13,680
se aplică această transformare care este cea

19340
15:11:10,400 --> 15:11:15,520
codificarea fierbinte la această coloană aplică acestea

19341
15:11:13,680 --> 15:11:18,880
transformări numerice care este un întreg

19342
15:11:15,520 --> 15:11:22,640
conductă. Deci sunt doi pași într-un

19343
15:11:18,880 --> 15:11:25,360
conductă de um

19344
15:11:22,640 --> 15:11:28,000
uh un imputer și un scaler vor face

19345
15:11:25,360 --> 15:11:29,916
fi aplicat la aceasta

19346
15:11:28,000 --> 15:11:32,000
chiar frumos. Deci acestea vor fi

19347
15:11:29,916 --> 15:11:33,916
toate împreună în acest transformator de coloană

19348
15:11:32,000 --> 15:11:36,000
și acesta este modul nostru de a semnala asta pentru

19349
15:11:33,916 --> 15:11:38,720
aceste caracteristici numerice le folosesc

19350
15:11:36,000 --> 15:11:41,116
trepte. Pentru caracteristicile noastre categorice utilizați

19351
15:11:38,720 --> 15:11:42,880
acest pas și și știi dacă am avut

19352
15:11:41,116 --> 15:11:45,200
mai mult de un pas la care aplicam

19353
15:11:42,880 --> 15:11:47,040
categoric am putea construi o conductă

19354
15:11:45,200 --> 15:11:49,116
pentru categoric și ar și face

19355
15:11:47,040 --> 15:11:52,080
acelasi lucru. Avem mai mult de unul

19356
15:11:49,116 --> 15:11:53,520
pas aici și deci este o bună practică când

19357
15:11:52,080 --> 15:11:55,916
ai mai mult de un pas de făcut

19358
15:11:53,520 --> 15:11:57,200
asta în conductă pentru că avem mai multe

19359
15:11:55,916 --> 15:12:00,000
decât un pas. Vom pune doar asta

19360
15:11:57,200 --> 15:12:03,200
această listă în interiorul conductei și noi

19361
15:12:00,000 --> 15:12:05,520
poate mapa acea conductă la acele caracteristici.

19362
15:12:03,200 --> 15:12:09,360
Aici avem doar un pas. Deci e în regulă

19363
15:12:05,520 --> 15:12:11,596
să pun asta acolo și să aplici asta

19364
15:12:09,360 --> 15:12:14,880
la trăsăturile categoriale. Dar dacă noi

19365
15:12:11,596 --> 15:12:17,520
avea mai mult de un pas, ar fi

19366
15:12:14,880 --> 15:12:18,796
bună practică de a pune asta într-un canal

19367
15:12:17,520 --> 15:12:20,000
ceea ce facem noi aici. Corect? Acest

19368
15:12:18,796 --> 15:12:23,596
conducta este mapată la acestea

19369
15:12:20,000 --> 15:12:26,916
caracteristici. Acest pas i se aplică

19370
15:12:23,596 --> 15:12:26,916
această caracteristică.

19371
15:12:28,000 --> 15:12:33,116
bine,

19372
15:12:30,560 --> 15:12:35,360
ce zici de asta? Sunteți capabili să alergați?

19373
15:12:33,116 --> 15:12:37,360
acela? Are sens ceea ce noi?

19374
15:12:35,360 --> 15:12:38,956
v-ați înființat până acum? Deci, suntem aproape

19375
15:12:37,360 --> 15:12:40,796
acolo. Aproape avem finala noastră

19376
15:12:38,956 --> 15:12:43,276
conductă. Avem preprocesarea noastră

19377
15:12:40,796 --> 15:12:44,796
practic făcut pentru a spune numărul nostru

19378
15:12:43,276 --> 15:12:47,040
caracteristicile ar trebui procesate cu asta

19379
15:12:44,796 --> 15:12:49,276
altă conductă și categoria noastră

19380
15:12:47,040 --> 15:12:50,880
caracteristicile ar trebui să fie unul codificat la cald.

19381
15:12:49,276 --> 15:12:54,796
Ne apropiem. Singurul lucru

19382
15:12:50,880 --> 15:12:56,480
chiar ne lipsește aici este un model.

19383
15:12:54,796 --> 15:12:59,276
Singurul lucru care ne lipsește cu adevărat este

19384
15:12:56,480 --> 15:13:01,840
să avem pregătirea noastră finală pentru model

19385
15:12:59,276 --> 15:13:04,480
pipeline este de a include de fapt un model

19386
15:13:01,840 --> 15:13:06,240
care ar trebui să vină la sfârșit.

19387
15:13:04,480 --> 15:13:09,040
Corect? Așa ar trebui să facem

19388
15:13:06,240 --> 15:13:12,080
mai întâi acești pași

19389
15:13:09,040 --> 15:13:14,000
apoi facem modelare pe care o cunoaștem corect

19390
15:13:12,080 --> 15:13:15,596
noi am făcut asta de multe ori. Noi am

19391
15:13:14,000 --> 15:13:18,756
ne-am făcut preprocesarea și apoi o facem

19392
15:13:15,596 --> 15:13:18,756
modelarea noastră.

19393
15:13:19,916 --> 15:13:23,640
Aveți întrebări despre asta?

19394
15:13:37,200 --> 15:13:41,796
Bine.

19395
15:13:38,796 --> 15:13:41,796
Fantastic.

19396
15:13:42,240 --> 15:13:48,240
În regulă.

19397
15:13:45,200 --> 15:13:51,596
Deci, dacă am vrut să vedem dacă am vrut

19398
15:13:48,240 --> 15:13:53,756
să testăm asta până acum, am putea. Deci noi

19399
15:13:51,596 --> 15:13:56,560
ar putea rula preprocesarea și

19400
15:13:53,756 --> 15:13:59,436
executați de fapt o transformare potrivită pe datele noastre

19401
15:13:56,560 --> 15:14:01,040
și asta va aplica practic asta

19402
15:13:59,436 --> 15:14:04,080
conductă către date. Acum asta ar fi

19403
15:14:01,040 --> 15:14:07,756
o verificare a sanităţii mentale. Acesta este un bun, acesta este un

19404
15:14:04,080 --> 15:14:12,560
un fel de bine, asta e o bună minte

19405
15:14:07,756 --> 15:14:15,116
verificați dacă pre-procesarea noastră

19406
15:14:12,560 --> 15:14:17,596
lucrări. Deci face ceea ce ne așteptam

19407
15:14:15,116 --> 15:14:19,596
face. Nu este conducta noastră finală pentru că

19408
15:14:17,596 --> 15:14:21,596
încă nu avem modelul nostru acolo.

19409
15:14:19,596 --> 15:14:23,840
Dar acest lucru este doar pentru a ne asigura că toate

19410
15:14:21,596 --> 15:14:27,680
caracteristicile se comportă ca noi

19411
15:14:23,840 --> 15:14:30,160
aştepta. Deci putem face asta și

19412
15:14:27,680 --> 15:14:32,240
putem arunca o privire la rezultatele um.

19413
15:14:30,160 --> 15:14:35,276
Asta arată destul de bine. Toate acestea ale noastre

19414
15:14:32,240 --> 15:14:37,360
caracteristicile numerice au ajuns la scară

19415
15:14:35,276 --> 15:14:39,040
ceea ce este destul de bine. Și avem unul

19416
15:14:37,360 --> 15:14:42,320
caracteristici codificate la cald pentru acel ocean

19417
15:14:39,040 --> 15:14:44,160
apropiere de aici.

19418
15:14:42,320 --> 15:14:46,956
Bine. Deci asta arata frumos, asta arata

19419
15:14:44,160 --> 15:14:49,200
rezonabil de aplicarea acelor pași

19420
15:14:46,956 --> 15:14:51,520
spre coloanele din dreapta. Dar acesta este un bun

19421
15:14:49,200 --> 15:14:55,436
un fel de verificare a stării de spirit pentru a ne rula potrivirea

19422
15:14:51,520 --> 15:14:57,756
transforma datele noastre pentru a le asigura

19423
15:14:55,436 --> 15:15:00,400
pași se întâmplă de fapt și ei

19424
15:14:57,756 --> 15:15:04,480
sunt. Puteți vedea aici rezultatul

19425
15:15:00,400 --> 15:15:05,916
scalare și uh cea mai caldă codificare.

19426
15:15:04,480 --> 15:15:08,916
Pentru ca totul să arate frumos

19427
15:15:05,916 --> 15:15:08,916
rezonabil,

19428
15:15:09,680 --> 15:15:15,200
nu?

19429
15:15:11,116 --> 15:15:16,880
Și ceea ce ar trebui să facem este să facem

19430
15:15:15,200 --> 15:15:18,560
sigur că nu există nule în aceasta care

19431
15:15:16,880 --> 15:15:22,956
nu ar trebui să existe pentru că am făcut

19432
15:15:18,560 --> 15:15:25,680
imper. Deci ar trebui să facem uh, nu

19433
15:15:22,956 --> 15:15:28,680
punct

19434
15:15:25,680 --> 15:15:28,680
suma

19435
15:15:29,200 --> 15:15:33,756
si nu mai exista nuluri. Așa că

19436
15:15:31,756 --> 15:15:37,116
arata destul de bine nu? Aceia au primit

19437
15:15:33,756 --> 15:15:39,840
completat uh făcându-ne pașii. noastre

19438
15:15:37,116 --> 15:15:44,320
pașii conductei executați foarte frumos

19439
15:15:39,840 --> 15:15:45,916
datele noastre de antrenament și am plecat

19440
15:15:44,320 --> 15:15:47,200
și alergând. Și nu este nimic unic

19441
15:15:45,916 --> 15:15:50,400
despre datele de antrenament. Am putea face

19442
15:15:47,200 --> 15:15:52,480
asta și la datele noastre de testare

19443
15:15:50,400 --> 15:15:54,160
și verificați dacă acești pași rulează

19444
15:15:52,480 --> 15:15:55,756
și ar face-o, nu? Nu e nimic

19445
15:15:54,160 --> 15:15:59,040
într-adevăr atât de special despre rularea lui

19446
15:15:55,756 --> 15:16:00,796
datele de antrenament. Ar trebui, de asemenea

19447
15:15:59,040 --> 15:16:05,520
lucrează și la funcțiile de testare și el

19448
15:16:00,796 --> 15:16:08,520
face. Puteți verifica asta pentru dvs.

19449
15:16:05,520 --> 15:16:08,520
Bine.

19450
15:16:10,640 --> 15:16:16,436
În regulă. Deci, e destul de misto. Noi

19451
15:16:12,080 --> 15:16:16,436
pot verifica tot ce funcționează.

19452
15:16:21,040 --> 15:16:25,840
Aveți întrebări despre asta?

19453
15:16:24,400 --> 15:16:28,796
Aproape am ajuns cu plinul nostru

19454
15:16:25,840 --> 15:16:30,080
conductă. Acesta este acesta nu este

19455
15:16:28,796 --> 15:16:32,796
conductă completă, dar asta este ceva

19456
15:16:30,080 --> 15:16:34,240
care va rula pe durata întregii conducte.

19457
15:16:32,796 --> 15:16:36,320
Desigur, caracteristicile noastre vor fi

19458
15:16:34,240 --> 15:16:38,880
transformată conform acelor paşi şi

19459
15:16:36,320 --> 15:16:42,560
atunci va fi introdus în modelul nostru

19460
15:16:38,880 --> 15:16:44,240
fie prezice, fie antrenează cu. Hm

19461
15:16:42,560 --> 15:16:48,880
deci hai sa facem asta. Să construim de fapt

19462
15:16:44,240 --> 15:16:50,320
Descoperă modelul nostru final aici. Deci este

19463
15:16:48,880 --> 15:16:53,840
de fapt va fi foarte ușor de făcut.

19464
15:16:50,320 --> 15:16:56,400
Tot ce trebuie să facem este să punem în noi

19465
15:16:53,840 --> 15:16:59,360
model. Deci aici vom importa

19466
15:16:56,400 --> 15:17:00,956
model de creasta aici. Acum, am putea folosi oricare

19467
15:16:59,360 --> 15:17:03,680
am putea folosi regresia liniară, am putea

19468
15:17:00,956 --> 15:17:07,520
folosiți lasso, am putea folosi plasă elastică. um,

19469
15:17:03,680 --> 15:17:11,116
doar o să folosim Ridge um uh um

19470
15:17:07,520 --> 15:17:15,520
doar pentru a-l testa. Și mergem

19471
15:17:11,116 --> 15:17:18,240
să punem acum o conductă finală. Deci,

19472
15:17:15,520 --> 15:17:21,116
ne vom folosi conducta. Si asa,

19473
15:17:18,240 --> 15:17:23,200
vom crea unul nou aici și

19474
15:17:21,116 --> 15:17:25,360
mapați pre-procesarea noastră la nostru

19475
15:17:23,200 --> 15:17:27,840
preprocesare pe care am construit-o deja.

19476
15:17:25,360 --> 15:17:30,400
Deci acesta este un transformator de coloană care

19477
15:17:27,840 --> 15:17:32,560
are deja toți pașii noștri. Și apoi

19478
15:17:30,400 --> 15:17:34,796
observați ce vine după ce este doar

19479
15:17:32,560 --> 15:17:36,640
model. Acum este destul de simplu,

19480
15:17:34,796 --> 15:17:39,840
dar are sens să vină

19481
15:17:36,640 --> 15:17:41,596
dupa acel model. Hm și bineînțeles asta

19482
15:17:39,840 --> 15:17:44,880
este un nume generic. Am putea să numim

19483
15:17:41,596 --> 15:17:48,240
este orice vrem noi. Um modelul creastă

19484
15:17:44,880 --> 15:17:51,840
este destul de rezonabil pentru că este

19485
15:17:48,240 --> 15:17:55,040
o regresie de creastă. Dar desigur

19486
15:17:51,840 --> 15:17:58,796
am putea schimba asta.

19487
15:17:55,040 --> 15:18:02,000
Bine. Deci asta construiește ultima noastră um

19488
15:17:58,796 --> 15:18:05,596
conductă. Deci acum avem o conductă. Şi

19489
15:18:02,000 --> 15:18:07,276
ceea ce este grozav la asta este acest semnal

19490
15:18:05,596 --> 15:18:09,596
că toți acești pași ar trebui să fie

19491
15:18:07,276 --> 15:18:12,000
finalizat înainte de a face ceva cu

19492
15:18:09,596 --> 15:18:14,560
acest model. Deci toate acele procesări

19493
15:18:12,000 --> 15:18:17,680
pașii vor rula și apoi suntem

19494
15:18:14,560 --> 15:18:19,596
va face ffit sau prezice și asta. Deci

19495
15:18:17,680 --> 15:18:21,840
asta e chiar grozav. Se asigură că toate

19496
15:18:19,596 --> 15:18:24,560
acei pași merg împreună fiecare

19497
15:18:21,840 --> 15:18:26,480
o singură dată sunăm.predic cu asta

19498
15:18:24,560 --> 15:18:30,160
cu acest model. Deci doar o să facem

19499
15:18:26,480 --> 15:18:32,720
utilizați conducta în locul modelului

19500
15:18:30,160 --> 15:18:35,756
pentru a se asigura că toți acești pași sunt

19501
15:18:32,720 --> 15:18:37,596
alergând împreună. Și acesta este asta al nostru

19502
15:18:35,756 --> 15:18:39,680
este un fel de conducta noastră finală pe care noi

19503
15:18:37,596 --> 15:18:42,080
ar folosi uh cu ceva de genul

19504
15:18:39,680 --> 15:18:45,200
ffit sau prezice.

19505
15:18:42,080 --> 15:18:50,560
Deci, permiteți-mi să notez asta. Acum

19506
15:18:45,200 --> 15:18:56,796
putem folosi această conductă finală la fel ca

19507
15:18:50,560 --> 15:19:00,320
un model obișnuit, adică pipeline.fit

19508
15:18:56,796 --> 15:19:01,840
sau conductă.predic.

19509
15:19:00,320 --> 15:19:06,720
Deci l-am putea folosi în ei în oricare

19510
15:19:01,840 --> 15:19:08,400
moda uh să antreneze conducta

19511
15:19:06,720 --> 15:19:10,000
ar fi acest tip și apoi ar folosi

19512
15:19:08,400 --> 15:19:11,360
conducta de a prezice ar fi aceasta. Şi

19513
15:19:10,000 --> 15:19:13,840
ceea ce ar trebui să realizăm este sub

19514
15:19:11,360 --> 15:19:16,320
capota, acești pași parcurg mai întâi și

19515
15:19:13,840 --> 15:19:20,756
apoi îl antrenăm sau rulează acești pași

19516
15:19:16,320 --> 15:19:20,756
mai întâi, apoi îl folosim pentru predicție.

19517
15:19:24,240 --> 15:19:29,040
bine,

19518
15:19:26,160 --> 15:19:32,000
întrebări despre asta. Are sens?

19519
15:19:29,040 --> 15:19:34,480
pe această conductă finală aici? Este doar

19520
15:19:32,000 --> 15:19:36,240
acum este foarte tare pentru că avem

19521
15:19:34,480 --> 15:19:39,116
o conductă

19522
15:19:36,240 --> 15:19:41,040
alcătuit dintr-o conductă într-adevăr,

19523
15:19:39,116 --> 15:19:42,720
nu? o conductă formată dintr-o conductă.

19524
15:19:41,040 --> 15:19:46,400
Dar asta îți permite scikitlearn să faci

19525
15:19:42,720 --> 15:19:49,436
că să compun conducte în acest fel.

19526
15:19:46,400 --> 15:19:52,436
Este destul de normal

19527
15:19:49,436 --> 15:19:52,436
acolo.

19528
15:19:59,756 --> 15:20:03,916
Bine.

19529
15:20:01,360 --> 15:20:06,400
Ceea ce vreau să vă arăt este că putem

19530
15:20:03,916 --> 15:20:08,480
utilizați de fapt această conductă într-o rețea

19531
15:20:06,400 --> 15:20:10,956
caută. Deci este destul de uimitor. Putem

19532
15:20:08,480 --> 15:20:13,756
folosiți această conductă în orice mod pe care îl putem folosi

19533
15:20:10,956 --> 15:20:16,480
un mo ca un model obișnuit. Este doar

19534
15:20:13,756 --> 15:20:18,320
pe care acum pașii noștri de preprocesare au

19535
15:20:16,480 --> 15:20:21,116
cam fost ambalate împreună cu noastre

19536
15:20:18,320 --> 15:20:22,956
model pentru a se asigura că rulează întotdeauna

19537
15:20:21,116 --> 15:20:27,436
oricând facem orice procesare cu aceasta

19538
15:20:22,956 --> 15:20:29,360
model. Hm, de exemplu, putem face a

19539
15:20:27,436 --> 15:20:31,596
căutare în grilă la fel cum am făcut cu a

19540
15:20:29,360 --> 15:20:34,560
obișnuit cu doar un model corect

19541
15:20:31,596 --> 15:20:37,520
doar cu asta. Hm, putem face la fel

19542
15:20:34,560 --> 15:20:40,720
chestia cu toată conducta. Um, deci

19543
15:20:37,520 --> 15:20:44,160
singura captură este pe care vrei să o faci

19544
15:20:40,720 --> 15:20:46,796
sigur că în grila ta numești lucrurile în

19545
15:20:44,160 --> 15:20:49,840
mod adecvat în interiorul tău uh

19546
15:20:46,796 --> 15:20:54,640
cheile din dicționarul dvs. Deci uh pentru

19547
15:20:49,840 --> 15:20:56,320
exemplu, în interiorul rețelei, suntem

19548
15:20:54,640 --> 15:20:59,040
urmând să configureze alfa care ar fi

19549
15:20:56,320 --> 15:21:01,756
folosit cu această regresie de creastă de

19550
15:20:59,040 --> 15:21:04,080
făcând referire la numele său. Deci acesta este modelul

19551
15:21:01,756 --> 15:21:06,160
creasta este acesta este numele modelului

19552
15:21:04,080 --> 15:21:08,560
în interiorul conductei. Deci vrei

19553
15:21:06,160 --> 15:21:11,436
asigurați-vă că asta merge primul.

19554
15:21:08,560 --> 15:21:13,596
Și apoi ceea ce face scikitlearn este asta

19555
15:21:11,436 --> 15:21:17,276
recunoaște parametrii care îi aparțin

19556
15:21:13,596 --> 15:21:22,720
acest model prin utilizarea unui dublu subliniere.

19557
15:21:17,276 --> 15:21:25,680
Deci, așa că aveți subliniere alfa um

19558
15:21:22,720 --> 15:21:27,916
aici. Deci dublu

19559
15:21:25,680 --> 15:21:31,276
subliniază

19560
15:21:27,916 --> 15:21:37,200
semnalează un parametru

19561
15:21:31,276 --> 15:21:39,756
aparținând modelului creasta în în

19562
15:21:37,200 --> 15:21:42,400
conductă.

19563
15:21:39,756 --> 15:21:44,160
Bine, deci avem un model de creastă este doar un

19564
15:21:42,400 --> 15:21:46,560
referință la modelul din conducta noastră.

19565
15:21:44,160 --> 15:21:48,796
Acesta este cel pe care îl vom testa

19566
15:21:46,560 --> 15:21:51,596
aceşti parametri cu. şi

19567
15:21:48,796 --> 15:21:56,480
underscore_pha este doar o modalitate de a spune asta

19568
15:21:51,596 --> 15:21:58,480
alfa aparține acestui model. Bine, asta

19569
15:21:56,480 --> 15:22:02,240
aparține, așa că va fi folosit cu

19570
15:21:58,480 --> 15:22:04,240
acel model în conducta noastră. Hm altfel

19571
15:22:02,240 --> 15:22:06,080
va funcționa exact la fel.

19572
15:22:04,240 --> 15:22:08,640
Doar că trebuie să aliniem această denumire

19573
15:22:06,080 --> 15:22:11,520
convenția de scikitlearn.

19574
15:22:08,640 --> 15:22:14,240
Trebuie doar să faci referire la asta

19575
15:22:11,520 --> 15:22:18,000
indiferent de numele pe care l-ai dat aici și apoi

19576
15:22:14,240 --> 15:22:21,360
parametru de subliniere. Deci raportul L1 alfa

19577
15:22:18,000 --> 15:22:26,400
orice drept ar merge acolo.

19578
15:22:21,360 --> 15:22:29,040
Bine. Deci există un interval de la 0,1 la 2

19579
15:22:26,400 --> 15:22:32,560
uh dimensiunea pasului de 0,1

19580
15:22:29,040 --> 15:22:34,640
um și apoi facem CV-ul nostru de căutare în grilă. Deci

19581
15:22:32,560 --> 15:22:38,080
aceasta este exact aceeași configurație ca și noi

19582
15:22:34,640 --> 15:22:40,720
înainte. Doar că modelul nostru este acum

19583
15:22:38,080 --> 15:22:43,680
conducta. Deci conducta noastră merge

19584
15:22:40,720 --> 15:22:46,080
acolo. Avem grila

19585
15:22:43,680 --> 15:22:48,640
Acolo. avem scorul nostru este același,

19586
15:22:46,080 --> 15:22:51,040
știi, eroare absolută negativă. um,

19587
15:22:48,640 --> 15:22:54,320
folosim validarea încrucișată de cinci ori

19588
15:22:51,040 --> 15:22:55,520
și paralelizăm această căutare. um,

19589
15:22:54,320 --> 15:23:00,320
așa că vom căuta printre acestea

19590
15:22:55,520 --> 15:23:05,116
alfa și practic se potrivesc asta cu noi

19591
15:23:00,320 --> 15:23:07,596
um date și găsiți cele mai bune um găsiți

19592
15:23:05,116 --> 15:23:08,880
cel mai bun alfa.

19593
15:23:07,596 --> 15:23:11,436
Deci, le va încerca pe toate

19594
15:23:08,880 --> 15:23:14,480
combinații și încercați să veniți cu

19595
15:23:11,436 --> 15:23:17,756
cel mai bun alfa.

19596
15:23:14,480 --> 15:23:19,916
Deci, se pare că cel mai bun alfa a fost 0,1 pentru

19597
15:23:17,756 --> 15:23:24,320
creasta.

19598
15:23:19,916 --> 15:23:28,640
Bine. Este cel mai bun. Deci atunci umm dacă noi

19599
15:23:24,320 --> 15:23:31,040
am vrut să putem prezice folosirea

19600
15:23:28,640 --> 15:23:34,240
modelul um care ar fi făcut

19601
15:23:31,040 --> 15:23:38,320
ceva de genul acesta. Hm, și am putea

19602
15:23:34,240 --> 15:23:41,320
de asemenea, întoarce-te și fă ceva ca noi

19603
15:23:38,320 --> 15:23:41,320
putea

19604
15:23:42,880 --> 15:23:50,436
acum folosește acest parametru. Deci am putea face

19605
15:23:47,436 --> 15:23:50,436
model

19606
15:23:50,560 --> 15:23:54,360
um este egal cu creasta

19607
15:23:55,116 --> 15:24:01,276
și apoi am putea pune în alfa.

19608
15:23:58,640 --> 15:24:03,360
Um, alfa sunt rezultatele noastre, cele mai bune

19609
15:24:01,276 --> 15:24:05,756
parametrii și apoi obținem acel model

19610
15:24:03,360 --> 15:24:09,480
creasta alfa. Și apoi doar reconstruim

19611
15:24:05,756 --> 15:24:09,480
conducta noastră

19612
15:24:10,320 --> 15:24:16,956
este egală cu conducta și apoi am introdus

19613
15:24:14,080 --> 15:24:20,240
acest nou model aici. Deci am putea face

19614
15:24:16,956 --> 15:24:24,320
acest. Acest lucru ar fi să se întoarcă înapoi și doar

19615
15:24:20,240 --> 15:24:27,360
punem aici cel mai bun alfa al nostru pentru

19616
15:24:24,320 --> 15:24:28,956
acest model și apoi să ne asigurăm că

19617
15:24:27,360 --> 15:24:30,560
parte a conductei noastre. Deci suntem doar

19618
15:24:28,956 --> 15:24:33,956
suprascriind acea conductă cu cele mai bune

19619
15:24:30,560 --> 15:24:33,956
model acolo

19620
15:24:36,796 --> 15:24:42,520
pentru a obține cel mai bun model în conducta noastră.

19621
15:24:42,956 --> 15:24:46,160
bine,

19622
15:24:44,560 --> 15:24:49,916
deci asta e tot ce face este doar

19623
15:24:46,160 --> 15:24:54,040
inițializarea unui nou um permiteți-mi de fapt eu

19624
15:24:49,916 --> 15:24:54,040
pot pune acest cod aici.

19625
15:24:56,240 --> 15:25:00,400
Acest lucru este de fapt doar obținerea asta este

19626
15:24:58,000 --> 15:25:03,360
tocmai obținem un model cu cel mai bun alfa

19627
15:25:00,400 --> 15:25:05,436
și apoi reinserând asta în nostru

19628
15:25:03,360 --> 15:25:07,756
uh, doar suprascriem finala noastră

19629
15:25:05,436 --> 15:25:10,480
conductă acolo cu cel mai bun model care

19630
15:25:07,756 --> 15:25:13,116
avem.

19631
15:25:10,480 --> 15:25:15,276
Atât de grozav că conducta poate fi folosită

19632
15:25:13,116 --> 15:25:17,360
practic exact ca un model, nu?

19633
15:25:15,276 --> 15:25:20,720
Se întâmplă chiar aici, în grilă

19634
15:25:17,360 --> 15:25:23,840
caută și fiind folosit în întregime ca un

19635
15:25:20,720 --> 15:25:26,240
model de bază. Deci ne potrivim

19636
15:25:23,840 --> 15:25:28,080
și asta ne permite să-l folosim. Noi

19637
15:25:26,240 --> 15:25:30,240
am putea prezice că am putea chiar să facem

19638
15:25:28,080 --> 15:25:33,116
pipeline.predic o dată am putea merge

19639
15:25:30,240 --> 15:25:34,796
înapoi și face conducta finală.fit

19640
15:25:33,116 --> 15:25:40,720
um cu asta și apoi final

19641
15:25:34,796 --> 15:25:40,720
conductă.prevăză cu aceasta și evaluează

19642
15:25:41,116 --> 15:25:45,596
bine,

19643
15:25:43,116 --> 15:25:47,680
atât de grozav că poate fi folosită conducta

19644
15:25:45,596 --> 15:25:50,160
practic exact ca un model

19645
15:25:47,680 --> 15:25:51,520
ar fi orice mod în care am folosi un model.f

19646
15:25:50,160 --> 15:25:54,160
model.pred prezice putem folosi a

19647
15:25:51,520 --> 15:25:56,880
conductă.

19648
15:25:54,160 --> 15:25:59,276
Deci căutarea în grilă este, de exemplu, ceva

19649
15:25:56,880 --> 15:26:00,880
care poate folosi un model acolo. Hm dar

19650
15:25:59,276 --> 15:26:03,116
în loc de doar un model pe care îl asigurăm

19651
15:26:00,880 --> 15:26:04,956
avem pașii noștri de preprocesare

19652
15:26:03,116 --> 15:26:06,880
incluse în acest model

19653
15:26:04,956 --> 15:26:09,880
conductă.

19654
15:26:06,880 --> 15:26:09,880
Oricare

19655
15:26:10,400 --> 15:26:17,400
întrebări pe

19656
15:26:12,796 --> 15:26:17,400
uh acest exemplu de pana acum?

19657
15:26:18,480 --> 15:26:24,596
Ați reușit să o duceți până aici?

19658
15:26:20,560 --> 15:26:24,596
Ați reușit să rulați căutarea în grilă?

19659
15:26:36,080 --> 15:26:39,400
Bine, grozav.

19660
15:26:45,436 --> 15:26:49,840
Bine.

19661
15:26:47,756 --> 15:26:51,200
Bine. Deci, asta este doar

19662
15:26:49,840 --> 15:26:54,560
arătându-ți ce se întâmplă de fapt

19663
15:26:51,200 --> 15:26:56,400
sub capotă e, știi,

19664
15:26:54,560 --> 15:27:00,240
facem niște scalare. Facem

19665
15:26:56,400 --> 15:27:03,756
vreo codificare fierbinte. Hm

19666
15:27:00,240 --> 15:27:06,720
și facem ceva uh facem a

19667
15:27:03,756 --> 15:27:10,240
model aici. Și asta face parte din a noastră

19668
15:27:06,720 --> 15:27:11,840
conductă. Um, și apoi putem folosi

19669
15:27:10,240 --> 15:27:14,320
conductă cum vrem noi. Deci pentru

19670
15:27:11,840 --> 15:27:17,040
de exemplu, știu că nu este aici, dar pentru

19671
15:27:14,320 --> 15:27:20,160
un exemplu, am putea folosi um odată ce o facem

19672
15:27:17,040 --> 15:27:25,276
odată ce avem această conductă finală, um noi

19673
15:27:20,160 --> 15:27:29,116
can poate folosi um final

19674
15:27:25,276 --> 15:27:31,116
conductă pentru a prezice. Deci putem face um

19675
15:27:29,116 --> 15:27:34,720
previziuni

19676
15:27:31,116 --> 15:27:36,480
egal final

19677
15:27:34,720 --> 15:27:38,640
conductă.predic

19678
15:27:36,480 --> 15:27:41,916
și apoi putem transmite datele noastre de testare.

19679
15:27:38,640 --> 15:27:44,956
Acum, ceea ce se întâmplă cu asta este odată ce avem

19680
15:27:41,916 --> 15:27:47,436
a rulat conducta noastră.fit we have a

19681
15:27:44,956 --> 15:27:50,240
conductă antrenată și apoi când alergăm

19682
15:27:47,436 --> 15:27:52,480
această conductă finală. prezice uh aceste date

19683
15:27:50,240 --> 15:27:53,520
va fi transformat.

19684
15:27:52,480 --> 15:27:55,680
O să treacă prin acelea

19685
15:27:53,520 --> 15:27:59,116
pași de transformare și apoi am face

19686
15:27:55,680 --> 15:28:00,796
aplica modelul nostru la el la sfarsit uh to

19687
15:27:59,116 --> 15:28:02,560
să facem acele previziuni și apoi noi

19688
15:28:00,796 --> 15:28:05,840
poate evalua acele previziuni care este

19689
15:28:02,560 --> 15:28:08,840
cam ce facem noi aici

19690
15:28:05,840 --> 15:28:08,840
corect.

19691
15:28:12,480 --> 15:28:15,480
Bine.

19692
15:28:16,320 --> 15:28:22,160
În regulă. Deci, în concluzie, avem

19693
15:28:19,520 --> 15:28:24,720
am trecut prin multe chestii aici. um,

19694
15:28:22,160 --> 15:28:27,916
am trecut prin regresie, am trecut

19695
15:28:24,720 --> 15:28:29,596
efectuat regularizarea pe regresie.

19696
15:28:27,916 --> 15:28:31,596
Deci sperăm că avem o bază bună

19697
15:28:29,596 --> 15:28:33,680
pe regresie. Hm, la ce vom merge

19698
15:28:31,596 --> 15:28:35,596
a face un pic este de fapt a face ceva

19699
15:28:33,680 --> 15:28:36,720
practică suplimentară cu regresie pe a

19700
15:28:35,596 --> 15:28:39,916
noua problema. Vom face o

19701
15:28:36,720 --> 15:28:43,200
problema capstone și faceți ceva suplimentar

19702
15:28:39,916 --> 15:28:47,116
regresie lucra cu asta. Hm, deci vom face

19703
15:28:43,200 --> 15:28:48,560
face asta mai departe. Hm, dar celălalt lucru noi

19704
15:28:47,116 --> 15:28:49,916
învățat este cum să evaluezi

19705
15:28:48,560 --> 15:28:52,160
regresie folosind lucruri precum mediul

19706
15:28:49,916 --> 15:28:55,116
eroare pătrat, RMSSE care este pătrat

19707
15:28:52,160 --> 15:28:58,320
rădăcina asta. Um care este care este

19708
15:28:55,116 --> 15:29:00,160
foarte tare. Deci avem un sentiment de asta

19709
15:28:58,320 --> 15:29:02,796
eroare care este distanța noastră de a noastră

19710
15:29:00,160 --> 15:29:05,520
predicție la valoarea reală. Asta e

19711
15:29:02,796 --> 15:29:08,796
intotdeauna ce astea uh asta e mereu ce

19712
15:29:05,520 --> 15:29:10,560
lucrurile astea merg așa, nu?

19713
15:29:08,796 --> 15:29:13,200
Aceasta înseamnă valoarea de eroare absolută de la

19714
15:29:10,560 --> 15:29:15,520
scikitlearn calculează media

19715
15:29:13,200 --> 15:29:18,160
distanța de la aceste predicții la acestea

19716
15:29:15,520 --> 15:29:20,880
testați etichetele pe care le avem corecte

19717
15:29:18,160 --> 15:29:23,116
valori reale. Hm și asta ne oferă o

19718
15:29:20,880 --> 15:29:24,720
simt în medie cât de departe sunt ai noștri

19719
15:29:23,116 --> 15:29:27,436
previziuni

19720
15:29:24,720 --> 15:29:30,160
um să vedem cât de bun este un model

19721
15:29:27,436 --> 15:29:32,560
au, nu? Și ar trebui să evaluăm

19722
15:29:30,160 --> 15:29:36,480
acea eroare în general

19723
15:29:32,560 --> 15:29:38,880
um, față de amploarea țintelor noastre

19724
15:29:36,480 --> 15:29:43,116
vezi, știi,

19725
15:29:38,880 --> 15:29:45,116
uh cât de departe suntem de obicei.

19726
15:29:43,116 --> 15:29:47,520
Bine. Orice întrebări despre asta

19727
15:29:45,116 --> 15:29:49,756
lectie despre regresie? Orice noi

19728
15:29:47,520 --> 15:29:50,956
acoperit până în acest punct?

19729
15:29:49,756 --> 15:29:54,796
Vom face mai multă practică

19730
15:29:50,956 --> 15:29:56,480
cu următorul. Vom face capstone. Deci

19731
15:29:54,796 --> 15:30:00,040
primim Așa că mai facem ceva

19732
15:29:56,480 --> 15:30:00,040
probleme de regresie.

19733
15:30:07,436 --> 15:30:10,796
Da, este un alt scor prost.

19734
15:30:09,040 --> 15:30:14,640
Este puțin greu de interpretat asta

19735
15:30:10,796 --> 15:30:17,520
deşi pentru că este m ae. Um asa unul

19736
15:30:14,640 --> 15:30:19,840
ceea ce am putea face este să calculăm media

19737
15:30:17,520 --> 15:30:22,640
eroare pătrat și apoi luați pătratul

19738
15:30:19,840 --> 15:30:25,756
root al acestuia pentru a obține RMSSE care este a

19739
15:30:22,640 --> 15:30:28,320
mult mai bine uh metrica de evaluare în

19740
15:30:25,756 --> 15:30:31,200
termenii țintei noastre. Hm ca să putem

19741
15:30:28,320 --> 15:30:34,160
de fapt rula asta. Dacă ne întoarcem aici

19742
15:30:31,200 --> 15:30:37,756
și am putea genera, de exemplu, noi

19743
15:30:34,160 --> 15:30:39,840
ar putea genera MSE care este media

19744
15:30:37,756 --> 15:30:41,360
pătrat

19745
15:30:39,840 --> 15:30:44,880
eroare

19746
15:30:41,360 --> 15:30:49,080
și este aceeași funcție exactă

19747
15:30:44,880 --> 15:30:49,080
de a folosi predicțiile noastre

19748
15:30:49,116 --> 15:30:52,560
um

19749
15:30:50,640 --> 15:30:56,360
și apoi am putea pur și simplu să tipărim asta

19750
15:30:52,560 --> 15:30:56,360
eroare pătrată medie.

19751
15:30:56,400 --> 15:31:03,360
Deci avem eroare pătrată medie și apoi

19752
15:30:58,000 --> 15:31:06,080
ceea ce putem face este să luăm MP-ul.

19753
15:31:03,360 --> 15:31:08,956
Rădăcina pătrată a acesteia.

19754
15:31:06,080 --> 15:31:10,796
Astfel, putem genera RMSSE.

19755
15:31:08,956 --> 15:31:15,040
Deci da, vreau să spun că e destul de rău.

19756
15:31:10,796 --> 15:31:18,480
E destul de rău. Uh, acum hai să facem

19757
15:31:15,040 --> 15:31:20,320
du-te înapoi și uită-te la noi

19758
15:31:18,480 --> 15:31:23,680
uh date totusi. Deci haideți să aruncăm o privire la

19759
15:31:20,320 --> 15:31:25,680
media pentru Y-ul nostru. Amintește-ți una

19760
15:31:23,680 --> 15:31:28,480
lucru pe care ar trebui să-l facem este să luăm o

19761
15:31:25,680 --> 15:31:31,680
uită-te la ce e să aruncăm o privire

19762
15:31:28,480 --> 15:31:34,080
at y test mean

19763
15:31:31,680 --> 15:31:38,320
pentru a obține o valoare medie. Deci media

19764
15:31:34,080 --> 15:31:41,276
valoarea este în anii 200.000. Deci

19765
15:31:38,320 --> 15:31:43,360
asta nu este asta nu este groaznic. Aceasta este

19766
15:31:41,276 --> 15:31:45,520
70.000. Este încă o cantitate decentă de

19767
15:31:43,360 --> 15:31:47,916
eroare. Nu este la fel de rău ca modelele noi

19768
15:31:45,520 --> 15:31:49,436
au înainte totuși, nu? Acesta este un

19769
15:31:47,916 --> 15:31:52,880
medie

19770
15:31:49,436 --> 15:31:56,320
prețul mediu al casei este în

19771
15:31:52,880 --> 15:31:59,436
26.000 și eroarea noastră a trecut

19772
15:31:56,320 --> 15:32:01,360
ca 70.000,

19773
15:31:59,436 --> 15:32:07,360
nu?

19774
15:32:01,360 --> 15:32:10,080
Deci, nu e bine. Hm, dar nu este

19775
15:32:07,360 --> 15:32:12,480
or ca la fel de rău ca nu este ca

19776
15:32:10,080 --> 15:32:14,480
oribil, așa cum am văzut până acum. Corect.

19777
15:32:12,480 --> 15:32:16,560
Acesta este un model puțin mai bun.

19778
15:32:14,480 --> 15:32:19,680
Un pic mai bine. mai aproape de zero

19779
15:32:16,560 --> 15:32:22,480
ar fi mai bine, nu? Hm, dar

19780
15:32:19,680 --> 15:32:26,560
mai mic cu atât mai bine. Dar amintește-ți asta

19781
15:32:22,480 --> 15:32:29,116
este um acestea chiar absolut mediul

19782
15:32:26,560 --> 15:32:33,916
eroarea este din punct de vedere tehnic în unități similare

19783
15:32:29,116 --> 15:32:37,596
ca uh um

19784
15:32:33,916 --> 15:32:39,756
ca țintă. Deci 50.000 60.000 aici

19785
15:32:37,596 --> 15:32:44,160
70.000 este încă o sumă decentă

19786
15:32:39,756 --> 15:32:45,596
eroare în termeni de 200.000.

19787
15:32:44,160 --> 15:32:47,040
Până acum am venit doar cu modele

19788
15:32:45,596 --> 15:32:48,720
și testați acuratețea lor cu disponibile

19789
15:32:47,040 --> 15:32:50,880
date. Nu am folosit un model pentru a face

19790
15:32:48,720 --> 15:32:53,520
previziuni complet noi despre Nu, noi

19791
15:32:50,880 --> 15:32:56,480
nu am facut asta. Numai că știm cum

19792
15:32:53,520 --> 15:32:58,560
a face asta. Așa ar fi să faci

19793
15:32:56,480 --> 15:33:00,400
previziunile asupra datelor noi ar fi exact

19794
15:32:58,560 --> 15:33:03,116
cum le punem la dispoziție

19795
15:33:00,400 --> 15:33:05,520
date pentru că de fapt facem asta toate

19796
15:33:03,116 --> 15:33:07,276
timp. Dacă ne întoarcem la modelul nostru

19797
15:33:05,520 --> 15:33:09,756
clădire,

19798
15:33:07,276 --> 15:33:13,200
um, arată exact așa, nu?

19799
15:33:09,756 --> 15:33:15,916
unde luăm, de exemplu, facem

19800
15:33:13,200 --> 15:33:18,320
predicții tot timpul pe datele de testare

19801
15:33:15,916 --> 15:33:22,640
care nu a fost niciodată implicat în antrenament.

19802
15:33:18,320 --> 15:33:25,840
Deci parcă aceste date imită noi

19803
15:33:22,640 --> 15:33:28,796
date pe care nu le-am mai văzut până acum. Deci dacă

19804
15:33:25,840 --> 15:33:31,596
am avut noi date brute, așa ar fi

19805
15:33:28,796 --> 15:33:33,840
ar fi exact același proces. cel nou

19806
15:33:31,596 --> 15:33:35,200
acum, cu conducta noastră, o face un

19807
15:33:33,840 --> 15:33:36,880
putin mai usor pentru ca cu

19808
15:33:35,200 --> 15:33:39,200
conductă

19809
15:33:36,880 --> 15:33:41,200
um, datele brute vor trece prin acestea

19810
15:33:39,200 --> 15:33:42,720
transformări pe care ar trebui să le corecteze

19811
15:33:41,200 --> 15:33:44,480
datele brute ar trebui pentru că dacă este

19812
15:33:42,720 --> 15:33:46,160
datele lipsă trebuie completate dacă

19813
15:33:44,480 --> 15:33:49,756
are categorice trebuie să fie unul

19814
15:33:46,160 --> 15:33:53,040
codificat la cald, așa că acesta este scopul

19815
15:33:49,756 --> 15:33:56,880
conducta este de fapt să ne asigurăm că

19816
15:33:53,040 --> 15:34:00,240
dacă avem de-a face cu date brute, acelea

19817
15:33:56,880 --> 15:34:05,520
pot avea loc pași pe datele dinaintea acesteia

19818
15:34:00,240 --> 15:34:07,200
intră în model. Corect? Deci noi așa

19819
15:34:05,520 --> 15:34:08,720
acesta este un fel de scop al

19820
15:34:07,200 --> 15:34:11,276
conductă

19821
15:34:08,720 --> 15:34:15,840
este să ne asigurăm că parcurgem acești pași

19822
15:34:11,276 --> 15:34:18,400
înainte de a-l folosi folosind un model cu el.

19823
15:34:15,840 --> 15:34:20,240
Dar, în cele din urmă, așa este

19824
15:34:18,400 --> 15:34:22,560
modelul scikitlearn se va descurca

19825
15:34:20,240 --> 15:34:25,520
prezice chiar dacă este o conductă

19826
15:34:22,560 --> 15:34:27,916
corect, va fi uh, pur și simplu mergem

19827
15:34:25,520 --> 15:34:30,240
înapoi aici va fi um

19828
15:34:27,916 --> 15:34:32,560
prezice că va fi mereu așa

19829
15:34:30,240 --> 15:34:35,560
date noi

19830
15:34:32,560 --> 15:34:35,560
da

19831
15:34:36,796 --> 15:34:41,756
bine

19832
15:34:39,276 --> 15:34:45,436
foarte buna intrebare ce am vrut sa fac

19833
15:34:41,756 --> 15:34:50,000
Următorul a fost să fac ceva antrenament, am vrut eu

19834
15:34:45,436 --> 15:34:52,640
pentru a trece la sesiunea finală cinci.

19835
15:34:50,000 --> 15:34:54,320
Deci, în acest curs, mai avem câteva

19836
15:34:52,640 --> 15:34:56,160
sesiuni de capstone. Deci, dacă aveți un

19837
15:34:54,320 --> 15:34:58,320
moment, vrei să le tragi în sus

19838
15:34:56,160 --> 15:35:00,956
materiale de sesiune capstone, the

19839
15:34:58,320 --> 15:35:03,520
materiale de sesiune de capstone incrementale.

19840
15:35:00,956 --> 15:35:06,480
Um, vom face sesiunea a cincea

19841
15:35:03,520 --> 15:35:08,880
azi. Deci, asta este doar , amintește-ți că este

19842
15:35:06,480 --> 15:35:11,520
doar o practică suplimentară pe care o facem după

19843
15:35:08,880 --> 15:35:14,000
am acoperit câteva concepte. Așa suntem

19844
15:35:11,520 --> 15:35:16,796
o să fac ceva practică de regresie acum

19845
15:35:14,000 --> 15:35:19,916
că am acoperit regresia

19846
15:35:16,796 --> 15:35:21,520
destul de complet și apoi asta va fi asta

19847
15:35:19,916 --> 15:35:24,240
va fi o bună practică înainte de a merge

19848
15:35:21,520 --> 15:35:26,956
în lecția a patru despre clasificare. Deci eu

19849
15:35:24,240 --> 15:35:28,560
vreau doar să fac această practică acum în timp ce

19850
15:35:26,956 --> 15:35:31,916
este proaspăt în timp ce materialul este cam

19851
15:35:28,560 --> 15:35:34,400
proaspăt în mintea noastră. Hm, tu

19852
15:35:31,916 --> 15:35:36,560
baietii au materialele de capstone? tu

19853
15:35:34,400 --> 15:35:39,596
știi de unde să-l obții în LMS-ul tău? Este

19854
15:35:36,560 --> 15:35:41,596
în LMS-ul dvs. și resursele uh

19855
15:35:39,596 --> 15:35:45,436
materiale capstone pe care doriți să le descărcați

19856
15:35:41,596 --> 15:35:48,720
că astfel încât să puteți obține datele um și

19857
15:35:45,436 --> 15:35:52,640
diapozitivele pentru instrucțiuni

19858
15:35:48,720 --> 15:35:55,360
corect sau PDF cred că pentru voi băieți

19859
15:35:52,640 --> 15:35:57,200
dar lasă-mă să te întreb dacă le ai

19860
15:35:55,360 --> 15:36:00,360
vrem să deschidem sesiunea cinci dacă tu

19861
15:35:57,200 --> 15:36:00,360
ai

19862
15:36:01,840 --> 15:36:05,840
mulțumesc, aveam de gând să împărtășesc asta

19863
15:36:03,276 --> 15:36:07,916
apreciez că da, așa că se va întâmpla

19864
15:36:05,840 --> 15:36:11,276
fie sesiune Întrebarea cinci. Um, ești

19865
15:36:07,916 --> 15:36:12,400
de asemenea, vom dori datele pe care le avem

19866
15:36:11,276 --> 15:36:15,360
va folosi cu asta, care va merge

19867
15:36:12,400 --> 15:36:18,320
să fie, uh, setul de date de închiriere de biciclete.

19868
15:36:15,360 --> 15:36:19,756
Voi împărtăși asta cu voi băieți acum.

19869
15:36:18,320 --> 15:36:22,240
Deci, vom folosi această bicicletă

19870
15:36:19,756 --> 15:36:24,560
set de date de închiriere pentru asta, pentru asta

19871
15:36:22,240 --> 15:36:28,916
capstone. Um, este cel la care mergem

19872
15:36:24,560 --> 15:36:28,916
pentru a construi un model de regresie din.

19873
15:36:29,116 --> 15:36:35,520
Bine. Deci, ar trebui să-l ai de la

19874
15:36:31,360 --> 15:36:37,436
de asemenea, seturile de date capstone.

19875
15:36:35,520 --> 15:36:41,360
În regulă. Deci, hai să trecem prin asta.

19876
15:36:37,436 --> 15:36:42,956
Um, vom face uh mașină

19877
15:36:41,360 --> 15:36:45,520
învăţând aici. Deci, vom fi

19878
15:36:42,956 --> 15:36:48,160
facem uh, deci vorbim despre asta

19879
15:36:45,520 --> 15:36:49,916
un fel de produs exemplu pe care Aura

19880
15:36:48,160 --> 15:36:54,796
produs care era în originalul nostru

19881
15:36:49,916 --> 15:36:57,596
capstone. Um, și pentru a face uh

19882
15:36:54,796 --> 15:37:00,400
pentru a lua decizii, va fi

19883
15:36:57,596 --> 15:37:02,240
trebuie să construiesc niște modele. Hm, în asta

19884
15:37:00,400 --> 15:37:04,880
Caz, va fi să faci niște biciclete

19885
15:37:02,240 --> 15:37:06,400
modelare de închiriere. um care sunt datele

19886
15:37:04,880 --> 15:37:08,880
set pe care îl avem. Deci ne îndepărtăm de

19887
15:37:06,400 --> 15:37:10,956
acel set de date de asistență medicală care se referă la asta

19888
15:37:08,880 --> 15:37:14,640
set de date de închiriere de biciclete ca exemplu de

19889
15:37:10,956 --> 15:37:18,000
capabilitățile de aici. Hm, deci mergem

19890
15:37:14,640 --> 15:37:20,080
pentru a face acest prim capstone. Um după noi

19891
15:37:18,000 --> 15:37:23,200
faceți clasificarea, vom face asta

19892
15:37:20,080 --> 15:37:24,880
practica. După ce facem nesupravegheați

19893
15:37:23,200 --> 15:37:26,956
învățând, vom face această practică

19894
15:37:24,880 --> 15:37:29,040
gruparea. Și apoi după ce o facem

19895
15:37:26,956 --> 15:37:31,200
recomandare uh care este ultima

19896
15:37:29,040 --> 15:37:32,796
lecția um ne vom întoarce și o vom face

19897
15:37:31,200 --> 15:37:34,956
exersați cu construirea unei recomandări

19898
15:37:32,796 --> 15:37:39,040
motor. Bine, dar vom face asta

19899
15:37:34,956 --> 15:37:41,200
unul azi. Hm și apoi vom face

19900
15:37:39,040 --> 15:37:44,000
aceste alte pietre de vârf pe măsură ce mergem. Deci

19901
15:37:41,200 --> 15:37:46,480
aceasta va fi sesiunea a șasea, sesiunea a șaptea,

19902
15:37:44,000 --> 15:37:51,200
si sesiunea 8

19903
15:37:46,480 --> 15:37:54,200
mai târziu în curs. Bine.

19904
15:37:51,200 --> 15:37:54,200
um,

19905
15:37:56,240 --> 15:38:00,400
bine. Un pic despre date. Deci,

19906
15:37:58,240 --> 15:38:03,200
uh, în această piatră de vârf, vom fi

19907
15:38:00,400 --> 15:38:06,400
lucrând cu un, um, un magazin, ca un

19908
15:38:03,200 --> 15:38:10,000
magazin de vânzare cu amănuntul care închiriază biciclete. Şi

19909
15:38:06,400 --> 15:38:13,520
au date, um, pe zi

19910
15:38:10,000 --> 15:38:15,596
cu, um, de fapt, pe oră

19911
15:38:13,520 --> 15:38:18,560
pe numărul de biciclete pe care le-au închiriat

19912
15:38:15,596 --> 15:38:20,640
în fiecare oră. Hm, deci poate o oră

19913
15:38:18,560 --> 15:38:23,680
au închiriat 20 de biciclete, încă o oră

19914
15:38:20,640 --> 15:38:26,000
au închiriat 30 de biciclete. Hm, altul

19915
15:38:23,680 --> 15:38:29,840
oră au închiriat 15. Deci au

19916
15:38:26,000 --> 15:38:31,436
acele date aici în CSV. Ei

19917
15:38:29,840 --> 15:38:33,200
au alte tipuri de date precum

19918
15:38:31,436 --> 15:38:35,436
date de mediu precum ceea ce

19919
15:38:33,200 --> 15:38:37,520
temperatura era la acea oră, la

19920
15:38:35,436 --> 15:38:41,200
umiditate, dacă a fost ninsoare dacă este

19921
15:38:37,520 --> 15:38:43,276
o vacanță, vântul, vizibilitatea,

19922
15:38:41,200 --> 15:38:47,276
punctul scadent, um, radiația solară,

19923
15:38:43,276 --> 15:38:51,276
ploi, uh, ce anotimp a fost. um

19924
15:38:47,276 --> 15:38:54,160
ce zi a fost

19925
15:38:51,276 --> 15:38:55,756
um, funcțional este ca și cum ar fi eu

19926
15:38:54,160 --> 15:38:58,400
crede că e ca și cum ar fi un weekend sau

19927
15:38:55,756 --> 15:39:00,320
ziua săptămânii um, care ar fi uh

19928
15:38:58,400 --> 15:39:03,756
nefuncțional

19929
15:39:00,320 --> 15:39:05,756
um asa

19930
15:39:03,756 --> 15:39:11,916
pe baza acestor caracteristici avem o grămadă

19931
15:39:05,756 --> 15:39:16,080
de sarcini în regulă, așa că avem um bazat pe

19932
15:39:11,916 --> 15:39:17,756
închiriat după numărul de ore din zi

19933
15:39:16,080 --> 15:39:19,520
temperatura, umiditatea, viteza vantului,

19934
15:39:17,756 --> 15:39:21,276
precipitații și orice alte caracteristici

19935
15:39:19,520 --> 15:39:22,880
suntem cei care sunt în setul de date. Suntem

19936
15:39:21,276 --> 15:39:24,480
de fapt, voi construi un model pentru

19937
15:39:22,880 --> 15:39:27,040
prezice numărul de biciclete necesar pentru

19938
15:39:24,480 --> 15:39:28,560
în fiecare oră pentru a avea o aprovizionare stabilă de

19939
15:39:27,040 --> 15:39:31,276
biciclete închiriate. Deci, scopul nostru este de fapt

19940
15:39:28,560 --> 15:39:36,796
va fi pentru a prezice închirierea bicicletei

19941
15:39:31,276 --> 15:39:38,560
numără pe oră. Um și uh mergem

19942
15:39:36,796 --> 15:39:41,520
pentru a face asta folosind toate caracteristicile pe care le avem

19943
15:39:38,560 --> 15:39:43,756
avem la dispoziție. um ca mai ales

19944
15:39:41,520 --> 15:39:47,436
acele caracteristici de mediu și ce

19945
15:39:43,756 --> 15:39:49,680
ziua asta este, astfel de lucruri. Hm

19946
15:39:47,436 --> 15:39:51,436
așa că ne vom încărca datele. Suntem

19947
15:39:49,680 --> 15:39:54,720
vom face verificarea noastră obișnuită. Deci verifica

19948
15:39:51,436 --> 15:39:56,720
pentru orice NLES, gestionați acele NLES lipsă.

19949
15:39:54,720 --> 15:39:58,560
De fapt, o să exersăm

19950
15:39:56,720 --> 15:40:00,880
convertim data noastră pentru că de fapt

19951
15:39:58,560 --> 15:40:02,480
au lucruri bazate pe o dată aici. Aşa

19952
15:40:00,880 --> 15:40:05,916
îl putem converti într-o dată și oră

19953
15:40:02,480 --> 15:40:09,680
obiect, extrage diferite caracteristici uh

19954
15:40:05,916 --> 15:40:12,796
de la asta um ca luna sau ziua

19955
15:40:09,680 --> 15:40:14,560
a saptamanii. O să verificăm

19956
15:40:12,796 --> 15:40:16,640
corelarea folosind harta termică. Suntem

19957
15:40:14,560 --> 15:40:18,640
o să fac niște comploturi, unele foarte de bază

19958
15:40:16,640 --> 15:40:20,000
parcele. Accentul se va pune pe

19959
15:40:18,640 --> 15:40:23,040
modelare. Deci, probabil că nu voi cheltui și eu

19960
15:40:20,000 --> 15:40:25,200
mult timp pe teren astăzi, dar um

19961
15:40:23,040 --> 15:40:27,916
sunt niște sarcini de complot aici, cum ar fi

19962
15:40:25,200 --> 15:40:30,480
histograma numărului de biciclete,

19963
15:40:27,916 --> 15:40:33,200
histograma caracteristicilor numerice.

19964
15:40:30,480 --> 15:40:35,436
Um box plot al bicicletelor împotriva

19965
15:40:33,200 --> 15:40:38,160
categorice.

19966
15:40:35,436 --> 15:40:40,400
Ca să putem face niște comploturi de genul ăsta

19967
15:40:38,160 --> 15:40:42,320
de la Seabor, de exemplu. Uh Seabor

19968
15:40:40,400 --> 15:40:44,000
teren de categorie de număr de biciclete închiriate

19969
15:40:42,320 --> 15:40:47,040
față de caracteristici precum ora, vacanța,

19970
15:40:44,000 --> 15:40:48,880
precipitatii, ninsori. Um, ca să vedem

19971
15:40:47,040 --> 15:40:50,480
cum se înfruntă asta cu ca

19972
15:40:48,880 --> 15:40:52,796
ore diferite ale zilei, diferite

19973
15:40:50,480 --> 15:40:55,436
sărbători, precipitații, vreme diferită

19974
15:40:52,796 --> 15:40:56,480
evenimente. Hm, atunci o să facem

19975
15:40:55,436 --> 15:40:58,000
vom începe să ne construim modelul,

19976
15:40:56,480 --> 15:41:01,276
nu? Deci codificați categoria noastră

19977
15:40:58,000 --> 15:41:04,796
caracteristici. Hm, identifică variabila țintă

19978
15:41:01,276 --> 15:41:06,160
și faceți despărțirea și apoi faceți scalarea și

19979
15:41:04,796 --> 15:41:07,116
face trei modele diferite. Deci suntem

19980
15:41:06,160 --> 15:41:09,756
de fapt va construi un liniar

19981
15:41:07,116 --> 15:41:11,916
regresie. Vom construi un lasso

19982
15:41:09,756 --> 15:41:15,200
regresie și construiți o regresie de creastă

19983
15:41:11,916 --> 15:41:16,480
pentru numărul orar de biciclete. iar noi suntem

19984
15:41:15,200 --> 15:41:19,040
mergi sa vezi ce model realizeaza

19985
15:41:16,480 --> 15:41:24,796
cel mai bun. Acum,

19986
15:41:19,040 --> 15:41:27,680
am putea și ar trebui să construim asta într-un

19987
15:41:24,796 --> 15:41:31,840
conductă. Deci, asta ar putea fi ceva noi

19988
15:41:27,680 --> 15:41:33,436
practica. Hm, dar această inițială

19989
15:41:31,840 --> 15:41:34,796
instrucțiunile de fapt nu necesită

19990
15:41:33,436 --> 15:41:38,400
fac asta, dar cred că e foarte bine

19991
15:41:34,796 --> 15:41:40,080
exersați să ne construim modelul. Deci, noi

19992
15:41:38,400 --> 15:41:42,320
ar putea folosi manechine git. Cum se spune

19993
15:41:40,080 --> 15:41:45,116
aici, indiciu pentru a folosi manechine git. Am putea

19994
15:41:42,320 --> 15:41:47,680
fă asta și construiește modelul nostru așa,

19995
15:41:45,116 --> 15:41:49,360
dar mai practic ar fi să faci

19996
15:41:47,680 --> 15:41:51,200
pașii pe care i-am făcut spre sfârșitul lecției

19997
15:41:49,360 --> 15:41:53,520
trei, ceea ce este de fapt punerea

19998
15:41:51,200 --> 15:41:55,360
totul împreună într-o conductă. Toate

19999
15:41:53,520 --> 15:41:57,520
corect, asta ar fi mai practic și apoi

20000
15:41:55,360 --> 15:42:01,436
potrivirea conductei si prezicerea cu

20001
15:41:57,520 --> 15:42:04,880
este pentru evaluare.

20002
15:42:01,436 --> 15:42:07,116
Deci, vom face asta. Cred că vom face

20003
15:42:04,880 --> 15:42:09,360
asta in schimb pentru ca cred ca asa va fi

20004
15:42:07,116 --> 15:42:12,160
mai practic. Conductele sunt

20005
15:42:09,360 --> 15:42:13,840
cu adevărat util. Deci lucrurile pe care le vom face

20006
15:42:12,160 --> 15:42:16,480
trebuie să facem când ne construim conducta

20007
15:42:13,840 --> 15:42:18,560
se va asigura că ne ocupăm de

20008
15:42:16,480 --> 15:42:20,400
valori lipsă. Deci ne vom dori acel imper

20009
15:42:18,560 --> 15:42:22,880
acolo pentru caracteristici numerice. Vom face

20010
15:42:20,400 --> 15:42:26,080
vrem codificarea noastră fierbinte foarte asemănătoare

20011
15:42:22,880 --> 15:42:27,596
conductă până la cea pe care am construit-o mai devreme. Hm

20012
15:42:26,080 --> 15:42:28,956
și apoi vom dori practic să facem o hartă

20013
15:42:27,596 --> 15:42:31,840
cele din coloanele din dreapta folosind

20014
15:42:28,956 --> 15:42:33,596
transformator de coloană. Și apoi vom face

20015
15:42:31,840 --> 15:42:36,240
să avem conducta noastră gata de plecare

20016
15:42:33,596 --> 15:42:38,160
antrenament și predicție.

20017
15:42:36,240 --> 15:42:41,520
Corect.

20018
15:42:38,160 --> 15:42:45,040
Bine. Deci, acestea vor fi uh-ul nostru

20019
15:42:41,520 --> 15:42:49,000
trepte. Orice întrebări despre asta înaintea noastră

20020
15:42:45,040 --> 15:42:49,000
un fel de a începe.

20021
15:42:54,560 --> 15:43:02,880
Bine. Deci, lasă-mă să trec la

20022
15:42:58,640 --> 15:43:05,880
caiete și lasă-mă să fac ceva nou

20023
15:43:02,880 --> 15:43:05,880
caietul.

20024
15:43:08,480 --> 15:43:14,880
Și o să numesc asta

20025
15:43:12,080 --> 15:43:18,360
capstone

20026
15:43:14,880 --> 15:43:18,360
sesiunea cinci.

20027
15:43:18,880 --> 15:43:22,320
Bine.

20028
15:43:20,880 --> 15:43:24,796
Deci, mă voi întoarce aici și

20029
15:43:22,320 --> 15:43:27,200
consultați pașii aici. Bine. Deci

20030
15:43:24,796 --> 15:43:30,320
pașii sunt să încărcăm setul nostru de date și

20031
15:43:27,200 --> 15:43:32,480
practic verificați pentru nles.

20032
15:43:30,320 --> 15:43:35,916
Așa că ar trebui să fim destul de abili în a face

20033
15:43:32,480 --> 15:43:38,796
că. Vom importa panda ca

20034
15:43:35,916 --> 15:43:40,720
pd.

20035
15:43:38,796 --> 15:43:45,360
Și trebuie să mă asigur că seturile de date

20036
15:43:40,720 --> 15:43:49,116
disponibil. Deci trebuie

20037
15:43:45,360 --> 15:43:52,596
uh încărcați asta aici. Deci vom folosi

20038
15:43:49,116 --> 15:43:52,596
închirierea noastră de biciclete.

20039
15:44:04,240 --> 15:44:07,276
Închiriere de biciclete în Florida.

20040
15:44:22,880 --> 15:44:27,560
Și apoi uită-te la primele cinci rânduri.

20041
15:44:34,480 --> 15:44:45,480
Am o eroare de decodor.

20042
15:44:39,756 --> 15:44:45,480
Codecul UTF8 poate decoda prin in

20043
15:44:58,320 --> 15:45:01,640
un moment.

20044
15:45:27,040 --> 15:45:30,880
Cred că avem o eroare în date

20045
15:45:29,520 --> 15:45:32,796
set. A putut cineva să ajungă la asta

20046
15:45:30,880 --> 15:45:35,756
alerga?

20047
15:45:32,796 --> 15:45:40,040
Să sperăm că ei

20048
15:45:35,756 --> 15:45:40,040
sau ai primit aceeasi eroare ca mine?

20049
15:45:50,640 --> 15:45:54,360
dandu-mi aceeasi eroare.

20050
15:45:58,080 --> 15:46:02,596
Cred că trebuie să setăm o

20051
15:46:14,796 --> 15:46:17,796
codificare

20052
15:46:37,840 --> 15:46:43,596
având alte probleme. Ce alte probleme?

20053
15:46:41,116 --> 15:46:46,596
Îmi pare rău, cred că aceste date sunt oarecum

20054
15:46:43,596 --> 15:46:46,596
corupt.

20055
15:46:50,480 --> 15:46:54,596
Poate că trebuie să-l deschid extern.

20056
15:46:55,916 --> 15:47:01,116
Bine, lasă-mă să-l deschid. Poate fi doar

20057
15:46:58,880 --> 15:47:04,116
un caracter rău care trebuie să fie

20058
15:47:01,116 --> 15:47:04,116
îndepărtat.

20059
15:47:14,640 --> 15:47:17,640
bine,

20060
15:47:22,080 --> 15:47:27,720
lasă-mă să încerc altceva. Lasă-mă să încerc

20061
15:47:24,160 --> 15:47:27,720
ceva foarte rapid.

20062
15:47:31,116 --> 15:47:36,436
Cred că datele trebuie actualizate.

20063
15:47:37,200 --> 15:47:41,560
Oh, am salvat-o ca fișier greșit.

20064
15:47:48,400 --> 15:47:51,640
Un moment.

20065
15:48:04,320 --> 15:48:08,520
Bine, lasă-mă să încerc să încarc asta.

20066
15:48:16,160 --> 15:48:24,116
Bine, acolo. Asta a funcționat mai bine. Deci, lasă

20067
15:48:18,880 --> 15:48:24,116
iti dau datele. Cred că a fost

20068
15:48:25,596 --> 15:48:32,080
Da, cred că acesta a fost gradul

20069
15:48:28,320 --> 15:48:36,200
codul îi dădea unele probleme. Deci, eu

20070
15:48:32,080 --> 15:48:36,200
de fapt tocmai l-am scos.

20071
15:48:39,116 --> 15:48:43,596
Poți să faci asta sau poți doar să lucrezi

20072
15:48:40,480 --> 15:48:46,080
cu acesta.

20073
15:48:43,596 --> 15:48:47,840
Am eliminat temperatura a avut un ciudat

20074
15:48:46,080 --> 15:48:50,796
ca simbolul gradului care nu era a fi

20075
15:48:47,840 --> 15:48:50,796
analizat.

20076
15:48:51,520 --> 15:48:55,360
Deci, tocmai am eliminat asta din aceste date

20077
15:48:53,116 --> 15:48:57,436
set. Acesta ar trebui să funcționeze. Cel eu

20078
15:48:55,360 --> 15:49:01,200
tocmai v-am trimis băieți, ar trebui să funcționeze. Sau da,

20079
15:48:57,436 --> 15:49:02,796
Cred că ai putea încerca CP1252

20080
15:49:01,200 --> 15:49:06,916
cu datele originale. Vezi dacă asta

20081
15:49:02,796 --> 15:49:06,916
lucrări. A funcționat pentru tine?

20082
15:49:14,880 --> 15:49:19,756
Bine, funcționează cu acea codificare. Deci

20083
15:49:16,480 --> 15:49:21,436
da, ai putea folosi acea codificare sau

20084
15:49:19,756 --> 15:49:23,596
uh

20085
15:49:21,436 --> 15:49:26,000
elimina acel grad de temperatura care este

20086
15:49:23,596 --> 15:49:29,480
ce am facut din asta. Deci folosesc asta

20087
15:49:26,000 --> 15:49:29,480
alt set de date.

20088
15:49:34,796 --> 15:49:42,840
Da, asta deschide datele, dar

20089
15:49:38,160 --> 15:49:42,840
nu este, nu este într-un cadru de date.

20090
15:49:43,276 --> 15:49:46,720
Vrem doar ca într-un cadru de date

20091
15:49:45,040 --> 15:49:49,756
lucrați cu modelele noastre și faceți totul

20092
15:49:46,720 --> 15:49:51,520
Da al nostru. Asa se deschide fisierul. Dacă

20093
15:49:49,756 --> 15:49:54,640
doar dacă ar fi fost un fișier text

20094
15:49:51,520 --> 15:49:56,480
bine, dar nu este într-un cadru de date. Vreau

20095
15:49:54,640 --> 15:49:59,640
într-un cadru de date structurat astfel încât să putem

20096
15:49:56,480 --> 15:49:59,640
foloseste-l.

20097
15:50:04,720 --> 15:50:08,400
Bine. Deci, una dintre acele metodologii

20098
15:50:07,116 --> 15:50:10,400
sper sa functioneze. Deci poți fie să lucrezi

20099
15:50:08,400 --> 15:50:13,596
cu fisierul pe care l-am trimis si l-am citit ca

20100
15:50:10,400 --> 15:50:15,360
aceasta sau puteți folosi codificarea.

20101
15:50:13,596 --> 15:50:19,400
Voi, băieți, alți oameni au fost capabili

20102
15:50:15,360 --> 15:50:19,400
îl deschid odată ce schimbă codificarea?

20103
15:50:29,756 --> 15:50:32,756
Bine.

20104
15:50:42,956 --> 15:50:47,276
Bine, foarte bine.

20105
15:50:46,080 --> 15:50:48,796
Să vedem ce avem. Să facem

20106
15:50:47,276 --> 15:50:50,400
df.info.

20107
15:50:48,796 --> 15:50:52,320
Să vedem ce avem, care este frumos

20108
15:50:50,400 --> 15:50:56,480
pas standard de făcut odată ce încărcăm prima dată

20109
15:50:52,320 --> 15:51:00,000
în unele date. Hm, deci avem vreo 14

20110
15:50:56,480 --> 15:51:03,436
coloane aici. Avem o întâlnire și apoi noi

20111
15:51:00,000 --> 15:51:04,720
au um care este un obiect chiar acum dar

20112
15:51:03,436 --> 15:51:07,200
de fapt o vom converti

20113
15:51:04,720 --> 15:51:09,596
la un obiect datetime într-un minut.

20114
15:51:07,200 --> 15:51:11,360
Avem numărul nostru de biciclete, ceea ce este

20115
15:51:09,596 --> 15:51:13,200
vrem să prezicem până la urmă. Aceasta este

20116
15:51:11,360 --> 15:51:14,640
variabila țintă din datele noastre.

20117
15:51:13,200 --> 15:51:18,000
Amintiți-vă că asta va fi problema

20118
15:51:14,640 --> 15:51:20,320
este de a prezice acel număr orar de biciclete. Hm

20119
15:51:18,000 --> 15:51:22,880
ora din zi în care suntem

20120
15:51:20,320 --> 15:51:25,116
producerea acelui număr de biciclete um este a

20121
15:51:22,880 --> 15:51:28,480
caracteristică. temperatura care este in

20122
15:51:25,116 --> 15:51:31,436
grade Celsius. Eu am eliminat asta

20123
15:51:28,480 --> 15:51:33,276
de acolo dar asta a fost in Celsius.

20124
15:51:31,436 --> 15:51:35,040
Hm

20125
15:51:33,276 --> 15:51:38,720
și apoi avem o grămadă de diferite

20126
15:51:35,040 --> 15:51:42,240
caracteristici care sunt un fel de boolean

20127
15:51:38,720 --> 15:51:46,160
ca da nu vacanță nu vacanță the

20128
15:51:42,240 --> 15:51:50,640
sezon. Deci tipii ăștia vor fi

20129
15:51:46,160 --> 15:51:52,160
buni candidați pentru

20130
15:51:50,640 --> 15:51:56,720
uh, aceștia vor fi candidați buni

20131
15:51:52,160 --> 15:51:58,400
pentru că facem o codificare fierbinte.

20132
15:51:56,720 --> 15:52:01,436
Corect? Acestea sunt probabil cele trei care

20133
15:51:58,400 --> 15:52:06,756
ar trebui să alegem să facem ceva

20134
15:52:01,436 --> 15:52:06,756
transformări la pentru singura noastră codificare.

20135
15:52:08,956 --> 15:52:11,956
Bine.

20136
15:52:15,276 --> 15:52:18,480
Orice altceva este destul de numeric

20137
15:52:16,880 --> 15:52:20,080
totuși, așa că acestea ar trebui să fie bine de păstrat

20138
15:52:18,480 --> 15:52:22,320
acelea. Dar ar vrea să plece

20139
15:52:20,080 --> 15:52:23,596
a fi candidați buni pentru scalare,

20140
15:52:22,320 --> 15:52:26,000
nu? Candidați cu adevărat buni pentru

20141
15:52:23,596 --> 15:52:30,840
scalare.

20142
15:52:26,000 --> 15:52:30,840
Bine, să ne întoarcem aici.

20143
15:52:37,360 --> 15:52:43,840
Și să revenim la sarcină.

20144
15:52:40,956 --> 15:52:45,276
Așa că am încărcat setul de date. Hm noi suntem

20145
15:52:43,840 --> 15:52:47,040
urmează să verifice valorile nule. Arata

20146
15:52:45,276 --> 15:52:49,840
ca și cum de fapt nu există niciun NLES. Deci

20147
15:52:47,040 --> 15:52:53,680
s-ar putea să nu existe vreun uh care să impută că noi

20148
15:52:49,840 --> 15:52:57,040
chiar trebuie să faci pentru asta. Hm, dar noi

20149
15:52:53,680 --> 15:53:00,080
poate verifica. Deci putem folosi este na sau este

20150
15:52:57,040 --> 15:53:02,400
nul și apoi faceți suma.

20151
15:53:00,080 --> 15:53:06,756
Se pare că nu avem. Așa că

20152
15:53:02,400 --> 15:53:06,756
asta e bine. Nu există nuluri.

20153
15:53:07,040 --> 15:53:10,640
E destul de bine. Deci nu trebuie

20154
15:53:08,796 --> 15:53:12,240
vă faceți griji pentru completarea oricăror spații libere

20155
15:53:10,640 --> 15:53:16,000
într-adevăr.

20156
15:53:12,240 --> 15:53:18,240
Hm, dar știi că asta ar fi în mod normal

20157
15:53:16,000 --> 15:53:21,040
asta ar fi o parte importantă a noastră

20158
15:53:18,240 --> 15:53:22,400
dreapta conductei completează orice nles.

20159
15:53:21,040 --> 15:53:24,320
Se pare că nu trebuie să ne facem griji

20160
15:53:22,400 --> 15:53:27,720
că aici.

20161
15:53:24,320 --> 15:53:27,720
Deci e bine.

20162
15:53:29,436 --> 15:53:34,720
Deci putem

20163
15:53:32,400 --> 15:53:38,160
uh

20164
15:53:34,720 --> 15:53:39,840
putem extrage putem face data uh

20165
15:53:38,160 --> 15:53:43,840
extractie. Și acum un singur lucru suntem

20166
15:53:39,840 --> 15:53:45,916
o să faci este să creez intenționat pentru

20167
15:53:43,840 --> 15:53:50,000
asta vom crea un weekend sau

20168
15:53:45,916 --> 15:53:52,000
caracteristica zilelor lucrătoare. Bine, în ziua săptămânii sau

20169
15:53:50,000 --> 15:53:55,276
weekend care ar trebui să fie foarte ușor

20170
15:53:52,000 --> 15:53:58,560
face din ziua săptămânii. um care noi

20171
15:53:55,276 --> 15:54:00,480
ar trebui să poată extrage din asta

20172
15:53:58,560 --> 15:54:02,320
de la data.

20173
15:54:00,480 --> 15:54:04,956
Să revenim la Apropo, ai fost,

20174
15:54:02,320 --> 15:54:06,320
ați fost capabili să rulați asta?

20175
15:54:04,956 --> 15:54:09,276
Vreau doar să mă asigur că toată lumea este cu

20176
15:54:06,320 --> 15:54:12,436
eu. Se verifică dacă există valori nule. Noi

20177
15:54:09,276 --> 15:54:12,436
a făcut asta.

20178
15:54:26,080 --> 15:54:29,080
Bine.

20179
15:54:35,916 --> 15:54:39,916
În regulă. Deci, ne urmărim

20180
15:54:37,360 --> 15:54:43,596
acolo. Am verificat dacă există nles.

20181
15:54:39,916 --> 15:54:45,520
Să ne facem conversia. Deci, hai să facem

20182
15:54:43,596 --> 15:54:48,000
um df

20183
15:54:45,520 --> 15:54:51,200
uh data.

20184
15:54:48,000 --> 15:54:53,116
Și asta va fi um

20185
15:54:51,200 --> 15:54:56,880
PD.2

20186
15:54:53,116 --> 15:54:59,436
data ora si apoi df

20187
15:54:56,880 --> 15:55:01,436
data.

20188
15:54:59,436 --> 15:55:03,916
În regulă. Și apoi să verificăm starea de spirit

20189
15:55:01,436 --> 15:55:06,916
că s-a convertit făcând

20190
15:55:03,916 --> 15:55:06,916
info.

20191
15:55:25,596 --> 15:55:29,640
Oh, s-ar putea să avem nevoie de acest format.

20192
15:55:43,840 --> 15:55:47,916
Hm, poate ar trebui să facem

20193
15:55:51,596 --> 15:55:57,436
Bine, deci chiar a funcționat. hai sa

20194
15:55:54,400 --> 15:55:59,360
vedea. Să verificăm de două ori

20195
15:55:57,436 --> 15:56:01,756
data.

20196
15:55:59,360 --> 15:56:03,276
Bine, așa că a funcționat. L-a extras

20197
15:56:01,756 --> 15:56:07,956
în

20198
15:56:03,276 --> 15:56:07,956
a extras-o în datele potrivite.

20199
15:56:09,756 --> 15:56:14,200
O codificare ciudată cu asta

20200
15:56:17,916 --> 15:56:22,400
Așa că merge până în 2018

20201
15:56:20,880 --> 15:56:24,956
din

20202
15:56:22,400 --> 15:56:27,436
datele de la început sunt în 2017

20203
15:56:24,956 --> 15:56:29,116
dreptul de început de an. Așa că merge

20204
15:56:27,436 --> 15:56:32,116
și apoi coada este până la capăt

20205
15:56:29,116 --> 15:56:32,116
2018.

20206
15:56:32,880 --> 15:56:37,240
Aceasta extrage data.

20207
15:56:41,840 --> 15:56:45,796
Dacă vreți să conduceți asta

20208
15:56:53,040 --> 15:56:56,840
voi băieți capabili să rulați asta

20209
15:56:57,680 --> 15:57:02,320
pentru a extrage data. Bine, perfect. Deci,

20210
15:57:00,640 --> 15:57:04,320
aceasta extrage data. Apropo, cel

20211
15:57:02,320 --> 15:57:07,200
motivul pentru care avem nevoie de asta este pentru că întâlnirea noastră

20212
15:57:04,320 --> 15:57:08,880
formatele nu sunt uniforme. Au fost

20213
15:57:07,200 --> 15:57:11,756
de fapt în diferite codificări. Deci unii

20214
15:57:08,880 --> 15:57:13,680
dintre ei au avut anul în care a fost șirul

20215
15:57:11,756 --> 15:57:16,080
într-un format ușor diferit unde

20216
15:57:13,680 --> 15:57:17,916
anul a fost ultimul sau anul a fost primul. Deci

20217
15:57:16,080 --> 15:57:20,400
dacă facem format mixt, cam așa

20218
15:57:17,916 --> 15:57:22,956
rearanjarea ei îl cam pune într-o uniformă

20219
15:57:20,400 --> 15:57:26,160
aranjament cu anul. este an,

20220
15:57:22,956 --> 15:57:29,040
luna, data, dar analizează asta

20221
15:57:26,160 --> 15:57:31,360
corect. Deci avem an, lună,

20222
15:57:29,040 --> 15:57:34,956
data acolo.

20223
15:57:31,360 --> 15:57:38,240
Hm, dar aceste șiruri erau amestecate

20224
15:57:34,956 --> 15:57:42,916
format. Deci am pus acel argument

20225
15:57:38,240 --> 15:57:42,916
acolo pentru a se ocupa de acel caz.

20226
15:57:43,756 --> 15:57:48,080
Bine. Deci motivul pe care îl vom face

20227
15:57:45,200 --> 15:57:52,640
adică ar trebui să putem crea

20228
15:57:48,080 --> 15:57:54,320
o zi a săptămânii uh caracteristică. Um asa

20229
15:57:52,640 --> 15:57:55,596
haideți să facem asta și să o adăugăm la noi

20230
15:57:54,320 --> 15:58:00,720
cadru de date. Deci ar trebui să putem

20231
15:57:55,596 --> 15:58:05,116
creează o zi a săptămânii

20232
15:58:00,720 --> 15:58:06,956
Și ar trebui să putem extrage eu

20233
15:58:05,116 --> 15:58:12,560
DF

20234
15:58:06,956 --> 15:58:14,320
data. Și apoi facem DT-ul nostru obișnuit

20235
15:58:12,560 --> 15:58:17,796
zi

20236
15:58:14,320 --> 15:58:17,796
de saptamana.

20237
15:58:19,040 --> 15:58:24,240
Bine. Deci, și apoi să vedem ce anume

20238
15:58:21,596 --> 15:58:27,596
face. Deci, dacă adăugăm asta, să facem de fapt

20239
15:58:24,240 --> 15:58:29,436
vezi, hai să vedem care sunt noile noastre caracteristici

20240
15:58:27,596 --> 15:58:32,560
sunt.

20241
15:58:29,436 --> 15:58:35,040
Așa că adăugăm că ar trebui să meargă până la capăt

20242
15:58:32,560 --> 15:58:37,276
a cadrului de date ca zi a săptămânii

20243
15:58:35,040 --> 15:58:41,200
este o zi numerică a săptămânii. Deci asta

20244
15:58:37,276 --> 15:58:44,480
acesta este uh um

20245
15:58:41,200 --> 15:58:48,480
aceasta arată ca o a th sau nu o miercuri.

20246
15:58:44,480 --> 15:58:51,276
Cred că este a treia zi.

20247
15:58:48,480 --> 15:58:52,640
Duminică luni fiind uh luni fiind

20248
15:58:51,276 --> 15:58:56,160
de fapt, aceasta ar fi o zi de joi. eu

20249
15:58:52,640 --> 15:58:59,640
cred că luni ar fi zero.

20250
15:58:56,160 --> 15:58:59,640
Asta ar fi joi.

20251
15:59:00,720 --> 15:59:05,400
Bine. Deci, extragem acea zi a

20252
15:59:02,400 --> 15:59:05,400
saptamana.

20253
15:59:07,040 --> 15:59:12,160
Deci, doar că adăugăm o nouă coloană

20254
15:59:09,520 --> 15:59:14,480
numită zi a săptămânii, care extrage

20255
15:59:12,160 --> 15:59:18,320
ziua săptămânii de la caracteristica dată,

20256
15:59:14,480 --> 15:59:21,320
caracteristica datetime, uh ziua

20257
15:59:18,320 --> 15:59:21,320
saptamana.

20258
15:59:23,040 --> 15:59:27,840
Și verificăm asta aici. Este acum

20259
15:59:25,520 --> 15:59:31,480
o nouă caracteristică numită ziua săptămânii.

20260
15:59:27,840 --> 15:59:31,480
care este un număr.

20261
15:59:40,640 --> 15:59:45,080
Are sens ce face asta?

20262
15:59:48,240 --> 15:59:53,520
Da, e joi. Deci, cred că da,

20263
15:59:50,480 --> 15:59:57,200
Luni este zero

20264
15:59:53,520 --> 15:59:59,520
iar duminica este șase. Deci,

20265
15:59:57,200 --> 16:00:03,116
um, luni este

20266
15:59:59,520 --> 16:00:05,200
zero, duminica este

20267
16:00:03,116 --> 16:00:09,480
şase.

20268
16:00:05,200 --> 16:00:09,480
Da. Deci, aceasta ar trebui să fie o zi de joi.

20269
16:00:14,080 --> 16:00:18,956
Aceste prime cinci rânduri sunt o zi de joi. si,

20270
16:00:16,240 --> 16:00:20,400
și apropo, datele um, asta este tot

20271
16:00:18,956 --> 16:00:23,040
în ziua de joi. Acesta este diferit

20272
16:00:20,400 --> 16:00:27,116
ore ale zilei.

20273
16:00:23,040 --> 16:00:28,480
Diferite ore ale zilei. Hm, și noi

20274
16:00:27,116 --> 16:00:30,560
lucrul despre care nu știm

20275
16:00:28,480 --> 16:00:32,640
acesta este neapărat fusul orar.

20276
16:00:30,560 --> 16:00:35,276
Deci, poate părea ciudat ca așa

20277
16:00:32,640 --> 16:00:37,436
este zero, ceea ce este ca miezul nopții.

20278
16:00:35,276 --> 16:00:38,796
Hm, s-ar putea să fie într-un

20279
16:00:37,436 --> 16:00:43,360
fus orar diferit. Deci, nu știm

20280
16:00:38,796 --> 16:00:47,276
asta neapărat, dar există

20281
16:00:43,360 --> 16:00:51,040
știi 250 de biciclete, 200 de biciclete, 173. Ea

20282
16:00:47,276 --> 16:00:54,916
începe să scadă în aceste ore.

20283
16:00:51,040 --> 16:00:54,916
Doar să observ că.

20284
16:01:11,596 --> 16:01:16,560
Bine. Deci, apropo, ar trebui să fim

20285
16:01:14,400 --> 16:01:18,480
capabil să creeze o nouă caracteristică. Deci haideți

20286
16:01:16,560 --> 16:01:21,840
crea

20287
16:01:18,480 --> 16:01:25,916
caracteristica de weekend

20288
16:01:21,840 --> 16:01:28,796
care este um putem crea folosind

20289
16:01:25,916 --> 16:01:32,160
uh weekend

20290
16:01:28,796 --> 16:01:36,916
și ne putem lua DF

20291
16:01:32,160 --> 16:01:36,916
um zi a săptămânii

20292
16:01:37,436 --> 16:01:45,756
și atunci putem doar um

20293
16:01:40,796 --> 16:01:50,080
spune că acesta este mai mare sau egal cu

20294
16:01:45,756 --> 16:01:52,400
mai mare sau egal cu cinci

20295
16:01:50,080 --> 16:01:54,480
pentru că ar fi cinci sau șase. Și suntem

20296
16:01:52,400 --> 16:01:58,916
mergând la

20297
16:01:54,480 --> 16:01:58,916
um pune asta ca

20298
16:02:11,436 --> 16:02:16,240
de fapt. Să lăsăm așa.

20299
16:02:12,880 --> 16:02:16,240
Ar trebui să fie bine.

20300
16:02:17,840 --> 16:02:23,956
Nu, să-l schimbăm ca tip

20301
16:02:20,796 --> 16:02:23,956
uh int.

20302
16:02:25,756 --> 16:02:30,360
Deci, să vedem această caracteristică.

20303
16:02:35,200 --> 16:02:38,916
Să vedem dacă funcționează.

20304
16:02:44,560 --> 16:02:49,116
Deci, acesta nu este un weekend, pentru că este

20305
16:02:47,116 --> 16:02:51,436
o joi, nu? Deci orice mai mare

20306
16:02:49,116 --> 16:02:53,276
decât cinci ar fi mai mare sau egal

20307
16:02:51,436 --> 16:02:56,240
la cinci ar fi cinci sau șase care ar fi

20308
16:02:53,276 --> 16:03:01,400
fie sâmbătă, duminică. Hm ca să știm că este

20309
16:02:56,240 --> 16:03:01,400
nu o zi de weekend. Acesta este zero.

20310
16:03:02,640 --> 16:03:05,640
Bine.

20311
16:03:09,276 --> 16:03:14,040
Deci doar creând acele caracteristici acolo

20312
16:03:14,720 --> 16:03:19,596
și le pot lipi pe acestea

20313
16:03:16,956 --> 16:03:22,400
simt ce tocmai am facut?

20314
16:03:19,596 --> 16:03:25,756
Aveți întrebări despre acel cod? Și aceasta este

20315
16:03:22,400 --> 16:03:28,796
important. Dacă nu ai asta, um-l

20316
16:03:25,756 --> 16:03:31,276
acesta va fi un adevărat sau un fals, dar noi

20317
16:03:28,796 --> 16:03:33,916
vreau să fie zero sau unu. Deci când

20318
16:03:31,276 --> 16:03:36,796
este de fapt adevărat, asta ar trebui să fie a

20319
16:03:33,916 --> 16:03:38,560
unul. Când este fals, va fi zero.

20320
16:03:36,796 --> 16:03:40,796
Deci, vrem să fie mai degrabă un număr întreg

20321
16:03:38,560 --> 16:03:44,160
decât un adevărat fals. Deci, de aceea am

20322
16:03:40,796 --> 16:03:46,956
această parte. De aceea am făcut asta aici

20323
16:03:44,160 --> 16:03:49,956
pentru a te asigura că este um asigură-te că este un

20324
16:03:46,956 --> 16:03:49,956
întreg.

20325
16:04:01,360 --> 16:04:04,360
Bun.

20326
16:04:05,916 --> 16:04:09,520
bine,

20327
16:04:07,436 --> 16:04:14,480
deci facem cam asta și

20328
16:04:09,520 --> 16:04:16,080
îl convertim în zi și extragem zi. Hm

20329
16:04:14,480 --> 16:04:20,000
hai sa

20330
16:04:16,080 --> 16:04:23,480
verificați harta noastră termică.

20331
16:04:20,000 --> 16:04:23,480
Să facem asta.

20332
16:04:26,956 --> 16:04:33,116
Deci, să importăm Seabour

20333
16:04:30,560 --> 16:04:35,360
ca SNS.

20334
16:04:33,116 --> 16:04:38,080
Deci, vom face harta termică în continuare.

20335
16:04:35,360 --> 16:04:40,160
Lasă-mă să notez asta. Deci, suntem

20336
16:04:38,080 --> 16:04:42,400
urmeaza sa faca

20337
16:04:40,160 --> 16:04:45,040
hartă termică

20338
16:04:42,400 --> 16:04:50,116
harta termică. um,

20339
16:04:45,040 --> 16:04:50,116
așa că vom face uh SNS

20340
16:04:50,160 --> 16:04:56,640
harta termică

20341
16:04:52,240 --> 16:05:00,640
și apoi să facem uh df.corelation.

20342
16:04:56,640 --> 16:05:02,480
Și să ne asigurăm că facem numere

20343
16:05:00,640 --> 16:05:06,116
um numai

20344
16:05:02,480 --> 16:05:06,116
egal cu adevărat

20345
16:05:10,160 --> 16:05:15,596
și apoi să facem adnotări

20346
16:05:13,040 --> 16:05:17,596
egal cu adevărat

20347
16:05:15,596 --> 16:05:19,276
astfel încât să obținem acele corelații

20348
16:05:17,596 --> 16:05:21,276
valorile care sunt afișate pe căldură

20349
16:05:19,276 --> 16:05:23,116
harta. Deci ceea ce va face asta este

20350
16:05:21,276 --> 16:05:26,240
creați harta noastră termică cu corelația noastră

20351
16:05:23,116 --> 16:05:28,560
matrix um unde ne asigurăm că

20352
16:05:26,240 --> 16:05:33,080
faceți numai caracteristicile numerice desigur

20353
16:05:28,560 --> 16:05:33,080
când facem harta termică.

20354
16:05:34,956 --> 16:05:41,276
Să generăm asta. Bine, așa că avem

20355
16:05:39,520 --> 16:05:45,840
unii

20356
16:05:41,276 --> 16:05:48,400
corelații destul de ușoare. Acum, cel

20357
16:05:45,840 --> 16:05:50,560
cei care sunt așa cei care sunt

20358
16:05:48,400 --> 16:05:52,480
corelate sunt temperatura şi

20359
16:05:50,560 --> 16:05:54,080
temperatura dupoint. Alea sunt frumoase

20360
16:05:52,480 --> 16:05:56,956
corelate.

20361
16:05:54,080 --> 16:05:59,360
Deci cred că am putea argumenta că noi

20362
16:05:56,956 --> 16:06:01,756
ar trebui să renunțe la unul dintre acestea. Probabil doar

20363
16:05:59,360 --> 16:06:04,560
temperatura dupoint pe care am putea scădea.

20364
16:06:01,756 --> 16:06:06,720
E o corelație foarte mare

20365
16:06:04,560 --> 16:06:08,796
chiar aici.

20366
16:06:06,720 --> 16:06:10,956
Lasă-mă să-l desenez în roșu. Asta e asta

20367
16:06:08,796 --> 16:06:12,880
asta aici

20368
16:06:10,956 --> 16:06:14,880
care este temperatura Dupoint împotriva

20369
16:06:12,880 --> 16:06:16,796
temperatura normală. Asta e super

20370
16:06:14,880 --> 16:06:20,480
înalt. 0,91

20371
16:06:16,796 --> 16:06:22,080
este aproape o corelație una.

20372
16:06:20,480 --> 16:06:24,560
Deci, acesta este un candidat bun

20373
16:06:22,080 --> 16:06:26,720
scăpat. Uh, unul dintre acei tipi, aș face-o

20374
16:06:24,560 --> 16:06:30,320
argumentați probabil temperatura Dupoint

20375
16:06:26,720 --> 16:06:31,756
am putea scăpa de cădere. Hm, și

20376
16:06:30,320 --> 16:06:36,240
păstrați doar temperatura normală

20377
16:06:31,756 --> 16:06:38,480
pentru că sunt aproape identice. Hm, dacă

20378
16:06:36,240 --> 16:06:40,320
cobori aici,

20379
16:06:38,480 --> 16:06:42,880
ziua saptamanii si weekendul sunt

20380
16:06:40,320 --> 16:06:44,160
corelate. Hm, și asta are sens.

20381
16:06:42,880 --> 16:06:47,360
Este o corelație destul de puternică

20382
16:06:44,160 --> 16:06:48,796
pentru că desigur dacă depinde de

20383
16:06:47,360 --> 16:06:52,560
ce zi a săptămânii este, este

20384
16:06:48,796 --> 16:06:54,160
weekend sau nu. Deci am putea merge și noi

20385
16:06:52,560 --> 16:06:55,596
ar putea merge înainte și să renunțe la ziua

20386
16:06:54,160 --> 16:06:58,320
coloana saptamanii daca am vrut pentru ca

20387
16:06:55,596 --> 16:07:00,320
am dedus deja weekendul

20388
16:06:58,320 --> 16:07:02,560
caracteristică care este o caracteristică mai simplă. este

20389
16:07:00,320 --> 16:07:07,200
este weekend sau nu este weekend?

20390
16:07:02,560 --> 16:07:09,756
Deci probabil că am putea renunța la ziua săptămânii

20391
16:07:07,200 --> 16:07:12,400
si fii bine. E destul de puternic

20392
16:07:09,756 --> 16:07:14,160
corelație. În rest, totul este frumos

20393
16:07:12,400 --> 16:07:16,080
slab. Nu văd niciun alt puternic

20394
16:07:14,160 --> 16:07:18,640
corelații

20395
16:07:16,080 --> 16:07:21,360
uh neaparat.

20396
16:07:18,640 --> 16:07:23,360
Um asa

20397
16:07:21,360 --> 16:07:24,956
ceea ce pare destul de rezonabil este că noi

20398
16:07:23,360 --> 16:07:27,916
am putea scăpa de noi am putea scăpa

20399
16:07:24,956 --> 16:07:30,720
acesta și am putea scăpa de zi de

20400
16:07:27,916 --> 16:07:32,160
săptămâna și probabil să fie bine,

20401
16:07:30,720 --> 16:07:34,880
nu? Acestea sunt destul de puternice

20402
16:07:32,160 --> 16:07:38,200
corelații. este 08 și 0,91.

20403
16:07:34,880 --> 16:07:38,200
Destul de puternic.

20404
16:07:42,080 --> 16:07:46,796
Bine. Ați fost capabili să o conduceți pe aia

20405
16:07:43,596 --> 16:07:48,000
și vezi harta căldurii uh? Și face

20406
16:07:46,796 --> 16:07:51,000
care au sens pe baza a ceea ce sunt

20407
16:07:48,000 --> 16:07:51,000
spunând?

20408
16:07:52,000 --> 16:07:56,880
Deci, vrem să rulăm harta termică

20409
16:07:55,040 --> 16:07:58,160
și trece în acea corelație. Iar noi

20410
16:07:56,880 --> 16:08:00,320
vreau să ne asigurăm că transformăm acest lucru în adevărat

20411
16:07:58,160 --> 16:08:04,400
pentru a face doar caracteristicile numerice. Şi

20412
16:08:00,320 --> 16:08:10,040
apoi aceasta la adevărat pentru a arăta valoarea

20413
16:08:04,400 --> 16:08:10,040
pe uh pe harta termică.

20414
16:08:25,276 --> 16:08:29,080
capabil să o conducă pe aia.

20415
16:08:32,956 --> 16:08:35,956
Mare.

20416
16:08:47,680 --> 16:08:50,680
Bine.

20417
16:08:54,400 --> 16:08:57,596
E o întrebare bună. Oricare

20418
16:08:56,480 --> 16:09:00,320
recomandare despre cum să alegeți între

20419
16:08:57,596 --> 16:09:04,400
cei doi? Uh,

20420
16:09:00,320 --> 16:09:05,756
nu chiar. cred eu

20421
16:09:04,400 --> 16:09:08,400
Nu cred că contează cu adevărat. Dacă

20422
16:09:05,756 --> 16:09:11,596
sunt corelate unul cu celălalt, atunci

20423
16:09:08,400 --> 16:09:13,916
inclusiv unul dintre ei,

20424
16:09:11,596 --> 16:09:15,436
um, inclusiv unul dintre ei ar trebui să dea

20425
16:09:13,916 --> 16:09:17,116
tu aceleași informații ca și celălalt,

20426
16:09:15,436 --> 16:09:19,436
mai ales dacă sunt într-adevăr corelate.

20427
16:09:17,116 --> 16:09:21,520
Deci, nu contează prea mult.

20428
16:09:19,436 --> 16:09:24,560
Hm

20429
16:09:21,520 --> 16:09:26,400
modul în care aș alege este să gândesc

20430
16:09:24,560 --> 16:09:30,796
cam așa cum vă voi da un exemplu în

20431
16:09:26,400 --> 16:09:34,480
această zi a săptămânii față de weekend. Hm noi

20432
16:09:30,796 --> 16:09:36,640
aș putea să argumentez drop zi din săptămână

20433
16:09:34,480 --> 16:09:39,276
pentru că weekendul este mai simplu

20434
16:09:36,640 --> 16:09:40,880
caracteristică. Este doar zero sau unu și

20435
16:09:39,276 --> 16:09:42,400
care este direct derivat din ziua de

20436
16:09:40,880 --> 16:09:47,116
saptamana.

20437
16:09:42,400 --> 16:09:48,880
Deci are mai puțină complexitate. este

20438
16:09:47,116 --> 16:09:51,596
o caracteristică puțin mai simplă și eu

20439
16:09:48,880 --> 16:09:53,436
cred că asta face mai ușor să lucrezi.

20440
16:09:51,596 --> 16:09:57,116
um,

20441
16:09:53,436 --> 16:09:59,756
dar adevărul este că am putea face

20442
16:09:57,116 --> 16:10:02,956
ambele variante si incearca-le si

20443
16:09:59,756 --> 16:10:05,360
evaluează rezultatele, nu? Deci, bine să

20444
16:10:02,956 --> 16:10:07,520
să fim cu adevărat minuțioși, ceea ce am putea

20445
16:10:05,360 --> 16:10:09,680
este să construim un model în care am scăpat

20446
16:10:07,520 --> 16:10:11,116
acesta și faceți evaluarea și apoi

20447
16:10:09,680 --> 16:10:14,796
întoarce-te și construiește un model acolo unde am fost

20448
16:10:11,116 --> 16:10:17,436
l-am lăsat pe acesta și facem evaluarea.

20449
16:10:14,796 --> 16:10:19,680
Corect? Deci, acesta este modul potrivit de a face asta

20450
16:10:17,436 --> 16:10:21,436
este să construim de fapt ambele modele

20451
16:10:19,680 --> 16:10:24,916
cu fiecare scăpat și vezi care

20452
16:10:21,436 --> 16:10:24,916
se comporta mai bine.

20453
16:10:28,240 --> 16:10:33,520
Altfel, tind să prefer să merg

20454
16:10:31,436 --> 16:10:37,160
pentru simplitate orice are fel

20455
16:10:33,520 --> 16:10:37,160
dintr-un interval inferior.

20456
16:10:39,840 --> 16:10:42,640
Dar adevărul este că dacă sunt, dacă sunt

20457
16:10:41,360 --> 16:10:44,720
într-adevăr puternic corelat, nu este

20458
16:10:42,640 --> 16:10:45,840
va conta prea mult. Uh pentru că

20459
16:10:44,720 --> 16:10:48,720
iti vor da la fel

20460
16:10:45,840 --> 16:10:51,276
informatii, nu? Pentru că ei sunt

20461
16:10:48,720 --> 16:10:53,200
atât de puternic corelate. Ca dacă aș intra

20462
16:10:51,276 --> 16:10:54,956
aceste date, ca și cum aș cunoaște

20463
16:10:53,200 --> 16:10:57,116
temperatura, știu cam ce

20464
16:10:54,956 --> 16:10:59,916
Temperatura Dupoint va fi.

20465
16:10:57,116 --> 16:11:01,840
Sunt atât de corelate.

20466
16:10:59,916 --> 16:11:05,480
Deci nu contează, nu contează

20467
16:11:01,840 --> 16:11:05,480
pe care o scap

20468
16:11:09,276 --> 16:11:13,880
dar da prefer să merg pentru

20469
16:11:10,880 --> 16:11:13,880
simplitate.

20470
16:11:16,796 --> 16:11:23,116
Bine.

20471
16:11:18,640 --> 16:11:25,276
Mă întorc să facem asta

20472
16:11:23,116 --> 16:11:28,000
complot acum a distribuţiei de

20473
16:11:25,276 --> 16:11:30,560
număr de biciclete închiriate. Așa ar trebui să fie

20474
16:11:28,000 --> 16:11:32,080
aruncând o privire la

20475
16:11:30,560 --> 16:11:35,116
um

20476
16:11:32,080 --> 16:11:38,720
cel inchiriat

20477
16:11:35,116 --> 16:11:41,720
numărarea bicicletelor și apoi doar făcând a

20478
16:11:38,720 --> 16:11:41,720
histogramă

20479
16:11:43,276 --> 16:11:50,956
și putem vedea care este distribuția

20480
16:11:45,596 --> 16:11:53,436
este. Cea mai mare parte este mai puțin de 250.

20481
16:11:50,956 --> 16:11:56,000
Hm, dar există niște valori care sunt

20482
16:11:53,436 --> 16:11:59,040
foarte mare, nu? Sunt câteva zile

20483
16:11:56,000 --> 16:12:03,116
care se dovedesc a fi peste 3.000 în

20484
16:11:59,040 --> 16:12:05,596
Gama 3500. E destul de puțin, dar

20485
16:12:03,116 --> 16:12:08,640
majoritatea zilelor sunt stivuite aici

20486
16:12:05,596 --> 16:12:10,956
în aceasta găleată de 250. Deci, de departe

20487
16:12:08,640 --> 16:12:14,160
asta e cel mai mult. Și apoi cam așa

20488
16:12:10,956 --> 16:12:17,200
scade de acolo. Cele mai multe valori sunt în

20489
16:12:14,160 --> 16:12:20,200
acea gamă și apoi cam așa

20490
16:12:17,200 --> 16:12:20,200
decline.

20491
16:12:22,160 --> 16:12:27,360
Deci asta ar trebui să fie atât de simplu

20492
16:12:24,080 --> 16:12:31,240
histograma aici.

20493
16:12:27,360 --> 16:12:31,240
Deci acesta este

20494
16:12:34,560 --> 16:12:37,560
histogramă.

20495
16:12:38,080 --> 16:12:42,360
Ar trebui să fie unul simplu de construit.

20496
16:12:44,640 --> 16:12:47,640
Au fost

20497
16:12:50,796 --> 16:12:54,756
voi băieți, sunteți în stare să o conduceți?

20498
16:13:00,720 --> 16:13:05,200
Dulce.

20499
16:13:02,560 --> 16:13:06,796
Bine, destul de simplu. Doar ne arată cum

20500
16:13:05,200 --> 16:13:09,436
este distribuit. Și am cam observat

20501
16:13:06,796 --> 16:13:11,436
că cea mai mare parte este în găleata de 250 sau

20502
16:13:09,436 --> 16:13:14,000
mai jos. Dar există o sumă bună

20503
16:13:11,436 --> 16:13:16,560
acolo dincolo ca în 500,

20504
16:13:14,000 --> 16:13:18,320
7500.000

20505
16:13:16,560 --> 16:13:20,480
um

20506
16:13:18,320 --> 16:13:23,200
până acolo sunt câteva zile în care

20507
16:13:20,480 --> 16:13:24,796
înregistrează-te cu un 3.000 și peste, nu?

20508
16:13:23,200 --> 16:13:27,796
3500.

20509
16:13:24,796 --> 16:13:27,796
Deci,

20510
16:13:31,840 --> 16:13:35,756
de fapt, am putut să ne uităm, nu am făcut-o

20511
16:13:33,756 --> 16:13:38,320
asta, dar ar putea merita să facem noi

20512
16:13:35,756 --> 16:13:42,520
ar putea privi la descrie pentru că noi

20513
16:13:38,320 --> 16:13:42,520
nu s-a uitat niciodată la maxim.

20514
16:13:42,560 --> 16:13:47,596
um,

20515
16:13:44,720 --> 16:13:50,480
Deci, pentru numărul de biciclete, există câteva

20516
16:13:47,596 --> 16:13:56,360
zile care sunt zero

20517
16:13:50,480 --> 16:13:56,360
iar maximul este de 3500. 3556

20518
16:13:56,560 --> 16:14:02,000
iar mediana este în jur de 500 de biciclete.

20519
16:14:00,080 --> 16:14:06,116
Hm

20520
16:14:02,000 --> 16:14:06,116
media în jur de 700.

20521
16:14:18,796 --> 16:14:23,560
Deci asta este doar descrierea noastră obișnuită

20522
16:14:30,560 --> 16:14:36,480
Bine, să vedem ce altceva. Uh,

20523
16:14:34,720 --> 16:14:41,720
trasează histograma tuturor numerelor

20524
16:14:36,480 --> 16:14:41,720
caracteristici. Deci, hai să facem asta.

20525
16:14:48,080 --> 16:14:54,240
Deci, din fericire, avem o scurtătură de făcut

20526
16:14:51,756 --> 16:15:01,116
aceasta. Dacă vă amintiți, avem noi

20527
16:14:54,240 --> 16:15:03,436
SNS um pereche complot și putem trece în nostru

20528
16:15:01,116 --> 16:15:07,040
uh datele noastre

20529
16:15:03,436 --> 16:15:10,880
are dreptul nostru, așa că putem trece asta.

20530
16:15:07,040 --> 16:15:14,400
Um, deci asta este un fel de frumos, acesta este un

20531
16:15:10,880 --> 16:15:17,680
lucru frumos de rulat care va genera

20532
16:15:14,400 --> 16:15:19,116
uh, diagramele de dispersie ale tuturor

20533
16:15:17,680 --> 16:15:21,596
trăsături unul împotriva celuilalt fel de fel

20534
16:15:19,116 --> 16:15:24,000
corelația dar în același timp

20535
16:15:21,596 --> 16:15:26,480
produce histogramele pe diagonală.

20536
16:15:24,000 --> 16:15:29,200
Corect? Deci, acesta ar trebui să fie un complot frumos

20537
16:15:26,480 --> 16:15:34,200
pentru a vedea toate histogramele

20538
16:15:29,200 --> 16:15:34,200
uh într-un fel de uh grilă.

20539
16:16:00,400 --> 16:16:04,040
Doar asta.

20540
16:16:15,596 --> 16:16:20,160
Bine, atât de drăguț, evident, este destul de bine

20541
16:16:18,640 --> 16:16:23,436
un pic de date, dar acestea sunt toate

20542
16:16:20,160 --> 16:16:25,040
caracteristici unul împotriva celuilalt. Uită-te la

20543
16:16:23,436 --> 16:16:26,560
aceasta. Adică, câteva lucruri pe care le vezi

20544
16:16:25,040 --> 16:16:27,916
imediat este uita-te la cele care sunt

20545
16:16:26,560 --> 16:16:29,360
într-adevăr foarte corelat ca

20546
16:16:27,916 --> 16:16:32,320
temperatura față de Dupoint

20547
16:16:29,360 --> 16:16:34,640
temperatura. Vedeți așa de puternic?

20548
16:16:32,320 --> 16:16:37,520
corelatie aici?

20549
16:16:34,640 --> 16:16:39,360
Deci, acesta este un foarte indicativ pentru a

20550
16:16:37,520 --> 16:16:40,880
corelație foarte puternică, nu? Asta e

20551
16:16:39,360 --> 16:16:42,480
temperatura față de Dupoint

20552
16:16:40,880 --> 16:16:45,520
temperatura. Asa are sens

20553
16:16:42,480 --> 16:16:47,756
că a fost 0,91

20554
16:16:45,520 --> 16:16:50,756
corelație. Deci, desigur, este ca

20555
16:16:47,756 --> 16:16:50,756
că.

20556
16:16:51,360 --> 16:16:56,240
Bineînțeles că așa arată, nu? Uh

20557
16:16:53,916 --> 16:16:58,640
doar o corelație foarte puternică pe on

20558
16:16:56,240 --> 16:17:00,080
axa x sau scuze pe diagonală este

20559
16:16:58,640 --> 16:17:04,796
toate histogramele. Sunt un pic

20560
16:17:00,080 --> 16:17:07,276
micșorat atât de greu de văzut. Hm dar

20561
16:17:04,796 --> 16:17:10,880
um ne putem da o idee despre cum unele dintre

20562
16:17:07,276 --> 16:17:12,560
acestea sunt distribuite ca prima

20563
16:17:10,880 --> 16:17:15,116
uh

20564
16:17:12,560 --> 16:17:17,596
scuze primul

20565
16:17:15,116 --> 16:17:20,320
care este numărul de mușcături pe care l-am făcut deja

20566
16:17:17,596 --> 16:17:23,116
um temperatura putem vedea cum e

20567
16:17:20,320 --> 16:17:26,000
distribuit acest al treilea este un fel

20568
16:17:23,116 --> 16:17:29,680
distribuite uniform

20569
16:17:26,000 --> 16:17:33,436
rămas din scadență față de temperatură aceasta

20570
16:17:29,680 --> 16:17:36,400
acela sunt orele

20571
16:17:33,436 --> 16:17:40,240
față de momentul scadent. Deci, este amabil

20572
16:17:36,400 --> 16:17:42,000
de distribuite uniform. Hm, care ar fi

20573
16:17:40,240 --> 16:17:44,160
probabil că ar avea sens

20574
16:17:42,000 --> 16:17:45,200
deoarece aceste date sunt de doi ani.

20575
16:17:44,160 --> 16:17:48,400
Deci, vei primi o mulțime de

20576
16:17:45,200 --> 16:17:50,080
date sezoniere acolo, nu? Deci, este

20577
16:17:48,400 --> 16:17:52,956
merge la ea va varia de la fel

20578
16:17:50,080 --> 16:17:55,756
anotimpuri. Da. Deci, se pare că este

20579
16:17:52,956 --> 16:17:57,360
răspândit foarte uniform.

20580
16:17:55,756 --> 16:17:58,880
Bine. Ai reușit să-l faci pe Parpot

20581
16:17:57,360 --> 16:18:01,116
alerga?

20582
16:17:58,880 --> 16:18:02,720
Are nevoie de un moment pentru a alerga.

20583
16:18:01,116 --> 16:18:03,840
durează un moment, dar produce tot

20584
16:18:02,720 --> 16:18:05,756
aceste parcele, inclusiv toate

20585
16:18:03,840 --> 16:18:07,520
histogramelor.

20586
16:18:05,756 --> 16:18:09,116
Și din nou, dacă am vrut să mărim

20587
16:18:07,520 --> 16:18:11,596
orice histogramă, am putea

20588
16:18:09,116 --> 16:18:13,360
face asta. Trebuie doar să copiem

20589
16:18:11,596 --> 16:18:15,276
și lipiți acest cod și schimbați-l

20590
16:18:13,360 --> 16:18:18,880
caracteristică. Schimbați această funcție și

20591
16:18:15,276 --> 16:18:21,436
putem obține o diagramă mărită de oricare

20592
16:18:18,880 --> 16:18:23,116
una dintre acele caracteristici precum

20593
16:18:21,436 --> 16:18:27,116
temperatura

20594
16:18:23,116 --> 16:18:28,720
um sau vizibilitatea sau orice ar fi.

20595
16:18:27,116 --> 16:18:31,360
Deci, ceea ce vreau să fac, cred că vom face

20596
16:18:28,720 --> 16:18:33,116
mai ia o pauză aici. Hm, și apoi

20597
16:18:31,360 --> 16:18:35,756
ceea ce vom face este să ne întoarcem și

20598
16:18:33,116 --> 16:18:37,116
termină doar practica noastră. Hm, eu sunt

20599
16:18:35,756 --> 16:18:38,796
urmează să înceapă construirea modelului. eu

20600
16:18:37,116 --> 16:18:42,000
știi că vrea să facem ceva suplimentar

20601
16:18:38,796 --> 16:18:44,956
complotând. Hm, dar vreau să ajung

20602
16:18:42,000 --> 16:18:49,916
în principal elementele de trasare, inclusiv

20603
16:18:44,956 --> 16:18:52,000
făcând conducta încă o dată. Um, deci

20604
16:18:49,916 --> 16:18:53,916
asta o să facem. Hm, mergem

20605
16:18:52,000 --> 16:18:56,560
pentru a exersa construirea conductei în

20606
16:18:53,916 --> 16:18:59,276
o modă asemănătoare cu exact cum noi

20607
16:18:56,560 --> 16:19:00,640
a construit conducta mai devreme și apoi faceți

20608
16:18:59,276 --> 16:19:02,080
ne vom construi modelele şi

20609
16:19:00,640 --> 16:19:04,080
o să exersăm asta în viitor.

20610
16:19:02,080 --> 16:19:06,720
Probabil că îți voi lăsa complotul

20611
16:19:04,080 --> 16:19:08,956
băieți să faceți ca un fel de teme dacă voi

20612
16:19:06,720 --> 16:19:11,116
vreau sa fac asta. Hm, doar pentru că vreau

20613
16:19:08,956 --> 16:19:13,040
pentru a ajunge la la modelare. salut si

20614
16:19:11,116 --> 16:19:15,360
bun venit la tutorialul de învățare automată

20615
16:19:13,040 --> 16:19:18,160
prima parte. Aceasta este prima parte a unei mașini

20616
16:19:15,360 --> 16:19:20,080
seria de învățare realizată de SimplyLearn.

20617
16:19:18,160 --> 16:19:21,276
Numele meu este Richard Kersner. Sunt cu

20618
16:19:20,080 --> 16:19:23,840
Echipa SimplyLearn. Asta e

20619
16:19:21,276 --> 16:19:26,560
www.simplearn.com.

20620
16:19:23,840 --> 16:19:28,560
Obțineți certificare, treceți înainte. Ce este în el

20621
16:19:26,560 --> 16:19:30,956
pentru tine azi? Ei bine, vom începe

20622
16:19:28,560 --> 16:19:32,956
cu o scurtă explicație a motivului pentru mașină

20623
16:19:30,956 --> 16:19:34,240
învățarea și ce este învățarea automată.

20624
16:19:32,956 --> 16:19:35,756
Și apoi vom intra în câteva dintre

20625
16:19:34,240 --> 16:19:38,400
tipuri de învățare automată. mașină

20626
16:19:35,756 --> 16:19:41,116
algoritmi de învățare, regresie liniară,

20627
16:19:38,400 --> 16:19:43,040
arbori de decizie, mașină vectorială de suport,

20628
16:19:41,116 --> 16:19:44,796
și, în sfârșit, vom face un caz de utilizare în care

20629
16:19:43,040 --> 16:19:47,040
vom clasifica dacă o rețetă

20630
16:19:44,796 --> 16:19:49,436
este o brioșă sau o brioșă folosind

20631
16:19:47,040 --> 16:19:51,520
SPM sau mașina de suport vector.

20632
16:19:49,436 --> 16:19:53,596
Pare un mod delicios de a explora

20633
16:19:51,520 --> 16:19:55,276
învățarea automată. Deci, de ce mașină

20634
16:19:53,596 --> 16:19:57,040
invatare? De ce ne pasă

20635
16:19:55,276 --> 16:19:59,436
având aceste computere să apară și să fie

20636
16:19:57,040 --> 16:20:01,596
capabil să facă toate aceste lucruri noi pentru noi?

20637
16:19:59,436 --> 16:20:03,596
Ei bine, pentru că acum mașinile pot conduce

20638
16:20:01,596 --> 16:20:05,756
mașina ta pentru tine. încă foarte în

20639
16:20:03,596 --> 16:20:08,720
stadiul bebelușului dar doar explodează ca

20640
16:20:05,756 --> 16:20:10,240
vedem cu Whimo de la Google și apoi

20641
16:20:08,720 --> 16:20:12,320
Uber avea programul lor care

20642
16:20:10,240 --> 16:20:13,680
s-a prăbușit din păcate. Ei știu asta

20643
16:20:12,320 --> 16:20:15,680
asta este imens. Acesta va fi

20644
16:20:13,680 --> 16:20:18,240
industrie uriașă pentru a ne schimba întregul

20645
16:20:15,680 --> 16:20:20,160
infrastructura de transport. Masina

20646
16:20:18,240 --> 16:20:22,160
Învățarea este acum folosită pentru a detecta peste 50

20647
16:20:20,160 --> 16:20:24,080
boli ale ochilor. Știi cât de uimitor

20648
16:20:22,160 --> 16:20:25,756
adică să ai un computer care să se dubleze

20649
16:20:24,080 --> 16:20:27,840
verificări pentru medic pentru lucrurile pe care le

20650
16:20:25,756 --> 16:20:29,520
ar putea rata? Asta e uriaș în

20651
16:20:27,840 --> 16:20:30,880
industria sanatatii. destul de curând ei

20652
16:20:29,520 --> 16:20:33,040
de fapt, am deja asta cu in

20653
16:20:30,880 --> 16:20:34,720
unele zone unde poate nu pentru ochi dar

20654
16:20:33,040 --> 16:20:36,480
pentru alte boli pe care le folosesc

20655
16:20:34,720 --> 16:20:38,160
camera de pe telefonul dvs. pentru a vă ajuta

20656
16:20:36,480 --> 16:20:40,560
pre-diagnosticați înainte de a intra și a vedea

20657
16:20:38,160 --> 16:20:43,276
doctorul. Și pentru că mașina poate

20658
16:20:40,560 --> 16:20:44,796
acum deblochează telefonul cu fața ta, eu

20659
16:20:43,276 --> 16:20:47,200
Adică, e mișto să fii

20660
16:20:44,796 --> 16:20:49,040
capabil să-ți identifice fața sau vocea

20661
16:20:47,200 --> 16:20:50,400
și să poată porni și dezactiva lucrurile pentru

20662
16:20:49,040 --> 16:20:52,560
tu în funcție de locul în care te afli și

20663
16:20:50,400 --> 16:20:55,040
ceea ce ai nevoie. Vorbește despre un final

20664
16:20:52,560 --> 16:20:57,436
automatizare lumea noastră în care trăim. Și ca

20665
16:20:55,040 --> 16:20:59,840
săpăm mai adânc, avem un exemplu frumos

20666
16:20:57,436 --> 16:21:01,916
de Facebook. După cum puteți vedea aici, ei

20667
16:20:59,840 --> 16:21:04,796
au postarea pe Facebook cu Halloween.

20668
16:21:01,916 --> 16:21:07,040
Comentați da dacă doriți să comandați aici.

20669
16:21:04,796 --> 16:21:09,680
Nimănui nu-i plac postările de spam de pe Facebook

20670
16:21:07,040 --> 16:21:12,160
enervează-i să interacționeze cu aprecieri,

20671
16:21:09,680 --> 16:21:13,840
partajări, comentarii și alte acțiuni. eu

20672
16:21:12,160 --> 16:21:16,240
amintiți-vă că cele originale au fost toate dacă

20673
16:21:13,840 --> 16:21:18,956
nu dai click aici, vei avea

20674
16:21:16,240 --> 16:21:20,720
ghinion sau un fel de factor de frică.

20675
16:21:18,956 --> 16:21:22,400
Ei bine, acesta este un lucru imens într-un social

20676
16:21:20,720 --> 16:21:25,436
mass-media atunci când oamenii primesc spam.

20677
16:21:22,400 --> 16:21:27,596
Și astfel această tactică cunoscută sub numele de angajament

20678
16:21:25,436 --> 16:21:29,596
momeala profită de Facebook-ul

20679
16:21:27,596 --> 16:21:31,436
algoritm pentru fluxul de știri prin alegere

20680
16:21:29,596 --> 16:21:34,480
angajament pentru a deveni mai mare

20681
16:21:31,436 --> 16:21:36,320
ajunge. Pentru a elimina momeala de angajament, the

20682
16:21:34,480 --> 16:21:38,080
companie revizuită și clasificată

20683
16:21:36,320 --> 16:21:39,756
sute de mii de posturi de antrenat

20684
16:21:38,080 --> 16:21:41,520
un model de învățare automată care detectează

20685
16:21:39,756 --> 16:21:42,796
diferite tipuri de momeală de logodnă. Deci

20686
16:21:41,520 --> 16:21:44,320
în acest caz, avem pe care le folosim

20687
16:21:42,796 --> 16:21:46,080
Facebook, dar acest lucru este desigur peste tot

20688
16:21:44,320 --> 16:21:47,596
toate rețelele sociale diferite. ei

20689
16:21:46,080 --> 16:21:50,560
au instrumente diferite se construiesc și

20690
16:21:47,596 --> 16:21:52,880
gif-ul derulant de pe Facebook va fi înlocuit

20691
16:21:50,560 --> 16:21:54,720
un fel ca un virus care vine acolo și

20692
16:21:52,880 --> 16:21:56,320
observă că există o anumită configurație

20693
16:21:54,720 --> 16:21:59,680
cu Facebook și poate înlocui

20694
16:21:56,320 --> 16:22:01,916
aceasta și au ca și reacția de momeală la vot

20695
16:21:59,680 --> 16:22:03,040
momeală cotă momeală au toate

20696
16:22:01,916 --> 16:22:05,116
astea diferite astea sunt un fel

20697
16:22:03,040 --> 16:22:06,560
titluri generale, dar cu siguranță există o

20698
16:22:05,116 --> 16:22:08,720
multe moduri de a te momeli să intri acolo

20699
16:22:06,560 --> 16:22:10,796
și faceți clic pe ceva, astfel încât să-i hrănească pe toți

20700
16:22:08,720 --> 16:22:12,560
aceste date au fost introduse în mașină

20701
16:22:10,796 --> 16:22:14,640
și apoi au noul post nou

20702
16:22:12,560 --> 16:22:16,240
apare post care preia o parte din

20703
16:22:14,640 --> 16:22:17,200
configurarea Facebook și asta este

20704
16:22:16,240 --> 16:22:19,040
te uiti la. Te uiți la

20705
16:22:17,200 --> 16:22:20,480
această nouă postare care a fost înlocuită ca un

20706
16:22:19,040 --> 16:22:22,480
virusul a înlocuit-o. Deci ce

20707
16:22:20,480 --> 16:22:24,400
Facebook a făcut pentru a elimina acest lucru

20708
16:22:22,480 --> 16:22:26,560
începeți să căutați cuvinte cheie și expresii

20709
16:22:24,400 --> 16:22:28,240
ca asta și verifică clicul

20710
16:22:26,560 --> 16:22:30,160
rata. Așa că începe să caute oameni

20711
16:22:28,240 --> 16:22:32,400
care fac clic prin el fără măcar

20712
16:22:30,160 --> 16:22:33,520
privindu-l sau făcând clic prin el și

20713
16:22:32,400 --> 16:22:35,596
nu este ceva ce ar fi în mod normal

20714
16:22:33,520 --> 16:22:37,840
fi făcut clic. Odată ce Facebook are

20715
16:22:35,596 --> 16:22:40,480
scanate pentru aceste cuvinte cheie și expresii,

20716
16:22:37,840 --> 16:22:42,320
acum este capabil să identifice spam-ul

20717
16:22:40,480 --> 16:22:44,080
intră și asta îți face viața

20718
16:22:42,320 --> 16:22:45,916
mai usor. Deci nu ești spam.

20719
16:22:44,080 --> 16:22:47,596
Nu este ca și cum te-ai plimba printr-un aeroport

20720
16:22:45,916 --> 16:22:48,880
si in multe tari ai like

20721
16:22:47,596 --> 16:22:51,040
sute de oameni care încearcă să te vândă

20722
16:22:48,880 --> 16:22:52,720
cota de timp. Vino alături de noi. Înscrieți-vă pentru

20723
16:22:51,040 --> 16:22:54,880
aceasta. Elimina acea enervare. Aşa

20724
16:22:52,720 --> 16:22:56,640
acum vă puteți bucura de Facebook și

20725
16:22:54,880 --> 16:22:58,720
pozele cu pisica ta. Sau poate este al tău

20726
16:22:56,640 --> 16:23:00,240
poze de familie. A mea este familia.

20727
16:22:58,720 --> 16:23:02,720
Cu siguranță oamenilor le plac pozele cu pisicile lor

20728
16:23:00,240 --> 16:23:05,756
de asemenea. Un alt exemplu bun este Google

20729
16:23:02,720 --> 16:23:07,840
Proiectul Deep Mind Alph Go. Un computer

20730
16:23:05,756 --> 16:23:09,916
program care joacă un joc de masă pe care Go are

20731
16:23:07,840 --> 16:23:12,080
a învins numărul unu din lume

20732
16:23:09,916 --> 16:23:14,880
jucător și sper să-i spun numele corect.

20733
16:23:12,080 --> 16:23:18,560
Kijiji cel mai bun joc de provocare go a

20734
16:23:14,880 --> 16:23:20,000
trei din trei a fost pe 27 mai 2017 deci

20735
16:23:18,560 --> 16:23:22,480
tocmai anul trecut asta

20736
16:23:20,000 --> 16:23:25,200
s-a întâmplat și ce face ca asta să fie așa

20737
16:23:22,480 --> 16:23:26,956
important este să știi că mergi este doar este

20738
16:23:25,200 --> 16:23:29,116
un joc deci nu este ca și cum ai conduce un

20739
16:23:26,956 --> 16:23:32,796
mașină sau ceva în lumea noastră reală dar

20740
16:23:29,116 --> 16:23:35,116
folosesc jocuri pentru a învăța cum să obțină

20741
16:23:32,796 --> 16:23:36,880
programul de învățare automată pentru a învăța

20742
16:23:35,116 --> 16:23:39,040
vor ca ea să înveţe cum să înveţe şi

20743
16:23:36,880 --> 16:23:40,956
este un pas uriaș, multe din acestea sunt

20744
16:23:39,040 --> 16:23:41,840
încă în stadiul ei infantil în măsura în care

20745
16:23:40,956 --> 16:23:44,320
dezvoltare

20746
16:23:41,840 --> 16:23:46,796
după cum am văzut ce sa întâmplat cu ca I

20747
16:23:44,320 --> 16:23:48,560
la care sa referit mai devreme mașinile Uber. Ei

20748
16:23:46,796 --> 16:23:50,720
și-au pierdut toată divizia pentru că ei

20749
16:23:48,560 --> 16:23:52,956
a sărit înainte prea repede. Deci încă un

20750
16:23:50,720 --> 16:23:55,436
stadiul de copil, dar băiatul este ca acesta

20751
16:23:52,956 --> 16:23:57,276
începutul unei lumi uimitoare care

20752
16:23:55,436 --> 16:23:59,040
este automatizat în moduri în care nici măcar nu putem

20753
16:23:57,276 --> 16:24:01,116
imaginează-ți cum va arăta mâine

20754
16:23:59,040 --> 16:24:03,040
ca. Ne-am uitat la o mulțime de exemple

20755
16:24:01,116 --> 16:24:05,040
de învățare automată. Deci, să vedem dacă noi

20756
16:24:03,040 --> 16:24:08,000
poate da un pic mai mult de beton

20757
16:24:05,040 --> 16:24:09,520
definiție. Ce este învățarea automată?

20758
16:24:08,000 --> 16:24:11,436
Învățarea automată este știința

20759
16:24:09,520 --> 16:24:13,916
făcând computerele să învețe și să se comporte ca

20760
16:24:11,436 --> 16:24:16,480
oameni prin hrănirea cu date și informații

20761
16:24:13,916 --> 16:24:17,916
fără a fi programat în mod explicit. Şi

20762
16:24:16,480 --> 16:24:19,596
vedem aici că avem un pic drăguț

20763
16:24:17,916 --> 16:24:22,400
diagramă în care avem obișnuitul nostru

20764
16:24:19,596 --> 16:24:24,160
sistem, computerul dvs. din zilele noastre, puteți

20765
16:24:22,400 --> 16:24:25,520
chiar să ruleze o mulțime de lucruri pe o celulă

20766
16:24:24,160 --> 16:24:27,520
telefon pentru că telefoanele mobile au avansat

20767
16:24:25,520 --> 16:24:29,756
atât de mult. Și apoi cu artificial

20768
16:24:27,520 --> 16:24:32,000
inteligență și învățare automată, ea

20769
16:24:29,756 --> 16:24:33,916
acum ia datele și învață din

20770
16:24:32,000 --> 16:24:36,080
ce sa întâmplat înainte și apoi

20771
16:24:33,916 --> 16:24:38,160
prezice ce va urma. Şi

20772
16:24:36,080 --> 16:24:39,840
atunci într-adevăr cea mai mare parte chiar acum

20773
16:24:38,160 --> 16:24:42,480
în învățarea automată care se întâmplă este

20774
16:24:39,840 --> 16:24:45,436
se îmbunătățește la asta. Cum găsim un

20775
16:24:42,480 --> 16:24:46,880
solutie noua? Deci trecem de la descriptiv

20776
16:24:45,436 --> 16:24:48,720
unde se învață despre lucruri și

20777
16:24:46,880 --> 16:24:50,480
înțelegerea modului în care se potrivește

20778
16:24:48,720 --> 16:24:52,560
prezicând ce va face

20779
16:24:50,480 --> 16:24:55,040
postcriptare care vine cu un nou

20780
16:24:52,560 --> 16:24:56,956
solutie. Și când lucrăm

20781
16:24:55,040 --> 16:24:58,640
învățare automată, există o serie de

20782
16:24:56,956 --> 16:25:00,796
diferite diagrame pe care le au oamenii

20783
16:24:58,640 --> 16:25:03,596
postat pentru ce pași trebuie să parcurgeți. A

20784
16:25:00,796 --> 16:25:05,840
multe dintre ele ar putea fi foarte specifice domeniului.

20785
16:25:03,596 --> 16:25:08,796
Deci, dacă lucrezi la fotografie

20786
16:25:05,840 --> 16:25:11,200
identificare versus limbaj versus

20787
16:25:08,796 --> 16:25:12,640
medicale sau fizice, unele dintre acestea sunt

20788
16:25:11,200 --> 16:25:14,080
schimbat puțin sau nou

20789
16:25:12,640 --> 16:25:15,916
lucrurile sunt introduse. Sunt foarte specifice

20790
16:25:14,080 --> 16:25:17,916
la domeniu. Acesta este un fel de foarte

20791
16:25:15,916 --> 16:25:20,160
diagrama generala. În primul rând, vrei

20792
16:25:17,916 --> 16:25:21,360
definiți-vă obiectivul. Foarte important să

20793
16:25:20,160 --> 16:25:22,720
știi ce vrei să faci

20794
16:25:21,360 --> 16:25:24,480
prezice. Atunci vei fi

20795
16:25:22,720 --> 16:25:25,840
colectarea datelor. Deci, odată ce ai făcut-o

20796
16:25:24,480 --> 16:25:28,080
definit un obiectiv, trebuie

20797
16:25:25,840 --> 16:25:30,480
colectează datele care se potrivesc. Cheltuiești

20798
16:25:28,080 --> 16:25:32,796
mult timp în colectarea științei datelor

20799
16:25:30,480 --> 16:25:34,320
date și următorul pas de pregătire a

20800
16:25:32,796 --> 16:25:36,560
date. Trebuie să te asiguri că ta

20801
16:25:34,320 --> 16:25:40,400
datele sunt curate intrând. Uite vechea

20802
16:25:36,560 --> 16:25:43,116
spunând, date proaste intră, răspuns prost afară sau

20803
16:25:40,400 --> 16:25:44,720
date proaste scoase. Și apoi, odată ce ai plecat

20804
16:25:43,116 --> 16:25:47,116
și am curățat toate chestiile astea

20805
16:25:44,720 --> 16:25:49,200
venind, apoi vei selecta

20806
16:25:47,116 --> 16:25:50,640
algoritmul. Ce algoritm esti?

20807
16:25:49,200 --> 16:25:52,400
vei folosi? Ai de gând să antrenezi asta

20808
16:25:50,640 --> 16:25:54,080
algoritm. În acest caz, cred că suntem

20809
16:25:52,400 --> 16:25:56,080
va lucra cu SVM, the

20810
16:25:54,080 --> 16:25:58,480
mașină vectorială de sprijin. Atunci trebuie

20811
16:25:56,080 --> 16:26:00,640
testați modelul. Functioneaza acest model? este

20812
16:25:58,480 --> 16:26:02,320
acesta este un model valabil pentru ceea ce facem?

20813
16:26:00,640 --> 16:26:04,000
Și apoi, odată ce l-ai testat, vrei

20814
16:26:02,320 --> 16:26:06,000
pentru a-ți rula predicția. Vrei să fugi

20815
16:26:04,000 --> 16:26:07,360
predicția ta sau alegerea ta sau

20816
16:26:06,000 --> 16:26:09,840
oricare ar fi rezultatul care va apărea

20817
16:26:07,360 --> 16:26:12,080
cu. Și apoi, odată ce totul este setat

20818
16:26:09,840 --> 16:26:13,680
și atunci ai făcut multe teste

20819
16:26:12,080 --> 16:26:15,360
vrei să mergi mai departe și să implementezi

20820
16:26:13,680 --> 16:26:17,436
model. Și amintiți-vă că am spus domeniu

20821
16:26:15,360 --> 16:26:19,436
specifice. Acest lucru este foarte general în măsura în care

20822
16:26:17,436 --> 16:26:21,116
scopul de a face ceva. Multe

20823
16:26:19,436 --> 16:26:23,116
modele ajungi la jumătatea drumului și tu

20824
16:26:21,116 --> 16:26:24,880
realizați că datele dvs. lipsesc

20825
16:26:23,116 --> 16:26:26,796
ceva și trebuie să te duci să colectezi ceva nou

20826
16:26:24,880 --> 16:26:28,080
date pentru că ați efectuat un test aici

20827
16:26:26,796 --> 16:26:29,436
undeva de-a lungul liniei. Tu spui,

20828
16:26:28,080 --> 16:26:30,720
„Hei, chiar nu primesc răspunsurile

20829
16:26:29,436 --> 16:26:32,796
am nevoie." Deci, sunt o mulțime de lucruri

20830
16:26:30,720 --> 16:26:34,560
care sunt specifice domeniului care devin

20831
16:26:32,796 --> 16:26:35,916
parte a acestui model. Acesta este foarte

20832
16:26:34,560 --> 16:26:38,000
model general, dar e foarte bun

20833
16:26:35,916 --> 16:26:40,796
model pentru început. Și avem câteva

20834
16:26:38,000 --> 16:26:42,720
diviziuni de bază ale învățării automate

20835
16:26:40,796 --> 16:26:44,160
este important de știut. Pentru

20836
16:26:42,720 --> 16:26:46,000
de exemplu, vrei să prezici a

20837
16:26:44,160 --> 16:26:48,240
categorie? Ei bine, dacă faci categorisiri

20838
16:26:46,000 --> 16:26:50,080
chestia asta e clasificarea. Pentru

20839
16:26:48,240 --> 16:26:52,160
de exemplu, dacă prețul acțiunilor va

20840
16:26:50,080 --> 16:26:54,000
creste sau scade. Deci, cu alte cuvinte,

20841
16:26:52,160 --> 16:26:56,160
Caut un răspuns da nu. este

20842
16:26:54,000 --> 16:26:57,756
urcă sau coboară? Și în

20843
16:26:56,160 --> 16:26:59,916
acest caz, am spune de fapt, este

20844
16:26:57,756 --> 16:27:01,756
urcând? Adevărat. Dacă nu crește,

20845
16:26:59,916 --> 16:27:04,400
este fals, adică scade.

20846
16:27:01,756 --> 16:27:06,640
În acest fel, este un da, nu. 01. Tu

20847
16:27:04,400 --> 16:27:08,480
vrei să prezici o cantitate? Asta e

20848
16:27:06,640 --> 16:27:10,080
regresie. Așa că ține minte, tocmai am făcut-o

20849
16:27:08,480 --> 16:27:12,000
clasificare. Acum ne uităm la

20850
16:27:10,080 --> 16:27:14,000
regresie. Acestea sunt cele două majore

20851
16:27:12,000 --> 16:27:16,000
diviziuni în ceea ce fac datele. Pentru

20852
16:27:14,000 --> 16:27:18,320
de exemplu, prezicerea vârstei unei persoane

20853
16:27:16,000 --> 16:27:20,160
bazat pe înălțime, greutate, sănătate și

20854
16:27:18,320 --> 16:27:21,436
alti factori. Deci pe baza acestora

20855
16:27:20,160 --> 16:27:23,596
diferiți factori, ați putea ghici cum

20856
16:27:21,436 --> 16:27:26,720
o persoană este bătrână. Și apoi există o

20857
16:27:23,596 --> 16:27:28,880
multe lucruri specifice domeniului, cum ar fi face

20858
16:27:26,720 --> 16:27:31,116
vrei sa detectezi o anomalie? Asta e

20859
16:27:28,880 --> 16:27:32,720
detectarea anomaliilor. Acest lucru este de fapt foarte

20860
16:27:31,116 --> 16:27:33,840
popular acum. De exemplu, tu

20861
16:27:32,720 --> 16:27:34,956
doresc să detecteze retragerea de bani

20862
16:27:33,840 --> 16:27:36,560
anomalii. Vrei să știi când

20863
16:27:34,956 --> 16:27:38,400
cineva face o retragere care ar putea

20864
16:27:36,560 --> 16:27:40,080
să nu fie cont propriu. De fapt

20865
16:27:38,400 --> 16:27:42,080
a adus în discuție asta pentru că asta este cu adevărat

20866
16:27:40,080 --> 16:27:44,240
mare chiar acum. Dacă prezici

20867
16:27:42,080 --> 16:27:45,916
stoc dacă să cumpere acțiuni sau nu, tu

20868
16:27:44,240 --> 16:27:48,080
vreau să știu dacă ce se întâmplă

20869
16:27:45,916 --> 16:27:49,756
pe bursa este o anomalie,

20870
16:27:48,080 --> 16:27:51,116
utilizați un model de predicție diferit deoarece

20871
16:27:49,756 --> 16:27:53,756
se întâmplă altceva. Trebuie

20872
16:27:51,116 --> 16:27:55,436
scoateți informații noi acolo sau există

20873
16:27:53,756 --> 16:27:58,000
asta doar norma? O să-mi iau

20874
16:27:55,436 --> 16:27:59,840
rentabilitatea normală a banilor mei investiți. Deci

20875
16:27:58,000 --> 16:28:02,640
a putea detecta anomalii este foarte

20876
16:27:59,840 --> 16:28:04,796
mare în știința datelor în aceste zile. Altul

20877
16:28:02,640 --> 16:28:07,840
întrebarea care apare care este despre ce

20878
16:28:04,796 --> 16:28:10,640
numim date neantrenate este vrei

20879
16:28:07,840 --> 16:28:12,320
descoperi structura în date neexplorate

20880
16:28:10,640 --> 16:28:14,560
și asta se numește clustering. Pentru

20881
16:28:12,320 --> 16:28:16,880
de exemplu, găsirea unor grupuri de clienți

20882
16:28:14,560 --> 16:28:18,880
cu comportament similar dat un mare

20883
16:28:16,880 --> 16:28:20,956
baza de date a datelor clientilor care contine

20884
16:28:18,880 --> 16:28:23,200
demografia lor și cumpărăturile anterioare

20885
16:28:20,956 --> 16:28:25,680
înregistrări. Și în acest caz, am putea

20886
16:28:23,200 --> 16:28:27,756
observați că oricine poartă

20887
16:28:25,680 --> 16:28:29,596
un anumit set de pantofi merge la cumpărături

20888
16:28:27,756 --> 16:28:31,276
anumite magazine sau orice ar fi. sunt

20889
16:28:29,596 --> 16:28:33,436
urmeaza sa faca anumite cumparaturi. De către

20890
16:28:31,276 --> 16:28:35,276
având aceste informații, ne ajută

20891
16:28:33,436 --> 16:28:37,360
piață sau grupează oameni împreună. Deci atunci

20892
16:28:35,276 --> 16:28:39,200
acum putem explora acel grup și găsim

20893
16:28:37,360 --> 16:28:40,796
a afla ce dorim să le oferim

20894
16:28:39,200 --> 16:28:42,640
dacă ești în lumea marketingului. Şi

20895
16:28:40,796 --> 16:28:44,480
care ar putea funcționa și în aproape orice

20896
16:28:42,640 --> 16:28:47,040
arena. Poate doriți să grupați oameni

20897
16:28:44,480 --> 16:28:49,916
împreună, indiferent dacă se bazează pe

20898
16:28:47,040 --> 16:28:52,640
diferitele lor domenii și investiții

20899
16:28:49,916 --> 16:28:54,000
și fundal financiar, indiferent dacă sunteți

20900
16:28:52,640 --> 16:28:55,436
le va da un împrumut sau nu. înainte

20901
16:28:54,000 --> 16:28:57,596
chiar începi să te uiți dacă

20902
16:28:55,436 --> 16:28:58,720
sunt un client valid pentru bancă,

20903
16:28:57,596 --> 16:29:00,320
poate vrei să te uiți la toate acestea

20904
16:28:58,720 --> 16:29:02,640
zone diferite și grupați-le împreună

20905
16:29:00,320 --> 16:29:03,680
pe baza unor date necunoscute. Deci, nu ești

20906
16:29:02,640 --> 16:29:04,956
nu știi la ce vor merge datele

20907
16:29:03,680 --> 16:29:07,276
îți spun, dar vrei să grupezi oamenii

20908
16:29:04,956 --> 16:29:10,796
împreună care vin împreună. Să luăm

20909
16:29:07,276 --> 16:29:12,640
un ocol rapid pentru timpul testului. Oh, doamne

20910
16:29:10,796 --> 16:29:15,200
favorit. Deci, vom avea o

20911
16:29:12,640 --> 16:29:17,756
câteva întrebări aici sub timpul testului

20912
16:29:15,200 --> 16:29:20,956
și vom posta răspunsurile în

20913
16:29:17,756 --> 16:29:22,160
această parte a doua a acestui tutorial. Deci,

20914
16:29:20,956 --> 16:29:23,756
hai să mergem mai departe și să aruncăm o privire la acestea

20915
16:29:22,160 --> 16:29:25,200
chestionare ori întrebări și sperăm

20916
16:29:23,756 --> 16:29:27,200
le vei înțelege pe toate și va fi

20917
16:29:25,200 --> 16:29:29,520
te gândești cum să procesezi datele

20918
16:29:27,200 --> 16:29:31,916
si ce se intampla. Poți să spui ce este

20919
16:29:29,520 --> 16:29:33,040
se întâmplă în următoarele cazuri? De

20920
16:29:31,916 --> 16:29:34,720
desigur, stai acolo cu tine

20921
16:29:33,040 --> 16:29:36,240
ceașcă de cafea și ai caseta ta de selectare

20922
16:29:34,720 --> 16:29:38,240
și pixul tău încearcă să-și dea seama ce este

20923
16:29:36,240 --> 16:29:41,200
următorul tău pas în știința datelor

20924
16:29:38,240 --> 16:29:44,000
analiza. Deci, primul este gruparea

20925
16:29:41,200 --> 16:29:46,956
documente în diferite categorii

20926
16:29:44,000 --> 16:29:49,916
în funcție de tema și conținutul fiecăruia

20927
16:29:46,956 --> 16:29:52,000
document. Foarte mare zilele astea. ştii,

20928
16:29:49,916 --> 16:29:53,916
ai acte legale, ai uh

20929
16:29:52,000 --> 16:29:55,596
poate sunt documente de grup sportiv,

20930
16:29:53,916 --> 16:29:58,160
poate analizezi ziarul

20931
16:29:55,596 --> 16:30:00,160
postări, dar cu siguranță având asta

20932
16:29:58,160 --> 16:30:03,596
automatizat este un lucru imens în zilele noastre

20933
16:30:00,160 --> 16:30:06,080
lume. B, identificarea cifrelor scrise de mână

20934
16:30:03,596 --> 16:30:07,916
în imagini corect. Deci, vrem să știm

20935
16:30:06,080 --> 16:30:10,320
fie că scriu un A sau

20936
16:30:07,916 --> 16:30:11,756
A, B, C majuscule, ce scriu

20937
16:30:10,320 --> 16:30:14,956
afară în cifra lor de mână, lor

20938
16:30:11,756 --> 16:30:17,596
scris de mână. Comportamentul C al unui site web

20939
16:30:14,956 --> 16:30:21,040
indicând faptul că site-ul nu funcționează

20940
16:30:17,596 --> 16:30:24,080
așa cum este proiectat. D, estimarea salariului unui

20941
16:30:21,040 --> 16:30:27,436
individ în funcție de anii săi de

20942
16:30:24,080 --> 16:30:29,916
experiență în angajarea resurselor umane uh configurație

20943
16:30:27,436 --> 16:30:31,276
acolo. Așa că rămâneți pe fază pentru partea a doua. Vom face

20944
16:30:29,916 --> 16:30:33,360
merge mai departe și răspunde la aceste întrebări când

20945
16:30:31,276 --> 16:30:35,040
ajungem la partea a doua a acestui tutorial

20946
16:30:33,360 --> 16:30:36,880
sau pur și simplu poți scrie la

20947
16:30:35,040 --> 16:30:39,360
jos și trimiteți o notă către SimplyLearn

20948
16:30:36,880 --> 16:30:41,916
și vă vor urmări.

20949
16:30:39,360 --> 16:30:44,080
Înapoi la conținutul nostru obișnuit. Acum astea

20950
16:30:41,916 --> 16:30:45,840
ultimele câteva ne aduc la următorul subiect

20951
16:30:44,080 --> 16:30:47,756
care este un alt mod de a ne împărți

20952
16:30:45,840 --> 16:30:51,276
tipuri de învățare automată și asta este

20953
16:30:47,756 --> 16:30:54,400
cu supravegheat nesupravegheat

20954
16:30:51,276 --> 16:30:56,400
și învățare prin întărire. Supravegheat

20955
16:30:54,400 --> 16:30:58,880
învăţarea este o metodă folosită pentru a permite

20956
16:30:56,400 --> 16:31:01,116
mașini pentru a clasifica obiectele prezice,

20957
16:30:58,880 --> 16:31:03,756
probleme sau situații bazate pe etichetate

20958
16:31:01,116 --> 16:31:05,840
date transmise mașinii. Și aici tu

20959
16:31:03,756 --> 16:31:08,240
vezi că avem un amestec de date cu

20960
16:31:05,840 --> 16:31:09,680
cercuri, triunghiuri și pătrate. Iar noi

20961
16:31:08,240 --> 16:31:11,360
etichetați-le. Avem ce este un cerc,

20962
16:31:09,680 --> 16:31:13,360
ce este un triunghi, ce este un pătrat și

20963
16:31:11,360 --> 16:31:15,040
avem pregătirea noastră de model și se antrenează

20964
16:31:13,360 --> 16:31:16,480
ea. Deci știm răspunsul. Foarte

20965
16:31:15,040 --> 16:31:18,956
important atunci când faci supraveghere

20966
16:31:16,480 --> 16:31:21,040
învățând, știți deja răspunsul la

20967
16:31:18,956 --> 16:31:23,200
multe din informațiile tale intră. Deci

20968
16:31:21,040 --> 16:31:25,756
ai un grup imens de date care vin

20969
16:31:23,200 --> 16:31:27,756
și apoi ai date noi care vin. Deci

20970
16:31:25,756 --> 16:31:29,596
ne-am antrenat modelul. Modelul acum

20971
16:31:27,756 --> 16:31:31,520
știe diferența dintre un cerc, a

20972
16:31:29,596 --> 16:31:33,436
pătrat, un triunghi. Și acum că am făcut-o

20973
16:31:31,520 --> 16:31:35,436
l-am instruit, putem trimite în acest caz

20974
16:31:33,436 --> 16:31:37,360
un pătrat și un cerc intră și el

20975
16:31:35,436 --> 16:31:39,276
prezice că cel de sus este un pătrat și

20976
16:31:37,360 --> 16:31:41,360
următorul este un cerc. Și poți vedea

20977
16:31:39,276 --> 16:31:42,956
că acest lucru este capabil să prezice

20978
16:31:41,360 --> 16:31:44,240
dacă cineva va fi implicit la o

20979
16:31:42,956 --> 16:31:46,640
împrumut pentru că vorbeam de bănci

20980
16:31:44,240 --> 16:31:48,320
mai devreme. Învățare supravegheată pe stoc

20981
16:31:46,640 --> 16:31:50,480
piață, indiferent dacă veți face

20982
16:31:48,320 --> 16:31:52,160
bani sau nu. Asta e întotdeauna important.

20983
16:31:50,480 --> 16:31:54,160
Și dacă cauți să faci avere

20984
16:31:52,160 --> 16:31:56,320
la bursă, rețineți că este

20985
16:31:54,160 --> 16:31:58,480
foarte greu să obții toate datele

20986
16:31:56,320 --> 16:32:00,720
corect la bursa. Este foarte

20987
16:31:58,480 --> 16:32:03,040
fluctuează în moduri cu adevărat greu

20988
16:32:00,720 --> 16:32:04,956
a prezice. Deci este destul de un rulou

20989
16:32:03,040 --> 16:32:06,320
plimbare cu coasterul. Dacă rulați mașină

20990
16:32:04,956 --> 16:32:08,160
învățând la bursă, începi

20991
16:32:06,320 --> 16:32:10,480
realizând că trebuie cu adevărat să caute noi

20992
16:32:08,160 --> 16:32:12,320
date. Așa că am supravegheat învățarea.

20993
16:32:10,480 --> 16:32:15,680
Și dacă ați supravegheat, avem nevoie

20994
16:32:12,320 --> 16:32:17,756
învăţare nesupravegheată. În nesupravegheat

20995
16:32:15,680 --> 16:32:20,400
învățarea, găsește modelul de învățare automată

20996
16:32:17,756 --> 16:32:22,160
modelul ascuns într-o date neetichetate.

20997
16:32:20,400 --> 16:32:24,400
Deci, în acest caz, în loc să spună

20998
16:32:22,160 --> 16:32:26,400
ce este cercul și ce triunghi

20999
16:32:24,400 --> 16:32:27,916
este și ce este un pătrat, intră

21000
16:32:26,400 --> 16:32:29,116
acolo, se uită la ei și spune pentru

21001
16:32:27,916 --> 16:32:30,480
indiferent de motiv, îi grupează

21002
16:32:29,116 --> 16:32:33,200
împreună. Poate îl va grupa după

21003
16:32:30,480 --> 16:32:35,040
numărul de colțuri. Și observă că a

21004
16:32:33,200 --> 16:32:36,640
numărul dintre ele toate au trei colțuri, a

21005
16:32:35,040 --> 16:32:38,160
numărul dintre ele toate au patru colțuri,

21006
16:32:36,640 --> 16:32:40,160
iar un număr dintre ei toți au nu

21007
16:32:38,160 --> 16:32:41,840
colțuri. Și este capabil să le filtreze

21008
16:32:40,160 --> 16:32:43,436
prin și grupați-le împreună. Noi

21009
16:32:41,840 --> 16:32:44,956
am vorbit despre asta mai devreme cu privirea

21010
16:32:43,436 --> 16:32:46,560
la un grup de oameni care sunt afară

21011
16:32:44,956 --> 16:32:48,796
cumpărături. Vrem să-i grupăm împreună

21012
16:32:46,560 --> 16:32:50,796
pentru a afla ce au în comun.

21013
16:32:48,796 --> 16:32:52,796
Și bineînțeles, odată ce înțelegi ce

21014
16:32:50,796 --> 16:32:54,320
oamenii au în comun, poate că ai tu

21015
16:32:52,796 --> 16:32:55,840
unul dintre ei care este client la dvs

21016
16:32:54,320 --> 16:32:57,596
magazin, sau aveți cinci dintre ele

21017
16:32:55,840 --> 16:32:59,276
client la magazinul dvs. și au un

21018
16:32:57,596 --> 16:33:01,436
mult în comun cu alți cinci care sunt

21019
16:32:59,276 --> 16:33:02,640
nu clienții din magazinul dvs. Cum faci

21020
16:33:01,436 --> 16:33:04,160
piaţă pentru cei cinci care nu sunt

21021
16:33:02,640 --> 16:33:05,680
clienții la magazinul dvs. încă? Se potrivesc

21022
16:33:04,160 --> 16:33:07,116
demografiile celor care vor face cumpărături

21023
16:33:05,680 --> 16:33:09,200
acolo și ai vrea să facă cumpărături la

21024
16:33:07,116 --> 16:33:10,640
magazinul tău, nu cel de lângă. De

21025
16:33:09,200 --> 16:33:12,240
desigur, aceasta este o versiune simplificată.

21026
16:33:10,640 --> 16:33:13,680
Poți vedea foarte ușor diferența

21027
16:33:12,240 --> 16:33:15,756
între un triunghi și un cerc, care

21028
16:33:13,680 --> 16:33:17,756
s-ar putea să nu fie atât de ușor în marketing.

21029
16:33:15,756 --> 16:33:19,520
Învățare prin întărire. Armare

21030
16:33:17,756 --> 16:33:21,436
învățarea este un tip important de mașină

21031
16:33:19,520 --> 16:33:23,520
învățând unde un agent învață cum să facă

21032
16:33:21,436 --> 16:33:25,756
se comportă într-un mediu prin performanţă

21033
16:33:23,520 --> 16:33:28,080
acțiuni și să văd rezultatul. Iar noi

21034
16:33:25,756 --> 16:33:29,520
au aici unde în acest caz un copil.

21035
16:33:28,080 --> 16:33:31,436
Este de fapt grozav că au folosit un

21036
16:33:29,520 --> 16:33:33,520
sugar pentru acest tobogan, deoarece

21037
16:33:31,436 --> 16:33:35,680
învățarea prin întărire este foarte mult în

21038
16:33:33,520 --> 16:33:38,000
stadiile sale infantile. Dar este și

21039
16:33:35,680 --> 16:33:40,240
probabil cea mai mare învățare automată

21040
16:33:38,000 --> 16:33:41,360
cerere acolo chiar acum sau în

21041
16:33:40,240 --> 16:33:43,360
viitor. O să se apropie

21042
16:33:41,360 --> 16:33:45,360
următorii câțiva ani este întărire

21043
16:33:43,360 --> 16:33:47,436
învățarea și cum să faci asta să funcționeze pentru

21044
16:33:45,360 --> 16:33:49,756
noi. Și puteți vedea aici unde avem

21045
16:33:47,436 --> 16:33:51,596
acțiunea noastră. În acțiunea din aceasta,

21046
16:33:49,756 --> 16:33:53,116
se duce în foc. Să sperăm că

21047
16:33:51,596 --> 16:33:54,796
Iubito, nu e doar o lumânare mică,

21048
16:33:53,116 --> 16:33:56,560
nu un foc uriaș așa cum arată

21049
16:33:54,796 --> 16:33:59,116
aici. Când copilul iese și

21050
16:33:56,560 --> 16:34:00,880
noua stare este copilul este trist și plânge

21051
16:33:59,116 --> 16:34:02,796
pentru că s-au ars pe foc. Şi

21052
16:34:00,880 --> 16:34:04,400
atunci poate vor lua o altă măsură. The

21053
16:34:02,796 --> 16:34:06,480
copilul este numit agent pentru că este

21054
16:34:04,400 --> 16:34:07,840
unul care face acțiunile. Și în asta

21055
16:34:06,480 --> 16:34:09,200
Caz, nu au intrat în foc. Ei

21056
16:34:07,840 --> 16:34:11,360
a mers într-o altă direcție. Și acum

21057
16:34:09,200 --> 16:34:13,276
copilul este fericit, râde și se joacă.

21058
16:34:11,360 --> 16:34:15,360
Învățarea prin întărire este foarte ușor

21059
16:34:13,276 --> 16:34:17,276
înțelege pentru că așa este ca oameni

21060
16:34:15,360 --> 16:34:19,596
acesta este unul dintre modurile prin care învățăm. Noi

21061
16:34:17,276 --> 16:34:21,276
Aflați dacă vă ardeți

21062
16:34:19,596 --> 16:34:23,360
aragazul, nu mai face asta. Nu

21063
16:34:21,276 --> 16:34:25,116
atinge aragazul. În imaginea de ansamblu,

21064
16:34:23,360 --> 16:34:27,360
putând avea învățare automată

21065
16:34:25,116 --> 16:34:29,840
programare sau un AI să poată face acest lucru

21066
16:34:27,360 --> 16:34:33,040
este uriaș pentru că acum începem

21067
16:34:29,840 --> 16:34:34,720
invata cum sa inveti. Este un salt mare

21068
16:34:33,040 --> 16:34:36,560
lumea computerului și a mașinilor

21069
16:34:34,720 --> 16:34:38,720
învăţarea. Și ne vom întoarce și

21070
16:34:36,560 --> 16:34:40,480
doar să te întorci super supravegheat

21071
16:34:38,720 --> 16:34:42,796
versus învățarea nesupravegheată.

21072
16:34:40,480 --> 16:34:44,240
Înțelegerea acestui lucru este enormă pentru că asta

21073
16:34:42,796 --> 16:34:47,116
va apărea în orice proiect

21074
16:34:44,240 --> 16:34:49,520
la care lucrezi. Avem în supraveghere

21075
16:34:47,116 --> 16:34:51,596
învăţând, avem date etichetate. Avem

21076
16:34:49,520 --> 16:34:53,276
feedback direct. Deci cineva este deja

21077
16:34:51,596 --> 16:34:55,200
a intrat acolo și a spus: „Da, asta este un

21078
16:34:53,276 --> 16:34:56,880
triunghi. Nu, nu este un triunghi.”

21079
16:34:55,200 --> 16:34:58,400
Și apoi prezici un rezultat. Deci tu

21080
16:34:56,880 --> 16:35:00,400
ai o previziune frumoasa. Acesta este acesta

21081
16:34:58,400 --> 16:35:01,680
acest nou set de date vine și noi

21082
16:35:00,400 --> 16:35:03,916
știi ce va fi. Și apoi

21083
16:35:01,680 --> 16:35:06,320
cu tranzacționare nesupravegheată, nu este

21084
16:35:03,916 --> 16:35:08,956
etichetat. Deci chiar nu știm ce este

21085
16:35:06,320 --> 16:35:10,480
este. Nu există feedback. Deci, nu suntem

21086
16:35:08,956 --> 16:35:12,080
spunându-i dacă este corect sau greșit.

21087
16:35:10,480 --> 16:35:14,080
Nu îi spunem dacă este o

21088
16:35:12,080 --> 16:35:16,240
triunghi sau un pătrat. Nu spunem

21089
16:35:14,080 --> 16:35:18,560
să meargă la stânga sau la dreapta. Tot ce facem este

21090
16:35:16,240 --> 16:35:20,720
găsim o structură ascunsă în

21091
16:35:18,560 --> 16:35:23,116
date, grupând datele împreună pentru a le găsi

21092
16:35:20,720 --> 16:35:25,360
a afla ce se leagă unul de celălalt. Şi

21093
16:35:23,116 --> 16:35:27,840
atunci le puteți folosi împreună. Deci,

21094
16:35:25,360 --> 16:35:29,840
imaginează-ți că ai o imagine și nu ești

21095
16:35:27,840 --> 16:35:32,160
sigur ce cauți. Deci, du-te

21096
16:35:29,840 --> 16:35:34,000
în și aveți datele nestructurate.

21097
16:35:32,160 --> 16:35:35,840
Găsiți toate aceste lucruri care sunt conectate

21098
16:35:34,000 --> 16:35:38,080
împreună și apoi cineva se uită la

21099
16:35:35,840 --> 16:35:40,640
acelea și le etichetează. Acum poți lua

21100
16:35:38,080 --> 16:35:42,560
care etichetează datele și programează ceva

21101
16:35:40,640 --> 16:35:44,320
preziceți ce este în imagine. Deci tu

21102
16:35:42,560 --> 16:35:46,080
pot vedea cum merg înainte și înapoi și

21103
16:35:44,320 --> 16:35:47,520
puteți începe să conectați toate acestea

21104
16:35:46,080 --> 16:35:49,520
diferite instrumente împreună pentru a face a

21105
16:35:47,520 --> 16:35:51,680
imagine mai mare. Sunt multe

21106
16:35:49,520 --> 16:35:53,200
algoritmi interesanți de învățare automată.

21107
16:35:51,680 --> 16:35:54,640
Să aruncăm o privire la câteva dintre ele.

21108
16:35:53,200 --> 16:35:56,320
Sper că asta ți-a dat puțină aromă

21109
16:35:54,640 --> 16:35:57,840
din ceea ce este acolo și acestea sunt câteva

21110
16:35:56,320 --> 16:35:59,756
dintre cele mai importante care sunt

21111
16:35:57,840 --> 16:36:02,560
utilizat în prezent. Vom arunca o privire

21112
16:35:59,756 --> 16:36:04,956
la regresie liniară, arbore de decizie și

21113
16:36:02,560 --> 16:36:07,596
mașina vectorului suport. Să începem

21114
16:36:04,956 --> 16:36:09,360
cu o privire mai atentă asupra regresiei liniare.

21115
16:36:07,596 --> 16:36:10,956
Regresia liniară este probabil una dintre cele

21116
16:36:09,360 --> 16:36:12,880
cel mai cunoscut și bine înțeles

21117
16:36:10,956 --> 16:36:15,040
algoritmi în statistică și mașină

21118
16:36:12,880 --> 16:36:17,276
învăţarea. Regresia liniară este liniară

21119
16:36:15,040 --> 16:36:19,756
model. De exemplu, un model care presupune

21120
16:36:17,276 --> 16:36:22,240
o relație liniară între intrare

21121
16:36:19,756 --> 16:36:24,720
variabilele x și ieșirea unică

21122
16:36:22,240 --> 16:36:27,360
variabila y. Și vei vedea asta dacă tu

21123
16:36:24,720 --> 16:36:30,320
amintiți-vă din orele de algebră, y =

21124
16:36:27,360 --> 16:36:33,116
mx c. Imaginează-ți că prezicem

21125
16:36:30,320 --> 16:36:35,040
distanța parcursă y față de viteza x. Al nostru

21126
16:36:33,116 --> 16:36:38,720
reprezentarea modelului de regresie liniară

21127
16:36:35,040 --> 16:36:43,360
pentru această problemă ar fi y = m * x c

21128
16:36:38,720 --> 16:36:45,360
sau distanta = m * viteza c unde m este

21129
16:36:43,360 --> 16:36:47,040
coeficientul și c este y

21130
16:36:45,360 --> 16:36:49,116
intercepta. Și o să ne uităm

21131
16:36:47,040 --> 16:36:50,956
două variante diferite ale acesteia. În primul rând,

21132
16:36:49,116 --> 16:36:52,720
vom începe cu timpul este

21133
16:36:50,956 --> 16:36:54,796
constantă. Și puteți vedea că avem un

21134
16:36:52,720 --> 16:36:56,880
biciclist. Are echipament de siguranță pe el,

21135
16:36:54,796 --> 16:36:59,360
Slavă Domnului. Viteza este egală cu 10

21136
16:36:56,880 --> 16:37:02,796
metri/s. Și așa peste o anumită sumă

21137
16:36:59,360 --> 16:37:04,480
de timp, distanța lui este egală cu 36 km. Noi

21138
16:37:02,796 --> 16:37:08,000
ai un al doilea biciclist care merge

21139
16:37:04,480 --> 16:37:09,840
de două ori viteza sau 20 m/s. Și poți

21140
16:37:08,000 --> 16:37:11,756
ghici dacă merge de două ori viteza și

21141
16:37:09,840 --> 16:37:14,160
timpul este o constantă, atunci el o va face

21142
16:37:11,756 --> 16:37:18,880
mergi de doua ori distanta. Și asta e ușor

21143
16:37:14,160 --> 16:37:21,116
a calcula. 36 * 2, obțineți 72 km. Şi

21144
16:37:18,880 --> 16:37:22,956
deci dacă ai avea întrebarea cât de repede

21145
16:37:21,116 --> 16:37:25,596
ar merge cineva de trei ori mai mult

21146
16:37:22,956 --> 16:37:27,680
viteza sau 30 m/s este, puteți cu ușurință

21147
16:37:25,596 --> 16:37:29,756
calculați distanța din capul nostru. Putem

21148
16:37:27,680 --> 16:37:31,116
face asta fără a avea nevoie de un computer, dar

21149
16:37:29,756 --> 16:37:32,796
vrem să facem asta pentru mai complicat

21150
16:37:31,116 --> 16:37:34,080
date. Deci, este oarecum frumos de comparat

21151
16:37:32,796 --> 16:37:35,520
cei doi. Dar, haideți să aruncăm o privire

21152
16:37:34,080 --> 16:37:38,240
asta și cum arată într-un

21153
16:37:35,520 --> 16:37:40,880
grafic. Deci, într-un model de regresie liniară,

21154
16:37:38,240 --> 16:37:44,080
avem distanta fata de viteza si noi

21155
16:37:40,880 --> 16:37:45,840
au m-ul nostru este egal cu panta ve a

21156
16:37:44,080 --> 16:37:47,916
linie. Și vom observa că linia are

21157
16:37:45,840 --> 16:37:49,916
o pantă în plus. Și ca viteza

21158
16:37:47,916 --> 16:37:52,080
crește, crește și distanța.

21159
16:37:49,916 --> 16:37:54,240
Prin urmare, variabilele au un pozitiv

21160
16:37:52,080 --> 16:37:56,640
relație. Și astfel viteza ta de

21161
16:37:54,240 --> 16:37:58,720
persoană care este egală cu y = mx plus c

21162
16:37:56,640 --> 16:38:00,956
distanta parcursa intr-un interval fix de

21163
16:37:58,720 --> 16:38:02,480
timp. Și am putea calcula foarte ușor

21164
16:38:00,956 --> 16:38:05,116
fie urmând linia fie doar

21165
16:38:02,480 --> 16:38:07,756
știind că aceasta este 3 * 10 m/s

21166
16:38:05,116 --> 16:38:10,956
distanță de aproximativ 102 km față de această treime

21167
16:38:07,756 --> 16:38:13,756
bicicleta a călătorit. Una dintre cheie

21168
16:38:10,956 --> 16:38:16,080
definițiile de aici sunt pozitive

21169
16:38:13,756 --> 16:38:18,320
relație. Deci panta dreptei

21170
16:38:16,080 --> 16:38:20,240
este pozitiv. Pe măsură ce distanța crește, cu atât

21171
16:38:18,320 --> 16:38:21,840
creste viteza. Să aruncăm o privire

21172
16:38:20,240 --> 16:38:24,400
la al doilea exemplu al nostru unde punem

21173
16:38:21,840 --> 16:38:26,956
distanta este o constanta. Deci avem viteză

21174
16:38:24,400 --> 16:38:29,040
este egal cu 10 m/s. Au un anumit

21175
16:38:26,956 --> 16:38:31,200
distanță de parcurs și îi ia 100

21176
16:38:29,040 --> 16:38:32,720
secunde pentru a parcurge această distanță. Iar noi

21177
16:38:31,200 --> 16:38:35,436
avem cel de-al doilea biciclist care e încă

21178
16:38:32,720 --> 16:38:37,200
face 20 m/s. Din moment ce el merge de două ori

21179
16:38:35,436 --> 16:38:39,360
viteza, putem ghici că va acoperi

21180
16:38:37,200 --> 16:38:40,956
distanță în aproximativ jumătate din timp, 50

21181
16:38:39,360 --> 16:38:42,956
secunde. Și, desigur, ai putea

21182
16:38:40,956 --> 16:38:44,796
probabil ghiciți pe al treilea, 100

21183
16:38:42,956 --> 16:38:46,796
împărțit la 30 pentru că merge trei

21184
16:38:44,796 --> 16:38:49,200
ori viteza. Puteți ghici cu ușurință

21185
16:38:46,796 --> 16:38:51,756
că acesta este 33,3333

21186
16:38:49,200 --> 16:38:53,840
timp de secunde. Am pus asta într-un liniar

21187
16:38:51,756 --> 16:38:55,520
model de regresie sau un grafic. Dacă

21188
16:38:53,840 --> 16:38:57,116
se presupune că distanța este constantă,

21189
16:38:55,520 --> 16:38:59,916
să vedem relația dintre viteză

21190
16:38:57,116 --> 16:39:01,916
si timp. Și pe măsură ce timpul trece,

21191
16:38:59,916 --> 16:39:04,640
cantitatea de viteză pentru a parcurge aceeași distanță

21192
16:39:01,916 --> 16:39:06,796
coboară. Deci acum m-ul tău este egal cu un minus

21193
16:39:04,640 --> 16:39:08,796
v panta dreptei. Ca viteza

21194
16:39:06,796 --> 16:39:11,840
crește, timpul scade. Prin urmare, cel

21195
16:39:08,796 --> 16:39:13,756
variabila are o relație negativă.

21196
16:39:11,840 --> 16:39:15,756
Din nou, există definiția noastră. pozitiv

21197
16:39:13,756 --> 16:39:17,756
relație și relație negativă

21198
16:39:15,756 --> 16:39:20,796
dependent de panta dreptei şi

21199
16:39:17,756 --> 16:39:23,040
cu o formulă simplă ca aceasta um și

21200
16:39:20,796 --> 16:39:24,400
chiar și o cantitate semnificativă de date. hai sa

21201
16:39:23,040 --> 16:39:26,640
uh vezi ce matematica

21202
16:39:24,400 --> 16:39:28,240
implementarea regresiei liniare și

21203
16:39:26,640 --> 16:39:32,560
vom lua aceste date. Deci să presupunem că avem

21204
16:39:28,240 --> 16:39:36,320
acest set de date unde avem xyx= 1 2 3 4

21205
16:39:32,560 --> 16:39:39,680
5 serii standard și valoarea y este 3

21206
16:39:36,320 --> 16:39:42,160
22 43. Când luăm asta și mergem înainte

21207
16:39:39,680 --> 16:39:43,360
și trasează aceste puncte pe un grafic, tu

21208
16:39:42,160 --> 16:39:44,956
pot vedea că există un fel de drăguț

21209
16:39:43,360 --> 16:39:47,116
împrăștierea și probabil că ai putea

21210
16:39:44,956 --> 16:39:48,720
globul ocular o linie prin mijlocul acestuia.

21211
16:39:47,116 --> 16:39:50,480
Dar vom calcula exact asta

21212
16:39:48,720 --> 16:39:52,320
linie pentru regresie liniară. Iar cel

21213
16:39:50,480 --> 16:39:55,360
primul lucru pe care îl facem este să venim aici sus și

21214
16:39:52,320 --> 16:39:57,360
avem media lui Xi. Și amintește-ți

21215
16:39:55,360 --> 16:40:00,080
medie este practic media. Deci noi

21216
16:39:57,360 --> 16:40:02,320
a adăugat cinci plus 4 plus 3 plus 2 plus 1

21217
16:40:00,080 --> 16:40:04,560
și împărțiți la cinci. Și asta pur și simplu

21218
16:40:02,320 --> 16:40:06,560
iese ca trei. Și apoi vom face

21219
16:40:04,560 --> 16:40:09,200
la fel pentru y. Vom merge mai departe și vom adăuga

21220
16:40:06,560 --> 16:40:11,276
măriți toate acele numere și împărțiți la cinci.

21221
16:40:09,200 --> 16:40:15,200
Și ajungem la o valoare medie a lui y of

21222
16:40:11,276 --> 16:40:16,956
i este egal cu 2,8 unde x i se referă

21223
16:40:15,200 --> 16:40:19,756
este o valoare medie sau medie. Iar cel

21224
16:40:16,956 --> 16:40:21,436
yi este, de asemenea, egal cu o valoare medie a lui y. Şi

21225
16:40:19,756 --> 16:40:25,520
când complotăm asta, vei vedea că noi

21226
16:40:21,436 --> 16:40:27,116
poate introduce y= 2,8 și x= 3 in

21227
16:40:25,520 --> 16:40:28,560
acolo pe graficul nostru. I-am cam dat un

21228
16:40:27,116 --> 16:40:30,720
culoare puțin diferită pentru a putea sorta

21229
16:40:28,560 --> 16:40:32,240
afară cu liniile întrerupte pe el. Şi

21230
16:40:30,720 --> 16:40:34,080
este important să rețineți că atunci când o facem

21231
16:40:32,240 --> 16:40:36,640
regresia liniară, liniară

21232
16:40:34,080 --> 16:40:38,720
modelul de regresie ar trebui să treacă prin asta

21233
16:40:36,640 --> 16:40:40,720
punct. Acum, să ne găsim regresia

21234
16:40:38,720 --> 16:40:42,796
ecuație pentru a găsi linia cea mai potrivită.

21235
16:40:40,720 --> 16:40:44,956
Amintiți-vă, mergem înainte și luăm y= mx

21236
16:40:42,796 --> 16:40:47,436
plus c. Deci, căutăm m și c.

21237
16:40:44,956 --> 16:40:50,000
Deci, pentru a găsi această ecuație pentru datele noastre,

21238
16:40:47,436 --> 16:40:55,200
trebuie să găsim panta noastră de m și a noastră

21239
16:40:50,000 --> 16:40:59,040
coeficient de c. Și avem y = mx c

21240
16:40:55,200 --> 16:41:02,640
unde m este egal cu suma mediei x - x

21241
16:40:59,040 --> 16:41:06,320
* y - y media sau y înseamnă și x înseamnă

21242
16:41:02,640 --> 16:41:07,840
peste suma lui x - x înseamnă pătrat.

21243
16:41:06,320 --> 16:41:09,840
Așa obținem panta valorii

21244
16:41:07,840 --> 16:41:11,756
a liniei. Și putem face asta cu ușurință

21245
16:41:09,840 --> 16:41:14,000
prin crearea unor coloane aici. Avem

21246
16:41:11,756 --> 16:41:16,080
xy. Calculatoarele sunt foarte bune

21247
16:41:14,000 --> 16:41:18,480
iterarea prin date. Și așa putem

21248
16:41:16,080 --> 16:41:21,360
calculați cu ușurință acest lucru și completați un grafic

21249
16:41:18,480 --> 16:41:24,080
de date. Și în graficul nostru puteți cu ușurință

21250
16:41:21,360 --> 16:41:26,560
vezi că dacă avem valoarea noastră x de 1 și

21251
16:41:24,080 --> 16:41:32,000
dacă vă amintiți x i sau mijloacele

21252
16:41:26,560 --> 16:41:35,276
valoarea este 3. 1 - 3 este egal cu a -2 și 2 - 3

21253
16:41:32,000 --> 16:41:38,796
= a -1 așa mai departe și așa mai departe. Și putem

21254
16:41:35,276 --> 16:41:42,240
completați cu ușurință coloana lui x - x i y -

21255
16:41:38,796 --> 16:41:47,680
yi. Și apoi din acestea putem calcula x

21256
16:41:42,240 --> 16:41:49,436
- x i^ 2 și x - x i * y - yi. Iar tu

21257
16:41:47,680 --> 16:41:50,956
pot ghici că următorul pas este să mergi

21258
16:41:49,436 --> 16:41:52,956
înainte și însumați diferitele coloane pentru

21259
16:41:50,956 --> 16:41:56,796
răspunsurile de care avem nevoie. Deci obținem un total

21260
16:41:52,956 --> 16:42:01,040
de 10 pentru x - x i^2 nostru și un total de 2

21261
16:41:56,796 --> 16:42:04,560
pentru x - x i * y - yi. Și le conectăm

21262
16:42:01,040 --> 16:42:06,956
în, obținem 2/10, care este egal cu 2. Deci acum

21263
16:42:04,560 --> 16:42:09,116
știm că panta dreptei noastre este egală cu 2.

21264
16:42:06,956 --> 16:42:10,640
Deci putem calcula valoarea lui c.

21265
16:42:09,116 --> 16:42:13,520
Acesta ar fi următorul pas pe care trebuie să-l facem

21266
16:42:10,640 --> 16:42:15,276
știi unde traversează y ais. Și dacă

21267
16:42:13,520 --> 16:42:18,240
îți amintești, am menționat mai devreme că

21268
16:42:15,276 --> 16:42:20,796
linia de regresie liniară trebuie să treacă

21269
16:42:18,240 --> 16:42:22,720
prin valoarea mijloacelor, cea pe care noi

21270
16:42:20,796 --> 16:42:24,796
arătat mai devreme. Putem doar să întoarcem înapoi

21271
16:42:22,720 --> 16:42:26,400
acolo la acel grafic. Și poți vedea

21272
16:42:24,796 --> 16:42:30,880
chiar aici, aici este valoarea noastră de mijloace,

21273
16:42:26,400 --> 16:42:33,520
care este 3 x= 3 și y= 2,8. Și din moment ce noi

21274
16:42:30,880 --> 16:42:38,160
știm acea valoare, putem pur și simplu conecta asta

21275
16:42:33,520 --> 16:42:42,720
în formula noastră. Y =2x c. Așa că conectam

21276
16:42:38,160 --> 16:42:44,880
că în, obținem 2,8 8 =2 * 3 C. Și

21277
16:42:42,720 --> 16:42:47,840
poți doar să rezolvi pentru C. Deci acum știm

21278
16:42:44,880 --> 16:42:50,160
că coeficientul nostru este egal cu 2,2. Şi

21279
16:42:47,840 --> 16:42:54,240
odată ce avem toate acestea, putem merge înainte

21280
16:42:50,160 --> 16:42:57,840
și trasează linia noastră de regresie. Y = 2 * X  

21281
16:42:54,240 --> 16:43:00,640
2.2. Și apoi din această ecuație, putem

21282
16:42:57,840 --> 16:43:04,640
calculează noi valori. Deci, să prezicem

21283
16:43:00,640 --> 16:43:07,040
valorile lui Y folosind X= 1 2 3 4 5 și reprezentați grafic

21284
16:43:04,640 --> 16:43:09,200
punctele. Amintiți-vă că 1 2 3 4 5 a fost

21285
16:43:07,040 --> 16:43:11,360
valorile noastre x originale. Deci acum suntem

21286
16:43:09,200 --> 16:43:13,276
merg să văd ce crezi că sunt, nu

21287
16:43:11,360 --> 16:43:16,240
ceea ce sunt de fapt. Și noi conectam

21288
16:43:13,276 --> 16:43:20,480
cei din, obținem y de desemnat cu y

21289
16:43:16,240 --> 16:43:23,436
din p. Puteți vedea că x= 1 = 2,4, x= 2=

21290
16:43:20,480 --> 16:43:26,720
2.6, și așa mai departe și așa mai departe. Deci avem

21291
16:43:23,436 --> 16:43:27,916
y a prezis valorile a ceea ce credem că este

21292
16:43:26,720 --> 16:43:29,596
va fi atunci când punem acele numere

21293
16:43:27,916 --> 16:43:31,756
in. Iar când tragem cele prezise

21294
16:43:29,596 --> 16:43:33,756
valorile împreună cu valorile reale, noi

21295
16:43:31,756 --> 16:43:34,956
poate vedea diferența. Și acesta este unul

21296
16:43:33,756 --> 16:43:36,560
dintre lucrurile cu care este foarte important

21297
16:43:34,956 --> 16:43:38,796
regresie liniară în oricare dintre aceste modele

21298
16:43:36,560 --> 16:43:40,480
este să înțelegem eroarea. Și așa noi

21299
16:43:38,796 --> 16:43:41,916
poate calcula eroarea pe toate noastre

21300
16:43:40,480 --> 16:43:45,040
valori diferite. Și poți vedea peste

21301
16:43:41,916 --> 16:43:46,796
aici am trasat um x și y și y

21302
16:43:45,040 --> 16:43:48,240
prezice. Și tragem o mică linie așa că

21303
16:43:46,796 --> 16:43:50,160
puteți vedea cum arată eroarea

21304
16:43:48,240 --> 16:43:52,560
ca acolo între diferitele puncte.

21305
16:43:50,160 --> 16:43:54,956
Deci scopul nostru este să reducem această eroare. Noi

21306
16:43:52,560 --> 16:43:57,200
dorim să minimizăm această valoare de eroare pe sistemul nostru

21307
16:43:54,956 --> 16:43:59,436
model de regresie liniară. Minimizarea

21308
16:43:57,200 --> 16:44:01,200
distanta. Există o mulțime de moduri de a

21309
16:43:59,436 --> 16:44:03,680
minimizați distanța dintre linie

21310
16:44:01,200 --> 16:44:06,320
iar datele punctelor ca suma pătratului

21311
16:44:03,680 --> 16:44:08,956
erori, suma erorilor absolute, rădăcină

21312
16:44:06,320 --> 16:44:10,480
eroare pătrată medie, etc. Continuăm să ne mișcăm

21313
16:44:08,956 --> 16:44:12,720
această linie prin date indică

21314
16:44:10,480 --> 16:44:14,640
asigurați-vă că linia cea mai potrivită are

21315
16:44:12,720 --> 16:44:16,796
distanța cel mai mic pătrat dintre date

21316
16:44:14,640 --> 16:44:18,480
puncte și dreapta de regresie. Deci să

21317
16:44:16,796 --> 16:44:20,796
recapitulați cu un liniar foarte simplu

21318
16:44:18,480 --> 16:44:22,720
model de regresie, mai întâi ne dăm seama

21319
16:44:20,796 --> 16:44:24,560
formula liniei noastre prin

21320
16:44:22,720 --> 16:44:27,276
mijloc și apoi ajustăm încet

21321
16:44:24,560 --> 16:44:29,200
linie pentru a minimiza eroarea. Ține minte

21322
16:44:27,276 --> 16:44:31,040
aceasta este o formulă foarte simplă. Matematica

21323
16:44:29,200 --> 16:44:33,040
devine chiar dacă matematica este foarte mult

21324
16:44:31,040 --> 16:44:35,200
la fel, devine mult mai complex ca

21325
16:44:33,040 --> 16:44:38,880
adăugăm în diferite dimensiuni. Deci asta

21326
16:44:35,200 --> 16:44:42,880
are doar două dimensiuni. Y este egal cu MX C.

21327
16:44:38,880 --> 16:44:44,480
Dar poți duce asta la X ZQ all

21328
16:44:42,880 --> 16:44:46,080
diferitele caracteristici de acolo și ele

21329
16:44:44,480 --> 16:44:47,596
poate reprezenta un model de regresie liniară

21330
16:44:46,080 --> 16:44:50,480
toți cei care folosesc diferit

21331
16:44:47,596 --> 16:44:52,320
formule pentru a minimiza eroarea. Să mergem

21332
16:44:50,480 --> 16:44:54,160
înainte și aruncați o privire asupra arborilor de decizie.

21333
16:44:52,320 --> 16:44:56,480
O modalitate foarte diferită de a rezolva probleme

21334
16:44:54,160 --> 16:44:58,880
în modelul de regresie liniară. Decizie

21335
16:44:56,480 --> 16:45:00,720
tree este un algoritm în formă de copac folosit pentru

21336
16:44:58,880 --> 16:45:02,640
determina un curs de actiune. Fiecare

21337
16:45:00,720 --> 16:45:05,276
ramura unui copac reprezintă un posibil

21338
16:45:02,640 --> 16:45:07,756
decizie, apariție sau reacție. Noi

21339
16:45:05,276 --> 16:45:10,320
au date care ne spun dacă este un bun

21340
16:45:07,756 --> 16:45:12,880
zi pentru a juca golf. Și dacă ar fi să deschidem

21341
16:45:10,320 --> 16:45:14,880
aceste date într-o foaie de calcul generală,

21342
16:45:12,880 --> 16:45:17,200
puteți vedea că avem perspectiva, dacă

21343
16:45:14,880 --> 16:45:20,880
este ploios, înnorat, însorit,

21344
16:45:17,200 --> 16:45:23,520
temperatura, cald, blând, rece, umiditate,

21345
16:45:20,880 --> 16:45:25,276
vânt, și mi-a plăcut să joc golf asta

21346
16:45:23,520 --> 16:45:27,596
zi? Da sau nu. Deci, luăm un

21347
16:45:25,276 --> 16:45:29,040
recensământ. Și cu siguranță, nu mi-aș dori un

21348
16:45:27,596 --> 16:45:30,956
computerul îmi spune când ar trebui să plec

21349
16:45:29,040 --> 16:45:32,560
joaca golf sau nu. Dar îți poți imagina

21350
16:45:30,956 --> 16:45:34,400
dacă te-ai trezit cu o noapte înainte,

21351
16:45:32,560 --> 16:45:36,160
încerci să-ți planifici ziua și asta

21352
16:45:34,400 --> 16:45:38,000
vine și spune: „Mâine ar fi un

21353
16:45:36,160 --> 16:45:40,000
zi bună pentru golf pentru tine dimineața

21354
16:45:38,000 --> 16:45:41,520
și nu o zi bună după-amiaza sau

21355
16:45:40,000 --> 16:45:43,276
așa ceva.” Acest lucru devine foarte

21356
16:45:41,520 --> 16:45:44,956
benefice și vedem acest lucru în multe

21357
16:45:43,276 --> 16:45:47,116
aplicațiile care apar acum unde este

21358
16:45:44,956 --> 16:45:49,116
vă oferă sugestii și vă anunță

21359
16:45:47,116 --> 16:45:51,520
ce s-ar potrivi pentru tine

21360
16:45:49,116 --> 16:45:53,840
pentru a doua zi sau următoarea achiziție sau

21361
16:45:51,520 --> 16:45:56,080
următoarea uh, orice știi, următoarea e-mail

21362
16:45:53,840 --> 16:45:57,840
afară în acest caz este mâine o zi bună

21363
16:45:56,080 --> 16:46:00,240
pentru a juca golf în funcție de vreme

21364
16:45:57,840 --> 16:46:02,240
intrând. Și așa venim și haideți

21365
16:46:00,240 --> 16:46:04,560
Stabilește dacă ar trebui să joci golf

21366
16:46:02,240 --> 16:46:05,916
când ziua este însorită și vântoasă. Deci noi

21367
16:46:04,560 --> 16:46:08,320
am aflat că se întâmplă prognoza de mâine

21368
16:46:05,916 --> 16:46:10,080
sa fie insorit si vant. Și să presupunem că noi

21369
16:46:08,320 --> 16:46:12,160
desenează copacul nostru așa. Vom merge

21370
16:46:10,080 --> 16:46:14,640
avem umiditatea noastră. Și apoi avem a noastră

21371
16:46:12,160 --> 16:46:16,160
normal, care este dacă este dacă ai

21372
16:46:14,640 --> 16:46:18,320
o umiditate normală, te vei duce

21373
16:46:16,160 --> 16:46:20,240
joaca golf. Și dacă umiditatea este într-adevăr

21374
16:46:18,320 --> 16:46:22,480
mare, apoi ne uităm la perspective. Şi

21375
16:46:20,240 --> 16:46:24,240
dacă perspectiva este însorită, înnorat sau

21376
16:46:22,480 --> 16:46:26,956
ploios, va schimba ceea ce tu

21377
16:46:24,240 --> 16:46:29,276
alege să faci. Deci, dacă știi că este o

21378
16:46:26,956 --> 16:46:30,480
umiditate foarte mare și este însorit,

21379
16:46:29,276 --> 16:46:31,360
probabil că nu vei juca golf

21380
16:46:30,480 --> 16:46:33,520
pentru că vei fi acolo

21381
16:46:31,360 --> 16:46:35,436
mizerabil, luptând împotriva țânțarilor

21382
16:46:33,520 --> 16:46:36,796
care ți se alătură pentru a juca golf

21383
16:46:35,436 --> 16:46:38,000
cu tine. Poate dacă plouă, tu

21384
16:46:36,796 --> 16:46:39,756
probabil că nu vreau să se joace în ploaie.

21385
16:46:38,000 --> 16:46:42,480
Dar dacă este puțin înnorat și tu

21386
16:46:39,756 --> 16:46:44,796
obține doar umbra potrivită, e bine

21387
16:46:42,480 --> 16:46:47,360
zi pentru a juca golf și a fi afară

21388
16:46:44,796 --> 16:46:49,360
verdele. Acum, în acest exemplu, puteți

21389
16:46:47,360 --> 16:46:51,040
probabil fă-ți propriul copac frumos

21390
16:46:49,360 --> 16:46:53,276
ușor pentru că este un set foarte simplu de

21391
16:46:51,040 --> 16:46:54,720
date care intră. Dar întrebarea este cum

21392
16:46:53,276 --> 16:46:56,240
stii ce sa imparti? Unde faci

21393
16:46:54,720 --> 16:46:58,640
împărțiți datele dvs.? Dacă asta e mult

21394
16:46:56,240 --> 16:47:00,880
date mai complicate acolo unde nu este

21395
16:46:58,640 --> 16:47:03,276
ceva ce ai face în mod special

21396
16:47:00,880 --> 16:47:05,276
intelege? cum ar fi studiul cancerului, ei

21397
16:47:03,276 --> 16:47:07,916
luați aproximativ 36 de măsurători ale

21398
16:47:05,276 --> 16:47:10,080
celulele canceroase și apoi fiecare dintre

21399
16:47:07,916 --> 16:47:12,000
acele măsurători reprezintă modul în care

21400
16:47:10,080 --> 16:47:14,160
bulbos este, cât de extins, cum

21401
16:47:12,000 --> 16:47:16,480
marginile ascutite sunt, ceva care ca a

21402
16:47:14,160 --> 16:47:18,240
uman pe care nu l-am înțelege.

21403
16:47:16,480 --> 16:47:20,240
Deci, cum decidem cum să împărțim asta

21404
16:47:18,240 --> 16:47:21,840
date și este decizia corectă

21405
16:47:20,240 --> 16:47:23,276
copac? Dar asta este o întrebare

21406
16:47:21,840 --> 16:47:25,360
urmează să vină. Acesta este dreptul

21407
16:47:23,276 --> 16:47:28,796
arborele de decizie? Pentru asta ar trebui

21408
16:47:25,360 --> 16:47:31,276
calcula entropia și câștigul de informații.

21409
16:47:28,796 --> 16:47:33,520
Există două cuvinte importante din vocabular

21410
16:47:31,276 --> 16:47:35,840
entropia și câștigul de informații.

21411
16:47:33,520 --> 16:47:38,720
Entropie. Entropia este o măsură a

21412
16:47:35,840 --> 16:47:40,796
aleatorie sau impuritate în setul de date.

21413
16:47:38,720 --> 16:47:43,040
Entropia ar trebui să fie scăzută. Deci vrem

21414
16:47:40,796 --> 16:47:45,040
haosul să fie cât mai jos posibil. Noi nu

21415
16:47:43,040 --> 16:47:46,796
vreau să-l privesc și să fiu confuz de

21416
16:47:45,040 --> 16:47:49,360
imaginile sau cu ce se întâmplă acolo

21417
16:47:46,796 --> 16:47:51,756
date mixte. Și câștigul de informații, asta

21418
16:47:49,360 --> 16:47:54,320
este o măsură a scăderii entropiei

21419
16:47:51,756 --> 16:47:57,840
după ce setul de date este împărțit. De asemenea, cunoscut

21420
16:47:54,320 --> 16:47:59,520
ca reducerea entropiei. câștig de informații

21421
16:47:57,840 --> 16:48:01,520
ar trebui să fie ridicat. Așa că ne dorim

21422
16:47:59,520 --> 16:48:03,756
informația pe care o scoatem din despărțire

21423
16:48:01,520 --> 16:48:06,080
să fie cât mai sus posibil. Să luăm o

21424
16:48:03,756 --> 16:48:08,160
uită-te la entropia din matematică

21425
16:48:06,080 --> 16:48:12,796
lateral. În acest caz, vom merge

21426
16:48:08,160 --> 16:48:14,956
notează entropia ca I din P din și N unde

21427
16:48:12,796 --> 16:48:17,916
P este probabilitatea ca tu să mergi

21428
16:48:14,956 --> 16:48:19,116
pentru a juca un joc de golf și N este

21429
16:48:17,916 --> 16:48:20,720
probabilitatea în care nu vei merge

21430
16:48:19,116 --> 16:48:22,480
juca golf. Acum, nu

21431
16:48:20,720 --> 16:48:23,680
chiar trebuie să memoreze aceste formule.

21432
16:48:22,480 --> 16:48:25,200
Sunt câțiva dintre ei acolo

21433
16:48:23,680 --> 16:48:26,560
in functie de cu ce lucrezi.

21434
16:48:25,200 --> 16:48:28,080
Dar este important de reținut că asta este

21435
16:48:26,560 --> 16:48:29,436
de unde provine această formulă. Deci

21436
16:48:28,080 --> 16:48:31,040
când îl vezi, nu ești pierdut când

21437
16:48:29,436 --> 16:48:32,880
îți rulezi programarea, dacă nu

21438
16:48:31,040 --> 16:48:35,916
îți construiești propriul arbore de decizie

21439
16:48:32,880 --> 16:48:40,480
cod în spate. Și pur și simplu avem un

21440
16:48:35,916 --> 16:48:43,116
log 2 din p n minus n / p n * jurnalul

21441
16:48:40,480 --> 16:48:44,720
pătratul lui n din p plus n. Dar hai să ne despărțim

21442
16:48:43,116 --> 16:48:46,796
asta jos și vezi ce arată de fapt

21443
16:48:44,720 --> 16:48:49,200
ca atunci când calculăm asta din

21444
16:48:46,796 --> 16:48:51,200
partea de script de calculator. Entropia a

21445
16:48:49,200 --> 16:48:53,680
clasa țintă a setului de date este

21446
16:48:51,200 --> 16:48:56,240
întreaga entropie. Deci avem joc de entropie

21447
16:48:53,680 --> 16:48:58,640
golf. Și ne uităm la asta. Dacă ne întoarcem

21448
16:48:56,240 --> 16:49:00,956
la date, puteți pur și simplu număra cum

21449
16:48:58,640 --> 16:49:03,680
multe da și nu în datele noastre complete

21450
16:49:00,956 --> 16:49:06,000
pregătit pentru zilele de joc de golf. În nostru

21451
16:49:03,680 --> 16:49:08,400
set complet, descoperim că avem cinci zile

21452
16:49:06,000 --> 16:49:11,520
am jucat golf și am făcut nouă zile

21453
16:49:08,400 --> 16:49:13,916
nu juca golf. Și astfel eu-ul nostru este egal, dacă

21454
16:49:11,520 --> 16:49:17,680
le adunați împreună, 9 5 este 14. Și

21455
16:49:13,916 --> 16:49:19,756
deci Iul nostru este egal cu 5 peste 14 și 9 peste 14.

21456
16:49:17,680 --> 16:49:22,480
Acestea sunt valorile noastre PNN la care ne conectăm

21457
16:49:19,756 --> 16:49:24,000
acea formulă. Și poți trece peste 5

21458
16:49:22,480 --> 16:49:26,320
14=.36.

21459
16:49:24,000 --> 16:49:28,560
9 peste4=64.

21460
16:49:26,320 --> 16:49:30,796
Și când faci toată ecuația, tu

21461
16:49:28,560 --> 16:49:36,320
obţine -.36

21462
16:49:30,796 --> 16:49:40,640
log<unk>^ 2 of.36 minus.64 log<unk> of

21463
16:49:36,320 --> 16:49:42,956
64. Și obținem o valoare setată. Primim 94.

21464
16:49:40,640 --> 16:49:44,796
Deci acum avem o valoare de entropie completă pentru

21465
16:49:42,956 --> 16:49:47,040
întregul set de date pe care le lucrăm

21466
16:49:44,796 --> 16:49:49,360
cu. Și vrem să facem acea entropie

21467
16:49:47,040 --> 16:49:51,436
coboara. Și așa cum am calculat

21468
16:49:49,360 --> 16:49:54,160
entropia pentru întregul set, putem

21469
16:49:51,436 --> 16:49:55,916
de asemenea, calculați entropia pentru a juca golf

21470
16:49:54,160 --> 16:49:58,720
și perspectiva. Oare va fi

21471
16:49:55,916 --> 16:50:00,956
înnorat sau ploios sau însorit? Și așa noi

21472
16:49:58,720 --> 16:50:03,596
uită-te la entropie. Avem P de soare

21473
16:50:00,956 --> 16:50:06,000
ori E de trei din doi. Și doar asta

21474
16:50:03,596 --> 16:50:08,480
iese cate zile insorite da si

21475
16:50:06,000 --> 16:50:10,000
câte zile însorite nu peste total,

21476
16:50:08,480 --> 16:50:11,916
care este cinci. Nu uitați să puneți

21477
16:50:10,000 --> 16:50:16,080
le vom împărți pe cele cinci mai târziu.

21478
16:50:11,916 --> 16:50:18,796
egal cu P înnorat = 4 virgulă 0 plus ploios

21479
16:50:16,080 --> 16:50:22,640
= 2a 3 și apoi când faci întregul

21480
16:50:18,796 --> 16:50:25,520
setup avem 5 peste4 amintiți-vă că am spus

21481
16:50:22,640 --> 16:50:30,480
au fost un total de cinci 5 peste 14 *

21482
16:50:25,520 --> 16:50:34,880
i-ul lui 3 din 2 4 peste 14 * 4 0

21483
16:50:30,480 --> 16:50:37,436
si 514 peste i din 23 si asa putem acum

21484
16:50:34,880 --> 16:50:39,596
calculați entropia doar a părții

21485
16:50:37,436 --> 16:50:42,640
asta are de-a face cu prognoza si noi

21486
16:50:39,596 --> 16:50:44,160
obține 693 similare Putem calcula

21487
16:50:42,640 --> 16:50:46,956
entropia altor predictori precum

21488
16:50:44,160 --> 16:50:48,560
temperatură, umiditate și vânt. Și așa

21489
16:50:46,956 --> 16:50:50,480
ne uităm la perspectiva câștigului. Cât de mult

21490
16:50:48,560 --> 16:50:52,560
vom câștiga din această entropie

21491
16:50:50,480 --> 16:50:55,276
joaca golf minus entropie joaca golf

21492
16:50:52,560 --> 16:50:58,480
perspectiva? Și putem lua originalul

21493
16:50:55,276 --> 16:51:01,436
0,94 pentru întregul set minus entropia

21494
16:50:58,480 --> 16:51:04,560
doar a zilei ploioase și a temperaturii

21495
16:51:01,436 --> 16:51:06,720
si ajungem cu un castig de.247.

21496
16:51:04,560 --> 16:51:09,116
Deci acesta este câștigul nostru de informații.

21497
16:51:06,720 --> 16:51:10,880
Amintiți-vă că definim entropia și definim

21498
16:51:09,116 --> 16:51:13,200
câștig de informații. Cu cât este mai mare

21499
16:51:10,880 --> 16:51:15,200
câștig de informații, cu cât entropia este mai mică,

21500
16:51:13,200 --> 16:51:16,720
cu atât mai bine. Câștigul de informații al

21501
16:51:15,200 --> 16:51:19,040
alte trei atribute pot fi calculate

21502
16:51:16,720 --> 16:51:22,160
in acelasi fel. Deci avem câștigul nostru pentru

21503
16:51:19,040 --> 16:51:23,916
temperatura este egală cu 0,029.

21504
16:51:22,160 --> 16:51:25,596
Avem câștigul nostru pentru umiditate

21505
16:51:23,916 --> 16:51:27,756
egal.152.

21506
16:51:25,596 --> 16:51:30,560
Și câștigul nostru pentru o zi cu vânt este egal

21507
16:51:27,756 --> 16:51:34,000
0048. Și dacă faci o comparație rapidă,

21508
16:51:30,560 --> 16:51:36,160
veți vedea că 247 este cel mai mare câștig

21509
16:51:34,000 --> 16:51:38,560
de informatii. Deci aceasta este despărțirea noastră

21510
16:51:36,160 --> 16:51:40,320
vreau. Acum să construim arborele de decizie.

21511
16:51:38,560 --> 16:51:42,640
Deci, avem perspectiva. Oare se va

21512
16:51:40,320 --> 16:51:44,000
să fie însorit, înnorat sau ploios? Asta e a noastră

21513
16:51:42,640 --> 16:51:45,596
prima împărțire pentru că asta ne oferă

21514
16:51:44,000 --> 16:51:47,276
cea mai mare parte a informațiilor câștigă. Și putem

21515
16:51:45,596 --> 16:51:49,116
continuați să coborâți în copac folosind

21516
16:51:47,276 --> 16:51:51,276
diferite câștiguri de informații cu

21517
16:51:49,116 --> 16:51:53,116
cea mai mare informație. Putem continua

21518
16:51:51,276 --> 16:51:54,720
jos nodurile copacului unde noi

21519
16:51:53,116 --> 16:51:56,956
alegeți atributul cu cel mai mare

21520
16:51:54,720 --> 16:51:59,520
câștig de informații ca nod rădăcină și

21521
16:51:56,956 --> 16:52:01,276
apoi continuați să împărțiți fiecare subnod cu

21522
16:51:59,520 --> 16:52:02,956
cel mai mare câștig de informații pe care îl putem

21523
16:52:01,276 --> 16:52:05,200
calculează. Și deși este puțin

21524
16:52:02,956 --> 16:52:07,360
a unui stropitor de limbi pentru a spune toate astea, tu

21525
16:52:05,200 --> 16:52:09,680
pot vedea că este foarte ușor de vizualizat

21526
16:52:07,360 --> 16:52:11,840
model vizual. Avem perspectiva noastră. Noi

21527
16:52:09,680 --> 16:52:13,840
împărțiți-l în trei direcții diferite. Dacă

21528
16:52:11,840 --> 16:52:15,596
perspectivele sunt înnorate, o vom face

21529
16:52:13,840 --> 16:52:17,520
joacă. Și apoi le putem împărți

21530
16:52:15,596 --> 16:52:19,756
mai jos dacă vrem. Deci, dacă s-a terminat

21531
16:52:17,520 --> 16:52:22,080
perspectiva este însorită, dar apoi este și

21532
16:52:19,756 --> 16:52:24,320
vânt. Dacă bate vânt, nu mergem

21533
16:52:22,080 --> 16:52:26,956
a juca. Dacă nu bate vânt, vom face

21534
16:52:24,320 --> 16:52:28,796
joacă. Deci, putem construi cu ușurință un frumos

21535
16:52:26,956 --> 16:52:30,480
arborele de decizie pentru a ghici ce am face

21536
16:52:28,796 --> 16:52:32,956
îmi place să fac mâine și să ne ofere un frumos

21537
16:52:30,480 --> 16:52:34,400
recomandare pentru zi. Deci, vrem

21538
16:52:32,956 --> 16:52:35,916
pentru a ști dacă este o zi bună pentru a juca golf

21539
16:52:34,400 --> 16:52:37,116
când este soare și vânt. Amintiți-vă de

21540
16:52:35,916 --> 16:52:38,560
întrebare originală care a ieșit,

21541
16:52:37,116 --> 16:52:40,240
buletinul meteo de mâine este însorit și

21542
16:52:38,560 --> 16:52:42,400
vânt. Puteți vedea coborând

21543
16:52:40,240 --> 16:52:44,000
copac, mergem perspective însorite, perspective

21544
16:52:42,400 --> 16:52:45,916
vânt. Nu vom juca golf

21545
16:52:44,000 --> 16:52:48,480
mâine. Așadar, micul nostru smartwatch apare

21546
16:52:45,916 --> 16:52:50,320
se ridică și spune, îmi pare rău, mâine nu este a

21547
16:52:48,480 --> 16:52:52,636
zi buna pentru golf. O să fie

21548
16:52:50,320 --> 16:52:55,276
insorit si vant. Și dacă ești uriaș

21549
16:52:52,636 --> 16:52:57,200
fan de golf, s-ar putea să spui: „Uh oh, nu este

21550
16:52:55,276 --> 16:52:59,040
o zi bună pentru a juca golf.” Putem intra

21551
16:52:57,200 --> 16:53:00,480
și urmăriți un meci de golf acasă. Deci, vom face

21552
16:52:59,040 --> 16:53:02,796
stai in fata televizorului in loc sa fii

21553
16:53:00,480 --> 16:53:04,400
afară jucând golf în vânt. Acum că

21554
16:53:02,796 --> 16:53:06,320
ne-am uitat la arborele nostru de decizie, haideți

21555
16:53:04,400 --> 16:53:08,636
uită-te la al treilea algoritm al noștri

21556
16:53:06,320 --> 16:53:10,720
investigam. Vector suport

21557
16:53:08,636 --> 16:53:12,880
mașină. Mașina vectorială de suport este a

21558
16:53:10,720 --> 16:53:14,796
algoritm de clasificare utilizat pe scară largă.

21559
16:53:12,880 --> 16:53:16,400
Ideea de mașină vector suport este

21560
16:53:14,796 --> 16:53:18,080
simplu. Algoritmul creează a

21561
16:53:16,400 --> 16:53:20,080
linie de separare care desparte

21562
16:53:18,080 --> 16:53:22,480
orele în cel mai bun mod posibil. Pentru

21563
16:53:20,080 --> 16:53:24,880
de exemplu, câine sau pisică, boală sau nu

21564
16:53:22,480 --> 16:53:27,040
boala. Să presupunem că avem o etichetă

21565
16:53:24,880 --> 16:53:30,320
date eșantion care indică înălțimea și

21566
16:53:27,040 --> 16:53:31,596
greutatea masculilor si femelelor. O nouă dată

21567
16:53:30,320 --> 16:53:33,116
sosește punctul și vrem să știm

21568
16:53:31,596 --> 16:53:36,080
fie că va fi un bărbat sau un

21569
16:53:33,116 --> 16:53:37,840
femeie. Așa că începem prin a trasa o linie.

21570
16:53:36,080 --> 16:53:39,916
Tragem linii de decizie. Dar dacă noi

21571
16:53:37,840 --> 16:53:42,320
luați în considerare prima linie de decizie, atunci vom face

21572
16:53:39,916 --> 16:53:44,636
clasifica individul ca bărbat. Şi

21573
16:53:42,320 --> 16:53:46,720
dacă luăm în considerare linia de decizie a doua, atunci

21574
16:53:44,636 --> 16:53:48,080
va fi o femeie. Deci poți vedea asta

21575
16:53:46,720 --> 16:53:49,520
o persoană stă cam în mijlocul

21576
16:53:48,080 --> 16:53:50,720
doua grupuri. Deci este puțin confuz

21577
16:53:49,520 --> 16:53:52,320
încercând să-şi dea seama pe ce linie

21578
16:53:50,720 --> 16:53:54,880
ar trebui să fie sub. Trebuie să știm care

21579
16:53:52,320 --> 16:53:57,840
linia împarte corect clasele. Dar

21580
16:53:54,880 --> 16:53:59,680
cum scopul este de a alege un hiperplan

21581
16:53:57,840 --> 16:54:01,680
și acesta este unul dintre cuvintele cheie ei

21582
16:53:59,680 --> 16:54:04,000
folosiți când vorbim despre vector suport

21583
16:54:01,680 --> 16:54:06,000
masini. Alegeți un hiperplan cu

21584
16:54:04,000 --> 16:54:07,840
cea mai mare marja posibila intre

21585
16:54:06,000 --> 16:54:10,480
linia de decizie și cel mai apropiat punct

21586
16:54:07,840 --> 16:54:12,956
în cadrul setului de antrenament. Deci poți vedea

21587
16:54:10,480 --> 16:54:14,956
aici avem vectorul nostru de suport. Avem

21588
16:54:12,956 --> 16:54:17,360
cele mai apropiate două puncte de el și desenăm

21589
16:54:14,956 --> 16:54:19,596
o linie între cele două puncte. Iar cel

21590
16:54:17,360 --> 16:54:21,596
marginea distanței este distanța dintre

21591
16:54:19,596 --> 16:54:23,756
hiperplanul și datele cele mai apropiate

21592
16:54:21,596 --> 16:54:26,480
punct din oricare set. Deci noi de fapt

21593
16:54:23,756 --> 16:54:28,560
au o valoare și ar trebui să fie egală

21594
16:54:26,480 --> 16:54:30,560
distanta intre cele doua puncte care

21595
16:54:28,560 --> 16:54:32,796
o comparăm cu. Când desenăm

21596
16:54:30,560 --> 16:54:35,436
hiperplane, observăm acea linie unu

21597
16:54:32,796 --> 16:54:37,436
are o distanta maxima. Așa că observăm

21598
16:54:35,436 --> 16:54:39,360
acea linie are o distanta maxima

21599
16:54:37,436 --> 16:54:41,520
marginea. Deci vom clasifica noile date

21600
16:54:39,360 --> 16:54:43,200
punct corect. Și rezultatul nostru în acest sens

21601
16:54:41,520 --> 16:54:45,520
unul va fi că noile date

21602
16:54:43,200 --> 16:54:49,916
punctul este MEL. Unul dintre motivele pentru care sunăm

21603
16:54:45,520 --> 16:54:51,680
un hiperplan față de o linie este că a

21604
16:54:49,916 --> 16:54:53,680
de multe ori nu ne uităm doar la

21605
16:54:51,680 --> 16:54:56,880
greutatea și înălțimea. S-ar putea să căutăm

21606
16:54:53,680 --> 16:54:58,880
la 36 de caracteristici sau dimensiuni diferite.

21607
16:54:56,880 --> 16:55:00,956
Și așa când o tăiem cu un hiper

21608
16:54:58,880 --> 16:55:03,116
avion, este mai mult un tridimensional

21609
16:55:00,956 --> 16:55:05,040
tăiați datele, multidimensionale care

21610
16:55:03,116 --> 16:55:07,520
reduce datele într-un anumit fel. Și fiecare

21611
16:55:05,040 --> 16:55:09,756
avionul continuă să-l taie până când noi

21612
16:55:07,520 --> 16:55:11,116
obține cea mai bună potrivire sau potrivire. hai sa

21613
16:55:09,756 --> 16:55:12,880
înțelege asta cu ajutorul unui

21614
16:55:11,116 --> 16:55:14,000
exemplu. Declarația problemei. Tu mereu

21615
16:55:12,880 --> 16:55:15,200
începe cu o declarație de problemă când

21616
16:55:14,000 --> 16:55:16,480
vei pune niște coduri împreună.

21617
16:55:15,200 --> 16:55:18,636
Vom face ceva codare acum.

21618
16:55:16,480 --> 16:55:21,436
Clasificarea rețetelor de brioșe și cupcake

21619
16:55:18,636 --> 16:55:24,000
folosind mașini vector suport. Deci

21620
16:55:21,436 --> 16:55:26,080
cupcake versus brioșă. Să luăm o

21621
16:55:24,000 --> 16:55:28,160
uită-te la setul nostru de date. Și avem

21622
16:55:26,080 --> 16:55:30,880
diferite rețete aici. Avem o brioșă

21623
16:55:28,160 --> 16:55:33,276
reteta care are atata faina. nu sunt

21624
16:55:30,880 --> 16:55:36,956
sigur în ce măsură este 55, dar asta

21625
16:55:33,276 --> 16:55:38,400
are 55, poate sunt uncii, dar are o

21626
16:55:36,956 --> 16:55:41,116
o anumită cantitate de făină, o anumită cantitate

21627
16:55:38,400 --> 16:55:43,596
de lapte, zahăr, unt, ou, copt

21628
16:55:41,116 --> 16:55:45,520
pudră, vanilie și sare. Și așa se bazează

21629
16:55:43,596 --> 16:55:47,040
pe aceste măsurători, vrem să ghicim

21630
16:55:45,520 --> 16:55:49,276
fie că facem o brioșă sau o

21631
16:55:47,040 --> 16:55:51,276
cupcake. Și puteți vedea în acesta, noi

21632
16:55:49,276 --> 16:55:53,116
nu au doar două caracteristici. Noi nu

21633
16:55:51,276 --> 16:55:55,360
doar să avem înălțime și greutate așa cum am făcut noi

21634
16:55:53,116 --> 16:55:57,840
inainte intre mascul si femela. În

21635
16:55:55,360 --> 16:55:59,520
aici, avem o serie de caracteristici. În

21636
16:55:57,840 --> 16:56:01,756
de fapt, în asta, ne uităm la opt

21637
16:55:59,520 --> 16:56:04,240
caracteristici diferite pentru a ghici dacă este

21638
16:56:01,756 --> 16:56:05,756
o brioșă sau o brioșă. Care este

21639
16:56:04,240 --> 16:56:08,080
diferența dintre o brioșă și a

21640
16:56:05,756 --> 16:56:10,320
cupcake? Se pare că brioșele au mai multe

21641
16:56:08,080 --> 16:56:12,720
făină, în timp ce cupcakes au mai mult unt

21642
16:56:10,320 --> 16:56:14,240
și zahăr. Deci, practic, cupcakes a

21643
16:56:12,720 --> 16:56:15,756
un pic mai mult de un desert, unde

21644
16:56:14,240 --> 16:56:18,000
brioșele sunt puțin mai fanteziste

21645
16:56:15,756 --> 16:56:20,080
pâine. Dar cum facem asta în Python?

21646
16:56:18,000 --> 16:56:21,840
Cum codificăm asta pentru a trece

21647
16:56:20,080 --> 16:56:24,560
retete si afla care este reteta

21648
16:56:21,840 --> 16:56:28,080
este? Și chiar vreau să spun

21649
16:56:24,560 --> 16:56:30,080
cupcakes versus brioșe ca unele mari

21650
16:56:28,080 --> 16:56:32,636
chestie de lupte profesionale. Înainte de noi

21651
16:56:30,080 --> 16:56:34,956
începem cu brioșele noastre versus brioșe, noi

21652
16:56:32,636 --> 16:56:36,880
vor lucra în Python.

21653
16:56:34,956 --> 16:56:38,560
Există multe versiuni de Python, multe

21654
16:56:36,880 --> 16:56:41,276
editori diferiti. Acesta este unul dintre

21655
16:56:38,560 --> 16:56:43,040
punctele forte și punctele slabe ale lui Python sunt

21656
16:56:41,276 --> 16:56:45,360
doar are atât de multe lucruri atașate.

21657
16:56:43,040 --> 16:56:47,360
Este una dintre cele mai populare date

21658
16:56:45,360 --> 16:56:49,436
pachete de programare științifică pe care le puteți

21659
16:56:47,360 --> 16:56:52,480
folosi. În acest caz, vom merge

21660
16:56:49,436 --> 16:56:55,596
înainte și folosiți Anaconda în Jupyter

21661
16:56:52,480 --> 16:56:58,320
Caiet. Anaconda Navigator are toate

21662
16:56:55,596 --> 16:57:00,400
feluri de instrumente distractive. Odată ce intri în

21663
16:56:58,320 --> 16:57:02,320
Anaconda Navigator, te poți schimba

21664
16:57:00,400 --> 16:57:04,320
medii. De fapt, am un număr

21665
16:57:02,320 --> 16:57:07,276
de medii de aici. Vom folosi

21666
16:57:04,320 --> 16:57:09,840
Mediul Python 36. Deci, acesta este în

21667
16:57:07,276 --> 16:57:12,240
Versiunea Python 36. Deși, nu

21668
16:57:09,840 --> 16:57:14,000
contează prea mult ce versiune folosești. eu

21669
16:57:12,240 --> 16:57:15,680
de obicei încearcă să rămâi cu 3x pentru că

21670
16:57:14,000 --> 16:57:17,276
sunt actuale, cu excepția cazului în care aveți un

21671
16:57:15,680 --> 16:57:19,916
proiect care este foarte specific în

21672
16:57:17,276 --> 16:57:22,080
versiunea 2x 27 cred că este de obicei ceea ce

21673
16:57:19,916 --> 16:57:24,400
majoritatea oamenilor folosesc în versiunea a doua. Şi

21674
16:57:22,080 --> 16:57:26,720
apoi, odată ce suntem în Jupiterul nostru

21675
16:57:24,400 --> 16:57:30,080
editor de notebook, pot merge sus și crea

21676
16:57:26,720 --> 16:57:33,116
un fișier nou și vom sări aici.

21677
16:57:30,080 --> 16:57:35,360
În acest caz, facem brioșe SPM

21678
16:57:33,116 --> 16:57:40,000
versus cupcake. Și apoi să începem

21679
16:57:35,360 --> 16:57:41,916
cu pachetele noastre pentru analiza datelor.

21680
16:57:40,000 --> 16:57:43,916
Și aproape întotdeauna folosim un cuplu

21681
16:57:41,916 --> 16:57:50,116
avem câteva pachete foarte standard

21682
16:57:43,916 --> 16:57:50,116
utilizare. Folosim import oops import

21683
16:57:50,400 --> 16:57:54,320
numpy

21684
16:57:52,000 --> 16:57:57,200
asta e pentru number python. Ei de obicei

21685
16:57:54,320 --> 16:57:59,436
denotă-l ca np care este foarte virgulă, adică

21686
16:57:57,200 --> 16:58:03,916
foarte frecvente. Și apoi vom merge

21687
16:57:59,436 --> 16:58:05,360
import panda ca pd. Și oferte numpy

21688
16:58:03,916 --> 16:58:07,276
cu matrice de numere. Sunt multe

21689
16:58:05,360 --> 16:58:10,080
lucruri interesante pe care le poți face cu numpy uh

21690
16:58:07,276 --> 16:58:12,720
configurarea în măsura în care înmulțim toate

21691
16:58:10,080 --> 16:58:15,756
valori într-o matrice într-o matrice de date numpy

21692
16:58:12,720 --> 16:58:17,276
matrice. Panda nu-mi amintesc dacă suntem

21693
16:58:15,756 --> 16:58:19,116
folosind-o efectiv în acest set de date. eu

21694
16:58:17,276 --> 16:58:21,200
Cred că facem ca un import, face un frumos

21695
16:58:19,116 --> 16:58:24,240
cadru de date. Și diferența dintre a

21696
16:58:21,200 --> 16:58:25,756
cadru de date și o matrice numpy este că a

21697
16:58:24,240 --> 16:58:28,160
cadrul de date este mai degrabă ca Excel

21698
16:58:25,756 --> 16:58:30,240
foaie de calcul. Ai coloane, ai

21699
16:58:28,160 --> 16:58:32,720
indici. Deci ai moduri diferite de

21700
16:58:30,240 --> 16:58:34,560
referindu-l cu ușurință vizându-l. Şi

21701
16:58:32,720 --> 16:58:36,636
există funcții suplimentare pe care le puteți rula

21702
16:58:34,560 --> 16:58:38,796
pe un cadru de date. Și panda se cam așază

21703
16:58:36,636 --> 16:58:41,436
pe numpy. Deci în ele ai nevoie de amândoi

21704
16:58:38,796 --> 16:58:45,276
acolo. Și apoi, în sfârșit, lucrăm

21705
16:58:41,436 --> 16:58:47,520
cu mașina vectorului suport. Deci de la

21706
16:58:45,276 --> 16:58:51,520
sklearn, vom folosi sklearn

21707
16:58:47,520 --> 16:58:53,840
model. Importați vectorul de suport SVM

21708
16:58:51,520 --> 16:58:56,796
mașină.

21709
16:58:53,840 --> 16:58:59,916
Și apoi, ca om de știință de date, ar trebui

21710
16:58:56,796 --> 16:59:01,916
încercați întotdeauna să vă vizualizați datele. Unii

21711
16:58:59,916 --> 16:59:03,840
datele, evident, sunt prea complicate sau

21712
16:59:01,916 --> 16:59:05,360
nu are niciun sens pentru om. Dar

21713
16:59:03,840 --> 16:59:06,956
daca se poate, e bine sa iei o

21714
16:59:05,360 --> 16:59:08,636
a doua uită-te la el ca să poți

21715
16:59:06,956 --> 16:59:10,480
vezi de fapt ce faci. Acum, pentru

21716
16:59:08,636 --> 16:59:12,000
asta, vom folosi două pachete.

21717
16:59:10,480 --> 16:59:15,680
Vom importa mapplot

21718
16:59:12,000 --> 16:59:18,796
library.pipplot ca plt. Din nou, foarte

21719
16:59:15,680 --> 16:59:21,276
comune. Și vom importa marin

21720
16:59:18,796 --> 16:59:23,436
ca sns. Și vom merge înainte și vom stabili

21721
16:59:21,276 --> 16:59:25,596
scara fontului în SNS chiar în nostru

21722
16:59:23,436 --> 16:59:28,560
linie de import. Asta este U

21723
16:59:25,596 --> 16:59:30,480
punct și virgulă urmat de o linie de date.

21724
16:59:28,560 --> 16:59:32,880
Vom seta SNS-ul. Și acestea

21725
16:59:30,480 --> 16:59:35,040
sunt grozave pentru că se află marea

21726
16:59:32,880 --> 16:59:37,360
în partea de sus a bibliotecii de hărți la fel ca

21727
16:59:35,040 --> 16:59:40,080
panda stă pe numpy. Deci adaugă mult

21728
16:59:37,360 --> 16:59:41,520
mai multe caracteristici, utilizări și control.

21729
16:59:40,080 --> 16:59:43,436
Evident că nu vom intra

21730
16:59:41,520 --> 16:59:45,680
biblioteca mattplot și seabour. Va fi al lui

21731
16:59:43,436 --> 16:59:48,400
propriul tutorial. Chiar ne concentrăm

21732
16:59:45,680 --> 16:59:52,080
pe SVM, mașina vector de suport

21733
16:59:48,400 --> 16:59:54,480
din sklearn. Și din moment ce suntem în Jupyter

21734
16:59:52,080 --> 16:59:57,916
caiet, trebuie să adăugăm o specială

21735
16:59:54,480 --> 17:00:00,480
intră aici pentru biblioteca noastră mattplot.

21736
16:59:57,916 --> 17:00:04,080
Și acesta este semnul tău procentual sau chihlimbarul

21737
17:00:00,480 --> 17:00:06,000
semnează biblioteca mattplot în linie. Acum, dacă

21738
17:00:04,080 --> 17:00:08,240
faci asta doar într-o directie

21739
17:00:06,000 --> 17:00:09,756
proiect de cod, de multe ori folosesc like

21740
17:00:08,240 --> 17:00:11,680
Notepad  

21741
17:00:09,756 --> 17:00:13,040
și o voi rula de acolo. Tu nu

21742
17:00:11,680 --> 17:00:14,880
trebuie să aibă acea linie acolo pentru că

21743
17:00:13,040 --> 17:00:16,240
va apărea ca o fereastră proprie

21744
17:00:14,880 --> 17:00:18,480
computerul dvs. în funcție de modul în care sunteți

21745
17:00:16,240 --> 17:00:20,880
computerul este configurat pentru că rulăm

21746
17:00:18,480 --> 17:00:23,916
asta în caietul Jupyter ca a

21747
17:00:20,880 --> 17:00:26,480
configurarea browserului. Aceasta îi spune să se afișeze

21748
17:00:23,916 --> 17:00:29,040
toate graficele noastre chiar mai jos pe

21749
17:00:26,480 --> 17:00:30,480
pagina. Deci pentru asta este acea linie.

21750
17:00:29,040 --> 17:00:31,756
Amintește-ți prima dată când am alergat asta, eu

21751
17:00:30,480 --> 17:00:33,916
nu știam asta și trebuia să mă duc să caut

21752
17:00:31,756 --> 17:00:36,000
asta cu ani in urma. Este destul de un

21753
17:00:33,916 --> 17:00:38,240
durere de cap. Deci, biblioteca mattplot inline este

21754
17:00:36,000 --> 17:00:40,400
doar pentru că rulăm asta pe

21755
17:00:38,240 --> 17:00:42,080
configurarea web și putem merge mai departe și rulăm

21756
17:00:40,400 --> 17:00:44,400
aceasta. asigurați-vă că toate modulele noastre sunt incluse.

21757
17:00:42,080 --> 17:00:46,080
Toate sunt importate, ceea ce este grozav. Dacă

21758
17:00:44,400 --> 17:00:48,636
nu le ai import, vei avea nevoie

21759
17:00:46,080 --> 17:00:49,756
a merge înainte și pip. Folosește pip sau

21760
17:00:48,636 --> 17:00:51,680
oricum ai face-o. Sunt multe

21761
17:00:49,756 --> 17:00:53,520
alte pachete de instalare acolo,

21762
17:00:51,680 --> 17:00:54,480
deși pip este cel mai frecvent. Iar tu

21763
17:00:53,520 --> 17:00:57,276
trebuie să vă asigurați că acestea sunt toate

21764
17:00:54,480 --> 17:00:58,720
instalat în configurația dvs. Python. Următorul

21765
17:00:57,276 --> 17:01:01,360
pasul, desigur, este să ne uităm

21766
17:00:58,720 --> 17:01:02,880
datele. Nu poți rula un model pentru

21767
17:01:01,360 --> 17:01:04,796
prezicerea datelor dacă nu aveți reale

21768
17:01:02,880 --> 17:01:07,360
date. Deci, ca să fac asta, lasă-mă să merg înainte

21769
17:01:04,796 --> 17:01:10,240
și deschide asta și aruncă o privire. Iar noi

21770
17:01:07,360 --> 17:01:13,116
avem brioșele versus brioșele noastre. şi

21771
17:01:10,240 --> 17:01:15,520
este un fișier CSV sau CSV, ceea ce înseamnă că este

21772
17:01:13,116 --> 17:01:17,116
variabilă separată prin virgulă

21773
17:01:15,520 --> 17:01:19,756
și o va deschide într-un mod frumos

21774
17:01:17,116 --> 17:01:21,680
foaie de calcul pentru mine. Și poți vedea

21775
17:01:19,756 --> 17:01:24,000
aici sus avem tipul de brioșe pe care le avem

21776
17:01:21,680 --> 17:01:25,756
brioșă brioșă cupcake cupcake cupcake

21777
17:01:24,000 --> 17:01:28,240
și apoi este rupt în făină,

21778
17:01:25,756 --> 17:01:31,040
lapte, zahăr, unt, ou, praf de copt,

21779
17:01:28,240 --> 17:01:33,840
vanilie si sare. Deci putem face asta putem

21780
17:01:31,040 --> 17:01:36,796
mergeți mai departe și uitați-vă la aceste date și în

21781
17:01:33,840 --> 17:01:40,160
Python-ul nostru.

21782
17:01:36,796 --> 17:01:43,116
Să creăm o rețetă variabilă egală

21783
17:01:40,160 --> 17:01:46,560
vom folosi modulul nostru panda

21784
17:01:43,116 --> 17:01:48,400
citește CSV. Amintiți-vă este o virgulă

21785
17:01:46,560 --> 17:01:50,000
variabilă

21786
17:01:48,400 --> 17:01:52,956
iar numele fișierului s-a întâmplat să fie

21787
17:01:50,000 --> 17:01:56,596
cupcakes versus brioșe. Hopa, am înțeles

21788
17:01:52,956 --> 17:01:56,596
paranteze duble acolo.

21789
17:01:57,596 --> 17:02:01,160
Fă-o așa.

21790
17:02:01,916 --> 17:02:08,000
Iată-ne. cupcakes versus brioșe.

21791
17:02:05,200 --> 17:02:10,000
Pentru că programul pe care l-am încărcat sau

21792
17:02:08,000 --> 17:02:12,160
locul în care am salvat acest Python special

21793
17:02:10,000 --> 17:02:14,080
programul este în același folder, putem

21794
17:02:12,160 --> 17:02:15,360
descurcă-te doar cu numele fișierului. Dar

21795
17:02:14,080 --> 17:02:16,796
amintiți-vă, dacă îl depozitați într-un

21796
17:02:15,360 --> 17:02:20,320
locație diferită, trebuie să puneți și

21797
17:02:16,796 --> 17:02:22,880
pe drumul complet de acolo.

21798
17:02:20,320 --> 17:02:25,276
Și apoi pentru că suntem în panda, suntem

21799
17:02:22,880 --> 17:02:27,040
va merge înainte și chiar poți

21800
17:02:25,276 --> 17:02:29,596
la rând, poți face asta, dar lasă-mă să fac

21801
17:02:27,040 --> 17:02:32,880
print-ul complet. Poți doar să tastați

21802
17:02:29,596 --> 17:02:34,796
rețete.cap cap în Jupyter

21803
17:02:32,880 --> 17:02:36,320
caietul. Dar dacă rulezi în cod

21804
17:02:34,796 --> 17:02:37,680
într-un script diferit, ar trebui să pleci

21805
17:02:36,320 --> 17:02:39,840
înainte și tastați întregul tipărit

21806
17:02:37,680 --> 17:02:41,680
retete.

21807
17:02:39,840 --> 17:02:44,956
Și Pandanda's știe că asta va merge

21808
17:02:41,680 --> 17:02:47,116
primele cinci rânduri de date. Și dacă noi

21809
17:02:44,956 --> 17:02:50,560
întoarceți înapoi la foaia de calcul

21810
17:02:47,116 --> 17:02:52,080
unde am deschis fișierul nostru CSV,

21811
17:02:50,560 --> 17:02:55,520
uh, puteți vedea de unde începe online

21812
17:02:52,080 --> 17:02:58,400
doi. Acesta îl numește zero. Și apoi 2

21813
17:02:55,520 --> 17:02:59,436
3 4 5 6 se va potrivi. Du-te și închide

21814
17:02:58,400 --> 17:03:02,320
asta pentru că nu avem nevoie de asta

21815
17:02:59,436 --> 17:03:04,000
mai mult. Și începe întotdeauna de la zero.

21816
17:03:02,320 --> 17:03:06,320
Și acestea sunt indexate automat

21817
17:03:04,000 --> 17:03:08,320
de vreme ce nu i-am spus să folosească un

21818
17:03:06,320 --> 17:03:10,480
index aici. Deci acesta este indexul

21819
17:03:08,320 --> 17:03:13,596
număr pentru partea stângă. Și asta

21820
17:03:10,480 --> 17:03:17,360
a luat automat rândul de sus ca

21821
17:03:13,596 --> 17:03:20,080
etichete. Deci, panda o folosește pentru a citi un CSV

21822
17:03:17,360 --> 17:03:22,400
este pur și simplu foarte elegant și rapid. Unul dintre

21823
17:03:20,080 --> 17:03:23,840
motivele pentru care ne iubim panda, nu doar

21824
17:03:22,400 --> 17:03:26,160
pentru că sunt drăguți și drăgălași

21825
17:03:23,840 --> 17:03:29,840
urșilor.

21826
17:03:26,160 --> 17:03:31,596
Și să mergem mai departe și să ne trasăm datele.

21827
17:03:29,840 --> 17:03:34,320
Și nu am de gând să complot totul. eu sunt

21828
17:03:31,596 --> 17:03:37,680
doar o să complotez zahărul uh și

21829
17:03:34,320 --> 17:03:39,596
făină. Acum, evident, puteți vedea unde

21830
17:03:37,680 --> 17:03:42,240
se complică cu adevărat dacă avem

21831
17:03:39,596 --> 17:03:43,840
tone de caracteristici diferite. Si asa,

21832
17:03:42,240 --> 17:03:45,596
le vei despărți și poate te uiți la

21833
17:03:43,840 --> 17:03:48,000
doar doi dintre ei la un moment dat pentru a vedea cum

21834
17:03:45,596 --> 17:03:49,116
se conectează.

21835
17:03:48,000 --> 17:03:51,756
Și să le complotăm, o să mergem

21836
17:03:49,116 --> 17:03:56,000
înainte și folosiți Seabor. Deci, acesta este al nostru

21837
17:03:51,756 --> 17:03:58,080
SNS. Și comanda pentru asta este SNS.LM

21838
17:03:56,000 --> 17:04:00,560
complot. Și apoi cele două diferite

21839
17:03:58,080 --> 17:04:02,160
variabilele pe care le voi reprezenta este făina și

21840
17:04:00,560 --> 17:04:05,596
zahăr.

21841
17:04:02,160 --> 17:04:07,840
Datele sunt egale cu rețete. Nuanța este egală

21842
17:04:05,596 --> 17:04:10,796
tip. Și asta este foarte distractiv pentru că

21843
17:04:07,840 --> 17:04:12,636
știe că sunt panda care vin.

21844
17:04:10,796 --> 17:04:17,276
Deci acesta este unul dintre lucrurile puternice

21845
17:04:12,636 --> 17:04:19,596
despre panda amestecate cu seabor și face

21846
17:04:17,276 --> 17:04:21,680
graficarea. Și apoi vom folosi a

21847
17:04:19,596 --> 17:04:23,360
set de paleți unul. Sunt multe

21848
17:04:21,680 --> 17:04:26,240
seturi diferite acolo. Poți merge să te uiți

21849
17:04:23,360 --> 17:04:27,840
ei pentru muncă pe mare. Facem o potrivire regulata

21850
17:04:26,240 --> 17:04:30,000
regulat este egal cu fals. Deci, nu suntem

21851
17:04:27,840 --> 17:04:32,480
chiar încercând să se potrivească cu orice. Și este

21852
17:04:30,000 --> 17:04:33,756
un KWS împrăștiat.

21853
17:04:32,480 --> 17:04:35,276
Multe dintre aceste setări le puteți căuta

21854
17:04:33,756 --> 17:04:37,200
în Seabor. Jumătate dintre acestea ai putea

21855
17:04:35,276 --> 17:04:38,636
probabil încetați când le rulați.

21856
17:04:37,200 --> 17:04:40,560
Cineva s-a jucat cu asta și a aflat

21857
17:04:38,636 --> 17:04:43,116
că acestea erau cele mai bune setări pentru

21858
17:04:40,560 --> 17:04:45,756
făcând un complot Seabor. Și să mergem înainte

21859
17:04:43,116 --> 17:04:49,200
și rulează asta. Și pentru că o face în

21860
17:04:45,756 --> 17:04:52,080
linie, o pune doar pe pagină.

21861
17:04:49,200 --> 17:04:55,360
Și puteți vedea chiar aici doar că

21862
17:04:52,080 --> 17:04:58,400
numai pe baza de zahăr și făină, există

21863
17:04:55,360 --> 17:04:59,756
o scindare definita. Și le folosim

21864
17:04:58,400 --> 17:05:01,916
modele pentru că te poți uita efectiv la

21865
17:04:59,756 --> 17:05:03,840
și spuneți: „Hei, dacă aș tras o linie corect

21866
17:05:01,916 --> 17:05:07,596
între mijlocul punctelor albastre și

21867
17:05:03,840 --> 17:05:09,436
punctele roșii, am putea face un SVM

21868
17:05:07,596 --> 17:05:12,436
și un hiperplan chiar acolo în

21869
17:05:09,436 --> 17:05:12,436
mijloc.

21870
17:05:12,720 --> 17:05:19,480
Apoi, următorul pas este formatarea sau

21871
17:05:16,480 --> 17:05:19,480
preproces

21872
17:05:20,240 --> 17:05:23,596
datele noastre.

21873
17:05:22,400 --> 17:05:26,560
Și o să despărțim asta în

21874
17:05:23,596 --> 17:05:29,840
două părți.

21875
17:05:26,560 --> 17:05:31,040
Avem nevoie de o etichetă de tip. Și amintește-ți,

21876
17:05:29,840 --> 17:05:32,880
vom decide dacă este o

21877
17:05:31,040 --> 17:05:34,636
brioșă sau o brioșă. Ei bine, un computer

21878
17:05:32,880 --> 17:05:37,436
nu știe brioșe sau cupcake. Ştie

21879
17:05:34,636 --> 17:05:39,916
zero și unu. Deci, ce vom face

21880
17:05:37,436 --> 17:05:42,880
vom crea o etichetă de tip.

21881
17:05:39,916 --> 17:05:46,560
Și din aceasta vom crea o matrice numpy

21882
17:05:42,880 --> 17:05:49,200
nump unde și aici putem face

21883
17:05:46,560 --> 17:05:52,880
ceva logica. Ne luăm rețetele de la noi

21884
17:05:49,200 --> 17:05:55,360
panda și oriunde tipul este egal cu brioșe

21885
17:05:52,880 --> 17:05:57,436
va fi zero. Și apoi dacă

21886
17:05:55,360 --> 17:05:59,360
nu este egal cu brioșele, care sunt brioșe

21887
17:05:57,436 --> 17:06:02,400
va fi unul. Așa că ne creăm

21888
17:05:59,360 --> 17:06:04,080
eticheta de tip. Acesta este răspunsul. Deci când

21889
17:06:02,400 --> 17:06:06,160
facem modelul nostru de antrenament, amintiți-vă

21890
17:06:04,080 --> 17:06:07,360
trebuie să avem o date de antrenament. Aceasta

21891
17:06:06,160 --> 17:06:09,756
este cu ce o vom antrena. este

21892
17:06:07,360 --> 17:06:12,240
ca e zero sau unu? este o brioșă sau

21893
17:06:09,756 --> 17:06:13,436
nu este.

21894
17:06:12,240 --> 17:06:16,240
Și apoi ne vom crea

21895
17:06:13,436 --> 17:06:17,840
caracteristicile retetei.

21896
17:06:16,240 --> 17:06:21,040
Și dacă îți amintești bine din dreapta

21897
17:06:17,840 --> 17:06:22,560
aici sus, prima coloană este tip.

21898
17:06:21,040 --> 17:06:24,720
Deci nu avem nevoie de coloana de tip

21899
17:06:22,560 --> 17:06:27,276
pentru că asta e brioșa sau cupcake-ul nostru.

21900
17:06:24,720 --> 17:06:29,040
Și în panda, putem sorta cu ușurință asta

21901
17:06:27,276 --> 17:06:33,400
afară.

21902
17:06:29,040 --> 17:06:33,400
Luăm rețetele noastre de valoare

21903
17:06:33,436 --> 17:06:39,360
coloane. Aceasta este o funcție de panda construită

21904
17:06:36,240 --> 17:06:41,840
în panda.

21905
17:06:39,360 --> 17:06:43,596
valorile transformându-le în valori. Deci

21906
17:06:41,840 --> 17:06:46,160
sunt doar titlurile coloanelor care trec peste

21907
17:06:43,596 --> 17:06:47,756
vârful și nu-l dorim pe primul.

21908
17:06:46,160 --> 17:06:51,360
Deci ceea ce facem este că începe întotdeauna

21909
17:06:47,756 --> 17:06:54,000
la zero, vrem unul

21910
17:06:51,360 --> 17:06:56,400
colon până la sfârșit.

21911
17:06:54,000 --> 17:06:59,040
Și apoi vrem să mergem înainte și să facem

21912
17:06:56,400 --> 17:07:02,436
aceasta este o lista. Și asta îl transformă în a

21913
17:06:59,040 --> 17:07:02,436
lista de șiruri.

21914
17:07:02,720 --> 17:07:05,680
Și apoi putem merge înainte și luăm doar o

21915
17:07:04,400 --> 17:07:08,796
uite și vezi ce căutăm

21916
17:07:05,680 --> 17:07:12,240
caracteristicile. Asigurați-vă că arată corect.

21917
17:07:08,796 --> 17:07:14,796
Eu merg înainte și execut asta.

21918
17:07:12,240 --> 17:07:16,240
Și am uitat S la rețete. Deci, vom face

21919
17:07:14,796 --> 17:07:18,560
mergeți mai departe și adăugați S acolo și apoi

21920
17:07:16,240 --> 17:07:22,080
alerga asta. Și vedem că avem făină,

21921
17:07:18,560 --> 17:07:24,400
lapte, zahăr, unt, ou, praf de copt,

21922
17:07:22,080 --> 17:07:26,480
vanilie și sare. Și asta se potrivește cu ce

21923
17:07:24,400 --> 17:07:28,956
avem aici sus, nu? Unde am tipărit

21924
17:07:26,480 --> 17:07:32,240
afară totul, în afară de tipul. Deci, avem

21925
17:07:28,956 --> 17:07:34,320
caracteristicile noastre și avem eticheta noastră.

21926
17:07:32,240 --> 17:07:37,200
Acum, caracteristicile rețetei sunt doar

21927
17:07:34,320 --> 17:07:40,596
titlurile coloanelor. Chiar avem nevoie

21928
17:07:37,200 --> 17:07:40,596
ingredientele.

21929
17:07:41,916 --> 17:07:46,240
Și în acest moment, avem un cuplu

21930
17:07:43,916 --> 17:07:48,160
opțiuni. Unu, am putea trece peste toate

21931
17:07:46,240 --> 17:07:50,240
ingredientele.

21932
17:07:48,160 --> 17:07:51,916
Și când faci asta, de obicei tu

21933
17:07:50,240 --> 17:07:53,596
face. Dar, pentru exemplul nostru, vrem

21934
17:07:51,916 --> 17:07:55,200
limitează-l astfel încât să poți vedea cu ușurință ce este

21935
17:07:53,596 --> 17:07:57,680
continuă pentru că dacă am face toate

21936
17:07:55,200 --> 17:08:00,240
ingrediente, avem, știi, asta e

21937
17:07:57,680 --> 17:08:02,400
ce, um, șapte, opt diferite

21938
17:08:00,240 --> 17:08:04,000
hiperplanuri care ar fi încorporate în el.

21939
17:08:02,400 --> 17:08:06,956
Vrem să ne uităm doar la unul. Deci poți

21940
17:08:04,000 --> 17:08:08,880
vezi ce face SVM-ul.

21941
17:08:06,956 --> 17:08:12,880
Și așa ne luăm rețetele și o vom face

21942
17:08:08,880 --> 17:08:14,400
faceți doar făină și zahăr. Din nou, poți

21943
17:08:12,880 --> 17:08:15,596
înlocuiți-l cu caracteristicile rețetei dvs

21944
17:08:14,400 --> 17:08:17,436
și le facem pe toate, dar o vom face

21945
17:08:15,596 --> 17:08:19,680
faceți doar făină și zahăr. Și mergem

21946
17:08:17,436 --> 17:08:21,116
pentru a converti asta în valori. Nu avem nevoie

21947
17:08:19,680 --> 17:08:23,840
pentru a face o listă din asta pentru că este

21948
17:08:21,116 --> 17:08:26,000
nu valori de șir. Acestea sunt reale

21949
17:08:23,840 --> 17:08:28,480
valorile de acolo. Și putem merge înainte și

21950
17:08:26,000 --> 17:08:30,320
doar tipăriți

21951
17:08:28,480 --> 17:08:32,080
ingrediente. Și poți vedea ce asta

21952
17:08:30,320 --> 17:08:34,000
arata ca.

21953
17:08:32,080 --> 17:08:38,240
Uh, și deci avem doar nanofloarea

21954
17:08:34,000 --> 17:08:40,240
și zahăr, doar cele două seturi de parcele.

21955
17:08:38,240 --> 17:08:43,840
Și doar pentru distracție, hai să mergem înainte și

21956
17:08:40,240 --> 17:08:46,480
luați asta aici și luați rețeta noastră

21957
17:08:43,840 --> 17:08:48,400
caracteristici.

21958
17:08:46,480 --> 17:08:50,880
Și așa că, dacă am decide să folosim toate

21959
17:08:48,400 --> 17:08:52,480
caracteristicile rețetei, veți vedea că ea

21960
17:08:50,880 --> 17:08:54,080
face o coloană frumoasă de date diferite.

21961
17:08:52,480 --> 17:08:55,596
Deci, pur și simplu scoate toate etichetele și

21962
17:08:54,080 --> 17:08:57,840
totul. Avem doar

21963
17:08:55,596 --> 17:09:01,040
valorile. Dar pentru că vrem să putem

21964
17:08:57,840 --> 17:09:02,480
pentru a vedea acest lucru cu ușurință într-un complot mai târziu,

21965
17:09:01,040 --> 17:09:05,840
vom merge înainte și vom lua asta și o vom face

21966
17:09:02,480 --> 17:09:07,116
făină și zahăr.

21967
17:09:05,840 --> 17:09:10,680
Și vom rula asta. Și o să vezi că este

21968
17:09:07,116 --> 17:09:10,680
doar cele două coloane.

21969
17:09:10,720 --> 17:09:14,320
Deci următorul pas este să mergi înainte și să te potrivești

21970
17:09:12,636 --> 17:09:16,636
modelul nostru.

21971
17:09:14,320 --> 17:09:19,596
Vom merge mai departe și o numim doar model.

21972
17:09:16,636 --> 17:09:23,080
Și este un SVM. Folosim un pachet

21973
17:09:19,596 --> 17:09:23,080
numit SVC.

21974
17:09:23,436 --> 17:09:27,360
În acest caz, vom merge înainte

21975
17:09:24,796 --> 17:09:29,596
și setați nucleul egal liniar. Deci,

21976
17:09:27,360 --> 17:09:31,596
folosește o configurație specifică acolo.

21977
17:09:29,596 --> 17:09:34,480
Și dacă mergem la referința de pe lor

21978
17:09:31,596 --> 17:09:36,160
site-ul web pentru SVM,

21979
17:09:34,480 --> 17:09:38,080
vei vedea că există cam acolo

21980
17:09:36,160 --> 17:09:39,916
opt dintre ei aici. Trei dintre ei sunt

21981
17:09:38,080 --> 17:09:43,436
pentru regresie.

21982
17:09:39,916 --> 17:09:45,116
Trei sunt pentru clasificare. SVC,

21983
17:09:43,436 --> 17:09:47,680
clasificarea vectorului suport, este

21984
17:09:45,116 --> 17:09:49,436
probabil una dintre cele mai des folosite.

21985
17:09:47,680 --> 17:09:51,916
Și apoi există și unul pentru detectare

21986
17:09:49,436 --> 17:09:52,720
outliers și încă unul care are de făcut

21987
17:09:51,916 --> 17:09:55,680
cu ceva un pic mai mult

21988
17:09:52,720 --> 17:09:57,596
specifice pe model. Dar SVC și SVR

21989
17:09:55,680 --> 17:10:00,160
sunt cele două cele mai des folosite în picioare

21990
17:09:57,596 --> 17:10:02,160
pentru clasificator de vectori suport și

21991
17:10:00,160 --> 17:10:05,200
regresie vectorială de suport. Ține minte

21992
17:10:02,160 --> 17:10:07,436
regresia este o valoare reală, un float

21993
17:10:05,200 --> 17:10:10,000
valoare sau orice încercați să lucrați

21994
17:10:07,436 --> 17:10:13,116
pe. Și SBC este un clasificator. Deci este o

21995
17:10:10,000 --> 17:10:15,596
da, nu, adevărat, fals.

21996
17:10:13,116 --> 17:10:17,840
Dar pentru asta vrem să știm 01 brioșă

21997
17:10:15,596 --> 17:10:19,840
cupcake. Dacă mergem înainte și ne creăm

21998
17:10:17,840 --> 17:10:22,000
model și odată ce avem modelul nostru

21999
17:10:19,840 --> 17:10:23,436
creat, vom face model.fit.

22000
17:10:22,000 --> 17:10:25,520
Și acest lucru este foarte comun, mai ales în

22001
17:10:23,436 --> 17:10:28,160
sklearnul. Toate modelele lor sunt

22002
17:10:25,520 --> 17:10:30,636
urmat de comanda fit.

22003
17:10:28,160 --> 17:10:32,560
Și ce am pus în potrivire, ce suntem

22004
17:10:30,636 --> 17:10:34,160
antrenament cu ea este punem în

22005
17:10:32,560 --> 17:10:36,720
ingrediente, care în acest caz noi

22006
17:10:34,160 --> 17:10:40,720
limitat la doar făină și zahăr și

22007
17:10:36,720 --> 17:10:43,916
eticheta de tip. Este o brioșă sau o brioșă?

22008
17:10:40,720 --> 17:10:46,480
Acum, în știința datelor mai complicate

22009
17:10:43,916 --> 17:10:47,680
serie, ai vrea să te împarti în noi

22010
17:10:46,480 --> 17:10:50,480
nu voi intra în asta astăzi, unde tu

22011
17:10:47,680 --> 17:10:52,160
împărțiți-l în date de antrenament și testare

22012
17:10:50,480 --> 17:10:54,000
date. Și chiar fac ceva unde

22013
17:10:52,160 --> 17:10:55,840
l-au împărțit în treimi, unde o treime

22014
17:10:54,000 --> 17:10:57,520
este folosit pentru locul unde comutați între ele

22015
17:10:55,840 --> 17:10:59,116
careia se antreneaza si testeaza. Există

22016
17:10:57,520 --> 17:11:00,560
tot felul de lucruri intră în asta. Ea

22017
17:10:59,116 --> 17:11:02,956
devine foarte complicat când ajungi

22018
17:11:00,560 --> 17:11:04,560
capătul superior. Nu prea complicat,

22019
17:11:02,956 --> 17:11:06,000
doar un pas în plus, ceea ce nu suntem

22020
17:11:04,560 --> 17:11:08,080
o să fac astăzi pentru că aceasta este foarte

22021
17:11:06,000 --> 17:11:09,916
set simplu de date.

22022
17:11:08,080 --> 17:11:12,956
Și hai să mergem mai departe și să rulăm asta. Și acum

22023
17:11:09,916 --> 17:11:14,400
avem modelul nostru potrivit. Și am primit un

22024
17:11:12,956 --> 17:11:18,320
eroare aici. Deci, lasă-mă să repar asta real

22025
17:11:14,400 --> 17:11:20,880
repede. Este capitala SBC. Se dovedește

22026
17:11:18,320 --> 17:11:23,276
Am făcut-o cu minuscule.

22027
17:11:20,880 --> 17:11:25,276
Vector suport

22028
17:11:23,276 --> 17:11:27,916
clasificator. Iată-ne. Să mergem înainte

22029
17:11:25,276 --> 17:11:29,680
și rulează asta. Și o să vezi că apare

22030
17:11:27,916 --> 17:11:32,000
cu toate aceste informații pe care le imprimă

22031
17:11:29,680 --> 17:11:34,400
scos automat. Acestea sunt

22032
17:11:32,000 --> 17:11:36,400
valorile implicite ale modelului. Observi asta

22033
17:11:34,400 --> 17:11:37,916
am schimbat nucleul în liniar. Şi

22034
17:11:36,400 --> 17:11:39,596
există nucleul nostru liniar pe

22035
17:11:37,916 --> 17:11:42,480
imprimare. Și mai sunt altele diferite

22036
17:11:39,596 --> 17:11:44,240
setări cu care te poți încurca.

22037
17:11:42,480 --> 17:11:45,596
O să lăsăm asta în pace

22038
17:11:44,240 --> 17:11:49,200
pentru chiar acum. Pentru asta, nu prea facem

22039
17:11:45,596 --> 17:11:51,680
trebuie să te încurci cu oricare dintre ele.

22040
17:11:49,200 --> 17:11:55,116
Deci, în continuare, vom săpă puțin

22041
17:11:51,680 --> 17:11:56,720
în modelul nostru nou pregătit. Și suntem

22042
17:11:55,116 --> 17:11:58,560
o să facem asta ca să vă putem arăta pe a

22043
17:11:56,720 --> 17:12:00,480
grafic.

22044
17:11:58,560 --> 17:12:03,480
Și hai să mergem mai departe și să luăm

22045
17:12:00,480 --> 17:12:03,480
separând.

22046
17:12:04,080 --> 17:12:08,956
și vom spune că o vom face

22047
17:12:05,436 --> 17:12:12,596
folosiți un W pentru variabila noastră aici și

22048
17:12:08,956 --> 17:12:12,596
vom face model.coreeficient_0.

22049
17:12:14,000 --> 17:12:18,400
Deci, ce naiba este asta? Din nou, suntem

22050
17:12:15,916 --> 17:12:21,200
săpat în model. Deci deja am făcut-o

22051
17:12:18,400 --> 17:12:23,276
am primit o predicție și un tren. Acesta este un

22052
17:12:21,200 --> 17:12:27,276
matematica din spatele ei la care ne uităm

22053
17:12:23,276 --> 17:12:30,080
chiar acum. Și așa va face w

22054
17:12:27,276 --> 17:12:33,916
reprezintă doi coeficienți diferiți.

22055
17:12:30,080 --> 17:12:35,756
Și dacă vă amintiți, am avut y = mx c.

22056
17:12:33,916 --> 17:12:38,480
Deci acești coeficienți sunt conectați la

22057
17:12:35,756 --> 17:12:40,160
asta dar în bidimensional este o

22058
17:12:38,480 --> 17:12:42,480
avionul.

22059
17:12:40,160 --> 17:12:44,240
Nu vrem să petrecem prea mult timp

22060
17:12:42,480 --> 17:12:46,400
asta pentru ca te poti pierde in

22061
17:12:44,240 --> 17:12:48,400
confuzie a matematicii. Deci, dacă ești un

22062
17:12:46,400 --> 17:12:50,636
math wiz asta e grozav. Poți merge

22063
17:12:48,400 --> 17:12:54,480
pe aici și vei vedea că avem

22064
17:12:50,636 --> 17:12:56,720
a= minus w de 0 peste w de 1. Amintiți-vă

22065
17:12:54,480 --> 17:12:59,596
sunt două valori diferite acolo. Şi

22066
17:12:56,720 --> 17:13:01,200
asta este practic panta pe care suntem

22067
17:12:59,596 --> 17:13:03,680
generatoare.

22068
17:13:01,200 --> 17:13:06,240
Și apoi vom construi un xx.

22069
17:13:03,680 --> 17:13:09,200
Ce este xx? O să o punem la punct

22070
17:13:06,240 --> 17:13:12,480
o matrice numpy. Aici este linia noastră np

22071
17:13:09,200 --> 17:13:15,756
spatiu. Deci creăm o linie

22072
17:13:12,480 --> 17:13:18,636
de valori între 30 și 60. Deci doar

22073
17:13:15,756 --> 17:13:21,360
creează un set de numere pentru x. Și apoi

22074
17:13:18,636 --> 17:13:26,956
dacă vă amintiți bine, avem noastre

22075
17:13:21,360 --> 17:13:29,360
formula y este egală cu panta * x

22076
17:13:26,956 --> 17:13:32,400
plus interceptarea. Ei bine, pentru a face asta

22077
17:13:29,360 --> 17:13:36,560
lucru, putem face asta ca y

22078
17:13:32,400 --> 17:13:38,400
este egal cu panta cu fiecare valoare în

22079
17:13:36,560 --> 17:13:41,116
acea matrice. Acesta este lucrul frumos

22080
17:13:38,400 --> 17:13:43,116
numpy. Deci, când fac un * xx, care este a

22081
17:13:41,116 --> 17:13:45,840
întreaga matrice numpy de valori, ea

22082
17:13:43,116 --> 17:13:47,520
multiplica a peste toate. Şi

22083
17:13:45,840 --> 17:13:50,160
atunci este nevoie de aceleași valori și noi

22084
17:13:47,520 --> 17:13:53,840
scădeți interceptul modelului. Asta e

22085
17:13:50,160 --> 17:13:57,840
dvs. am avut mx plus c. Deci, asta ar fi

22086
17:13:53,840 --> 17:13:59,276
c din formula y mx plus c.

22087
17:13:57,840 --> 17:14:00,880
Și de aici vin toate aceste cifre

22088
17:13:59,276 --> 17:14:02,320
din. Puțin confuz pentru că

22089
17:14:00,880 --> 17:14:04,636
se scot din acestea diferite

22090
17:14:02,320 --> 17:14:06,000
matrice. Și atunci ceea ce vrem să facem este

22091
17:14:04,636 --> 17:14:09,040
o să luăm asta și o să mergem

22092
17:14:06,000 --> 17:14:11,680
să merg înainte și să-l complotez. Deci complotează

22093
17:14:09,040 --> 17:14:14,160
paralele cu hiperplanul separator care

22094
17:14:11,680 --> 17:14:17,276
trece prin vectorii suport. Și așa

22095
17:14:14,160 --> 17:14:19,436
vom crea B egal cu un model

22096
17:14:17,276 --> 17:14:22,080
vectori suport. Atrăgându-ne sprijinul

22097
17:14:19,436 --> 17:14:24,160
vectori acolo. Iată y-ul nostru, care

22098
17:14:22,080 --> 17:14:27,360
știm acum că este un set de date. Iar noi

22099
17:14:24,160 --> 17:14:33,200
au uh vom crea y jos = a

22100
17:14:27,360 --> 17:14:35,756
* xx b1 - a * b 0. Și apoi modelați

22101
17:14:33,200 --> 17:14:38,956
vectorul suport b va fi setat ca

22102
17:14:35,756 --> 17:14:45,436
la o nouă valoare setarea minus1. Și și y

22103
17:14:38,956 --> 17:14:46,956
sus = a * xx b1 - a * b 0. Și putem

22104
17:14:45,436 --> 17:14:49,116
mergeți mai departe și rulați acest lucru pentru a le încărca

22105
17:14:46,956 --> 17:14:50,480
variabile în sus. Dacă ai vrut să știi

22106
17:14:49,116 --> 17:14:54,916
intelege putin mai mult ce este

22107
17:14:50,480 --> 17:14:54,916
continuă, poți vedea dacă tipărim

22108
17:14:55,680 --> 17:15:00,160
y, lasă-mă să execut asta. Poți vedea

22109
17:14:58,560 --> 17:15:02,560
este o matrice. Aceasta este o linie. Sale

22110
17:15:00,160 --> 17:15:04,000
va avea în acest caz între 30

22111
17:15:02,560 --> 17:15:06,880
și 60. Deci vor fi 30

22112
17:15:04,000 --> 17:15:08,240
variabile aici. Și același lucru

22113
17:15:06,880 --> 17:15:08,320
cu y y sus y y y y y y y y y y y y y y

22114
17:15:08,240 --> 17:15:08,480
y y y y y y y y y y y y y y y y y y y y

22115
17:15:08,320 --> 17:15:08,560
y y y y y y y y y y y y y y y y y y y y

22116
17:15:08,480 --> 17:15:10,720
y y y y y y y y y y y y y y y y y y y y

22117
17:15:08,560 --> 17:15:12,160
y y y y y y jos și vom face un complot

22118
17:15:10,720 --> 17:15:14,636
cele în doar un minut pe un grafic, așa că tu

22119
17:15:12,160 --> 17:15:15,916
pot vedea cum arată acestea.

22120
17:15:14,636 --> 17:15:18,400
Doar mergeți mai departe și ștergeți asta din

22121
17:15:15,916 --> 17:15:21,360
aici și rulează asta. Deci, încarcă

22122
17:15:18,400 --> 17:15:23,436
variabile. Frumos curat. doar sunt

22123
17:15:21,360 --> 17:15:27,200
voi copia asta de înainte. Ține minte

22124
17:15:23,436 --> 17:15:30,160
asta? SNS-ul nostru, plotul nostru Seabor, plotul LM,

22125
17:15:27,200 --> 17:15:31,436
floare, zahăr. Și o să merg și o să fug

22126
17:15:30,160 --> 17:15:32,560
foarte repede ca să vezi ce

22127
17:15:31,436 --> 17:15:35,520
amintiți-vă cum arată. Este doar

22128
17:15:32,560 --> 17:15:37,596
un grafic drept acolo. Și apoi unul

22129
17:15:35,520 --> 17:15:40,240
dintre lucrurile îngrijite este pentru că Seabour

22130
17:15:37,596 --> 17:15:42,400
se așează deasupra pilotului,

22131
17:15:40,240 --> 17:15:47,080
putem face piplotul pentru linia care merge

22132
17:15:42,400 --> 17:15:47,080
prin. Și acesta este pur și simplu plt.plot

22133
17:15:47,596 --> 17:15:53,680
Și acesta este xx și y sunt doi

22134
17:15:51,116 --> 17:15:55,360
valorile corespunzătoare xy. Și apoi

22135
17:15:53,680 --> 17:15:57,756
cineva s-a jucat cu asta ca să-și dea seama

22136
17:15:55,360 --> 17:16:00,240
că lățimea liniei este egală cu 2 și

22137
17:15:57,756 --> 17:16:01,756
culoarea negru ar arata bine. Deci hai să mergem

22138
17:16:00,240 --> 17:16:04,400
înainte și rulați toată chestia asta cu

22139
17:16:01,756 --> 17:16:06,560
pi plot acolo. Și poți vedea când

22140
17:16:04,400 --> 17:16:08,796
facem asta, doar facem făină și

22141
17:16:06,560 --> 17:16:10,796
zahăr aici.

22142
17:16:08,796 --> 17:16:16,000
Linia corespunzătoare dintre zahăr și

22143
17:16:10,796 --> 17:16:18,560
făina și brioșa versus cupcake.

22144
17:16:16,000 --> 17:16:21,756
Hm, și apoi am generat sprijinul

22145
17:16:18,560 --> 17:16:23,200
vectori, y jos și y sus. Deci haideți

22146
17:16:21,756 --> 17:16:24,720
aruncă o privire și vezi cum arată

22147
17:16:23,200 --> 17:16:27,436
ca.

22148
17:16:24,720 --> 17:16:30,480
Deci ne vom face complotul.

22149
17:16:27,436 --> 17:16:34,720
Și din nou, totul este împotriva lui xx,

22150
17:16:30,480 --> 17:16:36,320
valoarea noastră x, dar de data aceasta avem y

22151
17:16:34,720 --> 17:16:37,840
jos.

22152
17:16:36,320 --> 17:16:42,880
Și hai să facem ceva puțin amuzant

22153
17:16:37,840 --> 17:16:46,000
aceasta. Putem pune o liniuță k. Asta

22154
17:16:42,880 --> 17:16:49,200
îi spune doar să facă din el o linie punctată.

22155
17:16:46,000 --> 17:16:52,400
Și dacă o să-l facem pe cel jos,

22156
17:16:49,200 --> 17:16:55,276
vrem să o facem și pe cea de sus. Deci iată

22157
17:16:52,400 --> 17:16:58,720
yul nostru

22158
17:16:55,276 --> 17:17:01,756
sus. Și când rulăm asta, le adaugă pe ambele

22159
17:16:58,720 --> 17:17:03,520
seturi de linii. Și iată sprijinul nostru.

22160
17:17:01,756 --> 17:17:04,956
Și la asta te aștepți. te astepti

22161
17:17:03,520 --> 17:17:07,360
aceste două linii pentru a trece prin

22162
17:17:04,956 --> 17:17:08,880
cel mai apropiat punct de date. Deci liniile liniuțe merg

22163
17:17:07,360 --> 17:17:11,276
prin cea mai apropiată brioșă și

22164
17:17:08,880 --> 17:17:13,276
cea mai apropiată cupcake atunci când îl complotează.

22165
17:17:11,276 --> 17:17:14,880
Și apoi SVM-ul tău merge direct în jos

22166
17:17:13,276 --> 17:17:16,880
mijloc. Așa că îi oferă o divizare plăcută

22167
17:17:14,880 --> 17:17:19,916
datele noastre. Și puteți vedea cât de ușor este

22168
17:17:16,880 --> 17:17:23,596
pentru a vedea pe baza doar de zahar si faina

22169
17:17:19,916 --> 17:17:28,320
care este o brioșă sau o brioșă.

22170
17:17:23,596 --> 17:17:31,360
Să mergem mai departe și să creăm o funcție

22171
17:17:28,320 --> 17:17:34,480
a prezice

22172
17:17:31,360 --> 17:17:37,840
brioșă sau cupcake.

22173
17:17:34,480 --> 17:17:40,400
Am rețetele mele. Am scos

22174
17:17:37,840 --> 17:17:42,400
um internet și vreau să văd

22175
17:17:40,400 --> 17:17:44,636
diferența dintre a

22176
17:17:42,400 --> 17:17:46,880
brioșă sau o brioșă. Și așa avem nevoie de o

22177
17:17:44,636 --> 17:17:49,680
funcția de a împinge asta. Și noi

22178
17:17:46,880 --> 17:17:51,680
creați o funcție cu surd. Și haideți

22179
17:17:49,680 --> 17:17:53,436
numiți-o brioșă sau cupcake. Și amintește-ți,

22180
17:17:51,680 --> 17:17:55,596
azi facem doar făină și zahăr.

22181
17:17:53,436 --> 17:17:56,796
Nu facem toate ingredientele. Şi

22182
17:17:55,596 --> 17:17:57,596
de fapt, este o împărțire destul de bună.

22183
17:17:56,796 --> 17:17:59,116
Chiar nu ai nevoie de toate

22184
17:17:57,596 --> 17:18:02,000
ingrediente pentru a ști că este făină și

22185
17:17:59,116 --> 17:18:07,560
zahăr. Și hai să mergem înainte și să facem un dacă

22186
17:18:02,000 --> 17:18:07,560
declarație else. Deci, dacă modelul prezice

22187
17:18:07,756 --> 17:18:13,116
este de floare iar zahărul este egal cu zero. Deci

22188
17:18:11,040 --> 17:18:14,956
ne luăm modelul și rulăm a

22189
17:18:13,116 --> 17:18:17,040
prezice. Este foarte comun în sklearn

22190
17:18:14,956 --> 17:18:19,200
unde ai o previziune. Tu ai pus

22191
17:18:17,040 --> 17:18:21,840
date în și va reveni a

22192
17:18:19,200 --> 17:18:23,520
valoare. În acest caz, dacă este egal cu zero

22193
17:18:21,840 --> 17:18:26,880
apoi imprimă că te uiți la o brioșă

22194
17:18:23,520 --> 17:18:29,040
reteta. Altfel, dacă nu este zero, înseamnă

22195
17:18:26,880 --> 17:18:31,200
este unul și te uiți la o prăjitură

22196
17:18:29,040 --> 17:18:32,956
reteta. Este destul de simplu

22197
17:18:31,200 --> 17:18:35,680
pentru

22198
17:18:32,956 --> 17:18:38,000
funcția sau def pentru definiție. surd este

22199
17:18:35,680 --> 17:18:38,880
cum faci asta în Python. Și de

22200
17:18:38,000 --> 17:18:40,240
desigur, dacă intenționați să creați un

22201
17:18:38,880 --> 17:18:42,240
funcție, ar trebui să rulați ceva

22202
17:18:40,240 --> 17:18:44,240
ea. Și așa, hai să facem un cupcake. Şi

22203
17:18:42,240 --> 17:18:45,680
îi vom trimite valorile 50 și 20.

22204
17:18:44,240 --> 17:18:48,080
O brioșă sau o brioșă. nu stiu ce

22205
17:18:45,680 --> 17:18:50,400
este. Și hai să rulăm asta și să vedem

22206
17:18:48,080 --> 17:18:52,000
ce ne oferă. Se spune: „Oh, este o

22207
17:18:50,400 --> 17:18:54,240
brioșă. Te uiți la o brioșă

22208
17:18:52,000 --> 17:18:55,840
reteta." Deci, prezice foarte ușor

22209
17:18:54,240 --> 17:19:00,240
fie că ne uităm la o brioșă sau la o

22210
17:18:55,840 --> 17:19:02,160
reteta de cupcake. Să complotăm asta. Acolo

22211
17:19:00,240 --> 17:19:04,400
mergem. Trasează asta pe grafic ca să putem

22212
17:19:02,160 --> 17:19:06,480
vezi cum arata de fapt. Şi

22213
17:19:04,400 --> 17:19:08,000
Voi doar să-l copiez și să-l lipesc de pe

22214
17:19:06,480 --> 17:19:09,756
mai jos unde trasăm toate punctele

22215
17:19:08,000 --> 17:19:11,436
acolo.

22216
17:19:09,756 --> 17:19:13,756
Deci, acest lucru nu este nimic diferit de noi

22217
17:19:11,436 --> 17:19:15,436
făcut înainte. Dacă îl rulez, îl vei vedea

22218
17:19:13,756 --> 17:19:17,276
are toate punctele și liniile pe

22219
17:19:15,436 --> 17:19:20,000
acolo. Și ceea ce vrem să facem este să vrem

22220
17:19:17,276 --> 17:19:23,000
pentru a adăuga un alt punct. Și vom face

22221
17:19:20,000 --> 17:19:23,000
pltot.

22222
17:19:23,200 --> 17:19:27,200
Și dacă vă amintiți bine, am făcut-o

22223
17:19:24,880 --> 17:19:30,320
pentru testul nostru am făcut 50

22224
17:19:27,200 --> 17:19:33,200
și 20. Și apoi cineva a intrat aici

22225
17:19:30,320 --> 17:19:34,720
și am decis că vom face yo pentru galben sau

22226
17:19:33,200 --> 17:19:36,880
este un fel de culoare galben portocaliu

22227
17:19:34,720 --> 17:19:38,400
urmeaza sa iasa. Marker dimensiune nouă.

22228
17:19:36,880 --> 17:19:40,080
Acestea sunt setări cu care te poți juca.

22229
17:19:38,400 --> 17:19:41,680
Altcineva s-a jucat cu ei să vină

22230
17:19:40,080 --> 17:19:43,520
cu configurația potrivită, astfel încât să arate

22231
17:19:41,680 --> 17:19:46,956
bun. Și puteți vedea că acolo este

22232
17:19:43,520 --> 17:19:50,720
a reprezentat clar o brioșă.

22233
17:19:46,956 --> 17:19:53,756
În acest caz, în cupcakes versus brioșe,

22234
17:19:50,720 --> 17:19:56,720
brioșa a câștigat. Și dacă vrei

22235
17:19:53,756 --> 17:19:59,200
fă-ți propriul concurent pentru brioșe

22236
17:19:56,720 --> 17:20:01,596
serie, cu siguranță puteți trimite o notă

22237
17:19:59,200 --> 17:20:04,000
jos și echipa SimplyLearn

22238
17:20:01,596 --> 17:20:05,916
vă va trimite datele pentru care le folosesc

22239
17:20:04,000 --> 17:20:07,916
brioșa și cupcake-ul. Și asta este adevărat

22240
17:20:05,916 --> 17:20:09,916
a oricăreia dintre date. De fapt, nu am făcut-o

22241
17:20:07,916 --> 17:20:12,636
rulați un complot pe el mai devreme. Aveam bărbați

22242
17:20:09,916 --> 17:20:14,480
față de femei. Puteți solicita și asta

22243
17:20:12,636 --> 17:20:17,200
informații pentru a le rula pe datele dvs

22244
17:20:14,480 --> 17:20:19,916
înființat. Deci poți testa asta.

22245
17:20:17,200 --> 17:20:21,840
Așa că, pentru a reveni la configurația noastră, am mers

22246
17:20:19,916 --> 17:20:24,796
înainte pentru mașina noastră vectorială de suport

22247
17:20:21,840 --> 17:20:26,796
cod. Am făcut o prognoză de 40 de părți făină,

22248
17:20:24,796 --> 17:20:28,480
20 de părți zahăr. Cred că a fost diferit

22249
17:20:26,796 --> 17:20:30,560
decât cel pe care l-am făcut noi fie că este o

22250
17:20:28,480 --> 17:20:33,276
brioșă sau o brioșă. Prin urmare, avem

22251
17:20:30,560 --> 17:20:36,000
a construit un clasificator folosind SVM care este

22252
17:20:33,276 --> 17:20:39,200
capabil să clasifice dacă o rețetă este de a

22253
17:20:36,000 --> 17:20:41,916
cupcake sau o brioșă. Ceea ce ne încheie

22254
17:20:39,200 --> 17:20:44,636
cupcake versus brioșă. Deci cheia

22255
17:20:41,916 --> 17:20:46,080
concluzii, ce este învățarea automată? Noi

22256
17:20:44,636 --> 17:20:48,000
a discutat despre asta cu unii dintre

22257
17:20:46,080 --> 17:20:50,560
diferite aspecte ale învățării automate pe

22258
17:20:48,000 --> 17:20:52,480
acolo. Am intrat în tipuri de mașini

22259
17:20:50,560 --> 17:20:54,880
învăţarea. Dacă memorezi avem

22260
17:20:52,480 --> 17:20:56,956
supravegheat, nesupravegheat și

22261
17:20:54,880 --> 17:20:59,916
învăţarea prin întărire. Am discutat

22262
17:20:56,956 --> 17:21:02,000
linie de regresie sau cea mai bună potrivire și am făcut-o

22263
17:20:59,916 --> 17:21:04,956
construirea unui arbore de decizie și ce

22264
17:21:02,000 --> 17:21:07,840
logica stă în spatele asta. Și în sfârșit noi

22265
17:21:04,956 --> 17:21:10,000
a făcut clasificarea folosind suportul SVM

22266
17:21:07,840 --> 17:21:12,560
mașină vectorială și am făcut codul în

22267
17:21:10,000 --> 17:21:14,796
acolo. Astăzi ne scufundăm în mașină

22268
17:21:12,560 --> 17:21:17,200
învăţare, tehnologia din spatele lucrurilor

22269
17:21:14,796 --> 17:21:19,436
precum recomandări Netflix, CD și

22270
17:21:17,200 --> 17:21:21,276
chiar și deblocarea facială a telefonului dvs.

22271
17:21:19,436 --> 17:21:23,596
Învățarea automată ajută dispozitivele să obțină

22272
17:21:21,276 --> 17:21:25,680
mai inteligent învățând din date și

22273
17:21:23,596 --> 17:21:27,360
prezicerea a ceea ce ne-ar putea dori sau ne-ar trebui.

22274
17:21:25,680 --> 17:21:29,596
Și iată de ce învățarea automată este uriașă

22275
17:21:27,360 --> 17:21:31,276
pentru cariera ta. Chiar acum, mașină

22276
17:21:29,596 --> 17:21:33,520
locurile de muncă de învățare sunt printre cele mai rapide

22277
17:21:31,276 --> 17:21:36,160
roluri în creștere la nivel mondial. Companiile din

22278
17:21:33,520 --> 17:21:38,320
fiecare industrie, tehnologie, asistență medicală,

22279
17:21:36,160 --> 17:21:40,320
finanțe și altele, pe care le caută

22280
17:21:38,320 --> 17:21:42,796
oameni cu abilități de învățare automată să

22281
17:21:40,320 --> 17:21:45,040
să-și îmbunătățească produsele, să automatizeze sarcinile,

22282
17:21:42,796 --> 17:21:47,116
și luați decizii mai inteligente. Maşină

22283
17:21:45,040 --> 17:21:50,720
inginerii de învățare din SUA câștigă în jur

22284
17:21:47,116 --> 17:21:52,796
112.000 USD în medie, cu mult spațiu

22285
17:21:50,720 --> 17:21:54,636
pentru creștere pe măsură ce câștigați experiență. Deci,

22286
17:21:52,796 --> 17:21:56,400
dacă vrei să sari în acest captivant

22287
17:21:54,636 --> 17:21:58,480
domeniu, învățarea învățării automate poate

22288
17:21:56,400 --> 17:22:00,956
deschide porțile pentru cei care plătesc foarte mult în cerere

22289
17:21:58,480 --> 17:22:02,796
locuri de muncă. Așa că în acest videoclip vă voi ghida

22290
17:22:00,956 --> 17:22:05,840
prin harta rutieră supremă pentru a stăpâni

22291
17:22:02,796 --> 17:22:08,160
învățarea automată în 2025, un pas la un

22292
17:22:05,840 --> 17:22:10,240
timp. Deci, să începem. Deci, în

22293
17:22:08,160 --> 17:22:12,480
prima lună începe cu bazele de ten

22294
17:22:10,240 --> 17:22:14,480
de programare. Deci programarea este a

22295
17:22:12,480 --> 17:22:16,400
limba cu care veți folosi pentru a comunica

22296
17:22:14,480 --> 17:22:19,040
computerul dvs. și aduceți învățarea automată

22297
17:22:16,400 --> 17:22:21,200
algoritmi la viață. Deci luna aceasta este totul

22298
17:22:19,040 --> 17:22:23,360
despre Python, limbajul ales pentru

22299
17:22:21,200 --> 17:22:26,000
majoritatea practicienilor de învățare automată. Deci

22300
17:22:23,360 --> 17:22:28,320
iată pe ce să te concentrezi. În primul rând, învață

22301
17:22:26,000 --> 17:22:31,520
Bazele Python. Începeți cu Python

22302
17:22:28,320 --> 17:22:34,320
elemente fundamentale precum variabile, tipuri de date,

22303
17:22:31,520 --> 17:22:36,400
bucle și funcții. Așa că petreceți timp

22304
17:22:34,320 --> 17:22:38,796
scriind programe mici zilnic pentru a obține

22305
17:22:36,400 --> 17:22:41,360
confortabil. După aceea, explorați cheia

22306
17:22:38,796 --> 17:22:43,916
biblioteci precum numpy, panda și

22307
17:22:41,360 --> 17:22:46,636
scikitlearn. Deci numpy este pentru numeric

22308
17:22:43,916 --> 17:22:49,520
operațiuni. Face manipularea datelor mari

22309
17:22:46,636 --> 17:22:52,000
se instalează mai repede și mai ușor. Și panda este să

22310
17:22:49,520 --> 17:22:54,400
manipulează și analizează datele. Deci panda

22311
17:22:52,000 --> 17:22:56,636
vă permit să filtrați, să sortați și să remodelați

22312
17:22:54,400 --> 17:22:58,796
date într-o briză. Și apoi scikitlearn

22313
17:22:56,636 --> 17:23:00,956
este pentru implementarea algoritmilor doar în a

22314
17:22:58,796 --> 17:23:02,956
câteva linii de cod. Deci acum s-ar putea să ai

22315
17:23:00,956 --> 17:23:04,796
am auzit despre R, un alt limbaj folosit în

22316
17:23:02,956 --> 17:23:06,796
învățarea automată. Dar nu te stresa

22317
17:23:04,796 --> 17:23:08,400
ea acum. Python vă va servi bine,

22318
17:23:06,796 --> 17:23:10,636
mai ales ca începător, pentru că este

22319
17:23:08,400 --> 17:23:12,796
mai simplu și mai flexibil. Deci țintește să

22320
17:23:10,636 --> 17:23:14,560
petrece o oră sau două în fiecare zi codând. De către

22321
17:23:12,796 --> 17:23:16,480
la sfârșitul acestei luni, veți avea un

22322
17:23:14,560 --> 17:23:18,480
bază solidă pentru a construi. Acum, în

22323
17:23:16,480 --> 17:23:20,796
a doua lună, organizează-te cu versiunea

22324
17:23:18,480 --> 17:23:22,560
structuri de control și date. Deci asta

22325
17:23:20,796 --> 17:23:24,720
luna este despre a învăța cum să te organizezi

22326
17:23:22,560 --> 17:23:26,320
și gestionați-vă codul în mod eficient și

22327
17:23:24,720 --> 17:23:28,636
ascuțindu-vă abilitățile de rezolvare a problemelor

22328
17:23:26,320 --> 17:23:31,040
cu structuri de date și algoritmi. Deci

22329
17:23:28,636 --> 17:23:32,956
primul este controlul versiunilor cu git. Deci

22330
17:23:31,040 --> 17:23:35,360
Gândește-te la git ca la istoria proiectului tău

22331
17:23:32,956 --> 17:23:37,756
tracker. Așa că imaginați-vă că lucrați la un mare

22332
17:23:35,360 --> 17:23:39,840
proiect și a face modificări atunci

22333
17:23:37,756 --> 17:23:41,916
realizând că ceva nu a mers prost. Tu vrei

22334
17:23:39,840 --> 17:23:44,240
pentru a reveni la o versiune anterioară, nu?

22335
17:23:41,916 --> 17:23:46,720
Deci aici intervine git. Și iată

22336
17:23:44,240 --> 17:23:49,200
ce ar trebui să exersezi. Numărul unu este

22337
17:23:46,720 --> 17:23:51,436
comiterea de schimbări. Așa că salvează diferit

22338
17:23:49,200 --> 17:23:53,680
versiuni ale lucrării dvs. pe măsură ce progresați.

22339
17:23:51,436 --> 17:23:55,596
Și apoi ramificare, ceea ce înseamnă să lucrezi

22340
17:23:53,680 --> 17:23:58,636
caracteristici separate fără a vă afecta

22341
17:23:55,596 --> 17:24:00,480
codul principal. Și apoi vine fuzionarea care

22342
17:23:58,636 --> 17:24:02,240
înseamnă combinarea schimbărilor din diferite

22343
17:24:00,480 --> 17:24:04,000
versiuni odată ce sunt gata. Deci tu

22344
17:24:02,240 --> 17:24:06,956
trebuie să vă configurați un cont pe GitHub sau

22345
17:24:04,000 --> 17:24:09,276
GitLab pentru a vă stoca proiectele online. Deci

22346
17:24:06,956 --> 17:24:10,880
nu numai că acest lucru va fi super util, dar

22347
17:24:09,276 --> 17:24:13,360
va începe, de asemenea, să vă construiască

22348
17:24:10,880 --> 17:24:15,276
portofoliu. Acum urmează structurile de date

22349
17:24:13,360 --> 17:24:17,520
și algoritm. Așa că gândiți-vă la date

22350
17:24:15,276 --> 17:24:20,000
structuri precum instrumentele dintr-o trusă de instrumente. Deci

22351
17:24:17,520 --> 17:24:22,400
fiecare ca matrice, stive, indicii etc.

22352
17:24:20,000 --> 17:24:24,636
serveste unui scop anume. Deci, iată cum

22353
17:24:22,400 --> 17:24:26,720
să se apropie de ei. Numărul unu, matrice și

22354
17:24:24,636 --> 17:24:29,116
liste. Acum matricele și listele sunt pentru

22355
17:24:26,720 --> 17:24:30,636
stocarea datelor în succesiune. După aceea,

22356
17:24:29,116 --> 17:24:33,116
vă puteţi familiariza cu stivele şi

22357
17:24:30,636 --> 17:24:35,436
indicii. Deci stivele și indicațiile sunt pentru sarcini

22358
17:24:33,116 --> 17:24:36,796
care au nevoie de acces ordonat la date. Și apoi

22359
17:24:35,436 --> 17:24:39,200
ai sortare si cautare

22360
17:24:36,796 --> 17:24:41,116
algoritmi. Deci acestea fac programele tale

22361
17:24:39,200 --> 17:24:42,796
mai eficient. Și asta e super

22362
17:24:41,116 --> 17:24:44,956
important în învățarea automată unde date

22363
17:24:42,796 --> 17:24:46,796
poate deveni masiv. Deci, scopul aici este să

22364
17:24:44,956 --> 17:24:48,240
dezvoltă-ți abilitățile de rezolvare a problemelor

22365
17:24:46,796 --> 17:24:50,956
care sunt cheia învățării automate

22366
17:24:48,240 --> 17:24:53,116
succes. Așa că ia-o încet, exersează zilnic

22367
17:24:50,956 --> 17:24:55,276
si vei vedea progrese. Acum în

22368
17:24:53,116 --> 17:24:57,360
a treia lună, învață să accesezi datele cu

22369
17:24:55,276 --> 17:24:59,436
SQL. Deci, în învățarea automată, multe

22370
17:24:57,360 --> 17:25:02,400
munca presupune accesarea si organizarea

22371
17:24:59,436 --> 17:25:04,000
date din baze de date. Deci SQL, a

22372
17:25:02,400 --> 17:25:05,916
limbajul de interogare structurat, este dvs

22373
17:25:04,000 --> 17:25:08,160
bilet pentru a obține datele de care aveți nevoie

22374
17:25:05,916 --> 17:25:10,720
antrenarea modelelor ML. Deci iată ce tu

22375
17:25:08,160 --> 17:25:12,560
ar trebui să se concentreze asupra. Selectați și unde. Deci

22376
17:25:10,720 --> 17:25:14,880
aceste comenzi vă ajută să trageți specifice

22377
17:25:12,560 --> 17:25:17,520
date și apoi poți continua

22378
17:25:14,880 --> 17:25:19,360
a se alătura. Unirile combină de obicei date

22379
17:25:17,520 --> 17:25:20,880
de la diferite mese. Așa e așa

22380
17:25:19,360 --> 17:25:22,880
puternic pe care îl vei folosi pe tot

22381
17:25:20,880 --> 17:25:24,796
timp. Și apoi vine grupul de și

22382
17:25:22,880 --> 17:25:27,436
funcții agregate. Sunt grozavi pentru

22383
17:25:24,796 --> 17:25:29,680
rezumarea datelor pentru a găsi modele. Deci

22384
17:25:27,436 --> 17:25:32,160
petreceți timp lucrând cu exemple de baze de date

22385
17:25:29,680 --> 17:25:34,480
poți găsi online și exersa scrisul

22386
17:25:32,160 --> 17:25:36,240
interogări. A fi confortabil cu SQL va

22387
17:25:34,480 --> 17:25:38,636
economisiți timp la pregătirea datelor pentru

22388
17:25:36,240 --> 17:25:40,000
modelele tale. Acum, după finalizarea

22389
17:25:38,636 --> 17:25:42,080
a treia lună la care poți trece

22390
17:25:40,000 --> 17:25:44,320
matematica care iti construieste

22391
17:25:42,080 --> 17:25:45,680
minte analitică. Deci luna aceasta suntem

22392
17:25:44,320 --> 17:25:47,520
abordând matematica din spatele mașinii

22393
17:25:45,680 --> 17:25:49,756
învăţarea. Deci, nu vă faceți griji că nu aveți nevoie

22394
17:25:47,520 --> 17:25:51,596
a fi un geniu matematic dar înțelegător

22395
17:25:49,756 --> 17:25:53,840
anumite concepte vor face totul

22396
17:25:51,596 --> 17:25:56,240
te simti mai putin misterios. Deci in aceasta luna

22397
17:25:53,840 --> 17:25:58,240
trebuie să te concentrezi pe algebra liniară. Deci

22398
17:25:56,240 --> 17:26:00,880
aceasta este matematica din spatele modului în care văd modelele

22399
17:25:58,240 --> 17:26:03,200
date. Deci poți studia vectorii, matricele

22400
17:26:00,880 --> 17:26:05,520
și operații precum înmulțirea. În continuare

22401
17:26:03,200 --> 17:26:07,520
vine calculul. Deci vei folosi calculul

22402
17:26:05,520 --> 17:26:09,680
pentru a vă ajuta modelele să învețe. Deci ai

22403
17:26:07,520 --> 17:26:11,436
să se concentreze pe derivate și gradienți

22404
17:26:09,680 --> 17:26:13,200
care ajută la minimizarea erorilor din dvs

22405
17:26:11,436 --> 17:26:15,116
model. Și apoi poți trece la

22406
17:26:13,200 --> 17:26:17,200
probabilitate și statistică. Deci

22407
17:26:15,116 --> 17:26:19,116
înțelegerea probabilității te ajută să faci

22408
17:26:17,200 --> 17:26:20,880
simțul datelor. Așa că învață despre

22409
17:26:19,116 --> 17:26:23,276
distribuții ca distribuția normală,

22410
17:26:20,880 --> 17:26:25,680
distribuția borală și apoi varianța

22411
17:26:23,276 --> 17:26:27,916
și abaterea standard. Deci, odată ce ai

22412
17:26:25,680 --> 17:26:30,240
a învățat matematica, apoi vei trece mai departe

22413
17:26:27,916 --> 17:26:31,916
la manipularea şi vizualizarea datelor care

22414
17:26:30,240 --> 17:26:34,400
este inima învățării automate ca tine

22415
17:26:31,916 --> 17:26:36,240
toti stiu. Deci, cu Matt sub centura ta,

22416
17:26:34,400 --> 17:26:38,560
este timpul să pătrundem în manipularea datelor și

22417
17:26:36,240 --> 17:26:40,796
vizualizare. Deci pregătirea datelor este

22418
17:26:38,560 --> 17:26:43,040
vital pentru că modelul tău este la fel de bun

22419
17:26:40,796 --> 17:26:45,680
ca datele pe care le alimentezi. Deci numărul unu

22420
17:26:43,040 --> 17:26:47,596
vine manipularea datelor. Deci folosind panda

22421
17:26:45,680 --> 17:26:49,916
și numpy, vei face curat și ai organiza

22422
17:26:47,596 --> 17:26:51,916
datele dvs. S-ar putea să eliminați lipsa

22423
17:26:49,916 --> 17:26:53,680
valori precum curățarea datelor dezordonate, așa că

22424
17:26:51,916 --> 17:26:55,680
nu vă încurcă modelul. Și apoi

22425
17:26:53,680 --> 17:26:57,680
veți învăța să transformați variabile precum

22426
17:26:55,680 --> 17:26:59,916
conversia datelor în formate care funcționează

22427
17:26:57,680 --> 17:27:02,000
pentru modele. Și apoi vei trece la

22428
17:26:59,916 --> 17:27:04,320
codificarea datelor categorice, cum ar fi schimbarea

22429
17:27:02,000 --> 17:27:06,240
date text, cum ar fi femei sau bărbat în

22430
17:27:04,320 --> 17:27:07,916
numere. Acum, odată ce ai terminat cu datele

22431
17:27:06,240 --> 17:27:10,240
manipulare, urmează datele

22432
17:27:07,916 --> 17:27:12,160
vizualizare. Deci vizualizarea este cum

22433
17:27:10,240 --> 17:27:13,916
poți să-ți vezi datele înainte de antrenament

22434
17:27:12,160 --> 17:27:16,080
un model. Deci aici trebuie să înveți

22435
17:27:13,916 --> 17:27:18,636
buză mattplot și bord. Deci poți

22436
17:27:16,080 --> 17:27:21,116
creați diagrame cu linii, histograme, scatter

22437
17:27:18,636 --> 17:27:23,756
parcele și hărți termice. Deci asta vă permite

22438
17:27:21,116 --> 17:27:25,360
explorați tipare și identificați valorile aberante. Deci

22439
17:27:23,756 --> 17:27:27,276
înțelegerea acestor tipare în dvs

22440
17:27:25,360 --> 17:27:29,840
datele sunt esențiale pentru construirea eficientă

22441
17:27:27,276 --> 17:27:31,276
modele. Acum, în luna a șasea vei fi

22442
17:27:29,840 --> 17:27:33,436
trecerea la învățarea automată

22443
17:27:31,276 --> 17:27:35,360
fundamentale. Așa că acum este timpul să începem

22444
17:27:33,436 --> 17:27:37,116
construirea propriilor modele. Deci vei face

22445
17:27:35,360 --> 17:27:39,040
concentrați-vă pe două tipuri principale de mașini

22446
17:27:37,116 --> 17:27:41,436
invata luna aceasta. Vine numărul unu

22447
17:27:39,040 --> 17:27:43,916
învăţarea supravegheată. Deci, acesta este momentul

22448
17:27:41,436 --> 17:27:46,000
antrenezi un model pe datele etichetei unde

22449
17:27:43,916 --> 17:27:47,596
rezultatul este deja cunoscut. Deci vei face

22450
17:27:46,000 --> 17:27:49,680
lucrați cu algoritmi precum liniar

22451
17:27:47,596 --> 17:27:51,520
regresie care prezice o continuă

22452
17:27:49,680 --> 17:27:53,360
rezultatul. Atunci vei lucra cu decizie

22453
17:27:51,520 --> 17:27:55,276
copaci care descompune deciziile în a

22454
17:27:53,360 --> 17:27:56,956
structura arborelui. Și apoi ai

22455
17:27:55,276 --> 17:27:58,880
suport mașini vector sub supraveghere

22456
17:27:56,956 --> 17:28:00,796
învăţare care actualizează datele în

22457
17:27:58,880 --> 17:28:03,040
clasele. Acum, după învățare supravegheată

22458
17:28:00,796 --> 17:28:05,520
vine învățarea nesupravegheată. Deci aici

22459
17:28:03,040 --> 17:28:08,080
modelul dvs. identifică modele în date

22460
17:28:05,520 --> 17:28:09,840
fără rezultate etichetate. Deci două populare

22461
17:28:08,080 --> 17:28:11,840
tehnici în învăţarea nesupravegheată este

22462
17:28:09,840 --> 17:28:13,756
gruparea numărul unu ca înseamnă K

22463
17:28:11,840 --> 17:28:15,436
grupare care înseamnă grup similar

22464
17:28:13,756 --> 17:28:17,840
puncte de date și apoi aveți

22465
17:28:15,436 --> 17:28:19,916
reducerea dimensionalității. Aceasta reduce

22466
17:28:17,840 --> 17:28:21,916
complexitatea datelor prin concentrarea pe cheie

22467
17:28:19,916 --> 17:28:23,756
caracteristici. Deci poți folosi scikitle learning

22468
17:28:21,916 --> 17:28:25,520
pentru a încerca acești algoritmi pe eșantion

22469
17:28:23,756 --> 17:28:27,596
seturi de date. Deci asta vă va oferi

22470
17:28:25,520 --> 17:28:29,276
experiență practică cu formarea modelelor

22471
17:28:27,596 --> 17:28:31,276
și veți învăța să le reglați fin

22472
17:28:29,276 --> 17:28:33,276
obține rezultate mai bune. Acum înainte de a te muta

22473
17:28:31,276 --> 17:28:35,360
pe, dacă sunteți interesat să avansați

22474
17:28:33,276 --> 17:28:36,956
cariera ta în domeniul AI și

22475
17:28:35,360 --> 17:28:38,796
învățare automată, învățare simplă

22476
17:28:36,956 --> 17:28:40,956
program postuniversitar susținut în

22477
17:28:38,796 --> 17:28:43,520
colaborare cu Universitatea Purdue și

22478
17:28:40,956 --> 17:28:45,276
IBM este o oportunitate perfectă. Aceasta

22479
17:28:43,520 --> 17:28:47,200
programul foarte bine cotat oferă a

22480
17:28:45,276 --> 17:28:49,360
acoperire cuprinzătoare a curriculumului

22481
17:28:47,200 --> 17:28:52,080
subiecte esențiale precum învățarea automată,

22482
17:28:49,360 --> 17:28:54,240
învăţare profundă, NLP, viziune computerizată,

22483
17:28:52,080 --> 17:28:56,320
învățare prin consolidare, inteligență artificială generativă,

22484
17:28:54,240 --> 17:28:58,956
inginerie promptă și multe altele. Cu

22485
17:28:56,320 --> 17:29:00,796
experiență practică în peste 25 de proiecte

22486
17:28:58,956 --> 17:29:02,636
și acces la 20 plus de vârf

22487
17:29:00,796 --> 17:29:04,636
instrumente, veți dobândi abilitățile necesare

22488
17:29:02,636 --> 17:29:07,040
pentru a excela în slujba competitivă de astăzi

22489
17:29:04,636 --> 17:29:08,796
piata. Așa că alăturați-vă acum și ridicați-vă

22490
17:29:07,040 --> 17:29:10,480
expertiză cu sprijinul Produce

22491
17:29:08,796 --> 17:29:12,560
excelență academică și IBM

22492
17:29:10,480 --> 17:29:14,320
perspectivă de vârf în industrie. Poți găsi

22493
17:29:12,560 --> 17:29:16,636
linkul cursului din caseta de descriere

22494
17:29:14,320 --> 17:29:18,240
și fixați comentariile. Acum trecem la

22495
17:29:16,636 --> 17:29:20,560
luna a șaptea, vei construi și

22496
17:29:18,240 --> 17:29:22,160
modele de instruire cu biblioteci avansate.

22497
17:29:20,560 --> 17:29:24,480
Deci până acum ați experimentat

22498
17:29:22,160 --> 17:29:26,636
câteva modele de bază. Așa că hai să o intensificăm

22499
17:29:24,480 --> 17:29:29,360
cu instrumente avansate precum TensorFlow și

22500
17:29:26,636 --> 17:29:31,520
PyTorch. Deci aceste biblioteci oferă mai mult

22501
17:29:29,360 --> 17:29:33,360
flexibilitate si putere. Deci TensorFlow și

22502
17:29:31,520 --> 17:29:35,520
PyTorch. Deci aici puteți începe cu

22503
17:29:33,360 --> 17:29:37,360
modele simple și creșteți-vă. Deci

22504
17:29:35,520 --> 17:29:39,596
aceste biblioteci permit construirea

22505
17:29:37,360 --> 17:29:41,520
rețelele neuronale pe care le vei studia

22506
17:29:39,596 --> 17:29:43,116
mai multe în luna următoare. Acum o dată tu

22507
17:29:41,520 --> 17:29:44,956
s-au familiarizat cu TensorFlow și

22508
17:29:43,116 --> 17:29:46,880
PyTorch, puteți trece la model

22509
17:29:44,956 --> 17:29:48,796
instruire si evaluare. Deci trebuie

22510
17:29:46,880 --> 17:29:51,116
învățați să împărțiți datele în formare și

22511
17:29:48,796 --> 17:29:53,840
seturi de testare și evaluarea modelelor folosind

22512
17:29:51,116 --> 17:29:55,520
parametri precum acuratețea și precizia. Deci

22513
17:29:53,840 --> 17:29:57,436
scopul tău luna aceasta ar trebui să fie să obții

22514
17:29:55,520 --> 17:29:59,436
confortabil cu aceste biblioteci și

22515
17:29:57,436 --> 17:30:01,276
să înțeleagă cum manipulează datele și

22516
17:29:59,436 --> 17:30:02,636
antrenament de model în culise. Deci

22517
17:30:01,276 --> 17:30:04,560
odată ce ai terminat cu asta, vei fi

22518
17:30:02,636 --> 17:30:06,240
trecând la luna a opta unde

22519
17:30:04,560 --> 17:30:08,400
vei avea de-a face cu o mașină avansată

22520
17:30:06,240 --> 17:30:10,720
învăţarea. Deci conceptul din această lună va

22521
17:30:08,400 --> 17:30:12,560
fi numărul unu pe n simbol de învăţare care

22522
17:30:10,720 --> 17:30:14,560
înseamnă combinarea mai multor modele pentru a obține

22523
17:30:12,560 --> 17:30:17,200
previziuni mai bune. Deci aici vei fi

22524
17:30:14,560 --> 17:30:19,520
învăţând despre ambalare, de exemplu

22525
17:30:17,200 --> 17:30:21,840
păduri aleatorii aici decizie multiplă

22526
17:30:19,520 --> 17:30:24,880
copacii fac predicții și apoi ai

22527
17:30:21,840 --> 17:30:26,720
boosting like ada boost xg boost so

22528
17:30:24,880 --> 17:30:28,720
modelele învață unul din greșelile celuilalt

22529
17:30:26,720 --> 17:30:31,276
aici şi după învăţarea în ansamblu

22530
17:30:28,720 --> 17:30:33,360
vine învățarea profundă. Deci aici explorezi

22531
17:30:31,276 --> 17:30:34,956
rețele neuronale care imită omul

22532
17:30:33,360 --> 17:30:36,720
creierul. Așa că vei învăța despre neurală

22533
17:30:34,956 --> 17:30:38,956
elementele de bază ale rețelei. Deci poți începe cu

22534
17:30:36,720 --> 17:30:40,720
simple rețele complet conectate și apoi

22535
17:30:38,956 --> 17:30:42,720
poţi trece la propagarea înapoi şi

22536
17:30:40,720 --> 17:30:45,040
coborâre în gradient. Deci acestea vă ajută

22537
17:30:42,720 --> 17:30:47,200
model învață și îmbunătățește. Deci poți folosi

22538
17:30:45,040 --> 17:30:48,880
TensorFlow sau PyTorch pentru a exersa

22539
17:30:47,200 --> 17:30:50,636
construirea rețelelor neuronale. Deci poți

22540
17:30:48,880 --> 17:30:52,880
lucrează la proiecte pentru a le consolida

22541
17:30:50,636 --> 17:30:55,360
concepte. Acum mergi mai departe, ai doi

22542
17:30:52,880 --> 17:30:57,116
specializat pe subiecte precum NLP și

22543
17:30:55,360 --> 17:30:59,040
viziune computerizată. Deci învățarea automată

22544
17:30:57,116 --> 17:31:01,040
aplicațiile sunt atât de puternice și aici

22545
17:30:59,040 --> 17:31:02,956
veți avea un gust din două domenii majore

22546
17:31:01,040 --> 17:31:05,520
care este NLP sau limbaj natural

22547
17:31:02,956 --> 17:31:07,756
prelucrare. Deci aici lucrează cu text

22548
17:31:05,520 --> 17:31:09,916
date cu sarcini precum analiza sentimentelor

22549
17:31:07,756 --> 17:31:12,080
și clasificarea textului. Deci poți

22550
17:31:09,916 --> 17:31:14,560
începeți cu preprocesarea de bază, cum ar fi

22551
17:31:12,080 --> 17:31:16,480
tokenizare, eliminarea cuvântului oprit și mutare

22552
17:31:14,560 --> 17:31:18,636
pentru a construi modele simple NLP. După

22553
17:31:16,480 --> 17:31:21,360
că poți încerca viziunea computerizată. Deci pentru

22554
17:31:18,636 --> 17:31:23,596
datele de imagine trebuie să înveți CNN

22555
17:31:21,360 --> 17:31:26,080
rețele neuronale convoluționale. Deci astea

22556
17:31:23,596 --> 17:31:28,480
rețeaua analizează realizarea de modele vizuale

22557
17:31:26,080 --> 17:31:30,400
sunt ideale pentru clasificarea imaginilor. Deci

22558
17:31:28,480 --> 17:31:32,796
exersezi cu seturi de date deschise precum

22559
17:31:30,400 --> 17:31:34,240
text, documente sau imagini și aplicați

22560
17:31:32,796 --> 17:31:36,560
concepte pe care le vei învăța să vezi rezultate

22561
17:31:34,240 --> 17:31:38,400
în aplicațiile din lumea reală. Acum în

22562
17:31:36,560 --> 17:31:40,636
În a 10-a lună vei avea de-a face cu modelul

22563
17:31:38,400 --> 17:31:43,116
implementare care aduce modelele dvs

22564
17:31:40,636 --> 17:31:44,956
la viata. Deci aici vei folosi Flask

22565
17:31:43,116 --> 17:31:47,680
sau Django. Deci le puteți folosi pe acestea

22566
17:31:44,956 --> 17:31:49,360
cadre pentru a crea un API web, astfel încât utilizatorii

22567
17:31:47,680 --> 17:31:50,956
poate interacționa cu modelul dvs. Pentru

22568
17:31:49,360 --> 17:31:53,360
de exemplu, construiți o aplicație web care permite

22569
17:31:50,956 --> 17:31:55,200
oamenii încarcă imagini pentru clasificare.

22570
17:31:53,360 --> 17:31:57,040
Și apoi puteți încerca și Docker. Deci

22571
17:31:55,200 --> 17:31:59,436
împachetați modelul dvs. și dependențele acestuia

22572
17:31:57,040 --> 17:32:01,116
astfel încât să poată rula pe orice mașină. Deci asta este

22573
17:31:59,436 --> 17:32:03,360
foarte util pentru implementarea modelelor

22574
17:32:01,116 --> 17:32:04,880
fără probleme de compatibilitate. Deci de către

22575
17:32:03,360 --> 17:32:06,880
la sfârșitul acestei luni, veți putea

22576
17:32:04,880 --> 17:32:08,636
împărtășește-ți modelele lumii. Deci

22577
17:32:06,880 --> 17:32:11,116
trecând la luna a 11-a, vei fi

22578
17:32:08,636 --> 17:32:12,636
începând cu cloud și producție. Deci

22579
17:32:11,116 --> 17:32:14,320
luna aceasta, veți învăța cum să implementați

22580
17:32:12,636 --> 17:32:16,636
modele pe cloud și asigurați-vă că acestea

22581
17:32:14,320 --> 17:32:17,840
performează bine în mediile din lumea reală.

22582
17:32:16,636 --> 17:32:20,240
Deci vei avea de-a face cu cloud

22583
17:32:17,840 --> 17:32:22,320
platforme precum AWS, Google Cloud sau

22584
17:32:20,240 --> 17:32:23,840
Azure. Așa că trebuie să înveți să implementezi

22585
17:32:22,320 --> 17:32:26,160
modele ale furnizorului de cloud

22586
17:32:23,840 --> 17:32:28,240
accesibilitate și scalabilitate. Și apoi

22587
17:32:26,160 --> 17:32:29,756
vine monitorizarea și întreținerea. Deci

22588
17:32:28,240 --> 17:32:32,000
înțelegeți cum să vă urmăriți modelele

22589
17:32:29,756 --> 17:32:34,000
performanța în timp și actualizați-o ca

22590
17:32:32,000 --> 17:32:36,000
necesare. Deci aceste abilități sunt esențiale

22591
17:32:34,000 --> 17:32:38,560
pentru menţinerea modelelor în producţie şi

22592
17:32:36,000 --> 17:32:40,240
asigurându-se că rămân fiabile. Și în sfârșit

22593
17:32:38,560 --> 17:32:42,720
veți crea proiecte în lumea reală

22594
17:32:40,240 --> 17:32:45,040
și construirea portofoliului. Deci aici ai

22595
17:32:42,720 --> 17:32:47,200
să alegi subiecte care te interesează și

22596
17:32:45,040 --> 17:32:49,360
arătați-vă abilitățile. Deci mai întâi poți

22597
17:32:47,200 --> 17:32:51,436
începe cu proiecte complete. Atât de complet

22598
17:32:49,360 --> 17:32:53,756
proiecte care merg de la curățarea datelor și

22599
17:32:51,436 --> 17:32:55,680
construirea modelului până la implementare. Deci idei

22600
17:32:53,756 --> 17:32:57,520
ar putea fi un instrument de analiză a sentimentelor sau un

22601
17:32:55,680 --> 17:32:59,756
aplicație de recunoaștere a imaginii. Și apoi ai

22602
17:32:57,520 --> 17:33:01,756
pentru a vă construi portofoliul. Așa că organizează-te și

22603
17:32:59,756 --> 17:33:03,916
documentează-ți proiectele, găzduiește-le

22604
17:33:01,756 --> 17:33:05,520
GitHub și creați un portofoliu online

22605
17:33:03,916 --> 17:33:07,840
împărtășește cu potențialii angajatori sau

22606
17:33:05,520 --> 17:33:09,520
colaboratori. Deci urmând acest drum

22607
17:33:07,840 --> 17:33:11,200
hartă, vei fi bine pregătit să te descurci

22608
17:33:09,520 --> 17:33:13,276
provocări de învățare automată din lumea reală

22609
17:33:11,200 --> 17:33:13,916
și au un portofoliu impresionant de arătat

22610
17:33:13,276 --> 17:33:16,240
pentru asta.

22611
17:33:13,916 --> 17:33:18,636
>> Bine ați venit la tutorialul de învățare automată

22612
17:33:16,240 --> 17:33:20,560
partea a doua. Numele meu este Richard Kersner

22613
17:33:18,636 --> 17:33:23,040
cu echipa SimplyLearn. Adică

22614
17:33:20,560 --> 17:33:26,560
www.simplearn.com.

22615
17:33:23,040 --> 17:33:28,636
Obțineți certificare, treceți înainte. Astăzi în nostru

22616
17:33:26,560 --> 17:33:31,756
al doilea tutorial, vom acoperi K

22617
17:33:28,636 --> 17:33:33,680
înseamnă regresie liniară împreună cu mersul

22618
17:33:31,756 --> 17:33:36,400
peste întrebările test pe care le-am avut în timpul

22619
17:33:33,680 --> 17:33:38,956
primul nostru tutorial. Pentru ce este în el

22620
17:33:36,400 --> 17:33:41,520
tu? Vom acoperi gruparea.

22621
17:33:38,956 --> 17:33:43,040
Ce este clustering? K înseamnă grupare

22622
17:33:41,520 --> 17:33:45,200
care este una dintre cele mai frecvent utilizate

22623
17:33:43,040 --> 17:33:47,116
instrumente de grupare, inclusiv a

22624
17:33:45,200 --> 17:33:48,956
organigramă pentru a înțelege K înseamnă

22625
17:33:47,116 --> 17:33:51,360
clustering și modul în care funcționează și apoi

22626
17:33:48,956 --> 17:33:54,240
Vom face o demonstrație live Python reală

22627
17:33:51,360 --> 17:33:55,756
gruparea de mașini pe bază de mărci. Apoi

22628
17:33:54,240 --> 17:33:58,400
vom acoperi logistica

22629
17:33:55,756 --> 17:34:00,636
regresie. Ce este regresia logistică?

22630
17:33:58,400 --> 17:34:02,400
Curba de regresie logistică și sigmoid

22631
17:34:00,636 --> 17:34:05,040
funcția. Și apoi vom face alta

22632
17:34:02,400 --> 17:34:08,080
Demo de cod Python pentru a clasifica o tumoare ca

22633
17:34:05,040 --> 17:34:10,400
maligne sau benigne pe baza caracteristicilor.

22634
17:34:08,080 --> 17:34:12,560
Și să începem cu gruparea. Să presupunem

22635
17:34:10,400 --> 17:34:14,956
avem o grămadă de cărți de diferite

22636
17:34:12,560 --> 17:34:17,520
genuri. Acum le împărțim în

22637
17:34:14,956 --> 17:34:20,000
diferite grupuri precum ficțiunea, horror,

22638
17:34:17,520 --> 17:34:22,000
educație și după cum putem vedea din aceasta

22639
17:34:20,000 --> 17:34:23,840
domnișoară, cu siguranță îi place heavy

22640
17:34:22,000 --> 17:34:25,916
groază. Poți spune doar după acei ochi

22641
17:34:23,840 --> 17:34:27,756
iar frunza de arțar canadian pe ea

22642
17:34:25,916 --> 17:34:29,040
cămașă. Dar avem ficțiune, groază și

22643
17:34:27,756 --> 17:34:31,276
educație. Și vrem să mergem înainte și

22644
17:34:29,040 --> 17:34:33,840
împărțim cărțile noastre. Ei bine, organizarea

22645
17:34:31,276 --> 17:34:36,636
obiecte în grupuri pe baza asemănării

22646
17:34:33,840 --> 17:34:37,840
se grupează. Și în acest caz, ca

22647
17:34:36,636 --> 17:34:39,200
ne uităm la cărți, suntem

22648
17:34:37,840 --> 17:34:41,756
vorbind despre gruparea lucrurilor cu

22649
17:34:39,200 --> 17:34:43,596
categorii cunoscute. Dar poți folosi și

22650
17:34:41,756 --> 17:34:45,680
pentru a explora datele. Deci s-ar putea să nu

22651
17:34:43,596 --> 17:34:47,360
cunosc categoriile. Doar știi asta

22652
17:34:45,680 --> 17:34:49,520
trebuie să-l împărți într-un fel pentru

22653
17:34:47,360 --> 17:34:51,116
cuceri datele și să le organizezi

22654
17:34:49,520 --> 17:34:52,880
mai bine. Dar în acest caz, o vom face

22655
17:34:51,116 --> 17:34:54,636
se uită la gruparea în mod specific

22656
17:34:52,880 --> 17:34:57,436
categorii. Și să aruncăm o privire mai profundă

22657
17:34:54,636 --> 17:34:59,436
uite la asta. Vom folosi K mijloace

22658
17:34:57,436 --> 17:35:00,956
gruparea. K înseamnă gruparea este

22659
17:34:59,436 --> 17:35:02,956
probabil cel mai des folosit

22660
17:35:00,956 --> 17:35:05,116
instrument de grupare în învățarea automată

22661
17:35:02,956 --> 17:35:07,840
bibliotecă. K înseamnă gruparea este an

22662
17:35:05,116 --> 17:35:10,240
exemplu de învățare nesupravegheată. Dacă tu

22663
17:35:07,840 --> 17:35:12,956
amintește-ți de lucrul nostru anterior, așa este

22664
17:35:10,240 --> 17:35:14,400
folosit atunci când aveți date neetichetate. Deci noi

22665
17:35:12,956 --> 17:35:16,080
nu stiu inca raspunsul. Avem o

22666
17:35:14,400 --> 17:35:18,320
o mulțime de date pe care dorim să le grupăm

22667
17:35:16,080 --> 17:35:21,596
grupuri diferite. Definiți clustere în

22668
17:35:18,320 --> 17:35:23,520
date bazate pe asemănarea caracteristicilor. Deci

22669
17:35:21,596 --> 17:35:25,596
am introdus aici câțiva termeni.

22670
17:35:23,520 --> 17:35:28,720
Am vorbit deja despre nesupravegheat

22671
17:35:25,596 --> 17:35:30,160
învăţare şi date neetichetate. Deci noi nu

22672
17:35:28,720 --> 17:35:31,436
stiu inca raspunsul. Doar o să facem

22673
17:35:30,160 --> 17:35:33,360
grupați lucrurile împreună și vedem dacă putem

22674
17:35:31,436 --> 17:35:36,320
găsi un fără răspuns

22675
17:35:33,360 --> 17:35:38,160
conectați. Am introdus și funcția

22676
17:35:36,320 --> 17:35:40,400
asemănarea. Caracteristicile fiind diferite

22677
17:35:38,160 --> 17:35:44,240
caracteristicile datelor. Acum, cu cărți,

22678
17:35:40,400 --> 17:35:46,160
putem vedea cu ușurință ficțiune și groază și

22679
17:35:44,240 --> 17:35:48,560
cărți de istorie. Dar de multe ori cu

22680
17:35:46,160 --> 17:35:50,240
date, unele dintre aceste informații nu sunt așa

22681
17:35:48,560 --> 17:35:51,840
ușor de văzut chiar atunci când ne uităm pentru prima dată

22682
17:35:50,240 --> 17:35:53,520
ea. Și așa, K înseamnă că este unul dintre acestea

22683
17:35:51,840 --> 17:35:55,756
instrumente prin care putem începe să găsim lucruri

22684
17:35:53,520 --> 17:35:57,520
care leagă acel meci unul cu celălalt.

22685
17:35:55,756 --> 17:36:00,080
Să presupunem că avem aceste puncte de date și

22686
17:35:57,520 --> 17:36:01,756
doriți să le atribuiți într-un cluster. Acum

22687
17:36:00,080 --> 17:36:03,276
când mă uit la aceste puncte de date, eu

22688
17:36:01,756 --> 17:36:04,956
probabil că le-ar grupa în două

22689
17:36:03,276 --> 17:36:06,480
clustere doar privindu-le. aș

22690
17:36:04,956 --> 17:36:09,756
spune două dintre aceste grupe de date de fel

22691
17:36:06,480 --> 17:36:12,720
veni împreună. Dar în K înseamnă că alegem K

22692
17:36:09,756 --> 17:36:15,436
clustere și atribuiți centridi aleatori

22693
17:36:12,720 --> 17:36:17,520
clustere unde K clusterele reprezintă

22694
17:36:15,436 --> 17:36:19,200
două grupuri diferite. O alegem pe K

22695
17:36:17,520 --> 17:36:21,436
clustere și spune centroiide aleatoare la

22696
17:36:19,200 --> 17:36:24,240
clusterele. Apoi calculăm distanța

22697
17:36:21,436 --> 17:36:26,480
de la obiecte la centride. Acum noi

22698
17:36:24,240 --> 17:36:29,916
formează noi clustere pe baza minimului

22699
17:36:26,480 --> 17:36:32,000
distanțe și calculați centridele. Deci

22700
17:36:29,916 --> 17:36:33,436
ne dăm seama care este cea mai bună distanță

22701
17:36:32,000 --> 17:36:35,916
pentru centrid. Apoi mutam

22702
17:36:33,436 --> 17:36:38,080
centrați și recalculați acele distanțe.

22703
17:36:35,916 --> 17:36:40,000
Repetați doi pași anteriori în mod iterativ

22704
17:36:38,080 --> 17:36:42,400
până când centroidul clusterului nu se mai schimbă

22705
17:36:40,000 --> 17:36:44,560
pozițiile lor și devin statice.

22706
17:36:42,400 --> 17:36:46,320
Repetați doi pași anteriori în mod iterativ

22707
17:36:44,560 --> 17:36:48,320
până când centroidul clusterului nu se mai schimbă

22708
17:36:46,320 --> 17:36:50,636
iar poziţiile devin statice. Odată

22709
17:36:48,320 --> 17:36:52,720
clusterele devin statice, atunci K înseamnă

22710
17:36:50,636 --> 17:36:54,720
se spune că algoritmul de grupare este

22711
17:36:52,720 --> 17:36:56,080
convergentă. Și mai există un termen noi

22712
17:36:54,720 --> 17:36:58,240
vezi pe tot parcursul învățării automate este

22713
17:36:56,080 --> 17:37:00,480
convergentă. Asta înseamnă orice matematică

22714
17:36:58,240 --> 17:37:02,720
folosim pentru a ne da seama că răspunsul are

22715
17:37:00,480 --> 17:37:04,796
ajunge la o soluție sau converge

22716
17:37:02,720 --> 17:37:06,480
un răspuns. Să vedem diagrama de flux la

22717
17:37:04,796 --> 17:37:08,956
intelege sa aiba putin mai mult sens

22718
17:37:06,480 --> 17:37:11,840
punându-l într-un pas frumos și ușor

22719
17:37:08,956 --> 17:37:13,520
pas? Deci începem, alegem K. Vom

22720
17:37:11,840 --> 17:37:16,400
uită-te la metoda cotului în doar a

22721
17:37:13,520 --> 17:37:18,240
moment. Le atribuim centrid aleatori

22722
17:37:16,400 --> 17:37:20,080
clustere și uneori alegeți

22723
17:37:18,240 --> 17:37:21,916
centrids pentru că s-ar putea să te uiți la

22724
17:37:20,080 --> 17:37:24,000
date într-un grafic și spuneți ah acestea

22725
17:37:21,916 --> 17:37:26,636
sunt probabil punctele centrale. Apoi noi

22726
17:37:24,000 --> 17:37:29,360
calculați distanța de la obiecte până la

22727
17:37:26,636 --> 17:37:31,436
centridele. Luăm asta și formăm

22728
17:37:29,360 --> 17:37:33,756
noi clustere bazate pe distanța minimă

22729
17:37:31,436 --> 17:37:35,756
și calculați centridele lor. Apoi noi

22730
17:37:33,756 --> 17:37:37,916
calculați distanța de la obiecte la

22731
17:37:35,756 --> 17:37:39,436
noi centride. Și apoi ne întoarcem și

22732
17:37:37,916 --> 17:37:42,000
repetați ultimii doi pași. Noi

22733
17:37:39,436 --> 17:37:44,240
calculați distanțele. Deci așa cum suntem

22734
17:37:42,000 --> 17:37:46,560
făcând-o, aduce în noul centrid

22735
17:37:44,240 --> 17:37:48,080
iar apoi mutam centridul in jurul si

22736
17:37:46,560 --> 17:37:50,160
ne dăm seama care este cel mai bun care

22737
17:37:48,080 --> 17:37:52,000
obiectele sunt cele mai apropiate de fiecare centrid. Deci

22738
17:37:50,160 --> 17:37:53,276
obiectele pot comuta de la un centroid

22739
17:37:52,000 --> 17:37:55,520
la celălalt precum sunt centroiidele

22740
17:37:53,276 --> 17:37:58,720
ne-am mutat și continuăm asta până când

22741
17:37:55,520 --> 17:38:01,116
este convergentă. Să vedem un exemplu de

22742
17:37:58,720 --> 17:38:03,520
aceasta. Să presupunem că avem acest set de date de

22743
17:38:01,116 --> 17:38:07,276
șapte indivizi și scorul lor pe doi

22744
17:38:03,520 --> 17:38:09,680
subiectele A și B. Uh, iată subiectul nostru

22745
17:38:07,276 --> 17:38:12,560
în acest caz referindu-se la persoană

22746
17:38:09,680 --> 17:38:14,080
luând testul uh și apoi avem

22747
17:38:12,560 --> 17:38:15,840
subiectul A unde vedem ce au

22748
17:38:14,080 --> 17:38:17,200
au punctat la primul lor subiect și noi

22749
17:38:15,840 --> 17:38:19,360
au subiectul B și putem vedea ce au

22750
17:38:17,200 --> 17:38:21,520
punctaj la al doilea subiect. Acum hai

22751
17:38:19,360 --> 17:38:23,596
luați două puncte cele mai îndepărtate ca

22752
17:38:21,520 --> 17:38:25,200
centroidele clusterului inițial. Acum

22753
17:38:23,596 --> 17:38:27,436
amintiți-vă că am vorbit despre selectarea lor

22754
17:38:25,200 --> 17:38:28,720
aleatoriu sau le putem pune și pur și simplu

22755
17:38:27,436 --> 17:38:30,636
puncte diferite și alegeți cel mai departe

22756
17:38:28,720 --> 17:38:32,796
unul separat, astfel încât să se miște împreună. Oricum

22757
17:38:30,636 --> 17:38:34,400
unul funcționează bine în funcție de ce fel de

22758
17:38:32,796 --> 17:38:36,636
datele la care lucrați și ceea ce știți

22759
17:38:34,400 --> 17:38:40,080
despre asta. Așa că le-am dus pe cele două cele mai departe

22760
17:38:36,636 --> 17:38:41,680
punctele unu și unu și cinci și șapte.

22761
17:38:40,080 --> 17:38:43,520
Și acum să le luăm pe cele două cele mai îndepărtate

22762
17:38:41,680 --> 17:38:46,320
puncte separate ca cluster inițial

22763
17:38:43,520 --> 17:38:48,400
centride. Fiecare punct este apoi atribuit

22764
17:38:46,320 --> 17:38:51,116
cel mai apropiat cluster în raport cu

22765
17:38:48,400 --> 17:38:52,400
distanta fata de centride. Deci luăm

22766
17:38:51,116 --> 17:38:53,916
fiecare dintre aceste puncte acolo. Noi

22767
17:38:52,400 --> 17:38:55,360
masoara acea distanta. Și poți vedea

22768
17:38:53,916 --> 17:38:57,596
că dacă am măsurat fiecare dintre acestea

22769
17:38:55,360 --> 17:38:59,756
distanțe și utilizați

22770
17:38:57,596 --> 17:39:01,840
Teorema lui Pitagora pentru un triunghi în

22771
17:38:59,756 --> 17:39:04,240
acest caz pentru că știți x și

22772
17:39:01,840 --> 17:39:05,680
y și vă puteți da seama diagonala

22773
17:39:04,240 --> 17:39:07,276
linie de la asta sau poți doar să iei o

22774
17:39:05,680 --> 17:39:08,956
riglă și pune-o pe monitor. Asta ar fi

22775
17:39:07,276 --> 17:39:10,480
fii cam prost, dar ar funcționa dacă

22776
17:39:08,956 --> 17:39:12,636
doar o privești. Poți vedea

22777
17:39:10,480 --> 17:39:15,040
cum se unesc în mod natural

22778
17:39:12,636 --> 17:39:17,436
anumite zone. Acum calculăm din nou

22779
17:39:15,040 --> 17:39:19,840
centroizii fiecărui cluster. Deci

22780
17:39:17,436 --> 17:39:22,480
grupul unu și apoi grupul doi și noi

22781
17:39:19,840 --> 17:39:24,560
uită-te la fiecare punct individual. Există

22782
17:39:22,480 --> 17:39:26,796
unu, doi, trei. Suntem într-un singur grup.

22783
17:39:24,560 --> 17:39:30,160
Uh, centridul se mută. Ea

22784
17:39:26,796 --> 17:39:32,240
devine 1.8 virgulă 2.3. Așa că ține minte

22785
17:39:30,160 --> 17:39:33,756
era la 1 si unu. Ei bine, chiar centrul

22786
17:39:32,240 --> 17:39:36,320
din datele pe care le analizăm ar pune

22787
17:39:33,756 --> 17:39:38,956
la un punct, aproximativ 22, dar 1,8

22788
17:39:36,320 --> 17:39:41,360
și 2.3. Și al doilea, dacă noi

22789
17:39:38,956 --> 17:39:42,796
am vrut să fac vectorul mediu general,

22790
17:39:41,360 --> 17:39:44,956
vectorul mediu al tuturor diferitelor

22791
17:39:42,796 --> 17:39:48,080
distanțe până la acel centru, venim în sus

22792
17:39:44,956 --> 17:39:50,320
cu 4, 1 și 54. Deci acum ne-am mutat

22793
17:39:48,080 --> 17:39:52,240
centridele. Le comparăm pe fiecare

22794
17:39:50,320 --> 17:39:54,560
distanța individului față de propriul său grup

22795
17:39:52,240 --> 17:39:57,520
medie și la cea a clusterului opus

22796
17:39:54,560 --> 17:39:59,916
și găsim să construim o diagramă frumoasă aici

22797
17:39:57,520 --> 17:40:01,520
că pe măsură ce ne mișcăm acel centru

22798
17:39:59,916 --> 17:40:03,680
acum avem un nou tip diferit de

22799
17:40:01,520 --> 17:40:05,840
gruparea de grupuri și utilizarea uklidianului

22800
17:40:03,680 --> 17:40:07,680
distanța dintre puncte și medie

22801
17:40:05,840 --> 17:40:09,040
obținem aceeași formulă pe care o vedeți nouă

22802
17:40:07,680 --> 17:40:11,040
formule care apar. Deci avem

22803
17:40:09,040 --> 17:40:12,636
distanța punctelor individuale față de medie

22804
17:40:11,040 --> 17:40:14,956
centridul clusterului și distanța până la

22805
17:40:12,636 --> 17:40:16,880
centridul mediu al clusterului. Numai

22806
17:40:14,956 --> 17:40:19,916
individul trei este mai aproape de medie

22807
17:40:16,880 --> 17:40:21,756
a clusterului opus doi decât

22808
17:40:19,916 --> 17:40:23,360
propriul său cluster unul. Și poți vedea

22809
17:40:21,756 --> 17:40:25,360
aici în diagramă unde am cam

22810
17:40:23,360 --> 17:40:27,276
încercuit-o pe aia din mijloc. Deci când

22811
17:40:25,360 --> 17:40:29,116
am mutat grupul al cărui centroizi

22812
17:40:27,276 --> 17:40:30,956
clusterele peste unul dintre puncte

22813
17:40:29,116 --> 17:40:32,480
mutat la celălalt cluster pentru că

22814
17:40:30,956 --> 17:40:34,956
este mai aproape de acel grup de

22815
17:40:32,480 --> 17:40:37,200
indivizii. Astfel, individul 3 este

22816
17:40:34,956 --> 17:40:39,596
mutat în grupul doi, rezultând a

22817
17:40:37,200 --> 17:40:41,436
partiție nouă. Și regenerăm totul

22818
17:40:39,596 --> 17:40:43,436
acele numere de cât de aproape sunt

22819
17:40:41,436 --> 17:40:44,956
diferitele clustere. Pentru nou

22820
17:40:43,436 --> 17:40:47,116
clustere, vom găsi cea actuală

22821
17:40:44,956 --> 17:40:49,276
centroizii cluster. Deci acum mutam

22822
17:40:47,116 --> 17:40:50,880
centrid peste. Și poți vedea asta

22823
17:40:49,276 --> 17:40:52,880
acum am format două foarte distincte

22824
17:40:50,880 --> 17:40:54,636
clustere aici. La compararea

22825
17:40:52,880 --> 17:40:56,956
distanța distanței fiecărui individ

22826
17:40:54,636 --> 17:40:58,880
la propria sa medie cluster si la cea a

22827
17:40:56,956 --> 17:41:00,880
clusterul opus, aflăm că

22828
17:40:58,880 --> 17:41:03,116
punctele de date sunt stabile. Prin urmare, avem

22829
17:41:00,880 --> 17:41:05,840
clusterele noastre finale. Acum, dacă îți amintești

22830
17:41:03,116 --> 17:41:08,320
Am adus în discuție un concept mai devreme K mean on

22831
17:41:05,840 --> 17:41:10,400
K înseamnă algoritm care alege corect

22832
17:41:08,320 --> 17:41:12,880
valoarea lui K va ajuta într-un număr mai mic de

22833
17:41:10,400 --> 17:41:14,956
iterații și pentru a găsi cea potrivită

22834
17:41:12,880 --> 17:41:18,000
numărul de clustere dintr-un set de date pe care îl folosim

22835
17:41:14,956 --> 17:41:20,880
metoda cotului si in suma de

22836
17:41:18,000 --> 17:41:23,116
pătrate WSS este definită ca suma dintre

22837
17:41:20,880 --> 17:41:25,436
distanța pătrată dintre fiecare membru al

22838
17:41:23,116 --> 17:41:27,360
clusterul și centridul lui și deci tu

22839
17:41:25,436 --> 17:41:30,720
vezi că am făcut aici este că avem

22840
17:41:27,360 --> 17:41:33,040
număr de clustere și pe măsură ce faci

22841
17:41:30,720 --> 17:41:35,040
același K înseamnă algoritm peste

22842
17:41:33,040 --> 17:41:36,636
clustere diferite și tu calculezi

22843
17:41:35,040 --> 17:41:38,160
cum arată acel centrid și tu

22844
17:41:36,636 --> 17:41:40,000
găsiți optimul pe care îl puteți găsi de fapt

22845
17:41:38,160 --> 17:41:42,160
numărul optim de clustere folosind

22846
17:41:40,000 --> 17:41:44,636
cot graficul este numit cot

22847
17:41:42,160 --> 17:41:46,560
metoda și pe aceasta am ghicit la două

22848
17:41:44,636 --> 17:41:48,796
doar privind datele, dar ca tine

22849
17:41:46,560 --> 17:41:50,240
pot vedea panta pe care doar o privești

22850
17:41:48,796 --> 17:41:51,756
căci chiar acolo unde este cotul

22851
17:41:50,240 --> 17:41:54,080
panta si ai un raspuns clar

22852
17:41:51,756 --> 17:41:56,240
pe care vrem să începem două diferite

22853
17:41:54,080 --> 17:41:59,680
k înseamnă că este egal cu doi de multe ori oameni

22854
17:41:56,240 --> 17:42:02,560
ajunge să calculezi k înseamnă 2 3 patru

22855
17:41:59,680 --> 17:42:04,400
cinci până găsesc valoarea care

22856
17:42:02,560 --> 17:42:06,000
se potrivește pe articulația cotului. Uneori tu

22857
17:42:04,400 --> 17:42:08,480
poti doar sa te uiti la date si daca esti

22858
17:42:06,000 --> 17:42:10,080
foarte bine cu acel domeniu specific

22859
17:42:08,480 --> 17:42:12,080
amintiți-vă domeniul pe care l-am menționat ultimul

22860
17:42:10,080 --> 17:42:13,200
când veți ști că acela de unde să alegeți

22861
17:42:12,080 --> 17:42:15,680
acele numere și de unde să încep

22862
17:42:13,200 --> 17:42:17,596
ghicind care este acea valoare k. Deci

22863
17:42:15,680 --> 17:42:20,320
hai să luăm asta și o să folosim a

22864
17:42:17,596 --> 17:42:22,560
caz de utilizare folosind k înseamnă gruparea la

22865
17:42:20,320 --> 17:42:24,880
grupați mașinile în mărci care utilizează

22866
17:42:22,560 --> 17:42:27,756
parametri precum cai putere, cubic

22867
17:42:24,880 --> 17:42:30,160
inci, marca, anul etc. Deci, mergem

22868
17:42:27,756 --> 17:42:32,320
pentru a utiliza setul de date mașini date având

22869
17:42:30,160 --> 17:42:35,200
informații despre trei mărci de mașini,

22870
17:42:32,320 --> 17:42:37,916
Toyota, Honda și Nissan. Ne vom întoarce

22871
17:42:35,200 --> 17:42:41,360
la unealta mea preferată, Anaconda

22872
17:42:37,916 --> 17:42:42,956
Navigator cu caietul Jupiter. Şi

22873
17:42:41,360 --> 17:42:45,436
hai să mergem înainte și să trecem la nostru

22874
17:42:42,956 --> 17:42:46,956
Caietul Jupyter. Și în Jupyterul nostru

22875
17:42:45,436 --> 17:42:49,680
Caiet, am de gând să merg înainte și doar

22876
17:42:46,956 --> 17:42:51,436
lipiți codul de bază pe care îl facem de obicei

22877
17:42:49,680 --> 17:42:52,880
începe cu multe dintre acestea. Nu suntem

22878
17:42:51,436 --> 17:42:54,796
va intra prea mult în acest cod

22879
17:42:52,880 --> 17:42:56,796
pentru că am discutat deja despre numpy.

22880
17:42:54,796 --> 17:42:58,720
Am discutat deja despre biblioteca mapplot

22881
17:42:56,796 --> 17:43:00,880
și panda. Numpy fiind numărul

22882
17:42:58,720 --> 17:43:03,116
matrice, panda fiind datele panda

22883
17:43:00,880 --> 17:43:04,880
cadru și mattplot pentru reprezentare grafică. Şi

22884
17:43:03,116 --> 17:43:06,400
nu uita că dacă folosești

22885
17:43:04,880 --> 17:43:08,880
notebook-ul Jupyter, aveți nevoie de

22886
17:43:06,400 --> 17:43:10,720
biblioteca mattplot în linie astfel încât

22887
17:43:08,880 --> 17:43:13,360
trasează totul pe ecran. Dacă

22888
17:43:10,720 --> 17:43:14,720
utilizați un editor Python diferit,

22889
17:43:13,360 --> 17:43:16,320
atunci probabil că nu ai nevoie de asta

22890
17:43:14,720 --> 17:43:18,080
pentru că va avea o fereastră pop-up deschisă

22891
17:43:16,320 --> 17:43:20,400
computerul dvs. Și vom merge înainte și

22892
17:43:18,080 --> 17:43:23,116
rulați asta doar pentru a încărca bibliotecile noastre și

22893
17:43:20,400 --> 17:43:25,116
configurația noastră aici. Următorul pas este de

22894
17:43:23,116 --> 17:43:28,000
bineînțeles să mă uit la datele noastre pe care le am

22895
17:43:25,116 --> 17:43:29,756
deja deschis într-o foaie de calcul. Şi

22896
17:43:28,000 --> 17:43:32,080
puteți vedea aici că avem milele pe

22897
17:43:29,756 --> 17:43:34,320
galon, cilindri, inci cubi,

22898
17:43:32,080 --> 17:43:36,560
cai putere, kilograme, cum știi

22899
17:43:34,320 --> 17:43:39,360
cât de greu este, timpul necesar pentru a ajunge

22900
17:43:36,560 --> 17:43:42,560
60. Cardul meu este probabil pe acesta la

22901
17:43:39,360 --> 17:43:43,756
cam 80 sau 90. Ce an este? Deci asta

22902
17:43:42,560 --> 17:43:46,400
este, de fapt, puteți vedea că este un fel

22903
17:43:43,756 --> 17:43:48,720
mașini mai vechi și apoi marca Toyota,

22904
17:43:46,400 --> 17:43:51,200
Honda, Nissan. Deci diferitele mașini sunt

22905
17:43:48,720 --> 17:43:54,000
venind din tot drumul din 1971 dacă noi

22906
17:43:51,200 --> 17:43:55,916
derulați în jos până în anii 80. Avem

22907
17:43:54,000 --> 17:43:58,400
între anii 70 și 80 un număr de mașini

22908
17:43:55,916 --> 17:43:59,200
pe care le-au scos. Și hai să fim noi

22909
17:43:58,400 --> 17:44:01,040
întoarce-te aici. O să facem

22910
17:43:59,200 --> 17:44:04,240
importul datelor. Deci vom merge înainte

22911
17:44:01,040 --> 17:44:06,560
și faceți setul de date egal și vom folosi

22912
17:44:04,240 --> 17:44:08,636
panda în care să citească asta. Și e de la

22913
17:44:06,560 --> 17:44:11,116
un fișier CSV. Amintiți-vă, puteți oricând

22914
17:44:08,636 --> 17:44:13,436
postați asta în comentarii și cerere

22915
17:44:11,116 --> 17:44:15,680
fișierele de date pentru acestea fie în

22916
17:44:13,436 --> 17:44:18,240
comentarii aici pe videoclipul YouTube sau du-te

22917
17:44:15,680 --> 17:44:21,116
la simplylearn.com și solicită asta. The

22918
17:44:18,240 --> 17:44:23,756
CSV masina, l-am pus in acelasi folder ca

22919
17:44:21,116 --> 17:44:25,360
codul pe care l-am stocat. Deci, Python-ul meu

22920
17:44:23,756 --> 17:44:27,276
codul este stocat în același folder, așa că eu

22921
17:44:25,360 --> 17:44:28,720
nu trebuie să puneți calea completă. Dacă tu

22922
17:44:27,276 --> 17:44:30,080
stocați-le în foldere diferite, așa o faceți

22923
17:44:28,720 --> 17:44:31,840
trebuie să schimbi asta și să verifici

22924
17:44:30,080 --> 17:44:34,320
variabilele numelui dvs. Și vom merge înainte

22925
17:44:31,840 --> 17:44:35,756
și rulează asta. Și am ales datele

22926
17:44:34,320 --> 17:44:37,360
setat arbitrar pentru că, știi, este

22927
17:44:35,756 --> 17:44:39,756
un set de date pe care îl importăm. Și noi am

22928
17:44:37,360 --> 17:44:42,160
acum am importat CSV-ul mașinii noastre în date

22929
17:44:39,756 --> 17:44:43,840
set. După cum știți, trebuie să pregătiți

22930
17:44:42,160 --> 17:44:45,916
date. Deci, vom crea X

22931
17:44:43,840 --> 17:44:47,596
date. Acesta este cel în care mergem

22932
17:44:45,916 --> 17:44:49,916
pentru a încerca să-mi dau seama ce se întâmplă

22933
17:44:47,596 --> 17:44:51,916
cu. Și apoi există o serie de moduri

22934
17:44:49,916 --> 17:44:53,436
pentru a face asta, dar o vom face într-un mod simplu

22935
17:44:51,916 --> 17:44:57,116
buclă, astfel încât să puteți vedea de fapt ce este

22936
17:44:53,436 --> 17:44:58,636
merge mai departe. Deci, vom face pentru i și x.c

22937
17:44:57,116 --> 17:45:01,680
coloane. Deci, vom trece prin

22938
17:44:58,636 --> 17:45:04,160
fiecare dintre coloane. Și de multe ori

22939
17:45:01,680 --> 17:45:06,400
este important că voi face liste cu

22940
17:45:04,160 --> 17:45:08,320
coloane și fac asta pentru că aș putea

22941
17:45:06,400 --> 17:45:10,480
eliminați anumite coloane sau ar putea exista

22942
17:45:08,320 --> 17:45:12,880
coloane pe care vreau să le procesez

22943
17:45:10,480 --> 17:45:16,080
diferit. Dar pentru asta putem merge

22944
17:45:12,880 --> 17:45:19,040
înainte și luați x din i și vrem să mergem

22945
17:45:16,080 --> 17:45:20,000
umple na și asta e o comandă panda. Dar

22946
17:45:19,040 --> 17:45:22,000
întrebarea este ce vom face

22947
17:45:20,000 --> 17:45:24,240
completați datele lipsă cu? Noi

22948
17:45:22,000 --> 17:45:25,916
cu siguranță nu vreau să pun doar o

22949
17:45:24,240 --> 17:45:27,680
număr care de fapt nu înseamnă

22950
17:45:25,916 --> 17:45:31,916
ceva. Și așa, unul dintre trucurile tu

22951
17:45:27,680 --> 17:45:33,200
se poate face cu asta este că putem lua x din i.

22952
17:45:31,916 --> 17:45:35,840
Și în plus, vrem să mergem

22953
17:45:33,200 --> 17:45:37,360
înainte și transformă-l într-un număr întreg

22954
17:45:35,840 --> 17:45:39,596
deoarece multe dintre acestea sunt numere întregi. Deci

22955
17:45:37,360 --> 17:45:41,040
vom merge înainte și vom păstra numere întregi. Şi

22956
17:45:39,596 --> 17:45:42,560
adaug aici paranteza. Și o mulțime de

22957
17:45:41,040 --> 17:45:44,160
editorii vor face asta. Ei vor crede asta

22958
17:45:42,560 --> 17:45:45,680
închizi o paranteză. Asigură-te

22959
17:45:44,160 --> 17:45:47,520
primești acel al doilea parantez acolo dacă

22960
17:45:45,680 --> 17:45:49,276
este o paranteză dublă. Asta e mereu

22961
17:45:47,520 --> 17:45:51,276
ceva ce se întâmplă în mod regulat. Deci

22962
17:45:49,276 --> 17:45:53,040
odată ce avem întregul nostru x din yi,

22963
17:45:51,276 --> 17:45:55,916
aceasta va completa orice lipsă

22964
17:45:53,040 --> 17:45:57,840
date cu media. Și am fost atât de ocupat

22965
17:45:55,916 --> 17:45:59,916
închizând un set de paranteze, am uitat

22966
17:45:57,840 --> 17:46:01,756
că media are și paranteze între

22967
17:45:59,916 --> 17:46:02,720
acolo pentru panda. Deci putem vedea

22968
17:46:01,756 --> 17:46:04,160
aici, vom completa toate

22969
17:46:02,720 --> 17:46:06,160
date cu valoarea medie pentru aceasta

22970
17:46:04,160 --> 17:46:08,720
coloana. Deci, dacă lipsesc date, este în

22971
17:46:06,160 --> 17:46:10,560
media datelor pe care le are.

22972
17:46:08,720 --> 17:46:12,956
Apoi, odată ce am făcut asta, vom merge

22973
17:46:10,560 --> 17:46:15,360
înainte și străbate-l din nou

22974
17:46:12,956 --> 17:46:17,436
și verificați și vedeți pentru a vă asigura

22975
17:46:15,360 --> 17:46:21,276
totul este completat corect. Şi

22976
17:46:17,436 --> 17:46:23,436
vom tipări și apoi vom lua x este nul.

22977
17:46:21,276 --> 17:46:25,200
Și aceasta returnează un set de valoare nulă

22978
17:46:23,436 --> 17:46:27,276
sau câte linii sunt nule. Şi

22979
17:46:25,200 --> 17:46:29,436
Vom rezuma doar asta pentru a vedea ce anume

22980
17:46:27,276 --> 17:46:31,520
arata ca. Și așa când rulez asta și

22981
17:46:29,436 --> 17:46:33,276
Deci, cu X, ceea ce vrem să facem este noi

22982
17:46:31,520 --> 17:46:35,040
doresc să elimine ultima coloană deoarece

22983
17:46:33,276 --> 17:46:36,560
care avea modelele. Asta suntem

22984
17:46:35,040 --> 17:46:38,560
încercând să vedem dacă le putem grupa

22985
17:46:36,560 --> 17:46:41,116
lucruri și descoperă modelele. Acolo

22986
17:46:38,560 --> 17:46:44,880
este atât de multe moduri diferite de a sorta X

22987
17:46:41,116 --> 17:46:47,520
afară. În primul rând, am putea lua X și noi

22988
17:46:44,880 --> 17:46:50,000
ar putea merge set de date, variabila noastră suntem

22989
17:46:47,520 --> 17:46:53,200
folosind și folosiți localizarea ochilor, una dintre

22990
17:46:50,000 --> 17:46:55,360
caracteristicile care sunt în panda și noi

22991
17:46:53,200 --> 17:46:58,880
putea să ia asta și apoi să ia toate

22992
17:46:55,360 --> 17:47:01,436
rândurile și toate, cu excepția ultimei coloane a

22993
17:46:58,880 --> 17:47:03,680
set de date. Și în acest moment, am putea face

22994
17:47:01,436 --> 17:47:05,840
valorile. Îl transformăm doar în valori.

22995
17:47:03,680 --> 17:47:08,160
Deci, aceasta este o modalitate de a face asta. Și dacă eu

22996
17:47:05,840 --> 17:47:11,360
Lasă-mă să pun asta aici și să printez

22997
17:47:08,160 --> 17:47:13,360
X, este un X majuscul pe care l-am ales. iar eu fug

22998
17:47:11,360 --> 17:47:16,000
asta, poți vedea că sunt doar valorile.

22999
17:47:13,360 --> 17:47:17,276
Am putea scoate și valorile și

23000
17:47:16,000 --> 17:47:19,040
nu va returna nimic

23001
17:47:17,276 --> 17:47:21,756
pentru că nu există valori legate de

23002
17:47:19,040 --> 17:47:24,240
ea. Ceea ce îmi place să fac cu asta este

23003
17:47:21,756 --> 17:47:26,880
în loc să facă locația care face

23004
17:47:24,240 --> 17:47:29,276
numerele întregi mai frecvente este să vină aici

23005
17:47:26,880 --> 17:47:34,880
și avem setul nostru de date și mergem

23006
17:47:29,276 --> 17:47:36,720
pentru a face setul de date punct sau coloane set de date.

23007
17:47:34,880 --> 17:47:40,400
Și amintiți-vă că listează toate coloanele.

23008
17:47:36,720 --> 17:47:45,116
Deci, dacă intru aici, lasă-mă să marchez

23009
17:47:40,400 --> 17:47:48,080
că ca roșu și imprim set de date.c

23010
17:47:45,116 --> 17:47:49,840
coloane.

23011
17:47:48,080 --> 17:47:52,080
Puteți vedea că am indexul meu aici. eu

23012
17:47:49,840 --> 17:47:54,000
am cilindrii mei MPG totul

23013
17:47:52,080 --> 17:47:56,320
inclusiv marca pe care nu o dorim.

23014
17:47:54,000 --> 17:47:59,116
Deci modalitatea de a scăpa de marcă ar fi

23015
17:47:56,320 --> 17:48:01,916
fie a face coloane de date de tot dar

23016
17:47:59,116 --> 17:48:03,276
ultimul minus unu. Deci acum dacă eu

23017
17:48:01,916 --> 17:48:05,756
imprimați asta, veți vedea marca

23018
17:48:03,276 --> 17:48:10,320
dispare. Și așa pot de fapt

23019
17:48:05,756 --> 17:48:12,000
luați coloanele setului de date minus unu și voi

23020
17:48:10,320 --> 17:48:14,240
pune-l aici pentru coloane

23021
17:48:12,000 --> 17:48:17,200
o să ne uităm.

23022
17:48:14,240 --> 17:48:20,560
Și să demarcăm asta.

23023
17:48:17,200 --> 17:48:23,840
Și demarcați acest lucru.

23024
17:48:20,560 --> 17:48:26,320
Și acum dacă fac un x.ad

23025
17:48:23,840 --> 17:48:28,160
Acum am un nou cadru de date. Și poți

23026
17:48:26,320 --> 17:48:29,840
vezi chiar aici avem toate diferitele

23027
17:48:28,160 --> 17:48:33,040
coloane cu excepția mărcii de la sfârșit

23028
17:48:29,840 --> 17:48:35,040
a anului. Și se dovedește când tu

23029
17:48:33,040 --> 17:48:36,956
începe să te joci cu setul de date, ești

23030
17:48:35,040 --> 17:48:40,080
va primi o eroare mai târziu și va fi

23031
17:48:36,956 --> 17:48:42,480
spune că nu poate converti șirul în float

23032
17:48:40,080 --> 17:48:43,436
valoare. Și asta pentru că pentru unii

23033
17:48:42,480 --> 17:48:44,880
motivează aceste lucruri în felul în care ele

23034
17:48:43,436 --> 17:48:47,040
înregistrate trebuie să fi fost înregistrate ca

23035
17:48:44,880 --> 17:48:50,956
corzi. Deci avem o caracteristică îngrijită

23036
17:48:47,040 --> 17:48:54,840
aici pe panda pentru a converti. Și este

23037
17:48:50,956 --> 17:48:54,840
pur și simplu convertiți obiecte.

23038
17:48:55,040 --> 17:49:01,276
Și pentru asta vom face converti

23039
17:48:57,840 --> 17:49:05,756
hopa converti liniu de subliniere

23040
17:49:01,276 --> 17:49:07,200
numeric numeric egal cu adevărat. Și da, eu

23041
17:49:05,756 --> 17:49:09,360
a trebuit să caute asta. Eu nu

23042
17:49:07,200 --> 17:49:10,720
să-l memoreze convertirea numerică în

23043
17:49:09,360 --> 17:49:13,116
Acolo. Dacă lucrez cu multe

23044
17:49:10,720 --> 17:49:14,636
aceste lucruri, mi le amintesc, dar um

23045
17:49:13,116 --> 17:49:16,636
depinde unde sunt, ce sunt

23046
17:49:14,636 --> 17:49:18,400
fac, de obicei trebuie să caut. Şi

23047
17:49:16,636 --> 17:49:19,680
conducem asta. Hopa, trebuie să fi ratat

23048
17:49:18,400 --> 17:49:21,916
ceva aici. Lasă-mă să verific

23049
17:49:19,680 --> 17:49:23,436
ortografia mea. Și când îmi verific de două ori

23050
17:49:21,916 --> 17:49:25,436
vărsând, vei vedea că am ratat primul

23051
17:49:23,436 --> 17:49:27,680
subliniere în obiectele convertite. Şi

23052
17:49:25,436 --> 17:49:31,200
când rulez asta, acum are totul

23053
17:49:27,680 --> 17:49:32,160
convertită într-o valoare numerică deoarece

23054
17:49:31,200 --> 17:49:35,360
asta vom lucra

23055
17:49:32,160 --> 17:49:38,000
cu valori numerice aici.

23056
17:49:35,360 --> 17:49:40,320
Și următoarea parte este că trebuie să plecăm

23057
17:49:38,000 --> 17:49:42,320
prin date și eliminați nul

23058
17:49:40,320 --> 17:49:44,000
valorile. Majoritatea oamenilor când fac

23059
17:49:42,320 --> 17:49:46,080
cantități mici, lucrezi cu mici

23060
17:49:44,000 --> 17:49:47,436
pool-urile de date descoperă ulterior că acestea

23061
17:49:46,080 --> 17:49:50,400
au o valoare nulă și trebuie să plece

23062
17:49:47,436 --> 17:49:52,400
înapoi și fă asta. Deci, știi, fii conștient

23063
17:49:50,400 --> 17:49:54,080
ori de câte ori formatăm aceste date,

23064
17:49:52,400 --> 17:49:56,480
lucrurile vor apărea și uneori

23065
17:49:54,080 --> 17:49:58,636
mergi înapoi să-l repari. Și asta este

23066
17:49:56,480 --> 17:50:01,436
bine. Aceasta este doar o parte din explorarea

23067
17:49:58,636 --> 17:50:03,040
date și înțelegerea a ceea ce aveți.

23068
17:50:01,436 --> 17:50:05,040
Și ar fi trebuit să fac asta mai devreme, dar

23069
17:50:03,040 --> 17:50:08,840
lasă-mă să merg înainte și să măresc dimensiunea

23070
17:50:05,040 --> 17:50:08,840
fereastra mea o crestătură.

23071
17:50:09,116 --> 17:50:16,160
Iată-ne. Mai ușor de văzut.

23072
17:50:12,240 --> 17:50:17,756
Deci, vom face 4 I în lucrul cu X dot

23073
17:50:16,160 --> 17:50:21,436
coloane. va pagina prin toate

23074
17:50:17,756 --> 17:50:22,636
coloane. Și vrem să luăm X din I și

23075
17:50:21,436 --> 17:50:25,680
vom schimba asta. Mergem

23076
17:50:22,636 --> 17:50:29,040
să-l modifice. Și așa, cu asta, vrem

23077
17:50:25,680 --> 17:50:32,720
pentru a merge înainte și a completa X din I. Pandas

23078
17:50:29,040 --> 17:50:36,796
are completarea a. Și asta doar umple

23079
17:50:32,720 --> 17:50:38,560
în orice date lipsă inexistente. Şi

23080
17:50:36,796 --> 17:50:41,916
o să-mi punem paranteze. Și există o

23081
17:50:38,560 --> 17:50:43,680
multe moduri diferite de a completa aceste date.

23082
17:50:41,916 --> 17:50:45,200
Dacă aveți un set de date foarte mare,

23083
17:50:43,680 --> 17:50:46,956
unii oameni pur și simplu anulează acele date

23084
17:50:45,200 --> 17:50:49,916
pentru că dacă și apoi uită-te la asta mai târziu

23085
17:50:46,956 --> 17:50:53,116
o explorare separată a datelor. Unul dintre

23086
17:50:49,916 --> 17:50:56,720
trucurile pe care le putem face este că ne putem lua

23087
17:50:53,116 --> 17:50:59,436
coloană și putem găsi mijloacele

23088
17:50:56,720 --> 17:51:01,680
iar mijlocul este acolo sau citat

23089
17:50:59,436 --> 17:51:03,680
semne. Deci luăm coloanele, suntem

23090
17:51:01,680 --> 17:51:05,840
urmând să-l completeze pe cel inexistent

23091
17:51:03,680 --> 17:51:08,480
cu mijloacele. Problema este că

23092
17:51:05,840 --> 17:51:11,360
returnează o virgulă zecimală. Deci unii dintre

23093
17:51:08,480 --> 17:51:12,720
acestea nu sunt zecimale. Cu siguranță, tu

23094
17:51:11,360 --> 17:51:14,480
poate fi nevoie să fie puțin atent

23095
17:51:12,720 --> 17:51:16,240
asta, dar pentru acest exemplu, suntem doar

23096
17:51:14,480 --> 17:51:18,320
urmând să-l completeze cu numărul întreg

23097
17:51:16,240 --> 17:51:20,720
versiune a acesteia. Îl menține la egalitate

23098
17:51:18,320 --> 17:51:23,276
celelalte date care nu sunt zecimale

23099
17:51:20,720 --> 17:51:24,880
punct.

23100
17:51:23,276 --> 17:51:27,360
Și atunci ceea ce vrem să facem și noi este noi

23101
17:51:24,880 --> 17:51:29,276
vrei să verifici. De multe ori tu

23102
17:51:27,360 --> 17:51:30,636
fă mai întâi prima parte pentru a dubla

23103
17:51:29,276 --> 17:51:31,916
verificați, apoi faceți umplerea și apoi

23104
17:51:30,636 --> 17:51:33,520
o faci din nou doar ca să te asiguri

23105
17:51:31,916 --> 17:51:37,916
a făcut-o corect. Deci, vom merge

23106
17:51:33,520 --> 17:51:40,000
prin și testați pentru datele lipsă. Şi

23107
17:51:37,916 --> 17:51:44,480
unul dintre modurile în care poți face asta este

23108
17:51:40,000 --> 17:51:46,240
pur și simplu intră aici și ia X-ul nostru de I

23109
17:51:44,480 --> 17:51:48,880
coloana. Deci va trece prin

23110
17:51:46,240 --> 17:51:50,636
X din coloana I. Se spune că este nulă. Deci este

23111
17:51:48,880 --> 17:51:52,320
va întoarce oriunde unde există a

23112
17:51:50,636 --> 17:51:55,276
valoare nulă. De fapt, trece prin toate

23113
17:51:52,320 --> 17:51:57,200
rândurile fiecărei coloane sunt nule. Şi

23114
17:51:55,276 --> 17:51:59,520
atunci vrem să mergem înainte și să însumăm asta.

23115
17:51:57,200 --> 17:52:01,520
Deci luăm asta, adăugăm valoarea sumei.

23116
17:51:59,520 --> 17:52:04,480
Și aceștia sunt toți panda. Deci este nul este

23117
17:52:01,520 --> 17:52:05,840
o comandă panda și așa este suma. Și dacă noi

23118
17:52:04,480 --> 17:52:08,840
trecem prin asta și mergem înainte și alergăm

23119
17:52:05,840 --> 17:52:08,840
ea

23120
17:52:09,040 --> 17:52:12,560
și mergem înainte și luăm și rulăm asta,

23121
17:52:10,636 --> 17:52:15,040
vei vedea că toate coloanele au

23122
17:52:12,560 --> 17:52:16,720
zero valori nule. Deci am testat acum

23123
17:52:15,040 --> 17:52:18,720
și verificat de două ori și datele noastre sunt drăguțe

23124
17:52:16,720 --> 17:52:20,956
si curat. Nu avem valori nule.

23125
17:52:18,720 --> 17:52:23,360
Totul este acum o valoare numerică. Noi

23126
17:52:20,956 --> 17:52:26,400
l-am transformat în numeric și l-am eliminat

23127
17:52:23,360 --> 17:52:28,560
ultima coloană din datele noastre. Și la asta

23128
17:52:26,400 --> 17:52:30,400
punct, de fapt vom începe

23129
17:52:28,560 --> 17:52:32,320
folosind metoda cotului pentru a găsi

23130
17:52:30,400 --> 17:52:34,880
numărul optim de clustere. Deci, suntem

23131
17:52:32,320 --> 17:52:37,680
acum intrând de fapt în sklearn

23132
17:52:34,880 --> 17:52:40,240
parte. Uh, K înseamnă grupare

23133
17:52:37,680 --> 17:52:41,680
Aici. Cred că vom merge mai departe și vom mări

23134
17:52:40,240 --> 17:52:44,880
mai sus cu o crestătură ca să vezi ce

23135
17:52:41,680 --> 17:52:48,636
Tastesc aici.

23136
17:52:44,880 --> 17:52:50,720
Și apoi de la sklearn mergând la sau

23137
17:52:48,636 --> 17:52:57,040
sklearn

23138
17:52:50,720 --> 17:52:59,276
cluster, vom importa K înseamnă.

23139
17:52:57,040 --> 17:53:01,840
Uit mereu să scriu cu majuscule K și

23140
17:52:59,276 --> 17:53:05,360
M când fac asta. Deci este K majusculă,

23141
17:53:01,840 --> 17:53:09,436
majuscul M K înseamnă.

23142
17:53:05,360 --> 17:53:11,840
Și vom merge și vom crea o matrice um WCSS

23143
17:53:09,436 --> 17:53:14,080
este egal, îl vom face o matrice goală. Dacă

23144
17:53:11,840 --> 17:53:16,000
iti amintesti de la metoda cotului din

23145
17:53:14,080 --> 17:53:18,720
toboganul nostru

23146
17:53:16,000 --> 17:53:21,276
în cadrul sumelor pătratelor, WSS este

23147
17:53:18,720 --> 17:53:23,680
definită ca suma distanței pătrate

23148
17:53:21,276 --> 17:53:25,756
între fiecare membru al clusterului şi

23149
17:53:23,680 --> 17:53:27,596
este centrat. Deci ne uităm la asta

23150
17:53:25,756 --> 17:53:29,596
modificarea diferențelor în măsura în care a

23151
17:53:27,596 --> 17:53:33,840
distanta la patrat. Și o să alergăm

23152
17:53:29,596 --> 17:53:36,880
aceasta peste un număr de K valori medii.

23153
17:53:33,840 --> 17:53:39,200
De fapt, să mergem pentru I în rază. Vom face

23154
17:53:36,880 --> 17:53:41,596
face 11 dintre ele.

23155
17:53:39,200 --> 17:53:42,880
Intervalul zero de 11.

23156
17:53:41,596 --> 17:53:45,276
Și primul lucru pe care îl vom face este

23157
17:53:42,880 --> 17:53:48,756
vom crea ceea ce vom face

23158
17:53:45,276 --> 17:53:48,756
face totul cu litere mici.

23159
17:53:51,200 --> 17:53:58,560
Și așa vom crea acest obiect

23160
17:53:54,000 --> 17:54:00,796
din K înseamnă că tocmai am importat.

23161
17:53:58,560 --> 17:54:05,116
Și variabila pe care vrem să o punem

23162
17:54:00,796 --> 17:54:07,596
în aceasta este în clustere. Vom merge

23163
17:54:05,116 --> 17:54:08,796
set care este egal cu I. Asta e cel mai mult

23164
17:54:07,596 --> 17:54:11,680
una importantă pentru că ne uităm la

23165
17:54:08,796 --> 17:54:14,160
cum crește numărul de clustere

23166
17:54:11,680 --> 17:54:17,916
ne schimbă răspunsul. Sunt o mulțime de

23167
17:54:14,160 --> 17:54:19,756
setări la mijloacele K. Băieții noștri din

23168
17:54:17,916 --> 17:54:21,756
spatele a făcut o treabă grozavă

23169
17:54:19,756 --> 17:54:23,916
jucându-se cu unii dintre ei. Cel mai mult

23170
17:54:21,756 --> 17:54:26,636
cele comune pe care le vezi în multe

23171
17:54:23,916 --> 17:54:30,240
chestia este modul în care înțelegi K înseamnă. Deci

23172
17:54:26,636 --> 17:54:33,200
avem K înseamnă plus plus. Acesta este doar

23173
17:54:30,240 --> 17:54:35,116
un instrument pentru a lăsa modelul în sine să fie inteligent

23174
17:54:33,200 --> 17:54:37,360
cum o alege se centrid pentru început

23175
17:54:35,116 --> 17:54:39,436
centroidele sale inițiale. Noi vrem doar

23176
17:54:37,360 --> 17:54:42,400
repetați de cel mult 300 de ori. Avem

23177
17:54:39,436 --> 17:54:44,720
o iterație maximă pe care am pus-o acolo. Avem

23178
17:54:42,400 --> 17:54:46,796
infinitul este egal cu starea aleatorie

23179
17:54:44,720 --> 17:54:48,160
zero. Chiar nu trebuie să vă faceți griji

23180
17:54:46,796 --> 17:54:50,000
multe despre acestea când ești primul

23181
17:54:48,160 --> 17:54:51,840
învăţând asta. Pe măsură ce începi să sapi

23182
17:54:50,000 --> 17:54:55,116
mai profund, începi să descoperi că acestea sunt

23183
17:54:51,840 --> 17:54:57,200
comenzi rapide care vor accelera procesul

23184
17:54:55,116 --> 17:54:59,276
în ceea ce privește o configurație. Dar cel mare că

23185
17:54:57,200 --> 17:55:02,000
cu care lucrăm sunt inclușii

23186
17:54:59,276 --> 17:55:04,956
este egal cu I. Deci, vom face literalmente

23187
17:55:02,000 --> 17:55:08,080
antrenează K înseamnă de 11 ori. Mergem

23188
17:55:04,956 --> 17:55:10,320
pentru a face acest proces de 11 ori. Și dacă

23189
17:55:08,080 --> 17:55:12,160
lucrezi cu date mari, știi,

23190
17:55:10,320 --> 17:55:13,916
primul lucru pe care îl faci este să conduci a

23191
17:55:12,160 --> 17:55:15,756
eșantion mic de date pentru a putea testa

23192
17:55:13,916 --> 17:55:17,200
toate lucrurile tale de pe el. Și poți

23193
17:55:15,756 --> 17:55:19,436
vezi deja problema că dacă sunt

23194
17:55:17,200 --> 17:55:22,320
mergând să itereze printr-un terabyte de

23195
17:55:19,436 --> 17:55:23,756
date de 11 ori și apoi K înseamnă

23196
17:55:22,320 --> 17:55:25,840
însuși repetă prin date

23197
17:55:23,756 --> 17:55:27,756
de mai multe ori. Asta e o naiba

23198
17:55:25,840 --> 17:55:29,520
proces. Deci trebuie să fii puțin

23199
17:55:27,756 --> 17:55:32,320
atent cu asta. De multe ori însă

23200
17:55:29,520 --> 17:55:34,080
vă puteți găsi cotul folosind cotul

23201
17:55:32,320 --> 17:55:35,360
metoda. Găsiți numărul optim pe a

23202
17:55:34,080 --> 17:55:38,160
eșantion de date, mai ales dacă sunteți

23203
17:55:35,360 --> 17:55:39,436
lucrul cu surse de date mai mari. Deci noi

23204
17:55:38,160 --> 17:55:41,116
vreau să mergem înainte și să luăm mijloacele noastre K

23205
17:55:39,436 --> 17:55:43,200
și o să ne potrivim. Dacă

23206
17:55:41,116 --> 17:55:45,116
te uiți la oricare dintre sklearn,

23207
17:55:43,200 --> 17:55:46,400
foarte frecvent că vă potriviți modelului dvs. Şi

23208
17:55:45,116 --> 17:55:49,840
dacă vă amintiți corect, variabila noastră

23209
17:55:46,400 --> 17:55:53,116
noi folosim este capitalul X. Și o dată

23210
17:55:49,840 --> 17:55:54,720
ne potrivim acestei valori, ne întoarcem la um

23211
17:55:53,116 --> 17:55:57,756
matrice pe care am făcut-o. Și vrem să mergem și

23212
17:55:54,720 --> 17:55:59,436
doar adăugați acea valoare la sfârșit.

23213
17:55:57,756 --> 17:56:01,276
Și nu ne potrivim

23214
17:55:59,436 --> 17:56:03,116
fixând acolo. Este atunci când generează

23215
17:56:01,276 --> 17:56:05,596
aceasta, generează valoarea pe care o ești

23216
17:56:03,116 --> 17:56:07,840
caută este inerția. Deci k

23217
17:56:05,596 --> 17:56:10,636
înseamnă.inerția va trage acel specific

23218
17:56:07,840 --> 17:56:13,116
pune în valoare de care avem nevoie.

23219
17:56:10,636 --> 17:56:16,160
Și să obținem o imagine vizuală despre asta. Vom face

23220
17:56:13,116 --> 17:56:17,840
complotul nostru PLT. Și ce complotăm

23221
17:56:16,160 --> 17:56:21,596
aici

23222
17:56:17,840 --> 17:56:23,520
este mai întâi axa x, care este intervalul 0

23223
17:56:21,596 --> 17:56:30,520
11. Deci asta va genera un pic frumos

23224
17:56:23,520 --> 17:56:30,520
complot acolo. Și wcss pentru axa noastră y.

23225
17:56:30,720 --> 17:56:34,636
Întotdeauna e frumos să ne dăm un complot

23226
17:56:32,880 --> 17:56:36,240
titlu.

23227
17:56:34,636 --> 17:56:38,240
Și să vedem, îi dăm doar

23228
17:56:36,240 --> 17:56:40,080
metoda cotului pentru titlu. Și haideți

23229
17:56:38,240 --> 17:56:43,916
ia niste etichete. Deci hai să mergem înainte și

23230
17:56:40,080 --> 17:56:45,596
faceți eticheta PLT X.

23231
17:56:43,916 --> 17:56:50,480
Și ce vom face, vom face un număr de

23232
17:56:45,596 --> 17:56:52,880
clustere pentru asta. Și eticheta PLT Y. Şi

23233
17:56:50,480 --> 17:56:54,796
pentru asta, putem face oops, iată.

23234
17:56:52,880 --> 17:56:56,480
WCSS pentru că asta facem

23235
17:56:54,796 --> 17:56:58,796
complotul de acolo. Și, în sfârșit, vrem

23236
17:56:56,480 --> 17:57:02,560
pentru a continua și a afișa graficul nostru, care

23237
17:56:58,796 --> 17:57:04,320
este pur și simplu plt. Hopa!

23238
17:57:02,560 --> 17:57:07,276
Spectacol. Iată-ne. Și pentru că avem

23239
17:57:04,320 --> 17:57:09,040
a setat la inline, va apărea inline.

23240
17:57:07,276 --> 17:57:12,040
Sper că nu am făcut o eroare de tip

23241
17:57:09,040 --> 17:57:12,040
acolo.

23242
17:57:13,276 --> 17:57:16,720
Și puteți vedea că primim un foarte frumos

23243
17:57:14,796 --> 17:57:19,840
grafic. Se vede un cot foarte frumos

23244
17:57:16,720 --> 17:57:21,680
Joacă acolo la două și din nou corect

23245
17:57:19,840 --> 17:57:24,956
pe la trei și patru. Și apoi după

23246
17:57:21,680 --> 17:57:26,796
că nu sunt foarte multe. Acum ca a

23247
17:57:24,956 --> 17:57:29,680
cercetător de date, dacă m-am uitat la

23248
17:57:26,796 --> 17:57:31,360
asta, aș face ori trei sau patru.

23249
17:57:29,680 --> 17:57:33,756
Și chiar le-aș încerca pe amândouă să văd

23250
17:57:31,360 --> 17:57:35,040
cum arată ieșirea u. Și au făcut-o

23251
17:57:33,756 --> 17:57:36,720
am încercat deja asta în spate. Aşa,

23252
17:57:35,040 --> 17:57:38,240
Vom folosi doar trei ca o configurație

23253
17:57:36,720 --> 17:57:39,756
pe aici. Și hai să mergem înainte și să vedem ce

23254
17:57:38,240 --> 17:57:42,240
care arată ca atunci când folosim de fapt

23255
17:57:39,756 --> 17:57:45,240
asta pentru a arăta diferitele tipuri de

23256
17:57:42,240 --> 17:57:45,240
mașini.

23257
17:57:45,276 --> 17:57:50,320
Și așa, hai să mergem mai departe și să aplicăm K

23258
17:57:47,360 --> 17:57:52,000
înseamnă setul de date auto. Şi

23259
17:57:50,320 --> 17:57:54,320
practic, vom copia codul

23260
17:57:52,000 --> 17:57:56,636
pe care îl facem în buclă sus, unde K

23261
17:57:54,320 --> 17:57:57,840
înseamnă egal cu K înseamnă numărul de clustere.

23262
17:57:56,636 --> 17:58:00,480
Și doar o să setăm numărul

23263
17:57:57,840 --> 17:58:01,756
de clustere la trei pentru că asta este ceea ce

23264
17:58:00,480 --> 17:58:04,080
o să căutăm. Și ai putea

23265
17:58:01,756 --> 17:58:05,200
faceți trei și patru pe aceasta și graficați-le

23266
17:58:04,080 --> 17:58:06,560
doar pentru a vedea cum apar

23267
17:58:05,200 --> 17:58:08,240
diferit. Ar fi cam curios să

23268
17:58:06,560 --> 17:58:10,000
uite la asta. Dar pentru asta, suntem doar

23269
17:58:08,240 --> 17:58:13,680
o să-l setez la trei. Mergi înainte și

23270
17:58:10,000 --> 17:58:16,240
creăm propria noastră variabilă Y k înseamnă pt

23271
17:58:13,680 --> 17:58:19,276
răspunsurile noastre. Și o vom stabili

23272
17:58:16,240 --> 17:58:22,160
egal cu Whoops, dublul meu egal acolo

23273
17:58:19,276 --> 17:58:25,040
la K înseamnă. Dar nu vom face o

23274
17:58:22,160 --> 17:58:27,116
potrivi. Vom face o previziune potrivită

23275
17:58:25,040 --> 17:58:29,596
configurația pe care doriți să o utilizați. Și când

23276
17:58:27,116 --> 17:58:31,200
folosești modele neinstruite, vei

23277
17:58:29,596 --> 17:58:32,956
văd un pic diferit pentru că

23278
17:58:31,200 --> 17:58:34,956
de obicei crezi de cuviință și apoi vezi

23279
17:58:32,956 --> 17:58:38,080
doar prezicerea. Dar vrem pe amândoi

23280
17:58:34,956 --> 17:58:40,160
potriviți și preziceți k înseamnă pe aceasta. Şi

23281
17:58:38,080 --> 17:58:42,080
asta se potrivește sublinierea prezice. Și apoi

23282
17:58:40,160 --> 17:58:43,680
capitalul nostru x este datele pe care le lucrăm

23283
17:58:42,080 --> 17:58:45,756
cu.

23284
17:58:43,680 --> 17:58:47,436
Și înainte de a trasa aceste date, suntem

23285
17:58:45,756 --> 17:58:49,040
o să fac un mic truc panda. Suntem

23286
17:58:47,436 --> 17:58:51,916
vom lua valoarea noastră x și suntem

23287
17:58:49,040 --> 17:58:54,240
vom seta x ca matrice. Deci suntem

23288
17:58:51,916 --> 17:58:56,000
transformând acest lucru într-un rând frumos și

23289
17:58:54,240 --> 17:58:57,756
un fel de configurare a coloanelor. Dar noi vrem

23290
17:58:56,000 --> 17:58:59,200
vom avea coloane egal cu niciunul.

23291
17:58:57,756 --> 17:59:02,320
Deci va fi doar o matrice a

23292
17:58:59,200 --> 17:59:04,400
date aici. Și hai să mergem înainte și să alergăm

23293
17:59:02,320 --> 17:59:05,680
că.

23294
17:59:04,400 --> 17:59:06,880
Un mic avertisment. Vei vedea asta

23295
17:59:05,680 --> 17:59:08,796
apar avertismente pentru că lucrurile sunt

23296
17:59:06,880 --> 17:59:11,276
fiind mereu actualizat. Deci există ca

23297
17:59:08,796 --> 17:59:13,756
modificări minore în versiuni și viitoare

23298
17:59:11,276 --> 17:59:16,080
versiuni. Să setăm o matrice. Acum că

23299
17:59:13,756 --> 17:59:18,400
este mai obișnuit să-i setați valori

23300
17:59:16,080 --> 17:59:20,480
în loc să facă ca matrice, ci masă

23301
17:59:18,400 --> 17:59:22,080
matricea funcționează foarte bine acum și

23302
17:59:20,480 --> 17:59:23,916
veți dori să actualizați asta mai târziu. Dar

23303
17:59:22,080 --> 17:59:27,040
hai să mergem înainte și să ne scufundăm și să complotăm asta

23304
17:59:23,916 --> 17:59:29,276
și vezi cum arată. Și înainte

23305
17:59:27,040 --> 17:59:30,956
ne aprofundăm în trasarea acestor date, eu

23306
17:59:29,276 --> 17:59:33,360
întotdeauna îmi place să arunc o privire și să văd ce

23307
17:59:30,956 --> 17:59:35,680
complotez. Deci haideți să aruncăm o privire la

23308
17:59:33,360 --> 17:59:38,160
de ce K înseamnă. Am de gând să printez

23309
17:59:35,680 --> 17:59:41,596
că aici jos. Și vedem că avem

23310
17:59:38,160 --> 17:59:45,040
o serie de răspunsuri. Avem 2 1 0 2 1

23311
17:59:41,596 --> 17:59:47,840
2. Deci este gruparea acestor diferite

23312
17:59:45,040 --> 17:59:49,756
rânduri de date bazate pe cele trei

23313
17:59:47,840 --> 17:59:51,436
diferite spații în care crede că va ajunge

23314
17:59:49,756 --> 17:59:53,680
fii.

23315
17:59:51,436 --> 17:59:55,916
Și apoi să mergem mai departe și să tipărim X și

23316
17:59:53,680 --> 17:59:59,276
vezi ce avem pentru X. Și vom vedea

23317
17:59:55,916 --> 18:00:01,436
că X este o matrice. Este o matrice. Deci noi

23318
17:59:59,276 --> 18:00:03,116
au valorile noastre diferite în matrice.

23319
18:00:01,436 --> 18:00:05,520
Și ceea ce vom face, este foarte

23320
18:00:03,116 --> 18:00:07,200
greu de trasat toate valorile diferite

23321
18:00:05,520 --> 18:00:10,240
matricea. Deci doar vom fi

23322
18:00:07,200 --> 18:00:13,680
privind primele două sau poziții

23323
18:00:10,240 --> 18:00:16,160
zero și unu. Și dacă ai face o

23324
18:00:13,680 --> 18:00:18,560
prezentare completă în fața consiliului

23325
18:00:16,160 --> 18:00:20,400
întâlnire, ați putea de fapt să faceți puțin

23326
18:00:18,560 --> 18:00:22,320
diferit și și sapă puțin mai adânc

23327
18:00:20,400 --> 18:00:23,680
în diferitele aspecte deoarece aceasta

23328
18:00:22,320 --> 18:00:25,520
sunt toate coloanele diferite pe care le-am uitat

23329
18:00:23,680 --> 18:00:28,080
la. Dar ne vom uita doar la coloanele unu

23330
18:00:25,520 --> 18:00:29,520
și două pentru ca asta să fie ușor. Deci

23331
18:00:28,080 --> 18:00:32,880
hai să mergem mai departe și să ștergem aceste date

23332
18:00:29,520 --> 18:00:34,400
de aici și să aducem în discuție complotul nostru. Şi

23333
18:00:32,880 --> 18:00:37,200
vom face aici un grafic de dispersie.

23334
18:00:34,400 --> 18:00:38,956
Deci pl împrăștiați.

23335
18:00:37,200 --> 18:00:40,796
Şi

23336
18:00:38,956 --> 18:00:42,956
asta pare un pic complicat. Deci

23337
18:00:40,796 --> 18:00:46,000
hai sa explicam ce se intampla cu asta.

23338
18:00:42,956 --> 18:00:48,796
Vom lua valorile x

23339
18:00:46,000 --> 18:00:52,560
și ne interesează doar y din k

23340
18:00:48,796 --> 18:00:54,400
înseamnă că este egal cu 0, primul cluster. Bine?

23341
18:00:52,560 --> 18:00:56,400
Și apoi vom lua valoarea zero

23342
18:00:54,400 --> 18:00:58,400
pentru axa x. Și apoi vom merge

23343
18:00:56,400 --> 18:01:01,116
faceți același lucru aici. Suntem doar

23344
18:00:58,400 --> 18:01:02,720
interesat de k înseamnă egal cu 0, dar

23345
18:01:01,116 --> 18:01:04,240
vom lua a doua coloană.

23346
18:01:02,720 --> 18:01:07,436
Deci ne uităm doar la primele două

23347
18:01:04,240 --> 18:01:09,276
coloane din răspunsul nostru sau din date.

23348
18:01:07,436 --> 18:01:10,320
Și apoi au jucat băieții din spate

23349
18:01:09,276 --> 18:01:12,400
cu asta un pic pentru a reuși

23350
18:01:10,320 --> 18:01:14,320
drăguță.

23351
18:01:12,400 --> 18:01:16,796
Și au descoperit că arată bine

23352
18:01:14,320 --> 18:01:19,520
cu o dimensiune egală cu 100. Aceasta este dimensiunea

23353
18:01:16,796 --> 18:01:22,000
a punctelor. Vom folosi roșu pentru

23354
18:01:19,520 --> 18:01:24,796
acesta. Și când se uitau la

23355
18:01:22,000 --> 18:01:26,240
datele și ce a ieșit, așa a fost

23356
18:01:24,796 --> 18:01:27,200
cu siguranță Toyota pe asta. Suntem

23357
18:01:26,240 --> 18:01:29,276
doar o să merg înainte și să-l etichetez

23358
18:01:27,200 --> 18:01:32,400
Toyota. Din nou, asta ești ceva tu

23359
18:01:29,276 --> 18:01:34,080
chiar trebuie să explorez aici cât de departe

23360
18:01:32,400 --> 18:01:35,916
jucându-vă cu acele numere și vedeți ce

23361
18:01:34,080 --> 18:01:37,596
arata bine. Vom merge înainte și vom apăsa enter

23362
18:01:35,916 --> 18:01:40,320
acolo. Și am de gând să lipesc

23363
18:01:37,596 --> 18:01:43,436
următoarele două rânduri, care este următoarea

23364
18:01:40,320 --> 18:01:46,000
doua masini. Și aceasta este Nissa noastră și

23365
18:01:43,436 --> 18:01:48,560
Honda. Și vei vedea cu împrăștierea noastră

23366
18:01:46,000 --> 18:01:51,520
complot, acum ne uităm unde Y_K

23367
18:01:48,560 --> 18:01:53,840
înseamnă egal cu 1. Și vrem zero

23368
18:01:51,520 --> 18:01:55,276
coloană și YK înseamnă egal cu 2. Din nou,

23369
18:01:53,840 --> 18:01:57,756
ne uităm doar la primele două

23370
18:01:55,276 --> 18:02:00,000
coloane, zero și unu. Și fiecare dintre acestea

23371
18:01:57,756 --> 18:02:02,000
rânduri corespunde apoi lui Nissan și

23372
18:02:00,000 --> 18:02:03,276
Honda.

23373
18:02:02,000 --> 18:02:05,756
Și voi merge înainte și voi apăsa enter pe

23374
18:02:03,276 --> 18:02:08,320
acolo. Și în sfârșit, să aruncăm o privire

23375
18:02:05,756 --> 18:02:11,276
și puneți centridele acolo. Din nou,

23376
18:02:08,320 --> 18:02:13,436
vom face un grafic de dispersie.

23377
18:02:11,276 --> 18:02:16,160
Și pe centride, puteți doar să trageți

23378
18:02:13,436 --> 18:02:19,840
că din K înseamnă, uh modelul noi

23379
18:02:16,160 --> 18:02:22,880
au creat centre de cluster. Și mergem

23380
18:02:19,840 --> 18:02:25,436
sa fac doar um

23381
18:02:22,880 --> 18:02:26,796
toate la primul număr și toate

23382
18:02:25,436 --> 18:02:28,636
dintre ei în al doilea număr, adică

23383
18:02:26,796 --> 18:02:30,956
01 pentru că începi întotdeauna cu zero

23384
18:02:28,636 --> 18:02:32,796
si unul.

23385
18:02:30,956 --> 18:02:34,320
Și apoi se jucau cu mărimea

23386
18:02:32,796 --> 18:02:36,160
și totul ca să arate bine.

23387
18:02:34,320 --> 18:02:38,240
Vom face o dimensiune de 300. O să facem

23388
18:02:36,160 --> 18:02:39,680
faceți culoarea galbenă. Și vom eticheta

23389
18:02:38,240 --> 18:02:42,320
ei. Întotdeauna e bine să ai ceva bun

23390
18:02:39,680 --> 18:02:45,436
etichete. Centroidele.

23391
18:02:42,320 --> 18:02:47,200
Și apoi vrem să facem un titlu. PLT

23392
18:02:45,436 --> 18:02:50,320
titlu.

23393
18:02:47,200 --> 18:02:51,360
Și apare acolo. Titlul PLT. Deci tu

23394
18:02:50,320 --> 18:02:52,880
Întotdeauna faceți dorința să vă faceți graficele

23395
18:02:51,360 --> 18:02:56,720
arata frumos. Și îi vom numi clustere

23396
18:02:52,880 --> 18:03:01,756
de marca auto. Și una dintre caracteristicile

23397
18:02:56,720 --> 18:03:03,916
biblioteca de complot este puteți adăuga un

23398
18:03:01,756 --> 18:03:05,116
legenda. O va aduce automat

23399
18:03:03,916 --> 18:03:06,560
din moment ce am etichetat deja

23400
18:03:05,116 --> 18:03:09,436
diferite aspecte ale legendei cu

23401
18:03:06,560 --> 18:03:10,880
Toyota, Nissan și Honda.

23402
18:03:09,436 --> 18:03:13,520
Și, în sfârșit, vrem să mergem înainte și

23403
18:03:10,880 --> 18:03:15,200
arată astfel încât să o putem vedea cu adevărat. Şi

23404
18:03:13,520 --> 18:03:16,796
ține minte, este în linie. Uh, dacă ești

23405
18:03:15,200 --> 18:03:19,116
folosind un editor diferit care nu este

23406
18:03:16,796 --> 18:03:21,276
Jupyter notebook, veți primi o fereastră pop-up

23407
18:03:19,116 --> 18:03:22,720
aceasta. Și ar trebui să ai un set frumos de

23408
18:03:21,276 --> 18:03:25,116
clustere aici. Deci ne putem uita la asta

23409
18:03:22,720 --> 18:03:29,040
și avem un grup de Honda în

23410
18:03:25,116 --> 18:03:30,240
verde, Toyota în roșu, Nissan în violet.

23411
18:03:29,040 --> 18:03:32,956
Și puteți vedea unde au pus

23412
18:03:30,240 --> 18:03:34,636
centroizi pentru a le separa.

23413
18:03:32,956 --> 18:03:37,520
Acum, când ne uităm la asta, putem

23414
18:03:34,636 --> 18:03:39,360
de asemenea, trasează o mulțime de alte date diferite

23415
18:03:37,520 --> 18:03:40,720
aici până aici pentru că ne-am uitat doar la

23416
18:03:39,360 --> 18:03:44,240
primele două coloane. Acesta este doar

23417
18:03:40,720 --> 18:03:46,080
coloana unu și doi sau 01 așa cum etichetați

23418
18:03:44,240 --> 18:03:47,596
le în scripting computer. Dar poți

23419
18:03:46,080 --> 18:03:49,200
vezi aici avem un grup frumos de mașini

23420
18:03:47,596 --> 18:03:51,840
realizarea. și am reușit să scoatem

23421
18:03:49,200 --> 18:03:54,880
date și puteți vedea cum doar acestea două

23422
18:03:51,840 --> 18:03:57,436
coloanele formează grupuri foarte distincte de

23423
18:03:54,880 --> 18:03:58,880
date. Deci, dacă ați explora date noi

23424
18:03:57,436 --> 18:04:01,276
ai putea să arunci o privire și să spui bine ce

23425
18:03:58,880 --> 18:04:03,116
face ca acestea să fie diferite aproape să intre

23426
18:04:01,276 --> 18:04:04,880
invers, începi să te uiți la date

23427
18:04:03,116 --> 18:04:07,916
și smulgând coloanele pentru a găsi

23428
18:04:04,880 --> 18:04:09,916
de ce este înființat primul grup

23429
18:04:07,916 --> 18:04:11,276
felul în care este. Poate faci împrumuturi și

23430
18:04:09,916 --> 18:04:13,200
vrei să mergi, ei bine, de ce este acest grup

23431
18:04:11,276 --> 18:04:14,560
nu își încalcă împrumuturile și de ce este

23432
18:04:13,200 --> 18:04:16,796
ultimul grup ne-a respectat

23433
18:04:14,560 --> 18:04:19,520
împrumuturi? Și de ce grupul de mijloc este de 50%

23434
18:04:16,796 --> 18:04:21,520
să nu plătească împrumuturile bancare? Iar tu

23435
18:04:19,520 --> 18:04:26,080
începe să găsești modalități de a manipula

23436
18:04:21,520 --> 18:04:28,796
date și extrageți răspunsurile dorite.

23437
18:04:26,080 --> 18:04:31,596
Acum că ați văzut cum să folosiți K

23438
18:04:28,796 --> 18:04:34,480
înseamnă grupare, să trecem la

23439
18:04:31,596 --> 18:04:36,636
următorul subiect. Acum să ne uităm

23440
18:04:34,480 --> 18:04:38,880
regresie logistică. Logistica

23441
18:04:36,636 --> 18:04:41,276
algoritmul de regresie este cel mai simplu

23442
18:04:38,880 --> 18:04:43,916
algoritm de clasificare utilizat pentru binar

23443
18:04:41,276 --> 18:04:45,520
sau probleme de multiclasificare. Iar noi

23444
18:04:43,916 --> 18:04:47,756
pot vedea că avem fetița noastră de la

23445
18:04:45,520 --> 18:04:49,276
Canada care iubește cărțile de groază s-a întors.

23446
18:04:47,756 --> 18:04:51,116
E chiar înfricoșător când tu

23447
18:04:49,276 --> 18:04:52,956
gândește-te la asta cu ochii aceia mari. În

23448
18:04:51,116 --> 18:04:55,116
tutorialul anterior despre care am aflat

23449
18:04:52,956 --> 18:04:58,320
regresie liniară, dependentă și

23450
18:04:55,116 --> 18:05:03,040
variabile independente. Deci, pentru a peria,

23451
18:04:58,320 --> 18:05:06,400
y= mx c. Funcție algebrică foarte simplă

23452
18:05:03,040 --> 18:05:08,240
de uh y și x. Variabila dependentă este

23453
18:05:06,400 --> 18:05:12,720
variabila clasa țintă la care mergem

23454
18:05:08,240 --> 18:05:15,436
a prezice. Variabilele independente X1

23455
18:05:12,720 --> 18:05:17,200
până la XN sunt caracteristicile sau

23456
18:05:15,436 --> 18:05:19,756
atribute pe care le vom folosi pentru a prezice

23457
18:05:17,200 --> 18:05:21,436
clasa țintă. Știm ce este liniar

23458
18:05:19,756 --> 18:05:23,680
regresia arata ca. Dar folosind

23459
18:05:21,436 --> 18:05:25,596
grafic, nu putem împărți rezultatul în

23460
18:05:23,680 --> 18:05:30,320
categorii. Este foarte greu să

23461
18:05:25,596 --> 18:05:32,560
clasificați 1.5, 3.6, 9.8. Uh pentru

23462
18:05:30,320 --> 18:05:35,040
de exemplu, un grafic de regresie liniară poate

23463
18:05:32,560 --> 18:05:37,436
spune-ne că odată cu creșterea numărului de

23464
18:05:35,040 --> 18:05:39,596
ore studiate, notele unui student

23465
18:05:37,436 --> 18:05:41,916
va crește, dar nu ne va spune

23466
18:05:39,596 --> 18:05:44,000
dacă elevul va promova sau nu. În

23467
18:05:41,916 --> 18:05:46,400
astfel de cazuri în care avem nevoie de ieșire ca

23468
18:05:44,000 --> 18:05:48,080
valoare categorică, vom folosi logistică

23469
18:05:46,400 --> 18:05:50,240
regresie. Și pentru asta, vom merge

23470
18:05:48,080 --> 18:05:53,436
utilizați funcția sigmoidă. Deci poți vedea

23471
18:05:50,240 --> 18:05:54,956
aici avem notele noastre de la 0 la 100, număr

23472
18:05:53,436 --> 18:05:56,956
de ore studiate. Asta va fi

23473
18:05:54,956 --> 18:05:58,796
cu ce o compară în asta

23474
18:05:56,956 --> 18:06:01,840
exemplu. Și de obicei formăm o linie care

23475
18:05:58,796 --> 18:06:06,400
spune y = mx c. Și când folosim

23476
18:06:01,840 --> 18:06:09,200
funcția sigmoidă, avem p = 1 / 1 e

23477
18:06:06,400 --> 18:06:11,436
minusul y, generează un sigmoid

23478
18:06:09,200 --> 18:06:13,756
curba. Și așa puteți vedea chiar aici

23479
18:06:11,436 --> 18:06:16,000
când iei ln, care este

23480
18:06:13,756 --> 18:06:18,880
logaritmul natural. Mereu am crezut asta

23481
18:06:16,000 --> 18:06:22,480
ar trebui să fie nl, nu ln. Asta este doar

23482
18:06:18,880 --> 18:06:26,480
inversul uh e your e față de minus y.

23483
18:06:22,480 --> 18:06:29,756
Și așa facem asta, obținem ln din p 1 - p

23484
18:06:26,480 --> 18:06:31,840
= m * x c. Aceasta este curba sigmoidă

23485
18:06:29,756 --> 18:06:33,436
funcția pe care o căutăm. Și putem

23486
18:06:31,840 --> 18:06:36,000
măriți funcția și veți vedea

23487
18:06:33,436 --> 18:06:39,680
la care se îndreaptă funcția așa cum se dorește

23488
18:06:36,000 --> 18:06:41,756
unu sau la zero, în funcție de x

23489
18:06:39,680 --> 18:06:44,160
valoarea este. Și probabilitatea dacă este

23490
18:06:41,756 --> 18:06:46,080
mai mare de 0,5, valoarea este

23491
18:06:44,160 --> 18:06:47,916
rotunjită automat la unu

23492
18:06:46,080 --> 18:06:49,200
indicând că elevul va promova.

23493
18:06:47,916 --> 18:06:51,436
Deci, dacă fac o anumită cantitate de

23494
18:06:49,200 --> 18:06:54,080
studiind, probabil că vor trece. Apoi

23495
18:06:51,436 --> 18:06:55,520
aveți o valoare de prag la 0,5.

23496
18:06:54,080 --> 18:06:57,520
Acesta pune automat acest drept în

23497
18:06:55,520 --> 18:06:59,596
mijloc de obicei. Și probabilitatea ta dacă

23498
18:06:57,520 --> 18:07:01,276
este mai mică de 0,5, valoarea rulează

23499
18:06:59,596 --> 18:07:02,880
la zero indicând elevul va

23500
18:07:01,276 --> 18:07:04,880
eșuează. Deci dacă nu prea învață

23501
18:07:02,880 --> 18:07:06,160
greu, probabil că vor eșua.

23502
18:07:04,880 --> 18:07:07,916
Aceasta, desigur, este ignorarea

23503
18:07:06,160 --> 18:07:09,916
aberante ale aceluia student care este doar

23504
18:07:07,916 --> 18:07:11,916
un geniu natural și nu are nevoie de niciunul

23505
18:07:09,916 --> 18:07:14,240
studiind să memoreze totul. Asta e

23506
18:07:11,916 --> 18:07:16,480
nu eu, din pacate. Trebuie să studiez

23507
18:07:14,240 --> 18:07:19,200
greu să înveți lucruri noi. problema

23508
18:07:16,480 --> 18:07:22,320
afirmație pentru a clasifica dacă o tumoare este

23509
18:07:19,200 --> 18:07:24,320
malign sau B9. Și asta este de fapt

23510
18:07:22,320 --> 18:07:27,200
unul dintre seturile mele de date preferate de jucat

23511
18:07:24,320 --> 18:07:29,116
cu pentru că are atât de multe caracteristici și

23512
18:07:27,200 --> 18:07:31,200
când te uiți la ele, chiar ești

23513
18:07:29,116 --> 18:07:33,200
greu de inteles. Nu poți doar să te uiți

23514
18:07:31,200 --> 18:07:34,796
la ei și cunoașteți răspunsul. Deci dă

23515
18:07:33,200 --> 18:07:36,400
ai șansa de a te scufunda în ce

23516
18:07:34,796 --> 18:07:38,080
datele arată ca atunci când nu poți

23517
18:07:36,400 --> 18:07:40,080
înțelege domeniul specific al

23518
18:07:38,080 --> 18:07:42,636
date. Dar vreau și să-ți amintești

23519
18:07:40,080 --> 18:07:45,916
că în domeniul medicinei, dacă eu

23520
18:07:42,636 --> 18:07:48,720
ți-am spus că probabilitatea mea era cu adevărat

23521
18:07:45,916 --> 18:07:51,520
bun la lucruri clasificate care spun 90%

23522
18:07:48,720 --> 18:07:54,560
sau 95% și clasific dacă

23523
18:07:51,520 --> 18:07:56,080
vei avea un malign sau un B9

23524
18:07:54,560 --> 18:07:57,916
tumoră, bănuiesc că o vei face

23525
18:07:56,080 --> 18:07:59,840
du-te oricum sa-l testezi. Deci trebuie

23526
18:07:57,916 --> 18:08:01,436
amintiți-vă domeniul cu care lucrăm.

23527
18:07:59,840 --> 18:08:02,720
Deci de ce ai vrea să faci asta dacă tu

23528
18:08:01,436 --> 18:08:04,956
știi că doar vei merge să iei o

23529
18:08:02,720 --> 18:08:07,200
biopsie? Pentru că știi că asta e

23530
18:08:04,956 --> 18:08:08,636
serios. Acesta este ca un totul sau un nimic.

23531
18:08:07,200 --> 18:08:11,520
doar referindu-se la domeniu. Este

23532
18:08:08,636 --> 18:08:14,480
important. Ar putea ajuta medicul să știe

23533
18:08:11,520 --> 18:08:17,116
unde să te uiți doar înțelegând ce

23534
18:08:14,480 --> 18:08:18,796
este un fel de tumoare. Deci ar putea ajuta

23535
18:08:17,116 --> 18:08:20,956
ei sau să-i ajute în ceva ei

23536
18:08:18,796 --> 18:08:22,720
ratat de înainte. Deci hai să mergem înainte

23537
18:08:20,956 --> 18:08:24,480
și scufundă-te în cod și vin

23538
18:08:22,720 --> 18:08:26,320
înapoi la partea de domeniu a acestuia în doar a

23539
18:08:24,480 --> 18:08:28,240
minut. Așa că folosește cazul și o vom face

23540
18:08:26,320 --> 18:08:30,796
facem importurile noastre normale aici unde suntem

23541
18:08:28,240 --> 18:08:33,040
import numpy, panda, seabour, the

23542
18:08:30,796 --> 18:08:34,956
biblioteca mattplot și vom face

23543
18:08:33,040 --> 18:08:36,956
biblioteca mattplot la rând de când merg

23544
18:08:34,956 --> 18:08:38,160
pentru a trece la Anaconda. Deci, hai să mergem

23545
18:08:36,956 --> 18:08:40,956
înainte și întoarce-te acolo și ia asta

23546
18:08:38,160 --> 18:08:44,636
a început. Deci, am deschis o nouă fereastră

23547
18:08:40,956 --> 18:08:46,240
în caietul meu Anaconda Jupyter. Și prin

23548
18:08:44,636 --> 18:08:48,000
Apropo, Jupyter Notebook, nu

23549
18:08:46,240 --> 18:08:49,916
trebuie să folosească Anaconda pentru Jupyter

23550
18:08:48,000 --> 18:08:52,160
Caiet. Îmi place pur și simplu interfața și

23551
18:08:49,916 --> 18:08:55,680
toate instrumentele pe care le aduce Anaconda. Deci,

23552
18:08:52,160 --> 18:08:58,400
Avem aspy-ul nostru de import

23553
18:08:55,680 --> 18:09:00,000
matrice de numere. Avem panda noștri pd.

23554
18:08:58,400 --> 18:09:03,360
O să-l aducem pe Seabor să ajute

23555
18:09:00,000 --> 18:09:05,116
ne cu graficele noastre ca SNS. Atât de multe

23556
18:09:03,360 --> 18:09:06,796
instrumente foarte frumoase atât în Seabour cât și

23557
18:09:05,116 --> 18:09:10,160
Biblioteca Mattplot. Și o să ne facem

23558
18:09:06,796 --> 18:09:11,756
mapplot library.pipplot ca plt. Și apoi

23559
18:09:10,160 --> 18:09:13,200
bineînțeles că vrem să-l anunțăm să facă

23560
18:09:11,756 --> 18:09:16,080
e în linie. Și hai să mergem și să alergăm

23561
18:09:13,200 --> 18:09:18,400
că. Deci totul este pus la punct. Și suntem doar

23562
18:09:16,080 --> 18:09:20,956
vom apela datele noastre de date. Nu

23563
18:09:18,400 --> 18:09:25,276
creativ astăzi. Uh este egal cu pd. Și asta

23564
18:09:20,956 --> 18:09:28,636
se întâmplă să fie într-un fișier CSV. Deci vom face

23565
18:09:25,276 --> 18:09:31,040
utilizați un pdread_csv.

23566
18:09:28,636 --> 18:09:33,916
Și se întâmplă să numesc fișierul. redenumit

23567
18:09:31,040 --> 18:09:35,680
it date forp2.csv.

23568
18:09:33,916 --> 18:09:37,276
Bineînțeles că poți scrie în

23569
18:09:35,680 --> 18:09:38,796
comentarii de mai jos YouTube și cerere

23570
18:09:37,276 --> 18:09:40,480
pentru setul de date în sine sau accesați

23571
18:09:38,796 --> 18:09:43,520
Site-ul SimplyLearn și vom fi fericiți

23572
18:09:40,480 --> 18:09:45,200
să vă furnizeze asta. Și hai doar

23573
18:09:43,520 --> 18:09:46,636
um deschide datele înainte de a pleca

23574
18:09:45,200 --> 18:09:48,636
mai departe și să vedem cum arată

23575
18:09:46,636 --> 18:09:50,720
ca într-o foaie de calcul.

23576
18:09:48,636 --> 18:09:53,116
Deci, când îl deschid într-un local

23577
18:09:50,720 --> 18:09:55,276
foaie de calcul, acesta este doar un fișier CSV,

23578
18:09:53,116 --> 18:09:58,796
variabile separate prin virgulă. Avem o

23579
18:09:55,276 --> 18:10:00,636
ID. Deci, cred că U clasifică pentru

23580
18:09:58,796 --> 18:10:04,160
referință sau ce ID care a fost testul

23581
18:10:00,636 --> 18:10:06,240
gata. Diagnosticul M pentru malign, B

23582
18:10:04,160 --> 18:10:07,680
pentru B9. Deci există două opțiuni diferite

23583
18:10:06,240 --> 18:10:09,680
pe acolo. Și asta vom face

23584
18:10:07,680 --> 18:10:12,000
încercați să preziceți este M și B și testați

23585
18:10:09,680 --> 18:10:14,956
ea. Și apoi avem ca raza

23586
18:10:12,000 --> 18:10:17,840
medie sau medie media texturii,

23587
18:10:14,956 --> 18:10:20,000
medie perimetru, medie suprafață, netezime. eu

23588
18:10:17,840 --> 18:10:22,400
nu știu despre tine, dar dacă nu ești

23589
18:10:20,000 --> 18:10:23,756
un medic în domeniu, majoritatea

23590
18:10:22,400 --> 18:10:26,796
chestii, adică poți ghici ce

23591
18:10:23,756 --> 18:10:28,000
concav înseamnă doar prin termenul concav,

23592
18:10:26,796 --> 18:10:29,116
dar chiar nu aș ști ce aia

23593
18:10:28,000 --> 18:10:30,880
înseamnă în măsurătorile pe care le au

23594
18:10:29,116 --> 18:10:33,840
luând. Deci, au tot felul de lucruri

23595
18:10:30,880 --> 18:10:35,756
ca cât de netedă este, uh, simetria,

23596
18:10:33,840 --> 18:10:37,596
și toate acestea sunt valori flotante. Tu doar

23597
18:10:35,756 --> 18:10:39,520
parcurge-le foarte repede și o vei face

23598
18:10:37,596 --> 18:10:42,720
vezi că sunt, cred, 36 de ani, dacă eu

23599
18:10:39,520 --> 18:10:43,916
aminteste-ti corect, in aceasta.

23600
18:10:42,720 --> 18:10:45,116
Deci, există o mulțime de valori diferite

23601
18:10:43,916 --> 18:10:46,636
ei iau si toate aceste masuratori

23602
18:10:45,116 --> 18:10:48,636
iau când intră acolo și ei

23603
18:10:46,636 --> 18:10:52,080
aruncați o privire asupra creșterii diferite, a

23604
18:10:48,636 --> 18:10:54,636
crestere tumorala. Deci înapoi în datele noastre și

23605
18:10:52,080 --> 18:10:57,200
Am pus asta în același folder ca un cod.

23606
18:10:54,636 --> 18:10:58,720
Așa că am salvat acest cod în acel folder.

23607
18:10:57,200 --> 18:11:00,240
Evident, dacă îl ai într-un alt

23608
18:10:58,720 --> 18:11:05,040
locație, doriți să puneți calea completă

23609
18:11:00,240 --> 18:11:07,360
acolo și vom face doar uh panda

23610
18:11:05,040 --> 18:11:10,000
primele cinci rânduri de date cu datele

23611
18:11:07,360 --> 18:11:12,000
cap. Și noi conducem asta. Putem vedea asta

23612
18:11:10,000 --> 18:11:15,200
avem cam ceea ce tocmai privim

23613
18:11:12,000 --> 18:11:17,200
la. Avem un act de identitate. Avem un diagnostic.

23614
18:11:15,200 --> 18:11:19,040
Dacă trecem până la capăt, vei vedea

23615
18:11:17,200 --> 18:11:23,680
toate coloanele diferite care se întâlnesc

23616
18:11:19,040 --> 18:11:26,240
afișat frumos pentru datele noastre.

23617
18:11:23,680 --> 18:11:29,680
Și în timp ce explorăm datele, noastre

23618
18:11:26,240 --> 18:11:31,596
uh Seabor, pe care l-am referit ca SNS,

23619
18:11:29,680 --> 18:11:34,720
face foarte ușor să intri aici și să faci

23620
18:11:31,596 --> 18:11:36,560
un complot comun. Vei observa chiar

23621
18:11:34,720 --> 18:11:39,040
asemănător pentru că stă deasupra

23622
18:11:36,560 --> 18:11:41,040
a bibliotecii U plot. Deci, articulația

23623
18:11:39,040 --> 18:11:42,400
complotul lucrează mult pentru noi. Şi

23624
18:11:41,040 --> 18:11:44,880
o să ne uităm doar la primul

23625
18:11:42,400 --> 18:11:46,796
două coloane care ne interesează,

23626
18:11:44,880 --> 18:11:49,596
media razei și media texturii.

23627
18:11:46,796 --> 18:11:52,240
Ne vom uita doar la acele două coloane și

23628
18:11:49,596 --> 18:11:53,840
datele sunt egale cu date. Deci asta spune care

23629
18:11:52,240 --> 18:11:55,360
două coloane trasăm și asta

23630
18:11:53,840 --> 18:11:58,000
vom folosi datele pe care le avem

23631
18:11:55,360 --> 18:12:00,480
a tras înăuntru. Hai să rulăm asta. Și asta

23632
18:11:58,000 --> 18:12:02,000
generează un grafic foarte frumos aici.

23633
18:12:00,480 --> 18:12:03,360
Și sunt tot felul de lucruri interesante

23634
18:12:02,000 --> 18:12:05,116
acest grafic pentru a vedea. Adică, avem

23635
18:12:03,360 --> 18:12:10,080
media texturii și media razei

23636
18:12:05,116 --> 18:12:12,080
evident topoarele. De asemenea, puteți vedea

23637
18:12:10,080 --> 18:12:13,840
și unul dintre lucrurile interesante de aici este

23638
18:12:12,080 --> 18:12:15,756
puteți vedea și histograma. Ei

23639
18:12:13,840 --> 18:12:17,836
arătați că pentru media razei unde este

23640
18:12:15,756 --> 18:12:20,156
cea mai obișnuită medie a razei vin în sus și

23641
18:12:17,836 --> 18:12:22,476
unde este cea mai comună textura. Deci

23642
18:12:20,156 --> 18:12:25,280
ne uităm la tehnologia fiecăruia

23643
18:12:22,476 --> 18:12:28,000
crestere este textura medie si pe fiecare

23644
18:12:25,280 --> 18:12:29,196
raza este o rază medie acolo

23645
18:12:28,000 --> 18:12:31,436
devine puțin confuz pentru că suntem

23646
18:12:29,196 --> 18:12:33,516
vorbind despre obiectele individuale

23647
18:12:31,436 --> 18:12:36,000
medie. Și apoi ne putem uita și peste

23648
18:12:33,516 --> 18:12:39,116
aici și vedeți histograma afișată

23649
18:12:36,000 --> 18:12:42,156
noi mediana sau cât de comună fiecare

23650
18:12:39,116 --> 18:12:44,156
măsurarea este. Și asta sunt doar două

23651
18:12:42,156 --> 18:12:47,600
coloane. Deci hai să săpăm puțin mai adânc

23652
18:12:44,156 --> 18:12:49,116
în Seabor. Au și o hartă termică.

23653
18:12:47,600 --> 18:12:51,360
Și dacă nu ești familiarizat cu căldura

23654
18:12:49,116 --> 18:12:53,680
hărți, o hartă termică înseamnă doar că este în

23655
18:12:51,360 --> 18:12:55,116
culoare. Asta e tot ce înseamnă. Harta căldurii.

23656
18:12:53,680 --> 18:12:57,040
Bănuiesc că cele originale complotau

23657
18:12:55,116 --> 18:12:58,876
densitatea căldurii pe ceva. Și așa întotdeauna

23658
18:12:57,040 --> 18:13:00,960
de atunci se numește doar o hartă termică.

23659
18:12:58,876 --> 18:13:02,640
Și ne vom lua datele și vom obține

23660
18:13:00,960 --> 18:13:04,476
numerele noastre corespunzătoare pentru a pune asta

23661
18:13:02,640 --> 18:13:06,876
în harta termică. Și asta e pur și simplu

23662
18:13:04,476 --> 18:13:09,680
date.coR

23663
18:13:06,876 --> 18:13:11,280
pentru asta. Aceasta este o expresie de panda.

23664
18:13:09,680 --> 18:13:12,556
Să ne amintim că lucrăm într-un panda

23665
18:13:11,280 --> 18:13:15,196
cadru de date. Deci ăsta e unul dintre cele mai tari

23666
18:13:12,556 --> 18:13:17,196
instrumente în panda pentru datele noastre. Și haideți

23667
18:13:15,196 --> 18:13:19,516
doar trageți acea informație într-o căldură

23668
18:13:17,196 --> 18:13:21,360
harta și vezi cum arată. Şi

23669
18:13:19,516 --> 18:13:24,156
vei vedea că acum ne uităm la toate

23670
18:13:21,360 --> 18:13:26,080
diferitele caracteristici. Avem identitatea noastră.

23671
18:13:24,156 --> 18:13:29,116
Avem textura noastră. Avem zona noastră,

23672
18:13:26,080 --> 18:13:31,196
compactitatea noastră, punctele concave. Și dacă

23673
18:13:29,116 --> 18:13:32,960
te uiți în mijlocul acestei diagrame

23674
18:13:31,196 --> 18:13:35,836
diagonală mergând din stânga sus la

23675
18:13:32,960 --> 18:13:38,400
dreapta jos, totul e alb. Asta e

23676
18:13:35,836 --> 18:13:40,156
pentru că atunci când compari textura cu

23677
18:13:38,400 --> 18:13:43,280
textura, sunt identice. Deci sunt

23678
18:13:40,156 --> 18:13:45,040
100% sau în acest caz unul perfect în

23679
18:13:43,280 --> 18:13:48,796
corespondența lor.

23680
18:13:45,040 --> 18:13:51,360
Și vei vedea asta când te uiți să spui

23681
18:13:48,796 --> 18:13:53,040
zona sau chiar sub ea, are aproape a

23682
18:13:51,360 --> 18:13:54,960
negru acolo. când o compari cu

23683
18:13:53,040 --> 18:13:56,476
textura. Deci astea aproape nu au

23684
18:13:54,960 --> 18:13:58,156
date corespunzătoare. Ei nu chiar

23685
18:13:56,476 --> 18:13:59,680
formează un grafic liniar sau ceva care

23686
18:13:58,156 --> 18:14:02,080
poți să te uiți și să spui cât de conectat

23687
18:13:59,680 --> 18:14:04,640
ei sunt. Sunt date foarte dispersate.

23688
18:14:02,080 --> 18:14:06,476
Acesta este într-adevăr doar un grafic foarte frumos

23689
18:14:04,640 --> 18:14:08,960
pentru a arunca o privire rapidă asupra datelor dvs.

23690
18:14:06,476 --> 18:14:11,360
Nu schimbă atât de mult ceea ce faci, dar

23691
18:14:08,960 --> 18:14:12,640
se schimbă verificarea. Deci, când primești un

23692
18:14:11,360 --> 18:14:13,516
răspuns sau ceva de genul ăsta sau tu

23693
18:14:12,640 --> 18:14:15,920
începe să te uiți la unele dintre acestea

23694
18:14:13,516 --> 18:14:18,080
bucăți individuale, ați putea spune „Hei,

23695
18:14:15,920 --> 18:14:21,116
asta nu se potriveste. conform arătării

23696
18:14:18,080 --> 18:14:22,640
harta noastră termică, aceasta nu ar trebui să se coreleze

23697
18:14:21,116 --> 18:14:23,756
unul cu altul. Și dacă este, ești

23698
18:14:22,640 --> 18:14:25,600
va trebui să încep să întreb, ei bine,

23699
18:14:23,756 --> 18:14:27,756
de ce? Ce se întâmplă? Ce altceva este

23700
18:14:25,600 --> 18:14:30,000
intra acolo? Dar arată unele

23701
18:14:27,756 --> 18:14:33,756
informații foarte interesante aici. Adică,

23702
18:14:30,000 --> 18:14:36,640
vedem din actul de identitate, nu există real

23703
18:14:33,756 --> 18:14:39,040
o caracteristică care spune doar dacă mergi

23704
18:14:36,640 --> 18:14:40,796
peste linia de sus care se aprinde.

23705
18:14:39,040 --> 18:14:42,876
Nu există nicio caracteristică care să spună, hei,

23706
18:14:40,796 --> 18:14:44,876
dacă zona are o anumită dimensiune, atunci este

23707
18:14:42,876 --> 18:14:46,960
va fi B9 sau malign. Se spune

23708
18:14:44,876 --> 18:14:49,436
există unii care se adună și

23709
18:14:46,960 --> 18:14:51,836
acesta este un indiciu mare în datele pe care le avem

23710
18:14:49,436 --> 18:14:54,080
încercând să identific asta dacă este malign

23711
18:14:51,836 --> 18:14:56,640
sau B9. Acesta este un mare indiciu pentru noi ca date

23712
18:14:54,080 --> 18:14:59,280
oamenii de știință să meargă bine, nu putem rezolva

23713
18:14:56,640 --> 18:15:00,876
asta cu orice caracteristică. O să fie

23714
18:14:59,280 --> 18:15:02,156
fi ceva care include toate

23715
18:15:00,876 --> 18:15:03,920
caracteristici sau multe dintre diferite

23716
18:15:02,156 --> 18:15:07,040
caracteristici pentru a veni cu o soluție pentru

23717
18:15:03,920 --> 18:15:09,360
ea. Și în timp ce explorăm datele

23718
18:15:07,040 --> 18:15:12,640
haideti sa exploram inca o zona si haideti

23719
18:15:09,360 --> 18:15:15,680
uită-te la date este nulă. Vrem să verificăm

23720
18:15:12,640 --> 18:15:18,476
pentru valorile nule din datele noastre. Dacă tu

23721
18:15:15,680 --> 18:15:19,920
amintiți-vă de mai devreme în acest tutorial,

23722
18:15:18,476 --> 18:15:22,000
am făcut-o puțin diferit unde noi

23723
18:15:19,920 --> 18:15:23,436
a adăugat chestii și a le rezuma. Poți

23724
18:15:22,000 --> 18:15:25,756
de fapt cu panda fă-o cu adevărat

23725
18:15:23,436 --> 18:15:27,600
repede. Data.isnull și summit. Şi

23726
18:15:25,756 --> 18:15:30,960
va trece peste toate coloanele.

23727
18:15:27,600 --> 18:15:32,720
Deci, când rulez asta,

23728
18:15:30,960 --> 18:15:36,244
o să vezi venind toate coloanele

23729
18:15:32,720 --> 18:15:39,280
fără date nule.

23730
18:15:36,244 --> 18:15:42,000
Așa că trebuie doar să le reluăm pe acestea din urmă

23731
18:15:39,280 --> 18:15:44,000
câțiva pași. Am făcut multe

23732
18:15:42,000 --> 18:15:47,360
explorare. Ne-am uitat la primul

23733
18:15:44,000 --> 18:15:49,680
două coloane și am văzut cum complotează cu

23734
18:15:47,360 --> 18:15:52,244
marinarul cu o parcelă comună care

23735
18:15:49,680 --> 18:15:54,876
arată atât histograma cât și datele

23736
18:15:52,244 --> 18:15:58,156
reprezentate pe coordonatele XY. Şi

23737
18:15:54,876 --> 18:15:59,920
evident că poți face asta mai detaliat

23738
18:15:58,156 --> 18:16:02,320
cu coloane diferite și vezi cum

23739
18:15:59,920 --> 18:16:05,516
complotează împreună. Și apoi am luat și am făcut

23740
18:16:02,320 --> 18:16:07,680
harta termică Seabor SNS

23741
18:16:05,516 --> 18:16:09,600
harta termică a datelor. Și poți vedea

23742
18:16:07,680 --> 18:16:11,516
chiar aici, unde a făcut o treabă bună

23743
18:16:09,600 --> 18:16:13,756
arătându-ne câteva puncte luminoase unde lucruri

23744
18:16:11,516 --> 18:16:16,244
se corelează între ele și formează a

23745
18:16:13,756 --> 18:16:18,080
combinație foarte frumoasă sau puncte de

23746
18:16:16,244 --> 18:16:20,720
puncte de împrăștiere. Și puteți vedea, de asemenea

23747
18:16:18,080 --> 18:16:22,244
zone care nu.

23748
18:16:20,720 --> 18:16:24,320
Și apoi, în sfârșit, am mers înainte și

23749
18:16:22,244 --> 18:16:26,640
verificat datele. Datele sunt nule

23750
18:16:24,320 --> 18:16:28,796
valoare? Avem date lipsă

23751
18:16:26,640 --> 18:16:31,516
acolo? Un pas foarte important pentru că va fi

23752
18:16:28,796 --> 18:16:33,600
prăbușire mai târziu. Dacă uitați să faceți asta

23753
18:16:31,516 --> 18:16:35,360
pas, vă va reaminti când primiți

23754
18:16:33,600 --> 18:16:38,156
acel cod de eroare frumos care spune null

23755
18:16:35,360 --> 18:16:40,476
valorile. Bine. Deci, nu e mare lucru dacă tu

23756
18:16:38,156 --> 18:16:42,400
dor, dar nu este distractiv să mergi

23757
18:16:40,476 --> 18:16:44,400
înapoi când ești când ești într-o mare

23758
18:16:42,400 --> 18:16:45,920
proces și ați ratat acest pas și

23759
18:16:44,400 --> 18:16:47,360
acum ai 10 pași mai târziu și ai ajuns

23760
18:16:45,920 --> 18:16:49,600
du-te și amintește-ți unde trăgeai

23761
18:16:47,360 --> 18:16:51,360
date în.

23762
18:16:49,600 --> 18:16:54,556
Deci, trebuie să mergem înainte și să ne scoatem

23763
18:16:51,360 --> 18:16:57,436
X și Y-ul nostru. Deci, am lăsat-o jos

23764
18:16:54,556 --> 18:16:59,360
aici și vom seta X-ul egal cu. Şi

23765
18:16:57,436 --> 18:17:01,756
există o mulțime de opțiuni diferite aici.

23766
18:16:59,360 --> 18:17:04,080
Cu siguranță am putea face X egal cu toate

23767
18:17:01,756 --> 18:17:05,836
coloane cu excepţia primelor două deoarece

23768
18:17:04,080 --> 18:17:08,080
dacă vă amintiți primele două este ID-ul

23769
18:17:05,836 --> 18:17:10,244
si diagnosticul. Deci, cu siguranță

23770
18:17:08,080 --> 18:17:12,000
ar fi o optiune. Dar ce mergem

23771
18:17:10,244 --> 18:17:14,876
de făcut este să ne concentrăm de fapt

23772
18:17:12,000 --> 18:17:17,196
pe cel mai rău. Cea mai proastă rază, cea

23773
18:17:14,876 --> 18:17:20,556
cea mai proasta textură, zona parametrilor,

23774
18:17:17,196 --> 18:17:22,556
netezime, compactitate și așa mai departe. Unul

23775
18:17:20,556 --> 18:17:24,960
a motivelor pentru a începe să vă împărțiți

23776
18:17:22,556 --> 18:17:28,400
date când te uiți la asta

23777
18:17:24,960 --> 18:17:30,476
informația este uneori datele vor

23778
18:17:28,400 --> 18:17:33,360
să fie aceleași date care vin. Deci, dacă am

23779
18:17:30,476 --> 18:17:35,196
două măsurători intră în modelul meu,

23780
18:17:33,360 --> 18:17:37,280
le-ar putea suprapondere. S-ar putea

23781
18:17:35,196 --> 18:17:38,640
învinge celelalte măsurători pentru că

23782
18:17:37,280 --> 18:17:40,720
măsoară, practic ia

23783
18:17:38,640 --> 18:17:41,920
informația respectivă de două ori. Asta este o

23784
18:17:40,720 --> 18:17:43,920
puțin peste scopul acestui lucru

23785
18:17:41,920 --> 18:17:45,516
tutorial. Vreau să iei de la

23786
18:17:43,920 --> 18:17:47,756
aceasta însă este că împărțim

23787
18:17:45,516 --> 18:17:49,280
datele în bucăți și echipa noastră în

23788
18:17:47,756 --> 18:17:51,040
înapoi a mers înainte și a spus hei, haideți

23789
18:17:49,280 --> 18:17:54,000
uite ce e mai rau. Așa că mă duc

23790
18:17:51,040 --> 18:17:56,876
creați o matrice și veți vedea asta

23791
18:17:54,000 --> 18:17:58,476
raza matricei cea mai proasta textura cea mai proasta

23792
18:17:56,876 --> 18:18:00,080
perimetrul cel mai rău. Tocmai am luat

23793
18:17:58,476 --> 18:18:02,720
cel mai rău din cel mai rău și doar o voi face

23794
18:18:00,080 --> 18:18:05,360
pune asta în X-ul meu. Deci acest X este încă a

23795
18:18:02,720 --> 18:18:08,080
cadru de date panda, dar sunt doar acelea

23796
18:18:05,360 --> 18:18:10,556
coloane. Și Y-ul nostru, dacă vă amintiți

23797
18:18:08,080 --> 18:18:13,196
corect, va fi Hopa, stai

23798
18:18:10,556 --> 18:18:16,080
o secundă. Nu este X. sunt date. Acolo

23799
18:18:13,196 --> 18:18:17,516
mergem. Deci, x este egal cu date și apoi este a

23800
18:18:16,080 --> 18:18:19,436
lista diferitelor coloane, cea mai proasta

23801
18:18:17,516 --> 18:18:21,040
dintre cele mai rele. Și dacă o să luăm

23802
18:18:19,436 --> 18:18:24,156
asta, atunci trebuie să avem răspunsul nostru

23803
18:18:21,040 --> 18:18:25,680
pentru y-ul nostru pentru lucrurile pe care le știm. Și dacă

23804
18:18:24,156 --> 18:18:28,080
îți amintești bine, doar mergem

23805
18:18:25,680 --> 18:18:30,000
să se uite la

23806
18:18:28,080 --> 18:18:32,796
diagnosticul. Asta e tot ce ne pasă

23807
18:18:30,000 --> 18:18:35,360
ce este diagnosticat? Este B9 sau

23808
18:18:32,796 --> 18:18:37,600
malign? Și din moment ce este un singur

23809
18:18:35,360 --> 18:18:39,756
coloană, putem face doar un diagnostic. Oh, eu

23810
18:18:37,600 --> 18:18:42,400
am uitat să pun paranteze. Iată-ne.

23811
18:18:39,756 --> 18:18:44,640
Bine. Deci, e doar un diagnostic acolo.

23812
18:18:42,400 --> 18:18:46,796
Și, de asemenea, putem face foarte repede ca un

23813
18:18:44,640 --> 18:18:50,156
X fac. Dacă vrei să vezi cum arată

23814
18:18:46,796 --> 18:18:53,756
ca și Y cap

23815
18:18:50,156 --> 18:18:55,116
și rulează asta și vei vedea doar asta

23816
18:18:53,756 --> 18:18:57,196
face ultimul. Am uitat de asta.

23817
18:18:55,116 --> 18:19:00,000
Dacă nu imprimați, puteți vedea asta

23818
18:18:57,196 --> 18:19:02,080
Y.D este doar mm pentru că primul

23819
18:19:00,000 --> 18:19:04,960
toate sunt maligne. Și dacă fug

23820
18:19:02,080 --> 18:19:07,360
asta, capul X do este doar primul

23821
18:19:04,960 --> 18:19:09,196
cinci valori ale razei cele mai proaste, textura

23822
18:19:07,360 --> 18:19:13,196
cel mai rău, cel mai rău parametru, cel mai rău zonă și

23823
18:19:09,196 --> 18:19:17,196
asa mai departe. Voi merge înainte și voi scoate asta.

23824
18:19:13,196 --> 18:19:20,080
Deci, trecând la pasul următor, am

23825
18:19:17,196 --> 18:19:23,280
a construit cele două seturi de date ale noastre, răspunsul nostru și

23826
18:19:20,080 --> 18:19:26,080
apoi caracteristicile pe care vrem să le analizăm.

23827
18:19:23,280 --> 18:19:29,836
În știința datelor, este foarte important să

23828
18:19:26,080 --> 18:19:32,244
testați-vă modelul. Deci facem asta prin

23829
18:19:29,836 --> 18:19:34,960
împărțirea datelor

23830
18:19:32,244 --> 18:19:37,360
iar din selecția modelului sklearn suntem

23831
18:19:34,960 --> 18:19:39,436
mergi să importe diviziunea de testare a trenului. Deci

23832
18:19:37,360 --> 18:19:41,680
îl vom împărți în două grupuri.

23833
18:19:39,436 --> 18:19:43,360
Există atât de multe moduri de a face asta. eu

23834
18:19:41,680 --> 18:19:45,360
observat într-unul dintre modurile mai moderne

23835
18:19:43,360 --> 18:19:48,080
de fapt l-au împărțit în trei grupuri

23836
18:19:45,360 --> 18:19:50,080
iar apoi modelezi fiecare grup și testezi

23837
18:19:48,080 --> 18:19:51,516
aceasta împotriva celorlalte grupuri. Deci ai

23838
18:19:50,080 --> 18:19:53,680
tot felul și există motive pentru asta

23839
18:19:51,516 --> 18:19:56,080
care depăşeşte domeniul de aplicare al acestui şi pentru

23840
18:19:53,680 --> 18:19:57,360
acest exemplu anume nu este necesar

23841
18:19:56,080 --> 18:19:59,756
pentru aceasta. O să-l împărțim doar

23842
18:19:57,360 --> 18:20:02,400
în două grupe. unul pentru a ne instrui datele

23843
18:19:59,756 --> 18:20:05,756
și unul pentru a ne testa datele. Iar cel

23844
18:20:02,400 --> 18:20:07,680
sklearn uh.mmodel de selecție avem

23845
18:20:05,756 --> 18:20:09,360
testele de tren împărțite. Ai putea să-ți scrii

23846
18:20:07,680 --> 18:20:11,116
propriul cod rapid pentru a face acest lucru acolo unde doar

23847
18:20:09,360 --> 18:20:14,556
împărțiți aleatoriu datele în două

23848
18:20:11,116 --> 18:20:16,156
grupuri, dar o fac frumos pentru noi

23849
18:20:14,556 --> 18:20:17,600
și de fapt putem aproape că putem

23850
18:20:16,156 --> 18:20:19,516
face-o într-o singură declarație cu

23851
18:20:17,600 --> 18:20:23,280
aici vom genera patru

23852
18:20:19,516 --> 18:20:25,436
variabile capital X tren capital X

23853
18:20:23,280 --> 18:20:27,196
test. Deci avem datele noastre de antrenament

23854
18:20:25,436 --> 18:20:29,040
va folosi pentru a se potrivi modelului și apoi

23855
18:20:27,196 --> 18:20:30,400
avem nevoie de ceva care să-l testăm și apoi noi

23856
18:20:29,040 --> 18:20:32,080
avem trenul nostru. Deci vom merge

23857
18:20:30,400 --> 18:20:33,756
antrenează răspunsul și apoi avem al nostru

23858
18:20:32,080 --> 18:20:36,640
test. Deci acestea sunt lucrurile pe care vrem să le facem

23859
18:20:33,756 --> 18:20:38,556
vezi cât de bine a mers pe modelul nostru. Şi

23860
18:20:36,640 --> 18:20:41,116
vom merge înainte și vom face testul de tren

23861
18:20:38,556 --> 18:20:43,600
split pe care tocmai am importat-o.

23862
18:20:41,116 --> 18:20:45,436
Și vom face X și Y-ul nostru, al nostru

23863
18:20:43,600 --> 18:20:48,400
două date diferite pentru care se află

23864
18:20:45,436 --> 18:20:49,836
despărțirea noastră. Și apoi băieții din spate

23865
18:20:48,400 --> 18:20:52,796
a venit și a vrut să mergem înainte și

23866
18:20:49,836 --> 18:20:55,920
utilizați o dimensiune de test egală.3.

23867
18:20:52,796 --> 18:20:57,436
Aceasta este dimensiunea testului. Stare aleatorie. Este

23868
18:20:55,920 --> 18:20:59,516
Întotdeauna plăcut să schimbi la întâmplare

23869
18:20:57,436 --> 18:21:01,600
stat în jur, dar nu atât de important.

23870
18:20:59,516 --> 18:21:04,400
Ceea ce înseamnă aceasta este că dimensiunea testului este

23871
18:21:01,600 --> 18:21:06,244
vom lua 30% din date și

23872
18:21:04,400 --> 18:21:09,196
vom pune asta în testul nostru

23873
18:21:06,244 --> 18:21:11,680
variabile, testul nostru Y și testul nostru X.

23874
18:21:09,196 --> 18:21:13,040
Și vom face 70% în X

23875
18:21:11,680 --> 18:21:15,360
trenul și trenul Y. Deci, mergem

23876
18:21:13,040 --> 18:21:18,320
să folosim 70% din date pentru a ne instrui

23877
18:21:15,360 --> 18:21:21,196
model și 30% pentru a-l testa. Să mergem înainte

23878
18:21:18,320 --> 18:21:23,116
și rulați asta și încărcați-le. Deci acum

23879
18:21:21,196 --> 18:21:25,516
avem toate lucrurile împărțite și toate

23880
18:21:23,116 --> 18:21:27,116
datele noastre sunt gata de plecare. Și acum ajungem la

23881
18:21:25,516 --> 18:21:28,876
partea de logistică propriu-zisă. Suntem

23882
18:21:27,116 --> 18:21:30,796
de fapt ne vom crea

23883
18:21:28,876 --> 18:21:33,040
model. Deci hai să mergem mai departe și să aducem asta

23884
18:21:30,796 --> 18:21:34,796
in din sklearn. O să aducem

23885
18:21:33,040 --> 18:21:37,360
modelul nostru liniar și vom face

23886
18:21:34,796 --> 18:21:39,360
regresie logistică de import. Asta este

23887
18:21:37,360 --> 18:21:42,320
modelul real pe care îl folosim. Și haideți

23888
18:21:39,360 --> 18:21:44,156
îl vom numi model de jurnal.

23889
18:21:42,320 --> 18:21:46,320
Hopa, iată-ne. Model. Și hai doar

23890
18:21:44,156 --> 18:21:49,116
setați acest lucru egal cu logistica noastră

23891
18:21:46,320 --> 18:21:51,360
regresie pe care tocmai am importat-o. Deci acum

23892
18:21:49,116 --> 18:21:55,116
avem un model de jurnal variabil setat la asta

23893
18:21:51,360 --> 18:21:58,640
clasă pe care să o folosim noi. Și cu cele mai multe

23894
18:21:55,116 --> 18:22:01,436
uh modele în sklearn, avem nevoie doar

23895
18:21:58,640 --> 18:22:04,556
să mergi înainte și să o repari. Fit face a fit on

23896
18:22:01,436 --> 18:22:07,436
acolo. Și folosim trenul nostru x pe care noi

23897
18:22:04,556 --> 18:22:08,960
despărțiți cu trenul nostru y. Şi

23898
18:22:07,436 --> 18:22:10,476
hai să mergem mai departe și să rulăm asta. Deci odata

23899
18:22:08,960 --> 18:22:13,280
am rulat asta, vom avea un model care

23900
18:22:10,476 --> 18:22:15,600
se potrivește acestor date pe care 70% din formarea noastră

23901
18:22:13,280 --> 18:22:17,116
date.

23902
18:22:15,600 --> 18:22:18,156
Uh, și bineînțeles că imprimă asta

23903
18:22:17,116 --> 18:22:20,244
care ne spune totul diferit

23904
18:22:18,156 --> 18:22:21,756
variabile pe care le puteți seta acolo.

23905
18:22:20,244 --> 18:22:23,280
Aveți o mulțime de opțiuni diferite

23906
18:22:21,756 --> 18:22:25,040
poate face, dar pentru Word face, suntem doar

23907
18:22:23,280 --> 18:22:26,320
voi lăsa toate setările implicite. Noi

23908
18:22:25,040 --> 18:22:28,000
chiar nu trebuie să te încurci cu alea

23909
18:22:26,320 --> 18:22:29,836
acest exemplu special. Și există

23910
18:22:28,000 --> 18:22:32,556
nimic aici care să iasă în evidență

23911
18:22:29,836 --> 18:22:34,556
ca super important până începi

23912
18:22:32,556 --> 18:22:36,876
reglajul fin. Dar pentru ceea ce suntem

23913
18:22:34,556 --> 18:22:38,876
făcând, elementele de bază vor funcționa foarte bine.

23914
18:22:36,876 --> 18:22:41,116
Și atunci haideți să mergem înainte și

23915
18:22:38,876 --> 18:22:43,600
testați modelul nostru. Functioneaza? Deci

23916
18:22:41,116 --> 18:22:46,720
să creăm o variabilă Y predict. Şi

23917
18:22:43,600 --> 18:22:49,680
acesta va fi egal cu jurnalul nostru

23918
18:22:46,720 --> 18:22:52,320
model. Și vrem să facem o predicție.

23919
18:22:49,680 --> 18:22:54,476
Din nou, un format foarte standard pentru

23920
18:22:52,320 --> 18:22:56,640
biblioteca sklearn îți ia modelul și

23921
18:22:54,476 --> 18:22:59,360
făcând o previziune asupra ei. Și mergem

23922
18:22:56,640 --> 18:23:01,040
pentru a testa y prezice față de testul y. Deci

23923
18:22:59,360 --> 18:23:02,476
vrem să știm ce crede modelul

23924
18:23:01,040 --> 18:23:05,116
va fi. Asta este yul nostru

23925
18:23:02,476 --> 18:23:08,876
prezice este. Și cu asta, vrem

23926
18:23:05,116 --> 18:23:10,876
testul capital xx. Deci avem trenul nostru

23927
18:23:08,876 --> 18:23:12,876
setul și setul nostru de testare. Și acum suntem

23928
18:23:10,876 --> 18:23:15,040
ne vom face prezicerea. Și să mergem

23929
18:23:12,876 --> 18:23:18,476
înainte și rulează asta.

23930
18:23:15,040 --> 18:23:22,556
Și dacă imprimăm

23931
18:23:18,476 --> 18:23:25,280
și prezice, lasă-mă să merg înainte și să execut asta.

23932
18:23:22,556 --> 18:23:28,876
Veți vedea că apare și precedă a

23933
18:23:25,280 --> 18:23:30,640
imprimă o gamă frumoasă de uh B și M pentru B9

23934
18:23:28,876 --> 18:23:32,400
si maligne

23935
18:23:30,640 --> 18:23:34,960
pentru toate datele de testare diferite pe care le-am pus

23936
18:23:32,400 --> 18:23:36,720
acolo. Deci, se descurcă destul de bine. Suntem

23937
18:23:34,960 --> 18:23:38,320
nu știu exact cât de bine face, dar

23938
18:23:36,720 --> 18:23:40,876
putem vedea că de fapt funcționează și este

23939
18:23:38,320 --> 18:23:42,796
funcţional. A fost foarte ușor de creat.

23940
18:23:40,876 --> 18:23:45,920
Vei descoperi mereu cu datele noastre

23941
18:23:42,796 --> 18:23:47,836
știință că pe măsură ce explorezi asta, tu

23942
18:23:45,920 --> 18:23:50,320
petrece o cantitate semnificativă de timp

23943
18:23:47,836 --> 18:23:52,876
pregătindu-vă datele și asigurându-vă că dvs

23944
18:23:50,320 --> 18:23:56,080
datele care vin sunt bune. Uh, există o

23945
18:23:52,876 --> 18:23:59,280
spunând, date bune intră, răspunsuri bune.

23946
18:23:56,080 --> 18:24:02,080
Intră date proaste, ies răspunsuri proaste. Asta e

23947
18:23:59,280 --> 18:24:04,556
doar jumătate din lucru. Asta e doar jumătate din

23948
18:24:02,080 --> 18:24:06,400
ea. Selectarea modelelor dvs. devine

23949
18:24:04,556 --> 18:24:08,556
următoarea parte în ceea ce privește cât de bune modelele dvs

23950
18:24:06,400 --> 18:24:11,360
sunt. și apoi, bineînțeles, reglajul fin

23951
18:24:08,556 --> 18:24:12,720
in functie de modelul pe care il folosesti. Deci

23952
18:24:11,360 --> 18:24:14,400
venim aici, vrem să știm cum

23953
18:24:12,720 --> 18:24:20,000
bine a iesit asta. Deci avem Y-ul nostru

23954
18:24:14,400 --> 18:24:23,360
prezice aici, log model.predict X test.

23955
18:24:20,000 --> 18:24:24,640
Deci, pentru a decide cât de bun este modelul nostru,

23956
18:24:23,360 --> 18:24:26,320
vom merge de la

23957
18:24:24,640 --> 18:24:28,156
sklearn.metrics,

23958
18:24:26,320 --> 18:24:30,244
vom importa clasificarea

23959
18:24:28,156 --> 18:24:31,836
raport. Și asta doar arată cât de bine

23960
18:24:30,244 --> 18:24:33,756
modelul nostru merge. Și apoi mergem

23961
18:24:31,836 --> 18:24:36,476
pentru a-i alimenta datele modelului. Și haideți

23962
18:24:33,756 --> 18:24:39,600
doar tipăriți asta. și ne vom lua

23963
18:24:36,476 --> 18:24:43,680
raport de clasificare

23964
18:24:39,600 --> 18:24:46,876
și o să punem acolo

23965
18:24:43,680 --> 18:24:49,836
testăm datele noastre reale. Deci asta este

23966
18:24:46,876 --> 18:24:51,680
ceea ce știm de fapt este adevărat și al nostru

23967
18:24:49,836 --> 18:24:54,000
prezice ceea ce a prezis modelul nostru

23968
18:24:51,680 --> 18:24:57,756
acele date din partea de testare. Și haideți

23969
18:24:54,000 --> 18:24:59,680
rulează asta și vezi ce face asta.

23970
18:24:57,756 --> 18:25:03,436
Așa că o ridicăm. Vei vedea că noi

23971
18:24:59,680 --> 18:25:06,960
au o precizie pentru B9 și malign

23972
18:25:03,436 --> 18:25:10,000
B și M. Și avem o precizie de 93

23973
18:25:06,960 --> 18:25:12,476
și 91, un total de 92. Deci e cam

23974
18:25:10,000 --> 18:25:13,360
media dintre acestea două din 92.

23975
18:25:12,476 --> 18:25:16,960
Există tot felul de diferite

23976
18:25:13,360 --> 18:25:19,600
informatii pe aici. Scorul tău F1,

23977
18:25:16,960 --> 18:25:22,000
reamintirea dvs., sprijinul dvs. vine

23978
18:25:19,600 --> 18:25:23,920
pe aceasta. Și pentru asta, voi merge înainte și

23979
18:25:22,000 --> 18:25:26,000
doar întoarceți-vă la diapozitivele noastre că ei

23980
18:25:23,920 --> 18:25:26,960
adunate pentru a-l descrie. Și așa

23981
18:25:26,000 --> 18:25:28,876
aici ne vom uita la

23982
18:25:26,960 --> 18:25:30,640
precizie folosind clasificarea

23983
18:25:28,876 --> 18:25:32,876
raport. Și vezi că asta e la fel

23984
18:25:30,640 --> 18:25:34,244
tipărit pe care l-am avut mai sus. Unele dintre

23985
18:25:32,876 --> 18:25:36,720
numerele ar putea fi diferite pentru că

23986
18:25:34,244 --> 18:25:39,196
alege aleatoriu ce date suntem

23987
18:25:36,720 --> 18:25:43,680
folosind. Deci acest model este capabil să prezică

23988
18:25:39,196 --> 18:25:45,516
tipul de tumoră cu o acuratețe de 91%. Deci

23989
18:25:43,680 --> 18:25:47,680
ne uităm înapoi aici, asta vei vedea

23990
18:25:45,516 --> 18:25:49,756
unde avem B9 și maligne. Ea

23991
18:25:47,680 --> 18:25:52,720
de fapt are 92 care vin aici. Suntem

23992
18:25:49,756 --> 18:25:54,476
cautând o precizie de 92 91%. Şi

23993
18:25:52,720 --> 18:25:55,756
amintește-ți că ți-am amintit despre domeniu.

23994
18:25:54,476 --> 18:25:58,080
Deci, când vorbim despre domeniu

23995
18:25:55,756 --> 18:26:00,876
a unui domeniu medical cu o foarte

23996
18:25:58,080 --> 18:26:03,436
rezultat catastrofal, știi, la 91 sau

23997
18:26:00,876 --> 18:26:06,244
Precizie de 92%, tot vei merge

23998
18:26:03,436 --> 18:26:08,156
acolo și pune pe cineva să facă o biopsie

23999
18:26:06,244 --> 18:26:10,876
pe ea. Foarte diferit decât dacă ești

24000
18:26:08,156 --> 18:26:14,244
investind bani și există o șansă de 92%.

24001
18:26:10,876 --> 18:26:16,156
vei câștiga șanse de 10% și 8%.

24002
18:26:14,244 --> 18:26:17,756
vei pierde 8%, probabil că ești

24003
18:26:16,156 --> 18:26:19,116
o să pariez banii pentru că la asta

24004
18:26:17,756 --> 18:26:20,556
cote, este destul de bine că vei face

24005
18:26:19,116 --> 18:26:22,244
niște bani. Și pe termen lung, o faci

24006
18:26:20,556 --> 18:26:24,796
suficient, cu siguranță vei face

24007
18:26:22,244 --> 18:26:26,556
bani. Și, de asemenea, cu acest domeniu, am

24008
18:26:24,796 --> 18:26:29,040
de fapt, i-am văzut folosind asta pentru a identifica

24009
18:26:26,556 --> 18:26:30,080
diferite forme de cancer. Acesta este unul dintre

24010
18:26:29,040 --> 18:26:32,156
lucrurile pe care încep să le folosească

24011
18:26:30,080 --> 18:26:34,876
aceste modele pentru că atunci ajută a

24012
18:26:32,156 --> 18:26:37,116
doctorul știe ce să investigheze. Așa că

24013
18:26:34,876 --> 18:26:38,320
încheie această secțiune. Suntem în sfârșit

24014
18:26:37,116 --> 18:26:40,320
vom intra acolo și hai

24015
18:26:38,320 --> 18:26:43,116
discutați răspunsurile la testul întrebat în

24016
18:26:40,320 --> 18:26:44,796
tutorial de învățare automată partea întâi. Can

24017
18:26:43,116 --> 18:26:47,360
spui ce se întâmplă în

24018
18:26:44,796 --> 18:26:50,000
urmatoarele cazuri? Gruparea documentelor în

24019
18:26:47,360 --> 18:26:52,876
diferite categorii în funcție de subiect

24020
18:26:50,000 --> 18:26:54,556
și conținutul fiecărui document. Acesta este un

24021
18:26:52,876 --> 18:26:55,920
exemplu de grupare unde K înseamnă

24022
18:26:54,556 --> 18:26:58,640
gruparea poate fi folosită pentru a grupa

24023
18:26:55,920 --> 18:27:00,876
documente pe subiecte folosind pungă de cuvinte

24024
18:26:58,640 --> 18:27:02,640
abordare. Deci, dacă ai intrat acolo, asta

24025
18:27:00,876 --> 18:27:04,556
cauţi clustering şi

24026
18:27:02,640 --> 18:27:06,476
sper ca ai avut macar una sau doua

24027
18:27:04,556 --> 18:27:08,320
exemple precum K înseamnă care sunt folosite pentru

24028
18:27:06,476 --> 18:27:11,836
gruparea diferitelor lucruri apoi da

24029
18:27:08,320 --> 18:27:14,640
tu cu două degete în sus. B identificarea

24030
18:27:11,836 --> 18:27:17,280
cifrele scrise de mână în imagini corect.

24031
18:27:14,640 --> 18:27:18,960
Acesta este un exemplu de clasificare.

24032
18:27:17,280 --> 18:27:20,640
Abordarea tradițională pentru a rezolva acest lucru

24033
18:27:18,960 --> 18:27:22,320
ar fi extragerea cifrelor dependente

24034
18:27:20,640 --> 18:27:24,796
caracteristici precum curbura diferitelor

24035
18:27:22,320 --> 18:27:27,756
cifre etc. și apoi folosiți un clasificator

24036
18:27:24,796 --> 18:27:29,680
ca SVM pentru a distinge imagini.

24037
18:27:27,756 --> 18:27:31,756
Din nou, dacă ai înțeles că este un

24038
18:27:29,680 --> 18:27:33,600
exemplu de clasificare, dați-vă a

24039
18:27:31,756 --> 18:27:36,080
degetul mare în sus. Și dacă poți să pleci, hei,

24040
18:27:33,600 --> 18:27:38,876
hai să folosim SVM sau alt model pentru asta,

24041
18:27:36,080 --> 18:27:41,756
dă-ți acele două degete în sus pe ea.

24042
18:27:38,876 --> 18:27:44,720
C. Comportamentul unui site web care indică faptul că

24043
18:27:41,756 --> 18:27:47,116
site-ul nu funcționează așa cum a fost proiectat.

24044
18:27:44,720 --> 18:27:49,280
Acesta este un exemplu de detectare a anomaliilor.

24045
18:27:47,116 --> 18:27:51,680
În acest caz, algoritmul învață ce

24046
18:27:49,280 --> 18:27:53,436
este normal și ceea ce nu este normal,

24047
18:27:51,680 --> 18:27:55,680
de obicei prin observarea jurnalelor de la

24048
18:27:53,436 --> 18:27:57,836
site-ul web. Dă-ți degetul mare în sus dacă

24049
18:27:55,680 --> 18:27:59,196
ai luat-o pe aia. Și doar pentru un bonus,

24050
18:27:57,836 --> 18:28:01,360
vă puteți gândi la un alt exemplu de

24051
18:27:59,196 --> 18:28:03,920
detectarea anomaliilor? Una dintre cele pe care le folosesc

24052
18:28:01,360 --> 18:28:06,000
pentru că în propria mea afacere este detectarea

24053
18:28:03,920 --> 18:28:08,080
anomalii de pe piețele de valori. Stoc

24054
18:28:06,000 --> 18:28:10,556
piețele sunt foarte volubile și se comportă

24055
18:28:08,080 --> 18:28:12,556
foarte neregulat. Așa că le găsim neregulate

24056
18:28:10,556 --> 18:28:14,720
zone și apoi găsirea modalităților de urmărire

24057
18:28:12,556 --> 18:28:16,400
mai jos de ce sunt neregulate. A fost ceva

24058
18:28:14,720 --> 18:28:18,156
lansat pe rețelele de socializare? A fost ceva

24059
18:28:16,400 --> 18:28:21,280
eliberat poți vedea unde știind unde

24060
18:28:18,156 --> 18:28:23,196
acea anomalie vă poate ajuta să vă dați seama

24061
18:28:21,280 --> 18:28:25,756
a afla care este răspunsul la el în altul

24062
18:28:23,196 --> 18:28:28,400
zona. D prezicerea salariului an

24063
18:28:25,756 --> 18:28:30,556
individ în funcție de anii săi de

24064
18:28:28,400 --> 18:28:32,244
experiență. Acesta este un exemplu de

24065
18:28:30,556 --> 18:28:33,836
regresie. Această problemă poate fi

24066
18:28:32,244 --> 18:28:35,836
definită matematic ca o funcție

24067
18:28:33,836 --> 18:28:38,156
între ani independenţi de experienţă

24068
18:28:35,836 --> 18:28:40,320
iar variabilele dependente salariul an

24069
18:28:38,156 --> 18:28:42,244
individual. Și dacă ghiciți că asta

24070
18:28:40,320 --> 18:28:43,920
a fost un model de regresie, dați-vă un

24071
18:28:42,244 --> 18:28:46,476
degetul mare în sus. Și dacă ai fi în stare

24072
18:28:43,920 --> 18:28:49,116
amintiți-vă că era între independenți

24073
18:28:46,476 --> 18:28:52,320
și variabile dependente și acei termeni,

24074
18:28:49,116 --> 18:28:55,116
dă-ți două degete în sus. Rezumat. Deci

24075
18:28:52,320 --> 18:28:58,400
pentru a încheia, am trecut peste ceea ce este K

24076
18:28:55,116 --> 18:29:00,556
înseamnă și am trecut și prin diagramă

24077
18:28:58,400 --> 18:29:02,320
de alegerea metodei cotului și

24078
18:29:00,556 --> 18:29:04,476
atribuirea unui centrid aleatoriu lui

24079
18:29:02,320 --> 18:29:06,640
clustere, calculând distanța și

24080
18:29:04,476 --> 18:29:08,244
apoi intrând acolo și dând seama

24081
18:29:06,640 --> 18:29:09,600
care este centroidurile minime și

24082
18:29:08,244 --> 18:29:11,116
calculând distanța și parcurgând

24083
18:29:09,600 --> 18:29:13,360
acea buclă până devine perfectă

24084
18:29:11,116 --> 18:29:16,080
centrid. Și ne-am uitat în cot

24085
18:29:13,360 --> 18:29:17,920
metoda de a alege K pe baza rulării noastre

24086
18:29:16,080 --> 18:29:19,836
clustere într-un număr de variabile

24087
18:29:17,920 --> 18:29:22,156
și găsirea celei mai bune locații pentru asta.

24088
18:29:19,836 --> 18:29:23,920
Am făcut un exemplu frumos de grupare a mașinilor

24089
18:29:22,156 --> 18:29:25,600
cu K înseamnă chiar dacă doar ne-am uitat

24090
18:29:23,920 --> 18:29:27,600
la primele două coloane pentru a o face

24091
18:29:25,600 --> 18:29:29,756
simplu și ușor de reprezentat grafic. Poți cu ușurință

24092
18:29:27,600 --> 18:29:31,196
extrapolează asta și uită-te la toate

24093
18:29:29,756 --> 18:29:33,040
coloane diferite și vezi cum sunt toate

24094
18:29:31,196 --> 18:29:35,836
se potrivesc. Și ne-am uitat la ce este

24095
18:29:33,040 --> 18:29:38,000
regresie logistică. Am discutat despre

24096
18:29:35,836 --> 18:29:40,556
funcția sigmoidă. Ce este logistica

24097
18:29:38,000 --> 18:29:42,720
regresie? Și apoi am intrat într-un

24098
18:29:40,556 --> 18:29:45,436
exemplu de clasificare a tumorilor cu

24099
18:29:42,720 --> 18:29:47,196
logistica. Sper că v-a plăcut partea a doua

24100
18:29:45,436 --> 18:29:49,516
de învățare automată. Deci în cea de azi

24101
18:29:47,196 --> 18:29:52,400
sesiune vom discuta ce model RNN

24102
18:29:49,516 --> 18:29:55,280
este. Mergând înainte, vom vedea de ce ar trebui

24103
18:29:52,400 --> 18:29:58,244
folosim RNN. După aceea vom vedea cum

24104
18:29:55,280 --> 18:30:00,000
RNN funcționează rețeaua neuronală recurentă.

24105
18:29:58,244 --> 18:30:03,196
După acoperirea acestor subiecte ne vom muta

24106
18:30:00,000 --> 18:30:06,960
înainte și vedeți tipuri de RNN recurente

24107
18:30:03,196 --> 18:30:09,040
rețeaua neuronală și aplicațiile RNN.

24108
18:30:06,960 --> 18:30:11,756
La final vom face un laborator hands-off

24109
18:30:09,040 --> 18:30:13,436
demonstrație de analiză a sentimentelor folosind RNN. Deci

24110
18:30:11,756 --> 18:30:15,436
înainte de a începe să avem un simplu

24111
18:30:13,436 --> 18:30:17,516
întrebare pentru a ne peria cunoștințele. Deci

24112
18:30:15,436 --> 18:30:20,720
întrebarea este care sunt aplicațiile

24113
18:30:17,516 --> 18:30:24,156
RNN? Bine, NLP,

24114
18:30:20,720 --> 18:30:25,680
serii cronologice, subtitrări de imagini și toate

24115
18:30:24,156 --> 18:30:27,836
cele de mai sus. Vă rugăm să răspundeți în comentariu

24116
18:30:25,680 --> 18:30:29,756
secțiunea de mai jos și vom actualiza

24117
18:30:27,836 --> 18:30:31,680
răspuns corect în comentariile pin sau

24118
18:30:29,756 --> 18:30:33,040
poți întrerupe acest videoclip, dă-i un

24119
18:30:31,680 --> 18:30:34,720
gandeste-te si raspunde in comentariu

24120
18:30:33,040 --> 18:30:37,280
sectiunea. Înainte de a trece la

24121
18:30:34,720 --> 18:30:39,360
partea de programare, să discutăm despre ce RNN

24122
18:30:37,280 --> 18:30:41,920
este și procedați mai departe pentru același lucru. Deci

24123
18:30:39,360 --> 18:30:44,000
ce este RNN? Rețea neuronală recurentă.

24124
18:30:41,920 --> 18:30:46,080
Deci RNN lucrează pe principiul economisirii

24125
18:30:44,000 --> 18:30:47,920
ieșire pe un anumit strat și alimentare

24126
18:30:46,080 --> 18:30:50,080
aceasta înapoi la intrare pentru a

24127
18:30:47,920 --> 18:30:52,156
prezice rezultatul stratului. Aceasta este

24128
18:30:50,080 --> 18:30:54,556
cum se poate converti o rețea neuronală de alimentare

24129
18:30:52,156 --> 18:30:56,080
într-o rețea neuronală recurentă RN. The

24130
18:30:54,556 --> 18:30:58,476
nodul în diferite straturi de neuron

24131
18:30:56,080 --> 18:31:00,876
rețeaua sunt comprimate pentru a forma un singur

24132
18:30:58,476 --> 18:31:03,280
stratul rețelei neuronale recurente. A B

24133
18:31:00,876 --> 18:31:05,040
și C sunt parametrii neuronali

24134
18:31:03,280 --> 18:31:08,720
rețea. Acum că înțelegi ce

24135
18:31:05,040 --> 18:31:11,196
RNN este, să ne uităm la modul în care RNN.

24136
18:31:08,720 --> 18:31:13,196
Bine. Deci de ce RNN? RNN au fost create

24137
18:31:11,196 --> 18:31:14,960
pentru că există puține probleme în feed

24138
18:31:13,196 --> 18:31:16,960
rețeaua neuronală înainte nu poate gestiona

24139
18:31:14,960 --> 18:31:19,516
datele secvențiale iau în considerare numai

24140
18:31:16,960 --> 18:31:21,600
intrarea curentă nu poate memora anterior

24141
18:31:19,516 --> 18:31:24,720
intrare. Bine. Deci solutia acestora

24142
18:31:21,600 --> 18:31:26,720
problemele sunt RNN și RNN se pot descurca

24143
18:31:24,720 --> 18:31:28,960
date secvenţiale acceptând curentul

24144
18:31:26,720 --> 18:31:31,516
datele de intrare și intrarea primită anterior

24145
18:31:28,960 --> 18:31:33,600
date. Deci RNN poate memora intrarea anterioară

24146
18:31:31,516 --> 18:31:37,280
datorită memoriei lor interne. Atat de miscator

24147
18:31:33,600 --> 18:31:40,476
înainte să vedem cum funcționează rețelele RNN

24148
18:31:37,280 --> 18:31:42,640
munca. Bine. Deci stratul de intrare X ia

24149
18:31:40,476 --> 18:31:44,720
o intrare în rețeaua neuronală și

24150
18:31:42,640 --> 18:31:46,720
procesează-l și îl trece în

24151
18:31:44,720 --> 18:31:49,040
stratul mijlociu. Marginea stratului mijlociu poate

24152
18:31:46,720 --> 18:31:51,116
constau din mai multe straturi ascunse fiecare

24153
18:31:49,040 --> 18:31:53,836
cu funcţia de activare proprie şi

24154
18:31:51,116 --> 18:31:55,836
greutate și părtiniri. Dacă ai un neuron

24155
18:31:53,836 --> 18:31:57,920
rețea în care diverșii parametri ai

24156
18:31:55,836 --> 18:32:00,400
diferite straturi ascunse nu sunt afectate

24157
18:31:57,920 --> 18:32:02,720
de stratul anterior care este neuralul

24158
18:32:00,400 --> 18:32:06,080
atunci rețeaua nu are memorie

24159
18:32:02,720 --> 18:32:07,680
puteți folosi RNN. Deci RNN va face

24160
18:32:06,080 --> 18:32:09,836
standardizați diferitele activări

24161
18:32:07,680 --> 18:32:11,516
funcţia şi ponderi şi părtiniri astfel încât

24162
18:32:09,836 --> 18:32:13,360
fiecare strat ascuns are același

24163
18:32:11,516 --> 18:32:15,196
parametrul. Apoi, în loc să creeze

24164
18:32:13,360 --> 18:32:18,000
mai multe straturi ascunse, se va crea

24165
18:32:15,196 --> 18:32:20,320
o buclă de capăt peste el de câte ori are

24166
18:32:18,000 --> 18:32:23,516
necesar. Așa că mergând înainte, să vedem

24167
18:32:20,320 --> 18:32:25,040
tipuri de RNN. Deci există patru tipuri de

24168
18:32:23,516 --> 18:32:27,116
RNN

24169
18:32:25,040 --> 18:32:30,720
unu la unu,

24170
18:32:27,116 --> 18:32:32,244
unu la multi, multi la multi si multi la

24171
18:32:30,720 --> 18:32:35,836
unul.

24172
18:32:32,244 --> 18:32:37,516
Deci, să vedem RNN unu la unu. Deci asta

24173
18:32:35,836 --> 18:32:39,836
tipul de rețea neuronală este cunoscut sub numele de

24174
18:32:37,516 --> 18:32:41,680
rețeaua neuronală vanilie. Este folosit pentru

24175
18:32:39,836 --> 18:32:43,920
problemă generală de învățare automată care

24176
18:32:41,680 --> 18:32:45,756
are o singură intrare și o singură ieșire.

24177
18:32:43,920 --> 18:32:48,000
Acum vezi

24178
18:32:45,756 --> 18:32:50,320
unul la mai mulți RNN. Acest tip de neuron

24179
18:32:48,000 --> 18:32:52,796
rețeaua are o singură intrare și mai multe

24180
18:32:50,320 --> 18:32:55,360
iesiri. Un exemplu în acest sens este o imagine

24181
18:32:52,796 --> 18:32:58,400
subtitrare. Acum să vedem de la mulți la unul

24182
18:32:55,360 --> 18:33:00,400
RNN. Acest RNN preia o secvență de intrare

24183
18:32:58,400 --> 18:33:02,320
și generează o singură ieșire. Sentiment

24184
18:33:00,400 --> 18:33:04,556
analiza este un bun exemplu de acest fel

24185
18:33:02,320 --> 18:33:06,876
a rețelei neuronale unde o propoziție dată

24186
18:33:04,556 --> 18:33:08,796
poate fi clasificat ca exprimând pozitiv

24187
18:33:06,876 --> 18:33:12,000
sau sentiment negativ. Și ultimul

24188
18:33:08,796 --> 18:33:13,680
este de la mulți la mulți RNN. Acest RNN ia un

24189
18:33:12,000 --> 18:33:15,516
succesiune de intrări și generează a

24190
18:33:13,680 --> 18:33:17,436
secvența de ieșire. Traducere automată

24191
18:33:15,516 --> 18:33:19,680
este cel al exemplului. Atat de miscator

24192
18:33:17,436 --> 18:33:22,556
înainte, să vedem aplicarea

24193
18:33:19,680 --> 18:33:25,836
rețea neuronală recurentă. Prima este

24194
18:33:22,556 --> 18:33:28,080
subtitrarea imaginii. RNN-urile sunt obișnuite

24195
18:33:25,836 --> 18:33:30,400
legendă o imagine analizând

24196
18:33:28,080 --> 18:33:32,720
activitati prezente. Al doilea este

24197
18:33:30,400 --> 18:33:34,796
previziunea serii temporale. Orice serie temporală

24198
18:33:32,720 --> 18:33:36,476
problemă precum prezicerea prețurilor la

24199
18:33:34,796 --> 18:33:39,360
stocurile într-o anumită lună pot fi

24200
18:33:36,476 --> 18:33:41,836
rezolvat folosind RNN. Iar al treilea este

24201
18:33:39,360 --> 18:33:43,756
procesarea limbajului natural. Exploatarea textului

24202
18:33:41,836 --> 18:33:47,040
iar analiza sentimentelor poate fi efectuată

24203
18:33:43,756 --> 18:33:49,756
folosind RNN sau NLP. Limbajul natural

24204
18:33:47,040 --> 18:33:52,400
prelucrare. Al patrulea este o mașină

24205
18:33:49,756 --> 18:33:54,960
traducere. Dată o intrare într-unul

24206
18:33:52,400 --> 18:33:56,796
limba, RNN-urile pot fi folosite pentru a traduce

24207
18:33:54,960 --> 18:33:58,556
intrarea într-o limbă diferită ca

24208
18:33:56,796 --> 18:34:00,556
ieșire. Deci acum să trecem la

24209
18:33:58,556 --> 18:34:02,796
parte de programare. Mai întâi vom importa

24210
18:34:00,556 --> 18:34:05,040
unele biblioteci biblioteci majore pentru

24211
18:34:02,796 --> 18:34:09,244
mai întâi vom importa pentru cadrul de date.

24212
18:34:05,040 --> 18:34:09,244
Deci voi scrie import

24213
18:34:12,244 --> 18:34:17,600
pd.

24214
18:34:13,756 --> 18:34:20,476
Al doilea este import numpy

24215
18:34:17,600 --> 18:34:22,400
ca np.

24216
18:34:20,476 --> 18:34:24,000
Deci, Pandas este o bibliotecă de software scrisă

24217
18:34:22,400 --> 18:34:26,156
pentru limbajul de programare python pentru

24218
18:34:24,000 --> 18:34:27,756
manipularea și analiza datelor. În

24219
18:34:26,156 --> 18:34:29,516
în special, oferă o structură de date

24220
18:34:27,756 --> 18:34:32,244
şi operaţii de manipulare

24221
18:34:29,516 --> 18:34:34,720
tabele numerice și seriile temporale.

24222
18:34:32,244 --> 18:34:36,556
Și acest numpy numpy este o bibliotecă pentru

24223
18:34:34,720 --> 18:34:39,196
adăugarea limbajului de programare Python

24224
18:34:36,556 --> 18:34:41,836
suport pentru patru mari multi-dimensionale

24225
18:34:39,196 --> 18:34:44,080
matrice și matrice împreună cu un mare

24226
18:34:41,836 --> 18:34:46,796
colecție de matematică de înaltă calitate

24227
18:34:44,080 --> 18:34:49,680
funcția pentru a opera pe aceste matrice.

24228
18:34:46,796 --> 18:34:54,476
Bine. Deci, pentru a trasa, vom importa

24229
18:34:49,680 --> 18:34:56,476
unele biblioteci precum seabon

24230
18:34:54,476 --> 18:34:59,836
ca

24231
18:34:56,476 --> 18:35:01,280
SNS. Aceasta nu este doar o formă scurtă

24232
18:34:59,836 --> 18:35:04,796
de nu trebuie să scriem din nou și

24233
18:35:01,280 --> 18:35:08,600
din nou CON c putem scrie SNS. Deci atunci

24234
18:35:04,796 --> 18:35:08,600
altul este de la

24235
18:35:08,960 --> 18:35:11,960
wordcloud

24236
18:35:12,720 --> 18:35:15,720
port

24237
18:35:24,476 --> 18:35:28,796
mattplot lib

24238
18:35:27,116 --> 18:35:30,796
punct

24239
18:35:28,796 --> 18:35:34,000
pip plot

24240
18:35:30,796 --> 18:35:36,640
s plt. bibliotecă.

24241
18:35:34,000 --> 18:35:39,756
Bine, deci Seabone este o bibliotecă care folosește

24242
18:35:36,640 --> 18:35:41,756
Matt plot lib dedesubt pentru a trasa grafice.

24243
18:35:39,756 --> 18:35:44,320
Va fi folosit pentru a vizualiza zandom

24244
18:35:41,756 --> 18:35:46,244
distribuție și norul de cuvinte este a

24245
18:35:44,320 --> 18:35:48,476
reprezentări vizuale

24246
18:35:46,244 --> 18:35:50,320
de cuvinte. Creatorii de cloud sunt obișnuiți

24247
18:35:48,476 --> 18:35:52,796
evidențiați cuvinte și expresii populare

24248
18:35:50,320 --> 18:35:55,436
bazată pe frecvență și relevanță. Ei

24249
18:35:52,796 --> 18:35:57,680
vă oferă o imagine rapidă și simplă

24250
18:35:55,436 --> 18:36:00,000
perspective care pot duce la o mai mare profunzime

24251
18:35:57,680 --> 18:36:01,756
analiza. Și acest mattplot lil mattplot

24252
18:36:00,000 --> 18:36:03,360
lib este o bibliotecă de plotting pentru python

24253
18:36:01,756 --> 18:36:04,876
limbajul de programare și numerica acestuia

24254
18:36:03,360 --> 18:36:07,360
matematică

24255
18:36:04,876 --> 18:36:09,836
extensia ext numpy. Oferă un

24256
18:36:07,360 --> 18:36:12,156
API orientat pe obiecte pentru încorporarea graficelor

24257
18:36:09,836 --> 18:36:13,680
în aplicare folosind scop general

24258
18:36:12,156 --> 18:36:19,920
UI.

24259
18:36:13,680 --> 18:36:22,400
Bine. Ca tinker wxython QT sau gtk.

24260
18:36:19,920 --> 18:36:25,280
Deci, să importăm câteva

24261
18:36:22,400 --> 18:36:28,080
NLTK

24262
18:36:25,280 --> 18:36:29,600
trusa de instrumente pentru limbajul natural.

24263
18:36:28,080 --> 18:36:32,156
Deci

24264
18:36:29,600 --> 18:36:35,156
Voi scrie import

24265
18:36:32,156 --> 18:36:35,156
NLTK.

24266
18:36:36,556 --> 18:36:40,640
Bine. din

24267
18:36:38,960 --> 18:36:43,040
NLTK

24268
18:36:40,640 --> 18:36:46,040
tulpina punct

24269
18:36:43,040 --> 18:36:46,040
importator

24270
18:36:54,080 --> 18:37:01,960
apoi din corpus de puncte analitice

24271
18:36:58,960 --> 18:37:01,960
importurilor

24272
18:37:06,156 --> 18:37:10,400
şi

24273
18:37:08,720 --> 18:37:14,600
din

24274
18:37:10,400 --> 18:37:14,600
Bilet NL dot tokenize

24275
18:37:14,960 --> 18:37:17,960
port

24276
18:37:21,600 --> 18:37:24,600
tokeniza

24277
18:37:25,040 --> 18:37:30,640
NLTK trusa de instrumente pentru limbajul natural sau

24278
18:37:28,080 --> 18:37:33,280
mai frecvent NLTK este un costum de

24279
18:37:30,640 --> 18:37:35,196
biblioteci şi programe pentru simbolice şi

24280
18:37:33,280 --> 18:37:37,040
procesare statică a limbajului natural pentru

24281
18:37:35,196 --> 18:37:39,516
Engleză scrisă în programare Python

24282
18:37:37,040 --> 18:37:41,680
limbaj și acestea sunt cuvinte stop. Opreste-te

24283
18:37:39,516 --> 18:37:44,000
cuvintele sunt cuvinte atât de comune

24284
18:37:41,680 --> 18:37:46,960
sunt practic ignorate de tipic

24285
18:37:44,000 --> 18:37:48,796
tokenizer și acest cuvânt tokenize este a

24286
18:37:46,960 --> 18:37:51,516
funcție în Python care împarte un anumit

24287
18:37:48,796 --> 18:37:54,876
propoziție în cuvinte folosind analitice

24288
18:37:51,516 --> 18:37:56,640
bibliotecă. Bine. Deci, să importăm câteva

24289
18:37:54,876 --> 18:37:59,756
scikitlearn

24290
18:37:56,640 --> 18:38:02,000
bibliotecă. Deci pentru asta voi scrie din

24291
18:37:59,756 --> 18:38:05,640
skarn

24292
18:38:02,000 --> 18:38:05,640
model de puncte

24293
18:38:05,756 --> 18:38:10,244
colectare

24294
18:38:08,000 --> 18:38:12,320
import

24295
18:38:10,244 --> 18:38:15,320
tren

24296
18:38:12,320 --> 18:38:15,320
test.

24297
18:38:17,516 --> 18:38:23,400
Bine. Apoi din skarn

24298
18:38:25,516 --> 18:38:29,320
caracteristica punct

24299
18:38:31,040 --> 18:38:34,040
extractie

24300
18:38:34,240 --> 18:38:39,240
import text punct

24301
18:38:39,760 --> 18:38:42,760
vectorizator.

24302
18:38:44,720 --> 18:38:51,120
Și apoi de la

24303
18:38:47,120 --> 18:38:52,720
matrici de puncte skarn

24304
18:38:51,120 --> 18:38:54,720
matricea

24305
18:38:52,720 --> 18:38:58,360
import

24306
18:38:54,720 --> 18:38:58,360
metrica confuziei

24307
18:39:01,920 --> 18:39:04,920
clasificare.

24308
18:39:08,552 --> 18:39:13,760
Bine.

24309
18:39:10,552 --> 18:39:15,360
Deci, scikitlarn este un software gratuit

24310
18:39:13,760 --> 18:39:17,192
bibliotecă de învățare automată pentru Python

24311
18:39:15,360 --> 18:39:18,960
limbaj de programare. Prezintă

24312
18:39:17,192 --> 18:39:21,280
diverse clasificare, regresie și

24313
18:39:18,960 --> 18:39:22,872
algoritmi de grupare, inclusiv suport

24314
18:39:21,280 --> 18:39:25,192
Învățare automată vectorială, logistică

24315
18:39:22,872 --> 18:39:28,160
regresie și multe altele ca aleatoriu

24316
18:39:25,192 --> 18:39:30,320
clasificator forestier. Și acest test de tren

24317
18:39:28,160 --> 18:39:32,552
metoda split este folosită pentru a ne împărți datele

24318
18:39:30,320 --> 18:39:34,640
în tren și în set de testare. În primul rând, avem nevoie

24319
18:39:32,552 --> 18:39:38,400
pentru a ne împărți datele în caracteristici precum X

24320
18:39:34,640 --> 18:39:40,400
și etichete Y. Și acest vector TF ID

24321
18:39:38,400 --> 18:39:44,000
convertește o colecție de documente brute

24322
18:39:40,400 --> 18:39:47,360
într-o matrice de caracteristici TF. Postul

24323
18:39:44,000 --> 18:39:49,600
text sau ce să vectorizeze ce

24324
18:39:47,360 --> 18:39:51,760
încorporarea implementării Python și asta

24325
18:39:49,600 --> 18:39:53,600
matricea de confuzie. O matrice de confuzie este

24326
18:39:51,760 --> 18:39:54,872
un tabel care este folosit pentru a defini

24327
18:39:53,600 --> 18:39:57,600
efectuarea unei clasificări

24328
18:39:54,872 --> 18:40:00,320
algoritm. Bine.

24329
18:39:57,600 --> 18:40:04,512
Apoi vom importa câteva biblioteci precum

24330
18:40:00,320 --> 18:40:04,512
bal skarn

24331
18:40:08,720 --> 18:40:13,480
face model liniar

24332
18:40:15,512 --> 18:40:20,600
port

24333
18:40:17,600 --> 18:40:20,600
logistică

24334
18:40:21,040 --> 18:40:26,960
regresie.

24335
18:40:23,760 --> 18:40:29,960
Deci de la

24336
18:40:26,960 --> 18:40:29,960
colonm

24337
18:40:32,640 --> 18:40:35,640
port

24338
18:40:40,000 --> 18:40:43,320
iar din

24339
18:40:51,192 --> 18:40:56,960
import

24340
18:40:54,000 --> 18:41:00,600
aleatoriu

24341
18:40:56,960 --> 18:41:00,600
clasificator de păduri.

24342
18:41:01,040 --> 18:41:10,360
Bine. Apoi de la

24343
18:41:04,480 --> 18:41:10,360
baza de nume skarn dot

24344
18:41:10,720 --> 18:41:13,720
poroli

24345
18:41:15,832 --> 18:41:18,832
baza.

24346
18:41:19,440 --> 18:41:26,320
Bine.

24347
18:41:22,400 --> 18:41:28,872
Deci totul este corect. Vei vedea

24348
18:41:26,320 --> 18:41:31,360
în timp ce alerga. Deci regresie logistică

24349
18:41:28,872 --> 18:41:34,240
estima probabilitatea unui eveniment

24350
18:41:31,360 --> 18:41:36,080
care apar, cum ar fi a votat sau nu a votat

24351
18:41:34,240 --> 18:41:39,640
pe baza unui set de date dat al

24352
18:41:36,080 --> 18:41:39,640
variabilă independentă.

24353
18:41:40,160 --> 18:41:47,680
L SVC estimarea regresiei logistice

24354
18:41:44,480 --> 18:41:49,832
scuze mașină de suport liniar vector SVC

24355
18:41:47,680 --> 18:41:52,552
este un algoritm care încearcă să găsească a

24356
18:41:49,832 --> 18:41:54,800
hiperplan pentru a maximiza distanța

24357
18:41:52,552 --> 18:41:56,872
între probele clasificate şi aceasta

24358
18:41:54,800 --> 18:41:59,512
clasificatorul de pădure aleatoriu creează un set

24359
18:41:56,872 --> 18:42:03,120
de arbori de decizie dintr-un mod aleatoriu

24360
18:41:59,512 --> 18:42:05,680
subsetul selectat al setului de antrenament

24361
18:42:03,120 --> 18:42:07,512
iar acest Bernoli NBoli

24362
18:42:05,680 --> 18:42:09,512
baza de nume este o parte a bazei de nume

24363
18:42:07,512 --> 18:42:11,440
familie se bazează pe Bernoli

24364
18:42:09,512 --> 18:42:15,280
distribuție uțiune și acceptați numai

24365
18:42:11,440 --> 18:42:17,920
valori binare care sunt zero sau unu.

24366
18:42:15,280 --> 18:42:20,400
Deci, să importăm ceva tensorflow. Deci

24367
18:42:17,920 --> 18:42:22,480
import

24368
18:42:20,400 --> 18:42:24,240
tensorflow

24369
18:42:22,480 --> 18:42:29,832
punct

24370
18:42:24,240 --> 18:42:32,240
compad dot v2 și

24371
18:42:29,832 --> 18:42:35,192
apoi import

24372
18:42:32,240 --> 18:42:37,192
tensorflow

24373
18:42:35,192 --> 18:42:40,400
seturi de date

24374
18:42:37,192 --> 18:42:42,400
ca tfds.

24375
18:42:40,400 --> 18:42:43,832
Deci, TensorFlow este un program gratuit și open-source

24376
18:42:42,400 --> 18:42:46,080
bibliotecă pentru învățarea automată și

24377
18:42:43,832 --> 18:42:48,240
inteligență artificială într-o gamă largă

24378
18:42:46,080 --> 18:42:50,480
de sarcină, dar se concentrează în mod special asupra

24379
18:42:48,240 --> 18:42:57,080
antrenament și inferență neuronale profunde

24380
18:42:50,480 --> 18:42:57,080
retelelor. Bine, să importăm avertismente.

24381
18:42:57,512 --> 18:43:01,640
Nimic. Avertizare.

24382
18:43:02,960 --> 18:43:06,120
Avertismentele

24383
18:43:11,832 --> 18:43:14,832
import

24384
18:43:18,000 --> 18:43:21,000
sfoară

24385
18:43:21,280 --> 18:43:25,920
import.

24386
18:43:24,160 --> 18:43:28,552
Deci totul este de bază. Doar să vedem

24387
18:43:25,920 --> 18:43:31,040
muratul. De obicei este un Python

24388
18:43:28,552 --> 18:43:33,680
folosit în principal la serializare și

24389
18:43:31,040 --> 18:43:37,040
deserializarea unei structuri de obiecte Python.

24390
18:43:33,680 --> 18:43:40,040
Bine, hai să o rulăm. Sa vedem cati

24391
18:43:37,040 --> 18:43:40,040
eroare

24392
18:43:42,960 --> 18:43:46,960
după aceea vom încărca setul de date și

24393
18:43:45,680 --> 18:43:49,440
uh, vom trece prin date

24394
18:43:46,960 --> 18:43:52,000
vizualizare. Bine. Norul de cuvinte nu poate

24395
18:43:49,440 --> 18:43:55,552
import nume nor de cuvinte. Bine. C C va

24396
18:43:52,000 --> 18:43:55,552
fii capital aici.

24397
18:43:57,280 --> 18:44:00,920
pădure la întâmplare.

24398
18:44:06,480 --> 18:44:12,080
Bine, încă se încarcă aici. hai sa

24399
18:44:08,872 --> 18:44:14,480
vedea. Bine, deci încărcarea este gata. Deci acum

24400
18:44:12,080 --> 18:44:19,160
hai să încărcăm setul de date. Deci vom scrie

24401
18:44:14,480 --> 18:44:19,160
datele sunt egale cu PD dot

24402
18:44:19,440 --> 18:44:24,440
citire

24403
18:44:21,440 --> 18:44:24,440
CSV

24404
18:44:26,320 --> 18:44:29,320
nume

24405
18:44:37,440 --> 18:44:40,440
test.

24406
18:44:48,480 --> 18:44:53,280
Deci, puteți găsi acest set de date pe

24407
18:44:50,552 --> 18:44:57,240
caseta de descriere de mai jos.

24408
18:44:53,280 --> 18:44:57,240
Conform intrebarii

24409
18:45:04,400 --> 18:45:07,400
polaritate

24410
18:45:16,400 --> 18:45:20,480
ID,

24411
18:45:18,000 --> 18:45:22,160
datele paragrafelor,

24412
18:45:20,480 --> 18:45:24,400
virgulă

24413
18:45:22,160 --> 18:45:24,400
interogare

24414
18:45:46,480 --> 18:45:50,160
pentru că uiți virgula

24415
18:46:01,832 --> 18:46:05,640
polaritate. Bine.

24416
18:46:14,720 --> 18:46:18,040
Pare bine.

24417
18:46:19,192 --> 18:46:23,480
Lasă-mă să schimb asta mai întâi

24418
18:46:28,480 --> 18:46:33,000
folosește RNN.

24419
18:46:33,600 --> 18:46:42,080
Bine.

24420
18:46:36,320 --> 18:46:45,080
Deci aici voi scrie date plus punct de date

24421
18:46:42,080 --> 18:46:45,080
eşantion.

24422
18:46:45,920 --> 18:46:48,920
hai sa

24423
18:46:49,192 --> 18:46:52,512
fa unul.

24424
18:47:05,440 --> 18:47:14,120
Bine. Deci, permiteți-mi să vă spun pe scurt

24425
18:47:09,920 --> 18:47:14,120
că ceea ce mergem. Bine.

24426
18:47:14,872 --> 18:47:20,000
Permiteți-mi să vă spun ce o să facem

24427
18:47:16,960 --> 18:47:22,872
această analiză a sentimentelor folosind ARN. Deci in

24428
18:47:20,000 --> 18:47:26,160
acest demo ca și cum vei vedea uh text

24429
18:47:22,872 --> 18:47:27,832
prelucrarea pe setul de date Twitter și după

24430
18:47:26,160 --> 18:47:29,832
că vom efectua diferite mașini

24431
18:47:27,832 --> 18:47:32,080
algoritmi de învățare asupra datelor precum

24432
18:47:29,832 --> 18:47:35,192
regresie logistică pădure aleatoare

24433
18:47:32,080 --> 18:47:38,160
clasificator SVC nas pentru a clasifica pozitiv

24434
18:47:35,192 --> 18:47:40,960
și tipi negativi. După aceea o voi face

24435
18:47:38,160 --> 18:47:43,360
construiți, de asemenea, rețeaua neuronală recurentă RNN

24436
18:47:40,960 --> 18:47:46,240
care este cel mai potrivit pentru un astfel de text

24437
18:47:43,360 --> 18:47:48,320
analiza sentimentelor. Bine. Din moment ce este o

24438
18:47:46,240 --> 18:47:52,000
set de date secvenţiale care este o cerinţă

24439
18:47:48,320 --> 18:47:54,552
pentru rețeaua RNN. Deci haideți să ne aruncăm.

24440
18:47:52,000 --> 18:47:56,960
Deci acum

24441
18:47:54,552 --> 18:47:58,800
vom vedea vizualizarea datelor

24442
18:47:56,960 --> 18:48:01,832
setul de date detalii țintă precum

24443
18:47:58,800 --> 18:48:04,240
polaritatea tweet-urilor zero negativ.

24444
18:48:01,832 --> 18:48:07,760
Bine. apoi data ca data a

24445
18:48:04,240 --> 18:48:10,552
tweet și polaritatea și utilizatorul asta

24446
18:48:07,760 --> 18:48:13,960
ce a tweetat apoi textul bine, așa că eu

24447
18:48:10,552 --> 18:48:13,960
va scrie print

24448
18:48:15,512 --> 18:48:18,832
set de date

24449
18:48:21,600 --> 18:48:25,600
date

24450
18:48:23,440 --> 18:48:28,600
forma

24451
18:48:25,600 --> 18:48:28,600
bine

24452
18:48:30,552 --> 18:48:40,640
lasă-mă mai întâi să fac așa. Da.

24453
18:48:35,192 --> 18:48:43,600
Deci sunt 20

24454
18:48:40,640 --> 18:48:46,552
sau poți spune două ca rânduri și șase

24455
18:48:43,600 --> 18:48:49,832
numărul de coloane. Bine. Deci este uriaș

24456
18:48:46,552 --> 18:48:52,240
date. Voi găsi acest set de date

24457
18:48:49,832 --> 18:48:55,960
din caseta de descriere de mai jos. Deci aici

24458
18:48:52,240 --> 18:48:55,960
sa vedem datele

24459
18:48:57,360 --> 18:49:03,040
și de ce folosesc capul. Capul este folosit pentru

24460
18:49:01,120 --> 18:49:06,440
ca

24461
18:49:03,040 --> 18:49:06,440
pentru afisare

24462
18:49:07,760 --> 18:49:12,720
primele 10 rânduri ale setului de date. Dacă vrei

24463
18:49:10,400 --> 18:49:15,512
folosește coada în loc de cap, se va arăta

24464
18:49:12,720 --> 18:49:18,240
ultimele 10 rânduri ale setului de date. Bine.

24465
18:49:15,512 --> 18:49:21,360
Aici polaritatea zero. Zero înseamnă negativ

24466
18:49:18,240 --> 18:49:25,000
iar patru înseamnă pozitiv. Bine. Ca tine

24467
18:49:21,360 --> 18:49:25,000
poate lua în considerare 01.

24468
18:49:25,920 --> 18:49:33,080
Acesta este ID-ul, data, apoi interogarea. apoi utilizator

24469
18:49:29,760 --> 18:49:33,080
apoi textul.

24470
18:49:35,360 --> 18:49:41,760
Bine. Deci

24471
18:49:38,400 --> 18:49:44,760
aici voi face date

24472
18:49:41,760 --> 18:49:44,760
claritate.

24473
18:49:51,440 --> 18:49:56,080
Bine. Acestea sunt cele 04. Bine.

24474
18:49:54,080 --> 18:49:58,960
Unicitatea. Zero înseamnă negativ și

24475
18:49:56,080 --> 18:50:00,400
patru înseamnă pozitiv. înlocuind valoarea

24476
18:49:58,960 --> 18:50:02,000
patru ca unul pentru ușurința de

24477
18:50:00,400 --> 18:50:05,512
înțelegând ce ți-am spus, poți

24478
18:50:02,000 --> 18:50:08,512
considera ca 01. Deci date

24479
18:50:05,512 --> 18:50:08,512
polaritatea

24480
18:50:09,680 --> 18:50:15,240
la date

24481
18:50:12,240 --> 18:50:15,240
polaritatea

24482
18:50:19,120 --> 18:50:26,120
la unul

24483
18:50:22,552 --> 18:50:26,120
și apoi date.

24484
18:50:30,400 --> 18:50:36,720
Deci acum puteți vedea 0 1 0 1 0 1 1 0.

24485
18:50:34,320 --> 18:50:38,800
Bine.

24486
18:50:36,720 --> 18:50:43,360
Deci, dacă vei scrie doar cap, o va face

24487
18:50:38,800 --> 18:50:46,080
afișați numai primele cinci rânduri. Bine.

24488
18:50:43,360 --> 18:50:48,872
Deci acum să folosim o funcție Python

24489
18:50:46,080 --> 18:50:52,600
descrie

24490
18:50:48,872 --> 18:50:52,600
date dotribe.

24491
18:50:59,280 --> 18:51:05,120
Deci, după cum puteți vedea aici, numărul este de doi lakh

24492
18:51:02,640 --> 18:51:08,400
iar media rândului anume este

24493
18:51:05,120 --> 18:51:12,160
acesta și ID-ul este acest standard

24494
18:51:08,400 --> 18:51:15,360
abatere valoarea minima 25% 50%

24495
18:51:12,160 --> 18:51:18,480
iar cele 75% și maximul

24496
18:51:15,360 --> 18:51:24,040
bine să vedem numărul de pozitive

24497
18:51:18,480 --> 18:51:24,040
versus propoziție etichetată negativă bine

24498
18:51:27,832 --> 18:51:34,872
asa ca aici voi scrie pozitive

24499
18:51:32,240 --> 18:51:37,872
la date

24500
18:51:34,872 --> 18:51:37,872
polaritatea

24501
18:51:41,440 --> 18:51:47,280
polaritatea punctelor de date

24502
18:51:44,872 --> 18:51:50,960
= 1.

24503
18:51:47,280 --> 18:51:53,960
Atunci este

24504
18:51:50,960 --> 18:51:53,960
date

24505
18:51:54,720 --> 18:51:57,720
polaritatea

24506
18:51:58,872 --> 18:52:02,920
polaritatea punctelor de date

24507
18:52:03,192 --> 18:52:06,832
este egal cu zero.

24508
18:52:08,240 --> 18:52:11,240
Imprimați

24509
18:52:11,600 --> 18:52:20,040
total

24510
18:52:14,000 --> 18:52:20,040
lungimea datelor este

24511
18:52:27,680 --> 18:52:31,832
format punct

24512
18:52:30,320 --> 18:52:35,480
date

24513
18:52:31,832 --> 18:52:35,480
formă de punct. Da.

24514
18:52:50,552 --> 18:52:54,600
Acum voi imprima

24515
18:52:54,960 --> 18:53:03,552
lungimea totală, negativul și

24516
18:52:56,640 --> 18:53:03,552
pozitiv. Bine. Deci număr de pozitive

24517
18:53:09,120 --> 18:53:12,120
Bine.

24518
18:53:14,872 --> 18:53:17,872
Format

24519
18:53:18,480 --> 18:53:21,480
pozitive.

24520
18:53:24,080 --> 18:53:27,720
Deci voi copia

24521
18:53:29,120 --> 18:53:34,240
asta și lipiți-l aici.

24522
18:53:31,832 --> 18:53:37,240
Și aici voi face modificările pentru

24523
18:53:34,240 --> 18:53:37,240
negative.

24524
18:53:43,512 --> 18:53:47,320
Bine. Acum să vedem.

24525
18:53:50,960 --> 18:53:55,480
Deci aici polaritatea nu este definită.

24526
18:54:07,920 --> 18:54:11,600
Deci, după cum puteți vedea, lungimea totală a

24527
18:54:09,832 --> 18:54:17,720
datele sunt de două lakh și numărul de

24528
18:54:11,600 --> 18:54:17,720
propozițiile pozitive sunt ca un lakh 46

24529
18:54:18,960 --> 18:54:24,512
și numărul de negative ortografie ok

24530
18:54:21,512 --> 18:54:24,512
aceasta

24531
18:54:25,832 --> 18:54:30,720
numărul de propoziții cu text negativ

24532
18:54:28,320 --> 18:54:35,400
99.954.

24533
18:54:30,720 --> 18:54:35,400
Bine. Deci acum avem o scurtă date.

24534
18:54:53,192 --> 18:55:02,360
Deci acum să obținem un număr de cuvinte p de text.

24535
18:54:56,872 --> 18:55:02,360
Deci pentru asta voi scrie

24536
18:55:05,280 --> 18:55:09,960
numără

24537
18:55:06,960 --> 18:55:09,960
cuvinte

24538
18:55:13,760 --> 18:55:18,872
gata

24539
18:55:16,240 --> 18:55:21,512
lungime de

24540
18:55:18,872 --> 18:55:21,512
începe împărțirea.

24541
18:55:23,920 --> 18:55:26,920
Bine.

24542
18:55:29,360 --> 18:55:33,192
Și acum să tragem un număr de cuvinte

24543
18:55:31,760 --> 18:55:36,000
distribuţie atât pentru pozitiv cât şi

24544
18:55:33,192 --> 18:55:40,000
negativ. Așa că voi crea o diagramă de bare.

24545
18:55:36,000 --> 18:55:42,720
Deci pentru asta o voi scrie

24546
18:55:40,000 --> 18:55:45,720
cuvânt

24547
18:55:42,720 --> 18:55:45,720
numără.

24548
18:55:45,920 --> 18:55:50,552
date

24549
18:55:48,480 --> 18:55:54,400
text

24550
18:55:50,552 --> 18:55:57,872
se aplică punct

24551
18:55:54,400 --> 18:55:57,872
dar numără.

24552
18:56:00,552 --> 18:56:08,640
Bine, atunci voi scrie P pozitiv = date

24553
18:56:05,920 --> 18:56:11,640
apoi

24554
18:56:08,640 --> 18:56:11,640
numără

24555
18:56:15,120 --> 18:56:19,160
polaritatea punctelor de date

24556
18:56:19,280 --> 18:56:22,920
este egal cu 1

24557
18:56:23,760 --> 18:56:29,640
şi

24558
18:56:25,680 --> 18:56:29,640
lasa-ma sa copiez asta aici

24559
18:56:35,192 --> 18:56:38,832
Voi scrie zero

24560
18:56:41,120 --> 18:56:48,240
si bine atunci

24561
18:56:44,552 --> 18:56:51,800
plt dot figura

24562
18:56:48,240 --> 18:56:51,800
și dimensiunea figurii

24563
18:56:52,000 --> 18:56:57,960
equ= to

24564
18:56:53,920 --> 18:56:57,960
12 Mulțumesc.

24565
18:57:07,280 --> 18:57:15,640
Bine. Apoi plt

24566
18:57:12,240 --> 18:57:15,640
LT dota

24567
18:57:18,960 --> 18:57:21,960
45

24568
18:57:23,600 --> 18:57:28,600
apoi plt dot x eticheta

24569
18:57:29,600 --> 18:57:32,920
numărul de cuvinte

24570
18:57:33,440 --> 18:57:36,872
plt punct y etichetă

24571
18:57:38,872 --> 18:57:42,120
si frecventa

24572
18:57:44,720 --> 18:57:52,360
vom scrie uh g

24573
18:57:49,360 --> 18:57:52,360
punct

24574
18:57:55,120 --> 18:58:01,400
virgulă n

24575
18:57:58,400 --> 18:58:01,400
Uh

24576
18:58:19,512 --> 18:58:25,800
alfa, de asemenea, 0,5 Cinci

24577
18:58:30,960 --> 18:58:33,960
pozitiv.

24578
18:58:39,600 --> 18:58:44,920
Bine. Atunci să facem și o legendă.

24579
18:58:46,640 --> 18:58:50,680
Locația ar trebui să fie

24580
18:58:53,600 --> 18:58:56,600
Corect.

24581
18:59:00,800 --> 18:59:08,760
Fals.

24582
18:59:03,600 --> 18:59:08,760
Numărul de cuvinte de date este egal cu

24583
18:59:15,360 --> 18:59:18,920
Bine, răul meu.

24584
18:59:27,512 --> 18:59:31,680
Deci, după cum puteți vedea, pozitivul și

24585
18:59:29,360 --> 18:59:33,192
negative.

24586
18:59:31,680 --> 18:59:35,760
Bine.

24587
18:59:33,192 --> 18:59:37,360
Deci acestea sunt numărul de cuvinte asemănătoare

24588
18:59:35,760 --> 18:59:41,160
distribuţie atât pentru pozitiv cât şi

24589
18:59:37,360 --> 18:59:41,160
negativ. Bine.

24590
18:59:41,600 --> 18:59:47,512
Acum să vedem ce putem face

24591
18:59:45,280 --> 18:59:49,920
get like get the common words in

24592
18:59:47,512 --> 18:59:53,512
set de date de antrenament pentru datele de antrenament

24593
18:59:49,920 --> 18:59:55,040
set. Deci pentru asta voi face

24594
18:59:53,512 --> 18:59:57,512
din

24595
18:59:55,040 --> 19:00:00,512
colecții

24596
18:59:57,512 --> 19:00:00,512
import

24597
19:00:01,280 --> 19:00:04,280
contor

24598
19:00:04,800 --> 19:00:08,640
sau

24599
19:00:07,120 --> 19:00:11,640
cuvinte

24600
19:00:08,640 --> 19:00:11,640
la

24601
19:00:12,160 --> 19:00:15,160
pentru

24602
19:00:18,640 --> 19:00:21,640
testare

24603
19:00:22,080 --> 19:00:27,320
date

24604
19:00:24,320 --> 19:00:27,320
text

24605
19:00:30,640 --> 19:00:36,280
linie

24606
19:00:32,320 --> 19:00:36,280
punct împărțit

24607
19:00:37,360 --> 19:00:44,440
înainte. Cuvânt

24608
19:00:40,080 --> 19:00:44,440
si cuvinte.

24609
19:00:48,000 --> 19:00:53,832
Dacă lungimea de

24610
19:00:51,040 --> 19:00:57,960
cuvânt

24611
19:00:53,832 --> 19:00:57,960
decât doi

24612
19:00:58,552 --> 19:01:04,280
toate

24613
19:01:01,280 --> 19:01:04,280
punct

24614
19:01:05,680 --> 19:01:10,512
cu un punct mai jos

24615
19:01:13,280 --> 19:01:19,120
aici pot scrie counter

24616
19:01:16,480 --> 19:01:22,320
toate cuvintele

24617
19:01:19,120 --> 19:01:27,160
punct cele mai multe

24618
19:01:22,320 --> 19:01:27,160
obișnuit, atunci am nevoie de 20.

24619
19:01:31,440 --> 19:01:36,400
Deci, după cum puteți vedea, acestea sunt cele mai multe

24620
19:01:33,280 --> 19:01:40,240
cuvânt comun folosit ca în fiecare propoziție

24621
19:01:36,400 --> 19:01:43,440
și tu pentru că ai că eu sunt doar drept

24622
19:01:40,240 --> 19:01:46,160
ca asta peste toate.

24623
19:01:43,440 --> 19:01:49,832
Deci acestea sunt cele mai comune cuvinte precum

24624
19:01:46,160 --> 19:01:56,000
a folosit de 64.000 de ori

24625
19:01:49,832 --> 19:01:58,640
și astfel UR este folosit de 8.000 de ori

24626
19:01:56,000 --> 19:02:02,960
asa ceva. Deci acum vom face

24627
19:01:58,640 --> 19:02:05,680
unele date pentru prelucrarea datelor. Bine. Acum

24628
19:02:02,960 --> 19:02:08,640
hai sa facem prelucrarea datelor.

24629
19:02:05,680 --> 19:02:11,640
Deci

24630
19:02:08,640 --> 19:02:11,640
div

24631
19:02:17,600 --> 19:02:23,640
și diagrama curentului cu puncte SNS

24632
19:02:24,320 --> 19:02:29,360
date

24633
19:02:26,552 --> 19:02:32,360
polaritatea.

24634
19:02:29,360 --> 19:02:32,360
bine,

24635
19:02:34,160 --> 19:02:40,040
acestea sunt negativele și asta

24636
19:02:37,040 --> 19:02:40,040
pozitive.

24637
19:02:41,600 --> 19:02:49,280
Există o mică schimbare, cred că este

24638
19:02:45,120 --> 19:02:51,440
de ce nu se uita

24639
19:02:49,280 --> 19:02:53,040
atât de diferit ca și cum ar fi o

24640
19:02:51,440 --> 19:02:56,000
uşoară

24641
19:02:53,040 --> 19:03:00,600
46 diferit, așa că de aceea arată

24642
19:02:56,000 --> 19:03:00,600
aproape la fel. Bine.

24643
19:03:01,512 --> 19:03:08,800
Deci acum eliminăm coloanele inutile

24644
19:03:04,480 --> 19:03:11,800
cum ar fi interogare, utilizator, număr de cuvinte, punct de date

24645
19:03:08,800 --> 19:03:11,800
picătură,

24646
19:03:13,280 --> 19:03:16,280
data

24647
19:03:17,040 --> 19:03:20,040
interogare

24648
19:03:25,680 --> 19:03:29,552
și numărul de cuvinte.

24649
19:03:35,760 --> 19:03:40,320
X = 1

24650
19:03:38,800 --> 19:03:45,400
virgulă

24651
19:03:40,320 --> 19:03:45,400
loc= to true.

24652
19:03:45,680 --> 19:03:53,640
Bine.

24653
19:03:47,832 --> 19:03:53,640
Uh A va fi adevărat.

24654
19:03:57,120 --> 19:04:06,440
Deci aici voi scrie date

24655
19:04:01,120 --> 19:04:06,440
Ce este asta? Nu. Bine, rău.

24656
19:04:15,120 --> 19:04:19,720
Deci aici voi scrie data dot drop

24657
19:04:19,760 --> 19:04:23,680
id

24658
19:04:21,360 --> 19:04:26,680
virgulă

24659
19:04:23,680 --> 19:04:26,680
unul

24660
19:04:36,960 --> 19:04:41,640
apoi cap de punct de date

24661
19:04:42,400 --> 19:04:50,760
datele vezi avem doar la

24662
19:04:44,960 --> 19:04:50,760
polaritatea și textul. Bine.

24663
19:04:52,160 --> 19:04:55,160
Deci

24664
19:04:55,920 --> 19:05:02,872
acum hai să vedem valorile nule.

24665
19:05:00,240 --> 19:05:05,872
Deci date

24666
19:05:02,872 --> 19:05:05,872
punct

24667
19:05:09,120 --> 19:05:12,120
um

24668
19:05:15,512 --> 19:05:18,512
date

24669
19:05:20,400 --> 19:05:24,600
imprima. Bine.

24670
19:05:43,832 --> 19:05:48,872
Deci nu există valori nule. Deci acum

24671
19:05:45,920 --> 19:05:50,400
conversia obiectului panda într-un șir

24672
19:05:48,872 --> 19:05:52,960
tip.

24673
19:05:50,400 --> 19:05:55,192
Pentru asta trebuie să scriem

24674
19:05:52,960 --> 19:05:58,512
text

24675
19:05:55,192 --> 19:05:58,512
la date

24676
19:05:59,280 --> 19:06:02,280
text.

24677
19:06:07,512 --> 19:06:10,512
Da.

24678
19:06:15,120 --> 19:06:20,760
Obțineți ca tip.

24679
19:06:22,552 --> 19:06:29,800
Da. Așa că acum descărcați cuvintele oprite

24680
19:06:26,800 --> 19:06:29,800
NLTK.

24681
19:06:29,920 --> 19:06:32,920
Descărcați

24682
19:06:37,360 --> 19:06:40,360
cuvinte.

24683
19:06:40,800 --> 19:06:45,680
cuvinte

24684
19:06:43,040 --> 19:06:49,552
cum ai spus

24685
19:06:45,680 --> 19:06:49,552
cuvinte oprite

24686
19:06:51,512 --> 19:06:54,920
este in engleza

24687
19:07:00,240 --> 19:07:02,552
opriți

24688
19:07:16,160 --> 19:07:18,240
Aceasta

24689
19:07:37,512 --> 19:07:45,440
Acestea sunt câteva cuvinte oprite.

24690
19:07:42,080 --> 19:07:50,600
Deci, mergând mai departe, să descarcăm

24691
19:07:45,440 --> 19:07:50,600
NLTK dot download.net.

24692
19:08:10,240 --> 19:08:14,640
Deci pașii de preprocesare luați sunt

24693
19:08:12,720 --> 19:08:17,120
cum este turnarea inferioară fiecare text

24694
19:08:14,640 --> 19:08:20,872
convertit în minuscule apoi remover de

24695
19:08:17,120 --> 19:08:24,160
URL-urile vor face acest lucru, vom face linkuri în regulă

24696
19:08:20,872 --> 19:08:28,320
începând cu http sau https sau ww sunt

24697
19:08:24,160 --> 19:08:30,640
înlocuit cu virgule asemănătoare și eliminând

24698
19:08:28,320 --> 19:08:32,720
eliminarea numelor de utilizator eliminarea cuvintelor scurte

24699
19:08:30,640 --> 19:08:35,680
cuvinte stop precum limitarea este

24700
19:08:32,720 --> 19:08:41,192
procesul va face de pentru conversia a

24701
19:08:35,680 --> 19:08:44,000
cuvântul la bază. Bine. Deci pentru asta

24702
19:08:41,192 --> 19:08:49,160
ce voi face

24703
19:08:44,000 --> 19:08:49,160
Vom copia doar codul pentru tine.

24704
19:08:49,680 --> 19:08:53,920
Vă vom explica unul câte unul ce am

24705
19:08:51,832 --> 19:08:56,920
gata.

24706
19:08:53,920 --> 19:08:56,920
Bine.

24707
19:08:58,080 --> 19:09:05,600
Deci acesta este un curs pentru modelul URL

24708
19:09:00,480 --> 19:09:08,872
pentru eliminarea tuturor WW, HTTPS și HTTP

24709
19:09:05,600 --> 19:09:12,400
tip de lucru și îndepărtare

24710
19:09:08,872 --> 19:09:15,192
ei. Apoi am folosit modelul pentru

24711
19:09:12,400 --> 19:09:16,960
difuzare mai redusă eliminând toate adresele URL.

24712
19:09:15,192 --> 19:09:19,040
Bine.

24713
19:09:16,960 --> 19:09:22,480
Apoi eliminarea tuturor numelor de utilizator ca la

24714
19:09:19,040 --> 19:09:25,512
semnele de punctuație roșii și eliminând

24715
19:09:22,480 --> 19:09:28,960
și vorbe opri.

24716
19:09:25,512 --> 19:09:28,960
Bine. Ca aceasta.

24717
19:09:30,872 --> 19:09:35,800
Deci acum ce avem de făcut date

24718
19:09:40,080 --> 19:09:43,080
prelucrate

24719
19:09:43,920 --> 19:09:46,920
greutăți

24720
19:09:48,160 --> 19:09:54,512
apoi date

24721
19:09:51,512 --> 19:09:54,512
În continuare

24722
19:10:04,800 --> 19:10:08,280
se aplică punct

24723
19:10:08,640 --> 19:10:12,872
lambda

24724
19:10:10,320 --> 19:10:15,872
x

24725
19:10:12,872 --> 19:10:15,872
proces

24726
19:10:17,760 --> 19:10:20,640
apoi tweets.

24727
19:10:24,000 --> 19:10:27,000
Bine.

24728
19:10:35,360 --> 19:10:38,760
Apoi imprimați

24729
19:10:39,760 --> 19:10:44,600
în continuare.

24730
19:10:41,600 --> 19:10:44,600
reprocesare.

24731
19:10:50,800 --> 19:10:54,600
Este nevoie de timp

24732
19:11:17,512 --> 19:11:22,720
Acesta va fi finalizat. Se va întoarce

24733
19:11:19,832 --> 19:11:24,480
aici se face prelucrarea textului.

24734
19:11:22,720 --> 19:11:26,800
Bine.

24735
19:11:24,480 --> 19:11:31,040
După cum puteți vedea, procesarea pregătirii textului

24736
19:11:26,800 --> 19:11:34,872
este gata. Deci acum să verificăm

24737
19:11:31,040 --> 19:11:37,680
date dot add

24738
19:11:34,872 --> 19:11:40,240
10.

24739
19:11:37,680 --> 19:11:43,192
După cum puteți vedea, la rata și

24740
19:11:40,240 --> 19:11:44,960
aceste felii au dispărut.

24741
19:11:43,192 --> 19:11:48,640
Bine.

24742
19:11:44,960 --> 19:11:50,400
Deci acum textul este preprocesat.

24743
19:11:48,640 --> 19:11:52,640
Deci acum ce vom face? Vom analiza

24744
19:11:50,400 --> 19:11:54,320
datele. Deci acum vom analiza

24745
19:11:52,640 --> 19:11:56,160
datele preprocesate pentru a obține o

24746
19:11:54,320 --> 19:11:58,640
înțelegerea acesteia. Vom complot cuvântul

24747
19:11:56,160 --> 19:12:01,440
nori pentru tipi pozitivi și negativi

24748
19:11:58,640 --> 19:12:05,280
din setul nostru de date și vedeți ce cuvinte

24749
19:12:01,440 --> 19:12:08,160
apare cel mai mult. Bine. Mai întâi vom face

24750
19:12:05,280 --> 19:12:10,080
creați pentru cuvintele negative sau

24751
19:12:08,160 --> 19:12:13,600
tweet-uri negative pe care le poți spune. Așa că voi face

24752
19:12:10,080 --> 19:12:17,240
scrie pl dot figura

24753
19:12:13,600 --> 19:12:17,240
apoi dimensiunea figurii

24754
19:12:18,640 --> 19:12:21,640
15.

24755
19:12:23,192 --> 19:12:32,000
Bine. Apoi și nor de cuvinte

24756
19:12:27,600 --> 19:12:35,872
nor de cuvinte

24757
19:12:32,000 --> 19:12:35,872
x cuvinte

24758
19:12:36,240 --> 19:12:45,080
2,00 virgulă

24759
19:12:39,832 --> 19:12:45,080
lățime = până la 1.600

24760
19:12:45,192 --> 19:12:52,192
virgulă

24761
19:12:46,800 --> 19:12:52,192
înălțime = până la 800

24762
19:12:52,640 --> 19:12:55,640
rata

24763
19:12:58,800 --> 19:13:05,552
punctul unește polaritatea punctului de date

24764
19:13:05,832 --> 19:13:15,000
si voi scrie aici polaritate

24765
19:13:10,872 --> 19:13:15,000
bine este egal cu zero

24766
19:13:17,832 --> 19:13:20,832
din nou

24767
19:13:24,720 --> 19:13:31,480
apoi

24768
19:13:27,192 --> 19:13:31,480
tweet-uri procesate.

24769
19:13:33,600 --> 19:13:38,480
Bine.

24770
19:13:36,240 --> 19:13:44,360
Atunci aici

24771
19:13:38,480 --> 19:13:44,360
Trebuie să scriu plt dot show

24772
19:13:44,552 --> 19:13:47,800
arată eu

24773
19:13:49,192 --> 19:13:52,192
wcolaţie

24774
19:14:00,320 --> 19:14:03,320
liniară.

24775
19:14:04,800 --> 19:14:09,480
Poate ai uitat virgula aici.

24776
19:14:13,920 --> 19:14:19,512
Deci 2000

24777
19:14:16,960 --> 19:14:22,760
apoi lățimea virgulei

24778
19:14:19,512 --> 19:14:22,760
dot generate

24779
19:14:32,240 --> 19:14:36,192
aici. ce pot face.

24780
19:14:44,640 --> 19:14:51,720
Lasă-mă să fug acum. Să vedem. Sper asta

24781
19:14:48,160 --> 19:14:51,720
timp va funcționa.

24782
19:14:55,280 --> 19:14:59,000
Guess încă se încarcă.

24783
19:15:16,000 --> 19:15:20,440
După cum puteți vedea, aceasta este

24784
19:15:22,720 --> 19:15:30,480
bine ca azi sunt si munca nu doresc

24785
19:15:27,040 --> 19:15:33,440
au nevoie de mult. Acestea sunt cele mai multe

24786
19:15:30,480 --> 19:15:36,720
tweet-uri negative. Bine, cuvinte de la

24787
19:15:33,440 --> 19:15:40,240
tweet-uri negative pe care le poți spune,

24788
19:15:36,720 --> 19:15:44,360
nu? Deci, haideți să vedem partea pozitivă

24789
19:15:40,240 --> 19:15:44,360
tweet-uri. bine,

24790
19:15:46,400 --> 19:15:53,320
deci treaba va fi la fel.

24791
19:15:50,000 --> 19:15:53,320
Lasă-mă să copiez

24792
19:15:53,360 --> 19:16:00,512
lipiți-l aici. Deci pentru asta voi face una

24793
19:16:01,760 --> 19:16:09,512
va dura puțin timp

24794
19:16:05,360 --> 19:16:14,240
să vină încărcând ca după cum vezi hit

24795
19:16:09,512 --> 19:16:18,000
nu pot. Bine scuze

24796
19:16:14,240 --> 19:16:21,920
acestea sunt cuvintele negative.

24797
19:16:18,000 --> 19:16:25,400
Bine încă se încarcă. Asa ca sa asteptam

24798
19:16:21,920 --> 19:16:25,400
ca cateva secunde.

24799
19:16:26,552 --> 19:16:33,120
Acum puteți vedea cuvintele pozitive precum

24800
19:16:28,800 --> 19:16:37,120
dragoste, bine, bine, lol

24801
19:16:33,120 --> 19:16:39,440
si minunat asa ceva. bine,

24802
19:16:37,120 --> 19:16:42,160
deci astea sunt cateva

24803
19:16:39,440 --> 19:16:44,240
cuvinte pozitive. Deci acum hai să facem

24804
19:16:42,160 --> 19:16:47,360
vectorizarea și împărțirea datelor cum ar fi

24805
19:16:44,240 --> 19:16:50,240
stocarea în procesul variabilei de intrare la X

24806
19:16:47,360 --> 19:16:53,640
iar polaritatea variabilă de ieșire la Y. Bine,

24807
19:16:50,240 --> 19:16:53,640
asta vom face.

24808
19:16:57,760 --> 19:17:05,960
Deci x = la date

24809
19:17:02,960 --> 19:17:05,960
posedat

24810
19:17:07,440 --> 19:17:10,440
cu

24811
19:17:10,872 --> 19:17:18,640
valorile

24812
19:17:13,120 --> 19:17:21,040
iar pi= la date

24813
19:17:18,640 --> 19:17:22,320
entitate

24814
19:17:21,040 --> 19:17:24,400
punct

24815
19:17:22,320 --> 19:17:26,640
valorile.

24816
19:17:24,400 --> 19:17:31,120
Bine.

24817
19:17:26,640 --> 19:17:34,440
Acum voi scrie aici print

24818
19:17:31,120 --> 19:17:34,440
formă de punct

24819
19:17:35,192 --> 19:17:39,872
print y dot.shape.

24820
19:17:41,192 --> 19:17:45,040
Bine tare. Deci acum ce vom face noi

24821
19:17:43,440 --> 19:17:48,960
va converti textul în frecvența cuvintelor

24822
19:17:45,040 --> 19:17:52,000
vectori. Bine. TF către IDF. Deci acesta este un

24823
19:17:48,960 --> 19:17:54,320
acronim care reprezintă termenul frecvență la

24824
19:17:52,000 --> 19:17:56,160
frecvența inversă a documentului care sunt cele

24825
19:17:54,320 --> 19:17:58,320
componente ale scorurilor rezultate

24826
19:17:56,160 --> 19:18:00,240
atribuite fiecărui cuvânt. Bine. Deci termen

24827
19:17:58,320 --> 19:18:03,120
frecvență aceasta rezuma cât de des a

24828
19:18:00,240 --> 19:18:05,360
cuvântul dat apare în cadrul unui document și

24829
19:18:03,120 --> 19:18:07,832
frecvența inversă a documentului aceasta

24830
19:18:05,360 --> 19:18:11,040
reduce cuvintele care apar mult peste tot

24831
19:18:07,832 --> 19:18:12,720
documente. Bine. Așa că acum o vom face

24832
19:18:11,040 --> 19:18:16,400
converti o colecție de documente brute în

24833
19:18:12,720 --> 19:18:19,680
o matrice de caracteristici TF la IDF. Bine.

24834
19:18:16,400 --> 19:18:21,280
Și apoi voi scrie

24835
19:18:19,680 --> 19:18:23,920
intra

24836
19:18:21,280 --> 19:18:26,920
kazut

24837
19:18:23,920 --> 19:18:26,920
înălțător

24838
19:18:30,552 --> 19:18:34,192
și subliniară

24839
19:18:40,720 --> 19:18:44,680
x = la

24840
19:18:45,120 --> 19:18:51,640
punct cu

24841
19:18:48,640 --> 19:18:51,640
transforma

24842
19:18:55,360 --> 19:18:58,360
tipărite.

24843
19:19:06,000 --> 19:19:09,000
Bine.

24844
19:19:11,512 --> 19:19:14,512
Imprimați

24845
19:19:15,120 --> 19:19:19,800
numărul de caracteristici

24846
19:19:24,240 --> 19:19:27,720
lungime virgulă

24847
19:19:28,720 --> 19:19:34,960
vector

24848
19:19:31,040 --> 19:19:37,680
primești

24849
19:19:34,960 --> 19:19:37,680
numele lor.

24850
19:19:41,040 --> 19:19:46,240
Deci numărul de cuvinte caracteristice este ca 1703

24851
19:19:44,160 --> 19:19:51,240
la 1.

24852
19:19:46,240 --> 19:19:51,240
Bine. Acum vom face like

24853
19:19:51,680 --> 19:19:56,760
acum să tipărim forma.

24854
19:20:10,480 --> 19:20:15,680
Așa că acum vom face împărțirea

24855
19:20:13,192 --> 19:20:17,280
antrenează și testează. Deci datele pre-provizate

24856
19:20:15,680 --> 19:20:19,512
este împărțit în două seturi de date

24857
19:20:17,280 --> 19:20:21,760
datele de antrenament și datele de testare. Deci

24858
19:20:19,512 --> 19:20:25,120
setul de date pe care s-ar afla modelul

24859
19:20:21,760 --> 19:20:27,192
antrenat pe conține 80% date și

24860
19:20:25,120 --> 19:20:30,320
datele de testare sunt setul de date pe care

24861
19:20:27,192 --> 19:20:35,872
modelul ar fi testat din nou conține 20%

24862
19:20:30,320 --> 19:20:35,872
de date. Deci pentru asta voi scrie in plus

24863
19:20:37,280 --> 19:20:42,280
testare

24864
19:20:39,280 --> 19:20:42,280
virgulă

24865
19:20:50,800 --> 19:20:53,800
Testează

24866
19:21:00,480 --> 19:21:07,080
dimensiunea testului

24867
19:21:02,640 --> 19:21:07,080
= până la 0,20 2

24868
19:21:07,760 --> 19:21:11,680
aleatoriu

24869
19:21:09,832 --> 19:21:14,680
stare

24870
19:21:11,680 --> 19:21:14,680
101.

24871
19:21:16,240 --> 19:21:20,760
Bine. Stare aleatorie.

24872
19:21:23,360 --> 19:21:27,832
Deci ce voi face? Eu o voi face pe tine

24873
19:21:25,920 --> 19:21:29,760
știți tipăriți forma trenului X, Y

24874
19:21:27,832 --> 19:21:32,000
tren, test X, test Y ca câte

24875
19:21:29,760 --> 19:21:35,512
coloane sunt acolo? Rânduri nu coloană

24876
19:21:32,000 --> 19:21:39,280
exact rândurile sunt acolo. Bine.

24877
19:21:35,512 --> 19:21:41,920
Așa că vom lipi acolo. Deci vezi

24878
19:21:39,280 --> 19:21:44,240
tren suplimentar ca acesta este un total a fost

24879
19:21:41,920 --> 19:21:49,040
ca doi lakh.

24880
19:21:44,240 --> 19:21:51,920
Bine. Deci 1 lakh 60.000 la antrenament ca noi

24881
19:21:49,040 --> 19:21:56,320
discutat mai devreme ca 80% la antrenament

24882
19:21:51,920 --> 19:21:59,680
și 20% în testare. Bine.

24883
19:21:56,320 --> 19:22:03,440
Așa că acum să construim modelul.

24884
19:21:59,680 --> 19:22:07,120
Bine. Funcții de evaluare a modelului. Deci acum

24885
19:22:03,440 --> 19:22:08,720
hai sa facem un model.

24886
19:22:07,120 --> 19:22:12,080
Bine.

24887
19:22:08,720 --> 19:22:16,400
Și mai întâi voi face voi scrie și

24888
19:22:12,080 --> 19:22:19,192
atunci iti voi explica intregul. Bine.

24889
19:22:16,400 --> 19:22:20,872
Deci iată ce am făcut uh, asta vă va spune

24890
19:22:19,192 --> 19:22:24,320
acuratețea modelului de antrenament

24891
19:22:20,872 --> 19:22:26,320
datele și datele de testare. Bine. Apoi noi

24892
19:22:24,320 --> 19:22:28,800
va prezice valorile pentru datele de testare

24893
19:22:26,320 --> 19:22:30,160
setul și evaluarea pentru setul de date.

24894
19:22:28,800 --> 19:22:32,320
Apoi vom calcula și vom reprezenta graficul

24895
19:22:30,160 --> 19:22:34,240
matricea de confuzie.

24896
19:22:32,320 --> 19:22:36,552
Bine, ambele categorii sunt negative

24897
19:22:34,240 --> 19:22:39,832
pozitive. Bine, numele grupului va fi adevărat

24898
19:22:36,552 --> 19:22:45,800
negativ și fals pozitiv. bine,

24899
19:22:39,832 --> 19:22:45,800
deci nu există nimic care să ne permită să-l rulăm.

24900
19:22:46,320 --> 19:22:51,280
Deci acum ce vom face? Vom face mai întâi

24901
19:22:48,872 --> 19:22:54,640
pentru regresia logistică. Deci iată-mă

24902
19:22:51,280 --> 19:22:57,640
va scrie LG egal cu

24903
19:22:54,640 --> 19:22:57,640
logistică

24904
19:22:58,240 --> 19:23:01,240
regresie.

24905
19:23:01,600 --> 19:23:09,240
Bine. Apoi istoria

24906
19:23:04,240 --> 19:23:09,240
egal cu LG do fit

24907
19:23:09,600 --> 19:23:12,920
trenul X,

24908
19:23:13,512 --> 19:23:19,920
trenul Y

24909
19:23:16,640 --> 19:23:22,920
cu model

24910
19:23:19,920 --> 19:23:22,920
evalua

24911
19:23:23,120 --> 19:23:27,240
LG. Acum să vedem

24912
19:23:30,720 --> 19:23:37,400
aceasta este pentru regresia logistică.

24913
19:23:34,400 --> 19:23:37,400
bine,

24914
19:23:38,000 --> 19:23:42,320
după cum puteți vedea acuratețea

24915
19:23:40,000 --> 19:23:43,832
datele de instruire sunt 83% din datele de testare

24916
19:23:42,320 --> 19:23:46,832
77%.

24917
19:23:43,832 --> 19:23:46,832
Bine.

24918
19:23:48,640 --> 19:23:53,440
Deci aceasta este matricea de încredere

24919
19:23:51,600 --> 19:23:55,040
valoarea predictivă ca acestea sunt

24920
19:23:53,440 --> 19:23:57,760
categorii.

24921
19:23:55,040 --> 19:24:01,720
Acum să vedem pentru SPM liniar. Pentru

24922
19:23:57,760 --> 19:24:01,720
că voi scrie SPM

24923
19:24:02,720 --> 19:24:06,120
egal cu

24924
19:24:06,960 --> 19:24:09,960
SVC

24925
19:24:11,280 --> 19:24:17,872
apoi SVM

24926
19:24:14,000 --> 19:24:17,872
se potrivesc punct

24927
19:24:18,000 --> 19:24:21,000
tren.

24928
19:24:23,920 --> 19:24:30,000
Apoi modelați

24929
19:24:27,040 --> 19:24:33,400
evalua

24930
19:24:30,000 --> 19:24:33,400
a SVM.

24931
19:24:37,040 --> 19:24:40,720
Bine.

24932
19:24:39,040 --> 19:24:43,040
Și după aceea vom face la întâmplare

24933
19:24:40,720 --> 19:24:45,600
pădure și baza N. Bine. Apoi noi

24934
19:24:43,040 --> 19:24:47,440
va începe cu RNN.

24935
19:24:45,600 --> 19:24:50,872
Deci, după cum puteți vedea acuratețea

24936
19:24:47,440 --> 19:24:55,920
datele de antrenament sunt foarte bune 93%

24937
19:24:50,872 --> 19:24:57,760
iar logarea este de 83% iar testarea este

24938
19:24:55,920 --> 19:25:00,552
mai putin decat

24939
19:24:57,760 --> 19:25:03,760
model de regresie. Să vedem pentru

24940
19:25:00,552 --> 19:25:06,480
pădure la întâmplare. Deci voi scrie aici RF

24941
19:25:03,760 --> 19:25:10,160
egal cu

24942
19:25:06,480 --> 19:25:13,160
pădure la întâmplare

24943
19:25:10,160 --> 19:25:13,160
foc

24944
19:25:15,832 --> 19:25:21,800
m=

24945
19:25:18,320 --> 19:25:21,800
la 20

24946
19:25:23,832 --> 19:25:28,440
criteriu = to

24947
19:25:29,192 --> 19:25:34,640
tropy Bine.

24948
19:25:32,080 --> 19:25:38,720
Apoi max

24949
19:25:34,640 --> 19:25:42,920
adâncimea este egală cu 50.

24950
19:25:38,720 --> 19:25:42,920
Apoi punctul RF se potrivește

24951
19:25:44,640 --> 19:25:47,960
trenul X,

24952
19:25:48,400 --> 19:25:51,800
trenul Y

24953
19:25:51,832 --> 19:25:55,160
si model

24954
19:25:58,240 --> 19:26:01,240
evalua.

24955
19:26:05,512 --> 19:26:08,512
bine,

24956
19:26:14,400 --> 19:26:19,720
încărcare. Să vedem cum este exactitatea

24957
19:26:16,480 --> 19:26:19,720
va veni.

24958
19:26:26,080 --> 19:26:31,280
După aceasta vom face pentru baza de nume

24959
19:26:28,872 --> 19:26:34,240
iar după aceea vom trece la

24960
19:26:31,280 --> 19:26:35,680
modelul nostru principal RNN neuronal recurent

24961
19:26:34,240 --> 19:26:39,160
retelelor.

24962
19:26:35,680 --> 19:26:39,160
Încă se încarcă.

24963
19:26:41,120 --> 19:26:46,040
Presupun că va dura puțin timp.

24964
19:26:51,920 --> 19:26:56,600
Deci, după cum puteți vedea matricea de confuzie.

24965
19:26:56,720 --> 19:27:04,640
Bine. Deci acuratețea datelor de antrenament este de 75%

24966
19:27:01,440 --> 19:27:11,872
foarte putin. Deci acum să vedem ultimul

24967
19:27:04,640 --> 19:27:11,872
baza numelui modelului. Bine. Deci, NB este egal cu

24968
19:27:12,960 --> 19:27:15,960
NB

24969
19:27:16,872 --> 19:27:21,640
NB se potrivește cu puncte

24970
19:27:21,760 --> 19:27:24,760
SP,

24971
19:27:26,872 --> 19:27:30,192
tren larg.

24972
19:27:33,040 --> 19:27:40,440
Bine. Apoi modelați

24973
19:27:37,440 --> 19:27:40,440
evalua.

24974
19:27:45,440 --> 19:27:52,160
Oh, antrenamentul de bază NAB 867.

24975
19:27:50,080 --> 19:27:55,832
Deci, cât pentru

24976
19:27:52,160 --> 19:27:58,960
SEC liniar are cel mai bun

24977
19:27:55,832 --> 19:28:03,832
test de antrenament uh precizie puteți spune

24978
19:27:58,960 --> 19:28:06,400
iar cea mai bună acuratețe de testare este 7670

24979
19:28:03,832 --> 19:28:08,960
76.45 4 cinci

24980
19:28:06,400 --> 19:28:12,160
vezi regresia logistica. Deci acum haideți

24981
19:28:08,960 --> 19:28:14,872
treceți la modelul nostru principal RNN. Deci ce

24982
19:28:12,160 --> 19:28:16,872
este rețeaua neuronală recurentă RNN la

24983
19:28:14,872 --> 19:28:18,640
începe

24984
19:28:16,872 --> 19:28:21,440
sunt algoritmul de ultimă generație pentru

24985
19:28:18,640 --> 19:28:24,720
date secvențiale și sunt utilizate de Apple CD

24986
19:28:21,440 --> 19:28:27,120
și voce de căutare Google. Este primul

24987
19:28:24,720 --> 19:28:28,872
algoritm care își amintește intrarea datorată

24988
19:28:27,120 --> 19:28:30,552
la o memorie internă care o fac

24989
19:28:28,872 --> 19:28:33,360
perfect potrivit pentru învățarea automată

24990
19:28:30,552 --> 19:28:35,120
problemă care implică date secvențiale.

24991
19:28:33,360 --> 19:28:36,872
Și mai este un lucru încorporat

24992
19:28:35,120 --> 19:28:39,280
strat. Stratul de încorporare este unul dintre

24993
19:28:36,872 --> 19:28:41,120
straturi disponibile în KAS. Aceasta este în principal

24994
19:28:39,280 --> 19:28:43,192
utilizate în procesarea limbajului natural

24995
19:28:41,120 --> 19:28:45,280
aplicații conexe, cum ar fi limbajul

24996
19:28:43,192 --> 19:28:47,280
modelare dar poate fi folosit și cu

24997
19:28:45,280 --> 19:28:49,760
alte sarcini care implică rețele neuronale

24998
19:28:47,280 --> 19:28:51,832
în timp ce se confruntă cu problemele NLP. Putem

24999
19:28:49,760 --> 19:28:53,600
utilizați încorporarea de cuvinte pre-antrenată, cum ar fi

25000
19:28:51,832 --> 19:28:56,552
strălucire.

25001
19:28:53,600 --> 19:29:00,480
Alternativ, ne putem antrena și pe ai noștri

25002
19:28:56,552 --> 19:29:02,640
înglobări folosind stratul emitent kas.

25003
19:29:00,480 --> 19:29:05,440
Strat LSTM memorie pe termen lung

25004
19:29:02,640 --> 19:29:08,240
rețelele numite de obicei LSTM-uri pe care le am

25005
19:29:05,440 --> 19:29:11,360
a făcut deja multe videoclipuri pe care le puteți verifica

25006
19:29:08,240 --> 19:29:13,512
au fost introduse de Skyer acestea

25007
19:29:11,360 --> 19:29:15,120
au fost utilizate pe scară largă pentru vorbire

25008
19:29:13,512 --> 19:29:17,440
procesarea limbajului de recunoaștere

25009
19:29:15,120 --> 19:29:20,400
analiza sentimentelor și predicția textului

25010
19:29:17,440 --> 19:29:22,320
înainte de a pătrunde adânc în LSTM ar trebui

25011
19:29:20,400 --> 19:29:24,000
înţelege mai întâi necesitatea LSTM care

25012
19:29:22,320 --> 19:29:26,640
poate fi explicată prin dezavantajul

25013
19:29:24,000 --> 19:29:28,240
utilizarea practică a RNN, așa că să începem cu

25014
19:29:26,640 --> 19:29:31,240
ARN

25015
19:29:28,240 --> 19:29:31,240
Bine.

25016
19:29:31,512 --> 19:29:41,760
Deci aici voi importa câteva biblioteci.

25017
19:29:36,240 --> 19:29:44,760
Bine. Deci după aceea voi scrie import

25018
19:29:41,760 --> 19:29:44,760
kas

25019
19:29:48,640 --> 19:29:54,960
versiunea

25020
19:29:51,280 --> 19:29:54,960
2.110. Bine bine.

25021
19:29:57,680 --> 19:30:01,552
Deci acum haideți

25022
19:30:03,360 --> 19:30:06,360
vopsea

25023
19:30:19,360 --> 19:30:26,440
test X, virgulă,

25024
19:30:23,120 --> 19:30:26,440
trenul alb.

25025
19:30:29,120 --> 19:30:32,760
Hai să ne antrenăm

25026
19:30:33,920 --> 19:30:36,920
testare

25027
19:30:41,280 --> 19:30:49,280
greutăți, virgulă, polaritatea punctelor de date

25028
19:30:46,320 --> 19:30:52,160
valorile punctului.

25029
19:30:49,280 --> 19:30:59,120
Apoi testați

25030
19:30:52,160 --> 19:31:02,000
dimensiunea este egală cu 0,2. Dimensiunea testului 0,2 înseamnă

25031
19:30:59,120 --> 19:31:08,640
ca 80 si 20%

25032
19:31:02,000 --> 19:31:11,640
lucru 80 la antrenament și apoi 20% la

25033
19:31:08,640 --> 19:31:11,640
testarea.

25034
19:31:13,360 --> 19:31:19,080
Bine.

25035
19:31:15,120 --> 19:31:19,080
si haideti

25036
19:31:20,400 --> 19:31:28,872
evaluarea modelului. Bine.

25037
19:31:24,480 --> 19:31:32,160
Deci voi astea sunt relu sigmoid toate

25038
19:31:28,872 --> 19:31:35,600
știi straturile.

25039
19:31:32,160 --> 19:31:40,000
Deci acum această epocă va dura până la 5.000

25040
19:31:35,600 --> 19:31:42,400
ca număr va merge până la 5.000. Bine vezi

25041
19:31:40,000 --> 19:31:44,000
cele 5.000 și va merge la 1 la 10. Deci

25042
19:31:42,400 --> 19:31:48,872
va dura timp. Așa că voi reveni la

25043
19:31:44,000 --> 19:31:52,640
tu după ce ai completat acest lucru. Bine.

25044
19:31:48,872 --> 19:31:56,640
Acum, după cum puteți vedea, cutia

25045
19:31:52,640 --> 19:31:59,680
a rulat cu succes. Bine. Deci ce ar trebui

25046
19:31:56,640 --> 19:32:01,360
face? Dar voi lăsa puțin spațiu aici. Deci

25047
19:31:59,680 --> 19:32:04,720
acum vom vedea pozitivul și

25048
19:32:01,360 --> 19:32:06,960
rezultat negativ. Bine. Aceasta este

25049
19:32:04,720 --> 19:32:10,480
ceva de genul testării. Bine. Vom face

25050
19:32:06,960 --> 19:32:13,512
test. Vom prezice. vom da unul

25051
19:32:10,480 --> 19:32:15,440
o propoziție și apoi vom prezice

25052
19:32:13,512 --> 19:32:17,440
vine bine sau greșit. The

25053
19:32:15,440 --> 19:32:20,800
acuratețea înseamnă a da un drept sau un rău.

25054
19:32:17,440 --> 19:32:22,800
Bine. Deci aici voi scrie

25055
19:32:20,800 --> 19:32:26,640
succesiune

25056
19:32:22,800 --> 19:32:31,000
egal cu tokenizer

25057
19:32:26,640 --> 19:32:31,000
text punct

25058
19:32:31,600 --> 19:32:36,360
la

25059
19:32:33,360 --> 19:32:36,360
secvente.

25060
19:32:36,640 --> 19:32:45,512
Bine, atunci voi scrie asta

25061
19:32:42,320 --> 19:32:48,400
știința datelor

25062
19:32:45,512 --> 19:32:51,680
articol.

25063
19:32:48,400 --> 19:32:53,600
Aceasta a fost

25064
19:32:51,680 --> 19:32:58,480
bine.

25065
19:32:53,600 --> 19:33:01,480
Deci aici voi scrie test egal cu P

25066
19:32:58,480 --> 19:33:01,480
secvente

25067
19:33:02,800 --> 19:33:07,160
și aici voi scrie secvența

25068
19:33:07,280 --> 19:33:12,120
Lungime maximă virgulă

25069
19:33:13,832 --> 19:33:18,680
la

25070
19:33:15,360 --> 19:33:18,680
lungime max.

25071
19:33:24,720 --> 19:33:32,832
Atunci voi scrie aici predicție egală

25072
19:33:28,640 --> 19:33:32,832
a modela.

25073
19:33:37,440 --> 19:33:40,920
Scriem model

25074
19:33:43,760 --> 19:33:48,280
apoi vom scrie modelul 12

25075
19:33:49,920 --> 19:33:55,512
dot prezice

25076
19:33:53,040 --> 19:33:57,832
apoi testează.

25077
19:33:55,512 --> 19:34:01,640
Bine.

25078
19:33:57,832 --> 19:34:01,640
Dacă dicţia

25079
19:34:02,000 --> 19:34:08,240
este mai mare de 0,5 înseamnă 50%.

25080
19:34:06,240 --> 19:34:11,280
Apoi

25081
19:34:08,240 --> 19:34:14,160
ar trebui să se imprime

25082
19:34:11,280 --> 19:34:16,640
pozitiv.

25083
19:34:14,160 --> 19:34:19,640
Bine.

25084
19:34:16,640 --> 19:34:19,640
Altfel

25085
19:34:22,720 --> 19:34:25,720
negativ.

25086
19:34:26,240 --> 19:34:30,120
Bine. Lasă-mă să conduc asta.

25087
19:34:30,320 --> 19:34:37,720
Bine. Secvenţial

25088
19:34:32,320 --> 19:34:37,720
obiectul nu are ortografia ok

25089
19:34:40,080 --> 19:34:45,360
vezi negativul pentru că aici este

25090
19:34:42,160 --> 19:34:48,240
cel mai rău cuvânt care arată corect. Acum

25091
19:34:45,360 --> 19:34:54,400
verifica din modelul RNN. Deci model

25092
19:34:48,240 --> 19:34:58,320
este egal cu incarcarea punctelor modelelor kas

25093
19:34:54,400 --> 19:35:00,160
modele. Aici vom încărca modelul RNN. RNN

25094
19:34:58,320 --> 19:35:04,400
model

25095
19:35:00,160 --> 19:35:09,800
Fișierul SG. Este un model pre-antrenat. Bine.

25096
19:35:04,400 --> 19:35:09,800
Pretinde modelul RNN. Deci secvență

25097
19:35:10,080 --> 19:35:13,080
tokenizer

25098
19:35:14,080 --> 19:35:20,512
text punct

25099
19:35:17,120 --> 19:35:20,512
la secvenţe.

25100
19:35:22,800 --> 19:35:29,000
Apoi

25101
19:35:24,400 --> 19:35:29,000
Voi scrie aici asta

25102
19:35:31,760 --> 19:35:37,000
ML

25103
19:35:34,000 --> 19:35:37,000
desigur

25104
19:35:37,832 --> 19:35:47,480
este cel mai bun.

25105
19:35:40,000 --> 19:35:47,480
Bine. S este egal cu P secvențe

25106
19:35:47,600 --> 19:35:50,600
succesiune

25107
19:36:00,872 --> 19:36:03,872
X

25108
19:36:04,400 --> 19:36:11,832
bine, atunci predicția este egală cu modelul dot

25109
19:36:09,600 --> 19:36:15,512
prezice

25110
19:36:11,832 --> 19:36:21,160
Apoi testați

25111
19:36:15,512 --> 19:36:21,160
dacă predicția este mai mare de 0,5

25112
19:36:23,120 --> 19:36:29,360
in

25113
19:36:24,800 --> 19:36:31,832
pozitiv 0,5 înseamnă cu 50% mai mult decât 50%.

25114
19:36:29,360 --> 19:36:35,872
Altfel

25115
19:36:31,832 --> 19:36:35,872
negativ tipărit

25116
19:36:42,400 --> 19:36:46,360
modele de încărcare cu atribute

25117
19:36:50,480 --> 19:36:57,832
pozitiv, deoarece acest curs ML este cel mai bun.

25118
19:36:53,832 --> 19:37:00,832
Deci nu există un cuvânt negativ.

25119
19:36:57,832 --> 19:37:00,832
Bine.

25120
19:37:05,600 --> 19:37:11,832
Deci ceea ce vom face acum vom face model

25121
19:37:08,080 --> 19:37:17,760
salvând încărcarea și predicția. Bine. Deci

25122
19:37:11,832 --> 19:37:22,192
pentru asta voi scrie import murat

25123
19:37:17,760 --> 19:37:22,192
fisier = a deschide

25124
19:37:23,512 --> 19:37:26,512
vectorzer

25125
19:37:32,080 --> 19:37:35,080
apoi

25126
19:37:40,400 --> 19:37:45,360
aici voi Pickle

25127
19:37:42,960 --> 19:37:46,960
dot dump

25128
19:37:45,360 --> 19:37:51,000
haldă

25129
19:37:46,960 --> 19:37:51,000
vector fișier vector.

25130
19:38:03,280 --> 19:38:07,512
Bine.

25131
19:38:04,872 --> 19:38:12,160
Așa că așa trebuie să scriu pentru nume

25132
19:38:07,512 --> 19:38:13,832
logitation de bază SVM și pădure aleatoare.

25133
19:38:12,160 --> 19:38:16,160
Deci

25134
19:38:13,832 --> 19:38:17,920
ce voi face

25135
19:38:16,160 --> 19:38:20,720
chiar aici.

25136
19:38:17,920 --> 19:38:23,720
Bine. Să rulăm asta.

25137
19:38:20,720 --> 19:38:23,720
Bine.

25138
19:38:35,600 --> 19:38:42,760
Acum ce avem de făcut? Trebuie

25139
19:38:37,680 --> 19:38:42,760
prezice folosind modelul salvat. Bine.

25140
19:38:47,360 --> 19:38:55,040
Ce vom face aici? Vom încărca modelul

25141
19:38:49,600 --> 19:38:57,192
mai întâi și vom prezice. Bine. Deci

25142
19:38:55,040 --> 19:38:59,040
mai întâi voi scrie numele funcției

25143
19:38:57,192 --> 19:39:02,040
încărcătură

25144
19:38:59,040 --> 19:39:02,040
modele

25145
19:39:02,320 --> 19:39:07,360
și vom încărca vectorzerul. Așa că dosar

25146
19:39:05,192 --> 19:39:09,192
egal cu

25147
19:39:07,360 --> 19:39:11,040
deschis

25148
19:39:09,192 --> 19:39:14,600
vectorzer

25149
19:39:11,040 --> 19:39:14,600
murătură punct

25150
19:39:16,320 --> 19:39:19,320
IBizer

25151
19:39:31,280 --> 19:39:33,440
dosar.

25152
19:39:33,832 --> 19:39:38,360
fisierul se inchide.

25153
19:39:39,040 --> 19:39:47,160
Acum încarc regresia logistică

25154
19:39:41,680 --> 19:39:47,160
model. Deci pentru asta trebuie să scriem deschis

25155
19:39:57,280 --> 19:40:04,512
B

25156
19:39:59,280 --> 19:40:04,512
LG să aleagă

25157
19:40:04,720 --> 19:40:09,280
cod

25158
19:40:07,040 --> 19:40:13,120
dosar

25159
19:40:09,280 --> 19:40:16,120
apoi fisierul se inchide

25160
19:40:13,120 --> 19:40:16,120
apoi

25161
19:40:18,800 --> 19:40:22,400
înălțător

25162
19:40:20,872 --> 19:40:25,400
LG.

25163
19:40:22,400 --> 19:40:25,400
Bine.

25164
19:40:27,120 --> 19:40:33,920
Da. Deci acum vom prezice

25165
19:40:30,000 --> 19:40:36,920
sentiment. Deci pentru asta voi scrie aici

25166
19:40:33,920 --> 19:40:36,920
prezice

25167
19:40:37,600 --> 19:40:40,600
înălțător

25168
19:40:47,040 --> 19:40:52,480
text.

25169
19:40:49,360 --> 19:40:56,680
Bine. Uh, aici vom prezice

25170
19:40:52,480 --> 19:40:56,680
sentiment. Deci pentru asta

25171
19:40:59,680 --> 19:41:05,800
textul este egal cu

25172
19:41:02,800 --> 19:41:05,800
proces

25173
19:41:11,192 --> 19:41:17,920
apoi cereri pentru

25174
19:41:15,192 --> 19:41:20,920
sentiment în

25175
19:41:17,920 --> 19:41:20,920
text.

25176
19:41:21,360 --> 19:41:27,800
Apoi text

25177
19:41:24,800 --> 19:41:27,800
date

25178
19:41:30,320 --> 19:41:34,760
transformare punct.

25179
19:41:37,040 --> 19:41:40,192
Aceasta este

25180
19:41:42,640 --> 19:41:47,000
bine. Apoi sentimentul

25181
19:41:49,192 --> 19:41:53,872
modelul dot prezice.

25182
19:41:57,040 --> 19:42:01,512
Deci aici voi face o listă de text cu

25183
19:41:59,192 --> 19:42:07,360
sentiment. Deci pentru asta voi scrie date

25184
19:42:01,512 --> 19:42:09,192
este egal cu matricea goală. Apoi pentru text

25185
19:42:07,360 --> 19:42:12,440
predictie

25186
19:42:09,192 --> 19:42:12,440
și fermoar

25187
19:42:12,720 --> 19:42:17,320
textul x

25188
19:42:14,320 --> 19:42:17,320
sentiment

25189
19:42:18,960 --> 19:42:23,872
dt

25190
19:42:20,872 --> 19:42:23,872
anexează

25191
19:42:23,920 --> 19:42:29,760
predicție text.

25192
19:42:26,872 --> 19:42:31,760
Bine.

25193
19:42:29,760 --> 19:42:33,832
Apoi vom converti lista în pas

25194
19:42:31,760 --> 19:42:40,440
cadre de date. Deci pentru asta voi scrie df

25195
19:42:33,832 --> 19:42:40,440
= to ad dot data plan

25196
19:42:41,512 --> 19:42:46,720
coloane cu virgulă

25197
19:42:44,080 --> 19:42:48,552
persoana

25198
19:42:46,720 --> 19:42:50,320
în continuare

25199
19:42:48,552 --> 19:42:53,320
virgulă

25200
19:42:50,320 --> 19:42:53,320
sentiment

25201
19:42:58,400 --> 19:43:05,240
atunci df este egal cu df dot

25202
19:43:02,240 --> 19:43:05,240
Înlocuiește

25203
19:43:07,192 --> 19:43:10,760
virgula 1

25204
19:43:18,960 --> 19:43:21,960
pozitiv

25205
19:43:24,960 --> 19:43:29,400
si aici.

25206
19:43:30,552 --> 19:43:38,600
Bine.

25207
19:43:32,640 --> 19:43:38,600
Asa ca in sfarsit voi scrie aici daca

25208
19:43:41,832 --> 19:43:44,832
la

25209
19:43:47,600 --> 19:43:52,320
apoi aici vom încărca modelul

25210
19:43:50,720 --> 19:43:57,960
vectorzer

25211
19:43:52,320 --> 19:43:57,960
virgulă plus încărcare.

25212
19:44:00,320 --> 19:44:08,640
Aici trimitem text pentru a clasifica ca ce

25213
19:44:03,120 --> 19:44:13,512
ar trebui să fie în listă. Deci ca text

25214
19:44:08,640 --> 19:44:16,512
aici îmi va plăcea iubesc mașina

25215
19:44:13,512 --> 19:44:16,512
nume.

25216
19:44:21,680 --> 19:44:24,680
Deci

25217
19:44:33,832 --> 19:44:36,832
Ioane

25218
19:44:37,680 --> 19:44:41,320
fie asa

25219
19:44:52,872 --> 19:44:59,080
Deci aici df este egală până în prezent

25220
19:45:02,160 --> 19:45:08,160
textul comenzii

25221
19:45:06,080 --> 19:45:11,160
apoi tipăriți

25222
19:45:08,160 --> 19:45:11,160
df.

25223
19:45:19,360 --> 19:45:24,000
Îmi place învățarea automată. Pozitiv. B este

25224
19:45:21,512 --> 19:45:29,240
atât de activ. Pozitiv. J Mă simt atât de bine.

25225
19:45:24,000 --> 19:45:29,240
Negativ. Bine. Există

25226
19:45:39,192 --> 19:45:47,040
şi

25227
19:45:41,040 --> 19:45:50,400
da. Vezi acum că vine. Bine.

25228
19:45:47,040 --> 19:45:53,360
Acesta este modul în care puteți face sentimentul

25229
19:45:50,400 --> 19:45:55,832
analiza folosind uh model RNN. Aici noi

25230
19:45:53,360 --> 19:46:00,760
au încărcat modelul RNN. Deci se arată

25231
19:45:55,832 --> 19:46:00,760
corect. Deci să le facem ca ipostaze

25232
19:46:04,320 --> 19:46:07,552
chiar aici.

25233
19:46:09,360 --> 19:46:14,280
Adăugați

25234
19:46:11,280 --> 19:46:14,280
unul.

25235
19:46:25,192 --> 19:46:29,480
negativ. bine,

25236
19:46:29,512 --> 19:46:34,640
Modelul RNN funcționează. Deci, azi, noi

25237
19:46:32,480 --> 19:46:37,280
urmează să exploreze K vecinii cei mai apropiați

25238
19:46:34,640 --> 19:46:40,000
sau KNandN, care este una dintre cele mai populare

25239
19:46:37,280 --> 19:46:42,480
algoritmi în știința datelor. Python este un

25240
19:46:40,000 --> 19:46:44,480
instrument puternic pentru știința datelor și KNN

25241
19:46:42,480 --> 19:46:46,800
este excelent pentru clasificarea datelor după

25242
19:46:44,480 --> 19:46:49,600
prezicerea categoriei de bază de eșantion

25243
19:46:46,800 --> 19:46:52,400
pe vecinul său cel mai apropiat. Acesti algoritmi

25244
19:46:49,600 --> 19:46:55,360
este utilizat în multe domenii, cum ar fi asistența medicală,

25245
19:46:52,400 --> 19:46:58,240
finanțele și agricultura ne ajută să facem

25246
19:46:55,360 --> 19:47:00,720
decizie bazată pe date. Cea mai bună parte este

25247
19:46:58,240 --> 19:47:03,120
este cu adevărat ușor de utilizat. Trebuie doar să

25248
19:47:00,720 --> 19:47:05,360
alegeți un număr pentru K și alegeți a

25249
19:47:03,120 --> 19:47:08,240
funcție de distanță pentru a compara datele

25250
19:47:05,360 --> 19:47:10,160
puncte. Cu toate acestea, KNandN are dezavantaje.

25251
19:47:08,240 --> 19:47:12,720
Nu funcționează bine cu datele mari

25252
19:47:10,160 --> 19:47:15,192
setat și necesită o scalare adecvată a

25253
19:47:12,720 --> 19:47:17,120
date pentru a obține un rezultat precis. In aceasta

25254
19:47:15,192 --> 19:47:19,680
video, vă vom arăta cum funcționează KNN

25255
19:47:17,120 --> 19:47:21,680
cu setul de date reale, setul de date Iris.

25256
19:47:19,680 --> 19:47:23,680
Vă vom ghida prin Python simplu

25257
19:47:21,680 --> 19:47:26,240
cod și demonstrați cum să găsiți

25258
19:47:23,680 --> 19:47:28,960
cea mai bună valoare K pentru a maximiza modelul dvs

25259
19:47:26,240 --> 19:47:30,872
precizie. Așa că rămâneți pe fază pentru a căuta

25260
19:47:28,960 --> 19:47:33,512
acțiune. Deci bun venit la partea demo. Deci

25261
19:47:30,872 --> 19:47:36,640
Sunt aici folosind Google Colab. Deci poți

25262
19:47:33,512 --> 19:47:39,680
utilizați oricare dintre ID-urile dvs. preferate, cum ar fi Jupyter

25263
19:47:36,640 --> 19:47:43,040
notebook, Intelligi, Visual Code Studio,

25264
19:47:39,680 --> 19:47:48,760
orice. Bine. Deci, lasă-mă să redenumesc asta

25265
19:47:43,040 --> 19:47:48,760
fișier ca clasificare KNN.

25266
19:47:51,920 --> 19:47:56,872
Bine, cool. Deci, permiteți-mi să vă spun că KNandN

25267
19:47:55,192 --> 19:47:59,192
poate fi folosit pentru clasificare

25268
19:47:56,872 --> 19:48:00,720
probleme predictive de regresie. Deci KN

25269
19:47:59,192 --> 19:48:03,600
se încadrează în familia de învățare supravegheată

25270
19:48:00,720 --> 19:48:06,640
a algoritmilor. Bine, deci vom măsura

25271
19:48:03,600 --> 19:48:08,080
distanţa dintre vecinii K şi

25272
19:48:06,640 --> 19:48:11,600
primul pas va fi să alegem

25273
19:48:08,080 --> 19:48:14,080
numărul de K de vecini. Atunci uh uh

25274
19:48:11,600 --> 19:48:15,832
vom lua cei mai apropiati k vecini de

25275
19:48:14,080 --> 19:48:18,480
noul punct de date conform dvs

25276
19:48:15,832 --> 19:48:21,512
metrica distantei. Iar pasul trei va fi

25277
19:48:18,480 --> 19:48:23,680
fii printre aceste cazuri vecinii numără

25278
19:48:21,512 --> 19:48:25,600
numărul de puncte de date ale fiecăruia

25279
19:48:23,680 --> 19:48:27,600
categorie. Bine. Pasul patru îl vom atribui

25280
19:48:25,600 --> 19:48:29,440
noile date indică categorie

25281
19:48:27,600 --> 19:48:32,320
unde ai numărat cei mai mulți vecini.

25282
19:48:29,440 --> 19:48:35,192
Bine. Deci să începem. Mai întâi să importăm

25283
19:48:32,320 --> 19:48:37,680
vreo bibliotecă. import

25284
19:48:35,192 --> 19:48:42,400
numpy

25285
19:48:37,680 --> 19:48:45,920
ca np și să importăm

25286
19:48:42,400 --> 19:48:49,760
panda sp. Deci toată lumea știe ce este

25287
19:48:45,920 --> 19:48:51,280
numpy și panda. Bine, atât de numpy este

25288
19:48:49,760 --> 19:48:53,512
o bibliotecă pentru programarea python

25289
19:48:51,280 --> 19:48:56,240
Limbă adăugând suport pentru uh, știi

25290
19:48:53,512 --> 19:48:58,800
matrice mari multidimensionale. Bine.

25291
19:48:56,240 --> 19:49:01,280
Împreună cu marea colecție de uh

25292
19:48:58,800 --> 19:49:03,120
ce să spun matematică la nivel înalt

25293
19:49:01,280 --> 19:49:04,720
funcții și diverse panda este a

25294
19:49:03,120 --> 19:49:06,000
biblioteca de software scrisă pentru Python

25295
19:49:04,720 --> 19:49:09,192
limbaj de programare pentru date

25296
19:49:06,000 --> 19:49:12,400
manipulare și analiză uh toate

25297
19:49:09,192 --> 19:49:14,240
cadre de date și uh date le structurează

25298
19:49:12,400 --> 19:49:16,240
oferte pentru manipularea numerică

25299
19:49:14,240 --> 19:49:18,480
mesele. Bine. Și seria de timp tu

25300
19:49:16,240 --> 19:49:21,920
pot vedea. Așa că mergem înainte

25301
19:49:18,480 --> 19:49:23,512
importați setul nostru de date. Deci poți descărca

25302
19:49:21,920 --> 19:49:26,960
setul de date din caseta de descriere

25303
19:49:23,512 --> 19:49:30,640
mai jos. Bine. set de date

25304
19:49:26,960 --> 19:49:34,872
este egal cu pb dot read

25305
19:49:30,640 --> 19:49:38,400
csv. Numele datelor este iris dot csv.

25306
19:49:34,872 --> 19:49:42,080
Bine. Așa citești datele tale

25307
19:49:38,400 --> 19:49:47,832
în piton. Bine. Da. Setul de date este

25308
19:49:42,080 --> 19:49:52,720
încărcat. Deci forma punctului setului de date

25309
19:49:47,832 --> 19:49:57,280
forma. Bine. Da. Deci date uh set dot

25310
19:49:52,720 --> 19:49:59,040
forma este folosită pentru câte numere de

25311
19:49:57,280 --> 19:50:01,920
rânduri și coloane prezente în datele dvs

25312
19:49:59,040 --> 19:50:04,640
set. Bine, 150 de rânduri și șase coloane. Deci

25313
19:50:01,920 --> 19:50:08,080
permiteți-mi să vă spun pe scurt despre setul de date

25314
19:50:04,640 --> 19:50:11,440
acest set de date. Deci acest set de date include

25315
19:50:08,080 --> 19:50:14,160
trei specii de iris cu 50 de mostre

25316
19:50:11,440 --> 19:50:17,360
fiecare precum si unele proprietati despre

25317
19:50:14,160 --> 19:50:19,920
fiecare floare. Deci o specie de flori este

25318
19:50:17,360 --> 19:50:22,160
separabil liniar de celelalte două

25319
19:50:19,920 --> 19:50:24,480
poți spune, dar celelalte două nu sunt

25320
19:50:22,160 --> 19:50:27,120
separabile liniar unele de altele.

25321
19:50:24,480 --> 19:50:28,872
Bine. Și această formă ți-am spus că putem

25322
19:50:27,120 --> 19:50:30,872
fă-ți o idee rapidă despre câte cazuri

25323
19:50:28,872 --> 19:50:34,000
de rânduri și coloane sunt prezente în nostru

25324
19:50:30,872 --> 19:50:36,480
set de date. Deci, să vedem setul nostru de date.

25325
19:50:34,000 --> 19:50:41,120
Setul de date punct

25326
19:50:36,480 --> 19:50:44,640
cap. Deci capul este folosit pentru uh, știi de

25327
19:50:41,120 --> 19:50:47,680
puteți vedea primele cinci rânduri ale datelor dvs

25328
19:50:44,640 --> 19:50:50,080
setați folosind cap și dacă veți folosi coada

25329
19:50:47,680 --> 19:50:52,800
tu în loc de cap poți vedea ultimul

25330
19:50:50,080 --> 19:50:55,760
cinci rânduri din setul dvs. de date. Rece. Bine.

25331
19:50:52,800 --> 19:50:58,000
Deci, coloanele sunt eșantion de lungime a eșantionului de identificare

25332
19:50:55,760 --> 19:51:01,512
lățime lungime petale lățime petale și cel

25333
19:50:58,000 --> 19:51:03,832
specii. Rece. Apoi, mergem mai departe haideți

25334
19:51:01,512 --> 19:51:08,400
descrieți seturile noastre de date. Deci acestea sunt

25335
19:51:03,832 --> 19:51:12,512
noțiuni de bază uh funcție de bază. Bine.

25336
19:51:08,400 --> 19:51:12,512
despre Python se poate spune.

25337
19:51:12,552 --> 19:51:18,872
Deci set de date.descris ceea ce descrie face

25338
19:51:16,160 --> 19:51:21,512
este că vă va oferi numărătoarea tuturor

25339
19:51:18,872 --> 19:51:25,920
rânduri valoarea medie valoarea abaterii standard

25340
19:51:21,512 --> 19:51:28,960
valoarea minimă care este 25% în regulă

25341
19:51:25,920 --> 19:51:32,160
toate valorile din rândul respectiv.

25342
19:51:28,960 --> 19:51:34,160
Care este 50%? Care este 75%? Ce

25343
19:51:32,160 --> 19:51:37,512
este maximul? Maximul este de 150 puteți

25344
19:51:34,160 --> 19:51:40,480
spune. Bine. iar 25% din 150 este 38,25 25

25345
19:51:37,512 --> 19:51:42,960
aceasta este în regulă dintre toate coloanele dacă este

25346
19:51:40,480 --> 19:51:46,960
normal, știi caracterul, așa că nu va fi

25347
19:51:42,960 --> 19:51:49,680
vă dau orice date, bine, da, așa că

25348
19:51:46,960 --> 19:51:52,000
mergând înainte, hai să aruncăm o privire

25349
19:51:49,680 --> 19:51:56,400
la numărul de instanțe căruia îi aparține rândul

25350
19:51:52,000 --> 19:51:59,512
fiecare clasă este în regulă, așa că vom scrie date

25351
19:51:56,400 --> 19:52:02,832
set punct

25352
19:51:59,512 --> 19:52:02,832
grupează după

25353
19:52:03,120 --> 19:52:10,400
specii

25354
19:52:04,800 --> 19:52:14,400
dimensiunea punctului. Bine. Uh spec S este capital

25355
19:52:10,400 --> 19:52:17,760
de aceea arată eroarea. Da.

25356
19:52:14,400 --> 19:52:20,872
Deci poți vedea că Iris Satossa are 50 de ani, Iris

25357
19:52:17,760 --> 19:52:23,512
Verical are 50 și virginica este 50.

25358
19:52:20,872 --> 19:52:25,760
Bine. Iar tipul de date este întreg.

25359
19:52:23,512 --> 19:52:28,240
Rece. Deci, după cum puteți vedea, setul de date

25360
19:52:25,760 --> 19:52:30,640
conține șase coloane precum ID, eșantion

25361
19:52:28,240 --> 19:52:32,800
lungime, lățime eșantion și lungime petale,

25362
19:52:30,640 --> 19:52:34,960
lățimea și distanța petalelor. Actualul

25363
19:52:32,800 --> 19:52:37,440
caracteristicile sunt descrise de coloanele 1 la

25364
19:52:34,960 --> 19:52:39,680
patru. ultimele coloane etichete sau

25365
19:52:37,440 --> 19:52:41,760
mostre. Bine. Deci, în primul rând, trebuie

25366
19:52:39,680 --> 19:52:44,400
împărțiți datele în două matrice, cum ar fi X

25367
19:52:41,760 --> 19:52:48,320
caracteristici și etichete Y. Deci cum vom proceda

25368
19:52:44,400 --> 19:52:51,920
asta? Scriind cod ca caracteristică

25369
19:52:48,320 --> 19:52:54,160
coloane egal cu

25370
19:52:51,920 --> 19:52:56,552
lungimea probei lățimea probei lungimea petalei

25371
19:52:54,160 --> 19:53:01,360
lățimea petalelor. Amintește-ți doar că ești

25372
19:52:56,552 --> 19:53:03,920
scriind numele corect. Bine. Atunci x = to

25373
19:53:01,360 --> 19:53:06,800
set de date

25374
19:53:03,920 --> 19:53:09,760
caracteristică

25375
19:53:06,800 --> 19:53:12,160
coloane.

25376
19:53:09,760 --> 19:53:13,920
Bine. Dot

25377
19:53:12,160 --> 19:53:18,320
valorile.

25378
19:53:13,920 --> 19:53:20,872
Atunci y = to

25379
19:53:18,320 --> 19:53:25,280
set de date

25380
19:53:20,872 --> 19:53:29,120
valorile punctului speciilor. Rece. Atunci lasă-mă

25381
19:53:25,280 --> 19:53:31,920
rulează-l. Deci așa ne putem despărți

25382
19:53:29,120 --> 19:53:34,800
setul de date este bine în două matrice X și

25383
19:53:31,920 --> 19:53:36,552
Y. Bine. În X există caracteristici

25384
19:53:34,800 --> 19:53:39,760
coloane. Aceste patru coloane sunt acolo

25385
19:53:36,552 --> 19:53:41,680
iar în coloana speciilor Y este acolo. Bine.

25386
19:53:39,760 --> 19:53:45,600
Și care este rubrica despre specii

25387
19:53:41,680 --> 19:53:47,600
Satossa venica si toate astea. Rece.

25388
19:53:45,600 --> 19:53:49,680
Apoi acum vom face codificarea etichetelor. Deci

25389
19:53:47,600 --> 19:53:51,920
după cum puteți vedea etichetele sunt categorice

25390
19:53:49,680 --> 19:53:55,280
Clasificatorul Kverse nu acceptă șir

25391
19:53:51,920 --> 19:53:57,680
etichete. Deci trebuie să folosim codificatorul de etichete

25392
19:53:55,280 --> 19:54:00,400
pentru a le transforma în numere. Bine.

25393
19:53:57,680 --> 19:54:04,000
Apoi iris satossa corespunde cu zero.

25394
19:54:00,400 --> 19:54:07,360
Culoarea irisului vericy corespunde uneia și

25395
19:54:04,000 --> 19:54:13,440
I is virginica corespund la doi. Bine.

25396
19:54:07,360 --> 19:54:18,600
012. Cool. Deci de unde putem scrie

25397
19:54:13,440 --> 19:54:18,600
preprocesare skarn dot

25398
19:54:18,720 --> 19:54:23,040
import

25399
19:54:21,280 --> 19:54:26,640
eticheta

25400
19:54:23,040 --> 19:54:29,360
codificatorul bine, deci ce vom face eticheta

25401
19:54:26,640 --> 19:54:31,680
codificatorul le transformă în numere bine

25402
19:54:29,360 --> 19:54:34,240
asa ca voi scrie

25403
19:54:31,680 --> 19:54:36,872
l egal cu

25404
19:54:34,240 --> 19:54:41,760
codificator de etichetă

25405
19:54:36,872 --> 19:54:44,800
bine, codificatorul meu de etichetă prost. Bine. Apoi y

25406
19:54:41,760 --> 19:54:47,360
= to ele alate transform y. Bine. Deci acum

25407
19:54:44,800 --> 19:54:49,440
O voi rula. Da. Corecta. Deci

25408
19:54:47,360 --> 19:54:51,832
împărțirea setului de date în set de antrenament și

25409
19:54:49,440 --> 19:54:53,680
setul de test acum. Bine. Deci acum vom face

25410
19:54:51,832 --> 19:54:56,000
împărțiți setul de date în set de antrenament și

25411
19:54:53,680 --> 19:54:58,800
set de testare pentru a verifica mai târziu dacă sau

25412
19:54:56,000 --> 19:55:02,480
nu un clasificator funcționează corect sau nu.

25413
19:54:58,800 --> 19:55:06,552
Bine. Deci aici voi scrie de la skarn

25414
19:55:02,480 --> 19:55:11,080
nu încrucișați. O voi scrie aici.

25415
19:55:06,552 --> 19:55:11,080
Selecția Skarn domodel

25416
19:55:12,080 --> 19:55:17,040
import

25417
19:55:14,480 --> 19:55:19,512
împărțirea testului trenului. Deci, ce este testul de tren

25418
19:55:17,040 --> 19:55:21,760
despartit? Tren test split este un model

25419
19:55:19,512 --> 19:55:24,800
procedura de validare care dezvăluie cum

25420
19:55:21,760 --> 19:55:28,400
modelul dvs. funcționează pe noile dvs. date.

25421
19:55:24,800 --> 19:55:30,800
Bine. Și ce este trenul X acces trenul Y

25422
19:55:28,400 --> 19:55:32,552
Y test în Python. Bine. Lasă-mă mai întâi

25423
19:55:30,800 --> 19:55:35,920
scrie-l si apoi te anunt.

25424
19:55:32,552 --> 19:55:43,280
Bine. Atunci voi scrie aici

25425
19:55:35,920 --> 19:55:47,960
x tren virgula x test virgula y tren virgula

25426
19:55:43,280 --> 19:55:47,960
y test. Bine

25427
19:55:48,160 --> 19:55:52,960
test de tren

25428
19:55:51,440 --> 19:55:56,080
despicat

25429
19:55:52,960 --> 19:55:58,872
apoi x virgula y

25430
19:55:56,080 --> 19:56:02,720
dimensiunea testului virgulă

25431
19:55:58,872 --> 19:56:05,920
0.2 și aleatoriu este acesta. Bine. Bine.

25432
19:56:02,720 --> 19:56:08,160
A venit o eroare. Bine. Model de subliniere

25433
19:56:05,920 --> 19:56:12,872
selecție.

25434
19:56:08,160 --> 19:56:15,680
Da. Rece. Deci, ce este trenul X testul X? Y

25435
19:56:12,872 --> 19:56:17,920
testul trenului Y. Bine. Deci X tren și Y

25436
19:56:15,680 --> 19:56:20,480
garniturile de tren sunt folosite pentru antrenament și

25437
19:56:17,920 --> 19:56:23,120
potrivirea modelului. Bine. Deci testul X

25438
19:56:20,480 --> 19:56:26,320
iar testul Y sunt setul folosit pentru

25439
19:56:23,120 --> 19:56:30,080
testează modelul și se prezice

25440
19:56:26,320 --> 19:56:33,360
nivelul corect de ieșiri. Bine. Deci aici

25441
19:56:30,080 --> 19:56:37,832
puteți vedea că dimensiunea testului este de 0,2. în mijloace

25442
19:56:33,360 --> 19:56:41,040
80% este pentru testare sau scuze 80% este pentru

25443
19:56:37,832 --> 19:56:44,552
instruire și 20% este pentru testare pentru

25444
19:56:41,040 --> 19:56:46,552
date noi. Rece. Da. Deci acum vom vedea

25445
19:56:44,552 --> 19:56:48,872
unii hai să facem niște date

25446
19:56:46,552 --> 19:56:50,960
vizualizare. Bine. Deci aici voi face

25447
19:56:48,872 --> 19:56:53,832
import de scriere

25448
19:56:50,960 --> 19:56:56,832
mattplot lib

25449
19:56:53,832 --> 19:56:56,832
dotpipplot

25450
19:56:56,872 --> 19:57:01,440
ca plt

25451
19:56:59,120 --> 19:57:03,040
apoi import

25452
19:57:01,440 --> 19:57:05,120
cb

25453
19:57:03,040 --> 19:57:08,160
ca sns

25454
19:57:05,120 --> 19:57:10,320
atunci aici voi scrie person mattplot

25455
19:57:08,160 --> 19:57:12,800
lib

25456
19:57:10,320 --> 19:57:14,960
în linie. Deci, ce este mattplot lib?

25457
19:57:12,800 --> 19:57:17,192
Mattplot lib este o bibliotecă de plotting pentru

25458
19:57:14,960 --> 19:57:19,680
limbajul de programare python și este

25459
19:57:17,192 --> 19:57:22,400
extensie matematică numerică. Bine. Aşa

25460
19:57:19,680 --> 19:57:25,192
numpy oferă un obiect API pentru

25461
19:57:22,400 --> 19:57:27,832
încorporarea parcelelor în aplicație folosind

25462
19:57:25,192 --> 19:57:32,480
generatoare de instrumente GUI, cum ar fi

25463
19:57:27,832 --> 19:57:34,872
kintter și python sau gtk. Bine. întrucât

25464
19:57:32,480 --> 19:57:37,120
seabon seabon este o bibliotecă pentru realizarea

25465
19:57:34,872 --> 19:57:39,440
grafic static în python. Se bazează pe

25466
19:57:37,120 --> 19:57:42,160
partea superioară a buzei mattplot și se integrează

25467
19:57:39,440 --> 19:57:45,680
îndeaproape cu structura datelor panda.

25468
19:57:42,160 --> 19:57:49,760
Bine, seborn ne ajută să explorăm și

25469
19:57:45,680 --> 19:57:54,080
intelege datele. Bine, deci voi alerga

25470
19:57:49,760 --> 19:57:58,160
e aici. voi scrie de la

25471
19:57:54,080 --> 19:58:01,040
panda dot plotting

25472
19:57:58,160 --> 19:58:04,040
import

25473
19:58:01,040 --> 19:58:04,040
paralel

25474
19:58:04,720 --> 19:58:11,920
coordonate.

25475
19:58:07,440 --> 19:58:15,480
Apoi plt dot cifra

25476
19:58:11,920 --> 19:58:15,480
dimensiunea ar trebui să fie

25477
19:58:15,832 --> 19:58:24,832
15, 10. Bine.

25478
19:58:19,920 --> 19:58:24,832
Apoi coordonate paralele.

25479
19:58:25,192 --> 19:58:33,120
Bine. Apoi setul de date dot drop. Eu nu

25480
19:58:30,400 --> 19:58:36,320
nevoie de id,

25481
19:58:33,120 --> 19:58:41,240
x este unul.

25482
19:58:36,320 --> 19:58:41,240
Bine. apoi spații cu virgulă

25483
19:58:41,280 --> 19:58:48,000
apoi plt dot titlu

25484
19:58:44,800 --> 19:58:50,000
și lăsați paralel

25485
19:58:48,000 --> 19:58:53,920
coordonate

25486
19:58:50,000 --> 19:58:56,960
complot în regulă și

25487
19:58:53,920 --> 19:58:59,760
puteți da o dimensiune a fontului

25488
19:58:56,960 --> 19:59:02,080
egal cu 20

25489
19:58:59,760 --> 19:59:03,680
apoi font

25490
19:59:02,080 --> 19:59:05,680
greutate

25491
19:59:03,680 --> 19:59:10,800
egal cu

25492
19:59:05,680 --> 19:59:14,080
bine Să adăugăm bold numai bold apoi plt

25493
19:59:10,800 --> 19:59:15,832
eticheta punct x

25494
19:59:14,080 --> 19:59:17,680
apoi

25495
19:59:15,832 --> 19:59:20,000
caracteristici

25496
19:59:17,680 --> 19:59:22,160
virgulă

25497
19:59:20,000 --> 19:59:25,832
dimensiunea fontului

25498
19:59:22,160 --> 19:59:29,600
la 15 apoi plt

25499
19:59:25,832 --> 19:59:31,600
dot y etichetă atunci voi scrie aici

25500
19:59:29,600 --> 19:59:33,512
caracteristici

25501
19:59:31,600 --> 19:59:37,040
valorile

25502
19:59:33,512 --> 19:59:45,360
dimensiunea fontului virgulă

25503
19:59:37,040 --> 19:59:52,192
egal cu 15. Bine. apoi plt dot legenda

25504
19:59:45,360 --> 19:59:52,192
apoi localnicii la 1 virgula

25505
19:59:53,280 --> 20:00:00,400
Voi scrie cu cadru

25506
19:59:56,480 --> 20:00:06,120
este egal cu umbră virgulă adevărată

25507
20:00:00,400 --> 20:00:06,120
este egal cu culoarea feței virgulă adevărată

25508
20:00:06,320 --> 20:00:10,280
egal cu alb

25509
20:00:11,440 --> 20:00:15,160
T ar trebui să fie capital

25510
20:00:15,192 --> 20:00:19,480
și culoarea marginii virgulei

25511
20:00:19,600 --> 20:00:23,000
egal cu

25512
20:00:25,920 --> 20:00:30,872
ok plt dot show ok o eroare este

25513
20:00:28,960 --> 20:00:36,512
acolo plig

25514
20:00:30,872 --> 20:00:36,512
mărime în regulă greșeală de ortografie Ia.

25515
20:00:37,120 --> 20:00:45,040
Bine. Inca o eroare. PLT. Legendă. Bine.

25516
20:00:41,040 --> 20:00:48,240
Culoarea feței. Bine. Un stick de ortografie.

25517
20:00:45,040 --> 20:00:50,552
Deci da, lasă-mă să-l fac să iasă în întregime

25518
20:00:48,240 --> 20:00:52,720
ecran. Da. Deci coordonatele paralele sunt

25519
20:00:50,552 --> 20:00:56,000
o tehnică de complot pentru a te complot

25520
20:00:52,720 --> 20:00:59,120
cunosc date multivariate. Deci permite unul

25521
20:00:56,000 --> 20:01:02,320
pentru a vedea clustere în date și pentru a

25522
20:00:59,120 --> 20:01:04,552
estimați vizual alte statistici. Deci folosind

25523
20:01:02,320 --> 20:01:06,320
puncte de coordonate paralele, știi

25524
20:01:04,552 --> 20:01:10,160
sunt reprezentate ca linie conectată

25525
20:01:06,320 --> 20:01:12,960
segmente după cum puteți vedea. Bine. Și fiecare

25526
20:01:10,160 --> 20:01:15,512
linia verticală reprezintă un atribut

25527
20:01:12,960 --> 20:01:18,640
și un set de segmente de linie conectate

25528
20:01:15,512 --> 20:01:21,760
reprezintă un punct de date. Bine. Şi

25529
20:01:18,640 --> 20:01:25,600
vor apărea punctele care tind să se grupeze

25530
20:01:21,760 --> 20:01:29,512
mai aproape unul de altul. Bine. Deci asta uh asta

25531
20:01:25,600 --> 20:01:33,040
culoarea este irisul satossa și acesta este irisul

25532
20:01:29,512 --> 20:01:35,600
culoare si aceasta ba este iris virginica

25533
20:01:33,040 --> 20:01:38,480
după cum puteți vedea în legendă. Bine,

25534
20:01:35,600 --> 20:01:42,000
rece. Așa că mergând înainte, să creăm

25535
20:01:38,480 --> 20:01:44,552
un alt grafic și curbe. Bine, aici sunt

25536
20:01:42,000 --> 20:01:48,640
va scrie din

25537
20:01:44,552 --> 20:01:53,512
p și dotplotting import scatter. Oh,

25538
20:01:48,640 --> 20:01:56,320
acest import de complot

25539
20:01:53,512 --> 20:01:58,872
Andreo se curbe.

25540
20:01:56,320 --> 20:02:02,320
Bine, atunci plt

25541
20:01:58,872 --> 20:02:04,000
figura punct. Este bazat pe AI. Deci este

25542
20:02:02,320 --> 20:02:05,832
oferindu-mi sugestii. Sugestii.

25543
20:02:04,000 --> 20:02:08,160
Sugestii. Bine. Deci uneori

25544
20:02:05,832 --> 20:02:12,872
sugestiile sunt bune, dar nu întotdeauna.

25545
20:02:08,160 --> 20:02:15,280
Da. Să continuăm. Dimensiunea figurii este de 15,

25546
20:02:12,872 --> 20:02:19,000
10.

25547
20:02:15,280 --> 20:02:19,000
Apoi Andrei

25548
20:02:20,480 --> 20:02:25,600
curbe

25549
20:02:22,720 --> 20:02:29,040
apoi voi adăuga setul de date dot drop id

25550
20:02:25,600 --> 20:02:34,640
spatii de acces si diagrama plt si curbe.

25551
20:02:29,040 --> 20:02:38,000
Bine bine. Bine, lasă-mă să adaug că nu

25552
20:02:34,640 --> 20:02:40,160
nevoie de eticheta X și tot. Lasă-mă să adaug o legendă

25553
20:02:38,000 --> 20:02:41,920
complot

25554
20:02:40,160 --> 20:02:47,280
legenda.

25555
20:02:41,920 --> 20:02:50,552
Atunci aceeași LOC este egală cu 1. Apoi

25556
20:02:47,280 --> 20:02:54,000
dimensiunea propunerii.

25557
20:02:50,552 --> 20:02:56,960
Apoi voi scrie aici dimensiunea

25558
20:02:54,000 --> 20:03:03,040
este 15

25559
20:02:56,960 --> 20:03:07,360
de cadru pe egal cu două virgulă umbră

25560
20:03:03,040 --> 20:03:10,320
egal cu adevărat. Deci asta e cu adevărat

25561
20:03:07,360 --> 20:03:13,040
pe baza dvs. dacă doriți să adăugați o legendă

25562
20:03:10,320 --> 20:03:16,872
sau nu sau poți sări peste. Dacă vrei

25563
20:03:13,040 --> 20:03:20,960
sari poti sari. Bine. Culoarea feței

25564
20:03:16,872 --> 20:03:26,400
egal cu albul. Apoi

25565
20:03:20,960 --> 20:03:29,832
culoarea marginii este egală cu negru. Bine. Apoi

25566
20:03:26,400 --> 20:03:32,800
plt dot show.

25567
20:03:29,832 --> 20:03:36,400
Da. Deci nu există nicio eroare. Așa că lasă-mă

25568
20:03:32,800 --> 20:03:39,192
prima vizualizare a ieșirii pe ecran complet. Bine.

25569
20:03:36,400 --> 20:03:41,440
Deci Andrew curbe acestea sunt endoc-ul

25570
20:03:39,192 --> 20:03:44,400
curbe. Bine. Puteți vedea graficul în

25571
20:03:41,440 --> 20:03:47,120
curba. Deci și curba permiteți

25572
20:03:44,400 --> 20:03:50,000
reprezentați datele multivariate ca un număr mare

25573
20:03:47,120 --> 20:03:52,160
de curbe. Deci, acestea sunt create folosind

25574
20:03:50,000 --> 20:03:54,800
atributele mostrelor bine ca

25575
20:03:52,160 --> 20:03:57,600
coeficient pentru seria de 4 ani. Bine. Deci

25576
20:03:54,800 --> 20:04:00,240
prin colorarea diferită a acestor curbe pt

25577
20:03:57,600 --> 20:04:03,280
fiecare clasă. Este posibil să se vizualizeze

25578
20:04:00,240 --> 20:04:06,320
gruparea datelor. Deci curbele aparțin

25579
20:04:03,280 --> 20:04:08,720
aparținând mostrelor din aceeași clasă

25580
20:04:06,320 --> 20:04:11,440
vor fi de obicei mai apropiați și ei

25581
20:04:08,720 --> 20:04:13,440
formează o structură mare. Bine. Cum poți

25582
20:04:11,440 --> 20:04:15,600
vezi aici si aceasta este legenda de ce noi

25583
20:04:13,440 --> 20:04:19,120
se setează cele patru culori ar trebui să fie

25584
20:04:15,600 --> 20:04:22,320
alb și da și culoarea marginii ar trebui

25585
20:04:19,120 --> 20:04:24,800
fi negru bine și cadru pe umbră ar trebui

25586
20:04:22,320 --> 20:04:26,480
fii acolo poți vedea umbra bine

25587
20:04:24,800 --> 20:04:28,960
asa daca vrei sa sari poti

25588
20:04:26,480 --> 20:04:33,192
omite această parte legendă parte legendă

25589
20:04:28,960 --> 20:04:36,480
bine, dar parcă e bine să-l ai

25590
20:04:33,192 --> 20:04:39,192
bună practică pentru a avea acest lucru cool, așa că haideți

25591
20:04:36,480 --> 20:04:42,160
creează o parcelă de pereche mică, bine, așa că eu

25592
20:04:39,192 --> 20:04:45,160
va scrie aici plt dot

25593
20:04:42,160 --> 20:04:45,160
figura

25594
20:04:46,160 --> 20:04:53,920
apoi voi scrie SNS dot pair plot

25595
20:04:51,360 --> 20:04:56,640
apoi voi scrie setul de date

25596
20:04:53,920 --> 20:05:00,480
picătură punct

25597
20:04:56,640 --> 20:05:07,360
vom arunca din nou id nu avem nevoie de virgulă

25598
20:05:00,480 --> 20:05:09,760
xis este unul, atunci voi scrie u egal cu

25599
20:05:07,360 --> 20:05:13,040
specii

25600
20:05:09,760 --> 20:05:17,920
dimensiunea este egală cu trei.

25601
20:05:13,040 --> 20:05:23,512
Atunci marcatorii sunt egali cu

25602
20:05:17,920 --> 20:05:27,192
O SD. Da. Rece. Apoi plt dot show.

25603
20:05:23,512 --> 20:05:30,480
Se rulează. Da. Așa că mai întâi lasă-mă să fac

25604
20:05:27,192 --> 20:05:32,960
e pe ecran complet. Da. Deci aici pereche

25605
20:05:30,480 --> 20:05:34,480
wise este util atunci când vrei

25606
20:05:32,960 --> 20:05:36,960
vizualizați distribuția

25607
20:05:34,480 --> 20:05:39,192
variabilă sau relația dintre

25608
20:05:36,960 --> 20:05:42,640
variabile multiple separat în interior

25609
20:05:39,192 --> 20:05:46,080
subseturi ale setului dvs. de date. Bine. Deci aici

25610
20:05:42,640 --> 20:05:49,040
acesta albastru este stoa verol si cel

25611
20:05:46,080 --> 20:05:51,600
virginica. Bine. Deci astea sunt niște uh

25612
20:05:49,040 --> 20:05:55,360
grafic puteți spune sau aici puteți vedea

25613
20:05:51,600 --> 20:05:58,800
lungimea probei. Bine. Atât de verde este

25614
20:05:55,360 --> 20:06:01,680
virginica si versol aproape au

25615
20:05:58,800 --> 20:06:04,320
aceeași lungime a probei. Bine. Și aici sunt

25616
20:06:01,680 --> 20:06:07,440
diferitele tipuri de grafice. Bine. Dacă

25617
20:06:04,320 --> 20:06:10,080
nu vrei să uh să spunem dacă tu

25618
20:06:07,440 --> 20:06:12,552
nu stiu sa citesc acest grafic

25619
20:06:10,080 --> 20:06:14,720
puteți folosi acest grafic sau puteți folosi acesta

25620
20:06:12,552 --> 20:06:17,680
grafic. Fie puteți folosi acest grafic.

25621
20:06:14,720 --> 20:06:20,320
Bine. Aceasta este puterea perechilor înțelepte

25622
20:06:17,680 --> 20:06:24,320
comploturi pe care le poți spune. Și lățimea eșantionului

25623
20:06:20,320 --> 20:06:28,640
cm. Bine. Satossa. Nu. Bine, virginica

25624
20:06:24,320 --> 20:06:32,320
iar verticola avand din nou aproape la fel

25625
20:06:28,640 --> 20:06:35,440
lățimea probei. Bine, și aici, de asemenea.

25626
20:06:32,320 --> 20:06:39,360
Bine, acest stoa are o formă diferită.

25627
20:06:35,440 --> 20:06:42,872
Bine. Da. Deci, vom crea unul

25628
20:06:39,360 --> 20:06:45,280
mic uh pereche de voi un mic grafic atunci

25629
20:06:42,872 --> 20:06:48,552
vom merge înainte. Bine. O voi face

25630
20:06:45,280 --> 20:06:53,080
scrie aici plt dot. Deci acum suntem

25631
20:06:48,552 --> 20:06:53,080
crearea figurii box plot.

25632
20:06:54,000 --> 20:07:05,120
Bine. Apoi setul de date dot drop.

25633
20:06:58,400 --> 20:07:09,440
Apoi, din nou, virgulele ID ar trebui să fie una

25634
20:07:05,120 --> 20:07:12,160
diagramă cu puncte. Bine. Apoi figura mărimea I

25635
20:07:09,440 --> 20:07:15,040
ales asta. Da. Hai să-l rulăm. Da.

25636
20:07:12,160 --> 20:07:17,360
Vedeți din nou, acesta este diagrama de casete. Petală

25637
20:07:15,040 --> 20:07:20,552
lungime aceeași lățime petală lungime sevă sle

25638
20:07:17,360 --> 20:07:23,512
lățimea este ok în funcție de lățimea

25639
20:07:20,552 --> 20:07:26,000
arătând astfel de la aceasta până la această lățime noi

25640
20:07:23,512 --> 20:07:28,552
au culoarea veric si de la aceasta la

25641
20:07:26,000 --> 20:07:32,000
această lățime această lungime îmi pare rău eșantion

25642
20:07:28,552 --> 20:07:35,440
lungime avem uh că virginica minciuni

25643
20:07:32,000 --> 20:07:39,680
aici Iris virginica si de aici la

25644
20:07:35,440 --> 20:07:43,600
aici iristosa zace bine proba cool

25645
20:07:39,680 --> 20:07:46,480
și așa cum puteți folosi modele 3D, puteți

25646
20:07:43,600 --> 20:07:49,680
utilizați diferite tipuri de diagrame. Bine, eu

25647
20:07:46,480 --> 20:07:52,552
a făcut patru și patru sunt suficiente pentru a citi

25648
20:07:49,680 --> 20:07:54,552
set de date. Bine, deci acum vom face uh

25649
20:07:52,552 --> 20:07:56,160
oarecare clasificare a tunului. Bine, noi

25650
20:07:54,552 --> 20:07:59,512
va face predicție și vom vedea

25651
20:07:56,160 --> 20:08:04,160
acuratețea setului nostru de date. Bine, deci acum

25652
20:07:59,512 --> 20:08:07,160
ce voi face? Voi scrie aici de la

25653
20:08:04,160 --> 20:08:07,160
skarn

25654
20:08:07,192 --> 20:08:11,760
punct

25655
20:08:09,512 --> 20:08:15,832
vecinii

25656
20:08:11,760 --> 20:08:21,280
import k vecini. Bine.

25657
20:08:15,832 --> 20:08:23,280
Scrie din punct skarn

25658
20:08:21,280 --> 20:08:26,160
vecinii

25659
20:08:23,280 --> 20:08:29,360
import

25660
20:08:26,160 --> 20:08:31,440
k vecin

25661
20:08:29,360 --> 20:08:33,280
clasificator.

25662
20:08:31,440 --> 20:08:36,400
Bine.

25663
20:08:33,280 --> 20:08:37,920
Atunci voi scrie aici de la

25664
20:08:36,400 --> 20:08:40,872
skarn

25665
20:08:37,920 --> 20:08:43,600
matrice de puncte

25666
20:08:40,872 --> 20:08:46,552
import

25667
20:08:43,600 --> 20:08:48,080
confuzie

25668
20:08:46,552 --> 20:08:50,480
matricea

25669
20:08:48,080 --> 20:08:53,600
acuratețea virgulelor

25670
20:08:50,480 --> 20:08:55,280
scorul de precizie. Bine, atunci voi scrie

25671
20:08:53,600 --> 20:09:01,000
din

25672
20:08:55,280 --> 20:09:01,000
selecția modelului skarn dot

25673
20:09:01,120 --> 20:09:04,120
import

25674
20:09:04,160 --> 20:09:10,800
cruce

25675
20:09:05,920 --> 20:09:12,872
scor valoric. Bine, deci iată ce am făcut

25676
20:09:10,800 --> 20:09:14,960
uh, adaptăm clasificatorul la

25677
20:09:12,872 --> 20:09:18,000
set de antrenament și încărcarea bibliotecilor

25678
20:09:14,960 --> 20:09:21,280
practic. Bine, atunci vom iniția o

25679
20:09:18,000 --> 20:09:24,080
modelul de învățare K este egal cu trei. Bine.

25680
20:09:21,280 --> 20:09:26,960
Deci aici voi scrie clasificator.

25681
20:09:24,080 --> 20:09:29,960
Lasă-mă să dau un spațiu. Clasificatorul este egal

25682
20:09:26,960 --> 20:09:29,960
la

25683
20:09:30,080 --> 20:09:34,400
vecinii.

25684
20:09:31,760 --> 20:09:37,400
Clasificator

25685
20:09:34,400 --> 20:09:37,400
şi

25686
20:09:37,512 --> 20:09:42,640
vecinii

25687
20:09:39,040 --> 20:09:45,360
la trei. Bine. Apoi montarea modelului.

25688
20:09:42,640 --> 20:09:49,720
Voi scrie aici clasificator

25689
20:09:45,360 --> 20:09:49,720
se potrivesc punct

25690
20:09:50,640 --> 20:09:56,320
x tren,

25691
20:09:53,120 --> 20:09:59,360
y tren.

25692
20:09:56,320 --> 20:10:02,800
Bine. Atunci uh acum vom prezice

25693
20:09:59,360 --> 20:10:06,400
testează rezultatele setului de test. Bine. Deci y

25694
20:10:02,800 --> 20:10:11,120
predicția este egală cu

25695
20:10:06,400 --> 20:10:16,240
clasificator dot predice

25696
20:10:11,120 --> 20:10:19,240
x test. Rece. Bine. De la OK. ortografie

25697
20:10:16,240 --> 20:10:19,240
greseala.

25698
20:10:19,920 --> 20:10:22,920
Bine.

25699
20:10:23,760 --> 20:10:26,760
Bine.

25700
20:10:28,872 --> 20:10:35,760
Da. Presupun că e bine acum. Deci acum uh

25701
20:10:32,480 --> 20:10:38,552
să evaluăm predicția. Deci iată-mă

25702
20:10:35,760 --> 20:10:40,960
va construi matricea de confuzie.

25703
20:10:38,552 --> 20:10:44,872
Bine. Deci aici voi scrie cm confuzie

25704
20:10:40,960 --> 20:10:46,552
matricea este egală cu confuzia

25705
20:10:44,872 --> 20:10:48,800
matricea

25706
20:10:46,552 --> 20:10:51,512
uh y test

25707
20:10:48,800 --> 20:10:54,160
y predicție. Bine. Atunci aici voi face

25708
20:10:51,512 --> 20:10:56,480
scrie cm. Bine. Deci, ce este confuzia

25709
20:10:54,160 --> 20:10:59,192
matrice practic? Deci matrice de confuzie

25710
20:10:56,480 --> 20:11:02,480
știi, este un tabel care arată cum

25711
20:10:59,192 --> 20:11:05,440
bine un model funcționează comparându-și

25712
20:11:02,480 --> 20:11:08,800
predicție la valorile reale. Bine.

25713
20:11:05,440 --> 20:11:10,640
Deci, ceea ce arată este o matrice de confuzie

25714
20:11:08,800 --> 20:11:13,512
afiseaza numarul corect si

25715
20:11:10,640 --> 20:11:17,280
predicție incorectă a fiecărei clase în

25716
20:11:13,512 --> 20:11:19,440
modele ale căror fie îți poate da adevărat

25717
20:11:17,280 --> 20:11:21,440
pozitiv adevărat negativ fals pozitiv

25718
20:11:19,440 --> 20:11:24,080
fals negativ fie îți poate da

25719
20:11:21,440 --> 20:11:25,832
zero sau unu. Bine. Deci da, în mișcare

25720
20:11:24,080 --> 20:11:27,760
înainte să calculăm modelul

25721
20:11:25,832 --> 20:11:31,680
precizie. Aceasta este partea principală. Dacă

25722
20:11:27,760 --> 20:11:34,000
Precizia modelului este scăzută, înseamnă că dvs

25723
20:11:31,680 --> 20:11:38,000
analiza știi că este clasificarea

25724
20:11:34,000 --> 20:11:41,600
nu e bun. Bine. Deci exactitate ar trebui să fie

25725
20:11:38,000 --> 20:11:43,832
mai mult de 80 cel putin. precizie

25726
20:11:41,600 --> 20:11:45,832
egal cu

25727
20:11:43,832 --> 20:11:48,000
precizie

25728
20:11:45,832 --> 20:11:50,000
scor

25729
20:11:48,000 --> 20:11:54,160
y test

25730
20:11:50,000 --> 20:11:56,872
virgulă y predicție în 100, altfel

25731
20:11:54,160 --> 20:11:58,960
îmi va da în puncte așa că voi scrie

25732
20:11:56,872 --> 20:12:01,360
imprima

25733
20:11:58,960 --> 20:12:05,192
model

25734
20:12:01,360 --> 20:12:07,360
precizia modelului canon

25735
20:12:05,192 --> 20:12:10,552
este

25736
20:12:07,360 --> 20:12:15,552
oh voi scrie plus STR voi rotunji

25737
20:12:10,552 --> 20:12:15,552
ea. Bine. Precizie

25738
20:12:20,872 --> 20:12:26,240
Voi adăuga persoana. Deci de ce am scris

25739
20:12:23,120 --> 20:12:28,400
această precizie la rotunjire? Deci nu vreau

25740
20:12:26,240 --> 20:12:30,960
după puncte am nevoie doar de două numere.

25741
20:12:28,400 --> 20:12:34,552
Bine. Nu vreau ca 6 7 8 9 10 11 12

25742
20:12:30,960 --> 20:12:38,080
ca asta. Bine. Am nevoie doar de 80,20

25743
20:12:34,552 --> 20:12:41,192
ca aceasta. Rece. Să rulăm asta. vezi

25744
20:12:38,080 --> 20:12:43,280
Precizia modelului KNandN este de 96,67 67 adică

25745
20:12:41,192 --> 20:12:46,320
de ce am scris doua aici si procentul

25746
20:12:43,280 --> 20:12:50,080
ar trebui să fie acolo deci 96 ceea ce este foarte foarte

25747
20:12:46,320 --> 20:12:53,832
foarte bine, așa că așa poți

25748
20:12:50,080 --> 20:12:56,720
Găsiți exactitatea, așa că acum să găsim

25749
20:12:53,832 --> 20:12:59,832
numărul optim de vecini din K

25750
20:12:56,720 --> 20:13:02,400
bine, practic, găsim cel mai bun K, așa că noi

25751
20:12:59,832 --> 20:13:05,680
va folosi uh folosind validarea încrucișată

25752
20:13:02,400 --> 20:13:08,800
reglarea parametrilor ok, așa că mai întâi o voi face

25753
20:13:05,680 --> 20:13:10,960
creați lista de K pentru KN, deci aici

25754
20:13:08,800 --> 20:13:12,552
Voi scrie K

25755
20:13:10,960 --> 20:13:15,832
lista

25756
20:13:12,552 --> 20:13:18,080
este egal cu lista

25757
20:13:15,832 --> 20:13:22,400
interval

25758
20:13:18,080 --> 20:13:25,512
1 virgulă 50A 2.

25759
20:13:22,400 --> 20:13:29,600
Aici sunt voi crea lista de CV

25760
20:13:25,512 --> 20:13:32,000
scor. Bine. Deci aici voi scrie CV

25761
20:13:29,600 --> 20:13:34,480
scoruri.

25762
20:13:32,000 --> 20:13:36,240
Bine. Bine. Trebuie să dau paranteze.

25763
20:13:34,480 --> 20:13:39,832
Da.

25764
20:13:36,240 --> 20:13:41,760
Așa că aici vom efectua crucea de 10 ori

25765
20:13:39,832 --> 20:13:43,680
validare. Bine, o să-ți explic

25766
20:13:41,760 --> 20:13:50,040
ce este validarea încrucișată. Nu vă faceți griji.

25767
20:13:43,680 --> 20:13:50,040
Așa că mai întâi permiteți-mi să scriu pentru K N K listN

25768
20:13:52,240 --> 20:13:55,640
egal cu

25769
20:13:55,920 --> 20:14:02,832
K clasificator vecin

25770
20:13:58,160 --> 20:14:02,832
si aici voi adauga N vecin

25771
20:14:04,080 --> 20:14:12,400
vecini este egal cu K. Apoi punctează

25772
20:14:08,960 --> 20:14:15,120
egal a traversa

25773
20:14:12,400 --> 20:14:19,360
scor valoric

25774
20:14:15,120 --> 20:14:21,360
KNandN apoi trenul X

25775
20:14:19,360 --> 20:14:23,280
trenul Y

25776
20:14:21,360 --> 20:14:25,760
bine

25777
20:14:23,280 --> 20:14:28,080
Voi scrie aici validarea încrucișată

25778
20:14:25,760 --> 20:14:31,192
egal cu 10

25779
20:14:28,080 --> 20:14:35,320
scorul prin virgulă este egal cu Voi scrie

25780
20:14:31,192 --> 20:14:35,320
aici acuratețea

25781
20:14:35,832 --> 20:14:43,192
Bine. Și apoi aici cv

25782
20:14:40,000 --> 20:14:46,800
curs dotappend

25783
20:14:43,192 --> 20:14:52,320
la cupola cursului.

25784
20:14:46,800 --> 20:14:56,552
Bine. Așa că acum da, lasă-mă să o execut. Bine.

25785
20:14:52,320 --> 20:15:00,240
A venit o eroare prin virgulă. Bine. Eroarea

25786
20:14:56,552 --> 20:15:02,640
este parametrul de scor.

25787
20:15:00,240 --> 20:15:05,600
Da. De ce? Pentru că aici acuratețe poți

25788
20:15:02,640 --> 20:15:07,832
vezi și am făcut greșeala de ortografie.

25789
20:15:05,600 --> 20:15:09,920
Bine. Deci acum ce este validarea încrucișată?

25790
20:15:07,832 --> 20:15:11,920
Desigur, validarea încrucișată, știi

25791
20:15:09,920 --> 20:15:14,552
determinați precizia mașinii dvs

25792
20:15:11,920 --> 20:15:17,120
model de învăţare prin partiţionarea datelor

25793
20:15:14,552 --> 20:15:18,800
în două grupe diferite. Bine sunat

25794
20:15:17,120 --> 20:15:21,832
set de antrenament și set de testare. Poți

25795
20:15:18,800 --> 20:15:24,400
vezi testul trenului și setul de testare. Bine

25796
20:15:21,832 --> 20:15:25,920
X și Y. Deci datele sunt aleatorii

25797
20:15:24,400 --> 20:15:29,600
separate într-un anumit număr de

25798
20:15:25,920 --> 20:15:32,160
grupuri sau subseturi numite pliuri. Bine tu

25799
20:15:29,600 --> 20:15:34,800
pot vedea cele 10 falduri pe care le-am scris. Fiecare

25800
20:15:32,160 --> 20:15:36,872
pliul conține aproximativ aceeași cantitate de

25801
20:15:34,800 --> 20:15:39,120
bine și mai este ceva

25802
20:15:36,872 --> 20:15:41,120
validare. Deci validarea este o tehnică

25803
20:15:39,120 --> 20:15:43,512
pentru evaluarea acurateței modelului

25804
20:15:41,120 --> 20:15:46,320
pe setul de date. Bine. Și această cruce

25805
20:15:43,512 --> 20:15:49,832
validarea pe care am făcut-o pe noul set de date. Rece.

25806
20:15:46,320 --> 20:15:56,160
Deci acum să găsim cel mai bun K. Bine. Aşa

25807
20:15:49,832 --> 20:15:59,832
aici voi scrie cel mai bun K egal cu K

25808
20:15:56,160 --> 20:16:03,440
lista. Bine. Înainte de asta voi scrie unul

25809
20:15:59,832 --> 20:16:06,000
lucru. Voi scrie aici MSE a fost

25810
20:16:03,440 --> 20:16:09,512
trecerea la eroare de clasificare m. Bine.

25811
20:16:06,000 --> 20:16:16,480
Deci egal cu unu

25812
20:16:09,512 --> 20:16:18,800
asta este X pentru X in pentru X in

25813
20:16:16,480 --> 20:16:24,080
scoruri CV.

25814
20:16:18,800 --> 20:16:26,320
Bine. Bine, listă, voi scrie MSE dot

25815
20:16:24,080 --> 20:16:28,552
index

25816
20:16:26,320 --> 20:16:30,240
minim

25817
20:16:28,552 --> 20:16:33,280
MSE.

25818
20:16:30,240 --> 20:16:37,040
Voi folosi acest parantez paranteză pătrată.

25819
20:16:33,280 --> 20:16:38,800
Bine. Deci, voi scrie print

25820
20:16:37,040 --> 20:16:40,640
cel mai bun

25821
20:16:38,800 --> 20:16:45,000
optim

25822
20:16:40,640 --> 20:16:45,000
număr de

25823
20:16:45,280 --> 20:16:50,760
vecinii

25824
20:16:46,872 --> 20:16:50,760
este persoana

25825
20:16:53,600 --> 20:17:03,552
cel mai bun K. Bine, hai să o rulăm. Vezi cel mai bun

25826
20:16:58,320 --> 20:17:03,552
numărul optim de vecini. Bine. N

25827
20:17:04,160 --> 20:17:11,760
vecinii are 9. Bine. Deci, în K

25828
20:17:08,240 --> 20:17:13,760
Algoritmii KN de cel mai apropiat vecin. Bine. Deci

25829
20:17:11,760 --> 20:17:15,920
K reprezintă numărul de vecini care

25830
20:17:13,760 --> 20:17:19,832
sunt luate în considerare la clasificarea unei interogări

25831
20:17:15,920 --> 20:17:22,080
punct. Bine. Vezi dacă vom clasifica

25832
20:17:19,832 --> 20:17:26,552
acest punct special veți obține

25833
20:17:22,080 --> 20:17:28,872
şase. Bine. 1 2 3 4 5 6. Bine. Și lasă

25834
20:17:26,552 --> 20:17:32,400
iti arat eu. Daca vei clasifica asta

25835
20:17:28,872 --> 20:17:35,440
doar o porție, astfel încât veți obține 1 2 3 4 5

25836
20:17:32,400 --> 20:17:37,680
6 puncte ca asta. Bine. Deci cel mai bun

25837
20:17:35,440 --> 20:17:41,192
numărul optim de vecini este nouă.

25838
20:17:37,680 --> 20:17:43,040
>> Ce este Python? Python este un nivel înalt

25839
20:17:41,192 --> 20:17:46,872
limbaj de programare orientat pe obiecte

25840
20:17:43,040 --> 20:17:49,760
dezvoltat de Guido Van Roum în 1989 și

25841
20:17:46,872 --> 20:17:51,920
a fost lansat pentru prima dată în 1991.

25842
20:17:49,760 --> 20:17:54,080
Python este adesea numit baterii

25843
20:17:51,920 --> 20:17:56,872
limbajul inclus datorită acestuia

25844
20:17:54,080 --> 20:17:59,040
bibliotecă standard cuprinzătoare. O distracție

25845
20:17:56,872 --> 20:18:00,720
fapt despre Python este că numele

25846
20:17:59,040 --> 20:18:03,360
Python a fost de fapt luat din

25847
20:18:00,720 --> 20:18:07,360
populara emisiune de comedie BBC din acea vreme

25848
20:18:03,360 --> 20:18:12,080
Circul zburător al lui Montipython. Acum hai

25849
20:18:07,360 --> 20:18:14,400
uitați-vă la caracteristicile de top ale Python

25850
20:18:12,080 --> 20:18:16,872
mai întâi. Deci Python are o structură simplă

25851
20:18:14,400 --> 20:18:18,240
și o sintaxă clar definită. Aceasta

25852
20:18:16,872 --> 20:18:20,160
permite cursanților să ridice

25853
20:18:18,240 --> 20:18:22,400
limbajul rapid. Deci este ușor de învățat

25854
20:18:20,160 --> 20:18:24,160
si folosire.

25855
20:18:22,400 --> 20:18:27,120
Python poate rula pe diferite operațiuni

25856
20:18:24,160 --> 20:18:29,280
sisteme precum Windows, Linux și Mac,

25857
20:18:27,120 --> 20:18:30,872
făcându-l un limbaj portabil. Ea

25858
20:18:29,280 --> 20:18:32,960
permite programatorilor să dezvolte

25859
20:18:30,872 --> 20:18:36,552
software pentru mai multe platforme concurente

25860
20:18:32,960 --> 20:18:38,960
prin scrierea unui program o singură dată.

25861
20:18:36,552 --> 20:18:41,040
În al treilea rând, Python este disponibil gratuit la

25862
20:18:38,960 --> 20:18:43,192
site-ul oficial deoarece este deschis

25863
20:18:41,040 --> 20:18:45,760
sursa. Aceasta înseamnă că codul sursă este

25864
20:18:43,192 --> 20:18:47,680
disponibilă și publicului.

25865
20:18:45,760 --> 20:18:49,760
Acum, Python folosește o aplicație orientată pe obiecte

25866
20:18:47,680 --> 20:18:51,512
abordare care încapsulează codul în interior

25867
20:18:49,760 --> 20:18:53,120
obiecte.

25868
20:18:51,512 --> 20:18:54,872
Python oferă o colecție de

25869
20:18:53,120 --> 20:18:56,640
biblioteci pentru diverse sarcini precum

25870
20:18:54,872 --> 20:19:00,720
învățare automată, dezvoltare web și

25871
20:18:56,640 --> 20:19:02,400
analiza datelor. Și în sfârșit, în Python,

25872
20:19:00,720 --> 20:19:04,400
nu trebuie să atribuiți tipul de date

25873
20:19:02,400 --> 20:19:06,480
a variabilei. Când atribui unele

25874
20:19:04,400 --> 20:19:08,640
valoarea variabilei, aceasta este automat

25875
20:19:06,480 --> 20:19:10,160
alocă memoria variabilei la

25876
20:19:08,640 --> 20:19:12,320
timpul de rulare.

25877
20:19:10,160 --> 20:19:15,512
Acum, cu asta, să trecem la

25878
20:19:12,320 --> 20:19:17,360
utilizări ale programării Python.

25879
20:19:15,512 --> 20:19:19,760
Deci, este folosit limbajul de programare Python

25880
20:19:17,360 --> 20:19:22,640
pentru a dezvolta aplicații desktop și

25881
20:19:19,760 --> 20:19:24,160
construiți și aplicații web. Este

25882
20:19:22,640 --> 20:19:26,080
utilizate popular în domeniul datelor

25883
20:19:24,160 --> 20:19:28,552
știință, învățare automată și artificială

25884
20:19:26,080 --> 20:19:30,160
inteligență pentru a analiza date, a construi

25885
20:19:28,552 --> 20:19:32,640
modele predictive și face afaceri

25886
20:19:30,160 --> 20:19:35,760
deciziilor. Python este, de asemenea, utilizat pe scară largă în

25887
20:19:32,640 --> 20:19:37,280
dezvoltarea jocului. Acum, să vedem câteva dintre ele

25888
20:19:35,760 --> 20:19:38,800
cadrele populare Python și

25889
20:19:37,280 --> 20:19:40,800
biblioteci.

25890
20:19:38,800 --> 20:19:43,360
Python poate fi folosit pentru dezvoltarea web

25891
20:19:40,800 --> 20:19:45,512
folosind cadre precum Zango, Flask,

25892
20:19:43,360 --> 20:19:47,280
Piramida și Churi.

25893
20:19:45,512 --> 20:19:48,800
Acum puteți construi utilizator grafic

25894
20:19:47,280 --> 20:19:52,552
interfeţe folosind biblioteci şi

25895
20:19:48,800 --> 20:19:57,440
cadre precum Tkinter sau doar KER.

25896
20:19:52,552 --> 20:20:00,080
De asemenea, puteți utiliza PI GTK, PIQT sau PYJS sau

25897
20:19:57,440 --> 20:20:01,832
JavaScript Python.

25898
20:20:00,080 --> 20:20:03,600
Acum, Python este folosit și pentru a performa

25899
20:20:01,832 --> 20:20:06,240
sarcini de învățare automată folosind biblioteci

25900
20:20:03,600 --> 20:20:09,832
cum ar fi TensorFlow, PyTorch,

25901
20:20:06,240 --> 20:20:11,760
Scikitlearn, Mattplot Lib și Scypi.

25902
20:20:09,832 --> 20:20:15,680
Puteți efectua și matematică

25903
20:20:11,760 --> 20:20:17,832
calcule folosind numpy și panda.

25904
20:20:15,680 --> 20:20:19,760
Acum, să ne uităm la cele mai bune ID-uri pe care le aveți

25905
20:20:17,832 --> 20:20:22,240
poate folosi pentru a scrie programe în Python și

25906
20:20:19,760 --> 20:20:24,320
îndeplini sarcini specifice. Deci, avem

25907
20:20:22,240 --> 20:20:26,240
Jupyter notebook, care face parte din

25908
20:20:24,320 --> 20:20:29,040
Distribuție de anaconda care este pe scară largă

25909
20:20:26,240 --> 20:20:30,400
folosit in aceste zile. Chiar și pentru demonstrația noastră în

25910
20:20:29,040 --> 20:20:32,872
acest videoclip, vom folosi Jupyter

25911
20:20:30,400 --> 20:20:34,552
Caiet. Îți voi arăta peste ceva timp. Apoi

25912
20:20:32,872 --> 20:20:36,800
avem editorul de cod vizual de la

25913
20:20:34,552 --> 20:20:39,680
Microsoft. Acesta este, de asemenea, unul dintre

25914
20:20:36,800 --> 20:20:42,720
IDE-uri preferate de către cursanți și

25915
20:20:39,680 --> 20:20:45,920
companiilor. Apoi avem și popularul

25916
20:20:42,720 --> 20:20:48,552
editor de text numit Sublime Text editor.

25917
20:20:45,920 --> 20:20:52,552
Apoi avem și PyCharm urmat de

25918
20:20:48,552 --> 20:20:54,552
Python și Spider ca ideile noastre de top. Acum

25919
20:20:52,552 --> 20:20:58,480
să ne uităm la companiile de top care sunt

25920
20:20:54,552 --> 20:21:02,240
folosind Python în munca noastră de zi cu zi.

25921
20:20:58,480 --> 20:21:04,960
Deci avem Google, Kora, Facebook, chiar și

25922
20:21:02,240 --> 20:21:06,872
Netflix, Spotify și Instagram. Acum

25923
20:21:04,960 --> 20:21:08,480
există și alte produse de top,

25924
20:21:06,872 --> 20:21:11,040
bazate pe servicii și startup-uri care, de asemenea

25925
20:21:08,480 --> 20:21:14,400
utilizați programarea Python. Deci ce cu adevărat

25926
20:21:11,040 --> 20:21:16,960
este limbajul de programare Python?

25927
20:21:14,400 --> 20:21:18,720
Python este un highle orientat pe obiecte

25928
20:21:16,960 --> 20:21:20,400
limbaj de programare care suportă

25929
20:21:18,720 --> 20:21:21,920
structuri de date încorporate și dinamice

25930
20:21:20,400 --> 20:21:23,440
semantică.

25931
20:21:21,920 --> 20:21:25,440
Suportă programare multiplă

25932
20:21:23,440 --> 20:21:26,872
paradigme precum structurat,

25933
20:21:25,440 --> 20:21:28,480
orientate pe obiecte și funcționale

25934
20:21:26,872 --> 20:21:30,640
programare.

25935
20:21:28,480 --> 20:21:32,800
Python este adesea descris ca baterii

25936
20:21:30,640 --> 20:21:34,160
limbaj inclus deoarece are o

25937
20:21:32,800 --> 20:21:36,552
colecție cuprinzătoare de standarde

25938
20:21:34,160 --> 20:21:38,480
biblioteci. Python suportă diferite

25939
20:21:36,552 --> 20:21:43,000
module si pachete care permit

25940
20:21:38,480 --> 20:21:43,000
modularitatea programului și reutilizarea codului.

25941
20:21:43,040 --> 20:21:47,440
Python a fost dezvoltat de Guido Van Rosum

25942
20:21:45,760 --> 20:21:50,800
iar implementarea sa a început în

25943
20:21:47,440 --> 20:21:53,680
decembrie 1989.

25944
20:21:50,800 --> 20:21:56,872
Versiunea Python 1.0 a fost lansată în

25945
20:21:53,680 --> 20:21:59,680
anul 1994. A apărut Python 2.0

25946
20:21:56,872 --> 20:22:03,552
octombrie 2000 în timp ce Python 3.0 era

25947
20:21:59,680 --> 20:22:03,552
lansat în decembrie 2008.

25948
20:22:03,760 --> 20:22:07,280
Acum că ai o înțelegere

25949
20:22:05,192 --> 20:22:09,120
a limbajului de programare Python,

25950
20:22:07,280 --> 20:22:12,160
hai să ne uităm acum la primele 10 motive pentru care

25951
20:22:09,120 --> 20:22:16,552
ar trebui să înveți Python.

25952
20:22:12,160 --> 20:22:18,640
Deci, la numărul 10, avem ușurință în utilizare.

25953
20:22:16,552 --> 20:22:20,640
Unul dintre cele mai comune motive pentru care să vă placă

25954
20:22:18,640 --> 20:22:23,360
Python este că este destul de ușor de învățat

25955
20:22:20,640 --> 20:22:25,040
și cod. Oferă o sintaxă simplă

25956
20:22:23,360 --> 20:22:27,360
care îmbunătățește lizibilitatea și o face

25957
20:22:25,040 --> 20:22:29,192
mai ușor de înțeles. Deci dezvoltatorii pot

25958
20:22:27,360 --> 20:22:31,832
creați orice desktop sau pe mașină

25959
20:22:29,192 --> 20:22:33,832
aplicație folosind acest limbaj. Python

25960
20:22:31,832 --> 20:22:35,440
este foarte versatil și este esențial

25961
20:22:33,832 --> 20:22:38,000
inteligență artificială și mașină

25962
20:22:35,440 --> 20:22:41,120
învăţarea. Despre asta vom vorbi mai târziu

25963
20:22:38,000 --> 20:22:45,160
în sesiune. În comparație cu Java sau C,

25964
20:22:41,120 --> 20:22:45,160
are mai puține linii de coduri.

25965
20:22:45,360 --> 20:22:50,080
În exemplul de aici, tipărim a

25966
20:22:47,440 --> 20:22:52,320
program Hello World în Java. Cum poți

25967
20:22:50,080 --> 20:22:54,640
vezi,

25968
20:22:52,320 --> 20:22:57,760
dacă trebuie să scrieți un program în Java,

25969
20:22:54,640 --> 20:23:01,552
mai întâi trebuie să declarați numele clasei

25970
20:22:57,760 --> 20:23:01,552
împreună cu domeniul său de aplicare.

25971
20:23:02,080 --> 20:23:07,192
Apoi, folosind bretele, trebuie

25972
20:23:05,280 --> 20:23:09,760
trece metoda principală împreună cu ea

25973
20:23:07,192 --> 20:23:12,240
argumente. Și apoi folosind

25974
20:23:09,760 --> 20:23:14,400
system.out.print print len metoda tu

25975
20:23:12,240 --> 20:23:18,512
pot imprima salut lume, asta e destul de a

25976
20:23:14,400 --> 20:23:18,512
sarcină plictisitoare, nu-i așa

25977
20:23:19,040 --> 20:23:22,720
aceeași sarcină de a imprima Hello World

25978
20:23:20,960 --> 20:23:25,512
se poate face folosind doar o singură linie de cod

25979
20:23:22,720 --> 20:23:28,080
în python, așa cum se arată aici, puteți scrie

25980
20:23:25,512 --> 20:23:30,320
funcția de imprimare și trece orice ai

25981
20:23:28,080 --> 20:23:32,552
doresc să se afişeze între paranteze şi

25982
20:23:30,320 --> 20:23:35,552
care va imprima ieșirea, așa este

25983
20:23:32,552 --> 20:23:35,552
simplu

25984
20:23:36,000 --> 20:23:41,192
de aceea Python este considerat a

25985
20:23:37,920 --> 20:23:42,720
limbaj highle și este open source

25986
20:23:41,192 --> 20:23:47,320
Îl puteți descărca doar de pe

25987
20:23:42,720 --> 20:23:47,320
site-ul web și începeți să îl utilizați.

25988
20:23:49,360 --> 20:23:53,872
La nouă, avem o comunitate activă.

25989
20:23:53,920 --> 20:23:57,512
Ai nevoie de o comunitate pentru a învăța noi

25990
20:23:55,600 --> 20:23:59,280
tehnologia și prietenii sunt cei mai buni

25991
20:23:57,512 --> 20:24:02,080
atu când vine vorba de învățare a

25992
20:23:59,280 --> 20:24:05,480
limbaj de programare. Python are mare

25993
20:24:02,080 --> 20:24:05,480
sprijinul comunității.

25994
20:24:06,552 --> 20:24:10,960
Are o comunitate extinsă și activă

25995
20:24:08,800 --> 20:24:12,872
pentru a ajuta inginerii, dezvoltatorii,

25996
20:24:10,960 --> 20:24:14,720
analiști și oameni de știință de date cu

25997
20:24:12,872 --> 20:24:17,360
suport expert în cazul programării

25998
20:24:14,720 --> 20:24:19,120
erori sau probleme cu software-ul. tu

25999
20:24:17,360 --> 20:24:21,440
pot merge înainte și pune întrebări

26000
20:24:19,120 --> 20:24:22,960
pe forumul comunității. Comunitatea

26001
20:24:21,440 --> 20:24:25,760
membrii vă vor adresa întrebările în

26002
20:24:22,960 --> 20:24:27,920
timp foarte rapid. Comunități precum Stack

26003
20:24:25,760 --> 20:24:30,800
Overflow aduce, de asemenea, mulți experți Python

26004
20:24:27,920 --> 20:24:33,760
împreună pentru a ajuta cursanții.

26005
20:24:30,800 --> 20:24:35,440
Propuneri de îmbunătățire Python sau PEP este

26006
20:24:33,760 --> 20:24:38,640
unde propunerile si imbunatatirile

26007
20:24:35,440 --> 20:24:40,720
sunt anuntate. De asemenea, există un set de

26008
20:24:38,640 --> 20:24:43,600
recomandări sau valori de bază numite

26009
20:24:40,720 --> 20:24:45,280
Zen-ul lui Python scris de Tim Peters

26010
20:24:43,600 --> 20:24:48,832
care reprezintă principiile directoare

26011
20:24:45,280 --> 20:24:48,832
pentru dezvoltarea Python.

26012
20:24:50,080 --> 20:24:53,920
Următoarea la 8, avem portabile și

26013
20:24:52,080 --> 20:24:55,832
extensibil.

26014
20:24:53,920 --> 20:24:58,160
Operațiile multiple în mai multe limbi pot

26015
20:24:55,832 --> 20:25:01,040
să fie efectuată eficient deoarece Python

26016
20:24:58,160 --> 20:25:03,832
este portabil și extensibil în natură.

26017
20:25:01,040 --> 20:25:06,240
De exemplu, dacă utilizatorii au un Python

26018
20:25:03,832 --> 20:25:08,080
cod scris pe Windows și vor

26019
20:25:06,240 --> 20:25:10,552
executați pe un sistem de operare Mac sau

26020
20:25:08,080 --> 20:25:13,192
Sistem de operare Linux sau Solaris, ei

26021
20:25:10,552 --> 20:25:15,192
se poate face cu ușurință fără nici un amendament.

26022
20:25:13,192 --> 20:25:17,192
De asemenea, pot rula acest cod pe orice

26023
20:25:15,192 --> 20:25:20,160
platforma impecabil si fara niciuna

26024
20:25:17,192 --> 20:25:22,480
întrerupe.

26025
20:25:20,160 --> 20:25:24,000
Datorită caracteristicii sale de extensibilitate, dvs

26026
20:25:22,480 --> 20:25:27,360
poate integra alte programe

26027
20:25:24,000 --> 20:25:29,832
limbaje precum Java, Net, C și C  

26028
20:25:27,360 --> 20:25:31,680
coduri cu Python. Componentele lui

26029
20:25:29,832 --> 20:25:33,920
pot fi folosite alte limbaje de programare

26030
20:25:31,680 --> 20:25:35,440
cu Python și astfel poate fi folosit pentru

26031
20:25:33,920 --> 20:25:38,240
faceți o platformă multiplată potrivită

26032
20:25:35,440 --> 20:25:42,192
aplicarea de asemenea. Deci este foarte bun

26033
20:25:38,240 --> 20:25:42,192
caracteristica oferită de Python.

26034
20:25:45,360 --> 20:25:51,080
Următorul motiv pentru a învăța Python este

26035
20:25:47,680 --> 20:25:51,080
cadre de testare.

26036
20:25:51,512 --> 20:25:55,832
Python acceptă mai multe încorporate

26037
20:25:53,600 --> 20:25:57,600
instrumente și cadre de testare impecabile

26038
20:25:55,832 --> 20:26:00,552
care ajută la depanarea și accelerarea

26039
20:25:57,600 --> 20:26:02,240
fluxurilor de lucru.

26040
20:26:00,552 --> 20:26:04,552
Unele dintre instrumente și cadre

26041
20:26:02,240 --> 20:26:06,872
susținute de Python sunt Piest, Selenium

26042
20:26:04,552 --> 20:26:09,360
și Splinter. Acesta este motivul pentru

26043
20:26:06,872 --> 20:26:11,192
pe care fiecare tester încearcă să folosească Python

26044
20:26:09,360 --> 20:26:13,512
instrumente și cadre bazate pentru a testa orice

26045
20:26:11,192 --> 20:26:16,320
aplicație sau cod sau pentru a-l valida în

26046
20:26:13,512 --> 20:26:17,920
un mod mai ușor. Piest este cel mai mult

26047
20:26:16,320 --> 20:26:19,920
cadrul de testare recomandat pentru

26048
20:26:17,920 --> 20:26:22,720
funcțional, integrator și unitar

26049
20:26:19,920 --> 20:26:24,320
testarea. Puteți rula testul Selenium

26050
20:26:22,720 --> 20:26:26,720
scripturi folosind programarea Python

26051
20:26:24,320 --> 20:26:28,480
limbaj pentru automatizarea diferitelor sarcini. Şi

26052
20:26:26,720 --> 20:26:31,040
Splinter este un instrument open-source pentru

26053
20:26:28,480 --> 20:26:33,360
testarea aplicațiilor web folosind Python.

26054
20:26:31,040 --> 20:26:35,192
Vă permite să automatizați acțiunile browserului

26055
20:26:33,360 --> 20:26:38,512
cum ar fi vizitarea adreselor URL și interacțiunea

26056
20:26:35,192 --> 20:26:38,512
cu obiectele lor.

26057
20:26:39,512 --> 20:26:44,240
La numărul șase avem biblioteci și

26058
20:26:41,832 --> 20:26:46,240
pachete.

26059
20:26:44,240 --> 20:26:48,240
Un alt motiv pentru care Python a devenit așa

26060
20:26:46,240 --> 20:26:49,832
popular în industrie în aceste zile este

26061
20:26:48,240 --> 20:26:51,760
că are o colecție masivă de

26062
20:26:49,832 --> 20:26:54,960
biblioteci și pachete care vă fac

26063
20:26:51,760 --> 20:26:56,872
sarcină simplă și ușoară. Are o gamă de

26064
20:26:54,960 --> 20:26:58,720
biblioteci, pachete, cadre și

26065
20:26:56,872 --> 20:27:00,800
module pentru manipularea datelor,

26066
20:26:58,720 --> 20:27:03,192
calcul statistic, web

26067
20:27:00,800 --> 20:27:06,192
dezvoltare, învățare automată și date

26068
20:27:03,192 --> 20:27:06,192
stiinta.

26069
20:27:08,080 --> 20:27:11,680
Programatorii Python au dezvoltat tone

26070
20:27:10,000 --> 20:27:14,320
de biblioteci gratuite și open-source care

26071
20:27:11,680 --> 20:27:17,120
poti folosi. Puteți găsi multe dintre ele

26072
20:27:14,320 --> 20:27:19,680
prin indexul pachetului Python, depozitul

26073
20:27:17,120 --> 20:27:22,400
a software-ului Python. Python oferă

26074
20:27:19,680 --> 20:27:24,720
pachet implicit numit pip. Anaconda este

26075
20:27:22,400 --> 20:27:30,760
un ecosistem Python terț. Altele

26076
20:27:24,720 --> 20:27:30,760
exemplele includ numpy, sci și zango.

26077
20:27:31,760 --> 20:27:36,120
Apoi avem scripting și automatizare.

26078
20:27:37,280 --> 20:27:40,640
Python nu este doar o programare

26079
20:27:38,872 --> 20:27:42,960
limbaj. Poate fi folosit si pentru

26080
20:27:40,640 --> 20:27:47,080
scrierea de scripturi pentru automatizarea sarcinilor și

26081
20:27:42,960 --> 20:27:47,080
fluxuri de lucru fără intervenție umană.

26082
20:27:47,920 --> 20:27:52,400
Codul poate fi scris sub forma de

26083
20:27:49,600 --> 20:27:54,240
scripturi și executate mai târziu. Mai departe, ea

26084
20:27:52,400 --> 20:27:56,552
este interpretată de maşină şi

26085
20:27:54,240 --> 20:27:58,320
verificat pentru erori în timpul execuției. The

26086
20:27:56,552 --> 20:28:01,192
mașina este folosită pentru a citi și interpreta

26087
20:27:58,320 --> 20:28:03,600
codul. Odată ce dezvoltatorul verifică

26088
20:28:01,192 --> 20:28:06,552
cod, acesta poate fi rulat sau utilizat în continuare

26089
20:28:03,600 --> 20:28:08,320
de mai multe ori fără nicio întrerupere.

26090
20:28:06,552 --> 20:28:10,872
Acest lucru vă permite să automatizați un set de

26091
20:28:08,320 --> 20:28:12,320
anumite sarcini în cadrul unui program sau

26092
20:28:10,872 --> 20:28:16,120
același cod poate fi folosit cu altele

26093
20:28:12,320 --> 20:28:16,120
aplicatii de asemenea.

26094
20:28:16,872 --> 20:28:21,800
La numărul patru, avem dezvoltarea web.

26095
20:28:22,552 --> 20:28:26,480
Un alt motiv pentru a învăța Python este că

26096
20:28:24,400 --> 20:28:29,640
face ca procesul de dezvoltare web să fie astfel

26097
20:28:26,480 --> 20:28:29,640
mult mai usor.

26098
20:28:30,320 --> 20:28:33,360
Oferă o colecție largă de

26099
20:28:31,760 --> 20:28:36,320
cadre care facilitează

26100
20:28:33,360 --> 20:28:39,192
dezvoltatorilor să dezvolte aplicații web.

26101
20:28:36,320 --> 20:28:42,400
Unele dintre exemple sunt Zango, Flask,

26102
20:28:39,192 --> 20:28:44,080
Pyramid, Turbo Gears, CherryPie etc.

26103
20:28:42,400 --> 20:28:46,160
Aceste cadre sunt scrise în Python

26104
20:28:44,080 --> 20:28:48,160
ceea ce face ca codul să fie mult mai rapid și

26105
20:28:46,160 --> 20:28:50,800
stabil.

26106
20:28:48,160 --> 20:28:53,760
Sarcina care obișnuia să dureze ore în PHP

26107
20:28:50,800 --> 20:28:56,640
poate fi terminat în câteva minute folosind Python.

26108
20:28:53,760 --> 20:28:59,512
Python este folosit și pentru web scraping.

26109
20:28:56,640 --> 20:29:01,680
Django oferă multe elemente de complexitate

26110
20:28:59,512 --> 20:29:04,320
programe precum design de șablon,

26111
20:29:01,680 --> 20:29:10,360
panoul de management, conectare, semnare

26112
20:29:04,320 --> 20:29:10,360
up, deconectare, rutare URL etc.

26113
20:29:10,400 --> 20:29:16,240
Odată ce utilizatorul stabilește cadrul,

26114
20:29:12,800 --> 20:29:18,960
toate aceste caracteristici devin gata de utilizare.

26115
20:29:16,240 --> 20:29:21,360
Flask este un cadru scris cu microunde

26116
20:29:18,960 --> 20:29:23,192
în Python.

26117
20:29:21,360 --> 20:29:25,120
a tuturor componentelor care fac parte din

26118
20:29:23,192 --> 20:29:27,760
acest modul, toți sunt pregătiți

26119
20:29:25,120 --> 20:29:30,480
se execută în contextul serverului.

26120
20:29:27,760 --> 20:29:32,800
Pinterest și LinkedIn folosesc Flask.

26121
20:29:30,480 --> 20:29:35,832
Pyramid oferă mai multe atribute decât

26122
20:29:32,800 --> 20:29:38,640
Balon. Acesta va ajuta utilizatorii cu adresa URL

26123
20:29:35,832 --> 20:29:41,280
suport pentru rutare și autentificare.

26124
20:29:38,640 --> 20:29:42,640
Turbo Gears este foarte recomandat și

26125
20:29:41,280 --> 20:29:44,872
cadru scalabil care suportă

26126
20:29:42,640 --> 20:29:47,760
caracteristici precum autentificarea,

26127
20:29:44,872 --> 20:29:51,960
stocarea în cache, identificarea, gestionarea

26128
20:29:47,760 --> 20:29:51,960
sesiuni și aplicații conectabile.

26129
20:29:54,240 --> 20:29:59,120
Următorul la numărul trei, avem mașină

26130
20:29:57,120 --> 20:30:00,872
învăţarea.

26131
20:29:59,120 --> 20:30:03,280
Creșterea învățării automate a fost

26132
20:30:00,872 --> 20:30:05,760
fenomenal în ultimii 5 ani și este

26133
20:30:03,280 --> 20:30:07,280
schimbând rapid lumea din jurul nostru.

26134
20:30:05,760 --> 20:30:08,640
Python este unul dintre cele mai preferate

26135
20:30:07,280 --> 20:30:10,800
limbaje de programare pentru mașină

26136
20:30:08,640 --> 20:30:12,480
învăţare datorită sintaxei sale simple

26137
20:30:10,800 --> 20:30:15,280
și suport pentru mai multe machine learning

26138
20:30:12,480 --> 20:30:16,960
biblioteci.

26139
20:30:15,280 --> 20:30:19,040
Utilizarea diferitelor biblioteci și funcții

26140
20:30:16,960 --> 20:30:23,192
în Python, sistemul poate învăța și

26141
20:30:19,040 --> 20:30:25,280
se antrenează pe baza datelor din trecut.

26142
20:30:23,192 --> 20:30:29,280
Odată ce sistemul este antrenat, atunci poate

26143
20:30:25,280 --> 20:30:31,440
învață să se adapteze la noile intrări.

26144
20:30:29,280 --> 20:30:35,800
În cele din urmă, poate face predicții și

26145
20:30:31,440 --> 20:30:35,800
îndeplini automat sarcini umane.

26146
20:30:37,040 --> 20:30:42,552
La numărul doi, avem știința datelor.

26147
20:30:40,872 --> 20:30:45,832
Învățarea automată și știința datelor merg

26148
20:30:42,552 --> 20:30:47,600
mână în mână. Python este robust, scalabil

26149
20:30:45,832 --> 20:30:49,600
și oferă o vizualizare extensibilă

26150
20:30:47,600 --> 20:30:52,872
și opțiuni grafice. Prin urmare, este

26151
20:30:49,600 --> 20:30:55,192
utilizat pe scară largă în știința datelor.

26152
20:30:52,872 --> 20:30:57,680
Python are biblioteci precum numpy pentru

26153
20:30:55,192 --> 20:30:59,440
calculul numeric al datelor, panda

26154
20:30:57,680 --> 20:31:01,680
pentru operațiunile de manipulare a datelor

26155
20:30:59,440 --> 20:31:04,000
tabele numerice și serii de timp. Ea

26156
20:31:01,680 --> 20:31:06,080
prevede, de asemenea, pur și simplu simbolic

26157
20:31:04,000 --> 20:31:08,000
calcul si sci pentru tehnica si

26158
20:31:06,080 --> 20:31:10,160
calcule științifice.

26159
20:31:08,000 --> 20:31:12,240
Are o altă bibliotecă numită pyrain

26160
20:31:10,160 --> 20:31:14,000
care se caută pe baza de python

26161
20:31:12,240 --> 20:31:16,240
învăţare prin întărire, artificială

26162
20:31:14,000 --> 20:31:17,680
biblioteca de inteligență și rețea neuronală.

26163
20:31:16,240 --> 20:31:19,512
Scikitlearn este învățarea automată

26164
20:31:17,680 --> 20:31:21,760
bibliotecă pentru crearea clasificării,

26165
20:31:19,512 --> 20:31:24,160
algoritmi de regresie și clustering.

26166
20:31:21,760 --> 20:31:28,120
Și, în sfârșit, oferă PyTorch și

26167
20:31:24,160 --> 20:31:28,120
TensorFlow pentru învățare profundă.

26168
20:31:28,160 --> 20:31:32,480
În sfârșit, ajungând la cele mai importante și

26169
20:31:30,400 --> 20:31:36,480
motivul principal pentru a învăța Python care este

26170
20:31:32,480 --> 20:31:38,240
oportunități de carieră și salariu.

26171
20:31:36,480 --> 20:31:40,480
Limbajul Python oferă o varietate de

26172
20:31:38,240 --> 20:31:43,920
oportunități de angajare și promite un mare

26173
20:31:40,480 --> 20:31:45,680
grafic de creștere cu perspective salariale uriașe.

26174
20:31:43,920 --> 20:31:47,680
Este folosit de majoritatea tehnicienilor

26175
20:31:45,680 --> 20:31:49,512
giganți.

26176
20:31:47,680 --> 20:31:53,040
Liderii din industrie care folosesc Python sunt

26177
20:31:49,512 --> 20:31:56,680
Amazon, Google, Facebook, IBM, NASA,

26178
20:31:53,040 --> 20:31:56,680
Netflix și YouTube.

26179
20:31:57,280 --> 20:32:02,872
În continuare, puteți vedea tendințele Google

26180
20:32:01,120 --> 20:32:06,400
dar am luat în considerare trei programare

26181
20:32:02,872 --> 20:32:09,120
limbaje Python, Java și C. am

26182
20:32:06,400 --> 20:32:10,800
le-a comparat în ultimele 12 luni.

26183
20:32:09,120 --> 20:32:12,552
Puteți vedea clar pe ecranele dvs

26184
20:32:10,800 --> 20:32:14,400
că Python a devenit un pionist

26185
20:32:12,552 --> 20:32:17,440
în ceea ce privește popularitatea și căutarea pe web

26186
20:32:14,400 --> 20:32:19,832
volum. Înseamnă că oamenii sunt interesați

26187
20:32:17,440 --> 20:32:22,640
în Python. Vor să-l învețe și să-l folosească

26188
20:32:19,832 --> 20:32:25,192
asta în munca lor. De asemenea, puteți verifica

26189
20:32:22,640 --> 20:32:26,960
căutarea pe YouTube.

26190
20:32:25,192 --> 20:32:28,320
Acolo veți găsi și acel Python

26191
20:32:26,960 --> 20:32:32,360
limbajul de programare este cel mai

26192
20:32:28,320 --> 20:32:32,360
limba căutată pe YouTube.

26193
20:32:32,552 --> 20:32:38,960
Acum, pe ecranele dvs. puteți vedea

26194
20:32:35,280 --> 20:32:41,192
raportul PPL care este popularitatea

26195
20:32:38,960 --> 20:32:43,040
index al limbajului de programare. Este

26196
20:32:41,192 --> 20:32:45,600
creat prin analiza cât de des limbajul

26197
20:32:43,040 --> 20:32:48,240
tutorialele sunt căutate pe Google. Este

26198
20:32:45,600 --> 20:32:50,640
un indicator principal. Vin datele brute

26199
20:32:48,240 --> 20:32:53,040
din tendințele Google. Graficul cu bare

26200
20:32:50,640 --> 20:32:54,800
descrie că Python este cel mai popular

26201
20:32:53,040 --> 20:32:57,360
și limbaj de programare larg utilizat

26202
20:32:54,800 --> 20:33:00,400
pe tot globul urmat apoi de Java

26203
20:32:57,360 --> 20:33:02,240
JavaScript și C.

26204
20:33:00,400 --> 20:33:04,400
Popularitatea limbajului de programare

26205
20:33:02,240 --> 20:33:07,120
indexul vă poate ajuta să decideți ce limbă

26206
20:33:04,400 --> 20:33:10,512
a studia sau pe care să-l folosească într-un nou

26207
20:33:07,120 --> 20:33:10,512
proiect software.

26208
20:33:12,320 --> 20:33:17,360
Următorul grafic arată popularitatea

26209
20:33:14,960 --> 20:33:20,240
Python și Java de-a lungul anilor începând

26210
20:33:17,360 --> 20:33:23,512
din 2004 până în perioada actuală care

26211
20:33:20,240 --> 20:33:26,552
este 2020. La nivel mondial, Python este cel mai mare

26212
20:33:23,512 --> 20:33:29,920
limbaj popular. Python a crescut cel mai mult

26213
20:33:26,552 --> 20:33:34,832
în ultimii 5 ani cu 19,4%. 4% și

26214
20:33:29,920 --> 20:33:34,832
Java a pierdut cel mai mult cu minus 7,2%.

26215
20:33:37,120 --> 20:33:40,720
Acum să vorbim despre diferit

26216
20:33:38,480 --> 20:33:42,240
oportunități de carieră și rolurile de muncă

26217
20:33:40,720 --> 20:33:44,160
în care poți intra dacă înveți

26218
20:33:42,240 --> 20:33:47,832
Limbajul Python.

26219
20:33:44,160 --> 20:33:49,360
În primul rând, poți deveni un dezvoltator Python

26220
20:33:47,832 --> 20:33:51,680
unde vi se va cere să scrieți și

26221
20:33:49,360 --> 20:33:53,440
coduri de testare, programe de depanare și

26222
20:33:51,680 --> 20:33:55,760
integrarea aplicațiilor cu terțe părți

26223
20:33:53,440 --> 20:33:58,720
servicii web.

26224
20:33:55,760 --> 20:34:01,040
În al doilea rând, poți deveni un dezvoltator web.

26225
20:33:58,720 --> 20:34:03,680
Aici vei fi responsabil de scris

26226
20:34:01,040 --> 20:34:05,920
logica aplicației web pe server. Python

26227
20:34:03,680 --> 20:34:08,320
dezvoltatorii web dezvoltă de obicei back-end

26228
20:34:05,920 --> 20:34:10,480
componente, conectați aplicația cu

26229
20:34:08,320 --> 20:34:12,000
servicii terțe și sprijină

26230
20:34:10,480 --> 20:34:16,000
dezvoltatori front-end prin integrare

26231
20:34:12,000 --> 20:34:17,760
munca lor cu aplicația Python.

26232
20:34:16,000 --> 20:34:20,720
Puteți deveni și analist de date dacă

26233
20:34:17,760 --> 20:34:22,160
cunoști Python. În calitate de analist de date, dvs

26234
20:34:20,720 --> 20:34:24,400
trebuie să adune date de la mai multe

26235
20:34:22,160 --> 20:34:27,040
surse folosind scripturi. analiza asta

26236
20:34:24,400 --> 20:34:31,080
date, dezvolta și implementează baze de date

26237
20:34:27,040 --> 20:34:31,080
și sisteme de colectare a datelor.

26238
20:34:31,680 --> 20:34:36,320
Poți deveni un om de știință a datelor. Ca a

26239
20:34:34,400 --> 20:34:38,080
cercetător de date, trebuie să înțelegi

26240
20:34:36,320 --> 20:34:40,240
provocările în afaceri și să apară

26241
20:34:38,080 --> 20:34:41,920
cu cele mai bune soluții folosind modern

26242
20:34:40,240 --> 20:34:43,600
instrumente și tehnici de analiză,

26243
20:34:41,920 --> 20:34:46,320
vizualizați și construiți modele de predicție

26244
20:34:43,600 --> 20:34:48,480
pentru a lua decizii de afaceri.

26245
20:34:46,320 --> 20:34:50,240
În cele din urmă, poți fi o învățare automată

26246
20:34:48,480 --> 20:34:52,320
inginer unde te poți dezvolta

26247
20:34:50,240 --> 20:34:54,240
mașini inteligente de la care pot învăța

26248
20:34:52,320 --> 20:34:56,400
volume mari de date și aplicarea cunoștințelor

26249
20:34:54,240 --> 20:34:58,160
fără intervenție umană.

26250
20:34:56,400 --> 20:35:00,320
Deci, există o mulțime de domenii dacă înveți

26251
20:34:58,160 --> 20:35:02,080
Python. Dar înainte de a merge mai departe, haideți

26252
20:35:00,320 --> 20:35:03,920
înțelegeți mai întâi ce este Jupyter

26253
20:35:02,080 --> 20:35:06,640
Caiet. Deci băieți, după cum puteți vedea pe toți

26254
20:35:03,920 --> 20:35:08,960
aici acel Jupyter Notebook este un

26255
20:35:06,640 --> 20:35:11,192
popular instrument open-source care practic

26256
20:35:08,960 --> 20:35:14,552
vă permite să creați și să partajați documente

26257
20:35:11,192 --> 20:35:17,120
care conține coduri, ecuații, poți

26258
20:35:14,552 --> 20:35:19,120
au și vizualizări. Practic, asta

26259
20:35:17,120 --> 20:35:21,280
este folosit pentru analiza datelor, mașină

26260
20:35:19,120 --> 20:35:23,120
învăţare şi cercetare ştiinţifică care

26261
20:35:21,280 --> 20:35:25,280
îl face un instrument foarte esenţial pentru

26262
20:35:23,120 --> 20:35:28,160
dezvoltatorii ca oamenii de știință de date și

26263
20:35:25,280 --> 20:35:30,872
cercetători deopotrivă. Acum înainte de instalare

26264
20:35:28,160 --> 20:35:33,120
Caietul Jupyter vă rog să vă

26265
20:35:30,872 --> 20:35:36,160
aveți Python instalat în sistemul dvs. Deci

26266
20:35:33,120 --> 20:35:38,400
cerința ar trebui să fie Python 3.6 sau

26267
20:35:36,160 --> 20:35:40,480
mai mare. Așa că acum haideți-ne oficial

26268
20:35:38,400 --> 20:35:42,640
navigați la site-ul web al lui Python. Deci

26269
20:35:40,480 --> 20:35:45,120
băieți, după cum puteți vedea peste tot aici. Așa mai departe

26270
20:35:42,640 --> 20:35:47,920
python.org dacă dau clic pe descărcare

26271
20:35:45,120 --> 20:35:51,360
Python. Deci vom vedea toate astea

26272
20:35:47,920 --> 20:35:53,360
de aici descărcați Python 3.125. Asa ca si eu

26273
20:35:51,360 --> 20:35:55,920
v-a spus deja că cerința de

26274
20:35:53,360 --> 20:35:58,000
Python ar trebui să fie mai mare decât 3.6. Deci

26275
20:35:55,920 --> 20:36:02,040
doar poți face clic peste tot aici și tu

26276
20:35:58,000 --> 20:36:02,040
puteți vedea că descărcarea a început.

26277
20:36:03,512 --> 20:36:07,600
Deci băieți, după cum puteți vedea peste tot aici

26278
20:36:05,512 --> 20:36:10,080
că am instalat Python. Acum

26279
20:36:07,600 --> 20:36:11,760
hai sa deschidem fisierul. Deci puteți vedea

26280
20:36:10,080 --> 20:36:14,960
software-ul dat va fi instalat pe

26281
20:36:11,760 --> 20:36:17,680
acest director. Bine. Așa că faceți clic pe toate

26282
20:36:14,960 --> 20:36:20,000
aici. Deci băieți, după cum puteți vedea pe toți

26283
20:36:17,680 --> 20:36:23,440
aici instalarea Python a

26284
20:36:20,000 --> 20:36:27,512
3.125 este în curs. Să aşteptăm

26285
20:36:23,440 --> 20:36:29,280
ceva timp până se instalează.

26286
20:36:27,512 --> 20:36:31,120
Deci, după cum puteți vedea, băieți de peste tot aici

26287
20:36:29,280 --> 20:36:33,760
că ne-am instalat cu succes

26288
20:36:31,120 --> 20:36:35,680
Python. Acum să ne deschidem terminalul și

26289
20:36:33,760 --> 20:36:38,080
haideți să verificăm dacă Python este corect

26290
20:36:35,680 --> 20:36:40,080
instalat. Deci vom tasta

26291
20:36:38,080 --> 20:36:42,480
piton

26292
20:36:40,080 --> 20:36:44,552
/ versiunea.

26293
20:36:42,480 --> 20:36:46,960
Deci, după cum puteți vedea peste tot aici, avem

26294
20:36:44,552 --> 20:36:49,680
instalat cu succes Python-ul nostru. Deci

26295
20:36:46,960 --> 20:36:52,240
băieți, asta era condiția noastră prealabilă. Acum

26296
20:36:49,680 --> 20:36:54,872
Există două moduri de a instala Jupyter

26297
20:36:52,240 --> 20:36:58,000
caietul. Prima poate fi pip.

26298
20:36:54,872 --> 20:37:00,160
Bine, pip este un manager de pachete sau folosește

26299
20:36:58,000 --> 20:37:03,120
Distributie Anocanda. Asa ca sa vedem

26300
20:37:00,160 --> 20:37:04,960
cu pip mai întâi. Deci băieți, pip este un

26301
20:37:03,120 --> 20:37:07,440
manager de pachete care este folosit pentru instalare

26302
20:37:04,960 --> 20:37:09,360
și gestionați biblioteci de pachete software

26303
20:37:07,440 --> 20:37:11,920
scris în Python. Așa că poți vedea totul

26304
20:37:09,360 --> 20:37:14,240
aici că Python cu versiunea

26305
20:37:11,920 --> 20:37:16,720
mai mare de 3,6 au pip implicit

26306
20:37:14,240 --> 20:37:19,120
instalat în ele. Bine. Deci putem folosi

26307
20:37:16,720 --> 20:37:21,120
comanda pip pentru a instala Jupyter-ul nostru

26308
20:37:19,120 --> 20:37:23,360
caietul. Deci băieți, după cum puteți vedea pe toți

26309
20:37:21,120 --> 20:37:26,080
aici am ajuns la oficial

26310
20:37:23,360 --> 20:37:28,552
documentația jupitter.org și este

26311
20:37:26,080 --> 20:37:30,720
spunând că instalarea Jupyter lab cu

26312
20:37:28,552 --> 20:37:32,800
comanda pip. Deci ce puteți face, băieți

26313
20:37:30,720 --> 20:37:36,480
pot doar copia peste tot aici. Poți merge

26314
20:37:32,800 --> 20:37:38,800
chiar aici și faceți clic pe aceasta.

26315
20:37:36,480 --> 20:37:43,160
Acum, după cum puteți vedea peste tot aici, are

26316
20:37:38,800 --> 20:37:43,160
a început să descarce laboratorul Jupyter.

26317
20:37:57,440 --> 20:38:02,400
Deci băieți, vom instala

26318
20:37:59,920 --> 20:38:04,320
Laboratorul Jupyter cu comanda pip. Deci

26319
20:38:02,400 --> 20:38:07,680
aceasta este documentația oficială a

26320
20:38:04,320 --> 20:38:10,320
Caietul Jupyter. Bine? Și doar voi toți

26321
20:38:07,680 --> 20:38:12,960
trebuie să faceți este să copiați acest lucru și să tastați pe dvs

26322
20:38:10,320 --> 20:38:14,552
terminal. Deci, după cum puteți vedea peste tot

26323
20:38:12,960 --> 20:38:16,720
aici a început descărcarea

26324
20:38:14,552 --> 20:38:18,872
pachete care trebuie descărcate

26325
20:38:16,720 --> 20:38:22,120
caietul Jupyter. Să așteptăm

26326
20:38:18,872 --> 20:38:22,120
ceva timp.

26327
20:38:23,280 --> 20:38:27,680
Bine băieți, așa că am reușit

26328
20:38:25,280 --> 20:38:30,240
a finalizat acest pas. Acum hai să mergem mai departe

26329
20:38:27,680 --> 20:38:34,320
la următorul nostru pas. Deci, după cum puteți vedea toate

26330
20:38:30,240 --> 20:38:36,640
aici. Deci ne-am instalat. Bine.

26331
20:38:34,320 --> 20:38:39,120
Atunci ce trebuie să facem, atunci poți

26332
20:38:36,640 --> 20:38:41,832
tastați asta. Putem lansa laboratorul Jupyter

26333
20:38:39,120 --> 20:38:44,320
cu această comandă pe terminal. Acum

26334
20:38:41,832 --> 20:38:46,080
hai sa asteptam. Deci, după cum puteți vedea peste tot

26335
20:38:44,320 --> 20:38:48,960
aici baieti, am avut succes

26336
20:38:46,080 --> 20:38:51,120
a instalat notebook-ul nostru Jupyter. Deci tu

26337
20:38:48,960 --> 20:38:53,512
poate merge peste tot aici și doar crea un

26338
20:38:51,120 --> 20:38:56,160
notebook nou și puteți alege

26339
20:38:53,512 --> 20:38:58,640
nucleul tău și poți începe să lucrezi

26340
20:38:56,160 --> 20:39:02,872
caietul tău Jupyter. Să presupunem că voi arăta

26341
20:38:58,640 --> 20:39:05,440
tu un fragment. Deci 3 5. Să încercăm

26342
20:39:02,872 --> 20:39:07,680
rulați acest notebook. Deci, după cum puteți vedea

26343
20:39:05,440 --> 20:39:09,920
ne dă opt ca răspuns. Deci

26344
20:39:07,680 --> 20:39:12,240
urmează sintaxa Python și în

26345
20:39:09,920 --> 20:39:14,552
astfel ne-am instalat cu succes

26346
20:39:12,240 --> 20:39:18,160
caietul nostru Jupyter folosind pip

26347
20:39:14,552 --> 20:39:20,160
comanda. Așa că acum, după cum puteți vedea, de asemenea, toate

26348
20:39:18,160 --> 20:39:22,320
aici puteți instala și Jupyter

26349
20:39:20,160 --> 20:39:24,720
notebook cu această comandă pip install

26350
20:39:22,320 --> 20:39:27,120
notebook și apoi îl puteți deschide.

26351
20:39:24,720 --> 20:39:29,680
Aceasta este, de asemenea, o altă alternativă.

26352
20:39:27,120 --> 20:39:34,000
În mod similar, puteți instala și cu VA

26353
20:39:29,680 --> 20:39:35,920
aceeași comandă și deschideți VA. Acum,

26354
20:39:34,000 --> 20:39:38,640
dacă utilizați orice altă operație

26355
20:39:35,920 --> 20:39:41,440
sistem precum Mac OS sau Linux, atunci tu

26356
20:39:38,640 --> 20:39:44,080
se poate instala prin brew install Jupyter Lab.

26357
20:39:41,440 --> 20:39:47,192
Deci, home va fi managerul de pachete pentru

26358
20:39:44,080 --> 20:39:49,040
Mac OS și Linux. Deci, sper că așa ești

26359
20:39:47,192 --> 20:39:51,760
destul de clar cum să instalezi Jupyter

26360
20:39:49,040 --> 20:39:54,080
caiet cu comanda pep. Acum, eu

26361
20:39:51,760 --> 20:39:57,040
am descărcat Anacondas de pe aceasta

26362
20:39:54,080 --> 20:39:59,192
site-ul oficial. Deci, după cum puteți vedea toate

26363
20:39:57,040 --> 20:40:02,240
aici acesta este site-ul oficial

26364
20:39:59,192 --> 20:40:04,872
de Anaconda. Bine. Acum doar tastați dvs

26365
20:40:02,240 --> 20:40:07,360
e-mail și îl puteți descărca. Deci

26366
20:40:04,872 --> 20:40:09,360
la fel cum puteți vedea după

26367
20:40:07,360 --> 20:40:12,800
instalare voi lansa mea

26368
20:40:09,360 --> 20:40:16,480
instalator și permiteți-ne să facem clic pe următorul. Bine.

26369
20:40:12,800 --> 20:40:20,160
Dați clic pe de acord. Bine. Și lasă-ne

26370
20:40:16,480 --> 20:40:21,832
instalați acest lucru în directorul dat.

26371
20:40:20,160 --> 20:40:25,552
Să așteptăm ceva timp până la

26372
20:40:21,832 --> 20:40:25,552
instalarea devine completă.

26373
20:40:26,960 --> 20:40:30,960
Deci băieți, după cum puteți vedea peste tot aici

26374
20:40:29,440 --> 20:40:35,360
am finalizat instalarea noastră de

26375
20:40:30,960 --> 20:40:36,872
Anoconda. Așa că faceți clic pe finalizare și

26376
20:40:35,360 --> 20:40:39,600
poți spune că am avut succes

26377
20:40:36,872 --> 20:40:43,280
ne-a instalat Anocanda. Acum hai să deschidem

26378
20:40:39,600 --> 20:40:46,280
navigatorul nostru Anaconda. Deci doar faceți clic

26379
20:40:43,280 --> 20:40:46,280
pe.

26380
20:40:51,600 --> 20:40:56,400
Deci, după cum puteți vedea peste tot aici

26381
20:40:54,000 --> 20:40:58,480
faceți clic dreapta pe aceasta și pe Anocanda noastră

26382
20:40:56,400 --> 20:41:00,800
navigatorul va fi deschis. Așa cum poți

26383
20:40:58,480 --> 20:41:03,680
vezi peste tot aici aceasta este Anocanda noastră

26384
20:41:00,800 --> 20:41:06,240
navigator și încarcă pachetele

26385
20:41:03,680 --> 20:41:08,080
și pentru noi să instalăm Jupyter

26386
20:41:06,240 --> 20:41:10,872
caietul. Deci, după cum puteți vedea peste tot

26387
20:41:08,080 --> 20:41:12,640
aici doar faceți clic pe lansare. Deci băieți dacă

26388
20:41:10,872 --> 20:41:14,800
faceți clic pe lansare, se va deschide

26389
20:41:12,640 --> 20:41:17,120
caietul nostru Jupyter. Deci, după cum puteți vedea

26390
20:41:14,800 --> 20:41:19,600
peste tot aici se spune lansarea

26391
20:41:17,120 --> 20:41:23,120
Jupyter notebook și este găzduit pe

26392
20:41:19,600 --> 20:41:25,360
localhost 8889. Deci acesta este găzduirea noastră

26393
20:41:23,120 --> 20:41:27,512
Caietul Jupyter și, în mod similar, tu

26394
20:41:25,360 --> 20:41:29,512
poate crea un nou blocnotes peste tot aici

26395
20:41:27,512 --> 20:41:32,320
si in acest fel poti incepe sa lucrezi

26396
20:41:29,512 --> 20:41:34,480
>> LLMs. Dacă te-ai întrebat vreodată cum mașină

26397
20:41:32,320 --> 20:41:36,240
învăţarea poate acum să înţeleagă şi să genereze

26398
20:41:34,480 --> 20:41:38,400
text asemănător omului, ai dreptate

26399
20:41:36,240 --> 20:41:40,872
loc. De la forumuri de chat precum Chat GPT la

26400
20:41:38,400 --> 20:41:43,040
Asistent AI care alimentează motoarele de căutare,

26401
20:41:40,872 --> 20:41:44,552
LLM-urile transformă modul în care interacționăm

26402
20:41:43,040 --> 20:41:46,800
cu tehnologie. Una dintre cele mai multe

26403
20:41:44,552 --> 20:41:50,400
progres incitant în acest spațiu este

26404
20:41:46,800 --> 20:41:52,000
Google Gemini sau OpenAI Charging mare

26405
20:41:50,400 --> 20:41:54,160
model de limbaj conceput pentru a împinge

26406
20:41:52,000 --> 20:41:56,080
limitele a ceea ce AI poate realiza. În

26407
20:41:54,160 --> 20:41:58,872
acest videoclip, vom explora ce LLM-uri

26408
20:41:56,080 --> 20:42:01,360
sunt, cum funcționează și de ce modelelor le plac

26409
20:41:58,872 --> 20:42:04,000
Gemenii sunt critici pentru viitorul

26410
20:42:01,360 --> 20:42:06,640
AI. Google Gemini face parte dintr-un nou val

26411
20:42:04,000 --> 20:42:08,720
de modele AI care sunt mai inteligente, mai rapide,

26412
20:42:06,640 --> 20:42:11,192
si mai eficient. Este conceput pentru

26413
20:42:08,720 --> 20:42:13,760
înțelegeți mai bine contextul, oferiți mai mult

26414
20:42:11,192 --> 20:42:16,000
răspunsuri precise și se integrează profund

26415
20:42:13,760 --> 20:42:17,832
în serviciu precum căutarea Google și

26416
20:42:16,000 --> 20:42:19,760
Asistentul Google, oferind mai mult

26417
20:42:17,832 --> 20:42:21,832
interacțiuni asemănătoare omului. Deci vom sparge

26418
20:42:19,760 --> 20:42:23,512
jos știința din spatele LLM, inclusiv

26419
20:42:21,832 --> 20:42:25,832
setul lor masiv de date de antrenament,

26420
20:42:23,512 --> 20:42:28,000
Arhitectura transformatoarelor și modul în care modelele

26421
20:42:25,832 --> 20:42:30,320
precum Gemenii folosesc inovația de învățare profundă

26422
20:42:28,000 --> 20:42:32,240
pentru a schimba industriile. Plus că vom face

26423
20:42:30,320 --> 20:42:35,040
compara Google Gemini cu alte populare

26424
20:42:32,240 --> 20:42:36,720
Afișează modele LMS precum OpenAI Chity

26425
20:42:35,040 --> 20:42:39,040
cum este utilizată fiecare dintre aceste tehnologii

26426
20:42:36,720 --> 20:42:41,280
pentru a alimenta robotii de chat, asistenții virtuali

26427
20:42:39,040 --> 20:42:42,872
și alte aplicații AIdriven. Până la sfârșit

26428
20:42:41,280 --> 20:42:44,552
din acest videoclip, veți avea o claritate

26429
20:42:42,872 --> 20:42:46,720
înțelegerea cât de mare este limbajul

26430
20:42:44,552 --> 20:42:48,872
modele precum Gemeni funcționează, cheia lor

26431
20:42:46,720 --> 20:42:50,720
caracteristici și ce înseamnă ele pentru ei

26432
20:42:48,872 --> 20:42:52,480
viitor AI. Nu uita să dai like,

26433
20:42:50,720 --> 20:42:54,400
abonați-vă și apăsați pe pictograma clopoțel la

26434
20:42:52,480 --> 20:42:56,160
nu ratați niciodată nicio actualizare de la Simply Learn.

26435
20:42:54,400 --> 20:42:58,800
Deci, care sunt modelele mari de limbaj?

26436
20:42:56,160 --> 20:43:02,000
Modele mari de limbă precum Chargen

26437
20:42:58,800 --> 20:43:04,080
transformator pre-antrenat 4 o și Google

26438
20:43:02,000 --> 20:43:06,160
Gemenii sunt un sistem AI sofisticat

26439
20:43:04,080 --> 20:43:08,080
concepute pentru a înțelege și a genera

26440
20:43:06,160 --> 20:43:09,832
text asemănător omului. Aceste modele sunt construite

26441
20:43:08,080 --> 20:43:12,000
folosind tehnici de deep learning și sunt

26442
20:43:09,832 --> 20:43:13,440
instruit pe un set vast de date colectat de la

26443
20:43:12,000 --> 20:43:15,040
internetul. Ei se folosesc de sine

26444
20:43:13,440 --> 20:43:17,192
mecanism de atenție de analizat

26445
20:43:15,040 --> 20:43:19,280
relația dintre cuvinte sau simboluri

26446
20:43:17,192 --> 20:43:21,440
permiţându-le să surprindă contextul şi

26447
20:43:19,280 --> 20:43:23,360
produce răspunsuri relevante coerente.

26448
20:43:21,440 --> 20:43:25,280
LLM-urile au o aplicație semnificativă

26449
20:43:23,360 --> 20:43:27,512
inclusiv alimentarea asistentului virtual

26450
20:43:25,280 --> 20:43:29,600
forumuri de chat, creare de conținut, limbă

26451
20:43:27,512 --> 20:43:31,040
traducerea şi sprijinirea cercetării şi

26452
20:43:29,600 --> 20:43:32,872
luarea deciziilor. Capacitatea lor de a

26453
20:43:31,040 --> 20:43:34,720
generează fluent și contextual

26454
20:43:32,872 --> 20:43:36,872
textul adecvat a avansat natural

26455
20:43:34,720 --> 20:43:38,552
procesarea limbajului și uman îmbunătățit

26456
20:43:36,872 --> 20:43:40,800
interacțiunea cu computerul. Deci acum să vedem

26457
20:43:38,552 --> 20:43:42,960
pentru ce sunt folosite modelele de limbaj mari.

26458
20:43:40,800 --> 20:43:45,280
Modelele de limbaj mari sunt utilizate în

26459
20:43:42,960 --> 20:43:46,960
scenarii cu domeniu limitat sau fără domeniu

26460
20:43:45,280 --> 20:43:48,800
date specifice disponibile pentru antrenament.

26461
20:43:46,960 --> 20:43:50,720
Aceste scenarii includ atât câteva scurte

26462
20:43:48,800 --> 20:43:52,640
și zero abordări scurte de antrenament care

26463
20:43:50,720 --> 20:43:54,640
bazați-vă pe inductivitatea puternică a modelului

26464
20:43:52,640 --> 20:43:56,800
părtinire și capacitatea sa de a deriva

26465
20:43:54,640 --> 20:43:59,360
reprezentare semnificativă dintr-un mic

26466
20:43:56,800 --> 20:44:01,512
cantitatea de date sau chiar deloc.

26467
20:43:59,360 --> 20:44:03,440
Deci acum să vedem cum sunt limbajul mare

26468
20:44:01,512 --> 20:44:06,000
modele instruite. Modele mari de limbaj

26469
20:44:03,440 --> 20:44:08,240
de obicei, urmează un pre-formare pe a

26470
20:44:06,000 --> 20:44:10,080
bord. Setul de date cuprinzătoare care

26471
20:44:08,240 --> 20:44:12,400
împărtășește asemănări statice cu

26472
20:44:10,080 --> 20:44:14,160
set de date specific sarcinii țintă.

26473
20:44:12,400 --> 20:44:16,320
Obiectivul pregătirii preliminare este de a

26474
20:44:14,160 --> 20:44:18,480
permite modelului să necesite nivel înalt

26475
20:44:16,320 --> 20:44:21,120
caracteristică care poate fi aplicată ulterior în timpul

26476
20:44:18,480 --> 20:44:23,040
faza de reglare fină pentru o anumită sarcină.

26477
20:44:21,120 --> 20:44:25,600
Deci, există unele procese de antrenament de

26478
20:44:23,040 --> 20:44:27,360
LLM care presupune mai multe etape. The

26479
20:44:25,600 --> 20:44:28,960
primul este procesarea pregătirii textului. The

26480
20:44:27,360 --> 20:44:30,960
datele textuale se transformă în a

26481
20:44:28,960 --> 20:44:32,480
reprezentare numerică pe care LLM

26482
20:44:30,960 --> 20:44:34,160
modelul poate procesa eficient. Aceasta

26483
20:44:32,480 --> 20:44:36,320
conversia poate implica tehnici

26484
20:44:34,160 --> 20:44:38,080
cum ar fi codificarea și crearea tokenizării

26485
20:44:36,320 --> 20:44:39,832
secvențe de intrare. Al doilea este

26486
20:44:38,080 --> 20:44:41,280
inițializarea aleatorie a parametrilor. The

26487
20:44:39,832 --> 20:44:42,960
parametrii modelului sunt inițializați

26488
20:44:41,280 --> 20:44:44,960
aleatoriu înainte de procesul de antrenament

26489
20:44:42,960 --> 20:44:46,552
începe. Al treilea este introdus numeric

26490
20:44:44,960 --> 20:44:48,640
date. Reprezentarea numerică a

26491
20:44:46,552 --> 20:44:50,400
datele text sunt introduse în modelul de

26492
20:44:48,640 --> 20:44:52,400
prelucrare. Arhitectura modelului

26493
20:44:50,400 --> 20:44:53,760
de obicei bazat pe transformatoare permite

26494
20:44:52,400 --> 20:44:56,320
aceasta pentru a surprinde conceptual

26495
20:44:53,760 --> 20:44:58,080
relația dintre cuvinte sau simboluri

26496
20:44:56,320 --> 20:44:59,680
în următorul. A patra este pierderea

26497
20:44:58,080 --> 20:45:01,192
calculul funcției. O funcție de pierdere

26498
20:44:59,680 --> 20:45:02,872
calculul măsoară discrepanța

26499
20:45:01,192 --> 20:45:05,440
între predicția modelului și

26500
20:45:02,872 --> 20:45:08,160
următorul cuvânt sau simbol real într-o sintaxă.

26501
20:45:05,440 --> 20:45:09,832
Modelul LLM își propune să minimizeze această pierdere

26502
20:45:08,160 --> 20:45:11,512
în timpul antrenamentului. Al cincilea este

26503
20:45:09,832 --> 20:45:12,872
optimizarea parametrilor. Al modelului

26504
20:45:11,512 --> 20:45:14,720
parametrul sunt înregistrate prin

26505
20:45:12,872 --> 20:45:16,480
tehnica de optimizare. Aceasta implică

26506
20:45:14,720 --> 20:45:18,160
calcularea gradientului și actualizarea

26507
20:45:16,480 --> 20:45:20,000
parametrii corespunzător treptat

26508
20:45:18,160 --> 20:45:21,760
îmbunătățirea performanței modelului. The

26509
20:45:20,000 --> 20:45:23,680
ultimul este antrenamentul iterativ. The

26510
20:45:21,760 --> 20:45:26,320
procesul de antrenament se repetă peste

26511
20:45:23,680 --> 20:45:28,320
iterație multiplă sau epox până la

26512
20:45:26,320 --> 20:45:30,800
rezultatul modelului atinge un rezultat satisfăcător

26513
20:45:28,320 --> 20:45:32,400
nivelul de precizie asupra acelei sarcini date sau

26514
20:45:30,800 --> 20:45:34,160
set de date. Urmând acest antrenament

26515
20:45:32,400 --> 20:45:35,832
proces, model de limbaj mare învață să

26516
20:45:34,160 --> 20:45:38,000
captați modele lingvistice, înțelegeți

26517
20:45:35,832 --> 20:45:39,920
context și să genereze răspunsuri coerente

26518
20:45:38,000 --> 20:45:42,080
permițându-le să exceleze la diverse

26519
20:45:39,920 --> 20:45:44,960
sarcini legate de limbaj. Următorul subiect

26520
20:45:42,080 --> 20:45:46,640
este cum funcționează modelele mari de limbaj. Deci

26521
20:45:44,960 --> 20:45:48,640
modelele lingvistice mari au o pârghie profundă

26522
20:45:46,640 --> 20:45:50,720
rețea neuronală pentru a genera rezultate bazate

26523
20:45:48,640 --> 20:45:52,552
pe tiparele învățate din antrenament

26524
20:45:50,720 --> 20:45:54,480
date. De obicei, un model de limbaj mare

26525
20:45:52,552 --> 20:45:55,920
adoptă o arhitectură de transformator care

26526
20:45:54,480 --> 20:45:58,080
permite modelului să se identifice

26527
20:45:55,920 --> 20:45:59,832
relația dintre cuvintele dintr-o propoziție

26528
20:45:58,080 --> 20:46:02,552
indiferent de poziția lor în

26529
20:45:59,832 --> 20:46:04,552
succesiune. Spre deosebire de ARN-urile care se bazează

26530
20:46:02,552 --> 20:46:07,040
la recurență pentru a captura token

26531
20:46:04,552 --> 20:46:09,040
transformator de relații rețea neuronală

26532
20:46:07,040 --> 20:46:10,872
folosește atenția personală ca principală

26533
20:46:09,040 --> 20:46:12,400
mecanism. Atenția de sine calculează

26534
20:46:10,872 --> 20:46:14,400
scorurile de atenție care determină

26535
20:46:12,400 --> 20:46:16,320
importanța fiecărui jeton în ceea ce privește

26536
20:46:14,400 --> 20:46:18,552
celălalt simbol din secvența de text

26537
20:46:16,320 --> 20:46:20,552
facilitând modelarea complicatelor

26538
20:46:18,552 --> 20:46:22,552
relație în cadrul datelor. În continuare,

26539
20:46:20,552 --> 20:46:24,320
să vedem aplicarea limbajului mare

26540
20:46:22,552 --> 20:46:26,000
modele. Modelele de limbaj mari au o

26541
20:46:24,320 --> 20:46:27,760
gamă largă de aplicații în diverse

26542
20:46:26,000 --> 20:46:29,360
domenii. Deci, iată câteva notabile

26543
20:46:27,760 --> 20:46:31,680
aplicarea. Primul este natural

26544
20:46:29,360 --> 20:46:33,512
procesarea limbajului NLP. Limba mare

26545
20:46:31,680 --> 20:46:35,120
modelele sunt folosite pentru a îmbunătăți naturale

26546
20:46:33,512 --> 20:46:37,360
sarcini de înțelegere a limbajului precum

26547
20:46:35,120 --> 20:46:39,680
analiza sentimentelor, entitate numită

26548
20:46:37,360 --> 20:46:41,600
recunoașterea, clasificarea textului și

26549
20:46:39,680 --> 20:46:43,832
modelarea limbajului. Al doilea este

26550
20:46:41,600 --> 20:46:45,360
chatbot și asistent virtual. Mare

26551
20:46:43,832 --> 20:46:47,680
modelele lingvistice puterea conversațională

26552
20:46:45,360 --> 20:46:49,920
agenți, chatbot și asistent virtual

26553
20:46:47,680 --> 20:46:51,680
oferind mai interactiv și mai uman

26554
20:46:49,920 --> 20:46:53,680
interacțiunea utilizatorului. Al treilea este

26555
20:46:51,680 --> 20:46:55,440
traducere automată. Limba mare

26556
20:46:53,680 --> 20:46:57,192
modelele au fost folosite pentru automate

26557
20:46:55,440 --> 20:46:59,192
textul care permite traducerea limbii

26558
20:46:57,192 --> 20:47:01,192
traducere între diferite limbi

26559
20:46:59,192 --> 20:47:03,832
cu precizie îmbunătățită. Al patrulea

26560
20:47:01,192 --> 20:47:05,832
este analiza sentimentelor. LLM-urile pot analiza

26561
20:47:03,832 --> 20:47:08,000
și clasificați sentimentul sau emoția

26562
20:47:05,832 --> 20:47:10,320
exprimat într-o bucată de text care este

26563
20:47:08,000 --> 20:47:12,160
valoros pentru cercetare de piață, brand

26564
20:47:10,320 --> 20:47:14,000
monitorizare si analiza social media.

26565
20:47:12,160 --> 20:47:15,920
A cincea este recomandarea de conținut.

26566
20:47:14,000 --> 20:47:17,920
Aceste modele pot fi folosite pentru a oferi

26567
20:47:15,920 --> 20:47:20,320
recomandări personalizate de conținut

26568
20:47:17,920 --> 20:47:22,400
îmbunătățirea experienței utilizatorului și a implicării

26569
20:47:20,320 --> 20:47:24,240
pe platforme precum site-ul de știri sau

26570
20:47:22,400 --> 20:47:25,920
servicii de streaming. Deci aceste aplicații

26571
20:47:24,240 --> 20:47:27,760
evidențiază impactul potențial al mare

26572
20:47:25,920 --> 20:47:29,360
modele de limbaj în diverse domenii pt

26573
20:47:27,760 --> 20:47:31,760
îmbunătățirea înțelegerii limbii

26574
20:47:29,360 --> 20:47:35,040
automatizare. Deci salut baieti bine ati venit la

26575
20:47:31,760 --> 20:47:37,192
această parte demonstrativă a acestui videoclip. Deci aici

26576
20:47:35,040 --> 20:47:40,000
ce voi face voi merge la nou atunci

26577
20:47:37,192 --> 20:47:42,080
Fișier Python 3

26578
20:47:40,000 --> 20:47:46,160
apoi aici

26579
20:47:42,080 --> 20:47:49,160
Îi voi da numele numit

26580
20:47:46,160 --> 20:47:49,160
exploratorie

26581
20:47:54,720 --> 20:48:00,000
date

26582
20:47:56,400 --> 20:48:04,160
analiza. Practic, așa vom avea

26583
20:48:00,000 --> 20:48:07,192
un fișier de set de date de

26584
20:48:04,160 --> 20:48:09,600
roller coaster practic. Așa vom fi

26585
20:48:07,192 --> 20:48:11,512
folosind asta și îl poți descărca

26586
20:48:09,600 --> 20:48:14,080
fișier din caseta de descriere de mai jos de la

26587
20:48:11,512 --> 20:48:17,680
link-ul de mai jos link-ul de conducere. Bine. Deci noi

26588
20:48:14,080 --> 20:48:20,640
va face câteva mici funcții de bază

26589
20:48:17,680 --> 20:48:22,800
folosind Python și mai târziu vom uh

26590
20:48:20,640 --> 20:48:24,960
faceți niște diagrame bune. Bine. Vom face

26591
20:48:22,800 --> 20:48:26,480
eliminați duplicatele și tot vom face totul

26592
20:48:24,960 --> 20:48:28,872
că

26593
20:48:26,480 --> 20:48:32,720
lucru. Vom face pregătirea datelor. Vom face

26594
20:48:28,872 --> 20:48:35,120
face ingineria caracteristicilor. Bine. Și uh

26595
20:48:32,720 --> 20:48:38,800
vom elimina duplicatele. Vom verifica

26596
20:48:35,120 --> 20:48:43,360
pentru duplicate. Vom face diagrame

26597
20:48:38,800 --> 20:48:46,080
cum ar fi histograma, blocurile KD, box plot și

26598
20:48:43,360 --> 20:48:48,640
ca multe altele asemănătoare cu cea cum ar fi căldura

26599
20:48:46,080 --> 20:48:52,240
harta. Vom face un grup de diagrame de dispersie

26600
20:48:48,640 --> 20:48:56,872
comparatie. Bine, toți facem asta, nu?

26601
20:48:52,240 --> 20:49:00,872
Așa că rămâne cu mine și poți scrie

26602
20:48:56,872 --> 20:49:05,040
alaturi de mine aici acest cod. Bine.

26603
20:49:00,872 --> 20:49:07,440
Bine. Deci, să începem cu importul

26604
20:49:05,040 --> 20:49:09,832
panda mai întâi.

26605
20:49:07,440 --> 20:49:11,680
Cred că toată lumea știe ce este panda și

26606
20:49:09,832 --> 20:49:13,760
numpy

26607
20:49:11,680 --> 20:49:17,920
bine

26608
20:49:13,760 --> 20:49:20,920
ca np atunci voi importa

26609
20:49:17,920 --> 20:49:20,920
numpy

26610
20:49:21,192 --> 20:49:29,192
ca np de ce acesta este np și pd îmi pare rău pentru mine

26611
20:49:26,872 --> 20:49:32,240
pd este aici pentru că nu vreau să scriu

26612
20:49:29,192 --> 20:49:34,480
din nou și din nou, acest panda asta numpy

26613
20:49:32,240 --> 20:49:38,960
deci, practic, pot scrie asta mic

26614
20:49:34,480 --> 20:49:40,640
versiunea ok, da. Deci, dacă nu o faceți

26615
20:49:38,960 --> 20:49:43,280
știi ce este panda. Deci panda este foarte

26616
20:49:40,640 --> 20:49:46,000
bibliotecă populară pentru lucrul cu date.

26617
20:49:43,280 --> 20:49:48,720
Bine. Scopul lui este să fii cel mai mult

26618
20:49:46,000 --> 20:49:51,120
instrument opensource puternic și flexibil.

26619
20:49:48,720 --> 20:49:54,000
Bine. Deci s-a atins acel obiectiv. Deci

26620
20:49:51,120 --> 20:49:56,000
cadrele de date sunt centrul panda.

26621
20:49:54,000 --> 20:49:57,832
Și ce este cadrul de date? Un cadru de date este

26622
20:49:56,000 --> 20:49:59,600
structurat ca o masă sau o

26623
20:49:57,832 --> 20:50:02,552
foaie de calcul. Bine. Rândurile și

26624
20:49:59,600 --> 20:50:05,920
coloane. Bine. În timp ce numpy numpy este un

26625
20:50:02,552 --> 20:50:07,920
biblioteca Python cu sursă deschisă din nou că

26626
20:50:05,920 --> 20:50:09,832
facilitează uh știi eficient

26627
20:50:07,920 --> 20:50:12,720
operație numerică pe cantități mari

26628
20:50:09,832 --> 20:50:17,600
de date. Bine. Deci sunt multe

26629
20:50:12,720 --> 20:50:21,760
funcţionează în numpy la fel de bine cele pe care le putem

26630
20:50:17,600 --> 20:50:25,680
utilizați în cadrul de date panda. Am înţeles. Deci

26631
20:50:21,760 --> 20:50:28,720
mai importam unul

26632
20:50:25,680 --> 20:50:32,080
punct piplot

26633
20:50:28,720 --> 20:50:34,872
dotp. Bine. ca

26634
20:50:32,080 --> 20:50:38,320
plt. Bine, mai este o bibliotecă

26635
20:50:34,872 --> 20:50:42,080
mattplot lip pentru trasarea graficului și

26636
20:50:38,320 --> 20:50:44,160
și mai este un import

26637
20:50:42,080 --> 20:50:47,440
seabbon

26638
20:50:44,160 --> 20:50:49,120
ca SNS. Deci ce este se? Sebon este din nou

26639
20:50:47,440 --> 20:50:51,192
biblioteca de vizualizare a datelor Python

26640
20:50:49,120 --> 20:50:53,192
bazat pe buza complotului Matt. Bine, asta

26641
20:50:51,192 --> 20:50:56,320
oferă o interfață highle pentru desen

26642
20:50:53,192 --> 20:50:59,512
atractiv și informativ static te

26643
20:50:56,320 --> 20:51:03,760
cunosc grafice. Bine. Atunci voi scrie

26644
20:50:59,512 --> 20:51:06,720
aici plt dot stil

26645
20:51:03,760 --> 20:51:08,720
folosiți puncte.

26646
20:51:06,720 --> 20:51:12,832
Vom scrie ggplot.

26647
20:51:08,720 --> 20:51:12,832
Am înţeles. ggplot.

26648
20:51:12,872 --> 20:51:17,600
Amenda.

26649
20:51:15,760 --> 20:51:20,080
Deci da,

26650
20:51:17,600 --> 20:51:23,360
lasă-mă să-l conduc. Deci, ce este ggplot? Deci

26651
20:51:20,080 --> 20:51:25,600
ggplot este din nou, acesta este un opensource

26652
20:51:23,360 --> 20:51:29,832
pachet de vizualizare a datelor pentru

26653
20:51:25,600 --> 20:51:32,160
programare istorică. Bine. Deci da uh

26654
20:51:29,832 --> 20:51:34,720
puteți spune sau o schemă generală pentru date

26655
20:51:32,160 --> 20:51:36,800
vizualizare care descompune graficul în

26656
20:51:34,720 --> 20:51:42,960
cunoașteți componente semantice precum

26657
20:51:36,800 --> 20:51:45,960
solzi și straturi. Bine. ML lip py

26658
20:51:42,960 --> 20:51:45,960
pyab

26659
20:51:46,320 --> 20:51:53,512
p. Bine. Da. Deci acum

26660
20:51:50,640 --> 20:51:56,080
ne vom importa setul de date df. DF înseamnă

26661
20:51:53,512 --> 20:52:00,240
cadru de date. Puteți scrie orice cuvânt din

26662
20:51:56,080 --> 20:52:01,760
alegerea ta. Apoi pd din nou panda dot

26663
20:52:00,240 --> 20:52:05,920
citeste

26664
20:52:01,760 --> 20:52:09,760
csv folosit pentru citirea fișierului CSV. Bine.

26665
20:52:05,920 --> 20:52:11,680
Fișiere Excel. Am înţeles? Atunci aici voi face

26666
20:52:09,760 --> 20:52:14,552
scrie-mi

26667
20:52:11,680 --> 20:52:17,600
acest coaster

26668
20:52:14,552 --> 20:52:22,160
punct CSV. Bine. Nu scriu nicio cale

26669
20:52:17,600 --> 20:52:26,640
pentru că acest set de date este aici

26670
20:52:22,160 --> 20:52:30,080
în sine. Coaster Coaster CO acesta este

26671
20:52:26,640 --> 20:52:32,320
coaster.csv CSV. Bine. Dacă ai al tău

26672
20:52:30,080 --> 20:52:34,640
set de date într-o altă locație ca în similar

26673
20:52:32,320 --> 20:52:37,512
pe unitatea C, unitatea D sau orice altceva. Bine.

26674
20:52:34,640 --> 20:52:41,120
Poți să dai acea cale.

26675
20:52:37,512 --> 20:52:44,160
Bine. Lasă-mă să o conduc. Da. Deci acum noi

26676
20:52:41,120 --> 20:52:47,360
va face unele înțelegeri de date. Bine.

26677
20:52:44,160 --> 20:52:50,480
Vom vedea forma cadrului de date cap și coadă

26678
20:52:47,360 --> 20:52:55,600
tipuri de date și descrieți ca mici mici

26679
20:52:50,480 --> 20:52:59,832
funcția. Vom folosi forma de punct DF.

26680
20:52:55,600 --> 20:53:04,080
Corect? Deci avem 1087 de rânduri și 56

26681
20:52:59,832 --> 20:53:06,960
coloane din setul nostru de date. Bine. Apoi noi

26682
20:53:04,080 --> 20:53:09,960
va vedea df.hat

26683
20:53:06,960 --> 20:53:09,960
cinci.

26684
20:53:10,400 --> 20:53:15,832
Deci df do.head înseamnă că îmi va da top

26685
20:53:13,440 --> 20:53:19,512
cinci rânduri din setul meu de date. Bine. Poți

26686
20:53:15,832 --> 20:53:23,440
vezi 1 2 3 4 5. Bine. Cinci rânduri și 56

26687
20:53:19,512 --> 20:53:26,000
coloane. Aici coloana 56, dar avem 1087

26688
20:53:23,440 --> 20:53:28,080
rânduri. Bine. Deci avem un nume de coaster,

26689
20:53:26,000 --> 20:53:30,640
lungime, viteză, locație, stare, deschidere

26690
20:53:28,080 --> 20:53:34,080
data, tip, asta, asta, asta, asta.

26691
20:53:30,640 --> 20:53:36,320
Bine, vom face

26692
20:53:34,080 --> 20:53:39,440
știi că vom face niște grafice folosind

26693
20:53:36,320 --> 20:53:42,480
aceasta aceste coloane. Bine, și există

26694
20:53:39,440 --> 20:53:45,680
încă unul df.tail

26695
20:53:42,480 --> 20:53:48,552
din nou ultimele cinci rânduri. Deci df.tail dă

26696
20:53:45,680 --> 20:53:53,920
tu ultimele cinci rânduri. Vezi 1086

26697
20:53:48,552 --> 20:53:59,280
1085. Bine. Și dacă vrei să vezi

26698
20:53:53,920 --> 20:54:04,720
datele complete, sunt aici. Bine. 0 la 108.

26699
20:53:59,280 --> 20:54:07,440
Bine. Da. Deci mai avem un document df

26700
20:54:04,720 --> 20:54:09,832
coloane de verificat

26701
20:54:07,440 --> 20:54:11,920
toate coloanele.

26702
20:54:09,832 --> 20:54:14,800
Vezi numele coastei, terenul, viteza,

26703
20:54:11,920 --> 20:54:18,000
locație, stare, data deschiderii, tip și

26704
20:54:14,800 --> 20:54:22,080
toate acestea sunt numele coloanelor mele. Amenda. Deci

26705
20:54:18,000 --> 20:54:24,960
mai avem încă un tip de date. De fapt noi

26706
20:54:22,080 --> 20:54:27,600
am multe tipuri de date, dar permiteți-mă

26707
20:54:24,960 --> 20:54:31,120
să-ți arăți unele importante sau poți

26708
20:54:27,600 --> 20:54:33,920
spune câteva elemente de bază pe unul. Bine. Deci DF

26709
20:54:31,120 --> 20:54:35,920
tipuri de puncte D. Dypes înseamnă tipuri de date.

26710
20:54:33,920 --> 20:54:39,600
Numele coasterului este lungimea tipului de obiect

26711
20:54:35,920 --> 20:54:43,040
obiectul și inversarea este float. Bine.

26712
20:54:39,600 --> 20:54:45,280
Vom verifica inversia.

26713
20:54:43,040 --> 20:54:47,680
Unde este inversiunea? Da tip plutitor.

26714
20:54:45,280 --> 20:54:50,640
bine,

26715
20:54:47,680 --> 20:54:54,800
atunci totul este obiect și eer

26716
20:54:50,640 --> 20:54:58,160
introduce int unu numeric si latitudine

26717
20:54:54,800 --> 20:55:01,440
plutire. Bine, deci practic avem trei

26718
20:54:58,160 --> 20:55:05,600
tipurile float, int și object.

26719
20:55:01,440 --> 20:55:10,760
Bine, atunci ce vom face? Hai doar

26720
20:55:05,600 --> 20:55:10,760
verificați rapid această descriere.

26721
20:55:11,360 --> 20:55:17,280
Bine. Deci, care este numărul de asta

26722
20:55:14,960 --> 20:55:22,000
inversare 932?

26723
20:55:17,280 --> 20:55:24,872
Bine. Nu va include niciunul, știți ce

26724
20:55:22,000 --> 20:55:27,192
este celule goale. Bine. Nu va conta

26725
20:55:24,872 --> 20:55:29,512
celule goale. Corect. Adică asta

26726
20:55:27,192 --> 20:55:33,832
un anumit tabel, apoi abaterea standard

26727
20:55:29,512 --> 20:55:36,400
atunci valoarea medie minimă 25% 70% 75% și

26728
20:55:33,832 --> 20:55:40,552
max. Vă va descrie toate acestea.

26729
20:55:36,400 --> 20:55:45,440
Bine. Și mai există o informație df.info

26730
20:55:40,552 --> 20:55:49,512
pentru a obține informațiile. Vezi numele coasterului 1087

26731
20:55:45,440 --> 20:55:52,960
valoare obiect non-null apoi lungimea 953

26732
20:55:49,512 --> 20:55:55,920
nul. Bine. Ca aceasta.

26733
20:55:52,960 --> 20:55:58,240
Da. Deci acum mergem mai departe ceea ce vom face

26734
20:55:55,920 --> 20:56:00,320
face? Vom face pregătirea datelor. Bine.

26735
20:55:58,240 --> 20:56:02,720
Ceea ce vine în pregătirea datelor, cum ar fi

26736
20:56:00,320 --> 20:56:05,192
eliminarea coloanelor și rândurilor irelevante

26737
20:56:02,720 --> 20:56:07,440
pe care nu le dorim. Bine. Apoi al doilea

26738
20:56:05,192 --> 20:56:10,640
lucru este identificarea coloanelor duplicate.

26739
20:56:07,440 --> 20:56:13,040
Apoi, al treilea este redenumirea coloanelor.

26740
20:56:10,640 --> 20:56:15,192
Apoi vom face câteva creații de caracteristici,

26741
20:56:13,040 --> 20:56:18,480
nu?

26742
20:56:15,192 --> 20:56:20,552
Deci, dacă vrei să arunci o coloană, bine,

26743
20:56:18,480 --> 20:56:23,680
cum poti scapa?

26744
20:56:20,552 --> 20:56:28,480
Deci trebuie să scrieți doar df dot drop.

26745
20:56:23,680 --> 20:56:30,720
Mai întâi voi da aici date despre cerb

26746
20:56:28,480 --> 20:56:33,512
repage.

26747
20:56:30,720 --> 20:56:36,800
Bine. Da. Deci, cum puteți renunța la un

26748
20:56:33,512 --> 20:56:40,872
coloana? Bine. DF.

26749
20:56:36,800 --> 20:56:43,680
Atunci aici voi scrie

26750
20:56:40,872 --> 20:56:46,680
deschidere

26751
20:56:43,680 --> 20:56:46,680
data=

26752
20:56:47,832 --> 20:56:52,720
la 1.

26753
20:56:50,640 --> 20:56:57,480
Bine.

26754
20:56:52,720 --> 20:56:57,480
Deschidere. Bine. X greșește.

26755
20:56:58,800 --> 20:57:03,600
În loc de asta

26756
20:57:01,280 --> 20:57:06,872
poate care este data deschiderii? Bine. O

26757
20:57:03,600 --> 20:57:06,872
este capitala aici.

26758
20:57:08,640 --> 20:57:14,160
În loc de aceasta, puteți folosi dublu

26759
20:57:11,192 --> 20:57:18,240
egal cu

26760
20:57:14,160 --> 20:57:21,120
bine axa nu este definită.

26761
20:57:18,240 --> 20:57:26,080
răul meu. Deci ce trebuie să faci? ai

26762
20:57:21,120 --> 20:57:29,512
să dau asta aici și da.

26763
20:57:26,080 --> 20:57:35,600
Bine. Următorul nu este definit.

26764
20:57:29,512 --> 20:57:38,160
Da. Amenda. Bine. Deci, după cum puteți vedea aici

26765
20:57:35,600 --> 20:57:41,040
mai întâi vă voi arăta acest nume de întrebare

26766
20:57:38,160 --> 20:57:44,872
lungimea viteză starea locației și deschiderea

26767
20:57:41,040 --> 20:57:48,240
data este bine.

26768
20:57:44,872 --> 20:57:50,720
Deci, dacă veți merge aici numele întrebării

26769
20:57:48,240 --> 20:57:53,120
lungime viteza locație stare nimic

26770
20:57:50,720 --> 20:57:56,552
data deschiderii este acolo, așa că asta este

26771
20:57:53,120 --> 20:58:00,160
cum poți scăpa o masă amendă pentru a

26772
20:57:56,552 --> 20:58:02,160
în timp ce fac asta ca un comentariu poate

26773
20:58:00,160 --> 20:58:04,800
în viitor

26774
20:58:02,160 --> 20:58:08,480
viitoare, știi să fac un grafic

26775
20:58:04,800 --> 20:58:11,600
Lasă asta bine, așa că da, așa că voi scrie

26776
20:58:08,480 --> 20:58:14,600
aici df este egal cu

26777
20:58:11,600 --> 20:58:14,600
df

26778
20:58:14,872 --> 20:58:21,760
numele posterului,

26779
20:58:17,512 --> 20:58:24,872
virgulă, locație

26780
20:58:21,760 --> 20:58:27,120
apoi virgula

26781
20:58:24,872 --> 20:58:30,960
starea.

26782
20:58:27,120 --> 20:58:34,640
Apoi aici voi scrie producător.

26783
20:58:30,960 --> 20:58:38,680
Amenda. Apoi din nou virgulă.

26784
20:58:34,640 --> 20:58:38,680
Atunci voi da aici.

26785
20:58:38,800 --> 20:58:42,680
Bine. Anul

26786
20:58:42,800 --> 20:58:46,720
introdus

26787
20:58:45,040 --> 20:58:48,720
apoi

26788
20:58:46,720 --> 20:58:50,800
virgulă

26789
20:58:48,720 --> 20:58:52,720
latitudine.

26790
20:58:50,800 --> 20:58:55,760
Stai, o să-ți spun de ce fac asta.

26791
20:58:52,720 --> 20:58:58,240
Apoi longitudinea

26792
20:58:55,760 --> 20:59:01,240
latitudine longitudine

26793
20:58:58,240 --> 20:59:01,240
apoi

26794
20:59:03,040 --> 20:59:06,440
tip main.

26795
20:59:07,120 --> 20:59:13,320
Bine. Apoi

26796
20:59:10,320 --> 20:59:13,320
deschidere

26797
20:59:13,360 --> 20:59:18,832
data

26798
20:59:15,832 --> 20:59:18,832
curat.

26799
20:59:19,360 --> 20:59:25,360
Amenda.

26800
20:59:21,600 --> 20:59:29,120
Apoi viteză în

26801
20:59:25,360 --> 20:59:31,680
m/ oră r

26802
20:59:29,120 --> 20:59:37,240
viteza

26803
20:59:31,680 --> 20:59:37,240
si virgula ce altceva atunci

26804
20:59:38,000 --> 20:59:42,400
înălțime

26805
20:59:40,000 --> 20:59:45,360
piciorului

26806
20:59:42,400 --> 20:59:48,360
inversiune

26807
20:59:45,360 --> 20:59:48,360
curat

26808
20:59:49,920 --> 20:59:52,320
geforce

26809
20:59:52,872 --> 21:00:02,720
copie cu puncte curate. Da.

26810
20:59:58,800 --> 21:00:05,600
Deci aici voi scrie bine

26811
21:00:02,720 --> 21:00:10,080
introduceți

26812
21:00:05,600 --> 21:00:12,000
bine, încă o greșeală este aici

26813
21:00:10,080 --> 21:00:15,760
bine.

26814
21:00:12,000 --> 21:00:19,800
Deci acum ce voi face

26815
21:00:15,760 --> 21:00:19,800
Voi scrie aici deschiderea

26816
21:00:22,080 --> 21:00:29,360
data

26817
21:00:24,240 --> 21:00:32,640
curat este egal cu PD2

26818
21:00:29,360 --> 21:00:35,640
punct data ora

26819
21:00:32,640 --> 21:00:35,640
DF

26820
21:00:36,640 --> 21:00:40,872
deschidere

26821
21:00:38,720 --> 21:00:44,080
data

26822
21:00:40,872 --> 21:00:47,800
Curata bine.

26823
21:00:44,080 --> 21:00:47,800
Ce s-a întâmplat?

26824
21:00:50,080 --> 21:00:58,080
Deci, ce face acest PD pentru a face ora dată?

26825
21:00:54,640 --> 21:01:01,280
Bine. Deci convertește argumentul în date

26826
21:00:58,080 --> 21:01:04,080
ora data ora. Bine. Deci această funcție

26827
21:01:01,280 --> 21:01:06,640
știi că poți spune că convertește un scalar

26828
21:01:04,080 --> 21:01:08,800
matrice sau serie sau cadru de date

26829
21:01:06,640 --> 21:01:12,080
dicționar ca la un panda datetime

26830
21:01:08,800 --> 21:01:15,832
obiect. Bine.

26831
21:01:12,080 --> 21:01:17,680
Deci acum să redenumim coloanele.

26832
21:01:15,832 --> 21:01:23,192
Bine.

26833
21:01:17,680 --> 21:01:26,872
Atunci să știi pentru lucruri mai bune DF

26834
21:01:23,192 --> 21:01:31,640
este egal cu redenumirea punctului DF

26835
21:01:26,872 --> 21:01:31,640
coloane egal cu

26836
21:01:32,240 --> 21:01:37,512
poster

26837
21:01:34,160 --> 21:01:39,920
nume. Apoi

26838
21:01:37,512 --> 21:01:42,920
poster

26839
21:01:39,920 --> 21:01:42,920
nume,

26840
21:01:45,120 --> 21:01:48,120
an

26841
21:01:48,320 --> 21:01:54,000
introdus atunci

26842
21:01:51,920 --> 21:01:55,680
aici

26843
21:01:54,000 --> 21:01:58,320
introdus.

26844
21:01:55,680 --> 21:02:03,240
Bine.

26845
21:01:58,320 --> 21:02:03,240
Data deschiderii curat la

26846
21:02:05,280 --> 21:02:10,400
deschis

26847
21:02:08,000 --> 21:02:15,640
data.

26848
21:02:10,400 --> 21:02:15,640
Bine. Apoi voi scrie viteza

26849
21:02:16,960 --> 21:02:25,240
Apoi scriu majuscule viteză.

26850
21:02:26,320 --> 21:02:31,832
Am înţeles? Apoi

26851
21:02:30,320 --> 21:02:34,480
înălțime

26852
21:02:31,832 --> 21:02:38,360
în picior

26853
21:02:34,480 --> 21:02:38,360
O voi scrie ca

26854
21:02:41,680 --> 21:02:46,480
prinde 50.

26855
21:02:44,240 --> 21:02:48,552
Deci, de ce scriu asta pentru că asta este

26856
21:02:46,480 --> 21:02:52,000
o foarte bună practică ca profesionist

26857
21:02:48,552 --> 21:02:53,680
mod sau ca analist de date sau ca a

26858
21:02:52,000 --> 21:02:55,120
analist de afaceri, orice ai fi

26859
21:02:53,680 --> 21:02:59,280
lucrând la proiecte de învățare automată sau

26860
21:02:55,120 --> 21:03:02,640
oricare ar fi aceasta este o practică bună.

26861
21:02:59,280 --> 21:03:05,720
Bine. Deci inverions

26862
21:03:02,640 --> 21:03:05,720
în versiuni

26863
21:03:06,552 --> 21:03:11,280
curat

26864
21:03:08,240 --> 21:03:14,280
atunci ar trebui să fie ca

26865
21:03:11,280 --> 21:03:14,280
invers

26866
21:03:25,120 --> 21:03:29,120
bine.

26867
21:03:26,640 --> 21:03:33,360
Lasă-mă să o conduc.

26868
21:03:29,120 --> 21:03:36,552
Bine. Acum să verificăm coloana.

26869
21:03:33,360 --> 21:03:38,872
Da. Deci acum puteți vedea numele coloanei noastre

26870
21:03:36,552 --> 21:03:41,192
este schimbat.

26871
21:03:38,872 --> 21:03:46,040
Amenda.

26872
21:03:41,192 --> 21:03:46,040
Deci voi scrie acest na

26873
21:03:46,640 --> 21:03:50,832
sumă în puncte.

26874
21:03:51,120 --> 21:03:56,640
Deci, ce face acest lucru este o sumă de puncte? Deci

26875
21:03:54,480 --> 21:03:59,760
funcția is na returnează o valoare booleană

26876
21:03:56,640 --> 21:04:01,920
dintre voi știți adevărat dacă valoarea este n și

26877
21:03:59,760 --> 21:04:04,160
falsul altfel și funcția sumă

26878
21:04:01,920 --> 21:04:06,552
returnează suma valorilor adevărate care

26879
21:04:04,160 --> 21:04:10,552
egal cu numărul de n valori din

26880
21:04:06,552 --> 21:04:13,360
coloana. Deci aici avem zero și n aici

26881
21:04:10,552 --> 21:04:16,480
același statut 213

26882
21:04:13,360 --> 21:04:19,920
aici 217 5

26883
21:04:16,480 --> 21:04:25,760
înălțimea piciorului este de 916 bine, așa că acum ce avem

26884
21:04:19,920 --> 21:04:27,512
va face vom scrie aici df dot

26885
21:04:25,760 --> 21:04:31,512
locație

26886
21:04:27,512 --> 21:04:34,240
df dot duplicat

26887
21:04:31,512 --> 21:04:35,832
ți-am spus la început

26888
21:04:34,240 --> 21:04:37,760
vom face

26889
21:04:35,832 --> 21:04:39,440
duplicat

26890
21:04:37,760 --> 21:04:41,280
Bine.

26891
21:04:39,440 --> 21:04:47,120
Deci, numele întrebării, locația, starea,

26892
21:04:41,280 --> 21:04:50,080
om. Bine. Este duplicat acum. Bine.

26893
21:04:47,120 --> 21:04:52,872
Deci, acum ce vom face? voi verifica

26894
21:04:50,080 --> 21:04:56,160
duplicate pentru numele coasterului. Deci, tu

26895
21:04:52,872 --> 21:04:58,720
poate scrie df. Loc

26896
21:04:56,160 --> 21:05:01,440
apoi df

26897
21:04:58,720 --> 21:05:06,240
df dot

26898
21:05:01,440 --> 21:05:08,640
duplicat și submult este egal cu

26899
21:05:06,240 --> 21:05:14,640
poster

26900
21:05:08,640 --> 21:05:18,640
nume apoi punct cap. Bine. Cap de cinci.

26901
21:05:14,640 --> 21:05:21,680
Acum toată lumea știe ce face

26902
21:05:18,640 --> 21:05:26,480
ce face acest cap.

26903
21:05:21,680 --> 21:05:30,480
Bine. Da. Deci aici le puteți vedea așadar

26904
21:05:26,480 --> 21:05:32,000
sunt duplicate în regulă ale numelui întrebării

26905
21:05:30,480 --> 21:05:33,680
corect.

26906
21:05:32,000 --> 21:05:35,600
De ce? pentru că poți doar să verifici

26907
21:05:33,680 --> 21:05:39,512
tastarea

26908
21:05:35,600 --> 21:05:42,552
si toate. Amenda. Deci acum verific cu un

26909
21:05:39,512 --> 21:05:46,440
exemplu duplicat. Să verificăm

26910
21:05:42,552 --> 21:05:46,440
interogare punct

26911
21:05:47,760 --> 21:05:51,240
numele intrebarii

26912
21:05:53,832 --> 21:06:00,800
cristal.

26913
21:05:56,240 --> 21:06:03,512
Acum veți obține fiecare ciclon egal.

26914
21:06:00,800 --> 21:06:05,192
Bine. Am luat acest cifru cristal B.

26915
21:06:03,512 --> 21:06:09,040
Amenda.

26916
21:06:05,192 --> 21:06:12,160
Apoi rulează-l. Deci acum puteți vedea 39 și

26917
21:06:09,040 --> 21:06:14,240
43 sunt la fel.

26918
21:06:12,160 --> 21:06:17,512
Bine. Totul este la fel. Deci acesta este

26919
21:06:14,240 --> 21:06:19,832
duplicat. Deci acum ce voi face? o voi face

26920
21:06:17,512 --> 21:06:24,800
scrie aici. Lasă-mă să las puțin spațiu.

26921
21:06:19,832 --> 21:06:29,040
Da. Coloane cu puncte DF.

26922
21:06:24,800 --> 21:06:32,160
Atunci voi scrie aici DF

26923
21:06:29,040 --> 21:06:35,120
locația punctului.

26924
21:06:32,160 --> 21:06:38,120
Apoi TF punct

26925
21:06:35,120 --> 21:06:38,120
duplicat

26926
21:06:39,440 --> 21:06:43,920
subset

26927
21:06:41,120 --> 21:06:46,800
întrebare

26928
21:06:43,920 --> 21:06:48,720
nume

26929
21:06:46,800 --> 21:06:51,720
apoi

26930
21:06:48,720 --> 21:06:51,720
locație

26931
21:06:52,000 --> 21:06:55,000
apoi

26932
21:06:56,480 --> 21:07:00,640
deschidere

26933
21:06:58,800 --> 21:07:02,960
data.

26934
21:07:00,640 --> 21:07:04,640
Bine.

26935
21:07:02,960 --> 21:07:07,680
punct

26936
21:07:04,640 --> 21:07:09,832
d set

26937
21:07:07,680 --> 21:07:12,320
index

26938
21:07:09,832 --> 21:07:15,320
apoi arunca asta.

26939
21:07:12,320 --> 21:07:15,320
Bine.

26940
21:07:18,000 --> 21:07:21,920
Așa că acum ce vom face, vom face ceva

26941
21:07:19,832 --> 21:07:24,080
înțelegerea caracteristicilor.

26942
21:07:21,920 --> 21:07:26,480
Bine.

26943
21:07:24,080 --> 21:07:29,480
Așa că acum vom face o funcție

26944
21:07:26,480 --> 21:07:29,480
înţelegere.

26945
21:07:32,872 --> 21:07:37,040
Bine.

26946
21:07:34,480 --> 21:07:39,760
Deci, în aceasta vom reprezenta o caracteristică

26947
21:07:37,040 --> 21:07:44,920
distribuție ca histograma KD box plot.

26948
21:07:39,760 --> 21:07:44,920
Bine. Pentru asta voi scrie aici DF

26949
21:07:45,120 --> 21:07:48,920
an introdus.

26950
21:07:49,360 --> 21:07:54,680
Bine. Apoi voi scrie valoare

26951
21:07:54,720 --> 21:08:01,440
numără.

26952
21:07:56,800 --> 21:08:04,080
Deci acum ce voi face? Să creăm bara

26953
21:08:01,440 --> 21:08:08,760
grafic. Bine.

26954
21:08:04,080 --> 21:08:08,760
Axe goluri la der

26955
21:08:10,480 --> 21:08:16,080
introdus punct

26956
21:08:13,760 --> 21:08:21,040
valoare

26957
21:08:16,080 --> 21:08:26,192
conteaza. Bine. Apoi punct

26958
21:08:21,040 --> 21:08:26,192
adăugați 10 max. am nevoie

26959
21:08:27,120 --> 21:08:38,080
apoi dot plot fel este egal cu Am nevoie de bar

26960
21:08:33,920 --> 21:08:40,480
atunci titlul este top

26961
21:08:38,080 --> 21:08:43,360
Scriu ce ce ce ar trebui să dăm

26962
21:08:40,480 --> 21:08:45,360
top 10

26963
21:08:43,360 --> 21:08:49,120
ani

26964
21:08:45,360 --> 21:08:53,040
coasterele introduse.

26965
21:08:49,120 --> 21:08:59,120
Bine, atunci

26966
21:08:53,040 --> 21:09:05,552
Voi scrie aici ex dot set

26967
21:08:59,120 --> 21:09:05,552
eticheta X. Atunci voi scrie aici

26968
21:09:06,320 --> 21:09:14,080
introdus.

26969
21:09:09,192 --> 21:09:18,360
Bine. Atunci voi scrie aici ex dot

26970
21:09:14,080 --> 21:09:18,360
setați eticheta Y.

26971
21:09:18,720 --> 21:09:24,480
decât

26972
21:09:20,720 --> 21:09:27,280
numără. Bine, lasă-mă să o execut. bine,

26973
21:09:24,480 --> 21:09:28,872
caracter neașteptat după rând

26974
21:09:27,280 --> 21:09:31,872
continuarea.

26975
21:09:28,872 --> 21:09:31,872
bine,

26976
21:09:33,440 --> 21:09:39,040
putem elimina asta

26977
21:09:36,080 --> 21:09:42,000
intenție neașteptată.

26978
21:09:39,040 --> 21:09:46,000
Acum lasă-mă să o execut. Da, deci acesta este al nostru

26979
21:09:42,000 --> 21:09:49,920
bar plot. Bine. Deci, așa poți

26980
21:09:46,000 --> 21:09:53,440
creați grafic cu bare folosind datele dvs. Bine.

26981
21:09:49,920 --> 21:09:55,512
Deci, un complot de bar este că știi unul dintre

26982
21:09:53,440 --> 21:09:58,480
cele mai comune tipuri de grafică în aceasta

26983
21:09:55,512 --> 21:10:00,640
vizualizarea datelor sau EDA. Arată

26984
21:09:58,480 --> 21:10:03,832
relația dintre un numeric și cel

26985
21:10:00,640 --> 21:10:07,440
variabilă categorială. Bine. Deci fiecare

26986
21:10:03,832 --> 21:10:10,240
entitatea acestei variabile categorice este

26987
21:10:07,440 --> 21:10:15,512
reprezentat ca un bar.

26988
21:10:10,240 --> 21:10:19,760
Am înţeles? Așa că acum hai să mai facem ceva. Deci

26989
21:10:15,512 --> 21:10:21,280
ce hai să facem o clasă de stogramă.

26990
21:10:19,760 --> 21:10:23,440
bine,

26991
21:10:21,280 --> 21:10:26,720
histogramă.

26992
21:10:23,440 --> 21:10:31,040
Deci pentru asta voi scrie

26993
21:10:26,720 --> 21:10:33,600
a ex = to df

26994
21:10:31,040 --> 21:10:37,832
viteza

26995
21:10:33,600 --> 21:10:42,480
r apoi complotează

26996
21:10:37,832 --> 21:10:42,480
fel este egal cu

26997
21:10:44,160 --> 21:10:53,192
Atunci virgulă, voi scrie coșuri aici. Bine.

26998
21:10:48,480 --> 21:10:55,280
Coșuri este egală cu 20

26999
21:10:53,192 --> 21:10:58,280
apoi

27000
21:10:55,280 --> 21:10:58,280
titlu

27001
21:10:58,320 --> 21:11:01,512
coaster

27002
21:10:59,832 --> 21:11:06,160
viteza.

27003
21:11:01,512 --> 21:11:09,192
Bine. metru pe oră apoi AX

27004
21:11:06,160 --> 21:11:12,512
set de puncte

27005
21:11:09,192 --> 21:11:12,512
Nivelul X

27006
21:11:12,720 --> 21:11:18,960
viteza

27007
21:11:15,192 --> 21:11:22,320
bine, am uitat să dau asta

27008
21:11:18,960 --> 21:11:24,160
bine, deci se afișează histograma

27009
21:11:22,320 --> 21:11:28,000
date numerice prin gruparea datelor în

27010
21:11:24,160 --> 21:11:30,720
coșuri de lățime egală, așa că aici este fiecare coș

27011
21:11:28,000 --> 21:11:32,800
trasat ca o bară a cărei înălțime corespunde

27012
21:11:30,720 --> 21:11:35,440
la câte puncte de date sunt în acel

27013
21:11:32,800 --> 21:11:36,872
coșul de gunoi? Deci, coșurile pe care le puteți spune că sunt și ele

27014
21:11:35,440 --> 21:11:39,920
numite uneori intervalele sau

27015
21:11:36,872 --> 21:11:42,000
clase sau găleți. Practic

27016
21:11:39,920 --> 21:11:44,960
este la fel.

27017
21:11:42,000 --> 21:11:46,872
Așa că aici pentru asta este coșul de gunoi.

27018
21:11:44,960 --> 21:11:50,320
Pentru asta este un coș de gunoi. Aceasta este

27019
21:11:46,872 --> 21:11:55,680
asa. Bine.

27020
21:11:50,320 --> 21:12:00,240
Deci acum să creăm un diagramă KD. Deci pentru asta

27021
21:11:55,680 --> 21:12:04,552
este foarte simplu. Ax = la DF.

27022
21:12:00,240 --> 21:12:08,440
Atunci pot scrie ca viteza în mine a lui R

27023
21:12:04,552 --> 21:12:08,440
apoi complotează

27024
21:12:08,480 --> 21:12:11,480
cam

27025
21:12:13,040 --> 21:12:21,120
apoi titlul

27026
21:12:16,240 --> 21:12:23,360
Pot scrie coasterul

27027
21:12:21,120 --> 21:12:27,832
viteza

27028
21:12:23,360 --> 21:12:30,160
apoi ex dot set

27029
21:12:27,832 --> 21:12:30,160
X

27030
21:12:30,872 --> 21:12:35,680
viteza

27031
21:12:33,760 --> 21:12:39,600
poate.

27032
21:12:35,680 --> 21:12:42,800
Da. Deci, KD, ce înseamnă KD? A

27033
21:12:39,600 --> 21:12:45,280
estimarea densității nucleului. Acest complot este un

27034
21:12:42,800 --> 21:12:47,360
metoda, știți, de vizualizare a

27035
21:12:45,280 --> 21:12:51,280
distribuția observației într-o dată

27036
21:12:47,360 --> 21:12:53,760
setați analog la o stolă. Deci, KD reprezintă

27037
21:12:51,280 --> 21:12:57,280
datele folosind o probabilitate continuă

27038
21:12:53,760 --> 21:12:59,680
curba de densitate într-una sau mai multe dimensiuni.

27039
21:12:57,280 --> 21:13:03,360
Bine. Într-una sau mai multe dimensiuni care

27040
21:12:59,680 --> 21:13:05,832
curba bine. Deci acum hai să facem o caracteristică

27041
21:13:03,360 --> 21:13:08,000
relație. Deci în asta vom face

27042
21:13:05,832 --> 21:13:10,640
graficul de dispersie, corelarea hărții termice și

27043
21:13:08,000 --> 21:13:13,832
complot pereche. Bine. Sau putem face și noi ceva

27044
21:13:10,640 --> 21:13:16,552
grup prin comparație. Amenda. Deci acum haideți

27045
21:13:13,832 --> 21:13:22,872
prima face

27046
21:13:16,552 --> 21:13:25,680
diagramă de dispersie. Bine. Deci, df dot plot

27047
21:13:22,872 --> 21:13:27,192
fel este egal cu

27048
21:13:25,680 --> 21:13:28,872
împrăștiați

27049
21:13:27,192 --> 21:13:31,440
virgulă

27050
21:13:28,872 --> 21:13:32,960
x = la

27051
21:13:31,440 --> 21:13:35,280
viteza

27052
21:13:32,960 --> 21:13:39,360
m/ oră

27053
21:13:35,280 --> 21:13:42,240
virgula y = to

27054
21:13:39,360 --> 21:13:44,480
inaltime in picior.

27055
21:13:42,240 --> 21:13:48,160
Amenda.

27056
21:13:44,480 --> 21:13:52,640
Apoi virgulă să dăm titlul

27057
21:13:48,160 --> 21:13:54,400
este egală cu viteza coasterului

27058
21:13:52,640 --> 21:13:56,640
versus

27059
21:13:54,400 --> 21:14:01,552
înălțime.

27060
21:13:56,640 --> 21:14:01,552
Bine, atunci pl face

27061
21:14:02,240 --> 21:14:08,400
bine, există o eroare

27062
21:14:05,040 --> 21:14:12,240
contor de viteză pe oră. Bine. Bine. S

27063
21:14:08,400 --> 21:14:14,160
ar trebui să fie capital și H ar trebui să fie

27064
21:14:12,240 --> 21:14:16,240
capital.

27065
21:14:14,160 --> 21:14:19,760
Da.

27066
21:14:16,240 --> 21:14:22,720
Deci aceasta este viteza graficului de dispersie versus

27067
21:14:19,760 --> 21:14:26,640
înălțime. Aceasta este o viteză versus înălțime.

27068
21:14:22,720 --> 21:14:29,600
Bine. Dacă pot vedea aici înălțimea este

27069
21:14:26,640 --> 21:14:31,440
direct proporțională oarecum cu viteza

27070
21:14:29,600 --> 21:14:33,512
pentru că dacă poți vedea 350 este

27071
21:14:31,440 --> 21:14:36,480
viteza mai mica decat

27072
21:14:33,512 --> 21:14:38,640
120 km/h. Nu, nu este așa. Bine

27073
21:14:36,480 --> 21:14:41,360
bine.

27074
21:14:38,640 --> 21:14:43,280
Deci o diagramă de dispersie identifică

27075
21:14:41,360 --> 21:14:44,872
posibilă relație între schimbare

27076
21:14:43,280 --> 21:14:47,192
observate în două seturi diferite de

27077
21:14:44,872 --> 21:14:49,440
variabilă. Aici variabilele sunt înălțimea

27078
21:14:47,192 --> 21:14:51,920
si viteza. Bine. Acesta oferă o

27079
21:14:49,440 --> 21:14:53,440
vizual și estetic uh știi că înseamnă

27080
21:14:51,920 --> 21:14:59,120
pentru a testa puterea relației

27081
21:14:53,440 --> 21:15:02,000
între două variabile. Amenda. Acum hai

27082
21:14:59,120 --> 21:15:06,320
bine acum hai să mai facem unul să ți-o dăm

27083
21:15:02,000 --> 21:15:11,680
idee mai buna. Bine cu legenda.

27084
21:15:06,320 --> 21:15:15,760
Acum voi aștepta SNS dot scatter

27085
21:15:11,680 --> 21:15:18,720
grafic apoi x = la

27086
21:15:15,760 --> 21:15:21,720
viteza

27087
21:15:18,720 --> 21:15:21,720
r

27088
21:15:22,320 --> 21:15:26,192
y = to

27089
21:15:27,760 --> 21:15:34,960
înălțimea în picior

27090
21:15:32,080 --> 21:15:38,240
orice ai putea spune, atunci nuanța va fi

27091
21:15:34,960 --> 21:15:41,240
acolo anul

27092
21:15:38,240 --> 21:15:41,240
introdus.

27093
21:15:41,440 --> 21:15:52,680
Bine. Atunci datele sunt egale cu DF.

27094
21:15:47,280 --> 21:15:52,680
Apoi ex= pentru a seta titlul.

27095
21:15:53,280 --> 21:15:58,080
Setează titlul. Apoi

27096
21:15:56,160 --> 21:16:01,192
coaster

27097
21:15:58,080 --> 21:16:03,040
viteza versus

27098
21:16:01,192 --> 21:16:07,192
înălțime.

27099
21:16:03,040 --> 21:16:08,720
apoi plt dot show.

27100
21:16:07,192 --> 21:16:11,600
Da.

27101
21:16:08,720 --> 21:16:14,480
Deci acum poți vedea

27102
21:16:11,600 --> 21:16:17,280
deci această culoare știi culoarea deschisă I

27103
21:16:14,480 --> 21:16:20,480
mă lasă să măresc. Bine. Deci culoarea asta

27104
21:16:17,280 --> 21:16:23,760
avem câteva aici care sunt introduse

27105
21:16:20,480 --> 21:16:26,640
în anii '90. Bine. Și această culoare care sunt

27106
21:16:23,760 --> 21:16:30,320
introdus în 1925 şi aceste culoare care

27107
21:16:26,640 --> 21:16:32,960
sunt introduse în 2000. Bine. Deci poți

27108
21:16:30,320 --> 21:16:37,512
vezi si asa.

27109
21:16:32,960 --> 21:16:40,080
Așa că acum să facem un diagramă de perechi. Bine, este

27110
21:16:37,512 --> 21:16:44,320
arata uimitor.

27111
21:16:40,080 --> 21:16:51,160
Deci, lasă-mă să scriu punct SNS

27112
21:16:44,320 --> 21:16:51,160
graficul perechilor de puncte apoi virgula TF

27113
21:16:51,832 --> 21:16:57,832
variabila este egală cu I need

27114
21:16:56,240 --> 21:17:01,760
introduce

27115
21:16:57,832 --> 21:17:04,960
apoi viteza

27116
21:17:01,760 --> 21:17:09,760
metru pe R

27117
21:17:04,960 --> 21:17:13,512
virgula S ar trebui să fie înălțimea majusculei

27118
21:17:09,760 --> 21:17:15,920
picior. Amintește-ți doar ortografia, bine?

27119
21:17:13,512 --> 21:17:18,720
Este sensibil la majuscule.

27120
21:17:15,920 --> 21:17:21,512
Inversiunea

27121
21:17:18,720 --> 21:17:26,360
inversiuni, virgula,

27122
21:17:21,512 --> 21:17:26,360
inversiuni, virgula, geforce.

27123
21:17:26,800 --> 21:17:36,320
Bine. Virgulă. U voi pune ce? Ce?

27124
21:17:30,872 --> 21:17:37,920
Ce? Ce? Bine. Voi pune tip

27125
21:17:36,320 --> 21:17:42,720
principal.

27126
21:17:37,920 --> 21:17:46,480
Bine, atunci pl face

27127
21:17:42,720 --> 21:17:48,800
bine, lasă-mă să-l rulez, bine este o eroare

27128
21:17:46,480 --> 21:17:51,440
acolo

27129
21:17:48,800 --> 21:17:55,320
an introdus

27130
21:17:51,440 --> 21:17:55,320
y capital

27131
21:17:55,360 --> 21:18:01,760
hai să spunem aici, deci de aceea spun

27132
21:17:58,640 --> 21:18:04,320
amintește-ți din nou ortografia corectă

27133
21:18:01,760 --> 21:18:10,832
unii

27134
21:18:04,320 --> 21:18:10,832
eroarea în versiuni este versiunea.

27135
21:18:11,440 --> 21:18:18,512
Acum lasă-mă să o execut.

27136
21:18:14,240 --> 21:18:18,512
Bine. Din nou unii

27137
21:18:21,040 --> 21:18:28,480
ce inversiuni?

27138
21:18:23,512 --> 21:18:31,280
Bine. Lasă-mă să verific aici în timp ce redenumesc

27139
21:18:28,480 --> 21:18:33,512
numai inversiuni.

27140
21:18:31,280 --> 21:18:36,760
Bine. Amenda.

27141
21:18:33,512 --> 21:18:36,760
în versiuni.

27142
21:18:37,360 --> 21:18:44,240
Lasă-mă să introduc, dar nu se schimbă nimic. Lasă

27143
21:18:41,192 --> 21:18:48,440
verific din nou.

27144
21:18:44,240 --> 21:18:48,440
Bine, există o eroare.

27145
21:18:48,960 --> 21:18:54,320
Așteaptă. Deci da, puteți vedea că funcționează

27146
21:18:52,240 --> 21:18:58,400
bine.

27147
21:18:54,320 --> 21:19:00,480
Deci după asta ce voi face?

27148
21:18:58,400 --> 21:19:02,480
Deci, care este complotul perechilor? Deci complot pereche

27149
21:19:00,480 --> 21:19:05,120
funcția permite utilizatorului să vă cunoască

27150
21:19:02,480 --> 21:19:06,960
apoi o grilă de axe prin care fiecare

27151
21:19:05,120 --> 21:19:09,920
variabila numerică este stocată în date

27152
21:19:06,960 --> 21:19:12,320
este împărțit între x și y în regulă

27153
21:19:09,920 --> 21:19:14,800
coloana structurată.

27154
21:19:12,320 --> 21:19:17,680
Deci, așa vezi că știi că înseamnă

27155
21:19:14,800 --> 21:19:20,960
lemn altul și oțel acesta roșu este

27156
21:19:17,680 --> 21:19:24,800
lemn altul sau cel albastru si cel

27157
21:19:20,960 --> 21:19:26,872
violet sunt cele de oțel bine

27158
21:19:24,800 --> 21:19:31,040
format diferit, bine acum

27159
21:19:26,872 --> 21:19:35,760
să creăm ultimul grafic care este

27160
21:19:31,040 --> 21:19:39,440
Harta termică bine, lasă-mă să scriu df

27161
21:19:35,760 --> 21:19:43,800
corelația este egală cu df

27162
21:19:39,440 --> 21:19:43,800
aici prezentat,

27163
21:19:46,960 --> 21:19:52,920
virgula,

27164
21:19:48,720 --> 21:19:52,920
viteza m/a

27165
21:19:55,360 --> 21:19:59,440
înălțime

27166
21:19:57,440 --> 21:20:02,440
în picior

27167
21:19:59,440 --> 21:20:02,440
canoane,

27168
21:20:09,360 --> 21:20:14,120
virgulă

27169
21:20:10,800 --> 21:20:14,120
forța G

27170
21:20:15,120 --> 21:20:24,440
apoi

27171
21:20:16,872 --> 21:20:24,440
Aruncă apoi coaliția bine DFO

27172
21:20:29,680 --> 21:20:34,120
l-am prezentat pe I

27173
21:20:36,160 --> 21:20:41,512
capitala da

27174
21:20:39,040 --> 21:20:45,680
Deci, aceasta este valorile de corelație ale tuturor

27175
21:20:41,512 --> 21:20:47,440
lucrurile corecte. Deci acum să scriem SNS

27176
21:20:45,680 --> 21:20:50,480
punct

27177
21:20:47,440 --> 21:20:55,760
harta termică

27178
21:20:50,480 --> 21:20:59,360
harta termică TF C

27179
21:20:55,760 --> 21:21:01,760
nu va fi adevărat.

27180
21:20:59,360 --> 21:21:05,120
Bine.

27181
21:21:01,760 --> 21:21:07,360
Acum lasă-mă să o execut. Da. Deci pentru a crea

27182
21:21:05,120 --> 21:21:11,760
Harta termică în Python, astfel încât să puteți folosi aceasta.

27183
21:21:07,360 --> 21:21:13,760
Bine. Biblioteca de legături C pentru această hartă termică.

27184
21:21:11,760 --> 21:21:16,872
Deci, această funcție vă ia un cadru de date

27185
21:21:13,760 --> 21:21:20,480
cunoscut ca intrare și generează o hartă termică

27186
21:21:16,872 --> 21:21:22,720
tip de lucruri ca rezultat. Bine. Deci

27187
21:21:20,480 --> 21:21:26,872
acesta este modul în care puteți efectua EDA folosind

27188
21:21:22,720 --> 21:21:28,800
orice set de date sau vă puteți afișa datele

27189
21:21:26,872 --> 21:21:31,440
sau intuiții cu un frumos

27190
21:21:28,800 --> 21:21:34,640
reprezentare folosind grafice și toate asemenea

27191
21:21:31,440 --> 21:21:36,000
aceasta. Amenda. Web scraping este un puternic

27192
21:21:34,640 --> 21:21:38,872
tehnică care vă permite

27193
21:21:36,000 --> 21:21:40,720
extrage automat datele de pe site.

27194
21:21:38,872 --> 21:21:43,040
Întoarcerea cantității mari de informații

27195
21:21:40,720 --> 21:21:45,120
disponibil online în ceva ce poți

27196
21:21:43,040 --> 21:21:47,120
analiza și utilizarea cu ușurință. Fie că ești

27197
21:21:45,120 --> 21:21:48,720
culegerea de date pentru cercetare, construirea a

27198
21:21:47,120 --> 21:21:51,192
set de date pentru proiectul de învățare automată,

27199
21:21:48,720 --> 21:21:53,512
sau doar curios despre cum funcționează site-urile web

27200
21:21:51,192 --> 21:21:55,360
în culise. Web scraping este o

27201
21:21:53,512 --> 21:21:57,440
abilități esențiale pe care să le ai în tine

27202
21:21:55,360 --> 21:21:58,800
trusa de instrumente. Pe de altă parte, Python este

27203
21:21:57,440 --> 21:22:01,192
una dintre cele mai populare programe

27204
21:21:58,800 --> 21:22:03,280
limbi pentru web scraping datorită acestuia

27205
21:22:01,192 --> 21:22:05,040
simplitatea și bogăția bibliotecilor

27206
21:22:03,280 --> 21:22:07,512
disponibile. În acest videoclip, vom face

27207
21:22:05,040 --> 21:22:09,440
explorați cum să utilizați Python pentru a răzui datele

27208
21:22:07,512 --> 21:22:10,960
de pe site. Și ne vom scufunda în

27209
21:22:09,440 --> 21:22:13,360
exemple practice folosind Python

27210
21:22:10,960 --> 21:22:16,000
biblioteci ca cerere si frumos

27211
21:22:13,360 --> 21:22:17,920
supă pentru a prelua și analiza conținut web. Dar

27212
21:22:16,000 --> 21:22:20,160
nu este vorba doar de cod. Web

27213
21:22:17,920 --> 21:22:22,480
Scripping vine cu propriul set de

27214
21:22:20,160 --> 21:22:24,000
provocări și constituție etică. Noi

27215
21:22:22,480 --> 21:22:26,240
va vorbi despre cum să răzuiești

27216
21:22:24,000 --> 21:22:28,552
în mod responsabil, respectând regulile stabilite de

27217
21:22:26,240 --> 21:22:31,512
site-uri web și asigurându-vă că dvs. scraping

27218
21:22:28,552 --> 21:22:33,760
activitatea nu are un impact negativ asupra

27219
21:22:31,512 --> 21:22:35,512
site-urile de la care colectați date. Aşa

27220
21:22:33,760 --> 21:22:37,920
până la sfârșitul acestui videoclip, veți avea

27221
21:22:35,512 --> 21:22:40,480
o înțelegere solidă a modului de a începe

27222
21:22:37,920 --> 21:22:42,160
răzuirea datelor de pe web folosind Python.

27223
21:22:40,480 --> 21:22:43,832
Indiferent dacă sunteți nou în programare sau

27224
21:22:42,160 --> 21:22:45,760
caut să adăugați web scraping la dvs

27225
21:22:43,832 --> 21:22:47,440
set de aptitudini, acest videoclip vă va oferi

27226
21:22:45,760 --> 21:22:50,080
cunoștințele și instrumentele pe care trebuie să le obțineți

27227
21:22:47,440 --> 21:22:51,920
a început. Deci haideți să intrăm și să vedem cum

27228
21:22:50,080 --> 21:22:53,512
Python vă poate ajuta să deblocați complet

27229
21:22:51,920 --> 21:22:55,680
potenţialul web. Deci fără niciuna

27230
21:22:53,512 --> 21:22:57,680
mai departe, să începem. Deci aici

27231
21:22:55,680 --> 21:23:01,192
Folosesc această colaborare Google pentru

27232
21:22:57,680 --> 21:23:03,192
răzuire web. Bine. Poți să-l folosești pe al tău

27233
21:23:01,192 --> 21:23:06,320
precum Jupyter notebook, Visual Code

27234
21:23:03,192 --> 21:23:09,600
Studio, orice lucru. Bine. Deci aici voi

27235
21:23:06,320 --> 21:23:12,480
scrie răzuire

27236
21:23:09,600 --> 21:23:15,920
folosind Python.

27237
21:23:12,480 --> 21:23:19,040
Bine. Atunci aici mai întâi trebuie

27238
21:23:15,920 --> 21:23:22,960
instalați niște biblioteci precum

27239
21:23:19,040 --> 21:23:28,440
știi uh cerere

27240
21:23:22,960 --> 21:23:28,440
și trebuie să instalați frumos. Deci

27241
21:23:29,120 --> 21:23:35,040
trebuie să instalezi că știi panda

27242
21:23:33,040 --> 21:23:38,320
deoarece vom crea un cadru de date

27243
21:23:35,040 --> 21:23:42,640
și îl vom salva apoi vom verifica

27244
21:23:38,320 --> 21:23:44,800
datele noastre. Bine. Și puteți instala câteva

27245
21:23:42,640 --> 21:23:51,000
biblioteca de bază Python, cum ar fi numpy și tot

27246
21:23:44,800 --> 21:23:51,000
că. Bine. Deci aici voi importa mai întâi

27247
21:23:51,040 --> 21:23:59,440
cerere.

27248
21:23:53,360 --> 21:24:02,080
Bine. Apoi voi scrie de pe PS4

27249
21:23:59,440 --> 21:24:05,080
import

27250
21:24:02,080 --> 21:24:05,080
frumos

27251
21:24:06,960 --> 21:24:11,120
săpun.

27252
21:24:09,120 --> 21:24:12,800
Bine.

27253
21:24:11,120 --> 21:24:15,440
Deci

27254
21:24:12,800 --> 21:24:17,280
apoi voi scrie import

27255
21:24:15,440 --> 21:24:20,960
panda

27256
21:24:17,280 --> 21:24:24,640
ca plata.

27257
21:24:20,960 --> 21:24:27,280
Amenda. Atunci ce voi face acum? Bine

27258
21:24:24,640 --> 21:24:30,720
hai sa vedem care este aceasta cerere si tot

27259
21:24:27,280 --> 21:24:32,720
Solicitarea este o bibliotecă client HTTP

27260
21:24:30,720 --> 21:24:34,720
pentru limbajul de programare Python. Deci

27261
21:24:32,720 --> 21:24:37,440
cererea este una dintre cele mai multe pe care le cunoști

27262
21:24:34,720 --> 21:24:41,120
biblioteci Python descărcate. Bine. Este

27263
21:24:37,440 --> 21:24:44,000
ca mai mult ca peste 2.000 nu tocmai

27264
21:24:41,120 --> 21:24:46,720
2.000 scuze 200 sau 300 de milioane lunar

27265
21:24:44,000 --> 21:24:49,280
descărcare. Bine. Deci, ce face, hărtește

27266
21:24:46,720 --> 21:24:52,080
protocolul HTTP pe subiectul Python

27267
21:24:49,280 --> 21:24:54,872
semantică orientată. Și aici frumos

27268
21:24:52,080 --> 21:24:57,192
săpun. Deci

27269
21:24:54,872 --> 21:24:59,920
Ştiţi că SOAP este un pachet Python

27270
21:24:57,192 --> 21:25:02,000
analizarea documentelor HTML și XML

27271
21:24:59,920 --> 21:25:04,320
inclusiv cei cu tu cunoști malphone

27272
21:25:02,000 --> 21:25:06,720
marcare. Se creează un arbore de analiză pentru

27273
21:25:04,320 --> 21:25:10,400
documente cu care știți că obișnuiți

27274
21:25:06,720 --> 21:25:13,360
extrageți datele HTML din HTML care este

27275
21:25:10,400 --> 21:25:17,680
util pentru web scraping. Lasă-mă să o conduc

27276
21:25:13,360 --> 21:25:21,192
aici. Al doilea pas al nostru va fi

27277
21:25:17,680 --> 21:25:26,000
definiți adresa URL și anteturile. bine,

27278
21:25:21,192 --> 21:25:29,680
URL-ul și anteturile.

27279
21:25:26,000 --> 21:25:32,640
Deci URL-ul este ok de unde doriți

27280
21:25:29,680 --> 21:25:35,120
extrageți-vă datele. Deci voi scrie aici

27281
21:25:32,640 --> 21:25:37,920
pur si simplu invata

27282
21:25:35,120 --> 21:25:39,512
atunci e bine să deschidem acest PMP

27283
21:25:37,920 --> 21:25:44,800
certificare

27284
21:25:39,512 --> 21:25:48,360
da, așa că aici voi scrie asta

27285
21:25:44,800 --> 21:25:48,360
și anteturi

27286
21:25:48,480 --> 21:25:51,872
egal cu

27287
21:25:53,680 --> 21:26:00,552
deci acestea sunt anteturile bine, așa ca în

27288
21:25:57,760 --> 21:26:04,000
pe care îl cunoașteți pe dispozitiv sau pe care îl lucrați

27289
21:26:00,552 --> 21:26:06,960
pe ce browser lucrați. Deci

27290
21:26:04,000 --> 21:26:10,400
acestea sunt pentru anteturi. Deci acum ce

27291
21:26:06,960 --> 21:26:14,720
ce voi face, voi trimite o cerere de obținere

27292
21:26:10,400 --> 21:26:17,440
la pagina simplă. Bine la această adresă URL pentru

27293
21:26:14,720 --> 21:26:19,832
că știi bine, lasă-mă să scriu asta

27294
21:26:17,440 --> 21:26:23,600
trimitere

27295
21:26:19,832 --> 21:26:26,400
primi cerere.

27296
21:26:23,600 --> 21:26:28,552
Bine, aici scrieți răspunsul

27297
21:26:26,400 --> 21:26:30,640
egal cu

27298
21:26:28,552 --> 21:26:33,600
cerere

27299
21:26:30,640 --> 21:26:36,000
dot get

27300
21:26:33,600 --> 21:26:38,960
apoi URL

27301
21:26:36,000 --> 21:26:41,760
antete cu virgulă

27302
21:26:38,960 --> 21:26:45,600
egal cu antete.

27303
21:26:41,760 --> 21:26:49,760
Bine, lasă-mă să o execut. Bine, funcționează bine.

27304
21:26:45,600 --> 21:26:53,440
Deci acum hai să verificăm dacă cererea este

27305
21:26:49,760 --> 21:26:55,120
succes sau nu. Pentru asta dacă

27306
21:26:53,440 --> 21:27:03,600
răspuns

27307
21:26:55,120 --> 21:27:05,120
codul de stare punct plus este egal cu = 200

27308
21:27:03,600 --> 21:27:09,360
apoi

27309
21:27:05,120 --> 21:27:11,680
deci egal cu

27310
21:27:09,360 --> 21:27:17,080
fals.

27311
21:27:11,680 --> 21:27:17,080
Bine. Apoi răspuns

27312
21:27:17,280 --> 21:27:21,720
conținut de puncte

27313
21:27:23,600 --> 21:27:29,040
face

27314
21:27:26,320 --> 21:27:34,000
HTML

27315
21:27:29,040 --> 21:27:35,832
parser de puncte. Bine.

27316
21:27:34,000 --> 21:27:39,192
Aici.

27317
21:27:35,832 --> 21:27:43,040
Deci aici voi scrie curs

27318
21:27:39,192 --> 21:27:46,240
titluri. De ce? pentru că aici sunt, știi

27319
21:27:43,040 --> 21:27:49,280
inițializarea listei pentru a stoca

27320
21:27:46,240 --> 21:27:52,000
titluri sau orice sunt lucrurile în regulă

27321
21:27:49,280 --> 21:27:54,480
practic datele sunt bine de ce scriu

27322
21:27:52,000 --> 21:27:57,832
curs aici pentru că acesta este din nou curs

27323
21:27:54,480 --> 21:28:00,800
pagina de aceea nu e nimic altceva aici

27324
21:27:57,832 --> 21:28:04,080
va da lista goală

27325
21:28:00,800 --> 21:28:06,400
așa că acum vom găsi toate titlurile cursurilor

27326
21:28:04,080 --> 21:28:08,800
pe baza structurii HTML actuale ce

27327
21:28:06,400 --> 21:28:10,960
este structura HTML

27328
21:28:08,800 --> 21:28:14,480
trebuie sa mergi la pagina click dreapta

27329
21:28:10,960 --> 21:28:17,440
Faceți clic, apoi inspectați.

27330
21:28:14,480 --> 21:28:20,480
Bine. Conform acestei structuri HTML

27331
21:28:17,440 --> 21:28:22,872
înseamnă care este numele clasei? Ce este

27332
21:28:20,480 --> 21:28:25,440
știți că această certificare PMP este

27333
21:28:22,872 --> 21:28:30,640
care rubrica? Titlu H1, Titlu H2,

27334
21:28:25,440 --> 21:28:34,480
care titlu este. Bine. Deci, să vedem

27335
21:28:30,640 --> 21:28:37,600
care titlu este. Bine. Bine. Aceasta

27336
21:28:34,480 --> 21:28:41,280
Formare de certificare PMP Titlul H1.

27337
21:28:37,600 --> 21:28:45,192
Bine. Nu uitați decât titlul H1.

27338
21:28:41,280 --> 21:28:48,872
Deci aici voi scrie pentru

27339
21:28:45,192 --> 21:28:52,960
citate în săpun

27340
21:28:48,872 --> 21:28:55,760
dot find

27341
21:28:52,960 --> 21:28:57,360
sau

27342
21:28:55,760 --> 21:29:00,360
h1.

27343
21:28:57,360 --> 21:29:00,360
Bine.

27344
21:29:00,960 --> 21:29:05,080
Apoi titlu

27345
21:29:05,600 --> 21:29:12,240
text personalizat de curs

27346
21:29:09,440 --> 21:29:14,240
bandă de puncte.

27347
21:29:12,240 --> 21:29:19,040
Bine.

27348
21:29:14,240 --> 21:29:20,800
Atunci aici sunt un curs de scris

27349
21:29:19,040 --> 21:29:24,832
titluri

27350
21:29:20,800 --> 21:29:24,832
dot anexează

27351
21:29:24,960 --> 21:29:31,192
titlu. Bine.

27352
21:29:27,832 --> 21:29:35,832
Acum ce voi face? voi verifica

27353
21:29:31,192 --> 21:29:40,640
dacă vreo dată a fost extrasă înainte de aceasta, nu.

27354
21:29:35,832 --> 21:29:43,360
Bine, voi scrie dacă desigur

27355
21:29:40,640 --> 21:29:46,080
titluri.

27356
21:29:43,360 --> 21:29:52,280
Aici voi crea un cadru de date. DF

27357
21:29:46,080 --> 21:29:52,280
este egal cu cadrul de date PD dot.

27358
21:29:53,120 --> 21:29:59,760
În aceasta voi scrie titlul cursului. ea

27359
21:29:56,080 --> 21:30:01,680
va fi a noastră știi uh acea coloană

27360
21:29:59,760 --> 21:30:04,552
nume. Deci pentru că o voi scrie curs

27361
21:30:01,680 --> 21:30:06,480
date. Bine.

27362
21:30:04,552 --> 21:30:09,280
Apoi

27363
21:30:06,480 --> 21:30:12,280
desigur

27364
21:30:09,280 --> 21:30:12,280
titluri.

27365
21:30:12,640 --> 21:30:18,872
Bine.

27366
21:30:14,400 --> 21:30:22,280
Atunci aici voi scrie df

27367
21:30:18,872 --> 21:30:22,280
punct la

27368
21:30:22,480 --> 21:30:28,872
csv.

27369
21:30:24,480 --> 21:30:31,832
Atunci creează, pur și simplu, învață punctul

27370
21:30:28,872 --> 21:30:35,360
CSV. Bine. Deci datele noastre vor fi salvate în

27371
21:30:31,832 --> 21:30:39,120
acest lucru pur și simplu învață dot csv. Bine. CSV.

27372
21:30:35,360 --> 21:30:44,480
Amenda. Aici ce voi face voi scrie

27373
21:30:39,120 --> 21:30:46,320
indicele este egal cu fals.

27374
21:30:44,480 --> 21:30:48,720
Imprimați

27375
21:30:46,320 --> 21:30:53,832
date.

27376
21:30:48,720 --> 21:30:57,360
Datele de imprimare sunt salvate în CSV.

27377
21:30:53,832 --> 21:30:59,600
Învățați pur și simplu dot CSV.

27378
21:30:57,360 --> 21:31:03,512
Amenda.

27379
21:30:59,600 --> 21:31:06,512
Deci aici voi scrie

27380
21:31:03,512 --> 21:31:06,512
altfel

27381
21:31:07,440 --> 21:31:13,080
imprima

27382
21:31:09,760 --> 21:31:13,080
pagina web.

27383
21:31:13,680 --> 21:31:17,600
Bine.

27384
21:31:15,360 --> 21:31:20,600
câmp de scriere

27385
21:31:17,600 --> 21:31:20,600
la

27386
21:31:21,920 --> 21:31:30,320
preluați pagina web. Bine, asta e.

27387
21:31:27,680 --> 21:31:34,240
Lasă-mă să o conduc.

27388
21:31:30,320 --> 21:31:36,552
Bine, aici dacă stocarea răspunsului la asta

27389
21:31:34,240 --> 21:31:39,512
grup

27390
21:31:36,552 --> 21:31:44,040
obiectul spawn nu are niciun atribut

27391
21:31:39,512 --> 21:31:44,040
codul de stare. Bine.

27392
21:31:46,720 --> 21:31:50,360
Bine. Titlu.

27393
21:31:52,080 --> 21:31:59,040
Este text.

27394
21:31:54,320 --> 21:32:02,440
Există câteva greșeli minore de ortografie.

27395
21:31:59,040 --> 21:32:02,440
Bine. dragă.

27396
21:32:03,512 --> 21:32:07,480
Îmi pare rău. Îmi pare rău. răul meu

27397
21:32:09,280 --> 21:32:12,160
din nou.

27398
21:32:12,800 --> 21:32:16,192
Bine. Îmi pare rău.

27399
21:32:16,480 --> 21:32:22,720
D va fi capital, F va fi capital.

27400
21:32:20,320 --> 21:32:25,360
Da. Deci acum puteți vedea că datele sunt salvate

27401
21:32:22,720 --> 21:32:28,960
pur și simplu punct CSV. Deci ce voi face? eu

27402
21:32:25,360 --> 21:32:33,192
va scrie date egale cu toată lumea

27403
21:32:28,960 --> 21:32:35,832
cum să citiți CSV în Python. Citiți

27404
21:32:33,192 --> 21:32:39,440
CSV.

27405
21:32:35,832 --> 21:32:41,832
Care era numele fișierului nostru? Învață pur și simplu

27406
21:32:39,440 --> 21:32:45,512
CSV.

27407
21:32:41,832 --> 21:32:48,832
Bine. Lasă-mă să copiez și lipiți. Rulați-l. Link

27408
21:32:45,512 --> 21:32:48,832
date bune.

27409
21:32:49,680 --> 21:32:54,552
Bine.

27410
21:32:51,360 --> 21:32:59,040
Datele de formare pentru certificarea PMP sunt alimentate.

27411
21:32:54,552 --> 21:33:00,960
Bine. Aici puteți vedea H1 pe care l-am dat și

27412
21:32:59,040 --> 21:33:06,800
de aceea instruirea de certificare PMP

27413
21:33:00,960 --> 21:33:10,000
a venit. Să luăm ce este în H2.

27414
21:33:06,800 --> 21:33:12,720
Bine. În semestrul al doilea este liderul PMI premier

27415
21:33:10,000 --> 21:33:14,960
partener ceva este acolo. Bine. o voi face

27416
21:33:12,720 --> 21:33:20,400
schimba aici

27417
21:33:14,960 --> 21:33:22,552
H1 până la H2, apoi îl voi rula. Bine

27418
21:33:20,400 --> 21:33:24,552
bine.

27419
21:33:22,552 --> 21:33:26,320
Vezi premierul lider P P P P P P P P P P

27420
21:33:24,552 --> 21:33:30,240
P P P P P P P P P P PMI. Bine, lasă-mă

27421
21:33:26,320 --> 21:33:33,440
fă-o mai mare. Da. Deci acum poți vedea

27422
21:33:30,240 --> 21:33:37,600
datele cursului pe care le-am menționat. Deci

27423
21:33:33,440 --> 21:33:40,720
daca vei vedea acest H1 nu a venit de ce

27424
21:33:37,600 --> 21:33:44,320
pentru că am menționat H2 de aceea.

27425
21:33:40,720 --> 21:33:46,960
Deci toate acestea sunt H2.

27426
21:33:44,320 --> 21:33:49,832
Bine. Deci ce este asta? Nu știu.

27427
21:33:46,960 --> 21:33:52,000
Bine. Acesta este un grafic de serie de timp. Aceasta

27428
21:33:49,832 --> 21:33:56,160
Google se prăbușește. Bine. Deci asta este

27429
21:33:52,000 --> 21:33:59,040
cum vă puteți recupera literalmente datele

27430
21:33:56,160 --> 21:34:02,480
de pe orice site. Bine. Doar amintiți-vă

27431
21:33:59,040 --> 21:34:05,040
că unele site-uri web nu vă oferă acces

27432
21:34:02,480 --> 21:34:06,960
le cunoști pentru casarea lor

27433
21:34:05,040 --> 21:34:10,800
la fel cum Amazon nu dă, așa că aveți

27434
21:34:06,960 --> 21:34:15,040
pentru a utiliza la acel moment API și acest lucru nu este

27435
21:34:10,800 --> 21:34:16,872
etic, de asemenea, pentru a folosi datele cuiva bine

27436
21:34:15,040 --> 21:34:19,192
fără să întrebi sau orice poți

27437
21:34:16,872 --> 21:34:21,512
>> Bine ați venit la tutorialul rețelei neuronale

27438
21:34:19,192 --> 21:34:24,000
numele meu este Richard Kersner. Sunt cu

27439
21:34:21,512 --> 21:34:25,920
pur și simplu învață în echipă ce este în ea pentru tine

27440
21:34:24,000 --> 21:34:28,400
Ei bine, astăzi vom acoperi ceea ce este

27441
21:34:25,920 --> 21:34:31,120
o rețea neuronală ce poate neuronală

27442
21:34:28,400 --> 21:34:33,600
rețelele, cum funcționează o rețea neuronală

27443
21:34:31,120 --> 21:34:35,760
munca, tipuri de rețele neuronale și apoi

27444
21:34:33,600 --> 21:34:38,240
vom sări într-un caz de utilizare pentru

27445
21:34:35,760 --> 21:34:40,400
clasifică între fotografiile câinilor și

27446
21:34:38,240 --> 21:34:42,160
pisici și vom face asta pe KAS cu

27447
21:34:40,400 --> 21:34:44,160
TensorFlow din spate, dar este un

27448
21:34:42,160 --> 21:34:45,680
Script Python. Deci, asta e mereu al meu

27449
21:34:44,160 --> 21:34:48,960
partea preferată este atunci când ne scufundăm în

27450
21:34:45,680 --> 21:34:51,040
scenariu propriu-zis. Deci, ce este un neural

27451
21:34:48,960 --> 21:34:52,552
retea? Deci, salut băieți. Am auzit că vrei

27452
21:34:51,040 --> 21:34:54,240
pentru a ști ce este o rețea neuronală. Aici

27453
21:34:52,552 --> 21:34:56,320
se pare că tocmai a plecat

27454
21:34:54,240 --> 21:34:58,960
cumpărături la o vânzare cu etichetă roșie. Ai roboților mei

27455
21:34:56,320 --> 21:35:01,120
înapoi. Deci, de fapt, ai

27456
21:34:58,960 --> 21:35:03,360
folosit zilnic rețeaua neuronală

27457
21:35:01,120 --> 21:35:04,872
baza. În lumea de astăzi, este doar

27458
21:35:03,360 --> 21:35:06,720
uimitor cât de mult folosim noul nostru

27459
21:35:04,872 --> 21:35:08,400
tehnologie. Nici măcar nu suntem conștienți de asta.

27460
21:35:06,720 --> 21:35:10,080
Când îi ceri asistentului tău mobil să

27461
21:35:08,400 --> 21:35:12,400
efectuează o căutare pentru tine, știi, cum ar fi

27462
21:35:10,080 --> 21:35:15,512
spunând că ești Google sau Siri sau oricine

27463
21:35:12,400 --> 21:35:17,360
folosiți, Amazon Web, mașini cu conducere autonomă.

27464
21:35:15,512 --> 21:35:18,552
Deci ăsta este cel mai nou lucru care iese.

27465
21:35:17,360 --> 21:35:20,640
Tocmai acum încearcă să le facă

27466
21:35:18,552 --> 21:35:22,552
legal în diferite state din SUA și

27467
21:35:20,640 --> 21:35:24,480
în întreaga lume. Chiar și în Marea Britanie, ei

27468
21:35:22,552 --> 21:35:25,920
acum au mașini autonome care urcă și

27469
21:35:24,480 --> 21:35:27,600
jos pe stradă. Este destul de uimitor.

27470
21:35:25,920 --> 21:35:29,512
Toate acestea sunt conduse de rețele neuronale.

27471
21:35:27,600 --> 21:35:31,280
Jocurile pe calculator îl folosesc. Mult computer

27472
21:35:29,512 --> 21:35:34,160
jocurile sunt conduse de rețele neuronale în

27473
21:35:31,280 --> 21:35:36,160
partea din spate ca parte a sistemului de joc

27474
21:35:34,160 --> 21:35:38,000
și cum se adaptează la jucători. Şi

27475
21:35:36,160 --> 21:35:39,920
este folosit și la procesarea hărții

27476
21:35:38,000 --> 21:35:42,552
imagini de pe telefonul dvs. Deci de fiecare dată tu

27477
21:35:39,920 --> 21:35:44,400
faceți o navigație undeva și se deschide

27478
21:35:42,552 --> 21:35:45,760
gata, acum folosesc rețele neuronale pentru a

27479
21:35:44,400 --> 21:35:48,320
vă ajută să găsiți cea mai rapidă cale de a obține

27480
21:35:45,760 --> 21:35:51,120
acolo. Rețeaua neuronală. O rețea neuronală

27481
21:35:48,320 --> 21:35:53,280
este un sistem sau hardware care este proiectat

27482
21:35:51,120 --> 21:35:55,192
să funcționeze ca un creier uman. În

27483
21:35:53,280 --> 21:35:57,440
dezvoltarea de astăzi, așa este

27484
21:35:55,192 --> 21:35:59,192
important de înțeles pentru că noi nu

27485
21:35:57,440 --> 21:36:01,192
mai ai cu ce să-l compari. eu sunt

27486
21:35:59,192 --> 21:36:03,680
sigur, într-o zi în viitor, computerul

27487
21:36:01,192 --> 21:36:05,920
va redefini sau rețeaua neuronală sau

27488
21:36:03,680 --> 21:36:08,080
inteligența artificială AI va

27489
21:36:05,920 --> 21:36:10,000
redefiniți ce înseamnă acestea. Dar în măsura în care

27490
21:36:08,080 --> 21:36:11,760
putem lumea de azi, în cea de azi

27491
21:36:10,000 --> 21:36:13,600
dezvoltare comercială, trebuie să

27492
21:36:11,760 --> 21:36:15,360
compară-l cu ceea ce fac oamenii. Deci, este

27493
21:36:13,600 --> 21:36:17,040
vrem să comparăm și cum funcționează

27494
21:36:15,360 --> 21:36:19,832
la un creier uman și cum se rezolvă

27495
21:36:17,040 --> 21:36:22,000
probleme ca un om. Ce poate a

27496
21:36:19,832 --> 21:36:24,552
rețeaua neuronală face? Și într-adevăr, suntem

27497
21:36:22,000 --> 21:36:26,720
doar o să ne scufundăm mai adânc în noi

27498
21:36:24,552 --> 21:36:28,480
acoperite și priviți alte exemple. Deci,

27499
21:36:26,720 --> 21:36:30,080
ce poate face o rețea neuronală? Bine,

27500
21:36:28,480 --> 21:36:32,720
haideți să enumeram lucrurile neuronale

27501
21:36:30,080 --> 21:36:34,872
rețelele pot face pentru tine. Traduceți textul.

27502
21:36:32,720 --> 21:36:37,040
Băiete, avem Google Translate și

27503
21:36:34,872 --> 21:36:38,080
Microsoft are propria sa traducere. Ei

27504
21:36:37,040 --> 21:36:39,760
ai niste tare tare. Ei de fapt

27505
21:36:38,080 --> 21:36:42,000
au cască. Ar trebui să înceapă

27506
21:36:39,760 --> 21:36:44,080
traducând în timp ce vorbești. Ce misto

27507
21:36:42,000 --> 21:36:46,480
tehnologie. Ce timp grozav de trăit.

27508
21:36:44,080 --> 21:36:48,872
Identificați fețele. Vă puteți imagina toate

27509
21:36:46,480 --> 21:36:51,040
utilizări pentru identificarea facială? În

27510
21:36:48,872 --> 21:36:52,552
cazul eșantionului nostru sau codului nostru

27511
21:36:51,040 --> 21:36:54,640
o să ne uităm mai târziu, vom fi

27512
21:36:52,552 --> 21:36:56,720
identificarea câinilor și pisicilor. Deci, nu chiar

27513
21:36:54,640 --> 21:36:58,400
la fel de detaliat ca uh înțelegerea cui

27514
21:36:56,720 --> 21:37:00,160
chipul aparține cui. eu astept

27515
21:36:58,400 --> 21:37:02,320
ochelarii Google să iasă, ca să pot

27516
21:37:00,160 --> 21:37:03,680
vezi cine este cine și identifică fețele ca

27517
21:37:02,320 --> 21:37:05,440
Mă plimb. Ai un mic nume

27518
21:37:03,680 --> 21:37:07,280
eticheta peste ele. Nu există încă, dar

27519
21:37:05,440 --> 21:37:08,960
băiete, suntem aproape. Putem identifica

27520
21:37:07,280 --> 21:37:10,872
fețe și au tot felul de

27521
21:37:08,960 --> 21:37:13,760
tehnologii pentru a aduce aceste informații

27522
21:37:10,872 --> 21:37:16,400
înapoi la noi. Recunoașteți că vorbirea continuă

27523
21:37:13,760 --> 21:37:18,160
cu textul tradus. Deci acum ca

27524
21:37:16,400 --> 21:37:20,640
vorbești cu asistentul tău, asta

27525
21:37:18,160 --> 21:37:22,480
poate folosi asta pentru a face comenzi, a aprinde luminile

27526
21:37:20,640 --> 21:37:24,640
pe, tot felul de lucruri cu care poți face

27527
21:37:22,480 --> 21:37:26,400
recunoașterea vorbirii. Citiți scris de mână

27528
21:37:24,640 --> 21:37:28,160
text. Încep să traducă totul

27529
21:37:26,400 --> 21:37:30,000
aceste documente text vechi pe care le au

27530
21:37:28,160 --> 21:37:31,512
avut în depozit în loc să o facă

27531
21:37:30,000 --> 21:37:34,160
individual unde se duce cineva

27532
21:37:31,512 --> 21:37:36,000
prin fiecare text de la sine într-o cameră.

27533
21:37:34,160 --> 21:37:37,680
Imaginează-te ca un vechi Raiders of the Lost

27534
21:37:36,000 --> 21:37:39,600
Tema arcului unde este el în spate, tu

27535
21:37:37,680 --> 21:37:41,192
Știu, arheolog care studiază textul.

27536
21:37:39,600 --> 21:37:43,512
Acum este introdus într-un computer. Ei iau

27537
21:37:41,192 --> 21:37:46,320
o poză. Ei folosesc chiar și rețele neuronale

27538
21:37:43,512 --> 21:37:48,872
a lua un pergament atât de încurcat

27539
21:37:46,320 --> 21:37:51,760
că nu pot anula derularea și ei

27540
21:37:48,872 --> 21:37:53,600
radiografiază-l și apoi folosesc acea radiografie pentru

27541
21:37:51,760 --> 21:37:56,000
traduce textul din el fără

27542
21:37:53,600 --> 21:37:57,360
deschizând mereu sulul. Adică doar un fel

27543
21:37:56,000 --> 21:38:00,000
lucruri interesante cu care încep să facă

27544
21:37:57,360 --> 21:38:01,920
toate acestea. Și, desigur, controlează roboții.

27545
21:38:00,000 --> 21:38:03,832
Fără ce ar fi o rețea neuronală

27546
21:38:01,920 --> 21:38:05,280
aducerea roboților? Și avem a noastră

27547
21:38:03,832 --> 21:38:06,872
propriul robot preferat din mijloc care

27548
21:38:05,280 --> 21:38:08,480
merge la celula noastră roșie și pleacă

27549
21:38:06,872 --> 21:38:10,960
cumpărături pentru noi. Deci, știi, acestea sunt

27550
21:38:08,480 --> 21:38:12,800
doar câteva dintre lucrurile minunate care

27551
21:38:10,960 --> 21:38:15,360
se aplică rețelelor neuronale.

27552
21:38:12,800 --> 21:38:17,040
Este o tehnologie atât de copil.

27553
21:38:15,360 --> 21:38:18,640
Ce moment minunat în care sări. Și

27554
21:38:17,040 --> 21:38:20,080
sunt o mulțime de alte lucruri în care merge

27555
21:38:18,640 --> 21:38:21,600
în. Adică, am putea cheltui doar

27556
21:38:20,080 --> 21:38:23,600
vorbind mereu despre toate diferitele

27557
21:38:21,600 --> 21:38:25,192
aplicații de la business la orice

27558
21:38:23,600 --> 21:38:26,800
chiar iti poti imagina. Ei sunt acum

27559
21:38:25,192 --> 21:38:29,040
aplicarea rețelelor neuronale pentru a ne ajuta

27560
21:38:26,800 --> 21:38:30,240
intelege. Deci, acum am vorbit puțin

27561
21:38:29,040 --> 21:38:32,400
puțin despre toate lucrurile interesante pe care le poți face

27562
21:38:30,240 --> 21:38:35,360
cu o rețea neuronală. Să ne scufundăm și

27563
21:38:32,400 --> 21:38:36,960
să zicem, cum funcționează o rețea neuronală? Deci

27564
21:38:35,360 --> 21:38:39,360
acum am ajuns destul de departe ca să înțelegem

27565
21:38:36,960 --> 21:38:40,720
cum funcționează rețeaua neuronală. Să mergem înainte

27566
21:38:39,360 --> 21:38:42,720
și treci prin asta într-un mod frumos

27567
21:38:40,720 --> 21:38:44,720
reprezentare grafică. Ei de obicei

27568
21:38:42,720 --> 21:38:46,320
descrie o rețea neuronală ca având

27569
21:38:44,720 --> 21:38:48,160
straturi diferite. Și o să vezi asta

27570
21:38:46,320 --> 21:38:50,400
am identificat un strat verde, an

27571
21:38:48,160 --> 21:38:52,480
strat portocaliu și un strat roșu. Verdele

27572
21:38:50,400 --> 21:38:54,400
stratul este intrarea. Deci, ai a ta

27573
21:38:52,480 --> 21:38:56,640
datele care vin. Preia intrarea

27574
21:38:54,400 --> 21:38:58,720
semnalează și le trece la următorul

27575
21:38:56,640 --> 21:39:00,960
strat. Următorul strat face tot felul de

27576
21:38:58,720 --> 21:39:02,800
calcule și extragerea caracteristicilor.

27577
21:39:00,960 --> 21:39:04,480
Se numește stratul ascuns. Multe

27578
21:39:02,800 --> 21:39:06,320
ori mai multe sunt ascunse

27579
21:39:04,480 --> 21:39:07,920
strat. Arătăm doar unul în asta

27580
21:39:06,320 --> 21:39:10,080
imagine, dar vă vom arăta cum arată

27581
21:39:07,920 --> 21:39:11,920
ca într-un detaliu puțin.

27582
21:39:10,080 --> 21:39:14,400
Și apoi, în sfârșit, avem o ieșire

27583
21:39:11,920 --> 21:39:16,552
strat. Acest strat oferă finala

27584
21:39:14,400 --> 21:39:18,720
rezultat. Deci singurele două lucruri pe care le vedem sunt

27585
21:39:16,552 --> 21:39:20,160
stratul de intrare și stratul de ieșire.

27586
21:39:18,720 --> 21:39:22,960
Acum să folosim acest neural

27587
21:39:20,160 --> 21:39:24,800
rețea și vedeți cum funcționează. Mă întreb cum

27588
21:39:22,960 --> 21:39:26,872
camerele de trafic identifică vehiculele

27589
21:39:24,800 --> 21:39:29,192
plăcuță de înmatriculare pe drum pentru a detecta

27590
21:39:26,872 --> 21:39:30,800
vehiculele care depășesc viteză și cele care sparg

27591
21:39:29,192 --> 21:39:32,552
lege? M-au făcut să trec printr-un roșu

27592
21:39:30,800 --> 21:39:33,600
lumina zilele trecute. Ei bine, luna trecută.

27593
21:39:32,552 --> 21:39:35,360
Este ca lucrul oribil. Ei

27594
21:39:33,600 --> 21:39:36,640
să-ți trimită această poză cu tine și cu toți

27595
21:39:35,360 --> 21:39:38,400
informațiile tale pentru că le-au extras

27596
21:39:36,640 --> 21:39:39,600
sus de pe plăcuța ta de înmatriculare și ta

27597
21:39:38,400 --> 21:39:41,600
poza. Nu ar fi trebuit să trec prin

27598
21:39:39,600 --> 21:39:43,440
lumina rosie. Deci, iată-ne și noi

27599
21:39:41,600 --> 21:39:45,120
ai o imagine a unei mașini și poți vedea

27600
21:39:43,440 --> 21:39:46,552
placa de înmatriculare de acolo. Deci, hai

27601
21:39:45,120 --> 21:39:49,360
luați în considerare imaginea acestui vehicul și

27602
21:39:46,552 --> 21:39:52,080
aflați ce este pe plăcuța de înmatriculare. The

27603
21:39:49,360 --> 21:39:54,872
imaginea în sine este de 28x28 pixeli și

27604
21:39:52,080 --> 21:39:57,512
imaginea este alimentată ca intrare pentru a identifica

27605
21:39:54,872 --> 21:39:59,760
plăcuță de înmatriculare. Fiecare neuron are un

27606
21:39:57,512 --> 21:40:01,832
număr numit activare care reprezintă

27607
21:39:59,760 --> 21:40:04,160
valoarea în tonuri de gri a corespunzătoare

27608
21:40:01,832 --> 21:40:06,552
interval de pixeli. Și o variam de la zero

27609
21:40:04,160 --> 21:40:08,480
la unul. Unul pentru un pixel alb și zero

27610
21:40:06,552 --> 21:40:09,920
pentru un pixel negru. Și poți vedea în jos

27611
21:40:08,480 --> 21:40:12,080
aici avem un exemplu în care unul dintre

27612
21:40:09,920 --> 21:40:14,000
pixeli este înregistrat ca 082.

27613
21:40:12,080 --> 21:40:16,552
Înseamnă că probabil este destul de întuneric. Fiecare

27614
21:40:14,000 --> 21:40:18,872
neuronul este aprins atunci când este activat

27615
21:40:16,552 --> 21:40:20,872
aproape de unul. Deci, pe măsură ce ne apropiem de

27616
21:40:18,872 --> 21:40:22,480
negru pe alb, putem începe cu adevărat

27617
21:40:20,872 --> 21:40:24,240
văzând detaliile acolo. Și poți

27618
21:40:22,480 --> 21:40:26,000
vezi din nou pixelul ne arată unul în sus

27619
21:40:24,240 --> 21:40:28,080
acolo. E ca o parte a mașinii și așa

27620
21:40:26,000 --> 21:40:30,640
se aprinde. Deci pixeli sub formă de

27621
21:40:28,080 --> 21:40:32,480
matricele sunt alimentate în stratul de intrare. Şi

27622
21:40:30,640 --> 21:40:33,920
deci vedem aici pixelii imaginii unei mașini

27623
21:40:32,480 --> 21:40:36,160
alimentat ca intrare. Și o să vezi

27624
21:40:33,920 --> 21:40:38,240
că stratul de intrare care este verde este

27625
21:40:36,160 --> 21:40:40,240
o dimensiune în timp ce imaginea noastră este

27626
21:40:38,240 --> 21:40:41,920
bidimensional. Acum, când ne uităm la noi

27627
21:40:40,240 --> 21:40:43,512
configurație pe care o programăm în Python,

27628
21:40:41,920 --> 21:40:45,360
are o caracteristică cool care automat

27629
21:40:43,512 --> 21:40:47,280
face treaba pentru noi. Dacă lucrezi

27630
21:40:45,360 --> 21:40:49,120
cu un model mai vechi de rețea neuronală

27631
21:40:47,280 --> 21:40:51,040
pachet, apoi convertiți fiecare dintre

27632
21:40:49,120 --> 21:40:53,040
acele rânduri, deci este o singură matrice. Deci

27633
21:40:51,040 --> 21:40:54,800
ai avea ca rândul unu și apoi doar

27634
21:40:53,040 --> 21:40:56,320
prindeți rândul doi la capăt. Poți

27635
21:40:54,800 --> 21:40:58,240
aproape introduce imaginea direct în unele

27636
21:40:56,320 --> 21:41:01,040
dintre aceste rețele neuronale. Cheia este

27637
21:40:58,240 --> 21:41:03,360
totuși, dacă utilizați un 28x 28

27638
21:41:01,040 --> 21:41:06,800
și primești o poză cu acest 30x30,

27639
21:41:03,360 --> 21:41:09,040
micșorați 30x30 pentru a se potrivi cu 28x28.

27640
21:41:06,800 --> 21:41:11,360
Deci nu puteți crește numărul de

27641
21:41:09,040 --> 21:41:12,480
introduceți în acest caz puncte verzi. Este foarte

27642
21:41:11,360 --> 21:41:14,080
important de reținut când lucrați

27643
21:41:12,480 --> 21:41:17,120
rețele neuronale. Și să-i denumim

27644
21:41:14,080 --> 21:41:18,400
intrări x1 x2 x3 respectiv. Deci fiecare

27645
21:41:17,120 --> 21:41:20,240
unul dintre acestea reprezintă unul dintre

27646
21:41:18,400 --> 21:41:22,240
pixeli care vin. Și stratul de intrare

27647
21:41:20,240 --> 21:41:23,920
îl trece la stratul ascuns. Iar tu

27648
21:41:22,240 --> 21:41:26,240
pot vedea aici avem acum două ascunse

27649
21:41:23,920 --> 21:41:28,640
straturi din această imagine în portocaliu. Şi

27650
21:41:26,240 --> 21:41:31,040
fiecare dintre acești pixeli se conectează

27651
21:41:28,640 --> 21:41:33,360
fiecare dintre acele straturi ascunse. Iar cel

27652
21:41:31,040 --> 21:41:35,120
interconexiunilor li se atribuie ponderi la

27653
21:41:33,360 --> 21:41:38,080
aleatoriu. Deci primesc aceste greutăți aleatorii

27654
21:41:35,120 --> 21:41:40,160
care trec prin. Dacă x1 se aprinde, atunci

27655
21:41:38,080 --> 21:41:42,080
va fi de x1 ori această greutate

27656
21:41:40,160 --> 21:41:43,360
mergând în stratul ascuns. Și însumăm

27657
21:41:42,080 --> 21:41:45,192
acele greutăți. Greutățile sunt

27658
21:41:43,360 --> 21:41:47,280
înmulțit cu semnalul de intrare și a

27659
21:41:45,192 --> 21:41:49,832
la toate se adaugă părtinire. Deci ca si tine

27660
21:41:47,280 --> 21:41:51,440
pot vedea aici avem X1 intră și el

27661
21:41:49,832 --> 21:41:53,680
de fapt merge la toate diferitele

27662
21:41:51,440 --> 21:41:55,192
noduri de strat ascunse sau în acest caz uh

27663
21:41:53,680 --> 21:41:57,832
cum vrei să le numești rețea

27664
21:41:55,192 --> 21:42:00,960
setează punctele portocalii și așa iei

27665
21:41:57,832 --> 21:42:03,680
valoarea lui X1 o înmulțiți cu

27666
21:42:00,960 --> 21:42:06,480
greutate pentru următorul strat ascuns. Deci X1

27667
21:42:03,680 --> 21:42:09,192
merge la stratul ascuns 1 X1 merge la ascuns

27668
21:42:06,480 --> 21:42:11,680
stratul doi X1 merge ascuns stratul 1 nodul

27669
21:42:09,192 --> 21:42:14,240
două straturi ascunse un nod trei și așa

27670
21:42:11,680 --> 21:42:16,400
pe. Și părtinirea de multe ori ei

27671
21:42:14,240 --> 21:42:18,872
pur și simplu introduceți părtinirea ca pe alta

27672
21:42:16,400 --> 21:42:21,120
punct verde sau alt punct portocaliu și ei

27673
21:42:18,872 --> 21:42:23,832
dați părtinirii o valoare una și apoi toate

27674
21:42:21,120 --> 21:42:26,160
greutățile intră de la părtinire în

27675
21:42:23,832 --> 21:42:27,680
nodul următor. Deci părtinirea se poate schimba. Noi

27676
21:42:26,160 --> 21:42:29,512
amintește-ți întotdeauna că trebuie

27677
21:42:27,680 --> 21:42:31,760
au acea părtinire acolo. Sunt lucruri

27678
21:42:29,512 --> 21:42:33,680
asta se poate face cu ea. În general majoritatea

27679
21:42:31,760 --> 21:42:34,872
de pachete de acolo controlează că pentru

27680
21:42:33,680 --> 21:42:37,280
tu ca să nu ai de ce să-ți faci griji

27681
21:42:34,872 --> 21:42:38,960
a afla care este părtinirea. Dar dacă

27682
21:42:37,280 --> 21:42:40,480
te scufunzi vreodată adânc în rețelele neuronale,

27683
21:42:38,960 --> 21:42:42,320
trebuie să vă amintiți că există o părtinire sau

27684
21:42:40,480 --> 21:42:44,400
raspunsul nu va iesi corect. The

27685
21:42:42,320 --> 21:42:46,720
suma ponderată a intrării este alimentată ca un

27686
21:42:44,400 --> 21:42:48,720
intrare la funcția de activare pentru

27687
21:42:46,720 --> 21:42:50,800
decideți ce noduri să declanșați. Și pentru

27688
21:42:48,720 --> 21:42:52,320
extragerea caracteristicilor, pe măsură ce un semnal curge

27689
21:42:50,800 --> 21:42:54,320
în cadrul straturilor ascunse, ponderat

27690
21:42:52,320 --> 21:42:56,480
se calculează suma intrărilor și este alimentată

27691
21:42:54,320 --> 21:42:58,872
la funcția de activare din fiecare strat

27692
21:42:56,480 --> 21:43:00,400
pentru a decide ce noduri să declanșeze. Deci iată

27693
21:42:58,872 --> 21:43:01,920
caracteristica noastră de extragere a numărului

27694
21:43:00,400 --> 21:43:03,832
farfurie. Și puteți vedea că acestea sunt încă

27695
21:43:01,920 --> 21:43:05,040
noduri ascunse în mijloc. Și asta

27696
21:43:03,832 --> 21:43:06,800
devine important. Vom lua o

27697
21:43:05,040 --> 21:43:08,552
mic ocol aici și uită-te la

27698
21:43:06,800 --> 21:43:10,720
functia de activare. Deci, vom merge

27699
21:43:08,552 --> 21:43:12,240
scufundă-te puțin în matematică, așa că

27700
21:43:10,720 --> 21:43:13,760
poti incepe sa intelegi unde unii

27701
21:43:12,240 --> 21:43:15,120
dintre jocuri continuă atunci când joci

27702
21:43:13,760 --> 21:43:16,480
cu rețele neuronale în dvs

27703
21:43:15,120 --> 21:43:18,400
programare. Deci, să ne uităm la

27704
21:43:16,480 --> 21:43:20,640
diferite funcții de activare înaintea noastră

27705
21:43:18,400 --> 21:43:23,120
mergi inainte. Iată eticheta noastră roșie prietenoasă

27706
21:43:20,640 --> 21:43:25,120
robot de cumpărături. Și așa, unul este un sigmoid

27707
21:43:23,120 --> 21:43:28,960
funcția. Și funcția sigmoidă care

27708
21:43:25,120 --> 21:43:31,040
este 1 peste 1 e la minus x ia

27709
21:43:28,960 --> 21:43:34,000
valoarea x și puteți vedea unde este

27710
21:43:31,040 --> 21:43:35,920
generează aproape un zero și aproape unul

27711
21:43:34,000 --> 21:43:37,920
cu o zonă foarte mică la mijloc

27712
21:43:35,920 --> 21:43:40,160
unde trece peste și putem folosi

27713
21:43:37,920 --> 21:43:42,552
acea valoare pentru a alimenta altul

27714
21:43:40,160 --> 21:43:45,360
funcția. Deci, dacă este cu adevărat incert

27715
21:43:42,552 --> 21:43:46,552
ar putea avea un 0,1 sau 2 sau 3, dar pentru

27716
21:43:45,360 --> 21:43:48,160
în cea mai mare parte, va fi foarte aproape

27717
21:43:46,552 --> 21:43:50,552
la unul și foarte aproape de acest caz

27718
21:43:48,160 --> 21:43:52,080
zero zero la unu funcția de prag.

27719
21:43:50,552 --> 21:43:54,000
Deci, dacă nu doriți să vă faceți griji cu privire la

27720
21:43:52,080 --> 21:43:56,160
incertitudine la mijloc, spui doar,

27721
21:43:54,000 --> 21:43:58,960
„Oh, dacă x este mai mare sau egal cu

27722
21:43:56,160 --> 21:44:00,400
zero, dacă nu, atunci uh x este zero.” Deci

27723
21:43:58,960 --> 21:44:02,640
este fie zero, fie unul. într-adevăr

27724
21:44:00,400 --> 21:44:04,080
direct. Nu există între ele

27725
21:44:02,640 --> 21:44:06,800
În mijloc. Și apoi ai

27726
21:44:04,080 --> 21:44:08,640
ceea ce ei numesc funcția reel relu.

27727
21:44:06,800 --> 21:44:10,640
Și puteți vedea aici unde se stinge

27728
21:44:08,640 --> 21:44:13,040
valoarea, dar apoi spune, ei bine, dacă

27729
21:44:10,640 --> 21:44:15,600
e peste unu, va fi unul. Şi

27730
21:44:13,040 --> 21:44:17,440
dacă este mai mică decât zero, este zero. Deci

27731
21:44:15,600 --> 21:44:19,192
se cam amortizează pe cei doi

27732
21:44:17,440 --> 21:44:21,280
se termină, dar permite toate valorile din

27733
21:44:19,192 --> 21:44:23,440
mijloc. Și din nou, asta ca sigmoidul

27734
21:44:21,280 --> 21:44:24,960
funcția permite accesul acestor informații

27735
21:44:23,440 --> 21:44:26,960
la nivelul următor. Deci ar putea fi

27736
21:44:24,960 --> 21:44:29,192
important de știut dacă este 0,1 sau a

27737
21:44:26,960 --> 21:44:31,192
minus.1. Următorul strat ascuns ar putea

27738
21:44:29,192 --> 21:44:33,440
ridică asta și spune: „Oh, această bucată din

27739
21:44:31,192 --> 21:44:35,512
informația este incertă sau această valoare

27740
21:44:33,440 --> 21:44:37,680
are o certitudine foarte scăzută.” Şi

27741
21:44:35,512 --> 21:44:40,160
apoi funcţia tangentă hiperbolică.

27742
21:44:37,680 --> 21:44:44,640
Și puteți vedea aici că este un 1 - e la

27743
21:44:40,160 --> 21:44:46,240
-2x peste 1 e - 2x. Și este foarte mult

27744
21:44:44,640 --> 21:44:47,832
pe aceeași temă, puțin

27745
21:44:46,240 --> 21:44:49,832
diferit aici prin faptul că merge

27746
21:44:47,832 --> 21:44:51,600
între minus unu și unu. Deci vei vedea

27747
21:44:49,832 --> 21:44:53,440
unele dintre acestea merge 0ero la unul, dar

27748
21:44:51,600 --> 21:44:55,600
acesta merge minus unu la unu. Și dacă

27749
21:44:53,440 --> 21:44:57,512
este mai puțin de zero, este, știi, asta

27750
21:44:55,600 --> 21:44:59,600
nu trage și dacă este peste zero, asta

27751
21:44:57,512 --> 21:45:01,512
incendii. Și, de asemenea, încă stinge a

27752
21:44:59,600 --> 21:45:03,280
valoare. Deci mai ai o valoare pe care o poți

27753
21:45:01,512 --> 21:45:04,960
scapă de asta așa cum poți

27754
21:45:03,280 --> 21:45:07,440
functia sigmoida si relu

27755
21:45:04,960 --> 21:45:08,720
funcția. Foarte asemănător la utilizare. si eu

27756
21:45:07,440 --> 21:45:10,000
cred că inițial a fost

27757
21:45:08,720 --> 21:45:11,832
totul s-a făcut în sigmoid

27758
21:45:10,000 --> 21:45:13,512
funcția. Asta a fost cel mai frecvent

27759
21:45:11,832 --> 21:45:15,760
folosit. Și acum folosesc mai mult

27760
21:45:13,512 --> 21:45:17,920
funcția reloo. Motivul este unul,

27761
21:45:15,760 --> 21:45:20,240
procesează mai repede pentru că deja

27762
21:45:17,920 --> 21:45:22,960
au valoare și nu trebuie să adaugi

27763
21:45:20,240 --> 21:45:25,192
altul calculează 1 / 1 e la

27764
21:45:22,960 --> 21:45:27,440
minus x pentru fiecare nod ascuns și

27765
21:45:25,192 --> 21:45:29,120
datele care ies funcționează destul de bine până acum

27766
21:45:27,440 --> 21:45:30,960
ca punerea lui la nivelul următor. Dacă

27767
21:45:29,120 --> 21:45:32,552
vrei să știi cât de aproape este

27768
21:45:30,960 --> 21:45:34,720
zero, cât de aproape nu este de

27769
21:45:32,552 --> 21:45:36,800
funcționează, știi, este minus.1

27770
21:45:34,720 --> 21:45:39,920
minus.2 de obicei sunt valori flotante.

27771
21:45:36,800 --> 21:45:41,192
Primești ca punct minus minus.00138

27772
21:45:39,920 --> 21:45:42,480
sau ceva. Deci, știi, important

27773
21:45:41,192 --> 21:45:44,640
informații, dar Reu este cea mai mare

27774
21:45:42,480 --> 21:45:46,400
folosit în mod obișnuit în aceste zile, în măsura în care

27775
21:45:44,640 --> 21:45:48,640
configurația pe care o folosim. Dar vei vedea și tu

27776
21:45:46,400 --> 21:45:50,480
funcţia sigmoidă foarte frecvent utilizată

27777
21:45:48,640 --> 21:45:53,040
de asemenea. Acum că știi ce an

27778
21:45:50,480 --> 21:45:55,360
funcția de activare este, să revenim

27779
21:45:53,040 --> 21:45:56,640
la rețeaua neuronală. Deci, în sfârșit,

27780
21:45:55,360 --> 21:45:58,480
modelul ar prezice rezultatul

27781
21:45:56,640 --> 21:46:00,552
aplicând o funcție de activare adecvată

27782
21:45:58,480 --> 21:46:02,080
la stratul de ieșire. Deci, intrăm aici,

27783
21:46:00,552 --> 21:46:04,720
ne uităm la asta și avem optica

27784
21:46:02,080 --> 21:46:06,720
OCR de recunoaștere a caracterelor este utilizat pe

27785
21:46:04,720 --> 21:46:08,400
imagini pentru a le converti într-un text în

27786
21:46:06,720 --> 21:46:10,160
pentru a identifica ceea ce este scris pe

27787
21:46:08,400 --> 21:46:12,400
placă. Și pe măsură ce va ieși, vei vedea

27788
21:46:10,160 --> 21:46:14,800
nodul roșu. Și nodul roșu ar putea

27789
21:46:12,400 --> 21:46:16,240
reprezintă de fapt doar litera A. Deci

27790
21:46:14,800 --> 21:46:18,000
de obicei există o mulțime de ieșiri când

27791
21:46:16,240 --> 21:46:19,680
faci identificarea textului. Suntem

27792
21:46:18,000 --> 21:46:21,192
nu o să arăt asta aici, dar tu

27793
21:46:19,680 --> 21:46:23,120
ar putea să-l aibă chiar și în ordine. Ea

27794
21:46:21,192 --> 21:46:26,320
ar putea fi ceea ce comandă plăcuțele de înmatriculare

27795
21:46:23,120 --> 21:46:28,240
in. Deci ai putea avea ABCDE E FG, tu

27796
21:46:26,320 --> 21:46:32,000
Știi, tot alfabetul plus numerele.

27797
21:46:28,240 --> 21:46:34,160
Și s-ar putea să ai 1 2 3 4 5 6 7 8 9

27798
21:46:32,000 --> 21:46:36,080
10 locuri. Deci este o matrice foarte mare

27799
21:46:34,160 --> 21:46:38,000
care iese. Nu este o cantitate mică

27800
21:46:36,080 --> 21:46:40,800
dintre uh, știi, arătăm trei puncte

27801
21:46:38,000 --> 21:46:42,640
venind, opt noduri de straturi ascunse, tu

27802
21:46:40,800 --> 21:46:44,720
știi, două seturi de patru. Noi arătăm doar unul

27803
21:46:42,640 --> 21:46:47,680
roșu care iese. De multe ori asta este

27804
21:46:44,720 --> 21:46:50,640
uh, știi, 28 * 28. Dacă ai făcut 30 *

27805
21:46:47,680 --> 21:46:52,552
30, adică 900 de noduri. Deci 28

27806
21:46:50,640 --> 21:46:54,480
este puțin mai puțin decât atât, uh, doar

27807
21:46:52,552 --> 21:46:57,120
pe intrare. Și așa vă puteți imagina

27808
21:46:54,480 --> 21:46:58,800
stratul ascuns este la fel de mare. Fiecare ascuns

27809
21:46:57,120 --> 21:47:00,640
stratul este la fel de mare, dacă nu mai mare. Apoi

27810
21:46:58,800 --> 21:47:01,680
ieșirea va fi acolo este așa

27811
21:47:00,640 --> 21:47:03,120
multe cifre. Știi, este mult.

27812
21:47:01,680 --> 21:47:04,552
Există o cantitate imensă de intrare și

27813
21:47:03,120 --> 21:47:06,080
ieșire. Dar îți arătăm doar,

27814
21:47:04,552 --> 21:47:07,680
știi, va fi greu să arăți într-una

27815
21:47:06,080 --> 21:47:09,120
poza. Și așa apare și asta este

27816
21:47:07,680 --> 21:47:11,192
ceea ce iese în final în ieșire

27817
21:47:09,120 --> 21:47:15,480
întrucât identifică un număr de pe placă.

27818
21:47:11,192 --> 21:47:15,480
Și în acest caz, avem 08-d3858.

27819
21:47:16,080 --> 21:47:20,872
Eroare la ieșire este propagată înapoi

27820
21:47:18,960 --> 21:47:22,872
prin retea si greutatile sunt

27821
21:47:20,872 --> 21:47:24,960
ajustat pentru a minimiza rata de eroare.

27822
21:47:22,872 --> 21:47:27,040
Acesta este calculat printr-o funcție de cost.

27823
21:47:24,960 --> 21:47:28,872
Când ne antrenăm datele, asta este

27824
21:47:27,040 --> 21:47:30,720
ce este folosit și ne vom uita la asta în

27825
21:47:28,872 --> 21:47:33,040
codul când facem antrenamentul de date.

27826
21:47:30,720 --> 21:47:35,512
Deci, avem lucruri la care știm răspunsul

27827
21:47:33,040 --> 21:47:38,480
și apoi transmitem informațiile

27828
21:47:35,512 --> 21:47:40,080
și spune da, a fost corect sau nu,

27829
21:47:38,480 --> 21:47:41,600
pentru că nu uitați că am stabilit la întâmplare toate

27830
21:47:40,080 --> 21:47:43,680
greutăți pentru început. Și dacă este

27831
21:47:41,600 --> 21:47:45,280
greșit, luăm acea eroare. Cât de departe

27832
21:47:43,680 --> 21:47:47,440
esti? Știi, ești pe acolo?

27833
21:47:45,280 --> 21:47:50,160
dacă a fost ca minus unu, ești doar un

27834
21:47:47,440 --> 21:47:51,600
putin depasit. Dacă este ca minus 300

27835
21:47:50,160 --> 21:47:53,192
a fost rezultatul dvs., amintiți-vă când suntem

27836
21:47:51,600 --> 21:47:54,872
Privind acele opțiuni diferite, tu

27837
21:47:53,192 --> 21:47:57,920
știi, hiperbolic sau orice altceva, și suntem

27838
21:47:54,872 --> 21:48:00,080
uitandu-se la putea nu are o

27839
21:47:57,920 --> 21:48:02,000
limita de sus sau de jos. este de fapt doar

27840
21:48:00,080 --> 21:48:04,160
generează un număr. Deci, dacă este departe,

27841
21:48:02,000 --> 21:48:05,440
trebuie să ajustezi mult acele greutăți.

27842
21:48:04,160 --> 21:48:07,192
Dar dacă este destul de aproape, s-ar putea

27843
21:48:05,440 --> 21:48:09,360
reglați greutățile doar puțin.

27844
21:48:07,192 --> 21:48:10,960
Și continui să reglezi greutățile până când

27845
21:48:09,360 --> 21:48:13,440
se potrivesc tuturor antrenamentelor diferite

27846
21:48:10,960 --> 21:48:15,192
modele pe care le-ai pus. Deci s-ar putea să ai 500

27847
21:48:13,440 --> 21:48:17,440
modele de antrenament și acele greutăți vor

27848
21:48:15,192 --> 21:48:19,440
ajustați folosind propagarea înapoi. Ea

27849
21:48:17,440 --> 21:48:21,512
trimite eroarea înapoi. Ieșirea este

27850
21:48:19,440 --> 21:48:23,680
în comparaţie cu rezultatul iniţial şi

27851
21:48:21,512 --> 21:48:25,760
se fac mai multe iterații pentru a obține

27852
21:48:23,680 --> 21:48:27,280
precizie maximă. Deci, nu numai că o face

27853
21:48:25,760 --> 21:48:29,440
uită-te la fiecare, dar trece prin el

27854
21:48:27,280 --> 21:48:31,440
și continuă să meargă cu bicicleta prin acestea

27855
21:48:29,440 --> 21:48:33,680
date efectuând mici modificări în rețea

27856
21:48:31,440 --> 21:48:35,600
până când primește răspunsurile corecte. Cu

27857
21:48:33,680 --> 21:48:38,160
fiecare iterație, greutățile la fiecare

27858
21:48:35,600 --> 21:48:40,000
interconectarea sunt ajustate pe baza

27859
21:48:38,160 --> 21:48:41,832
eroarea. Nu ne vom scufunda în

27860
21:48:40,000 --> 21:48:43,120
acea matematică pentru că este o diferenţială

27861
21:48:41,832 --> 21:48:45,120
ecuație și devine puțin

27862
21:48:43,120 --> 21:48:46,872
complicat, dar voi vorbi puțin

27863
21:48:45,120 --> 21:48:49,120
puțin despre unele dintre opțiunile diferite

27864
21:48:46,872 --> 21:48:51,280
au când ne uităm la cod. Deci,

27865
21:48:49,120 --> 21:48:52,640
am explorat o rețea neuronală. hai sa

27866
21:48:51,280 --> 21:48:55,040
uită-te la diferitele tipuri de

27867
21:48:52,640 --> 21:48:57,192
rețele neuronale artificiale. Și aceasta este

27868
21:48:55,040 --> 21:48:59,192
ca cea mai mare zonă în creștere este cum

27869
21:48:57,192 --> 21:49:02,000
toate acestea vin împreună. Să vedem

27870
21:48:59,192 --> 21:49:03,680
diferite tipuri de rețele neuronale. Şi

27871
21:49:02,000 --> 21:49:06,480
din nou, comparăm asta cu uman

27872
21:49:03,680 --> 21:49:08,480
învăţarea. Deci iată un creier uman. eu

27873
21:49:06,480 --> 21:49:11,360
imi pare rau pentru bietul tip. Deci avem

27874
21:49:08,480 --> 21:49:14,800
un feed pentru rețeaua neuronală directă.

27875
21:49:11,360 --> 21:49:17,192
Cea mai simplă formă de a o numesc ann a

27876
21:49:14,800 --> 21:49:20,000
rețea neuronală. Datele circulă doar într-unul singur

27877
21:49:17,192 --> 21:49:22,640
direcția de intrare la ieșire. Aceasta este ceea ce

27878
21:49:20,000 --> 21:49:24,640
doar ne-am uitat. Deci, pe măsură ce vin datele

27879
21:49:22,640 --> 21:49:26,000
în, toate greutățile sunt adăugate, merge

27880
21:49:24,640 --> 21:49:27,680
la stratul ascuns, toate greutățile sunt

27881
21:49:26,000 --> 21:49:29,040
adăugat, trece la următorul strat ascuns,

27882
21:49:27,680 --> 21:49:31,040
toate greutățile sunt adăugate și merge

27883
21:49:29,040 --> 21:49:34,160
la ieșire. Singura dată când utilizați

27884
21:49:31,040 --> 21:49:35,760
propagarea inversă este de a o antrena. Aşa

27885
21:49:34,160 --> 21:49:37,600
când îl folosești de fapt, este foarte

27886
21:49:35,760 --> 21:49:38,800
repede. Când îl antrenezi, este nevoie

27887
21:49:37,600 --> 21:49:40,400
un timp pentru că trebuie să repete

27888
21:49:38,800 --> 21:49:42,800
prin toate datele tale de antrenament. Iar tu

27889
21:49:40,400 --> 21:49:44,232
începe să intri în big data pentru că tu

27890
21:49:42,800 --> 21:49:45,920
le pot antrena cu o cantitate imensă de

27891
21:49:44,232 --> 21:49:47,280
date. Cu cât introduceți mai multe date, cu atât

27892
21:49:45,920 --> 21:49:49,120
ei sunt mai bine instruiți. The

27893
21:49:47,280 --> 21:49:51,040
aplicații viziune și vorbire

27894
21:49:49,120 --> 21:49:52,640
recunoaștere, de fapt, sunt destul de mult

27895
21:49:51,040 --> 21:49:55,120
tot ceea ce am vorbit foarte mult

27896
21:49:52,640 --> 21:49:57,832
aproape toţi folosesc această formă de

27897
21:49:55,120 --> 21:50:00,320
rețea neuronală la un anumit nivel de bază radio

27898
21:49:57,832 --> 21:50:02,960
funcționarea rețelei neuronale acest model

27899
21:50:00,320 --> 21:50:05,120
clasifică un punct de date pe baza acestuia

27900
21:50:02,960 --> 21:50:07,440
distanta fata de un punct central. Ce aia

27901
21:50:05,120 --> 21:50:09,440
înseamnă că s-ar putea să nu ai

27902
21:50:07,440 --> 21:50:11,600
date de antrenament. Deci vrei să te grupezi

27903
21:50:09,440 --> 21:50:13,192
lucrurile împreună și creați central

27904
21:50:11,600 --> 21:50:14,720
puncte și caută toate lucrurile

27905
21:50:13,192 --> 21:50:16,080
știi că unele dintre aceste lucruri sunt doar

27906
21:50:14,720 --> 21:50:18,160
ca celălalt. Dacă te-ai uitat vreodată

27907
21:50:16,080 --> 21:50:20,080
Sesame Street când eram copil, care se întâlnește

27908
21:50:18,160 --> 21:50:21,600
eu. Deci, aduce lucrurile împreună și

27909
21:50:20,080 --> 21:50:23,040
aceasta este o modalitate grozavă dacă nu aveți

27910
21:50:21,600 --> 21:50:24,552
modelul de antrenament potrivit, poți începe

27911
21:50:23,040 --> 21:50:25,920
să găsești lucruri care te conectează

27912
21:50:24,552 --> 21:50:29,040
s-ar putea să nu fi observat înainte.

27913
21:50:25,920 --> 21:50:30,872
Aplicații sisteme de restabilire a energiei electrice.

27914
21:50:29,040 --> 21:50:33,040
Ei încearcă să descopere ce este conectat

27915
21:50:30,872 --> 21:50:35,192
și apoi pe baza asta pot repara

27916
21:50:33,040 --> 21:50:38,080
problemă dacă aveți un sistem de alimentare mare.

27917
21:50:35,192 --> 21:50:40,720
 și rețeaua neuronală auto-organizată

27918
21:50:38,080 --> 21:50:43,920
sunt introduși vectori de dimensiuni aleatorii

27919
21:50:40,720 --> 21:50:46,000
la o hartă discretă compusă din neuroni. Deci

27920
21:50:43,920 --> 21:50:48,800
practic găsesc o modalitate de a le desena

27921
21:50:46,000 --> 21:50:51,040
numiți-le ei spun dimensiuni sau vectori

27922
21:50:48,800 --> 21:50:53,120
sau avioane pentru că de fapt toacă

27923
21:50:51,040 --> 21:50:55,120
date într-o dimensiune, două dimensiuni,

27924
21:50:53,120 --> 21:50:56,800
trei dimensiuni, patru, cinci, șase. Ei

27925
21:50:55,120 --> 21:50:58,480
continuă să adaugi dimensiuni și să găsești căi

27926
21:50:56,800 --> 21:51:00,000
pentru a separa datele și a conecta

27927
21:50:58,480 --> 21:51:02,160
diferite bucăți de date împreună.

27928
21:51:00,000 --> 21:51:04,720
Aplicații utilizate pentru recunoașterea tiparelor

27929
21:51:02,160 --> 21:51:07,120
în date ca în analiza medicală. The

27930
21:51:04,720 --> 21:51:09,360
stratul ascuns își salvează rezultatul pentru a fi utilizat

27931
21:51:07,120 --> 21:51:11,832
pentru prognoza viitoare. Neural recurent

27932
21:51:09,360 --> 21:51:13,832
retelelor. Deci straturile ascunse își amintesc

27933
21:51:11,832 --> 21:51:16,080
ieșirea sa de ultima dată și asta

27934
21:51:13,832 --> 21:51:18,320
devine parte din noua sa intrare. Uh tu

27935
21:51:16,080 --> 21:51:19,920
ar putea folosi asta în special în robotică sau

27936
21:51:18,320 --> 21:51:22,480
zburând cu o dronă. Vrei să știi ce

27937
21:51:19,920 --> 21:51:24,232
ultima ta schimbare a fost și cât de repede a fost

27938
21:51:22,480 --> 21:51:25,760
te va ajuta să prezici ce urmează

27939
21:51:24,232 --> 21:51:27,120
schimbarea pe care trebuie să o faci este să ajungi la

27940
21:51:25,760 --> 21:51:30,000
unde vrea să meargă drona.

27941
21:51:27,120 --> 21:51:31,440
Aplicații conversație text în vorbire

27942
21:51:30,000 --> 21:51:33,680
model. Deci, știi, am vorbit despre

27943
21:51:31,440 --> 21:51:36,640
drone, dar știi, doar identificarea

27944
21:51:33,680 --> 21:51:38,800
pe Lexus sau Google Assistant sau oricare dintre acestea

27945
21:51:36,640 --> 21:51:41,680
acestea, încep să adauge în I'd

27946
21:51:38,800 --> 21:51:44,400
îmi place să cânt un cântec pe Pandora mea și

27947
21:51:41,680 --> 21:51:45,832
Mi-ar plăcea să fie la volum 90%. Deci, tu

27948
21:51:44,400 --> 21:51:47,832
acum pot adăuga lucruri diferite acolo,

27949
21:51:45,832 --> 21:51:50,000
și le leagă între ele. Intrarea

27950
21:51:47,832 --> 21:51:51,832
caracteristicile sunt luate în loturi, cum ar fi a

27951
21:51:50,000 --> 21:51:54,552
filtrul. Acest lucru permite unei rețele să

27952
21:51:51,832 --> 21:51:57,280
amintiți-vă o imagine în părți. Convoluție

27953
21:51:54,552 --> 21:51:59,600
rețea neuronală. lumea de azi în fotografie

27954
21:51:57,280 --> 21:52:00,800
identificarea și demontarea fotografiilor

27955
21:51:59,600 --> 21:52:02,640
și încercând să știi că ai vreodată

27956
21:52:00,800 --> 21:52:04,320
am văzut asta pe Google unde ai cinci

27957
21:52:02,640 --> 21:52:06,640
oameni împreună, acesta este genul de

27958
21:52:04,320 --> 21:52:08,160
Lucrul îi separă pe toți acei oameni, așa că atunci

27959
21:52:06,640 --> 21:52:10,320
poate face o recunoaștere a feței pentru fiecare

27960
21:52:08,160 --> 21:52:12,400
aplicații de persoană utilizate în semnal și

27961
21:52:10,320 --> 21:52:14,872
procesarea imaginii in acest caz o folosesc

27962
21:52:12,400 --> 21:52:17,512
imagini faciale sau imagini Google picture

27963
21:52:14,872 --> 21:52:20,000
ca una dintre opțiunile neuronale modulare

27964
21:52:17,512 --> 21:52:22,232
rețea are o colecție de diferite

27965
21:52:20,000 --> 21:52:24,480
rețelele neuronale care lucrează împreună pentru a obține

27966
21:52:22,232 --> 21:52:26,320
ieșirea așa că wow tocmai am trecut

27967
21:52:24,480 --> 21:52:28,960
toate aceste tipuri diferite de neuronale

27968
21:52:26,320 --> 21:52:30,872
retelelor. Iar finalul este de a pune

27969
21:52:28,960 --> 21:52:32,080
mai multe rețele neuronale împreună. eu

27970
21:52:30,872 --> 21:52:34,320
am menționat asta puțin când noi

27971
21:52:32,080 --> 21:52:36,400
oameni despărțiți într-o fotografie mai mare și

27972
21:52:34,320 --> 21:52:38,232
indivizii din fotografie și apoi faceți

27973
21:52:36,400 --> 21:52:40,640
recunoașterea facială pe fiecare persoană. Aşa

27974
21:52:38,232 --> 21:52:43,040
se foloseşte o singură reţea pentru a le separa şi

27975
21:52:40,640 --> 21:52:44,320
următoarea rețea este apoi folosită pentru a figura

27976
21:52:43,040 --> 21:52:46,552
afla cine sunt ei și fac masajul facial

27977
21:52:44,320 --> 21:52:48,960
recunoaștere. Aplicații încă

27978
21:52:46,552 --> 21:52:51,192
în curs de cercetare. Aceasta este o tăietură

27979
21:52:48,960 --> 21:52:53,600
marginea. auzi termenul conductă și

27980
21:52:51,192 --> 21:52:55,600
există real în codul Python și în

27981
21:52:53,600 --> 21:52:57,440
aproape toate rețelele neuronale diferite

27982
21:52:55,600 --> 21:52:59,600
setup-uri acolo au acum un

27983
21:52:57,440 --> 21:53:02,000
caracteristica conductei de obicei și doar

27984
21:52:59,600 --> 21:53:04,320
înseamnă că iei datele de la un neural

27985
21:53:02,000 --> 21:53:05,832
rețea și poate o altă rețea neuronală

27986
21:53:04,320 --> 21:53:07,360
sau îl pui în următorul neural

27987
21:53:05,832 --> 21:53:09,360
rețea și apoi iei trei sau patru

27988
21:53:07,360 --> 21:53:11,120
alte rețele neuronale și le alimentează

27989
21:53:09,360 --> 21:53:13,600
altul. Deci, cum conectăm

27990
21:53:11,120 --> 21:53:15,920
rețelele neuronale sunt într-adevăr doar tăiate

27991
21:53:13,600 --> 21:53:17,680
margine și este atât de experimental. Adică

27992
21:53:15,920 --> 21:53:19,280
este aproape creativ prin natura sa.

27993
21:53:17,680 --> 21:53:22,160
Nu există cu adevărat o știință în asta

27994
21:53:19,280 --> 21:53:23,760
deoarece fiecare domeniu specific are

27995
21:53:22,160 --> 21:53:25,192
diferite lucruri la care se uită. Deci dacă

27996
21:53:23,760 --> 21:53:27,040
ești în domeniul bancar, merge

27997
21:53:25,192 --> 21:53:29,280
să fie diferit de domeniul medical

27998
21:53:27,040 --> 21:53:31,040
decât domeniul mașinii automate. Şi

27999
21:53:29,280 --> 21:53:33,192
dându-și brusc seama cum se potrivesc toate acestea

28000
21:53:31,040 --> 21:53:35,360
împreună este doar foarte distractiv și cu adevărat

28001
21:53:33,192 --> 21:53:37,360
misto. Deci avem tipurile noastre de artificiale

28002
21:53:35,360 --> 21:53:39,440
rețea neuronală. Avem feed forward

28003
21:53:37,360 --> 21:53:40,960
rețea neuronală. Avem o bază radială

28004
21:53:39,440 --> 21:53:43,760
funcționarea rețelei neuronale. Avem al nostru

28005
21:53:40,960 --> 21:53:46,320
Rețeaua neuronală auto-organizată Cohen,

28006
21:53:43,760 --> 21:53:48,640
rețea neuronală recurentă, convoluție

28007
21:53:46,320 --> 21:53:49,832
rețea neuronală și neuron modular

28008
21:53:48,640 --> 21:53:52,000
rețea unde le aduce pe toate

28009
21:53:49,832 --> 21:53:53,920
împreună. Și nu culorile de pe

28010
21:53:52,000 --> 21:53:56,960
creierul nu se potrivește cu creierul tău

28011
21:53:53,920 --> 21:53:58,960
de fapt, dar o scot la iveală

28012
21:53:56,960 --> 21:54:00,872
că cele mai multe dintre acestea au fost dezvoltate de

28013
21:53:58,960 --> 21:54:02,720
înțelegerea modului în care oamenii învață. Și ca

28014
21:54:00,872 --> 21:54:05,192
înțelegem din ce în ce mai mult cum

28015
21:54:02,720 --> 21:54:07,760
oamenii învață, putem construi ceva în

28016
21:54:05,192 --> 21:54:09,600
industria calculatoarelor să imite asta, să

28017
21:54:07,760 --> 21:54:12,160
reflecta asta. Și așa erau acestea

28018
21:54:09,600 --> 21:54:13,832
dezvoltat. Parte atât de interesantă, caz de utilizare

28019
21:54:12,160 --> 21:54:15,600
enunțul problemei. Deci aici este locul în care noi

28020
21:54:13,832 --> 21:54:18,000
sari inauntru. Aceasta este partea mea preferata. hai sa

28021
21:54:15,600 --> 21:54:19,920
utilizați sistemul pentru a identifica între o pisică

28022
21:54:18,000 --> 21:54:21,600
si un caine. Dacă vă amintiți bine, eu

28023
21:54:19,920 --> 21:54:24,000
a spus că vom face niște cod Python.

28024
21:54:21,600 --> 21:54:25,600
Și puteți vedea aici, părul meu este

28025
21:54:24,000 --> 21:54:27,440
cam lipit de computer,

28026
21:54:25,600 --> 21:54:29,440
ceașcă de cafea pe o parte și puțin

28027
21:54:27,440 --> 21:54:31,120
un pic de școală veche. Un creion și un pix pe

28028
21:54:29,440 --> 21:54:33,512
cealaltă parte. Da, majoritatea oamenilor acum

28029
21:54:31,120 --> 21:54:35,280
ia notite. Îmi plac stickies-urile de pe

28030
21:54:33,512 --> 21:54:37,440
calculator. Grozav. Asta este

28031
21:54:35,280 --> 21:54:39,120
calculatorul meu. Am note lipicioase pe mine

28032
21:54:37,440 --> 21:54:41,512
computer în diferite culori. Deci, nu

28033
21:54:39,120 --> 21:54:43,760
prea departe de programatorul de astăzi. Deci,

28034
21:54:41,512 --> 21:54:46,160
problema este că vrem să clasificăm

28035
21:54:43,760 --> 21:54:48,640
fotografii cu pisici și câini folosind un neural

28036
21:54:46,160 --> 21:54:50,480
rețea. Și puteți vedea aici noi

28037
21:54:48,640 --> 21:54:53,192
au o varietate de câini în

28038
21:54:50,480 --> 21:54:55,120
poze și pisici și știi doar

28039
21:54:53,192 --> 21:54:56,872
a rezolva că este o pisică este drăguț

28040
21:54:55,120 --> 21:54:58,000
uimitor. Și de ce ar vrea cineva

28041
21:54:56,872 --> 21:55:00,480
chiar știi diferența dintre o pisică

28042
21:54:58,000 --> 21:55:02,160
si un caine? Bine, știi de ce? Ei bine, eu

28043
21:55:00,480 --> 21:55:05,040
au o ușă pentru pisici. Ar fi cam distractiv

28044
21:55:02,160 --> 21:55:06,552
că în loc să identifice, în schimb

28045
21:55:05,040 --> 21:55:08,480
de a avea ca un guler mic cu o

28046
21:55:06,552 --> 21:55:10,160
magnet pe el, care este ceea ce are pisica mea,

28047
21:55:08,480 --> 21:55:11,832
ușa ar putea vedea, oh,

28048
21:55:10,160 --> 21:55:13,680
asta e pisica. Asta e pisica noastră care vine

28049
21:55:11,832 --> 21:55:15,360
înăuntru. Oh, acesta este câinele. Avem un câine,

28050
21:55:13,680 --> 21:55:16,720
prea. Este un câine pe care vreau să-l las să intre.

28051
21:55:15,360 --> 21:55:18,640
Poate că nu vreau să-l las pe celălalt

28052
21:55:16,720 --> 21:55:19,920
animal în cauză că este un raton. Deci, tu

28053
21:55:18,640 --> 21:55:21,832
poti vedea unde ai putea sa-l duci pe acesta

28054
21:55:19,920 --> 21:55:23,120
pas mai departe și aplicați efectiv acest lucru.

28055
21:55:21,832 --> 21:55:25,440
Chiar ai putea începe puțin

28056
21:55:23,120 --> 21:55:28,000
idee de companie startup, care se identifică

28057
21:55:25,440 --> 21:55:30,800
usa. Deci, acest caz de utilizare va fi

28058
21:55:28,000 --> 21:55:33,832
implementat pe Python. sunt de fapt in

28059
21:55:30,800 --> 21:55:35,360
Python 3.6. Întotdeauna e plăcut să spui

28060
21:55:33,832 --> 21:55:37,280
oamenii versiunea Python pentru că

28061
21:55:35,360 --> 21:55:38,800
care afectează uneori care module

28062
21:55:37,280 --> 21:55:40,640
incarci si tot. Și mergem

28063
21:55:38,800 --> 21:55:42,400
pentru a începe prin importul necesar

28064
21:55:40,640 --> 21:55:44,640
pachete. Ți-am spus că o să facem

28065
21:55:42,400 --> 21:55:48,080
asta în Kass. Deci vom importa

28066
21:55:44,640 --> 21:55:51,680
din modelele KAS secvenţiale din Kass

28067
21:55:48,080 --> 21:55:55,280
conversie straturi 2D sau COV2D max

28068
21:55:51,680 --> 21:55:56,720
reunirea 2D aplatizată și densă. Și vom face

28069
21:55:55,280 --> 21:55:58,720
vorbiți despre ceea ce face fiecare dintre aceștia

28070
21:55:56,720 --> 21:56:00,080
doar o secundă. Dar înainte de a face asta,

28071
21:55:58,720 --> 21:56:01,832
hai sa vorbim putin despre

28072
21:56:00,080 --> 21:56:03,192
mediul în care vom lucra. Și

28073
21:56:01,832 --> 21:56:06,000
știi, de fapt, lasă-mă să merg înainte

28074
21:56:03,192 --> 21:56:07,512
și deschide un site web, al lui KASS

28075
21:56:06,000 --> 21:56:09,680
site-ul web, ca să putem învăța puțin

28076
21:56:07,512 --> 21:56:14,080
mai multe despre KASS. Deci iată-ne pe

28077
21:56:09,680 --> 21:56:16,000
Site-ul Kurass și este uh ke.io.

28078
21:56:14,080 --> 21:56:17,360
Acesta este site-ul oficial pentru Kurass.

28079
21:56:16,000 --> 21:56:20,160
Și primul lucru pe care îl vei observa este

28080
21:56:17,360 --> 21:56:23,192
că Kurass aleargă peste oricare

28081
21:56:20,160 --> 21:56:25,040
TensorFlow, CNTK și cred că este

28082
21:56:23,192 --> 21:56:27,512
rostit Thano sau Theo. Ce este

28083
21:56:25,040 --> 21:56:28,872
important aici este că TensorFlow și

28084
21:56:27,512 --> 21:56:30,320
la fel este valabil pentru toate acestea, dar

28085
21:56:28,872 --> 21:56:32,800
TensorFlow este probabil unul dintre cele mai multe

28086
21:56:30,320 --> 21:56:34,640
utilizate pe scară largă în prezent pachete acolo

28087
21:56:32,800 --> 21:56:36,000
cu KAS. Și bineînțeles, știi,

28088
21:56:34,640 --> 21:56:37,360
mâine totul se va schimba.

28089
21:56:36,000 --> 21:56:38,800
Totul va dispărea și ei vor dispărea

28090
21:56:37,360 --> 21:56:40,232
ai ceva nou acolo. Deci, face

28091
21:56:38,800 --> 21:56:42,640
sigur că atunci când înveți acest cod

28092
21:56:40,232 --> 21:56:44,160
înțelegi ce se întâmplă și de asemenea

28093
21:56:42,640 --> 21:56:45,360
cunoaste codul. Adică, uite, când tu

28094
21:56:44,160 --> 21:56:46,800
uită-te la cod, nu este ca

28095
21:56:45,360 --> 21:56:48,480
complicat odată ce înțelegi ce este

28096
21:56:46,800 --> 21:56:50,640
merge mai departe. Codul în sine este frumos

28097
21:56:48,480 --> 21:56:52,720
direct. Și motivul pentru care ne place

28098
21:56:50,640 --> 21:56:54,320
KAS și motivul pentru care oamenii sunt

28099
21:56:52,720 --> 21:56:56,320
sări pe el chiar acum, e atât de mare

28100
21:56:54,320 --> 21:56:58,000
treaba este dacă venim aici, lasă-mă

28101
21:56:56,320 --> 21:57:00,160
derulează doar puțin în jos. Ei vorbesc

28102
21:56:58,000 --> 21:57:02,800
despre ușurința de utilizare, modularitate,

28103
21:57:00,160 --> 21:57:04,320
extensibilitate ușoară, lucrați cu Python.

28104
21:57:02,800 --> 21:57:06,400
Python este unul mare pentru că multe

28105
21:57:04,320 --> 21:57:08,232
oamenii din știința datelor folosesc acum Python,

28106
21:57:06,400 --> 21:57:10,232
deși poți accesa de fapt Kass

28107
21:57:08,232 --> 21:57:12,720
alte moduri. Dacă vom continua aici

28108
21:57:10,232 --> 21:57:14,400
este straturi. Și aici ajunge

28109
21:57:12,720 --> 21:57:16,800
foarte tare. Când lucrăm cu

28110
21:57:14,400 --> 21:57:18,000
KASS, adaugi doar straturi. Ține minte

28111
21:57:16,800 --> 21:57:21,040
acele straturi ascunse de care vorbeam

28112
21:57:18,000 --> 21:57:22,480
despre? Și am vorbit despre reelu

28113
21:57:21,040 --> 21:57:24,480
activare. Puteți vedea chiar aici. Lasă

28114
21:57:22,480 --> 21:57:27,040
Eu doar am mărit un pic.

28115
21:57:24,480 --> 21:57:29,832
Iată-ne. Asta e mare. Pot adăuga într-un

28116
21:57:27,040 --> 21:57:31,920
eelu strat. Și apoi pot adăuga o

28117
21:57:29,832 --> 21:57:33,760
stratul softmax în următoarea instanță. Noi

28118
21:57:31,920 --> 21:57:35,920
nu am vorbit despre softmax. Deci poți face

28119
21:57:33,760 --> 21:57:38,552
fiecare strat separat. Acum dacă lucrez

28120
21:57:35,920 --> 21:57:40,960
în unele dintre celelalte truse pe care le folosesc, le iau

28121
21:57:38,552 --> 21:57:42,872
asta și am o configurație și apoi eu

28122
21:57:40,960 --> 21:57:44,400
alimentați rezultatul în următorul. Aceasta

28123
21:57:42,872 --> 21:57:45,440
unul după care pot adăuga un strat ascuns

28124
21:57:44,400 --> 21:57:47,600
strat ascuns cu diferit

28125
21:57:45,440 --> 21:57:50,080
informații din el, ceea ce o face foarte

28126
21:57:47,600 --> 21:57:52,160
puternic și foarte rapid de rotit și

28127
21:57:50,080 --> 21:57:53,600
încercați diferite configurații și vedeți cum

28128
21:57:52,160 --> 21:57:54,960
lucrați cu datele la care lucrați.

28129
21:57:53,600 --> 21:57:57,120
Și vom săpă puțin mai adânc

28130
21:57:54,960 --> 21:57:58,640
aici. Și multe dintre acestea sunt foarte mult

28131
21:57:57,120 --> 21:58:01,040
la fel. Așa că, când ajungem la acea parte, o voi face

28132
21:57:58,640 --> 21:58:03,600
arata asta si tie. Acum doar un

28133
21:58:01,040 --> 21:58:05,192
notă secundară rapidă, folosesc Anaconda cu

28134
21:58:03,600 --> 21:58:07,120
Python în el. Și am mers înainte și

28135
21:58:05,192 --> 21:58:09,760
mi-am creat propriul pachet și l-am sunat

28136
21:58:07,120 --> 21:58:12,080
Kass Python 36 pentru că sunt în Python

28137
21:58:09,760 --> 21:58:13,600
36. Anaconda este cool pe care o poți crea

28138
21:58:12,080 --> 21:58:14,720
diferite medii cu adevărat ușor. Dacă

28139
21:58:13,600 --> 21:58:16,000
faci multe lucruri diferite

28140
21:58:14,720 --> 21:58:17,680
experimentând cu acestea diferite

28141
21:58:16,000 --> 21:58:19,760
pachete, probabil că doriți să vă creați

28142
21:58:17,680 --> 21:58:21,040
propriul mediu acolo. Și primul

28143
21:58:19,760 --> 21:58:22,800
lucru, după cum puteți vedea chiar aici,

28144
21:58:21,040 --> 21:58:24,480
sunt multe dependențe. Multe

28145
21:58:22,800 --> 21:58:26,400
pe acestea ar trebui să le recunoașteți până acum dacă

28146
21:58:24,480 --> 21:58:28,640
ați făcut oricare dintre aceste videoclipuri. Daca nu,

28147
21:58:26,400 --> 21:58:32,232
felicitări pentru tine pentru că ai sărit astăzi. PIP,

28148
21:58:28,640 --> 21:58:34,720
instala, numpy, sci, scikitlearn,

28149
21:58:32,232 --> 21:58:37,440
pernă și h5py

28150
21:58:34,720 --> 21:58:39,192
sunt ambele necesare pentru fluxul tensor și

28151
21:58:37,440 --> 21:58:41,120
apoi punând Kass-ul acolo. Și apoi

28152
21:58:39,192 --> 21:58:42,872
veți vedea aici uh și Pip este doar a

28153
21:58:41,120 --> 21:58:44,720
programul de instalare standard cu care îl utilizați

28154
21:58:42,872 --> 21:58:46,640
Python. Veți vedea aici că am făcut pip

28155
21:58:44,720 --> 21:58:48,800
instalați TensorFlow de când vom face acest lucru

28156
21:58:46,640 --> 21:58:50,480
faceți KAS peste TensorFlow. Și apoi

28157
21:58:48,800 --> 21:58:52,960
pip install și am mers înainte și am folosit

28158
21:58:50,480 --> 21:58:55,120
GitHub-ul. Deci, git plusgit și vei

28159
21:58:52,960 --> 21:58:56,960
vezi aici github.com. Acesta este unul dintre

28160
21:58:55,120 --> 21:58:58,480
lansările lor, una dintre cele mai actuale

28161
21:58:56,960 --> 21:58:59,920
eliberare pe acolo care merge deasupra

28162
21:58:58,480 --> 21:59:01,600
TensorFlow. Și le poți căuta pe acestea

28163
21:58:59,920 --> 21:59:04,232
instrucțiuni aproape oriunde. Aceasta

28164
21:59:01,600 --> 21:59:05,600
este pentru a face asta pe Anaconda. Desigur

28165
21:59:04,232 --> 21:59:07,680
ați dori să le instalați dacă sunteți

28166
21:59:05,600 --> 21:59:09,120
făcând-o în configurarea serverului Iuntu. tu

28167
21:59:07,680 --> 21:59:11,760
ai vrea să obții, nu cred că ai nevoie

28168
21:59:09,120 --> 21:59:12,800
H5 py și aru, dar aveți nevoie de

28169
21:59:11,760 --> 21:59:14,320
odihnește-te acolo pentru că sunt

28170
21:59:12,800 --> 21:59:15,832
dependențe acolo și e drăguț

28171
21:59:14,320 --> 21:59:17,512
simplu și asta este de fapt în

28172
21:59:15,832 --> 21:59:18,960
unele dintre instrucțiunile pe care le au

28173
21:59:17,512 --> 21:59:19,920
site-ul lor, astfel încât să nu fie nevoie

28174
21:59:18,960 --> 21:59:21,760
trece neapărat prin asta

28175
21:59:19,920 --> 21:59:24,960
amintiți-vă site-ul lor acolo și apoi

28176
21:59:21,760 --> 21:59:26,552
când sunt sub navigatorul meu Anaconda

28177
21:59:24,960 --> 21:59:28,400
care imi place o sa vezi unde am

28178
21:59:26,552 --> 21:59:30,552
medii și în partea de jos am creat

28179
21:59:28,400 --> 21:59:32,872
un mediu nou și l-am numit KAS

28180
21:59:30,552 --> 21:59:35,512
Python 36 doar pentru a separa totul

28181
21:59:32,872 --> 21:59:37,440
poți spune că am Python 3.5 și Python

28182
21:59:35,512 --> 21:59:39,280
36 Am avut o grămadă de altele,

28183
21:59:37,440 --> 21:59:41,280
dar a cam curățat casa recent.

28184
21:59:39,280 --> 21:59:43,600
Și, desigur, odată ce intru aici, pot

28185
21:59:41,280 --> 21:59:45,280
lansează-mi Jupyter Notebook, asigurându-mă

28186
21:59:43,600 --> 21:59:47,760
Folosesc mediul potrivit pe care eu

28187
21:59:45,280 --> 21:59:50,232
doar configurat. Aceasta, desigur, se deschide

28188
21:59:47,760 --> 21:59:52,320
um, în acest caz, folosesc Google

28189
21:59:50,232 --> 21:59:54,640
Chrome. Și aici, aș putea merge și doar

28190
21:59:52,320 --> 21:59:56,960
creați un nou document aici. Și asta

28191
21:59:54,640 --> 21:59:58,872
este totul în fereastra browserului dvs. când

28192
21:59:56,960 --> 22:00:01,832
folosești Anaconda. Trebuie sa folosesti

28193
21:59:58,872 --> 22:00:03,832
Caietul Anaconda și Jupyter? Nu. Tu

28194
22:00:01,832 --> 22:00:05,600
poate folosi orice fel de editor Python,

28195
22:00:03,832 --> 22:00:07,760
indiferent de configurația cu care vă simțiți confortabil

28196
22:00:05,600 --> 22:00:09,760
și orice faci acolo. Deci,

28197
22:00:07,760 --> 22:00:11,760
hai să mergem înainte și să intrăm aici și să lipim

28198
22:00:09,760 --> 22:00:14,080
codul în. Și importăm un

28199
22:00:11,760 --> 22:00:16,320
număr de setări diferite aici. Noi

28200
22:00:14,080 --> 22:00:17,680
au import secvenţial. Asta e sub

28201
22:00:16,320 --> 22:00:19,192
modele pentru că acesta este modelul care suntem

28202
22:00:17,680 --> 22:00:21,760
urmând a folosi până la nivelul nostru neuronal

28203
22:00:19,192 --> 22:00:24,960
reţea. Și apoi avem straturi și noi

28204
22:00:21,760 --> 22:00:27,360
au conversie 2D, pooling maxim 2D,

28205
22:00:24,960 --> 22:00:29,360
aplatiza dens. Și de fapt poți doar

28206
22:00:27,360 --> 22:00:31,040
ghiciți ce fac acestea. Suntem

28207
22:00:29,360 --> 22:00:32,640
vorbim că lucrăm în 2D

28208
22:00:31,040 --> 22:00:35,360
fotografie. Și dacă îți amintești

28209
22:00:32,640 --> 22:00:37,600
corect, am vorbit despre modul real

28210
22:00:35,360 --> 22:00:39,440
stratul de intrare este o singură matrice. Nu este

28211
22:00:37,600 --> 22:00:41,440
în două dimensiuni. Este o singură dimensiune.

28212
22:00:39,440 --> 22:00:43,280
Tot ce fac acestea este că acestea sunt instrumente de ajutor

28213
22:00:41,440 --> 22:00:44,800
aplatiza imaginea. Deci, este nevoie de o

28214
22:00:43,280 --> 22:00:46,800
imagine bidimensională și apoi ea

28215
22:00:44,800 --> 22:00:48,080
își creează propria configurație adecvată. Tu nu

28216
22:00:46,800 --> 22:00:49,192
trebuie să vă faceți griji în legătură cu toate acestea. tu

28217
22:00:48,080 --> 22:00:51,120
nu trebuie să faci nimic special cu

28218
22:00:49,192 --> 22:00:52,640
fotografia. L-ai lăsat pe carass să facă

28219
22:00:51,120 --> 22:00:53,920
ea. Și vom rula asta. Şi

28220
22:00:52,640 --> 22:00:55,360
veți vedea chiar aici că au câteva

28221
22:00:53,920 --> 22:00:56,872
lucruri care vor fi amortizate

28222
22:00:55,360 --> 22:00:58,640
și schimbat pentru că asta face.

28223
22:00:56,872 --> 22:01:00,160
Totul se schimbă pe măsură ce mergem. tu

28224
22:00:58,640 --> 22:01:01,680
nu trebuie să vă faceți prea multe griji pentru asta.

28225
22:01:00,160 --> 22:01:03,120
Dacă aveți avertismente, dacă îl rulați a

28226
22:01:01,680 --> 22:01:04,720
a doua oară, avertismentul va dispărea.

28227
22:01:03,120 --> 22:01:07,360
Și asta tocmai le-a importat

28228
22:01:04,720 --> 22:01:08,720
pachete pe care să le folosim noi. Jupiter e frumos

28229
22:01:07,360 --> 22:01:10,960
despre asta că poți face fiecare lucru

28230
22:01:08,720 --> 22:01:13,192
pas cu pas. Și voi merge înainte și de asemenea

28231
22:01:10,960 --> 22:01:14,480
măriți acolo. Puțin plus de control.

28232
22:01:13,192 --> 22:01:17,120
Acesta este unul dintre lucrurile frumoase despre

28233
22:01:14,480 --> 22:01:20,000
fiind într-un mediu de browser. Deci, aici

28234
22:01:17,120 --> 22:01:21,192
ne-am întors. Încă o înghițitură de cafea. Dacă

28235
22:01:20,000 --> 22:01:23,040
ești familiarizat cu celelalte videoclipuri ale mele,

28236
22:01:21,192 --> 22:01:24,720
ai observat că sorb mereu cafea. eu

28237
22:01:23,040 --> 22:01:26,640
au întotdeauna un latte în cazul meu lângă

28238
22:01:24,720 --> 22:01:28,640
eu, un espresso. Deci următorul pas este să

28239
22:01:26,640 --> 22:01:31,680
mergeți mai departe și inițializați. Vom merge

28240
22:01:28,640 --> 22:01:33,440
numiți-o CNN sau clasificator neural

28241
22:01:31,680 --> 22:01:34,872
rețea. Și motivul pentru care îl numim a

28242
22:01:33,440 --> 22:01:36,720
clasificatorul este pentru că va

28243
22:01:34,872 --> 22:01:38,480
clasifică-l între două lucruri. Este

28244
22:01:36,720 --> 22:01:40,960
va fi pisica sau caine. Deci când ești

28245
22:01:38,480 --> 22:01:43,280
făcând clasificare, alegi

28246
22:01:40,960 --> 22:01:45,440
obiecte specifice. Ești specific. Este

28247
22:01:43,280 --> 22:01:48,000
un adevărat sau fals. Da, nu. Este

28248
22:01:45,440 --> 22:01:50,000
ceva sau nu este. Deci primul lucru

28249
22:01:48,000 --> 22:01:51,920
vom crea clasificatorul nostru și

28250
22:01:50,000 --> 22:01:54,480
va fi egal secvenţial. Deci lor

28251
22:01:51,920 --> 22:01:56,160
configurația secvențială este clasificatorul.

28252
22:01:54,480 --> 22:01:58,080
Acesta este modelul real pe care îl folosim.

28253
22:01:56,160 --> 22:02:01,360
Asta e rețeaua neuronală. Așa că o numim

28254
22:01:58,080 --> 22:02:03,920
un clasificator. Și următorul pas este să

28255
22:02:01,360 --> 22:02:06,080
adăugați în circumvoluția noastră. Și lasă-mă doar

28256
22:02:03,920 --> 22:02:07,680
lasă-mă să-l micșorez în dimensiune

28257
22:02:06,080 --> 22:02:09,040
astfel încât să puteți vedea întreaga linie. Și haideți

28258
22:02:07,680 --> 22:02:11,512
vorbiți puțin despre ce se întâmplă

28259
22:02:09,040 --> 22:02:13,920
aici. Am clasificatorul meu și adaug

28260
22:02:11,512 --> 22:02:16,232
ceva. Ce adaug? Ei bine, eu sunt

28261
22:02:13,920 --> 22:02:18,640
adăugând primul meu strat. Acest prim strat

28262
22:02:16,232 --> 22:02:20,552
adăugăm, probabil, cel care

28263
22:02:18,640 --> 22:02:22,480
ia cea mai mare muncă pentru a te asigura

28264
22:02:20,552 --> 22:02:24,320
pune-l corect. Și motivul pentru care eu

28265
22:02:22,480 --> 22:02:25,832
spune că aceasta este intrarea ta reală.

28266
22:02:24,320 --> 22:02:30,552
Și vom sări aici la rol

28267
22:02:25,832 --> 22:02:32,800
care spune că forma de intrare este egală cu 64x 64x3.

28268
22:02:30,552 --> 22:02:35,192
Ce înseamnă asta? Ei bine, asta înseamnă

28269
22:02:32,800 --> 22:02:36,720
că pozele noastre vin. Și mai sunt

28270
22:02:35,192 --> 22:02:40,080
aceste poze. Amintiți-vă că am avut ca

28271
22:02:36,720 --> 22:02:43,512
Poza mașinii era de 128x128 pixeli.

28272
22:02:40,080 --> 22:02:46,480
Ei bine, acesta are 64x64 pixeli. Şi

28273
22:02:43,512 --> 22:02:48,400
fiecare pixel are trei valori. Asta e

28274
22:02:46,480 --> 22:02:50,720
de unde provin aceste numere. Și este

28275
22:02:48,400 --> 22:02:52,080
atât de important încât asta se potrivește. eu

28276
22:02:50,720 --> 22:02:53,920
a menționat puțin că dacă ai

28277
22:02:52,080 --> 22:02:56,400
ca o imagine mai mare, trebuie

28278
22:02:53,920 --> 22:02:58,480
reformatați-l pentru a se potrivi cu această formă. Dacă este

28279
22:02:56,400 --> 22:03:00,640
apare ca ceva mai mare, nu există

28280
22:02:58,480 --> 22:03:02,000
note de intrare. Nu există nicio intrare neuronală

28281
22:03:00,640 --> 22:03:03,832
rețeaua de acolo care se va ocupa de asta

28282
22:03:02,000 --> 22:03:06,080
spatiu suplimentar. Deci, trebuie să te remodelezi

28283
22:03:03,832 --> 22:03:07,680
datele dvs. să se încadreze aici. Acum, primul

28284
22:03:06,080 --> 22:03:10,400
stratul este cel mai important deoarece

28285
22:03:07,680 --> 22:03:12,080
după aceea, KAS știe care este forma ta

28286
22:03:10,400 --> 22:03:15,280
venind aici și știe ce este

28287
22:03:12,080 --> 22:03:17,040
ieșire și așa că stabilește cu adevărat

28288
22:03:15,280 --> 22:03:19,360
etapa. Cel mai important lucru este că

28289
22:03:17,040 --> 22:03:20,872
forma de intrare se potrivește cu datele primite.

28290
22:03:19,360 --> 22:03:22,232
Și vei primi o mulțime de erori dacă asta

28291
22:03:20,872 --> 22:03:24,232
nu. Vei trece pe acolo și

28292
22:03:22,232 --> 22:03:26,320
poza numărul 55 nu se potrivește cu ea

28293
22:03:24,232 --> 22:03:27,760
corect. Și ghiciți ce face? Ea

28294
22:03:26,320 --> 22:03:29,680
de obicei iti da o eroare. Și apoi

28295
22:03:27,760 --> 22:03:31,512
activare, dacă vă amintiți, am vorbit

28296
22:03:29,680 --> 22:03:34,160
despre diferitele activări de aici.

28297
22:03:31,512 --> 22:03:36,720
Folosim modelul reelu. Ca si eu

28298
22:03:34,160 --> 22:03:39,040
spus, acesta este cel mai des folosit acum

28299
22:03:36,720 --> 22:03:41,512
pentru că unul, este rapid. Nu are

28300
22:03:39,040 --> 22:03:43,760
a adăugat calcule în ea. Doar spune

28301
22:03:41,512 --> 22:03:47,192
iată valoarea care iese pe baza

28302
22:03:43,760 --> 22:03:49,512
greutățile și valoarea care intră. Și um

28303
22:03:47,192 --> 22:03:51,920
de acolo, știi, e uh dacă este

28304
22:03:49,512 --> 22:03:53,832
peste unu, atunci e bun sau peste zero,

28305
22:03:51,920 --> 22:03:55,680
este bine. Dacă este sub zero, atunci este

28306
22:03:53,832 --> 22:03:58,640
considerat neactiv. Și apoi avem

28307
22:03:55,680 --> 22:04:01,600
această conversie 2D. Ce naiba este

28308
22:03:58,640 --> 22:04:03,760
conversie 2D? Nu am de gând să intru

28309
22:04:01,600 --> 22:04:05,680
prea multe detalii în asta pentru că asta are

28310
22:04:03,760 --> 22:04:06,800
câteva lucruri pe care le face aici, a

28311
22:04:05,680 --> 22:04:08,320
puțin mai profund decât suntem noi

28312
22:04:06,800 --> 22:04:11,280
gata de acoperit în acest tutorial. Dar

28313
22:04:08,320 --> 22:04:14,000
aceasta este folosită pentru a converti din fotografie

28314
22:04:11,280 --> 22:04:16,320
pentru că avem 64x 64x3 și suntem doar

28315
22:04:14,000 --> 22:04:18,232
transformându-l într-un tip bidimensional de

28316
22:04:16,320 --> 22:04:20,160
setare. Deci este foarte conștient că acesta este un

28317
22:04:18,232 --> 22:04:21,512
fotografie și că diferite piese sunt

28318
22:04:20,160 --> 22:04:24,552
unul lângă altul. Și apoi mergem

28319
22:04:21,512 --> 22:04:27,040
pentru a adăuga un al doilea convoluțional

28320
22:04:24,552 --> 22:04:29,360
strat. Asta reprezintă cov

28321
22:04:27,040 --> 22:04:31,360
2D. Deci acestea sunt straturi ascunse. Deci

28322
22:04:29,360 --> 22:04:32,800
avem stratul nostru de intrare și cei doi

28323
22:04:31,360 --> 22:04:34,080
straturi ascunse și sunt

28324
22:04:32,800 --> 22:04:36,000
bidimensional pentru că avem de-a face

28325
22:04:34,080 --> 22:04:37,832
cu o fotografie bidimensională. Şi

28326
22:04:36,000 --> 22:04:40,720
vei vedea aici jos că la ultimul

28327
22:04:37,832 --> 22:04:43,600
unul, adaugam un max pooling 2D si punem

28328
22:04:40,720 --> 22:04:45,440
o dimensiune a piscinei este egală cu 22. Și deci ce asta

28329
22:04:43,600 --> 22:04:47,040
este că pe măsură ce ajungi la sfârșitul

28330
22:04:45,440 --> 22:04:48,320
aceste straturi, unul dintre lucrurile pe care le aveți

28331
22:04:47,040 --> 22:04:50,080
Întotdeauna vor să se gândească la ceea ce ei

28332
22:04:48,320 --> 22:04:52,320
cartografierea apelurilor și apoi reducerea.

28333
22:04:50,080 --> 22:04:53,920
Terminologie minunată din big data.

28334
22:04:52,320 --> 22:04:56,232
Cartografiam aceste date prin toate

28335
22:04:53,920 --> 22:04:59,360
aceste straturi. Și acum vrem să reducem

28336
22:04:56,232 --> 22:05:01,120
la doar două seturi. În acest caz, este

28337
22:04:59,360 --> 22:05:02,872
deja în două seturi pentru că este un 2D

28338
22:05:01,120 --> 22:05:05,360
fotografie. Dar am avut, știi, doi

28339
22:05:02,872 --> 22:05:07,680
dimensiuni de la noi avem de fapt 64x 64

28340
22:05:05,360 --> 22:05:10,080
de 3. Așa că acum doar o luăm jos

28341
22:05:07,680 --> 22:05:11,680
la un 2x doi. Doar cele două dimensiuni

28342
22:05:10,080 --> 22:05:13,280
bidimensional în loc să aibă

28343
22:05:11,680 --> 22:05:15,280
a treia dimensiune a culorilor. Și vom merge

28344
22:05:13,280 --> 22:05:17,040
înainte și rulați acestea. Nu suntem cu adevărat

28345
22:05:15,280 --> 22:05:18,800
văzând orice în scriptul nostru de rulare

28346
22:05:17,040 --> 22:05:20,480
pentru că tocmai ne instalăm. Aceasta este

28347
22:05:18,800 --> 22:05:21,920
toate puse la punct. Și de aici începi

28348
22:05:20,480 --> 22:05:23,440
joc pentru că poate vei adăuga un

28349
22:05:21,920 --> 22:05:25,280
un strat diferit aici pentru a face ceva

28350
22:05:23,440 --> 22:05:27,440
altfel să vedem cum funcționează și să vedem ce

28351
22:05:25,280 --> 22:05:29,512
ieșirea dvs. este. Asta face ca KAS să fie așa

28352
22:05:27,440 --> 22:05:31,920
bine că pot doar cu câteva răsturnări

28353
22:05:29,512 --> 22:05:33,680
de cod pus într-un strat complet nou care

28354
22:05:31,920 --> 22:05:35,920
face o procesare complet nouă și vezi

28355
22:05:33,680 --> 22:05:38,160
indiferent dacă asta îmi îmbunătățește alergarea sau o face

28356
22:05:35,920 --> 22:05:40,800
mai rău. Și în sfârșit, vom face

28357
22:05:38,160 --> 22:05:43,040
configurația finală, care este de a aplatiza

28358
22:05:40,800 --> 22:05:44,800
clasificator, adăugați o configurație de aplatizare. Şi

28359
22:05:43,040 --> 22:05:46,872
apoi vom adăuga și un strat, a

28360
22:05:44,800 --> 22:05:49,360
strat dens și apoi vom adăuga

28361
22:05:46,872 --> 22:05:50,232
într-un alt strat dens. Și atunci suntem

28362
22:05:49,360 --> 22:05:52,000
urmează să-l construiască. Vom merge

28363
22:05:50,232 --> 22:05:53,440
compilați totul împreună. Deci,

28364
22:05:52,000 --> 22:05:55,512
hai să ne întoarcem și să vedem cum arată

28365
22:05:53,440 --> 22:05:56,552
ca. Și chiar le-am numărat pentru

28366
22:05:55,512 --> 22:05:58,960
tu. Deci, vom face

28367
22:05:56,552 --> 22:06:00,872
aplatizarea. Și aplatizarea este exact ceea ce

28368
22:05:58,960 --> 22:06:03,040
se pare ca. Noi am lucrat într-o

28369
22:06:00,872 --> 22:06:04,640
matrice bidimensională de imagine, care

28370
22:06:03,040 --> 22:06:06,640
de fapt este în trei dimensiuni pentru că

28371
22:06:04,640 --> 22:06:08,232
a pixelilor. Pixelii au un întreg

28372
22:06:06,640 --> 22:06:10,000
o altă dimensiune a lui de trei

28373
22:06:08,232 --> 22:06:12,480
valori diferite. Și am cam

28374
22:06:10,000 --> 22:06:14,160
redimensionați-le la 2x doi. Dar acum

28375
22:06:12,480 --> 22:06:16,320
doar o să o aplatizăm. Eu nu

28376
22:06:14,160 --> 22:06:19,120
doresc să aibă dimensiuni multiple fiind

28377
22:06:16,320 --> 22:06:21,440
lucrat de tensor și de kas. vreau

28378
22:06:19,120 --> 22:06:23,440
doar o singură matrice. Deci, este aplatizat

28379
22:06:21,440 --> 22:06:26,080
afară. Și apoi pasul patru, plin

28380
22:06:23,440 --> 22:06:28,232
conexiune. Așa că adăugăm ultimele două

28381
22:06:26,080 --> 22:06:29,760
straturi. Și ai putea de fapt să faci totul

28382
22:06:28,232 --> 22:06:31,760
fel de lucruri cu asta. Ai putea

28383
22:06:29,760 --> 22:06:33,512
de fapt, lasă afară câteva dintre acestea

28384
22:06:31,760 --> 22:06:35,512
straturi și joacă-te cu ele. Ai nevoie

28385
22:06:33,512 --> 22:06:37,760
pentru a o aplatiza. Asta e foarte important.

28386
22:06:35,512 --> 22:06:40,080
Apoi vrem să folosim din nou loviturile.

28387
22:06:37,760 --> 22:06:42,080
Luăm asta și luăm

28388
22:06:40,080 --> 22:06:43,760
orice a intrat în ea. Deci, odată ce luăm

28389
22:06:42,080 --> 22:06:45,512
toate cele diferite cele două dimensiuni

28390
22:06:43,760 --> 22:06:47,440
sau trei dimensiuni așa cum sunt și noi

28391
22:06:45,512 --> 22:06:49,440
aplatizați-o într-o singură dimensiune. Vrem

28392
22:06:47,440 --> 22:06:52,000
ia asta și o vom trage

28393
22:06:49,440 --> 22:06:53,920
în unităţi de 128. Au obţinut asta. Tu esti

28394
22:06:52,000 --> 22:06:55,120
spune de unde au luat 128? tu

28395
22:06:53,920 --> 22:06:56,720
s-ar putea juca efectiv cu acel număr și

28396
22:06:55,120 --> 22:07:00,400
obține tot felul de rezultate ciudate. Dar în

28397
22:06:56,720 --> 22:07:02,232
în acest caz am luat 64 64 este 128.

28398
22:07:00,400 --> 22:07:04,000
Probabil că ai putea face asta chiar și cu 64

28399
22:07:02,232 --> 22:07:05,760
sau 32. De obicei vrei să-l păstrezi

28400
22:07:04,000 --> 22:07:07,600
același multiplu indiferent de date

28401
22:07:05,760 --> 22:07:10,160
este forma pe care o folosești deja. Și

28402
22:07:07,600 --> 22:07:11,832
folosim activarea re lu

28403
22:07:10,160 --> 22:07:15,040
exact cum am făcut înainte. Și apoi noi

28404
22:07:11,832 --> 22:07:17,760
în cele din urmă filtre toate acestea într-un singur

28405
22:07:15,040 --> 22:07:19,440
ieșire. Și are câte unități? Unul.

28406
22:07:17,760 --> 22:07:21,760
De ce? Pentru că vrem să știm dacă

28407
22:07:19,440 --> 22:07:24,552
adevărat sau fals. Este fie un câine, fie un

28408
22:07:21,760 --> 22:07:26,232
pisica. Ai putea spune că unul este câine, zero este

28409
22:07:24,552 --> 22:07:28,872
pisica. Sau poate ești un iubitor de pisici și

28410
22:07:26,232 --> 22:07:31,280
este unul este pisica și zero este câine. Și dacă

28411
22:07:28,872 --> 22:07:33,120
iubești atât câinii, cât și pisicile, ești

28412
22:07:31,280 --> 22:07:35,680
va trebui să aleagă. Și apoi folosim

28413
22:07:33,120 --> 22:07:38,160
activarea sigmoidiană. Dacă îți amintești

28414
22:07:35,680 --> 22:07:40,080
de înainte aveam mulineta și există

28415
22:07:38,160 --> 22:07:42,400
de asemenea sigmoidul. Sigmoidul face doar

28416
22:07:40,080 --> 22:07:44,320
este clar că este da sau nu. Nu vrem o

28417
22:07:42,400 --> 22:07:46,160
orice fel de număr între care vine

28418
22:07:44,320 --> 22:07:48,160
afară. Și vom merge înainte și vom rula asta.

28419
22:07:46,160 --> 22:07:49,600
Și veți vedea că este încă totul în configurație.

28420
22:07:48,160 --> 22:07:52,000
Și apoi, în sfârșit, vrem să mergem înainte

28421
22:07:49,600 --> 22:07:54,640
și compilați. Și să punem compilarea

28422
22:07:52,000 --> 22:07:56,872
rețeaua neuronală a clasificatorului nostru. Şi

28423
22:07:54,640 --> 22:07:59,280
vom folosi atomul optimizator.

28424
22:07:56,872 --> 22:08:01,680
Și am făcut aluzie la asta doar puțin

28425
22:07:59,280 --> 22:08:03,760
înainte. Unde intervine atomul? Unde

28426
22:08:01,680 --> 22:08:06,232
apare un optimizator? Ei bine,

28427
22:08:03,760 --> 22:08:08,232
optimizatorul este propagarea inversă.

28428
22:08:06,232 --> 22:08:10,480
Când îl antrenăm, merge tot

28429
22:08:08,232 --> 22:08:12,400
drum prin și spune eroare și apoi cum

28430
22:08:10,480 --> 22:08:14,800
reajustează acele greutăți. Acolo

28431
22:08:12,400 --> 22:08:17,760
sunt un număr dintre ele. Atomul este cel mai mult

28432
22:08:14,800 --> 22:08:20,000
folosit în mod obișnuit și funcționează cel mai bine pe mari dimensiuni

28433
22:08:17,760 --> 22:08:21,760
date. Majoritatea oamenilor rămân cu atomul

28434
22:08:20,000 --> 22:08:23,600
pentru că atunci când testează pe mai mici

28435
22:08:21,760 --> 22:08:24,800
date, vezi dacă modelul lor va merge

28436
22:08:23,600 --> 22:08:26,720
prin și scoateți toate erorile lor

28437
22:08:24,800 --> 22:08:28,080
înainte de a-l rula pe seturi de date mai mari.

28438
22:08:26,720 --> 22:08:30,160
Oricum o vor rula pe atom,

28439
22:08:28,080 --> 22:08:32,080
așa că o lasă pe atom cel mai mult

28440
22:08:30,160 --> 22:08:33,600
folosit în mod obișnuit. Dar mai sunt și alții

28441
22:08:32,080 --> 22:08:35,280
cele de acolo. Ar trebui să fii conștient de

28442
22:08:33,600 --> 22:08:37,280
că ai putea să le încerci dacă ești

28443
22:08:35,280 --> 22:08:39,360
blocat sau ai putea estompa asta

28444
22:08:37,280 --> 22:08:40,960
în viitor, dar de obicei atomul este just

28445
22:08:39,360 --> 22:08:42,640
bine acolo. Și apoi ai două

28446
22:08:40,960 --> 22:08:44,400
mai multe setari. Ai pierdere și

28447
22:08:42,640 --> 22:08:46,552
metrici. Nu vom săpă prea mult

28448
22:08:44,400 --> 22:08:48,232
în pierderi sau valori. Acestea sunt lucruri

28449
22:08:46,552 --> 22:08:50,400
chiar trebuie să explorezi KAS pentru că

28450
22:08:48,232 --> 22:08:52,640
sunt atatea alegeri. Acesta este cum

28451
22:08:50,400 --> 22:08:53,920
calculează eroarea. Sunt atât de multe

28452
22:08:52,640 --> 22:08:55,832
moduri diferite de pe spate

28453
22:08:53,920 --> 22:08:57,600
propagarea și formarea dumneavoastră. Deci suntem

28454
22:08:55,832 --> 22:08:59,440
folosind modelul atomic, dar poți

28455
22:08:57,600 --> 22:09:02,000
calculează eroarea după standardul um

28456
22:08:59,440 --> 22:09:04,000
abatere, abatere standard la pătrat.

28457
22:09:02,000 --> 22:09:05,192
Ei folosesc entropia încrucișată binară. aș fi avut

28458
22:09:04,000 --> 22:09:07,280
să mă uit la asta ca să știi ce anume

28459
22:09:05,192 --> 22:09:08,960
este. Sunt atât de multe dintre acestea. Multe

28460
22:09:07,280 --> 22:09:11,040
ori începi doar cu cele care

28461
22:09:08,960 --> 22:09:12,960
arată corect care sunt cele mai frecvent utilizate

28462
22:09:11,040 --> 22:09:14,800
și apoi trebuie să mergi să citești KAS

28463
22:09:12,960 --> 22:09:16,800
site-ul și a vedea de fapt ce acestea

28464
22:09:14,800 --> 22:09:18,640
pierderi și valori diferite și ce

28465
22:09:16,800 --> 22:09:20,400
diferite opțiuni pe care le au. Deci, suntem

28466
22:09:18,640 --> 22:09:21,832
nu o să intru prea mult în ele

28467
22:09:20,400 --> 22:09:23,832
în afară de a te referi la

28468
22:09:21,832 --> 22:09:25,040
Site-ul web KAS pentru a le explora mai profund, dar

28469
22:09:23,832 --> 22:09:27,120
vom merge înainte și le vom rula.

28470
22:09:25,040 --> 22:09:29,832
Și acum ne-am configurat clasificatorul. Deci,

28471
22:09:27,120 --> 22:09:31,360
avem un clasificator de obiecte. Și dacă tu

28472
22:09:29,832 --> 22:09:33,600
du-te înapoi aici, vei vedea că am făcut-o

28473
22:09:31,360 --> 22:09:36,480
adăugat la pasul unu. Am adăugat în stratul nostru

28474
22:09:33,600 --> 22:09:38,872
pentru intrare. Am adăugat un strat care

28475
22:09:36,480 --> 22:09:41,120
vine acolo si foloseste reelu pt

28476
22:09:38,872 --> 22:09:42,872
activare. Și apoi extrage datele.

28477
22:09:41,120 --> 22:09:44,720
Deci asta chiar dacă acestea sunt două

28478
22:09:42,872 --> 22:09:46,400
straturi, stratul real al rețelei neuronale

28479
22:09:44,720 --> 22:09:49,280
este aici sus. Și apoi folosește asta pentru

28480
22:09:46,400 --> 22:09:50,552
trageți datele într-un 2x doi. Deci într-o

28481
22:09:49,280 --> 22:09:52,160
matrice bidimensională de la a

28482
22:09:50,552 --> 22:09:54,232
matrice tridimensională cu culorile.

28483
22:09:52,160 --> 22:09:56,552
Apoi o aplatizăm. Deci, există suma noastră

28484
22:09:54,232 --> 22:09:58,960
aplatiza. Și apoi adăugăm un alt dens

28485
22:09:56,552 --> 22:10:00,960
ceea ce ei numesc strat dens. acest dens

28486
22:09:58,960 --> 22:10:04,320
stratul intră acolo și își reduce dimensiunea

28487
22:10:00,960 --> 22:10:06,080
acesta la 128. O reduce. Deci poți

28488
22:10:04,320 --> 22:10:08,400
Uită-te la asta, căci le cartografiem pe toate

28489
22:10:06,080 --> 22:10:10,160
aceste date în configurația bidimensională

28490
22:10:08,400 --> 22:10:12,552
iar apoi îl turtim. Așa că o mapam

28491
22:10:10,160 --> 22:10:15,680
o hartă aplatizată și apoi o luăm și

28492
22:10:12,552 --> 22:10:18,552
reduceți-l la 128 și folosim

28493
22:10:15,680 --> 22:10:20,720
mulinete din nou. Și apoi, în sfârșit, reducem

28494
22:10:18,552 --> 22:10:22,960
asta până la o singură ieșire și noi

28495
22:10:20,720 --> 22:10:25,192
folosește un sigmoid pentru a face asta pentru a-ți da seama

28496
22:10:22,960 --> 22:10:27,440
fie că este da, nu, adevărat, fals, în

28497
22:10:25,192 --> 22:10:29,280
în acest caz pisică sau câine. Și apoi în sfârșit

28498
22:10:27,440 --> 22:10:30,720
odată ce punem toate aceste straturi împreună noi

28499
22:10:29,280 --> 22:10:33,120
compilați-le. Asta am făcut

28500
22:10:30,720 --> 22:10:35,280
aici și le-am compilat în măsura în care

28501
22:10:33,120 --> 22:10:37,920
cum se antrenează să folosească aceste setări pentru

28502
22:10:35,280 --> 22:10:40,480
propagarea spatelui antrenamentului. Deci dacă tu

28503
22:10:37,920 --> 22:10:42,640
amintiți-vă că am vorbit despre antrenamentul nostru

28504
22:10:40,480 --> 22:10:44,552
configurare și când vom intra în asta, veți

28505
22:10:42,640 --> 22:10:46,320
vezi că avem două seturi de date. Avem

28506
22:10:44,552 --> 22:10:48,800
unul numit set de antrenament și

28507
22:10:46,320 --> 22:10:51,440
set de testare. Și asta este foarte standard în

28508
22:10:48,800 --> 22:10:53,512
orice prelucrare a datelor trebuie să aveți

28509
22:10:51,440 --> 22:10:55,192
asta este destul de comun în orice date

28510
22:10:53,512 --> 22:10:56,872
procesarea este că trebuie să aveți o anumită

28511
22:10:55,192 --> 22:10:58,400
cantitatea de date pentru a o antrena și apoi tu

28512
22:10:56,872 --> 22:11:00,160
am aflat dacă funcționează sau nu. este

28513
22:10:58,400 --> 22:11:02,080
este bine și de aceea ai un

28514
22:11:00,160 --> 22:11:03,512
set separat de date pentru testarea acestuia

28515
22:11:02,080 --> 22:11:04,800
unde știi deja răspunsul dar

28516
22:11:03,512 --> 22:11:07,120
nu vrei să folosești asta ca parte a

28517
22:11:04,800 --> 22:11:10,160
setul de antrenament. Așa că aici sărim

28518
22:11:07,120 --> 22:11:12,400
în partea a doua care se potrivește clasificatorului

28519
22:11:10,160 --> 22:11:15,120
rețeaua de neuroni la imagini și apoi

28520
22:11:12,400 --> 22:11:16,232
de la KAS, permiteți-mi să măresc acolo. eu

28521
22:11:15,120 --> 22:11:18,000
Întotdeauna îmi place lucrul cu care lucrezi

28522
22:11:16,232 --> 22:11:19,192
Caiete Jupyter. Chiar poți vedea.

28523
22:11:18,000 --> 22:11:21,440
O să intrăm aici. Noi facem

28524
22:11:19,192 --> 22:11:24,160
preprocesarea încrucișată a unei imagini. Iar noi

28525
22:11:21,440 --> 22:11:26,232
generator de date de import imagine. Așa este

28526
22:11:24,160 --> 22:11:28,320
frumos de KAS. Este atât de high-end

28527
22:11:26,232 --> 22:11:30,160
produs chiar acum. Și de când

28528
22:11:28,320 --> 22:11:31,920
imaginile sunt atât de comune, încât au deja

28529
22:11:30,160 --> 22:11:33,920
toate aceste lucruri pentru a ne ajuta să procesăm

28530
22:11:31,920 --> 22:11:36,480
date, ceea ce este grozav. Și așa, intrăm

28531
22:11:33,920 --> 22:11:38,000
aici, antrenăm generația de date și suntem

28532
22:11:36,480 --> 22:11:40,960
vom crea obiectul nostru pentru a ajuta

28533
22:11:38,000 --> 22:11:43,040
ne antrenăm pentru remodelarea datelor astfel încât

28534
22:11:40,960 --> 22:11:45,600
va funcționa cu configurația noastră. şi

28535
22:11:43,040 --> 22:11:47,600
folosim un generator de date de imagine și suntem

28536
22:11:45,600 --> 22:11:49,920
urmând să-l redimensioneze. Și vei vedea aici

28537
22:11:47,600 --> 22:11:53,120
avem un punct care ne spune că este a

28538
22:11:49,920 --> 22:11:55,280
valoare flotantă la redimensionarea peste 255.

28539
22:11:53,120 --> 22:11:57,192
De unde vine 255? Ei bine, asta e

28540
22:11:55,280 --> 22:11:59,680
scara în culorile imaginilor

28541
22:11:57,192 --> 22:12:02,800
folosim. Au valoare de la 0 la

28542
22:11:59,680 --> 22:12:05,280
255. Deci, vrem să o împărțim la 255 și

28543
22:12:02,800 --> 22:12:08,160
va genera un număr între 0 și 1.

28544
22:12:05,280 --> 22:12:10,400
Au o rază mare și o rază de zoom.

28545
22:12:08,160 --> 22:12:12,232
Flip orizontal este egal cu adevărat. Si asta,

28546
22:12:10,400 --> 22:12:14,400
desigur, are de-a face cu dacă fotografiile

28547
22:12:12,232 --> 22:12:15,680
au forme și dimensiuni diferite. Ca si eu

28548
22:12:14,400 --> 22:12:17,600
a spus, este un pachet minunat. tu

28549
22:12:15,680 --> 22:12:19,280
chiar trebuie să sapi adânc pentru a vedea tot

28550
22:12:17,600 --> 22:12:21,192
diferitele opțiuni pe care le aveți pentru

28551
22:12:19,280 --> 22:12:22,232
configurarea imaginilor dvs. Pentru chiar acum

28552
22:12:21,192 --> 22:12:23,832
totuși, vom rămâne doar cu

28553
22:12:22,232 --> 22:12:25,832
câteva lucruri de bază aici. Și dă-mi drumul

28554
22:12:23,832 --> 22:12:27,040
înainte și rulați acest cod. Și din nou, asta

28555
22:12:25,832 --> 22:12:29,120
chiar nu face nimic pentru că suntem

28556
22:12:27,040 --> 22:12:31,040
încă se configurează preprocesarea.

28557
22:12:29,120 --> 22:12:33,440
Să aruncăm o privire la acest următor set de

28558
22:12:31,040 --> 22:12:35,760
cod. Și acesta este doar uriaș. Suntem

28559
22:12:33,440 --> 22:12:37,832
crearea setului de antrenament. Deci

28560
22:12:35,760 --> 22:12:40,160
setul de antrenament va intra aici și

28561
22:12:37,832 --> 22:12:42,640
va folosi genul nostru de date ale trenurilor

28562
22:12:40,160 --> 22:12:45,512
tocmai a creat fluxul din director. Este

28563
22:12:42,640 --> 22:12:48,480
mergând să acceseze în acest caz calea

28564
22:12:45,512 --> 22:12:50,160
set de antrenament pentru setul de date. Acesta este un folder.

28565
22:12:48,480 --> 22:12:52,552
Deci va scoate toate imaginile

28566
22:12:50,160 --> 22:12:54,872
din acel folder. Acum chiar alerg

28567
22:12:52,552 --> 22:12:57,280
asta în folderul pe care îl stabilesc datele

28568
22:12:54,872 --> 22:12:59,280
in. Deci, dacă faci aceeași configurare

28569
22:12:57,280 --> 22:13:01,120
și vă încărcați datele acolo și

28570
22:12:59,280 --> 22:13:03,360
faci asta, asigură-te oriunde

28571
22:13:01,120 --> 22:13:05,920
notebook-ul tău Jupyter salvează lucruri

28572
22:13:03,360 --> 22:13:07,760
pentru a crea această cale sau poți

28573
22:13:05,920 --> 22:13:10,640
faceți calea completă dacă aveți nevoie, voi

28574
22:13:07,760 --> 22:13:13,360
știi, C bară oblică etc. Și ținta

28575
22:13:10,640 --> 22:13:15,280
dimensiunea, dimensiunea lotului și modul de clasă este

28576
22:13:13,360 --> 22:13:17,192
binar. Deci, clasele, ne schimbăm

28577
22:13:15,280 --> 22:13:18,960
totul la o valoare binară. Lot

28578
22:13:17,192 --> 22:13:20,232
dimensiune. Ce dracu este dimensiunea lotului? Ei bine,

28579
22:13:18,960 --> 22:13:22,000
la câte poze vom merge

28580
22:13:20,232 --> 22:13:25,120
lot prin antrenament de fiecare dată.

28581
22:13:22,000 --> 22:13:26,720
Și dimensiunea țintă 64x 64. Puțin

28582
22:13:25,120 --> 22:13:28,552
confuz, dar puteți vedea chiar aici

28583
22:13:26,720 --> 22:13:30,000
că aceasta este doar o pregătire generală și

28584
22:13:28,552 --> 22:13:31,280
poți intra acolo și te uiți la toate

28585
22:13:30,000 --> 22:13:33,512
diferite setări pentru antrenamentul dvs

28586
22:13:31,280 --> 22:13:35,192
set. Și, desigur, cu date diferite,

28587
22:13:33,512 --> 22:13:36,640
facem poze. Există tot felul

28588
22:13:35,192 --> 22:13:38,320
de setari diferite in functie de ce

28589
22:13:36,640 --> 22:13:39,920
cu care lucrezi. Să mergem înainte și

28590
22:13:38,320 --> 22:13:41,832
rulează asta și vezi ce se întâmplă. Şi

28591
22:13:39,920 --> 22:13:44,960
vei vedea că a găsit 800 de imagini

28592
22:13:41,832 --> 22:13:47,832
aparținând unei clase. Deci avem 800

28593
22:13:44,960 --> 22:13:50,160
imagini din setul de antrenament. Și dacă suntem

28594
22:13:47,832 --> 22:13:52,872
o să fac asta cu antrenamentul

28595
22:13:50,160 --> 22:13:55,280
setat, trebuie să formatăm și imaginile

28596
22:13:52,872 --> 22:13:56,960
în setul de testare. Acum, nu suntem de fapt

28597
22:13:55,280 --> 22:14:00,080
făcând orice predicții. Nu suntem

28598
22:13:56,960 --> 22:14:01,920
de fapt programând modelul încă. Toate

28599
22:14:00,080 --> 22:14:03,512
ceea ce facem este să pregătim datele. Deci,

28600
22:14:01,920 --> 22:14:05,600
vom pregăti un set de antrenament

28601
22:14:03,512 --> 22:14:07,680
și setul de testare. Deci, orice schimbări noi

28602
22:14:05,600 --> 22:14:09,920
face la antrenamentul stabilit în acest moment

28603
22:14:07,680 --> 22:14:11,440
de asemenea, trebuie aduse la setul de testare.

28604
22:14:09,920 --> 22:14:13,600
Deci, am făcut chestia asta. Am făcut o

28605
22:14:11,440 --> 22:14:15,680
generator de date de tren. Ne-am făcut

28606
22:14:13,600 --> 22:14:17,512
set de antrenament. Și atunci avem și noi

28607
22:14:15,680 --> 22:14:18,872
amintiți-vă setul nostru de date de testare. Deci sunt

28608
22:14:17,512 --> 22:14:21,040
o sa fac acelasi lucru cu asta.

28609
22:14:18,872 --> 22:14:22,480
Voi crea un gen de date de testare și

28610
22:14:21,040 --> 22:14:24,400
vom face aceste date de imagine

28611
22:14:22,480 --> 22:14:26,720
generator. Vom redimensiona unul

28612
22:14:24,400 --> 22:14:28,232
peste 255. Nu avem nevoie de celălalt

28613
22:14:26,720 --> 22:14:30,080
setări, doar o singură setare pentru

28614
22:14:28,232 --> 22:14:31,512
datele de testare gen. Și o să mergem

28615
22:14:30,080 --> 22:14:33,040
creați setul nostru de testare. O să facem

28616
22:14:31,512 --> 22:14:34,480
același lucru pe care l-am făcut cu setul de testare

28617
22:14:33,040 --> 22:14:37,512
cu excepția faptului că îl tragem din

28618
22:14:34,480 --> 22:14:39,600
folderul setului de testare. Și vom rula asta. Şi

28619
22:14:37,512 --> 22:14:42,160
veți vedea în setul nostru de testare pe care l-am găsit

28620
22:14:39,600 --> 22:14:45,280
2.000 de imagini. Cam așa este. Suntem

28621
22:14:42,160 --> 22:14:47,680
folosind 20% din imagini ca test și 80%

28622
22:14:45,280 --> 22:14:50,160
pentru a-l antrena. Și apoi, în sfârșit, ne-am stabilit

28623
22:14:47,680 --> 22:14:52,320
up toate datele noastre. Ne-am configurat toate

28624
22:14:50,160 --> 22:14:54,160
straturi, care este locul în care este toată munca

28625
22:14:52,320 --> 22:14:55,832
curăță acele date, asigurându-se

28626
22:14:54,160 --> 22:14:58,080
intră corect acolo. Și suntem

28627
22:14:55,832 --> 22:15:00,080
chiar o să se potrivească. Vom merge

28628
22:14:58,080 --> 22:15:02,232
antrenați setul nostru de date. Și să vedem ce

28629
22:15:00,080 --> 22:15:03,920
care arata ca. Și iată-ne. hai sa

28630
22:15:02,232 --> 22:15:06,080
pune informatia aici. Și haideți

28631
22:15:03,920 --> 22:15:08,080
aruncă o privire rapidă la ceea ce suntem

28632
22:15:06,080 --> 22:15:09,920
Privind cu generatorul nostru de potrivire. Noi

28633
22:15:08,080 --> 22:15:12,552
au clasificatorul nostru.fit

28634
22:15:09,920 --> 22:15:14,552
generator. Aceasta este propagarea noastră în spate.

28635
22:15:12,552 --> 22:15:16,400
Așa că informația trece înainte

28636
22:15:14,552 --> 22:15:18,000
cu o poză și scrie: „Oh, ești

28637
22:15:16,400 --> 22:15:21,040
ori ai dreptate, ori te înșeli.” Și apoi

28638
22:15:18,000 --> 22:15:23,440
eroarea merge înapoi și se reprogramează

28639
22:15:21,040 --> 22:15:25,512
toate acele greutăți. Deci ne antrenăm

28640
22:15:23,440 --> 22:15:27,280
rețea neuronală. Și bineînțeles, suntem

28641
22:15:25,512 --> 22:15:28,872
folosind setul de antrenament. Ține minte, noi

28642
22:15:27,280 --> 22:15:31,600
a creat antrenamentul stabilit aici. Şi

28643
22:15:28,872 --> 22:15:34,872
apoi mergem pași pe epopee. Deci este

28644
22:15:31,600 --> 22:15:36,080
8.000 de pași. Epic înseamnă că așa este

28645
22:15:34,872 --> 22:15:37,920
de multe ori trecem prin toate

28646
22:15:36,080 --> 22:15:39,440
poze. Așa că vom relua fiecare

28647
22:15:37,920 --> 22:15:41,832
a pozelor. și o să mergem

28648
22:15:39,440 --> 22:15:43,360
prin întregul set de date de 25 de ori, dar

28649
22:15:41,832 --> 22:15:46,400
ne vom uita la fiecare imagine

28650
22:15:43,360 --> 22:15:47,920
în timpul fiecărei epopee de 8.000 de ori. Deci, suntem

28651
22:15:46,400 --> 22:15:50,000
cu adevărat programarea naibii din asta

28652
22:15:47,920 --> 22:15:52,800
și revenind peste el. Și apoi ei

28653
22:15:50,000 --> 22:15:54,872
au datele de validare egale cu setul de test.

28654
22:15:52,800 --> 22:15:56,080
Deci, avem setul nostru de antrenament și apoi

28655
22:15:54,872 --> 22:15:57,440
vom avea testul setat

28656
22:15:56,080 --> 22:15:59,192
valida-l. Deci, vom face asta

28657
22:15:57,440 --> 22:16:00,640
totul dintr-o singură lovitură și o să ne uităm

28658
22:15:59,192 --> 22:16:02,400
la asta și vor face 200

28659
22:16:00,640 --> 22:16:04,080
pași pentru fiecare validare și vom vedea

28660
22:16:02,400 --> 22:16:05,680
cum arată într-un minut.

28661
22:16:04,080 --> 22:16:07,600
Să mergem mai departe și să ne desfășurăm antrenamentul

28662
22:16:05,680 --> 22:16:10,960
aici. Și ne vom potrivi cu datele noastre.

28663
22:16:07,600 --> 22:16:12,400
Și în continuare, scrie unul epic din 25.

28664
22:16:10,960 --> 22:16:14,720
Începi să realizezi că asta se întâmplă

28665
22:16:12,400 --> 22:16:18,552
a lua ceva timp. Pe computerul meu mai vechi,

28666
22:16:14,720 --> 22:16:21,192
durează aproximativ 45 de minute. Am un dual

28667
22:16:18,552 --> 22:16:23,832
procesor. Știi, procesăm uh

28668
22:16:21,192 --> 22:16:26,000
10.000 de fotografii. Nu este o sumă mică

28669
22:16:23,832 --> 22:16:27,920
de fotografii de prelucrat. Deci, dacă ești

28670
22:16:26,000 --> 22:16:29,680
pe laptopul tău, știi, care sunt eu,

28671
22:16:27,920 --> 22:16:31,600
va dura ceva timp. Deci, hai să mergem

28672
22:16:29,680 --> 22:16:33,280
înainte și du-te să ne luăm ceașca de cafea

28673
22:16:31,600 --> 22:16:35,512
și o înghițitură și întoarce-te și vezi ce

28674
22:16:33,280 --> 22:16:36,872
asta arata ca. Deci, m-am întors. tu

28675
22:16:35,512 --> 22:16:39,512
nu știam că am plecat. Asta a fost

28676
22:16:36,872 --> 22:16:41,120
de fapt, o pauză lungă acolo. am facut o

28677
22:16:39,512 --> 22:16:43,280
schimbări de cuplu. Să le discutăm

28678
22:16:41,120 --> 22:16:44,800
se schimbă foarte repede și de ce le-am făcut.

28679
22:16:43,280 --> 22:16:46,160
Deci, primul lucru pe care îl voi face este

28680
22:16:44,800 --> 22:16:48,232
Mă duc aici sus și voi introduce a

28681
22:16:46,160 --> 22:16:50,000
celula de mai sus și să lipim originalul

28682
22:16:48,232 --> 22:16:52,080
codul din nou acolo. Și o să vezi asta

28683
22:16:50,000 --> 22:16:55,920
lucrul inițial a fost pași pe epopee

28684
22:16:52,080 --> 22:16:58,640
8.000, 25 de epopee și pași de validare

28685
22:16:55,920 --> 22:17:02,800
2.000. Și le-am schimbat la 4.000

28686
22:16:58,640 --> 22:17:05,832
epopee sau 4.000 de pași pe epopee, 10 epopee,

28687
22:17:02,800 --> 22:17:07,440
și doar 10 pași de validare. Și asta

28688
22:17:05,832 --> 22:17:09,360
va cauza probleme dacă faci asta

28689
22:17:07,440 --> 22:17:11,040
ca lansare comercială. Dar pentru demo

28690
22:17:09,360 --> 22:17:13,040
scopuri, acest lucru ar trebui să funcționeze. Și dacă tu

28691
22:17:11,040 --> 22:17:15,040
amintiți-vă pașii noștri per epopee, așa

28692
22:17:13,040 --> 22:17:16,400
multe fotografii pe care le vom procesa. În

28693
22:17:15,040 --> 22:17:18,480
De fapt, lasă-mă să merg înainte și să-mi iau desenul

28694
22:17:16,400 --> 22:17:21,280
stilou afară. Și hai să evidențiem

28695
22:17:18,480 --> 22:17:23,192
asta chiar aici. Avem 8.000 de poze

28696
22:17:21,280 --> 22:17:24,800
trecem prin. Deci, pentru fiecare epopee,

28697
22:17:23,192 --> 22:17:26,000
O să schimb asta la 4.000. eu sunt

28698
22:17:24,800 --> 22:17:28,320
o să tai asta în jumătate. Deci, este

28699
22:17:26,000 --> 22:17:29,920
voi alege aleatoriu 4.000 de poze

28700
22:17:28,320 --> 22:17:32,080
de fiecare dată când trece printr-o epopee. Şi

28701
22:17:29,920 --> 22:17:34,480
epopeea este câte procese. Deci, asta

28702
22:17:32,080 --> 22:17:37,040
are 25. Și am de gând să o reduc la

28703
22:17:34,480 --> 22:17:39,440
10. Deci, în loc să faci 25 de rulări

28704
22:17:37,040 --> 22:17:42,080
8.000 de fotografii fiecare, pe care le puteți face

28705
22:17:39,440 --> 22:17:44,080
matematica de 25 * 8.000, o să fac doar

28706
22:17:42,080 --> 22:17:47,600
10 până la 4.000. Deci, am de gând să alerg

28707
22:17:44,080 --> 22:17:49,280
aceasta de 40.000 de ori prin procese.

28708
22:17:47,600 --> 22:17:50,800
Și următorul lucru pe care nu îl vei face

28709
22:17:49,280 --> 22:17:52,872
Vreau să observ este că și eu m-am schimbat

28710
22:17:50,800 --> 22:17:54,960
pasul de validare. Și asta ar fi

28711
22:17:52,872 --> 22:17:56,872
cauza unele probleme majore la eliberare

28712
22:17:54,960 --> 22:17:58,800
pentru că l-am scăzut până la 10.

28713
22:17:56,872 --> 22:18:01,832
Ceea ce face pasul de validare este că scrie

28714
22:17:58,800 --> 22:18:03,512
avem 2.000 de fotografii în antrenament sau

28715
22:18:01,832 --> 22:18:05,280
în setul nostru de testare și o vom face

28716
22:18:03,512 --> 22:18:07,192
folosește asta pentru validare. Ei bine, doar eu sunt

28717
22:18:05,280 --> 22:18:09,280
voi folosi 10 aleatoriu dintre acestea

28718
22:18:07,192 --> 22:18:11,120
valida. Deci, nu chiar cel mai bun

28719
22:18:09,280 --> 22:18:13,360
setări, dar permiteți-mi să vă arăt de ce am făcut-o

28720
22:18:11,120 --> 22:18:15,360
că. Să derulăm în jos aici doar a

28721
22:18:13,360 --> 22:18:17,280
puțin și să ne uităm la rezultat

28722
22:18:15,360 --> 22:18:19,280
aici și vezi ce se întâmplă

28723
22:18:17,280 --> 22:18:22,080
acolo. Așadar, mi-am recuperat instrumentul de desen

28724
22:18:19,280 --> 22:18:24,080
activat și veți vedea aici că listează o alergare.

28725
22:18:22,080 --> 22:18:26,232
Deci, de fiecare dată când trece printr-o epopee,

28726
22:18:24,080 --> 22:18:28,000
va face 4.000 de pași. Și asta

28727
22:18:26,232 --> 22:18:29,920
este locul unde intervin cei 4.000. Deci, asta este

28728
22:18:28,000 --> 22:18:32,000
unde avem. Avem unul epic din 10,

28729
22:18:29,920 --> 22:18:33,920
4.000 de pași. Deci, se alege la întâmplare

28730
22:18:32,000 --> 22:18:34,872
jumătate din pozele din dosar și merg

28731
22:18:33,920 --> 22:18:36,960
prin ele. Și apoi vom merge

28732
22:18:34,872 --> 22:18:40,640
uită-te la acest număr chiar aici. Adică

28733
22:18:36,960 --> 22:18:42,640
pentru întreaga epopee, și asta înseamnă 24, 411

28734
22:18:40,640 --> 22:18:44,960
secunde. Și dacă îți amintești bine,

28735
22:18:42,640 --> 22:18:47,120
împărțiți asta la 60, obțineți minute.

28736
22:18:44,960 --> 22:18:48,640
Dacă împărțiți asta la 60, obțineți ore.

28737
22:18:47,120 --> 22:18:52,960
Sau poți pur și simplu împărți totul

28738
22:18:48,640 --> 22:18:55,280
cu 60 * 60 care este 3600. Dacă 3600 este an

28739
22:18:52,960 --> 22:18:57,760
oră, asta durează aproximativ 45 de minute

28740
22:18:55,280 --> 22:19:00,480
aici. Și asta înseamnă 45 de minute de procesat

28741
22:18:57,760 --> 22:19:02,000
jumătate din poze. Deci dacă aș face totul

28742
22:19:00,480 --> 22:19:06,232
pozele, vorbim o oră și

28743
22:19:02,000 --> 22:19:09,440
o jumătate pe ori epic 36 sau nu 25. Ei

28744
22:19:06,232 --> 22:19:11,040
avea 25 peste 25. Deci cam a

28745
22:19:09,440 --> 22:19:12,872
câteva zile. Câteva zile de

28746
22:19:11,040 --> 22:19:14,160
prelucrare. Ei bine, pentru această demonstrație, noi

28747
22:19:12,872 --> 22:19:15,760
nu vreau sa fac asta. nu vreau

28748
22:19:14,160 --> 22:19:17,360
revino a doua zi. În plus, al meu

28749
22:19:15,760 --> 22:19:19,040
computerul a repornit în mijlocul

28750
22:19:17,360 --> 22:19:20,480
noaptea. Deci, ne uităm la asta și noi

28751
22:19:19,040 --> 22:19:22,232
spune: „Bine, hai să testăm

28752
22:19:20,480 --> 22:19:25,680
asta afară. Computerul meu pe care îl rulez

28753
22:19:22,232 --> 22:19:28,480
acesta este un procesor dual core. Uh,

28754
22:19:25,680 --> 22:19:29,920
rulează 0,9 gigaherți pe secundă. Pentru a

28755
22:19:28,480 --> 22:19:31,360
laptop, știi, e bun cam 4

28756
22:19:29,920 --> 22:19:33,040
cu ani în urmă, dar pentru a conduce ceva

28757
22:19:31,360 --> 22:19:34,872
așa, probabil că este puțin lent.

28758
22:19:33,040 --> 22:19:36,480
Deci, reducem timpul. Și ultimul

28759
22:19:34,872 --> 22:19:38,872
una a fost validarea. Suntem doar

28760
22:19:36,480 --> 22:19:40,552
validând-o pe 10 fotografii aleatorii. Şi

28761
22:19:38,872 --> 22:19:42,720
aceasta intră în vigoare pentru că ești

28762
22:19:40,552 --> 22:19:46,232
o să vedem aici jos unde avem

28763
22:19:42,720 --> 22:19:48,480
acuratețe, pierdere de valoare, precizie de valoare,

28764
22:19:46,232 --> 22:19:50,800
si pierdere. Acestea sunt foarte importante

28765
22:19:48,480 --> 22:19:53,192
numere de privit. Deci 10 înseamnă că sunt

28766
22:19:50,800 --> 22:19:56,080
validând doar pe 10 imagini. Asta

28767
22:19:53,192 --> 22:19:58,160
aici avem valoare. Acesta este ACC

28768
22:19:56,080 --> 22:19:59,760
este pentru precizie. Pierdere de valoare. Nu suntem

28769
22:19:58,160 --> 22:20:02,720
o să-mi fac prea multe griji pentru asta. Şi

28770
22:19:59,760 --> 22:20:04,552
precizie. Acum acuratețea este în timp ce este

28771
22:20:02,720 --> 22:20:06,720
alergând, pune aceste două numere

28772
22:20:04,552 --> 22:20:09,360
împreună. Asta este exactitatea. Şi

28773
22:20:06,720 --> 22:20:11,440
acuratețea valorii este la sfârșitul

28774
22:20:09,360 --> 22:20:12,800
epic. Care este acuratețea noastră în epopee?

28775
22:20:11,440 --> 22:20:14,480
La ce se uită? În acest tutorial,

28776
22:20:12,800 --> 22:20:16,080
nu vom merge atât de adânc, dar acestea

28777
22:20:14,480 --> 22:20:19,280
numerele sunt cu adevărat importante atunci când tu

28778
22:20:16,080 --> 22:20:22,320
începe să vorbești despre aceste două numere

28779
22:20:19,280 --> 22:20:24,400
reflectă părtinire. Asta este cu adevărat important.

28780
22:20:22,320 --> 22:20:26,080
Am pus asta acolo. Și părtinirea este a

28781
22:20:24,400 --> 22:20:28,552
puțin dincolo de acest tutorial, dar

28782
22:20:26,080 --> 22:20:30,800
Pe scurt, este dacă această precizie,

28783
22:20:28,552 --> 22:20:34,400
care este validarea noastră pe pas

28784
22:20:30,800 --> 22:20:36,720
scade și precizia valorii

28785
22:20:34,400 --> 22:20:38,872
continuă să urce, asta înseamnă că există o

28786
22:20:36,720 --> 22:20:41,512
părtinire. Asta înseamnă că memorez

28787
22:20:38,872 --> 22:20:44,080
poze la care ma uit. Nu sunt de fapt

28788
22:20:41,512 --> 22:20:46,080
căutând ce face un câine un câine, ce

28789
22:20:44,080 --> 22:20:48,080
face o pisică o pisică. Doar memorez

28790
22:20:46,080 --> 22:20:50,640
ei. Și cu atât mai mult această discrepanță

28791
22:20:48,080 --> 22:20:54,160
crește, cu cât părtinirea este mai mare. Și asta

28792
22:20:50,640 --> 22:20:55,832
este cu adevărat frumusețea neuronului KAS

28793
22:20:54,160 --> 22:20:57,440
rețea. Are multe incorporate

28794
22:20:55,832 --> 22:20:59,600
caracteristici ca aceasta care fac asta cu adevărat

28795
22:20:57,440 --> 22:21:01,760
ușor de urmărit. Deci hai să mergem înainte și

28796
22:20:59,600 --> 22:21:04,000
aruncați o privire la următorul set de coduri. Deci

28797
22:21:01,760 --> 22:21:06,160
iată că suntem în partea a treia. Mergem

28798
22:21:04,000 --> 22:21:07,512
pentru a face o nouă predicție. Și așa suntem

28799
22:21:06,160 --> 22:21:09,760
voi aduce câteva unelte pentru

28800
22:21:07,512 --> 22:21:11,512
că. Și apoi trebuie să procesăm

28801
22:21:09,760 --> 22:21:13,280
imagine care vine si afla daca

28802
22:21:11,512 --> 22:21:15,040
este un câine sau o pisică adevărată dacă putem

28803
22:21:13,280 --> 22:21:17,280
folosește-l de fapt pentru a-l identifica. Și de

28804
22:21:15,040 --> 22:21:19,192
desigur, pasul final al părții a treia este

28805
22:21:17,280 --> 22:21:20,552
pentru a imprima predicția. Vom merge înainte și

28806
22:21:19,192 --> 22:21:22,800
combina acestea. Și bineînțeles că poți vedea

28807
22:21:20,552 --> 22:21:24,400
eu acolo adăugând mai multe note lipicioase la mine

28808
22:21:22,800 --> 22:21:26,232
ecranul computerului ascuns în spatele

28809
22:21:24,400 --> 22:21:29,440
ecran. Și știi că ultimul a fost nu

28810
22:21:26,232 --> 22:21:30,640
uitați să hrăniți pisica și câinele.

28811
22:21:29,440 --> 22:21:32,080
Deci haideți să aruncăm o privire la asta și

28812
22:21:30,640 --> 22:21:34,232
vezi cum arată în cod și pune

28813
22:21:32,080 --> 22:21:36,800
că în caietul nostru Jupyter. În regulă.

28814
22:21:34,232 --> 22:21:40,160
Și hai să lipim asta aici. Și vom face

28815
22:21:36,800 --> 22:21:42,400
începe prin a importa numpy ca np. Numpy este

28816
22:21:40,160 --> 22:21:44,320
un pachet foarte comun. eu destul de mult

28817
22:21:42,400 --> 22:21:46,000
importați-l pe orice proiect Python pe care îl am

28818
22:21:44,320 --> 22:21:47,600
lucrând la. Un altul pe care îl folosesc în mod regulat

28819
22:21:46,000 --> 22:21:49,920
este panda. Sunt doar moduri de

28820
22:21:47,600 --> 22:21:52,480
organizarea datelor. Și atunci np este

28821
22:21:49,920 --> 22:21:54,872
de obicei, standardul în majoritatea mașinilor

28822
22:21:52,480 --> 22:21:56,720
instrumente de învățare ca întoarcere pentru

28823
22:21:54,872 --> 22:21:58,800
matrice de date. Deși știi că folosești un

28824
22:21:56,720 --> 22:22:01,280
matrice de date standard de la Python. Iar noi

28825
22:21:58,800 --> 22:22:02,872
au imagine de import cu preprocesare încrucișată.

28826
22:22:01,280 --> 22:22:04,720
Toate acestea ar trebui să pară familiare pentru că

28827
22:22:02,872 --> 22:22:06,552
vom face o imagine de test și

28828
22:22:04,720 --> 22:22:09,360
vom stabili că egal cu în asta

28829
22:22:06,552 --> 22:22:11,360
caz pisică sau câine unul după cum puteți vedea peste

28830
22:22:09,360 --> 22:22:13,040
aici. Și știi să-mi iau desenul

28831
22:22:11,360 --> 22:22:15,280
instrumentul din nou. Deci haideți să aruncăm o privire la

28832
22:22:13,040 --> 22:22:17,680
aceasta. Avem imaginea noastră de testare

28833
22:22:15,280 --> 22:22:19,360
se încarcă și aici avem o imagine de test

28834
22:22:17,680 --> 22:22:20,872
unul. Iar acesta nu are date nu are

28835
22:22:19,360 --> 22:22:22,640
l-am vazut deloc pe acesta. Deci asta este tot

28836
22:22:20,872 --> 22:22:24,400
nou. Oh, lasă-mă să micșorez ecranul.

28837
22:22:22,640 --> 22:22:26,800
Lasă-mă să o iau de la capăt. Deci aici avem

28838
22:22:24,400 --> 22:22:29,120
imaginea mea de testare și am mers înainte și

28839
22:22:26,800 --> 22:22:31,040
procesarea încrucișată are această imagine frumoasă

28840
22:22:29,120 --> 22:22:34,400
setare. Deci vom încărca imaginea

28841
22:22:31,040 --> 22:22:36,232
și îl vom modifica la un 64x 64

28842
22:22:34,400 --> 22:22:37,760
imprima. Așa că de la început, plecăm

28843
22:22:36,232 --> 22:22:39,192
a traversa e bine asa. Ea

28844
22:22:37,760 --> 22:22:41,040
o setează automat pentru noi, astfel încât noi

28845
22:22:39,192 --> 22:22:42,800
nu trebuie să ne refacă toate imaginile și

28846
22:22:41,040 --> 22:22:45,280
găsiți o modalitate de a le reseta. Și apoi noi

28847
22:22:42,800 --> 22:22:47,280
utilizați și pentru a seta imaginea într-o matrice.

28848
22:22:45,280 --> 22:22:49,120
Deci, din nou, suntem cu toții în pre-procesare

28849
22:22:47,280 --> 22:22:51,512
datele exact așa cum am preprocesat

28850
22:22:49,120 --> 22:22:53,360
înainte cu informațiile noastre de testare și noastre

28851
22:22:51,512 --> 22:22:56,000
date de antrenament. Și apoi folosim

28852
22:22:53,360 --> 22:22:58,480
numpy. Iată numpy-ul nostru de la care vine

28853
22:22:56,000 --> 22:23:01,280
um-ul nostru chiar aici. Import numpy ca în

28854
22:22:58,480 --> 22:23:03,920
p extinde dimensiunile axei imaginii de testare

28855
22:23:01,280 --> 22:23:07,040
egal cu zero. Deci îl pune într-un singur

28856
22:23:03,920 --> 22:23:09,120
matrice. Și apoi, în sfârșit, toată acea muncă

28857
22:23:07,040 --> 22:23:10,960
tot ceea ce pre-procesează și tot ceea ce facem este

28858
22:23:09,120 --> 22:23:13,440
rulăm rezultatul. Facem clic pe aici noi

28859
22:23:10,960 --> 22:23:15,280
merge rezultatul este egal cu clasificatorul predict test

28860
22:23:13,440 --> 22:23:17,120
imagine. Și apoi aflăm, ei bine, ce

28861
22:23:15,280 --> 22:23:18,640
este imaginea de test? Și să luăm doar o

28862
22:23:17,120 --> 22:23:20,640
Uită-te rapid și vezi doar ce este.

28863
22:23:18,640 --> 22:23:23,040
Și puteți vedea când am alergat-o, vine

28864
22:23:20,640 --> 22:23:25,192
sus câine. Și dacă ne uităm la acele imagini,

28865
22:23:23,040 --> 22:23:27,280
acolo este. Pisică sau câine. Numărul imaginii

28866
22:23:25,192 --> 22:23:29,440
unul. Arată ca o ureche drăguță

28867
22:23:27,280 --> 22:23:31,040
laborator. Prietenos cu limba atârnată

28868
22:23:29,440 --> 22:23:33,040
afară. Este fie asta, fie o dischetă foarte mare

28869
22:23:31,040 --> 22:23:34,232
pisica cu urechi. Nu sunt sigur care. Dar

28870
22:23:33,040 --> 22:23:36,320
conform software-ului nostru, spune că este

28871
22:23:34,232 --> 22:23:37,440
un câine. Și avem o a doua poză

28872
22:23:36,320 --> 22:23:39,040
aici. Să vedem ce se întâmplă

28873
22:23:37,440 --> 22:23:40,872
când rulăm a doua imagine. Putem

28874
22:23:39,040 --> 22:23:43,760
du-te aici și schimbă asta din câine

28875
22:23:40,872 --> 22:23:45,760
imagine unu la doi. Vom rula asta. și acesta

28876
22:23:43,760 --> 22:23:47,120
vine aici și spune pisica. Poți

28877
22:23:45,760 --> 22:23:49,280
vezi-mă subliniind-o acolo jos ca

28878
22:23:47,120 --> 22:23:51,512
pisica. Deci, procesul nostru funcționează. Ești în stare

28879
22:23:49,280 --> 22:23:53,280
a eticheta un câine drept câine și o pisică o pisică

28880
22:23:51,512 --> 22:23:55,040
doar din poze. Iată-ne.

28881
22:23:53,280 --> 22:23:56,872
Mi-am șters instrumentul de desen. Și ultimul

28882
22:23:55,040 --> 22:23:59,280
lucru pe care vreau să-l observi când venim

28883
22:23:56,872 --> 22:24:02,552
Înapoi aici până când l-am condus, o vei face

28884
22:23:59,280 --> 22:24:05,280
vezi că are o precizie de unu și

28885
22:24:02,552 --> 22:24:07,680
precizia valorii de unu. Ei bine, valoarea

28886
22:24:05,280 --> 22:24:09,600
acurateţea este cea importantă deoarece

28887
22:24:07,680 --> 22:24:11,360
acuratețea valorii este ceea ce este de fapt

28888
22:24:09,600 --> 22:24:12,552
rulează pe datele de testare. Ține minte, eu sunt

28889
22:24:11,360 --> 22:24:14,480
testându-l doar pe. si sunt doar

28890
22:24:12,552 --> 22:24:16,720
validând-o pe 10 fotografii aleatorii și

28891
22:24:14,480 --> 22:24:18,400
s-au întâmplat să apară acele 10 fotografii

28892
22:24:16,720 --> 22:24:21,600
unul. Acum, când au rulat asta pe

28893
22:24:18,400 --> 22:24:23,512
server, de fapt a venit cu aproximativ 86%.

28894
22:24:21,600 --> 22:24:26,080
Acesta este motivul pentru reducerea acestor numere

28895
22:24:23,512 --> 22:24:27,192
până acum pentru o lansare comercială este rău.

28896
22:24:26,080 --> 22:24:28,480
Deci, vrei să te asiguri că ești un

28897
22:24:27,192 --> 22:24:30,000
puțin atent la asta când ești

28898
22:24:28,480 --> 22:24:31,832
testează-ți lucrurile că le schimbi

28899
22:24:30,000 --> 22:24:33,832
numerele înapoi când îl rulați pe un mai mult

28900
22:24:31,832 --> 22:24:35,600
computer de întreprindere, altul decât vechiul dvs

28901
22:24:33,832 --> 22:24:37,120
laptop pe care tocmai exersezi sau

28902
22:24:35,600 --> 22:24:38,400
incurcandu-se cu. Și venim aici și

28903
22:24:37,120 --> 22:24:40,800
din nou, știi, am avut validarea

28904
22:24:38,400 --> 22:24:42,232
de pisică. Și așa am avut cu succes

28905
22:24:40,800 --> 22:24:44,640
a construit o rețea neuronală care ar putea

28906
22:24:42,232 --> 22:24:46,872
distinge între fotografiile unei pisici și

28907
22:24:44,640 --> 22:24:48,480
un câine. Imaginați-vă toate celelalte lucruri pe care le aveți

28908
22:24:46,872 --> 22:24:50,080
putea distinge. Imaginează-ți toate

28909
22:24:48,480 --> 22:24:51,920
diferite industrii în care te-ai putea scufunda

28910
22:24:50,080 --> 22:24:53,360
cu asta. Doar a putea înțelege

28911
22:24:51,920 --> 22:24:55,280
cele două diferențe de imagini. Ce

28912
22:24:53,360 --> 22:24:56,640
despre tantari? Ai putea găsi

28913
22:24:55,280 --> 22:24:58,480
tantari care musca fata de

28914
22:24:56,640 --> 22:25:00,232
tantari care sunt prietenosi? Se întoarce

28915
22:24:58,480 --> 22:25:02,320
țânțarii care ne mușcă sunt doar

28916
22:25:00,232 --> 22:25:04,160
4% din populația de țânțari, dacă chiar

28917
22:25:02,320 --> 22:25:06,400
asta, poate 2%. Există tot felul de

28918
22:25:04,160 --> 22:25:08,400
industriile care folosesc asta și așa este

28919
22:25:06,400 --> 22:25:11,120
multe industrii care sunt abia acum

28920
22:25:08,400 --> 22:25:13,512
realizând cât de puternice sunt aceste instrumente.

28921
22:25:11,120 --> 22:25:15,680
Doar în fotografii există o

28922
22:25:13,512 --> 22:25:17,832
o multitudine de industrii care au înflorit. si eu

28923
22:25:15,680 --> 22:25:19,680
am spus-o înainte, o voi spune din nou. Ce

28924
22:25:17,832 --> 22:25:22,160
un timp interesant pentru a trăi cu acestea

28925
22:25:19,680 --> 22:25:24,160
instrumente și cu care să ne jucăm. Deci

28926
22:25:22,160 --> 22:25:26,552
concluzii cheie. Ei bine, am acoperit ceea ce este

28927
22:25:24,160 --> 22:25:29,192
o rețea neuronală. Folosim tot felul de

28928
22:25:26,552 --> 22:25:30,960
procesarea imaginilor hărții de pe telefon.

28929
22:25:29,192 --> 22:25:33,760
Am vorbit despre lucruri care sunt neurale

28930
22:25:30,960 --> 22:25:36,480
rețeaua poate face. traduce text, identifică

28931
22:25:33,760 --> 22:25:38,232
se confruntă până la capăt pentru a controla roboții, tu

28932
22:25:36,480 --> 22:25:40,640
Știi, multe lucruri interesante. Cum face

28933
22:25:38,232 --> 22:25:42,400
o rețea neuronală funcționează? Deci, am discutat

28934
22:25:40,640 --> 22:25:44,872
că cu diferitele straturi mergând

28935
22:25:42,400 --> 22:25:46,480
de la imagine la stratul de intrare la

28936
22:25:44,872 --> 22:25:48,232
straturile ascunse și greutățile lor să

28937
22:25:46,480 --> 22:25:50,640
stratul final de ieșire. Am vorbit și noi

28938
22:25:48,232 --> 22:25:54,000
despre modul în care face matematica și calculul

28939
22:25:50,640 --> 22:25:55,832
ieșirea ca da sau nu, categoric

28940
22:25:54,000 --> 22:25:57,760
adevărat fals. Am discutat despre tipuri de

28941
22:25:55,832 --> 22:25:59,680
rețele neuronale artificiale. Multe

28942
22:25:57,760 --> 22:26:01,040
vocabularul de acolo din feed forward

28943
22:25:59,680 --> 22:26:03,040
rețeaua neuronală care este cea mai mare

28944
22:26:01,040 --> 22:26:04,872
folosit în mod obișnuit. Acesta este cel neural

28945
22:26:03,040 --> 22:26:06,872
rețeaua pe care am folosit-o este o rețea neuronală feed forward

28946
22:26:04,872 --> 22:26:08,640
rețea care face propagare înapoi

28947
22:26:06,872 --> 22:26:10,080
a antrena. Și mai sunt multe altele

28948
22:26:08,640 --> 22:26:13,280
cele de acolo. Acolo este radial

28949
22:26:10,080 --> 22:26:15,280
prejudecăți, cohen se auto-organiza

28950
22:26:13,280 --> 22:26:17,832
rețea neuronală recurentă, convoluție

28951
22:26:15,280 --> 22:26:19,512
rețea neuronală, rețea neuronală modulară.

28952
22:26:17,832 --> 22:26:21,360
Cel mare era modular pentru că

28953
22:26:19,512 --> 22:26:23,680
încorporează bucăți din toate celelalte

28954
22:26:21,360 --> 22:26:27,040
cele. Pentru ca orice lucru la care lucrezi

28955
22:26:23,680 --> 22:26:29,280
acum este un conglomerat imens de multipli

28956
22:26:27,040 --> 22:26:31,120
retelelor. Doar toate de vârf. Toate

28957
22:26:29,280 --> 22:26:32,872
este nou. Oameni chiar lucrează la el

28958
22:26:31,120 --> 22:26:35,440
nici nu stiu unde se duce. Din nou,

28959
22:26:32,872 --> 22:26:37,040
vremuri foarte interesante. Și în cele din urmă, am săpat

28960
22:26:35,440 --> 22:26:39,680
prin partea mea preferată. Poți vedea

28961
22:26:37,040 --> 22:26:41,040
cu latte-ul meu pe o parte, bătrânul meu

28962
22:26:39,680 --> 22:26:43,040
pixuri și creion și toate mele

28963
22:26:41,040 --> 22:26:45,192
note lipicioase care funcționează. Asta nu este

28964
22:26:43,040 --> 22:26:46,640
de fapt eu, apropo. Probabil tu

28965
22:26:45,192 --> 22:26:48,232
ghicit asta. Și am trecut prin și

28966
22:26:46,640 --> 22:26:50,000
de fapt, a făcut o fotografie cu pisici și câine, a

28967
22:26:48,232 --> 22:26:51,360
fotografie simplă de pisică și câine. Și ai putea

28968
22:26:50,000 --> 22:26:53,600
vezi unde sunt unele dintre probleme

28969
22:26:51,360 --> 22:26:55,360
prelucrarea unor cantități mari de fotografii

28970
22:26:53,600 --> 22:26:58,160
și date unde asta începe să devină

28971
22:26:55,360 --> 22:27:00,080
mergând de la o singură mașină pe laptopul meu

28972
22:26:58,160 --> 22:27:02,640
cu aceasta, știi, o cantitate mai mică de

28973
22:27:00,080 --> 22:27:04,400
resurse până la big data. Cum

28974
22:27:02,640 --> 22:27:06,400
dacă procesezi sute și

28975
22:27:04,400 --> 22:27:07,920
mii de aceste fotografii, asta acum

28976
22:27:06,400 --> 22:27:09,440
trebuie înființat într-o întreprindere

28977
22:27:07,920 --> 22:27:11,440
mașină sau chiar pe un grup de

28978
22:27:09,440 --> 22:27:13,280
calculatoare. Din nou, semnificativ trecut

28979
22:27:11,440 --> 22:27:15,360
domeniul de aplicare al acesteia. Partea îngrijită despre asta

28980
22:27:13,280 --> 22:27:17,120
deși este odată ce ai scris acest cod, majoritatea

28981
22:27:15,360 --> 22:27:19,192
din acest cod, acum au instrumente care

28982
22:27:17,120 --> 22:27:21,120
poti lua aproape aceleasi idei, daca

28983
22:27:19,192 --> 22:27:23,920
nu codul real și împingeți-l corect

28984
22:27:21,120 --> 22:27:26,232
pe un calcul de cluster. Deci cu adevărat

28985
22:27:23,920 --> 22:27:28,080
vremuri grozave pentru acest Python. Numele meu este

28986
22:27:26,232 --> 22:27:30,800
Richard Kersner cu SimplyLearn

28987
22:27:28,080 --> 22:27:33,680
echipa. Acesta este www.simplearn.com.

28988
22:27:30,800 --> 22:27:36,160
Obțineți certificare, treceți înainte. Deși adânc

28989
22:27:33,680 --> 22:27:38,552
Învățarea există de ceva vreme,

28990
22:27:36,160 --> 22:27:40,872
este doar în stadiile sale infantile de

28991
22:27:38,552 --> 22:27:42,960
dezvoltare în măsura în care explodează pe

28992
22:27:40,872 --> 22:27:44,800
piata. Vreau să spun că chiar acum sunt

28993
22:27:42,960 --> 22:27:47,040
construind roboți cu ea. Învățare profundă

28994
22:27:44,800 --> 22:27:49,680
este folosit pentru a antrena roboți pentru a face oameni

28995
22:27:47,040 --> 22:27:51,680
sarcini. Compoziție muzicală. Neural profund

28996
22:27:49,680 --> 22:27:53,280
plasele pot fi folosite pentru a produce muzică prin

28997
22:27:51,680 --> 22:27:55,440
făcând computerele să învețe tiparele

28998
22:27:53,280 --> 22:27:57,832
implicat în compunerea muzicii. Imagine

28999
22:27:55,440 --> 22:27:59,760
colorare. Rețeaua neuronală recunoaște

29000
22:27:57,832 --> 22:28:01,440
obiecte și folosește informații din

29001
22:27:59,760 --> 22:28:03,512
imagini pentru a le colora. Masina

29002
22:28:01,440 --> 22:28:04,960
traducere. Dat un cuvânt, o expresie sau o

29003
22:28:03,512 --> 22:28:06,800
propoziție într-o singură limbă, neural

29004
22:28:04,960 --> 22:28:08,800
rețelele le traduc automat

29005
22:28:06,800 --> 22:28:10,872
într-o altă limbă. Google Translate

29006
22:28:08,800 --> 22:28:13,120
este un astfel de traducător automat popular

29007
22:28:10,872 --> 22:28:14,720
poate ai dat peste. Și vei

29008
22:28:13,120 --> 22:28:17,920
observați aici că nu am arătat niciuna

29009
22:28:14,720 --> 22:28:20,000
exemple de numere drepte ca uh

29010
22:28:17,920 --> 22:28:21,920
celule proiective într-o urmărire a afacerii

29011
22:28:20,000 --> 22:28:23,760
stocul tău preferat. Cu siguranță poți

29012
22:28:21,920 --> 22:28:25,832
face-le cu limbaje mașină, dar

29013
22:28:23,760 --> 22:28:27,440
acesta este următorul nivel. Păstrează asta pentru

29014
22:28:25,832 --> 22:28:28,552
modelele tale de regresie, liniarul tău

29015
22:28:27,440 --> 22:28:30,080
regresie unde te afli de fapt

29016
22:28:28,552 --> 22:28:32,080
procesare și zdrobire doar drept

29017
22:28:30,080 --> 22:28:33,760
numere. Cu machine learning și deep

29018
22:28:32,080 --> 22:28:35,600
învăţând, vom merge la ceva cu totul nou

29019
22:28:33,760 --> 22:28:37,360
nivel în măsura în care ne putem da seama

29020
22:28:35,600 --> 22:28:39,280
pe computer. Ce este pentru tine?

29021
22:28:37,360 --> 22:28:40,400
Vom acoperi ceea ce este adânc

29022
22:28:39,280 --> 22:28:42,400
învăţarea. O să aruncăm o privire la

29023
22:28:40,400 --> 22:28:44,800
biologic versus artificial

29024
22:28:42,400 --> 22:28:46,640
inteligență. Ce este rețeaua neuronală

29025
22:28:44,800 --> 22:28:48,872
funcția de activare în neuronul tău

29026
22:28:46,640 --> 22:28:50,960
rețeaua și funcția de cost și cum se face

29027
22:28:48,872 --> 22:28:52,960
rețelele neuronale funcționează. Cum faci neural

29028
22:28:50,960 --> 22:28:54,232
rețelele învață? Deci mai este puțin

29029
22:28:52,960 --> 22:28:55,512
vei vedea un comutator chiar acolo. Noi doar

29030
22:28:54,232 --> 22:28:57,192
a plecat de la cum lucrează în

29031
22:28:55,512 --> 22:28:58,552
matematică în fundal la exact cum

29032
22:28:57,192 --> 22:29:00,400
învață ei. Vom implementa

29033
22:28:58,552 --> 22:29:02,480
rețeaua neuronală. Vom face un gradient

29034
22:29:00,400 --> 22:29:04,552
coborâre platforme de învățare profundă și

29035
22:29:02,480 --> 22:29:06,640
vom oferi o introducere în TensorFlow

29036
22:29:04,552 --> 22:29:08,552
și implementare în TensorFlow. Asta e

29037
22:29:06,640 --> 22:29:09,760
Platforma Google pe care au deschis-o

29038
22:29:08,552 --> 22:29:12,080
recent și probabil că este unul dintre

29039
22:29:09,760 --> 22:29:13,920
cele mai de vârf în învățarea profundă și

29040
22:29:12,080 --> 22:29:15,040
chiar dacă este încă în stadiul infantil

29041
22:29:13,920 --> 22:29:17,192
care este unul dintre motivele pentru care

29042
22:29:15,040 --> 22:29:19,120
l-a lansat în sursă deschisă. Ce este adânc

29043
22:29:17,192 --> 22:29:20,720
invatare? Învățarea profundă este un subdomeniu

29044
22:29:19,120 --> 22:29:22,872
de învățare automată care se ocupă de

29045
22:29:20,720 --> 22:29:24,080
algoritmi inspirati din structura si

29046
22:29:22,872 --> 22:29:25,680
funcția creierului. Și poți vedea

29047
22:29:24,080 --> 22:29:27,440
avem o poza frumoasa aici. Avem

29048
22:29:25,680 --> 22:29:29,440
inteligența artificială care este un fel de

29049
22:29:27,440 --> 22:29:30,640
bula mare care cuprinde toate

29050
22:29:29,440 --> 22:29:32,320
aceste lucruri diferite despre care vorbim

29051
22:29:30,640 --> 22:29:34,872
despre. Aceasta este capacitatea mașinii de a

29052
22:29:32,320 --> 22:29:36,552
imita comportamentul uman inteligent. Şi

29053
22:29:34,872 --> 22:29:38,720
acolo avem machine learning

29054
22:29:36,552 --> 22:29:41,120
aplicarea AI care permite un sistem

29055
22:29:38,720 --> 22:29:42,872
din care să învețe și să se perfecționeze automat

29056
22:29:41,120 --> 22:29:44,400
experiență. Și dacă te-ai uita la oricare dintre

29057
22:29:42,872 --> 22:29:46,872
celelalte videoclipuri ale noastre, vei ști asta

29058
22:29:44,400 --> 22:29:48,640
învățarea automată acoperă multe. Atât de adânc

29059
22:29:46,872 --> 22:29:50,232
învăţarea este o subcategorie a acesteia. Dar

29060
22:29:48,640 --> 22:29:52,400
nu uitați că învățarea automată are totul

29061
22:29:50,232 --> 22:29:54,800
alte tipuri de instrumente pe care oamenii le folosesc

29062
22:29:52,400 --> 22:29:56,960
face foarte simplu uh descriptiv și

29063
22:29:54,800 --> 22:29:58,480
predictiv și postscriptiv uh

29064
22:29:56,960 --> 22:30:00,232
analitice. Și apoi ai adânc

29065
22:29:58,480 --> 22:30:03,040
aplicarea învățării învățării automate

29066
22:30:00,232 --> 22:30:05,040
care folosește algoritmi complecși și profund

29067
22:30:03,040 --> 22:30:07,120
rețele neuronale pentru a antrena un model. Să luăm

29068
22:30:05,040 --> 22:30:09,280
o privire asupra neuronului biologic versus

29069
22:30:07,120 --> 22:30:11,040
neuronul artificial. Acum amintiți-vă în

29070
22:30:09,280 --> 22:30:12,960
creierul uman și și acest lucru este adevărat pentru

29071
22:30:11,040 --> 22:30:14,960
majoritatea animalelor de acolo sunt multe

29072
22:30:12,960 --> 22:30:16,872
diferiți neuroni care au loc. Deci asta este

29073
22:30:14,960 --> 22:30:19,192
cel foarte de bază. Adică există

29074
22:30:16,872 --> 22:30:20,960
sute de celule diferite implicate. Deci

29075
22:30:19,192 --> 22:30:22,480
când vorbim despre reţele neuronale şi

29076
22:30:20,960 --> 22:30:24,800
de aceea spun că este la un copil foarte sugar

29077
22:30:22,480 --> 22:30:26,320
etapă. Ei chiar se bazează pe uh

29078
22:30:24,800 --> 22:30:28,400
doar cel mai elementar lucru care suntem

29079
22:30:26,320 --> 22:30:30,000
capabil să-și dea seama ce se întâmplă în

29080
22:30:28,400 --> 22:30:32,160
rețele neuronale. Și poți vedea bine

29081
22:30:30,000 --> 22:30:34,232
aici avem informații despre dendrite

29082
22:30:32,160 --> 22:30:36,960
de la un neuroni adiacente și le trece

29083
22:30:34,232 --> 22:30:39,280
pe ca intrări. Deci ai datele tale

29084
22:30:36,960 --> 22:30:40,800
intră și datele tale ies. Oricare

29085
22:30:39,280 --> 22:30:42,400
modelul computerului ar trebui să se uite la asta

29086
22:30:40,800 --> 22:30:44,872
ce vine înăuntru ce iese. The

29087
22:30:42,400 --> 22:30:47,280
datele sunt furnizate ca intrare către neuron.

29088
22:30:44,872 --> 22:30:49,360
Deci ne uităm la neuronul artificial. Tu

29089
22:30:47,280 --> 22:30:51,192
pot vedea că avem contribuțiile noastre. Ei intră

29090
22:30:49,360 --> 22:30:52,800
fiecare este ponderat special în

29091
22:30:51,192 --> 22:30:55,192
neuron și atunci neuronul are o

29092
22:30:52,800 --> 22:30:57,280
ieșire. Nucleul celular procesează

29093
22:30:55,192 --> 22:30:59,280
informatii primite de la dendrite

29094
22:30:57,280 --> 22:31:01,832
iar neuronul procesează informaţia

29095
22:30:59,280 --> 22:31:03,280
furnizate ca intrări. Axonii sunt cablurile

29096
22:31:01,832 --> 22:31:05,040
peste care se află informaţia

29097
22:31:03,280 --> 22:31:06,800
transmise și informația este

29098
22:31:05,040 --> 22:31:08,552
transferate pe canale ponderate. Deci

29099
22:31:06,800 --> 22:31:10,640
te poți uita la asta am menționat

29100
22:31:08,552 --> 22:31:12,872
cântărește scurt, dar modifici datele

29101
22:31:10,640 --> 22:31:15,360
venind. Deci acele greutăţi sunt ceea ce

29102
22:31:12,872 --> 22:31:17,280
determină intrarea diferitelor informații

29103
22:31:15,360 --> 22:31:19,120
să fie ponderate diferit și prelucrate

29104
22:31:17,280 --> 22:31:20,872
diferit. Și sinapsele primesc

29105
22:31:19,120 --> 22:31:22,872
informaţia de la axoni şi

29106
22:31:20,872 --> 22:31:24,480
o transmite neuronilor adiacente.

29107
22:31:22,872 --> 22:31:25,600
Asta e în modelul tău biologic. Şi

29108
22:31:24,480 --> 22:31:27,440
apoi când ne uităm la artificial

29109
22:31:25,600 --> 22:31:29,440
neuron, rezultatul este o valoare finală

29110
22:31:27,440 --> 22:31:31,360
prezis de neuronul artificial. Deci

29111
22:31:29,440 --> 22:31:34,160
pe măsură ce săpăm mai adânc în privința

29112
22:31:31,360 --> 22:31:35,600
teoria din spatele rețelei neuronale și noi

29113
22:31:34,160 --> 22:31:38,080
un fel de răsturnare înainte și înapoi între

29114
22:31:35,600 --> 22:31:40,720
acestea pentru că există două aspecte uriașe

29115
22:31:38,080 --> 22:31:42,232
din ea. Unul este din exterior. Ce sunt

29116
22:31:40,720 --> 22:31:44,400
tu vezi și ce se întâmplă de la

29117
22:31:42,232 --> 22:31:46,080
înăuntru, astfel încât să poți găsi să faci ceea ce tu

29118
22:31:44,400 --> 22:31:47,832
trebuie să faci și să dai cele mai bune rezultate

29119
22:31:46,080 --> 22:31:50,320
poate. Și începem cu ce facem

29120
22:31:47,832 --> 22:31:52,552
hrana? Alimentam o imagine neetichetată către a

29121
22:31:50,320 --> 22:31:54,320
mașină care o identifică fără niciuna

29122
22:31:52,552 --> 22:31:56,080
intervenția umană. Și așa poți vedea

29123
22:31:54,320 --> 22:31:59,440
aici avem un cerc care vine la

29124
22:31:56,080 --> 22:32:01,440
784 pixeli și vine cu 28x 28.

29125
22:31:59,440 --> 22:32:03,280
Și puteți vedea cum se colorează în um

29126
22:32:01,440 --> 22:32:05,040
cercul de acolo. Și punem o

29127
22:32:03,280 --> 22:32:08,480
triunghi in. Vine si triunghiul in

29128
22:32:05,040 --> 22:32:10,160
este 28x 28 și are 784 pixeli. Deci

29129
22:32:08,480 --> 22:32:13,832
vei vedea între cei doi amândoi

29130
22:32:10,160 --> 22:32:15,512
sunt 784 pixeli. Această mașină este

29131
22:32:13,832 --> 22:32:17,440
suficient de inteligent pentru a face diferenta

29132
22:32:15,512 --> 22:32:18,720
între diversele forme. Deci asta e

29133
22:32:17,440 --> 22:32:20,640
ceea ce vrem să folosim rețeaua noastră neuronală

29134
22:32:18,720 --> 22:32:22,480
a face este să spui hei, acesta este un cerc.

29135
22:32:20,640 --> 22:32:23,832
Acesta este un triunghi. Adică mai mult a

29136
22:32:22,480 --> 22:32:25,120
categoric. De asemenea, puteți face o

29137
22:32:23,832 --> 22:32:27,192
model de regresie unde te afli de fapt

29138
22:32:25,120 --> 22:32:28,872
scoaterea valorii flotante sau a unei cifre

29139
22:32:27,192 --> 22:32:30,872
valoare. Ne vom uita la adevărat

29140
22:32:28,872 --> 22:32:31,920
fals sau modelul categoric mai ales

29141
22:32:30,872 --> 22:32:33,832
pentru că de aici începi de obicei

29142
22:32:31,920 --> 22:32:36,160
la diferit nu există real

29143
22:32:33,832 --> 22:32:38,232
diferenta cand esti cat de departe

29144
22:32:36,160 --> 22:32:40,080
funcționarea internă merge atunci când tu

29145
22:32:38,232 --> 22:32:41,440
începe să te răsuci între ele în afară de

29146
22:32:40,080 --> 22:32:42,872
Ei bine, vom vorbi despre asta doar într-o

29147
22:32:41,440 --> 22:32:44,640
minut. Deci, poți să mergi între ele

29148
22:32:42,872 --> 22:32:46,872
cei doi destul de usor si cel neural

29149
22:32:44,640 --> 22:32:48,320
rețeaua oferă această capacitate. Deci

29150
22:32:46,872 --> 22:32:49,920
vom folosi această capacitate pentru

29151
22:32:48,320 --> 22:32:51,440
uita-te intre cei doi. Unul dintre

29152
22:32:49,920 --> 22:32:54,480
lucruri pe care vreau să le notați aici sunt

29153
22:32:51,440 --> 22:32:57,280
că ne uităm la 784 de pixeli. Suntem

29154
22:32:54,480 --> 22:32:59,760
uitând la 784 de intrări. Asta e foarte

29155
22:32:57,280 --> 22:33:02,480
diferit de stocul cu un nivel scăzut ridicat sau

29156
22:32:59,760 --> 22:33:04,480
vânzările de anul trecut în funcție de dată sau suntem

29157
22:33:02,480 --> 22:33:06,080
privind doar câteva numere și

29158
22:33:04,480 --> 22:33:07,680
sunt foarte clare. Sunt numere.

29159
22:33:06,080 --> 22:33:09,192
Ei sunt foarte clari ce sunt, care

29160
22:33:07,680 --> 22:33:10,960
este ceva ce ai pune într-o mașină

29161
22:33:09,192 --> 22:33:12,720
învățarea modelului de regresie liniară. Aceasta

29162
22:33:10,960 --> 22:33:14,800
este un pas înainte de asta în sensul că suntem

29163
22:33:12,720 --> 22:33:16,800
privind modelele complexe și cum se face

29164
22:33:14,800 --> 22:33:19,120
iti dai seama de acele modele complexe.

29165
22:33:16,800 --> 22:33:21,040
Deci, o rețea neuronală este un sistem modelat

29166
22:33:19,120 --> 22:33:22,640
asupra creierului uman. Și ne-am uitat la

29167
22:33:21,040 --> 22:33:24,640
că comparând cele două. Să mergem înainte

29168
22:33:22,640 --> 22:33:26,720
și priviți mai adânc în rețeaua neuronală

29169
22:33:24,640 --> 22:33:28,480
în sine. Avem intrările noastre. Deci

29170
22:33:26,720 --> 22:33:30,720
intrările sunt alimentate unui neuron care

29171
22:33:28,480 --> 22:33:33,040
prelucrează o dată și ne oferă o ieșire.

29172
22:33:30,720 --> 22:33:35,360
Intrare și ieșire. Acesta este cel mai elementar

29173
22:33:33,040 --> 22:33:37,192
structura unei rețele neuronale cunoscută sub numele de a

29174
22:33:35,360 --> 22:33:38,720
perceptron. Deci, dacă vedeți termenul

29175
22:33:37,192 --> 22:33:40,320
perceptron, despre asta vorbim

29176
22:33:38,720 --> 22:33:42,800
despre. Vorbim despre acest single

29177
22:33:40,320 --> 22:33:44,800
nod care are intrări și o ieșire.

29178
22:33:42,800 --> 22:33:47,120
Cu toate acestea, rețelele neuronale sunt de obicei

29179
22:33:44,800 --> 22:33:49,040
mult mai complex. Să începem cu

29180
22:33:47,120 --> 22:33:51,280
vizualizarea unei rețele neuronale ca un negru

29181
22:33:49,040 --> 22:33:53,280
cutie. Și mereu iubesc acel simbol. Este

29182
22:33:51,280 --> 22:33:55,280
o cutie neagră. Este un fel de magic. Noi

29183
22:33:53,280 --> 22:33:57,760
primim contribuțiile noastre și vrem

29184
22:33:55,280 --> 22:34:00,080
anumite ieşiri. Caseta preia intrări,

29185
22:33:57,760 --> 22:34:02,080
le procesează și dă o ieșire.

29186
22:34:00,080 --> 22:34:04,640
Să aruncăm o privire la ce se întâmplă în interior

29187
22:34:02,080 --> 22:34:06,800
această cutie. Și mă poți vedea acolo în mine

29188
22:34:04,640 --> 22:34:08,480
Uh, un agent secret și mi-am luat

29189
22:34:06,800 --> 22:34:10,480
glugă ascunsă și tot. Bănuiesc că sunt

29190
22:34:08,480 --> 22:34:12,080
o parte din craniul negru sau ceva de genul

29191
22:34:10,480 --> 22:34:14,160
ca acel grup. Hai să aruncăm o privire

29192
22:34:12,080 --> 22:34:15,600
la ceea ce se întâmplă în această cutie magică.

29193
22:34:14,160 --> 22:34:17,512
Și amintiți-vă, sărim înapoi și

29194
22:34:15,600 --> 22:34:19,440
mai departe între teoria a ceea ce se întâmplă

29195
22:34:17,512 --> 22:34:21,680
în cutie, ceea ce trebuie să știți

29196
22:34:19,440 --> 22:34:23,360
cum să reglați fin și cum să construiți,

29197
22:34:21,680 --> 22:34:25,192
față de a-l privi din afară.

29198
22:34:23,360 --> 22:34:27,512
Programăm această cutie și am făcut-o

29199
22:34:25,192 --> 22:34:29,760
o intrare și o ieșire către cutie ca a

29200
22:34:27,512 --> 22:34:31,680
întreg. În cutie există o rețea

29201
22:34:29,760 --> 22:34:33,760
acesta este un nucleu al învățării profunde. Și tu

29202
22:34:31,680 --> 22:34:35,920
puteți vedea aici că arătăm un strat și

29203
22:34:33,760 --> 22:34:38,232
avem grila. Rețeaua

29204
22:34:35,920 --> 22:34:40,160
este format din straturi de neuroni. Fiecare

29205
22:34:38,232 --> 22:34:42,320
neuronul este asociat cu un număr

29206
22:34:40,160 --> 22:34:45,120
numită părtinire. Și te poți gândi la

29207
22:34:42,320 --> 22:34:46,800
părtinirea uh dacă simplifici prea mult acest lucru

29208
22:34:45,120 --> 22:34:49,040
și facem o regresie liniară

29209
22:34:46,800 --> 22:34:50,960
model. Aceasta este interceptarea ta în tine

29210
22:34:49,040 --> 22:34:52,800
geometria uklidiană. Trebuie să ai

29211
22:34:50,960 --> 22:34:54,872
ceva care o compensează. Și așa și tu

29212
22:34:52,800 --> 22:34:56,552
au întotdeauna o părtinire în aceste celule.

29213
22:34:54,872 --> 22:34:58,640
Neuronii fiecărui strat transmit

29214
22:34:56,552 --> 22:35:00,552
informații către neuronii următorului strat

29215
22:34:58,640 --> 22:35:02,480
peste canale. Și astfel le puteți vedea pe fiecare

29216
22:35:00,552 --> 22:35:04,320
a straturilor noastre care trec de la stânga la

29217
22:35:02,480 --> 22:35:06,400
corect. Aceste canale sunt asociate

29218
22:35:04,320 --> 22:35:08,320
cu numere numite greutăți. Acestea

29219
22:35:06,400 --> 22:35:10,232
ponderile împreună cu prejudecățile determină

29220
22:35:08,320 --> 22:35:12,800
informația care este trecută de la

29221
22:35:10,232 --> 22:35:15,360
de la neuron la neuron. Deci la fel ca

29222
22:35:12,800 --> 22:35:17,832
bias este interceptarea ta în uklidian

29223
22:35:15,360 --> 22:35:19,120
geometrie. Ai putea să te uiți la unul

29224
22:35:17,832 --> 22:35:20,160
greutate. Amintiți-vă că acest lucru este foarte

29225
22:35:19,120 --> 22:35:21,280
complicat. Deci nu ne uităm

29226
22:35:20,160 --> 22:35:23,440
doar o greutate. Ai putea să te uiți la

29227
22:35:21,280 --> 22:35:27,120
greutate ca panta ta a liniei. Sau dacă

29228
22:35:23,440 --> 22:35:29,280
faci x= uh my y c, ar fi

29229
22:35:27,120 --> 22:35:31,040
valoarea m. Neuronii fiecărui strat

29230
22:35:29,280 --> 22:35:32,640
transmite informații către neuronii

29231
22:35:31,040 --> 22:35:34,960
stratul următor. Și puteți vedea aici ca ei

29232
22:35:32,640 --> 22:35:37,280
lumina trecând în finală

29233
22:35:34,960 --> 22:35:38,960
strat. și apoi la ieșire. Și în

29234
22:35:37,280 --> 22:35:41,512
în acest caz, rezultatul va fi

29235
22:35:38,960 --> 22:35:42,960
fie un pătrat în acesta, fie el

29236
22:35:41,512 --> 22:35:44,552
ar putea să-l aprindă pe celălalt care este a

29237
22:35:42,960 --> 22:35:46,872
cerc. Stratul de ieșire emite a

29238
22:35:44,552 --> 22:35:49,280
ieșirea prevăzută. Deci, în acest caz, suntem

29239
22:35:46,872 --> 22:35:51,440
uitându-te la o clasificare, adevărat

29240
22:35:49,280 --> 22:35:53,440
fals. Este un cerc? Este un triunghi?

29241
22:35:51,440 --> 22:35:55,512
Este un pătrat? Să mergem acum mai adânc.

29242
22:35:53,440 --> 22:35:57,120
Ce se întâmplă în interiorul neuronului? Deci suntem

29243
22:35:55,512 --> 22:35:58,872
mergând să sape mai adânc și să încep să obțineți o

29244
22:35:57,120 --> 22:36:00,080
puțin mai aproape de o parte din matematică.

29245
22:35:58,872 --> 22:36:01,512
Nu-ți face griji, nu trebuie să fii a

29246
22:36:00,080 --> 22:36:03,512
expert în calcul și cunoaște-ți

29247
22:36:01,512 --> 22:36:06,000
ecuatii diferentiale. Chiar dacă asta

29248
22:36:03,512 --> 22:36:07,280
este o ecuație diferențială uriașă, tu

29249
22:36:06,000 --> 22:36:09,192
nu trebuie să-i înțelegi pe aceștia

29250
22:36:07,280 --> 22:36:11,192
intelegi ce se intampla. În cadrul fiecăruia

29251
22:36:09,192 --> 22:36:13,440
neuron, următoarele operații sunt

29252
22:36:11,192 --> 22:36:15,440
efectuate. Produsul fiecărei intrări și

29253
22:36:13,440 --> 22:36:17,760
greutatea canalului pe care a trecut

29254
22:36:15,440 --> 22:36:19,600
peste este găsit. Aceasta este pur și simplu o adăugare.

29255
22:36:17,760 --> 22:36:21,600
Vom rezuma timpii greutății

29256
22:36:19,600 --> 22:36:23,360
ieșirea de pe canalul anterior și

29257
22:36:21,600 --> 22:36:25,192
plus părtinirea. Suma ponderilor

29258
22:36:23,360 --> 22:36:27,832
produsele sunt calculate. Aceasta se numește

29259
22:36:25,192 --> 22:36:29,920
suma ponderata. Bias unic neuronului

29260
22:36:27,832 --> 22:36:32,232
se adaugă la suma ponderată. Finala

29261
22:36:29,920 --> 22:36:34,000
suma este apoi supusă particularului

29262
22:36:32,232 --> 22:36:36,000
funcția și vom discuta despre cele care

29263
22:36:34,000 --> 22:36:38,160
funcţie particulară. Partea aceea este cu adevărat

29264
22:36:36,000 --> 22:36:40,552
important pentru că acele funcții uh

29265
22:36:38,160 --> 22:36:42,000
au un impact enorm asupra cât de bine sunteți

29266
22:36:40,552 --> 22:36:43,920
modelul funcționează sub diferite

29267
22:36:42,000 --> 22:36:45,832
conditii. Suma finală este atunci

29268
22:36:43,920 --> 22:36:48,232
supuse unei anumite funcții. Aceasta

29269
22:36:45,832 --> 22:36:50,480
este funcția de activare. Deci dacă tu

29270
22:36:48,232 --> 22:36:51,920
auziți vreodată termenul funcție de activare,

29271
22:36:50,480 --> 22:36:53,920
despre asta vorbim. Ce

29272
22:36:51,920 --> 22:36:56,000
activează această celulă și ce nu. Ca

29273
22:36:53,920 --> 22:36:57,760
săpăm mai adânc în funcția de activare,

29274
22:36:56,000 --> 22:37:00,400
o funcție de activare ia

29275
22:36:57,760 --> 22:37:03,120
suma ponderată a intrării ca intrare

29276
22:37:00,400 --> 22:37:05,360
adaugă o părtinire și oferă o ieșire. Şi

29277
22:37:03,120 --> 22:37:07,512
de multe ori chiar vei vedea unul

29278
22:37:05,360 --> 22:37:09,280
formula pentru suma greutății

29279
22:37:07,512 --> 22:37:10,872
suma ponderată și părtinirea. Doar vei

29280
22:37:09,280 --> 22:37:12,552
vezi asta ca pe o singură linie a tuturor

29281
22:37:10,872 --> 22:37:14,000
adăugate împreună. Și iată că l-am rupt

29282
22:37:12,552 --> 22:37:16,320
în afară pentru că arată clar că

29283
22:37:14,000 --> 22:37:18,320
această părtinire nu este calculată la fel ca

29284
22:37:16,320 --> 22:37:20,640
sumele ponderate. Aici sunt cele mai multe

29285
22:37:18,320 --> 22:37:22,160
tipuri populare de funcție de activare.

29286
22:37:20,640 --> 22:37:24,160
Și mereu găsesc aceste lucruri interesante

29287
22:37:22,160 --> 22:37:26,000
pentru că la un moment dat stăteam la o

29288
22:37:24,160 --> 22:37:28,960
masă cu un domn care termina

29289
22:37:26,000 --> 22:37:30,552
doctoratul lui. Era în ultimul an și el

29290
22:37:28,960 --> 22:37:32,552
a spus că a trecut prin toate chestiile astea și

29291
22:37:30,552 --> 22:37:34,160
a ajuns să încerce doar cele patru

29292
22:37:32,552 --> 22:37:36,160
diferite funcții de activare pe aceasta

29293
22:37:34,160 --> 22:37:38,480
problemă specială la care lucra. Deci

29294
22:37:36,160 --> 22:37:40,320
știind matematica din spatele ei nu

29295
22:37:38,480 --> 22:37:42,232
înseamnă neapărat că o vei ști

29296
22:37:40,320 --> 22:37:43,920
imediat. Uh, chiar și cineva care

29297
22:37:42,232 --> 22:37:46,000
s-ar putea să aibă un doctorat și să facă

29298
22:37:43,920 --> 22:37:48,000
calculele pe acest lucru iese din nou

29299
22:37:46,000 --> 22:37:50,232
și ajunge doar să încerce diferit

29300
22:37:48,000 --> 22:37:51,760
uhm funcții de activare pentru a vedea ce este

29301
22:37:50,232 --> 22:37:53,440
va face diferența. Și o mulțime de

29302
22:37:51,760 --> 22:37:54,720
ori, acesta este un ultim pas. Asta este

29303
22:37:53,440 --> 22:37:56,400
un fel de lucru în care ți-ai construit întregul

29304
22:37:54,720 --> 22:37:58,080
model. Te-ai întors și ești ca

29305
22:37:56,400 --> 22:38:00,160
stai putin, pot face o afacere mai buna

29306
22:37:58,080 --> 22:38:02,000
cu o funcţie sigmoidă sau cu pragul

29307
22:38:00,160 --> 22:38:03,512
sau redresorul. Știind ce sunt

29308
22:38:02,000 --> 22:38:05,280
a face este important pentru a putea explica

29309
22:38:03,512 --> 22:38:07,192
la altcineva. Și din nou, probabil

29310
22:38:05,280 --> 22:38:08,720
faceți acest lucru pe un set mic de date. Dacă

29311
22:38:07,192 --> 22:38:10,872
Lucrezi cu date mari, tu

29312
22:38:08,720 --> 22:38:12,872
nu vreau să distrug serverul complet

29313
22:38:10,872 --> 22:38:14,400
fermă doar pentru a-ți testa trei

29314
22:38:12,872 --> 22:38:16,160
serii diferite. Luați un mic

29315
22:38:14,400 --> 22:38:17,920
parte din acele date, testați-o și apoi

29316
22:38:16,160 --> 22:38:19,040
ai pus-o prin big data. Aşa

29317
22:38:17,920 --> 22:38:20,800
hai să aruncăm o privire la asta. Avem

29318
22:38:19,040 --> 22:38:22,552
funcția sigmoidă și este folosită pentru

29319
22:38:20,800 --> 22:38:24,552
modele în care trebuie să prezicem

29320
22:38:22,552 --> 22:38:26,640
probabilitatea ca rezultat. Ea există

29321
22:38:24,552 --> 22:38:28,800
intre zero si unu. Și vei vedea

29322
22:38:26,640 --> 22:38:30,800
asta este valabil pentru toată activarea noastră

29323
22:38:28,800 --> 22:38:33,360
funcțiile cu care lucrăm. Fie

29324
22:38:30,800 --> 22:38:34,800
celulele activate sau dezactivate, este adevărat sau fals. Şi

29325
22:38:33,360 --> 22:38:37,192
ar putea exista o mică variație în

29326
22:38:34,800 --> 22:38:40,080
acolo care ar putea fi folosit ca ieșire

29327
22:38:37,192 --> 22:38:42,000
pentru a calcula incertitudinea în soluția dvs.

29328
22:38:40,080 --> 22:38:43,680
Deci, dacă primești un 7 cu asta

29329
22:38:42,000 --> 22:38:45,760
funcția de activare, ar putea fi bine

29330
22:38:43,680 --> 22:38:46,872
Nu sunt sigur dacă acesta este într-adevăr un pătrat

29331
22:38:45,760 --> 22:38:49,440
sau nu sunt sigur că este într-adevăr o

29332
22:38:46,872 --> 22:38:51,512
triunghi. Și asta ar putea fi un steag pentru

29333
22:38:49,440 --> 22:38:53,120
pentru a fi privit de un observator uman

29334
22:38:51,512 --> 22:38:54,960
cel puțin în modelele de astăzi în care ne aflăm

29335
22:38:53,120 --> 22:38:57,360
chiar acum. Și puteți vedea aici noi

29336
22:38:54,960 --> 22:39:00,320
au formula este pur și simplu egală cu 1 peste

29337
22:38:57,360 --> 22:39:02,232
1 e minus x unde x este valoarea ta

29338
22:39:00,320 --> 22:39:03,600
intrând. şi o să-ţi dea o

29339
22:39:02,232 --> 22:39:04,800
rezultat care seamănă foarte mult cu

29340
22:39:03,600 --> 22:39:07,120
grafic pe acolo care este undeva

29341
22:39:04,800 --> 22:39:09,120
intre zero si unu. Um, și chiar înăuntru

29342
22:39:07,120 --> 22:39:11,360
pe mijloc se vede că există o

29343
22:39:09,120 --> 22:39:13,440
uriaș, uh fel, poți trece prin toate

29344
22:39:11,360 --> 22:39:15,512
diferitele valori și incertitudini

29345
22:39:13,440 --> 22:39:17,440
implicat. Deci funcția sigmoidă este

29346
22:39:15,512 --> 22:39:19,192
probabil implicit pentru majoritatea dintre ele. Uh

29347
22:39:17,440 --> 22:39:20,960
următoarea este funcția de prag.

29348
22:39:19,192 --> 22:39:23,280
Este o activare bazată pe prag

29349
22:39:20,960 --> 22:39:24,960
funcția. Dacă valoarea x este mai mare decât a

29350
22:39:23,280 --> 22:39:26,960
anumită valoare, funcția este activată

29351
22:39:24,960 --> 22:39:29,440
și a tras. Altfel nu. Frumos

29352
22:39:26,960 --> 22:39:30,800
direct. Da, nu, adevărat, fals.

29353
22:39:29,440 --> 22:39:32,552
nu vreau să testez

29354
22:39:30,800 --> 22:39:34,160
improbabilități. Vreau doar o chintă

29355
22:39:32,552 --> 22:39:36,480
răspuns. Nu vreau să știu dacă există

29356
22:39:34,160 --> 22:39:38,552
o valoare parțială acolo. Ori este

29357
22:39:36,480 --> 22:39:40,400
adevărat sau este fals. Și redresorul

29358
22:39:38,552 --> 22:39:42,400
funcție, este cea mai utilizată

29359
22:39:40,400 --> 22:39:45,120
functia de activare. aș dezbate

29360
22:39:42,400 --> 22:39:46,872
că. Um redresor este unul destul de comun,

29361
22:39:45,120 --> 22:39:48,800
deşi văd că funcţia sigmoidă

29362
22:39:46,872 --> 22:39:50,320
este folosit pentru a fi cel de bază, dar este până

29363
22:39:48,800 --> 22:39:52,232
acolo. Funcția redresor este foarte

29364
22:39:50,320 --> 22:39:54,720
folosit în mod obișnuit. Obțineți rezultatul lui X

29365
22:39:52,232 --> 22:39:57,680
dacă X este pozitiv și zero în caz contrar. Şi

29366
22:39:54,720 --> 22:39:59,360
poți vedea din nou aici la fel ca um uh

29367
22:39:57,680 --> 22:40:02,000
fie că primești o valoare

29368
22:39:59,360 --> 22:40:03,832
urcând acolo sus. Deci max de x de zero. Deci

29369
22:40:02,000 --> 22:40:06,320
este din nou este ca pragul

29370
22:40:03,832 --> 22:40:08,480
funcția. Da, nu, adevărat, fals. Uh este

29371
22:40:06,320 --> 22:40:10,160
fie zero, fie este un fel de

29372
22:40:08,480 --> 22:40:12,160
valoare progresivă. Și apoi avem

29373
22:40:10,160 --> 22:40:13,832
functia redresorului. m-as certa cu

29374
22:40:12,160 --> 22:40:15,440
asta pentru ca functia sigmoida folosita

29375
22:40:13,832 --> 22:40:17,440
să fie cea mai comună. Dar cu

29376
22:40:15,440 --> 22:40:19,832
funcția redresor, acum spune că este

29377
22:40:17,440 --> 22:40:21,680
cel mai des folosit sau utilizat pe scară largă

29378
22:40:19,832 --> 22:40:24,320
funcția de activare și dă o ieșire

29379
22:40:21,680 --> 22:40:26,160
de X dacă X este pozitiv și zero

29380
22:40:24,320 --> 22:40:29,120
altfel. E cam frumos pentru că

29381
22:40:26,160 --> 22:40:31,120
acum spune absolut nu sau dă

29382
22:40:29,120 --> 22:40:33,040
tu o valoare a probabilității. Acum, când eu

29383
22:40:31,120 --> 22:40:34,552
spune o valoare a probabilității, fii foarte

29384
22:40:33,040 --> 22:40:36,552
atent acolo. Nu spun că este

29385
22:40:34,552 --> 22:40:38,400
o să vă spun că aceasta este șansa de 75%.

29386
22:40:36,552 --> 22:40:41,040
fiind un cerc. am de gând să-ți spun

29387
22:40:38,400 --> 22:40:43,440
că scrie, hei, dacă acesta spune 0.1, asta

29388
22:40:41,040 --> 22:40:45,680
probabil că trebuie privit sau 2 sau

29389
22:40:43,440 --> 22:40:48,000
3. Va depinde de datele dvs. ca

29390
22:40:45,680 --> 22:40:49,920
la ce înseamnă acea valoare. In general,

29391
22:40:48,000 --> 22:40:51,680
asta înseamnă doar că se semnalează că dacă

29392
22:40:49,920 --> 22:40:53,192
nu este unul, atunci sunt șanse

29393
22:40:51,680 --> 22:40:55,440
trebuie privit de o persoană și

29394
22:40:53,192 --> 22:40:57,280
reevaluat. Și există un hiperbolic

29395
22:40:55,440 --> 22:40:59,192
funcția tangentă. Această funcție este

29396
22:40:57,280 --> 22:41:01,680
similar cu funcţia sigmoid este legat de

29397
22:40:59,192 --> 22:41:05,280
un interval de la minus1 la 1. Deci puteți vedea

29398
22:41:01,680 --> 22:41:07,680
există 1 nostru - eus 2x și 1 plus peste 1

29399
22:41:05,280 --> 22:41:10,000
  eu 2x. Din nou, este foarte asemănător cu

29400
22:41:07,680 --> 22:41:12,480
funcția sigmoidă. Bonusul

29401
22:41:10,000 --> 22:41:14,080
funcția hiperbolică este că ai asta

29402
22:41:12,480 --> 22:41:16,232
variabilă care vine prin mijloc. Deci

29403
22:41:14,080 --> 22:41:18,160
din nou, te poți uita la el și ai un

29404
22:41:16,232 --> 22:41:20,000
puțin mai multă greutate cât poți

29405
22:41:18,160 --> 22:41:21,360
procesează-l pe linie. Asta este o

29406
22:41:20,000 --> 22:41:22,872
putin mai avansat decat ce

29407
22:41:21,360 --> 22:41:24,400
ne uităm chiar acum. Și o mulțime de

29408
22:41:22,872 --> 22:41:26,400
ori nici nu este necesar în multe

29409
22:41:24,400 --> 22:41:28,480
dintre diferitele noastre utilizări pentru acestea

29410
22:41:26,400 --> 22:41:30,640
funcții de activare. Acum, ne-am uitat la

29411
22:41:28,480 --> 22:41:32,960
funcții de activare și am cam spus

29412
22:41:30,640 --> 22:41:35,280
acestea sunt un pic ca o cutie neagră

29413
22:41:32,960 --> 22:41:36,400
pentru că chiar dacă știi toată matematica, a

29414
22:41:35,280 --> 22:41:38,080
de multe ori ajungi doar să joci

29415
22:41:36,400 --> 22:41:39,440
cu ei pentru a afla ce funcționează. Și asta

29416
22:41:38,080 --> 22:41:40,872
depinde si ce model esti

29417
22:41:39,440 --> 22:41:42,872
lucru cu, indiferent dacă aveți nevoie de un apartament

29418
22:41:40,872 --> 22:41:44,232
da, nu, adevărat, fals sau trebuie

29419
22:41:42,872 --> 22:41:46,232
ai ceva la mijloc care spune:

29420
22:41:44,232 --> 22:41:47,760
hei, acesta nu este chiar unul. S-ar putea

29421
22:41:46,232 --> 22:41:49,040
trebuie să procesăm asta cu omul

29422
22:41:47,760 --> 22:41:50,640
interventie. Și ai putea să te uiți la

29423
22:41:49,040 --> 22:41:52,872
că. Uh, un exemplu ar fi

29424
22:41:50,640 --> 22:41:54,400
mașini cu conducere autonomă. Nu vrei o mașină

29425
22:41:52,872 --> 22:41:56,232
să fiu da, nu, o să trec prin

29426
22:41:54,400 --> 22:41:58,800
lumina. Vrei să fie ca,

29427
22:41:56,232 --> 22:42:00,480
Bine, dacă e aproape da, poate noi

29428
22:41:58,800 --> 22:42:02,720
opriți-vă și avem intervenția umană așa că noi

29429
22:42:00,480 --> 22:42:04,720
nu ai un accident. Funcția de cost este

29430
22:42:02,720 --> 22:42:07,120
ceva ce poți vedea și măsura cu adevărat

29431
22:42:04,720 --> 22:42:08,960
si este foarte important. Valoarea costului este

29432
22:42:07,120 --> 22:42:11,512
diferența dintre rețelele neuronale

29433
22:42:08,960 --> 22:42:13,832
producția prevăzută și producția reală

29434
22:42:11,512 --> 22:42:15,920
dintr-un set de date de antrenament etichetate. Deci

29435
22:42:13,832 --> 22:42:17,680
avem grupul nostru de date care este a

29436
22:42:15,920 --> 22:42:19,832
cerc pătrat și din moment ce ne uităm la

29437
22:42:17,680 --> 22:42:21,600
forme geometrice, am avut pe cineva

29438
22:42:19,832 --> 22:42:23,192
deja etichetat acele date. Ei au

29439
22:42:21,600 --> 22:42:25,040
am spus deja că acesta este un triunghi, acesta este

29440
22:42:23,192 --> 22:42:26,480
un pătrat. Și deci dacă asta se va întâmpla

29441
22:42:25,040 --> 22:42:28,400
și ne dă și ne spune a

29442
22:42:26,480 --> 22:42:30,872
pătratul este un triunghi și spune a

29443
22:42:28,400 --> 22:42:33,120
triunghiul este un cerc, rezultatul este

29444
22:42:30,872 --> 22:42:35,120
greșit. Și astfel încât rezultatul poate fi atunci

29445
22:42:33,120 --> 22:42:37,280
măsurată în raport cu producția reală

29446
22:42:35,120 --> 22:42:39,360
si asta e costul. Uh, s-ar putea și tu

29447
22:42:37,280 --> 22:42:41,280
auzi asta ca eroare pentru că asta este

29448
22:42:39,360 --> 22:42:43,040
valoarea de eroare este returnată. Cât de departe

29449
22:42:41,280 --> 22:42:45,280
este? Și ceea ce căutăm este

29450
22:42:43,040 --> 22:42:47,120
cel mai mic cost sau cea mai mică valoare de eroare. Şi

29451
22:42:45,280 --> 22:42:49,600
se obține prin ajustări la

29452
22:42:47,120 --> 22:42:51,680
ponderile și părtinirile în mod iterativ

29453
22:42:49,600 --> 22:42:54,160
pe tot parcursul procesului de instruire. Şi

29454
22:42:51,680 --> 22:42:55,360
aceasta se numește propagare înapoi.

29455
22:42:54,160 --> 22:42:57,760
Și o să ne uităm puțin la asta

29456
22:42:55,360 --> 22:42:58,960
mai profund în timp ce privim un exemplu. Este

29457
22:42:57,760 --> 22:43:01,040
foarte greu de văzut când ești doar

29458
22:42:58,960 --> 22:43:02,872
privind săgețile fără numere reale

29459
22:43:01,040 --> 22:43:04,080
și de unde vine acel flux. Dar

29460
22:43:02,872 --> 22:43:06,800
te poți uita la asta, aici este a noastră

29461
22:43:04,080 --> 22:43:08,552
intrări. Au făcut o predicție. The

29462
22:43:06,800 --> 22:43:09,920
iese predicția și spune: „Hei,

29463
22:43:08,552 --> 22:43:11,512
am etichetat deja aceste date pentru că

29464
22:43:09,920 --> 22:43:13,920
suntem în modul antrenament și antrenament

29465
22:43:11,512 --> 22:43:16,720
datele sunt oprite. Acesta este costul. Putem

29466
22:43:13,920 --> 22:43:18,720
trimite acea eroare sau acel cost înapoi și

29467
22:43:16,720 --> 22:43:20,800
regla acele greutăți?" Și o facem

29468
22:43:18,720 --> 22:43:23,040
incremente foarte mici peste mari

29469
22:43:20,800 --> 22:43:25,440
cantități de date astfel încât acele ponderi

29470
22:43:23,040 --> 22:43:28,080
minimizați acel cost sau acea eroare. Dar

29471
22:43:25,440 --> 22:43:29,920
ce se întâmplă în interiorul acestor neuroni? Deci

29472
22:43:28,080 --> 22:43:31,192
să ne uităm la un mic exemplu în acest sens.

29473
22:43:29,920 --> 22:43:32,800
Un fel de ajutor dacă aveți un fel de

29474
22:43:31,192 --> 22:43:35,192
vizuale. Să construim o rețea neuronală

29475
22:43:32,800 --> 22:43:37,120
care prezic prețurile bicicletelor pe baza câtorva

29476
22:43:35,192 --> 22:43:39,680
a caracteristicilor sale. Și vom vedea aici

29477
22:43:37,120 --> 22:43:41,760
au CC-ul nostru, kilometrajul nostru și ABS-ul nostru.

29478
22:43:39,680 --> 22:43:43,512
Și acestea sunt cele trei straturi de intrare ale noastre.

29479
22:43:41,760 --> 22:43:45,440
Și apoi avem prețul bicicletei și

29480
22:43:43,512 --> 22:43:47,280
stratul de ieșire. Acum, nu ne face prea mult

29481
22:43:45,440 --> 22:43:48,872
bine să-l pompam din

29482
22:43:47,280 --> 22:43:50,552
pornind și pompează-l afară. Și să fie

29483
22:43:48,872 --> 22:43:52,400
sincer, aș folosi o învățare automată

29484
22:43:50,552 --> 22:43:54,640
model de regresie liniară pe aceasta deoarece

29485
22:43:52,400 --> 22:43:57,192
acestea sunt doar numere drepte. Dar

29486
22:43:54,640 --> 22:43:58,232
pentru că vrem un exemplu simplu, suntem

29487
22:43:57,192 --> 22:43:59,760
voi pune asta prin asta și vă arăt

29488
22:43:58,232 --> 22:44:01,280
ca o rețea neuronală ceea ce arată

29489
22:43:59,760 --> 22:44:02,872
ca. Și trebuie să punem un strat ascuns

29490
22:44:01,280 --> 22:44:05,440
acolo. Stratul ascuns ajută la intrare

29491
22:44:02,872 --> 22:44:08,232
îmbunătățirea preciziei de ieșire. Și tu

29492
22:44:05,440 --> 22:44:10,400
ar putea privi asta ca pe o grămadă de minereuri.

29493
22:44:08,232 --> 22:44:13,040
Deci s-ar putea spune, hei, când comparăm

29494
22:44:10,400 --> 22:44:15,040
aceste trei valori pe prima ascunse

29495
22:44:13,040 --> 22:44:17,040
strat neuron, ne uităm la un set

29496
22:44:15,040 --> 22:44:18,320
de caracteristici și apoi am putea pondere

29497
22:44:17,040 --> 22:44:20,000
ei în al doilea. Deci acestea sunt a

29498
22:44:18,320 --> 22:44:22,080
grămadă de minereuri diferite fel de fel

29499
22:44:20,000 --> 22:44:23,760
matematica iese în culise. Şi

29500
22:44:22,080 --> 22:44:26,080
apoi ies desigur la bicicletă

29501
22:44:23,760 --> 22:44:27,832
urmă sau stratul de ieșire. Și fiecare dintre

29502
22:44:26,080 --> 22:44:30,000
legăturile au o pondere atribuită

29503
22:44:27,832 --> 22:44:31,760
cu ea. Și veți vedea aici avem un

29504
22:44:30,000 --> 22:44:34,000
kilometraj CC cu cea de greutate si

29505
22:44:31,760 --> 22:44:35,832
greutatea doi intră în primul nostru neuron.

29506
22:44:34,000 --> 22:44:39,920
Și ai avea și ABS-ul tău să intre

29507
22:44:35,832 --> 22:44:42,400
acolo. Deci X1 * greutate 1 X2 *

29508
22:44:39,920 --> 22:44:44,480
greutatea 2 plus părtinirea unuia. Și pas

29509
22:44:42,400 --> 22:44:45,832
doi este activarea noastră. Activarea

29510
22:44:44,480 --> 22:44:48,080
funcția care vine acolo. Când face asta

29511
22:44:45,832 --> 22:44:50,320
foc? Și neuronul ia un subset de

29512
22:44:48,080 --> 22:44:52,160
intrările și le prelucrează. Și apoi noi

29513
22:44:50,320 --> 22:44:54,232
treceți și facem asta cu um

29514
22:44:52,160 --> 22:44:56,872
al doilea strat ascuns neuron și al treilea

29515
22:44:54,232 --> 22:44:59,440
unul si asa mai departe. Deci procesați fiecare strat

29516
22:44:56,872 --> 22:45:01,440
pentru a merge mai departe. Acum când am spus

29517
22:44:59,440 --> 22:45:04,400
voi, acesta este în stadiul de copil, ei

29518
22:45:01,440 --> 22:45:06,320
acum au neuroni care se declanșează în același timp

29519
22:45:04,400 --> 22:45:08,400
strat sau înapoi un strat, astfel încât acum

29520
22:45:06,320 --> 22:45:09,600
au o serie de timp și există tot felul

29521
22:45:08,400 --> 22:45:11,600
de lucruri sălbatice care sunt

29522
22:45:09,600 --> 22:45:13,512
experimentând pe aceste straturi. Aceasta

29523
22:45:11,600 --> 22:45:16,400
configurarea de bază există încă de la

29524
22:45:13,512 --> 22:45:18,552
mijlocul anilor '90. Doar acum din cauza noastră

29525
22:45:16,400 --> 22:45:19,832
tehnologie la care este deschis aproape

29526
22:45:18,552 --> 22:45:21,832
toată lumea să se joace cu ea. Și asta este

29527
22:45:19,832 --> 22:45:24,080
de ce spun că este într-un stadiu infantil în

29528
22:45:21,832 --> 22:45:26,080
dezvoltarea este această matematică de bază este aici,

29529
22:45:24,080 --> 22:45:27,360
dar ceea ce putem face cu el este uimitor.

29530
22:45:26,080 --> 22:45:28,800
Și ce fac ei de fapt cu toți

29531
22:45:27,360 --> 22:45:30,552
aceste lucruri diferite sunt uimitoare. Şi

29532
22:45:28,800 --> 22:45:32,320
deci suntem abia la începutul cum să facem

29533
22:45:30,552 --> 22:45:34,000
folosiți toate aceste instrumente diferite și noastre

29534
22:45:32,320 --> 22:45:35,760
învățarea profundă și rețelele noastre neuronale.

29535
22:45:34,000 --> 22:45:37,920
Uh și așa, odată ce avem stratul nostru ascuns

29536
22:45:35,760 --> 22:45:39,512
calculat, informația ajungând la

29537
22:45:37,920 --> 22:45:41,680
neuronii din stratul ascuns este supus

29538
22:45:39,512 --> 22:45:43,440
la funcţia de activare respectivă.

29539
22:45:41,680 --> 22:45:45,920
Și astfel fiecare dintre aceste incendii an

29540
22:45:43,440 --> 22:45:47,832
ieșire de activare uh și atunci acestea sunt

29541
22:45:45,920 --> 22:45:50,080
fiecare ponderat la nivelul final de ieșire.

29542
22:45:47,832 --> 22:45:52,320
Deci informațiile prelucrate sunt acum trimise

29543
22:45:50,080 --> 22:45:54,232
la stratul de ieșire din nou peste

29544
22:45:52,320 --> 22:45:56,400
canale ponderate. Și ai putea să te uiți la

29545
22:45:54,232 --> 22:45:58,000
asta deoarece fiecare dintre acestea este eu întotdeauna

29546
22:45:56,400 --> 22:45:59,360
Privește asta ca pe un grup de oameni.

29547
22:45:58,000 --> 22:46:00,960
Toți se uită la buletin

29548
22:45:59,360 --> 22:46:02,640
bord și prima persoană spune că asta este

29549
22:46:00,960 --> 22:46:04,400
ceea ce proiectez vânzări pentru companie și

29550
22:46:02,640 --> 22:46:06,400
persoana a doua si a treia si asa

29551
22:46:04,400 --> 22:46:08,552
pe. Și apoi perspectivele lor sunt

29552
22:46:06,400 --> 22:46:10,160
ponderate pe baza expertizei lor. Aşa

29553
22:46:08,552 --> 22:46:12,960
contabilul tău ar putea avea un nivel foarte mare

29554
22:46:10,160 --> 22:46:14,400
Greutatea unde este poate servitorul tău

29555
22:46:12,960 --> 22:46:16,480
are o greutate foarte mică deoarece lor

29556
22:46:14,400 --> 22:46:18,552
expertiza nu este in contabilitate si apoi

29557
22:46:16,480 --> 22:46:20,320
care intră în stratul de ieșire și o dată

29558
22:46:18,552 --> 22:46:22,320
în stratul de ieșire merge uh the

29559
22:46:20,320 --> 22:46:24,480
ieșire care este valoarea estimată este

29560
22:46:22,320 --> 22:46:26,640
comparat cu valoarea initiala. Deci

29561
22:46:24,480 --> 22:46:29,192
acum avem stratul nostru de ieșire și de atunci

29562
22:46:26,640 --> 22:46:31,360
avem deja o listă de biciclete

29563
22:46:29,192 --> 22:46:33,440
cu configurațiile lor diferite și ce

29564
22:46:31,360 --> 22:46:35,680
valoarea lor este că acum putem genera o

29565
22:46:33,440 --> 22:46:37,760
eroare din asta. Funcția de cost

29566
22:46:35,680 --> 22:46:40,320
determină eroarea în predicţie şi

29567
22:46:37,760 --> 22:46:42,232
îl raportează rețelei neuronale.

29568
22:46:40,320 --> 22:46:44,552
Deci acesta este costul. Acesta este cât de departe

29569
22:46:42,232 --> 22:46:46,480
este. Aceasta este eroarea ta de revenire.

29570
22:46:44,552 --> 22:46:48,872
Și după cum puteți vedea, acesta s-a întors

29571
22:46:46,480 --> 22:46:50,800
propagarea în curs. Deci acum eroarea noastră

29572
22:46:48,872 --> 22:46:53,280
merge invers pentru că știm

29573
22:46:50,800 --> 22:46:55,040
nu avem total dreptate în privința asta

29574
22:46:53,280 --> 22:46:57,120
anumit canal. Greutățile sunt

29575
22:46:55,040 --> 22:46:59,192
ajustate pentru a reduce eroarea.

29576
22:46:57,120 --> 22:47:01,440
Deci, de fiecare dată când ne întoarcem, ne schimbăm

29577
22:46:59,192 --> 22:47:04,400
acele greutăți pentru a reduce această eroare. şi

29578
22:47:01,440 --> 22:47:07,280
le schimbăm în trepte mici. tu

29579
22:47:04,400 --> 22:47:09,280
nu vreau să se potrivească cu o singură intrare. ține minte,

29580
22:47:07,280 --> 22:47:11,192
este posibil să aveți un pool de date cu un

29581
22:47:09,280 --> 22:47:12,640
terabyte de date. Nu vrei

29582
22:47:11,192 --> 22:47:14,480
rezolvați pentru primul set de date care

29583
22:47:12,640 --> 22:47:16,080
intră și asta ar fi soluția principală

29584
22:47:14,480 --> 22:47:17,680
pentru că totul va fi oprit.

29585
22:47:16,080 --> 22:47:20,232
Asta te va deruta. Asta e

29586
22:47:17,680 --> 22:47:22,400
numită și părtinire. Deci, avem părtinirea

29587
22:47:20,232 --> 22:47:24,552
în celula în care adăugăm o valoare,

29588
22:47:22,400 --> 22:47:27,192
genul de interceptare y și noi

29589
22:47:24,552 --> 22:47:28,872
au o părtinire a întregii rețele neuronale,

29590
22:47:27,192 --> 22:47:31,040
ceea ce înseamnă că este ponderat spre

29591
22:47:28,872 --> 22:47:32,640
un singur set de răspunsuri. Deci vrem să facem

29592
22:47:31,040 --> 22:47:34,320
mici modificări ale acestor greutăți deci noi

29593
22:47:32,640 --> 22:47:36,080
nu creați o părtinire și ponderile sunt

29594
22:47:34,320 --> 22:47:38,400
ajustat pentru a reduce eroarea sau

29595
22:47:36,080 --> 22:47:40,800
costul. Rețeaua este acum instruită

29596
22:47:38,400 --> 22:47:42,720
folosind noile greutăți. Încă o dată cel

29597
22:47:40,800 --> 22:47:44,720
costul este determinat și propagarea înapoi

29598
22:47:42,720 --> 22:47:46,872
se continuă până când costul nu poate fi

29599
22:47:44,720 --> 22:47:48,800
redus mai departe. Deci hai să mergem înainte

29600
22:47:46,872 --> 22:47:51,120
și conectați valorile și vedeți cum noastre

29601
22:47:48,800 --> 22:47:52,872
rețeaua neuronală funcționează. Așa că iată-ne

29602
22:47:51,120 --> 22:47:55,280
aici și inițial canalele noastre sunt

29603
22:47:52,872 --> 22:47:57,040
atribuite cu ponderi aleatorii. Aceasta este

29604
22:47:55,280 --> 22:47:58,640
important pentru că dacă le atribui pe toate

29605
22:47:57,040 --> 22:48:01,120
cu aceeași greutate, s-ar putea să poți

29606
22:47:58,640 --> 22:48:03,120
pentru a o reproduce. Dar se dovedește că

29607
22:48:01,120 --> 22:48:05,120
dacă îmi pun toate greutățile ca una sau toate

29608
22:48:03,120 --> 22:48:06,800
greutăți ca zero, durează mai mult

29609
22:48:05,120 --> 22:48:08,320
antrenează-te unde dacă ai greutăți aleatorii,

29610
22:48:06,800 --> 22:48:10,400
au deja un pic de

29611
22:48:08,320 --> 22:48:12,552
ajustare şi minereuri încorporate şi că

29612
22:48:10,400 --> 22:48:14,720
ne va da un răspuns mai bun și ne va antrena

29613
22:48:12,552 --> 22:48:17,360
mai repede. Primul nostru neuron ia o valoare

29614
22:48:14,720 --> 22:48:19,280
de kilometraj și CC ca intrări. Deci aici

29615
22:48:17,360 --> 22:48:21,280
vine calculul nostru oricare ar fi acestea

29616
22:48:19,280 --> 22:48:23,120
intrările sunt. Și facem asta din nou cu

29617
22:48:21,280 --> 22:48:24,552
al doilea neuron cu acele valori

29618
22:48:23,120 --> 22:48:26,800
intră. Puteți vedea aici că avem

29619
22:48:24,552 --> 22:48:28,872
greutatea trei și așa mai departe și apoi a noastră

29620
22:48:26,800 --> 22:48:30,400
al treilea neuron coborând și bineînțeles

29621
22:48:28,872 --> 22:48:32,080
al patrulea neuron al nostru. Așa că adăugăm toate

29622
22:48:30,400 --> 22:48:34,160
aceste valori diferite care vin aici

29623
22:48:32,080 --> 22:48:36,232
stratul nostru ascuns. Valoarea procesului de la

29624
22:48:34,160 --> 22:48:38,480
fiecare neuron este trimis la stratul de ieșire

29625
22:48:36,232 --> 22:48:40,400
peste canale ponderate. Deci din nou iată

29626
22:48:38,480 --> 22:48:43,120
ne vin greutățile și avem N1,

29627
22:48:40,400 --> 22:48:45,280
N2, N3 și N4. Din nou valorile sunt

29628
22:48:43,120 --> 22:48:47,832
supus funcţiei de activare şi

29629
22:48:45,280 --> 22:48:49,760
o singură valoare este emisă ca ieșire.

29630
22:48:47,832 --> 22:48:51,512
La compararea valorii prezise cu

29631
22:48:49,760 --> 22:48:53,440
valoarea reală, vedem clar că noastre

29632
22:48:51,512 --> 22:48:55,680
rețeaua necesită pregătire. Deci, iată-ne

29633
22:48:53,440 --> 22:48:57,680
Să spunem că prețul bicicletei noastre am pus

29634
22:48:55,680 --> 22:48:59,440
am crezut că valorează 2.000

29635
22:48:57,680 --> 22:49:02,160
greutățile noastre aleatorii și bicicleta de fapt

29636
22:48:59,440 --> 22:49:04,000
era 4.000 de dolari acolo. Bănuiesc că nu este

29637
22:49:02,160 --> 22:49:05,680
Dolari SUA pentru că ar fi foarte

29638
22:49:04,000 --> 22:49:08,000
bicicleta scumpa. Dar poate că este. Există

29639
22:49:05,680 --> 22:49:10,160
niște biciclete de 2.000 de dolari 4.000 de dolari acolo. The

29640
22:49:08,000 --> 22:49:12,232
funcția de cost este calculată și înapoi

29641
22:49:10,160 --> 22:49:14,160
are loc propagarea. Și aceasta este

29642
22:49:12,232 --> 22:49:16,080
destul de simplu. Puteți privi asta ca

29643
22:49:14,160 --> 22:49:18,232
um, noi scădem o valoare din

29644
22:49:16,080 --> 22:49:20,720
celălalt. O pătram și apoi luăm

29645
22:49:18,232 --> 22:49:23,120
jumătate din aceasta și aceasta este propagată înapoi

29646
22:49:20,720 --> 22:49:24,872
sus. Și fiecare strat își generează propriul strat

29647
22:49:23,120 --> 22:49:27,600
erori. Să ne întoarcem unul pentru că tu

29648
22:49:24,872 --> 22:49:29,680
ai Y-ul prezis și Y-ul real.

29649
22:49:27,600 --> 22:49:31,360
Asta se întoarce la primul strat. Şi

29650
22:49:29,680 --> 22:49:33,440
apoi pe baza valorii costului

29651
22:49:31,360 --> 22:49:35,760
funcția, anumite greutăți sunt modificate.

29652
22:49:33,440 --> 22:49:39,512
Deci, când ne uităm la următorul strat, asta

29653
22:49:35,760 --> 22:49:42,552
eroarea nu este originalul 4.000 - 2.000

29654
22:49:39,512 --> 22:49:45,040
squar / 2. Această eroare se bazează pe

29655
22:49:42,552 --> 22:49:47,440
eroarea fiecărei celule generate. Cât de departe

29656
22:49:45,040 --> 22:49:48,552
off este acea celulă în măsura în care greutățile ei.

29657
22:49:47,440 --> 22:49:50,160
Nu vă vom arăta. Este

29658
22:49:48,552 --> 22:49:51,680
de fapt un diferential foarte complicat

29659
22:49:50,160 --> 22:49:53,440
ecuație. Și probabil că o poți scrie

29660
22:49:51,680 --> 22:49:55,280
afară dacă ai vrut. Doar scrieți

29661
22:49:53,440 --> 22:49:56,800
fiecare formulă care trece în următoarea

29662
22:49:55,280 --> 22:49:57,920
nivel și le adaugi pe toate împreună și

29663
22:49:56,800 --> 22:49:59,600
îl poți scrie până la capăt

29664
22:49:57,920 --> 22:50:01,280
prin. Calculatoarele o fac astfel încât să nu o faci

29665
22:49:59,600 --> 22:50:02,960
trebuie. Și rețeaua noastră neuronală este

29666
22:50:01,280 --> 22:50:05,280
considerat antrenat atunci când valoarea pentru

29667
22:50:02,960 --> 22:50:07,600
funcția de cost este minimă. Deci când noi

29668
22:50:05,280 --> 22:50:08,960
să ne coborâm erorile cât de jos putem,

29669
22:50:07,600 --> 22:50:10,872
atunci este rețeaua noastră neuronală

29670
22:50:08,960 --> 22:50:12,320
antrenat. Și aici mă refer doar recent

29671
22:50:10,872 --> 22:50:14,320
au venit cu tot felul de

29672
22:50:12,320 --> 22:50:16,160
mijloace diferite de măsurare

29673
22:50:14,320 --> 22:50:18,720
valoare particulară. putin dincolo

29674
22:50:16,160 --> 22:50:19,760
domeniul de aplicare al rețelei neuronale de astăzi, dar

29675
22:50:18,720 --> 22:50:21,440
poti chiar poti vedea

29676
22:50:19,760 --> 22:50:23,512
ea. Știi, cât de departe faci asta

29677
22:50:21,440 --> 22:50:25,192
până când rețeaua neuronală nu are nevoie

29678
22:50:23,512 --> 22:50:27,360
mai fii antrenat și poți să te supraantrenezi

29679
22:50:25,192 --> 22:50:29,280
o rețea neuronală. Acum, instrumentele care

29680
22:50:27,360 --> 22:50:31,280
ne uităm la vă permitem automat

29681
22:50:29,280 --> 22:50:33,280
știi când să te oprești, ceea ce este foarte frumos.

29682
22:50:31,280 --> 22:50:34,800
Și așa cum am spus, suntem

29683
22:50:33,280 --> 22:50:36,232
stadiile de început în rețelele neuronale

29684
22:50:34,800 --> 22:50:38,320
și este foarte tare ce pot

29685
22:50:36,232 --> 22:50:40,080
faceți acum și cât de mult este automatizat

29686
22:50:38,320 --> 22:50:41,760
și cât de mult este experimental.

29687
22:50:40,080 --> 22:50:44,000
Acum, să aruncăm o privire la gradient

29688
22:50:41,760 --> 22:50:46,800
coborâre. Dar ce abordare luăm

29689
22:50:44,000 --> 22:50:49,440
minimizarea funcției de cost? Deci aici noi

29690
22:50:46,800 --> 22:50:51,280
au apărut o eroare bună. Aceasta este

29691
22:50:49,440 --> 22:50:53,120
costul nostru sau eroarea noastră. Hai să începem

29692
22:50:51,280 --> 22:50:55,360
cu trasarea funcţiei de cost împotriva

29693
22:50:53,120 --> 22:50:58,720
valoarea prezisă. Și așa poți vedea

29694
22:50:55,360 --> 22:51:00,960
s-au hrănit în mai multe y și acestea sunt

29695
22:50:58,720 --> 22:51:02,720
erorile care vin și costul

29696
22:51:00,960 --> 22:51:05,832
fiecare dintre aceste intrări și modificări mergând

29697
22:51:02,720 --> 22:51:08,552
pe. Rețineți că începem dintr-un punct aleatoriu

29698
22:51:05,832 --> 22:51:09,832
curba. Deci de obicei pui în tine

29699
22:51:08,552 --> 22:51:11,440
știi că îți ridici datele și tu

29700
22:51:09,832 --> 22:51:12,800
alege la întâmplare de unde să începi în ta

29701
22:51:11,440 --> 22:51:13,920
date. De multe ori pur și simplu îl rulezi

29702
22:51:12,800 --> 22:51:15,440
de la început pentru că te duci

29703
22:51:13,920 --> 22:51:17,360
prin atât de multe date, nu este atât de mare

29704
22:51:15,440 --> 22:51:19,512
de o afacere. Dar începeți cu un punct

29705
22:51:17,360 --> 22:51:20,960
intră. Deci propagarea ta înainte

29706
22:51:19,512 --> 22:51:22,800
trece prin. Ai de gând să mergi înainte

29707
22:51:20,960 --> 22:51:24,480
și găsiți costul sau eroarea dvs. Ea

29708
22:51:22,800 --> 22:51:25,920
puncte care pe curbă. Și poți

29709
22:51:24,480 --> 22:51:27,512
vezi cum ne complotăm aici.

29710
22:51:25,920 --> 22:51:29,600
Deoarece gradientul în acest punct este

29711
22:51:27,512 --> 22:51:30,640
pozitiv, ne putem deplasa la dreapta. Deci suntem

29712
22:51:29,600 --> 22:51:32,480
se va deplasa putin la dreapta

29713
22:51:30,640 --> 22:51:33,680
pe aici. Și de data aceasta gradientul este

29714
22:51:32,480 --> 22:51:36,000
negativ. Ne trecem puțin la

29715
22:51:33,680 --> 22:51:38,080
stânga. În cele din urmă încercăm ideea

29716
22:51:36,000 --> 22:51:41,192
unde gradientul este zero. Acesta este un

29717
22:51:38,080 --> 22:51:43,832
cea mai mică valoare a funcției de cost. ai

29718
22:51:41,192 --> 22:51:45,832
sa fii putin atent cu asta pentru ca

29719
22:51:43,832 --> 22:51:48,000
asta în special, vreau să spun că o fac să arate

29720
22:51:45,832 --> 22:51:50,480
frumos și simplu în acest grafic. Uneori

29721
22:51:48,000 --> 22:51:53,120
aceste curbe arată ca treptele scărilor şi

29722
22:51:50,480 --> 22:51:55,512
deci există minime globale și apoi

29723
22:51:53,120 --> 22:51:57,360
există local, ar putea fi un local

29724
22:51:55,512 --> 22:51:59,192
punctul în care gradientul este zero dar

29725
22:51:57,360 --> 22:52:01,040
nu este cel global. Așa s-ar putea

29726
22:51:59,192 --> 22:52:02,720
fii mult la stânga acolo unde este

29727
22:52:01,040 --> 22:52:04,232
se întâmplă să demisioneze puțin și

29728
22:52:02,720 --> 22:52:05,600
crezi că ești în gradientul potrivit.

29729
22:52:04,232 --> 22:52:07,600
Și cu asta avem tot dreptul

29730
22:52:05,600 --> 22:52:10,800
greutăți și putem spune că rețeaua noastră este

29731
22:52:07,600 --> 22:52:12,720
antrenat. Deci aici avem doar câteva

29732
22:52:10,800 --> 22:52:14,480
major acestea sunt câteva dintre nume mari

29733
22:52:12,720 --> 22:52:16,720
acolo chiar acum în dezvoltare pentru

29734
22:52:14,480 --> 22:52:18,400
platforme de învățare profundă. TensorFlow

29735
22:52:16,720 --> 22:52:20,400
în care vom face de fapt un exemplu în

29736
22:52:18,400 --> 22:52:22,872
un minut. Învățare profundă pentru J care este

29737
22:52:20,400 --> 22:52:24,400
în platforma Java. Uh, dacă ești un

29738
22:52:22,872 --> 22:52:26,160
Apropo, programator Java este

29739
22:52:24,400 --> 22:52:28,080
TensorFlow este accesat de majoritatea oamenilor

29740
22:52:26,160 --> 22:52:29,600
folosind Python pentru a-l accesa, dar este un

29741
22:52:28,080 --> 22:52:31,192
sistem care este oarecum separat de a

29742
22:52:29,600 --> 22:52:33,360
multe dintre limbaje de programare care

29743
22:52:31,192 --> 22:52:36,080
îl face mult mai flexibil

29744
22:52:33,360 --> 22:52:38,400
ca utilizare. Deep learning forj este bazat pe Java

29745
22:52:36,080 --> 22:52:40,720
și apoi crucea tocmai explodează

29746
22:52:38,400 --> 22:52:42,960
acum. Și asta este interesant. Crucea este

29747
22:52:40,720 --> 22:52:44,960
lucrez cu TensorFlow. De fapt

29748
22:52:42,960 --> 22:52:47,192
poate sta deasupra TensorFlow. Și se poate

29749
22:52:44,960 --> 22:52:48,720
isi face si treaba lui. Uh, dacă ești

29750
22:52:47,192 --> 22:52:50,320
studiind învățarea profundă, obțineți

29751
22:52:48,720 --> 22:52:52,000
în ea, vrei să știi elementele de bază ale

29752
22:52:50,320 --> 22:52:53,920
TensorFlow, dar și tu o vei face

29753
22:52:52,000 --> 22:52:55,680
doresc să cunoască nivelul superior al KAS

29754
22:52:53,920 --> 22:52:57,120
stând deasupra lui TensorFlow. Doar suntem

29755
22:52:55,680 --> 22:52:59,040
uitându-mă la TensorFlow astăzi, deși în

29756
22:52:57,120 --> 22:53:00,480
exemplul nostru. Și există și Torch aprins

29757
22:52:59,040 --> 22:53:03,760
acolo. Mai sunt o grămadă decât noi

29758
22:53:00,480 --> 22:53:06,480
nu a fost listat aici. Um chiar sklearn sau

29759
22:53:03,760 --> 22:53:08,320
pachetul lateral uh din Python are un

29760
22:53:06,480 --> 22:53:10,552
rețea neuronală puteți programa o foarte

29761
22:53:08,320 --> 22:53:12,320
unul de bază și este același de bază

29762
22:53:10,552 --> 22:53:13,512
ceea ce ai putea face în TensorFlow dacă ai

29763
22:53:12,320 --> 22:53:15,280
a scos totul din el și apoi

29764
22:53:13,512 --> 22:53:17,192
TensorFlow are o mulțime de instrumente pe care le au

29765
22:53:15,280 --> 22:53:18,960
adăugat și KAS la fel, dar mergem

29766
22:53:17,192 --> 22:53:21,680
să se uite în mod special la TensorFlow

29767
22:53:18,960 --> 22:53:23,832
în exemplul nostru și TensorFlow este un

29768
22:53:21,680 --> 22:53:26,400
instrument open-source folosit pentru a defini și a rula

29769
22:53:23,832 --> 22:53:28,480
calcule pe ceea ce ei numesc tensori

29770
22:53:26,400 --> 22:53:30,400
limbaj foarte comun acum deci tu mai mult și

29771
22:53:28,480 --> 22:53:32,720
mai mult vedem termenul tensor ca fiind a

29772
22:53:30,400 --> 22:53:34,320
standard în învățarea profundă

29773
22:53:32,720 --> 22:53:36,080
limba și asta a fost inițial

29774
22:53:34,320 --> 22:53:37,920
dezvoltat de Google. Deci hai să săpăm a

29775
22:53:36,080 --> 22:53:40,552
cam mare acolo. Ce sunt

29776
22:53:37,920 --> 22:53:43,192
tensori? Tensorii sunt doar un alt nume

29777
22:53:40,552 --> 22:53:46,080
pentru matrice. Deci un tensor de dimensiune

29778
22:53:43,192 --> 22:53:47,920
cinci. Puteți vedea aici că avem ab kmq

29779
22:53:46,080 --> 22:53:50,400
orice. Deci este o matrice care vine.

29780
22:53:47,920 --> 22:53:52,400
Și tensorul dimensiunii 54 mai degrabă

29781
22:53:50,400 --> 22:53:54,480
o poză. Foarte des întâlnit să vezi că într-un

29782
22:53:52,400 --> 22:53:56,160
poza. Puteți vedea și un tensor chiar

29783
22:53:54,480 --> 22:53:58,640
mai detaliat decât o imagine pe măsură ce mergem la

29784
22:53:56,160 --> 22:54:00,800
următorul. Tensorul dimensiunii 333.

29785
22:53:58,640 --> 22:54:02,800
Acesta este spațiul 3D. S-ar putea să aveți o

29786
22:54:00,800 --> 22:54:04,480
poza care are si culori. Asta ar putea

29787
22:54:02,800 --> 22:54:06,640
fi a treia dimensiune. S-ar putea să ai

29788
22:54:04,480 --> 22:54:08,720
patru dimensiuni pentru că le ai pe amândouă

29789
22:54:06,640 --> 22:54:11,280
grila ta și culoarea ta diferită

29790
22:54:08,720 --> 22:54:13,440
canalele și zplotul dvs. Poți vedea

29791
22:54:11,280 --> 22:54:16,320
unde acum puteți procesa o foarte

29792
22:54:13,440 --> 22:54:18,400
set de date de nivel înalt care intră dacă

29793
22:54:16,320 --> 22:54:19,832
ca imagine sau caracteristici. Ar putea fi

29794
22:54:18,400 --> 22:54:21,440
caracteristici care nu au nimic de-a face cu

29795
22:54:19,832 --> 22:54:23,512
imagini. Deci sunt o mulțime de lucruri

29796
22:54:21,440 --> 22:54:25,192
pot face acum cu tensorii care vin.

29797
22:54:23,512 --> 22:54:27,600
Așadar, aici se află termenul tensorflow

29798
22:54:25,192 --> 22:54:29,600
provine din. Deci avem um chiar acum

29799
22:54:27,600 --> 22:54:31,680
TensorFlow este cea mai populară bibliotecă

29800
22:54:29,600 --> 22:54:33,600
în deep learning și am menționat KAS

29801
22:54:31,680 --> 22:54:35,280
acum funcționează cu TensorFlow. Deci există o

29802
22:54:33,600 --> 22:54:37,680
multe lucruri pe care le poți face între cei doi.

29803
22:54:35,280 --> 22:54:40,480
E o bibliotecă de software open-source

29804
22:54:37,680 --> 22:54:43,040
dezvoltat de Google. Deci au lovit a

29805
22:54:40,480 --> 22:54:45,760
blocaj și și-au dat seama, hei, asta este

29806
22:54:43,040 --> 22:54:46,872
o tehnologie pentru scena infantilă. Știți noi

29807
22:54:45,760 --> 22:54:48,320
am crezut că va fi următorul

29808
22:54:46,872 --> 22:54:50,480
cel mai mare lucru și aveam să avem

29809
22:54:48,320 --> 22:54:52,160
ține-o, dar este cu adevărat copilăresc ca

29810
22:54:50,480 --> 22:54:53,760
în ceea ce privește modul în care se aplică și ce putem

29811
22:54:52,160 --> 22:54:55,600
face cu ea. Să deschidem sursa așa

29812
22:54:53,760 --> 22:54:56,960
toată lumea poate lucra la asta. hai să luăm

29813
22:54:55,600 --> 22:54:58,800
e la nivelul următor. Și asta este cu adevărat

29814
22:54:56,960 --> 22:55:00,400
ce face open source cu multe dintre acestea

29815
22:54:58,800 --> 22:55:03,680
uh pachete când le eliberează. Şi

29816
22:55:00,400 --> 22:55:05,760
puteți rula fie pe un procesor, fie pe un GPU. Deci

29817
22:55:03,680 --> 22:55:08,232
când ne uităm la detalii, dacă ai

29818
22:55:05,760 --> 22:55:10,400
unitățile tale de procesare grafică, ce este

29819
22:55:08,232 --> 22:55:12,232
frumos despre acestea este că aleargă mult

29820
22:55:10,400 --> 22:55:13,360
mai repede. Dezavantajul este că trebuie să joci

29821
22:55:12,232 --> 22:55:14,640
cu ei un pic pentru a-i ridica

29822
22:55:13,360 --> 22:55:16,400
și alergând. Și este un hardware

29823
22:55:14,640 --> 22:55:18,800
upgrade. Când îl vom rula, voi alerga

29824
22:55:16,400 --> 22:55:21,040
este în modul CPU. m-am jucat cu

29825
22:55:18,800 --> 22:55:22,400
este în GPU-ul meu de pe computerul meu personal.

29826
22:55:21,040 --> 22:55:24,800
știi, crește

29827
22:55:22,400 --> 22:55:26,800
prelucrare. Uh, dar am dat de unele

29828
22:55:24,800 --> 22:55:28,160
probleme de versiune cu Python-ul meu și

29829
22:55:26,800 --> 22:55:29,920
chestii de genul ăsta. Și când am făcut-o în sfârșit

29830
22:55:28,160 --> 22:55:31,192
rezolva, m-am întors la procesor

29831
22:55:29,920 --> 22:55:32,800
pentru că nu mi-a mărit viteza

29832
22:55:31,192 --> 22:55:34,232
suficient pentru ceea ce lucram. Dar în

29833
22:55:32,800 --> 22:55:36,320
un grup mai mare, ați putea pune

29834
22:55:34,232 --> 22:55:37,832
că pe. Dacă lucrați cu un mai mare

29835
22:55:36,320 --> 22:55:39,832
teanc de computere, poate doriți

29836
22:55:37,832 --> 22:55:42,480
rulați-l în GPU. Puteți crea o dată

29837
22:55:39,832 --> 22:55:44,400
grafice de flux care au noduri și muchii.

29838
22:55:42,480 --> 22:55:46,320
Deci ne apar marginile. Noi

29839
22:55:44,400 --> 22:55:48,960
nu am vorbit despre margini, dar asta e foarte

29840
22:55:46,320 --> 22:55:50,872
mod în ascensiune de a te uita la tine

29841
22:55:48,960 --> 22:55:52,552
datele analitice este modul de a face diferite

29842
22:55:50,872 --> 22:55:54,000
nodurile se conectează? Cum arată acele margini

29843
22:55:52,552 --> 22:55:55,600
ca intre ele? Și este folosit pentru

29844
22:55:54,000 --> 22:55:58,320
aplicații de învățare automată precum

29845
22:55:55,600 --> 22:56:00,160
rețele neuronale. Este în mare parte un neural

29846
22:55:58,320 --> 22:56:02,000
rețea, dar au tot felul de

29847
22:56:00,160 --> 22:56:03,920
instrumente care stau peste nivelul nostru de bază

29848
22:56:02,000 --> 22:56:06,960
rețea neuronală. Au lucruri noi

29849
22:56:03,920 --> 22:56:09,280
evoluând în biblioteca TensorFlow.

29850
22:56:06,960 --> 22:56:10,800
Deci, explodează foarte mult.

29851
22:56:09,280 --> 22:56:12,000
este momentul potrivit pentru a sari în TensorFlow

29852
22:56:10,800 --> 22:56:13,512
pentru că există tot felul de lucruri interesante

29853
22:56:12,000 --> 22:56:15,512
ne descurcăm cu ea și tot felul de

29854
22:56:13,512 --> 22:56:17,832
aplicații grozave pe care le poți folosi acum

29855
22:56:15,512 --> 22:56:20,400
TensorFlow pentru. Deci haideți să aruncăm o privire la

29856
22:56:17,832 --> 22:56:21,920
implementare în TensorFlow și suntem

29857
22:56:20,400 --> 22:56:24,552
de gând să construiască o rețea neuronală pentru

29858
22:56:21,920 --> 22:56:28,320
identificați cifrele scrise de mână folosind uh

29859
22:56:24,552 --> 22:56:30,080
Baza de date Mnest sau baza de date MNIST și

29860
22:56:28,320 --> 22:56:32,320
care înseamnă național modificat

29861
22:56:30,080 --> 22:56:34,960
Institutul de Standarde și Tehnologie

29862
22:56:32,320 --> 22:56:37,600
baza de date. Este o colecție de 70.000

29863
22:56:34,960 --> 22:56:39,680
cifrele scrise de mână și etichetele cifrelor

29864
22:56:37,600 --> 22:56:41,760
identifica fiecare dintre cifrele de la 0ero la

29865
22:56:39,680 --> 22:56:43,600
nouă. Acesta este un exemplu grozav pentru că

29866
22:56:41,760 --> 22:56:45,440
este destul de simplu încât ai putea

29867
22:56:43,600 --> 22:56:48,080
de fapt, rulați acest lucru prin unele de bază

29868
22:56:45,440 --> 22:56:50,000
algoritmi de clasificare a învățării automate

29869
22:56:48,080 --> 22:56:51,832
și antrenează-i și vei înțelege

29870
22:56:50,000 --> 22:56:53,832
același răspuns pentru că din nou este

29871
22:56:51,832 --> 22:56:55,512
grilă simplă. Cifrele de pe grilă

29872
22:56:53,832 --> 22:56:57,680
nu au o cantitate mare de variație

29873
22:56:55,512 --> 22:56:59,760
cum ai spune un condus automat

29874
22:56:57,680 --> 22:57:02,000
mașina privind mediul înconjurător. Deci tu

29875
22:56:59,760 --> 22:57:03,680
încă mai pot face asta cu mult din um-ul tău

29876
22:57:02,000 --> 22:57:05,120
diferite modele liniare și chestii de genul

29877
22:57:03,680 --> 22:57:06,872
că. Poți rezolva asta și vei obține

29878
22:57:05,120 --> 22:57:08,960
cam acelasi raspuns. Când am alergat un

29879
22:57:06,872 --> 22:57:11,192
comparație între TensorFlow și

29880
22:57:08,960 --> 22:57:13,192
între unele modele de regresie uh de bază

29881
22:57:11,192 --> 22:57:15,440
sau categoria modele uh în mașină

29882
22:57:13,192 --> 22:57:17,832
învățând, au apărut destul de bine ca

29883
22:57:15,440 --> 22:57:20,000
până la ieşirea lor. Deci asta e amabil

29884
22:57:17,832 --> 22:57:22,080
de unde începem să vedem complexitatea

29885
22:57:20,000 --> 22:57:24,000
de ceva ce vine în acest caz a

29886
22:57:22,080 --> 22:57:26,320
tensor pe care îl știi sau o grilă de uh

29887
22:57:24,000 --> 22:57:29,680
informații unde învățarea profundă

29888
22:57:26,320 --> 22:57:31,680
modelul merge la fel de bine ca modelele obișnuite

29889
22:57:29,680 --> 22:57:34,320
iar când treci peste acest gen de

29890
22:57:31,680 --> 22:57:36,160
complexitatea și caracteristicile dintr-o dată

29891
22:57:34,320 --> 22:57:38,320
rețelele neuronale vin cu mai bune

29892
22:57:36,160 --> 22:57:40,080
răspunde soluții mai bune și o mai bună

29893
22:57:38,320 --> 22:57:42,400
construi și de aceea există o astfel de mișcare

29894
22:57:40,080 --> 22:57:44,000
în rețelele neuronale este trăim într-o

29895
22:57:42,400 --> 22:57:45,680
lume complicată și este cu adevărat

29896
22:57:44,000 --> 22:57:47,832
mișto putem face cu asta. Deci

29897
22:57:45,680 --> 22:57:50,080
cifre scrise de mână din um NIST

29898
22:57:47,832 --> 22:57:52,320
baza de date, ei intră, setul de date este

29899
22:57:50,080 --> 22:57:55,280
folosit pentru a antrena mașina, o nouă imagine

29900
22:57:52,320 --> 22:57:56,960
dintr-o cifră este alimentată și cifra este

29901
22:57:55,280 --> 22:57:59,040
identificate. Hm și dacă te-ai uitat la

29902
22:57:56,960 --> 22:58:00,960
oricare dintre celelalte instrumente de învățare automată ale noastre

29903
22:57:59,040 --> 22:58:03,600
unde ne antrenăm, unde facem

29904
22:58:00,960 --> 22:58:05,120
antrenează modelul nostru să se potrivească și apoi tu

29905
22:58:03,600 --> 22:58:07,280
Testează-l, ar trebui să arate frumos

29906
22:58:05,120 --> 22:58:09,832
familiar. Uh și există niște instrumente

29907
22:58:07,280 --> 22:58:11,120
acolo pentru a spune categorisirea neantrenată uh

29908
22:58:09,832 --> 22:58:12,872
unde caută doar funcții

29909
22:58:11,120 --> 22:58:14,552
care se potrivesc. Deci există instrumente

29910
22:58:12,872 --> 22:58:16,160
care nu au nevoie de această pregătire. Dar asta

29911
22:58:14,552 --> 22:58:17,600
este locul în care vorbim despre neural

29912
22:58:16,160 --> 22:58:21,320
rețelele, trebuie să le instruim. Şi

29913
22:58:17,600 --> 22:58:21,320
la asta ne uităm.

29914
22:58:33,600 --> 22:58:38,552
Deci pentru asta voi folosi

29915
22:58:35,600 --> 22:58:40,640
Anaconda Navigator doar pentru că este un

29916
22:58:38,552 --> 22:58:43,280
instrument vizual foarte frumos. S-ar putea să fii în

29917
22:58:40,640 --> 22:58:45,040
PyCharm sau unul dintre celelalte IDE-uri ale tale pentru

29918
22:58:43,280 --> 22:58:47,600
editarea Python pentru că ne uităm la

29919
22:58:45,040 --> 22:58:49,680
Python TensorFlow. Și sub Anaconda,

29920
22:58:47,600 --> 22:58:51,280
avem caietul, ceea ce este ceva

29921
22:58:49,680 --> 22:58:53,760
folosim destul de regulat. Și au

29922
22:58:51,280 --> 22:58:55,832
Laboratorul Jupyter. Laboratorul Jupyter este

29923
22:58:53,760 --> 22:58:57,680
Caiet Jupyter, dar cu file și a

29924
22:58:55,832 --> 22:58:59,680
câteva caracteristici noi. Deci, vom folosi

29925
22:58:57,680 --> 22:59:01,600
Laboratorul Jupyter astăzi. Iar sub

29926
22:58:59,680 --> 22:59:04,080
mediu, vei dori să mergi înainte și

29927
22:59:01,600 --> 22:59:05,600
și dacă nu ai făcut-o încă, vei vedea

29928
22:59:04,080 --> 22:59:08,400
că am o serie de configurații diferite

29929
22:59:05,600 --> 22:59:12,000
aici. Chiar acum am Python-ul

29930
22:59:08,400 --> 22:59:14,872
versiunea 36 și TensorFlow. In aceasta

29931
22:59:12,000 --> 22:59:16,800
în cazul în care am TensorFlow 1.12. Dacă noi

29932
22:59:14,872 --> 22:59:19,832
derulați în jos puteți vedea că aici noi

29933
22:59:16,800 --> 22:59:21,832
du-te. TensorFlow și versiunea sa 1.12.

29934
22:59:19,832 --> 22:59:23,920
Și aici, dacă încă nu ai făcut-o, o vei face

29935
22:59:21,832 --> 22:59:26,232
trebuie să le instalezi și să intri și doar

29936
22:59:23,920 --> 22:59:29,192
deschide terminalul nostru. Și tu dacă nu ai făcut-o niciodată

29937
22:59:26,232 --> 22:59:30,552
folosit Anaconda sau dacă sunteți în dvs

29938
22:59:29,192 --> 22:59:33,440
altceva ai putea avea ceva

29939
22:59:30,552 --> 22:59:36,640
simplu ca pip. Este ceea ce folosesc pentru mine

29940
22:59:33,440 --> 22:59:38,232
instalați. Și puteți face pur și simplu instalarea

29941
22:59:36,640 --> 22:59:40,160
TensorFlow. Și asta ar trebui să aducă în

29942
22:59:38,232 --> 22:59:42,552
cea mai actuală versiune. Acum, când eu

29943
22:59:40,160 --> 22:59:44,080
l-a instalat acum câteva luni, Python

29944
22:59:42,552 --> 22:59:45,360
versiune, nu voi rula asta

29945
22:59:44,080 --> 22:59:48,872
pentru ca am instalat deja

29946
22:59:45,360 --> 22:59:51,192
aici. Versiunea Python 3.7, cea mai nouă

29947
22:59:48,872 --> 22:59:53,192
afară, mai aveam câteva probleme

29948
22:59:51,192 --> 22:59:55,120
TensorFlow. Cred că s-au reparat

29949
22:59:53,192 --> 22:59:56,800
în momentul în care am scris asta, dar eu sunt

29950
22:59:55,120 --> 22:59:58,720
voi rămâne cu 3.6 doar ca să nu o fac

29951
22:59:56,800 --> 23:00:02,000
face surprize acolo. Deci, aceasta este

29952
22:59:58,720 --> 23:00:04,480
Versiunea Python 36 cu TensorFlow 1.12

29953
23:00:02,000 --> 23:00:06,552
pe aici. Și dacă nu l-ați instalat

29954
23:00:04,480 --> 23:00:08,872
totuși, doriți să instalați și Numpy pentru

29955
23:00:06,552 --> 23:00:12,000
acest exemplu. Acesta este Numbers Python sau

29956
23:00:08,872 --> 23:00:14,160
uh nu py. Puteți pur și simplu să rulați un

29957
23:00:12,000 --> 23:00:16,720
instalați acolo. Ține cont dacă ești

29958
23:00:14,160 --> 23:00:18,640
în Anaconda și ai creat unul dintre

29959
23:00:16,720 --> 23:00:21,120
aceste medii specifice acestui lucru,

29960
23:00:18,640 --> 23:00:22,552
ține departe.

29961
23:00:21,120 --> 23:00:24,552
Dacă ai de gând să folosești pip, ține cu

29962
23:00:22,552 --> 23:00:26,400
pip. Nu instalați un pachet cu pip

29963
23:00:24,552 --> 23:00:28,232
și unul sub pentru că așa ei

29964
23:00:26,400 --> 23:00:30,400
urmăriți acele numere de versiune și modul în care acestea

29965
23:00:28,232 --> 23:00:32,232
se potrivesc și puteți ajunge cu o

29966
23:00:30,400 --> 23:00:34,160
problema. ei nu pip nu vede cond

29967
23:00:32,232 --> 23:00:35,512
si invers. Așa că păstrează asta înăuntru

29968
23:00:34,160 --> 23:00:37,120
contează când rulezi instalările.

29969
23:00:35,512 --> 23:00:39,192
Vom merge mai departe și vom deschide Jupyter Lab

29970
23:00:37,120 --> 23:00:41,192
și vom lansa asta. Deci

29971
23:00:39,192 --> 23:00:42,960
aici este Jupyter Lab-ul meu. Una dintre cele cu adevărat

29972
23:00:41,192 --> 23:00:45,280
caracteristicile interesante ale Jupyter Lab sunt pe care le aveți

29973
23:00:42,960 --> 23:00:46,960
file acum. Deci poți deschide mai multe uh

29974
23:00:45,280 --> 23:00:48,720
caiete. Și asta este frumos pentru că am

29975
23:00:46,960 --> 23:00:50,160
notele mele la care lucrez și apoi ale noastre

29976
23:00:48,720 --> 23:00:52,480
fereastra reală în care ne uităm. Și

29977
23:00:50,160 --> 23:00:54,720
vom merge mai departe și vom mări puțin

29978
23:00:52,480 --> 23:00:56,552
aici. Iată-ne. Deci ai un u

29979
23:00:54,720 --> 23:00:58,080
sperăm că fonturile sunt ușor de văzut. Și apoi

29980
23:00:56,552 --> 23:00:59,832
vom merge înainte și vom face un simplu sau obținem

29981
23:00:58,080 --> 23:01:01,760
importurile noastre din drum. Hm, și așa

29982
23:00:59,832 --> 23:01:03,440
vom importa TensorFlow-ul nostru ca

29983
23:01:01,760 --> 23:01:06,232
TF. Uh, acesta este aproape un standard

29984
23:01:03,440 --> 23:01:10,000
pentru TensorFlow, numpy, numerele noastre

29985
23:01:06,232 --> 23:01:13,920
Python ca py și ne vom importa matt

29986
23:01:10,000 --> 23:01:16,800
bibliotecă plot ca plt. Din nou, acestea sunt

29987
23:01:13,920 --> 23:01:18,960
foarte frecvente. Deci, dacă vedeți TF sau py sau

29988
23:01:16,800 --> 23:01:21,040
plt, acesta este un standard pe care majoritatea oamenilor

29989
23:01:18,960 --> 23:01:23,832
utilizare. trebuie? Nu, ai putea

29990
23:01:21,040 --> 23:01:25,040
import numpy în loc să faci ca py.

29991
23:01:23,832 --> 23:01:28,040
Și apoi de la

29992
23:01:25,040 --> 23:01:28,040
tensorflow.acamples.tutorial

29993
23:01:28,480 --> 23:01:32,872
tutoriale. Acest lucru este întotdeauna frumos pentru că

29994
23:01:30,552 --> 23:01:34,552
ele includ de fapt setul de date care suntem

29995
23:01:32,872 --> 23:01:37,512
mergi sa te joci cu. Deci, vom merge

29996
23:01:34,552 --> 23:01:39,360
import date de intrare. Deci, sunt datele noastre

29997
23:01:37,512 --> 23:01:40,480
intră. Asta e tot ce facem este

29998
23:01:39,360 --> 23:01:41,600
spunându-i că aici vine

29999
23:01:40,480 --> 23:01:42,800
din. Și dacă vom spune unde

30000
23:01:41,600 --> 23:01:44,160
vine de la, trebuie să mergem înainte

30001
23:01:42,800 --> 23:01:45,680
și creați o variabilă cu asta

30002
23:01:44,160 --> 23:01:48,080
informații din ea. Și doar o să sunăm

30003
23:01:45,680 --> 23:01:49,680
acest mnist

30004
23:01:48,080 --> 23:01:50,872
sau tocate. Știi, nu știu cu adevărat

30005
23:01:49,680 --> 23:01:52,080
cum pronunță ei asta. ar trebui

30006
23:01:50,872 --> 23:01:54,320
probabil că uită-te la asta. Este foarte

30007
23:01:52,080 --> 23:01:57,192
set comun de date de utilizat. Și acolo este al nostru

30008
23:01:54,320 --> 23:01:59,760
date de intrare. Și vom citi date

30009
23:01:57,192 --> 23:02:01,920
seturi. Și asta e dacă te uiți

30010
23:01:59,760 --> 23:02:05,040
aceasta, am importat date de intrare din nostru

30011
23:02:01,920 --> 23:02:07,832
TensorFlow. Și deci acesta este un TensorFlow

30012
23:02:05,040 --> 23:02:09,512
citiți declarația pentru tutorialele lor. Deci

30013
23:02:07,832 --> 23:02:11,512
asta nu este ca un Python special

30014
23:02:09,512 --> 23:02:13,440
setare. Aceasta este doar configurația lor. Face

30015
23:02:11,512 --> 23:02:14,800
este ușor să-l tragi. Deci, odată ce ajungem

30016
23:02:13,440 --> 23:02:16,800
în seturile lor de date, trebuie să mergem

30017
23:02:14,800 --> 23:02:18,232
înainte și spuneți-i ce fel de set de date.

30018
23:02:16,800 --> 23:02:20,080
Și din nou, asta este ceea ce am adus,

30019
23:02:18,232 --> 23:02:24,080
dar vor fi datele nint. Şi

30020
23:02:20,080 --> 23:02:27,832
această parte este foarte importantă. unul fierbinte

30021
23:02:24,080 --> 23:02:31,120
este egal cu adevărat. Aceasta înseamnă că în loc de

30022
23:02:27,832 --> 23:02:33,040
importând o valoare de la 0 la 9, noi

30023
23:02:31,120 --> 23:02:35,600
evalua setul de date. O să fie

30024
23:02:33,040 --> 23:02:37,832
adu-l ca unul fierbinte. Ori de câte ori vezi

30025
23:02:35,600 --> 23:02:40,232
un codificator fierbinte, o aplatizăm

30026
23:02:37,832 --> 23:02:42,640
afară. Și avem adevărat fals pentru zero,

30027
23:02:40,232 --> 23:02:44,480
adevărat fals pentru unul, adevărat fals pentru doi.

30028
23:02:42,640 --> 23:02:46,872
Deci rezultatul nostru, dacă vă amintiți de la nostru

30029
23:02:44,480 --> 23:02:48,480
scos din slide-ul pe care l-am făcut mai devreme,

30030
23:02:46,872 --> 23:02:50,000
uh, în acest caz, l-am luat pe cel pentru

30031
23:02:48,480 --> 23:02:52,552
pretul bicicletei. Chiar nu contează care

30032
23:02:50,000 --> 23:02:54,640
unul pe care îl folosim. Aceasta are o singură ieșire. Deci noi

30033
23:02:52,552 --> 23:02:56,320
avem prețul bicicletei noastre pe asta. Mergem

30034
23:02:54,640 --> 23:02:58,640
pentru a avea în loc de o singură ieșire, suntem

30035
23:02:56,320 --> 23:03:00,720
va avea 10 ieșiri reprezentând

30036
23:02:58,640 --> 23:03:02,080
fiecare dintre cifrele de acolo. Și asta

30037
23:03:00,720 --> 23:03:03,512
codul chiar nu ne va arăta

30038
23:03:02,080 --> 23:03:05,192
orice. E bine să vedem ce suntem

30039
23:03:03,512 --> 23:03:08,720
privind de fapt. Deci hai să mergem

30040
23:03:05,192 --> 23:03:13,280
înainte și face o figura axe egale intra în

30041
23:03:08,720 --> 23:03:15,040
biblioteca noastră de parcele subparcele 10, 10. Și

30042
23:03:13,280 --> 23:03:17,440
asta dacă îți amintești despre care am vorbit

30043
23:03:15,040 --> 23:03:20,320
tensor. Tensorul fiind datele care vin.

30044
23:03:17,440 --> 23:03:22,400
Aceasta este o grilă de 10 pe 10 sau 100 de pixeli

30045
23:03:20,320 --> 23:03:24,960
acolo. Și dacă îl vom afișa,

30046
23:03:22,400 --> 23:03:28,400
hai să facem K0

30047
23:03:24,960 --> 23:03:30,552
pentru I și intervalul 10. Doar o buclă simplă

30048
23:03:28,400 --> 23:03:33,600
prin intermediul datelor. Să facem ceea ce este

30049
23:03:30,552 --> 23:03:36,320
asta? Uh, pentru J și intervalul 10. Și I

30050
23:03:33,600 --> 23:03:38,400
de fapt, am greșit că 10 uh 10 x 10 este

30051
23:03:36,320 --> 23:03:40,320
nu dimensiunea reală a pixelilor. Uh

30052
23:03:38,400 --> 23:03:41,680
pixelii efectivi vor fi noi

30053
23:03:40,320 --> 23:03:42,960
uită-te la forme și vom intra

30054
23:03:41,680 --> 23:03:45,120
că într-o secundă aici. Vom lua o

30055
23:03:42,960 --> 23:03:47,680
privire rapidă la forma de acolo. Uh se întoarce

30056
23:03:45,120 --> 23:03:50,232
afară sunt uh ce sunt? sunt, eu

30057
23:03:47,680 --> 23:03:51,440
crede, 28x 28. Uh, deci să luăm o

30058
23:03:50,232 --> 23:03:53,040
uite la asta. Și doar o să facem

30059
23:03:51,440 --> 23:03:54,800
complotează acestea. La ce ne uităm? Ce

30060
23:03:53,040 --> 23:03:56,800
lucram cu? Ca date

30061
23:03:54,800 --> 23:03:59,192
om de știință, ar trebui să cauți mereu

30062
23:03:56,800 --> 23:04:00,720
înapoi la datele dvs. și vedeți ce sunt

30063
23:03:59,192 --> 23:04:02,720
seamănă cu acel om

30064
23:04:00,720 --> 23:04:04,232
perspectivă pentru că nu știi niciodată.

30065
23:04:02,720 --> 23:04:06,800
Știi, computerul poate pune

30066
23:04:04,232 --> 23:04:08,480
ceva care pare nu are sens.

30067
23:04:06,800 --> 23:04:10,320
Și în acel moment, vrei să te întorci

30068
23:04:08,480 --> 23:04:11,760
și reevaluează ceea ce ai făcut. Uh, deci

30069
23:04:10,320 --> 23:04:13,360
vom merge înainte și vom complota. Suntem

30070
23:04:11,760 --> 23:04:14,800
Vom reprezenta 10 cifre, știi, 10 din

30071
23:04:13,360 --> 23:04:17,760
cifrele cu 10 dintre cifre. Şi

30072
23:04:14,800 --> 23:04:19,440
iată toporul nostru. Vom crea J-ul pe nostru

30073
23:04:17,760 --> 23:04:20,480
subtrame și vom face o imagine

30074
23:04:19,440 --> 23:04:24,000
arată. Ne vom uita la

30075
23:04:20,480 --> 23:04:25,760
imagine de antrenament pentru imaginile lui K. Și apoi

30076
23:04:24,000 --> 23:04:27,512
vrem să remodelăm acest lucru. Vom merge

30077
23:04:25,760 --> 23:04:30,080
remodelează asta. Și o să ne remodelăm

30078
23:04:27,512 --> 23:04:31,512
acest 28x 28. Așa am știut că îl am

30079
23:04:30,080 --> 23:04:33,120
greșit este pentru că m-am uitat în jos notițelor mele. eu

30080
23:04:31,512 --> 23:04:34,800
Era ca, oh, nu, asta spune 28. Nu este

30081
23:04:33,120 --> 23:04:36,400
10 x 10. Și ar trebui să știu deja asta

30082
23:04:34,800 --> 23:04:37,832
pentru că m-am încurcat destul cu asta

30083
23:04:36,400 --> 23:04:40,080
set de date pe care ar fi trebuit să-l amintesc.

30084
23:04:37,832 --> 23:04:41,760
Uh, dar este 28 x 28. Și aspectul

30085
23:04:40,080 --> 23:04:43,360
vom face este auto. Și aceasta este

30086
23:04:41,760 --> 23:04:46,000
toate, dacă te uiți la asta, iată-le noastre

30087
23:04:43,360 --> 23:04:48,320
variabila NIST. din care provine NIST

30088
23:04:46,000 --> 23:04:51,192
set de date. Uh, deci totul face parte din

30089
23:04:48,320 --> 23:04:52,800
Învățare sau exemple TF TensorFlow

30090
23:04:51,192 --> 23:04:56,000
tutorial acolo. Și apoi vom merge

30091
23:04:52,800 --> 23:04:58,000
înainte și facem K plus egal cu 1. Deci doar

30092
23:04:56,000 --> 23:04:59,512
continuați să căutați prin diferitele noastre um

30093
23:04:58,000 --> 23:05:02,000
imagini. Și să vedem cum arată

30094
23:04:59,512 --> 23:05:03,440
ca. Să mergem mai departe și să facem un spectacol.

30095
23:05:02,000 --> 23:05:04,720
Uh și vom merge înainte și vom rula asta, așa că noi

30096
23:05:03,440 --> 23:05:06,480
putem arunca o privire și vedem ce avem

30097
23:05:04,720 --> 23:05:08,080
aici. Și așa avem un complot frumos aici.

30098
23:05:06,480 --> 23:05:09,832
Și puteți vedea doar că avem uh

30099
23:05:08,080 --> 23:05:11,760
câteva numere aleatorii care apar în fiecare

30100
23:05:09,832 --> 23:05:14,080
una dintre aceste mici subploturi. Dacă ești

30101
23:05:11,760 --> 23:05:16,000
dorind o copie a acestui cod, pune o notă

30102
23:05:14,080 --> 23:05:17,280
jos în videoclipul de pe YouTube și lasă-ne

30103
23:05:16,000 --> 23:05:19,360
știi sau vino la noi la

30104
23:05:17,280 --> 23:05:20,960
www.simplearn.com

30105
23:05:19,360 --> 23:05:22,552
și vă vom trimite o copie a ce

30106
23:05:20,960 --> 23:05:24,800
lucrăm și obținem o copie a acestuia

30107
23:05:22,552 --> 23:05:26,400
pentru propria ta configurație. Uh, deci acum avem

30108
23:05:24,800 --> 23:05:27,920
aruncăm o privire și putem doar să vedem că avem

30109
23:05:26,400 --> 23:05:29,440
iată pozele noastre care apar.

30110
23:05:27,920 --> 23:05:31,360
Le-am trasat astfel încât să avem o idee

30111
23:05:29,440 --> 23:05:33,440
la ce ne uităm. Să mergem înainte

30112
23:05:31,360 --> 23:05:35,920
și imprimați. Să ne uităm la forma

30113
23:05:33,440 --> 23:05:39,832
caracteristicile. Atunci când avem asta, noi

30114
23:05:35,920 --> 23:05:41,192
avem imaginile noastre cu trenul cuib și vom face

30115
23:05:39,832 --> 23:05:43,360
forma de acolo. Să aruncăm o privire

30116
23:05:41,192 --> 23:05:45,760
și vedeți la ce ne uităm

30117
23:05:43,360 --> 23:05:49,040
în măsura în care numărul nostru și tot. Şi

30118
23:05:45,760 --> 23:05:50,720
deci puteți vedea aici că avem 55.000.

30119
23:05:49,040 --> 23:05:53,600
Practic, atâtea imagini avem

30120
23:05:50,720 --> 23:05:55,440
iar aceasta prin 784. Și în acest set de date

30121
23:05:53,600 --> 23:05:57,600
sunt și etichetele noastre. Deci să luăm un

30122
23:05:55,440 --> 23:05:59,600
uite la asta. Avem trenul nostru de plasă

30123
23:05:57,600 --> 23:06:01,440
forma etichetelor. Să aruncăm o privire și să vedem

30124
23:05:59,600 --> 23:06:03,512
cum arată. Uh și acolo noi

30125
23:06:01,440 --> 23:06:04,872
au 10 pentru că sunt 10 cifre. Deci noi

30126
23:06:03,512 --> 23:06:06,480
adus înăuntru, aceasta este rezultatul nostru

30127
23:06:04,872 --> 23:06:08,872
privind. Și așa avem acolo, mergem

30128
23:06:06,480 --> 23:06:10,400
55.000. Se potrivesc. Ar trebui să se potrivească

30129
23:06:08,872 --> 23:06:12,640
pentru că ar trebui să aveți numere egale în

30130
23:06:10,400 --> 23:06:14,232
ambele. Știi, iată datele noastre

30131
23:06:12,640 --> 23:06:16,720
în și iată răspunsul nostru. Dacă tu

30132
23:06:14,232 --> 23:06:19,360
amintiți-vă, acesta este o grămadă de zerouri și

30133
23:06:16,720 --> 23:06:21,040
cu câte câte unul, fiecare va fi 0001

30134
23:06:19,360 --> 23:06:22,320
ar fi ce litera patru sau ceva

30135
23:06:21,040 --> 23:06:24,720
asa. Deci, să aruncăm o privire la ce

30136
23:06:22,320 --> 23:06:26,552
singura noastră codificare fierbinte a făcut-o pentru prima

30137
23:06:24,720 --> 23:06:28,720
observatie. Și aici suntem

30138
23:06:26,552 --> 23:06:30,720
explorând date, chiar vrei să sapi

30139
23:06:28,720 --> 23:06:31,920
acolo și vezi ce dracu sunt

30140
23:06:30,720 --> 23:06:33,760
privind. Deci, ne vom uita la

30141
23:06:31,920 --> 23:06:35,440
etichetele. Și acesta ar fi primul

30142
23:06:33,760 --> 23:06:37,360
eticheta care apare. Și vom merge înainte

30143
23:06:35,440 --> 23:06:38,872
și rulează asta. Și ne uităm la asta. tu

30144
23:06:37,360 --> 23:06:43,600
pot vedea despre asta vorbesc.

30145
23:06:38,872 --> 23:06:47,040
0 0 sau 1 este 0 2 este 0 3 este 0 patru este 0 5

30146
23:06:43,600 --> 23:06:49,192
este 0 6 este 0. 7 este egal cu 1. Deci, foarte

30147
23:06:47,040 --> 23:06:51,040
prima etichetă este un șapte. Dar chiar al nostru

30148
23:06:49,192 --> 23:06:54,160
apare prima etichetă că este un șapte.

30149
23:06:51,040 --> 23:06:56,080
Și deci nu avem de la 0 la 9.

30150
23:06:54,160 --> 23:06:58,720
Avem o grămadă de zerouri și doar

30151
23:06:56,080 --> 23:07:00,232
unul să-l marcheze ca șapte aici. Deci

30152
23:06:58,720 --> 23:07:02,400
acum ne-am cam uitat rapid la

30153
23:07:00,232 --> 23:07:05,832
datele. Și aici s-ar putea să întrebi pe unii

30154
23:07:02,400 --> 23:07:08,080
întrebări precum ce este 784? 24 * 24.

30155
23:07:05,832 --> 23:07:10,960
Amintiți-vă că aceasta este dimensiunea grilei noastre

30156
23:07:08,080 --> 23:07:12,720
acolo sau intră tensorul nostru. Deci 784 este

30157
23:07:10,960 --> 23:07:14,320
o configurație acolo. Și am trecut prin

30158
23:07:12,720 --> 23:07:16,320
toate acestea vizând datele. Vom merge

30159
23:07:14,320 --> 23:07:18,320
înainte și începeți să vă uitați la noi

30160
23:07:16,320 --> 23:07:19,760
tensorflow. Deci, să luăm X-ul nostru

30161
23:07:18,320 --> 23:07:22,640
variabilă. Acesta va fi al nostru

30162
23:07:19,760 --> 23:07:24,232
set de antrenament. Vom face un substituent și

30163
23:07:22,640 --> 23:07:26,232
atunci le vom face pe astea să intre

30164
23:07:24,232 --> 23:07:28,480
ca plutitor. Acum, dacă îmi amintesc bine,

30165
23:07:26,232 --> 23:07:30,400
de fapt sunt, știi, zero sau unu

30166
23:07:28,480 --> 23:07:31,832
pentru valori pentru că sunt fie

30167
23:07:30,400 --> 23:07:33,360
dar le avem venind ca un plutitor

30168
23:07:31,832 --> 23:07:34,720
valoare. Și avem un pic de a

30169
23:07:33,360 --> 23:07:37,360
forma care vine aici. Și acolo este al nostru

30170
23:07:34,720 --> 23:07:39,192
784. Așa că îi anunțăm că asta este

30171
23:07:37,360 --> 23:07:41,680
care este contribuția noastră pentru noi

30172
23:07:39,192 --> 23:07:43,360
TensorFlow. Și acesta este antrenamentul nostru

30173
23:07:41,680 --> 23:07:46,000
set. Așa că vom pune o etichetă acolo

30174
23:07:43,360 --> 23:07:48,720
să ne ajute să urmărim acel tren. Şi

30175
23:07:46,000 --> 23:07:51,832
apoi W. Și cu W, vom merge înainte și

30176
23:07:48,720 --> 23:07:54,960
face variabile TF. Și vom face asta ca uh

30177
23:07:51,832 --> 23:07:58,400
zerouri variabile TF zerouri. Și vom stabili

30178
23:07:54,960 --> 23:08:01,760
aceasta ca 784 cu 10. 10 fiind cel

30179
23:07:58,400 --> 23:08:04,400
ieșire. 784 fiind numărul nostru de

30180
23:08:01,760 --> 23:08:06,552
variabile în și acestea sunt ponderile noastre.

30181
23:08:04,400 --> 23:08:08,720
Amintiți-vă că avem o părtinire și acolo.

30182
23:08:06,552 --> 23:08:11,120
Și voi reveni peste asta în doar o

30183
23:08:08,720 --> 23:08:13,760
în al doilea rând, când vedem cum se potrivește

30184
23:08:11,120 --> 23:08:15,920
în fluxul nostru tensor. Și o vom face pe asta

30185
23:08:13,760 --> 23:08:17,440
cu variabilele noastre din nou. Avem 10.

30186
23:08:15,920 --> 23:08:19,040
Deci vom face părtinirea. Suntem

30187
23:08:17,440 --> 23:08:22,232
mergând să o fac în același tip de format și

30188
23:08:19,040 --> 23:08:25,040
configurați aici. Și așa vom face asta ca

30189
23:08:22,232 --> 23:08:26,960
ca zerouri TF de 10. Deci vom crea doar

30190
23:08:25,040 --> 23:08:30,552
o matrice de 10 acolo. Și acesta este al nostru

30191
23:08:26,960 --> 23:08:32,400
părtinire. Deci, cu aceste trei rânduri um și

30192
23:08:30,552 --> 23:08:35,120
de fapt, ei ies cu ei

30193
23:08:32,400 --> 23:08:36,552
execuția nerăbdătoare care ar ocoli

30194
23:08:35,120 --> 23:08:37,832
ceva din ceea ce facem. Dar asta este

30195
23:08:36,552 --> 23:08:39,280
important de înțeles este primul

30196
23:08:37,832 --> 23:08:41,192
lucru pe care trebuie să-l faci cu TensorFlow este

30197
23:08:39,280 --> 23:08:44,080
trebuie să alocăm un spațiu pentru

30198
23:08:41,192 --> 23:08:46,080
variabilele și substituentul nostru TF și nostru

30199
23:08:44,080 --> 23:08:48,000
TF variabilă cu greutățile noastre și ale noastre

30200
23:08:46,080 --> 23:08:49,680
părtiniri. Acest lucru de fapt nu s-a făcut

30201
23:08:48,000 --> 23:08:51,192
orice încă. Deci tot ce este

30202
23:08:49,680 --> 23:08:53,040
substituenți. De aceea este în regulă

30203
23:08:51,192 --> 23:08:55,040
utilizați zerouri. Ai putea avea la fel

30204
23:08:53,040 --> 23:08:57,680
cele folosite usor sau orice altceva si asta

30205
23:08:55,040 --> 23:09:00,232
nu ar conta. Următoarea etapă este să mergi

30206
23:08:57,680 --> 23:09:02,000
înainte și configurați unele dintre funcții

30207
23:09:00,232 --> 23:09:03,832
merge mai departe. Dar înainte de a face asta, doar

30208
23:09:02,000 --> 23:09:05,760
rețineți că acest lucru nu a făcut nimic.

30209
23:09:03,832 --> 23:09:07,512
Chiar dacă îl execut, tot ce se face este

30210
23:09:05,760 --> 23:09:09,600
a creat substituenți până când facem

30211
23:09:07,512 --> 23:09:11,600
initializarea finala. Și așa trebuie

30212
23:09:09,600 --> 23:09:14,480
merge mai departe și înființează-te. Vom face y=

30213
23:09:11,600 --> 23:09:18,480
tf.n.oftmax.

30214
23:09:14,480 --> 23:09:21,280
Și codul pentru aceasta este tf.mmoxw.

30215
23:09:18,480 --> 23:09:22,800
Și aceasta este suma noastră. Să punem doar o

30216
23:09:21,280 --> 23:09:25,680
notează aici ca să putem urmări ceea ce este

30217
23:09:22,800 --> 23:09:29,040
merge mai departe. Găsim suma ponderată a

30218
23:09:25,680 --> 23:09:31,600
intrări plus părtinirea. Uh, deci acolo este al nostru

30219
23:09:29,040 --> 23:09:34,480
plus b părtinire și apoi trebuie să mergem

30220
23:09:31,600 --> 23:09:36,640
înainte ține um hai să facem y subliniere și

30221
23:09:34,480 --> 23:09:38,800
din nou un alt substituent și acesta

30222
23:09:36,640 --> 23:09:41,360
o să-l punem de fapt o să punem ca

30223
23:09:38,800 --> 23:09:43,920
substituent tf pe aici substituent tf

30224
23:09:41,360 --> 23:09:46,720
nu plutește nici unul 10. Iată-o fierbinte

30225
23:09:43,920 --> 23:09:50,160
codificatorul merge acolo. Deci cele 10 valori ale noastre

30226
23:09:46,720 --> 23:09:52,552
ieșind și vom face o entropie încrucișată

30227
23:09:50,160 --> 23:09:55,760
aici și asta va fi minus tf

30228
23:09:52,552 --> 23:09:57,760
reduce suma și vom face y aici este y-ul nostru

30229
23:09:55,760 --> 23:10:00,552
subliniază care este amintiți-vă că avem

30230
23:09:57,760 --> 23:10:02,480
ieșirea dvs. y și ieșirea dvs. reală. Uh

30231
23:10:00,552 --> 23:10:06,232
deci acesta va fi timpul nostru de subliniere

30232
23:10:02,480 --> 23:10:08,232
logul tf al lui y. Și apoi în sfârșit um

30233
23:10:06,232 --> 23:10:10,000
înainte de a face inițializarea propriu-zisă

30234
23:10:08,232 --> 23:10:12,552
dintre toate variabilele noastre le vom configura

30235
23:10:10,000 --> 23:10:14,552
pas de tren. Aceasta este egală cu gradientul nostru

30236
23:10:12,552 --> 23:10:16,480
optimizator de coborâre. Foarte important.

30237
23:10:14,552 --> 23:10:18,552
Amintiți-vă că ne-am uitat la acea diagramă de pe noi

30238
23:10:16,480 --> 23:10:20,232
um uh diapozitive și așa le-am configurat pe toate

30239
23:10:18,552 --> 23:10:22,800
aceste formule și iată gradientul nostru

30240
23:10:20,232 --> 23:10:24,800
optimizator de coborâre și pe măsură ce se păstrează

30241
23:10:22,800 --> 23:10:26,720
caută-l continuă să caute acel zero

30242
23:10:24,800 --> 23:10:28,872
valoare. Asta facem cu asta

30243
23:10:26,720 --> 23:10:30,400
formula anume. Deci haideți să aruncăm o privire

30244
23:10:28,872 --> 23:10:32,320
și vezi ce facem aici. Noi doar

30245
23:10:30,400 --> 23:10:34,720
aduna toate piesele noastre pentru

30246
23:10:32,320 --> 23:10:37,832
TensorFlow. Și știi că diavolul e înăuntru

30247
23:10:34,720 --> 23:10:39,512
detaliile. Avem aici antrenamentul nostru

30248
23:10:37,832 --> 23:10:42,080
set venind. Trebuie să punem o

30249
23:10:39,512 --> 23:10:44,232
substituent acolo. Avem uh-ul nostru

30250
23:10:42,080 --> 23:10:46,960
variabilele cu ponderile lor. Avem

30251
23:10:44,232 --> 23:10:49,760
prejudecățile noastre ies la iveală și apoi am introdus

30252
23:10:46,960 --> 23:10:52,000
suma noastră ponderată. Deci iată

30253
23:10:49,760 --> 23:10:54,552
însumând aici suma noastră. Apoi noi

30254
23:10:52,000 --> 23:10:56,552
au ieșirea noastră variabilă y. Deci există

30255
23:10:54,552 --> 23:10:58,800
ai nostru cum funcționează și apoi bineînțeles

30256
23:10:56,552 --> 23:11:01,040
ieșirea reală de acolo. Și apoi noi

30257
23:10:58,800 --> 23:11:04,232
avem entropia noastră cruce și

30258
23:11:01,040 --> 23:11:06,640
acesta este minusul nostru tf.reduce suma y *

30259
23:11:04,232 --> 23:11:08,960
logul tf al lui y. Și apoi antrenamentul

30260
23:11:06,640 --> 23:11:10,872
optimizator de coborâre a gradientului de pas și

30261
23:11:08,960 --> 23:11:12,640
folosim un 0,01 în asta și suntem

30262
23:11:10,872 --> 23:11:14,232
va minimiza entropia încrucișată. Deci,

30263
23:11:12,640 --> 23:11:16,160
o vom lăsa să facă toată treaba.

30264
23:11:14,232 --> 23:11:18,400
Deci, odată ce le-am configurat pe toate

30265
23:11:16,160 --> 23:11:20,000
straturi diferite, pentru care le-am alocat

30266
23:11:18,400 --> 23:11:22,400
ei, trebuie să mergem mai departe și să le inițializam

30267
23:11:20,000 --> 23:11:24,720
ei. Deci, vom face un init tf

30268
23:11:22,400 --> 23:11:26,720
inițializați și totul va fi

30269
23:11:24,720 --> 23:11:28,232
variabile. Uh, unul dintre lucrurile interesante este

30270
23:11:26,720 --> 23:11:30,080
sunt pe cale să dispară

30271
23:11:28,232 --> 23:11:32,000
cu asta. Deci, toți acești pași ar fi

30272
23:11:30,080 --> 23:11:33,920
grupate într-unul singur în loc să fie nevoie

30273
23:11:32,000 --> 23:11:36,400
au substituenți. Le inițializați

30274
23:11:33,920 --> 23:11:38,800
în același proces care se desfășoară. Și apoi

30275
23:11:36,400 --> 23:11:40,320
în cele din urmă, totul în TensorFlow este

30276
23:11:38,800 --> 23:11:42,000
pe baza sesiunii dvs. Acum, aceasta este

30277
23:11:40,320 --> 23:11:43,600
schimbând faptul că există alte opțiuni pentru

30278
23:11:42,000 --> 23:11:46,640
să putem rula asta, dar vrem să mergem

30279
23:11:43,600 --> 23:11:48,640
înainte și face uh sesiune. Acolo este TF-ul nostru.

30280
23:11:46,640 --> 23:11:50,640
Există o sesiune TF. Și atunci vrem

30281
23:11:48,640 --> 23:11:51,920
pentru a merge înainte și a rula sesiunea. Și ce

30282
23:11:50,640 --> 23:11:54,160
o sa alergam? Ei bine, am făcut-o

30283
23:11:51,920 --> 23:11:55,600
inițializarea tuturor variabilelor noastre. Uh

30284
23:11:54,160 --> 23:11:57,920
deci, asta este ceea ce alergăm. Și asta

30285
23:11:55,600 --> 23:12:00,552
de fapt suntem odată ce facem asta, noi

30286
23:11:57,920 --> 23:12:02,872
creați de fapt obiectul nostru TensorFlow.

30287
23:12:00,552 --> 23:12:05,360
Deci, toată această bucată de cod chiar aici

30288
23:12:02,872 --> 23:12:07,120
este obiectul nostru TensorFlow. Avem al nostru

30289
23:12:05,360 --> 23:12:10,080
intrarea vine cu ponderarea noastră

30290
23:12:07,120 --> 23:12:12,640
variabile care vin. Maxul nostru soft pentru

30291
23:12:10,080 --> 23:12:14,960
metalul nostru se stinge. Cum îl adaugă

30292
23:12:12,640 --> 23:12:17,040
împreună pentru valoarea noastră? Uh și apoi noi

30293
23:12:14,960 --> 23:12:19,360
au venit valoarea reală uh float

30294
23:12:17,040 --> 23:12:20,872
afară. Ne verificăm până la capăt.

30295
23:12:19,360 --> 23:12:22,400
Deci puteți vedea toate etapele diferite

30296
23:12:20,872 --> 23:12:23,512
trecând prin asta ne instalăm. Hm

30297
23:12:22,400 --> 23:12:26,160
iar acesta este unul dintre motivele pentru care a

30298
23:12:23,512 --> 23:12:28,720
mulți oameni ca TensorFlow este pentru că

30299
23:12:26,160 --> 23:12:30,960
puteți desemna toate acestea diferite

30300
23:12:28,720 --> 23:12:32,400
bucăți câte un pas. Aceasta este de asemenea

30301
23:12:30,960 --> 23:12:34,480
unul dintre motivele pentru care oamenilor nu le place

30302
23:12:32,400 --> 23:12:36,080
TensorFlow este pentru că trebuie

30303
23:12:34,480 --> 23:12:38,400
desemnează toate straturile diferite

30304
23:12:36,080 --> 23:12:40,872
coborând și sunt o mulțime de trepte

30305
23:12:38,400 --> 23:12:43,680
făcut chiar acum pentru a minimiza acest lucru

30306
23:12:40,872 --> 23:12:45,360
ușurează fie automatizarea acestuia, fie

30307
23:12:43,680 --> 23:12:47,600
pentru a vă permite să faceți mai complicat

30308
23:12:45,360 --> 23:12:49,360
lucrurile și toți acești pași sunt încă la

30309
23:12:47,600 --> 23:12:51,192
joacă. Deci merită să cercetăm

30310
23:12:49,360 --> 23:12:53,760
versiune mai avansată ce se întâmplă

30311
23:12:51,192 --> 23:12:55,040
cu KAS deasupra TensorFlow. Este de asemenea

30312
23:12:53,760 --> 23:12:56,552
important să înțelegem ce se întâmplă

30313
23:12:55,040 --> 23:12:58,160
la aceste niveluri individuale dacă sunteți

30314
23:12:56,552 --> 23:13:00,160
mergi sa te joci cu ei. Este important

30315
23:12:58,160 --> 23:13:02,232
să înțeleg, hei, ce se întâmplă cu

30316
23:13:00,160 --> 23:13:04,080
uh găsirea sumei ponderate a

30317
23:13:02,232 --> 23:13:06,000
intrări plus părtinirea pentru că există

30318
23:13:04,080 --> 23:13:07,680
alte moduri de a face asta. Există tot felul

30319
23:13:06,000 --> 23:13:09,600
de alte instrumente acolo acum, dar asta este

30320
23:13:07,680 --> 23:13:11,280
configurarea de bază pe care doriți să o faceți pe a

30321
23:13:09,600 --> 23:13:12,960
TensorFlow vine. Și vrem să mergem

30322
23:13:11,280 --> 23:13:14,640
înainte și doar fugi și recunoaște-ne

30323
23:13:12,960 --> 23:13:16,480
TensorFlow. Deci, hai să mergem înainte și să facem

30324
23:13:14,640 --> 23:13:18,480
că. Să rulăm asta. Primim un

30325
23:13:16,480 --> 23:13:20,640
avertisment aici pentru că e o mișcare

30326
23:13:18,480 --> 23:13:22,552
pentru a utiliza variabile globale. Acesta este unul dintre

30327
23:13:20,640 --> 23:13:23,832
schimbările pe care le fac, dar ca

30328
23:13:22,552 --> 23:13:25,360
în ceea ce privește acest exemplu, nu va fi

30329
23:13:23,832 --> 23:13:26,800
face o diferență pentru că facem

30330
23:13:25,360 --> 23:13:28,232
odată ce îl inițializam. Aceasta este

30331
23:13:26,800 --> 23:13:29,680
inițializarea variabilelor noastre. Și din nou,

30332
23:13:28,232 --> 23:13:31,600
acestea sunt doar substituenți aici sus

30333
23:13:29,680 --> 23:13:33,760
până le inițializam. Și aș face-o

30334
23:13:31,600 --> 23:13:35,832
vă sugerez să puneți o notă acolo jos sau

30335
23:13:33,760 --> 23:13:38,080
sau accesați simplylearn.com și lăsați

30336
23:13:35,832 --> 23:13:39,832
ei știu și cereți-i să vă e-mail o copie

30337
23:13:38,080 --> 23:13:41,832
a codului. Deci, chiar poți să te joci

30338
23:13:39,832 --> 23:13:43,512
cu acest cod chiar aici pentru că asta

30339
23:13:41,832 --> 23:13:46,080
este corpul a ceea ce se întâmplă înăuntru

30340
23:13:43,512 --> 23:13:48,160
TensorFlow. Aceasta este construirea în neural

30341
23:13:46,080 --> 23:13:50,160
retelelor. Și apoi, odată ce am făcut asta,

30342
23:13:48,160 --> 23:13:52,080
acum vine partea distractivă în care suntem noi

30343
23:13:50,160 --> 23:13:53,832
trebuie să mergi înainte și să-l antrenezi. Da

30344
23:13:52,080 --> 23:13:56,232
am creat TensorFlow-ul nostru, am creat

30345
23:13:53,832 --> 23:13:57,920
ne-am creat rețeaua și acum avem nevoie

30346
23:13:56,232 --> 23:13:59,760
să merg înainte și să-l antrenezi. Uh, haideți

30347
23:13:57,920 --> 23:14:03,680
pune cap la cap acel cod de antrenament și

30348
23:13:59,760 --> 23:14:05,600
hai să facem uh pentru I în intervalul u 0 până la

30349
23:14:03,680 --> 23:14:07,680
1.000. Deci ne vom uita doar la uh

30350
23:14:05,600 --> 23:14:10,232
primii 10.000 din pregătirea noastră. Şi

30351
23:14:07,680 --> 23:14:13,360
felul în care extragem acele date din monetăria noastră

30352
23:14:10,232 --> 23:14:14,872
Antrenează următorul lot de 100. Așa că te uiți

30353
23:14:13,360 --> 23:14:16,720
la asta. Vom face grupuri

30354
23:14:14,872 --> 23:14:18,960
de 100 și apoi va merge

30355
23:14:16,720 --> 23:14:21,280
printr-o mie dintre ele. Acest lucru este foarte

30356
23:14:18,960 --> 23:14:23,192
important ca TensorFlow să construiască acest lucru

30357
23:14:21,280 --> 23:14:25,192
in. Acesta este unul dintre dezavantajele

30358
23:14:23,192 --> 23:14:27,680
făcând sklearn sau unul dintre cei mai vechi

30359
23:14:25,192 --> 23:14:29,440
pachetele este că nu vă lasă să faceți loturi

30360
23:14:27,680 --> 23:14:31,040
au vrut să aibă totul

30361
23:14:29,440 --> 23:14:33,040
în față și apoi trebuie să-ți construiești

30362
23:14:31,040 --> 23:14:34,480
propriile programe batch chiar acum. Uh asta

30363
23:14:33,040 --> 23:14:36,800
lasă-ne să mergem înainte și să facem asta. Și tu

30364
23:14:34,480 --> 23:14:39,680
se poate vedea aici avem lot x de s, lot

30365
23:14:36,800 --> 23:14:41,832
y din s. Deci există x-ul nostru și y-ul nostru. tu

30366
23:14:39,680 --> 23:14:45,360
am putea privi asta ca antrenamentul nostru pentru X

30367
23:14:41,832 --> 23:14:47,680
și trenul nostru de Y sau datele N și

30368
23:14:45,360 --> 23:14:49,600
Răspundeți. Uh și apoi facem pur și simplu

30369
23:14:47,680 --> 23:14:50,872
rularea sesiunii. Uh, iată sesiunea noastră

30370
23:14:49,600 --> 23:14:53,920
pe care le-am creat. O să alergăm

30371
23:14:50,872 --> 23:14:55,832
și vrem să facem pasul de tren. Noi

30372
23:14:53,920 --> 23:14:58,080
a inițializat pasul nostru de tren sus aici și

30373
23:14:55,832 --> 23:15:00,480
TF-ul nostru. Și așa este pasul nostru de tren

30374
23:14:58,080 --> 23:15:01,920
hrana. Este un dicționar. Dicţionar

30375
23:15:00,480 --> 23:15:06,160
venirea în care vom crea

30376
23:15:01,920 --> 23:15:09,192
chiar aici. uh este x este lotul nostru x de

30377
23:15:06,160 --> 23:15:12,720
eșantionul nostru de virgulă și liniuța noastră y este

30378
23:15:09,192 --> 23:15:14,320
va fi lotul nostru de eșantion y.

30379
23:15:12,720 --> 23:15:16,800
Uh și așa se întâmplă și noi

30380
23:15:14,320 --> 23:15:19,040
acum apăsați butonul de alergare și ne-am antrenat

30381
23:15:16,800 --> 23:15:21,040
sesiunea noastră. Am antrenat această configurație

30382
23:15:19,040 --> 23:15:22,400
aici. Și odată ce l-am antrenat, atunci noi

30383
23:15:21,040 --> 23:15:24,400
trebuie să mergi înainte și să afli cât de bine

30384
23:15:22,400 --> 23:15:25,760
acuratețea noastră a fost și de fapt începe

30385
23:15:24,400 --> 23:15:27,512
rulând niște predicții prin acolo.

30386
23:15:25,760 --> 23:15:29,120
Deci vom merge mai departe și vom crea un a

30387
23:15:27,512 --> 23:15:31,680
predicție corectă. Și aici este locul

30388
23:15:29,120 --> 23:15:34,080
nostru tf.egal egal. Vom folosi argmaxul nostru

30389
23:15:31,680 --> 23:15:35,920
y de unu și tf argmax de y of

30390
23:15:34,080 --> 23:15:37,440
sublinierea unuia pentru a ne ajuta să obținem

30391
23:15:35,920 --> 23:15:39,680
predicții corecte acolo. Și apoi

30392
23:15:37,440 --> 23:15:42,080
vrem să folosim asta pentru a alimenta o

30393
23:15:39,680 --> 23:15:45,360
precizie. Și astfel precizia noastră merge

30394
23:15:42,080 --> 23:15:48,000
a fi tf reduce uh înseamnă și vom lua

30395
23:15:45,360 --> 23:15:49,832
asta și vom face o distribuție și asta este

30396
23:15:48,000 --> 23:15:52,720
predicția corectă că suntem

30397
23:15:49,832 --> 23:15:54,640
trimit acolo. Și este un plutitor

30398
23:15:52,720 --> 23:15:56,160
valoare. Păstrați-o simplu. Și să mergem

30399
23:15:54,640 --> 23:15:57,680
înainte și imprimați asta ca să putem vedea

30400
23:15:56,160 --> 23:15:59,360
la ce ne uităm. Uh, ce suntem

30401
23:15:57,680 --> 23:16:01,280
imprimarea? Trebuie să facem o sesiune

30402
23:15:59,360 --> 23:16:03,280
alerga. Această sesiune va avea loc

30403
23:16:01,280 --> 23:16:05,920
acuratețea. Unde vine acuratețea

30404
23:16:03,280 --> 23:16:07,832
de la? Acesta este TF-ul nostru

30405
23:16:05,920 --> 23:16:10,552
acolo cu previziunile corecte

30406
23:16:07,832 --> 23:16:12,160
că. Așa că iată feed-ul nostru de precizie. Deci

30407
23:16:10,552 --> 23:16:13,512
are nevoie de un dicționar pentru date

30408
23:16:12,160 --> 23:16:16,960
intră. Vom crea

30409
23:16:13,512 --> 23:16:21,040
dicționar și x va fi cuibul nostru

30410
23:16:16,960 --> 23:16:23,440
imagini de testare și y va fi

30411
23:16:21,040 --> 23:16:25,192
cuibul nostru.est

30412
23:16:23,440 --> 23:16:26,552
etichete. Lasă-mă să verific din nou și

30413
23:16:25,192 --> 23:16:28,080
asigurați-vă că am asta scris acolo

30414
23:16:26,552 --> 23:16:29,440
corect. Iată-ne. Oh, și hai să mergem

30415
23:16:28,080 --> 23:16:33,512
înainte și rulează asta și vezi ce vine

30416
23:16:29,440 --> 23:16:36,160
sus. Și ajungem cu un N165

30417
23:16:33,512 --> 23:16:38,640
pentru acuratețea noastră, ceea ce înseamnă a noastră

30418
23:16:36,160 --> 23:16:40,552
rețeaua neuronală antrenată face un lucru frumos

30419
23:16:38,640 --> 23:16:42,400
bună treabă să ne anunțați ce acestea

30420
23:16:40,552 --> 23:16:44,640
diferite simboluri sunt în ghicirea că a

30421
23:16:42,400 --> 23:16:46,552
șapte și trei și patru, uh,

30422
23:16:44,640 --> 23:16:48,552
ceva pe care noi, ca oameni, îl luăm

30423
23:16:46,552 --> 23:16:49,920
de la sine înțeles. Chiar am probleme cu cititul

30424
23:16:48,552 --> 23:16:51,440
aceasta. Deci, nu știu dacă aș fi

30425
23:16:49,920 --> 23:16:52,960
capabil ca primul, as sta

30426
23:16:51,440 --> 23:16:54,960
acolo de multă vreme dând seama

30427
23:16:52,960 --> 23:16:56,720
este un șapte versus un doi. Asta ar putea

30428
23:16:54,960 --> 23:16:58,480
au fost cu ușurință doi pentru mine. Canta pare

30429
23:16:56,720 --> 23:17:00,000
pentru a face o treabă destul de bună analizând asta

30430
23:16:58,480 --> 23:17:01,832
date. Și aceasta este folosită pentru a analiza

30431
23:17:00,000 --> 23:17:04,232
ceva foarte complicat la acestea

30432
23:17:01,832 --> 23:17:07,360
imagini, foarte diferite decât a

30433
23:17:04,232 --> 23:17:09,360
valoarea directă a uh costul vânzărilor și

30434
23:17:07,360 --> 23:17:10,960
iată revenirea noastră și marketingul nostru. Uh

30435
23:17:09,360 --> 23:17:12,640
acum putem crea acest neural frumos

30436
23:17:10,960 --> 23:17:14,320
rețea care face tot felul de mișto

30437
23:17:12,640 --> 23:17:16,400
lucruri. Știți prietenii asta

30438
23:17:14,320 --> 23:17:18,640
conform statisticilor de creditare

30439
23:17:16,400 --> 23:17:22,480
cererea de specialist AI și ML este

30440
23:17:18,640 --> 23:17:24,552
se estimează că va crește cu 40% între 2023

30441
23:17:22,480 --> 23:17:27,120
până în 2027.

30442
23:17:24,552 --> 23:17:31,512
Și, în medie, un inginer ML este

30443
23:17:27,120 --> 23:17:34,080
se așteaptă să câștige în jur de 133 și 336 USD per

30444
23:17:31,512 --> 23:17:36,080
an. Deci, dacă ești un aspirant ML

30445
23:17:34,080 --> 23:17:38,000
inginer și gândindu-mă la ce

30446
23:17:36,080 --> 23:17:41,280
proiecte inovatoare pe care le puteți afișa în dvs

30447
23:17:38,000 --> 23:17:43,280
portofoliu, atunci așteptarea ta s-a încheiat pentru că intră

30448
23:17:41,280 --> 23:17:45,280
acest videoclip voi acoperi opt

30449
23:17:43,280 --> 23:17:48,000
proiecte ML uimitoare pe care le puteți

30450
23:17:45,280 --> 23:17:49,832
prezentați în CV-ul dvs. Deci băieți, haideți

30451
23:17:48,000 --> 23:17:51,680
începe mai întâi cu un nivel de începător

30452
23:17:49,832 --> 23:17:53,440
proiect și primul proiect pe care noi

30453
23:17:51,680 --> 23:17:56,000
vor întâlni că este acasă

30454
23:17:53,440 --> 23:17:58,000
predicția valorii. Deci băieți, acest proiect

30455
23:17:56,000 --> 23:17:59,760
își propune să dezvolte un model predictiv pentru

30456
23:17:58,000 --> 23:18:02,080
estimați valoarea locuințelor

30457
23:17:59,760 --> 23:18:04,080
proprietăți. Modelul va analiza

30458
23:18:02,080 --> 23:18:06,960
diverse caracteristici, cum ar fi locația,

30459
23:18:04,080 --> 23:18:09,512
pătrat, suprafață, număr de dormitoare și

30460
23:18:06,960 --> 23:18:11,680
bai, vechimea proprietatii si altele

30461
23:18:09,512 --> 23:18:14,000
factori relevanți. Prin pârghie

30462
23:18:11,680 --> 23:18:15,832
date istorice de proprietate, modelul va

30463
23:18:14,000 --> 23:18:18,160
să poată oferi valoarea exactă a locuinței

30464
23:18:15,832 --> 23:18:21,440
predicții care pot fi utile în realitate

30465
23:18:18,160 --> 23:18:23,440
agenți imobiliari, cumpărători și vânzători. Deci

30466
23:18:21,440 --> 23:18:25,360
baieti, limbajul de programare pe care noi

30467
23:18:23,440 --> 23:18:27,600
vor folosi peste tot aici vor fi

30468
23:18:25,360 --> 23:18:28,960
Python și biblioteci de învățare automată

30469
23:18:27,600 --> 23:18:31,920
pe care o vom folosi va fi

30470
23:18:28,960 --> 23:18:34,080
scikitlearn, tensorflow, kas și for

30471
23:18:31,920 --> 23:18:37,280
biblioteci de tratare a datelor avem panda,

30472
23:18:34,080 --> 23:18:39,920
numpy și pentru vizualizare trebuie să

30473
23:18:37,280 --> 23:18:42,232
utilizați mattplot și seabon. Acum ce va fi

30474
23:18:39,920 --> 23:18:44,320
fii abordarea pentru asta băieți? Deci

30475
23:18:42,232 --> 23:18:46,552
băieți primul care avem date

30476
23:18:44,320 --> 23:18:48,232
colectare. Deci iată ce se întâmplă

30477
23:18:46,552 --> 23:18:49,920
se intampla baieti? Deci mai întâi trebuie

30478
23:18:48,232 --> 23:18:52,000
colectează datele istorice despre proprietate

30479
23:18:49,920 --> 23:18:54,552
din surse precum Zillow

30480
23:18:52,000 --> 23:18:56,480
retailer.com. De asemenea, puteți obține o bază de date

30481
23:18:54,552 --> 23:18:58,400
din bazele de date publice imobiliare

30482
23:18:56,480 --> 23:19:00,720
cum ar fi seturile de date Kaggle unde aveți

30483
23:18:58,400 --> 23:19:02,480
Predicția valorii casei Zillow. Asigurați-vă

30484
23:19:00,720 --> 23:19:04,000
că setul de date include caracteristici precum

30485
23:19:02,480 --> 23:19:06,400
locație unde aveți latitudine,

30486
23:19:04,000 --> 23:19:08,960
longitudine, metru pătrat, număr de

30487
23:19:06,400 --> 23:19:11,360
camere, an construit, tip de proprietate si

30488
23:19:08,960 --> 23:19:13,680
vânzări anterioare. Următorul pas care vine

30489
23:19:11,360 --> 23:19:15,600
este curățarea datelor. Trebuie să te descurci cu

30490
23:19:13,680 --> 23:19:17,360
valori lipsă prin folosirea imputării

30491
23:19:15,600 --> 23:19:20,160
tehnici sau eliminarea incompletă

30492
23:19:17,360 --> 23:19:22,400
înregistrări. Eliminarea valorilor aberante care pot deforma

30493
23:19:20,160 --> 23:19:24,000
predicția modelului, normalizarea sau

30494
23:19:22,400 --> 23:19:26,232
standardiza datele pentru a asigura

30495
23:19:24,000 --> 23:19:28,320
consistenta. Al treilea pe care îl avem

30496
23:19:26,232 --> 23:19:30,320
este ingineria caracteristicilor. Trebuie

30497
23:19:28,320 --> 23:19:32,720
creați noi caracteristici, cum ar fi apropierea de

30498
23:19:30,320 --> 23:19:35,280
școli, ratele criminalității și accesul la

30499
23:19:32,720 --> 23:19:37,040
transport public. Codificare categorială

30500
23:19:35,280 --> 23:19:38,960
variabile, exemplu tip de proprietate,

30501
23:19:37,040 --> 23:19:41,192
locație folosind tehnici precum unul fierbinte

30502
23:19:38,960 --> 23:19:42,720
codificare. Generați caracteristici de interacțiune

30503
23:19:41,192 --> 23:19:44,800
care captează relația dintre

30504
23:19:42,720 --> 23:19:46,872
caracteristici existente. Al patrulea care

30505
23:19:44,800 --> 23:19:48,232
avem este selecția modelului. Utilizare

30506
23:19:46,872 --> 23:19:49,920
modele de regresie ca liniare

30507
23:19:48,232 --> 23:19:52,080
regresie, pădure aleatoare, gradient

30508
23:19:49,920 --> 23:19:53,832
stimularea rețelelor neuronale. Experimentează

30509
23:19:52,080 --> 23:19:56,160
cu diferite modele pentru a identifica

30510
23:19:53,832 --> 23:19:58,160
cel mai performant. Acum în următorul

30511
23:19:56,160 --> 23:20:00,800
faza tot ce trebuie sa faci baieti este modelul

30512
23:19:58,160 --> 23:20:03,280
instruire si evaluare. Împărțiți datele

30513
23:20:00,800 --> 23:20:05,600
setați în seturi de antrenament și de testare. tren

30514
23:20:03,280 --> 23:20:07,440
modelul pe un set de antrenament și evaluați

30515
23:20:05,600 --> 23:20:10,400
performanța lor pe setul de testare

30516
23:20:07,440 --> 23:20:12,960
folosind valori precum RSM care înseamnă rădăcină

30517
23:20:10,400 --> 23:20:14,720
eroare pătrată medie. Puteți folosi cruce

30518
23:20:12,960 --> 23:20:17,440
validare pentru a asigura modelul

30519
23:20:14,720 --> 23:20:19,360
robustețe și evitați supraadaptarea. The

30520
23:20:17,440 --> 23:20:21,600
al șaselea pe care îl avem peste tot aici este

30521
23:20:19,360 --> 23:20:23,280
reglare hiperparametrică. Puteți optimiza

30522
23:20:21,600 --> 23:20:25,280
hiperparametrul modelului folosind

30523
23:20:23,280 --> 23:20:27,920
tehnici precum căutarea în grilă sau aleatoriu

30524
23:20:25,280 --> 23:20:29,360
căutare pentru a îmbunătăți acuratețea. Și dacă

30525
23:20:27,920 --> 23:20:31,280
aștepți cu nerăbdare să-ți implementezi

30526
23:20:29,360 --> 23:20:33,600
model, atunci puteți dezvolta un web

30527
23:20:31,280 --> 23:20:35,832
interfață folosind flask sau Django pentru a permite

30528
23:20:33,600 --> 23:20:38,080
utilizatorii să introducă caracteristicile proprietății și să obțină

30529
23:20:35,832 --> 23:20:40,000
previziuni. Puteți implementa modelul pe

30530
23:20:38,080 --> 23:20:41,600
platforma cloud ca AWS pentru

30531
23:20:40,000 --> 23:20:43,600
scalabilitate.

30532
23:20:41,600 --> 23:20:45,600
Acum, dacă vorbim despre complexitate

30533
23:20:43,600 --> 23:20:48,080
la acest nivel, știm cu toții că este un

30534
23:20:45,600 --> 23:20:50,640
proiect de nivel incepator. Acum hai să ne mișcăm

30535
23:20:48,080 --> 23:20:53,600
la un alt set care este muzica

30536
23:20:50,640 --> 23:20:55,120
clasificarea și generarea genurilor. Deci

30537
23:20:53,600 --> 23:20:57,120
băieți, acesta este și unul dintre cele mai multe

30538
23:20:55,120 --> 23:20:58,872
proiect de nivel incepator. Acest proiect

30539
23:20:57,120 --> 23:21:00,640
are ca scop dezvoltarea unui sistem care poate

30540
23:20:58,872 --> 23:21:02,232
clasifică melodiile muzicale în diferite

30541
23:21:00,640 --> 23:21:04,872
genuri și generează muzică nouă

30542
23:21:02,232 --> 23:21:06,720
compoziție în cadrul genului specificat. The

30543
23:21:04,872 --> 23:21:08,800
scopul este de a construi un model care analizează

30544
23:21:06,720 --> 23:21:10,872
caracteristici audio pentru a clasifica muzica și

30545
23:21:08,800 --> 23:21:13,440
folosește tehnici de deep learning pentru a crea

30546
23:21:10,872 --> 23:21:15,280
muzica noua. Acest proiect prezintă

30547
23:21:13,440 --> 23:21:17,760
concept avansat de procesare audio,

30548
23:21:15,280 --> 23:21:19,760
învățare profundă și modele generative. Deci

30549
23:21:17,760 --> 23:21:21,280
baieti, ce se va folosi in asta? Deci

30550
23:21:19,760 --> 23:21:23,280
vom avea un limbaj de programare care

30551
23:21:21,280 --> 23:21:25,360
va fi Python. Pentru procesarea audio,

30552
23:21:23,280 --> 23:21:26,640
vom folosi librosa. Pentru mașină

30553
23:21:25,360 --> 23:21:29,040
biblioteci de învățare, vom folosi

30554
23:21:26,640 --> 23:21:30,320
tensorflow, kas, pytorch. Pentru date

30555
23:21:29,040 --> 23:21:32,872
gestionând biblioteci, vom folosi

30556
23:21:30,320 --> 23:21:35,440
panda, numpy. Pentru vizualizare, vom face

30557
23:21:32,872 --> 23:21:38,160
folosiți mattplot, seabon. Pentru date

30558
23:21:35,440 --> 23:21:40,320
setați băieți, puteți folosi genul muzical gtzan

30559
23:21:38,160 --> 23:21:42,232
set de date sau îl puteți obține gratuit

30560
23:21:40,320 --> 23:21:43,600
arhiva muzicala. Deci băieți în primul

30561
23:21:42,232 --> 23:21:45,600
faza vom avea date

30562
23:21:43,600 --> 23:21:47,040
colectare. Puteți obține seturi de date

30563
23:21:45,600 --> 23:21:49,192
care conțin piese muzicale și acestea

30564
23:21:47,040 --> 23:21:51,760
genul corespunzător din surse

30565
23:21:49,192 --> 23:21:54,160
din setul de date despre genul muzical GTN și

30566
23:21:51,760 --> 23:21:55,832
arhivă muzicală gratuită. Asigurați-vă că o dată

30567
23:21:54,160 --> 23:21:58,160
setul include genuri diverse și

30568
23:21:55,832 --> 23:22:00,320
număr substanțial de piese pe gen.

30569
23:21:58,160 --> 23:22:02,400
În continuare, vom merge la pregătirea datelor.

30570
23:22:00,320 --> 23:22:04,320
Folosiți biblioteca librosa pentru a încărca și

30571
23:22:02,400 --> 23:22:06,080
preprocesează fișierele audio inclusiv

30572
23:22:04,320 --> 23:22:08,872
extracție caracteristică cum ar fi mil

30573
23:22:06,080 --> 23:22:11,360
frecvență, coeficienți septali, croma

30574
23:22:08,872 --> 23:22:13,360
caracteristici și contrast spectral. Poți

30575
23:22:11,360 --> 23:22:15,192
normalizați caracteristicile extrase la

30576
23:22:13,360 --> 23:22:17,920
asigura o intrare consistentă pentru ceea ce este dat

30577
23:22:15,192 --> 23:22:19,280
modele. Acum, dacă vorbiți despre caracteristică

30578
23:22:17,920 --> 23:22:20,960
ingineri, puteți extrage

30579
23:22:19,280 --> 23:22:23,512
caracteristici suplimentare din fișierele audio

30580
23:22:20,960 --> 23:22:25,680
cum ar fi tempo, ritm, rata de trecere zero

30581
23:22:23,512 --> 23:22:27,832
etc. Creați o matrice de caracteristici care

30582
23:22:25,680 --> 23:22:30,320
reprezintă caracteristicile audio extrase.

30583
23:22:27,832 --> 23:22:32,080
Apoi alegeți modelul. Utilizare

30584
23:22:30,320 --> 23:22:33,680
rețea neuronală convențională sau recurentă

30585
23:22:32,080 --> 23:22:36,000
rețele neuronale pentru genul muzical

30586
23:22:33,680 --> 23:22:38,232
clasificare. Împărțiți setul de date în

30587
23:22:36,000 --> 23:22:40,000
set de date de instruire și testare. Acum dacă noi

30588
23:22:38,232 --> 23:22:42,080
vorbim despre formarea și evaluarea modelelor

30589
23:22:40,000 --> 23:22:43,680
băieți, atunci îi puteți antrena pe selectați

30590
23:22:42,080 --> 23:22:46,080
model de clasificare a instruirii

30591
23:22:43,680 --> 23:22:47,680
set. Evaluați performanța modelului pe

30592
23:22:46,080 --> 23:22:50,000
setul de testare folosind valori precum

30593
23:22:47,680 --> 23:22:52,232
acuratețe, precizie, rechemare și F1

30594
23:22:50,000 --> 23:22:53,440
scor. Utilizați matrici de confuzie pentru a

30595
23:22:52,232 --> 23:22:55,832
intelege clasificarea

30596
23:22:53,440 --> 23:22:57,760
performanță în diferite genuri. Acum

30597
23:22:55,832 --> 23:22:59,832
dacă vorbim de selecţia modelului şi

30598
23:22:57,760 --> 23:23:01,280
antrenament pentru generația muzicală, ce

30599
23:22:59,832 --> 23:23:03,360
veti face baieti? Puteți folosi

30600
23:23:01,280 --> 23:23:05,680
reţele adverse generative sau

30601
23:23:03,360 --> 23:23:07,360
rețele neuronale recurente, cum ar fi LSTM,

30602
23:23:05,680 --> 23:23:09,280
memorie lungă pe termen scurt pentru muzică

30603
23:23:07,360 --> 23:23:11,040
generație. Antrenează modelul generativ

30604
23:23:09,280 --> 23:23:13,760
pe setul de date pentru a crea muzică nouă

30605
23:23:11,040 --> 23:23:15,512
secvente. În continuare, avem antrenament pentru modele

30606
23:23:13,760 --> 23:23:17,440
și evaluare. Puteți antrena

30607
23:23:15,512 --> 23:23:19,360
model generativ pe secvențe de audio

30608
23:23:17,440 --> 23:23:21,040
caracteristici. Puteți evalua cele generate

30609
23:23:19,360 --> 23:23:23,192
muzica prin teste de ascultare si prin

30610
23:23:21,040 --> 23:23:26,160
metrici obiective, cum ar fi scorul inițial

30611
23:23:23,192 --> 23:23:27,832
sau fche distanta audio. Dacă vorbesc despre

30612
23:23:26,160 --> 23:23:29,600
ghiduri de reglare hiperparametrică, putem

30613
23:23:27,832 --> 23:23:31,280
optimiza modelul. Puteți folosi

30614
23:23:29,600 --> 23:23:33,120
hiperparametri folosind tehnici precum

30615
23:23:31,280 --> 23:23:35,600
căutare în grilă sau căutare aleatorie pentru a îmbunătăți

30616
23:23:33,120 --> 23:23:37,440
performanta. Dacă vorbesc despre desfășurare

30617
23:23:35,600 --> 23:23:40,320
Băieți, puteți implementa aceste modele

30618
23:23:37,440 --> 23:23:43,040
platforme cloud precum AWS. Acum haideți

30619
23:23:40,320 --> 23:23:44,960
trece la următorul nostru proiect. Deci băieți,

30620
23:23:43,040 --> 23:23:47,192
complexitatea acestui proiect este la

30621
23:23:44,960 --> 23:23:49,360
nivel incepator. Acum să trecem la

30622
23:23:47,192 --> 23:23:50,960
proiecte de nivel mediu. Următorul

30623
23:23:49,360 --> 23:23:53,680
proiectul pe care îl avem peste tot aici este

30624
23:23:50,960 --> 23:23:55,280
analiza sentimentului datelor Twitter. Aceasta

30625
23:23:53,680 --> 23:23:57,760
proiectul urmărește să dezvolte un sentiment

30626
23:23:55,280 --> 23:24:00,400
model de analiză care poate clasifica la sa

30627
23:23:57,760 --> 23:24:02,400
partea pozitivă, negativă sau neutră. The

30628
23:24:00,400 --> 23:24:04,480
scopul este de a analiza sentimentul public asupra

30629
23:24:02,400 --> 23:24:06,960
diverse subiecte sau evenimente folosind naturale

30630
23:24:04,480 --> 23:24:09,120
tehnici de limbaj. Deci băieți, ce va fi

30631
23:24:06,960 --> 23:24:11,280
să fie folosit peste tot aici? Deci în asta noi

30632
23:24:09,120 --> 23:24:15,360
va avea limbaj de programare ca

30633
23:24:11,280 --> 23:24:16,960
Python. Bine. Biblioteci NLP, NLTK spacy.

30634
23:24:15,360 --> 23:24:19,120
Pentru bibliotecile de învățare automată puteți

30635
23:24:16,960 --> 23:24:21,040
utilizați scikitlearn, tensorflow, kas. Pentru

30636
23:24:19,120 --> 23:24:23,120
biblioteci de tratare a datelor avem panda,

30637
23:24:21,040 --> 23:24:25,832
numpy. Pentru vizualizare avem

30638
23:24:23,120 --> 23:24:28,872
mattplot lilip seon și putem folosi

30639
23:24:25,832 --> 23:24:31,360
API Twitter pentru colectarea datelor. Acum cum

30640
23:24:28,872 --> 23:24:33,280
veți lucra la asta băieți? Deci băieți dacă

30641
23:24:31,360 --> 23:24:35,360
Vorbesc despre utilizarea colectării datelor a

30642
23:24:33,280 --> 23:24:37,360
Twitter API pentru a colecta tweet-uri pe baza

30643
23:24:35,360 --> 23:24:39,760
hashtag-uri specifice, cum ar fi cuvinte cheie sau

30644
23:24:37,360 --> 23:24:42,080
subiecte. Extrageți câmpuri relevante, cum ar fi

30645
23:24:39,760 --> 23:24:43,920
text tweet, informații despre utilizator, marca temporală

30646
23:24:42,080 --> 23:24:46,080
etc. Atunci dacă vorbesc despre date

30647
23:24:43,920 --> 23:24:48,320
băieți cu procesare pregătitoare, curățați tweetul

30648
23:24:46,080 --> 23:24:50,640
text prin eliminarea caracterelor speciale,

30649
23:24:48,320 --> 23:24:53,120
linkuri, mențiuni, hashtag-uri și stop

30650
23:24:50,640 --> 23:24:55,360
cuvinte. Tokenizați textul și executați

30651
23:24:53,120 --> 23:24:57,440
limizarea sau steming pentru a reduce

30652
23:24:55,360 --> 23:24:59,360
cuvintele la forma lor de bază. În continuare, dacă tu

30653
23:24:57,440 --> 23:25:00,960
vorbiți despre inginerie caracteristică, băieți

30654
23:24:59,360 --> 23:25:03,760
convertiți datele text curate în

30655
23:25:00,960 --> 23:25:06,160
reprezentare numerică folosind TF, înapoi

30656
23:25:03,760 --> 23:25:07,832
de cuvinte sau de încorporare a cuvintelor. Acum dacă eu

30657
23:25:06,160 --> 23:25:09,512
vorbiți despre selecția de modele băieți, puteți

30658
23:25:07,832 --> 23:25:13,040
alege un algoritm de clasificare astfel

30659
23:25:09,512 --> 23:25:14,872
ca regresie logistică, n bias sau LSDM.

30660
23:25:13,040 --> 23:25:17,440
Împărțiți setul de date în formare și

30661
23:25:14,872 --> 23:25:19,512
set de date de testare. Acum dacă vorbesc despre

30662
23:25:17,440 --> 23:25:21,120
model de instruire și evaluare, apoi tu

30663
23:25:19,512 --> 23:25:23,192
poate antrena modelul selectat pe

30664
23:25:21,120 --> 23:25:24,872
set de antrenament. Evaluați modelul

30665
23:25:23,192 --> 23:25:26,872
performanța pe setul de testare folosind

30666
23:25:24,872 --> 23:25:29,360
parametri precum acuratețea, precizia,

30667
23:25:26,872 --> 23:25:31,120
recall și scorul fn. Folosește cruce

30668
23:25:29,360 --> 23:25:32,872
validare pentru a asigura modelul

30669
23:25:31,120 --> 23:25:34,552
robustețe. Dacă vorbesc despre

30670
23:25:32,872 --> 23:25:36,552
Oameni de reglare hiperparametrică, puteți

30671
23:25:34,552 --> 23:25:38,400
optimizarea hiperparametrilor modelului

30672
23:25:36,552 --> 23:25:40,720
folosind căutarea în grilă sau căutarea aleatorie pentru

30673
23:25:38,400 --> 23:25:42,640
îmbunătăți performanța pentru implementare

30674
23:25:40,720 --> 23:25:44,720
care poate fi optional. Puteți implementa

30675
23:25:42,640 --> 23:25:46,960
modelul dvs. pe AWS în timp real

30676
23:25:44,720 --> 23:25:48,720
analiza sentimentelor. Deci dacă vorbesc despre

30677
23:25:46,960 --> 23:25:51,600
nivelul de complexitate baieti, e

30678
23:25:48,720 --> 23:25:53,600
complexitatea este intermediară. Deci băieți, noștri

30679
23:25:51,600 --> 23:25:56,160
următorul proiect este segmentarea clienților

30680
23:25:53,600 --> 23:25:58,232
folosirea K înseamnă grupare. Acest proiect

30681
23:25:56,160 --> 23:25:59,680
își propune să segmenteze clienții în distincti

30682
23:25:58,232 --> 23:26:01,920
grupuri în funcție de achiziția lor

30683
23:25:59,680 --> 23:26:03,832
comportament și informații demografice.

30684
23:26:01,920 --> 23:26:05,832
Obiectivul este de a înțelege clientul

30685
23:26:03,832 --> 23:26:08,552
segmente și să adapteze strategiile de marketing

30686
23:26:05,832 --> 23:26:10,400
în consecință. Deci băieți, ce programare

30687
23:26:08,552 --> 23:26:12,320
limbi pe care le vom folosi? Deci practic

30688
23:26:10,400 --> 23:26:13,440
vom folosi Python. Pentru mașină

30689
23:26:12,320 --> 23:26:15,120
biblioteci de învăţare, vom avea

30690
23:26:13,440 --> 23:26:17,360
scikitlearn. Pentru manipularea datelor

30691
23:26:15,120 --> 23:26:18,720
biblioteci, vom avea panda, numpy. Pentru

30692
23:26:17,360 --> 23:26:21,360
biblioteci de vizualizare, vom avea

30693
23:26:18,720 --> 23:26:23,040
mattplot lab, seabon. Și setul de date

30694
23:26:21,360 --> 23:26:25,360
sursa va fi tranzacția de comerț electronic

30695
23:26:23,040 --> 23:26:27,360
date. cum vom lucra la asta

30696
23:26:25,360 --> 23:26:29,040
unul. Pentru colectarea datelor, putem obține

30697
23:26:27,360 --> 23:26:30,640
un set de date privind tranzacțiile de comerț electronic

30698
23:26:29,040 --> 23:26:32,000
care includ datele demografice ale clienților,

30699
23:26:30,640 --> 23:26:33,920
istoricul achizițiilor și produsul

30700
23:26:32,000 --> 23:26:35,360
informaţii. În continuare, vom avea date

30701
23:26:33,920 --> 23:26:37,440
prelucrare. Pentru date

30702
23:26:35,360 --> 23:26:38,960
prep-processing, vom face

30703
23:26:37,440 --> 23:26:41,760
curățarea datelor prin manipularea

30704
23:26:38,960 --> 23:26:43,120
valori lipsă și valori aberante. Apoi, pentru

30705
23:26:41,760 --> 23:26:44,720
ingineria caracteristicilor, vom face

30706
23:26:43,120 --> 23:26:46,872
creați caracteristici precum achiziția totală

30707
23:26:44,720 --> 23:26:48,720
suma, frecvența de cumpărare și recentitatea

30708
23:26:46,872 --> 23:26:50,160
a cumpărăturilor.

30709
23:26:48,720 --> 23:26:52,320
Apoi, vom continua pentru

30710
23:26:50,160 --> 23:26:54,320
selectarea modelului. Puteți folosi K mijloace

30711
23:26:52,320 --> 23:26:56,232
gruparea pentru a segmenta clienții în

30712
23:26:54,320 --> 23:26:58,080
grupuri distincte. Puteți determina

30713
23:26:56,232 --> 23:27:01,040
numărul optim de clustere folosind metode

30714
23:26:58,080 --> 23:27:03,192
precum metodele albumului sau silhouul.

30715
23:27:01,040 --> 23:27:05,040
Acum dacă vorbesc despre antrenamentul modelului și

30716
23:27:03,192 --> 23:27:07,760
evaluare, puteți antrena mijloacele K

30717
23:27:05,040 --> 23:27:09,512
model pe setul de date de proces. Poți

30718
23:27:07,760 --> 23:27:11,760
evalua calitatea clusterelor prin

30719
23:27:09,512 --> 23:27:14,080
analizând intracluster și intercluster

30720
23:27:11,760 --> 23:27:15,600
distante. În continuare avem evaluarea.

30721
23:27:14,080 --> 23:27:17,920
Puteți vizualiza clusterele folosind

30722
23:27:15,600 --> 23:27:22,232
tehnici precum PCA, componentă principală

30723
23:27:17,920 --> 23:27:25,440
analiză, TSN etc. În continuare avem

30724
23:27:22,232 --> 23:27:27,120
reglare hiperparametrică. Acum poți

30725
23:27:25,440 --> 23:27:29,192
acordați acest model și interpretați

30726
23:27:27,120 --> 23:27:30,872
caracteristic fiecărui segment. Poți

30727
23:27:29,192 --> 23:27:32,640
dezvoltarea unei strategii de marketing țintă

30728
23:27:30,872 --> 23:27:35,512
pentru fiecare segment bazat pe unic

30729
23:27:32,640 --> 23:27:37,440
comportament și preferințe. Acum implementare

30730
23:27:35,512 --> 23:27:39,512
este opțională. Puteți dezvolta un tablou de bord

30731
23:27:37,440 --> 23:27:41,280
folosind flacon sau Django pentru a vizualiza

30732
23:27:39,512 --> 23:27:44,960
segmente de clienți și urmăriți marketingul

30733
23:27:41,280 --> 23:27:47,120
campanii. Deci băieți, dacă vorbesc despre

30734
23:27:44,960 --> 23:27:49,600
complexitatea acestui proiect. Deci asta este

30735
23:27:47,120 --> 23:27:51,680
un proiect de nivel mediu. Deci băieți

30736
23:27:49,600 --> 23:27:53,600
pentru setul de date puteți folosi Kaggle's

30737
23:27:51,680 --> 23:27:56,320
set de date de segmentare a clienților care este

30738
23:27:53,600 --> 23:27:58,080
disponibil pe platforma lui Kaggle. Acum

30739
23:27:56,320 --> 23:28:00,080
al treilea proiect de nivel mediu

30740
23:27:58,080 --> 23:28:02,872
pe care le avem peste tot aici este construirea a

30741
23:28:00,080 --> 23:28:05,040
chatbot cu Rasa. Acest proiect are ca scop

30742
23:28:02,872 --> 23:28:06,960
construiește un chatbot inteligent folosind Rasa

30743
23:28:05,040 --> 23:28:08,640
cadru. Chatbot-ul va fi capabil

30744
23:28:06,960 --> 23:28:10,552
de înțelegere a interogărilor utilizatorilor și

30745
23:28:08,640 --> 23:28:13,040
oferirea de răspunsuri adecvate

30746
23:28:10,552 --> 23:28:15,600
este util pentru suport pentru clienți, personal

30747
23:28:13,040 --> 23:28:17,192
asistență sau regăsire informații.

30748
23:28:15,600 --> 23:28:19,440
Ce limbi vom folosi? Deci

30749
23:28:17,192 --> 23:28:22,872
va fi bazat pe Python. Vom avea

30750
23:28:19,440 --> 23:28:24,480
Biblioteci NLP precum Rasa, NLTK, Spacey.

30751
23:28:22,872 --> 23:28:26,080
Pentru bibliotecile de învățare automată, suntem

30752
23:28:24,480 --> 23:28:28,872
va avea scikitlearn, tensorflow,

30753
23:28:26,080 --> 23:28:31,360
kas, etc. Pentru bibliotecile de tratare a datelor,

30754
23:28:28,872 --> 23:28:33,600
vom folosi panda, numpy. Deci

30755
23:28:31,360 --> 23:28:35,920
băieți, asta o să facem

30756
23:28:33,600 --> 23:28:37,512
și cum poți lucra la acesta prin

30757
23:28:35,920 --> 23:28:39,760
colectarea datelor, colectarea

30758
23:28:37,512 --> 23:28:41,920
date de conversație și întrebări frecvente de la

30759
23:28:39,760 --> 23:28:43,280
domeniul țintă, adnotă datele către

30760
23:28:41,920 --> 23:28:45,280
creați exemple de instruire pentru

30761
23:28:43,280 --> 23:28:47,440
chatbot. Urmează datele

30762
23:28:45,280 --> 23:28:48,872
prelucrare. Curățați datele text de

30763
23:28:47,440 --> 23:28:50,960
eliminarea caracterelor speciale și

30764
23:28:48,872 --> 23:28:53,512
normalizarea textului. Puteți tokeniza

30765
23:28:50,960 --> 23:28:55,192
și limitați textul pentru a se pregăti pentru a

30766
23:28:53,512 --> 23:28:57,280
antrenament. Al treilea îl avem

30767
23:28:55,192 --> 23:28:59,760
antrenamentul modelelor. Puteți folosi Rasa's

30768
23:28:57,280 --> 23:29:01,440
Componenta NLU pentru formarea unui model pentru

30769
23:28:59,760 --> 23:29:03,600
recunoașterea intenției și entitate

30770
23:29:01,440 --> 23:29:05,192
extractie. Puteți defini un dialog

30771
23:29:03,600 --> 23:29:07,600
politici de management pentru a gestiona diferite

30772
23:29:05,192 --> 23:29:09,192
conversația curge. Următorii băieți, puteți

30773
23:29:07,600 --> 23:29:11,760
efectuează ingineria caracteristicilor și

30774
23:29:09,192 --> 23:29:13,512
integrare. Puteți integra Ras

30775
23:29:11,760 --> 23:29:15,360
NLU și componente de bază de construit

30776
23:29:13,512 --> 23:29:17,040
chatbot complet. Puteți conecta

30777
23:29:15,360 --> 23:29:19,600
chatbot la platforma de mesagerie cum ar fi

30778
23:29:17,040 --> 23:29:21,440
Facebook Messenger etc. Pentru model

30779
23:29:19,600 --> 23:29:23,120
selectarea și testarea a ceea ce puteți face

30780
23:29:21,440 --> 23:29:25,280
băieți cu care puteți testa acest chatbot

30781
23:29:23,120 --> 23:29:28,080
diverse intrări pentru a se asigura că se ocupă

30782
23:29:25,280 --> 23:29:30,552
scenariile în mod corespunzător și poți

30783
23:29:28,080 --> 23:29:32,960
de asemenea, selectați modelul potrivit folosind aceasta.

30784
23:29:30,552 --> 23:29:34,640
Acum, dacă vorbesc despre antrenamentul de model, băieți

30785
23:29:32,960 --> 23:29:36,480
ce trebuie să faci trebuie să colectezi

30786
23:29:34,640 --> 23:29:38,320
feedback-ul utilizatorului și conversație

30787
23:29:36,480 --> 23:29:41,360
jurnalele pentru a lucra continuu la antrenament

30788
23:29:38,320 --> 23:29:43,832
modelul. În continuare, la fel trebuie

30789
23:29:41,360 --> 23:29:46,080
reantrenează periodic modelul cu

30790
23:29:43,832 --> 23:29:48,720
date noi pentru a vedea cum funcționează. Deci

30791
23:29:46,080 --> 23:29:50,720
asta va fi evaluarea ta. Acum pentru

30792
23:29:48,720 --> 23:29:52,720
reglajul hiperparametrului, ce ești

30793
23:29:50,720 --> 23:29:54,800
o sa faci baieti? Trebuie să te înregistrezi

30794
23:29:52,720 --> 23:29:56,720
acele scenarii în care se poate regla

30795
23:29:54,800 --> 23:29:59,192
cu acele scenarii în care se poate

30796
23:29:56,720 --> 23:30:01,440
gestionați intrarea în mod corespunzător. Și mai departe

30797
23:29:59,192 --> 23:30:04,320
este desfășurare. Deci băieți, pentru desfășurare

30798
23:30:01,440 --> 23:30:07,192
acesta, puteți utiliza AWS. Deci băieți, pentru date

30799
23:30:04,320 --> 23:30:09,280
set, puteți utiliza sursa deschisă Ras. Deci

30800
23:30:07,192 --> 23:30:11,192
acesta este un set de date foarte bun pentru tine

30801
23:30:09,280 --> 23:30:13,192
continua. Deci băieți, dacă vorbiți despre

30802
23:30:11,192 --> 23:30:15,280
dificultatea acestui proiect, acesta este o

30803
23:30:13,192 --> 23:30:17,760
proiect de nivel mediu. Acum haideți

30804
23:30:15,280 --> 23:30:19,600
trece la proiecte de nivel avansat.

30805
23:30:17,760 --> 23:30:21,440
Pentru proiecte de nivel avansat, primul

30806
23:30:19,600 --> 23:30:24,640
unul care îmi vine în minte este filmul

30807
23:30:21,440 --> 23:30:26,552
asemănarea din rezumatele complotului. Acum asta

30808
23:30:24,640 --> 23:30:28,800
proiectul urmăreşte dezvoltarea unui sistem care

30809
23:30:26,552 --> 23:30:31,192
pot afla filme similare recomandate

30810
23:30:28,800 --> 23:30:33,600
la un anumit film bazat pe intriga lor

30811
23:30:31,192 --> 23:30:35,680
rezumate. Prin analiza textuală

30812
23:30:33,600 --> 23:30:37,832
conținutul rezumatelor intrigii filmului,

30813
23:30:35,680 --> 23:30:39,680
modelul va identifica asemănările şi

30814
23:30:37,832 --> 23:30:42,080
sugerează filme cu teme similare,

30815
23:30:39,680 --> 23:30:44,160
povestiri sau genuri. Acest proiect

30816
23:30:42,080 --> 23:30:46,400
îi introduce pe începători în limbajul natural

30817
23:30:44,160 --> 23:30:48,480
procesarea textului în mod similar măsoară și

30818
23:30:46,400 --> 23:30:50,080
sisteme de recomandare. Ce limbi

30819
23:30:48,480 --> 23:30:53,920
vom folosi băieți? Vom folosi

30820
23:30:50,080 --> 23:30:55,120
Bibliotecile Python NLP precum NLTK spacy

30821
23:30:53,920 --> 23:30:57,440
biblioteci de învățare automată cum ar fi

30822
23:30:55,120 --> 23:31:00,000
biblioteci de tratare a datelor scikitlearn cum ar fi

30823
23:30:57,440 --> 23:31:02,800
vizualizarea panda numpy pe care o putem folosi

30824
23:31:00,000 --> 23:31:05,600
numpy și sursa setului de date va fi IMDb

30825
23:31:02,800 --> 23:31:07,920
sau Kegel, deci băieți, acest proces este și el

30826
23:31:05,600 --> 23:31:09,832
implicând colectarea datelor apoi tu

30827
23:31:07,920 --> 23:31:12,640
atunci trebuie să mergi la curățarea datelor

30828
23:31:09,832 --> 23:31:14,400
inginerie caracteristică următoarea selecție a modelului

30829
23:31:12,640 --> 23:31:16,480
proces așa cum am discutat

30830
23:31:14,400 --> 23:31:18,872
în alte proiecte așa că trebuie să mergi și tu

30831
23:31:16,480 --> 23:31:21,192
prin aceeași pe lângă ce aveți

30832
23:31:18,872 --> 23:31:23,192
a face dispozitivul. La fel, ceea ce ai

30833
23:31:21,192 --> 23:31:25,680
pentru a face, trebuie să antrenezi modelul, atunci

30834
23:31:23,192 --> 23:31:28,400
evaluează modelul, apoi hipertune-l

30835
23:31:25,680 --> 23:31:30,720
și în cele din urmă treceți la desfășurare.

30836
23:31:28,400 --> 23:31:33,600
Deci, acesta este procesul general al acestui lucru

30837
23:31:30,720 --> 23:31:36,160
proiect. Încercați să căutați pe site

30838
23:31:33,600 --> 23:31:38,960
la fel ca cum îl poți extrage. Deci,

30839
23:31:36,160 --> 23:31:40,552
băieți, puteți folosi kegel sau spre date

30840
23:31:38,960 --> 23:31:42,800
știință să cerceteze mai multe despre asta

30841
23:31:40,552 --> 23:31:44,640
proiect. Acum băieți, dacă vorbesc despre

30842
23:31:42,800 --> 23:31:47,760
dificultatea acestui proiect și aceasta este

30843
23:31:44,640 --> 23:31:50,000
un proiect de nivel avansat. Acum haideți

30844
23:31:47,760 --> 23:31:52,400
treceți la următorul pe care îl avem pe toți

30845
23:31:50,000 --> 23:31:55,040
aici este segmentarea imaginii

30846
23:31:52,400 --> 23:31:57,192
proiect pentru prognosticul tumorii cerebrale. Aceasta

30847
23:31:55,040 --> 23:31:58,720
este un proiect foarte, foarte uimitor și

30848
23:31:57,192 --> 23:32:00,960
cu siguranță poți să-ți suporti

30849
23:31:58,720 --> 23:32:02,640
portofoliu. Practic băieți acest proiect

30850
23:32:00,960 --> 23:32:05,120
are ca scop dezvoltarea unei segmentări a imaginii

30851
23:32:02,640 --> 23:32:07,680
model pentru identificarea și delinizarea creierului

30852
23:32:05,120 --> 23:32:09,440
tumori de la scanări RMN. Scopul este să

30853
23:32:07,680 --> 23:32:11,360
segmentează cu precizie regiunile tumorale

30854
23:32:09,440 --> 23:32:13,920
care poate ajuta la tratamentul prognostic

30855
23:32:11,360 --> 23:32:15,832
planificarea intervențiilor chirurgicale. Aceasta

30856
23:32:13,920 --> 23:32:17,360
proiectul introduce nivelul intermediar

30857
23:32:15,832 --> 23:32:19,920
concepte de viziune computerizată, profunde

30858
23:32:17,360 --> 23:32:21,832
învățarea și analiza imaginii medicale. Deci

30859
23:32:19,920 --> 23:32:23,440
băieți, ce vom folosi peste tot aici

30860
23:32:21,832 --> 23:32:25,280
pentru limbaje de programare pe care le putem folosi

30861
23:32:23,440 --> 23:32:27,680
python pentru biblioteci de învățare profundă noi

30862
23:32:25,280 --> 23:32:29,360
poate folosi tensorflow, kas, pytor. Pentru

30863
23:32:27,680 --> 23:32:31,680
biblioteci de procesare a imaginilor, putem folosi

30864
23:32:29,360 --> 23:32:34,872
opencv, imagine scikit. Pentru manipularea datelor

30865
23:32:31,680 --> 23:32:36,720
biblioteci, putem folosi panda, numpy. Pentru

30866
23:32:34,872 --> 23:32:39,832
vizualizare, putem folosi mattplot,

30867
23:32:36,720 --> 23:32:41,760
cbond. Acum, dacă vorbesc despre ce este

30868
23:32:39,832 --> 23:32:44,552
procesul de dezvoltare a acestui proiect

30869
23:32:41,760 --> 23:32:46,320
primul pas va fi aceeași colectare a datelor.

30870
23:32:44,552 --> 23:32:48,480
Deci, următorul pas trebuie să mergeți după date

30871
23:32:46,320 --> 23:32:50,480
prelucrare. Al treilea pas trebuie

30872
23:32:48,480 --> 23:32:53,192
faceți selecția modelului unde puteți utiliza

30873
23:32:50,480 --> 23:32:56,232
Modele CNN pentru sarcina de segmentare a imaginii.

30874
23:32:53,192 --> 23:32:58,080
Apoi te duci la alegerea modelului. În mișcare

30875
23:32:56,232 --> 23:32:59,920
înainte vei avea modelul

30876
23:32:58,080 --> 23:33:02,000
instruire si evaluare. Trebuie

30877
23:32:59,920 --> 23:33:05,040
împărțiți setul de date în formare și

30878
23:33:02,000 --> 23:33:07,600
seturi de date de validare și testare. În continuare

30879
23:33:05,040 --> 23:33:09,680
trecerea la faza de evaluare. bine,

30880
23:33:07,600 --> 23:33:11,600
evalua modelul cu anumite metrici.

30881
23:33:09,680 --> 23:33:13,192
Așa că aici vă pot da o anumită idee, cum ar fi

30882
23:33:11,600 --> 23:33:15,920
puteți folosi coeficientul de zaruri,

30883
23:33:13,192 --> 23:33:17,920
intersecție peste unire sau precizie.

30884
23:33:15,920 --> 23:33:19,280
Apoi mergeți pentru reglarea hiperparametrului unde

30885
23:33:17,920 --> 23:33:20,960
trebuie sa optimizati modelul

30886
23:33:19,280 --> 23:33:22,800
hiperparametrii.

30887
23:33:20,960 --> 23:33:24,720
Puteți utiliza căutarea în grilă sau căutarea aleatorie

30888
23:33:22,800 --> 23:33:27,440
asa cum am discutat. Și în sfârșit tu

30889
23:33:24,720 --> 23:33:30,160
poate implementa acest model pe AWS. Acum băieți

30890
23:33:27,440 --> 23:33:32,552
am ajuns la proiectul final. Aceasta

30891
23:33:30,160 --> 23:33:34,232
este, de asemenea, un proiect foarte uimitor băieți. Deci

30892
23:33:32,552 --> 23:33:36,872
baieti, nivelul de complexitate al acestui lucru

30893
23:33:34,232 --> 23:33:39,760
proiectul este de nivel avansat.

30894
23:33:36,872 --> 23:33:42,320
Acum haideți să trecem la proiectul nostru final

30895
23:33:39,760 --> 23:33:44,552
acesta este impactul schimbărilor climatice asupra

30896
23:33:42,320 --> 23:33:46,320
păsări. Acesta este un foarte, foarte uimitor

30897
23:33:44,552 --> 23:33:48,640
proiect și cu siguranță îl puteți adăuga

30898
23:33:46,320 --> 23:33:50,400
CV-ul dvs. Acest proiect are ca scop

30899
23:33:48,640 --> 23:33:52,000
analiza impactul schimbărilor climatice asupra

30900
23:33:50,400 --> 23:33:54,400
populația păsărilor și migrația

30901
23:33:52,000 --> 23:33:56,232
modele prin examinarea variatelor climatice

30902
23:33:54,400 --> 23:33:58,320
factori și corelarea lor cu pasărea

30903
23:33:56,232 --> 23:34:00,160
date despre specii. Proiectul urmărește să

30904
23:33:58,320 --> 23:34:02,480
prezice modul în care schimbările climatice ar putea afecta

30905
23:34:00,160 --> 23:34:04,400
comportamentul și distribuția păsărilor. Aceasta

30906
23:34:02,480 --> 23:34:06,000
proiect vă va prezenta câteva avansate

30907
23:34:04,400 --> 23:34:08,320
concepte de nivel precum seria temporală

30908
23:34:06,000 --> 23:34:10,960
analiza, modelarea datelor de mediu,

30909
23:34:08,320 --> 23:34:12,640
etc. Deci băieți, ce limbaje de programare

30910
23:34:10,960 --> 23:34:14,480
vom folosi pentru analiza datelor? tu

30911
23:34:12,640 --> 23:34:15,920
pot vedea că vom avea panda, numpy. Pentru

30912
23:34:14,480 --> 23:34:18,160
biblioteci de învățare automată, mergem

30913
23:34:15,920 --> 23:34:19,360
a avea scikitlearn, tensorflow. Pentru

30914
23:34:18,160 --> 23:34:22,160
vizualizare, vom avea

30915
23:34:19,360 --> 23:34:24,400
mattplot lab, plotly. Pentru geospațial, noi

30916
23:34:22,160 --> 23:34:26,000
vor avea geopande, folium. Pentru

30917
23:34:24,400 --> 23:34:27,680
sursă de date, vom avea public

30918
23:34:26,000 --> 23:34:30,232
seturi de date privind observarea păsărilor și

30919
23:34:27,680 --> 23:34:32,160
surse de date climatice de la eird. Acum ce

30920
23:34:30,232 --> 23:34:33,512
va curge procesul pentru acesta băieți?

30921
23:34:32,160 --> 23:34:35,600
Mai întâi trebuie să procedați pentru date

30922
23:34:33,512 --> 23:34:37,920
colectare. Adunați observarea păsărilor de la

30923
23:34:35,600 --> 23:34:40,160
datele precum EIRD care furnizează

30924
23:34:37,920 --> 23:34:42,232
înregistrare extinsă de observări de păsări.

30925
23:34:40,160 --> 23:34:44,320
Bine. Și pentru datele climatice poți

30926
23:34:42,232 --> 23:34:46,232
colectează-l de la NOA inclusiv

30927
23:34:44,320 --> 23:34:48,552
temperatura, precipitatii si altele

30928
23:34:46,232 --> 23:34:50,080
factorii climatici relevanți de-a lungul timpului.

30929
23:34:48,552 --> 23:34:52,080
Și următorul proces similar va fi

30930
23:34:50,080 --> 23:34:54,232
Prelucrarea datelor. Atunci trebuie

30931
23:34:52,080 --> 23:34:56,320
continuați pentru ingineria caracteristicilor. Apoi

30932
23:34:54,232 --> 23:34:58,232
trebuie să mergi la alegerea modelului.

30933
23:34:56,320 --> 23:35:01,040
Bine. Mergând înainte, trebuie să mergi pentru

30934
23:34:58,232 --> 23:35:03,040
antrenament model. apoi evaluarea, apoi

30935
23:35:01,040 --> 23:35:05,040
reglajul hiperparametrului și în cele din urmă tu

30936
23:35:03,040 --> 23:35:07,760
trebuie să implementeze modelul. Deci cercetare

30937
23:35:05,040 --> 23:35:09,360
despre acest proiect, vezi ce modele ai

30938
23:35:07,760 --> 23:35:10,872
urmează să utilizeze. Să presupunem că îți pot da

30939
23:35:09,360 --> 23:35:14,160
un indiciu despre asta. Puteți folosi timpul

30940
23:35:10,872 --> 23:35:16,872
modele de analiză în serie precum ARMA sau ML

30941
23:35:14,160 --> 23:35:18,960
modele. De asemenea, puteți folosi pădure aleatoare

30942
23:35:16,872 --> 23:35:21,440
sau creșterea gradientului pentru predicție

30943
23:35:18,960 --> 23:35:23,360
impact asupra populației de păsări. Deci băieți,

30944
23:35:21,440 --> 23:35:25,440
utilizați Google în mod exhaustiv pentru a cerceta

30945
23:35:23,360 --> 23:35:26,960
despre acest proiect. Acesta este, de asemenea, foarte

30946
23:35:25,440 --> 23:35:29,192
proiect uimitor și va da

30947
23:35:26,960 --> 23:35:31,512
ai o gramada de idei. Acum dacă vorbesc despre

30948
23:35:29,192 --> 23:35:33,192
nivelul de complexitate al acestuia, este o

30949
23:35:31,512 --> 23:35:34,960
proiect de nivel avansat.

30950
23:35:33,192 --> 23:35:37,192
>> Bine ați venit la interviul de deep learning

30951
23:35:34,960 --> 23:35:39,120
întrebări. Numele meu este Richard Kersner

30952
23:35:37,192 --> 23:35:41,600
cu echipa SimplyLearn. Asta e

30953
23:35:39,120 --> 23:35:44,080
www.simplearn.com.

30954
23:35:41,600 --> 23:35:45,920
Obțineți certificare, treceți înainte. Astăzi suntem

30955
23:35:44,080 --> 23:35:47,512
vă va ajuta să vă pregătiți pentru interviu

30956
23:35:45,920 --> 23:35:48,720
întrebări referitoare la învățarea profundă.

30957
23:35:47,512 --> 23:35:51,440
Și vom merge de la bun început

30958
23:35:48,720 --> 23:35:54,320
bazele rețelelor neuronale și profunde

30959
23:35:51,440 --> 23:35:56,480
învățarea în unele dintre cele mai frecvente

30960
23:35:54,320 --> 23:35:57,760
modele folosite pentru a putea avea un

30961
23:35:56,480 --> 23:35:59,120
înțelegerea ce fel de întrebări

30962
23:35:57,760 --> 23:36:01,192
vor apărea și ceea ce aveți nevoie

30963
23:35:59,120 --> 23:36:03,120
să știe în întrebările interviului. Vom face

30964
23:36:01,192 --> 23:36:05,192
începe cu un concept foarte general de

30965
23:36:03,120 --> 23:36:07,360
ce este învățarea profundă. Aici noi

30966
23:36:05,192 --> 23:36:09,680
luați volume mari de date în acest caz

30967
23:36:07,360 --> 23:36:12,480
pe pisici și câini sau orice altceva. O mulţime de

30968
23:36:09,680 --> 23:36:13,920
ori când folosești o configurație de antrenament

30969
23:36:12,480 --> 23:36:16,000
antrenează-ți modelul. Amintește-ți că este un fel

30970
23:36:13,920 --> 23:36:17,600
ca o cutie neagră magică care se întâmplă acolo.

30971
23:36:16,000 --> 23:36:19,680
Și apoi îl folosim pentru a extrage caracteristici

30972
23:36:17,600 --> 23:36:22,000
sau extrage informatii si in acest caz

30973
23:36:19,680 --> 23:36:23,760
clasifică imaginea unei pisici și a unui câine.

30974
23:36:22,000 --> 23:36:25,832
Așa că vorbim despre principala variantă

30975
23:36:23,760 --> 23:36:28,000
despre învățarea profundă din care învață

30976
23:36:25,832 --> 23:36:30,400
volume mari de structurat şi uniform

30977
23:36:28,000 --> 23:36:32,720
date nestructurate și utilizări complexe

30978
23:36:30,400 --> 23:36:34,720
algoritmi pentru antrenarea rețelelor neuronale. Ea

30979
23:36:32,720 --> 23:36:36,872
efectuează de asemenea operații complexe pentru

30980
23:36:34,720 --> 23:36:38,400
extrageți modele și caracteristici ascunse.

30981
23:36:36,872 --> 23:36:40,480
Și dacă vom discuta profund

30982
23:36:38,400 --> 23:36:42,232
învățarea în acest mod foarte simplificată

30983
23:36:40,480 --> 23:36:44,320
privire de ansamblu și trebuie să trecem și peste

30984
23:36:42,232 --> 23:36:46,720
ce este o rețea neuronală. Acesta este un

30985
23:36:44,320 --> 23:36:49,120
imagine comună pe care o veți vedea despre un desen

30986
23:36:46,720 --> 23:36:51,512
o rețea neuronală cu propagare înainte și

30987
23:36:49,120 --> 23:36:53,832
este un sistem inspirat de creierul uman

30988
23:36:51,512 --> 23:36:55,600
care reproduc modul în care oamenii învață. Deci

30989
23:36:53,832 --> 23:36:57,192
acest lucru a inspirat modul în care propriii noștri neuroni

30990
23:36:55,600 --> 23:36:58,872
iar creierul nostru arde dar cu mult

30991
23:36:57,192 --> 23:37:00,640
nivel simplificat. Evident că nu este

30992
23:36:58,872 --> 23:37:02,720
gata să preia omul uh

30993
23:37:00,640 --> 23:37:04,400
populație și să fii încă liderul nostru.

30994
23:37:02,720 --> 23:37:06,232
Nu de mulți ani. Este foarte mult în

30995
23:37:04,400 --> 23:37:08,400
stadiul ei infantil. Dar este inspirat de

30996
23:37:06,232 --> 23:37:10,160
cum funcționează creierul nostru. Hm și folosesc a

30997
23:37:08,400 --> 23:37:13,040
multe alte inspirații. Poți studia

30998
23:37:10,160 --> 23:37:14,480
creier de molii si alte animale care

30999
23:37:13,040 --> 23:37:16,320
obișnuiau să-și dea seama cum

31000
23:37:14,480 --> 23:37:18,232
îmbunătățirea acestor rețele neuronale. Cel mai mult

31001
23:37:16,320 --> 23:37:20,080
unul comun este format din trei straturi de

31002
23:37:18,232 --> 23:37:21,600
rețeaua și, în general, așa se face

31003
23:37:20,080 --> 23:37:23,760
vizualizați aceste rețele dacă aveți un

31004
23:37:21,600 --> 23:37:26,232
intrare, aveți un strat ascuns și un

31005
23:37:23,760 --> 23:37:28,160
ieșire. Și rețeaua neuronală este

31006
23:37:26,232 --> 23:37:30,160
ruptă în multe bucăți. Dar când noi

31007
23:37:28,160 --> 23:37:31,600
concentrează-te doar pe rețeaua neuronală, e

31008
23:37:30,160 --> 23:37:33,680
mereu pe straturile ascunse pe care le suntem

31009
23:37:31,600 --> 23:37:36,552
făcând toate ajustările și calculând

31010
23:37:33,680 --> 23:37:39,360
aflați cum să le configurați cel mai bine pe cele ascunse

31011
23:37:36,552 --> 23:37:41,280
straturi pentru funcțiile lor să se antreneze atât

31012
23:37:39,360 --> 23:37:42,232
mai rapid și să funcționeze mai bine. Când noi

31013
23:37:41,280 --> 23:37:44,320
Uită-te la asta, desigur, avem noastre

31014
23:37:42,232 --> 23:37:47,360
intrare, ascuns și ieșire. Fiecare strat

31015
23:37:44,320 --> 23:37:49,600
conține neuroni numiți ca efectul nodurilor

31016
23:37:47,360 --> 23:37:51,192
diverse operatii. Și puteți vedea aici

31017
23:37:49,600 --> 23:37:52,800
avem lista nodurilor. Avem

31018
23:37:51,192 --> 23:37:54,720
atât nodurile noastre de intrare, cât și de ieșire

31019
23:37:52,800 --> 23:37:56,552
nodurile și apoi nodurile noastre de strat ascunse.

31020
23:37:54,720 --> 23:38:00,080
Și este folosit în algoritmul de învățare profundă

31021
23:37:56,552 --> 23:38:01,512
precum CNN, RNN, GN etc. Ne vom adresa

31022
23:38:00,080 --> 23:38:03,600
unele dintre aceste modele un pic mai aproape, la

31023
23:38:01,512 --> 23:38:05,440
cel puțin cele mai comune modele pe măsură ce mergem

31024
23:38:03,600 --> 23:38:06,720
jos pe listă și studiem adâncul

31025
23:38:05,440 --> 23:38:09,440
învăţare şi reţeaua neuronală

31026
23:38:06,720 --> 23:38:12,720
cadru. Să începem cu ceea ce este a

31027
23:38:09,440 --> 23:38:14,320
multi-strat perceptron sau MLP o mulțime de

31028
23:38:12,720 --> 23:38:16,480
timp la care se face referire. Și vei

31029
23:38:14,320 --> 23:38:18,000
vezi aceste abrevieri. Voi fi sincer,

31030
23:38:16,480 --> 23:38:19,360
Trebuie să le notez pe o bucată de

31031
23:38:18,000 --> 23:38:21,040
hârtie și le parcurg pentru că eu

31032
23:38:19,360 --> 23:38:22,640
nici măcar nu-ți amintești ce înseamnă toate

31033
23:38:21,040 --> 23:38:24,640
deși mă joc cu ei tot timpul.

31034
23:38:22,640 --> 23:38:26,320
Ce este un perceptron cu mai multe straturi? Ei bine,

31035
23:38:24,640 --> 23:38:27,832
dacă te uiți la imaginea din dreapta,

31036
23:38:26,320 --> 23:38:29,512
este foarte asemănător cu ceea ce tocmai ne-am uitat

31037
23:38:27,832 --> 23:38:31,280
la. Aveți stratul dvs. de intrare, dvs

31038
23:38:29,512 --> 23:38:33,040
stratul ascuns și stratul de ieșire. Şi

31039
23:38:31,280 --> 23:38:34,320
exact asta este. Are

31040
23:38:33,040 --> 23:38:36,552
aceeași structură a unui singur strat

31041
23:38:34,320 --> 23:38:38,800
perceptron cu unul sau mai multe ascunse

31042
23:38:36,552 --> 23:38:40,872
straturi cu excepția stratului de intrare, fiecare nod

31043
23:38:38,800 --> 23:38:43,192
în celelalte straturi folosește un neliniar

31044
23:38:40,872 --> 23:38:45,192
functia de activare. Ceea ce înseamnă asta este

31045
23:38:43,192 --> 23:38:47,512
stratul dvs. de intrare sunt datele dvs. care intră

31046
23:38:45,192 --> 23:38:49,512
și apoi funcția ta de activare este

31047
23:38:47,512 --> 23:38:51,440
bazat pe toate acele noduri și greutăți

31048
23:38:49,512 --> 23:38:54,080
fiind adăugate împreună și apoi are

31049
23:38:51,440 --> 23:38:56,640
ieșire. MLP folosește învățarea supravegheată

31050
23:38:54,080 --> 23:38:58,640
metoda numita inapoi propagare pt

31051
23:38:56,640 --> 23:39:00,640
antrenarea modelului. Foarte cuvânt cheie acolo

31052
23:38:58,640 --> 23:39:02,872
este propagarea înapoi. Un singur strat

31053
23:39:00,640 --> 23:39:06,320
perceptronul poate clasifica numai liniar

31054
23:39:02,872 --> 23:39:08,640
clase separabile cu ieșire binară 01.

31055
23:39:06,320 --> 23:39:10,872
Dar MLP poate clasifica neliniar

31056
23:39:08,640 --> 23:39:12,800
clasele. Așa că hai să descompunem asta doar a

31057
23:39:10,872 --> 23:39:14,320
un pic. Perceptronul multistrat

31058
23:39:12,800 --> 23:39:16,160
cu un strat de intrare și un strat ascuns

31059
23:39:14,320 --> 23:39:18,232
și un strat de ieșire. După cum vezi că

31060
23:39:16,160 --> 23:39:20,400
vine acolo, a aduna toate

31061
23:39:18,232 --> 23:39:22,320
numere și greutăți în funcție de cum

31062
23:39:20,400 --> 23:39:23,832
configurația ta este. Asta merge apoi la

31063
23:39:22,320 --> 23:39:25,760
stratul următor. Apoi trece la următorul

31064
23:39:23,832 --> 23:39:27,920
strat ascuns dacă aveți mai multe straturi ascunse

31065
23:39:25,760 --> 23:39:30,480
straturi. Și în sfârșit la nivelul de ieșire.

31066
23:39:27,920 --> 23:39:32,320
Propagarea înapoi preia eroarea

31067
23:39:30,480 --> 23:39:33,920
că vede. Deci, indiferent de rezultat,

31068
23:39:32,320 --> 23:39:35,680
scrie, hei, asta are o eroare.

31069
23:39:33,920 --> 23:39:37,832
Este greșit. Și apoi trimite acea eroare

31070
23:39:35,680 --> 23:39:39,360
înapoi de unde a venit. Şi

31071
23:39:37,832 --> 23:39:42,552
există o mulțime de funcții diferite

31072
23:39:39,360 --> 23:39:44,480
obișnuiam să antrenez asta pe baza asta

31073
23:39:42,552 --> 23:39:46,960
eroare și cum acea eroare merge înapoi

31074
23:39:44,480 --> 23:39:49,040
în note. Uh, atât de înainte ai primit

31075
23:39:46,960 --> 23:39:51,680
răspunsurile tale. Înapoi este pentru antrenament.

31076
23:39:49,040 --> 23:39:53,920
Vezi asta în fiecare zi. Chiar și uh-ul meu

31077
23:39:51,680 --> 23:39:55,760
Telefonul Google Pixel are asta. Ei

31078
23:39:53,920 --> 23:39:57,512
antrenează rețeaua neuronală care ia a

31079
23:39:55,760 --> 23:39:59,440
mult mai multe date de antrenat decât pentru

31080
23:39:57,512 --> 23:40:01,760
folosi. Și apoi încarcă acel neural

31081
23:39:59,440 --> 23:40:03,600
în rețea în acest caz am un Pixel

31082
23:40:01,760 --> 23:40:05,832
2 care are de fapt un neural încorporat

31083
23:40:03,600 --> 23:40:07,920
rețea pentru procesarea imaginilor. Și așa

31084
23:40:05,832 --> 23:40:10,080
este doar propagarea înainte pe care o folosesc

31085
23:40:07,920 --> 23:40:11,680
când îmi prelucrează fotografiile, dar când

31086
23:40:10,080 --> 23:40:13,440
ei îl antrenau, tu folosești spatele

31087
23:40:11,680 --> 23:40:15,360
propagare pentru a-l antrena cu erorile

31088
23:40:13,440 --> 23:40:17,120
aveau. Vom reveni la

31089
23:40:15,360 --> 23:40:18,800
diferite modele care sunt utilizate. Pentru

31090
23:40:17,120 --> 23:40:21,680
chiar acum, totuși, cu mai multe straturi

31091
23:40:18,800 --> 23:40:24,000
perceptron, MLP, lasă-l jos ca al tău

31092
23:40:21,680 --> 23:40:26,800
cuvânt de vocabular și bineînțeles înapoi

31093
23:40:24,000 --> 23:40:29,040
propagare. Ce este normalizarea datelor

31094
23:40:26,800 --> 23:40:30,872
si de ce avem nevoie de ea? Așa este

31095
23:40:29,040 --> 23:40:32,640
important. Petrecem atât de mult timp în

31096
23:40:30,872 --> 23:40:34,640
normalizarea datelor noastre și obținerea noastră

31097
23:40:32,640 --> 23:40:36,872
curățarea datelor și configurarea acestora. Uh, deci noi

31098
23:40:34,640 --> 23:40:38,800
vorbim despre date, există o pre-procesare

31099
23:40:36,872 --> 23:40:40,872
pas de standardizare a datelor. Deci

31100
23:40:38,800 --> 23:40:43,760
orice am intra, nu vrem

31101
23:40:40,872 --> 23:40:46,800
să fie un fișier de un gigabyte

31102
23:40:43,760 --> 23:40:49,360
aici o poză de 2 GBTE aici și una de 3

31103
23:40:46,800 --> 23:40:50,960
text kilobyte acolo. Chiar și ca eu uman

31104
23:40:49,360 --> 23:40:52,872
nu le pot procesa pe toate la fel

31105
23:40:50,960 --> 23:40:54,400
grup. Trebuie să le reformatez în unele

31106
23:40:52,872 --> 23:40:56,872
mod care le unește astfel încât să fie

31107
23:40:54,400 --> 23:40:58,640
un format standardizat. Noi folosim asta uh

31108
23:40:56,872 --> 23:41:01,600
normalizarea datelor și și

31109
23:40:58,640 --> 23:41:04,232
preprocesare pentru a reduce și a elimina

31110
23:41:01,600 --> 23:41:06,232
redundanța datelor. De multe ori datele

31111
23:41:04,232 --> 23:41:08,552
intră și ajungi cu doi dintre

31112
23:41:06,232 --> 23:41:10,480
aceleași imagini sau uh uh aceleași

31113
23:41:08,552 --> 23:41:12,800
informații în diferite formate. Apoi

31114
23:41:10,480 --> 23:41:14,960
dorim să redimensionăm valorile pentru a se potrivi într-un

31115
23:41:12,800 --> 23:41:17,440
un interval special pentru a realiza mai bine

31116
23:41:14,960 --> 23:41:20,000
convergenta. Ce înseamnă asta este cu

31117
23:41:17,440 --> 23:41:22,400
majoritatea rețelelor neuronale formează o părtinire.

31118
23:41:20,000 --> 23:41:24,400
Am văzut asta recent în atacuri

31119
23:41:22,400 --> 23:41:26,960
pe rețelele neuronale unde se aprind

31120
23:41:24,400 --> 23:41:29,920
un pixel sau o bucată din vedere și

31121
23:41:26,960 --> 23:41:32,800
deformează întregul răspuns. Deci brusc u

31122
23:41:29,920 --> 23:41:34,080
pentru că un pixel este foarte luminos

31123
23:41:32,800 --> 23:41:36,080
nu stie ce sa faca. Ei bine, când noi

31124
23:41:34,080 --> 23:41:38,800
începe să-l rescalăm punem toate valorile

31125
23:41:36,080 --> 23:41:40,480
între spune minus unu și unu și noi

31126
23:41:38,800 --> 23:41:42,320
schimbați-le și remontați-le pe acelea

31127
23:41:40,480 --> 23:41:44,232
valorile. Te ajută să scapi de această părtinire

31128
23:41:42,320 --> 23:41:46,080
ajută la rezolvarea unora dintre aceste probleme.

31129
23:41:44,232 --> 23:41:47,832
Și apoi, în cele din urmă, restructuram datele

31130
23:41:46,080 --> 23:41:49,600
și îmbunătățirea integrității. Vrem

31131
23:41:47,832 --> 23:41:51,360
asigurați-vă că nu ne lipsesc valori

31132
23:41:49,600 --> 23:41:54,080
sau nu avem date parțiale

31133
23:41:51,360 --> 23:41:57,120
in. Un fel de a privi asta este rău

31134
23:41:54,080 --> 23:41:59,040
date în date proaste. Și așa vrei

31135
23:41:57,120 --> 23:42:01,600
curățați datele și doriți răspunsuri bune

31136
23:41:59,040 --> 23:42:04,320
ieşind. Unul dintre cele mai de bază modele

31137
23:42:01,600 --> 23:42:06,400
folosit este o mașină Boltzman. Deci haideți

31138
23:42:04,320 --> 23:42:08,080
abordează ce este o mașină Boltzman. Şi

31139
23:42:06,400 --> 23:42:10,400
dacă știi că tocmai am făcut MLP-ul

31140
23:42:08,080 --> 23:42:12,720
perceptron multistrat. Deci acum suntem

31141
23:42:10,400 --> 23:42:14,480
va intra într-un aspect aproape simplificat

31142
23:42:12,720 --> 23:42:16,400
versiunea asta. Și în aceasta avem a noastră

31143
23:42:14,480 --> 23:42:18,160
strat de intrare vizibil și avem nostru

31144
23:42:16,400 --> 23:42:19,600
strat ascuns. Mașinile Boltzman sunt

31145
23:42:18,160 --> 23:42:21,512
aproape întotdeauna superficială. De obicei sunt

31146
23:42:19,600 --> 23:42:24,000
doar rețele neuronale cu două straturi care fac

31147
23:42:21,512 --> 23:42:26,552
decizii stocastice dacă un neuron

31148
23:42:24,000 --> 23:42:28,640
ar trebui să fie pornit sau oprit. Adevărat sau fals? Da.

31149
23:42:26,552 --> 23:42:30,800
Nu. Primul strat este un strat vizibil și

31150
23:42:28,640 --> 23:42:32,872
al doilea strat este stratul ascuns. Noduri

31151
23:42:30,800 --> 23:42:34,640
sunt conectate între ele peste tot

31152
23:42:32,872 --> 23:42:36,232
straturi, dar nu există două noduri ale aceluiași

31153
23:42:34,640 --> 23:42:39,280
stratul sunt conectate. Prin urmare, este și

31154
23:42:36,232 --> 23:42:41,920
cunoscut sub numele de mașină Boltzman restricționată.

31155
23:42:39,280 --> 23:42:44,080
Acum că am acoperit un MLP de bază sau

31156
23:42:41,920 --> 23:42:46,000
perceptron multistrat și am plecat

31157
23:42:44,080 --> 23:42:47,920
peste mașina Boltzman, cunoscută și ca

31158
23:42:46,000 --> 23:42:49,440
mașina Boltzman restricționată, haideți

31159
23:42:47,920 --> 23:42:53,360
vorbiți puțin despre activare

31160
23:42:49,440 --> 23:42:55,680
formule. Și acesta este un subiect uriaș

31161
23:42:53,360 --> 23:42:57,680
poate deveni foarte complicat, dar și

31162
23:42:55,680 --> 23:42:59,360
este automatizat. Deci este foarte simplu. Deci

31163
23:42:57,680 --> 23:43:02,080
ai atât un complicat cât și unul simplu

31164
23:42:59,360 --> 23:43:03,760
in acelasi timp. Deci care este rolul

31165
23:43:02,080 --> 23:43:05,920
funcțiile de activare într-un neuron

31166
23:43:03,760 --> 23:43:08,160
retea? Funcția de activare decide

31167
23:43:05,920 --> 23:43:10,080
dacă un neuron ar trebui declanșat sau nu.

31168
23:43:08,160 --> 23:43:11,600
Acesta este cel mai de bază și asta

31169
23:43:10,080 --> 23:43:13,760
de fapt se schimbă puțin pentru că

31170
23:43:11,600 --> 23:43:16,320
fie că este tras sau nu în asta

31171
23:43:13,760 --> 23:43:17,920
funcția de activare a cazului sau ce valoare

31172
23:43:16,320 --> 23:43:19,760
ar trebui să iasă când este tras. Dar în

31173
23:43:17,920 --> 23:43:22,400
aceste modele, ne uităm doar la

31174
23:43:19,760 --> 23:43:24,160
straturi restrictionate boltsman. Deci asta este

31175
23:43:22,400 --> 23:43:26,232
ce le face să tragă. Fie ei

31176
23:43:24,160 --> 23:43:28,320
nu fac sau o fac. Este un da sau nu,

31177
23:43:26,232 --> 23:43:30,800
adevărat, fals, totul sau nimic. Acceptă

31178
23:43:28,320 --> 23:43:33,192
suma ponderată a intrărilor, părtinirea

31179
23:43:30,800 --> 23:43:35,440
ca intrare pentru orice funcție de activare. Deci

31180
23:43:33,192 --> 23:43:37,120
indiferent de funcția de activare, aceasta

31181
23:43:35,440 --> 23:43:39,280
trebuie să aibă suma greutăților

31182
23:43:37,120 --> 23:43:40,640
ori intrarea. Deci fiecare intrare, dacă tu

31183
23:43:39,280 --> 23:43:42,160
ține minte pe acel model și haideți

31184
23:43:40,640 --> 23:43:44,552
întoarce-te foarte repede la acel model. Şi

31185
23:43:42,160 --> 23:43:46,800
atunci trebuie să adăugați întotdeauna o părtinire. Şi

31186
23:43:44,552 --> 23:43:49,120
te poți uita la părtinire dacă îți amintești

31187
23:43:46,800 --> 23:43:51,440
din geometria ta uklitiană. Desenezi un

31188
23:43:49,120 --> 23:43:54,160
linie dreaptă. Formula pentru acea linie are

31189
23:43:51,440 --> 23:43:56,720
o coordonată y la sfârșit. Este întotdeauna

31190
23:43:54,160 --> 23:43:58,320
um cx plus m sau ceva de genul asta

31191
23:43:56,720 --> 23:44:00,080
unde m este locul în care traversează

31192
23:43:58,320 --> 23:44:02,720
y coordonatele. Dacă faci o chintă

31193
23:44:00,080 --> 23:44:04,552
aliniat cu aceste greutăți, este foarte

31194
23:44:02,720 --> 23:44:07,192
similar, dar de multe ori doar adăugăm

31195
23:44:04,552 --> 23:44:09,360
ea ca greutate proprie. O luăm ca pe o

31196
23:44:07,192 --> 23:44:11,192
nodul unei valori de o singură intrare și apoi

31197
23:44:09,360 --> 23:44:12,960
calculăm noua sa greutate. Și asta este

31198
23:44:11,192 --> 23:44:14,640
cum calculăm această părtinire la fel ca noi

31199
23:44:12,960 --> 23:44:16,720
calculați toate celelalte greutăți care vin.

31200
23:44:14,640 --> 23:44:18,552
Nodul care este declanșat depinde de

31201
23:44:16,720 --> 23:44:20,480
valoarea y. Și apoi avem un pas

31202
23:44:18,552 --> 23:44:21,760
funcția. Și aceasta este funcția pas

31203
23:44:20,480 --> 23:44:23,832
unde ține minte că am spus că o să ajungă

31204
23:44:21,760 --> 23:44:25,600
complicat și simplu în același timp

31205
23:44:23,832 --> 23:44:28,000
timp. Avem multe etape diferite

31206
23:44:25,600 --> 23:44:30,080
funcții. Avem funcția sigmoidă.

31207
23:44:28,000 --> 23:44:33,192
Avem doar o funcție standard de pas.

31208
23:44:30,080 --> 23:44:35,512
Avem ru se pronunță ca ray

31209
23:44:33,192 --> 23:44:37,760
raza de soare si lu ca a

31210
23:44:35,512 --> 23:44:39,600
nume. Deci funcția ru. Și avem

31211
23:44:37,760 --> 23:44:41,360
funcția tangentă h. Și dacă te uiți la

31212
23:44:39,600 --> 23:44:44,080
astea, toate au ceva asemanator.

31213
23:44:41,360 --> 23:44:45,920
Toți fie forțează să fie unul singur

31214
23:44:44,080 --> 23:44:47,920
valoare sau alta. Ei forțează să fie

31215
23:44:45,920 --> 23:44:50,000
în cazul primelor trei un zero sau

31216
23:44:47,920 --> 23:44:51,920
unul. Și în ultimul, este fie a

31217
23:44:50,000 --> 23:44:54,232
minus unul sau unul. Și poți ușor

31218
23:44:51,920 --> 23:44:56,480
convertiți asta la 0, unu, da, nu, adevărat,

31219
23:44:54,232 --> 23:44:58,720
fals. Și pe aceasta, una dintre cele mai multe

31220
23:44:56,480 --> 23:45:00,800
cele comune este funcția pas în sine

31221
23:44:58,720 --> 23:45:03,440
pentru că nu există o valoare medie. Acolo

31222
23:45:00,800 --> 23:45:05,440
nu este o discrepanță care spune, ei bine,

31223
23:45:03,440 --> 23:45:07,360
Nu sunt sigur. Dar pe măsură ce intri

31224
23:45:05,440 --> 23:45:09,192
modele diferite, probabil cele mai multe

31225
23:45:07,360 --> 23:45:11,280
folosit în mod obișnuit pentru a fi sigmoidul era

31226
23:45:09,192 --> 23:45:13,600
cel mai des folosit, dar văd relu

31227
23:45:11,280 --> 23:45:15,040
folosit mai des. Într-adevăr, în funcție de

31228
23:45:13,600 --> 23:45:16,720
ceea ce faci, trebuie doar să te joci

31229
23:45:15,040 --> 23:45:19,040
cu acestea și află care funcționează

31230
23:45:16,720 --> 23:45:22,480
cel mai bine în funcție de datele din dvs

31231
23:45:19,040 --> 23:45:24,400
ieșire. Motivul pentru a avea un non01

31232
23:45:22,480 --> 23:45:25,832
răspuns sau ceva de genul în

31233
23:45:24,400 --> 23:45:27,440
mijlocul este atunci când te uiți la asta

31234
23:45:25,832 --> 23:45:30,232
și iese, chiar poți

31235
23:45:27,440 --> 23:45:32,320
procesează acea cale de mijloc ca parte a

31236
23:45:30,232 --> 23:45:34,960
răspunsul într-o altă rețea neuronală.

31237
23:45:32,320 --> 23:45:38,872
Deci s-ar putea ca funcția relu

31238
23:45:34,960 --> 23:45:41,600
spune hei, acesta este doar un 6, nu unul și

31239
23:45:38,872 --> 23:45:43,920
uh, chiar dacă unul este ceea ce se întâmplă

31240
23:45:41,600 --> 23:45:47,040
în următoarea rețea neuronală sau în următoarea

31241
23:45:43,920 --> 23:45:49,120
strat ascuns ca intrare valoarea 6

31242
23:45:47,040 --> 23:45:51,512
s-ar putea să intre acolo să te lase

31243
23:45:49,120 --> 23:45:53,120
știi, hei, acesta nu este unul direct

31244
23:45:51,512 --> 23:45:54,552
sau direct la zero este undeva

31245
23:45:53,120 --> 23:45:56,160
la mijloc acest lucru este puțin incert

31246
23:45:54,552 --> 23:45:58,232
ce iese aici, deci este foarte

31247
23:45:56,160 --> 23:45:59,832
instrument puternic în neuronul de bază

31248
23:45:58,232 --> 23:46:02,640
rețeaua pe care o utilizați de obicei doar pasul

31249
23:45:59,832 --> 23:46:05,512
funcția este da sau nu hai să luăm un um

31250
23:46:02,640 --> 23:46:08,232
un mare pas înapoi și fă un fel de an

31251
23:46:05,512 --> 23:46:10,640
privire de ansamblu. Următoarea funcție este ceea ce este a

31252
23:46:08,232 --> 23:46:12,320
funcția de cost pe care o vom acoperi.

31253
23:46:10,640 --> 23:46:14,320
Acest lucru este atât de important pentru că asta este

31254
23:46:12,320 --> 23:46:16,720
rezultatul final pe care îl vei face

31255
23:46:14,320 --> 23:46:18,400
iar și iar și folosit pentru a decide

31256
23:46:16,720 --> 23:46:19,920
indiferent dacă modelul funcționează sau nu,

31257
23:46:18,400 --> 23:46:21,440
dacă trebuie să încercați un pas diferit

31258
23:46:19,920 --> 23:46:22,720
funcția, indiferent dacă trebuie să încercați o

31259
23:46:21,440 --> 23:46:24,872
activare diferită, indiferent dacă aveți nevoie

31260
23:46:22,720 --> 23:46:26,800
pentru a încerca un model complet diferit folosit. Uh

31261
23:46:24,872 --> 23:46:29,040
deci care este funcția de cost? Cost

31262
23:46:26,800 --> 23:46:31,440
funcția este o măsură pentru a evalua cum

31263
23:46:29,040 --> 23:46:34,640
performanta modelului tau este buna. Este

31264
23:46:31,440 --> 23:46:36,320
de asemenea, denumită pierdere sau eroare folosită pentru

31265
23:46:34,640 --> 23:46:38,400
calculați eroarea stratului de ieșire

31266
23:46:36,320 --> 23:46:39,832
în timpul înmulțirii înapoi. Acolo e al nostru

31267
23:46:38,400 --> 23:46:42,000
propagarea spatelui acolo unde ne antrenăm

31268
23:46:39,832 --> 23:46:44,400
modelul nostru. Acesta este unul dintre cuvintele noastre cheie.

31269
23:46:42,000 --> 23:46:46,800
Eroarea medie pătratică este un exemplu de a

31270
23:46:44,400 --> 23:46:50,720
funcția de cost populară. Și așa iată-ne

31271
23:46:46,800 --> 23:46:52,872
au funcția de cost C = jumătate din Y - Y

31272
23:46:50,720 --> 23:46:54,960
prezis. Hm și apoi pătrați asta.

31273
23:46:52,872 --> 23:46:56,552
Deci primul lucru este că știi real

31274
23:46:54,960 --> 23:46:58,480
repede dacă nu ai făcut statistici

31275
23:46:56,552 --> 23:47:00,480
acesta nu este un procent. Nu este o

31276
23:46:58,480 --> 23:47:02,720
procent din cât de precis este. este

31277
23:47:00,480 --> 23:47:04,320
doar o măsurare a erorii și noi

31278
23:47:02,720 --> 23:47:06,232
luăm acea eroare dacă o antrenăm și

31279
23:47:04,320 --> 23:47:08,160
împingem acea eroare înapoi prin

31280
23:47:06,232 --> 23:47:10,000
rețeaua neuronală și o folosim prin

31281
23:47:08,160 --> 23:47:12,000
diferitele funcții de antrenament

31282
23:47:10,000 --> 23:47:14,160
in functie de modelul pe care il folosesti

31283
23:47:12,000 --> 23:47:15,920
antrenează rețeaua neuronală. Deci când tu

31284
23:47:14,160 --> 23:47:17,280
implementați rețeaua pe care ați terminat de obicei

31285
23:47:15,920 --> 23:47:19,512
antrenamentul pentru că este nevoie de mult

31286
23:47:17,280 --> 23:47:21,280
forță de calcul pentru a o antrena. Hm asta

31287
23:47:19,512 --> 23:47:22,720
este un model foarte simplu și deci implementați

31288
23:47:21,280 --> 23:47:24,552
cea de tren. Dar vrem să știm

31289
23:47:22,720 --> 23:47:26,552
cum este eroarea ta și cum procedăm

31290
23:47:24,552 --> 23:47:28,872
asta? Ei bine, ți-ai împărțit datele. parte din

31291
23:47:26,552 --> 23:47:30,400
datele dvs. sunt pentru tranzacționare și fac parte din

31292
23:47:28,872 --> 23:47:32,480
datele tale sunt pentru testare. Și apoi noi

31293
23:47:30,400 --> 23:47:33,832
poate testa și eroarea acolo. Aşa

31294
23:47:32,480 --> 23:47:36,232
este foarte important. Și atunci suntem

31295
23:47:33,832 --> 23:47:38,000
o să mai fac un pas în acest sens. Noi

31296
23:47:36,232 --> 23:47:40,872
trebuie să se uite atât la local, cât și la

31297
23:47:38,000 --> 23:47:42,872
configurație globală. S-ar putea să funcționeze grozav

31298
23:47:40,872 --> 23:47:44,400
testați-vă datele pe ceea ce aveți pe dvs

31299
23:47:42,872 --> 23:47:46,232
computer, dar asta e diferit de în

31300
23:47:44,400 --> 23:47:48,160
câmpul. Deci, când vorbim despre

31301
23:47:46,232 --> 23:47:50,800
toate aceste teste diferite și eroarea

31302
23:47:48,160 --> 23:47:52,232
testează cât de mult pierderea ta, nu tu

31303
23:47:50,800 --> 23:47:53,600
vrei să te asigur că te afli într-o

31304
23:47:52,232 --> 23:47:55,192
mediu închis când faci inițiale

31305
23:47:53,600 --> 23:47:56,640
testare, dar vrei să deschizi și asta

31306
23:47:55,192 --> 23:47:58,232
sus și asigurați-vă că urmați cu

31307
23:47:56,640 --> 23:47:59,760
testarea la scară mai mare a datelor

31308
23:47:58,232 --> 23:48:01,040
pentru că se va schimba. S-ar putea să nu se potrivească

31309
23:47:59,760 --> 23:48:02,080
la scara mai mare. S-ar putea să existe

31310
23:48:01,040 --> 23:48:04,160
ceva acolo în felul tău

31311
23:48:02,080 --> 23:48:06,480
a adus datele în mod specific sau

31312
23:48:04,160 --> 23:48:08,000
grupul de date pe care l-ați folosit sau oricare dintre acestea

31313
23:48:06,480 --> 23:48:09,280
ar putea cauza o eroare. Deci, este foarte

31314
23:48:08,000 --> 23:48:11,920
important să ne amintim că căutăm

31315
23:48:09,280 --> 23:48:14,400
atât în contextul local, cât și în cel global

31316
23:48:11,920 --> 23:48:16,800
a erorii noastre. Și doar o altă parte

31317
23:48:14,400 --> 23:48:19,512
notă cu privire la multe dintre modelele mai noi ale

31318
23:48:16,800 --> 23:48:21,920
rețelele neuronale prin compararea erorii

31319
23:48:19,512 --> 23:48:24,160
primim pe date datele noastre de antrenament

31320
23:48:21,920 --> 23:48:25,832
cu o parte din datele de testare putem

31321
23:48:24,160 --> 23:48:27,760
de fapt, afli cât de bun este modelul

31322
23:48:25,832 --> 23:48:29,280
este dacă este suprainstalat sau nu. Vom face

31323
23:48:27,760 --> 23:48:31,512
intră în asta puțin mai mult pe măsură ce mergem

31324
23:48:29,280 --> 23:48:34,080
în unele dintre diferitele modele. Deci noi

31325
23:48:31,512 --> 23:48:35,920
avem producția noastră. Suntem capabili să ne dăm seama

31326
23:48:34,080 --> 23:48:37,760
scoateți eroarea pe baza pătratului

31327
23:48:35,920 --> 23:48:39,600
înseamnă de obicei, deși există și alte uh

31328
23:48:37,760 --> 23:48:41,760
functiile folosite. Deci vrem să vorbim despre

31329
23:48:39,600 --> 23:48:44,480
ce este coborârea în gradient? Altul

31330
23:48:41,760 --> 23:48:47,040
vocabularul cuvânt gradient descent is an

31331
23:48:44,480 --> 23:48:49,360
algoritm de optimizare pentru a minimiza

31332
23:48:47,040 --> 23:48:51,280
funcția de cost sau pentru a minimiza eroarea.

31333
23:48:49,360 --> 23:48:53,280
Scopul este de a găsi local sau global

31334
23:48:51,280 --> 23:48:55,040
minime ale unei funcții. Determinați

31335
23:48:53,280 --> 23:48:57,280
direcția în care ar trebui să o ia modelul

31336
23:48:55,040 --> 23:48:59,760
reduce eroarea. Deci, așa cum ne uităm

31337
23:48:57,280 --> 23:49:01,512
asta, avem eroarea noastră pătrat că

31338
23:48:59,760 --> 23:49:03,600
tocmai ne-am dat seama de co baza pe

31339
23:49:01,512 --> 23:49:05,040
funcția de cost. Spune cât de rău este al meu

31340
23:49:03,600 --> 23:49:07,360
model care se potrivește cu datele pe care tocmai le-am pus

31341
23:49:05,040 --> 23:49:08,872
prin ea. Și atunci vrem să reducem

31342
23:49:07,360 --> 23:49:10,800
acea eroare. Deci cum iti dai seama

31343
23:49:08,872 --> 23:49:12,320
in ce directie sa fac asta? Ei bine, asta

31344
23:49:10,800 --> 23:49:14,160
ar putea fi că te uiți doar la

31345
23:49:12,320 --> 23:49:16,000
acea linie a acelei linii de date care vine

31346
23:49:14,160 --> 23:49:17,600
in. Deci ar fi minime locale. Noi

31347
23:49:16,000 --> 23:49:19,600
vreau să aflu care este eroarea

31348
23:49:17,600 --> 23:49:21,920
o anumită configurație vine. Și apoi tu

31349
23:49:19,600 --> 23:49:24,080
au minimele tale globale. Noi

31350
23:49:21,920 --> 23:49:25,920
doresc să o minimizeze pe baza generalului

31351
23:49:24,080 --> 23:49:28,552
datele pe care le transmitem. Și cu

31352
23:49:25,920 --> 23:49:30,960
asta ne putem da seama global

31353
23:49:28,552 --> 23:49:33,040
cost minim. Vrem să le luăm pe toate

31354
23:49:30,960 --> 23:49:34,960
costurile minime locale ale fiecărei piese de

31355
23:49:33,040 --> 23:49:36,400
datele care vin și dau seama global

31356
23:49:34,960 --> 23:49:38,232
unul. Cum vom ajusta asta

31357
23:49:36,400 --> 23:49:40,080
model pentru a se potrivi cu toate datele? Nu vrem

31358
23:49:38,232 --> 23:49:42,640
să fie părtinitoare doar pe trei sau patru

31359
23:49:40,080 --> 23:49:45,120
liniile de date care vin. Vrem

31360
23:49:42,640 --> 23:49:46,872
un fel de extrapolare un răspuns general pentru

31361
23:49:45,120 --> 23:49:49,192
toate datele care vin. Dar aceasta de

31362
23:49:46,872 --> 23:49:51,600
bineînțeles că am menționat-o pe scurt despre

31363
23:49:49,192 --> 23:49:53,680
propagarea înapoi. Aici este cu adevărat

31364
23:49:51,600 --> 23:49:56,080
este util să ne antrenăm modelul.

31365
23:49:53,680 --> 23:49:58,000
Tehnica rețelei neuronale pentru a minimiza

31366
23:49:56,080 --> 23:49:59,440
funcția de cost ajută la îmbunătățirea

31367
23:49:58,000 --> 23:50:01,440
performanta retelei. Înapoi

31368
23:49:59,440 --> 23:50:03,832
propaga eroarea și actualizează

31369
23:50:01,440 --> 23:50:05,680
greutăți pentru a reduce eroarea. Deci ca si tine

31370
23:50:03,832 --> 23:50:08,320
pot vedea aici este o descriere foarte frumoasă a

31371
23:50:05,680 --> 23:50:10,872
o propagare înapoi. Avem al nostru

31372
23:50:08,320 --> 23:50:12,320
a prezis y ieșirea și apoi avem

31373
23:50:10,872 --> 23:50:13,920
deoarece este un set de antrenament pe care îl avem deja

31374
23:50:12,320 --> 23:50:16,480
stii raspunsul si raspunsul vine

31375
23:50:13,920 --> 23:50:18,080
spate și pe baza cazului pătratului

31376
23:50:16,480 --> 23:50:20,320
mijloacele a fost una dintre funcțiile pe care le-am căutat

31377
23:50:18,080 --> 23:50:22,160
la uh una dintre funcțiile de activare

31378
23:50:20,320 --> 23:50:24,720
pe baza funcției costului respectiv

31379
23:50:22,160 --> 23:50:26,640
functioneaza apoi in functie de ceea ce tu

31380
23:50:24,720 --> 23:50:28,160
alegeți metoda de propagare înapoi

31381
23:50:26,640 --> 23:50:29,920
și un număr dintre ei se vor schimba

31382
23:50:28,160 --> 23:50:31,600
greutățile va schimba greutatea

31383
23:50:29,920 --> 23:50:34,080
mergând la fiecare dintre acele noduri în

31384
23:50:31,600 --> 23:50:35,680
stratul ascuns și apoi bazat pe

31385
23:50:34,080 --> 23:50:37,040
eroare care este încă adusă înapoi

31386
23:50:35,680 --> 23:50:39,040
va schimba greutățile mergând la

31387
23:50:37,040 --> 23:50:41,512
următorul strat ascuns și apoi calculează

31388
23:50:39,040 --> 23:50:43,280
un nivel de eroare pe asta și trimite asta

31389
23:50:41,512 --> 23:50:44,800
înapoi. Și o să spui, bine,

31390
23:50:43,280 --> 23:50:46,720
dacă calculează eroarea în primul

31391
23:50:44,800 --> 23:50:48,872
strat ascuns și îl fixează, de ce ar fi

31392
23:50:46,720 --> 23:50:52,160
opri acolo? Ei bine, ține minte, noi nu

31393
23:50:48,872 --> 23:50:54,232
doresc să creeze o rețea neuronală părtinitoare.

31394
23:50:52,160 --> 23:50:56,160
Deci, facem doar mici ajustări

31395
23:50:54,232 --> 23:50:57,680
aceste greutăți. Nu facem un mare

31396
23:50:56,160 --> 23:50:59,920
ajustare care schimbă totul corect

31397
23:50:57,680 --> 23:51:00,872
din bataie. Deci, indiferent cât de departe

31398
23:50:59,920 --> 23:51:02,320
te duci, vei avea mereu o

31399
23:51:00,872 --> 23:51:03,512
mică eroare, și asta este încă

31400
23:51:02,320 --> 23:51:05,600
va continua să meargă până la capăt

31401
23:51:03,512 --> 23:51:08,872
sus straturile ascunse. Pentru moment,

31402
23:51:05,600 --> 23:51:11,192
se concentrează pe propagarea din spate

31403
23:51:08,872 --> 23:51:13,360
acea eroare și mișcând-o înapoi

31404
23:51:11,192 --> 23:51:15,120
rețeaua neuronală pentru a modifica greutățile

31405
23:51:13,360 --> 23:51:17,512
și ajută-l să-l programezi astfel încât să aibă

31406
23:51:15,120 --> 23:51:20,160
răspunsurile corecte. Până acum am fost

31407
23:51:17,512 --> 23:51:22,000
vorbind despre propagarea înainte neuronală

31408
23:51:20,160 --> 23:51:23,832
retelelor. Totul merge înainte, merge

31409
23:51:22,000 --> 23:51:25,280
de la stânga la dreapta. Uh, dar haideți să luăm o

31410
23:51:23,832 --> 23:51:27,600
mic ocol și să vedem care este

31411
23:51:25,280 --> 23:51:30,000
diferența dintre un feed forward neural

31412
23:51:27,600 --> 23:51:31,760
rețea și o rețea neuronală recurentă.

31413
23:51:30,000 --> 23:51:33,120
Acum, aceasta este în funcție, nu când

31414
23:51:31,760 --> 23:51:34,960
îl antrenăm folosind spatele

31415
23:51:33,120 --> 23:51:36,232
propagare. Deci, ai nou

31416
23:51:34,960 --> 23:51:37,600
informațiile care vin și doriți

31417
23:51:36,232 --> 23:51:39,192
primiți răspunsul și sunt câteva

31418
23:51:37,600 --> 23:51:40,800
diferite rețele acolo și ne dorim

31419
23:51:39,192 --> 23:51:42,720
să știm că avem un feed forward neural

31420
23:51:40,800 --> 23:51:45,440
rețea și avem un nou vocabular

31421
23:51:42,720 --> 23:51:47,512
termen de rețea neuronală recurentă. Un furaj

31422
23:51:45,440 --> 23:51:50,232
semnalele rețelei neuronale înainte călătoresc

31423
23:51:47,512 --> 23:51:52,320
o singură direcție de la intrare la ieșire. Nu

31424
23:51:50,232 --> 23:51:54,720
buclele de feedback iau în considerare numai

31425
23:51:52,320 --> 23:51:58,000
intrarea curentă nu poate memora anterior

31426
23:51:54,720 --> 23:51:59,360
intrări. Un exemplu de unul dintre aceste feeduri

31427
23:51:58,000 --> 23:52:00,960
rețele neuronale înainte. Și noi am

31428
23:51:59,360 --> 23:52:02,552
a acoperit un număr dintre ele, dar unul dintre

31429
23:52:00,960 --> 23:52:05,512
cele care au un mare punct culminant în zilele noastre

31430
23:52:02,552 --> 23:52:07,920
este CNN, un neuronal convoluțional

31431
23:52:05,512 --> 23:52:10,160
reţea. TensorFlow, cel scos de

31432
23:52:07,920 --> 23:52:12,800
Google este probabil cel mai cunoscut pentru ei

31433
23:52:10,160 --> 23:52:15,360
CNN, unde informațiile merg mai departe.

31434
23:52:12,800 --> 23:52:16,800
Mai întâi face o poză, o împarte

31435
23:52:15,360 --> 23:52:18,552
în afară, trece prin individ

31436
23:52:16,800 --> 23:52:20,480
pixeli pe imagine, deci captează a

31437
23:52:18,552 --> 23:52:22,720
lectură diferită, apoi calculează bazat

31438
23:52:20,480 --> 23:52:24,552
pe asta, intră într-un feed obișnuit

31439
23:52:22,720 --> 23:52:26,552
rețea neuronală înainte și apoi dă

31440
23:52:24,552 --> 23:52:28,720
ai o categorizare acolo. Acum,

31441
23:52:26,552 --> 23:52:30,960
nu acoperim astăzi CNN, dar noi

31442
23:52:28,720 --> 23:52:33,440
ai un videoclip pe care îl poți căuta

31443
23:52:30,960 --> 23:52:35,440
pe YouTube publicat de SimplyLearn, the

31444
23:52:33,440 --> 23:52:37,280
rețea neuronală convoluțională. minunat

31445
23:52:35,440 --> 23:52:38,640
tutorial. Verificați asta și învățați multe

31446
23:52:37,280 --> 23:52:40,080
mai multe despre neuronul convoluțional

31447
23:52:38,640 --> 23:52:43,280
rețea. Dar trebuie să știi asta

31448
23:52:40,080 --> 23:52:45,040
CNN este un neuronal de propagare înainte

31449
23:52:43,280 --> 23:52:46,320
numai în rețea. Deci se mișcă doar într-una

31450
23:52:45,040 --> 23:52:48,552
direcție. Deci vrem să ne uităm la un

31451
23:52:46,320 --> 23:52:51,120
rețea neuronală recurentă. Semnalele călătoresc

31452
23:52:48,552 --> 23:52:53,280
în ambele direcții făcându-l o buclă

31453
23:52:51,120 --> 23:52:55,360
rețea. Ia în considerare intrarea curentă

31454
23:52:53,280 --> 23:52:57,120
împreună cu intrările primite anterioare

31455
23:52:55,360 --> 23:52:59,600
pentru generarea ieșirii unui strat.

31456
23:52:57,120 --> 23:53:01,512
Are capacitatea de a memora datele din trecut

31457
23:52:59,600 --> 23:53:03,920
datorită memoriei sale interne. Și poți

31458
23:53:01,512 --> 23:53:06,080
vezi că au o imagine frumoasă aici. Noi

31459
23:53:03,920 --> 23:53:07,760
au contribuția noastră și dintr-un motiv oarecare

31460
23:53:06,080 --> 23:53:10,080
ei fac întotdeauna neuronul recurent

31461
23:53:07,760 --> 23:53:11,512
reţea um invers de jos în sus în

31462
23:53:10,080 --> 23:53:13,512
imaginile. Este un fel de standard

31463
23:53:11,512 --> 23:53:16,080
deși nu sunt sigur de ce. X-ul tău merge

31464
23:53:13,512 --> 23:53:17,920
în stratul tău ascuns și în stratul tău ascuns

31465
23:53:16,080 --> 23:53:20,320
stratificați răspunsul pentru o parte a răspunsului

31466
23:53:17,920 --> 23:53:22,320
din care generează feed-back în

31467
23:53:20,320 --> 23:53:24,400
stratul ascuns. Deci acum ai un

31468
23:53:22,320 --> 23:53:25,832
introducerea atât a lui X, cât și a unei părți din ascuns

31469
23:53:24,400 --> 23:53:28,232
strat și apoi care se alimentează în dvs

31470
23:53:25,832 --> 23:53:30,080
ieșire. Acum dacă ne întoarcem la înainte

31471
23:53:28,232 --> 23:53:32,320
Lasă-mă să mă întorc cu un tobogan și suntem

31472
23:53:30,080 --> 23:53:34,872
uitându-ne la propagarea noastră înainte

31473
23:53:32,320 --> 23:53:37,120
rețea. Unul dintre trucurile pe care le poți face

31474
23:53:34,872 --> 23:53:39,192
utilizați doar o rețea de propagare înainte

31475
23:53:37,120 --> 23:53:41,360
este dacă te afli într-un timp ce ei numesc

31476
23:53:39,192 --> 23:53:43,832
secvență, acesta este un termen bun

31477
23:53:41,360 --> 23:53:45,760
amintiți-vă sau o serie de timp care înseamnă asta

31478
23:53:43,832 --> 23:53:48,800
sunt date secvențiale. Fiecare termen vine

31479
23:53:45,760 --> 23:53:51,040
după cealaltă. Poți păcăli asta prin

31480
23:53:48,800 --> 23:53:53,280
crearea nodurilor de intrare ca și în cazul

31481
23:53:51,040 --> 23:53:55,680
istorie. Deci, dacă știi că ai

31482
23:53:53,280 --> 23:53:57,680
valorile unu, cinci și șapte intrând în și

31483
23:53:55,680 --> 23:53:59,600
știi care este rezultatul de la unul

31484
23:53:57,680 --> 23:54:02,080
care sunt acele ieșiri, vă puteți extinde

31485
23:53:59,600 --> 23:54:03,440
intrarea să includă intrarea istoricului.

31486
23:54:02,080 --> 23:54:05,360
Acesta este unul dintre modalitățile de a păcăli a

31487
23:54:03,440 --> 23:54:06,960
rețea de propagare înainte în căutarea

31488
23:54:05,360 --> 23:54:09,280
la asta. Dar când faci cu a

31489
23:54:06,960 --> 23:54:11,280
rețea neuronală recurentă, lăsați

31490
23:54:09,280 --> 23:54:13,360
stratul ascuns face asta pentru tine. Se trimite

31491
23:54:11,280 --> 23:54:14,720
acele date și le reprocesează

31492
23:54:13,360 --> 23:54:16,640
în sine. Care sunt unele dintre

31493
23:54:14,720 --> 23:54:19,192
aplicații neuronale recurente

31494
23:54:16,640 --> 23:54:21,280
retea? RNN poate fi folosit pentru

31495
23:54:19,192 --> 23:54:23,120
analiza sentimentelor și extragerea textului.

31496
23:54:21,280 --> 23:54:24,720
E bine să te trezești dimineața devreme

31497
23:54:23,120 --> 23:54:26,232
pentru sănătate și este un lucru pozitiv

31498
23:54:24,720 --> 23:54:27,360
sentiment. Unul dintre te prinde cu adevărat

31499
23:54:26,232 --> 23:54:29,760
vrei să te uiți la asta când te uiți

31500
23:54:27,360 --> 23:54:32,232
la limba este că aș putea schimba

31501
23:54:29,760 --> 23:54:33,512
asta în jur și neagă total

31502
23:54:32,232 --> 23:54:35,280
sensul a ceea ce fac. Deci, nu

31503
23:54:33,512 --> 23:54:37,192
mai fi pozitiv. Deci, când ești

31504
23:54:35,280 --> 23:54:39,512
privind o propoziție, cunoscând ordinea

31505
23:54:37,192 --> 23:54:41,040
a cuvintelor este la fel de important ca și

31506
23:54:39,512 --> 23:54:42,800
sensul cuvintelor. Nu poți pur și simplu

31507
23:54:41,040 --> 23:54:45,120
numără câte cuvinte bune sunt

31508
23:54:42,800 --> 23:54:46,640
versus cuvintele rele pentru a deveni pozitiv

31509
23:54:45,120 --> 23:54:48,320
sentiment. Știi, trebuie să știi ce

31510
23:54:46,640 --> 23:54:50,720
ei se adresează. Și sunt multe

31511
23:54:48,320 --> 23:54:52,552
alte utilizări diferite. Uh, copiii sunt

31512
23:54:50,720 --> 23:54:54,552
jucând fotbal sau fotbal, așa cum îi spunem noi

31513
23:54:52,552 --> 23:54:56,872
în SUA. RN vă poate ajuta subtitrarea an

31514
23:54:54,552 --> 23:54:58,800
imagine. Deci, pe baza informațiilor anterioare

31515
23:54:56,872 --> 23:55:01,680
intrând, îl realimentează înapoi în și

31516
23:54:58,800 --> 23:55:03,440
ai un set de imagini. Și apoi timpul

31517
23:55:01,680 --> 23:55:05,832
probleme de serie precum prezicerea

31518
23:55:03,440 --> 23:55:07,760
prețurile stocurilor într-o lună sau trimestru

31519
23:55:05,832 --> 23:55:10,000
sau vânzarea produsului poate fi rezolvată folosind

31520
23:55:07,760 --> 23:55:11,920
un RNN. Și asta este foarte bun

31521
23:55:10,000 --> 23:55:13,600
exemplu. Ai oricare dintre stocurile tale

31522
23:55:11,920 --> 23:55:15,040
făceau la începutul acestei luni va avea

31523
23:55:13,600 --> 23:55:17,120
un efect uriaș al a ceea ce fac

31524
23:55:15,040 --> 23:55:19,512
azi dacă investești. Deci având un

31525
23:55:17,120 --> 23:55:21,280
Modelul RNN, o rețea neuronală recurentă

31526
23:55:19,512 --> 23:55:23,760
hrănind în sine ceea ce se întâmpla

31527
23:55:21,280 --> 23:55:25,920
anterior îi permite să preia acel model

31528
23:55:23,760 --> 23:55:28,400
și program în toată acea serie fără

31529
23:55:25,920 --> 23:55:30,080
trebuind sa puna intreaga o luna la a

31530
23:55:28,400 --> 23:55:31,600
timpul datelor. Nu poți pune decât unul

31531
23:55:30,080 --> 23:55:33,040
zi la un moment dat. Dar dacă le ții înăuntru

31532
23:55:31,600 --> 23:55:34,400
comanda, se va uita în urmă și va spune: „Oh,

31533
23:55:33,040 --> 23:55:35,920
asta din cauza a ceea ce s-a întâmplat ieri,

31534
23:55:34,400 --> 23:55:37,120
Am nevoie de niște informații din asta și

31535
23:55:35,920 --> 23:55:39,120
Voi folosi asta ca să ajut să prezic

31536
23:55:37,120 --> 23:55:40,800
azi.” Și așa mai departe și așa mai departe. Suntem

31537
23:55:39,120 --> 23:55:43,040
ne vom întoarce la activarea noastră

31538
23:55:40,800 --> 23:55:44,480
funcții. Ține minte că ți-am spus ReLU

31539
23:55:43,040 --> 23:55:46,480
a fost una dintre cele mai comune funcții

31540
23:55:44,480 --> 23:55:49,600
folosit. Hai să mai vorbim puțin

31541
23:55:46,480 --> 23:55:51,280
despre ReLU și, de asemenea, softmax. Softmax este

31542
23:55:49,600 --> 23:55:54,000
o funcţie de activare care generează

31543
23:55:51,280 --> 23:55:56,400
ieșirea între zero și unu. Ea

31544
23:55:54,000 --> 23:55:58,320
împarte fiecare ieșire astfel încât totalul

31545
23:55:56,400 --> 23:56:00,400
suma ieșirilor este egală cu unu. Ea

31546
23:55:58,320 --> 23:56:03,512
este adesea folosit în straturile de ieșire.

31547
23:56:00,400 --> 23:56:05,760
Softmax L al lui N este egal cu E cu L cu N

31548
23:56:03,512 --> 23:56:07,832
peste valoarea absolută a lui E la L.

31549
23:56:05,760 --> 23:56:09,832
Deci, ce înseamnă această funcție? Adică

31550
23:56:07,832 --> 23:56:12,080
ce se intampla de fapt aici? Deci noi

31551
23:56:09,832 --> 23:56:13,920
au nodurile noastre de ieșire și ieșirea noastră

31552
23:56:12,080 --> 23:56:17,360
nodurile ne oferă uh să spunem că

31553
23:56:13,920 --> 23:56:19,440
ne-a dat 1.2.9 și punctul4. Ca om

31554
23:56:17,360 --> 23:56:21,760
fiind mă uit la asta și spun bine cel

31555
23:56:19,440 --> 23:56:23,440
cea mai mare valoare este 1,2. Deci orice

31556
23:56:21,760 --> 23:56:24,960
categorie, adică dacă ai trei

31557
23:56:23,440 --> 23:56:27,360
diferite categorii poate că nu ești

31558
23:56:24,960 --> 23:56:29,512
doar fac dacă este o pisică sau este un câine

31559
23:56:27,360 --> 23:56:31,600
sau u oh să spunem că este o vaca. Noi am avut

31560
23:56:29,512 --> 23:56:33,192
pisici și câini mai devreme. De ce pisicile și

31561
23:56:31,600 --> 23:56:34,800
câinii stau cu o vaca. Eu nu

31562
23:56:33,192 --> 23:56:38,160
stiu. Dar avem o valoare și s-ar putea

31563
23:56:34,800 --> 23:56:40,232
să spunem 1,2 2 este o pisică, 0,9 este câinele și

31564
23:56:38,160 --> 23:56:41,760
punctul4 este o vacă. Din anumite motive, asta

31565
23:56:40,232 --> 23:56:43,360
crede că există șanse să fie

31566
23:56:41,760 --> 23:56:44,872
oricare dintre aceste trei articole și asta este

31567
23:56:43,360 --> 23:56:47,040
cum iese din stratul de ieșire.

31568
23:56:44,872 --> 23:56:48,480
Ei bine, ca om, pot să mă uit la 1.2 și

31569
23:56:47,040 --> 23:56:50,320
spune că asta este cu siguranță. Este

31570
23:56:48,480 --> 23:56:51,680
cu siguranță o pisică sau orice ar fi. Uh,

31571
23:56:50,320 --> 23:56:53,360
poate că se uită la diferite tipuri de

31572
23:56:51,680 --> 23:56:55,360
mașinile ar putea fi mai bune, indiferent dacă este vorba de un

31573
23:56:53,360 --> 23:56:57,512
mașină, camion sau motocicletă. Poate

31574
23:56:55,360 --> 23:56:59,360
asta ar fi un exemplu mai bun. Ei bine, de la a

31575
23:56:57,512 --> 23:57:00,800
din punctul de vedere al computerului, acesta ar putea fi a

31576
23:56:59,360 --> 23:57:02,960
puțin confuz pentru că sunt doar

31577
23:57:00,800 --> 23:57:06,000
numere care ne flutură cu mâna. Și așa cu

31578
23:57:02,960 --> 23:57:08,480
soft max, vrem ca toate acele numere

31579
23:57:06,000 --> 23:57:10,000
aduna întotdeauna la unu. Deci când adaug

31580
23:57:08,480 --> 23:57:12,000
trei numere împreună, vreau finala

31581
23:57:10,000 --> 23:57:13,920
ieșirea să fie una acolo. Și așa este

31582
23:57:12,000 --> 23:57:15,680
trece prin această formulă se schimbă fiecare

31583
23:57:13,920 --> 23:57:18,232
dintre aceste numere. În acest caz, acesta

31584
23:57:15,680 --> 23:57:20,960
le schimbă în 46.34

31585
23:57:18,232 --> 23:57:22,552
și 2. Toate însumează unul. Şi

31586
23:57:20,960 --> 23:57:24,960
este mult mai ușor de înregistrat pentru că

31587
23:57:22,552 --> 23:57:26,400
este foarte stabilit. Este o ieșire setată. Este

31588
23:57:24,960 --> 23:57:27,920
nu va fi niciodată mai mult de unul. Este

31589
23:57:26,400 --> 23:57:29,280
nu va fi niciodată mai mică de zero. Și așa

31590
23:57:27,920 --> 23:57:30,480
puteți vedea aici că probabil că există o

31591
23:57:29,280 --> 23:57:32,400
șanse destul de mari să fie primul

31592
23:57:30,480 --> 23:57:34,480
unul. Deci, ești ca ființă umană, avem

31593
23:57:32,400 --> 23:57:37,120
nici o problema sa stii asta. Dar această ieșire

31594
23:57:34,480 --> 23:57:39,832
apoi poate intra și să spună o altă intrare.

31595
23:57:37,120 --> 23:57:41,600
Deci ar putea fi o mașină automatizată

31596
23:57:39,832 --> 23:57:43,680
ridicând imagini și scrie acea imagine

31597
23:57:41,600 --> 23:57:45,192
în fața noastră este probabil un camion mare.

31598
23:57:43,680 --> 23:57:46,872
Ar trebui să ne descurcăm cu asta ca și cum ar fi mare

31599
23:57:45,192 --> 23:57:48,720
camion. Probabil că nu este o motocicletă.

31600
23:57:46,872 --> 23:57:50,720
Hm sau oricare ar fi acele categorii.

31601
23:57:48,720 --> 23:57:52,400
Aceasta este partea softmax. Dar acum

31602
23:57:50,720 --> 23:57:54,720
avem ru. Ei bine, unde este

31603
23:57:52,400 --> 23:57:57,120
ru vine de la? Ei bine, ru este ceea ce este

31604
23:57:54,720 --> 23:57:59,512
generând 1.2 și 0.9 și

31605
23:57:57,120 --> 23:58:03,120
punctul4. Și așa dacă vă amintiți relu-ul nostru

31606
23:57:59,512 --> 23:58:05,040
reprezintă unitate liniară rectificată și este

31607
23:58:03,120 --> 23:58:06,640
cea mai utilizată activare

31608
23:58:05,040 --> 23:58:08,400
funcția. Ne-am uitat la un număr de

31609
23:58:06,640 --> 23:58:10,960
diferite funcții de activare inclusiv

31610
23:58:08,400 --> 23:58:12,720
tangenta h functia pas. ține minte eu

31611
23:58:10,960 --> 23:58:13,920
a spus că funcția pas este într-adevăr folosită dacă

31612
23:58:12,720 --> 23:58:15,280
asta este rezultatul tău real

31613
23:58:13,920 --> 23:58:17,440
pentru că atunci știi că este zero sau

31614
23:58:15,280 --> 23:58:19,280
unul. Dar relu daca ai asta ca

31615
23:58:17,440 --> 23:58:21,360
ieșirea dvs. acum aveți o discrepanță

31616
23:58:19,280 --> 23:58:23,192
acolo. Și dacă asta se întâmplă

31617
23:58:21,360 --> 23:58:25,192
altă rețea neuronală sau alta

31618
23:58:23,192 --> 23:58:26,960
procesul care are această discrepanță este

31619
23:58:25,192 --> 23:58:29,512
cu adevărat important. și dă o ieșire

31620
23:58:26,960 --> 23:58:31,832
de x dacă x este pozitiv și zero

31621
23:58:29,512 --> 23:58:33,680
altfel. Deci, spune valoarea mea x este

31622
23:58:31,832 --> 23:58:36,640
va fi undeva între zero sau

31623
23:58:33,680 --> 23:58:38,800
unul și apoi uh, de obicei, dacă nu este

31624
23:58:36,640 --> 23:58:40,552
într-adevăr nesigur rezultatul este de obicei a

31625
23:58:38,800 --> 23:58:41,920
unul sau zero și atunci ai asta

31626
23:58:40,552 --> 23:58:43,600
mică bucată de incertitudine acolo că

31627
23:58:41,920 --> 23:58:45,120
puteți trimite înainte către altă rețea

31628
23:58:43,600 --> 23:58:47,040
sau te poți uita la pentru a ști că există

31629
23:58:45,120 --> 23:58:49,360
incertitudinea implicată și este adesea folosită

31630
23:58:47,040 --> 23:58:50,960
în straturile ascunse. Asta este

31631
23:58:49,360 --> 23:58:53,512
ieșind din straturile ascunse în

31632
23:58:50,960 --> 23:58:56,080
stratul de ieșire de obicei sau după cum ne referim

31633
23:58:53,512 --> 23:58:58,552
rețeaua neuronală de convoluție uh

31634
23:58:56,080 --> 23:59:01,920
CNN ar trebui să mergi la alt videoclip

31635
23:58:58,552 --> 23:59:05,120
revizuirea RLU este cel mai frecvent utilizat

31636
23:59:01,920 --> 23:59:06,640
pentru partea convoluțională a acelei rețele

31637
23:59:05,120 --> 23:59:08,160
are o grămadă de bucăți mici care sunt

31638
23:59:06,640 --> 23:59:09,760
foarte simplificat privind toate

31639
23:59:08,160 --> 23:59:12,320
imagini diferite sau secțiuni diferite

31640
23:59:09,760 --> 23:59:13,760
a hărții și RLU funcționează foarte bine

31641
23:59:12,320 --> 23:59:15,920
pentru asta cum am spus, mai sunt altele

31642
23:59:13,760 --> 23:59:17,280
formulele folosite dar că acesta este cel mai mult

31643
23:59:15,920 --> 23:59:18,960
una comună și veți vedea că în

31644
23:59:17,280 --> 23:59:20,640
straturi ascunse mergând poate între unul

31645
23:59:18,960 --> 23:59:23,680
stratul și stratul următor. Deci doar un

31646
23:59:20,640 --> 23:59:25,600
recapitulare rapidă, avem soft max, care

31647
23:59:23,680 --> 23:59:27,680
înseamnă că dacă ai uh numeroase

31648
23:59:25,600 --> 23:59:29,600
categorii, doar una dintre ele va merge

31649
23:59:27,680 --> 23:59:31,192
fii ales, dar vrei și să ai

31650
23:59:29,600 --> 23:59:33,280
ceva valoare atașată, cât de bine

31651
23:59:31,192 --> 23:59:35,280
l-ai ales și l-ai pus între 01.

31652
23:59:33,280 --> 23:59:37,120
Deci este foarte standardizat. Deci avem

31653
23:59:35,280 --> 23:59:38,552
softul nostru max. Ne-am uitat la asta. Să

31654
23:59:37,120 --> 23:59:39,920
întoarce-te unul. Ne-am uitat la asta aici

31655
23:59:38,552 --> 23:59:41,832
unde transformă numerele. Şi

31656
23:59:39,920 --> 23:59:44,232
atunci avem funcția noastră ReLU care

31657
23:59:41,832 --> 23:59:46,232
preia informațiile din însumare

31658
23:59:44,232 --> 23:59:48,552
și îl pune între zero și unu

31659
23:59:46,232 --> 23:59:52,080
unde este fie clar zero, fie

31660
23:59:48,552 --> 23:59:54,232
în funcție de cât de încrezător este modelul nostru,

31661
23:59:52,080 --> 23:59:57,120
va merge între valoarea zero și unu.

31662
23:59:54,232 --> 23:59:58,160
Ce sunt hiperparametrii? Oh, acesta este un

31663
23:59:57,120 --> 24:00:00,080
grozava intrebare de interviu.

31664
23:59:58,160 --> 24:00:01,920
Hiperparametri. Când faci

31665
24:00:00,080 --> 24:00:03,512
rețele neuronale, asta ești

31666
24:00:01,920 --> 24:00:05,280
jucând cu de cele mai multe ori o dată

31667
24:00:03,512 --> 24:00:07,192
ați format datele

31668
24:00:05,280 --> 24:00:09,440
corect. Un hiperparametru este a

31669
24:00:07,192 --> 24:00:12,080
parametrul a cărui valoare este setată înainte de

31670
24:00:09,440 --> 24:00:14,000
începe procesul de învățare. Determină cum

31671
24:00:12,080 --> 24:00:15,760
se antreneaza o retea si structura

31672
24:00:14,000 --> 24:00:17,360
a rețelei. Aceasta include lucruri

31673
24:00:15,760 --> 24:00:18,800
cum ar fi numărul de unități ascunse, cum

31674
24:00:17,360 --> 24:00:20,720
multe straturi ascunse vei avea

31675
24:00:18,800 --> 24:00:23,360
și câte noduri în fiecare strat.

31676
24:00:20,720 --> 24:00:25,280
Rata de învățare. Rata de învățare este de obicei

31677
24:00:23,360 --> 24:00:26,400
înmulțit odată ce ți-ai dat seama că

31678
24:00:25,280 --> 24:00:28,080
eroare și cât de mult doriți să schimbați

31679
24:00:26,400 --> 24:00:29,760
greutățile. Am vorbit despre sau eu

31680
24:00:28,080 --> 24:00:31,512
am menționat-o mai devreme doar pe scurt. tu

31681
24:00:29,760 --> 24:00:32,800
nu vreau să fac doar o schimbare uriașă

31682
24:00:31,512 --> 24:00:34,160
altfel vei avea un părtinitor

31683
24:00:32,800 --> 24:00:35,832
model. Deci iei doar puțin

31684
24:00:34,160 --> 24:00:37,280
schimbări progresive și asta este ceea ce

31685
24:00:35,832 --> 24:00:39,760
rata de învățare este cea mică

31686
24:00:37,280 --> 24:00:41,280
modificări treptate. Epopee, câte

31687
24:00:39,760 --> 24:00:43,360
vremuri vei trece prin toate

31688
24:00:41,280 --> 24:00:45,440
datele din setul de antrenament? Deci unul

31689
24:00:43,360 --> 24:00:46,960
epic este o călătorie prin toate datele.

31690
24:00:45,440 --> 24:00:48,552
Și sunt multe alte lucruri

31691
24:00:46,960 --> 24:00:50,960
in functie de modelul in care lucrezi

31692
24:00:48,552 --> 24:00:53,920
cu și ce script de programare ești

31693
24:00:50,960 --> 24:00:55,760
lucrând cu. La fel ca sklearnul Python

31694
24:00:53,920 --> 24:00:58,232
pachetul îl va avea ușor diferit

31695
24:00:55,760 --> 24:00:59,280
decât să spunem pachetul TensorFlow de la Google

31696
24:00:58,232 --> 24:01:01,680
care va fi puțin diferit

31697
24:00:59,280 --> 24:01:03,360
decât pachetul de învățare automată Spark.

31698
24:01:01,680 --> 24:01:05,360
Deci acestea sunt doar câteva exemple ale

31699
24:01:03,360 --> 24:01:07,440
hiperparametrii. Și așa vezi aici

31700
24:01:05,360 --> 24:01:09,832
avem o imagine frumoasă a datelor noastre care vin

31701
24:01:07,440 --> 24:01:11,440
și ne antrenăm modelul. Apoi facem o

31702
24:01:09,832 --> 24:01:13,280
comparație pentru a vedea cât de bun este modelul nostru.

31703
24:01:11,440 --> 24:01:14,800
Și apoi ne întoarcem și spunem: „Hei,

31704
24:01:13,280 --> 24:01:17,360
acest model este destul de bun, dar este

31705
24:01:14,800 --> 24:01:19,120
părtinitoare”. Atunci îl trimitem înapoi și noi

31706
24:01:17,360 --> 24:01:20,960
ne schimbăm hiperparametrii pentru a vedea dacă noi

31707
24:01:19,120 --> 24:01:22,480
putem obține un model imparțial sau putem avea

31708
24:01:20,960 --> 24:01:24,640
o predicție mai bună pe ea care se potrivește

31709
24:01:22,480 --> 24:01:27,192
datele noastre mai aproape. Ce se va întâmpla dacă

31710
24:01:24,640 --> 24:01:29,760
rata de învățare este setată prea scăzută sau prea

31711
24:01:27,192 --> 24:01:30,800
mare? Avem câteva grafice frumoase aici.

31712
24:01:29,760 --> 24:01:32,320
Avem unul aici. Se spune a

31713
24:01:30,800 --> 24:01:34,000
rata de învățare setată prea scăzută. Și poți

31714
24:01:32,320 --> 24:01:36,160
vezi că încetează să coboare

31715
24:01:34,000 --> 24:01:38,080
curba. Și în dreapta poți vedea

31716
24:01:36,160 --> 24:01:39,832
o rată de învățare stabilită prea mare. Este doar

31717
24:01:38,080 --> 24:01:41,680
sărind înainte și înapoi. Când dvs

31718
24:01:39,832 --> 24:01:43,192
rata de învățare este prea mică, asta este ceea ce noi

31719
24:01:41,680 --> 24:01:45,280
studiat acum două diapozitive. Asta e ceea ce

31720
24:01:43,192 --> 24:01:47,760
rata de învățare a fost. Antrenamentul modelului

31721
24:01:45,280 --> 24:01:50,160
va progresa foarte încet așa cum suntem noi

31722
24:01:47,760 --> 24:01:51,920
făcând actualizări foarte mici ale greutăților.

31723
24:01:50,160 --> 24:01:54,080
Vom primi multe actualizări înainte de a ajunge

31724
24:01:51,920 --> 24:01:56,000
punctul minim. Așa că tocmai am menționat

31725
24:01:54,080 --> 24:01:57,360
epic parcurgând toate datele. tu

31726
24:01:56,000 --> 24:01:59,360
ar putea fi nevoit să treacă prin toate datele a

31727
24:01:57,360 --> 24:02:01,680
de mii de ori în loc de 500 de ori pt

31728
24:01:59,360 --> 24:02:04,480
ea să se antreneze. Rata de învățare prea mare

31729
24:02:01,680 --> 24:02:06,552
provoacă un comportament divergent nedorit la

31730
24:02:04,480 --> 24:02:08,400
funcția de pierdere din cauza actualizărilor drastice

31731
24:02:06,552 --> 24:02:10,552
si greutati. Uneori poate eșua

31732
24:02:08,400 --> 24:02:12,320
converg sau chiar diverge. Deci dacă ai

31733
24:02:10,552 --> 24:02:14,000
rata de învățare a fost stabilită prea mare și este

31734
24:02:12,320 --> 24:02:16,320
antrenează-te prea repede, poate vei obține

31735
24:02:14,000 --> 24:02:18,080
norocos și se antrenează după o alergare epică,

31736
24:02:16,320 --> 24:02:19,280
dar de multe ori s-ar putea să nu fie niciodată

31737
24:02:18,080 --> 24:02:21,120
capabil să se antreneze pentru că greutățile sunt

31738
24:02:19,280 --> 24:02:22,872
schimbându-se prea repede. Ei se întorc înapoi

31739
24:02:21,120 --> 24:02:25,600
și înainte prea ușor. Și vezi jos

31740
24:02:22,872 --> 24:02:29,360
aici am introdus doi termeni noi

31741
24:02:25,600 --> 24:02:32,000
converg si diverg. Converge înseamnă

31742
24:02:29,360 --> 24:02:34,640
că modelul nostru a ajuns într-un punct în care

31743
24:02:32,000 --> 24:02:36,400
este capabil să dea un răspuns destul de bun

31744
24:02:34,640 --> 24:02:38,232
pentru toate datele pe care le-am introdus. Toate acestea

31745
24:02:36,400 --> 24:02:40,640
greutățile s-au ajustat și este redus la minimum

31746
24:02:38,232 --> 24:02:42,872
eroarea. Diverge înseamnă că datele

31747
24:02:40,640 --> 24:02:45,040
este atât de haotic încât nu se poate descurca niciodată

31748
24:02:42,872 --> 24:02:46,872
să se antreneze la acele date. Datele sunt

31749
24:02:45,040 --> 24:02:48,800
pur și simplu prea haotic pentru a se antrena. Deci noi

31750
24:02:46,872 --> 24:02:50,872
au două cuvinte noi acolo. Converge și

31751
24:02:48,800 --> 24:02:53,920
diverge sunt importante de știut. De asemenea, ce

31752
24:02:50,872 --> 24:02:56,160
este abandonul și normalizarea loturilor?

31753
24:02:53,920 --> 24:02:58,160
Abandonul este o tehnică de abandon

31754
24:02:56,160 --> 24:03:00,800
unități ascunse și vizibile ale unei rețele

31755
24:02:58,160 --> 24:03:02,480
aleatoriu pentru a preveni supraadaptarea datelor.

31756
24:03:00,800 --> 24:03:04,720
Acesta dublează numărul de iterații

31757
24:03:02,480 --> 24:03:06,480
necesare pentru convergerea rețelei. Deci aici

31758
24:03:04,720 --> 24:03:08,872
avem rețeaua noastră neuronală standard și

31759
24:03:06,480 --> 24:03:10,080
apoi după aplicarea abandonului. Acum asta

31760
24:03:08,872 --> 24:03:12,000
nu înseamnă că ștergem de fapt

31761
24:03:10,080 --> 24:03:13,760
nod. Nodul este încă acolo și noi suntem

31762
24:03:12,000 --> 24:03:16,160
încă o să folosească acel nod. Ce

31763
24:03:13,760 --> 24:03:18,552
înseamnă că vom merge doar la muncă

31764
24:03:16,160 --> 24:03:20,320
cu câteva dintre noduri. Hm, multe

31765
24:03:18,552 --> 24:03:23,360
ori cred că cea mai comună este corectă

31766
24:03:20,320 --> 24:03:25,760
acum folosit este de 20%. Uh, așa că vei renunța

31767
24:03:23,360 --> 24:03:27,760
20% din noduri atunci când faci ta

31768
24:03:25,760 --> 24:03:29,600
de antrenament, vă propagați invers

31769
24:03:27,760 --> 24:03:31,192
date și apoi veți alege la întâmplare

31770
24:03:29,600 --> 24:03:32,872
alte 20 de noduri data viitoare când mergi

31771
24:03:31,192 --> 24:03:34,480
printr-un antrenament epic de date. Deci fiecare

31772
24:03:32,872 --> 24:03:36,552
când treci printr-o epopee, o vei face

31773
24:03:34,480 --> 24:03:39,360
alege la întâmplare 20 dintre aceste noduri să nu le facă

31774
24:03:36,552 --> 24:03:41,280
să nu te încurci. Și asta permite

31775
24:03:39,360 --> 24:03:43,192
mai puțină supraadaptare a datelor. Deci prin

31776
24:03:41,280 --> 24:03:44,320
făcând asta la întâmplare, creezi un eu

31777
24:03:43,192 --> 24:03:45,512
Bănuiesc că doar trage niște noduri

31778
24:03:44,320 --> 24:03:46,872
plecă într-o parte și spune că vom merge

31779
24:03:45,512 --> 24:03:49,512
gestionăm datele mai târziu, ca să nu facem noi

31780
24:03:46,872 --> 24:03:51,440
supraadaptare. Normalizarea lotului este a

31781
24:03:49,512 --> 24:03:54,080
tehnică de îmbunătăţire a performanţei şi

31782
24:03:51,440 --> 24:03:56,000
stabilitatea rețelei neuronale. Ideea este

31783
24:03:54,080 --> 24:03:57,832
pentru a normaliza intrările în fiecare strat

31784
24:03:56,000 --> 24:03:59,600
astfel încât să aibă producţie medie şi

31785
24:03:57,832 --> 24:04:02,400
activarea zero și standard

31786
24:03:59,600 --> 24:04:04,480
abaterea unuia. Această întrebare acoperă a

31787
24:04:02,400 --> 24:04:06,320
multe lucruri diferite, ceea ce este grozav.

31788
24:04:04,480 --> 24:04:07,760
Este o întrebare grozavă de interviu

31789
24:04:06,320 --> 24:04:10,160
pentru că trage înăuntru că trebuie

31790
24:04:07,760 --> 24:04:12,480
înțelegeți care este valoarea medie. Deci a

31791
24:04:10,160 --> 24:04:15,120
activare medie a ieșirii de zero care

31792
24:04:12,480 --> 24:04:16,640
înseamnă că activarea noastră medie este zero. Deci

31793
24:04:15,120 --> 24:04:19,440
când o normalizi amintește-ți de obicei

31794
24:04:16,640 --> 24:04:20,872
mergem între minus1 și unu la a

31795
24:04:19,440 --> 24:04:22,552
multe dintre acestea. Este un foarte standard

31796
24:04:20,872 --> 24:04:24,480
setare. Deci trebuie să fii foarte conștient de asta

31797
24:04:22,552 --> 24:04:25,832
aceasta este activarea medie a ieșirii

31798
24:04:24,480 --> 24:04:28,160
zero. Și apoi avem standardul nostru

31799
24:04:25,832 --> 24:04:30,552
abaterea unuia. Deci vrem să ne păstrăm

31800
24:04:28,160 --> 24:04:32,960
eroare până la o singură valoare. The

31801
24:04:30,552 --> 24:04:34,800
beneficiile acestui lucru a face un lot

31802
24:04:32,960 --> 24:04:37,760
normalizarea este aceasta

31803
24:04:34,800 --> 24:04:40,400
regularizare. Se antrenează mai repede, mai sus

31804
24:04:37,760 --> 24:04:42,320
ratele de învățare și greutățile sunt mai ușor de realizat

31805
24:04:40,400 --> 24:04:44,720
inițializați. Care este diferența

31806
24:04:42,320 --> 24:04:47,360
între coborârea gradientului lotului și

31807
24:04:44,720 --> 24:04:49,192
coborâre a gradientului stocastic? Lot

31808
24:04:47,360 --> 24:04:51,280
coborâre în gradient. Gradient de lot

31809
24:04:49,192 --> 24:04:53,440
calculează gradientul folosind întregul

31810
24:04:51,280 --> 24:04:55,440
set de date. Este nevoie de timp pentru a converge

31811
24:04:53,440 --> 24:04:57,680
deoarece volumul de date este uriaş şi

31812
24:04:55,440 --> 24:04:59,600
greutățile se actualizează lent. Deci poți să te uiți

31813
24:04:57,680 --> 24:05:01,832
la loturi. De multe ori dacă ești

31814
24:04:59,600 --> 24:05:03,680
folosind date mari, grupați datele în loturi, dar

31815
24:05:01,832 --> 24:05:05,512
încă treci printr-o epopee plină. tu

31816
24:05:03,680 --> 24:05:07,040
mai parcurge toate datele de acolo.

31817
24:05:05,512 --> 24:05:08,640
Deci coborârea gradientului bash înseamnă că ești

31818
24:05:07,040 --> 24:05:11,120
urmând să-l folosească pentru a se potrivi cu toate datele și

31819
24:05:08,640 --> 24:05:13,440
caută o convergență acolo. Stochastic

31820
24:05:11,120 --> 24:05:15,440
coborâre în gradient. Gradient stocastic

31821
24:05:13,440 --> 24:05:17,512
calculează gradientul folosind un singur

31822
24:05:15,440 --> 24:05:19,512
probă. Converge mult mai repede decât

31823
24:05:17,512 --> 24:05:21,680
gradient de lot deoarece actualizează greutatea

31824
24:05:19,512 --> 24:05:23,512
mai frecvent. Explicați supraadaptarea și

31825
24:05:21,680 --> 24:05:25,512
underfitting și modul de combatere a acestora.

31826
24:05:23,512 --> 24:05:27,680
Supraajustarea are loc atunci când un model învață

31827
24:05:25,512 --> 24:05:29,440
detaliile și zgomotul din antrenament

31828
24:05:27,680 --> 24:05:31,192
date în măsura în care acestea sunt negative

31829
24:05:29,440 --> 24:05:33,120
influenţează execuţia modelului asupra

31830
24:05:31,192 --> 24:05:35,280
noile informatii. Este mai probabil

31831
24:05:33,120 --> 24:05:37,360
să apară cu modele neliniare care au

31832
24:05:35,280 --> 24:05:39,680
mai multă flexibilitate atunci când învățați o țintă

31833
24:05:37,360 --> 24:05:42,640
funcția. Un exemplu în acest sens ar fi um

31834
24:05:39,680 --> 24:05:45,512
dacă te uiți la mașini și camioane

31835
24:05:42,640 --> 24:05:47,832
și motociclete, s-ar putea doar să recunoască

31836
24:05:45,512 --> 24:05:50,400
camioane care au o anumită cutie

31837
24:05:47,832 --> 24:05:52,320
forma. S-ar putea să nu poată observa a

31838
24:05:50,400 --> 24:05:54,080
camion plat, cu excepția cazului în care este doar un

31839
24:05:52,320 --> 24:05:55,760
anumit tip de camion cu platformă sau numai

31840
24:05:54,080 --> 24:05:57,440
Camioane Ford pentru că asta a văzut

31841
24:05:55,760 --> 24:05:59,760
pe platoul de antrenament. Aceasta înseamnă că

31842
24:05:57,440 --> 24:06:02,640
modelul tău funcționează grozav la trenul tău

31843
24:05:59,760 --> 24:06:04,480
date și grozav la un mic test poate

31844
24:06:02,640 --> 24:06:06,320
cantitatea de date, dar când mergeți să utilizați

31845
24:06:04,480 --> 24:06:08,552
în lumea reală, omite o

31846
24:06:06,320 --> 24:06:11,040
mult și începe și nu este foarte funcțional

31847
24:06:08,552 --> 24:06:13,192
în afara zonei tale mici, lent

31848
24:06:11,040 --> 24:06:14,640
vin date de laborator.

31849
24:06:13,192 --> 24:06:16,400
făcând opusul atunci când nu te adaptezi

31850
24:06:14,640 --> 24:06:18,720
datele dvs. Underfitting face aluzie la a

31851
24:06:16,400 --> 24:06:21,040
model pe care nici nu este bine antrenat

31852
24:06:18,720 --> 24:06:22,960
datele de antrenament și nici nu se pot generaliza la noi

31853
24:06:21,040 --> 24:06:25,440
informaţii. De obicei se întâmplă când există

31854
24:06:22,960 --> 24:06:27,192
sunt date mai puține și necorespunzătoare pentru a antrena a

31855
24:06:25,440 --> 24:06:29,120
model. are o performanță de freză și

31856
24:06:27,192 --> 24:06:30,872
precizie. Deci, dacă utilizați echipament insuficient

31857
24:06:29,120 --> 24:06:32,640
date și generați un model și dvs

31858
24:06:30,872 --> 24:06:34,232
distribuiți-l într-o zonă comercială,

31859
24:06:32,640 --> 24:06:35,440
vei avea o mulțime de oameni nemulțumiți

31860
24:06:34,232 --> 24:06:37,832
tu pentru că nu le va da

31861
24:06:35,440 --> 24:06:39,920
raspunsuri foarte bune. Așa că am explicat

31862
24:06:37,832 --> 24:06:41,920
supraadaptare și subadaptare. Deci acum noi

31863
24:06:39,920 --> 24:06:44,160
vreau să întreb cum să le combat.

31864
24:06:41,920 --> 24:06:46,000
Combaterea supraajustării și subadaptarii,

31865
24:06:44,160 --> 24:06:49,120
reeșantionarea datelor pentru a estima

31866
24:06:46,000 --> 24:06:51,360
acuratețea modelului, validare încrucișată în k-fold,

31867
24:06:49,120 --> 24:06:53,512
având un set de date de validare de evaluat

31868
24:06:51,360 --> 24:06:55,360
modelul. Deci, când facem reeșantionarea,

31869
24:06:53,512 --> 24:06:57,440
vom alege la întâmplare

31870
24:06:55,360 --> 24:06:59,512
date și le vom rula de câteva ori pentru a vedea

31871
24:06:57,440 --> 24:07:01,920
cum funcționează asta în funcție de aleatoriu nostru

31872
24:06:59,512 --> 24:07:03,760
date și modul în care eșantionăm datele

31873
24:07:01,920 --> 24:07:05,920
generăm modelul nostru și apoi vrem

31874
24:07:03,760 --> 24:07:07,920
mergeți mai departe și validați datele setate de

31875
24:07:05,920 --> 24:07:10,232
având datele noastre de antrenament și apoi

31876
24:07:07,920 --> 24:07:12,552
păstrând câteva date pe partea de testare

31877
24:07:10,232 --> 24:07:14,800
date pentru a le valida. Cum sunt greutățile

31878
24:07:12,552 --> 24:07:16,640
initializat intr-o retea? Inițializare

31879
24:07:14,800 --> 24:07:18,480
toate greutățile la zero. Toate greutățile sunt

31880
24:07:16,640 --> 24:07:20,480
setat la zero. Asta face modelul tău

31881
24:07:18,480 --> 24:07:22,160
similar cu un model liniar. Deci dacă tu

31882
24:07:20,480 --> 24:07:23,832
au date liniare care vin, făcând a

31883
24:07:22,160 --> 24:07:25,760
o astfel de configurație de bază ar putea funcționa. Toate

31884
24:07:23,832 --> 24:07:28,080
neuronii din fiecare strat efectuează

31885
24:07:25,760 --> 24:07:30,320
aceeași operațiune având aceeași ieșire și

31886
24:07:28,080 --> 24:07:31,600
făcând inutil plasa adâncă. Corect?

31887
24:07:30,320 --> 24:07:33,192
Există un cuvânt cheie. O să fie

31888
24:07:31,600 --> 24:07:35,360
inutil dacă inițializați totul la

31889
24:07:33,192 --> 24:07:37,360
zero. În acel moment, să te uiți la unele

31890
24:07:35,360 --> 24:07:39,440
alte instrumente de învățare automată.

31891
24:07:37,360 --> 24:07:41,280
Inițializarea tuturor greutăților în mod aleatoriu. Aici

31892
24:07:39,440 --> 24:07:43,280
ponderile sunt repartizate aleatoriu de

31893
24:07:41,280 --> 24:07:45,192
inițialându-le foarte aproape de zero. Ea

31894
24:07:43,280 --> 24:07:46,960
oferă o precizie mai bună modelului deoarece

31895
24:07:45,192 --> 24:07:49,192
fiecare neuron funcționează diferit

31896
24:07:46,960 --> 24:07:50,872
calcule. Și aici avem

31897
24:07:49,192 --> 24:07:52,400
greutățile sunt stabilite aleatoriu. Avem al nostru

31898
24:07:50,872 --> 24:07:54,720
stratul de intrare, straturile ascunse și

31899
24:07:52,400 --> 24:07:57,192
stratul de ieșire. Și W este egal cu NP aleatoriu

31900
24:07:54,720 --> 24:07:59,192
aleatoriu N mărimea stratului L, dimensiunea stratului L

31901
24:07:57,192 --> 24:08:01,280
minus unu. Acesta este cel mai frecvent

31902
24:07:59,192 --> 24:08:03,512
folosit este pentru a genera aleatoriu

31903
24:08:01,280 --> 24:08:06,640
greutăți. Care sunt diferitele straturi

31904
24:08:03,512 --> 24:08:08,960
în CNN? Rețea neuronală convoluțională.

31905
24:08:06,640 --> 24:08:11,512
Primul este stratul convoluțional care

31906
24:08:08,960 --> 24:08:13,280
efectuează o operație convoluțională. Noi

31907
24:08:11,512 --> 24:08:14,960
scoateți celălalt videoclip dacă doriți

31908
24:08:13,280 --> 24:08:17,040
exploreaza asta mai mult. si intra in detalii

31909
24:08:14,960 --> 24:08:19,512
exact cum C este convoluțional

31910
24:08:17,040 --> 24:08:21,680
stratul funcționează în CNN în măsura în care

31911
24:08:19,512 --> 24:08:23,680
creând un număr de imagini mai mici

31912
24:08:21,680 --> 24:08:26,320
ferestre care trec peste date. Uh

31913
24:08:23,680 --> 24:08:28,480
al doilea pas este ca un strat relu relu

31914
24:08:26,320 --> 24:08:30,160
aduce neliniaritate în rețea și

31915
24:08:28,480 --> 24:08:32,872
convertește toți pixelii negativi în

31916
24:08:30,160 --> 24:08:34,872
zero. Ieșirea este harta caracteristică rectificată.

31917
24:08:32,872 --> 24:08:37,280
Deci intră într-o caracteristică de cartografiere acolo.

31918
24:08:34,872 --> 24:08:38,720
Regruparea stratului de grupare este o eșantionare în jos

31919
24:08:37,280 --> 24:08:40,960
operatie care reduce

31920
24:08:38,720 --> 24:08:42,720
dimensionalitatea hărții caracteristicilor. Deci noi

31921
24:08:40,960 --> 24:08:44,640
au tot stratul nostru de relu care trage

31922
24:08:42,720 --> 24:08:46,400
toate aceste mici hărți din noi

31923
24:08:44,640 --> 24:08:48,080
stratul convoluțional. E nevoie de asta

31924
24:08:46,400 --> 24:08:49,440
imagine și puțin creând un mic mic

31925
24:08:48,080 --> 24:08:51,280
rețelele neuronale să privească diferit

31926
24:08:49,440 --> 24:08:53,360
părți ale imaginii. Atunci trebuie

31927
24:08:51,280 --> 24:08:55,440
trageți-l împreună și apoi în cele din urmă

31928
24:08:53,360 --> 24:08:57,680
strat complet conectat. Așa că ne aplatizăm

31929
24:08:55,440 --> 24:08:59,120
punerea în comun a stratului și avem un complet

31930
24:08:57,680 --> 24:09:01,192
stratul conectat recunoaște și

31931
24:08:59,120 --> 24:09:03,280
clasifică obiectele din imagine. Şi

31932
24:09:01,192 --> 24:09:05,440
asta este de fapt propagarea ta înainte

31933
24:09:03,280 --> 24:09:06,640
model de antrenament de propagare inversă

31934
24:09:05,440 --> 24:09:08,160
de obicei. Adică există un număr de

31935
24:09:06,640 --> 24:09:11,120
diferite modele, desigur.

31936
24:09:08,160 --> 24:09:13,920
Ce este pooling în CNN și cum se face

31937
24:09:11,120 --> 24:09:16,640
munca? Pooling folosit pentru a reduce spațiul

31938
24:09:13,920 --> 24:09:18,320
dimensiunile unui CNN efectuează în jos

31939
24:09:16,640 --> 24:09:20,400
operațiune de eșantionare pentru a reduce

31940
24:09:18,320 --> 24:09:22,872
dimensionalitate. Creează o caracteristică trasă

31941
24:09:20,400 --> 24:09:25,192
harta prin glisarea unei matrice de filtru peste

31942
24:09:22,872 --> 24:09:27,280
matricea de intrare. Am menționat asta pe scurt

31943
24:09:25,192 --> 24:09:29,120
pe slide-ul precedent. E important

31944
24:09:27,280 --> 24:09:31,120
sa stii ca ai daca vezi aici

31945
24:09:29,120 --> 24:09:33,192
au o hartă a caracteristicilor rectificată. Şi

31946
24:09:31,120 --> 24:09:35,280
deci fiecare dintre acele culori ca

31947
24:09:33,192 --> 24:09:37,192
culoare galbenă care ar putea fi una dintre a

31948
24:09:35,280 --> 24:09:39,600
rețea neuronală mai mică folosind

31949
24:09:37,192 --> 24:09:41,512
ReLU. O să te uiți la asta

31950
24:09:39,600 --> 24:09:42,800
treci peste poza principală și uită-te la

31951
24:09:41,512 --> 24:09:45,120
toate zonele diferite de pe principal

31952
24:09:42,800 --> 24:09:47,040
poza. Deci s-ar putea să faci pasul unu 2 3 patru

31953
24:09:45,120 --> 24:09:49,120
spatii. Hm și apoi mai ai unul

31954
24:09:47,040 --> 24:09:52,720
asta se uită și la caracteristici și la asta

31955
24:09:49,120 --> 24:09:54,160
are un 2785. Fiecare dintre acestea este o hartă.

31956
24:09:52,720 --> 24:09:56,320
Deci ar putea fi primul ar putea fi a

31957
24:09:54,160 --> 24:09:58,872
harta cautand urechi de pisica si a doua

31958
24:09:56,320 --> 24:10:00,480
unul care caută ochi umani. Când o face

31959
24:09:58,872 --> 24:10:02,000
asta, apoi ai rectificat acest lucru

31960
24:10:00,480 --> 24:10:04,232
harta caracteristicilor uitându-se la acestea diferite

31961
24:10:02,000 --> 24:10:06,232
caracteristici și pooling maxim cu un 2x

31962
24:10:04,232 --> 24:10:07,832
două filtre și un pas de două. Stride

31963
24:10:06,232 --> 24:10:09,440
înseamnă, în loc să săriți peste fiecare pixel,

31964
24:10:07,832 --> 24:10:11,680
vei merge la fiecare doi pixeli. tu

31965
24:10:09,440 --> 24:10:13,440
luați valorile maxime și puteți vedea

31966
24:10:11,680 --> 24:10:15,512
aici ne uităm la o caracteristică trasă

31967
24:10:13,440 --> 24:10:17,360
harta. Una dintre caracteristici spune, hei, eu

31968
24:10:15,512 --> 24:10:20,232
avea o valoare maximă de opt. Deci undeva

31969
24:10:17,360 --> 24:10:21,920
aici am văzut un ochi uman etichetat ca

31970
24:10:20,232 --> 24:10:23,920
opt. Etichetă destul de înaltă. Și poate

31971
24:10:21,920 --> 24:10:25,760
șapte era o mână de om și poate patru

31972
24:10:23,920 --> 24:10:27,600
a fost mustăți de pisică sau ceva ce noi

31973
24:10:25,760 --> 24:10:29,040
crezut că ar putea fi mustăți de pisică. Patru este

31974
24:10:27,600 --> 24:10:30,640
un număr destul de mic în acest sens

31975
24:10:29,040 --> 24:10:32,480
caz comparativ cu celelalte. Deci tu

31976
24:10:30,640 --> 24:10:34,720
ai harta completă a caracteristicilor piscinei. Poți

31977
24:10:32,480 --> 24:10:36,800
vezi procesul aici este că avem nostru

31978
24:10:34,720 --> 24:10:38,640
pasand, cautam valoarea maxima si

31979
24:10:36,800 --> 24:10:42,232
apoi creăm o hartă a caracteristicilor grupate

31980
24:10:38,640 --> 24:10:44,552
valorile maxime. Cum funcționează un LSTM

31981
24:10:42,232 --> 24:10:46,000
munca in retea? Asta e pe termen lung

31982
24:10:44,552 --> 24:10:48,552
memorie. Deci primul lucru de știut este

31983
24:10:46,000 --> 24:10:50,872
că un LSTM-uri sunt un tip special de

31984
24:10:48,552 --> 24:10:52,960
rețea neuronală recurentă capabilă de

31985
24:10:50,872 --> 24:10:54,800
învăţarea dependenţelor pe termen lung.

31986
24:10:52,960 --> 24:10:57,120
amintirea informațiilor pentru perioade lungi de timp

31987
24:10:54,800 --> 24:10:59,440
de timp este comportamentul lor implicit. Noi

31988
24:10:57,120 --> 24:11:01,760
s-a uitat la RNN despre care am vorbit pe scurt

31989
24:10:59,440 --> 24:11:05,192
modul în care stratul ascuns revine

31990
24:11:01,760 --> 24:11:06,960
în sine. Cu LSTM are mult mai mult

31991
24:11:05,192 --> 24:11:09,440
feedback complicat și puteți vedea

31992
24:11:06,960 --> 24:11:11,192
aici avem stratul ascuns de T minus

31993
24:11:09,440 --> 24:11:13,280
unul și stratul ascuns asta este

31994
24:11:11,192 --> 24:11:15,440
H reprezintă stratul ascuns al lui T și

31995
24:11:13,280 --> 24:11:18,320
formule care intră. După cum putem vedea aici noi

31996
24:11:15,440 --> 24:11:21,040
au straturile ascunse avem T minus

31997
24:11:18,320 --> 24:11:22,960
unu și apoi H din T unde T reprezintă

31998
24:11:21,040 --> 24:11:24,232
timp. Deci aceasta este o serie de amintit

31999
24:11:22,960 --> 24:11:26,000
lucrăm cu seriale și vrem

32000
24:11:24,232 --> 24:11:28,480
amintește-ți trecutul și te poți vedea

32001
24:11:26,000 --> 24:11:31,920
ai fostul tău intrarea ta de t și asta

32002
24:11:28,480 --> 24:11:33,832
ar putea fi un cadru dintr-un videoclip ca un cadru

32003
24:11:31,920 --> 24:11:36,800
vine în care se folosesc de obicei în acesta

32004
24:11:33,832 --> 24:11:38,720
formula de activare tangente h dar tu

32005
24:11:36,800 --> 24:11:40,800
vezi si ca trece printr-un cuplu

32006
24:11:38,720 --> 24:11:42,552
alte formule formula omega și așa

32007
24:11:40,800 --> 24:11:44,720
când le combină pe acestea care apoi merge

32008
24:11:42,552 --> 24:11:46,960
în următorul strat următorul tău ascuns

32009
24:11:44,720 --> 24:11:49,192
strat care apoi intră în date

32010
24:11:46,960 --> 24:11:51,600
care este transmis la următoarea intrare, deci

32011
24:11:49,192 --> 24:11:53,192
ai x din t unu. Deci când tu

32012
24:11:51,600 --> 24:11:55,120
primește asta, apoi ai a ta

32013
24:11:53,192 --> 24:11:57,440
Valoarea H care vine înainte de la

32014
24:11:55,120 --> 24:11:59,512
ultimul proces. Si in functie de cate

32015
24:11:57,440 --> 24:12:01,440
dintre aceste structuri omega pe care le pui

32016
24:11:59,512 --> 24:12:03,040
depinde de cât de lungă

32017
24:12:01,440 --> 24:12:05,280
memoria devine. Deci este important să

32018
24:12:03,040 --> 24:12:07,832
amintiți-vă că acest lucru este mai mult pentru dvs. pe termen lung

32019
24:12:05,280 --> 24:12:11,120
rețele neuronale recurente. Cei trei

32020
24:12:07,832 --> 24:12:13,280
pași într-un LSTM, pasul unu decide ce

32021
24:12:11,120 --> 24:12:15,680
să uite și ce să-ți amintești. Pasul

32022
24:12:13,280 --> 24:12:17,360
doi, actualizați selectiv starea celulei

32023
24:12:15,680 --> 24:12:18,800
valorile. Deci, pe baza a ceea ce ne dorim

32024
24:12:17,360 --> 24:12:20,800
Amintiți-vă și uitați, vrem să actualizăm

32025
24:12:18,800 --> 24:12:22,800
acele valori de celule și apoi decide ce

32026
24:12:20,800 --> 24:12:24,960
o parte din starea actuală ajunge la

32027
24:12:22,800 --> 24:12:27,280
ieșire. Deci acum trebuie să avem și un

32028
24:12:24,960 --> 24:12:29,512
ieșire acolo. Ce dispar și

32029
24:12:27,280 --> 24:12:30,720
gradiente care explodează? Acesta este grozav

32030
24:12:29,512 --> 24:12:33,192
întrebare care ne afectează toate neuronale

32031
24:12:30,720 --> 24:12:35,600
retelelor. În timp ce antrenați un RNN, dvs

32032
24:12:33,192 --> 24:12:37,280
panta poate deveni fie prea mică, fie prea mică

32033
24:12:35,600 --> 24:12:39,120
mare și asta face antrenamentul

32034
24:12:37,280 --> 24:12:41,192
dificil. Când panta este prea mică,

32035
24:12:39,120 --> 24:12:43,280
problema este cunoscută sub numele de dispariție

32036
24:12:41,192 --> 24:12:45,280
gradient. Deci panta noastră, avem a noastră

32037
24:12:43,280 --> 24:12:47,192
schimbarea în x și schimbarea noastră în y. Când

32038
24:12:45,280 --> 24:12:49,120
panta scade treptat la o foarte

32039
24:12:47,192 --> 24:12:51,192
valoare mică, uneori negativă, și

32040
24:12:49,120 --> 24:12:53,512
face antrenamentul dificil. Când panta

32041
24:12:51,192 --> 24:12:55,192
tinde să crească exponențial în loc de

32042
24:12:53,512 --> 24:12:57,680
în descompunere, această problemă se numește

32043
24:12:55,192 --> 24:12:59,192
gradient de explozie. Panta crește

32044
24:12:57,680 --> 24:13:00,872
exponenţial. Puteți vedea un grafic frumos

32045
24:12:59,192 --> 24:13:03,192
de asta aici. Probleme în gradient

32046
24:13:00,872 --> 24:13:05,360
problemă, timp lung de antrenament, slab

32047
24:13:03,192 --> 24:13:07,600
performanță și precizie scăzută. Ce este

32048
24:13:05,360 --> 24:13:09,760
diferența dintre epic, lot și

32049
24:13:07,600 --> 24:13:12,080
iterație în învățarea profundă? Epic. An

32050
24:13:09,760 --> 24:13:14,232
epic reprezintă o iterație peste

32051
24:13:12,080 --> 24:13:15,600
întregul set de date. Deci asta e totul

32052
24:13:14,232 --> 24:13:17,760
vei merge înainte și vei pune în

32053
24:13:15,600 --> 24:13:19,760
acel model de antrenament. Lot. Nu putem

32054
24:13:17,760 --> 24:13:21,600
trece întregul set de date în neuron

32055
24:13:19,760 --> 24:13:24,320
rețea deodată. Deci împărțim datele

32056
24:13:21,600 --> 24:13:27,280
stabilite într-un număr de loturi. Și apoi

32057
24:13:24,320 --> 24:13:30,000
iterație. Dacă avem 10.000 de imagini ca

32058
24:13:27,280 --> 24:13:32,720
date și o dimensiune a lotului de 200, apoi

32059
24:13:30,000 --> 24:13:34,552
epic ar trebui să ruleze de 10.000 de ori peste 200.

32060
24:13:32,720 --> 24:13:37,440
Deci asta înseamnă că avem numărul nostru total

32061
24:13:34,552 --> 24:13:39,440
peste 200 este egal cu 50 de iterații. Deci in

32062
24:13:37,440 --> 24:13:41,040
fiecare epopee pe care o trecem peste toate

32063
24:13:39,440 --> 24:13:43,360
set de date, vom avea 50

32064
24:13:41,040 --> 24:13:46,080
iterații. Și fiecare dintre acele iterații

32065
24:13:43,360 --> 24:13:48,232
include un lot de 200 de imagini în aceasta

32066
24:13:46,080 --> 24:13:50,320
caz. De ce TensorFlow este cel mai mult

32067
24:13:48,232 --> 24:13:52,960
biblioteca preferată în deep learning? Uh

32068
24:13:50,320 --> 24:13:55,440
Ei bine, mai întâi TensorFlow oferă atât C  

32069
24:13:52,960 --> 24:13:57,680
și API-uri Python care facilitează

32070
24:13:55,440 --> 24:13:59,360
lucra la. Are un timp de compilare mai rapid

32071
24:13:57,680 --> 24:14:02,480
decât alte biblioteci de deep learning precum

32072
24:13:59,360 --> 24:14:05,680
KAS și lanternă. TensorFlow acceptă ambele

32073
24:14:02,480 --> 24:14:08,232
Dispozitive de calcul CPU-uri și GPU. Deci

32074
24:14:05,680 --> 24:14:10,080
chiar acum TensorFlow este în vârful

32075
24:14:08,232 --> 24:14:11,832
pe piață pentru că este atât de ușor de utilizat

32076
24:14:10,080 --> 24:14:13,680
atât pentru partea de programator cât și pentru

32077
24:14:11,832 --> 24:14:15,192
partea hardware și pentru viteza de

32078
24:14:13,680 --> 24:14:17,440
punând ceva în funcțiune. Ce

32079
24:14:15,192 --> 24:14:19,192
vrei să spui prin tensor în TensorFlow?

32080
24:14:17,440 --> 24:14:20,872
Tensorul este un obiect matematic

32081
24:14:19,192 --> 24:14:22,872
reprezentate ca șiruri de superioare

32082
24:14:20,872 --> 24:14:24,480
dimensiuni. Aceste matrice de date cu

32083
24:14:22,872 --> 24:14:26,480
diferite dimensiuni și ranguri care sunt

32084
24:14:24,480 --> 24:14:28,232
alimentate ca intrare în rețeaua neuronală sunt

32085
24:14:26,480 --> 24:14:31,192
numiti tensori. Și puteți vedea aici noi

32086
24:14:28,232 --> 24:14:32,872
au un tensor de dimensiuni cinci, patru.

32087
24:14:31,192 --> 24:14:34,552
Deci vine un tensor bidimensional

32088
24:14:32,872 --> 24:14:37,040
in. Um, te poti uita la o imagine ca

32089
24:14:34,552 --> 24:14:38,320
asta că fiecare dintre acești pixeli este a

32090
24:14:37,040 --> 24:14:40,160
valoare diferită dacă este negru și

32091
24:14:38,320 --> 24:14:41,512
alb. Deci, ar putea fi zero și unu și

32092
24:14:40,160 --> 24:14:43,920
atunci fiecare reprezintă un negru şi

32093
24:14:41,512 --> 24:14:46,000
imagine albă. Într-o fotografie color, s-ar putea

32094
24:14:43,920 --> 24:14:48,000
um fie găsiți un sistem de valori diferit

32095
24:14:46,000 --> 24:14:50,160
sau s-ar putea să ai o valoare tensorală care

32096
24:14:48,000 --> 24:14:51,920
are coordonatele xy așa cum vedem aici

32097
24:14:50,160 --> 24:14:54,320
plus culorile. Deci, s-ar putea să ai

32098
24:14:51,920 --> 24:14:56,080
încă trei dimensiuni diferite pentru

32099
24:14:54,320 --> 24:14:58,400
trei imagini diferite, roșul, cel

32100
24:14:56,080 --> 24:15:01,040
albastru și galbenul intră. Și chiar

32101
24:14:58,400 --> 24:15:03,120
pe măsură ce treci de la un strat sau un tensor

32102
24:15:01,040 --> 24:15:04,960
la următorul, aceste straturi s-ar putea schimba.

32103
24:15:03,120 --> 24:15:07,280
S-ar putea să le aplatizăm, s-ar putea să le aducem

32104
24:15:04,960 --> 24:15:08,960
numeroase. În cazul convergenţei

32105
24:15:07,280 --> 24:15:10,640
rețea neuronală, avem toate acestea

32106
24:15:08,960 --> 24:15:12,232
mapări diferite mai mici ale caracteristicilor

32107
24:15:10,640 --> 24:15:14,160
care intră. Deci fiecare dintre acestea

32108
24:15:12,232 --> 24:15:15,832
straturi care trec prin este un tensor. Dacă este

32109
24:15:14,160 --> 24:15:17,512
are dimensiuni multiple care intră și

32110
24:15:15,832 --> 24:15:19,280
greutățile atașate acestuia, care sunt

32111
24:15:17,512 --> 24:15:21,120
elemente de programare în TensorFlow?

32112
24:15:19,280 --> 24:15:22,872
Ei bine, avem constantele noastre. constante

32113
24:15:21,120 --> 24:15:25,040
sunt parametri a căror valoare nu

32114
24:15:22,872 --> 24:15:27,920
schimbare. Pentru a defini o constantă, folosim

32115
24:15:25,040 --> 24:15:31,512
tf.comandă constantă. Exemplu, A este egal

32116
24:15:27,920 --> 24:15:34,232
TF.Constant 2.0 TF float 32. Deci este a

32117
24:15:31,512 --> 24:15:37,120
valoarea tensorului flotant de 32. B este egal cu TF

32118
24:15:34,232 --> 24:15:40,160
constanta 3.0. Print AB. Dacă am face o

32119
24:15:37,120 --> 24:15:42,552
print de AB, am avea um TF.stant și

32120
24:15:40,160 --> 24:15:44,960
atunci, desigur, uh B este acea instanță a

32121
24:15:42,552 --> 24:15:47,280
ea. Variabile. Variabilele ne permit să adăugăm

32122
24:15:44,960 --> 24:15:49,512
noi parametri antrenați pentru a reprezenta grafic. Pentru a

32123
24:15:47,280 --> 24:15:51,192
definim o variabilă, folosim TF.variable

32124
24:15:49,512 --> 24:15:53,440
comanda și inițializați-le înainte

32125
24:15:51,192 --> 24:15:57,120
rularea graficului în sesiune. Exemplul W

32126
24:15:53,440 --> 24:15:59,680
este egal cu variabila TF.3 DT tip TF float 32

32127
24:15:57,120 --> 24:16:01,760
sau B este egal cu o variabilă TF minus 3, D

32128
24:15:59,680 --> 24:16:04,400
tip float 32. Substituenți.

32129
24:16:01,760 --> 24:16:06,400
Substituenții ne permit să furnizăm date la a

32130
24:16:04,400 --> 24:16:08,480
Modelul TensorFlow din afara unui model.

32131
24:16:06,400 --> 24:16:10,400
Permite atribuirea unei valori mai târziu.

32132
24:16:08,480 --> 24:16:12,800
Pentru a defini un substituent, folosim TF

32133
24:16:10,400 --> 24:16:16,400
comanda substituent. Exemplul A este egal cu TF

32134
24:16:12,800 --> 24:16:20,232
substituent b= a * 2 cu sesiunea TF

32135
24:16:16,400 --> 24:16:22,552
deoarece rezultatul SESS este egal cu executarea sesiunii B,

32136
24:16:20,232 --> 24:16:24,160
Dicționarul de alimentare este egal cu A3.0. 0 print

32137
24:16:22,552 --> 24:16:26,080
rezultat. Deci avem un exemplu frumos

32138
24:16:24,160 --> 24:16:28,232
acolo a unei sesiuni de substituent. A

32139
24:16:26,080 --> 24:16:30,232
se rulează sesiunea pentru a evalua nodurile.

32140
24:16:28,232 --> 24:16:33,040
Aceasta se numește flux tensor

32141
24:16:30,232 --> 24:16:36,872
timpul de rulare. Deci, de exemplu, aveți a= tf

32142
24:16:33,040 --> 24:16:38,640
constantă 2,0 b= tf constantă 4,0 c= a

32143
24:16:36,872 --> 24:16:40,960
plus b. Și în acest moment ai merge înainte

32144
24:16:38,640 --> 24:16:43,832
și creați o sesiune egală cu sesiune tf.

32145
24:16:40,960 --> 24:16:46,400
Și apoi ați putea evalua tensorul C

32146
24:16:43,832 --> 24:16:48,320
sesiunea de tipărire rulează C. Aceasta ar introduce C

32147
24:16:46,400 --> 24:16:51,040
ca o intrare în sesiunea dvs. Ce să faci

32148
24:16:48,320 --> 24:16:52,872
înțelegi printr-un grafic de calcul?

32149
24:16:51,040 --> 24:16:55,360
Pe care se bazează totul în TensorFlow

32150
24:16:52,872 --> 24:16:57,192
crearea unui grafic de calcul. Are o

32151
24:16:55,360 --> 24:16:59,600
reţea de noduri unde fiecare nod

32152
24:16:57,192 --> 24:17:01,760
efectuează o operație. Nodurile reprezintă

32153
24:16:59,600 --> 24:17:04,552
operație matematică și muchii

32154
24:17:01,760 --> 24:17:06,720
reprezintă tensori. Deoarece datele circulă în a

32155
24:17:04,552 --> 24:17:09,280
forma unui grafic, se mai numește și a

32156
24:17:06,720 --> 24:17:11,512
graficul fluxului de date. Și avem un frumos

32157
24:17:09,280 --> 24:17:13,192
vizual al acestui grafic sau imagine grafică a

32158
24:17:11,512 --> 24:17:15,360
un grafic de calcul. Și poți vedea

32159
24:17:13,192 --> 24:17:17,512
aici avem nodurile noastre de intrare, add

32160
24:17:15,360 --> 24:17:19,360
multiply nodes și nodul nostru de multiplicare la

32161
24:17:17,512 --> 24:17:22,080
sfârşitul. Și apoi avem marginile

32162
24:17:19,360 --> 24:17:24,640
unde curg datele. Deci avem de la A

32163
24:17:22,080 --> 24:17:26,552
mergând la C, A mergând la D. Ne puteți vedea

32164
24:17:24,640 --> 24:17:29,280
au un doi care curg, un patru care curg.

32165
24:17:26,552 --> 24:17:31,440
Explicați rețeaua adversativă generativă

32166
24:17:29,280 --> 24:17:33,440
împreună cu un exemplu. Să presupunem că există

32167
24:17:31,440 --> 24:17:35,280
un magazin de vinuri care cumpără vin de la

32168
24:17:33,440 --> 24:17:36,960
dealeri pe care îi vor revând ulterior. Deci

32169
24:17:35,280 --> 24:17:38,960
avem dealerul nostru care merge la vin,

32170
24:17:36,960 --> 24:17:40,872
proprietarul magazinului nostru care apoi îl vinde pentru a

32171
24:17:38,960 --> 24:17:42,872
profit. Dar există unii defectori

32172
24:17:40,872 --> 24:17:44,640
dealerii care vând vin fals. In aceasta

32173
24:17:42,872 --> 24:17:46,400
caz, proprietarul magazinului ar trebui să poată

32174
24:17:44,640 --> 24:17:48,232
distinge între fals și autentic

32175
24:17:46,400 --> 24:17:50,160
vin. Falsificatorul va încerca să fie diferit

32176
24:17:48,232 --> 24:17:52,320
tehnici pentru a vinde și a face vin fals

32177
24:17:50,160 --> 24:17:54,080
sigur că anumite tehnici trec pe lângă magazin

32178
24:17:52,320 --> 24:17:56,000
cecul proprietarului. Deci, iată falsificatorul nostru

32179
24:17:54,080 --> 24:17:57,512
proprietarul unui magazin de vinuri fals. Proprietarul magazinului

32180
24:17:56,000 --> 24:17:59,440
ar primi probabil ceva feedback de la

32181
24:17:57,512 --> 24:18:01,360
experții în vin că o parte din vin

32182
24:17:59,440 --> 24:18:03,280
nu este original. Proprietarul ar trebui

32183
24:18:01,360 --> 24:18:05,680
îmbunătăți modul în care determină dacă un vin

32184
24:18:03,280 --> 24:18:07,360
este fals sau autentic. Scopul falsificatorului să

32185
24:18:05,680 --> 24:18:09,192
creați vinuri care nu se pot distinge

32186
24:18:07,360 --> 24:18:11,360
din cele autentice. Scopul magazinului

32187
24:18:09,192 --> 24:18:12,872
proprietarul să spună cu exactitate dacă vinul este

32188
24:18:11,360 --> 24:18:15,440
real sau nu. Sunt două principale

32189
24:18:12,872 --> 24:18:17,600
componente ale contradictorialităţii generative

32190
24:18:15,440 --> 24:18:19,512
rețea. Și ne referim la un zgomot

32191
24:18:17,600 --> 24:18:21,600
vector care vine acolo unde avem

32192
24:18:19,512 --> 24:18:24,000
falsificator care va genera vin fals

32193
24:18:21,600 --> 24:18:25,760
și apoi avem vinul nostru adevărat autentic

32194
24:18:24,000 --> 24:18:27,360
și, bineînțeles, proprietarul magazinului nostru care trebuie

32195
24:18:25,760 --> 24:18:30,232
afli dacă este real sau fals.

32196
24:18:27,360 --> 24:18:32,000
Generatorul este un CNN care păstrează

32197
24:18:30,232 --> 24:18:34,080
producând imagini care sunt mai apropiate în

32198
24:18:32,000 --> 24:18:35,832
aspectul la imaginile reale în timp ce

32199
24:18:34,080 --> 24:18:38,000
discriminatorul încearcă să determine

32200
24:18:35,832 --> 24:18:39,512
diferența dintre imaginile reale și cele false.

32201
24:18:38,000 --> 24:18:41,832
Scopul final este de a face

32202
24:18:39,512 --> 24:18:44,872
discriminatorul învață să identifice reale și

32203
24:18:41,832 --> 24:18:46,640
imagini false. Ce este un autoencoder?

32204
24:18:44,872 --> 24:18:48,960
Rețeaua este pregătită să reconstruiască

32205
24:18:46,640 --> 24:18:51,600
intrările sale. Este o rețea neuronală care

32206
24:18:48,960 --> 24:18:53,680
are trei straturi. Aici neuronii de intrare

32207
24:18:51,600 --> 24:18:55,920
sunt egale cu neuronul de ieșire. The

32208
24:18:53,680 --> 24:18:58,400
ținta rețelei din exterior este aceeași cu cea

32209
24:18:55,920 --> 24:19:01,360
intrare. Utilizează reducerea dimensionalității

32210
24:18:58,400 --> 24:19:03,040
pentru a restructura intrarea. Imagine de intrare

32211
24:19:01,360 --> 24:19:05,192
intră. Avem spațiul nostru latin

32212
24:19:03,040 --> 24:19:07,360
reprezentare și apoi se stinge din nou

32213
24:19:05,192 --> 24:19:09,360
reconstruind imaginea. Funcționează prin

32214
24:19:07,360 --> 24:19:11,360
comprimarea intrării într-un spațiu latin

32215
24:19:09,360 --> 24:19:13,440
reprezentare şi apoi reconstruire

32216
24:19:11,360 --> 24:19:15,360
rezultatul din această reprezentare.

32217
24:19:13,440 --> 24:19:17,280
Ce este ambalarea și stimularea? Bagare

32218
24:19:15,360 --> 24:19:19,120
și amplificarea sunt tehnici de ansamblu

32219
24:19:17,280 --> 24:19:21,360
unde ideea este să antrenezi multipli

32220
24:19:19,120 --> 24:19:23,280
modele folosind același algoritm de învățare

32221
24:19:21,360 --> 24:19:25,040
și apoi preluați un apel. Deci avem aici

32222
24:19:23,280 --> 24:19:26,552
unde punem sacul. Luăm un set de date

32223
24:19:25,040 --> 24:19:28,400
și o împărțim. O să avem al nostru

32224
24:19:26,552 --> 24:19:29,920
datele de antrenament și datele noastre de testare. Foarte

32225
24:19:28,400 --> 24:19:32,480
lucru standard de făcut. Apoi mergem

32226
24:19:29,920 --> 24:19:34,400
pentru a selecta aleatoriu datele în pungi

32227
24:19:32,480 --> 24:19:36,720
și antrenează-ți modelul separat. Deci noi

32228
24:19:34,400 --> 24:19:38,872
ar putea avea geanta unu, modelul unu, geanta doi,

32229
24:19:36,720 --> 24:19:40,800
modelul doi, geanta trei, modelul 3 și așa

32230
24:19:38,872 --> 24:19:42,720
pe. În sporirea accentului este să

32231
24:19:40,800 --> 24:19:45,280
selectați punctele de date care dau greșit

32232
24:19:42,720 --> 24:19:47,120
ieșire pentru a îmbunătăți acuratețea.

32233
24:19:45,280 --> 24:19:49,192
Deci, în boosting avem setul nostru de date

32234
24:19:47,120 --> 24:19:51,120
din nou l-am împărțit pentru a testa datele și a antrena

32235
24:19:49,192 --> 24:19:53,120
date și vom lua o geantă și o vom face

32236
24:19:51,120 --> 24:19:55,680
antrenează modelul. Datele indică greșit

32237
24:19:53,120 --> 24:19:57,512
predicțiile intră apoi în sacul doi și noi

32238
24:19:55,680 --> 24:20:00,800
apoi antrenează modelul respectiv și repetă.

32239
24:19:57,512 --> 24:20:02,960
învățarea automată este un subset al

32240
24:20:00,800 --> 24:20:04,640
inteligenta artificiala, nu? Asta e

32241
24:20:02,960 --> 24:20:08,232
practic

32242
24:20:04,640 --> 24:20:11,040
um mașini de învățare din date

32243
24:20:08,232 --> 24:20:14,232
pentru a lua decizii

32244
24:20:11,040 --> 24:20:17,512
în esență. Deci asta a fost mare

32245
24:20:14,232 --> 24:20:19,832
abatere de la sistemele bazate pe reguli

32246
24:20:17,512 --> 24:20:22,232
la momentul respectiv, nu? Asta au fost în mod explicit

32247
24:20:19,832 --> 24:20:25,512
programat pentru a lua decizii. Deci doar

32248
24:20:22,232 --> 24:20:27,920
Gândește-te la un exemplu ca unul cu adevărat mare

32249
24:20:25,512 --> 24:20:30,640
cam dacă asta atunci că atunci că atunci

32250
24:20:27,920 --> 24:20:33,192
asta si altceva daca asta asta asta

32251
24:20:30,640 --> 24:20:36,400
corect, așa că o grămadă de reguli care trebuiau să fie

32252
24:20:33,192 --> 24:20:39,280
preprogramat pentru a ieși

32253
24:20:36,400 --> 24:20:40,640
cu un răspuns final. Uh cu mașină

32254
24:20:39,280 --> 24:20:42,552
învățând că este exact opusul

32255
24:20:40,640 --> 24:20:46,000
că. de fapt antrenăm ceva

32256
24:20:42,552 --> 24:20:50,080
din exemple din datele existente um in

32257
24:20:46,000 --> 24:20:52,800
pentru a prezice ceva sau um

32258
24:20:50,080 --> 24:20:54,480
ia un fel de decizie. Uh și așa

32259
24:20:52,800 --> 24:20:56,400
vom învăța despre diverse

32260
24:20:54,480 --> 24:20:59,600
moduri în care putem face învățarea automată. Dar dacă

32261
24:20:56,400 --> 24:21:01,600
Vă amintiți despre care am vorbit

32262
24:20:59,600 --> 24:21:05,040
unora dintre acestea le plac diferenţele şi

32263
24:21:01,600 --> 24:21:09,120
abordările bazate pe reguli

32264
24:21:05,040 --> 24:21:11,920
la învățarea din abordarea datelor. Hm și

32265
24:21:09,120 --> 24:21:14,080
inclus în asta va fi uh

32266
24:21:11,920 --> 24:21:16,960
date complexe nestructurate. Deci lucrurile

32267
24:21:14,080 --> 24:21:20,080
cum ar fi imagini, text, audio. Ce mânere

32268
24:21:16,960 --> 24:21:22,872
alea foarte bine este o învățare profundă

32269
24:21:20,080 --> 24:21:26,400
la care vom ajunge în cursul de după

32270
24:21:22,872 --> 24:21:28,872
aceasta. Dar acestea sunt cu siguranță în

32271
24:21:26,400 --> 24:21:31,512
acolo ca învățarea din date chiar și complexă

32272
24:21:28,872 --> 24:21:33,920
date.

32273
24:21:31,512 --> 24:21:35,440
Deci am avut această poză și cred

32274
24:21:33,920 --> 24:21:40,000
asta e cam de unde am plecat

32275
24:21:35,440 --> 24:21:41,360
data trecută a fost doar o distincție

32276
24:21:40,000 --> 24:21:43,280
între cei trei termeni. Vedem noi

32277
24:21:41,360 --> 24:21:44,640
inteligență artificială, învățare profundă

32278
24:21:43,280 --> 24:21:46,000
iar învățarea automată este folosită

32279
24:21:44,640 --> 24:21:48,080
interschimbabil, dar chiar așa este

32280
24:21:46,000 --> 24:21:51,680
se potrivesc. Inteligenţa artificială este

32281
24:21:48,080 --> 24:21:55,360
un fel de ceva larg care imită umanul

32282
24:21:51,680 --> 24:21:57,832
inteligență. Hm, care nu trebuie

32283
24:21:55,360 --> 24:22:00,400
să înveți din date, dar mașină

32284
24:21:57,832 --> 24:22:02,320
învățarea face parte din asta. Și apoi um

32285
24:22:00,400 --> 24:22:04,640
o modalitate de a realiza învățarea automată

32286
24:22:02,320 --> 24:22:08,320
este de a folosi rețele neuronale care este punctul central

32287
24:22:04,640 --> 24:22:09,832
de învățare profundă. Hm și atât de adânc

32288
24:22:08,320 --> 24:22:12,960
învățarea a fost găsită o mulțime de

32289
24:22:09,832 --> 24:22:15,512
succes mai ales recent cu uh

32290
24:22:12,960 --> 24:22:18,400
acele tipuri de date complexe, cum ar fi imaginile,

32291
24:22:15,512 --> 24:22:20,552
vorbire, text, nu? Atât de învățare profundă

32292
24:22:18,400 --> 24:22:23,600
folosit peste tot. Chiar și în um

32293
24:22:20,552 --> 24:22:26,720
modern precum IA generativă, vedem profund

32294
24:22:23,600 --> 24:22:29,680
învăţarea folosită destul de mult. Um, chiar

32295
24:22:26,720 --> 24:22:32,160
orice folosește rețele neuronale este uh

32296
24:22:29,680 --> 24:22:35,920
va fi o învățare profundă.

32297
24:22:32,160 --> 24:22:37,280
Hm și din nou ne vom concentra asupra asta mai târziu

32298
24:22:35,920 --> 24:22:39,360
dar ne vom concentra în principal asupra

32299
24:22:37,280 --> 24:22:41,280
învățarea automată pentru acest curs.

32300
24:22:39,360 --> 24:22:43,760
În primul rând, învățarea automată care nu

32301
24:22:41,280 --> 24:22:45,760
utilizați rețele neuronale. Bine. Deci doar

32302
24:22:43,760 --> 24:22:48,000
modele care nu sunt neapărat neuronale

32303
24:22:45,760 --> 24:22:51,400
retelelor

32304
24:22:48,000 --> 24:22:51,400
fii focusul nostru.

32305
24:22:51,832 --> 24:22:59,512
Deci, în învățarea automată, am avut un exemplu

32306
24:22:54,232 --> 24:23:03,920
a unui joc, în esență, învăț

32307
24:22:59,512 --> 24:23:06,480
ce decizii să iau pe baza

32308
24:23:03,920 --> 24:23:09,680
uh, un fel de stare actuală a

32309
24:23:06,480 --> 24:23:12,960
bord. Acesta ar putea fi un um, știi

32310
24:23:09,680 --> 24:23:15,680
exemplu de învățare automată pe care îl învață

32311
24:23:12,960 --> 24:23:18,160
din multe exemple anterioare. Deci multe

32312
24:23:15,680 --> 24:23:22,160
datele din jurul acestor jocuri sunt folosite pentru

32313
24:23:18,160 --> 24:23:24,000
antrenează astfel de roboți care pot

32314
24:23:22,160 --> 24:23:26,480
jucați aceste jocuri și jucați-le într-un mod foarte

32315
24:23:24,000 --> 24:23:28,872
nivel înalt. Deci au fost multe

32316
24:23:26,480 --> 24:23:32,000
succese de fapt în învățarea automată

32317
24:23:28,872 --> 24:23:36,400
și învățarea profundă în jur

32318
24:23:32,000 --> 24:23:38,480
uh jucând jocuri precum șah sau go

32319
24:23:36,400 --> 24:23:41,280
um folosind algoritmi de învățare automată. Deci

32320
24:23:38,480 --> 24:23:42,400
destul de misto.

32321
24:23:41,280 --> 24:23:43,832
Bine, deci cred că aici este locul în care noi

32322
24:23:42,400 --> 24:23:45,760
s-a încheiat. Ultima dată am spus că sunt o grămadă

32323
24:23:43,832 --> 24:23:48,960
de diferite cazuri de utilizare pentru mașină

32324
24:23:45,760 --> 24:23:50,160
învăţarea. Deci sistemul de recomandare este

32325
24:23:48,960 --> 24:23:53,040
va fi unul mare și vom face

32326
24:23:50,160 --> 24:23:56,000
de fapt studiază asta într-unul dintre noi

32327
24:23:53,040 --> 24:23:58,320
lecțiile finale ale acestui curs. Um chat

32328
24:23:56,000 --> 24:24:00,552
roboților le place AI generativ care face sentimente

32329
24:23:58,320 --> 24:24:02,720
analiză chat bot-i vom studia mai târziu dar

32330
24:24:00,552 --> 24:24:06,080
acestea sunt cu siguranță o aplicație a

32331
24:24:02,720 --> 24:24:08,320
învățând din date pentru a uh

32332
24:24:06,080 --> 24:24:11,040
generați răspunsuri la solicitările text

32333
24:24:08,320 --> 24:24:13,680
corect. Filtrarea spam-ului e bună

32334
24:24:11,040 --> 24:24:17,440
exemplu, cum ar fi clasificarea unui e-mail ca

32335
24:24:13,680 --> 24:24:20,640
spam sau nu spam. Hm, asta devine

32336
24:24:17,440 --> 24:24:24,080
instruit din exemple și învățare

32337
24:24:20,640 --> 24:24:26,960
din date precum e-mailurile anterioare. Hm

32338
24:24:24,080 --> 24:24:32,552
analiza postărilor din rețelele sociale este alta

32339
24:24:26,960 --> 24:24:35,120
un fel de date text, un caz de utilizare, dar tu

32340
24:24:32,552 --> 24:24:38,320
poti face multe cu acel text ca si tine

32341
24:24:35,120 --> 24:24:41,760
preziceți sentimentul pe care îl puteți prezice

32342
24:24:38,320 --> 24:24:44,640
uh categoria a ceea ce este postul

32343
24:24:41,760 --> 24:24:47,440
vorbind despre astfel de lucruri

32344
24:24:44,640 --> 24:24:49,360
totul se poate face cu machine learning

32345
24:24:47,440 --> 24:24:51,920
>> și multe alte cazuri de utilizare care nu se referă la asta

32346
24:24:49,360 --> 24:24:56,512
lista pe care o vom acoperi

32347
24:24:51,920 --> 24:24:56,512
>> știi cum mergem mai departe.

32348
24:25:02,640 --> 24:25:08,552
Bine, deci aici am plecat

32349
24:25:04,960 --> 24:25:11,192
oprit. Um, deci ce face atât de greu

32350
24:25:08,552 --> 24:25:12,960
munca aici este

32351
24:25:11,192 --> 24:25:16,320
>> uh algoritmi de învățare automată. Deci astea

32352
24:25:12,960 --> 24:25:19,512
sunt lucruri care vor um acestea sunt lucruri

32353
24:25:16,320 --> 24:25:24,232
care va învăța din date. Deci ei

32354
24:25:19,512 --> 24:25:28,320
sunt uh ei sunt practic um

32355
24:25:24,232 --> 24:25:29,832
algoritmi sau seturi de reguli care uh sau

32356
24:25:28,320 --> 24:25:31,440
reguli matematice ar trebui să spun că nu

32357
24:25:29,832 --> 24:25:34,800
reguli formale ca în sensul de

32358
24:25:31,440 --> 24:25:37,920
un sistem de reguli dar matematic um

32359
24:25:34,800 --> 24:25:41,360
formule și reguli matematice

32360
24:25:37,920 --> 24:25:43,920
în esență, care ne ajută să învățăm din

32361
24:25:41,360 --> 24:25:46,400
date. Deci corelează datele cu unele

32362
24:25:43,920 --> 24:25:49,192
tip de rezultat. Deci un fel de

32363
24:25:46,400 --> 24:25:50,872
prezice uh dacă asta va fi

32364
24:25:49,192 --> 24:25:53,280
după cum vom vedea dacă asta ar putea fi

32365
24:25:50,872 --> 24:25:56,400
ca un număr așa cum prezicem a

32366
24:25:53,280 --> 24:25:58,872
preț sau cerere sau vânzări

32367
24:25:56,400 --> 24:26:01,832
um sau ar putea fi o categorie ca este

32368
24:25:58,872 --> 24:26:03,680
această tranzacție fraudă sau nu fraudă sau

32369
24:26:01,832 --> 24:26:07,360
care este probabilitatea ca asta să fie

32370
24:26:03,680 --> 24:26:08,720
fraudă, deci avem diferite tipuri de

32371
24:26:07,360 --> 24:26:10,480
predicții pe care le putem face cu mașina

32372
24:26:08,720 --> 24:26:14,480
învăţarea

32373
24:26:10,480 --> 24:26:17,920
um, dar vom studia tipul de

32374
24:26:14,480 --> 24:26:19,760
diferențele dintre cele care apar. Hm, dar

32375
24:26:17,920 --> 24:26:21,832
algoritmii de învățare automată sunt cu adevărat

32376
24:26:19,760 --> 24:26:23,120
ce putere sunt modelele,

32377
24:26:21,832 --> 24:26:26,400
nu? Ele sunt modelele care ajută

32378
24:26:23,120 --> 24:26:28,480
puterea uh machine learning să de fapt

32379
24:26:26,400 --> 24:26:30,160
invata din date.

32380
24:26:28,480 --> 24:26:33,120
Deci, vom petrece mult timp

32381
24:26:30,160 --> 24:26:34,960
în acest curs studiind acei algoritmi

32382
24:26:33,120 --> 24:26:37,040
ca diferitele modele pe care le putem

32383
24:26:34,960 --> 24:26:38,320
construi și care sunt diferențele lor,

32384
24:26:37,040 --> 24:26:40,800
care sunt punctele lor forte, care sunt

32385
24:26:38,320 --> 24:26:44,040
punctele slabe sunt. O să învățăm multe

32386
24:26:40,800 --> 24:26:44,040
despre acelea.

32387
24:26:44,720 --> 24:26:49,512
Bine. Deci, cred că vă puteți imagina

32388
24:26:46,720 --> 24:26:52,552
totul este atât de dependent de date, nu?

32389
24:26:49,512 --> 24:26:55,040
Învățăm din date. Deci uh

32390
24:26:52,552 --> 24:26:56,872
are sens că calitatea datelor

32391
24:26:55,040 --> 24:26:59,832
chiar contează aici

32392
24:26:56,872 --> 24:27:03,120
determinând cât de puternic poate fi modelul.

32393
24:26:59,832 --> 24:27:07,512
Așa că vezi acest grafic aici grafic

32394
24:27:03,120 --> 24:27:11,600
un fel de date de înaltă calitate um

32395
24:27:07,512 --> 24:27:14,320
față de orice date vechi, dar decente

32396
24:27:11,600 --> 24:27:16,552
cantitate suficientă din ea. Poți să vezi

32397
24:27:14,320 --> 24:27:20,400
acea performanță și performanța este

32398
24:27:16,552 --> 24:27:23,120
măsurată printr-o metrică de evaluare. um,

32399
24:27:20,400 --> 24:27:24,720
așa că gândește-te la asta ca la ceva de genul

32400
24:27:23,120 --> 24:27:27,600
precizie. Parcă am fi prezis

32401
24:27:24,720 --> 24:27:30,960
fraudă sau nu fraudă, cât de precise pot noastre

32402
24:27:27,600 --> 24:27:33,760
modelul ajunge să detecteze efectiv frauda,

32403
24:27:30,960 --> 24:27:36,552
um, devine din ce în ce mai bine și mai bine

32404
24:27:33,760 --> 24:27:39,192
graficul arată că cu cât este mai mare calitate

32405
24:27:36,552 --> 24:27:40,872
a datelor pe care le avem. Deci există un fel de

32406
24:27:39,192 --> 24:27:44,000
că există o zicală în

32407
24:27:40,872 --> 24:27:46,232
învățare automată, numită gunoi

32408
24:27:44,000 --> 24:27:48,640
gunoiul afară. Ceea ce înseamnă asta este dacă tu

32409
24:27:46,232 --> 24:27:51,440
au date slabe, chiar și cel mai bun model din

32410
24:27:48,640 --> 24:27:53,832
lumea, datele slabe nu vor

32411
24:27:51,440 --> 24:27:56,872
rezultă în a avea un model bun care poate

32412
24:27:53,832 --> 24:28:00,160
să fie precis și să funcționeze bine. Um, asa e

32413
24:27:56,872 --> 24:28:01,920
trebuie să fie de înaltă calitate, adică um

32414
24:28:00,160 --> 24:28:04,720
trebuie să existe o cantitate decentă

32415
24:28:01,920 --> 24:28:07,512
și trebuie să fie etichetat corespunzător

32416
24:28:04,720 --> 24:28:10,800
despre care vom vorbi

32417
24:28:07,512 --> 24:28:12,720
și trebuie să nu aibă niciunul, tu

32418
24:28:10,800 --> 24:28:15,600
știu, valori aberante semnificative. trebuie

32419
24:28:12,720 --> 24:28:18,320
fii curat, nu ai acele valori lipsă,

32420
24:28:15,600 --> 24:28:20,480
toate aceste lucruri. Hm, poți tu

32421
24:28:18,320 --> 24:28:24,720
au șanse mari să obțină bine

32422
24:28:20,480 --> 24:28:28,512
predicții din date de calitate superioară

32423
24:28:24,720 --> 24:28:28,512
așa cum arată acest gen.

32424
24:28:30,000 --> 24:28:34,480
Bine.

32425
24:28:32,232 --> 24:28:36,960
Deci, un lucru o să învățăm

32426
24:28:34,480 --> 24:28:38,872
mergem împreună este

32427
24:28:36,960 --> 24:28:41,680
conteaza si cantitatea. Deci, nu numai

32428
24:28:38,872 --> 24:28:42,800
calitate, dar o cantitate decentă din ea. Şi

32429
24:28:41,680 --> 24:28:45,040
um, vom învăța așa ceva

32430
24:28:42,800 --> 24:28:48,640
reguli de bază, cum ar fi câte date am

32431
24:28:45,040 --> 24:28:51,920
nevoie de anumiți algoritmi. Unul

32432
24:28:48,640 --> 24:28:53,512
lucru pe care îl vom vedea este că uh the

32433
24:28:51,920 --> 24:28:56,552
modelele de bază de învățare automată care

32434
24:28:53,512 --> 24:28:59,440
vom studia nu au nevoie de atât de mult ca a

32435
24:28:56,552 --> 24:29:02,800
rețeaua neuronală ar. Știi neural

32436
24:28:59,440 --> 24:29:05,280
rețelele vor necesita mult mai mult

32437
24:29:02,800 --> 24:29:08,160
decât un model de bază de învățare automată

32438
24:29:05,280 --> 24:29:10,552
model de învățare. Deci asta e ceva

32439
24:29:08,160 --> 24:29:12,160
vom vedea pe măsură ce mergem. Dar asta

32440
24:29:10,552 --> 24:29:14,232
este ceva despre care vom vorbi și

32441
24:29:12,160 --> 24:29:16,160
discutăm cu fiecare model pe care îl studiem este

32442
24:29:14,232 --> 24:29:22,192
cam câte date avem de fapt

32443
24:29:16,160 --> 24:29:22,192
trebuie să producă un model de înaltă calitate.

32444
24:29:24,232 --> 24:29:30,600
Bine, vreo întrebare până acum?

32445
24:29:34,960 --> 24:29:39,512
Bine, hai să vorbim despre diferit

32446
24:29:37,512 --> 24:29:41,600
tipuri de învățare automată pe care le avem

32447
24:29:39,512 --> 24:29:43,832
merg sa discutam. Pime, se întâmplă

32448
24:29:41,600 --> 24:29:46,232
fie două primare pe care le vom studia

32449
24:29:43,832 --> 24:29:47,600
în acest curs și apoi încă câteva

32450
24:29:46,232 --> 24:29:50,232
asta va fi un pic mai avansat

32451
24:29:47,600 --> 24:29:52,000
la care nu vom ajunge, dar merită să știm

32452
24:29:50,232 --> 24:29:55,120
despre. Um, deci vor fi patru

32453
24:29:52,000 --> 24:29:58,160
total despre care vom studia sau vorbim și

32454
24:29:55,120 --> 24:30:00,720
vor fi pe această listă aici, adică

32455
24:29:58,160 --> 24:30:03,760
învățarea supravegheată și nesupravegheată

32456
24:30:00,720 --> 24:30:06,800
învăţarea. Acum, aș spune că majoritatea

32457
24:30:03,760 --> 24:30:08,320
concentrarea noastră se va concentra probabil pe supraveghere

32458
24:30:06,800 --> 24:30:12,160
învăţând şi vom vorbi despre ce anume

32459
24:30:08,320 --> 24:30:14,400
înseamnă, dar vom acoperi și nesupravegheat

32460
24:30:12,160 --> 24:30:16,800
învăţarea de asemenea. Și așa, ne vom uita

32461
24:30:14,400 --> 24:30:20,000
cele mai populare tehnici în fiecare dintre

32462
24:30:16,800 --> 24:30:21,760
aceste tipuri de învățare automată.

32463
24:30:20,000 --> 24:30:24,080
um,

32464
24:30:21,760 --> 24:30:25,512
și apoi vom vorbi despre acestea două, dar

32465
24:30:24,080 --> 24:30:28,480
nu le studiezi cu adevărat pentru că sunt

32466
24:30:25,512 --> 24:30:30,872
subiecte mai avansate um că asta va

32467
24:30:28,480 --> 24:30:34,872
fi dincolo de scopul a ceea ce vom face.

32468
24:30:30,872 --> 24:30:38,320
Dar astea vor fi um

32469
24:30:34,872 --> 24:30:42,160
diferite stiluri de învățare automată

32470
24:30:38,320 --> 24:30:43,832
care vor fi caracterizate de um

32471
24:30:42,160 --> 24:30:46,960
ce fel de predicții fac,

32472
24:30:43,832 --> 24:30:50,640
ce fel de date au nevoie și au nevoie.

32473
24:30:46,960 --> 24:30:55,120
Um și ce fel de rezultate sunt

32474
24:30:50,640 --> 24:30:57,512
producand efectiv. Hm, deci haideți

32475
24:30:55,120 --> 24:30:59,120
intra în fiecare dintre acestea, dar uh the

32476
24:30:57,512 --> 24:31:00,552
unul pe care probabil îl vom petrece

32477
24:30:59,120 --> 24:31:03,360
majoritatea timpului nostru va fi

32478
24:31:00,552 --> 24:31:05,360
învăţare supravegheată, dar vom studia

32479
24:31:03,360 --> 24:31:06,640
învățarea nesupravegheată de asemenea. Vom face

32480
24:31:05,360 --> 24:31:08,800
studiază pe amândouă și vom vorbi despre

32481
24:31:06,640 --> 24:31:11,440
le vom defini pe amândouă

32482
24:31:08,800 --> 24:31:12,800
venind. Și din nou, acestea vor fi a

32483
24:31:11,440 --> 24:31:15,440
subiecte puțin mai avansate decât noi

32484
24:31:12,800 --> 24:31:17,760
nu va petrece prea mult timp.

32485
24:31:15,440 --> 24:31:21,192
Hm, dar vom discuta despre ele

32486
24:31:17,760 --> 24:31:25,400
relevanța în învățarea automată și

32487
24:31:21,192 --> 24:31:25,400
da-i o definitie buna.

32488
24:31:28,800 --> 24:31:31,800
Bine.

32489
24:31:32,000 --> 24:31:38,000
În regulă. Să începem cu supravegheat

32490
24:31:34,232 --> 24:31:41,600
învăţarea. Acum asta va fi uh a

32491
24:31:38,000 --> 24:31:46,720
termen la care se referă cu adevărat

32492
24:31:41,600 --> 24:31:50,640
folosind exemple. Deci folosind etichetat

32493
24:31:46,720 --> 24:31:54,800
exemple. Deci aici spunem date etichetate la

32494
24:31:50,640 --> 24:31:58,480
ajută-ne să antreneze modelul. Cu alte cuvinte,

32495
24:31:54,800 --> 24:32:01,832
ajuta modelul nostru să poată prezice ghidat

32496
24:31:58,480 --> 24:32:04,080
prin perechi de intrare-ieșiri specifice. Deci

32497
24:32:01,832 --> 24:32:10,000
supravegheat se referă într-adevăr la fapt

32498
24:32:04,080 --> 24:32:12,640
că avem răspunsuri. Avem exemple,

32499
24:32:10,000 --> 24:32:15,280
avem răspunsuri cu acelea și folosim

32500
24:32:12,640 --> 24:32:19,120
acea colecție de date pentru a ne construi

32501
24:32:15,280 --> 24:32:23,040
modelați astfel încât să putem prezice

32502
24:32:19,120 --> 24:32:27,192
um genul ăsta de lucruri, cum ar fi un preț,

32503
24:32:23,040 --> 24:32:29,360
ca o categorie, ca un spam, nu ca spam.

32504
24:32:27,192 --> 24:32:32,160
în acest diapozitiv așa cum am fi noi

32505
24:32:29,360 --> 24:32:34,400
prezicerea dacă această formă este un pătrat, a

32506
24:32:32,160 --> 24:32:38,720
triunghi sau un cerc.

32507
24:32:34,400 --> 24:32:42,872
Hm, dar când construim un model pentru

32508
24:32:38,720 --> 24:32:44,320
că, avem date care au un răspuns

32509
24:32:42,872 --> 24:32:45,512
atașat de acesta. Corect? Am vorbit

32510
24:32:44,320 --> 24:32:50,400
despre asta înainte un pic cu

32511
24:32:45,512 --> 24:32:52,552
etichete. Deci există un ghid acolo

32512
24:32:50,400 --> 24:32:55,600
ne poate ghida spre construirea modelului nostru.

32513
24:32:52,552 --> 24:32:58,640
există un real pentru fiecare exemplu

32514
24:32:55,600 --> 24:33:01,920
are un răspuns și acel răspuns este cu adevărat

32515
24:32:58,640 --> 24:33:06,800
esențial pentru a ajuta la construirea modelului nostru.

32516
24:33:01,920 --> 24:33:11,600
Deci, e aproape ca și tu

32517
24:33:06,800 --> 24:33:13,760
ai o grămadă de exerciții

32518
24:33:11,600 --> 24:33:15,512
în să spunem ca un manual de matematică. tu

32519
24:33:13,760 --> 24:33:18,160
ai o grămadă de exerciții și ai

32520
24:33:15,512 --> 24:33:20,720
răspunsurile și așa poți cam

32521
24:33:18,160 --> 24:33:24,320
verifica-ti munca. Te gândești la model

32522
24:33:20,720 --> 24:33:26,232
antrenament um asta este cu adevărat o mulțime de

32523
24:33:24,320 --> 24:33:29,360
acel proces de antrenament model așa cum suntem noi

32524
24:33:26,232 --> 24:33:32,000
mergi să descoperi este, practic

32525
24:33:29,360 --> 24:33:35,280
verificându-ne munca în raport cu aceste răspunsuri

32526
24:33:32,000 --> 24:33:38,960
în datele noastre în datele noastre de antrenament.

32527
24:33:35,280 --> 24:33:41,280
Bine. Deci, învățarea supravegheată este de orice tip

32528
24:33:38,960 --> 24:33:44,080
de învățare automată care implică

32529
24:33:41,280 --> 24:33:47,040
învăţând din datele etichetate pentru a

32530
24:33:44,080 --> 24:33:49,600
prezice rezultate. Bine, preziceți rezultatele

32531
24:33:47,040 --> 24:33:52,640
ca acum rezultatele pot fi

32532
24:33:49,600 --> 24:33:56,000
numerice. Pot fi ca un preț,

32533
24:33:52,640 --> 24:33:58,000
temperatură, cerere, vânzări, venituri.

32534
24:33:56,000 --> 24:33:59,760
Ele pot fi numerice, dar pot și

32535
24:33:58,000 --> 24:34:01,832
fi categoric. Deci pot fi ca

32536
24:33:59,760 --> 24:34:05,832
spam, nu spam, fraudă, nu fraudă,

32537
24:34:01,832 --> 24:34:09,512
cancer, nu cancer. Hm, câine, pisică,

32538
24:34:05,832 --> 24:34:11,360
girafe, acele categorii. um,

32539
24:34:09,512 --> 24:34:13,832
le-am putea prezice. Este un fel

32540
24:34:11,360 --> 24:34:17,192
de rezultat. Bine, un fel de rezultat.

32541
24:34:13,832 --> 24:34:20,480
Cheia este că folosim exemple etichetate

32542
24:34:17,192 --> 24:34:23,120
pentru a ne ghida construirea modelului. De aceea

32543
24:34:20,480 --> 24:34:26,552
se numește învățare supravegheată.

32544
24:34:23,120 --> 24:34:28,160
Deci știm că în datele noastre știm ce

32545
24:34:26,552 --> 24:34:30,000
intrările sunt. Bineînțeles, acelea merg

32546
24:34:28,160 --> 24:34:34,080
pentru a fi gândit la intrări ca la toate

32547
24:34:30,000 --> 24:34:36,080
coloanele noastre și apoi avem o specială

32548
24:34:34,080 --> 24:34:37,192
coloană etichetă care reprezintă rezultatul

32549
24:34:36,080 --> 24:34:40,232
încercăm să prevedem. Deci dacă te gândești

32550
24:34:37,192 --> 24:34:42,232
despre acele date despre prețul locuințelor, eticheta

32551
24:34:40,232 --> 24:34:44,640
ar putea fi pretul. Și asta e ceva

32552
24:34:42,232 --> 24:34:47,760
am construi un model de prezis, dar

32553
24:34:44,640 --> 24:34:50,400
avem răspunsuri pentru toate exemplele noastre

32554
24:34:47,760 --> 24:34:52,872
în rândurile noastre. Avem răspunsuri de ajutor

32555
24:34:50,400 --> 24:34:54,872
ne ghidează construirea modelului.

32556
24:34:52,872 --> 24:34:58,080
Ele ajută la ajustarea modelului nostru pentru că noi

32557
24:34:54,872 --> 24:34:59,920
știi răspunsul dinainte. Deci

32558
24:34:58,080 --> 24:35:03,760
sunt chiar exemple bune pentru care

32559
24:34:59,920 --> 24:35:05,832
construim modelul nostru din.

32560
24:35:03,760 --> 24:35:08,832
Bine. Deci asta este supravegheat

32561
24:35:05,832 --> 24:35:08,832
învăţarea.

32562
24:35:12,872 --> 24:35:16,872
În acest exemplu este cerc, nu în

32563
24:35:14,800 --> 24:35:18,320
predicție pentru că nu face parte din

32564
24:35:16,872 --> 24:35:20,720
datele de testare chiar dacă sunt în

32565
24:35:18,320 --> 24:35:23,680
date etichetate.

32566
24:35:20,720 --> 24:35:27,360
Hm, nu, pur și simplu nu neapărat. Doar

32567
24:35:23,680 --> 24:35:30,232
înseamnă că așa cum învățăm împotriva tuturor

32568
24:35:27,360 --> 24:35:33,512
aceste exemple care au aceste răspunsuri

32569
24:35:30,232 --> 24:35:35,280
și atunci când observăm exemple noi um

32570
24:35:33,512 --> 24:35:38,480
putem încerca să prezicem ce ar fi acestea

32571
24:35:35,280 --> 24:35:40,480
să se bazeze pe ceea ce am văzut înainte. Deci eu

32572
24:35:38,480 --> 24:35:42,800
dacă a existat o știi că este doar o

32573
24:35:40,480 --> 24:35:44,960
coincidenta avem doar doi doi

32574
24:35:42,800 --> 24:35:46,480
exemple în datele noastre de testare așa cum am putea

32575
24:35:44,960 --> 24:35:48,720
avem un cerc aici, caz în care noi

32576
24:35:46,480 --> 24:35:50,960
ar prezice cerc

32577
24:35:48,720 --> 24:35:52,400
e bine sau cel puțin am spera

32578
24:35:50,960 --> 24:35:54,320
modelul nostru ar prezice cerc dreapta

32579
24:35:52,400 --> 24:35:56,640
asta sperăm că poate sau nu

32580
24:35:54,320 --> 24:36:01,120
face bine

32581
24:35:56,640 --> 24:36:03,360
um, dar doar că nu este acolo pentru că

32582
24:36:01,120 --> 24:36:04,960
ne place doar să presupunem că noi

32583
24:36:03,360 --> 24:36:07,120
avem doar două exemple pe care le testăm

32584
24:36:04,960 --> 24:36:09,360
împotrivă, dar în realitate am fi probabil

32585
24:36:07,120 --> 24:36:10,872
face mult mai mult de două.

32586
24:36:09,360 --> 24:36:13,872
Doar că este doar o coincidență

32587
24:36:10,872 --> 24:36:13,872
într-adevăr.

32588
24:36:17,832 --> 24:36:21,512
În realitate, am testa foarte multe

32589
24:36:19,512 --> 24:36:24,640
mai multe date. Și de fapt o vom face

32590
24:36:21,512 --> 24:36:28,160
vezi de ce am face asta. Cum ar fi de ce

32591
24:36:24,640 --> 24:36:32,480
ne antrenăm modelul și apoi tipul de utilizare

32592
24:36:28,160 --> 24:36:34,000
date suplimentare pentru a o evalua?

32593
24:36:32,480 --> 24:36:36,400
De fapt, este foarte important ca noi

32594
24:36:34,000 --> 24:36:38,320
fă acel pas pentru a-ți da seama cât de bine

32595
24:36:36,400 --> 24:36:41,600
modelul nostru este înainte de a-l scoate

32596
24:36:38,320 --> 24:36:45,760
lumea reală. Deci dacă aplicăm modelul nostru

32597
24:36:41,600 --> 24:36:49,192
pe care le construim pe datele noastre de etichetă

32598
24:36:45,760 --> 24:36:52,160
um acest tip de set de date de testare pe care noi

32599
24:36:49,192 --> 24:36:54,160
nu au fost expuse înainte. Ajută

32600
24:36:52,160 --> 24:36:57,040
dă-ne un sentiment cât de bun este al nostru

32601
24:36:54,160 --> 24:37:00,280
model. Deci, este testat este de obicei folosit

32602
24:36:57,040 --> 24:37:00,280
pentru evaluare.

32603
24:37:00,480 --> 24:37:04,552
Deci asta e ceva care este ceva

32604
24:37:01,680 --> 24:37:07,120
vom studia.

32605
24:37:04,552 --> 24:37:11,832
Cum ne antrenăm? Uh, depinde de

32606
24:37:07,120 --> 24:37:14,232
model. Deci antrenamentul va fi un sens

32607
24:37:11,832 --> 24:37:16,480
va fi un algoritm care va um

32608
24:37:14,232 --> 24:37:19,440
practic actualizați modelul conform

32609
24:37:16,480 --> 24:37:21,040
datele. Aceste exemple etichetate. Hm

32610
24:37:19,440 --> 24:37:24,480
fiecare model va fi diferit

32611
24:37:21,040 --> 24:37:25,680
exact cum se antrenează. Deci vom merge

32612
24:37:24,480 --> 24:37:27,440
vom vorbi despre asta când vom

32613
24:37:25,680 --> 24:37:29,280
ajunge la modelele individuale pe care le vom

32614
24:37:27,440 --> 24:37:31,760
studiul.

32615
24:37:29,280 --> 24:37:35,040
Dar vorbind vag, ei pleacă

32616
24:37:31,760 --> 24:37:37,280
să folosească datele pentru a se ajusta. Ca

32617
24:37:35,040 --> 24:37:40,960
imaginați-vă reglați ca reglajul o grămadă de

32618
24:37:37,280 --> 24:37:43,512
butoane. Um, ca cel mai bun exemplu pe care pot

32619
24:37:40,960 --> 24:37:45,120
da-ți este noi, cred că am făcut asta

32620
24:37:43,512 --> 24:37:46,800
saptamana trecuta unde ai un fel de a

32621
24:37:45,120 --> 24:37:50,080
funcția

32622
24:37:46,800 --> 24:37:51,920
care prezice prețul și să spunem

32623
24:37:50,080 --> 24:37:54,640
are

32624
24:37:51,920 --> 24:37:58,720
um greutăți ca greutatea una cu caracteristică

32625
24:37:54,640 --> 24:38:01,040
unu, greutate doi cu caracteristica doi,

32626
24:37:58,720 --> 24:38:03,040
greutatea trei cu caracteristica trei. Deci

32627
24:38:01,040 --> 24:38:05,680
imaginați-vă că aveam trei caracteristici de intrare și

32628
24:38:03,040 --> 24:38:07,760
am construit un răspuns în funcție de asta.

32629
24:38:05,680 --> 24:38:12,160
În esență, ce am face pentru a ne antrena

32630
24:38:07,760 --> 24:38:15,760
modelul este ajustarea acestora

32631
24:38:12,160 --> 24:38:19,920
um, pentru a obține acest lucru corect pe baza

32632
24:38:15,760 --> 24:38:21,440
exemplele noastre etichetate.

32633
24:38:19,920 --> 24:38:22,640
Bine.

32634
24:38:21,440 --> 24:38:24,400
Deci asta e ceva ce vom învăța

32635
24:38:22,640 --> 24:38:26,000
despre venirea în scurt timp când noi când noi

32636
24:38:24,400 --> 24:38:27,192
de fapt scufundă-te în model. Fiecare model este

32637
24:38:26,000 --> 24:38:29,360
va fi ușor diferit în ceea ce privește modul

32638
24:38:27,192 --> 24:38:33,192
trenuri, dar la un nivel înalt merge

32639
24:38:29,360 --> 24:38:35,760
pentru a utiliza datele de antrenament cu acelea

32640
24:38:33,192 --> 24:38:38,960
exemple, nu? exemplele etichetate la

32641
24:38:35,760 --> 24:38:42,400
ajuta la ghidarea formulei în esență către

32642
24:38:38,960 --> 24:38:44,232
ajustați pentru a genera tipul potrivit de

32643
24:38:42,400 --> 24:38:45,360
model aici.

32644
24:38:44,232 --> 24:38:48,800
Aceste lucruri vor fi

32645
24:38:45,360 --> 24:38:52,720
ajustat în funcție de date

32646
24:38:48,800 --> 24:38:54,640
pentru a produce rezultatul corect.

32647
24:38:52,720 --> 24:38:57,640
Așa că gândește-te la acestea ca la butoane care vor

32648
24:38:54,640 --> 24:38:57,640
întoarce.

32649
24:38:59,512 --> 24:39:02,512
Bine.

32650
24:39:02,640 --> 24:39:06,800
Ce tip de învățare automată este

32651
24:39:04,080 --> 24:39:08,232
folosit? Probabil a supravegheat, care este

32652
24:39:06,800 --> 24:39:10,000
despre ce vorbim acum. Deci

32653
24:39:08,232 --> 24:39:12,000
probabil supravegheat pentru că majoritatea oamenilor

32654
24:39:10,000 --> 24:39:14,720
vreau să

32655
24:39:12,000 --> 24:39:16,232
um construi un tip de model pentru a prezice

32656
24:39:14,720 --> 24:39:22,040
ceva.

32657
24:39:16,232 --> 24:39:22,040
Da, aș spune că aș spune să supraveghez.

32658
24:39:25,120 --> 24:39:28,720
Da, suntem cu siguranță mergem

32659
24:39:26,480 --> 24:39:31,760
pentru a învăța să te antrenezi. Da, vom vedea.

32660
24:39:28,720 --> 24:39:33,760
Vom face codul. Um, o să-ți spun

32661
24:39:31,760 --> 24:39:34,960
despre cum se face. Da, suntem

32662
24:39:33,760 --> 24:39:36,640
cu siguranță o să-l învețe. Dar ce eu

32663
24:39:34,960 --> 24:39:38,720
spunea că este un fel de model

32664
24:39:36,640 --> 24:39:40,720
după model.

32665
24:39:38,720 --> 24:39:42,080
Așa că vreau să aștept până intrăm în

32666
24:39:40,720 --> 24:39:44,232
modele individuale, apoi vom vorbi despre

32667
24:39:42,080 --> 24:39:45,832
cum sunt antrenati.

32668
24:39:44,232 --> 24:39:48,832
Dar da, vom învăța cum să facem

32669
24:39:45,832 --> 24:39:48,832
că.

32670
24:39:52,480 --> 24:39:57,920
Dar da, supervizorul este folosit peste tot

32671
24:39:54,080 --> 24:40:00,000
locul. Chiar și pentru generativ

32672
24:39:57,920 --> 24:40:03,760
modele, folosesc învățarea supravegheată

32673
24:40:00,000 --> 24:40:06,872
pentru că um ca un LLM

32674
24:40:03,760 --> 24:40:09,680
va folosi exemple etichetate în

32675
24:40:06,872 --> 24:40:12,160
pentru a te antrena, nu? Pentru a se antrena

32676
24:40:09,680 --> 24:40:15,760
modul de a genera răspunsuri conform

32677
24:40:12,160 --> 24:40:18,320
solicitări. Trebuie să învețe împotriva unui

32678
24:40:15,760 --> 24:40:21,280
multe exemple de text.

32679
24:40:18,320 --> 24:40:24,232
Deci, acea învățare supravegheată este ceea ce

32680
24:40:21,280 --> 24:40:26,000
rezultă în acel model,

32681
24:40:24,232 --> 24:40:29,000
nu? Învățând de la cei etichetați

32682
24:40:26,000 --> 24:40:29,000
exemple.

32683
24:40:36,080 --> 24:40:39,080
Bine.

32684
24:40:42,640 --> 24:40:48,720
Este da imagine imagine uh o mulțime de um

32685
24:40:47,192 --> 24:40:52,000
da, o mulțime de procesare a imaginilor este

32686
24:40:48,720 --> 24:40:54,552
supravegheat ca detectarea obiectelor. Deci

32687
24:40:52,000 --> 24:40:57,192
Modelul YOLO este un model de detectare a obiectelor.

32688
24:40:54,552 --> 24:41:00,800
Da. Pentru că trebuie antrenat

32689
24:40:57,192 --> 24:41:04,080
corect. Trebuie să fie antrenat pe uh, așa are

32690
24:41:00,800 --> 24:41:06,800
a fi instruit pe imagini

32691
24:41:04,080 --> 24:41:09,280
cu etichete ca acesta este obiectul

32692
24:41:06,800 --> 24:41:11,440
este în această imagine. Aceasta este cutia din jur

32693
24:41:09,280 --> 24:41:15,600
obiectul.

32694
24:41:11,440 --> 24:41:18,960
Hm da. Deci dacă dacă este dacă folosește vreodată

32695
24:41:15,600 --> 24:41:21,192
etichetați datele pentru a antrena și a construi modelul,

32696
24:41:18,960 --> 24:41:24,552
este supravegheat. Deci YOLO este cu siguranță

32697
24:41:21,192 --> 24:41:26,960
supravegheat și de fapt vom face noi

32698
24:41:24,552 --> 24:41:29,192
va acoperi modelul YOLO mai târziu

32699
24:41:26,960 --> 24:41:31,680
cursul nostru de deep learning. Vorbim despre

32700
24:41:29,192 --> 24:41:34,720
detectarea obiectelor.

32701
24:41:31,680 --> 24:41:38,360
Deci, vom studia asta.

32702
24:41:34,720 --> 24:41:38,360
Dar da, este supravegheat

32703
24:41:45,120 --> 24:41:50,872
Bine. Deci, pe slide avem câteva

32704
24:41:48,320 --> 24:41:53,600
algoritmi comuni de învățare supravegheată

32705
24:41:50,872 --> 24:41:55,760
adica vom studia. Deci toate astea

32706
24:41:53,600 --> 24:41:58,160
vom studia și vom înțelege ce au

32707
24:41:55,760 --> 24:42:00,552
fac și cum funcționează, dar doar îți oferă

32708
24:41:58,160 --> 24:42:02,720
unii pentru a le numi. regresia liniară este

32709
24:42:00,552 --> 24:42:06,160
un fel de cel pe care tocmai l-am desenat care este

32710
24:42:02,720 --> 24:42:08,232
um, acesta este prototipul

32711
24:42:06,160 --> 24:42:11,280
cel mai ușor de înțeles model care este amabil

32712
24:42:08,232 --> 24:42:14,160
de um exact așa unde noi

32713
24:42:11,280 --> 24:42:17,280
au o greutate ori o caracteristică

32714
24:42:14,160 --> 24:42:19,680
um o greutate ori o caracteristică și apoi a

32715
24:42:17,280 --> 24:42:21,440
greutatea ori o caracteristică

32716
24:42:19,680 --> 24:42:23,440
și mai departe și mai departe. Poți avea ca

32717
24:42:21,440 --> 24:42:26,720
multe câte vrei.

32718
24:42:23,440 --> 24:42:29,192
um, aceasta este o regresie liniară. Și așa

32719
24:42:26,720 --> 24:42:33,040
asta e un model supravegheat

32720
24:42:29,192 --> 24:42:36,320
pentru că avem nevoie de această valoare aici și noi

32721
24:42:33,040 --> 24:42:38,552
am nevoie de toate contribuțiile noastre pentru a putea

32722
24:42:36,320 --> 24:42:40,480
antrenează de fapt acest model și generează

32723
24:42:38,552 --> 24:42:45,192
toate acele greutăți

32724
24:42:40,480 --> 24:42:48,080
um că asta este uh care folosește um etichetat

32725
24:42:45,192 --> 24:42:49,760
exemple pentru a ajuta la reglarea tuturor acelor butoane.

32726
24:42:48,080 --> 24:42:50,800
La fel cu toate celelalte modele. Deci,

32727
24:42:49,760 --> 24:42:51,512
vom vorbi despre decizie

32728
24:42:50,800 --> 24:42:53,760
copaci. Vom vorbi despre

32729
24:42:51,512 --> 24:42:56,000
regresia logistică și și SVM-uri, care

32730
24:42:53,760 --> 24:42:57,360
sunt mașini vector suport. Vom vorbi

32731
24:42:56,000 --> 24:42:59,920
despre toate acestea, dar sunt toate

32732
24:42:57,360 --> 24:43:01,832
exemple de supravegheat uh supravegheat

32733
24:42:59,920 --> 24:43:05,512
învăţarea.

32734
24:43:01,832 --> 24:43:08,320
Bine, vom vorbi despre toate acestea.

32735
24:43:05,512 --> 24:43:10,720
Toți sunt supravegheați pentru că toți

32736
24:43:08,320 --> 24:43:13,512
necesită exemple etichetate pentru a

32737
24:43:10,720 --> 24:43:17,480
antrenează-le și apoi folosește-le ulterior

32738
24:43:13,512 --> 24:43:17,480
ei. Bine.

32739
24:43:25,280 --> 24:43:29,120
Bine. Deci, care sunt unele cazuri de utilizare

32740
24:43:26,800 --> 24:43:30,960
exemple? Deci, de exemplu, în uh

32741
24:43:29,120 --> 24:43:33,280
învățarea supravegheată pe care o putem prezice

32742
24:43:30,960 --> 24:43:36,160
temperatura bazată pe temperatura anuală

32743
24:43:33,280 --> 24:43:40,080
tendinte. Deci am avea asta anual

32744
24:43:36,160 --> 24:43:42,400
date ca um ca exemplele noastre etichetate

32745
24:43:40,080 --> 24:43:44,960
iar aceia ar supraveghea învăţarea

32746
24:43:42,400 --> 24:43:46,872
a unui model care prezice temperatura.

32747
24:43:44,960 --> 24:43:50,400
Același lucru cu prognoza recoltei

32748
24:43:46,872 --> 24:43:51,832
randamentul bazat pe calitatea recoltei sezoniere

32749
24:43:50,400 --> 24:43:54,960
schimbari. Deci poate avem o grămadă de

32750
24:43:51,832 --> 24:43:58,720
caracteristici legate de calitatea recoltei. Noi

32751
24:43:54,960 --> 24:44:01,440
ar putea prezice randamentul culturii. Hm, am face-o

32752
24:43:58,720 --> 24:44:03,680
am nevoie doar de exemple istorice cu acelea

32753
24:44:01,440 --> 24:44:07,760
etichete, nu? Care este randamentul culturii

32754
24:44:03,680 --> 24:44:09,680
pentru fiecare perioadă de timp. Să zicem că am face-o

32755
24:44:07,760 --> 24:44:12,232
am nevoie doar de acele exemple supravegheate

32756
24:44:09,680 --> 24:44:13,680
și am putea construi cu ușurință un model

32757
24:44:12,232 --> 24:44:15,360
ea.

32758
24:44:13,680 --> 24:44:17,832
Hm

32759
24:44:15,360 --> 24:44:19,440
uh, acesta din urmă sortând deșeurile

32760
24:44:17,832 --> 24:44:22,400
pe baza deșeurilor cunoscute și a acestora

32761
24:44:19,440 --> 24:44:24,232
tipurile de deșeuri corespunzătoare. Hm asta e

32762
24:44:22,400 --> 24:44:27,192
un fel de spam. Este ca și filtrarea

32763
24:44:24,232 --> 24:44:29,832
practic ca o filtrare de spam. Um asa

32764
24:44:27,192 --> 24:44:32,552
Gândește-te la asta ca la exemplul formelor.

32765
24:44:29,832 --> 24:44:34,872
Sortăm lucrurile în pătrate, cercuri,

32766
24:44:32,552 --> 24:44:36,800
triunghiuri. Um, același tip de idee aici

32767
24:44:34,872 --> 24:44:40,480
unde avem o grămadă de exemple

32768
24:44:36,800 --> 24:44:43,760
ce acelea um ce acele articole de deșeuri

32769
24:44:40,480 --> 24:44:45,120
ar trebui să aparțină, cum ar fi

32770
24:44:43,760 --> 24:44:50,000
coșurile de gunoi la care ar merge, pentru

32771
24:44:45,120 --> 24:44:53,280
exemplu. Um, și acestea ar putea fi etichetate

32772
24:44:50,000 --> 24:44:55,280
și prin urmare am putea um

32773
24:44:53,280 --> 24:44:57,440
să înțeleagă ce categorie de deșeuri au

32774
24:44:55,280 --> 24:44:59,920
aparțin.

32775
24:44:57,440 --> 24:45:02,232
Um, același lucru cu spam-ul. Ceva este

32776
24:44:59,920 --> 24:45:03,680
fraudă sau nu fraudă. spam sau nu spam,

32777
24:45:02,232 --> 24:45:05,760
cancer sau nu cancer. Toate acestea sunt

32778
24:45:03,680 --> 24:45:07,680
vor fi exemple de învățare supravegheate

32779
24:45:05,760 --> 24:45:09,600
pentru că vor cere înăuntru

32780
24:45:07,680 --> 24:45:12,552
pentru a-i antrena, vor face

32781
24:45:09,600 --> 24:45:15,920
necesită date care au acele etichete.

32782
24:45:12,552 --> 24:45:20,232
Bine? Deci, orice are etichete este

32783
24:45:15,920 --> 24:45:23,120
va fi învățare supravegheată. Deci

32784
24:45:20,232 --> 24:45:26,232
din nou, aici vom cheltui

32785
24:45:23,120 --> 24:45:29,120
probabil cea mai mare parte a timpului nostru este

32786
24:45:26,232 --> 24:45:31,600
fac probleme de învățare supravegheată, alea

32787
24:45:29,120 --> 24:45:32,720
că avem date etichetate. Suntem

32788
24:45:31,600 --> 24:45:35,760
construim un model și vom face

32789
24:45:32,720 --> 24:45:38,760
prezice acele etichete

32790
24:45:35,760 --> 24:45:38,760
în esență.

32791
24:45:44,400 --> 24:45:52,192
Bine, înainte de a merge la nesupravegheat, oricare

32792
24:45:47,440 --> 24:45:52,192
întrebări despre uh supravegheat.

32793
24:46:04,232 --> 24:46:07,232
Bine.

32794
24:46:07,360 --> 24:46:14,552
În regulă. Deci supravegheat necesită etichete

32795
24:46:11,600 --> 24:46:17,040
pentru a avea un exemplu din care să plece

32796
24:46:14,552 --> 24:46:19,760
pentru a vă construi modelul. Și asta pentru că

32797
24:46:17,040 --> 24:46:21,600
tu prezici astfel de rezultate

32798
24:46:19,760 --> 24:46:25,280
ca spam sau nu spam, cancer sau nu

32799
24:46:21,600 --> 24:46:28,232
cancer. Acum, învățarea nesupravegheată este

32800
24:46:25,280 --> 24:46:32,480
complet diferit. Este opusul.

32801
24:46:28,232 --> 24:46:35,680
Deci, învățarea nesupravegheată este locul în care facem

32802
24:46:32,480 --> 24:46:38,232
nu folosiți etichete. Deci nu suntem

32803
24:46:35,680 --> 24:46:40,320
folosind orice etichetă. Deci este tot

32804
24:46:38,232 --> 24:46:42,480
poate fi complet neetichetat sau chiar dacă

32805
24:46:40,320 --> 24:46:45,440
este etichetat, nu folosim etichete

32806
24:46:42,480 --> 24:46:48,800
orice fel. Dar am spune în primul rând

32807
24:46:45,440 --> 24:46:50,400
sunt date neetichetate. Nu avem nicio îndrumare

32808
24:46:48,800 --> 24:46:54,400
pentru că nu folosim etichetele în

32809
24:46:50,400 --> 24:46:56,232
orice fel. Nu avem nicio îndrumare pentru um

32810
24:46:54,400 --> 24:46:57,512
prezice orice, dar asta pentru că

32811
24:46:56,232 --> 24:46:59,600
nu prea prezicem nimic

32812
24:46:57,512 --> 24:47:01,192
învăţare nesupravegheată. În general, ce

32813
24:46:59,600 --> 24:47:03,920
facem este să căutăm unele

32814
24:47:01,192 --> 24:47:05,512
structura sau modelul.

32815
24:47:03,920 --> 24:47:07,920
Bine, cu învățare nesupravegheată, suntem

32816
24:47:05,512 --> 24:47:12,800
căutând o structură sau un model.

32817
24:47:07,920 --> 24:47:14,480
Deci, um, un tip de exemplu care este foarte

32818
24:47:12,800 --> 24:47:17,512
foarte popular va fi acest al doilea

32819
24:47:14,480 --> 24:47:20,320
unul, care este, um, identificarea

32820
24:47:17,512 --> 24:47:22,800
identificarea grupurilor de utilizatori pe baza

32821
24:47:20,320 --> 24:47:25,600
asemănări sau puncte comune. Acum, asta

32822
24:47:22,800 --> 24:47:28,920
va fi o problemă cunoscută în principiu

32823
24:47:25,600 --> 24:47:28,920
ca grupare

32824
24:47:29,440 --> 24:47:33,280
și este o problemă pe care o vom studia destul de a

32825
24:47:31,440 --> 24:47:35,192
pic. se va dovedi a fi

32826
24:47:33,280 --> 24:47:37,600
o mulțime de algoritmi diferiți care pot

32827
24:47:35,192 --> 24:47:39,600
realiza clustering. Deci ce

32828
24:47:37,600 --> 24:47:43,040
gruparea încercărilor de a face este practic

32829
24:47:39,600 --> 24:47:46,320
spune că avem date care sunt așa și

32830
24:47:43,040 --> 24:47:48,552
apoi date aici și apoi date peste

32831
24:47:46,320 --> 24:47:50,320
aici. Să le grupăm împreună.

32832
24:47:48,552 --> 24:47:51,832
Deci, așa ar trebui să fie un singur grup, acesta

32833
24:47:50,320 --> 24:47:54,552
ar trebui să fie un singur grup și acesta ar trebui să fie

32834
24:47:51,832 --> 24:47:57,192
un grup. Și le putem găsi

32835
24:47:54,552 --> 24:48:00,080
structuri și spuneți bine, acesta este un grup

32836
24:47:57,192 --> 24:48:02,160
unu, acesta este grupul doi și acesta este grupul

32837
24:48:00,080 --> 24:48:05,360
trei.

32838
24:48:02,160 --> 24:48:07,832
unu, doi, trei. Și, practic, putem

32839
24:48:05,360 --> 24:48:11,680
construim ceea ce am numi clustere de

32840
24:48:07,832 --> 24:48:13,680
date um bazate pe cât de aproape unul de celălalt

32841
24:48:11,680 --> 24:48:16,872
punctele sunt cam situate în acest fel

32842
24:48:13,680 --> 24:48:18,640
de zone de cluster ca aceste casete pe care le am

32843
24:48:16,872 --> 24:48:20,552
desenat.

32844
24:48:18,640 --> 24:48:22,480
Bine. Acum, asta nu necesită niciunul

32845
24:48:20,552 --> 24:48:24,552
etichetă de făcut, ceea ce este cu adevărat fascinant.

32846
24:48:22,480 --> 24:48:26,160
Deci, nesupravegheat, nu ai nevoie de niciunul

32847
24:48:24,552 --> 24:48:29,280
eticheta la toate pentru a realiza

32848
24:48:26,160 --> 24:48:30,552
algoritm. Așadar, gruparea este una bună

32849
24:48:29,280 --> 24:48:33,120
exemplu.

32850
24:48:30,552 --> 24:48:34,872
um găsirea unor valori aberante sau anomalii este

32851
24:48:33,120 --> 24:48:37,360
alta. Deci nu avem neapărat

32852
24:48:34,872 --> 24:48:40,400
orice etichetă a ceea ce este un outlier sau ce

32853
24:48:37,360 --> 24:48:43,040
este o anomalie. Deducem asta din

32854
24:48:40,400 --> 24:48:45,600
numai caracteristicile. Nu există îndrumare.

32855
24:48:43,040 --> 24:48:49,120
Nu există nicio etichetă pentru a face like

32856
24:48:45,600 --> 24:48:50,960
detectarea valorii aberante sau detectarea anomaliilor.

32857
24:48:49,120 --> 24:48:55,280
Bine, deci acesta este un alt exemplu bun.

32858
24:48:50,960 --> 24:48:57,120
Una care nu este listată aici, dar este

32859
24:48:55,280 --> 24:48:59,440
de asemenea foarte important că vom studia

32860
24:48:57,120 --> 24:49:01,512
este ceva cunoscut sub numele de dimensionalitate

32861
24:48:59,440 --> 24:49:05,360
reducerea.

32862
24:49:01,512 --> 24:49:08,800
Atât de slabă reducere și ce asta

32863
24:49:05,360 --> 24:49:11,920
se concentrează pe este practic comprimarea

32864
24:49:08,800 --> 24:49:15,040
set de date un pic. Așa că ne luăm datele și

32865
24:49:11,920 --> 24:49:17,680
practic comprima-l um astfel încât, dar noi

32866
24:49:15,040 --> 24:49:20,552
faceți-o în așa fel încât să reținem ca

32867
24:49:17,680 --> 24:49:23,192
cât de multe informații putem. Acesta este un

32868
24:49:20,552 --> 24:49:26,960
foarte asemanator cu compresia inteligenta si ce e

32869
24:49:23,192 --> 24:49:29,120
face este că scade dimensiunea. Hm

32870
24:49:26,960 --> 24:49:32,320
dimensiune Gândește-te la dimensiune ca fiind asemănătoare

32871
24:49:29,120 --> 24:49:34,400
numărul de coloane.

32872
24:49:32,320 --> 24:49:37,360
Numărul de coloane.

32873
24:49:34,400 --> 24:49:38,960
Așa că imaginați-vă că avem 100 de coloane într-o dată

32874
24:49:37,360 --> 24:49:42,720
cadru. Ceea ce am putea face este de fapt

32875
24:49:38,960 --> 24:49:47,040
reduceți-l la 10. Deci cam 10% din

32876
24:49:42,720 --> 24:49:49,600
că. Așa că o reducem la 10. Și um

32877
24:49:47,040 --> 24:49:54,232
dar cei 10 sunt, nu e ca noi

32878
24:49:49,600 --> 24:49:56,080
a tăiat alte 90 de coloane. Noi um

32879
24:49:54,232 --> 24:49:59,832
inteligent cam comprimat toate astea

32880
24:49:56,080 --> 24:50:01,920
informații în aceste 10 noi coloane um

32881
24:49:59,832 --> 24:50:04,960
care sunt versiuni comprimate ale

32882
24:50:01,920 --> 24:50:07,040
o sută pe care o aveam noi. Um asa

32883
24:50:04,960 --> 24:50:09,040
reducerea dimensionalității este alta

32884
24:50:07,040 --> 24:50:13,680
tehnică nesupravegheată. Este nevoie de nr

32885
24:50:09,040 --> 24:50:15,680
îndrumări, nicio etichetă de făcut, dar este um a

32886
24:50:13,680 --> 24:50:17,440
tehnică cu adevărat utilă pentru a reduce

32887
24:50:15,680 --> 24:50:20,480
dimensiunea datelor tale dacă faci lucruri

32888
24:50:17,440 --> 24:50:23,192
cu ea. Hm, deci acesta este altul care

32889
24:50:20,480 --> 24:50:24,640
vom studia cum să o facem și

32890
24:50:23,192 --> 24:50:26,720
practic mai multe detalii în spatele ei, ce

32891
24:50:24,640 --> 24:50:30,000
algoritmii sunt.

32892
24:50:26,720 --> 24:50:31,512
Probabil că îi vom intra pe cei doi

32893
24:50:30,000 --> 24:50:33,360
nesupravegheat va cheltui cea mai mare sumă

32894
24:50:31,512 --> 24:50:36,360
de timp pe clustering și dimensionalitate

32895
24:50:33,360 --> 24:50:36,360
reducerea.

32896
24:50:42,232 --> 24:50:46,552
uh și supravegheat dacă unele date sunt

32897
24:50:43,920 --> 24:50:49,280
prezent, dar nu am etichetat înseamnă în

32898
24:50:46,552 --> 24:50:53,720
exemplu, am avut cerc triunghi pătrat în

32899
24:50:49,280 --> 24:50:53,720
datele de antrenament le adăugăm pentagon

32900
24:50:58,960 --> 24:51:03,960
dar nu am etichetat asta în acest caz

32901
24:51:04,160 --> 24:51:10,160
uh da, deci fiecare um este supravegheat

32902
24:51:07,192 --> 24:51:12,800
învățarea, fiecare rând, gândește-te la asta ca

32903
24:51:10,160 --> 24:51:14,872
ca fiecare rând din cadrul nostru de date are nevoie

32904
24:51:12,800 --> 24:51:16,960
să aibă o etichetă

32905
24:51:14,872 --> 24:51:21,640
asociat cu el. Trebuie să aibă un

32906
24:51:16,960 --> 24:51:21,640
o coloană care reprezintă eticheta.

32907
24:51:21,760 --> 24:51:27,640
Deci, dacă nu am mai văzut niciodată Pentagonul,

32908
24:51:23,600 --> 24:51:27,640
Nu pot folosi asta ca etichetă.

32909
24:51:29,040 --> 24:51:35,120
Deci, trebuie ca Pentagonul să existe

32910
24:51:32,232 --> 24:51:38,440
în date dacă voi putea

32911
24:51:35,120 --> 24:51:38,440
prezice,

32912
24:51:41,280 --> 24:51:45,360
nu? Deci, nu pot prezice, nu? Dacă

32913
24:51:43,192 --> 24:51:47,192
nu l-am mai văzut până acum, nu avem

32914
24:51:45,360 --> 24:51:50,000
exemple pentru a merge. Nu avem nicio îndrumare.

32915
24:51:47,192 --> 24:51:54,440
Deci, cum am putea prezice asta?

32916
24:51:50,000 --> 24:51:54,440
Corect? Nu o putem prezice.

32917
24:52:05,512 --> 24:52:11,280
dacă este dacă este acolo. Deci dacă dacă noi

32918
24:52:08,232 --> 24:52:14,000
au etichete ale Pentagonului, să spunem, atunci

32919
24:52:11,280 --> 24:52:17,000
Da, am putea prezice Pentagonul. Noi

32920
24:52:14,000 --> 24:52:17,000
putea

32921
24:52:29,280 --> 24:52:33,232
îndepărtați. Elimina ce?

32922
24:52:36,232 --> 24:52:39,760
Nu am face-o dacă ar fi vorba despre

32923
24:52:37,600 --> 24:52:42,640
Pentagon, nu am elimina asta. nu,

32924
24:52:39,760 --> 24:52:46,232
lasă-mă să mă întorc la pagina respectivă. Noi nu am face-o

32925
24:52:42,640 --> 24:52:47,600
îndepărtați-l. Hm, este doar dacă nu este înăuntru

32926
24:52:46,232 --> 24:52:50,800
etichetele noastre, nu vom putea

32927
24:52:47,600 --> 24:52:55,512
să o prezic. Deci, Pentagonul e bun

32928
24:52:50,800 --> 24:52:58,480
exemplu aici. Uh, Pentagonul nu este unul dintre

32929
24:52:55,512 --> 24:53:00,720
etichetele noastre. Deci, în prezent nu este în

32930
24:52:58,480 --> 24:53:02,400
setul nostru de date ca una dintre etichete. Noi

32931
24:53:00,720 --> 24:53:05,832
au doar date care sunt fie un triunghi,

32932
24:53:02,400 --> 24:53:08,640
cerc sau un pătrat. Nu avem

32933
24:53:05,832 --> 24:53:11,280
pentagon. Deci, nu aș putea niciodată

32934
24:53:08,640 --> 24:53:13,192
prezice pentagonul. Nu voi putea niciodată

32935
24:53:11,280 --> 24:53:15,360
fă asta dacă nu am văzut exemple

32936
24:53:13,192 --> 24:53:17,832
înainte.

32937
24:53:15,360 --> 24:53:19,600
Bine. Dar să presupunem că am avut asta în

32938
24:53:17,832 --> 24:53:23,232
acolo.

32939
24:53:19,600 --> 24:53:23,232
Deci am avut Pentagonul.

32940
24:53:24,960 --> 24:53:32,360
Deci dacă am avea Pentagon, am putea avea

32941
24:53:27,920 --> 24:53:32,360
un exemplu în etichetele noastre

32942
24:53:37,040 --> 24:53:42,440
și apoi da, noi ar putea fi atunci noi

32943
24:53:38,960 --> 24:53:42,440
putea să o prezică.

32944
24:53:46,552 --> 24:53:51,040
Da. Da. Nu vă faceți griji.

32945
24:53:48,720 --> 24:53:53,192
Nu vă faceți griji pentru datele de testare. Deci

32946
24:53:51,040 --> 24:53:55,360
datele de testare spun doar că iată o nouă

32947
24:53:53,192 --> 24:53:57,832
iată o formă. Ce este? Bine, asta e

32948
24:53:55,360 --> 24:53:59,512
un pătrat. Iată o formă. Ce este?

32949
24:53:57,832 --> 24:54:01,280
Bine, acesta este un triunghi. Și am putea

32950
24:53:59,512 --> 24:54:03,760
avem la fel de multe dintre acele exemple ca noi

32951
24:54:01,280 --> 24:54:06,080
dorim în datele noastre de testare. Deci am putea avea

32952
24:54:03,760 --> 24:54:09,480
un cerc și spune, bine, ce este asta?

32953
24:54:06,080 --> 24:54:09,480
Ar trebui să fie cerc,

32954
24:54:09,680 --> 24:54:13,680
nu? Datele de testare pot fi orice

32955
24:54:11,832 --> 24:54:15,040
orice vrea. Dar da, dacă am făcut-o

32956
24:54:13,680 --> 24:54:18,920
N-am mai văzut Pentagonul până acum, nu suntem niciodată

32957
24:54:15,040 --> 24:54:18,920
va fi capabil să o prezică.

32958
24:54:25,920 --> 24:54:31,360
Acestea sunt datele și etichetele etichetei

32959
24:54:29,040 --> 24:54:34,960
practic vorbesc despre același lucru

32960
24:54:31,360 --> 24:54:39,280
lucru. Etichetele înseamnă doar care sunt

32961
24:54:34,960 --> 24:54:41,280
categorii care sunt prezente în datele noastre.

32962
24:54:39,280 --> 24:54:45,000
Deci în aceste date avem doar trei

32963
24:54:41,280 --> 24:54:45,000
etichete care sunt prezente.

32964
24:54:48,800 --> 24:54:54,720
Deci etichetele sunt relativ la noi

32965
24:54:51,360 --> 24:54:58,040
date de etichetă, nu? Se spune

32966
24:54:54,720 --> 24:54:58,040
ce etichete,

32967
24:54:58,552 --> 24:55:05,680
scuză-mă, ce etichete avem

32968
24:55:03,512 --> 24:55:08,480
în datele noastre și avem doar acele trei

32969
24:55:05,680 --> 24:55:10,160
cerc, triunghi, pătrat. Deci așa și Pentagonul

32970
24:55:08,480 --> 24:55:13,872
nu ar face parte din acele etichete. Noi

32971
24:55:10,160 --> 24:55:13,872
nu puteam prezice.

32972
24:55:24,480 --> 24:55:29,760
Nu. Deci nesupravegheat nu va face

32973
24:55:27,680 --> 24:55:31,512
o previziune. Asta e marea diferenta

32974
24:55:29,760 --> 24:55:34,720
cu nesupravegheat. Nu o vor face

32975
24:55:31,512 --> 24:55:36,320
faceți o astfel de predicție. Um asa

32976
24:55:34,720 --> 24:55:37,832
nesupravegheat nu va face a

32977
24:55:36,320 --> 24:55:40,640
predictie. O să facă ceva

32978
24:55:37,832 --> 24:55:42,480
diferit ca um practic spune ca

32979
24:55:40,640 --> 24:55:45,040
băieții ăștia sunt asemănători, ăștia sunt

32980
24:55:42,480 --> 24:55:46,640
similare, acestea sunt similare, aceasta este a

32981
24:55:45,040 --> 24:55:50,080
cluster, acesta este un cluster, acesta este un

32982
24:55:46,640 --> 24:55:52,160
cluster. Nu va face un

32983
24:55:50,080 --> 24:55:55,552
predictie. Asta a supravegheat

32984
24:55:52,160 --> 24:55:55,552
învăţarea face.

32985
24:55:56,720 --> 24:56:01,920
Clustering, da, care este nesupravegheat,

32986
24:55:59,280 --> 24:56:03,760
da, gruparea nu necesită niciuna

32987
24:56:01,920 --> 24:56:05,512
etichete. Nesupravegheat înseamnă doar că nu

32988
24:56:03,760 --> 24:56:08,080
au orice etichetă. Nu avem nevoie de niciunul

32989
24:56:05,512 --> 24:56:08,080
etichete.

32990
24:56:24,080 --> 24:56:29,120
Deci celălalt lucru nesupravegheat ar putea face

32991
24:56:26,232 --> 24:56:31,832
s-ar putea spune

32992
24:56:29,120 --> 24:56:35,192
și din nou fără etichete s-ar putea

32993
24:56:31,832 --> 24:56:35,192
spuneți că acesta este o situație anormală.

32994
24:56:36,552 --> 24:56:40,320
s-ar putea spune că acest tip este un outlier

32995
24:56:38,640 --> 24:56:42,872
pentru că există doar, există doar unul dintre

32996
24:56:40,320 --> 24:56:45,280
acelea și nu sunt ca celelalte. Deci

32997
24:56:42,872 --> 24:56:50,600
că asta e ceva ce e

32998
24:56:45,280 --> 24:56:50,600
ceva ce ar putea face nesupravegheat.

32999
24:56:54,960 --> 24:57:03,600
Da și nu. E un fel de etichete

33000
24:56:59,600 --> 24:57:05,920
un grup în sensul că um ar fi

33001
24:57:03,600 --> 24:57:08,960
practic, atribuiți-i un număr ca

33002
24:57:05,920 --> 24:57:13,920
acesta este clusterul unu, acesta este clusterul

33003
24:57:08,960 --> 24:57:15,832
doi, acesta este grupul trei.

33004
24:57:13,920 --> 24:57:17,760
Îi va atribui un număr, dar este

33005
24:57:15,832 --> 24:57:20,160
nu prea semnificativ pe care nu îl atribuie

33006
24:57:17,760 --> 24:57:22,872
ca o etichetă de predicție în în

33007
24:57:20,160 --> 24:57:24,960
sensul tradițional al unei etichete.

33008
24:57:22,872 --> 24:57:26,872
Oferă ca un index numeric

33009
24:57:24,960 --> 24:57:29,440
pentru cluster pentru ca ceea ce vrem

33010
24:57:26,872 --> 24:57:31,440
a ști este ca în regulă tipul ăsta are

33011
24:57:29,440 --> 24:57:33,120
cluster de unul. Acest tip îi aparține

33012
24:57:31,440 --> 24:57:35,360
cluster unu. Tipul ăsta aparține grupului

33013
24:57:33,120 --> 24:57:37,360
unul. Tipul ăsta aparține grupului doi.

33014
24:57:35,360 --> 24:57:38,640
Tipul ăsta aparține grupului doi. Face

33015
24:57:37,360 --> 24:57:40,960
asta are sens? Deci trebuie să existe

33016
24:57:38,640 --> 24:57:43,440
unele ca index al grupului de tine

33017
24:57:40,960 --> 24:57:46,232
aparțin.

33018
24:57:43,440 --> 24:57:50,760
Deci este un fel ca o etichetă, dar nu în interior

33019
24:57:46,232 --> 24:57:50,760
sensul tradițional de predicție similară.

33020
24:58:00,232 --> 24:58:03,232
Foarte

33021
24:58:15,760 --> 24:58:22,320
bun. Deci, din nou, nesupravegheat, fără etichete.

33022
24:58:19,680 --> 24:58:24,720
Faci lucruri de genul

33023
24:58:22,320 --> 24:58:27,440
identificarea clusterelor,

33024
24:58:24,720 --> 24:58:29,360
um identificând valori aberante, fac

33025
24:58:27,440 --> 24:58:32,080
reducerea dimensionalității. Acestea sunt toate

33026
24:58:29,360 --> 24:58:34,720
orientat spre structură și model

33027
24:58:32,080 --> 24:58:37,600
lucruri. Nu sunt predicții pentru a

33028
24:58:34,720 --> 24:58:42,192
eticheta. Bine? Nu sunt ceea ce

33029
24:58:37,600 --> 24:58:42,192
am vedea în învăţarea supravegheată.

33030
24:58:46,320 --> 24:58:53,600
Bine. Deci un exemplu ar fi că noi

33031
24:58:49,360 --> 24:58:57,512
luăm, punem datele pe care le putem grupa

33032
24:58:53,600 --> 24:59:00,160
împreună uh date cum ar fi imagini în

33033
24:58:57,512 --> 24:59:01,920
categorii bazate pe asemănări um

33034
24:59:00,160 --> 24:59:04,400
care ar fi ca acele clustere. Deci

33035
24:59:01,920 --> 24:59:06,080
nu există aceste grupuri ar fi noi

33036
24:59:04,400 --> 24:59:07,760
nu au nicio etichetă în avans

33037
24:59:06,080 --> 24:59:09,760
parcă nu avem, nu spunem asta

33038
24:59:07,760 --> 24:59:12,160
această imagine ar trebui să aparțină acestui lucru

33039
24:59:09,760 --> 24:59:14,320
imaginea ar trebui să aparțină acestui lucru pe care îl derivăm

33040
24:59:12,160 --> 24:59:18,552
că din caracteristicile celui

33041
24:59:14,320 --> 24:59:21,832
date. Gândește-te așa cum este un exemplu bun

33042
24:59:18,552 --> 24:59:24,552
um grupuri de clienți. Deci ne-am identifica

33043
24:59:21,832 --> 24:59:27,120
clienții se bazează pe cum bine fac

33044
24:59:24,552 --> 24:59:29,512
au niveluri similare de cheltuieli? Câți

33045
24:59:27,120 --> 24:59:31,680
zile merg la cumpărături într-o săptămână? Cum

33046
24:59:29,512 --> 24:59:33,600
multi bani cheltuiesc? Și putem

33047
24:59:31,680 --> 24:59:36,160
un fel de grupare pe bază de clienți

33048
24:59:33,600 --> 24:59:38,720
pe calități similare.

33049
24:59:36,160 --> 24:59:41,040
Clustering va găsi acele grupuri care

33050
24:59:38,720 --> 24:59:43,280
ar trebui să existe.

33051
24:59:41,040 --> 24:59:47,680
um va descoperi acele grupuri bazate

33052
24:59:43,280 --> 24:59:49,920
pe um asemănările în date, dar

33053
24:59:47,680 --> 24:59:52,640
nu există etichete care să spună ca

33054
24:59:49,920 --> 24:59:54,480
această persoană ar trebui să fie în acest grup,

33055
24:59:52,640 --> 24:59:57,040
această persoană ar trebui să fie în asta înaintea

33056
24:59:54,480 --> 24:59:59,040
timp. Nu există etichete pentru asta. Se ajunge

33057
24:59:57,040 --> 25:00:02,040
derivate în timpul algoritmului. Este

33058
24:59:59,040 --> 25:00:02,040
nesupravegheat,

33059
25:00:02,640 --> 25:00:07,440
corect? Nu există cu adevărat nesupravegheat

33060
25:00:04,720 --> 25:00:09,360
literal înseamnă nicio îndrumare. Nu există

33061
25:00:07,440 --> 25:00:11,192
îndrumare pentru a o face. Doar deducem

33062
25:00:09,360 --> 25:00:14,680
că din structura datelor

33063
25:00:11,192 --> 25:00:14,680
care sunt asemănările.

33064
25:00:27,832 --> 25:00:30,832
Bine.

33065
25:00:33,680 --> 25:00:39,832
În regulă. Deci,

33066
25:00:36,720 --> 25:00:44,960
încă câteva pentru tine. Deci am avut um

33067
25:00:39,832 --> 25:00:47,512
supravegheat care folosește etichetele. Noi

33068
25:00:44,960 --> 25:00:49,760
au nesupravegheat care nu folosește etichete

33069
25:00:47,512 --> 25:00:52,720
cautand structura. Și apoi avem

33070
25:00:49,760 --> 25:00:56,480
ceva care este cam la mijloc

33071
25:00:52,720 --> 25:00:59,440
care este um ceea ce este cunoscut ca

33072
25:00:56,480 --> 25:01:03,120
învăţare semisupravegheată. Și aceasta este

33073
25:00:59,440 --> 25:01:05,920
unde folosești o combinație de puțin

33074
25:01:03,120 --> 25:01:09,280
un pic de date de etichetă, dar majoritatea datelor dvs

33075
25:01:05,920 --> 25:01:12,552
sunt de fapt date neetichetate. Hm, și tu

33076
25:01:09,280 --> 25:01:17,280
încercați să profitați de acea etichetă

33077
25:01:12,552 --> 25:01:22,480
date pentru a construi un model din

33078
25:01:17,280 --> 25:01:27,192
ea. Și așa folosește um pe care îl folosește

33079
25:01:22,480 --> 25:01:29,600
acele date de etichetă pe care le furnizează în general

33080
25:01:27,192 --> 25:01:32,160
câteva îndrumări despre ceea ce se întâmplă de obicei

33081
25:01:29,600 --> 25:01:35,760
cu învățarea semi-supravegheată este folosiți

33082
25:01:32,160 --> 25:01:38,000
datele dvs. de etichetă pentru a cam prezice ce

33083
25:01:35,760 --> 25:01:40,232
eticheta ar trebui să fie pentru cei neetichetat

33084
25:01:38,000 --> 25:01:42,800
date și apoi puteți merge de acolo. Deci

33085
25:01:40,232 --> 25:01:46,400
puteți crea etichete artificiale pe aceasta

33086
25:01:42,800 --> 25:01:48,320
date neetichetate și apoi le puteți folosi pe toate

33087
25:01:46,400 --> 25:01:51,600
odată ce totul a fost etichetat

33088
25:01:48,320 --> 25:01:53,600
ca o abordare a învățării supravegheate.

33089
25:01:51,600 --> 25:01:55,192
Deci, dar dar acest lucru este semi-supravegheat

33090
25:01:53,600 --> 25:01:58,480
practic se referă la faptul că tu

33091
25:01:55,192 --> 25:02:01,360
începe cu majoritatea datelor tale nu

33092
25:01:58,480 --> 25:02:03,832
fiind etichetat, dar ai ceva

33093
25:02:01,360 --> 25:02:06,480
exemple etichetate și ceea ce puteți face este

33094
25:02:03,832 --> 25:02:10,400
practic extrapolează acele etichete în

33095
25:02:06,480 --> 25:02:13,040
setul de date neetichetat și apoi furnizați

33096
25:02:10,400 --> 25:02:14,400
niște etichete artificiale și apoi acum

33097
25:02:13,040 --> 25:02:16,872
totul are o etichetă pe care o poți face

33098
25:02:14,400 --> 25:02:20,800
învăţare supravegheată.

33099
25:02:16,872 --> 25:02:23,280
Bine. Deci, se încadrează oarecum între um

33100
25:02:20,800 --> 25:02:26,720
supravegheat și și nesupravegheat.

33101
25:02:23,280 --> 25:02:28,720
Uh și acolo, așa că asta este un fel

33102
25:02:26,720 --> 25:02:30,160
rare. De cele mai multe ori nu mergi

33103
25:02:28,720 --> 25:02:33,920
a face asta. De fapt, doar mergi

33104
25:02:30,160 --> 25:02:35,440
eu prefer să începem cu toate

33105
25:02:33,920 --> 25:02:37,280
date de etichetă. Acesta este de obicei preferatul

33106
25:02:35,440 --> 25:02:38,960
abordare. De cele mai multe ori vei

33107
25:02:37,280 --> 25:02:41,512
de fapt, să fie doar supravegheat

33108
25:02:38,960 --> 25:02:47,160
învăţare, nu chiar semi-supravegheată

33109
25:02:41,512 --> 25:02:47,160
învăţarea. Deci, este destul de rar, dar um

33110
25:02:49,680 --> 25:02:54,552
ar putea să-ți placă dacă Da, ar putea dacă

33111
25:02:52,320 --> 25:02:56,640
dacă am avea o mulțime de exemple de

33112
25:02:54,552 --> 25:02:58,872
Pentagonul și noi am vrut și așa au fost

33113
25:02:56,640 --> 25:03:02,080
neetichetat și apoi am încercat să ghicim

33114
25:02:58,872 --> 25:03:05,920
ce fel de formă erau um şi

33115
25:03:02,080 --> 25:03:07,680
oferiți o etichetă artificială și apoi

33116
25:03:05,920 --> 25:03:10,160
um apoi folosește întregul set de date pentru a construi

33117
25:03:07,680 --> 25:03:14,280
un model de atunci da, s-ar putea

33118
25:03:10,160 --> 25:03:14,280
ar putea intra în această categorie. Bine.

33119
25:03:18,800 --> 25:03:21,680
Ei Oh, revenind la întrebare,

33120
25:03:20,320 --> 25:03:24,872
încă folosesc un fel de date de etichetă

33121
25:03:21,680 --> 25:03:26,640
precum vârsta, sexul. Ei folosesc asta

33122
25:03:24,872 --> 25:03:29,040
acestea nu sunt, nu sunt chiar etichete.

33123
25:03:26,640 --> 25:03:32,080
Acestea sunt caracteristicile. Deci, da, ei

33124
25:03:29,040 --> 25:03:34,400
utilizați în continuare caracteristicile de bază ale datelor.

33125
25:03:32,080 --> 25:03:36,872
Pur și simplu nu au nicio etichetă similară

33126
25:03:34,400 --> 25:03:39,040
sensul tradițional al unei etichete. Ca

33127
25:03:36,872 --> 25:03:41,280
ar trebui să te gândești la o etichetă ca la ceva

33128
25:03:39,040 --> 25:03:43,360
încercăm să prevedem.

33129
25:03:41,280 --> 25:03:46,000
Deci, dacă acesta este un preț, dacă

33130
25:03:43,360 --> 25:03:48,080
este ca o categorie ca spam, nu

33131
25:03:46,000 --> 25:03:49,600
spam, cancer, nu cancer, e ceva

33132
25:03:48,080 --> 25:03:52,960
ne-ar interesa un fel de

33133
25:03:49,600 --> 25:03:55,192
prezicerea. Și așa în datele noastre, noi

33134
25:03:52,960 --> 25:03:56,640
ar avea un răspuns pentru fiecare rând. Am vrea

33135
25:03:55,192 --> 25:03:59,280
a avea una dintre coloanele noastre ar fi ca

33136
25:03:56,640 --> 25:04:01,280
rezultatul ca și răspunsul rezultat

33137
25:03:59,280 --> 25:04:03,512
pe care încercăm să-l prevedem. Asta este

33138
25:04:01,280 --> 25:04:05,680
eticheta.

33139
25:04:03,512 --> 25:04:07,440
Deci, în nesupravegheat, nu avem nimic

33140
25:04:05,680 --> 25:04:09,440
etichetele.

33141
25:04:07,440 --> 25:04:13,360
Avem doar caracteristicile obișnuite

33142
25:04:09,440 --> 25:04:16,360
cum ar fi sexul, vârsta, venitul, pătratul

33143
25:04:13,360 --> 25:04:16,360
filmare,

33144
25:04:17,512 --> 25:04:21,960
dormitoare, băi, toate acele lucruri.

33145
25:04:24,640 --> 25:04:27,640
Bine.

33146
25:04:28,552 --> 25:04:32,480
Deci, avem semi-supravegheat că cade

33147
25:04:30,552 --> 25:04:35,040
între supravegheat. Acum, motivul

33148
25:04:32,480 --> 25:04:37,440
se încadrează între este fi este pentru că

33149
25:04:35,040 --> 25:04:39,760
există o cantitate decentă de date

33150
25:04:37,440 --> 25:04:43,360
neetichetat. De fapt, majoritatea

33151
25:04:39,760 --> 25:04:45,832
neetichetat. Dar ceea ce putem face este să încercăm

33152
25:04:43,360 --> 25:04:48,480
etichetați-l. Putem încerca să luăm ceea ce avem

33153
25:04:45,832 --> 25:04:51,920
știi din etichetele noastre existente și

33154
25:04:48,480 --> 25:04:54,400
prezice o etichetă artificială și apoi folosește

33155
25:04:51,920 --> 25:04:56,640
toate acele date împreună într-un fel de a

33156
25:04:54,400 --> 25:04:59,640
modă supravegheată pentru un model de jos

33157
25:04:56,640 --> 25:04:59,640
drum.

33158
25:05:02,080 --> 25:05:08,160
Deci cam asta e imaginea asta

33159
25:05:04,232 --> 25:05:10,960
spune că putem încerca să ne luăm, știi

33160
25:05:08,160 --> 25:05:14,080
poate încercăm să deducem niște etichete pe baza

33161
25:05:10,960 --> 25:05:16,960
pe avem câteva date etichetate aici.

33162
25:05:14,080 --> 25:05:20,160
Avem majoritatea datelor noastre neetichetate

33163
25:05:16,960 --> 25:05:22,640
și încercăm să-i furnizăm niște etichete.

33164
25:05:20,160 --> 25:05:27,600
Poate că avem o categorie de bebeluși

33165
25:05:22,640 --> 25:05:31,512
de adolescenți, un preadolescent, uh, știi tinerețe și

33166
25:05:27,600 --> 25:05:35,440
adulți. Hm și apoi încercăm, așa că noi

33167
25:05:31,512 --> 25:05:37,832
luăm etichetele noastre și încercăm

33168
25:05:35,440 --> 25:05:39,760
extrapolați-le în etichete artificiale

33169
25:05:37,832 --> 25:05:42,160
pentru aceste date neetichetate ca să putem

33170
25:05:39,760 --> 25:05:44,720
folosește-l acum pentru că atunci totul are o

33171
25:05:42,160 --> 25:05:46,480
etichetați în acest moment și apoi putem doar

33172
25:05:44,720 --> 25:05:49,480
mergeți mai departe și învățați supravegheat de la

33173
25:05:46,480 --> 25:05:49,480
acolo.

33174
25:05:52,000 --> 25:05:55,600
Deci putem face supravegheat de acolo. Ce

33175
25:05:53,920 --> 25:05:57,832
am prefera să facem și ce vom face

33176
25:05:55,600 --> 25:06:00,160
in acest curs

33177
25:05:57,832 --> 25:06:02,232
um este doar începe cu supravegheat. Vom face

33178
25:06:00,160 --> 25:06:04,872
începe doar cu etichetele. Nu vom încerca

33179
25:06:02,232 --> 25:06:08,920
pentru a deriva de obicei etichete artificiale.

33180
25:06:04,872 --> 25:06:08,920
Vom începe doar cu etichetele.

33181
25:06:15,760 --> 25:06:22,480
Deci un exemplu în lumea reală este

33182
25:06:18,640 --> 25:06:24,400
ceva de genul Google Photos care um

33183
25:06:22,480 --> 25:06:28,872
ori de câte ori faci o poză se poate

33184
25:06:24,400 --> 25:06:32,320
furnizați etichete bazate pe anterioare

33185
25:06:28,872 --> 25:06:37,040
uh imagini din biblioteca ta. Deci se poate

33186
25:06:32,320 --> 25:06:39,040
poate produce etichete sau etichete pe acestea.

33187
25:06:37,040 --> 25:06:41,280
Uh, în general, când faci acea poză

33188
25:06:39,040 --> 25:06:44,000
este oarecum neetichetat dacă nu intri

33189
25:06:41,280 --> 25:06:46,800
și să furnizeze în mod specific niște etichete și

33190
25:06:44,000 --> 25:06:51,192
unele etichete. Dar dacă nu faci asta

33191
25:06:46,800 --> 25:06:53,040
încă mai poate, încă mai poate face

33192
25:06:51,192 --> 25:06:55,512
crea artificial una dintre cele bazate

33193
25:06:53,040 --> 25:06:57,280
pe celelalte date de etichetă pe care le aveți deja

33194
25:06:55,512 --> 25:07:00,320
au.

33195
25:06:57,280 --> 25:07:03,720
Deci asta e um

33196
25:07:00,320 --> 25:07:03,720
asta e un exemplu.

33197
25:07:08,800 --> 25:07:11,800
Bine.

33198
25:07:12,080 --> 25:07:18,320
În regulă. Ultimul din punct de vedere al mașinii

33199
25:07:14,872 --> 25:07:20,000
învăţarea. Deci am supravegheat, avem

33200
25:07:18,320 --> 25:07:22,160
nesupravegheat.

33201
25:07:20,000 --> 25:07:23,920
Atunci am fost semi-supervizați, adică

33202
25:07:22,160 --> 25:07:26,872
undeva la mijloc un amestec de a avea

33203
25:07:23,920 --> 25:07:27,760
unele date neetichetate și date etichetate. Hm

33204
25:07:26,872 --> 25:07:29,192
acum vom vorbi despre

33205
25:07:27,760 --> 25:07:32,480
învăţarea prin întărire care este

33206
25:07:29,192 --> 25:07:33,680
complet diferit. Ea este

33207
25:07:32,480 --> 25:07:36,000
complet diferit de celălalt

33208
25:07:33,680 --> 25:07:39,040
trei. Este un tip de învățare automată

33209
25:07:36,000 --> 25:07:41,760
de unde învățăm practic

33210
25:07:39,040 --> 25:07:44,232
interacțiunea cu mediul. Şi

33211
25:07:41,760 --> 25:07:48,400
ați putea întreba ce învățăm? Noi

33212
25:07:44,232 --> 25:07:51,192
învață ce acțiuni să întreprindă în

33213
25:07:48,400 --> 25:07:53,440
mediu. Hm și felul în care facem asta

33214
25:07:51,192 --> 25:07:56,232
este prin întărire

33215
25:07:53,440 --> 25:08:00,552
acțiuni pozitive care conduc la o a

33216
25:07:56,232 --> 25:08:02,480
recompensă. Um, deci acolo este cuvântul

33217
25:08:00,552 --> 25:08:05,440
întărirea vine de la noi

33218
25:08:02,480 --> 25:08:07,600
în principiu, imaginează-ți ca un copil

33219
25:08:05,440 --> 25:08:09,120
asta înseamnă, știi, să înveți din proces

33220
25:08:07,600 --> 25:08:10,640
si eroare. De parcă ar încerca să se târască,

33221
25:08:09,120 --> 25:08:13,360
încearcă să meargă și țin

33222
25:08:10,640 --> 25:08:15,920
prăvălire. ei în cele din urmă învață

33223
25:08:13,360 --> 25:08:19,760
cum să o faci prin încercare și eroare și

33224
25:08:15,920 --> 25:08:21,680
ar putea primi o recompensă sau ar putea um

33225
25:08:19,760 --> 25:08:24,400
consolida unele dintre cele pozitive

33226
25:08:21,680 --> 25:08:28,480
mişcări care îi conduc la mers sau

33227
25:08:24,400 --> 25:08:31,192
craw um sau ar putea învăța de la

33228
25:08:28,480 --> 25:08:34,160
sancțiuni, nu? S-ar putea să învețe de la

33229
25:08:31,192 --> 25:08:35,832
un fel de feedback. Deci ar putea

33230
25:08:34,160 --> 25:08:38,080
Învață din cădere de genul „Oh, asta

33231
25:08:35,832 --> 25:08:39,280
doare. Ar trebui să mă întrețin a

33232
25:08:38,080 --> 25:08:42,400
putin mai bine, nu?" Sau fii a

33233
25:08:39,280 --> 25:08:44,640
putin mai coordonat. Hm

33234
25:08:42,400 --> 25:08:46,320
și astfel ei învață din aceștia

33235
25:08:44,640 --> 25:08:49,192
acțiunile și interacțiunea lor cu

33236
25:08:46,320 --> 25:08:55,440
mediu. Hm

33237
25:08:49,192 --> 25:08:59,440
deci acesta este un algoritm complex

33238
25:08:55,440 --> 25:09:02,160
în esență, se ocupă de multe

33239
25:08:59,440 --> 25:09:04,480
um din nou luând măsuri. De obicei când

33240
25:09:02,160 --> 25:09:08,232
faci o acțiune în care ceva se schimbă

33241
25:09:04,480 --> 25:09:10,480
mediul, atunci tu cam

33242
25:09:08,232 --> 25:09:13,920
observați un fel de feedback. Deci, gandeste-te

33243
25:09:10,480 --> 25:09:15,760
cam ca un joc de societate unde te afli

33244
25:09:13,920 --> 25:09:17,680
încercând să-mi dau seama ce te mișcă

33245
25:09:15,760 --> 25:09:20,552
ar trebui să facă sau un alt exemplu bun este

33246
25:09:17,680 --> 25:09:23,040
ca cu un robot care încearcă să navigheze

33247
25:09:20,552 --> 25:09:24,480
un labirint. Deci, cum ar fi ce traseu ar trebui

33248
25:09:23,040 --> 25:09:26,080
ia? Ar trebui să meargă înainte? Ar trebui

33249
25:09:24,480 --> 25:09:28,000
mișcă înapoi? Ar trebui să se miște la stânga sau

33250
25:09:26,080 --> 25:09:30,872
nu? Acestea sunt acțiuni diferite

33251
25:09:28,000 --> 25:09:32,720
poate lua. De asemenea, ca o mașină care se conduce singur,

33252
25:09:30,872 --> 25:09:34,400
ar trebui sa se intoarca? Ar trebui

33253
25:09:32,720 --> 25:09:36,800
accelera? Ar trebui să încetinească? Acestea sunt

33254
25:09:34,400 --> 25:09:38,160
toate exemple bune de lucruri care au

33255
25:09:36,800 --> 25:09:40,960
fost antrenat din întărire

33256
25:09:38,160 --> 25:09:40,960
învăţarea.

33257
25:09:45,360 --> 25:09:51,360
Da. Deci exemplele din lumea reală ar fi

33258
25:09:48,160 --> 25:09:55,192
ca într-un joc de masă, o recompensă

33259
25:09:51,360 --> 25:09:57,280
fii ca și cum ai câștiga jocul. Hm sau dacă

33260
25:09:55,192 --> 25:10:00,232
îți place să captezi o piesă ca în

33261
25:09:57,280 --> 25:10:01,760
dame sau șah, asta e o recompensă. A

33262
25:10:00,232 --> 25:10:03,832
pedeapsa ar fi ca dacă pierzi

33263
25:10:01,760 --> 25:10:06,800
joc sau pierzi una dintre piesele tale, asta

33264
25:10:03,832 --> 25:10:11,192
ar putea fi o penalizare.

33265
25:10:06,800 --> 25:10:14,000
într-un joc de societate sau îmi pare rău într-un a

33266
25:10:11,192 --> 25:10:16,960
sarcină de navigare robot, ar putea ajunge

33267
25:10:14,000 --> 25:10:18,640
recompense pentru că te-ai mutat în dreapta

33268
25:10:16,960 --> 25:10:21,280
direcție

33269
25:10:18,640 --> 25:10:22,960
um spre ieșire sau like când vrea

33270
25:10:21,280 --> 25:10:25,120
să presupunem că ai vrut să antrenezi un robot

33271
25:10:22,960 --> 25:10:27,512
cum să deschizi ușa și să navighezi a

33272
25:10:25,120 --> 25:10:29,832
camera. Ai sancționa pentru asta

33273
25:10:27,512 --> 25:10:34,760
lovindu-se de perete.

33274
25:10:29,832 --> 25:10:34,760
Ai da o recompensă pentru mutare

33275
25:10:37,512 --> 25:10:42,232
de obicei oh ca oh algoritmii

33276
25:10:40,080 --> 25:10:45,120
ei înșiși, de obicei, este ca un pas

33277
25:10:42,232 --> 25:10:47,360
funcția um de obicei este ca o

33278
25:10:45,120 --> 25:10:50,640
funcția discretă pe care se bazează

33279
25:10:47,360 --> 25:10:54,000
asupra statului deci răsplata ar putea fi

33280
25:10:50,640 --> 25:10:55,680
ca um ca depinde de let's

33281
25:10:54,000 --> 25:10:58,640
să revenim la exemplul jocului de masă

33282
25:10:55,680 --> 25:11:01,040
ca și cum recompensa ar putea fi ca sau chiar

33283
25:10:58,640 --> 25:11:02,872
labirintul să spunem ca un navigator

33284
25:11:01,040 --> 25:11:05,192
labirint ca să ajungi la asta hai să spunem asta

33285
25:11:02,872 --> 25:11:09,080
a fost ieșirea

33286
25:11:05,192 --> 25:11:09,080
Și asta era intrarea.

33287
25:11:09,360 --> 25:11:13,360
Apoi, dacă ajung aici, primesc un

33288
25:11:11,832 --> 25:11:14,960
numeric ca dacă ar ajunge la

33289
25:11:13,360 --> 25:11:17,600
ieșire, ei primesc o recompensă numerică de

33290
25:11:14,960 --> 25:11:21,920
ca plus 100, să zicem. Deci este doar o

33291
25:11:17,600 --> 25:11:23,600
număr. Și apoi dacă le place dacă le-ar plăcea

33292
25:11:21,920 --> 25:11:25,360
bump dacă intră aici, de genul hai

33293
25:11:23,600 --> 25:11:27,760
spune că asta e ca o capcană mortală sau

33294
25:11:25,360 --> 25:11:30,960
ca o groapă, asta ar fi ca o

33295
25:11:27,760 --> 25:11:33,512
minus 100. Deci ar putea fi ca discret

33296
25:11:30,960 --> 25:11:34,800
valorile numerice ar putea fi recompensa dacă

33297
25:11:33,512 --> 25:11:36,160
se mișcă în direcția corectă.

33298
25:11:34,800 --> 25:11:37,920
Să zicem că vrem să încurajăm

33299
25:11:36,160 --> 25:11:39,760
mergând în acest fel atunci am putea da

33300
25:11:37,920 --> 25:11:41,680
recompense intermediare mai mici ca aceasta

33301
25:11:39,760 --> 25:11:44,480
ar trebui să fie un plus ca dacă te muți

33302
25:11:41,680 --> 25:11:47,440
înainte acesta este un plus cinci acesta este un

33303
25:11:44,480 --> 25:11:49,192
plus 10, acesta este un plus 15 dacă ești

33304
25:11:47,440 --> 25:11:52,232
deplasându-se în direcția greșită departe de

33305
25:11:49,192 --> 25:11:55,192
iesirea. Ar fi ca un minus5

33306
25:11:52,232 --> 25:11:58,000
sau un minus 10. Are sens? Deci

33307
25:11:55,192 --> 25:11:59,680
sunt de natură numerică și

33308
25:11:58,000 --> 25:12:01,920
ceea ce încerci să faci este să colectezi

33309
25:11:59,680 --> 25:12:05,440
cea mai mare recompensă. Încercați să obțineți

33310
25:12:01,920 --> 25:12:07,680
cea mai mare recompensă pe care o puteți prin încercare și

33311
25:12:05,440 --> 25:12:10,720
eroare. Așa că încerci asta multe

33312
25:12:07,680 --> 25:12:13,040
de multe ori. Practic simulezi

33313
25:12:10,720 --> 25:12:16,320
alergând prin acest labirint multe multe

33314
25:12:13,040 --> 25:12:19,280
ori. Și ce o dictează ce

33315
25:12:16,320 --> 25:12:21,120
dictează cum ar fi locul unde ar trebui să merg

33316
25:12:19,280 --> 25:12:22,800
pe ceea ce am observat în trecut. Este

33317
25:12:21,120 --> 25:12:24,800
aproape ca și cum ai fi un copil care își amintește

33318
25:12:22,800 --> 25:12:27,680
cum ar fi, bine, din ce mișcare ar trebui să fac

33319
25:12:24,800 --> 25:12:29,440
acest spatiu? Ca dacă sunt aici, dacă sunt

33320
25:12:27,680 --> 25:12:31,280
aici, pe ce drum ar trebui să merg? Ar trebui să merg

33321
25:12:29,440 --> 25:12:33,760
jos? Ar trebui să merg corect? Ar trebui să merg

33322
25:12:31,280 --> 25:12:35,280
plecat? Cam știi asta de la

33323
25:12:33,760 --> 25:12:36,720
experiență.

33324
25:12:35,280 --> 25:12:39,120
Are sens? Pe baza

33325
25:12:36,720 --> 25:12:40,720
recompensă pe care am văzut-o în trecut, cum ar fi

33326
25:12:39,120 --> 25:12:44,232
când m-am mutat în jos, am primit un

33327
25:12:40,720 --> 25:12:45,600
recompensă mai mare decât deplasarea la stânga sau la dreapta.

33328
25:12:44,232 --> 25:12:48,872
Are sens? Deci, da, este

33329
25:12:45,600 --> 25:12:51,920
este o valoare numerică

33330
25:12:48,872 --> 25:12:51,920
drept recompensă.

33331
25:12:57,360 --> 25:13:02,000
Da, e o întrebare grozavă. Cum

33332
25:13:00,232 --> 25:13:05,192
diferențiază recompensele în funcție de

33333
25:13:02,000 --> 25:13:07,680
câștig și pierdere? fac șah. Deci este un

33334
25:13:05,192 --> 25:13:12,160
foarte comp complicat uh răspuns dar

33335
25:13:07,680 --> 25:13:14,800
în esență, din fiecare dată pe tabla de șah

33336
25:13:12,160 --> 25:13:17,280
te poți gândi la tablă ca la fiecare

33337
25:13:14,800 --> 25:13:21,512
fiecare um

33338
25:13:17,280 --> 25:13:23,600
spațiul este o stare.

33339
25:13:21,512 --> 25:13:26,400
Așa că aș putea fi în această stare în care aș putea fi

33340
25:13:23,600 --> 25:13:29,120
în această stare și atunci nu este numai

33341
25:13:26,400 --> 25:13:31,120
este fiecare fiecare uh spațiu, dar unde toate

33342
25:13:29,120 --> 25:13:33,360
celelalte piese sunt. Deci sunt multe

33343
25:13:31,120 --> 25:13:36,080
state care sunt posibile.

33344
25:13:33,360 --> 25:13:39,280
Um, deci

33345
25:13:36,080 --> 25:13:43,360
felul în care există o modalitate de a cuantifica

33346
25:13:39,280 --> 25:13:44,960
în esență, care este valoarea luării unui

33347
25:13:43,360 --> 25:13:47,832
anumite acțiuni, cum ar fi mutarea piesei mele

33348
25:13:44,960 --> 25:13:51,680
stânga, mutându-l la dreapta, mutându-l în sus sau

33349
25:13:47,832 --> 25:13:52,800
jos um dat fiind restul statului. Deci

33350
25:13:51,680 --> 25:13:56,232
ai dreptate, poate fi

33351
25:13:52,800 --> 25:13:58,480
benefic de sacrificat. Hm, dar noi

33352
25:13:56,232 --> 25:14:00,800
ar învăţa că prin experienţă că

33353
25:13:58,480 --> 25:14:02,640
bine, cea mai bună mișcare în această situație este

33354
25:14:00,800 --> 25:14:04,232
a se sacrifica.

33355
25:14:02,640 --> 25:14:06,000
Ar trebui să învățăm asta

33356
25:14:04,232 --> 25:14:08,640
prin încercare și eroare multe multe multe

33357
25:14:06,000 --> 25:14:12,000
ori, adică în regulă dacă sunt

33358
25:14:08,640 --> 25:14:14,000
în această stare actuală a dreptului mondial

33359
25:14:12,000 --> 25:14:16,872
toate aceste piese sunt distribuite în aceasta

33360
25:14:14,000 --> 25:14:18,872
modul cea mai bună mișcare pentru mine în acest moment

33361
25:14:16,872 --> 25:14:21,192
pe termen lung

33362
25:14:18,872 --> 25:14:22,872
pentru a obține cea mai mare recompensă pe termen lung

33363
25:14:21,192 --> 25:14:25,360
este să-mi sacrific de fapt piesa și

33364
25:14:22,872 --> 25:14:28,160
mutați-l corect mutați-l ca pe un rău

33365
25:14:25,360 --> 25:14:29,760
poziție teoretic dar știm din

33366
25:14:28,160 --> 25:14:32,160
experiență care este de fapt cea mai mare

33367
25:14:29,760 --> 25:14:35,040
recompensa pe termen lung este din acea poziție

33368
25:14:32,160 --> 25:14:38,720
ca și cum să-l miști corect poate fi cel mai bun

33369
25:14:35,040 --> 25:14:40,720
pentru mine. Deci ceea ce înveți este cum să iei

33370
25:14:38,720 --> 25:14:43,360
actiuni

33371
25:14:40,720 --> 25:14:45,512
și acțiunile sunt de obicei ca deplasarea la dreapta,

33372
25:14:43,360 --> 25:14:47,680
misca la stanga, misca in sus, misca in jos. crezi tu

33373
25:14:45,512 --> 25:14:50,080
cam ca o mașină care se conduce singur, totuși,

33374
25:14:47,680 --> 25:14:55,120
asta va fi ca o încetinire, viteză

33375
25:14:50,080 --> 25:14:58,360
sus, rotiți roata cu 10 grade. Hm acelea

33376
25:14:55,120 --> 25:14:58,360
fel de acțiuni.

33377
25:14:59,360 --> 25:15:06,480
Deci răspunsul scurt este că există

33378
25:15:02,080 --> 25:15:10,320
un calcul acolo că înveți ce

33379
25:15:06,480 --> 25:15:13,120
valoarea pe termen lung a fiecărei stări este

33380
25:15:10,320 --> 25:15:15,192
fiecare stare unică

33381
25:15:13,120 --> 25:15:17,512
și apoi încerci să spui practic

33382
25:15:15,192 --> 25:15:19,040
ce masuri ar trebui sa iau din asta

33383
25:15:17,512 --> 25:15:22,872
stare

33384
25:15:19,040 --> 25:15:22,872
având în vedere că starea actuală a

33385
25:15:29,920 --> 25:15:34,000
Bine.

33386
25:15:31,832 --> 25:15:35,920
Și chiar îmi place foarte mult întărirea

33387
25:15:34,000 --> 25:15:38,000
învăţarea. De fapt, este probabil al meu

33388
25:15:35,920 --> 25:15:40,480
domeniul preferat al învățării automate.

33389
25:15:38,000 --> 25:15:43,280
Din păcate, nu o vom acoperi

33390
25:15:40,480 --> 25:15:45,280
în cursul nostru principal. Avem

33391
25:15:43,280 --> 25:15:47,920
a oferit cursuri opționale

33392
25:15:45,280 --> 25:15:49,512
învăţarea prin consolidare în trecut. Deci,

33393
25:15:47,920 --> 25:15:51,760
um fii pe fază. Poate când ajungem la

33394
25:15:49,512 --> 25:15:53,600
La sfârșitul acestui program, uh, vom oferi un

33395
25:15:51,760 --> 25:15:57,512
electiv pe el și dacă semnează destui oameni

33396
25:15:53,600 --> 25:15:59,280
pentru asta, o vom rula. Dar, um

33397
25:15:57,512 --> 25:16:00,640
noi nu face parte din noi nu facem cu adevărat

33398
25:15:59,280 --> 25:16:03,280
acoperă învățarea prin consolidare ca parte a

33399
25:16:00,640 --> 25:16:05,600
subiectele noastre principale. Este un avansat

33400
25:16:03,280 --> 25:16:08,800
uh subiect mai avansat decât ce

33401
25:16:05,600 --> 25:16:12,760
vom acoperi, dar îmi place foarte mult.

33402
25:16:08,800 --> 25:16:12,760
Mi se pare foarte fascinant.

33403
25:16:17,760 --> 25:16:22,480
Bine. Deci, toate acestea sunt un fel de um

33404
25:16:20,232 --> 25:16:25,120
ilustrând ceea ce spuneam, adică

33405
25:16:22,480 --> 25:16:27,040
um, te gândești la chestia asta

33406
25:16:25,120 --> 25:16:30,480
interacționând în mediu precum

33407
25:16:27,040 --> 25:16:34,160
robotul sau mașina sau omul care se mișcă a

33408
25:16:30,480 --> 25:16:36,000
piesa de piept este cunoscută ca agent. Sale

33409
25:16:34,160 --> 25:16:39,040
interacționând cu mediul prin

33410
25:16:36,000 --> 25:16:41,360
întreprinderea de acțiuni care actualizează starea

33411
25:16:39,040 --> 25:16:43,360
um de a mediului. Deci asta e

33412
25:16:41,360 --> 25:16:45,360
de aceea vezi acest cuvânt stare aici.

33413
25:16:43,360 --> 25:16:48,000
Acesta este actualizat constant de fiecare dată

33414
25:16:45,360 --> 25:16:49,680
faci o acțiune. În cele din urmă, ce

33415
25:16:48,000 --> 25:16:52,872
Învățarea prin întărire încearcă să facă

33416
25:16:49,680 --> 25:16:56,552
este să înveți cea mai bună acțiune cum ar fi

33417
25:16:52,872 --> 25:16:58,552
fi cea mai bună acțiune de luat. Hm

33418
25:16:56,552 --> 25:17:01,512
și cea mai bună acțiune este aceea care

33419
25:16:58,552 --> 25:17:04,872
conduce la cea mai lungă recompensă.

33420
25:17:01,512 --> 25:17:09,360
Asta e cea mai bună acțiune. Um, deci ai

33421
25:17:04,872 --> 25:17:12,000
ca trebuie să înveți ceea ce știi

33422
25:17:09,360 --> 25:17:14,080
ceea ce duce la o recompensă bună prin fel de

33423
25:17:12,000 --> 25:17:16,480
trăind asta din nou și din nou și din nou

33424
25:17:14,080 --> 25:17:19,120
prin încercare și eroare. Deci există o

33425
25:17:16,480 --> 25:17:22,480
o mulțime de fel de simulare sau închiriere

33426
25:17:19,120 --> 25:17:24,160
robotul încearcă mult ceva

33427
25:17:22,480 --> 25:17:26,160
pentru a învăța cumva ce este plin de satisfacții

33428
25:17:24,160 --> 25:17:27,832
si ce nu este. Gândește-te din nou

33429
25:17:26,160 --> 25:17:29,680
parcă cred că un exemplu bun este ca cu

33430
25:17:27,832 --> 25:17:32,320
copii, nu? cam trebuie să lași

33431
25:17:29,680 --> 25:17:34,872
ei încearcă lucruri până învață mai departe

33432
25:17:32,320 --> 25:17:37,120
ale lor ce e ce pot face și

33433
25:17:34,872 --> 25:17:41,040
ce nu pot face

33434
25:17:37,120 --> 25:17:43,280
care sunt cele mai bune acțiuni corecte

33435
25:17:41,040 --> 25:17:46,000
astfel încât învăţarea prin întărire şi-a făcut

33436
25:17:43,280 --> 25:17:48,800
drum în alte locuri, așa că am spus ca a

33437
25:17:46,000 --> 25:17:50,232
exemplu bun sunt mașinile cu conducere autonomă sau ro

33438
25:17:48,800 --> 25:17:52,000
robotica întărește mult

33439
25:17:50,232 --> 25:17:54,640
învățarea prin întărire este folosită acolo

33440
25:17:52,000 --> 25:17:57,280
locul în care și-a găsit drumul recent

33441
25:17:54,640 --> 25:17:58,400
este un fel de sisteme de recomandare

33442
25:17:57,280 --> 25:18:03,120
fuzionat cu învăţarea prin întărire

33443
25:17:58,400 --> 25:18:05,192
învăţarea. Hm, și asta pentru că tu

33444
25:18:03,120 --> 25:18:08,480
vă puteți imagina că există un fel de a

33445
25:18:05,192 --> 25:18:11,280
recompensă încorporată pentru dvs. făcând clic pe a

33446
25:18:08,480 --> 25:18:13,920
video și cum îl vizionați.

33447
25:18:11,280 --> 25:18:17,920
Um, așa că asta întărește asta

33448
25:18:13,920 --> 25:18:20,872
recomandare și apoi uh, acolo

33449
25:18:17,920 --> 25:18:22,872
um, atunci poți să recomanzi un fel de a

33450
25:18:20,872 --> 25:18:25,360
ceva asemanator si vezi daca e asa

33451
25:18:22,872 --> 25:18:27,832
recompensând și generează un clic sau

33452
25:18:25,360 --> 25:18:30,400
generează un timp de vizionare sau un timp de vizionare

33453
25:18:27,832 --> 25:18:32,480
sau orice altceva. Hm, deci întărire

33454
25:18:30,400 --> 25:18:35,440
învăţarea şi-a găsit drumul într-o mulţime de

33455
25:18:32,480 --> 25:18:38,080
zone. Recomandările fiind una dintre

33456
25:18:35,440 --> 25:18:40,872
pentru că este pur și simplu firesc pentru

33457
25:18:38,080 --> 25:18:43,680
idee de like ce ar trebui să recomand

33458
25:18:40,872 --> 25:18:44,800
alături de a genera cea mai mare recompensă. În

33459
25:18:43,680 --> 25:18:46,872
în acest caz, recompensa este oarecum

33460
25:18:44,800 --> 25:18:49,832
corelat cu au făcut clic pe el sau

33461
25:18:46,872 --> 25:18:52,400
nu sau au făcut cât timp s-au uitat

33462
25:18:49,832 --> 25:18:56,000
uita-te mai mult timp este mai plina de satisfactii

33463
25:18:52,400 --> 25:18:57,760
genul ăsta de lucruri, dar locul

33464
25:18:56,000 --> 25:19:01,280
locuri în care învățarea prin întărire au

33465
25:18:57,760 --> 25:19:05,040
fost folosit, am spus mașini autonome um

33466
25:19:01,280 --> 25:19:06,872
jocuri deci unul dintre cele mai faimoase

33467
25:19:05,040 --> 25:19:11,680
exemple dacă vrei să-l cauți

33468
25:19:06,872 --> 25:19:15,040
um Alph Go asta a fost în 2016 um the

33469
25:19:11,680 --> 25:19:18,480
Algoritmul Alph Go uh a fost o întărire

33470
25:19:15,040 --> 25:19:21,512
bot de învățare care a învins o parte din

33471
25:19:18,480 --> 25:19:25,760
cei mai buni jucători Go din lume, ceea ce dacă ești

33472
25:19:21,512 --> 25:19:29,040
nu este familiar, Go este un joc de societate

33473
25:19:25,760 --> 25:19:32,552
asta e un pic mai complex

33474
25:19:29,040 --> 25:19:37,280
decât șahul. Are mai multe uh este a

33475
25:19:32,552 --> 25:19:39,120
placă mai mare um mai multe piese la ea. Hm

33476
25:19:37,280 --> 25:19:41,680
dar ei au existat o întărire

33477
25:19:39,120 --> 25:19:43,832
bot alimentat de învățare care de fapt um

33478
25:19:41,680 --> 25:19:46,232
a învățat cum să joci așa

33479
25:19:43,832 --> 25:19:49,040
eficient ar putea învinge un fel de lume

33480
25:19:46,232 --> 25:19:51,360
Masters la jocuri a fost destul de uimitor.

33481
25:19:49,040 --> 25:19:55,832
Um, asta e alpha go și asta a trecut

33482
25:19:51,360 --> 25:19:57,280
deep mind Google și deep mind în 2016.

33483
25:19:55,832 --> 25:19:59,832
A fost frumos, a fost doar 10 ani

33484
25:19:57,280 --> 25:20:04,552
nu cu mult timp în urmă.

33485
25:19:59,832 --> 25:20:07,760
Um atât de sigur că am spus recomandare

33486
25:20:04,552 --> 25:20:10,720
uh, chiar și autocorectarea învățând să

33487
25:20:07,760 --> 25:20:12,552
preziceți cum ar fi cea mai bună corecție

33488
25:20:10,720 --> 25:20:14,960
uh pentru a genera o recompensă care ar fi

33489
25:20:12,552 --> 25:20:17,680
ca și cum ai accepta acea corectare sau tu

33490
25:20:14,960 --> 25:20:20,160
respingerea ar fi o penalizare. Um asa

33491
25:20:17,680 --> 25:20:21,832
învăţarea consolidată a fost adaptată la

33492
25:20:20,160 --> 25:20:24,232
acest gen de probleme foarte

33493
25:20:21,832 --> 25:20:27,360
cu succes. Să aruncăm o privire la

33494
25:20:24,232 --> 25:20:30,960
pachete pe care le vom folosi pe tot parcursul. Deci

33495
25:20:27,360 --> 25:20:33,512
Bineînțeles că ne vom baza pe acești trei

33496
25:20:30,960 --> 25:20:36,552
pe care ne-am bazat deja pentru a face a

33497
25:20:33,512 --> 25:20:39,512
multe lucruri precum numpy de făcut numeric

33498
25:20:36,552 --> 25:20:42,320
manipulări și calcule.

33499
25:20:39,512 --> 25:20:44,552
Uh mapplot lib pentru a face orice complot și

33500
25:20:42,320 --> 25:20:48,160
nu numai hărți lib ci poate seabour ca

33501
25:20:44,552 --> 25:20:51,512
bine amândoi să comploteze. um,

33502
25:20:48,160 --> 25:20:53,120
panda este una mare pentru că

33503
25:20:51,512 --> 25:20:55,280
acolo vor merge toate datele noastre

33504
25:20:53,120 --> 25:20:57,280
fi manipulat și pregătit înaintea lui

33505
25:20:55,280 --> 25:20:59,280
intră în modelare.

33506
25:20:57,280 --> 25:21:01,832
Deci toate acele lucruri din care învățăm

33507
25:20:59,280 --> 25:21:04,960
Pandis va fi cu siguranță aplicat

33508
25:21:01,832 --> 25:21:07,920
aici, în acest curs, așa cum noi de fapt

33509
25:21:04,960 --> 25:21:09,440
construi modele. Um, desigur ca astea

33510
25:21:07,920 --> 25:21:12,640
cele vechi cu care am lucrat

33511
25:21:09,440 --> 25:21:16,232
destul de um încă va fi util

33512
25:21:12,640 --> 25:21:17,920
aici în stadiul de modelare. Hm, în principal

33513
25:21:16,232 --> 25:21:20,872
din motive diferite, deși mai ales pentru

33514
25:21:17,920 --> 25:21:23,120
pregătiți datele noastre pentru a face un anumit tip de

33515
25:21:20,872 --> 25:21:24,872
modelarea sau poate să-l vizualizeze înainte

33516
25:21:23,120 --> 25:21:29,040
facem modeling pentru a ne da o idee despre ceea ce este

33517
25:21:24,872 --> 25:21:31,120
arată ca genul ăsta de lucruri.

33518
25:21:29,040 --> 25:21:35,280
um,

33519
25:21:31,120 --> 25:21:38,232
SF-ul este uneori util cu siguranță

33520
25:21:35,280 --> 25:21:39,760
uh um procesare ca nesupravegheată

33521
25:21:38,232 --> 25:21:41,600
învăţarea. De fapt, vom folosi scyp a

33522
25:21:39,760 --> 25:21:44,800
puțin pentru a face dimensionalitate

33523
25:21:41,600 --> 25:21:47,280
reducere sau ajutați-ne să facem asta. Um asa

33524
25:21:44,800 --> 25:21:49,120
scypi va fi folosit ici și colo și

33525
25:21:47,280 --> 25:21:51,512
am mai văzut-o cu ipoteze

33526
25:21:49,120 --> 25:21:54,640
testarea. Folosim scypi ca testul t

33527
25:21:51,512 --> 25:21:56,232
și testul z a venit de acolo. Hm, unele dintre

33528
25:21:54,640 --> 25:21:58,872
lucrurile de învățare nesupravegheate vor

33529
25:21:56,232 --> 25:22:02,480
ieșim de acolo, dar pachetul noi

33530
25:21:58,872 --> 25:22:05,920
va folosi de departe cel mai mult în acest curs

33531
25:22:02,480 --> 25:22:09,192
va fi Scikitlearn,

33532
25:22:05,920 --> 25:22:11,920
care este aici. Hm, și am făcut-o deja

33533
25:22:09,192 --> 25:22:14,400
am văzut puțin despre scikitlearn în

33534
25:22:11,920 --> 25:22:18,400
termenii capacității sale de pre-procesare.

33535
25:22:14,400 --> 25:22:20,480
Deci, folosim scalatorul uh minmax și

33536
25:22:18,400 --> 25:22:23,120
scaler standard de acolo de la

33537
25:22:20,480 --> 25:22:27,440
modul de preprocesare în scikitlearn.

33538
25:22:23,120 --> 25:22:30,872
dar are multe modele diferite

33539
25:22:27,440 --> 25:22:34,480
încorporat în el pe care îl putem folosi pentru a ajuta uh

33540
25:22:30,872 --> 25:22:36,640
faceți antrenamentul și previziunile noastre. Um asa

33541
25:22:34,480 --> 25:22:38,400
este o mașină incredibil de utilă

33542
25:22:36,640 --> 25:22:42,080
biblioteca de invatare. Este industria

33543
25:22:38,400 --> 25:22:43,512
bibliotecă standard de învățare automată. Hm dacă

33544
25:22:42,080 --> 25:22:46,000
vei face orice în mașină

33545
25:22:43,512 --> 25:22:48,320
învăţând, ar fi de aşteptat ca tu

33546
25:22:46,000 --> 25:22:50,480
știi cum să folosești scikitlearn.

33547
25:22:48,320 --> 25:22:53,360
Acum, ceea ce este cu adevărat norocos la asta este

33548
25:22:50,480 --> 25:22:55,832
că scikitlearn este foarte ușor

33549
25:22:53,360 --> 25:22:57,440
pachet cu care să te obișnuiești. Aproape

33550
25:22:55,832 --> 25:23:00,480
tot ceea ce facem în scikitlearn va fi

33551
25:22:57,440 --> 25:23:02,480
de cele mai multe ori urmează același model și așa

33552
25:23:00,480 --> 25:23:04,640
codul va fi extrem de simplu. Ei

33553
25:23:02,480 --> 25:23:06,552
a făcut o treabă grozavă cu acel pachet de

33554
25:23:04,640 --> 25:23:09,512
face lucrurile cu adevărat ușor de utilizat,

33555
25:23:06,552 --> 25:23:10,872
chiar simplu. Hm, este cu adevărat

33556
25:23:09,512 --> 25:23:13,280
pachet fantastic și vom primi

33557
25:23:10,872 --> 25:23:14,872
multă practică cu ea pe măsură ce mergem

33558
25:23:13,280 --> 25:23:17,832
de-a lungul. Fiecare model pe care îl construim va fi

33559
25:23:14,872 --> 25:23:20,400
în esență să fie de la scikitlearn

33560
25:23:17,832 --> 25:23:22,160
și nu doar ca modelele, ci um

33561
25:23:20,400 --> 25:23:24,872
făcând antrenamentul făcând predicțiile

33562
25:23:22,160 --> 25:23:27,600
și apoi face evaluarea va toate

33563
25:23:24,872 --> 25:23:30,960
provin din diferite uh scikitlearn u

33564
25:23:27,600 --> 25:23:33,040
module. Deci va fi foarte frumos și

33565
25:23:30,960 --> 25:23:35,280
vom avea o bună expunere la asta

33566
25:23:33,040 --> 25:23:38,080
pachet pe tot parcursul cursului. Deci dacă

33567
25:23:35,280 --> 25:23:42,080
orice va ieşi din acest curs

33568
25:23:38,080 --> 25:23:45,120
ca um psychit învață uh uh experți

33569
25:23:42,080 --> 25:23:47,040
asta va fi foarte frumos. Deci asta este

33570
25:23:45,120 --> 25:23:51,800
va fi cel nou pentru noi, psychitlearn

33571
25:23:47,040 --> 25:23:51,800
dar vom avea multă practică cu el.

33572
25:23:52,160 --> 25:23:55,160
Bine.

33573
25:23:56,232 --> 25:24:01,192
În regulă. Așa că doar pentru a recapitula acea lecție

33574
25:23:59,120 --> 25:24:02,400
înainte de a trece la lecția trei. Hm noi

33575
25:24:01,192 --> 25:24:06,000
a vorbit despre învățarea automată ca

33576
25:24:02,400 --> 25:24:08,872
învăţarea din date. um care este inclus

33577
25:24:06,000 --> 25:24:10,640
sub umbrela AI. Dar adânc

33578
25:24:08,872 --> 25:24:11,600
învățarea este, de asemenea, inclusă în mașină

33579
25:24:10,640 --> 25:24:14,232
învăț pentru că încă se învață

33580
25:24:11,600 --> 25:24:15,760
din date, dar se învață folosind neuronale

33581
25:24:14,232 --> 25:24:17,600
retelelor.

33582
25:24:15,760 --> 25:24:18,800
Am vorbit despre cele patru diferite

33583
25:24:17,600 --> 25:24:21,680
tipuri de învățare automată. Am avut

33584
25:24:18,800 --> 25:24:24,400
supravegheat, nesupravegheat,

33585
25:24:21,680 --> 25:24:25,920
semisupravegheata si intarire. Deci

33586
25:24:24,400 --> 25:24:28,552
acestea sunt diferitele tipuri de

33587
25:24:25,920 --> 25:24:30,080
învățarea automată care există. Hm

33588
25:24:28,552 --> 25:24:33,760
și apoi am vorbit despre unii dintre pi

33589
25:24:30,080 --> 25:24:35,920
pachetele python uh pe care le vom folosi

33590
25:24:33,760 --> 25:24:37,832
principalul fiind scikitlearn și bineînțeles

33591
25:24:35,920 --> 25:24:39,760
ne vom folosi bătrânii ca panda

33592
25:24:37,832 --> 25:24:42,800
să ne manipulăm datele și să le treci

33593
25:24:39,760 --> 25:24:46,720
este în formarea noastră de model etc.

33594
25:24:42,800 --> 25:24:50,160
Dar scikitlearn va fi alegerea noastră

33595
25:24:46,720 --> 25:24:52,160
orice învățare automată.

33596
25:24:50,160 --> 25:24:55,120
În regulă. Deci, câteva întrebări pentru tine

33597
25:24:52,160 --> 25:24:56,720
baieti, niste verificari.

33598
25:24:55,120 --> 25:24:59,360
Deci, anunță-mă în chat. ce faci

33599
25:24:56,720 --> 25:25:04,512
băieții cred? Uh, care dintre următoarele

33600
25:24:59,360 --> 25:25:04,512
descrie cel mai bine învățarea automată?

33601
25:25:07,120 --> 25:25:13,280
Care alegere crezi că este cea mai bună

33602
25:25:09,760 --> 25:25:13,280
este cel mai bun pentru asta?

33603
25:25:52,320 --> 25:25:56,800
Foarte bun. Foarte bun. Văd că văd multe

33604
25:25:54,480 --> 25:25:59,760
de opțiuni pentru A și A ar fi

33605
25:25:56,800 --> 25:26:04,000
alegere corectă. Deci învățarea automată este

33606
25:25:59,760 --> 25:26:05,832
cu siguranță un subset de AI. asta e

33607
25:26:04,000 --> 25:26:07,440
sub acea umbrelă AI, dar de

33608
25:26:05,832 --> 25:26:09,120
bineînțeles că învățăm din experiență

33609
25:26:07,440 --> 25:26:12,232
și desigur că această experiență este

33610
25:26:09,120 --> 25:26:14,800
înregistrate în datele um fără a fi

33611
25:26:12,232 --> 25:26:16,400
programat în mod explicit. Uh, deci este

33612
25:26:14,800 --> 25:26:18,400
exact opusul BNC. Cu siguranță suntem

33613
25:26:16,400 --> 25:26:21,192
nu invata din reguli si este

33614
25:26:18,400 --> 25:26:23,192
cu siguranță nu folosit doar pentru imagine și

33615
25:26:21,192 --> 25:26:26,552
recunoașterea vorbirii. Poate fi folosit pentru

33616
25:26:23,192 --> 25:26:29,192
multe alte lucruri dincolo de acestea. Deci da,

33617
25:26:26,552 --> 25:26:32,832
A este cea mai bună alegere acolo.

33618
25:26:29,192 --> 25:26:32,832
Ce spunem aici?

33619
25:26:33,760 --> 25:26:37,440
Bine. Ce părere aveți despre asta?

33620
25:26:35,280 --> 25:26:38,872
Care exemplu ilustrează utilizarea

33621
25:26:37,440 --> 25:26:44,120
învățare automată pentru a îmbunătăți clientul

33622
25:26:38,872 --> 25:26:44,120
experiență într-o companie de comerț electronic?

33623
25:26:53,440 --> 25:26:57,920
Cu alte cuvinte, ce ar fi ceva ce

33624
25:26:54,960 --> 25:27:01,232
ar fi niște uh cazuri de utilizare tipice ale

33625
25:26:57,920 --> 25:27:01,232
învățare automată?

33626
25:27:25,920 --> 25:27:31,280
Bun. Deci cred că uh C va fi

33627
25:27:28,640 --> 25:27:34,480
cel mai bun raspuns aici. Categoric C. Deci este

33628
25:27:31,280 --> 25:27:36,480
folosind învățarea automată pentru a face fraudă

33629
25:27:34,480 --> 25:27:38,232
tranzacții. Deci asta ar fi o

33630
25:27:36,480 --> 25:27:40,552
predicție probabil o supraveghere

33631
25:27:38,232 --> 25:27:43,760
învățând corect dacă dacă aceasta este fraudă sau

33632
25:27:40,552 --> 25:27:46,480
nu fraudă. Hm și apoi poate unii

33633
25:27:43,760 --> 25:27:48,640
comportamentul clientului, asta ar putea fi

33634
25:27:46,480 --> 25:27:50,960
nesupravegheat. Deci, poate gruparea împreună

33635
25:27:48,640 --> 25:27:53,440
clienții grupându-i pe baza

33636
25:27:50,960 --> 25:27:57,040
datele lor precum comportamentul lor de cumpărături

33637
25:27:53,440 --> 25:27:58,720
si caracteristici. Hm că asta ar putea

33638
25:27:57,040 --> 25:28:01,192
fi nesupravegheat, dar oricum e

33639
25:27:58,720 --> 25:28:04,192
învățarea automată.

33640
25:28:01,192 --> 25:28:04,192
Bine.

33641
25:28:06,872 --> 25:28:11,040
Bine. Cel final. Ceea ce distinge adânc

33642
25:28:09,120 --> 25:28:12,400
învățarea din învățarea automată și

33643
25:28:11,040 --> 25:28:16,360
inteligență artificială? Deci ce este

33644
25:28:12,400 --> 25:28:16,360
unic în ceea ce privește învățarea profundă?

33645
25:28:43,760 --> 25:28:49,280
Oh, foarte bine. Da. Deci, învățare profundă

33646
25:28:45,600 --> 25:28:50,800
folosește rețele neuronale așa cum sunteți voi

33647
25:28:49,280 --> 25:28:52,400
chiar deasupra. Adanc neuronal

33648
25:28:50,800 --> 25:28:55,120
învățarea folosește rețele neuronale. Asta este

33649
25:28:52,400 --> 25:28:57,120
îl face unic. Deci, învățarea automată

33650
25:28:55,120 --> 25:28:58,872
ar fi partea A. Învățarea automată este

33651
25:28:57,120 --> 25:29:01,120
concentrat pe învăţarea din date.

33652
25:28:58,872 --> 25:29:03,760
dedesubt se află învățarea din date

33653
25:29:01,120 --> 25:29:07,192
folosind rețele neuronale care este ceea ce uh

33654
25:29:03,760 --> 25:29:10,400
învăţarea profundă este.

33655
25:29:07,192 --> 25:29:14,800
Foarte bun.

33656
25:29:10,400 --> 25:29:16,960
În regulă, să trecem la lecția trei.

33657
25:29:14,800 --> 25:29:20,232
Și lecția trei are două caiete.

33658
25:29:16,960 --> 25:29:21,680
Vom începe cu 3.1.

33659
25:29:20,232 --> 25:29:23,120
Deci, veți dori să deschideți asta

33660
25:29:21,680 --> 25:29:27,872
caietul. Am de gând să trec la el

33661
25:29:23,120 --> 25:29:27,872
acum. Oferă-ți un moment pentru a deschide asta.

33662
25:29:33,120 --> 25:29:37,832
Deci, vom deschide versiunea 3.1

33663
25:29:34,872 --> 25:29:39,280
caietul. Hm, sunt doi. Vom face

33664
25:29:37,832 --> 25:29:42,400
vedem cât de departe putem ajunge în

33665
25:29:39,280 --> 25:29:44,640
a doua azi. Probabil că va.

33666
25:29:42,400 --> 25:29:46,552
Hm, dar vom face ceea ce suntem

33667
25:29:44,640 --> 25:29:48,400
va începe cu notebook-ul 3.1. tu

33668
25:29:46,552 --> 25:29:53,280
baieti au acest caiet? Ar trebui să fie în

33669
25:29:48,400 --> 25:29:54,552
materialele dvs. pentru acest curs.

33670
25:29:53,280 --> 25:29:57,512
Permiteți-mi să vă acord un moment pentru a deschide asta

33671
25:29:54,552 --> 25:29:57,512
unul.

33672
25:30:10,800 --> 25:30:14,440
Voi îl aveți?

33673
25:30:27,040 --> 25:30:34,800
În regulă. Deci, vom începe cu

33674
25:30:30,232 --> 25:30:36,872
vorbesc despre învățarea supravegheată

33675
25:30:34,800 --> 25:30:38,232
în călătoria noastră de învățare automată. Deci

33676
25:30:36,872 --> 25:30:40,960
ține minte, vom vorbi despre uh

33677
25:30:38,232 --> 25:30:43,600
supravegheat și nesupravegheat după ce o facem

33678
25:30:40,960 --> 25:30:45,832
supravegheat. Hm și va fi o

33679
25:30:43,600 --> 25:30:49,440
lot de acoperit cu supravegheat în principal

33680
25:30:45,832 --> 25:30:52,320
pentru că sunt două diferite

33681
25:30:49,440 --> 25:30:54,320
tipuri de probleme pe care le putem aborda, care

33682
25:30:52,320 --> 25:30:57,280
va fi uh despre care vom vorbi într-o clipă

33683
25:30:54,320 --> 25:30:59,040
prezice diferite tipuri de valori. Hm

33684
25:30:57,280 --> 25:31:01,512
dar să vorbim despre felul de ce

33685
25:30:59,040 --> 25:31:02,720
sperăm să aflăm aici care este um

33686
25:31:01,512 --> 25:31:04,232
vorbesc despre diferitele tipuri de

33687
25:31:02,720 --> 25:31:06,160
problemele pe care le vom studia care sunt

33688
25:31:04,232 --> 25:31:08,640
acestea aceste categorii de supravegheat

33689
25:31:06,160 --> 25:31:09,760
învăţarea. Sunt acele două categorii

33690
25:31:08,640 --> 25:31:11,192
urmând a fi numită clasificare și

33691
25:31:09,760 --> 25:31:13,192
regresie. Vom vorbi despre acestea și

33692
25:31:11,192 --> 25:31:16,720
diferențele lor și apoi vorbesc despre

33693
25:31:13,192 --> 25:31:18,400
unele aplicații și câteva exemple

33694
25:31:16,720 --> 25:31:20,640
algoritmi

33695
25:31:18,400 --> 25:31:24,160
și asta se află doar în acest caiet. Hm

33696
25:31:20,640 --> 25:31:25,680
3.2 doi vom intra în regresie

33697
25:31:24,160 --> 25:31:28,552
deosebit

33698
25:31:25,680 --> 25:31:30,552
um, care va fi uh foarte foarte

33699
25:31:28,552 --> 25:31:32,080
interesant. Bine. Deci asta va fi al nostru

33700
25:31:30,552 --> 25:31:35,552
primele modele pe care le vom construi vor fi

33701
25:31:32,080 --> 25:31:35,552
acolo în 3.2.

33702
25:31:36,160 --> 25:31:40,160
Bine. Deci, dacă vă amintiți, băieți

33703
25:31:38,480 --> 25:31:43,360
învățarea supravegheată este locul în care învățăm

33704
25:31:40,160 --> 25:31:47,360
din datele etichetate. Deci avem intrare și

33705
25:31:43,360 --> 25:31:50,320
ieșiri în setul nostru de date. Hm și

33706
25:31:47,360 --> 25:31:53,192
tu așa că antrenezi un model pe aceste date

33707
25:31:50,320 --> 25:31:57,040
care include caracteristici de intrare și

33708
25:31:53,192 --> 25:32:01,192
ieşirile corespunzătoare care sunt care sunt

33709
25:31:57,040 --> 25:32:04,160
etichetele. Corect? Deci scopul este să

33710
25:32:01,192 --> 25:32:05,832
învață o relație între intrare

33711
25:32:04,160 --> 25:32:09,040
și ieșirea. Bineînțeles că asta este

33712
25:32:05,832 --> 25:32:12,400
orice model încearcă să facă. Hm, și ce

33713
25:32:09,040 --> 25:32:14,640
acest lucru ne permite să facem este apoi să luăm asta

33714
25:32:12,400 --> 25:32:16,640
modelați și utilizați-l pentru a face predicții asupra

33715
25:32:14,640 --> 25:32:19,512
neprevăzut niciodată

33716
25:32:16,640 --> 25:32:21,600
uh date. Corect? Deci atunci avem un

33717
25:32:19,512 --> 25:32:25,360
model predictiv din ceea ce putem

33718
25:32:21,600 --> 25:32:27,760
folosește-te în continuare cu exemple noi.

33719
25:32:25,360 --> 25:32:30,640
Um asa

33720
25:32:27,760 --> 25:32:33,120
amintiți-vă că vom avea în datele noastre a

33721
25:32:30,640 --> 25:32:34,960
o grămadă de caracteristici care sunt coloane și

33722
25:32:33,120 --> 25:32:36,640
atunci, în general, una dintre acele coloane va

33723
25:32:34,960 --> 25:32:38,232
fi eticheta pe care încercăm să o facem

33724
25:32:36,640 --> 25:32:40,720
prezice.

33725
25:32:38,232 --> 25:32:42,232
Și modelul nostru va încerca să învețe

33726
25:32:40,720 --> 25:32:46,000
un fel de relație între aceștia

33727
25:32:42,232 --> 25:32:47,680
intrări și eticheta de ieșire. Deci

33728
25:32:46,000 --> 25:32:51,512
eticheta de ieșire ar putea fi ca o fraudă nu

33729
25:32:47,680 --> 25:32:55,600
fraudă, cancer nu cancer, uh un preț, a

33730
25:32:51,512 --> 25:32:58,480
temperatura, astfel de lucruri.

33731
25:32:55,600 --> 25:33:00,080
Deci hai să vorbim despre asta. înăuntrul lui

33732
25:32:58,480 --> 25:33:03,192
învățarea supravegheată sunt două

33733
25:33:00,080 --> 25:33:06,640
diferite tipuri de învățare pe care le putem

33734
25:33:03,192 --> 25:33:09,120
fac și se bazează într-adevăr pe etichetă

33735
25:33:06,640 --> 25:33:12,480
sau uneori acea etichetă este cunoscută sub numele de

33736
25:33:09,120 --> 25:33:15,360
ținta pe care încercăm să o prevedem. Hm

33737
25:33:12,480 --> 25:33:16,960
și în funcție de tipul respectiv le obținem

33738
25:33:15,360 --> 25:33:19,280
două categorii diferite de învăţare sau

33739
25:33:16,960 --> 25:33:22,320
două tipuri diferite de învăţare. Unul este

33740
25:33:19,280 --> 25:33:25,120
cunoscut sub numele de regresie. Deci asta e in general

33741
25:33:22,320 --> 25:33:27,192
când prezicem ceva care este

33742
25:33:25,120 --> 25:33:30,000
continuu sau ceva care este a

33743
25:33:27,192 --> 25:33:32,160
numerice.

33744
25:33:30,000 --> 25:33:35,440
Deci numeric

33745
25:33:32,160 --> 25:33:37,832
valoare numerică. Deci gândește-te la preț,

33746
25:33:35,440 --> 25:33:39,600
gândiți-vă la temperatură, gândiți-vă la venituri.

33747
25:33:37,832 --> 25:33:42,872
Încercăm să prezicem ceva de genul

33748
25:33:39,600 --> 25:33:45,512
că. Um față de ceva care este

33749
25:33:42,872 --> 25:33:46,872
categoric. Deci prezicerea

33750
25:33:45,512 --> 25:33:49,832
ceva categoric ar fi ca

33751
25:33:46,872 --> 25:33:53,360
fraudă, nu fraudă, spam, nu spam. um

33752
25:33:49,832 --> 25:33:55,832
acestea sunt categorii discrete și

33753
25:33:53,360 --> 25:33:59,280
problema prezicerii categoriilor este este

33754
25:33:55,832 --> 25:34:02,872
cunoscut sub numele de clasificare pentru că suntem

33755
25:33:59,280 --> 25:34:06,720
încercând să clasifice exemplele ca aparținând

33756
25:34:02,872 --> 25:34:09,600
la o categorie sau alta.

33757
25:34:06,720 --> 25:34:11,600
Deci avem aceste două tipuri principale de

33758
25:34:09,600 --> 25:34:13,680
probleme de învățare supravegheată. avem

33759
25:34:11,600 --> 25:34:16,080
regresie și avem clasificare

33760
25:34:13,680 --> 25:34:17,600
și vor fi manipulate ușor

33761
25:34:16,080 --> 25:34:20,552
diferit

33762
25:34:17,600 --> 25:34:23,680
din multe motive pe care le vom face

33763
25:34:20,552 --> 25:34:26,160
descoperi. Unul dintre motivele principale

33764
25:34:23,680 --> 25:34:27,512
asta, desigur, prezicem

33765
25:34:26,160 --> 25:34:28,872
ceva care este continuu în

33766
25:34:27,512 --> 25:34:31,120
caz de regresie versus ceva

33767
25:34:28,872 --> 25:34:33,440
discret. Deci modelele trebuie să fie

33768
25:34:31,120 --> 25:34:37,680
ușor diferit pentru a explica asta.

33769
25:34:33,440 --> 25:34:40,800
Hm, dar apoi un pas dincolo de asta este

33770
25:34:37,680 --> 25:34:42,232
evaluarea trebuie să fie și ea diferită. Hm eu

33771
25:34:40,800 --> 25:34:43,512
s-a cam făcut aluzie la asta săptămâna trecută, dar

33772
25:34:42,232 --> 25:34:46,000
când prezici o regresie,

33773
25:34:43,512 --> 25:34:51,680
este foarte foarte dificil să obții

33774
25:34:46,000 --> 25:34:56,080
răspuns numeric exact. Deci, în general

33775
25:34:51,680 --> 25:34:59,120
nu ne pasă de asta. Hm, în general

33776
25:34:56,080 --> 25:35:00,960
nu ne interesează să obținem exact uh

33777
25:34:59,120 --> 25:35:02,160
nu ne interesează să-l obținem exact

33778
25:35:00,960 --> 25:35:05,280
corect.

33779
25:35:02,160 --> 25:35:07,120
ne pasă doar să-l luăm

33780
25:35:05,280 --> 25:35:10,720
doar ne pasă să-l obținem

33781
25:35:07,120 --> 25:35:13,360
aproape, apropiindu-l suficient. Hm

33782
25:35:10,720 --> 25:35:14,720
în timp ce clasificare, ne pasă

33783
25:35:13,360 --> 25:35:17,040
ajunge exact pentru că este o

33784
25:35:14,720 --> 25:35:18,552
categorie discretă. Deci vom fi

33785
25:35:17,040 --> 25:35:20,720
capabil să evalueze puțin asta

33786
25:35:18,552 --> 25:35:22,320
altfel să spunem că am primit răspunsul

33787
25:35:20,720 --> 25:35:25,832
corect sau greșit. Regresia va fi

33788
25:35:22,320 --> 25:35:26,960
fi ne-am apropiat? Hm pentru că suntem noi

33789
25:35:25,832 --> 25:35:29,280
presupun că va fi aproape

33790
25:35:26,960 --> 25:35:34,400
imposibil de prezis un continuu

33791
25:35:29,280 --> 25:35:36,160
număr. E foarte greu de făcut.

33792
25:35:34,400 --> 25:35:38,960
Bine.

33793
25:35:36,160 --> 25:35:42,192
Deci, orice întrebări despre

33794
25:35:38,960 --> 25:35:42,192
uh asta?

33795
25:35:44,872 --> 25:35:47,600
Aveți întrebări despre aceste două diferențe?

33796
25:35:46,320 --> 25:35:51,280
Permiteți-mi să vă dau câteva exemple. Poate

33797
25:35:47,600 --> 25:35:52,960
va ajuta și el.

33798
25:35:51,280 --> 25:35:55,120
Deci, din nou, clasificarea merge

33799
25:35:52,960 --> 25:35:57,192
să prezic ceva care este

33800
25:35:55,120 --> 25:36:02,360
categoric. regresia va fi

33801
25:35:57,192 --> 25:36:02,360
prezice ceva care este continuu.

33802
25:36:04,320 --> 25:36:08,000
Deci gândește-te să încerci să prezici

33803
25:36:06,320 --> 25:36:09,512
prețul unei case pe baza celorlalte

33804
25:36:08,000 --> 25:36:12,400
caracteristici despre care am vorbit înainte ca

33805
25:36:09,512 --> 25:36:14,400
mp, dormitoare, bai, toate

33806
25:36:12,400 --> 25:36:16,232
acele lucruri prezicem prețul. Asta

33807
25:36:14,400 --> 25:36:19,832
ar fi o problemă de regresie deoarece

33808
25:36:16,232 --> 25:36:22,320
pretul este o valoare continua.

33809
25:36:19,832 --> 25:36:26,400
Să aruncăm o privire la un exemplu aici.

33810
25:36:22,320 --> 25:36:29,440
Hm, imaginează-ți că am încercat să prezicem

33811
25:36:26,400 --> 25:36:31,600
temperatura de maine. Asta merge

33812
25:36:29,440 --> 25:36:33,512
a fi o problemă de regresie, a a

33813
25:36:31,600 --> 25:36:35,920
tip de regresie de învățare supravegheată

33814
25:36:33,512 --> 25:36:39,360
problemă pentru că încercăm să prezicem

33815
25:36:35,920 --> 25:36:43,920
o temperatură numerică.

33816
25:36:39,360 --> 25:36:45,600
Bine? Și față de o categorie ca a

33817
25:36:43,920 --> 25:36:47,120
categorie discretă ar fi aceasta ar fi

33818
25:36:45,600 --> 25:36:49,360
o clasificare. Deci acesta este un

33819
25:36:47,120 --> 25:36:52,000
regresie la stânga. Acesta este un

33820
25:36:49,360 --> 25:36:56,960
clasificare

33821
25:36:52,000 --> 25:37:01,120
pe dreapta. Clasificare

33822
25:36:56,960 --> 25:37:03,440
um pentru că um prezicem unul dintre

33823
25:37:01,120 --> 25:37:05,512
doua categorii. Este doar cald sau rece?

33824
25:37:03,440 --> 25:37:08,000
Acum, nu spunem exact unde

33825
25:37:05,512 --> 25:37:10,000
pragul este pe ceea ce este cald sau rece. Asta

33826
25:37:08,000 --> 25:37:12,160
ar fi o decizie asupra a ceea ce ne dorim

33827
25:37:10,000 --> 25:37:13,680
la ceea ce categoriile noastre discrete de fapt

33828
25:37:12,160 --> 25:37:17,280
înseamnă.

33829
25:37:13,680 --> 25:37:18,960
Dar avem doar două variante, fierbinte sau

33830
25:37:17,280 --> 25:37:21,512
frig.

33831
25:37:18,960 --> 25:37:24,720
versus prezicerea întregii temperaturi

33832
25:37:21,512 --> 25:37:28,960
care ar fi o predicție numerică

33833
25:37:24,720 --> 25:37:30,800
de un număr exact. Corect? Așa ar fi

33834
25:37:28,960 --> 25:37:34,232
fie o regresie și apoi pe dreapta

33835
25:37:30,800 --> 25:37:35,832
ar fi o clasificare. Hm acum din nou

33836
25:37:34,232 --> 25:37:37,192
de ce este asta atât de diferit? Poți vedea

33837
25:37:35,832 --> 25:37:38,480
tipurile de predicții pe care le facem

33838
25:37:37,192 --> 25:37:40,720
sunt complet diferite. Unul este a

33839
25:37:38,480 --> 25:37:44,552
număr, unu este o categorie. Dar din nou cu

33840
25:37:40,720 --> 25:37:48,000
evaluare este ca și cum dacă ar fi adevărat

33841
25:37:44,552 --> 25:37:51,120
răspunsul în etichetele noastre a fost 84

33842
25:37:48,000 --> 25:37:53,192
și am prezis 83 care este destul de bun

33843
25:37:51,120 --> 25:37:55,040
rezultat. Asta e încă destul de aproape.

33844
25:37:53,192 --> 25:37:57,280
E destul de aproape de asta. Deci dintr-o

33845
25:37:55,040 --> 25:38:00,320
perspectiva evaluării este frumoasă

33846
25:37:57,280 --> 25:38:02,720
bine. Hm, în timp ce parcă aș fi prezis

33847
25:38:00,320 --> 25:38:05,760
frig și de fapt e cald, atât

33848
25:38:02,720 --> 25:38:08,080
un raspuns gresit. Deci sunt evaluați

33849
25:38:05,760 --> 25:38:10,160
usor diferit.

33850
25:38:08,080 --> 25:38:13,680
Hm, și asta e ceva la care vom merge

33851
25:38:10,160 --> 25:38:16,080
vezi când vorbim despre evaluarea noastră

33852
25:38:13,680 --> 25:38:17,440
modelele odată ce le construim depinde

33853
25:38:16,080 --> 25:38:18,480
pe dacă este regresie de clasificare,

33854
25:38:17,440 --> 25:38:22,000
vor exista moduri diferite de

33855
25:38:18,480 --> 25:38:23,512
evaluându-le.

33856
25:38:22,000 --> 25:38:26,480
Poți să vezi de ce este foarte

33857
25:38:23,512 --> 25:38:30,232
greu de spus, bine, am ajuns exact

33858
25:38:26,480 --> 25:38:31,680
84 când ar putea fi orice număr. Al nostru

33859
25:38:30,232 --> 25:38:34,552
modelul va prezice a

33860
25:38:31,680 --> 25:38:36,960
număr. Este foarte greu de stabilit

33861
25:38:34,552 --> 25:38:39,040
un număr exact flotant. Deci,

33862
25:38:36,960 --> 25:38:40,800
Cel mai bine putem face este să spunem cât de aproape

33863
25:38:39,040 --> 25:38:42,160
am primit? Ca, asta ar fi mai rău

33864
25:38:40,800 --> 25:38:44,480
răspuns. Dacă am primit ceva până la capăt

33865
25:38:42,160 --> 25:38:47,120
aici jos, asta e o distanță foarte lungă

33866
25:38:44,480 --> 25:38:48,320
până aici. Asta e rău. Asta e un rău

33867
25:38:47,120 --> 25:38:51,440
predictie. Dar dacă primesc ceva

33868
25:38:48,320 --> 25:38:53,192
foarte aproape, e mai bine, nu?

33869
25:38:51,440 --> 25:38:55,440
Este o predicție decentă pentru că este

33870
25:38:53,192 --> 25:38:57,512
destul de aproape,

33871
25:38:55,440 --> 25:38:58,800
nu?

33872
25:38:57,512 --> 25:39:00,960
Desigur, a fi perfect ar fi

33873
25:38:58,800 --> 25:39:04,920
ajunge exact, dar asta ar fi

33874
25:39:00,960 --> 25:39:04,920
aproape imposibil de făcut.

33875
25:39:13,760 --> 25:39:16,760
Bine.

33876
25:39:18,320 --> 25:39:23,192
În regulă. Aveți întrebări despre asta?

33877
25:39:21,440 --> 25:39:24,800
Are sens asupra regresiei versus

33878
25:39:23,192 --> 25:39:27,440
clasificare? O să le folosim

33879
25:39:24,800 --> 25:39:29,120
cuvinte destul de puțin pe măsură ce mergem. Aşa

33880
25:39:27,440 --> 25:39:31,760
regresia care prezice continuu

33881
25:39:29,120 --> 25:39:34,400
clasificarea valorii prezicerea a

33882
25:39:31,760 --> 25:39:36,480
categorie

33883
25:39:34,400 --> 25:39:40,280
și vor fi diferiți

33884
25:39:36,480 --> 25:39:40,280
modele care fac asta

33885
25:39:41,512 --> 25:39:44,640
diferite modele fiind folosite pentru

33886
25:39:42,960 --> 25:39:47,960
regresia versus diferite modele fiind

33887
25:39:44,640 --> 25:39:47,960
folosit pentru clasificare.

33888
25:39:52,872 --> 25:39:58,872
Bine, să vorbim despre supravegheat

33889
25:39:55,440 --> 25:40:02,232
învăţarea. uh aplicații aici. Deci doar

33890
25:39:58,872 --> 25:40:03,512
pentru a numi câteva, avem operațiuni de HR.

33891
25:40:02,232 --> 25:40:06,000
Imaginați-vă recrutorul dvs. însărcinat

33892
25:40:03,512 --> 25:40:08,872
găsirea celor mai buni candidați. Um asa

33893
25:40:06,000 --> 25:40:10,640
învățarea supravegheată poate ajuta de um

33894
25:40:08,872 --> 25:40:12,480
respingerea sau acceptarea candidaților. Acum

33895
25:40:10,640 --> 25:40:17,192
acesta este ceva care se întâmplă destul de a

33896
25:40:12,480 --> 25:40:20,080
putin chiar si azi. Hm și că este un fel

33897
25:40:17,192 --> 25:40:22,000
cum se întâmplă recomandările

33898
25:40:20,080 --> 25:40:24,640
acest CV ar trebui să fie um

33899
25:40:22,000 --> 25:40:28,232
recomandat acest lucru nu ar trebui să um de la a

33900
25:40:24,640 --> 25:40:32,232
întregul grup de aplicații. Um asa

33901
25:40:28,232 --> 25:40:34,080
există astfel de cazuri de utilizare a um

33902
25:40:32,232 --> 25:40:36,080
prezicând o categorie care ar fi ca

33903
25:40:34,080 --> 25:40:39,512
o clasificare. Ar trebui să facem

33904
25:40:36,080 --> 25:40:41,680
accept sau respinge candidatul?

33905
25:40:39,512 --> 25:40:44,160
um finante. Vezi asta tot timpul

33906
25:40:41,680 --> 25:40:45,680
cu lucruri precum riscul și împrumutul

33907
25:40:44,160 --> 25:40:49,680
aprobări.

33908
25:40:45,680 --> 25:40:52,480
Poți să prezici

33909
25:40:49,680 --> 25:40:54,160
categorie de like if the if the credit if

33910
25:40:52,480 --> 25:40:57,760
ar trebui să acceptăm sau să respingem împrumutul

33911
25:40:54,160 --> 25:40:59,440
aplicarea. Hm, știi că ar fi o

33912
25:40:57,760 --> 25:41:01,512
clasificare.

33913
25:40:59,440 --> 25:41:03,680
Ce este interesant

33914
25:41:01,512 --> 25:41:06,232
clasificări de altfel, așa se spune

33915
25:41:03,680 --> 25:41:09,040
aici ca și cum am putea prezice probabilitatea

33916
25:41:06,232 --> 25:41:13,920
a unui împrumut în curs de rambursare.

33917
25:41:09,040 --> 25:41:16,480
um este o mulțime de clasificări um noi noi

33918
25:41:13,920 --> 25:41:18,552
spun că ei prezic o categorie dar

33919
25:41:16,480 --> 25:41:20,400
sub capotă ei chiar pot prezice

33920
25:41:18,552 --> 25:41:25,920
o probabilitate și o întoarcem

33921
25:41:20,400 --> 25:41:27,920
probabilitatea într-o categorie. Deci tu

33922
25:41:25,920 --> 25:41:29,360
știm cum am putea spune ce am putea

33923
25:41:27,920 --> 25:41:31,600
spune probabilitatea ca împrumutul ei să fie

33924
25:41:29,360 --> 25:41:35,040
rambursat este foarte mic. Să zicem că este mai puțin

33925
25:41:31,600 --> 25:41:38,000
probabilitate de peste 50%. Atunci am putea

33926
25:41:35,040 --> 25:41:39,360
etichetați acest lucru drept respingere,

33927
25:41:38,000 --> 25:41:43,360
nu? Corect? Am putea eticheta asta drept a

33928
25:41:39,360 --> 25:41:46,552
respingere. Hm dacă este mai mare de 50%.

33929
25:41:43,360 --> 25:41:49,192
Atunci am putea eticheta asta ca accept. Deci

33930
25:41:46,552 --> 25:41:52,160
putem stabili un prag acolo

33931
25:41:49,192 --> 25:41:54,320
și spuneți bine, cu adevărat, prezicem a

33932
25:41:52,160 --> 25:41:57,120
probabil ca modelul nostru scuipa a

33933
25:41:54,320 --> 25:41:59,512
probabilitate, dar o transformăm într-o

33934
25:41:57,120 --> 25:42:02,232
categorie spunând ar trebui să acceptăm dacă

33935
25:41:59,512 --> 25:42:05,360
este mai puțin de 50% ar trebui să respingem dacă

33936
25:42:02,232 --> 25:42:06,720
este mai mare decât ar trebui să acceptăm.

33937
25:42:05,360 --> 25:42:08,160
Bine. Deci asta e ceva ce vom vedea

33938
25:42:06,720 --> 25:42:10,640
cu unele dintre modelele noastre de clasificare

33939
25:42:08,160 --> 25:42:12,720
este că produc de fapt o

33940
25:42:10,640 --> 25:42:16,232
probabilitate și întoarcem acea probabilitate

33941
25:42:12,720 --> 25:42:18,232
într-o etichetă de categorie

33942
25:42:16,232 --> 25:42:21,440
um făcând ceva simplu de genul

33943
25:42:18,232 --> 25:42:25,000
asta pune un prag pe ea um pt

33944
25:42:21,440 --> 25:42:25,000
pentru categorie.

33945
25:42:25,920 --> 25:42:29,512
Deci finanțele sunt folosite peste tot.

33946
25:42:27,832 --> 25:42:30,960
Nu doar împrumuturi precum frauda, noi

33947
25:42:29,512 --> 25:42:32,960
a vorbit despre fraudă, nu despre fraudă. Asta

33948
25:42:30,960 --> 25:42:36,552
ar fi o clasificare.

33949
25:42:32,960 --> 25:42:38,960
Hm prezicerea veniturilor din vânzări, așa ar fi

33950
25:42:36,552 --> 25:42:40,800
fi o regresie, nu? Ce este

33951
25:42:38,960 --> 25:42:42,800
veniturile vor fi în următoarele două

33952
25:42:40,800 --> 25:42:45,280
sferturi? Asta va fi o

33953
25:42:42,800 --> 25:42:48,000
problema de regresie.

33954
25:42:45,280 --> 25:42:50,160
E-mailuri ca spam, nu spam, asta e

33955
25:42:48,000 --> 25:42:52,080
va fi o clasificare.

33956
25:42:50,160 --> 25:42:54,960
um asta va opera pe asta

33957
25:42:52,080 --> 25:42:58,320
va prelua textul introdus și va prezice

33958
25:42:54,960 --> 25:43:00,960
dacă acest e-mail este un spam sau nu este un spam.

33959
25:42:58,320 --> 25:43:02,800
Va fi supravegheat

33960
25:43:00,960 --> 25:43:05,680
problemă de învățare, dar va fi a

33961
25:43:02,800 --> 25:43:08,552
problema de clasificare,

33962
25:43:05,680 --> 25:43:11,280
nu? Uh, producția este supravegheată

33963
25:43:08,552 --> 25:43:12,800
Învățarea este folosită pentru a inspecta și uh

33964
25:43:11,280 --> 25:43:14,320
calitatea si clasificarea produselor in

33965
25:43:12,800 --> 25:43:16,320
grade diferite. De exemplu, o fabrică

33966
25:43:14,320 --> 25:43:17,280
ar putea folosi un model pentru a verifica defecte.

33967
25:43:16,320 --> 25:43:19,440
Deci, acesta este de fapt ceva care

33968
25:43:17,280 --> 25:43:21,120
se întâmplă dacă te uiți la imagini cu

33969
25:43:19,440 --> 25:43:23,360
produsele pe măsură ce trec prin asamblare

33970
25:43:21,120 --> 25:43:25,040
linie și le puteți arunca o privire

33971
25:43:23,360 --> 25:43:28,232
imagini și preziceți dacă este un mare

33972
25:43:25,040 --> 25:43:30,640
calitate, calitate scăzută, calitate medie. Hm

33973
25:43:28,232 --> 25:43:31,832
deci pot fi aceasta este o clasificare,

33974
25:43:30,640 --> 25:43:35,360
nu? Ei intră în diferit

33975
25:43:31,832 --> 25:43:37,360
categorii de calitate. Hm, deci e mult

33976
25:43:35,360 --> 25:43:42,400
la fel ca o intervenție manuală

33977
25:43:37,360 --> 25:43:44,640
de unii uh QA sau control de calitate uh

33978
25:43:42,400 --> 25:43:48,512
specialist.

33979
25:43:44,640 --> 25:43:48,512
Bine. Dar asta e o clasificare.

33980
25:43:51,040 --> 25:43:55,512
Deci în industria maritimă, supravegheat

33981
25:43:53,360 --> 25:43:57,680
învăţarea poate fi folosită pentru a prezice curentul.

33982
25:43:55,512 --> 25:44:00,720
Deci nivelul actual

33983
25:43:57,680 --> 25:44:03,440
și asta poate fi folosit pentru a prognoza uh

33984
25:44:00,720 --> 25:44:07,040
cererea si oferta. Hm, așa ar fi

33985
25:44:03,440 --> 25:44:09,120
ca modelele de regresie care sunt obișnuite

33986
25:44:07,040 --> 25:44:13,480
prezice un fel de temperatură, dar

33987
25:44:09,120 --> 25:44:13,480
în acest caz ca niveluri de titlu.

33988
25:44:14,160 --> 25:44:18,160
Am vorbit deja despre fraudă, așa că asta e

33989
25:44:16,160 --> 25:44:21,160
acolo. Um, asta ar fi o

33990
25:44:18,160 --> 25:44:21,160
clasificare.

33991
25:44:23,760 --> 25:44:30,872
bine,

33992
25:44:26,552 --> 25:44:34,000
vreo întrebare despre aceste exemple?

33993
25:44:30,872 --> 25:44:36,480
Desigur, mai sunt multe. Hm

33994
25:44:34,000 --> 25:44:39,600
recomandarea este un fel de a

33995
25:44:36,480 --> 25:44:41,360
problemă de învățare supravegheată, unde ești

33996
25:44:39,600 --> 25:44:43,512
sunt

33997
25:44:41,360 --> 25:44:46,232
luând exemple de lucruri pe care oamenii

33998
25:44:43,512 --> 25:44:48,800
au văzut în trecut sau sau au revizuit

33999
25:44:46,232 --> 25:44:50,720
în trecut și folosind asta pentru a prezice

34000
25:44:48,800 --> 25:44:54,232
ce ar dori să urmărească în

34001
25:44:50,720 --> 25:44:58,320
viitor. Așa este recomandarea

34002
25:44:54,232 --> 25:45:00,320
învăţare supravegheată. Hm și este ca o

34003
25:44:58,320 --> 25:45:03,920
clasificare, știi, încercând

34004
25:45:00,320 --> 25:45:07,512
prezice umh un anumit număr de

34005
25:45:03,920 --> 25:45:11,680
categorii de emisiuni sau filme care

34006
25:45:07,512 --> 25:45:13,600
ai vrea sa te uiti. Hm

34007
25:45:11,680 --> 25:45:15,192
și asta e ceva pe care îl vom studia

34008
25:45:13,600 --> 25:45:16,552
în viitor. Recomand noi vom face

34009
25:45:15,192 --> 25:45:20,440
au o întreagă lecție dedicată

34010
25:45:16,552 --> 25:45:20,440
recomandare de asemenea.

34011
25:45:21,680 --> 25:45:28,320
În regulă.

34012
25:45:23,920 --> 25:45:30,232
Deci, când vine vorba de real

34013
25:45:28,320 --> 25:45:31,920
modelele în sine, așa că există de gând

34014
25:45:30,232 --> 25:45:36,000
fi o mulțime de modele diferite care suntem

34015
25:45:31,920 --> 25:45:38,552
mergând să acopere. Hm și ei pleacă

34016
25:45:36,000 --> 25:45:41,192
să fie diferiţi în scopul lor şi

34017
25:45:38,552 --> 25:45:46,480
ce fel de probleme au

34018
25:45:41,192 --> 25:45:48,400
sunt folosite pentru. Au lor

34019
25:45:46,480 --> 25:45:51,760
cum va fi de fapt ei antrenamente

34020
25:45:48,400 --> 25:45:53,600
diferite. Hm, dar la un nivel înalt,

34021
25:45:51,760 --> 25:45:55,600
toți încearcă să facă același lucru,

34022
25:45:53,600 --> 25:45:57,920
care înseamnă să înveți un fel de relație

34023
25:45:55,600 --> 25:45:59,680
între datele de intrare și și

34024
25:45:57,920 --> 25:46:00,800
eticheta, nu? Chiar asta sunt

34025
25:45:59,680 --> 25:46:02,800
încearcă să facă pentru că sunt toți

34026
25:46:00,800 --> 25:46:04,640
supravegheat. Ei au acelea

34027
25:46:02,800 --> 25:46:07,192
etichete, încercând să construiesc câteva

34028
25:46:04,640 --> 25:46:09,120
relație acolo. Ei doar o fac

34029
25:46:07,192 --> 25:46:11,512
diferit.

34030
25:46:09,120 --> 25:46:13,280
Și ceea ce vom studia este

34031
25:46:11,512 --> 25:46:14,872
avantaje și dezavantaje ale multor dintre aceste modele,

34032
25:46:13,280 --> 25:46:17,512
cum ar fi când aș folosi una dintre ele, când

34033
25:46:14,872 --> 25:46:20,160
as folosi alta. Hm, așa că vom încerca

34034
25:46:17,512 --> 25:46:23,040
vorbim despre asta pe măsură ce mergem. Hm, dar

34035
25:46:20,160 --> 25:46:25,040
toți încearcă să învețe ceva

34036
25:46:23,040 --> 25:46:27,512
relația dintre caracteristicile de intrare

34037
25:46:25,040 --> 25:46:29,680
și ieșirea, nu? Deci trebuie

34038
25:46:27,512 --> 25:46:31,920
tine cont de asta. Ei încearcă

34039
25:46:29,680 --> 25:46:34,080
modelează acea relație. Ei doar o fac

34040
25:46:31,920 --> 25:46:37,192
în moduri diferite. Bine? Deci, pe măsură ce mergem

34041
25:46:34,080 --> 25:46:38,720
împreună și aflați despre modele noi, um, noi

34042
25:46:37,192 --> 25:46:42,232
va afla detaliile. va învăța

34043
25:46:38,720 --> 25:46:44,720
dezavantaje și avantaje și dezavantaje,

34044
25:46:42,232 --> 25:46:48,320
dar sunt indiferent ce, sunt toate

34045
25:46:44,720 --> 25:46:50,400
încercând să învețe acea relație,

34046
25:46:48,320 --> 25:46:53,832
corect? Și să poți face previziuni

34047
25:46:50,400 --> 25:46:55,680
pe date noi.

34048
25:46:53,832 --> 25:46:58,552
bine,

34049
25:46:55,680 --> 25:47:02,640
așa că iată o listă de modele pe care le vom face

34050
25:46:58,552 --> 25:47:04,872
acoperiți și lucrați pe tot parcursul uh the

34051
25:47:02,640 --> 25:47:07,280
sesiunile pe care le avem. nu suntem

34052
25:47:04,872 --> 25:47:09,192
le voi face pe toate într-o singură ședință,

34053
25:47:07,280 --> 25:47:11,440
dar primul la care o să mergem

34054
25:47:09,192 --> 25:47:14,000
începe cu și pe care îl vom acoperi astăzi este

34055
25:47:11,440 --> 25:47:16,080
va fi regresie liniară.

34056
25:47:14,000 --> 25:47:18,800
Deci vom acoperi regresia liniară și

34057
25:47:16,080 --> 25:47:21,512
apoi îi vom acoperi pe restul acestor tipi

34058
25:47:18,800 --> 25:47:23,040
mai ales în contextul uh

34059
25:47:21,512 --> 25:47:26,160
clasificare.

34060
25:47:23,040 --> 25:47:28,800
Deci, um, ceea ce este interesant este o parte din

34061
25:47:26,160 --> 25:47:30,640
acești tipi pot fi folosiți pentru ambele

34062
25:47:28,800 --> 25:47:33,192
regresie şi clasificare atâta timp cât

34063
25:47:30,640 --> 25:47:36,160
le faci, um, anumite ajustări

34064
25:47:33,192 --> 25:47:38,800
ei. Au variații care pot fi

34065
25:47:36,160 --> 25:47:42,480
folosit pentru a face clasificare și regresie

34066
25:47:38,800 --> 25:47:45,280
este foarte interesant. Hm, dar mergem

34067
25:47:42,480 --> 25:47:47,440
pentru a începe cu regresia liniară astăzi

34068
25:47:45,280 --> 25:47:49,760
și apoi ne facem drum prin restul

34069
25:47:47,440 --> 25:47:51,680
dintre aceste modele când facem um suntem

34070
25:47:49,760 --> 25:47:53,680
voi face o lecție separată a patru despre

34071
25:47:51,680 --> 25:47:57,800
clasificare. Deci toți acești tipi

34072
25:47:53,680 --> 25:47:57,800
va veni din lecția a patra.

34073
25:47:59,120 --> 25:48:06,160
Um și apoi uh îl vom pune pe tipul ăsta

34074
25:48:03,440 --> 25:48:10,360
lecția trei în caietul 3.2. Vom face

34075
25:48:06,160 --> 25:48:10,360
face totul despre regresia liniară.

34076
25:48:10,480 --> 25:48:15,832
Da, așa că regresia logistică este o

34077
25:48:12,960 --> 25:48:18,080
clasificare um care este un fel de

34078
25:48:15,832 --> 25:48:20,800
ciudat că numele lui este regresie dar

34079
25:48:18,080 --> 25:48:23,040
face o clasificare dar the

34080
25:48:20,800 --> 25:48:26,720
motivul este că regresia logistică

34081
25:48:23,040 --> 25:48:29,440
um calculează o probabilitate. Deci face o

34082
25:48:26,720 --> 25:48:31,440
regresie pentru a prezice un număr dar că

34083
25:48:29,440 --> 25:48:34,480
numărul este de fapt o probabilitate. Deci

34084
25:48:31,440 --> 25:48:38,872
produce un rezultat care este între el

34085
25:48:34,480 --> 25:48:43,320
produce o probabilitate care este între um

34086
25:48:38,872 --> 25:48:43,320
evident, zero și unu.

34087
25:48:43,760 --> 25:48:47,280
Deci uh și apoi luăm asta

34088
25:48:45,760 --> 25:48:49,192
probabilitate și o transformăm în a

34089
25:48:47,280 --> 25:48:52,800
categorie

34090
25:48:49,192 --> 25:48:54,960
ca un spam, nu fraudă spam, nu fraudă.

34091
25:48:52,800 --> 25:48:57,120
Hm, dar deci regresia logistică este bună

34092
25:48:54,960 --> 25:48:58,800
de special. Este un fel ca o

34093
25:48:57,120 --> 25:49:00,480
regresie dar prezice o foarte

34094
25:48:58,800 --> 25:49:03,192
tip specific de valoare care este a

34095
25:49:00,480 --> 25:49:08,680
probabilitate. Deci din acest motiv este

34096
25:49:03,192 --> 25:49:08,680
un algoritm de clasificare în primul rând.

34097
25:49:12,800 --> 25:49:17,832
Așa că îl vom studia pe acesta în lecția a patra.

34098
25:49:15,512 --> 25:49:19,512
Uh, dar da, de aceea este

34099
25:49:17,832 --> 25:49:21,120
sub genul acela de umbrelă de

34100
25:49:19,512 --> 25:49:22,800
clasificarea este pentru că este

34101
25:49:21,120 --> 25:49:26,160
producând o probabilitate ca principală

34102
25:49:22,800 --> 25:49:28,400
ieșire pe care apoi o putem transforma într-o

34103
25:49:26,160 --> 25:49:32,320
categorie atâta timp cât interpretăm asta

34104
25:49:28,400 --> 25:49:34,160
probabilitatea ca um în modul corect uh

34105
25:49:32,320 --> 25:49:38,040
cum ar fi probabilitatea de spam,

34106
25:49:34,160 --> 25:49:38,040
probabilitatea de a nu face spam.

34107
25:49:40,480 --> 25:49:43,480
Bine.

34108
25:49:44,080 --> 25:49:49,440
Bine. Deci, lasă-mă să mă concentrez pe um

34109
25:49:47,832 --> 25:49:50,720
permiteți-mi să mă concentrez pe regresia liniară. eu sunt

34110
25:49:49,440 --> 25:49:52,800
nu o să trec prin toate astea

34111
25:49:50,720 --> 25:49:56,232
alte cazuri de utilizare pentru că noi nu am

34112
25:49:52,800 --> 25:49:59,360
am învățat încă aceste modele. Aşa, nu

34113
25:49:56,232 --> 25:50:01,440
cred ca sunt buni. Nu cred

34114
25:49:59,360 --> 25:50:04,080
e bine să citești încă despre ele până când

34115
25:50:01,440 --> 25:50:06,000
le-am acoperit. Deci, odată ce acoperim

34116
25:50:04,080 --> 25:50:08,232
ei în lecția a patra, mă voi întoarce și

34117
25:50:06,000 --> 25:50:10,232
descrieți-vă aceste exemple și

34118
25:50:08,232 --> 25:50:12,960
vom vedea de ce are sens. Dar eu

34119
25:50:10,232 --> 25:50:14,872
gândiți-vă la o regresie liniară um care

34120
25:50:12,960 --> 25:50:16,720
este ceea ce vom trata în continuare, lasă-mă să vorbesc

34121
25:50:14,872 --> 25:50:18,552
despre acel exemplu. Deci un prototip

34122
25:50:16,720 --> 25:50:20,720
exemplu ar fi ca și cum ai prezice

34123
25:50:18,552 --> 25:50:22,960
prețurile caselor pe care le-am văzut în asta

34124
25:50:20,720 --> 25:50:27,512
set de date despre prețul casei.

34125
25:50:22,960 --> 25:50:30,872
Deci dacă am fi vrut, dacă am vrea

34126
25:50:27,512 --> 25:50:35,232
prezicem dacă am vrut să estimăm

34127
25:50:30,872 --> 25:50:35,232
valoarea de piata a unei case deci pretul

34128
25:50:35,360 --> 25:50:40,080
am putea face asta folosind

34129
25:50:38,080 --> 25:50:42,232
caracteristici precum numărul de dormitoare,

34130
25:50:40,080 --> 25:50:46,232
metru pătrat, locație, vechime

34131
25:50:42,232 --> 25:50:48,720
proprietate. Hm și știi atunci când a

34132
25:50:46,232 --> 25:50:50,800
nou atunci când o casă nouă apare pe piață

34133
25:50:48,720 --> 25:50:54,080
am putea estima ce preț ar trebui

34134
25:50:50,800 --> 25:50:56,320
să se bazeze pe acele caracteristici. Atât de liniară

34135
25:50:54,080 --> 25:50:59,680
regresia este una bună pentru a prezice

34136
25:50:56,320 --> 25:51:02,160
preț ca prețul unei locuințe. Hm și vom face

34137
25:50:59,680 --> 25:51:05,160
de fapt practică asta în următorul uh

34138
25:51:02,160 --> 25:51:05,160
caietul.

34139
25:51:05,912 --> 25:51:10,232
Deci vom face uh și apoi toate astea

34140
25:51:08,640 --> 25:51:11,440
alte acum există descrieri ale acestora

34141
25:51:10,232 --> 25:51:13,040
alte modele, dar din nou nu avem

34142
25:51:11,440 --> 25:51:15,192
i-a acoperit pe acești tipi. Deci nu vreau

34143
25:51:13,040 --> 25:51:17,280
să trecem cu adevărat prin acelea până ajungem

34144
25:51:15,192 --> 25:51:20,720
la acele modele. Așa că ajungem la cele pe care le voi

34145
25:51:17,280 --> 25:51:23,440
reveniți și menționați exemplul.

34146
25:51:20,720 --> 25:51:27,120
Uh pot fi folosite K și N pentru grupare?

34147
25:51:23,440 --> 25:51:29,512
Nu. Deci modelul de grupare merge

34148
25:51:27,120 --> 25:51:31,280
a fi diferit. Va fi uh K

34149
25:51:29,512 --> 25:51:33,600
înseamnă

34150
25:51:31,280 --> 25:51:36,800
K înseamnă că aceasta este gruparea primară

34151
25:51:33,600 --> 25:51:39,512
model. Nu K vecini cei mai apropiați. K

34152
25:51:36,800 --> 25:51:40,720
cei mai apropiați vecini este folosit pentru uh se poate

34153
25:51:39,512 --> 25:51:43,680
fi folosit pentru regresie. Poate fi folosit

34154
25:51:40,720 --> 25:51:43,680
pentru clasificare.

34155
25:51:44,720 --> 25:51:48,960
Deci vom vorbi despre K și N care

34156
25:51:46,800 --> 25:51:51,832
este K cei mai apropiați vecini din lecție

34157
25:51:48,960 --> 25:51:54,000
patru.

34158
25:51:51,832 --> 25:51:56,080
Sună într-adevăr similar. Da, asta

34159
25:51:54,000 --> 25:51:57,600
sună foarte asemănător, dar K înseamnă a

34160
25:51:56,080 --> 25:51:59,912
algoritm de clustering, asta e

34161
25:51:57,600 --> 25:52:02,480
usor diferit

34162
25:51:59,912 --> 25:52:06,000
diferit, nu se folosesc etichete

34163
25:52:02,480 --> 25:52:08,552
toate. Acest K vecini cei mai apropiați este a is a

34164
25:52:06,000 --> 25:52:11,720
algoritm de învățare supravegheată. Se foloseste

34165
25:52:08,552 --> 25:52:11,720
etichete.

34166
25:52:18,400 --> 25:52:23,400
Bun. Alte întrebări până acum?

34167
25:52:36,400 --> 25:52:41,360
Bine.

34168
25:52:38,320 --> 25:52:44,872
Deci acestea fiind spuse, să trecem la

34169
25:52:41,360 --> 25:52:47,440
3.2 notebook.

34170
25:52:44,872 --> 25:52:51,280
Să trecem la ceea ce va fi al nostru

34171
25:52:47,440 --> 25:52:54,320
prima discuție despre uh

34172
25:52:51,280 --> 25:52:56,552
regresie. Deci intrând în supraveghere

34173
25:52:54,320 --> 25:52:59,512
învăţare şi regresie. Ofer-o baieti

34174
25:52:56,552 --> 25:53:01,280
momentul să trag acest caiet.

34175
25:52:59,512 --> 25:53:04,080
Dar da, vrei să ridici 3.2.

34176
25:53:01,280 --> 25:53:06,160
Vom face asta în continuare. Deci ne vom concentra

34177
25:53:04,080 --> 25:53:08,232
in. Și astfel planul nostru este să facem regresie

34178
25:53:06,160 --> 25:53:12,512
mai întâi și apoi vom vorbi despre

34179
25:53:08,232 --> 25:53:12,512
clasificare în lecția a patra

34180
25:53:15,600 --> 25:53:20,080
pe care le vom acoperi pe toate celelalte

34181
25:53:17,440 --> 25:53:22,640
modele pe care le-ai putea folosi

34182
25:53:20,080 --> 25:53:23,680
clasificare pe acea listă, dar apoi

34183
25:53:22,640 --> 25:53:27,720
vom vorbi despre liniar

34184
25:53:23,680 --> 25:53:27,720
regresie mai întâi.

34185
25:53:33,512 --> 25:53:39,040
În regulă. Deci, avem o agendă mare.

34186
25:53:36,320 --> 25:53:42,480
Acesta este un caiet mare de parcurs

34187
25:53:39,040 --> 25:53:44,232
mult material aici înconjurător

34188
25:53:42,480 --> 25:53:47,360
regresie. Deci, vom merge

34189
25:53:44,232 --> 25:53:50,232
începe cu regresia liniară și vezi um

34190
25:53:47,360 --> 25:53:53,440
cum o facem de fapt, ce asta

34191
25:53:50,232 --> 25:53:55,040
modelul merge. Hm, pe care îl avem

34192
25:53:53,440 --> 25:53:56,552
am văzut puțin ideea

34193
25:53:55,040 --> 25:53:59,360
deja, așa că ar trebui să fie oarecum

34194
25:53:56,552 --> 25:54:02,800
familiar. Hm și apoi vom vorbi despre

34195
25:53:59,360 --> 25:54:06,480
cum să adaptăm ideea de regresie liniară

34196
25:54:02,800 --> 25:54:08,080
să um neliniar ceea ce se numește neliniar

34197
25:54:06,480 --> 25:54:10,000
regresie care va fi folosită

34198
25:54:08,080 --> 25:54:11,760
ca polomial

34199
25:54:10,000 --> 25:54:15,360
uh caracteristici. Vom vorbi despre cum se face

34200
25:54:11,760 --> 25:54:17,912
că. Hm și apoi un mare mare subiect

34201
25:54:15,360 --> 25:54:19,912
pentru noi va fi evaluarea

34202
25:54:17,912 --> 25:54:22,480
model. Deci va fi destul de ușor

34203
25:54:19,912 --> 25:54:25,360
pentru a o construi efectiv. construirea modelului

34204
25:54:22,480 --> 25:54:30,232
va fi cu adevărat ușor dar de evaluare și

34205
25:54:25,360 --> 25:54:33,360
interpretarea asta va fi uh o mulțime de

34206
25:54:30,232 --> 25:54:34,872
o lucrare interesantă acolo pentru că noi

34207
25:54:33,360 --> 25:54:36,960
Vrei să știi care este performanța

34208
25:54:34,872 --> 25:54:38,400
acel model este odată ce l-am construit

34209
25:54:36,960 --> 25:54:41,120
corect vrem să știm cât de bun de a

34210
25:54:38,400 --> 25:54:43,360
modelul este merită folosit sau facem noi

34211
25:54:41,120 --> 25:54:46,160
trebuie să-l reinstruiți sau să obțineți date noi sau

34212
25:54:43,360 --> 25:54:48,232
schimba modelul pentru a vorbi despre asta

34213
25:54:46,160 --> 25:54:50,232
um, cum determini ce să faci pe baza

34214
25:54:48,232 --> 25:54:53,912
pe acea performanță

34215
25:54:50,232 --> 25:54:55,120
um și apoi vom vorbi despre aici um a

34216
25:54:53,912 --> 25:54:57,680
cuplu de lucruri. S-ar putea să nu ajungem la asta

34217
25:54:55,120 --> 25:54:59,912
azi, dar regularizarea

34218
25:54:57,680 --> 25:55:03,600
care este folosit pentru a spori performanța

34219
25:54:59,912 --> 25:55:07,280
în anumite situații, ori de câte ori

34220
25:55:03,600 --> 25:55:08,960
modelul are performanțe slabe

34221
25:55:07,280 --> 25:55:11,760
împotriva datelor de testare, chiar dacă aceasta

34222
25:55:08,960 --> 25:55:14,232
funcționează destul de bine pe datele de antrenament.

34223
25:55:11,760 --> 25:55:16,400
În acest scenariu, puteți folosi ramuri

34224
25:55:14,232 --> 25:55:18,160
de regresie liniară care fac ceva uh

34225
25:55:16,400 --> 25:55:20,000
ceea ce se numește regularizare. Vom vorbi

34226
25:55:18,160 --> 25:55:21,440
despre asta.

34227
25:55:20,000 --> 25:55:24,872
Hm și apoi vom vorbi despre

34228
25:55:21,440 --> 25:55:26,552
reglarea hiperparametrului uh, în general, ca a

34229
25:55:24,872 --> 25:55:28,000
strategie care este ceva pentru tine

34230
25:55:26,552 --> 25:55:31,600
în general, vrei să faci când ești

34231
25:55:28,000 --> 25:55:35,040
antrenarea modelelor de învățare automată. Um asa

34232
25:55:31,600 --> 25:55:38,400
din nou la acești doi s-ar putea să nu ajungem astăzi

34233
25:55:35,040 --> 25:55:40,720
dar destul de multe de ajuns să fie

34234
25:55:38,400 --> 25:55:43,360
înainte de aceea centrat în principal în jurul

34235
25:55:40,720 --> 25:55:45,192
evaluare și construcție liniară

34236
25:55:43,360 --> 25:55:47,600
regresie.

34237
25:55:45,192 --> 25:55:49,280
Bine. Atât de fain. vom ajunge la noi

34238
25:55:47,600 --> 25:55:51,040
primul tip de model aici. Acest liniar

34239
25:55:49,280 --> 25:55:54,512
regresie

34240
25:55:51,040 --> 25:55:54,512
pentru a începe cu.

34241
25:55:55,120 --> 25:55:59,680
bine,

34242
25:55:56,640 --> 25:56:04,640
deci să începem cu regresia liniară

34243
25:55:59,680 --> 25:56:08,232
aici. Hm, și într-adevăr ce liniar

34244
25:56:04,640 --> 25:56:11,912
regresia încearcă să facă și eu

34245
25:56:08,232 --> 25:56:14,720
vreau să vă arăt acest lucru în această imagine este

34246
25:56:11,912 --> 25:56:17,912
trage această linie uneori ceea ce se știe

34247
25:56:14,720 --> 25:56:20,480
ca linie de cea mai bună potrivire. Deci acesta este al nostru

34248
25:56:17,912 --> 25:56:25,120
model care trece prin date

34249
25:56:20,480 --> 25:56:30,400
și, în general, este un bun predictor

34250
25:56:25,120 --> 25:56:33,360
pentru că dacă îmi dai caracteristici

34251
25:56:30,400 --> 25:56:35,680
dacă îmi oferi funcții noi și hai

34252
25:56:33,360 --> 25:56:38,080
spune că sunt hai să spunem că îmi dai o

34253
25:56:35,680 --> 25:56:39,600
caracteristică care este chiar aici.

34254
25:56:38,080 --> 25:56:43,040
Deci spui, bine, am o caracteristică

34255
25:56:39,600 --> 25:56:45,440
aceasta este valoarea pe axa x. Apoi eu

34256
25:56:43,040 --> 25:56:49,280
Știu că tot ce trebuie să fac este să-l conectez la

34257
25:56:45,440 --> 25:56:52,552
ecuația mea de linie și voi genera a

34258
25:56:49,280 --> 25:56:54,800
o valoare care este ca aici.

34259
25:56:52,552 --> 25:56:57,192
Bine, ce frumos este pe acea linie

34260
25:56:54,800 --> 25:56:59,512
la acea intrare. Și asta va fi al meu

34261
25:56:57,192 --> 25:57:00,640
predicție pentru ce variabila de ieșire

34262
25:56:59,512 --> 25:57:04,080
ar trebui să fie. Doar va fi

34263
25:57:00,640 --> 25:57:07,192
ceva pe acea linie. Și ce poți

34264
25:57:04,080 --> 25:57:10,320
vezi dacă această linie este o estimare decentă

34265
25:57:07,192 --> 25:57:13,040
pentru aceste date pentru că se tranșează

34266
25:57:10,320 --> 25:57:16,232
asta destul de uniform. Deci este o presupunere bună

34267
25:57:13,040 --> 25:57:18,400
în ceea ce privește rezultatul care trebuie dat

34268
25:57:16,232 --> 25:57:21,912
oricare dintre aceste intrări. Este un este o

34269
25:57:18,400 --> 25:57:23,760
bun estimator această linie. Și așa a noastră

34270
25:57:21,912 --> 25:57:26,640
Scopul construirii unei regresii liniare este de a

34271
25:57:23,760 --> 25:57:30,320
un fel de a construi ecuația acestei linii.

34272
25:57:26,640 --> 25:57:34,960
Deci vrem această ecuație.

34273
25:57:30,320 --> 25:57:39,480
Ecuația acestei linii

34274
25:57:34,960 --> 25:57:39,480
va fi modelul nostru.

34275
25:57:41,760 --> 25:57:45,832
Da, va arăta exact așa.

34276
25:57:43,512 --> 25:57:48,480
MX plus B sau da, MX plus C. Merge

34277
25:57:45,832 --> 25:57:52,640
sa arate exact asa. uh, cu excepția

34278
25:57:48,480 --> 25:57:56,320
că va fi mai mult decât doar MX

34279
25:57:52,640 --> 25:57:57,912
pentru că avem în general mai mult decât

34280
25:57:56,320 --> 25:58:00,960
o caracteristică. Deci te gândești la X ca la a

34281
25:57:57,912 --> 25:58:03,512
caracteristică um va fi mai mult decât doar MX.

34282
25:58:00,960 --> 25:58:07,232
În general, va fi așa cum va fi

34283
25:58:03,512 --> 25:58:07,232
in general arata asa

34284
25:58:10,960 --> 25:58:16,720
și apoi plus poate ceva părtinire aici plus

34285
25:58:14,232 --> 25:58:18,552
o interceptare. Da, va fi în general

34286
25:58:16,720 --> 25:58:21,360
arata asa. Deci, da, ești exact

34287
25:58:18,552 --> 25:58:24,080
corect. MX plusb este ideea potrivită.

34288
25:58:21,360 --> 25:58:28,040
Exact corect.

34289
25:58:24,080 --> 25:58:28,040
În general, va arăta așa.

34290
25:58:28,720 --> 25:58:33,040
Neliniar. Se poate adapta la

34291
25:58:30,320 --> 25:58:34,400
neliniară. Da. Dacă ne transformăm, suntem

34292
25:58:33,040 --> 25:58:36,552
o sa vorbesc despre asta. Dacă noi

34293
25:58:34,400 --> 25:58:39,680
transforma toate caracteristicile noastre într-un

34294
25:58:36,552 --> 25:58:42,000
mod neliniar, um putem aplica liniar

34295
25:58:39,680 --> 25:58:45,280
regresie la acesta. Da. Și și asta

34296
25:58:42,000 --> 25:58:48,800
ar fi o regresie neliniară. Deci da,

34297
25:58:45,280 --> 25:58:52,360
putem face și lucruri neliniare.

34298
25:58:48,800 --> 25:58:52,360
Vom vorbi despre asta.

34299
25:58:58,800 --> 25:59:04,480
Bine. Deci regresia liniară este din nou

34300
25:59:01,912 --> 25:59:07,040
artă sau știință ar trebui să spun că nu chiar

34301
25:59:04,480 --> 25:59:09,192
artă dar este o știință exactă a

34302
25:59:07,040 --> 25:59:12,960
găsind ecuaţia acestei drepte care

34303
25:59:09,192 --> 25:59:14,480
se potrivește prin aceste date. Acum de ce unul

34304
25:59:12,960 --> 25:59:18,232
lucru la care ar trebui să te gândești este

34305
25:59:14,480 --> 25:59:20,640
de ce această linie este un bun predictor și

34306
25:59:18,232 --> 25:59:22,800
argumentul este că dacă arunci o privire

34307
25:59:20,640 --> 25:59:24,400
la această distanţă de aceste puncte albastre

34308
25:59:22,800 --> 25:59:28,720
deci să spunem că aceste puncte albastre sunt ale noastre

34309
25:59:24,400 --> 25:59:32,552
punctele de date reale către care urmează această linie

34310
25:59:28,720 --> 25:59:34,480
fi găsit astfel încât să minimizeze acest lucru

34311
25:59:32,552 --> 25:59:37,280
distanta

34312
25:59:34,480 --> 25:59:39,680
de la puncte la de fapt ar trebui

34313
25:59:37,280 --> 25:59:41,192
trageți-o astfel de la puncte la

34314
25:59:39,680 --> 25:59:44,960
linie.

34315
25:59:41,192 --> 25:59:47,120
Deci, vrem ca această distanță să fie um

34316
25:59:44,960 --> 25:59:50,000
de fapt ar trebui să-l desenez așa, asta

34317
25:59:47,120 --> 25:59:52,800
cale. Vrem ca această distanță să fie un fel

34318
25:59:50,000 --> 25:59:54,480
la minim. Deci, ar fi rău să

34319
25:59:52,800 --> 25:59:56,400
trage o linie până aici pentru că

34320
25:59:54,480 --> 25:59:59,192
atunci e multă distanță, nu?

34321
25:59:56,400 --> 26:00:01,040
Deci, și asta ar fi o mulțime de erori

34322
25:59:59,192 --> 26:00:02,960
a contribuit din a nu putea

34323
26:00:01,040 --> 26:00:05,280
preziceți acele puncte din setul nostru de date

34324
26:00:02,960 --> 26:00:07,360
foarte bine. Hm, care este antrenamentul nostru

34325
26:00:05,280 --> 26:00:09,280
date. De aceea avem etichete, nu?

34326
26:00:07,360 --> 26:00:12,480
care ne ghidează în construirea asta

34327
26:00:09,280 --> 26:00:16,960
linie. Deci scopul nostru este să construim asta

34328
26:00:12,480 --> 26:00:20,000
linie mai ales ca această eroare sau

34329
26:00:16,960 --> 26:00:22,552
această distanţă poate fi minimă ca

34330
26:00:20,000 --> 26:00:25,192
posibil. Corect? Care sunt toate acestea

34331
26:00:22,552 --> 26:00:28,160
distanțe de la aceste puncte la linie.

34332
26:00:25,192 --> 26:00:30,800
Vrem ca acestea să fie cât mai minime

34333
26:00:28,160 --> 26:00:32,872
posibil. Deci scopul nostru este să găsim asta

34334
26:00:30,800 --> 26:00:34,320
ecuație.

34335
26:00:32,872 --> 26:00:37,960
Deci vom construi un model care să fie

34336
26:00:34,320 --> 26:00:37,960
vom găsi această ecuație.

34337
26:00:39,120 --> 26:00:46,232
a liniei

34338
26:00:41,832 --> 26:00:49,640
um astfel încât eroarea noastră

34339
26:00:46,232 --> 26:00:49,640
este minimă.

34340
26:00:50,080 --> 26:00:55,232
Si care este eroarea? Eroarea este

34341
26:00:52,232 --> 26:00:55,232
distanta

34342
26:00:56,320 --> 26:01:00,600
a punctelor noastre de date

34343
26:01:02,800 --> 26:01:05,800
la

34344
26:01:06,400 --> 26:01:10,400
la linia pe care o construim. Deci

34345
26:01:08,552 --> 26:01:13,040
în esență ceea ce vom face pentru a

34346
26:01:10,400 --> 26:01:15,680
antrena aceasta va fi pentru a regla

34347
26:01:13,040 --> 26:01:16,640
parametrii sau sau în aceea ca I

34348
26:01:15,680 --> 26:01:19,600
cred că e foarte bine că ai crescut

34349
26:01:16,640 --> 26:01:22,080
MX plus C. Practic, M și C

34350
26:01:19,600 --> 26:01:25,440
se va ajusta. Așa că le adaptăm

34351
26:01:22,080 --> 26:01:28,552
în consecinţă pentru a face această distanţă ca

34352
26:01:25,440 --> 26:01:30,640
cât mai mic posibil.

34353
26:01:28,552 --> 26:01:33,800
Bine să minimizez la fel de mult distanța

34354
26:01:30,640 --> 26:01:33,800
pe cât posibil.

34355
26:01:39,680 --> 26:01:45,912
Bine.

34356
26:01:41,760 --> 26:01:47,512
Deci, unde se folosește regresia? Noi am

34357
26:01:45,912 --> 26:01:50,320
am vazut deja cateva exemple. Iată câteva

34358
26:01:47,512 --> 26:01:55,280
mai multă publicitate, cum ar fi prezicerea

34359
26:01:50,320 --> 26:01:57,280
vânzări, prezicând ulei și ulei

34360
26:01:55,280 --> 26:02:00,080
producția și cererea. Acestea sunt ca

34361
26:01:57,280 --> 26:02:02,720
previz că acestea sunt probleme de regresie.

34362
26:02:00,080 --> 26:02:07,360
Um retail ca prognoza cererii pentru

34363
26:02:02,720 --> 26:02:12,160
inventar. Asistența medicală prezice um

34364
26:02:07,360 --> 26:02:14,640
uh nivelurile anumitor um uh sânge

34365
26:02:12,160 --> 26:02:18,000
markere sau știi așa ceva.

34366
26:02:14,640 --> 26:02:20,480
Um, bazate pe predicții imobiliare

34367
26:02:18,000 --> 26:02:22,480
pe acelea despre care s-a vorbit ca pătrat

34368
26:02:20,480 --> 26:02:24,640
filmări, dormitoare, băi, alea

34369
26:02:22,480 --> 26:02:26,800
lucruri. Deci regresia este folosită din nou

34370
26:02:24,640 --> 26:02:29,832
ori de câte ori dorim să prezicem un număr a

34371
26:02:26,800 --> 26:02:32,832
ieșire numerică este o regresie

34372
26:02:29,832 --> 26:02:32,832
problema.

34373
26:02:35,440 --> 26:02:41,360
Deci despre acest tip de regresie vorbim

34374
26:02:37,512 --> 26:02:45,760
despre aici este în general

34375
26:02:41,360 --> 26:02:48,232
um cunoscut sub numele de uh a când acea ecuație este

34376
26:02:45,760 --> 26:02:49,680
liniar care este cunoscut ca liniar

34377
26:02:48,232 --> 26:02:52,800
regresie. Și deci întoarce-te la asta

34378
26:02:49,680 --> 26:02:55,280
imagine când avem o când asta

34379
26:02:52,800 --> 26:02:58,960
ecuația dreptei pe care o găsim este a

34380
26:02:55,280 --> 26:03:00,960
ecuație liniară ceea ce înseamnă că este

34381
26:02:58,960 --> 26:03:04,480
exact forma pe care ti-am spus-o.

34382
26:03:00,960 --> 26:03:06,960
Deci este ceva de genul greutatea

34383
26:03:04,480 --> 26:03:09,912
caracteristica de timp

34384
26:03:06,960 --> 26:03:13,680
plus caracteristica de timp de greutate

34385
26:03:09,912 --> 26:03:17,120
plus caracteristica de timp de greutate

34386
26:03:13,680 --> 26:03:21,040
și apoi poate un termen de interceptare

34387
26:03:17,120 --> 26:03:24,552
ca niște termeni de părtinire acolo. Hm asta

34388
26:03:21,040 --> 26:03:27,360
este o ecuație liniară deoarece toate

34389
26:03:24,552 --> 26:03:29,912
caracteristicile sunt la puterea unică. Deci

34390
26:03:27,360 --> 26:03:32,480
este o putere liniară și aceasta este o putere liniară

34391
26:03:29,912 --> 26:03:35,040
combinație de caracteristici cu acelea

34392
26:03:32,480 --> 26:03:36,720
greutăți diferite. Deci, acesta este un liniar

34393
26:03:35,040 --> 26:03:40,160
model

34394
26:03:36,720 --> 26:03:43,360
pentru că este uh, este ceea ce în matematică

34395
26:03:40,160 --> 26:03:45,440
ar numi aceasta o ecuație liniară corectă

34396
26:03:43,360 --> 26:03:48,080
totul este la prima putere. Ea

34397
26:03:45,440 --> 26:03:53,280
seamana cu mx plus b. Este un liniar

34398
26:03:48,080 --> 26:03:56,080
ecuație sau un model liniar. Hm, atunci când

34399
26:03:53,280 --> 26:03:58,000
vorbim de regresie liniară adică

34400
26:03:56,080 --> 26:04:01,600
un model de regresie, așa că anticipăm

34401
26:03:58,000 --> 26:04:05,120
vreo ţintă continuă care presupune noi

34402
26:04:01,600 --> 26:04:08,720
sunt model modelul nostru este format din aceasta

34403
26:04:05,120 --> 26:04:12,000
fel de ecuație o ecuație liniară.

34404
26:04:08,720 --> 26:04:14,000
Deci acesta va fi modelul nostru pentru

34405
26:04:12,000 --> 26:04:17,232
un liniar

34406
26:04:14,000 --> 26:04:17,232
uh regresie.

34407
26:04:17,512 --> 26:04:23,192
Bine.

34408
26:04:20,480 --> 26:04:25,680
Și așa atunci când antrenezi un liniar

34409
26:04:23,192 --> 26:04:30,080
regresie, scopul tău este să înveți acestea

34410
26:04:25,680 --> 26:04:32,400
greutăți, astfel încât să vă puteți conecta

34411
26:04:30,080 --> 26:04:36,552
poate conecta oricare dintre intrările tale

34412
26:04:32,400 --> 26:04:38,552
caracteristici și puteți genera un

34413
26:04:36,552 --> 26:04:40,800
predictie. Poți care va fi

34414
26:04:38,552 --> 26:04:42,320
ceva pe linia asta, nu? Este

34415
26:04:40,800 --> 26:04:44,800
va fi o valoare care sta aici

34416
26:04:42,320 --> 26:04:46,640
pe această linie.

34417
26:04:44,800 --> 26:04:50,720
Punem toate caracteristicile noastre și încheiem

34418
26:04:46,640 --> 26:04:53,960
acolo undeva pe acea linie.

34419
26:04:50,720 --> 26:04:53,960
Această ieșire.

34420
26:04:54,320 --> 26:04:57,320
Bine.

34421
26:05:05,760 --> 26:05:12,960
Bine. Lasă-mă să mă opresc acolo. Orice întrebări

34422
26:05:07,600 --> 26:05:17,000
pe modelul liniar aici sau de ce este

34423
26:05:12,960 --> 26:05:17,000
numită regresie liniară?

34424
26:05:28,000 --> 26:05:32,960
Bine. Și apropo, în aceste note

34425
26:05:31,120 --> 26:05:34,960
acest marcant indică aici unde spune asta

34426
26:05:32,960 --> 26:05:36,960
folosește criteriul celor mai mici pătrate pentru

34427
26:05:34,960 --> 26:05:38,720
estimaţi coeficienţii adică

34428
26:05:36,960 --> 26:05:40,552
exact ce am spus mai devreme cu

34429
26:05:38,720 --> 26:05:42,480
distanta. Deci distanța se bazează pe

34430
26:05:40,552 --> 26:05:45,512
pătratul

34431
26:05:42,480 --> 26:05:47,912
de aceasta această cantitate ca cât de departe

34432
26:05:45,512 --> 26:05:51,440
ești din linie se bazează pe asta

34433
26:05:47,912 --> 26:05:54,400
distanță pătrată aici și aici și aici

34434
26:05:51,440 --> 26:05:58,872
si aici. Deci ceea ce încercăm să facem este

34435
26:05:54,400 --> 26:06:00,552
găsiți cea mai mică distanță sau cele mai mici pătrate

34436
26:05:58,872 --> 26:06:03,512
care este acea distanță minimă. Aşa

34437
26:06:00,552 --> 26:06:06,000
așa găsim toate aceste greutăți

34438
26:06:03,512 --> 26:06:09,192
este de la minimizare. Practic le acordăm

34439
26:06:06,000 --> 26:06:12,480
suficient folosind etichetele noastre. Deci, iată-ne

34440
26:06:09,192 --> 26:06:14,872
etichetă care este y. Practic, conectam

34441
26:06:12,480 --> 26:06:16,960
în datele noastre și acordați-le suficient pentru

34442
26:06:14,872 --> 26:06:19,192
minimizați eroarea. Este un este un

34443
26:06:16,960 --> 26:06:21,680
problema de optimizare,

34444
26:06:19,192 --> 26:06:26,400
nu? Noi încercăm să găsim

34445
26:06:21,680 --> 26:06:30,192
minim din această cantitate care este aceea

34446
26:06:26,400 --> 26:06:30,192
linia cea mai potrivită.

34447
26:06:40,000 --> 26:06:44,872
Bine.

34448
26:06:41,680 --> 26:06:49,040
Deci avem regresie liniară

34449
26:06:44,872 --> 26:06:51,600
um și putem face un simplu liniar

34450
26:06:49,040 --> 26:06:53,600
regresie care are o singură caracteristică. Deci

34451
26:06:51,600 --> 26:06:56,552
dacă are o singură caracteristică, adică

34452
26:06:53,600 --> 26:06:59,600
exact așa dacă există o singură intrare

34453
26:06:56,552 --> 26:07:01,360
caracteristică uneori cunoscută sub numele de um

34454
26:06:59,600 --> 26:07:03,440
regresie simplă sau liniară simplă

34455
26:07:01,360 --> 26:07:05,120
regresie și, practic, există

34456
26:07:03,440 --> 26:07:08,640
doar o caracteristică. Deci unul independent

34457
26:07:05,120 --> 26:07:11,832
variabila este caracteristica.

34458
26:07:08,640 --> 26:07:16,160
Există o singură caracteristică. Și așa asta

34459
26:07:11,832 --> 26:07:18,160
ecuația seamănă cu

34460
26:07:16,160 --> 26:07:22,232
Ecuația exactă pe care tocmai ați introdus-o

34461
26:07:18,160 --> 26:07:25,360
acolo, care este um mx plus b,

34462
26:07:22,232 --> 26:07:27,120
nu? Seamănă exact cu asta. Hm

34463
26:07:25,360 --> 26:07:30,480
doar folosim simboluri diferite pentru

34464
26:07:27,120 --> 26:07:34,720
acelea ca beta beta 0 și beta 1. Dar

34465
26:07:30,480 --> 26:07:37,912
um practic exact acea linie simplă este

34466
26:07:34,720 --> 26:07:42,232
doar o caracteristică. Deci, și asta pentru că

34467
26:07:37,912 --> 26:07:44,720
acea linie va ajunge la um acea linie este

34468
26:07:42,232 --> 26:07:46,320
va fi generat uh conform

34469
26:07:44,720 --> 26:07:48,400
acea ecuație. Deci, iată ce anume

34470
26:07:46,320 --> 26:07:50,480
se pare ca.

34471
26:07:48,400 --> 26:07:52,720
Aceasta este linia cea mai potrivită prin toate

34472
26:07:50,480 --> 26:07:54,480
aceste puncte albastre. Acesta este ceva ce suntem

34473
26:07:52,720 --> 26:07:57,040
va putea construi. Mergem

34474
26:07:54,480 --> 26:08:00,640
pentru a putea construi acea ecuație

34475
26:07:57,040 --> 26:08:03,040
destul de ușor în scikitlearn.

34476
26:08:00,640 --> 26:08:06,480
Deci, vom putea găsi asta și asta

34477
26:08:03,040 --> 26:08:11,912
nu va fi prea greu. Deci această linie va fi

34478
26:08:06,480 --> 26:08:15,760
um y = beta 0 plus beta 1. Deci unii

34479
26:08:11,912 --> 26:08:17,760
greutate beta de 1 ori singura caracteristică pe care o avem

34480
26:08:15,760 --> 26:08:21,192
au x1.

34481
26:08:17,760 --> 26:08:24,080
Bine. Deci, în acest caz, am fi

34482
26:08:21,192 --> 26:08:26,080
prezicerea vânzărilor. Deci vânzările ar fi

34483
26:08:24,080 --> 26:08:28,872
prețuiesc practic eticheta pe care o suntem

34484
26:08:26,080 --> 26:08:34,000
încercând să prezică și caracteristica care

34485
26:08:28,872 --> 26:08:38,400
punem în ea, cred că este

34486
26:08:34,000 --> 26:08:40,080
numărul de cheltuieli TV. Da. Cheltuielile TV

34487
26:08:38,400 --> 26:08:47,000
care se află pe axa x. Deci există unul

34488
26:08:40,080 --> 26:08:47,000
caracteristică care este cheltuiala TV.

34489
26:08:48,080 --> 26:08:54,480
Deci, pe acest grafic, acesta ar fi acesta

34490
26:08:52,232 --> 26:08:56,552
ar fi modelul nostru.

34491
26:08:54,480 --> 26:09:00,232
Bine, acesta ar fi modelul nostru. Doar noi

34492
26:08:56,552 --> 26:09:03,040
au o caracteristică și le avem pe acestea

34493
26:09:00,232 --> 26:09:06,080
doua greutati. Avem o intersecție B 0

34494
26:09:03,040 --> 26:09:08,232
și sau beta 0 și apoi o greutate de o singură

34495
26:09:06,080 --> 26:09:11,760
care se aplică acelei caracteristici

34496
26:09:08,232 --> 26:09:13,760
beta 1. Și așa ar fi modelul nostru

34497
26:09:11,760 --> 26:09:16,320
o anumită valoare pentru beta 0 și o anumită

34498
26:09:13,760 --> 26:09:20,600
valoare pentru beta 1. Asta este ceea ce obține

34499
26:09:16,320 --> 26:09:20,600
tipii astia sunt invatati

34500
26:09:21,192 --> 26:09:27,360
învăţat în timpul

34501
26:09:24,872 --> 26:09:30,360
model

34502
26:09:27,360 --> 26:09:30,360
antrenament.

34503
26:09:33,360 --> 26:09:38,872
Bine. Deci astea sunt ceea ce se învață

34504
26:09:36,320 --> 26:09:41,600
în timpul antrenamentului nostru de model și primesc

34505
26:09:38,872 --> 26:09:43,600
învăţat de un a cel puţin ceea ce se numeşte a

34506
26:09:41,600 --> 26:09:45,760
algoritmul de închiriere pătrate care încearcă

34507
26:09:43,600 --> 26:09:48,960
pentru a minimiza acea distanta. Încearcă

34508
26:09:45,760 --> 26:09:51,760
ajustați beta 0 beta 1 pentru a minimiza acest lucru

34509
26:09:48,960 --> 26:09:53,760
distanța acestei linii

34510
26:09:51,760 --> 26:09:57,720
um această linie

34511
26:09:53,760 --> 26:09:57,720
la toate aceste puncte

34512
26:09:58,552 --> 26:10:04,960
încercând să minimizeze acest lucru.

34513
26:10:02,400 --> 26:10:08,160
Așa că imaginați-vă că luați o linie și un fel de

34514
26:10:04,960 --> 26:10:11,512
mișcându-l și întorcându-l pe ea

34515
26:10:08,160 --> 26:10:13,832
panta, unghiul ei um pentru a încerca să găsesc asta

34516
26:10:11,512 --> 26:10:16,080
cel mai potrivit,

34517
26:10:13,832 --> 26:10:20,120
care reduce acea eroare cel mai mult.

34518
26:10:16,080 --> 26:10:20,120
Corect? Cam asta facem.

34519
26:10:40,320 --> 26:10:48,480
Pot să explic? Da. Deci vânzările sunt

34520
26:10:44,232 --> 26:10:50,400
în dolari și și cheltuiala TV

34521
26:10:48,480 --> 26:10:52,320
um

34522
26:10:50,400 --> 26:10:54,000
uh

34523
26:10:52,320 --> 26:10:56,080
TV, de fapt, cred că e invers

34524
26:10:54,000 --> 26:10:59,040
în jurul. Cred că vânzările sunt de fapt a

34525
26:10:56,080 --> 26:11:03,120
cantitate. Deci, acesta este numărul de vânzări

34526
26:10:59,040 --> 26:11:05,280
pe care îl avem și cheltuielile cu televizorul sunt eu

34527
26:11:03,120 --> 26:11:08,800
cred că e în dolari. Deci cum

34528
26:11:05,280 --> 26:11:11,280
multi bani cata cheltuiala am facut

34529
26:11:08,800 --> 26:11:13,912
introduse în produs și apoi

34530
26:11:11,280 --> 26:11:17,232
cam de câte vânzări am avut

34531
26:11:13,912 --> 26:11:17,232
acel produs.

34532
26:11:17,832 --> 26:11:21,960
Deci cred că e invers

34533
26:11:24,720 --> 26:11:31,760
dar ce arată acest grafic

34534
26:11:27,120 --> 26:11:34,640
punctele albastre sunt datele noastre reale

34535
26:11:31,760 --> 26:11:37,360
puncte. Bine. Deci avem o colecție

34536
26:11:34,640 --> 26:11:39,760
ca și cum am avea un cadru de date care are așa

34537
26:11:37,360 --> 26:11:42,232
imaginați-vă că avem un cadru de date care are

34538
26:11:39,760 --> 26:11:46,000
uh adevarate valori.

34539
26:11:42,232 --> 26:11:50,320
Deci are cheltuielile TV.

34540
26:11:46,000 --> 26:11:53,040
Hm, are puncte care sunt ca unul. Deci

34541
26:11:50,320 --> 26:11:57,040
are puncte care sunt ca 120 și apoi

34542
26:11:53,040 --> 26:12:00,160
vânzările ar putea fi de aproximativ 700

34543
26:11:57,040 --> 26:12:01,912
700 de unități, să zicem. Și apoi are um

34544
26:12:00,160 --> 26:12:03,360
deci acesta este doar setul nostru de date, nu?

34545
26:12:01,912 --> 26:12:06,480
Acest lucru ar fi ca într-un cadru de date care

34546
26:12:03,360 --> 26:12:10,320
avem. Și apoi am avut unele care au fost

34547
26:12:06,480 --> 26:12:13,912
um 50 și atunci asta ar putea fi um asta

34548
26:12:10,320 --> 26:12:16,640
ar putea fi 400 să spunem și mai departe și mai departe și

34549
26:12:13,912 --> 26:12:19,192
în dreapta, deci acestea sunt datele noastre și acestea

34550
26:12:16,640 --> 26:12:21,680
datele sunt reprezentate în albastru, așa că acestea sunt

34551
26:12:19,192 --> 26:12:24,000
aceste puncte albastre de aici

34552
26:12:21,680 --> 26:12:27,600
corect, deci acestea sunt punctele albastre aici

34553
26:12:24,000 --> 26:12:31,192
iar punctele roșii sunt este modelul nostru deci

34554
26:12:27,600 --> 26:12:33,280
am construit un model de regresie liniară um

34555
26:12:31,192 --> 26:12:36,640
unde punem unele valori

34556
26:12:33,280 --> 26:12:38,720
introducem niște valori false x

34557
26:12:36,640 --> 26:12:41,192
aici și generând niște predicții

34558
26:12:38,720 --> 26:12:44,960
care este această linie,

34559
26:12:41,192 --> 26:12:48,872
această linie de regresie liniară, nu?

34560
26:12:44,960 --> 26:12:50,960
Și acea linie este derivată din aceste date,

34561
26:12:48,872 --> 26:12:55,192
nu? Se învață din asta

34562
26:12:50,960 --> 26:12:57,512
exemple supravegheate.

34563
26:12:55,192 --> 26:13:00,160
Are sens?

34564
26:12:57,512 --> 26:13:03,360
Acea linie este derivată din date. este

34565
26:13:00,160 --> 26:13:09,320
de fapt, am învățat de la linia similară

34566
26:13:03,360 --> 26:13:09,320
cea mai bună potrivire se învață din acele date

34567
26:13:10,960 --> 26:13:15,832
iar datele reale sunt în albastru.

34568
26:13:14,400 --> 26:13:17,912
Deci puteți vedea că încercăm să construim

34569
26:13:15,832 --> 26:13:20,000
asta astfel încât această distanță este un fel

34570
26:13:17,912 --> 26:13:24,280
un minim

34571
26:13:20,000 --> 26:13:24,280
deci este o potrivire optima

34572
26:13:24,320 --> 26:13:28,512
pentru a echilibra aceste distante.

34573
26:13:34,160 --> 26:13:37,192
Deci este doar un complot. Deci este doar

34574
26:13:35,912 --> 26:13:39,360
construirea acelei relații între

34575
26:13:37,192 --> 26:13:42,080
intrare și ieșire. Ca atunci când atunci când

34576
26:13:39,360 --> 26:13:45,400
cheltuielile sunt mai mari, se pare că avem

34577
26:13:42,080 --> 26:13:45,400
mai multe vanzari.

34578
26:14:01,280 --> 26:14:04,280
Bine.

34579
26:14:10,480 --> 26:14:14,320
Ce e perpendiculară ca

34580
26:14:12,160 --> 26:14:15,832
distanta? Asta ar trebui să fie asta ar trebui să fie

34581
26:14:14,320 --> 26:14:18,832
perpendicular pentru ca este o distanta

34582
26:14:15,832 --> 26:14:18,832
aici.

34583
26:14:19,600 --> 26:14:22,400
Asta vrei să spui? Ca și distanța

34584
26:14:20,960 --> 26:14:24,720
de la punctele reale la linie? Da,

34585
26:14:22,400 --> 26:14:26,480
care ar trebui să fie perpendicular

34586
26:14:24,720 --> 26:14:29,480
pentru că este o distanță

34587
26:14:26,480 --> 26:14:29,480
formula.

34588
26:14:46,872 --> 26:14:49,360
Bine.

34589
26:14:50,960 --> 26:14:58,000
În regulă. Deci, mai general, acum faceți

34590
26:14:54,232 --> 26:15:01,832
de obicei avem o caracteristică? Nu. Deci

34591
26:14:58,000 --> 26:15:04,320
în general extindem acest lucru la mai mult

34592
26:15:01,832 --> 26:15:06,720
caz general în care avem mai mult de unul

34593
26:15:04,320 --> 26:15:08,800
caracteristică ca ceea ce vedem în carcasă

34594
26:15:06,720 --> 26:15:10,640
date exact acolo unde am putea prezice a

34595
26:15:08,800 --> 26:15:13,512
preț, dar avem multe intrări diferite

34596
26:15:10,640 --> 26:15:16,080
cum ar fi dormitoare, băi, metru pătrat

34597
26:15:13,512 --> 26:15:19,680
etc.

34598
26:15:16,080 --> 26:15:22,480
Deci mai larg

34599
26:15:19,680 --> 26:15:24,720
în loc de regresie liniară simplă noi

34600
26:15:22,480 --> 26:15:26,400
au ceea ce se numește liniar multiplu

34601
26:15:24,720 --> 26:15:29,680
regresie liniară ceea ce înseamnă că avem

34602
26:15:26,400 --> 26:15:32,872
variabile multiple sau caracteristici multiple.

34603
26:15:29,680 --> 26:15:36,320
Deci aceasta este exact ecuația pe care o am

34604
26:15:32,872 --> 26:15:39,760
despre care am vorbit. Hm, deci doar extindem

34605
26:15:36,320 --> 26:15:42,640
că acela în multe caracteristici. Deci

34606
26:15:39,760 --> 26:15:47,040
care este cazul acesta și apoi o interceptare

34607
26:15:42,640 --> 26:15:50,552
termen care este acolo ca uneori

34608
26:15:47,040 --> 26:15:52,800
cunoscut sub numele de părtinire. Hm

34609
26:15:50,552 --> 26:15:54,960
dar acesta este termenul de interceptare a tipului

34610
26:15:52,800 --> 26:16:00,872
de orientare a liniei pentru a începe în

34611
26:15:54,960 --> 26:16:03,680
locul potrivit. Um și uh, dar acesta este

34612
26:16:00,872 --> 26:16:05,680
um, aceasta este ecuația pe care am fi

34613
26:16:03,680 --> 26:16:06,800
construirea modelului. Acesta este modelul nostru

34614
26:16:05,680 --> 26:16:09,680
in esenta, nu? Aceasta este ecuația

34615
26:16:06,800 --> 26:16:11,360
am invata.

34616
26:16:09,680 --> 26:16:14,080
Interceptarea este ca o constantă. Da. Deci

34617
26:16:11,360 --> 26:16:16,552
dacă dacă toate caracteristicile ar fi zero, um

34618
26:16:14,080 --> 26:16:18,080
acestea ar fi datele noastre. Aceasta

34619
26:16:16,552 --> 26:16:19,832
acesta ar fi rezultatul nostru. Dacă

34620
26:16:18,080 --> 26:16:22,400
practic, dacă acesta a fost zero, acesta a fost

34621
26:16:19,832 --> 26:16:25,120
zero, acesta era zero, s-ar reduce la

34622
26:16:22,400 --> 26:16:29,400
asta ca predictie. Da. Este ca

34623
26:16:25,120 --> 26:16:29,400
o constantă. Da.

34624
26:16:33,912 --> 26:16:37,512
Deci, în geometrie, interceptarea

34625
26:16:36,232 --> 26:16:39,680
de fapt foarte important pentru că asta

34626
26:16:37,512 --> 26:16:42,720
orientează unde ar trebui să înceapă linia dvs. Deci

34627
26:16:39,680 --> 26:16:44,800
se orientează așa așa așa sunt aceste valori

34628
26:16:42,720 --> 26:16:47,280
cam ca panta. Ei orientează

34629
26:16:44,800 --> 26:16:49,760
înclinarea acestuia. Ca și cum ar trebui să fie înclinat

34630
26:16:47,280 --> 26:16:52,320
asa sau ar trebui sa fie mai inclinat?

34631
26:16:49,760 --> 26:16:54,480
Dar interceptarea o orientează unde este

34632
26:16:52,320 --> 26:16:56,232
ar trebui să înceapă așa cum ar trebui pe verticală

34633
26:16:54,480 --> 26:16:58,552
începe până aici? Ar trebui

34634
26:16:56,232 --> 26:17:01,120
începe mai mult aici?

34635
26:16:58,552 --> 26:17:04,440
Um, asta este interceptarea

34636
26:17:01,120 --> 26:17:04,440
ne spune.

34637
26:17:11,832 --> 26:17:15,760
Bine, deci aceasta este situația. Aceasta este

34638
26:17:14,320 --> 26:17:17,280
va fi modelul nostru de regresie liniară

34639
26:17:15,760 --> 26:17:19,600
că vom construi majoritatea

34640
26:17:17,280 --> 26:17:22,080
timp pentru că vom avea din nou acestea

34641
26:17:19,600 --> 26:17:25,360
toate vor fi caracteristici.

34642
26:17:22,080 --> 26:17:29,192
Deci aceasta este o caracteristică X-ul

34643
26:17:25,360 --> 26:17:33,192
unele caracteristici aceasta este o caracteristică

34644
26:17:29,192 --> 26:17:35,440
X1 etc. Acestea sunt toate caracteristicile și ce

34645
26:17:33,192 --> 26:17:37,120
se învață în timpul antrenamentului sunt

34646
26:17:35,440 --> 26:17:41,192
acești coeficienți. Deci toate astea

34647
26:17:37,120 --> 26:17:43,360
coeficienți inclusiv beta 0ero um

34648
26:17:41,192 --> 26:17:45,440
va fi invatat. Deci acestea vor primi

34649
26:17:43,360 --> 26:17:48,000
învăţat

34650
26:17:45,440 --> 26:17:51,280
um din datele noastre chiar au învățat

34651
26:17:48,000 --> 26:17:53,680
vor fi instruiți din datele noastre

34652
26:17:51,280 --> 26:17:56,232
comandă și cum se antrenează

34653
26:17:53,680 --> 26:17:59,040
este din reducerea acelei distanțe pe care încercăm

34654
26:17:56,232 --> 26:18:02,400
pentru a obține acea linie de cea mai bună potrivire prin ajustări

34655
26:17:59,040 --> 26:18:04,232
acele beta-uri suficiente pentru a ajunge până ajungem

34656
26:18:02,400 --> 26:18:07,120
o distanta minima dar exista

34657
26:18:04,232 --> 26:18:10,232
un algoritm în spatele acelui um că aia

34658
26:18:07,120 --> 26:18:13,360
scikitlearn va alerga ca să găsim asta

34659
26:18:10,232 --> 26:18:15,832
se potrivește cel mai bine, așa că nu trebuie să facem asta

34660
26:18:13,360 --> 26:18:18,160
manual, dar acesta este procesul

34661
26:18:15,832 --> 26:18:21,120
practic este ajustarea acestor greutăți la

34662
26:18:18,160 --> 26:18:23,440
ajunge cu acea linie cea mai potrivită. Deci in

34663
26:18:21,120 --> 26:18:26,232
dimensiuni mai mari, în loc de linie,

34664
26:18:23,440 --> 26:18:28,960
primești mai mult din ceea ce se numește avion

34665
26:18:26,232 --> 26:18:32,080
aici. Hm, care arată așa.

34666
26:18:28,960 --> 26:18:34,960
Deci cel mai potrivit avion este de fapt acest avion

34667
26:18:32,080 --> 26:18:37,440
unde, um, cam disecă totul

34668
26:18:34,960 --> 26:18:40,000
aceste puncte exact așa, um, în

34669
26:18:37,440 --> 26:18:42,080
dimensiuni mai mari. Deci asta e în schimb

34670
26:18:40,000 --> 26:18:45,120
dintr-o linie în care primești asta în trei

34671
26:18:42,080 --> 26:18:47,360
dimensiunile ai acest avion astfel

34672
26:18:45,120 --> 26:18:49,280
dar tot e ca o linie de cele mai bune

34673
26:18:47,360 --> 26:18:52,720
este doar o linie mai generală a celor mai bune

34674
26:18:49,280 --> 26:18:55,512
potrivi. Este în continuare aceeași idee. Suntem

34675
26:18:52,720 --> 26:18:57,680
încă încerc să vin cu ce este mai bun

34676
26:18:55,512 --> 26:19:01,832
coeficienți pentru a minimiza această distanță

34677
26:18:57,680 --> 26:19:03,192
de la noastre de la punctele noastre la linie.

34678
26:19:01,832 --> 26:19:04,872
Deși în dimensiuni mai mari este nr

34679
26:19:03,192 --> 26:19:06,320
o linie mai lungă. Este mai mult ca un avion

34680
26:19:04,872 --> 26:19:08,160
ca asta. Deci încerci să minimizi

34681
26:19:06,320 --> 26:19:09,912
aceasta distanta de aici in jos pana la

34682
26:19:08,160 --> 26:19:12,232
avionul

34683
26:19:09,912 --> 26:19:14,960
aici până în avion

34684
26:19:12,232 --> 26:19:17,760
în dimensiuni superioare. Așa că vreau să faci

34685
26:19:14,960 --> 26:19:19,280
ține cont de ceea ce încercăm să facem

34686
26:19:17,760 --> 26:19:20,800
înainte de a intra în cod, deoarece

34687
26:19:19,280 --> 26:19:22,320
codul va face să pară cu adevărat

34688
26:19:20,800 --> 26:19:24,232
foarte simplu și asta pentru că

34689
26:19:22,320 --> 26:19:26,480
scikitlearn este grozav și asta este

34690
26:19:24,232 --> 26:19:27,912
face.

34691
26:19:26,480 --> 26:19:29,600
Dar ar trebui să ne dăm seama că există

34692
26:19:27,912 --> 26:19:33,680
ceva cu adevărat complex care se întâmplă

34693
26:19:29,600 --> 26:19:35,600
găsește din nou cea mai bună valoare dintre acestea

34694
26:19:33,680 --> 26:19:39,120
greutăți

34695
26:19:35,600 --> 26:19:42,800
care minimizează distanța acestei linii

34696
26:19:39,120 --> 26:19:44,720
la punctele de date pe care le avem. Deci

34697
26:19:42,800 --> 26:19:47,680
există un algoritm acolo care va

34698
26:19:44,720 --> 26:19:50,400
continuați să încercați să faceți ajustări la asta

34699
26:19:47,680 --> 26:19:52,400
pe baza acestor distante. Deci merge

34700
26:19:50,400 --> 26:19:56,480
pentru a folosi acele distante ca un ghid pentru

34701
26:19:52,400 --> 26:19:58,320
le cam modifică pentru a-l găsi pe cel care

34702
26:19:56,480 --> 26:19:59,912
rezultă cea mai mică cantitate de

34703
26:19:58,320 --> 26:20:02,000
distanta. Așa că continuăm să facem ajustări, continuă

34704
26:19:59,912 --> 26:20:05,120
făcând ajustări, continuă să faci ajustări și

34705
26:20:02,000 --> 26:20:06,800
în cele din urmă încercăm să găsim spre care convergem

34706
26:20:05,120 --> 26:20:10,480
setul de greutăți care ne oferă asta

34707
26:20:06,800 --> 26:20:13,512
cea mai potrivită linie. Hm și și există o

34708
26:20:10,480 --> 26:20:16,720
algoritmul care apare acolo. Acum, din fericire

34709
26:20:13,512 --> 26:20:18,552
care se abstrage pentru noi un pic în urmă

34710
26:20:16,720 --> 26:20:21,680
um scikitlearn

34711
26:20:18,552 --> 26:20:25,192
um găsirea cea mai potrivită. Deci va fi

34712
26:20:21,680 --> 26:20:26,960
o funcție pe care o folosim în scikitlearn

34713
26:20:25,192 --> 26:20:30,720
când construim modelul care va merge

34714
26:20:26,960 --> 26:20:33,512
înainte și găsiți cele mai bune greutăți pentru noi

34715
26:20:30,720 --> 26:20:35,600
și atunci avem acum optimul nostru

34716
26:20:33,512 --> 26:20:38,872
model corect pe care apoi îl putem conecta

34717
26:20:35,600 --> 26:20:41,600
în valori diferite ale acestor caracteristici

34718
26:20:38,872 --> 26:20:44,960
și generați o predicție care merge

34719
26:20:41,600 --> 26:20:48,160
să fie acest rezultat corect, așa că asta e

34720
26:20:44,960 --> 26:20:50,800
ceea ce încercăm în cele din urmă să facem este uh

34721
26:20:48,160 --> 26:20:54,080
antrenează modelul care va găsi tot

34722
26:20:50,800 --> 26:20:56,160
acele greutăți optime și apoi putem

34723
26:20:54,080 --> 26:20:58,800
prezice cu ea care ar fi conectarea

34724
26:20:56,160 --> 26:21:02,000
în diferite valori ale caracteristicilor to to

34725
26:20:58,800 --> 26:21:03,512
generează o predicție.

34726
26:21:02,000 --> 26:21:05,040
bine,

34727
26:21:03,512 --> 26:21:07,760
deci să vedem cum se întâmplă asta. Sale

34728
26:21:05,040 --> 26:21:09,832
de fapt va fi foarte ușor cu

34729
26:21:07,760 --> 26:21:13,512
scikitlearn.

34730
26:21:09,832 --> 26:21:15,760
Deci, în acest scenariu avem um suntem

34731
26:21:13,512 --> 26:21:19,120
ne vom importa panda pentru că suntem

34732
26:21:15,760 --> 26:21:20,480
ne vom încărca datele din asta. Um, deci

34733
26:21:19,120 --> 26:21:22,232
bineînțeles că avem nevoie de niște date pentru a funcționa

34734
26:21:20,480 --> 26:21:23,912
cu. Deci o să încărcăm asta

34735
26:21:22,232 --> 26:21:26,960
CSV.

34736
26:21:23,912 --> 26:21:30,080
Hm, eu

34737
26:21:26,960 --> 26:21:32,232
deci nu am reușit să găsesc

34738
26:21:30,080 --> 26:21:33,832
acest CSV pentru acest exemplu, dar vreau să spun

34739
26:21:32,232 --> 26:21:35,680
e în regulă pentru că vom face ceva

34740
26:21:33,832 --> 26:21:38,872
faceți alte exemple cu care vom lucra

34741
26:21:35,680 --> 26:21:42,232
datele. Dacă se întâmplă să-l ai, um,

34742
26:21:38,872 --> 26:21:43,912
grozav. Nu l-am văzut în fișierele mele.

34743
26:21:42,232 --> 26:21:46,640
Așa că trebuie doar să crezi pe cuvânt

34744
26:21:43,912 --> 26:21:50,320
că acestea sunt asta este acel televizor și

34745
26:21:46,640 --> 26:21:52,080
coloanele de vânzări aici sunt din aceste date

34746
26:21:50,320 --> 26:21:57,440
set.

34747
26:21:52,080 --> 26:22:01,280
Bine. Um ca exemplu. Deci doar să

34748
26:21:57,440 --> 26:22:04,232
vezi cum se potrivește la ce vom merge

34749
26:22:01,280 --> 26:22:07,280
face și asta va fi foarte

34750
26:22:04,232 --> 26:22:09,440
proces standard pentru noi pentru construirea unui

34751
26:22:07,280 --> 26:22:11,760
model. Acești pași vor fi foarte

34752
26:22:09,440 --> 26:22:15,680
foarte standard pentru noi, ceea ce va fi

34753
26:22:11,760 --> 26:22:18,160
fie în primul rând împărțirea caracteristicilor

34754
26:22:15,680 --> 26:22:20,480
departe de etichetă. Asta e primul

34755
26:22:18,160 --> 26:22:23,192
pas pe care îl vom face mereu. Deci dacă tu

34756
26:22:20,480 --> 26:22:28,232
aruncați o privire la acest cod, este nevoie

34757
26:22:23,192 --> 26:22:30,080
toate rândurile, dar numai prima coloană.

34758
26:22:28,232 --> 26:22:33,040
Bine, deci extrage toate

34759
26:22:30,080 --> 26:22:35,680
caracteristici din cadrul de date um care

34760
26:22:33,040 --> 26:22:39,360
se întâmplă să fie care este doar primul

34761
26:22:35,680 --> 26:22:42,720
prima coloană uh care este televizorul uh

34762
26:22:39,360 --> 26:22:46,400
coloana din dreapta doar acea coloană de acolo și

34763
26:22:42,720 --> 26:22:50,400
variabila noastră țintă, care este eticheta noastră.

34764
26:22:46,400 --> 26:22:54,160
Deci variabila noastră țintă, eticheta um

34765
26:22:50,400 --> 26:22:57,280
este a doua coloană, nu? Asta este

34766
26:22:54,160 --> 26:23:01,280
acea coloană de vânzări.

34767
26:22:57,280 --> 26:23:05,040
Um și deci primul nostru pas aici, lasă-mă

34768
26:23:01,280 --> 26:23:08,320
suna asta aici. Primul pas este să

34769
26:23:05,040 --> 26:23:12,080
despărțit întotdeauna

34770
26:23:08,320 --> 26:23:14,800
caracteristici de la etichete.

34771
26:23:12,080 --> 26:23:17,600
Bine, așa că am pus toate aceste caracteristici

34772
26:23:14,800 --> 26:23:20,872
un cadru de date numit X și avem toate

34773
26:23:17,600 --> 26:23:24,232
etichetele noastre într-o serie tehnică dar

34774
26:23:20,872 --> 26:23:28,160
cam ca un cadru de date, nu? Hm

34775
26:23:24,232 --> 26:23:32,720
numit Y, care este doar um care este

34776
26:23:28,160 --> 26:23:35,192
doar etichetele uh uh. Deci doar asta

34777
26:23:32,720 --> 26:23:39,512
valorile TV. Hm, acum o să faci

34778
26:23:35,192 --> 26:23:42,640
vezi de ce facem asta. Pentru că avem nevoie

34779
26:23:39,512 --> 26:23:44,960
um, caracteristicile și etichetele noastre sunt împărțite

34780
26:23:42,640 --> 26:23:48,320
în afară de a le pune în model

34781
26:23:44,960 --> 26:23:50,872
functia de constructie. Ne așteaptă

34782
26:23:48,320 --> 26:23:54,080
variabile independente sau caracteristicile noastre la

34783
26:23:50,872 --> 26:23:57,680
fi separat de răspunsurile noastre sau ale noastre

34784
26:23:54,080 --> 26:23:58,960
etichete care ghidează construirea modelului.

34785
26:23:57,680 --> 26:24:01,040
Acesta este primul lucru pe care trebuie să-l faci

34786
26:23:58,960 --> 26:24:03,040
separă pe acelea.

34787
26:24:01,040 --> 26:24:06,480
Bine, deci acest cod le va separa pe acestea

34788
26:24:03,040 --> 26:24:08,000
într-un X majuscul și un Y minuscul.

34789
26:24:06,480 --> 26:24:10,960
Și asta este de fapt o industrie destul de bună

34790
26:24:08,000 --> 26:24:13,192
notație standard. Ori de câte ori te despărți

34791
26:24:10,960 --> 26:24:15,680
în afară de toate trăsăturile tale, de obicei le pui

34792
26:24:13,192 --> 26:24:18,720
le într-un cadru de date numit capital X

34793
26:24:15,680 --> 26:24:20,872
și apoi aveți un Y minuscul la

34794
26:24:18,720 --> 26:24:23,040
reprezentați etichetele dvs. Asta e de fapt

34795
26:24:20,872 --> 26:24:26,960
destul de standard.

34796
26:24:23,040 --> 26:24:29,280
Deci este destul de standard ca um X

34797
26:24:26,960 --> 26:24:31,120
reprezintă

34798
26:24:29,280 --> 26:24:32,640
caracteristici

34799
26:24:31,120 --> 26:24:37,512
şi

34800
26:24:32,640 --> 26:24:39,680
Y reprezintă etichete

34801
26:24:37,512 --> 26:24:41,440
coloana de etichete

34802
26:24:39,680 --> 26:24:44,640
oricare ar fi coloana noastră de etichete în aceasta

34803
26:24:41,440 --> 26:24:48,440
În cazul în care sunt vânzările pentru că mergem

34804
26:24:44,640 --> 26:24:48,440
să prezică vânzările

34805
26:24:49,832 --> 26:24:56,192
folosind coloana TV cheltuiala TV quant

34806
26:24:53,192 --> 26:24:56,192
cantitate.

34807
26:25:00,080 --> 26:25:08,080
Da. Deci, care este însărcinarea

34808
26:25:03,360 --> 26:25:09,600
că suntem um misiunea este că noi

34809
26:25:08,080 --> 26:25:14,400
sunt

34810
26:25:09,600 --> 26:25:17,512
uh, ne împărțim datele.

34811
26:25:14,400 --> 26:25:20,872
Așa că atunci când citim pentru prima dată datele

34812
26:25:17,512 --> 26:25:24,720
um este un drept cadru de date care are două

34813
26:25:20,872 --> 26:25:28,960
coloane TV si vanzari.

34814
26:25:24,720 --> 26:25:33,120
Oh perfect, mulțumesc Tim. eu voi face

34815
26:25:28,960 --> 26:25:36,000
mergeți mai departe și deci dacă ne uităm la aceste date

34816
26:25:33,120 --> 26:25:39,120
are doar acele două coloane exact

34817
26:25:36,000 --> 26:25:42,800
are doar acele două coloane. Bine. Deci

34818
26:25:39,120 --> 26:25:44,960
ceea ce facem cu asta este că suntem

34819
26:25:42,800 --> 26:25:47,600
despărțindu-se

34820
26:25:44,960 --> 26:25:52,080
nostru variabila independentă nostru

34821
26:25:47,600 --> 26:25:55,552
caracteristici. Deci acest x va conține

34822
26:25:52,080 --> 26:25:55,552
caracteristicile noastre

34823
26:25:56,000 --> 26:26:03,280
și y va conține

34824
26:25:59,912 --> 26:26:04,720
eticheta noastră.

34825
26:26:03,280 --> 26:26:06,720
Are sens? Ne despărțim

34826
26:26:04,720 --> 26:26:09,680
aceste date în afară. Deci, nu facem decât să apucăm

34827
26:26:06,720 --> 26:26:12,232
prima coloană aici să fie a noastră

34828
26:26:09,680 --> 26:26:13,912
caracteristici. Și apoi ne apucăm

34829
26:26:12,232 --> 26:26:15,192
a doua coloană, care este vânzările,

34830
26:26:13,912 --> 26:26:17,512
pentru că vom prezice

34831
26:26:15,192 --> 26:26:19,040
vânzări. Aceasta este eticheta noastră. Vom merge

34832
26:26:17,512 --> 26:26:23,760
vom construi un model pentru a prezice

34833
26:26:19,040 --> 26:26:26,720
vânzările având în vedere intrarea TV, cheltuielile TV

34834
26:26:23,760 --> 26:26:28,960
intrare. Deci, primul lucru pe care trebuie să-l facem

34835
26:26:26,720 --> 26:26:31,360
este împărțit caracteristicile și

34836
26:26:28,960 --> 26:26:33,040
eticheta.

34837
26:26:31,360 --> 26:26:35,912
Bine, acesta este primul pas pe care îl facem de obicei

34838
26:26:33,040 --> 26:26:39,040
va lua. Și motivul pentru care trebuie să facem

34839
26:26:35,912 --> 26:26:42,160
asta doar ca să reiterăm, motivul pentru care noi

34840
26:26:39,040 --> 26:26:45,360
trebuie să facem asta pentru că modelul nostru

34841
26:26:42,160 --> 26:26:47,600
ne vom aștepta ca funcțiile noastre de date să fie

34842
26:26:45,360 --> 26:26:50,320
separat de etichetă. Vom trece

34843
26:26:47,600 --> 26:26:54,080
cele din separat.

34844
26:26:50,320 --> 26:26:57,960
X este televizor. Este prima coloană

34845
26:26:54,080 --> 26:26:57,960
pentru că folosim eyeling.

34846
26:27:09,120 --> 26:27:15,720
Previzăm vânzările având în vedere televizorul

34847
26:27:12,232 --> 26:27:15,720
valoarea de cheltuiala.

34848
26:27:17,280 --> 26:27:22,960
Da. motiv pentru care l-am împărțit în așa

34849
26:27:20,232 --> 26:27:26,680
aceasta este a doua coloană din dreapta

34850
26:27:22,960 --> 26:27:26,680
indexați o coloană

34851
26:27:28,160 --> 26:27:34,400
uh, ai introdus CSV de citire și dai

34852
26:27:30,640 --> 26:27:37,760
URL-ul, astfel încât să puteți exact codul

34853
26:27:34,400 --> 26:27:41,512
asta a fost mai devreme de la Tim

34854
26:27:37,760 --> 26:27:49,360
um doar faci asta

34855
26:27:41,512 --> 26:27:49,360
și apoi datele sunt egale cu adresa URL CSV citită

34856
26:27:49,760 --> 26:27:56,000
Deci ne împărțim datele în X și Y aici.

34857
26:27:53,600 --> 26:27:58,160
În regulă. Acum, un alt pas

34858
26:27:56,000 --> 26:27:59,832
vom lua că este foarte foarte

34859
26:27:58,160 --> 26:28:03,360
pas critic și vei ajunge la noi

34860
26:27:59,832 --> 26:28:05,760
mergând să văd acest pas iar și iar și

34861
26:28:03,360 --> 26:28:08,160
iar si iar. Deci despărțindu-se

34862
26:28:05,760 --> 26:28:10,800
în X și Y vor deveni, vom face asta

34863
26:28:08,160 --> 26:28:14,480
iar si iar si iar si iar.

34864
26:28:10,800 --> 26:28:17,360
Nu numai atât, dar făcând următorul pas,

34865
26:28:14,480 --> 26:28:19,600
care este ceea ce se numește un test de tren

34866
26:28:17,360 --> 26:28:24,800
despicat. Acum, lasă-mă să-ți arăt ce

34867
26:28:19,600 --> 26:28:27,360
tren test split face. Ne ia datele

34868
26:28:24,800 --> 26:28:30,160
și ne va diviza datele

34869
26:28:27,360 --> 26:28:32,480
pe care le avem, datele noastre X și Y. Este

34870
26:28:30,160 --> 26:28:34,960
urmând să-l despart într-o

34871
26:28:32,480 --> 26:28:37,512
procentul care va fi folosit pentru antrenament

34872
26:28:34,960 --> 26:28:39,832
datele

34873
26:28:37,512 --> 26:28:42,552
iar apoi un procent care va fi folosit

34874
26:28:39,832 --> 26:28:45,192
a testa. Acum, de ce am vrea să facem

34875
26:28:42,552 --> 26:28:48,480
asta? Este în principal ca să putem face

34876
26:28:45,192 --> 26:28:51,760
evaluarea. Deci, construim modelul peste

34877
26:28:48,480 --> 26:28:55,280
aici și apoi îl testăm pe date care

34878
26:28:51,760 --> 26:28:57,040
nu a mai văzut. Deci, ne rezervăm a

34879
26:28:55,280 --> 26:29:01,832
procentul de date pentru care trebuie utilizat

34880
26:28:57,040 --> 26:29:06,232
test. De obicei, aceste date sunt um

34881
26:29:01,832 --> 26:29:09,600
undeva între 20 și 30%.

34882
26:29:06,232 --> 26:29:12,000
Deci undeva între 20 și 30% din

34883
26:29:09,600 --> 26:29:14,232
date originale. Deci asta înseamnă

34884
26:29:12,000 --> 26:29:17,280
majoritatea este folosită pentru antrenament. Aşa

34885
26:29:14,232 --> 26:29:22,832
majoritatea celor X și Y peste

34886
26:29:17,280 --> 26:29:22,832
aici va fi între 70 și 80%.

34887
26:29:23,120 --> 26:29:30,400
va fi folosit în general pentru pentru uh pentru

34888
26:29:27,280 --> 26:29:32,720
antrenament. Bine. Deci undeva intre 20

34889
26:29:30,400 --> 26:29:35,120
la 30 standardul industriei este ceva

34890
26:29:32,720 --> 26:29:37,192
oriunde între acolo. Hm multe

34891
26:29:35,120 --> 26:29:40,480
oamenilor le place să folosească 30%, unora le place

34892
26:29:37,192 --> 26:29:43,192
a folosi 20%. Orice în intervalul ăsta este

34893
26:29:40,480 --> 26:29:46,872
acceptabil. Hm, o să cred că

34894
26:29:43,192 --> 26:29:50,960
în general, va favoriza aproximativ 30%.

34895
26:29:46,872 --> 26:29:53,600
um să fie folosit pentru testare. Dar um

34896
26:29:50,960 --> 26:29:55,512
Ideea este că nu vrem, nu vrem

34897
26:29:53,600 --> 26:30:00,232
amestecați-le împreună. Vrem ca acestea să fie

34898
26:29:55,512 --> 26:30:02,552
despărțiți ca să putem avea un târg

34899
26:30:00,232 --> 26:30:05,192
evaluare, nu? Vrem să ne antrenăm

34900
26:30:02,552 --> 26:30:08,960
datele despre acest antrenează modelul nostru în acest sens

34901
26:30:05,192 --> 26:30:10,960
date și apoi vedeți cât de bine funcționează

34902
26:30:08,960 --> 26:30:12,640
pe aceste date pe care nu le-a văzut niciodată

34903
26:30:10,960 --> 26:30:14,872
înainte.

34904
26:30:12,640 --> 26:30:16,160
Corect? Deci pentru a avea date este

34905
26:30:14,872 --> 26:30:17,832
nemaivăzut până acum, vom lua

34906
26:30:16,160 --> 26:30:21,440
x-ul nostru și y-ul nostru și ne vom împărți

34907
26:30:17,832 --> 26:30:24,160
folosind această funcție numită testul trenului

34908
26:30:21,440 --> 26:30:27,832
split care va face acest tip de

34909
26:30:24,160 --> 26:30:30,400
împărțirea pentru noi. Bine, deci scikitlearn

34910
26:30:27,832 --> 26:30:32,000
are o funcție numită tren test split

34911
26:30:30,400 --> 26:30:34,960
asta va merge înainte și vom merge

34912
26:30:32,000 --> 26:30:38,400
trece x-ul nostru și y-ul nostru și vom trece în a

34913
26:30:34,960 --> 26:30:40,872
procent de 30% pe care vrem să o facem

34914
26:30:38,400 --> 26:30:44,080
împărțit într-un set de testare și apoi în

34915
26:30:40,872 --> 26:30:47,760
restul de 70% vor fi utilizate

34916
26:30:44,080 --> 26:30:50,760
pentru antrenamentul modelului.

34917
26:30:47,760 --> 26:30:50,760
Bine.

34918
26:30:50,960 --> 26:30:55,120
Deci, ceea ce vom obține, lasă-mă să redesenez

34919
26:30:53,760 --> 26:30:57,512
că. Deci din ce vom scoate

34920
26:30:55,120 --> 26:30:59,192
asta pentru împărțirea testului de tren este că suntem

34921
26:30:57,512 --> 26:31:02,480
mergând la vom avea un X și un

34922
26:30:59,192 --> 26:31:05,360
Y per

34923
26:31:02,480 --> 26:31:10,832
antrenament și testare. Deci vom primi

34924
26:31:05,360 --> 26:31:10,832
acum vom lua un tren X

34925
26:31:11,192 --> 26:31:17,040
și un tren Y.

34926
26:31:15,120 --> 26:31:19,600
Deci vom primi funcții de antrenament

34927
26:31:17,040 --> 26:31:24,400
și etichete de formare. Și atunci suntem

34928
26:31:19,600 --> 26:31:28,000
va primi funcții de testare

34929
26:31:24,400 --> 26:31:32,400
pentru a conecta la modelul nostru și și a testa

34930
26:31:28,000 --> 26:31:34,720
răspunsuri sau etichete de test

34931
26:31:32,400 --> 26:31:36,480
să facem evaluare pentru că ceea ce ar trebui

34932
26:31:34,720 --> 26:31:38,872
a putea face este să construiască modelul peste

34933
26:31:36,480 --> 26:31:41,440
aici și apoi aplicați modelul pe aceasta

34934
26:31:38,872 --> 26:31:44,960
date. Înseamnă că putem lua aceste caracteristici

34935
26:31:41,440 --> 26:31:47,600
și conectați-l la modelul nostru și apoi vedeți

34936
26:31:44,960 --> 26:31:50,800
ce răspunsuri primim și le comparăm

34937
26:31:47,600 --> 26:31:52,960
răspunsuri la aceste date de testare. Corect? Noi

34938
26:31:50,800 --> 26:31:55,960
ar trebui să poată face asta pentru a genera un

34939
26:31:52,960 --> 26:31:55,960
evaluarea.

34940
26:31:56,640 --> 26:32:01,360
Bine. Acum s-ar putea să vă întrebați de ce facem noi

34941
26:31:59,440 --> 26:32:03,120
face ceva din asta? Care este scopul

34942
26:32:01,360 --> 26:32:06,872
asta?

34943
26:32:03,120 --> 26:32:11,040
Evaluarea lui pe aceste date de testare ne oferă

34944
26:32:06,872 --> 26:32:15,440
un bun simț al voinței modelul nostru

34945
26:32:11,040 --> 26:32:18,160
generalizați la noi exemple. Corect? Dacă este

34946
26:32:15,440 --> 26:32:19,760
funcționează destul de bine cu aceste date,

34947
26:32:18,160 --> 26:32:21,280
este un semnal bun ca atunci când este

34948
26:32:19,760 --> 26:32:24,232
performanță destul de bine pe datele sunt

34949
26:32:21,280 --> 26:32:26,000
nemaivăzut până acum, e bine

34950
26:32:24,232 --> 26:32:28,800
indicator că va funcționa

34951
26:32:26,000 --> 26:32:30,480
destul de bine când îl folosim pe nou-nouț

34952
26:32:28,800 --> 26:32:33,120
exemple

34953
26:32:30,480 --> 26:32:37,120
um în viitor.

34954
26:32:33,120 --> 26:32:40,640
Corect. Deci, de aceea facem asta

34955
26:32:37,120 --> 26:32:43,120
evaluare pe aceste date pe care nu o are

34956
26:32:40,640 --> 26:32:44,872
vazut inainte. O să vadă asta

34957
26:32:43,120 --> 26:32:47,832
date de antrenament, nu? Vom merge

34958
26:32:44,872 --> 26:32:49,680
antrenați modelul pe acele date. Dar asta

34959
26:32:47,832 --> 26:32:53,120
modelul nu va fi niciodată supus acestui test

34960
26:32:49,680 --> 26:32:56,000
date până când facem evaluarea

34961
26:32:53,120 --> 26:32:58,160
și și generați câteva valori pentru a vedea cum

34962
26:32:56,000 --> 26:32:59,832
bine este aceasta performanta

34963
26:32:58,160 --> 26:33:02,640
și are șanse mari să

34964
26:32:59,832 --> 26:33:04,720
generalizând la nemaivăzut până acum

34965
26:33:02,640 --> 26:33:06,080
exemple care este ceea ce vrem corect

34966
26:33:04,720 --> 26:33:08,232
pentru că vom folosi acest model în

34967
26:33:06,080 --> 26:33:10,872
lumea reală. O să fie

34968
26:33:08,232 --> 26:33:13,912
folosit pe exemple noi pe care nu le-a văzut

34969
26:33:10,872 --> 26:33:15,600
înainte. Ne dorim să funcționeze bine. Deci,

34970
26:33:13,912 --> 26:33:18,600
acesta este un fel de test al nostru, al nostru

34971
26:33:15,600 --> 26:33:18,600
evaluarea.

34972
26:33:20,000 --> 26:33:24,552
Bine. Orice întrebări despre Mergem

34973
26:33:23,040 --> 26:33:27,192
pentru a face asta într-o clipă. Îți voi arăta

34974
26:33:24,552 --> 26:33:29,760
cum arată în cod, dar orice

34975
26:33:27,192 --> 26:33:32,400
conceptual orice întrebări pe tren

34976
26:33:29,760 --> 26:33:37,280
testați ideea împărțirii. Este un foarte foarte

34977
26:33:32,400 --> 26:33:38,960
idee importantă pe care o folosim practic

34978
26:33:37,280 --> 26:33:41,512
o parte din date pentru a o instrui și apoi

34979
26:33:38,960 --> 26:33:43,600
o altă parte a acesteia de evaluat. Este

34980
26:33:41,512 --> 26:33:46,800
foarte important să facem asta. Apropo,

34981
26:33:43,600 --> 26:33:50,232
asta are un termen um asta în mașină

34982
26:33:46,800 --> 26:33:53,232
învățarea asta se numește cruce

34983
26:33:50,232 --> 26:33:53,232
validare

34984
26:33:55,040 --> 26:34:00,800
deoarece folosim un set de date pentru

34985
26:33:58,640 --> 26:34:03,192
antrenează modelul și apoi suntem încrucișați

34986
26:34:00,800 --> 26:34:06,320
peste noi trecem asta în

34987
26:34:03,192 --> 26:34:12,120
un alt set de date pentru a-l valida care este

34988
26:34:06,320 --> 26:34:12,120
uh, testarea asta.

34989
26:34:13,440 --> 26:34:17,360
Deci aceasta se numește validare încrucișată. Hm

34990
26:34:15,832 --> 26:34:18,480
de fapt, există multe moduri de a face cross

34991
26:34:17,360 --> 26:34:20,400
validare. Asta e ceva ce vom face

34992
26:34:18,480 --> 26:34:21,760
studiul. Acesta este un mod foarte simplu de

34993
26:34:20,400 --> 26:34:24,160
efectuând validare încrucișată. Mai sunt

34994
26:34:21,760 --> 26:34:26,160
moduri complexe. Vă puteți lua datele și

34995
26:34:24,160 --> 26:34:27,832
chiar îl poți împărți în multe

34996
26:34:26,160 --> 26:34:29,912
secțiuni

34997
26:34:27,832 --> 26:34:32,080
și, practic, îl antrenează împotriva celor mai multe

34998
26:34:29,912 --> 26:34:35,280
acestea și evaluați-l față de unul la a

34999
26:34:32,080 --> 26:34:36,872
timp și apoi rotiți. Deci asta e alta

35000
26:34:35,280 --> 26:34:40,000
modalitate de a face validarea încrucișată. Mergem

35001
26:34:36,872 --> 26:34:44,912
să studiez asta. Hm, dar acesta este asta

35002
26:34:40,000 --> 26:34:44,912
este cel mai simplu mod de a face asta aici.

35003
26:34:48,872 --> 26:34:52,872
Bine.

35004
26:34:51,440 --> 26:34:55,360
Așa că lasă-mă să-ți arăt ce primești când ești

35005
26:34:52,872 --> 26:34:58,320
folosiți diviziunea de testare a trenului. Deci mergem

35006
26:34:55,360 --> 26:35:00,872
a importa din sklearn.

35007
26:34:58,320 --> 26:35:03,192
Suntem din selecția modelului

35008
26:35:00,872 --> 26:35:04,552
modul. Acum nu am folosit asta înainte.

35009
26:35:03,192 --> 26:35:07,120
Este prima dată când îl folosim. Dar

35010
26:35:04,552 --> 26:35:10,640
iată selecția noastră de modele. Mergem

35011
26:35:07,120 --> 26:35:13,760
pentru a importa această funcție de împărțire a testului de tren

35012
26:35:10,640 --> 26:35:17,512
și îl vom folosi pe X și Y

35013
26:35:13,760 --> 26:35:20,960
și vom stabili o dimensiune de test de

35014
26:35:17,512 --> 26:35:23,120
30% care este care este.3. Deci testul nostru

35015
26:35:20,960 --> 26:35:25,680
dimensiune

35016
26:35:23,120 --> 26:35:29,040
este de 30%.

35017
26:35:25,680 --> 26:35:32,320
Convertit în zecimală

35018
26:35:29,040 --> 26:35:36,080
drept convertit în.3 deci asta înseamnă că suntem

35019
26:35:32,320 --> 26:35:37,912
rezervând 30% pentru acel set de testare. Um tu

35020
26:35:36,080 --> 26:35:42,480
poate seta o stare aleatorie. Acum asta e

35021
26:35:37,912 --> 26:35:47,000
complet optional. Um starea aleatorie

35022
26:35:42,480 --> 26:35:47,000
este pentru reproductibilitate

35023
26:35:50,160 --> 26:35:53,192
pentru că ceea ce este împărțirea testului de tren

35024
26:35:51,832 --> 26:35:56,400
o să faci este de fapt

35025
26:35:53,192 --> 26:35:58,400
amestecați datele și apoi împărțiți-le

35026
26:35:56,400 --> 26:36:02,080
în 7030.

35027
26:35:58,400 --> 26:36:04,800
Deci, da, sămânța. Exact. Este ca

35028
26:36:02,080 --> 26:36:06,720
o sămânță. Deci se spune ca atunci când

35029
26:36:04,800 --> 26:36:08,080
faci asta de fiecare dată când fug

35030
26:36:06,720 --> 26:36:10,080
acest caiet o să primesc la fel

35031
26:36:08,080 --> 26:36:11,760
rezultat, dar va fi aleatoriu

35032
26:36:10,080 --> 26:36:13,680
mai întâi va fi aleatoriu, dar eu sunt

35033
26:36:11,760 --> 26:36:18,160
va putea reproduce asta

35034
26:36:13,680 --> 26:36:21,872
aleatoriu cu acea stare aleatorie. Da,

35035
26:36:18,160 --> 26:36:21,872
este ca o sămânță.

35036
26:36:23,600 --> 26:36:29,912
Uh, poți alege orice număr să fie

35037
26:36:26,160 --> 26:36:31,680
ești um starea ta aleatorie. Este 42

35038
26:36:29,912 --> 26:36:33,600
nu este important. Ai putea alege zero.

35039
26:36:31,680 --> 26:36:37,512
Ai putea alege unul. Ai putea

35040
26:36:33,600 --> 26:36:41,600
alege orice număr întreg pozitiv. Hm, 42 este

35041
26:36:37,512 --> 26:36:43,680
cam ca standardul industriei.

35042
26:36:41,600 --> 26:36:47,192
Este că ar trebui să cauți de ce

35043
26:36:43,680 --> 26:36:50,160
este. Se pare că 42 este ceva special

35044
26:36:47,192 --> 26:36:52,320
număr. um,

35045
26:36:50,160 --> 26:36:54,232
în felul istoriei dezvoltării

35046
26:36:52,320 --> 26:36:56,232
chestia asta, nu există nimic cu adevărat

35047
26:36:54,232 --> 26:36:58,552
special despre 42. Ai putea alege o

35048
26:36:56,232 --> 26:37:01,832
aleatoriu Ai putea alege o sămânță aleatorie

35049
26:36:58,552 --> 26:37:05,280
fi uh zero. Asta e bine. Nu este

35050
26:37:01,832 --> 26:37:08,320
chiar nu conteaza.

35051
26:37:05,280 --> 26:37:11,280
Vrei doar că poți alege să fie

35052
26:37:08,320 --> 26:37:13,192
uh unu, doi, trei. O poți alege

35053
26:37:11,280 --> 26:37:15,280
să fie 15. Poți alege să fie

35054
26:37:13,192 --> 26:37:17,832
orice vrei tu să fie. Este cu adevărat

35055
26:37:15,280 --> 26:37:19,600
astfel încât amestecul tău să fie

35056
26:37:17,832 --> 26:37:21,280
consistent. De fiecare dată când rulezi asta

35057
26:37:19,600 --> 26:37:23,512
notebook, primești aceeași amestecare

35058
26:37:21,280 --> 26:37:28,360
rezultat. Așa că mereu voi obține

35059
26:37:23,512 --> 26:37:28,360
aceleași rânduri în aceste despărțiri.

35060
26:37:29,760 --> 26:37:34,360
Hitch. Acolo este. Știam că este de la

35061
26:37:31,360 --> 26:37:34,360
ceva.

35062
26:37:38,000 --> 26:37:46,872
Da. Deci 42 este un fel ca a

35063
26:37:42,800 --> 26:37:50,400
este doar folosit omniprezent

35064
26:37:46,872 --> 26:37:52,160
uh, știi ca un fel de a plăti

35065
26:37:50,400 --> 26:37:54,552
omagiu adus Ghidul autostopitului la

35066
26:37:52,160 --> 26:37:56,480
Galaxy, dar nu este, nu există nimic

35067
26:37:54,552 --> 26:37:58,232
aia speciala despre 42. Nu-i asa

35068
26:37:56,480 --> 26:37:59,512
nu ne vom schimba rezultatul sau

35069
26:37:58,232 --> 26:38:02,160
orice.

35070
26:37:59,512 --> 26:38:04,720
Doar pentru ca acest tren să se despartă

35071
26:38:02,160 --> 26:38:07,280
va amesteca datele noastre și va împărți

35072
26:38:04,720 --> 26:38:08,960
se desparte în 7030.

35073
26:38:07,280 --> 26:38:11,040
Vrei doar să setezi asta la ceva

35074
26:38:08,960 --> 26:38:13,280
ca să primești un minus de fiecare dată când alergăm

35075
26:38:11,040 --> 26:38:15,120
acest caiet, obținem o consecvență

35076
26:38:13,280 --> 26:38:18,480
amestecă.

35077
26:38:15,120 --> 26:38:23,960
Și astfel datele din aceste seturi

35078
26:38:18,480 --> 26:38:23,960
sunt consecvenți. Asta e tot.

35079
26:38:27,192 --> 26:38:33,680
Bine. Dar vedeți cum trecem înăuntru?

35080
26:38:30,080 --> 26:38:36,232
X-ul nostru și Y-ul nostru și generăm patru noi

35081
26:38:33,680 --> 26:38:38,960
generează patru date diferite

35082
26:38:36,232 --> 26:38:41,360
cantități aici pe care le generăm

35083
26:38:38,960 --> 26:38:43,912
caracteristici de antrenament, caracteristici de testare,

35084
26:38:41,360 --> 26:38:47,680
etichete de antrenament şi etichete de test pentru că

35085
26:38:43,912 --> 26:38:50,080
din nou le generăm aceste patru

35086
26:38:47,680 --> 26:38:53,120
diferit, generăm date despre acestea

35087
26:38:50,080 --> 26:38:56,400
două seturi diferite un set de antrenament

35088
26:38:53,120 --> 26:39:00,000
și un set de testare. Deci avem antrenament

35089
26:38:56,400 --> 26:39:04,552
caracteristici, etichetă de antrenament,

35090
26:39:00,000 --> 26:39:07,360
și apoi testați caracteristicile, testați eticheta.

35091
26:39:04,552 --> 26:39:09,760
Bine, de aceea este atât de important să

35092
26:39:07,360 --> 26:39:12,800
împărțiți datele noastre în X și în

35093
26:39:09,760 --> 26:39:16,680
Y. Avem nevoie de cele împărțite în ordine

35094
26:39:12,800 --> 26:39:16,680
pentru ca această parte să funcționeze.

35095
26:39:16,720 --> 26:39:21,600
Deci, apropo, acești doi pași îi vom face

35096
26:39:18,640 --> 26:39:24,720
faceți întotdeauna pentru orice model pe care îl construim. Vom face

35097
26:39:21,600 --> 26:39:28,160
în general, faceți X și Y și apoi antrenați testul

35098
26:39:24,720 --> 26:39:32,600
split pentru a genera datele care

35099
26:39:28,160 --> 26:39:32,600
vom folosi pentru construirea modelului nostru.

35100
26:39:35,600 --> 26:39:40,720
Bine. Deci aceste date de aici vor merge

35101
26:39:38,160 --> 26:39:41,912
fie ceea ce folosim de fapt pentru a ghida

35102
26:39:40,720 --> 26:39:43,832
antrenamentul modelului nostru. Deci este

35103
26:39:41,912 --> 26:39:45,360
cu siguranță supravegheat, nu? Linear

35104
26:39:43,832 --> 26:39:50,600
regresie

35105
26:39:45,360 --> 26:39:50,600
um noi vom folosi asta

35106
26:39:55,280 --> 26:39:59,760
Bine, deci nu am construit încă modelul.

35107
26:39:57,440 --> 26:40:02,080
Doar ne împărțim datele

35108
26:39:59,760 --> 26:40:04,552
și gata de antrenament. Nu am făcut-o

35109
26:40:02,080 --> 26:40:07,912
chiar am construit modelul nostru încă, nu?

35110
26:40:04,552 --> 26:40:09,600
Asta va apărea într-o clipă. Dar

35111
26:40:07,912 --> 26:40:11,832
aceasta este pregătirea datelor noastre. Noi

35112
26:40:09,600 --> 26:40:16,400
a început cu cadrul nostru de date. L-am împărțit

35113
26:40:11,832 --> 26:40:22,480
separat în uh un x și un y. Și ne-am despărțit

35114
26:40:16,400 --> 26:40:25,280
asta într-o împărțire a testului de tren. Și tu

35115
26:40:22,480 --> 26:40:28,872
știi că atunci putem merge mai departe

35116
26:40:25,280 --> 26:40:32,680
și treci la antrenamentul nostru de model

35117
26:40:28,872 --> 26:40:32,680
ceea ce vom face într-o clipă.

35118
26:40:36,160 --> 26:40:40,232
E o întrebare bună. Ai putea

35119
26:40:38,000 --> 26:40:41,760
fugi, așa că ceea ce ai putea face este să poți

35120
26:40:40,232 --> 26:40:45,760
alerga

35121
26:40:41,760 --> 26:40:49,280
ar trebui să importam numpy? Să vedem.

35122
26:40:45,760 --> 26:40:54,872
Am făcut-o. Bine. Ai putea rula media

35123
26:40:49,280 --> 26:40:58,960
pe um ai putea verifica media MP

35124
26:40:54,872 --> 26:41:00,720
trenul X și vedeți cum se compară cu

35125
26:40:58,960 --> 26:41:04,832
um

35126
26:41:00,720 --> 26:41:04,832
vezi cum se compară cu X.

35127
26:41:05,512 --> 26:41:09,760
Deci ai putea să faci asta și să vezi

35128
26:41:07,040 --> 26:41:11,912
care este media acestei caracteristici

35129
26:41:09,760 --> 26:41:13,440
comparativ cu media originalului.

35130
26:41:11,912 --> 26:41:16,800
S-ar putea să nu fie perfecți pentru că suntem noi

35131
26:41:13,440 --> 26:41:18,640
luând o dimensiune redusă a setului de date. Deci eu

35132
26:41:16,800 --> 26:41:20,232
să nu crezi că există cu adevărat ceva bun

35133
26:41:18,640 --> 26:41:21,912
nu există ca o mărime unică pentru toate

35134
26:41:20,232 --> 26:41:24,232
validare pe care o putem face pentru că suntem

35135
26:41:21,912 --> 26:41:26,400
luând o amestecare aleatorie și luând o

35136
26:41:24,232 --> 26:41:28,800
la sută. Luăm 70% din date

35137
26:41:26,400 --> 26:41:30,960
afară. Deci nu avem garanția de a menține

35138
26:41:28,800 --> 26:41:32,960
aceleași statistici. Putem vedea dacă

35139
26:41:30,960 --> 26:41:34,720
sunt aproape.

35140
26:41:32,960 --> 26:41:36,232
Hm, dar are sens? Așa cum suntem

35141
26:41:34,720 --> 26:41:37,912
nu este garantat să obțineți aceleași statistici

35142
26:41:36,232 --> 26:41:40,320
pentru că luăm o felie din ea.

35143
26:41:37,912 --> 26:41:43,760
Luăm 70%.

35144
26:41:40,320 --> 26:41:48,760
Deci nu este garantat să to to

35145
26:41:43,760 --> 26:41:48,760
să fie cu adevărat aceeași distribuție.

35146
26:41:50,800 --> 26:41:57,192
Șterge asta.

35147
26:41:53,600 --> 26:42:00,400
E o practică bună? Da, este.

35148
26:41:57,192 --> 26:42:03,360
Este. 30% este standardul industriei.

35149
26:42:00,400 --> 26:42:05,760
Orice între 20 și 30, deci 0,2,

35150
26:42:03,360 --> 26:42:07,912
0,25,3,

35151
26:42:05,760 --> 26:42:12,000
oricare dintre acestea este acceptabil. Este cu adevărat

35152
26:42:07,912 --> 26:42:15,040
depinde de tine. Um, văd în mare parte 30%.

35153
26:42:12,000 --> 26:42:17,680
Mo cred.3 este o bună practică

35154
26:42:15,040 --> 26:42:20,552
de folosit cu siguranță.

35155
26:42:17,680 --> 26:42:23,440
Am explicat starea aleatorie. Uh aleatoriu

35156
26:42:20,552 --> 26:42:26,552
starea este astfel încât să devii consecvent

35157
26:42:23,440 --> 26:42:28,552
amestecând. Poti seta asta la oricare

35158
26:42:26,552 --> 26:42:31,832
întreg care vrei să fie. Este

35159
26:42:28,552 --> 26:42:34,800
chiar nu conteaza. Poți să-l setezi

35160
26:42:31,832 --> 26:42:38,000
la uh 100, îl poți seta la 10, poți

35161
26:42:34,800 --> 26:42:40,320
setează-l la 15. Hm doar asigură pentru că

35162
26:42:38,000 --> 26:42:42,232
ceea ce va face această scindare este că va face

35163
26:42:40,320 --> 26:42:45,440
amestecați mai întâi datele. Se va amesteca

35164
26:42:42,232 --> 26:42:49,360
rândurile și apoi împărțiți-o în

35165
26:42:45,440 --> 26:42:51,280
în tren și seturi de testare. Deci tu

35166
26:42:49,360 --> 26:42:53,360
setați starea aleatorie astfel încât următoarea

35167
26:42:51,280 --> 26:42:55,600
când rulezi asta, primești același lucru

35168
26:42:53,360 --> 26:42:57,360
amestecare consistentă. Asta e singurul

35169
26:42:55,600 --> 26:43:00,400
asta e singurul lucru care te ajuta

35170
26:42:57,360 --> 26:43:03,680
cu pentru că este randomizat dar când

35171
26:43:00,400 --> 26:43:05,192
ai setat o stare aleatorie um e așa că

35172
26:43:03,680 --> 26:43:07,280
parcă dacă îl rulezi din nou vei primi

35173
26:43:05,192 --> 26:43:08,960
aceeași amestecare.

35174
26:43:07,280 --> 26:43:11,192
Veți obține același lucru la amestecare

35175
26:43:08,960 --> 26:43:15,552
contează pentru că asta dictează

35176
26:43:11,192 --> 26:43:15,552
ce ajunge în aceste seturi.

35177
26:43:19,360 --> 26:43:24,400
Bine.

35178
26:43:21,120 --> 26:43:28,080
În regulă. Așa că să vedem hai să facem hai

35179
26:43:24,400 --> 26:43:30,320
construiți modelul. Hm și lasă-mă să-ți arăt

35180
26:43:28,080 --> 26:43:31,832
cât de ușor va fi de construit

35181
26:43:30,320 --> 26:43:34,872
modelul. Și chiar așa stau lucrurile

35182
26:43:31,832 --> 26:43:37,760
va fi pentru fiecare scikitlearn

35183
26:43:34,872 --> 26:43:39,680
modelul va arata practic exact la fel

35184
26:43:37,760 --> 26:43:41,912
pentru antrenament care este ceea ce se va întâmpla

35185
26:43:39,680 --> 26:43:45,192
fă-l cu adevărat frumos. Deci primul

35186
26:43:41,912 --> 26:43:46,872
ceea ce trebuie să facem este să ne importăm modelul.

35187
26:43:45,192 --> 26:43:49,192
Deci de la scikitlearn vom fi

35188
26:43:46,872 --> 26:43:53,600
folosind un liniar din modelul liniar

35189
26:43:49,192 --> 26:43:55,680
pachet sau modulul model liniar I

35190
26:43:53,600 --> 26:43:58,480
ar trebui să spun în sklearn vom merge

35191
26:43:55,680 --> 26:44:00,640
importarea regresiei liniare

35192
26:43:58,480 --> 26:44:03,440
și vom crea o instanță a

35193
26:44:00,640 --> 26:44:07,600
aici regresia liniară.

35194
26:44:03,440 --> 26:44:12,080
Bine, deci regresie liniară și uite cum

35195
26:44:07,600 --> 26:44:17,280
ușor asta va fi. Aproape toate

35196
26:44:12,080 --> 26:44:22,720
aproape toate modelele sklearn folosesc

35197
26:44:17,280 --> 26:44:25,040
funcția ffit pentru a antrena.

35198
26:44:22,720 --> 26:44:28,080
Deci fiecare dintre ei, indiferent care

35199
26:44:25,040 --> 26:44:32,320
unul pe care îl folosim, cum ar fi arborele de decizie, cum ar fi

35200
26:44:28,080 --> 26:44:33,760
regresia logistică, oricare dintre ele

35201
26:44:32,320 --> 26:44:35,600
cum folosim noi pentru clasificare care sunt

35202
26:44:33,760 --> 26:44:37,912
va apărea în lecția a patra,

35203
26:44:35,600 --> 26:44:40,960
toate vor arăta la fel

35204
26:44:37,912 --> 26:44:44,480
termenii de rulare.fit,

35205
26:44:40,960 --> 26:44:46,960
care este al lui scikitlearn

35206
26:44:44,480 --> 26:44:50,552
uh funcție generică pentru antrenamentul tău

35207
26:44:46,960 --> 26:44:53,760
model. Deci, aceasta va executa antrenamentul

35208
26:44:50,552 --> 26:44:55,912
odată ce rulăm acest cod. Și ce asta

35209
26:44:53,760 --> 26:44:59,120
iar antrenamentul de regresie liniară este

35210
26:44:55,912 --> 26:45:02,960
va face acea distanță cu cele mai mici pătrate

35211
26:44:59,120 --> 26:45:05,360
procedură sau algoritm pentru a încerca să găsească

35212
26:45:02,960 --> 26:45:07,512
greutățile potrivite. Încearcă să găsească

35213
26:45:05,360 --> 26:45:10,800
acele greutăți care minimizează acel pătrat

35214
26:45:07,512 --> 26:45:13,680
distanță uh de linia noastră că este

35215
26:45:10,800 --> 26:45:16,160
încercând să construiască pe date.

35216
26:45:13,680 --> 26:45:19,360
Și ceea ce vreau să observați este ceea ce noi

35217
26:45:16,160 --> 26:45:20,872
pus în ffit. Vezi cum punem în

35218
26:45:19,360 --> 26:45:23,360
datele de antrenament unde am pus în

35219
26:45:20,872 --> 26:45:27,120
caracteristici de antrenament și am pus în

35220
26:45:23,360 --> 26:45:30,640
etichete de antrenament. Acum acest lucru este supravegheat.

35221
26:45:27,120 --> 26:45:33,512
Deci, bineînțeles, punem etichetele,

35222
26:45:30,640 --> 26:45:35,600
nu? Bineînțeles că punem aceste etichete

35223
26:45:33,512 --> 26:45:38,872
aici și bineînțeles că punem în nostru

35224
26:45:35,600 --> 26:45:43,440
caracteristici aici. Deci punem toate

35225
26:45:38,872 --> 26:45:46,800
din exemplele noastre din diviziunea noastră de formare

35226
26:45:43,440 --> 26:45:50,320
în acest ffit care se va antrena

35227
26:45:46,800 --> 26:45:52,640
modelul uh ca să putem să îl folosim

35228
26:45:50,320 --> 26:45:55,360
ea pentru predicție.

35229
26:45:52,640 --> 26:45:58,400
Bine, este foarte rapid. Dacă conduc asta,

35230
26:45:55,360 --> 26:46:00,160
va fi aproape instantaneu.

35231
26:45:58,400 --> 26:46:02,000
Aproape instantaneu se antrenează.

35232
26:46:00,160 --> 26:46:03,912
Și puteți vedea aici că acum avem un

35233
26:46:02,000 --> 26:46:06,872
regresie liniară. poti vedea in asta

35234
26:46:03,912 --> 26:46:08,320
cutie mică. Hm, și asta și asta

35235
26:46:06,872 --> 26:46:11,120
informația spune că a fost

35236
26:46:08,320 --> 26:46:13,440
montat. Deci, acum este gata de utilizare.

35237
26:46:11,120 --> 26:46:15,832
Corect? Deci, noi acum asta este. Noi am

35238
26:46:13,440 --> 26:46:18,800
ne-am antrenat modelul. Încercăm așa

35239
26:46:15,832 --> 26:46:21,280
ușor așa a fost. Ne-am potrivit. Acum, ce noi

35240
26:46:18,800 --> 26:46:24,872
ar trebui să realizeze că este mult de lucru

35241
26:46:21,280 --> 26:46:26,960
se desfășoară în culisele acestui ffit.

35242
26:46:24,872 --> 26:46:30,400
Bine. Se lucrează mult

35243
26:46:26,960 --> 26:46:33,512
acolo pentru a face algoritmul celor mai mici pătrate

35244
26:46:30,400 --> 26:46:36,552
și găsiți acele greutăți și creați

35245
26:46:33,512 --> 26:46:38,000
acea linie cea mai potrivită. Corect? Deci acolo

35246
26:46:36,552 --> 26:46:39,760
se lucrează mult

35247
26:46:38,000 --> 26:46:42,320
acolo ce se întâmplă acolo în spatele

35248
26:46:39,760 --> 26:46:44,800
scene, dar scikitlearn face abstractie

35249
26:46:42,320 --> 26:46:48,960
este departe pentru noi, nu? Și tot ce avem

35250
26:46:44,800 --> 26:46:52,640
de făcut este potrivit când folosim acest cod.

35251
26:46:48,960 --> 26:46:54,232
Chiar ușor. Chiar ușor. Fit. Și acolo

35252
26:46:52,640 --> 26:46:57,720
mergem. Ne-am antrenat liniarul

35253
26:46:54,232 --> 26:46:57,720
model de regresie.

35254
26:46:58,232 --> 26:47:03,280
Și apropo, dacă vrei să vezi ce

35255
26:47:01,120 --> 26:47:05,360
coeficienții sunt, poți de fapt

35256
26:47:03,280 --> 26:47:09,040
extrage-le dacă faci asta dacă iei

35257
26:47:05,360 --> 26:47:12,480
regresia ta lin și faci um

35258
26:47:09,040 --> 26:47:16,640
coeficienți ca acesta.

35259
26:47:12,480 --> 26:47:19,600
COF cu a cu subliniere. Deci asta

35260
26:47:16,640 --> 26:47:21,120
ne oferă cei instruiți

35261
26:47:19,600 --> 26:47:23,440
greutăți

35262
26:47:21,120 --> 26:47:26,400
coeficienți

35263
26:47:23,440 --> 26:47:29,120
cunoscut și sub denumirea de drept coeficienți.

35264
26:47:26,400 --> 26:47:33,680
Hm, deci dacă rulezi asta poți vedea uh

35265
26:47:29,120 --> 26:47:35,912
chiar acum avem acest coeficient aici

35266
26:47:33,680 --> 26:47:38,400
um care este singurul coeficient pe care l-am avut

35267
26:47:35,912 --> 26:47:42,600
pe caracteristica noastră. Deci am avut doar unul

35268
26:47:38,400 --> 26:47:42,600
coeficient de caracteristică acolo.

35269
26:47:51,280 --> 26:47:55,400
Și putem arunca o privire la interceptarea noastră

35270
26:47:57,912 --> 26:48:03,760
care este aceasta.

35271
26:48:00,720 --> 26:48:06,000
Deci asta ne oferă greutățile trenului

35272
26:48:03,760 --> 26:48:10,160
și astfel ne putem uita la interceptarea noi

35273
26:48:06,000 --> 26:48:12,000
se poate uita la coeficientul. Hm

35274
26:48:10,160 --> 26:48:14,552
deci evident dacă avem mai multe

35275
26:48:12,000 --> 26:48:16,400
caracteristici modelul nostru are multe caracteristici

35276
26:48:14,552 --> 26:48:18,320
va avea mai multe valori în asta

35277
26:48:16,400 --> 26:48:21,832
coeficient, dar interceptarea este justă

35278
26:48:18,320 --> 26:48:25,192
valoarea unică 7,23

35279
26:48:21,832 --> 26:48:28,872
iar apoi coeficientul

35280
26:48:25,192 --> 26:48:31,872
este 0,046. Deci aceasta este greutatea care primește

35281
26:48:28,872 --> 26:48:31,872
învăţat.

35282
26:48:32,232 --> 26:48:37,680
Există o limită de dimensiune? Nu, nu chiar.

35283
26:48:34,320 --> 26:48:39,600
Nu există limită de dimensiune. um,

35284
26:48:37,680 --> 26:48:41,192
nu. Puteți folosi la fel de multe date ca dvs

35285
26:48:39,600 --> 26:48:43,280
vreau.

35286
26:48:41,192 --> 26:48:47,552
Nu există într-adevăr nicio limită de dimensiune în afară de

35287
26:48:43,280 --> 26:48:47,552
ce place ce poti incapea in memorie.

35288
26:48:48,320 --> 26:48:51,360
Aș spune că asta este singura limită

35289
26:48:49,680 --> 26:48:54,912
practic care este cantitatea de date care

35290
26:48:51,360 --> 26:48:54,912
poate incapea in memorie.

35291
26:49:00,000 --> 26:49:03,680
Bine.

35292
26:49:02,400 --> 26:49:05,040
În regulă. Ați fost capabili să alergați

35293
26:49:03,680 --> 26:49:09,080
asta? Ați fost capabili să conduceți

35294
26:49:05,040 --> 26:49:09,080
regresie liniară ffit?

35295
26:49:09,192 --> 26:49:12,600
Bine, perfect.

35296
26:49:16,552 --> 26:49:24,640
Perfect. Ești bine, grozav. Mare.

35297
26:49:21,440 --> 26:49:27,192
Deci, avem un model și îl putem folosi

35298
26:49:24,640 --> 26:49:29,280
prezice. Hm, și asta este de fapt ceea ce

35299
26:49:27,192 --> 26:49:32,080
vom face mai departe. Dacă coborâm

35300
26:49:29,280 --> 26:49:35,600
aici, um, vom avea o funcție

35301
26:49:32,080 --> 26:49:39,192
asta va construi o diagramă de dispersie

35302
26:49:35,600 --> 26:49:41,512
din datele noastre de testare originale.

35303
26:49:39,192 --> 26:49:43,912
Deci vom avea datele noastre de testare

35304
26:49:41,512 --> 26:49:45,832
aici.

35305
26:49:43,912 --> 26:49:48,872
um,

35306
26:49:45,832 --> 26:49:51,120
iar apoi ne vom lua

35307
26:49:48,872 --> 26:49:54,640
ne vom lua datele de antrenament

35308
26:49:51,120 --> 26:49:58,720
și complot că vom folosi asta

35309
26:49:54,640 --> 26:50:00,160
date versus previziunile noastre de vânzări. Deci

35310
26:49:58,720 --> 26:50:02,640
poți vedea că mergem la tine asta este

35311
26:50:00,160 --> 26:50:05,680
cum apropo, așa folosești

35312
26:50:02,640 --> 26:50:08,160
model scikitlearn pentru a prezice. Ai o

35313
26:50:05,680 --> 26:50:10,000
apt să-l antreneze și să privească funcția

35314
26:50:08,160 --> 26:50:13,280
folositi pentru a prezice. Este la propriu doar

35315
26:50:10,000 --> 26:50:15,360
numit prezice. Așa este de ușor.

35316
26:50:13,280 --> 26:50:17,600
și transmiteți datele dvs., toate

35317
26:50:15,360 --> 26:50:21,192
caracteristici în acest prezice și ea

35318
26:50:17,600 --> 26:50:23,760
generează o predicție pentru fiecare rând. Deci

35319
26:50:21,192 --> 26:50:27,912
fiecare rând din aceste caracteristici din aceste date

35320
26:50:23,760 --> 26:50:30,160
frame um va sfârși cu o predicție

35321
26:50:27,912 --> 26:50:34,640
folosind modelul nostru. Deci la ce vom merge

35322
26:50:30,160 --> 26:50:38,232
face este să complotăm caracteristicile noastre de antrenament

35323
26:50:34,640 --> 26:50:41,192
față de vânzările prevăzute pentru a vedea cum

35324
26:50:38,232 --> 26:50:46,600
o potrivire bună care a fost cu adevărat.

35325
26:50:41,192 --> 26:50:46,600
Bine. pentru a vedea pentru a vedea regresia potrivită.

35326
26:50:49,040 --> 26:50:54,320
Bine. Și deci există potrivirea regresiei.

35327
26:50:52,232 --> 26:50:56,960
Avem toate datele noastre de testare aici

35328
26:50:54,320 --> 26:51:00,720
trasate în verde. Avem albastrul nostru,

35329
26:50:56,960 --> 26:51:04,552
care este um nostru, avem albastrul nostru,

35330
26:51:00,720 --> 26:51:06,720
care este linia noastră de date de antrenament

35331
26:51:04,552 --> 26:51:10,080
pe care ne-am construit modelul. Deci asta este un

35332
26:51:06,720 --> 26:51:12,400
potrivire destul de decentă. Hm și apoi testul nostru

35333
26:51:10,080 --> 26:51:14,320
datele sunt aici. Tocmai am complotat în

35334
26:51:12,400 --> 26:51:17,440
împrăștiere verde. Dar lucrul pe care te vreau

35335
26:51:14,320 --> 26:51:19,440
pentru a vedea este această predicție, nu? Noi noi

35336
26:51:17,440 --> 26:51:23,192
au putut genera unele predicții

35337
26:51:19,440 --> 26:51:24,960
pe acel antrenament um rulând nostru

35338
26:51:23,192 --> 26:51:27,192
funcția de predicție cu modelul nostru. Acum

35339
26:51:24,960 --> 26:51:30,080
acest model a fost antrenat. Deci am

35340
26:51:27,192 --> 26:51:32,080
se potrivește deja și acum îl folosim

35341
26:51:30,080 --> 26:51:34,800
prezice, nu? Și așa prevăzăm

35342
26:51:32,080 --> 26:51:38,000
vânzările și plotarea că pe y

35343
26:51:34,800 --> 26:51:40,000
ais. Deci, vânzările sunt noi folosim

35344
26:51:38,000 --> 26:51:44,480
vânzările prezise acolo, care este albastrul nostru

35345
26:51:40,000 --> 26:51:49,640
linie. Deci aceasta este linia noastră cea mai potrivită.

35346
26:51:44,480 --> 26:51:49,640
Deci aceasta este predicția modelului nostru.

35347
26:51:52,720 --> 26:51:58,000
Acestea sunt predicțiile modelului nostru. Corect?

35348
26:51:56,400 --> 26:52:00,000
Puteți vedea că este destul de decent

35349
26:51:58,000 --> 26:52:02,400
linie, nu? Linie destul de decentă de best

35350
26:52:00,000 --> 26:52:04,080
potrivi.

35351
26:52:02,400 --> 26:52:06,320
Desigur, există o eroare aici. Ca

35352
26:52:04,080 --> 26:52:09,040
acolo, știi, nu e perfect, dar

35353
26:52:06,320 --> 26:52:12,440
face o treabă decentă de a fi cel mai bun

35354
26:52:09,040 --> 26:52:12,440
linia de potrivire.

35355
26:52:23,192 --> 26:52:27,600
Bine.

35356
26:52:24,720 --> 26:52:30,480
Așa că uite cât de ușor a fost

35357
26:52:27,600 --> 26:52:32,800
doar pentru a recapitula asta pentru a se potrivi cu modelul nostru a fost

35358
26:52:30,480 --> 26:52:35,192
o regresie liniară.potrivire şi bineînţeles

35359
26:52:32,800 --> 26:52:37,760
vom face mai multe exemple. Deci nu

35360
26:52:35,192 --> 26:52:39,912
ne îngrijorează că vom vedea

35361
26:52:37,760 --> 26:52:42,160
de multe ori de multe ori pe tot parcursul

35362
26:52:39,912 --> 26:52:45,912
acest caiet. Dar avem liniară

35363
26:52:42,160 --> 26:52:48,160
regresie.apt să-l antrenăm și apoi noi

35364
26:52:45,912 --> 26:52:50,872
au regresie liniară.predic

35365
26:52:48,160 --> 26:52:53,440
la și trecem în trăsăturile noastre și că

35366
26:52:50,872 --> 26:52:57,360
generează o ieșire estimată.

35367
26:52:53,440 --> 26:53:02,440
Corect? Deci ceea ce face asta de fapt este

35368
26:52:57,360 --> 26:53:02,440
calculează această cantitate.

35369
26:53:12,400 --> 26:53:19,360
Am putea face oricare.

35370
26:53:14,640 --> 26:53:22,720
Am putea face oricare. Um, ca să putem face,

35371
26:53:19,360 --> 26:53:24,960
deci un lucru pe care l-am putea face este să complotăm

35372
26:53:22,720 --> 26:53:26,720
l-am putea schimba. Noi, am putea face

35373
26:53:24,960 --> 26:53:28,232
fie unul. Nu, nu este mare

35374
26:53:26,720 --> 26:53:31,680
se ocupa de a face setul de antrenament. Am putea

35375
26:53:28,232 --> 26:53:36,360
faceți, astfel încât să putem trasa testul X și apoi noi

35376
26:53:31,680 --> 26:53:36,360
ar putea reprezenta un grafic de regresie liniară X test.

35377
26:53:42,800 --> 26:53:48,872
Deci este o linie similară. Hm, este

35378
26:53:47,040 --> 26:53:51,512
doar diferite caracteristici de intrare, dar

35379
26:53:48,872 --> 26:53:53,440
linia va fi aceeași. Doar

35380
26:53:51,512 --> 26:53:55,120
intrări diferite,

35381
26:53:53,440 --> 26:53:57,040
dar coeficienții sunt aceiași,

35382
26:53:55,120 --> 26:54:00,680
nu? Este aceeași linie. Suntem doar noi

35383
26:53:57,040 --> 26:54:00,680
generează rezultate diferite.

35384
26:54:02,800 --> 26:54:08,800
Deci da, ai putea face oricare dintre ele.

35385
26:54:06,232 --> 26:54:10,400
Acesta este, sincer, acesta este

35386
26:54:08,800 --> 26:54:11,680
probabil mai bine. Văd ce ești

35387
26:54:10,400 --> 26:54:14,160
spunând. Acest lucru este probabil mai bine pentru că

35388
26:54:11,680 --> 26:54:16,960
aceasta este linia care se potrivește cel mai bine

35389
26:54:14,160 --> 26:54:20,640
aceste date. Deci, probabil că are sens

35390
26:54:16,960 --> 26:54:23,120
a face pentru a face prezice pe setul de testare.

35391
26:54:20,640 --> 26:54:26,440
De acord cu asta. Probabil face despre

35392
26:54:23,120 --> 26:54:26,440
cel mai bun sens.

35393
26:54:30,400 --> 26:54:34,280
Dar ai putea face oricare dintre ele.

35394
26:54:42,640 --> 26:54:46,080
Da, cred că asta ar fi cel mai mult

35395
26:54:44,320 --> 26:54:48,000
cred că este cel mai logic pentru

35396
26:54:46,080 --> 26:54:50,160
sa fie pe aceeasi doar sa

35397
26:54:48,000 --> 26:54:52,960
valida. Așa cum am putea face, am putea

35398
26:54:50,160 --> 26:54:55,440
face antrenament aici și apoi antrenează-te și

35399
26:54:52,960 --> 26:54:58,400
Antrenează-te doar pentru a vedea cum se îndreaptă acele date

35400
26:54:55,440 --> 26:55:00,640
sus. Într-adevăr, ceea ce încercăm să facem este

35401
26:54:58,400 --> 26:55:03,192
au datele noastre împrăștiate și apoi ale noastre

35402
26:55:00,640 --> 26:55:05,120
linia cea mai potrivită pe aceeași parcelă.

35403
26:55:03,192 --> 26:55:06,960
Asta este tot ce încercăm să facem, nu?

35404
26:55:05,120 --> 26:55:10,120
Deci, da, cred că ar trebui să fie

35405
26:55:06,960 --> 26:55:10,120
la fel.

35406
26:55:10,320 --> 26:55:14,120
Cred că are sens.

35407
26:55:14,960 --> 26:55:22,192
Aceste valori

35408
26:55:17,912 --> 26:55:22,192
sau ce valori vrei sa vezi?

35409
26:55:24,320 --> 26:55:29,832
Da, am putea genera

35410
26:55:26,232 --> 26:55:34,160
alea dacă le facem, hai să coborâm

35411
26:55:29,832 --> 26:55:38,480
aici. Deci valorile liniei

35412
26:55:34,160 --> 26:55:40,872
um vor fi uh predicția. Deci

35413
26:55:38,480 --> 26:55:43,280
um the

35414
26:55:40,872 --> 26:55:45,440
uh test

35415
26:55:43,280 --> 26:55:49,720
previziuni

35416
26:55:45,440 --> 26:55:49,720
este egal cu um

35417
26:55:50,480 --> 26:55:54,232
predicțiile testului sunt egale cu liniar

35418
26:55:52,160 --> 26:55:56,720
regresie.predict prezic testul x și

35419
26:55:54,232 --> 26:56:00,832
apoi am putea imprima

35420
26:55:56,720 --> 26:56:00,832
predicții de testare.

35421
26:56:01,440 --> 26:56:07,680
Da. Deci putem vedea care sunt cele reale

35422
26:56:03,360 --> 26:56:10,680
valorile sunt pe setul de testare.

35423
26:56:07,680 --> 26:56:10,680
Da.

35424
26:56:18,000 --> 26:56:21,600
O să facem asta. Da. Deci te-ai gândit

35425
26:56:20,160 --> 26:56:23,360
verificam cât de bine sunt datele noastre

35426
26:56:21,600 --> 26:56:24,960
antrenat. Vom face asta. Da, noi

35427
26:56:23,360 --> 26:56:26,872
nu am învățat cum să evaluez asta

35428
26:56:24,960 --> 26:56:29,760
încă. Vom vorbi despre asta

35429
26:56:26,872 --> 26:56:31,360
urmand. Da, asta vom face.

35430
26:56:29,760 --> 26:56:33,280
Doar că nu am învățat cum să facem cum trebuie

35431
26:56:31,360 --> 26:56:36,160
evaluarea

35432
26:56:33,280 --> 26:56:37,512
a unui model de regresie.

35433
26:56:36,160 --> 26:56:39,832
Dar da, este ceva ce vom face

35434
26:56:37,512 --> 26:56:44,192
vorbesc despre sigur

35435
26:56:39,832 --> 26:56:44,192
și vezi cum să faci în codul nostru.

35436
26:56:46,552 --> 26:56:49,552
Bine.

35437
26:56:49,912 --> 26:56:55,480
În regulă. Orice alte întrebări despre

35438
26:56:52,232 --> 26:56:55,480
acest exemplu?

35439
26:56:59,120 --> 26:57:06,400
Din nou, lucruri mari

35440
26:57:02,000 --> 26:57:08,400
apt să-l antreneze și apoi să prezice să-l folosească

35441
26:57:06,400 --> 26:57:11,680
ea.

35442
26:57:08,400 --> 26:57:16,040
Preziceți caracteristicile pentru a utiliza modelul

35443
26:57:11,680 --> 26:57:16,040
și faceți predicții cu el.

35444
26:57:16,160 --> 26:57:19,912
Deci iată un exemplu. Noi am făcut toate

35445
26:57:18,640 --> 26:57:22,400
previziuni. Acestea sunt toate

35446
26:57:19,912 --> 26:57:23,832
valorile care se află pe acea linie.

35447
26:57:22,400 --> 26:57:25,760
Acestea sunt toate previziunile noastre. Şi

35448
26:57:23,832 --> 26:57:27,280
observați că aceasta este o regresie cu adevărat,

35449
26:57:25,760 --> 26:57:29,760
nu? Toate acestea sunt în virgulă flotantă

35450
26:57:27,280 --> 26:57:34,040
valorile. Hm, deci acesta este cu siguranță un

35451
26:57:29,760 --> 26:57:34,040
regresie, nu?

35452
26:57:43,120 --> 26:57:46,120
Bine.

35453
26:57:50,800 --> 26:57:58,552
E o întrebare bună. um,

35454
26:57:54,800 --> 26:58:02,360
Nu sunt sigur dacă există

35455
26:57:58,552 --> 26:58:02,360
dacă există ca un verboz

35456
26:58:03,120 --> 26:58:06,720
nu există cu adevărat, nu există cu adevărat

35457
26:58:05,120 --> 26:58:08,552
un verbos. Poți, adică poți să te uiți

35458
26:58:06,720 --> 26:58:11,512
la codul sursă dacă chiar vrei

35459
26:58:08,552 --> 26:58:14,720
vezi, poți vedea codul sursă pentru a vedea

35460
26:58:11,512 --> 26:58:17,512
um cum se face. Pot să vă spun, vreau să spun

35461
26:58:14,720 --> 26:58:21,040
deci în general se face regresia liniară

35462
26:58:17,512 --> 26:58:24,552
în două moduri. Fie folosești o formulă um

35463
26:58:21,040 --> 26:58:27,440
pentru a rezolva problema de optimizare a

35464
26:58:24,552 --> 26:58:32,000
minimizând astfel această distanță

35465
26:58:27,440 --> 26:58:33,912
de la puncte la la linie. Hm

35466
26:58:32,000 --> 26:58:35,760
sau folosești ceva numit gradient

35467
26:58:33,912 --> 26:58:39,192
coborâre care este cât de multe dintre acestea

35468
26:58:35,760 --> 26:58:40,872
lucrurile fac asta este ele repetă prin a

35469
26:58:39,192 --> 26:58:44,720
o grămadă de iterații diferite în care acestea

35470
26:58:40,872 --> 26:58:48,480
actualizați aceste ponderi conform um a

35471
26:58:44,720 --> 26:58:50,960
anumite uh practic un gradient al

35472
26:58:48,480 --> 26:58:53,192
funcția de eroare. Funcția de eroare

35473
26:58:50,960 --> 26:58:59,192
în acest caz este pătratul

35474
26:58:53,192 --> 26:59:01,120
distanta de la linie la uh to to

35475
26:58:59,192 --> 26:59:03,912
punctele.

35476
26:59:01,120 --> 26:59:06,320
Deci putem calcula gradientul de

35477
26:59:03,912 --> 26:59:08,160
asta și faceți o coborâre în gradient. Deci dacă

35478
26:59:06,320 --> 26:59:10,320
chiar vrei să te uiți la asta, aș vrea

35479
26:59:08,160 --> 26:59:13,120
faceți niște cercetări pe liniar

35480
26:59:10,320 --> 26:59:15,192
coborâre a gradientului de regresie.

35481
26:59:13,120 --> 26:59:17,760
Bine, coborâre gradient de regresie liniară

35482
26:59:15,192 --> 26:59:21,600
să văd cum e așa

35483
26:59:17,760 --> 26:59:25,440
gata. Da, este destul de simplu

35484
26:59:21,600 --> 26:59:28,720
procedura. Hm, din nou, ai

35485
26:59:25,440 --> 26:59:32,640
ideea este că doriți să minimizați

35486
26:59:28,720 --> 26:59:34,552
minimizați pierderea sau eroarea. Uh, în

35487
26:59:32,640 --> 26:59:38,552
în acest caz, pierderea este pătratul

35488
26:59:34,552 --> 26:59:41,280
distanta. Deci, e ca și cum ar fi

35489
26:59:38,552 --> 26:59:44,320
a este o formulă. Este ca o sumă de a

35490
26:59:41,280 --> 26:59:48,000
distanță pătrată față de predicția dvs

35491
26:59:44,320 --> 26:59:53,760
um sau eticheta ta imi pare rau pentru modelul tau

35492
26:59:48,000 --> 26:59:56,720
care este beta 0 um plus beta 1 x1

35493
26:59:53,760 --> 26:59:59,832
plus beta 2 x2

35494
26:59:56,720 --> 27:00:01,512
etc ca modelul tău și apoi pătrat. Aşa

35495
26:59:59,832 --> 27:00:04,720
acest pătrat acesta este pătratul

35496
27:00:01,512 --> 27:00:07,440
distanță aici și minimizați acest lucru

35497
27:00:04,720 --> 27:00:10,320
tip care este ca o problemă de calcul.

35498
27:00:07,440 --> 27:00:12,232
Găsești că practic găsești asta

35499
27:00:10,320 --> 27:00:14,160
este un lucru în care intru atât de departe

35500
27:00:12,232 --> 27:00:17,280
buruieni de asta, dar aceasta este ca o

35501
27:00:14,160 --> 27:00:19,280
parabolă și tu mergi cum vrei Nu, nu,

35502
27:00:17,280 --> 27:00:22,400
esti bun. Este un bun

35503
27:00:19,280 --> 27:00:24,720
întrebare. Um, mergi până la

35504
27:00:22,400 --> 27:00:26,640
minimul acestuia. Are sens?

35505
27:00:24,720 --> 27:00:28,720
De parcă ai fi făcut drumul aici jos

35506
27:00:26,640 --> 27:00:31,760
și faci asta printr-o coborâre

35507
27:00:28,720 --> 27:00:33,440
proces, ca o iterație de coborâre.

35508
27:00:31,760 --> 27:00:35,040
Hm

35509
27:00:33,440 --> 27:00:37,280
deci

35510
27:00:35,040 --> 27:00:41,192
asa se gasesc astea.

35511
27:00:37,280 --> 27:00:42,960
Hm, dar nu vezi că se întâmplă asta în

35512
27:00:41,192 --> 27:00:44,480
fundalul. Dar dacă te uiți la

35513
27:00:42,960 --> 27:00:46,232
cod sursă, vă garantez că ar fi

35514
27:00:44,480 --> 27:00:48,000
fie că va fi asta sau

35515
27:00:46,232 --> 27:00:51,440
ei vor folosi ei merg

35516
27:00:48,000 --> 27:00:57,000
pentru a utiliza o formulă a a matricei pentru a practic

35517
27:00:51,440 --> 27:00:57,000
rezolvați o ecuație um care implică acest lucru.

35518
27:00:57,280 --> 27:01:02,232
Practic, derivata acestui set

35519
27:00:59,280 --> 27:01:03,760
egal cu zero și găsești minimul.

35520
27:01:02,232 --> 27:01:06,912
Oricum, găsești minimul

35521
27:01:03,760 --> 27:01:06,912
din aceasta.

35522
27:01:09,120 --> 27:01:15,040
Bine. Dar da, nu cred că Psycharn

35523
27:01:12,160 --> 27:01:18,800
are ca un uh poate există un fel de

35524
27:01:15,040 --> 27:01:21,192
steag verbor pe care îl puteți căuta.

35525
27:01:18,800 --> 27:01:24,600
Nu cred că au așa ceva. Nu

35526
27:01:21,192 --> 27:01:24,600
pe care l-am văzut.

35527
27:01:31,440 --> 27:01:37,360
În regulă.

35528
27:01:33,280 --> 27:01:40,552
Deci am un concept important

35529
27:01:37,360 --> 27:01:43,360
vorbește despre următoarea care va fi uh

35530
27:01:40,552 --> 27:01:45,912
numite supraajustare și subadaptare

35531
27:01:43,360 --> 27:01:48,872
um, care este un concept cu adevărat important

35532
27:01:45,912 --> 27:01:51,360
asta este legat de antrenament și test

35533
27:01:48,872 --> 27:01:53,440
date pe care tocmai le împărțim pentru a le face

35534
27:01:51,360 --> 27:01:56,640
evaluarea.

35535
27:01:53,440 --> 27:01:58,400
Și, în esență, problema cu

35536
27:01:56,640 --> 27:02:00,872
învățarea automată este că nu este

35537
27:01:58,400 --> 27:02:03,512
perfect și se poate lupta în diferite

35538
27:02:00,872 --> 27:02:05,120
moduri. Și cele două moduri în care în primul rând

35539
27:02:03,512 --> 27:02:06,640
luptele va fi supraadaptată și

35540
27:02:05,120 --> 27:02:11,600
submontare.

35541
27:02:06,640 --> 27:02:14,872
Deci supraadaptarea este o situație în care

35542
27:02:11,600 --> 27:02:18,872
modelul memorează practic antrenamentul

35543
27:02:14,872 --> 27:02:21,680
datele atât de bine încât nu reușesc

35544
27:02:18,872 --> 27:02:25,040
generalizați la noi exemple. Deci ce noi

35545
27:02:21,680 --> 27:02:26,720
vezi cu supraajustarea este exact acest semn

35546
27:02:25,040 --> 27:02:28,400
aici unde avem foarte bine

35547
27:02:26,720 --> 27:02:30,720
performanță pe datele de antrenament. Deci

35548
27:02:28,400 --> 27:02:34,552
când da, când facem acea împărțire a testului de tren

35549
27:02:30,720 --> 27:02:39,280
vedem o precizie foarte bună sau chiar

35550
27:02:34,552 --> 27:02:41,600
eroare scăzută asupra datelor de antrenament, dar aceasta

35551
27:02:39,280 --> 27:02:44,800
nu funcționează nicăieri aproape de asta

35552
27:02:41,600 --> 27:02:48,000
că datele de testare sunt împărțite. Deci ce înseamnă asta

35553
27:02:44,800 --> 27:02:50,160
este că modelul este supraadaptat la

35554
27:02:48,000 --> 27:02:54,160
date de antrenament. Practic este memorarea

35555
27:02:50,160 --> 27:02:56,080
ea și nu prea se poate generaliza

35556
27:02:54,160 --> 27:02:58,960
bine.

35557
27:02:56,080 --> 27:03:01,360
Acum, de ce se întâmplă asta? De obicei este

35558
27:02:58,960 --> 27:03:04,872
deoarece modelul este mult prea complex.

35559
27:03:01,360 --> 27:03:07,912
Și asta înseamnă că, în general, trebuie să faci

35560
27:03:04,872 --> 27:03:10,872
ceva care să reducă complexitatea.

35561
27:03:07,912 --> 27:03:12,800
Fie trebuie să utilizați un model mai simplu

35562
27:03:10,872 --> 27:03:15,192
sau trebuie să utilizați un tip de

35563
27:03:12,800 --> 27:03:17,360
tehnică de atenuare a supraadaptarii. Şi

35564
27:03:15,192 --> 27:03:18,872
vom studia câteva

35565
27:03:17,360 --> 27:03:20,872
din acele tehnici care apar în aceasta

35566
27:03:18,872 --> 27:03:22,800
caietul. uh, s-ar putea să nu ajungem la asta

35567
27:03:20,872 --> 27:03:24,552
azi, dar vom studia

35568
27:03:22,800 --> 27:03:26,320
în special ce putem face pentru a preveni

35569
27:03:24,552 --> 27:03:28,400
supraajustarea deoarece supraadaptarea este

35570
27:03:26,320 --> 27:03:32,160
problemă mai frecventă cu învățarea automată

35571
27:03:28,400 --> 27:03:34,720
modele. Au tendința să se descurce atât de bine la

35572
27:03:32,160 --> 27:03:37,280
învăţând din datele pe care le preiau

35573
27:03:34,720 --> 27:03:38,872
mici detalii și modele în

35574
27:03:37,280 --> 27:03:41,912
exemple de antrenament pe care le sunt expuse

35575
27:03:38,872 --> 27:03:43,912
la. Ei nu fac o treabă grozavă la

35576
27:03:41,912 --> 27:03:45,600
generalizarea la noi exemple. Ei pot

35577
27:03:43,912 --> 27:03:48,720
lupta cu asta.

35578
27:03:45,600 --> 27:03:50,872
Deci supraadaptarea se luptă

35579
27:03:48,720 --> 27:03:53,040
generalizează la noi exemple, dar o faci

35580
27:03:50,872 --> 27:03:55,512
foarte bine pe datele tale de antrenament. Deci

35581
27:03:53,040 --> 27:03:57,360
pare că ai un model bun, dar

35582
27:03:55,512 --> 27:03:59,680
nu poate merge și face

35583
27:03:57,360 --> 27:04:01,120
predicții asupra datelor de testare foarte bine,

35584
27:03:59,680 --> 27:04:03,120
ceea ce înseamnă că nu am dori să folosim

35585
27:04:01,120 --> 27:04:05,360
acel model din lumea reală, nu?

35586
27:04:03,120 --> 27:04:07,512
Pentru că nu este capabil să generalizeze

35587
27:04:05,360 --> 27:04:08,800
în afara a ceea ce s-a văzut deja. Şi

35588
27:04:07,512 --> 27:04:10,960
nu este un lucru bun dacă încercăm

35589
27:04:08,800 --> 27:04:12,480
pentru a-l folosi pentru exemple din lumea reală,

35590
27:04:10,960 --> 27:04:16,000
nu?

35591
27:04:12,480 --> 27:04:17,912
Deci supraadaptarea este o problemă reală. Um tu

35592
27:04:16,000 --> 27:04:19,600
vezi tot timpul. Am văzut-o multe

35593
27:04:17,912 --> 27:04:22,872
de multe ori în lumea reală, reală

35594
27:04:19,600 --> 27:04:25,040
industria uh munca pe care am făcut-o.

35595
27:04:22,872 --> 27:04:26,960
Suprafitting este o provocare pentru a

35596
27:04:25,040 --> 27:04:29,680
multe modele de învățare automată. Și așa

35597
27:04:26,960 --> 27:04:31,192
avem nevoie de câteva tehnici de depășit

35598
27:04:29,680 --> 27:04:35,280
supraadaptare. Și o să studiem

35599
27:04:31,192 --> 27:04:39,120
unele dintre acestea vor apărea în scurt timp.

35600
27:04:35,280 --> 27:04:40,872
Unul dintre lucrurile pe care le putem face,

35601
27:04:39,120 --> 27:04:43,760
unul dintre lucrurile pe care le putem

35602
27:04:40,872 --> 27:04:46,872
face pentru a detecta supraadaptarea este exact ceea ce

35603
27:04:43,760 --> 27:04:48,960
tocmai am făcut-o, adică te-ai despărțit

35604
27:04:46,872 --> 27:04:50,480
datele dvs. în instruire și testare astfel

35605
27:04:48,960 --> 27:04:52,480
că ai șansa să faci o

35606
27:04:50,480 --> 27:04:54,552
evaluare pentru a vedea dacă ești egal

35607
27:04:52,480 --> 27:04:58,000
supraadaptarea în primul rând. Tu vrei

35608
27:04:54,552 --> 27:05:00,552
pentru a vedea că performanța este consistentă

35609
27:04:58,000 --> 27:05:02,720
de la tren la test, nu? Tu vrei

35610
27:05:00,552 --> 27:05:05,512
vezi consistenta. Ceea ce nu vrei

35611
27:05:02,720 --> 27:05:08,232
vezi este performanța care scade pe

35612
27:05:05,512 --> 27:05:10,320
date de testare. E mult mai rău. Tu nu

35613
27:05:08,232 --> 27:05:12,960
vreau sa vad asta. Asta înseamnă că dvs

35614
27:05:10,320 --> 27:05:14,640
modelul este supraadaptat la antrenamentul tău

35615
27:05:12,960 --> 27:05:17,360
date și nu va funcționa bine

35616
27:05:14,640 --> 27:05:18,960
în lumea reală.

35617
27:05:17,360 --> 27:05:22,320
Bine. Deci, vom avea un cuplu

35618
27:05:18,960 --> 27:05:25,600
modalități de a depăși asta. Vorbește despre

35619
27:05:22,320 --> 27:05:27,360
că. Acum, opusul poate de fapt

35620
27:05:25,600 --> 27:05:30,640
se întâmplă și, care se numește

35621
27:05:27,360 --> 27:05:33,912
submontare. Și subadaptare

35622
27:05:30,640 --> 27:05:37,192
se referă la faptul că un model este de asemenea

35623
27:05:33,912 --> 27:05:40,000
simplu și de fapt pur și simplu funcționează

35624
27:05:37,192 --> 27:05:44,160
prost peste tot. Deci dacă vedem

35625
27:05:40,000 --> 27:05:46,960
performanţă slabă la antrenament şi

35626
27:05:44,160 --> 27:05:50,400
date de testare, acesta este un semnal bun că

35627
27:05:46,960 --> 27:05:52,552
modelul nu este potrivit și asta înseamnă că este

35628
27:05:50,400 --> 27:05:55,440
prea simplu de obicei și ar trebui să încerci

35629
27:05:52,552 --> 27:05:57,832
folosind ceva mai complex. Hm, deci

35630
27:05:55,440 --> 27:06:01,440
cel mai bun mod de a combate subadaptarea este să

35631
27:05:57,832 --> 27:06:03,832
utilizați un model mai complex. Și pe măsură ce mergem

35632
27:06:01,440 --> 27:06:05,040
prin și învață despre modele,

35633
27:06:03,832 --> 27:06:06,960
vom afla despre care dintre ele

35634
27:06:05,040 --> 27:06:09,512
sunt simple și care sunt complexe.

35635
27:06:06,960 --> 27:06:11,760
Deci vom avea o scară de fel

35636
27:06:09,512 --> 27:06:13,600
de complexitate. Și dacă ești

35637
27:06:11,760 --> 27:06:16,160
underfitting, vrei să treci până la

35638
27:06:13,600 --> 27:06:18,400
la un model mai complex. Dacă ești dacă

35639
27:06:16,160 --> 27:06:20,320
ești supraadaptat, un mod de a lupta

35640
27:06:18,400 --> 27:06:22,720
adică să cobori de fapt la ceva

35641
27:06:20,320 --> 27:06:24,800
mai simplu. Mergi pe sens invers

35642
27:06:22,720 --> 27:06:26,160
ceva mai simplu. Deci trebuie să învățăm

35643
27:06:24,800 --> 27:06:27,760
acum am învățat doar liniar

35644
27:06:26,160 --> 27:06:30,000
regresie

35645
27:06:27,760 --> 27:06:32,640
dar vom învăța și alte modele pe care le cunoașteți

35646
27:06:30,000 --> 27:06:34,080
în viitor și despre care vom vorbi

35647
27:06:32,640 --> 27:06:36,320
uh complexitatea lor și cum sunt

35648
27:06:34,080 --> 27:06:38,800
legate între ele.

35649
27:06:36,320 --> 27:06:41,440
Bine, dar acestea sunt două probleme pe care le vedem

35650
27:06:38,800 --> 27:06:43,280
doar pentru a scoate asta din nou este dacă noi

35651
27:06:41,440 --> 27:06:46,320
avem o divizare de test de tren acolo unde avem

35652
27:06:43,280 --> 27:06:49,040
7030 split să spunem și facem

35653
27:06:46,320 --> 27:06:51,760
foarte bine aici, dar mergem să aplicăm

35654
27:06:49,040 --> 27:06:54,232
modelul acela de aici și eșuează

35655
27:06:51,760 --> 27:06:56,080
precizia scade semnificativ mai mult

35656
27:06:54,232 --> 27:07:00,400
eroare asta e cu siguranta

35657
27:06:56,080 --> 27:07:02,960
supraadaptare care nu este bună

35658
27:07:00,400 --> 27:07:04,872
corect și apoi underfitting pur și simplu nu este

35659
27:07:02,960 --> 27:07:06,800
performând bine în ambele cazuri deci chiar

35660
27:07:04,872 --> 27:07:09,360
pe datele de antrenament în sine ești al tău

35661
27:07:06,800 --> 27:07:11,832
precizia nu este foarte buna. Deci nu ești

35662
27:07:09,360 --> 27:07:15,280
învăț cu adevărat eficient. Tu esti

35663
27:07:11,832 --> 27:07:20,120
nu corespunde modelului dvs. Deci asta e

35664
27:07:15,280 --> 27:07:20,120
e un caz insuficient.

35665
27:07:21,912 --> 27:07:24,912
Bine.

35666
27:07:26,872 --> 27:07:32,320
În regulă. Acum problema este că se poate

35667
27:07:29,600 --> 27:07:33,912
fi foarte dificil să echilibrezi aceste două

35668
27:07:32,320 --> 27:07:34,960
si sa-l corecteze. Asta face

35669
27:07:33,912 --> 27:07:37,912
un pic de învățare automată

35670
27:07:34,960 --> 27:07:41,360
provocator este obținerea acestui echilibru

35671
27:07:37,912 --> 27:07:43,600
corect de simplitate și complexitate. Deci

35672
27:07:41,360 --> 27:07:45,600
nu vrei să fii prea complex

35673
27:07:43,600 --> 27:07:48,800
te antrenezi prea mult, dar nu vrei să fii

35674
27:07:45,600 --> 27:07:51,440
exagerat de simplu că nu te potrivești și

35675
27:07:48,800 --> 27:07:53,120
nu ești capabil să înveți eficient. Deci

35676
27:07:51,440 --> 27:07:55,040
există un pic de compromis acolo. Şi

35677
27:07:53,120 --> 27:07:58,400
acest compromis este de obicei cunoscut în

35678
27:07:55,040 --> 27:08:01,040
comunitatea ca schimb de variație de părtinire. Hm

35679
27:07:58,400 --> 27:08:02,960
caz în care uh practic este ca o

35680
27:08:01,040 --> 27:08:06,080
complexitate simplitate compromis. Este

35681
27:08:02,960 --> 27:08:10,552
un alt cuvânt pentru asta. um,

35682
27:08:06,080 --> 27:08:15,512
și așa, uh, se crede că, um,

35683
27:08:10,552 --> 27:08:16,800
dacă tu, uh, dacă ai foarte, um, dacă tu

35684
27:08:15,512 --> 27:08:19,360
ai o situație în care poți

35685
27:08:16,800 --> 27:08:22,160
se potrivesc foarte bine cu datele de antrenament, tu

35686
27:08:19,360 --> 27:08:24,400
riscul de a nu putea generaliza. În

35687
27:08:22,160 --> 27:08:28,320
cu alte cuvinte, riști să te supraajustezi și

35688
27:08:24,400 --> 27:08:33,360
e greu de um, e greu de combatut

35689
27:08:28,320 --> 27:08:34,872
că într-un fel. Um, și um, pe

35690
27:08:33,360 --> 27:08:38,160
reversul, dacă ai ceva

35691
27:08:34,872 --> 27:08:40,720
foarte simplu, um, riști să nu înveți

35692
27:08:38,160 --> 27:08:43,680
suficient. Chiar dacă încerci să lupți

35693
27:08:40,720 --> 27:08:45,192
acea supraadaptare, riști să nu înveți

35694
27:08:43,680 --> 27:08:47,760
suficient și modelul tău pur și simplu nu

35695
27:08:45,192 --> 27:08:49,912
performează cât de bine ar putea. Deci, există

35696
27:08:47,760 --> 27:08:51,760
un pic de compromis acolo de a încerca

35697
27:08:49,912 --> 27:08:54,552
găsi echilibrul potrivit între ceva

35698
27:08:51,760 --> 27:08:58,000
destul de complex pentru a învăța, dar ceva

35699
27:08:54,552 --> 27:09:01,512
nu prea complex pentru care va fi

35700
27:08:58,000 --> 27:09:05,040
nu generalizați la date noi. Asta este

35701
27:09:01,512 --> 27:09:08,320
provocare. Cum am spus, mergem

35702
27:09:05,040 --> 27:09:10,552
pentru a avea tehnici pentru a depăși acest lucru. Deci

35703
27:09:08,320 --> 27:09:15,120
din fericire, sunt lucruri de practic

35704
27:09:10,552 --> 27:09:17,120
depășește acest compromis și um și ajută

35705
27:09:15,120 --> 27:09:18,720
noi pe parcurs ca să nu facem

35706
27:09:17,120 --> 27:09:20,232
supraadaptare. Ele practic previn

35707
27:09:18,720 --> 27:09:23,040
supraadaptare

35708
27:09:20,232 --> 27:09:27,600
și permiteți-ne să folosim suficient de complex

35709
27:09:23,040 --> 27:09:31,912
modele um că asta nu va fi supraadaptat.

35710
27:09:27,600 --> 27:09:34,232
Acesta este în um, asta a fost în uh-ul nostru

35711
27:09:31,912 --> 27:09:35,600
caietul lecția 3.2. Deci vrei să tragi

35712
27:09:34,232 --> 27:09:37,192
acela înapoi. Lucram la

35713
27:09:35,600 --> 27:09:40,000
luni.

35714
27:09:37,192 --> 27:09:42,320
Um, și doar ca să recapitulez puțin,

35715
27:09:40,000 --> 27:09:44,872
amintiți-vă că construiam un liniar

35716
27:09:42,320 --> 27:09:48,320
regresie, am vrut să recapitulez câteva dintre ele

35717
27:09:44,872 --> 27:09:50,320
pașii pe care i-am făcut acolo, um, că noi

35718
27:09:48,320 --> 27:09:53,192
va face din nou și din nou. Şi

35719
27:09:50,320 --> 27:09:55,760
într-adevăr același tip de pași, uh, că

35720
27:09:53,192 --> 27:09:57,512
facem aici, vom face în multe dintre noi

35721
27:09:55,760 --> 27:09:59,600
construirea de modele. Aproape toate ale noastre

35722
27:09:57,512 --> 27:10:01,440
construirea de modele, asta facem, dacă

35723
27:09:59,600 --> 27:10:04,000
este regresie sau clasificare,

35724
27:10:01,440 --> 27:10:07,680
chiar nu conteaza. um tot vom fi

35725
27:10:04,000 --> 27:10:09,600
făcând mulți dintre acești pași care sunt um

35726
27:10:07,680 --> 27:10:13,600
amintiți-vă că mai întâi ne-am împărțit datele

35727
27:10:09,600 --> 27:10:16,160
într-un fel de caracteristici și etichetă

35728
27:10:13,600 --> 27:10:19,192
uh x și y și motivul asta

35729
27:10:16,160 --> 27:10:23,192
important este pentru că um modelul

35730
27:10:19,192 --> 27:10:26,232
antrenamentul folosește caracteristicile și eticheta

35731
27:10:23,192 --> 27:10:29,120
pentru a ajuta la antrenamentul modelului, nu? Ei

35732
27:10:26,232 --> 27:10:31,040
folosiți-le separat. Hm, deci vrem

35733
27:10:29,120 --> 27:10:33,192
împărțiți-le pe acestea ori de câte ori putem. Şi

35734
27:10:31,040 --> 27:10:35,760
deci avem de obicei uh este un bun

35735
27:10:33,192 --> 27:10:39,680
exersați-vă să vă numiți caracteristicile X majusculă

35736
27:10:35,760 --> 27:10:42,720
iar etichetele tale minuscule Y. Și ce noi

35737
27:10:39,680 --> 27:10:44,640
face cu asta este să ne amintim imediat

35738
27:10:42,720 --> 27:10:47,280
împărțiți asta în ceea ce numim

35739
27:10:44,640 --> 27:10:51,912
antrenament într-un set de testare. Și poza

35740
27:10:47,280 --> 27:10:55,912
am avut pentru că a fost ceva de genul acesta

35741
27:10:51,912 --> 27:10:58,640
unde aveam aproximativ 70% din date

35742
27:10:55,912 --> 27:11:01,760
obișnuiam să antrenăm modelul împotriva și

35743
27:10:58,640 --> 27:11:04,400
apoi celelalte 30% din datele pe care le folosim

35744
27:11:01,760 --> 27:11:07,192
testați modelul împotriva. Adică noi

35745
27:11:04,400 --> 27:11:10,320
construiește un model aici și îl aplicăm

35746
27:11:07,192 --> 27:11:12,640
la acest set de aici um să fac

35747
27:11:10,320 --> 27:11:14,000
previziuni. Și apoi acolo

35748
27:11:12,640 --> 27:11:17,360
învățarea supravegheată chiar vine

35749
27:11:14,000 --> 27:11:19,760
în joc, nu? este pe acest set de testare.

35750
27:11:17,360 --> 27:11:21,912
Avem deja răspunsurile. Noi deja

35751
27:11:19,760 --> 27:11:24,552
au eticheta. Și astfel ne putem aplica

35752
27:11:21,912 --> 27:11:27,512
model la aceasta la caracteristicile de aici.

35753
27:11:24,552 --> 27:11:30,480
Prezice care ar trebui să fie eticheta

35754
27:11:27,512 --> 27:11:33,440
si compara asta. Putem obține o metrică,

35755
27:11:30,480 --> 27:11:36,640
corect, asta compară cât de aproape suntem

35756
27:11:33,440 --> 27:11:38,480
predicția noastră la valorile reale. Hm

35757
27:11:36,640 --> 27:11:40,720
și asta a fost o parte din performanța noastră

35758
27:11:38,480 --> 27:11:42,720
metrici. O să recapitulez câteva dintre acestea

35759
27:11:40,720 --> 27:11:45,680
un fel de măsurare a acelei distanțe

35760
27:11:42,720 --> 27:11:49,360
predicțiile noastre la ceea ce eticheta reală

35761
27:11:45,680 --> 27:11:52,232
este. Hm, dar amintește-ți că aveam acest tren

35762
27:11:49,360 --> 27:11:55,680
funcția de testare a împărțirii, care ne ajută să divizăm

35763
27:11:52,232 --> 27:11:58,480
în afară de caracteristicile și etichetele noastre

35764
27:11:55,680 --> 27:12:00,552
aceste patru seturi de date. Deci avem

35765
27:11:58,480 --> 27:12:02,552
caracteristicile noastre de antrenament, testarea noastră

35766
27:12:00,552 --> 27:12:05,120
funcțiile și apoi etichetele noastre de antrenament

35767
27:12:02,552 --> 27:12:08,000
și etichetele noastre de testare. Deci avem pe toate

35768
27:12:05,120 --> 27:12:10,720
dintre aceștia și chiar acești doi tipi

35769
27:12:08,000 --> 27:12:12,320
vor fi folosite pentru a antrena modelul.

35770
27:12:10,720 --> 27:12:13,680
De aceea se numesc subliniere

35771
27:12:12,320 --> 27:12:16,000
tren. Vor fi folosiți pentru antrenament

35772
27:12:13,680 --> 27:12:18,400
acel model. Și atunci suntem

35773
27:12:16,000 --> 27:12:20,872
va prezice pe aceste set de

35774
27:12:18,400 --> 27:12:23,832
caracteristici și apoi com să le folosească

35775
27:12:20,872 --> 27:12:25,832
previziuni de comparat cu acest set de

35776
27:12:23,832 --> 27:12:28,872
etichete, nu? Asta e la testul de testare

35777
27:12:25,832 --> 27:12:32,080
set. Hm și observați aici testul nostru

35778
27:12:28,872 --> 27:12:33,912
dimensiunea este setată la 30%. E frumos

35779
27:12:32,080 --> 27:12:37,360
număr standard. Oriunde între like

35780
27:12:33,912 --> 27:12:40,552
20 până la 30% este destul de standard. Hm, vom face

35781
27:12:37,360 --> 27:12:44,160
de obicei folosește.3, dar ar putea fi 02.

35782
27:12:40,552 --> 27:12:47,120
Oriunde între ele este bine.

35783
27:12:44,160 --> 27:12:49,512
Bine, deci am avut asta. Să sperăm că uh

35784
27:12:47,120 --> 27:12:51,832
ne amintim că de luni.

35785
27:12:49,512 --> 27:12:53,512
Deci am avut un tren și un set de testare. Şi

35786
27:12:51,832 --> 27:12:55,360
atunci construirea modelului a fost de fapt

35787
27:12:53,512 --> 27:12:57,760
chiar foarte usor. Odată ce le ai

35788
27:12:55,360 --> 27:13:00,872
tren și seturi de testare, um, doar importăm

35789
27:12:57,760 --> 27:13:02,720
obiectul nostru model. Deci de la uh scikitlearn

35790
27:13:00,872 --> 27:13:05,832
sklearn

35791
27:13:02,720 --> 27:13:08,000
um model liniar uh modul de la asta

35792
27:13:05,832 --> 27:13:11,192
pachetul importăm regresia liniară

35793
27:13:08,000 --> 27:13:12,800
model și apoi facem um liniar

35794
27:13:11,192 --> 27:13:14,720
regresie.potrivire

35795
27:13:12,800 --> 27:13:17,512
și trecem în trăsăturile noastre și ale noastre

35796
27:13:14,720 --> 27:13:18,872
etichete și aici este din nou aici

35797
27:13:17,512 --> 27:13:21,440
că învățarea supravegheată este într-adevăr

35798
27:13:18,872 --> 27:13:23,600
intrând în joc pentru că trecem

35799
27:13:21,440 --> 27:13:24,872
în aceste etichete.

35800
27:13:23,600 --> 27:13:26,552
Acesta este cu adevărat ceea ce face ca acest lucru să funcționeze,

35801
27:13:24,872 --> 27:13:29,040
nu? Avem nevoie de acele etichete pentru a ajuta

35802
27:13:26,552 --> 27:13:32,000
ghidați modelul pentru a face acele actualizări.

35803
27:13:29,040 --> 27:13:35,960
Dacă vă amintiți, modelul este

35804
27:13:32,000 --> 27:13:35,960
ceva care arată așa.

35805
27:13:37,832 --> 27:13:41,912
Deci, asta a fost o grămadă de diferite

35806
27:13:40,160 --> 27:13:44,872
coeficienți

35807
27:13:41,912 --> 27:13:49,440
um ori caracteristicile,

35808
27:13:44,872 --> 27:13:51,832
oricat de multi avem. Hm, și deci acestea

35809
27:13:49,440 --> 27:13:56,000
etichetele iau cu adevărat locul

35810
27:13:51,832 --> 27:13:58,000
asta și ne ajută să facem

35811
27:13:56,000 --> 27:14:00,160
actualizări corecte ale acestora la acestea

35812
27:13:58,000 --> 27:14:05,680
coeficienți sau uneori îi numim

35813
27:14:00,160 --> 27:14:07,600
greutăți. Hm, aceste B 0, B1, B2. Hm, noi

35814
27:14:05,680 --> 27:14:09,760
afla care este cea optimă pentru a obține

35815
27:14:07,600 --> 27:14:13,680
cea mai potrivită, nu? Pentru a obține linia de

35816
27:14:09,760 --> 27:14:15,512
cel mai potrivit. Um asta este modelul

35817
27:14:13,680 --> 27:14:16,800
antrenament când numim asta ffit ffit

35818
27:14:15,512 --> 27:14:18,160
asta e cu adevărat ceea ce face în

35819
27:14:16,800 --> 27:14:20,400
fundalul este găsirea tuturor celor

35820
27:14:18,160 --> 27:14:21,912
coeficienții drept pentru a ajunge la

35821
27:14:20,400 --> 27:14:25,480
linia de cea mai bună potrivire care are cea mai mică

35822
27:14:21,912 --> 27:14:25,480
cantitatea de eroare.

35823
27:14:26,232 --> 27:14:31,440
Bine, sper că are sens.

35824
27:14:28,232 --> 27:14:33,912
E doar un mod potrivit pentru a ne antrena

35825
27:14:31,440 --> 27:14:36,232
modele. Și asta chiar va fi um

35826
27:14:33,912 --> 27:14:39,280
cazul pentru

35827
27:14:36,232 --> 27:14:42,000
cam fiecare model

35828
27:14:39,280 --> 27:14:43,912
ne antrenăm cu scikitlearn. Este

35829
27:14:42,000 --> 27:14:46,080
aproape va fi o potrivire. Trecem

35830
27:14:43,912 --> 27:14:49,400
în antrenamentul nostru uh caracteristici și noastre

35831
27:14:46,080 --> 27:14:49,400
etichete de antrenament.

35832
27:14:49,760 --> 27:14:54,960
Bine, deci am avut asta și asta a fost

35833
27:14:52,640 --> 27:14:57,360
vizualizarea aceluia în care aveam noi

35834
27:14:54,960 --> 27:14:59,192
punctele de testare cam împrăștiate și vedem

35835
27:14:57,360 --> 27:15:01,912
linia noastră cea mai potrivită este cea care

35836
27:14:59,192 --> 27:15:05,280
trece prin acolo cu acel minim

35837
27:15:01,912 --> 27:15:09,160
eroare. Acesta este tot scopul.

35838
27:15:05,280 --> 27:15:09,160
Predictor destul de decent.

35839
27:15:10,872 --> 27:15:15,040
Bine. Și apoi am vorbit despre

35840
27:15:13,192 --> 27:15:17,600
supramontare underfitting. Deci doar să

35841
27:15:15,040 --> 27:15:19,680
recapitulați această supraadaptare este conceptul de

35842
27:15:17,600 --> 27:15:21,600
modelul nostru practic memorându-ne

35843
27:15:19,680 --> 27:15:24,400
date de antrenament. Funcționează foarte bine

35844
27:15:21,600 --> 27:15:27,192
pe acel set de antrenament, dar nu este capabil

35845
27:15:24,400 --> 27:15:30,000
a generaliza în afara asta. Deci

35846
27:15:27,192 --> 27:15:33,040
funcţionează slab la setul de testare sau datele

35847
27:15:30,000 --> 27:15:36,160
că nu s-a mai văzut niciodată. Hm și

35848
27:15:33,040 --> 27:15:38,400
asta e supraadaptare. Deci motivul pentru care

35849
27:15:36,160 --> 27:15:42,000
se supraajustează este în general modelul este

35850
27:15:38,400 --> 27:15:44,800
prea complex și trebuie să fie

35851
27:15:42,000 --> 27:15:46,552
trebuie simplificat putin. Și unul dintre

35852
27:15:44,800 --> 27:15:48,800
lucrurile pe care le vom face astăzi sunt

35853
27:15:46,552 --> 27:15:51,760
vedem câteva moduri în care putem modifica

35854
27:15:48,800 --> 27:15:55,440
model de regresie liniară um dacă suntem

35855
27:15:51,760 --> 27:15:57,440
supramontare pentru a preveni supraadaptarea. Hm

35856
27:15:55,440 --> 27:16:00,000
așa că vor exista modalități de a gestiona

35857
27:15:57,440 --> 27:16:02,552
aceasta. Um și așa vom explora

35858
27:16:00,000 --> 27:16:04,160
unii dintre cei de azi.

35859
27:16:02,552 --> 27:16:06,160
uh underfitting este cam invers

35860
27:16:04,160 --> 27:16:07,760
de aceea. Amintiți-vă, acolo este modelul

35861
27:16:06,160 --> 27:16:09,912
nu învață suficient. Deci,

35862
27:16:07,760 --> 27:16:12,400
performanța este slabă chiar și la antrenament

35863
27:16:09,912 --> 27:16:16,000
date. Nu e bine cu datele de testare

35864
27:16:12,400 --> 27:16:18,080
fie. E un semn că modelul

35865
27:16:16,000 --> 27:16:20,320
este probabil prea simplu și poate noi

35866
27:16:18,080 --> 27:16:22,320
ar trebui să folosească ceva mai complex, cum ar fi

35867
27:16:20,320 --> 27:16:25,440
treci de la o regresie liniară poate să folosești

35868
27:16:22,320 --> 27:16:28,000
o regresie polomială. Um sau poate folosi

35869
27:16:25,440 --> 27:16:29,680
un model cu totul diferit.

35870
27:16:28,000 --> 27:16:31,832
um, dacă suntem nepotriviți, al nostru

35871
27:16:29,680 --> 27:16:36,160
performanța este slabă, este un semnal bun

35872
27:16:31,832 --> 27:16:37,832
ar trebui să încercăm altceva. Hm

35873
27:16:36,160 --> 27:16:41,192
bine,

35874
27:16:37,832 --> 27:16:43,120
așa că am vorbit despre acestea

35875
27:16:41,192 --> 27:16:45,600
și unul dintre lucrurile pe care le-am vorbit

35876
27:16:43,120 --> 27:16:47,280
despre a fost evaluări. Dacă voi băieți

35877
27:16:45,600 --> 27:16:50,552
amintiți-vă, am avut diferite valori care

35878
27:16:47,280 --> 27:16:52,872
am putea calcula pentru a obține un indicator al cum

35879
27:16:50,552 --> 27:16:55,360
bine modelul nostru este de fapt performant.

35880
27:16:52,872 --> 27:16:57,832
Unul dintre aceștia a fost MSE, care este acesta

35881
27:16:55,360 --> 27:16:59,912
funcția de eroare medie pătrată. Hm, deci noi

35882
27:16:57,832 --> 27:17:04,800
a făcut acest exemplu în timpul orei ultima dată

35883
27:16:59,912 --> 27:17:07,912
Luni, unde am putut

35884
27:17:04,800 --> 27:17:09,912
generează eroarea pătratică medie. Asta e

35885
27:17:07,912 --> 27:17:12,080
una dintre valorile noastre. Și putem vedea ce

35886
27:17:09,912 --> 27:17:13,760
eroarea pătratică medie este pe

35887
27:17:12,080 --> 27:17:17,192
set de antrenament și vezi ce este pe

35888
27:17:13,760 --> 27:17:18,960
test stabilit de um tocmai ce trece în um

35889
27:17:17,192 --> 27:17:21,512
previziunile de antrenament și antrenamentul nostru

35890
27:17:18,960 --> 27:17:23,600
etichetele, predicțiile noastre de testare și

35891
27:17:21,512 --> 27:17:25,680
etichete de testare. trece-le în acest mijloc

35892
27:17:23,600 --> 27:17:27,832
funcția de eroare pătrat și calculează

35893
27:17:25,680 --> 27:17:31,040
MSE și asta este un ajutor

35894
27:17:27,832 --> 27:17:35,912
funcția din metrica scikitlearn

35895
27:17:31,040 --> 27:17:38,800
um pachet um sau modul ar trebui să spun și

35896
27:17:35,912 --> 27:17:40,960
vom folosi asta destul de mult pentru a face

35897
27:17:38,800 --> 27:17:42,720
știi evaluarea de mai ales a

35898
27:17:40,960 --> 27:17:46,080
regresie dreapta medie pătrată eroare este

35899
27:17:42,720 --> 27:17:48,400
drăguță este probabil cea mai comună uh

35900
27:17:46,080 --> 27:17:50,232
metrica de performanță putem avea și dacă

35901
27:17:48,400 --> 27:17:52,552
Vă amintiți ce face cu adevărat

35902
27:17:50,232 --> 27:17:54,000
este măsurarea acestor distanțe

35903
27:17:52,552 --> 27:17:56,640
eroarea pătrată este un fel ca

35904
27:17:54,000 --> 27:17:59,912
distanta medie de la noi

35905
27:17:56,640 --> 27:18:02,160
indică um real la

35906
27:17:59,912 --> 27:18:05,360
predicții care sunt predicțiile

35907
27:18:02,160 --> 27:18:07,680
toate pe această linie. Um deci parcă

35908
27:18:05,360 --> 27:18:10,320
măsurând în medie câtă eroare

35909
27:18:07,680 --> 27:18:13,832
avem in medie nu? Hm, și

35910
27:18:10,320 --> 27:18:15,760
ideea este cu cât mai aproape de zero, cu atât mai bine.

35911
27:18:13,832 --> 27:18:18,000
În general, înseamnă că distanța

35912
27:18:15,760 --> 27:18:20,320
de la predicția noastră până la punctele noastre este

35913
27:18:18,000 --> 27:18:23,192
destul de jos. Cu cât este mai aproape de zero.

35914
27:18:20,320 --> 27:18:25,512
Hm, ceea ce este destul de dezirabil.

35915
27:18:23,192 --> 27:18:28,000
Deci un MSE scăzut este cam ceea ce suntem

35916
27:18:25,512 --> 27:18:32,000
cautand. Um, mai aproape de zero

35917
27:18:28,000 --> 27:18:36,640
mai bine. Și așa, um, dacă un model are dacă

35918
27:18:32,000 --> 27:18:38,720
un model are un MSE mai mic decât

35919
27:18:36,640 --> 27:18:42,760
alta, este o performanță mai bună

35920
27:18:38,720 --> 27:18:42,760
model, nu? Are mai puține erori.

35921
27:18:42,800 --> 27:18:48,960
Bine. Și apoi ne-am uitat și la R r

35922
27:18:45,760 --> 27:18:52,960
pătrat sau uneori cunoscut ca R2 um

35923
27:18:48,960 --> 27:18:55,360
scor. Aceasta este o altă măsurătoare pe care noi

35924
27:18:52,960 --> 27:18:56,872
ar putea folosi că măsoară

35925
27:18:55,360 --> 27:19:01,280
variabilitate

35926
27:18:56,872 --> 27:19:03,760
um de uh previziunile și dacă noastre

35927
27:19:01,280 --> 27:19:07,192
modelul surprinde acea variabilitate

35928
27:19:03,760 --> 27:19:10,080
ei bine um și deci R pătrat are o gamă de

35929
27:19:07,192 --> 27:19:12,872
0 la unu este mai bine, adică

35930
27:19:10,080 --> 27:19:16,400
modelul surprinde schimbările în în

35931
27:19:12,872 --> 27:19:18,960
ieșirea um um predicțiile noastre

35932
27:19:16,400 --> 27:19:22,000
urmează aceleași schimbări

35933
27:19:18,960 --> 27:19:25,192
deci sunt destul de aproape, atât de aproape

35934
27:19:22,000 --> 27:19:27,192
unul ar fi un scor mai bun. Deci avem

35935
27:19:25,192 --> 27:19:30,800
genul ăsta de metrici. Deci ca pe asta

35936
27:19:27,192 --> 27:19:32,720
date um acest lucru ar arăta că

35937
27:19:30,800 --> 27:19:34,640
acest model nu era potrivit

35938
27:19:32,720 --> 27:19:38,400
deoarece aceasta

35939
27:19:34,640 --> 27:19:40,000
înseamnă că acest MSE a fost rău și acest MSE a fost

35940
27:19:38,400 --> 27:19:42,872
rău.

35941
27:19:40,000 --> 27:19:47,120
Hm și ce ar trebui să ne gândim despre acestea

35942
27:19:42,872 --> 27:19:49,192
unitățile a ceea ce sunt etichetele noastre. um

35943
27:19:47,120 --> 27:19:51,512
mai ales dacă luăm rădăcina pătrată a

35944
27:19:49,192 --> 27:19:54,552
acesta este RMSSE care a fost o altă măsurătoare

35945
27:19:51,512 --> 27:19:58,000
am avut um rădăcina pătrată a acesteia este

35946
27:19:54,552 --> 27:20:00,960
de fapt în unitățile exacte pe care noi um

35947
27:19:58,000 --> 27:20:04,960
au pentru etichetele noastre. Deci în asta

35948
27:20:00,960 --> 27:20:07,832
exemplu, acesta a fost um, acesta a fost

35949
27:20:04,960 --> 27:20:11,440
unități sau vânzări față de televizor

35950
27:20:07,832 --> 27:20:13,512
produse, nu? Um și așa ar fi

35951
27:20:11,440 --> 27:20:16,160
indică faptul că, în medie, dacă luăm

35952
27:20:13,512 --> 27:20:19,192
rădăcina pătrată a acestui um

35953
27:20:16,160 --> 27:20:20,720
iar rădăcina pătrată a acestui um avem

35954
27:20:19,192 --> 27:20:24,232
uh

35955
27:20:20,720 --> 27:20:26,000
Suntem în medie aproximativ 11 unități de vânzare

35956
27:20:24,232 --> 27:20:27,912
off pătrat. Deci dacă luăm pătratul

35957
27:20:26,000 --> 27:20:31,280
rădăcina asta este undeva în jurul valorii de 3

35958
27:20:27,912 --> 27:20:35,120
la patru um undeva între trei

35959
27:20:31,280 --> 27:20:37,760
și patru unități oprite. Și asta este la fel.

35960
27:20:35,120 --> 27:20:39,912
Hm, și pentru că ambele sunt încă

35961
27:20:37,760 --> 27:20:42,640
nu aproape de zero. Um, asta ar fi

35962
27:20:39,912 --> 27:20:44,320
sub potrivire. Și asta arată și asta.

35963
27:20:42,640 --> 27:20:47,040
Acesta nu este atât de aproape de unul. Este

35964
27:20:44,320 --> 27:20:49,360
decent, dar nu e atât de aproape

35965
27:20:47,040 --> 27:20:52,480
la unul. Deci, am spune și performanță

35966
27:20:49,360 --> 27:20:53,832
este slab atât la antrenament, cât și la seturile de testare.

35967
27:20:52,480 --> 27:20:58,832
Acesta este indicatorul cheie al

35968
27:20:53,832 --> 27:20:58,832
submontare. E slab la ambele.

35969
27:21:01,120 --> 27:21:05,912
Da. Exact. MSE ridicat se corelează cu

35970
27:21:03,360 --> 27:21:10,000
submontare. Da. Da. Și ce este

35971
27:21:05,912 --> 27:21:13,280
cheia este că este MSE mare pe ambele

35972
27:21:10,000 --> 27:21:15,600
antrenament și seturile de testare.

35973
27:21:13,280 --> 27:21:17,832
Dacă aveți un MSE mare pe setul dvs. de testare

35974
27:21:15,600 --> 27:21:20,720
dar un MSE scăzut pe setul tău de antrenament,

35975
27:21:17,832 --> 27:21:22,872
e supraadaptat, nu? Unde este

35976
27:21:20,720 --> 27:21:24,960
negeneralizand din setul de antrenament

35977
27:21:22,872 --> 27:21:27,440
la datele de testare pe care nu le-a văzut

35978
27:21:24,960 --> 27:21:32,192
înainte. Asta e supraadaptare. Deci cheia

35979
27:21:27,440 --> 27:21:32,192
este MSE mare pe ambele seturi.

35980
27:21:33,040 --> 27:21:38,640
În regulă. Deci am vorbit despre asta. Hm

35981
27:21:35,600 --> 27:21:42,160
am făcut regresia polomială data trecută. Deci

35982
27:21:38,640 --> 27:21:46,640
asta făcea eu

35983
27:21:42,160 --> 27:21:48,640
asta făcea un grafic curbat

35984
27:21:46,640 --> 27:21:49,832
transformând trăsăturile în polomial

35985
27:21:48,640 --> 27:21:51,192
caracteristici și apoi făcând liniar

35986
27:21:49,832 --> 27:21:54,480
regresie cu asta. Deci voi băieți

35987
27:21:51,192 --> 27:21:58,480
aminteste-ti de luni am facut asta unde

35988
27:21:54,480 --> 27:22:00,480
Ne-am luat trăsăturile și ne-am transformat

35989
27:21:58,480 --> 27:22:02,872
ei conform acestor caracteristici polomiale

35990
27:22:00,480 --> 27:22:04,640
de la scikitlearn. Deci putem merge pe toate

35991
27:22:02,872 --> 27:22:06,232
până la grad, indiferent de gradul nostru

35992
27:22:04,640 --> 27:22:07,512
vreau. Deci am pus patru aici, dar

35993
27:22:06,232 --> 27:22:10,400
nu e nimic special la patru

35994
27:22:07,512 --> 27:22:12,400
într-adevăr. Acesta este doar un test. Hm

35995
27:22:10,400 --> 27:22:14,960
și generăm polomiul

35996
27:22:12,400 --> 27:22:17,192
caracteristici și putem potrivi un liniar

35997
27:22:14,960 --> 27:22:20,480
regresie asupra acelor caracteristici polomiale

35998
27:22:17,192 --> 27:22:23,040
și obținem un model puțin mai bun,

35999
27:22:20,480 --> 27:22:25,832
nu? Um, se potrivește puțin cu datele

36000
27:22:23,040 --> 27:22:28,320
mai bine decât o linie dreaptă. acest

36001
27:22:25,832 --> 27:22:30,080
linie curbată cu polomiul

36002
27:22:28,320 --> 27:22:31,912
caracteristici um funcționează puțin mai bine

36003
27:22:30,080 --> 27:22:35,280
și am putut vedea asta cu dreptul MSE

36004
27:22:31,912 --> 27:22:37,600
am putea evalua MSE-ul acestui um și

36005
27:22:35,280 --> 27:22:39,040
ar fi mai jos

36006
27:22:37,600 --> 27:22:42,232
ar fi mai jos decât linia curbă

36007
27:22:39,040 --> 27:22:44,080
și asta e ceva ce am putea face noi

36008
27:22:42,232 --> 27:22:45,600
ar trebui doar să treacă aceste teste

36009
27:22:44,080 --> 27:22:48,320
predicţii antrenament predicţii şi

36010
27:22:45,600 --> 27:22:50,080
apoi etichetele de testare și formarea

36011
27:22:48,320 --> 27:22:51,912
etichetează și trece la pătratul mediu

36012
27:22:50,080 --> 27:22:54,960
funcția de eroare și am putea calcula asta

36013
27:22:51,912 --> 27:22:54,960
corect nu ar fi greu

36014
27:22:56,872 --> 27:23:01,912
În regulă. Și apoi, în sfârșit, unde suntem

36015
27:22:58,400 --> 27:23:03,440
a lăsat, știi, este pe noi

36016
27:23:01,912 --> 27:23:05,512
metrici de performanță. Deci, am vorbit despre

36017
27:23:03,440 --> 27:23:08,552
eroare pătrată medie. Asta e media

36018
27:23:05,512 --> 27:23:11,192
distanta de la etichete la noi

36019
27:23:08,552 --> 27:23:13,360
previziuni. Hm, și luăm pătratul

36020
27:23:11,192 --> 27:23:15,120
rădăcina asta. Este practic

36021
27:23:13,360 --> 27:23:17,512
măsurând același lucru, dar este

36022
27:23:15,120 --> 27:23:19,040
rădăcina pătrată a acestuia este um mai mult

36023
27:23:17,512 --> 27:23:21,832
interpretabil pentru că este în același

36024
27:23:19,040 --> 27:23:25,360
unități ca etichetă noastră.

36025
27:23:21,832 --> 27:23:27,280
um eroare absolută medie este este media

36026
27:23:25,360 --> 27:23:29,760
distanța valorii absolute. Deci este

36027
27:23:27,280 --> 27:23:32,480
nu formula distanței la pătrat ca a

36028
27:23:29,760 --> 27:23:34,960
distanța uklidiană dar este un absolut

36029
27:23:32,480 --> 27:23:36,552
valoare. Deci este un pic mai puțin

36030
27:23:34,960 --> 27:23:41,040
sensibile la valori aberante. Ei nu primesc

36031
27:23:36,552 --> 27:23:43,912
mărită la fel de mult. Hm, dar nu este

36032
27:23:41,040 --> 27:23:46,000
folosit de obicei la fel de mult ca un pătrat mediu

36033
27:23:43,912 --> 27:23:48,400
eroarea ar fi cu regresie. um noi

36034
27:23:46,000 --> 27:23:51,440
am vorbit despre ultima dată pentru că um

36035
27:23:48,400 --> 27:23:53,680
formula distanței sau acea distanță este

36036
27:23:51,440 --> 27:23:57,440
de fapt ce este folosit pentru a antrena modelul.

36037
27:23:53,680 --> 27:24:01,480
Deci este o potrivire mai naturala pentru a

36038
27:23:57,440 --> 27:24:01,480
metrica de performanță pentru aceasta.

36039
27:24:02,480 --> 27:24:05,440
În regulă. Și apoi am avut R pătratul. Noi

36040
27:24:03,760 --> 27:24:08,320
tocmai am vorbit despre asta mai aproape de zero

36041
27:24:05,440 --> 27:24:10,552
ar fi mai rău. Mai aproape de unul ar fi

36042
27:24:08,320 --> 27:24:13,600
fii mai bun. Asta înseamnă că modelul

36043
27:24:10,552 --> 27:24:16,800
explică um toată variabilitatea în

36044
27:24:13,600 --> 27:24:21,192
în previziuni. Uh le surprinde pe acelea

36045
27:24:16,800 --> 27:24:26,400
predicțiile sunt aproape de etichete

36046
27:24:21,192 --> 27:24:29,600
um foarte bine. Deci unul ar fi mai bine.

36047
27:24:26,400 --> 27:24:31,680
Mai aproape de unul ar fi mai bine.

36048
27:24:29,600 --> 27:24:33,912
În regulă. Deci de aici am plecat.

36049
27:24:31,680 --> 27:24:36,160
O să luăm de acolo cu

36050
27:24:33,912 --> 27:24:38,160
validare încrucișată. De fapt, am făcut-o

36051
27:24:36,160 --> 27:24:40,480
am văzut deja o metodă de cruce

36052
27:24:38,160 --> 27:24:41,912
validare. Deci, vom studia

36053
27:24:40,480 --> 27:24:44,552
o să recapitulăm într-un fel și

36054
27:24:41,912 --> 27:24:48,232
și apoi vorbim despre validarea încrucișată

36055
27:24:44,552 --> 27:24:51,040
în general um și uită-te la unele mai multe

36056
27:24:48,232 --> 27:24:53,680
tehnici sofisticate ale ei um vin

36057
27:24:51,040 --> 27:24:56,320
mai departe. Dar înainte să fac asta, orice

36058
27:24:53,680 --> 27:24:59,512
întrebări despre orice am acoperit

36059
27:24:56,320 --> 27:25:02,232
până în acest punct în recapitulare sau

36060
27:24:59,512 --> 27:25:04,720
ceva de luni? Orice întrebări despre

36061
27:25:02,232 --> 27:25:07,680
asta?

36062
27:25:04,720 --> 27:25:12,320
În regulă. Deci hai să vorbim despre cruce

36063
27:25:07,680 --> 27:25:16,400
validare. Hm acum acest termen cruce

36064
27:25:12,320 --> 27:25:19,512
validarea se referă la o tehnică care

36065
27:25:16,400 --> 27:25:23,280
evaluează performanța. Și ce face

36066
27:25:19,512 --> 27:25:25,512
este împarte datele noastre în esență

36067
27:25:23,280 --> 27:25:27,680
um seturi de antrenament și de testare pe care le avem

36068
27:25:25,512 --> 27:25:30,480
cam văzut deja. Și atunci suntem

36069
27:25:27,680 --> 27:25:32,800
capabil să antreneze un model cu privire la antrenament

36070
27:25:30,480 --> 27:25:34,000
setați, evaluați-l pe setul de testare și

36071
27:25:32,800 --> 27:25:36,552
de acolo obținem

36072
27:25:34,000 --> 27:25:38,552
validarea încrucișată a numelui pentru că suntem

36073
27:25:36,552 --> 27:25:41,760
trecerea peste modelul nostru dintr-un lot

36074
27:25:38,552 --> 27:25:43,600
de date folosite pentru a-l antrena către altul

36075
27:25:41,760 --> 27:25:47,040
set de date utilizate pentru validarea acestora

36076
27:25:43,600 --> 27:25:48,960
previziuni. Um, și există de fapt

36077
27:25:47,040 --> 27:25:50,480
moduri diferite de a face validarea încrucișată.

36078
27:25:48,960 --> 27:25:52,320
Deci validarea încrucișată este un pic

36079
27:25:50,480 --> 27:25:54,232
termen umbrelă pentru mai multe moduri de a face

36080
27:25:52,320 --> 27:25:56,720
că. Am văzut deja o modalitate de

36081
27:25:54,232 --> 27:26:01,192
făcând asta pe care o voi derula

36082
27:25:56,720 --> 27:26:03,680
până la este cunoscută sub numele de cruce

36083
27:26:01,192 --> 27:26:06,400
validare. Deci asta am fost

36084
27:26:03,680 --> 27:26:10,160
făcând până acum. Deci asta este doar um

36085
27:26:06,400 --> 27:26:13,360
generând un tren și un set de testare

36086
27:26:10,160 --> 27:26:16,480
antrenează-te.

36087
27:26:13,360 --> 27:26:19,760
Hm, asta e ceea ce este cunoscut sub numele de

36088
27:26:16,480 --> 27:26:21,600
menține metoda de validare încrucișată. Hm și

36089
27:26:19,760 --> 27:26:24,080
și asta este exact ceea ce am fost

36090
27:26:21,600 --> 27:26:26,720
faceți până acum, care este vă împărțiți

36091
27:26:24,080 --> 27:26:28,320
date într-un anumit tip de împărțire, de obicei

36092
27:26:26,720 --> 27:26:31,360
7030,

36093
27:26:28,320 --> 27:26:34,400
un tren și un test

36094
27:26:31,360 --> 27:26:37,040
și apoi um um antrena modelul dvs. despre asta

36095
27:26:34,400 --> 27:26:39,912
secțiunea de date și apoi aplicați-o

36096
27:26:37,040 --> 27:26:41,680
asta pentru a evalua performanța. Corect? Deci

36097
27:26:39,912 --> 27:26:46,640
asta e ceea ce se numește hold

36098
27:26:41,680 --> 27:26:49,040
metoda out. Uh, e uh, știi

36099
27:26:46,640 --> 27:26:53,360
relativ simplu. Este destul de rapid să

36100
27:26:49,040 --> 27:26:56,160
face. Hm, dar există modalități mai robuste

36101
27:26:53,360 --> 27:26:59,280
să încercăm să ne împărțim puțin datele

36102
27:26:56,160 --> 27:27:01,360
ceva mai uniform. În loc de doar

36103
27:26:59,280 --> 27:27:04,800
având o divizare, chiar putem face

36104
27:27:01,360 --> 27:27:06,232
multe împărțiri, care este ideea um the

36105
27:27:04,800 --> 27:27:09,440
următorul tip de validare încrucișată o voi

36106
27:27:06,232 --> 27:27:11,040
acoperi. Dar metoda rezistă este una care

36107
27:27:09,440 --> 27:27:13,192
noi deja am studiat. Este cel mai mult

36108
27:27:11,040 --> 27:27:16,720
tip de bază de validare încrucișată pe care îl puteți

36109
27:27:13,192 --> 27:27:18,320
au. Așa că ține, asta este cel mai mult

36110
27:27:16,720 --> 27:27:21,360
de bază

36111
27:27:18,320 --> 27:27:26,480
și noi am fost deja am fost deja

36112
27:27:21,360 --> 27:27:28,160
am lucrat cu acest tip. Bine.

36113
27:27:26,480 --> 27:27:31,680
Deci am văzut deja rezistând

36114
27:27:28,160 --> 27:27:33,440
metoda. Lasă-mă să-ți explic mai multe

36115
27:27:31,680 --> 27:27:36,232
metodă sofisticată un pic mai mult

36116
27:27:33,440 --> 27:27:39,600
avansat de o validare încrucișată um care

36117
27:27:36,232 --> 27:27:42,320
este cunoscută ca validare încrucișată Kfold. Deci

36118
27:27:39,600 --> 27:27:45,120
asta va fi un pic mai mult

36119
27:27:42,320 --> 27:27:47,680
avansat de o tehnică, dar acesta este

36120
27:27:45,120 --> 27:27:49,192
ideea de kfold este că îți iei datele

36121
27:27:47,680 --> 27:27:54,400
set

36122
27:27:49,192 --> 27:27:57,360
și îl împărțiți în k număr de ce

36123
27:27:54,400 --> 27:27:59,192
se numesc despicaturi sau pliuri. Deci iei

36124
27:27:57,360 --> 27:28:02,320
datele tale și să zicem că a fost let's

36125
27:27:59,192 --> 27:28:05,320
spunem k este 5. Deci avem cinci împărțiri

36126
27:28:02,320 --> 27:28:05,320
aici.

36127
27:28:05,512 --> 27:28:13,192
Bine. Deci, să presupunem că k este egal cu 5. avem

36128
27:28:08,160 --> 27:28:15,440
cinci despărțiri. Deci ce vom face

36129
27:28:13,192 --> 27:28:19,360
o să ne antrenăm

36130
27:28:15,440 --> 27:28:22,400
modelul nostru pe K minus unul dintre acele pliuri.

36131
27:28:19,360 --> 27:28:24,872
Deci, dacă K avea cinci, aveam cinci împărțiri.

36132
27:28:22,400 --> 27:28:28,232
Ne vom lua modelul și ne vom antrena

36133
27:28:24,872 --> 27:28:32,400
pe patru din cinci dintre acestea uh

36134
27:28:28,232 --> 27:28:36,512
despica. Deci, să spunem că sunt acești patru.

36135
27:28:32,400 --> 27:28:36,512
Îl antrenăm pe aceste patru.

36136
27:28:36,960 --> 27:28:43,192
Bine. Și atunci ceea ce facem este acela

36137
27:28:39,912 --> 27:28:45,600
împărțire care a mai rămas vom face

36138
27:28:43,192 --> 27:28:50,160
testați modelul nostru împotriva acelei diviziuni. Deci

36139
27:28:45,600 --> 27:28:52,800
vom testa aici.

36140
27:28:50,160 --> 27:28:54,232
Bine. Acum, asta sună foarte asemănător cu

36141
27:28:52,800 --> 27:28:56,720
metoda hold out în care facem a

36142
27:28:54,232 --> 27:28:58,640
Proba trenului împărțit, dar este puțin

36143
27:28:56,720 --> 27:29:00,640
această validare încrucișată kful este puțin

36144
27:28:58,640 --> 27:29:03,512
ceva mai sofisticat pentru că repetăm

36145
27:29:00,640 --> 27:29:06,000
acest proces pe care tocmai l-am menționat

36146
27:29:03,512 --> 27:29:08,720
și peste pentru toate combinațiile de

36147
27:29:06,000 --> 27:29:13,192
despica. Deci, ce vom face, asta este

36148
27:29:08,720 --> 27:29:16,480
doar o încercare că o vom face din nou,

36149
27:29:13,192 --> 27:29:18,320
dar de data asta vom alege patru

36150
27:29:16,480 --> 27:29:21,440
despărțiri diferite.

36151
27:29:18,320 --> 27:29:24,232
Deci, de data aceasta am putea alege,

36152
27:29:21,440 --> 27:29:27,832
lasă-mă să fac albastru. De data asta s-ar putea să alegem

36153
27:29:24,232 --> 27:29:29,832
acesta, acesta,

36154
27:29:27,832 --> 27:29:32,080
um,

36155
27:29:29,832 --> 27:29:35,360
acesta,

36156
27:29:32,080 --> 27:29:37,600
iar acesta.

36157
27:29:35,360 --> 27:29:39,832
Și apoi cei patru îi vom antrena pe noștri

36158
27:29:37,600 --> 27:29:42,872
date despre. Și apoi vom testa împotriva

36159
27:29:39,832 --> 27:29:45,680
acesta. Bine? Și vom face, vom face

36160
27:29:42,872 --> 27:29:52,440
repeta asta

36161
27:29:45,680 --> 27:29:52,440
repetați pentru toate combinațiile de pliuri.

36162
27:29:55,760 --> 27:29:59,832
Bine. Așa că vom repeta asta. Aşa

36163
27:29:58,080 --> 27:30:02,160
în esență, ceea ce facem este să ne rotim

36164
27:29:59,832 --> 27:30:03,912
prin. De fiecare dată când ne întoarcem

36165
27:30:02,160 --> 27:30:07,600
unul dintre pliuri va fi lăsat afară

36166
27:30:03,912 --> 27:30:09,440
ca set de testare. Acum asta e un pic

36167
27:30:07,600 --> 27:30:12,720
mai robust decât un simplu test de tren

36168
27:30:09,440 --> 27:30:15,600
împărțit, nu? pentru că expunem

36169
27:30:12,720 --> 27:30:17,280
modelul nostru la mai multe date din în

36170
27:30:15,600 --> 27:30:20,080
fac asta, nu? Pentru că mergem

36171
27:30:17,280 --> 27:30:22,232
pentru a o împărți uniform în cinci sau 10

36172
27:30:20,080 --> 27:30:25,832
despica. Acestea sunt destul de comune um

36173
27:30:22,232 --> 27:30:27,600
numărul de pliuri de utilizat. 10 sau cinci. Hm

36174
27:30:25,832 --> 27:30:32,320
acestea sunt cele pe care le am cel mai frecvent

36175
27:30:27,600 --> 27:30:33,912
văzut. Hm, dar o vom face prin rotire

36176
27:30:32,320 --> 27:30:36,320
prin care se folosesc pliuri pentru

36177
27:30:33,912 --> 27:30:39,280
antrenament, care fiind omise. um

36178
27:30:36,320 --> 27:30:41,040
ne expunem modelul nostru la mai multe

36179
27:30:39,280 --> 27:30:44,320
datele în acest fel decât doar a face a

36180
27:30:41,040 --> 27:30:47,192
divizarea testului unui singur tren. Corect? Deci acum

36181
27:30:44,320 --> 27:30:50,320
ce facem cu rezultatele este

36182
27:30:47,192 --> 27:30:52,480
de fiecare dată când facem asta, generăm um

36183
27:30:50,320 --> 27:30:54,400
un MSE să spunem sau un fel de

36184
27:30:52,480 --> 27:30:57,680
metrica de performanță. Deci să spunem noi

36185
27:30:54,400 --> 27:31:00,720
generează un MSE de la acest tip,

36186
27:30:57,680 --> 27:31:04,400
generăm un MSE din această versiune și

36187
27:31:00,720 --> 27:31:07,360
generăm un MSE pentru toate combo-urile.

36188
27:31:04,400 --> 27:31:10,320
fiecare combo generăm MSE și apoi ce

36189
27:31:07,360 --> 27:31:13,680
facem este medie

36190
27:31:10,320 --> 27:31:16,320
metricile

36191
27:31:13,680 --> 27:31:19,192
sau în acest caz uh dacă folosim MSE noi

36192
27:31:16,320 --> 27:31:21,280
le-ar media pe cei împreună. Deci fiecare

36193
27:31:19,192 --> 27:31:23,120
timp facem o combinatie fold si noi

36194
27:31:21,280 --> 27:31:25,192
păstrați patru dintre ei pentru antrenament, unul pentru

36195
27:31:23,120 --> 27:31:27,440
testăm și ne rotim prin toate acestea

36196
27:31:25,192 --> 27:31:30,552
combinații, vom genera

36197
27:31:27,440 --> 27:31:32,160
un MSE pentru fiecare combinație

36198
27:31:30,552 --> 27:31:36,960
atunci vom face doar o medie a acestora

36199
27:31:32,160 --> 27:31:40,552
MSE trebuie să obțină o finală. Deci MSE final

36200
27:31:36,960 --> 27:31:43,680
de cruce val al acestui kffold.

36201
27:31:40,552 --> 27:31:46,960
Deci metrica finală

36202
27:31:43,680 --> 27:31:48,720
este doar media uh

36203
27:31:46,960 --> 27:31:52,320
performanță pe toate pliurile

36204
27:31:48,720 --> 27:31:54,232
combinatii. Bine. Deci finalul nostru MSE, noi

36205
27:31:52,320 --> 27:31:56,800
doar media tuturor acelor MSE din toate

36206
27:31:54,232 --> 27:31:58,720
combinațiile noastre.

36207
27:31:56,800 --> 27:32:01,280
Bine.

36208
27:31:58,720 --> 27:32:04,640
Acum, care este avantajul de a face asta?

36209
27:32:01,280 --> 27:32:06,872
Este mult mai robustă ca o estimare a

36210
27:32:04,640 --> 27:32:09,192
a performanței modelului

36211
27:32:06,872 --> 27:32:11,600
pentru că o expunem tuturor

36212
27:32:09,192 --> 27:32:12,960
practic toate datele noastre, nu? Suntem

36213
27:32:11,600 --> 27:32:16,000
a avea o idee a modului în care funcționează

36214
27:32:12,960 --> 27:32:18,000
peste toate aceste pliuri diferite. Hm

36215
27:32:16,000 --> 27:32:20,400
mai degrabă decât să faci un singur tren

36216
27:32:18,000 --> 27:32:23,040
diviziunea de testare, care este puțin de bază,

36217
27:32:20,400 --> 27:32:26,160
funcționează, dar e puțin de bază. Um asa

36218
27:32:23,040 --> 27:32:28,000
aceasta este o estimare mai robustă a

36219
27:32:26,160 --> 27:32:30,320
performanta.

36220
27:32:28,000 --> 27:32:32,400
Acum, care este dezavantajul să faci asta

36221
27:32:30,320 --> 27:32:34,320
este că este mai intens. Deci, dacă tu

36222
27:32:32,400 --> 27:32:36,000
au o mulțime de date, asta va fi

36223
27:32:34,320 --> 27:32:37,512
destul de scump de făcut pentru că ești

36224
27:32:36,000 --> 27:32:39,040
va trebui mai ales tu ai o

36225
27:32:37,512 --> 27:32:41,512
număr mare de pliuri, nu? Tu esti

36226
27:32:39,040 --> 27:32:43,280
va trebui să vă împărțiți datele în k

36227
27:32:41,512 --> 27:32:45,832
număr de pliuri și vei avea

36228
27:32:43,280 --> 27:32:47,832
să facă asta din nou și din nou. Hm, și

36229
27:32:45,832 --> 27:32:49,680
dacă este un set mare de date, ar putea dura

36230
27:32:47,832 --> 27:32:52,480
modelul tău mult timp să te antrenezi. Sale

36231
27:32:49,680 --> 27:32:55,120
va fi un pic mai mult uh

36232
27:32:52,480 --> 27:32:57,440
intens computațional decât dacă am fi doar

36233
27:32:55,120 --> 27:32:59,680
a făcut un test de tren.

36234
27:32:57,440 --> 27:33:02,160
Bine, tocmai am făcut un single ca 7030

36235
27:32:59,680 --> 27:33:04,640
despicat. Facem asta o singură dată. Doar noi

36236
27:33:02,160 --> 27:33:08,232
antrenează modelul o dată, nu? Îl antrenăm

36237
27:33:04,640 --> 27:33:11,280
pe 70, aplicați-l la datele de testare de 30%.

36238
27:33:08,232 --> 27:33:14,080
și evaluează performanța în acest fel. um,

36239
27:33:11,280 --> 27:33:16,080
așa că folosim cu adevărat doar modelul și

36240
27:33:14,080 --> 27:33:19,040
antrenând modelul o dată, dar în asta

36241
27:33:16,080 --> 27:33:23,040
kfold, o vom face um, tu

36242
27:33:19,040 --> 27:33:24,720
știi, de k de ori în esență

36243
27:33:23,040 --> 27:33:27,040
sau ar trebui să spun unul pentru fiecare

36244
27:33:24,720 --> 27:33:30,832
combinație prin care trebuie să lucrăm

36245
27:33:27,040 --> 27:33:30,832
dintre toate pliurile.

36246
27:33:32,800 --> 27:33:38,640
Bine.

36247
27:33:35,440 --> 27:33:41,760
În regulă. Are sens? Orice oricare

36248
27:33:38,640 --> 27:33:42,480
întrebări despre validarea încrucișată Kfold? Deci

36249
27:33:41,760 --> 27:33:42,552
K K K K K K K K K K K K K K K K K K K K

36250
27:33:42,480 --> 27:33:45,760
K K K K K K K K K K K K K K K K K K K K

36251
27:33:42,552 --> 27:33:48,640
K este un număr important aici. Ea

36252
27:33:45,760 --> 27:33:50,800
este câte pliuri, câte despărțiri fac

36253
27:33:48,640 --> 27:33:54,400
ai? O valoare tipică pentru K merge

36254
27:33:50,800 --> 27:33:57,192
a fi undeva ca cinci sau zece.

36255
27:33:54,400 --> 27:34:00,832
Deci 10 ori cinci ori. Acestea sunt

36256
27:33:57,192 --> 27:34:00,832
destul de standard

36257
27:34:01,512 --> 27:34:05,640
din ce din ce am vazut.

36258
27:34:05,760 --> 27:34:09,440
Dar are sens conceptul?

36259
27:34:07,512 --> 27:34:11,360
sau există întrebări despre el în

36260
27:34:09,440 --> 27:34:13,360
în termeni de um, vei pleca mereu

36261
27:34:11,360 --> 27:34:15,760
unul pliabil. Îl vei împărți

36262
27:34:13,360 --> 27:34:18,160
până în K număr de pliuri. Pleacă mereu

36263
27:34:15,760 --> 27:34:19,912
unul afară. Antrenează-te pe restul.

36264
27:34:18,160 --> 27:34:22,000
Evaluează-l pe cel care este lăsat afară

36265
27:34:19,912 --> 27:34:23,040
și apoi rotiți-le prin. Şi

36266
27:34:22,000 --> 27:34:25,040
vei face asta pentru fiecare

36267
27:34:23,040 --> 27:34:28,040
combinație și medie toate acestea

36268
27:34:25,040 --> 27:34:28,040
metrici.

36269
27:34:32,080 --> 27:34:36,232
Și apropo, va exista o

36270
27:34:33,832 --> 27:34:38,872
funcție ușoară în scikitlearn care va

36271
27:34:36,232 --> 27:34:41,192
fă asta pentru noi. Deci gestionând toate acestea

36272
27:34:38,872 --> 27:34:43,512
combinațiile vor fi foarte ușoare. Este

36273
27:34:41,192 --> 27:34:46,480
de fapt, doar încorporat în scikitlearn. Deci

36274
27:34:43,512 --> 27:34:48,872
nu trebuie, nu trebuie să facem

36275
27:34:46,480 --> 27:34:50,640
asta totul cu mana. Bine, asta va fi în

36276
27:34:48,872 --> 27:34:53,280
scikitlearn. Se va descurca să facă totul

36277
27:34:50,640 --> 27:34:55,832
aceste combinaţii de pliuri pentru noi şi

36278
27:34:53,280 --> 27:34:59,280
calcularea valorii medii va fi

36279
27:34:55,832 --> 27:35:00,720
foarte usor. Deci um

36280
27:34:59,280 --> 27:35:02,080
nu trebuie să ne facem griji pentru asta. Suntem

36281
27:35:00,720 --> 27:35:04,000
voi vedea un exemplu al acestei veniri

36282
27:35:02,080 --> 27:35:08,320
sus in scurt timp.

36283
27:35:04,000 --> 27:35:10,160
În regulă, de validare încrucișată kfold.

36284
27:35:08,320 --> 27:35:12,160
Dar acesta este un lucru cu adevărat pe scară largă

36285
27:35:10,160 --> 27:35:13,912
tehnica folosita. Și din nou ca

36286
27:35:12,160 --> 27:35:15,832
scop, poate vă întrebați ce este

36287
27:35:13,912 --> 27:35:18,160
scopul în cele din urmă de a face asta?

36288
27:35:15,832 --> 27:35:20,800
Este pentru a înțelege dacă modelul nostru este

36289
27:35:18,160 --> 27:35:22,232
va avea performanțe bune cu datele noi.

36290
27:35:20,800 --> 27:35:23,832
Chiar asta vrem să știm. ca

36291
27:35:22,232 --> 27:35:26,080
modelul va funcționa bine când

36292
27:35:23,832 --> 27:35:30,000
Încep să-l folosesc pe date noi care sunt

36293
27:35:26,080 --> 27:35:34,000
nemaivăzut până acum și acest kffold este un

36294
27:35:30,000 --> 27:35:37,040
indicator decent pentru că suntem

36295
27:35:34,000 --> 27:35:40,232
variind datele pe care le vede pe mai multe

36296
27:35:37,040 --> 27:35:44,160
diferite pliuri corect, deci este un it's

36297
27:35:40,232 --> 27:35:46,720
un fel de bun proxy pentru a-l expune

36298
27:35:44,160 --> 27:35:49,280
la diferite tipuri de date de fiecare dată și

36299
27:35:46,720 --> 27:35:50,080
văzând cum se comportă

36300
27:35:49,280 --> 27:35:51,680
bine pentru că lucrăm

36301
27:35:50,080 --> 27:35:53,192
drumul nostru prin fiecare dintre pliuri

36302
27:35:51,680 --> 27:35:55,192
va rămâne întotdeauna un pliu

36303
27:35:53,192 --> 27:35:58,960
afară. Vom schimba ce pliu

36304
27:35:55,192 --> 27:36:00,800
este omis de fiecare dată. Și asta e

36305
27:35:58,960 --> 27:36:02,552
mimând într-un fel ideea că suntem

36306
27:36:00,800 --> 27:36:05,360
vom aplica modelul nostru la date noi și

36307
27:36:02,552 --> 27:36:09,552
vezi cum se comporta. Și este nou

36308
27:36:05,360 --> 27:36:09,552
date fiecare pliu.

36309
27:36:25,760 --> 27:36:32,320
de unde știm care model se potrivește cel mai bine

36310
27:36:29,680 --> 27:36:36,552
pentru care scenariu pentru că avem Da,

36311
27:36:32,320 --> 27:36:38,080
asta e o intrebare buna. Um, deci suntem noi

36312
27:36:36,552 --> 27:36:39,192
vom învăța asta pe măsură ce mergem mai departe

36313
27:36:38,080 --> 27:36:43,040
pentru că nu am acoperit toate

36314
27:36:39,192 --> 27:36:46,080
modele încă, dar în general cele mai bune

36315
27:36:43,040 --> 27:36:49,192
sfatul pe care îl pot da în acest sens

36316
27:36:46,080 --> 27:36:51,600
tu în general vrei să începi ca

36317
27:36:49,192 --> 27:36:53,912
cât de simplu poți obține și apoi dacă este

36318
27:36:51,600 --> 27:36:56,320
nu funcționează bine, atunci lucrează în felul tău

36319
27:36:53,912 --> 27:36:58,800
până la ceva mai complex.

36320
27:36:56,320 --> 27:37:00,000
Deci vom avea modele care sunt

36321
27:36:58,800 --> 27:37:02,480
mai simplu. Vom avea modele așa

36322
27:37:00,000 --> 27:37:04,960
sunt mai complexe. Regula de bază este

36323
27:37:02,480 --> 27:37:07,120
pentru a începe cu cel mai simplu model care

36324
27:37:04,960 --> 27:37:10,160
lucrări.

36325
27:37:07,120 --> 27:37:12,000
Deci, de obicei, vei avea la fel

36326
27:37:10,160 --> 27:37:14,960
cele pe care le vei încerca în

36327
27:37:12,000 --> 27:37:16,720
începutul. Și regresia liniară este a

36328
27:37:14,960 --> 27:37:18,232
model foarte simplu. De obicei este

36329
27:37:16,720 --> 27:37:20,552
primul pe care vrei să-l încerci pentru regresie

36330
27:37:18,232 --> 27:37:22,552
pentru ca este cel mai simplu.

36331
27:37:20,552 --> 27:37:24,960
Hm, și pentru clasificare, mergem

36332
27:37:22,552 --> 27:37:26,960
pentru a avea o logistică similară

36333
27:37:24,960 --> 27:37:29,192
regresia este cel mai simplu tip de

36334
27:37:26,960 --> 27:37:31,280
model de clasificare pe care l-am putea avea. Deci

36335
27:37:29,192 --> 27:37:34,232
de obicei vreau să încep cu asta și apoi

36336
27:37:31,280 --> 27:37:37,120
dacă nu se potrivește ca dacă vedem că este

36337
27:37:34,232 --> 27:37:39,600
producând multe erori, atunci lucrăm

36338
27:37:37,120 --> 27:37:41,440
drumul nostru până la unul mai sofisticat

36339
27:37:39,600 --> 27:37:45,192
model.

36340
27:37:41,440 --> 27:37:47,512
Deci așa e noi așa e

36341
27:37:45,192 --> 27:37:50,000
ar trebui să meargă de obicei este simplu

36342
27:37:47,512 --> 27:37:52,080
complexează-l pe baza performanței lor.

36343
27:37:50,000 --> 27:37:53,912
Așa că o evaluăm și apoi putem repeta

36344
27:37:52,080 --> 27:37:55,440
procesul. Dacă nu funcționează bine

36345
27:37:53,912 --> 27:37:59,872
putem încerca ceva diferit, adică

36346
27:37:55,440 --> 27:37:59,872
mai complex dacă este insuficient.

36347
27:38:05,120 --> 27:38:09,120
Uh, aceasta este o întrebare bună. Face un model

36348
27:38:06,872 --> 27:38:12,000
resetează după antrenament fiecare k minus unu

36349
27:38:09,120 --> 27:38:15,680
pliază? Da, în esență este ca o

36350
27:38:12,000 --> 27:38:19,040
model gol de fiecare dată, uh, fiecare pliu. Deci

36351
27:38:15,680 --> 27:38:22,160
um ne imaginăm ca și cum ai avea un brand

36352
27:38:19,040 --> 27:38:26,440
au un model nou la fiecare um k minus unu

36353
27:38:22,160 --> 27:38:26,440
combinație. Da.

36354
27:38:30,400 --> 27:38:35,832
Și motivul pentru care trebuie să fie

36355
27:38:32,160 --> 27:38:39,832
așa este pentru că nu vrei

36356
27:38:35,832 --> 27:38:42,232
alte pliuri influenţând modelul care

36357
27:38:39,832 --> 27:38:43,760
ca la următoarea combinație. tu

36358
27:38:42,232 --> 27:38:45,680
nu vreau ca combinația anterioară

36359
27:38:43,760 --> 27:38:48,872
influența rezultatele asupra următoarei,

36360
27:38:45,680 --> 27:38:51,360
nu? Vrei să fie proaspăt

36361
27:38:48,872 --> 27:38:54,360
evaluare pe fiecare combinație de

36362
27:38:51,360 --> 27:38:54,360
pliuri.

36363
27:39:10,640 --> 27:39:15,512
Bine.

36364
27:39:12,480 --> 27:39:18,320
În regulă. Deci, permiteți-mi să vă descriu a

36365
27:39:15,512 --> 27:39:20,552
variație a ceea ce tocmai am vorbit

36366
27:39:18,320 --> 27:39:22,872
cam cu K-fold. Deci, există

36367
27:39:20,552 --> 27:39:26,320
o altă validare încrucișată cunoscută ca

36368
27:39:22,872 --> 27:39:29,280
K-fold stratificat. Și acesta este

36369
27:39:26,320 --> 27:39:31,440
aceeași procedură exactă ca și kfold, cu excepția

36370
27:39:29,280 --> 27:39:32,960
că atunci când noi aceasta este folosită pentru

36371
27:39:31,440 --> 27:39:35,832
clasificare.

36372
27:39:32,960 --> 27:39:37,512
Atunci când facem clasificare

36373
27:39:35,832 --> 27:39:40,872
uh vrem să ne asigurăm că

36374
27:39:37,512 --> 27:39:43,280
diferite categorii vor fi um

36375
27:39:40,872 --> 27:39:45,600
împărțit între acele pliuri într-o

36376
27:39:43,280 --> 27:39:48,872
mod proporțional. Deci nu facem ceea ce facem

36377
27:39:45,600 --> 27:39:50,960
nu vreau să se întâmple atunci când ne despărțim

36378
27:39:48,872 --> 27:39:53,440
în afară de date. Deci, să spunem că avem

36379
27:39:50,960 --> 27:39:56,000
să presupunem că nu anticipăm spam

36380
27:39:53,440 --> 27:39:58,800
spam. Ceea ce nu vrem să se întâmple

36381
27:39:56,000 --> 27:40:01,912
când ne despărțim este că nu vrem

36382
27:39:58,800 --> 27:40:04,800
pentru ca toate spamurile să ajungă într-unul singur

36383
27:40:01,912 --> 27:40:08,160
pliază și apoi fiecare altă faldă are nr

36384
27:40:04,800 --> 27:40:11,280
spam, fără spam, fără spam, fără spam, nu?

36385
27:40:08,160 --> 27:40:13,440
Asta nu e foarte bine. Hm pentru că dacă noi

36386
27:40:11,280 --> 27:40:16,080
dacă ne antrenăm împotriva tuturor acestor tipi, noi

36387
27:40:13,440 --> 27:40:18,720
nu au nicio șansă să prezică spam-ul când

36388
27:40:16,080 --> 27:40:20,960
nu au mai văzut niciodată spam. Deci

36389
27:40:18,720 --> 27:40:23,120
stratify kayfold este folosit în

36390
27:40:20,960 --> 27:40:27,120
clasificare

36391
27:40:23,120 --> 27:40:29,440
și este pentru a ne despărți

36392
27:40:27,120 --> 27:40:32,000
asigurați-vă că au practic a

36393
27:40:29,440 --> 27:40:34,640
număr echilibrat de categorii pentru fiecare

36394
27:40:32,000 --> 27:40:37,120
despicat. Ca să nu ajungem cu noi

36395
27:40:34,640 --> 27:40:40,320
anumite divizări cu mult mai multe spam-uri decât

36396
27:40:37,120 --> 27:40:42,720
nu spam-uri. Așa că facem cum se numește

36397
27:40:40,320 --> 27:40:45,440
stratificând acolo unde ne asigurăm că

36398
27:40:42,720 --> 27:40:47,760
proporțiile sunt echilibrate în fiecare uh

36399
27:40:45,440 --> 27:40:50,232
despicat. Deci, acest lucru este cu adevărat util doar în

36400
27:40:47,760 --> 27:40:51,680
clasificare, nu chiar necesară în

36401
27:40:50,232 --> 27:40:53,600
regresie deoarece prezicem a

36402
27:40:51,680 --> 27:40:55,512
valoare. Dar dacă am prezice o

36403
27:40:53,600 --> 27:40:58,232
categorie,

36404
27:40:55,512 --> 27:41:00,400
ca în clasificare ca fraudă, nu

36405
27:40:58,232 --> 27:41:03,280
fraudă, nu vrem să facem despărțirea și

36406
27:41:00,400 --> 27:41:05,760
au fiecare exemplu de fraudă

36407
27:41:03,280 --> 27:41:09,120
ghinion în amestecul nostru și despicat

36408
27:41:05,760 --> 27:41:11,760
până într-o împărțire și fiecare alta um fiecare

36409
27:41:09,120 --> 27:41:13,680
altă diviziune nu are exemple de fraudă.

36410
27:41:11,760 --> 27:41:16,160
Corect? Deci vrem să stratificăm acest lucru

36411
27:41:13,680 --> 27:41:21,360
răspândi acele fraude împotriva tuturor

36412
27:41:16,160 --> 27:41:23,040
celelalte se despart. Um deci uh din nou um

36413
27:41:21,360 --> 27:41:24,960
scikitlearn se va ocupa de asta pt

36414
27:41:23,040 --> 27:41:26,720
tu. Hm, dar dacă faci

36415
27:41:24,960 --> 27:41:29,680
clasificare și aveți o

36416
27:41:26,720 --> 27:41:32,232
set de date dezechilibrat, tu chiar

36417
27:41:29,680 --> 27:41:36,720
vreau să vă asigurați că stratificați k-fold.

36418
27:41:32,232 --> 27:41:38,232
um dezechilibrat însemnând că ai un a

36419
27:41:36,720 --> 27:41:39,832
um numar diferit. Ca dacă ești

36420
27:41:38,232 --> 27:41:42,552
făcând fraudă, nu fraudă, ai cum

36421
27:41:39,832 --> 27:41:45,440
mai mult nu fraude decât fraude. Hm unde

36422
27:41:42,552 --> 27:41:46,800
în cazul în care acea categorie este dezechilibrată,

36423
27:41:45,440 --> 27:41:49,912
vrei să te asiguri că este echilibrat

36424
27:41:46,800 --> 27:41:52,160
peste toate diviziunile tale.

36425
27:41:49,912 --> 27:41:53,600
Um, deci asta este util în

36426
27:41:52,160 --> 27:41:54,872
doar clasificare, nu chiar

36427
27:41:53,600 --> 27:41:57,512
regresie, despre care vorbim

36428
27:41:54,872 --> 27:41:59,360
cam acum. Hm, dar este doar o

36429
27:41:57,512 --> 27:42:02,400
variaţie asupra acestui lucru care asigură când noi

36430
27:41:59,360 --> 27:42:04,480
face acele pliuri um datele sunt

36431
27:42:02,400 --> 27:42:06,640
distribuite uniform între aceste pliuri

36432
27:42:04,480 --> 27:42:08,960
cât putem. Etichetele sunt I

36433
27:42:06,640 --> 27:42:12,080
ar trebui să spună.

36434
27:42:08,960 --> 27:42:14,552
Bine. Deci este kfold stratificat. Este

36435
27:42:12,080 --> 27:42:16,080
aceeași procedură odată ce avem

36436
27:42:14,552 --> 27:42:18,800
despica. Este la fel unde facem k

36437
27:42:16,080 --> 27:42:22,720
minus unul dintre ei. Antrenăm testul pentru asta

36438
27:42:18,800 --> 27:42:24,552
ultima pliere um și apoi rotiți prin toate

36439
27:42:22,720 --> 27:42:26,872
pliurile și și medie toate cele

36440
27:42:24,552 --> 27:42:29,760
metrici. exact aceeași procedură. Este

36441
27:42:26,872 --> 27:42:34,192
doar despărțirea în sine urmează

36442
27:42:29,760 --> 27:42:34,192
să fie echilibrat într-un kfold stratificat.

36443
27:42:35,192 --> 27:42:39,912
Bine. Așadar, stai bine că am vorbit deja

36444
27:42:36,960 --> 27:42:42,080
despre um face doar un singur tren

36445
27:42:39,912 --> 27:42:44,080
divizarea testului. Am vorbit despre asta. Unul

36446
27:42:42,080 --> 27:42:46,720
mai multă variație care este un pic

36447
27:42:44,080 --> 27:42:48,552
versiune extremă a K-fold. Deci este

36448
27:42:46,720 --> 27:42:52,960
de fapt același proces ca Kfold, dar

36449
27:42:48,552 --> 27:42:54,872
este o versiune extremă dacă setați K

36450
27:42:52,960 --> 27:42:57,760
egal cu numărul de puncte de date. Deci

36451
27:42:54,872 --> 27:43:00,480
practic ești, asta este cu adevărat

36452
27:42:57,760 --> 27:43:03,760
Kfold într-adevăr extrem unde tu um

36453
27:43:00,480 --> 27:43:06,800
practic sunt de formare pe toate datele.

36454
27:43:03,760 --> 27:43:10,080
Deci te antrenezi cu toate datele

36455
27:43:06,800 --> 27:43:13,192
cu excepția unui punct și apoi testezi

36456
27:43:10,080 --> 27:43:16,320
împotriva aceluia punct. Hm acum de ce ar face-o

36457
27:43:13,192 --> 27:43:20,720
faci asta vreodata? Hm, în principal așa este pentru

36458
27:43:16,320 --> 27:43:22,480
acest motiv aici. Este pentru a maximiza

36459
27:43:20,720 --> 27:43:24,720
cantitatea de date de antrenament pe care dvs

36460
27:43:22,480 --> 27:43:26,640
modelul este expus pentru că în loc de

36461
27:43:24,720 --> 27:43:28,552
doar fac în loc să faci doar cinci

36462
27:43:26,640 --> 27:43:31,512
despica

36463
27:43:28,552 --> 27:43:33,280
um care ar fi ca

36464
27:43:31,512 --> 27:43:36,000
știi că aceste patru pliuri se vor face

36465
27:43:33,280 --> 27:43:39,280
fie folosit și apoi testăm împotriva unuia

36466
27:43:36,000 --> 27:43:42,480
pliază. um, în esență, vom folosi

36467
27:43:39,280 --> 27:43:45,040
99% din date, nu? Un punct este

36468
27:43:42,480 --> 27:43:47,760
va fi lăsat afară. 99% din date

36469
27:43:45,040 --> 27:43:49,360
se obișnuiește să se antreneze. Hm și apoi suntem

36470
27:43:47,760 --> 27:43:51,360
mereu o să omite un punct. Şi

36471
27:43:49,360 --> 27:43:53,120
și problema este că de fapt o vom face

36472
27:43:51,360 --> 27:43:55,600
fă asta iar și iar și iar și

36473
27:43:53,120 --> 27:43:58,000
rotiți acel punct pentru a acoperi întregul

36474
27:43:55,600 --> 27:44:01,832
set de date. Deci, ne vom antrena mai departe

36475
27:43:58,000 --> 27:44:03,760
99%, lasă unul subliniat,

36476
27:44:01,832 --> 27:44:05,832
și apoi rotiți prin fiecare

36477
27:44:03,760 --> 27:44:08,160
combinație de puncte până când plecăm

36478
27:44:05,832 --> 27:44:10,400
fiecare punct și apoi medie

36479
27:44:08,160 --> 27:44:13,680
toți cei împreună. Um, deci acesta este un

36480
27:44:10,400 --> 27:44:15,192
acesta este un kfold extrem. Din nou,

36481
27:44:13,680 --> 27:44:16,960
numărul de pliuri este de fapt egal cu

36482
27:44:15,192 --> 27:44:19,912
numărul de puncte de date în acest caz. Deci,

36483
27:44:16,960 --> 27:44:23,120
avem fiecare punct este propriul său fald și

36484
27:44:19,912 --> 27:44:26,400
ne antrenăm pentru orice, în afară de unul. Testează pornit

36485
27:44:23,120 --> 27:44:28,400
acela. Acest lucru vă obține dimensiunea maximă

36486
27:44:26,400 --> 27:44:30,320
a datelor tale de antrenament pentru că ești

36487
27:44:28,400 --> 27:44:32,480
practic, va avea toate punctele în afară de unul

36488
27:44:30,320 --> 27:44:34,800
folosit la antrenament.

36489
27:44:32,480 --> 27:44:38,800
Acest lucru vă obține dimensiunea maximă. Cu toate acestea,

36490
27:44:34,800 --> 27:44:40,400
îți aduce cheltuiala maximă

36491
27:44:38,800 --> 27:44:42,080
în special pentru seturi mari de date. Aceasta este

36492
27:44:40,400 --> 27:44:44,872
va fi, de obicei, nu vei face

36493
27:44:42,080 --> 27:44:48,232
utilizați acest lucru în special pentru date mari

36494
27:44:44,872 --> 27:44:49,832
setează pentru că este prea extrem. Este

36495
27:44:48,232 --> 27:44:52,232
iti va lua foarte mult timp

36496
27:44:49,832 --> 27:44:55,192
lucrează prin fiecare punct de ființă

36497
27:44:52,232 --> 27:44:57,192
lăsat afară. um, va dura doar o

36498
27:44:55,192 --> 27:45:00,320
în timp ce să facă.

36499
27:44:57,192 --> 27:45:02,000
Deci, din acest motiv, lăsați-l afară

36500
27:45:00,320 --> 27:45:04,160
um că de aceea se numește lăsați unul

36501
27:45:02,000 --> 27:45:08,160
afară pentru că lași unul afară

36502
27:45:04,160 --> 27:45:09,912
de fiecare dată. Um este rar folosit. eu

36503
27:45:08,160 --> 27:45:12,800
Nu prea am văzut că a folosit asta

36504
27:45:09,912 --> 27:45:16,512
adesea, dar este o versiune extremă a

36505
27:45:12,800 --> 27:45:16,512
validare încrucișată kful.

36506
27:45:16,720 --> 27:45:20,872
Bine. Dar foarte rar folosit. eu

36507
27:45:19,040 --> 27:45:22,720
cred că cei care se obișnuiesc

36508
27:45:20,872 --> 27:45:25,512
cele mai multe sunt cu siguranță metoda hold out

36509
27:45:22,720 --> 27:45:27,512
cu doar o împărțire obișnuită de testare a trenului. Hm

36510
27:45:25,512 --> 27:45:30,640
și apoi celălalt care se obișnuiește

36511
27:45:27,512 --> 27:45:32,552
destul de mult este este kfold

36512
27:45:30,640 --> 27:45:34,320
sau kfold stratificat dacă ești dacă ești

36513
27:45:32,552 --> 27:45:36,232
fac clasificare,

36514
27:45:34,320 --> 27:45:38,552
dar cu siguranta kfold in in a

36515
27:45:36,232 --> 27:45:41,552
caz de regresie.

36516
27:45:38,552 --> 27:45:41,552
Bine.

36517
27:45:43,120 --> 27:45:47,440
În regulă. Um, vom face o

36518
27:45:45,280 --> 27:45:48,552
exemplu cu tipii astia. Așa că vom face

36519
27:45:47,440 --> 27:45:50,080
că în continuare.

36520
27:45:48,552 --> 27:45:54,480
um cu cu cruce diferită

36521
27:45:50,080 --> 27:45:57,600
tehnici de validare. Hm, dar oricare

36522
27:45:54,480 --> 27:45:59,680
întrebări despre ceea ce fac

36523
27:45:57,600 --> 27:46:03,000
conceptual înainte de a face efectiv

36524
27:45:59,680 --> 27:46:03,000
exemplu de cod.

36525
27:46:16,160 --> 27:46:22,280
Bine.

36526
27:46:18,872 --> 27:46:22,280
Foarte bun.

36527
27:46:25,120 --> 27:46:32,000
În regulă. Deci, să vedem câteva exemple.

36528
27:46:27,912 --> 27:46:34,480
Hai să intrăm în codul nostru și să construim un

36529
27:46:32,000 --> 27:46:37,192
modelați și faceți crucea diferită

36530
27:46:34,480 --> 27:46:38,320
tehnici de validare pe acesta. Um, ești

36531
27:46:37,192 --> 27:46:40,800
să văd că de fapt va fi

36532
27:46:38,320 --> 27:46:43,360
foarte ușor de făcut și sună

36533
27:46:40,800 --> 27:46:45,600
complex ca a face kfold și a pleca

36534
27:46:43,360 --> 27:46:47,600
unul afară și testare. Sună oarecum

36535
27:46:45,600 --> 27:46:51,600
complex, dar vă promit că scikitlearn

36536
27:46:47,600 --> 27:46:54,960
face cu adevărat ușor de făcut. um,

36537
27:46:51,600 --> 27:46:57,280
și așa, uh, nu va trebui să facem prea multe

36538
27:46:54,960 --> 27:46:59,360
în plus, folosește instrumentele potrivite

36539
27:46:57,280 --> 27:47:01,912
de la scikitlearn. Uh, așa că o să facem

36540
27:46:59,360 --> 27:47:05,440
o să vedem asta. Um, deci aici suntem

36541
27:47:01,912 --> 27:47:07,280
au unele importuri. Primarul, uh,

36542
27:47:05,440 --> 27:47:09,832
lucru care este puțin nou pentru noi este

36543
27:47:07,280 --> 27:47:11,440
vor fi acestea, um, feluri diferite

36544
27:47:09,832 --> 27:47:13,120
a tehnicilor de validare încrucișată. Deci noi

36545
27:47:11,440 --> 27:47:15,600
avem kfoldul nostru, avem stratificat

36546
27:47:13,120 --> 27:47:17,192
kfold, lăsați unul afară. Hm, care sunt

36547
27:47:15,600 --> 27:47:19,440
acele diferite validare încrucișată

36548
27:47:17,192 --> 27:47:24,640
tehnici. Um, astea vor fi

36549
27:47:19,440 --> 27:47:27,360
folosit in combinatie cu aceasta cruce val

36550
27:47:24,640 --> 27:47:29,512
scorul pe care îl va urmări

36551
27:47:27,360 --> 27:47:31,832
diferitele valori um și apoi

36552
27:47:29,512 --> 27:47:35,440
le medie

36553
27:47:31,832 --> 27:47:38,400
uh, în timp ce facem una dintre aceste um cruce

36554
27:47:35,440 --> 27:47:42,080
tehnici de validare. Deci tipul ăsta primește

36555
27:47:38,400 --> 27:47:44,400
folosit în combinație cu unul dintre acestea pentru a

36556
27:47:42,080 --> 27:47:48,080
așa cum vom vedea în cod

36557
27:47:44,400 --> 27:47:49,912
uh, pentru a face o medie a acelor valori

36558
27:47:48,080 --> 27:47:52,320
pliuri diferite, nu? Efectuați a face

36559
27:47:49,912 --> 27:47:55,360
performanță împotriva diferitelor pliuri.

36560
27:47:52,320 --> 27:47:57,120
Bine. Și atunci, desigur, avem nevoie de un model

36561
27:47:55,360 --> 27:48:00,080
folosind o regresie liniară. Asta este

36562
27:47:57,120 --> 27:48:02,160
cel pe care l-am studiat până acum. Hm și

36563
27:48:00,080 --> 27:48:05,600
atunci avem doar o metrică obișnuită. Dacă

36564
27:48:02,160 --> 27:48:08,960
vrem să le calculăm um folosind poate

36565
27:48:05,600 --> 27:48:10,640
doar stai, nu? Și ține um

36566
27:48:08,960 --> 27:48:12,800
care este doar un test de tren obișnuit

36567
27:48:10,640 --> 27:48:14,960
împărțim, am putea folosi acești tipi

36568
27:48:12,800 --> 27:48:17,680
evalua performanta.

36569
27:48:14,960 --> 27:48:19,680
Dar într-un stil kfold mai sofisticat

36570
27:48:17,680 --> 27:48:24,280
de validare încrucișată, vom folosi

36571
27:48:19,680 --> 27:48:24,280
aceasta pentru a evalua performanța.

36572
27:48:25,512 --> 27:48:30,232
Bine, să vedem.

36573
27:48:28,552 --> 27:48:33,600
Deci, vom lucra cu asta

36574
27:48:30,232 --> 27:48:37,760
locuințe cu date de proximitate oceanului. um,

36575
27:48:33,600 --> 27:48:40,160
voi băieți ar trebui să aveți asta. Uh,

36576
27:48:37,760 --> 27:48:41,832
deci ar trebui să aveți asta. Deci, dacă

36577
27:48:40,160 --> 27:48:46,400
vrei să-l urmărești și să-l rulezi

36578
27:48:41,832 --> 27:48:51,360
tu însuți, um, îl poți încărca pe acela.

36579
27:48:46,400 --> 27:48:52,872
Vreau să mă asigur că o am.

36580
27:48:51,360 --> 27:48:56,280
Lasă-mă să-l trag. Deci, ar trebui

36581
27:48:52,872 --> 27:48:56,280
fii acest tip.

36582
27:49:03,760 --> 27:49:08,960
O să-l încarc ca să pot face

36583
27:49:05,120 --> 27:49:11,960
sigur că o conduc cu voi băieți.

36584
27:49:08,960 --> 27:49:11,960
um,

36585
27:49:17,680 --> 27:49:21,232
lasă-mă să conduc asta.

36586
27:49:21,912 --> 27:49:28,720
Aveți acele date?

36587
27:49:24,720 --> 27:49:30,800
locuința cu apropierea oceanului.

36588
27:49:28,720 --> 27:49:33,760
Este o altă dată, este o altă dată despre locuințe

36589
27:49:30,800 --> 27:49:35,360
set. Hm

36590
27:49:33,760 --> 27:49:38,720
dar este puțin diferit de

36591
27:49:35,360 --> 27:49:40,872
cele pe care le-am mai văzut. Are un a

36592
27:49:38,720 --> 27:49:45,800
caracteristică specială pentru cât de aproape este

36593
27:49:40,872 --> 27:49:45,800
oceanul în diferite locații.

36594
27:49:50,640 --> 27:49:54,320
Deci arată cam așa. Dacă noi

36595
27:49:52,160 --> 27:49:57,832
încărcați-l și faceți-ne capul, adică

36596
27:49:54,320 --> 27:50:00,080
de obicei ce facem, nu? Putem vedea um

36597
27:49:57,832 --> 27:50:05,280
putem vedea că are aceste caracteristici.

36598
27:50:00,080 --> 27:50:08,800
Deci are uh uh dormitoare, camere totale,

36599
27:50:05,280 --> 27:50:10,872
um, are vârsta medie. Acum asta este

36600
27:50:08,800 --> 27:50:15,512
asta pare putin ciudat in totalitate

36601
27:50:10,872 --> 27:50:19,512
camere și dormitoare și populație

36602
27:50:15,512 --> 27:50:22,872
etc. Dar este um

36603
27:50:19,512 --> 27:50:24,720
este că are acelea uh, are alea

36604
27:50:22,872 --> 27:50:27,040
pentru că reprezintă un întreg

36605
27:50:24,720 --> 27:50:29,192
cartier. Deci este un întreg

36606
27:50:27,040 --> 27:50:30,320
cartier. Și ne uităm la asta

36607
27:50:29,192 --> 27:50:32,720
um, acesta va fi de fapt al nostru

36608
27:50:30,320 --> 27:50:34,720
eticheta este această valoare medie a casei pentru

36609
27:50:32,720 --> 27:50:38,232
întreg cartierul. Deci ce este asta

36610
27:50:34,720 --> 27:50:40,640
valoarea mediană în cartier? Şi

36611
27:50:38,232 --> 27:50:43,912
acesta este numărul total de dormitoare,

36612
27:50:40,640 --> 27:50:46,320
numărul total de camere, um populație,

36613
27:50:43,912 --> 27:50:49,120
gospodăriilor. Deci, câte case sunt

36614
27:50:46,320 --> 27:50:51,600
acolo? Hm, venitul mediu. Si bineinteles,

36615
27:50:49,120 --> 27:50:58,872
acestea sunt scalate. Deci, acestea sunt um

36616
27:50:51,600 --> 27:51:02,800
ori probabil, știi, mii. Hm

36617
27:50:58,872 --> 27:51:06,280
dar astea sunt datele noastre. Am putea

36618
27:51:02,800 --> 27:51:06,280
descrie-l.

36619
27:51:07,912 --> 27:51:13,120
Deci putem vedea vârsta medie, medie

36620
27:51:10,160 --> 27:51:15,600
vârsta medie. Um, ceea ce sună puțin

36621
27:51:13,120 --> 27:51:18,552
ciudat, dar asta pentru că din nou

36622
27:51:15,600 --> 27:51:22,480
aceasta este mediana datelor din a

36623
27:51:18,552 --> 27:51:27,912
cartier. Um deci media celor

36624
27:51:22,480 --> 27:51:30,912
este de aproximativ 28 sau 29. Avem

36625
27:51:27,912 --> 27:51:30,912
u

36626
27:51:31,600 --> 27:51:36,320
total dormitoare. Ne putem uita la

36627
27:51:33,760 --> 27:51:38,480
bărbați. Sunt câteva date care doar au

36628
27:51:36,320 --> 27:51:41,440
unul. Deci, probabil că este doar o casă înăuntru

36629
27:51:38,480 --> 27:51:43,192
acolo. Um, care este asta

36630
27:51:41,440 --> 27:51:45,192
reprezintă. Există o singură casă. Deci,

36631
27:51:43,192 --> 27:51:48,872
acolo este un cartier care

36632
27:51:45,192 --> 27:51:53,120
are o singură casă. Hm, și vedem

36633
27:51:48,872 --> 27:51:55,440
mediană um vedem mediana minimă uh

36634
27:51:53,120 --> 27:52:00,760
valorile casei acolo. Și apoi maximul

36635
27:51:55,440 --> 27:52:00,760
aici jos este un număr destul de mare.

36636
27:52:01,600 --> 27:52:05,280
6.000 de gospodării este cea mai mare pe care o avem

36637
27:52:03,912 --> 27:52:07,600
au în oricare dintre acestea

36638
27:52:05,280 --> 27:52:09,440
cartiere.

36639
27:52:07,600 --> 27:52:13,160
Bine. Deci, doar un pic de

36640
27:52:09,440 --> 27:52:13,160
descrierea datelor.

36641
27:52:25,760 --> 27:52:30,232
Bine. Deci, atunci putem rula.info. Deci, asta

36642
27:52:28,000 --> 27:52:35,000
lasă-mă să vă întreb, băieți, dacă ați putut

36643
27:52:30,232 --> 27:52:35,000
sa incarci asta? Ai fost capabil să rulezi asta?

36644
27:52:36,552 --> 27:52:39,512
Dacă te urmărești, ai putut

36645
27:52:38,000 --> 27:52:43,640
la

36646
27:52:39,512 --> 27:52:43,640
incarca-l si arunca o privire la

36647
27:52:49,832 --> 27:52:55,280
Bine, grozav. Mare.

36648
27:52:52,552 --> 27:53:00,080
Bine, deci putem să încărcăm asta și

36649
27:52:55,280 --> 27:53:02,232
apoi uită-te la cap. Perfect. Hm

36650
27:53:00,080 --> 27:53:05,120
Bine.

36651
27:53:02,232 --> 27:53:07,440
Um și apoi alergăm descrieți care dă

36652
27:53:05,120 --> 27:53:10,160
noi că uh obișnuit fel de statistică

36653
27:53:07,440 --> 27:53:14,192
descriere. Ca să putem vedea câteva

36654
27:53:10,160 --> 27:53:14,192
statistici interesante despre acestea.

36655
27:53:18,000 --> 27:53:22,080
Ce observați băieți despre informații?

36656
27:53:20,480 --> 27:53:25,080
Orice interesant din care vedem

36657
27:53:22,080 --> 27:53:25,080
acolo?

36658
27:53:36,872 --> 27:53:41,640
Lipsesc date

36659
27:53:42,080 --> 27:53:47,360
vreo caracteristică care are date lipsă? Can

36660
27:53:44,960 --> 27:53:49,760
vedem noi

36661
27:53:47,360 --> 27:53:51,912
obiect? Da, tipul de obiect este de obicei

36662
27:53:49,760 --> 27:53:54,640
sfoară. Dacă este un tip de obiect, asta

36663
27:53:51,912 --> 27:53:56,640
de obicei înseamnă șir. Python când noi

36664
27:53:54,640 --> 27:53:59,280
citește-l în panda, de obicei este doar un

36665
27:53:56,640 --> 27:54:00,960
sfoară.

36666
27:53:59,280 --> 27:54:03,120
Pentru ca asta să aibă sens ca și noi

36667
27:54:00,960 --> 27:54:05,760
mai ales caracteristici numerice dar apoi noi

36668
27:54:03,120 --> 27:54:08,760
au o această apropiere de ocean care este o

36669
27:54:05,760 --> 27:54:08,760
şir.

36670
27:54:14,720 --> 27:54:18,640
Da. Total dormitoare are nles. Asta e

36671
27:54:16,640 --> 27:54:21,440
corect. Pentru că aici puteți vedea asta

36672
27:54:18,640 --> 27:54:23,192
nu este egal cu numărul de rânduri uh

36673
27:54:21,440 --> 27:54:24,872
pe care o avem. Deci acesta este numărul de

36674
27:54:23,192 --> 27:54:27,760
rânduri care aproximativ 20.000 de rânduri. Asta este o

36675
27:54:24,872 --> 27:54:30,400
set de date de dimensiuni bune, nu? 20.000 de rânduri.

36676
27:54:27,760 --> 27:54:34,232
Asta e decent. Cu siguranță suntem

36677
27:54:30,400 --> 27:54:35,680
lipsesc câteva date aici cu siguranță. Hm noi

36678
27:54:34,232 --> 27:54:40,800
am putea număra cât de mult ne lipsesc

36679
27:54:35,680 --> 27:54:42,872
exact prin rularea aceasta este suma NATO. Hm

36680
27:54:40,800 --> 27:54:46,720
și așa vedem că totalul dormitoare este

36681
27:54:42,872 --> 27:54:51,720
lipsesc aproximativ 200 uh 200 de rânduri sunt

36682
27:54:46,720 --> 27:54:51,720
lipsește valoarea totală a dormitorului.

36683
27:54:52,232 --> 27:54:56,960
Bine. Și apoi un lucru mi-am dorit

36684
27:54:54,640 --> 27:54:58,720
Uită-te la este da, acesta este un șir. Deci

36685
27:54:56,960 --> 27:55:01,040
ce ne amintim ce putem face cu acestea?

36686
27:54:58,720 --> 27:55:05,552
Asta e categoric.

36687
27:55:01,040 --> 27:55:05,552
Deci apropierea oceanului

36688
27:55:06,400 --> 27:55:11,040
este un categoric

36689
27:55:09,192 --> 27:55:13,512
sfoară

36690
27:55:11,040 --> 27:55:15,512
caracteristică.

36691
27:55:13,512 --> 27:55:17,512
Deci putem arunca o privire asupra valorii sale

36692
27:55:15,512 --> 27:55:20,720
contează, ceea ce este de obicei o idee bună

36693
27:55:17,512 --> 27:55:23,440
aruncați o privire și vedeți ce valori posibile

36694
27:55:20,720 --> 27:55:25,760
acea caracteristică ar putea fi. Deci dacă ne uităm la

36695
27:55:23,440 --> 27:55:27,912
noastre

36696
27:55:25,760 --> 27:55:30,912
um cum numim asta? Locuințe

36697
27:55:27,912 --> 27:55:30,912
date.

36698
27:55:31,192 --> 27:55:36,720
date despre locuințe

36699
27:55:34,160 --> 27:55:39,720
ocean

36700
27:55:36,720 --> 27:55:39,720
apropierea

36701
27:55:42,080 --> 27:55:45,480
valoarea contează.

36702
27:55:49,440 --> 27:55:53,120
Deci, iată diferitele tipuri de asta

36703
27:55:51,360 --> 27:55:54,720
unul poate fi. Deci, sunt câteva

36704
27:55:53,120 --> 27:55:56,720
cartiere care au mai puțin de 1 oră

36705
27:55:54,720 --> 27:55:58,720
din ocean. Sunt unele care sunt

36706
27:55:56,720 --> 27:56:01,360
în interior. Sunt unele care sunt aproape de

36707
27:55:58,720 --> 27:56:03,040
ocean. Sunt unele care sunt lângă un golf.

36708
27:56:01,360 --> 27:56:05,760
Există chiar și cinci dintre ei care sunt pe un

36709
27:56:03,040 --> 27:56:08,400
insula. Deci, acestea sunt diferite

36710
27:56:05,760 --> 27:56:09,760
valorile apropierii oceanului. Deci,

36711
27:56:08,400 --> 27:56:12,080
amintește-ți, poți oricând să faci asta. Dacă tu

36712
27:56:09,760 --> 27:56:14,800
vezi o caracteristică șir, poți oricând

36713
27:56:12,080 --> 27:56:17,440
uitați-vă la ce categorii sunt

36714
27:56:14,800 --> 27:56:18,800
sunt. Și se pare că majoritatea lucrurilor sunt

36715
27:56:17,440 --> 27:56:22,320
la mai puțin de 1 oră de ocean, dar

36716
27:56:18,800 --> 27:56:25,192
este cam uniform distribuit aici. Hm

36717
27:56:22,320 --> 27:56:28,912
altfel

36718
27:56:25,192 --> 27:56:28,912
foarte putine insule.

36719
27:56:33,120 --> 27:56:36,720
Dar după cum vă puteți imagina, ca această caracteristică

36720
27:56:34,800 --> 27:56:40,800
probabil va fi important pentru

36721
27:56:36,720 --> 27:56:44,440
determinând care este valoarea, nu?

36722
27:56:40,800 --> 27:56:44,440
Probabil va fi important.

36723
27:56:47,760 --> 27:56:53,120
Bine. Deci, trebuie să ne ocupăm de acestea

36724
27:56:51,040 --> 27:56:55,120
NLES. Dacă vom construi un model,

36725
27:56:53,120 --> 27:56:57,600
nu? Deci, um, asta este tot al nostru

36726
27:56:55,120 --> 27:56:58,720
pregătirea tipică a datelor Dacă vrem să construim un

36727
27:56:57,600 --> 27:57:00,872
model, va trebui să ne ocupăm

36728
27:56:58,720 --> 27:57:03,120
aceste NLES. Ce credeți că noi

36729
27:57:00,872 --> 27:57:05,040
ar trebui să faci cu NLES? Ce ai vrea

36730
27:57:03,120 --> 27:57:06,800
ce parere aveti despre dormitoarele totale?

36731
27:57:05,040 --> 27:57:12,000
Care crezi că este o strategie bună

36732
27:57:06,800 --> 27:57:15,680
face? Rețineți că avem 20.000 de puncte,

36733
27:57:12,000 --> 27:57:20,160
20.000 de rânduri ar trebui să spun și aproximativ 200

36734
27:57:15,680 --> 27:57:20,160
dintre ele sunt nule.

36735
27:57:22,960 --> 27:57:28,232
Corect. Deci aproximativ 200 sunt nule. Hm, ce

36736
27:57:27,120 --> 27:57:29,912
faceți ce credeți că ar fi

36737
27:57:28,232 --> 27:57:33,640
ca o strategie bună pentru a face față acestora

36738
27:57:29,912 --> 27:57:33,640
NLES în acest caz?

36739
27:57:51,040 --> 27:57:58,080
medie. Nu-l putem ignora pentru că noi

36740
27:57:55,040 --> 27:58:00,800
nu pot ignora acea coloană.

36741
27:57:58,080 --> 27:58:04,760
Nu putem ignora întreaga coloană. Deci,

36742
27:58:00,800 --> 27:58:04,760
ceva trebuie să meargă acolo.

36743
27:58:09,280 --> 27:58:14,400
Probabil că nu vreau să o fac zero.

36744
27:58:11,832 --> 27:58:16,800
Cred că medie este o medie decentă este a

36745
27:58:14,400 --> 27:58:19,600
idee decenta. Probabil că nu vreau să fac

36746
27:58:16,800 --> 27:58:21,760
este zero pentru că asta ar indica

36747
27:58:19,600 --> 27:58:24,160
că nu există dormitoare și totuși noi

36748
27:58:21,760 --> 27:58:28,360
mai au o grămadă de camere totale. Deci

36749
27:58:24,160 --> 27:58:28,360
probabil că nu are sens să faci zero.

36750
27:58:30,872 --> 27:58:34,480
Medie, cred că medie ar putea fi a

36751
27:58:32,640 --> 27:58:37,360
unul decent.

36752
27:58:34,480 --> 27:58:41,440
Acum, în acest exemplu, ceea ce suntem de fapt

36753
27:58:37,360 --> 27:58:43,280
o să facem este că suntem

36754
27:58:41,440 --> 27:58:45,040
rânduri.

36755
27:58:43,280 --> 27:58:46,960
De fapt, vom renunța la rândurile al

36756
27:58:45,040 --> 27:58:50,160
împreună. Acum, de ce facem asta?

36757
27:58:46,960 --> 27:58:54,080
Pentru că avem atât de multe date și

36758
27:58:50,160 --> 27:58:56,480
doar 200 dintre ele sunt nule.

36759
27:58:54,080 --> 27:58:57,912
Bine, doar 200 dintre ele sunt nule. Deci,

36760
27:58:56,480 --> 27:59:02,400
de fapt o să renunțăm la

36761
27:58:57,912 --> 27:59:05,440
rânduri. Acum, asta e o alegere.

36762
27:59:02,400 --> 27:59:07,120
E o alegere, nu? Este noi

36763
27:59:05,440 --> 27:59:09,120
ar putea completa cu media ca tine

36764
27:59:07,120 --> 27:59:11,600
sugerează băieții. Ceea ce suntem de fapt

36765
27:59:09,120 --> 27:59:15,440
trebuie doar să aruncați rândurile. Este

36766
27:59:11,600 --> 27:59:18,320
constituie mai putin. Reprezintă aproximativ 1% din

36767
27:59:15,440 --> 27:59:21,832
toate datele. Deci nu este atât de mult

36768
27:59:18,320 --> 27:59:22,960
lipseste. Putem renunța la acele rânduri.

36769
27:59:21,832 --> 27:59:26,080
Deci, de fapt, asta vom face

36770
27:59:22,960 --> 27:59:28,800
face aici este să eliminăm toate rolurile cu

36771
27:59:26,080 --> 27:59:31,680
NLES făcând drop NA. Deci asta doar

36772
27:59:28,800 --> 27:59:37,192
le scapă. Deci acele rânduri sunt tăiate.

36773
27:59:31,680 --> 27:59:38,800
Hm, este discutabil că am putea înlocui

36774
27:59:37,192 --> 27:59:40,640
este discutabil că am putea doar înlocui

36775
27:59:38,800 --> 27:59:42,800
cu ceva și cred că voi băieți

36776
27:59:40,640 --> 27:59:45,040
ai ganduri bune care este media

36777
27:59:42,800 --> 27:59:47,832
un implicit

36778
27:59:45,040 --> 27:59:51,040
presupunem total dormitoare. Am putea

36779
27:59:47,832 --> 27:59:53,192
putea incerca asta. Da.

36780
27:59:51,040 --> 27:59:54,960
Atribuiți o valoare pe baza unei case comparabile

36781
27:59:53,192 --> 27:59:57,440
valoare. Da, ai putea să faci și asta.

36782
27:59:54,960 --> 27:59:59,192
Aceasta este o strategie bună este să te uiți la

36783
27:59:57,440 --> 28:00:02,552
alte rânduri care îi sunt asemănătoare și

36784
27:59:59,192 --> 28:00:04,480
completați o valoare. Este absolut corect.

36785
28:00:02,552 --> 28:00:09,080
Hm, în acest exemplu, suntem de fapt doar

36786
28:00:04,480 --> 28:00:09,080
o să renunț la rândurile respective,

36787
28:00:09,120 --> 28:00:13,512
dar cred că asta e total um total

36788
28:00:11,912 --> 28:00:16,160
valabil.

36789
28:00:13,512 --> 28:00:22,800
Aceasta este o alegere.

36790
28:00:16,160 --> 28:00:26,000
Am putea umple NA cu valori diferite

36791
28:00:22,800 --> 28:00:29,440
precum media

36792
28:00:26,000 --> 28:00:33,912
total dormitoare

36793
28:00:29,440 --> 28:00:35,760
um deducem o valoare etc. Deci am putea

36794
28:00:33,912 --> 28:00:37,512
derivă ceva ce cred că Brent tu

36795
28:00:35,760 --> 28:00:40,232
ai o sugestie bună, care este bună

36796
28:00:37,512 --> 28:00:42,400
sugestie. Am putea deduce ceva

36797
28:00:40,232 --> 28:00:44,800
așa uh și completează golul și

36798
28:00:42,400 --> 28:00:48,232
asta cred ca este total valabil. um,

36799
28:00:44,800 --> 28:00:51,192
am putea lua media um

36800
28:00:48,232 --> 28:00:54,480
dormitoare. Mă refeream la totalul camerelor aici.

36801
28:00:51,192 --> 28:00:56,640
Ne pare rău, totalul camerelor. Am putea completa

36802
28:00:54,480 --> 28:01:00,800
l-am putea completa cu totalul camerelor

36803
28:00:56,640 --> 28:01:03,600
pentru acea categorie um sau pentru acel rând.

36804
28:01:00,800 --> 28:01:05,832
Hm, multe opțiuni. În acest caz, suntem

36805
28:01:03,600 --> 28:01:07,600
de fapt, o să renunț la acele rânduri

36806
28:01:05,832 --> 28:01:10,480
pentru că ele alcătuiesc un așa mic

36807
28:01:07,600 --> 28:01:14,400
procent în raport cu cele 20.000 de rânduri

36808
28:01:10,480 --> 28:01:17,280
pe care o avem. Este vorba despre 1%. Corect? 200

36809
28:01:14,400 --> 28:01:19,680
rânduri este de aproximativ 1% din 20.000.

36810
28:01:17,280 --> 28:01:21,600
Deci, o să le scăpăm. Dar

36811
28:01:19,680 --> 28:01:24,000
asta e o alegere. Nu trebuie să cădem

36812
28:01:21,600 --> 28:01:26,552
ei. Am putea completa cu ceva.

36813
28:01:24,000 --> 28:01:32,280
Hm, și dacă am face asta, am folosi

36814
28:01:26,552 --> 28:01:32,280
umple NA mai degrabă decât arunca NA, nu?

36815
28:01:42,480 --> 28:01:48,552
După ce ai lăsat rândurile, câte? Deci

36816
28:01:45,360 --> 28:01:50,000
este așa după ce scăpăm rândurile, um

36817
28:01:48,552 --> 28:01:53,040
după ce scăpăm rândurile, pur și simplu merge

36818
28:01:50,000 --> 28:01:54,872
pentru a fi mai avem toate celelalte rânduri

36819
28:01:53,040 --> 28:01:57,872
sunt intacte, nu? Deci, dacă ne uităm la asta

36820
28:01:54,872 --> 28:01:57,872
acum,

36821
28:02:03,120 --> 28:02:09,120
acum avem um puțin uh puțin mai puțin

36822
28:02:07,192 --> 28:02:12,400
intrări.

36823
28:02:09,120 --> 28:02:16,160
Deci acum avem atât de multe, mai degrabă

36824
28:02:12,400 --> 28:02:20,192
decât atât de mulți,

36825
28:02:16,160 --> 28:02:20,192
nu? Am scăpat cei 200

36826
28:02:25,760 --> 28:02:28,960
Dar toate sunt completate. Da, sunt

36827
28:02:27,360 --> 28:02:30,552
Deci toate celelalte coloane sunt nemișcate

36828
28:02:28,960 --> 28:02:32,320
completat. Suntem doar noi suntem

36829
28:02:30,552 --> 28:02:35,120
decupând întregul rând. Deci dacă tu

36830
28:02:32,320 --> 28:02:38,480
Gândește-te la setul nostru de date, le avem pe toate

36831
28:02:35,120 --> 28:02:40,320
aceste rânduri și toate aceste coloane. Ce

36832
28:02:38,480 --> 28:02:42,720
facem este ca și cum ar fi un nul

36833
28:02:40,320 --> 28:02:45,280
aici, doar că tocmai scăpăm

36834
28:02:42,720 --> 28:02:49,480
a întregului rând, nu? Și așa noi

36835
28:02:45,280 --> 28:02:49,480
au încă toate celelalte rânduri intacte.

36836
28:02:54,320 --> 28:03:00,912
Uh, le putem scăpa pentru că avem o

36837
28:02:56,640 --> 28:03:00,912
dimensiune bună a eșantionului. Da,

36838
28:03:02,720 --> 28:03:05,912
este exact, Ronald. Da, noi

36839
28:03:04,320 --> 28:03:08,800
le putem renunța pentru că avem avem

36840
28:03:05,912 --> 28:03:13,552
20.000 de rânduri și doar 200 lipsesc

36841
28:03:08,800 --> 28:03:13,552
valorile. Deci, e perfect.

36842
28:03:15,680 --> 28:03:20,400
Uh, drop a elimină toate rândurile care au vreuna

36843
28:03:17,760 --> 28:03:22,320
nulă. Da, este adevărat. Se va duce

36844
28:03:20,400 --> 28:03:24,640
înainte și aruncați orice rând unde

36845
28:03:22,320 --> 28:03:28,440
există orice nul, indiferent de coloană

36846
28:03:24,640 --> 28:03:28,440
este înăuntru. Da,

36847
28:03:35,912 --> 28:03:43,192
index. Da, indexul nu ajunge

36848
28:03:37,680 --> 28:03:45,600
resetare. E adevărat. Deci, um, ce noi

36849
28:03:43,192 --> 28:03:48,720
ceea ce poți face întotdeauna este să poți reseta

36850
28:03:45,600 --> 28:03:50,552
indicele. Deci, um, dacă vrei, este

36851
28:03:48,720 --> 28:03:52,480
opțional. Noi chiar nu o să facem

36852
28:03:50,552 --> 28:03:54,400
folosiți indexul pentru orice

36853
28:03:52,480 --> 28:03:59,680
important, nu? Dar ce am putea face

36854
28:03:54,400 --> 28:04:01,192
este, uh, resetarea indexului.

36855
28:03:59,680 --> 28:04:02,800
Uh,

36856
28:04:01,192 --> 28:04:06,192
am putea face asta, nu? Care va

36857
28:04:02,800 --> 28:04:06,192
resetați-l.

36858
28:04:17,120 --> 28:04:21,320
Așa că acum este resetat.

36859
28:04:36,640 --> 28:04:41,360
Dar lasă-mă, de fapt, nu, nu

36860
28:04:39,280 --> 28:04:45,080
chiar vreau să fac asta. ma duc sa

36861
28:04:41,360 --> 28:04:45,080
resetați acest lucru.

36862
28:04:48,400 --> 28:04:51,400
um,

36863
28:04:57,040 --> 28:05:00,760
da, am putea face asta.

36864
28:05:18,640 --> 28:05:23,192
Bine.

36865
28:05:20,400 --> 28:05:25,280
Deci, acum important ar trebui să existe uh nu

36866
28:05:23,192 --> 28:05:27,040
lipsesc date despre aceasta din nou

36867
28:05:25,280 --> 28:05:29,600
unde am aruncat NAS. Corect. Deci acum

36868
28:05:27,040 --> 28:05:31,440
asta e bine. Dacă tu acum motivul pentru care noi

36869
28:05:29,600 --> 28:05:33,912
a trebuit să facem asta pentru că dacă încercăm

36870
28:05:31,440 --> 28:05:37,912
construim o regresie liniară și avem

36871
28:05:33,912 --> 28:05:40,080
NLES acolo. Hm, problema este ca

36872
28:05:37,912 --> 28:05:43,640
cum construiești un model acolo unde ai

36873
28:05:40,080 --> 28:05:43,640
ceva de genul acesta

36874
28:05:48,480 --> 28:05:54,320
si astea sunt nule? Ca ce faci cum faci

36875
28:05:51,120 --> 28:05:58,000
inmultiti un numar cu un nul?

36876
28:05:54,320 --> 28:06:03,480
Nu prea putem face asta, nu?

36877
28:05:58,000 --> 28:06:03,480
chiar nu putem face asta. Deci, um,

36878
28:06:07,280 --> 28:06:12,480
de aceea, trebuie să scăpăm de

36879
28:06:10,160 --> 28:06:15,360
NLES ca nulul nu este cu adevărat

36880
28:06:12,480 --> 28:06:17,192
mergi să lucrez acolo. Deci, avem nevoie

36881
28:06:15,360 --> 28:06:18,872
pentru a scăpa de ele pentru regresia liniară

36882
28:06:17,192 --> 28:06:20,960
pentru a avea cu adevărat șansa de a lucra,

36883
28:06:18,872 --> 28:06:22,552
nu? Pentru a-l antrena și a putea folosi

36884
28:06:20,960 --> 28:06:26,512
ea.

36885
28:06:22,552 --> 28:06:26,512
Trebuie să scapi de acele nles.

36886
28:06:30,640 --> 28:06:34,320
În regulă,

36887
28:06:33,040 --> 28:06:35,832
vreo intrebare pana acum? Deci, nu am făcut-o

36888
28:06:34,320 --> 28:06:37,832
a făcut vreo modelare încă. Facem ceva

36889
28:06:35,832 --> 28:06:39,440
Facem ceva pregătiri de date înainte

36890
28:06:37,832 --> 28:06:41,040
ajungem la modelare. Și nu am făcut-o

36891
28:06:39,440 --> 28:06:42,552
a făcut încă vreo validare încrucișată. Noi

36892
28:06:41,040 --> 28:06:44,400
nu am setat asta. Doar facem

36893
28:06:42,552 --> 28:06:47,040
pregătirea datelor noastre înainte de a ajunge la

36894
28:06:44,400 --> 28:06:50,640
modelarea. Corect? Deci, am scăpat

36895
28:06:47,040 --> 28:06:52,720
unele NAS. L-am verificat. Hm, suntem

36896
28:06:50,640 --> 28:06:57,040
o să mai fac un pas de pregătire, adică

36897
28:06:52,720 --> 28:06:58,872
să schimbi acea apropiere a oceanului

36898
28:06:57,040 --> 28:07:00,960
caracteristică în ceva numeric deoarece

36899
28:06:58,872 --> 28:07:03,120
din nou, cum construiești un model unde

36900
28:07:00,960 --> 28:07:05,680
inserezi un șir în acelea

36901
28:07:03,120 --> 28:07:07,440
ca beta 1, beta 2, beta de 3 ori de

36902
28:07:05,680 --> 28:07:10,640
caracteristici? Chiar nu poți face asta când

36903
28:07:07,440 --> 28:07:12,640
este o sfoară. Hm, deci ce mergem

36904
28:07:10,640 --> 28:07:13,832
de făcut, o să scap de asta

36905
28:07:12,640 --> 28:07:18,872
pentru că nu cred că avem nevoie

36906
28:07:13,832 --> 28:07:22,720
că. um este că vom conduce asta

36907
28:07:18,872 --> 28:07:26,480
Obține funcția manechine care este um nostru

36908
28:07:22,720 --> 28:07:29,040
Obține funcția manechine este cea obișnuită

36909
28:07:26,480 --> 28:07:32,000
uh, unul dintre manechinele noastre git este cel obișnuit

36910
28:07:29,040 --> 28:07:34,800
la um

36911
28:07:32,000 --> 28:07:40,040
uh, obțineți singura noastră codificare fierbinte.

36912
28:07:34,800 --> 28:07:40,040
Deci aceasta este codificarea noastră fierbinte aici.

36913
28:07:42,800 --> 28:07:48,080
Acum vom avea date care sunt

36914
28:07:45,832 --> 28:07:50,960
asa, nu? Deci avem ocean. Deci

36915
28:07:48,080 --> 28:07:54,232
Deci, apropo, acest prefix

36916
28:07:50,960 --> 28:07:56,872
um, acest prefix este OP, care este

36917
28:07:54,232 --> 28:07:59,680
prescurtare pentru apropierea oceanului, nu? Deci noi

36918
28:07:56,872 --> 28:08:02,160
au apropierea oceanului mai puțin de 1 oră

36919
28:07:59,680 --> 28:08:04,872
de la ocean, apropierea oceanului în interior,

36920
28:08:02,160 --> 28:08:07,280
insulă aproape de ocean, lângă golf, aproape

36921
28:08:04,872 --> 28:08:10,320
ocean. Deci primele cinci rânduri sunt aproape

36922
28:08:07,280 --> 28:08:12,720
golful. Hm, deci au unul acolo și

36923
28:08:10,320 --> 28:08:15,192
un zero în celelalte locuri. Deci asta este

36924
28:08:12,720 --> 28:08:19,832
bine. Acesta codifică această caracteristică

36925
28:08:15,192 --> 28:08:21,760
în aceste valori numerice uh,

36926
28:08:19,832 --> 28:08:24,080
nu?

36927
28:08:21,760 --> 28:08:27,232
Ați reușit să o conduceți? ei

36928
28:08:24,080 --> 28:08:27,232
obține manechine.

36929
28:08:31,512 --> 28:08:35,040
Deci motivul pentru care Da, e grozav

36930
28:08:33,280 --> 28:08:38,800
întrebare. Cum a mers în apropierea oceanului?

36931
28:08:35,040 --> 28:08:41,280
Pentru că asta e singurul

36932
28:08:38,800 --> 28:08:43,280
caracteristica șir pe care o avem. Asta e singurul

36933
28:08:41,280 --> 28:08:45,680
una pe care o avem. Deci o să arate

36934
28:08:43,280 --> 28:08:47,680
pentru orice non-numerice și unul fierbinte

36935
28:08:45,680 --> 28:08:51,040
codifica pe acelea oricat de multe oricat de multe

36936
28:08:47,680 --> 28:08:52,720
există. Deci orice obiecte avem

36937
28:08:51,040 --> 28:08:57,160
care sunt șiruri, va fi

36938
28:08:52,720 --> 28:08:57,160
automat oneh fierbinte le codifică.

36939
28:09:03,360 --> 28:09:07,680
Da, am putea avea dreptate. Am putea avea

36940
28:09:05,040 --> 28:09:11,120
a mers aici și a făcut bine. Am putea avea

36941
28:09:07,680 --> 28:09:13,760
făcut ocean

36942
28:09:11,120 --> 28:09:17,040
apropiere,

36943
28:09:13,760 --> 28:09:18,552
dar avem doar una dintre aceste caracteristici.

36944
28:09:17,040 --> 28:09:20,800
Așa că doar va face asta

36945
28:09:18,552 --> 28:09:23,360
întreg cadrul de date

36946
28:09:20,800 --> 28:09:26,800
pe acea caracteristică. Deci ceea ce suntem

36947
28:09:23,360 --> 28:09:30,800
o să faci este să mergi înainte și să-l împarte

36948
28:09:26,800 --> 28:09:34,160
într-un x și un y um care este x

36949
28:09:30,800 --> 28:09:35,760
întotdeauna ceea ce include caracteristicile noastre. y

36950
28:09:34,160 --> 28:09:40,080
este ceea ce încercăm să prevedem care

36951
28:09:35,760 --> 28:09:41,600
este eticheta. Acum, um, pentru a

36952
28:09:40,080 --> 28:09:44,480
separați-le, ceea ce vom face

36953
28:09:41,600 --> 28:09:48,800
do este alocarea lui X pentru a fi variabila care

36954
28:09:44,480 --> 28:09:50,800
este, um, cadrul nostru de date minus această mediană

36955
28:09:48,800 --> 28:09:55,120
coloana valorii casei. Deci ce este asta

36956
28:09:50,800 --> 28:09:57,600
a face este um uh nu este permanent

36957
28:09:55,120 --> 28:10:01,360
scăpăm pentru că nu scăpăm

36958
28:09:57,600 --> 28:10:04,480
este pe loc, dar ne întoarce a

36959
28:10:01,360 --> 28:10:06,872
copie a cadrului de date cu mediana

36960
28:10:04,480 --> 28:10:09,280
coloana valoarea casei stânga afară dreapta este

36961
28:10:06,872 --> 28:10:11,440
scăpat. Deci asta e ceva

36962
28:10:09,280 --> 28:10:14,000
vrem să facem pentru că asta va fi restul

36963
28:10:11,440 --> 28:10:18,960
din acesta va conține caracteristicile noastre corect.

36964
28:10:14,000 --> 28:10:24,640
Deci, asta va fi temporar sau ar trebui

36965
28:10:18,960 --> 28:10:28,720
spuneți să returnați o copie a DF cu um

36966
28:10:24,640 --> 28:10:30,960
valoarea medie a casei

36967
28:10:28,720 --> 28:10:33,912
a scapat,

36968
28:10:30,960 --> 28:10:37,192
nu? Valoarea medie a casei a scăzut. Um asa

36969
28:10:33,912 --> 28:10:38,872
mergem înainte și renunțăm la asta. Uh acum

36970
28:10:37,192 --> 28:10:41,280
amintiți-vă că nu este permanent. Este doar

36971
28:10:38,872 --> 28:10:44,480
dându-ne uh restul care

36972
28:10:41,280 --> 28:10:46,720
sunt aceste date despre locuințe. scăpând asta și

36973
28:10:44,480 --> 28:10:49,120
este atribuirea asta lui X și apoi suntem

36974
28:10:46,720 --> 28:10:52,000
luând valoarea medie reală a casei

36975
28:10:49,120 --> 28:10:53,912
coloană din datele originale și

36976
28:10:52,000 --> 28:10:57,440
atribuindu-i-o lui Y. Deci asta se va

36977
28:10:53,912 --> 28:11:02,400
fii etichetele noastre,

36978
28:10:57,440 --> 28:11:05,192
nu? Deci asta este ceea ce încercăm

36979
28:11:02,400 --> 28:11:07,360
prezice.

36980
28:11:05,192 --> 28:11:10,000
Bine, deci acesta este Y-ul nostru și așa este întotdeauna

36981
28:11:07,360 --> 28:11:12,552
cum este. X este caracteristicile noastre, Y este a noastră

36982
28:11:10,000 --> 28:11:15,280
etichete. Sper că are sens.

36983
28:11:12,552 --> 28:11:17,600
Ceea ce face acest lucru este asta

36984
28:11:15,280 --> 28:11:19,912
scapa de coloana aceea de etichete si

36985
28:11:17,600 --> 28:11:22,232
orice altceva vor fi caracteristicile noastre și

36986
28:11:19,912 --> 28:11:26,320
atunci aceasta va scăpa de această voință doar

36987
28:11:22,232 --> 28:11:28,960
atribuiți coloana etichetei lui Y.

36988
28:11:26,320 --> 28:11:32,000
În regulă. Și atunci ceea ce putem face este

36989
28:11:28,960 --> 28:11:34,800
treceți X și Y în diviziunea noastră de testare a trenului

36990
28:11:32,000 --> 28:11:36,872
funcția și aceasta va genera reținerea

36991
28:11:34,800 --> 28:11:39,192
out set. Deci dacă vrem să facem hold

36992
28:11:36,872 --> 28:11:41,512
validarea încrucișată, așa este

36993
28:11:39,192 --> 28:11:45,360
Ar face asta este că am împărți datele

36994
28:11:41,512 --> 28:11:48,232
în X tren X test Y tren Y test um

36995
28:11:45,360 --> 28:11:51,440
folosind divizarea testului de tren. Deci asta este ceea ce

36996
28:11:48,232 --> 28:11:58,720
am facut ultima data. Acesta ar fi asta

36997
28:11:51,440 --> 28:12:03,120
ar fi pentru validarea încrucișată

36998
28:11:58,720 --> 28:12:06,552
chiar acolo unde suntem uh uh doar ai asta

36999
28:12:03,120 --> 28:12:08,640
un set pentru a testa un set pentru uh

37000
28:12:06,552 --> 28:12:11,600
un set pentru antrenament un test un set

37001
28:12:08,640 --> 28:12:14,080
pentru testare ar trebui să spun corect așadar asta

37002
28:12:11,600 --> 28:12:16,720
este un test de tren destul de standard

37003
28:12:14,080 --> 28:12:18,800
trecem în acel x trecem în y we

37004
28:12:16,720 --> 28:12:19,600
utilizați o dimensiune de test de 30%, care este destul

37005
28:12:18,800 --> 28:12:21,440
standard

37006
28:12:19,600 --> 28:12:23,280
și stare aleatorie astfel încât să obținem

37007
28:12:21,440 --> 28:12:26,800
amestecare consistentă dacă ar fi să alergăm

37008
28:12:23,280 --> 28:12:30,232
asta de mai multe ori. Am înțeles asta

37009
28:12:26,800 --> 28:12:31,832
uh randomizare consistentă.

37010
28:12:30,232 --> 28:12:36,000
bine,

37011
28:12:31,832 --> 28:12:39,760
deci avem asta și acum trenul nostru X

37012
28:12:36,000 --> 28:12:44,400
este un procentaj um din cadrul de date al

37013
28:12:39,760 --> 28:12:46,960
cele 20.000 de rânduri și testul X este uh

37014
28:12:44,400 --> 28:12:48,960
30% din asta. Deci sunt doar aproximativ 6.000

37015
28:12:46,960 --> 28:12:51,960
rânduri, care este forma aia

37016
28:12:48,960 --> 28:12:51,960
este.

37017
28:12:52,080 --> 28:12:57,440
Da. X. Deci X sunt caracteristicile noastre. Deci suntem

37018
28:12:55,120 --> 28:13:01,120
punem toate datele noastre în asta

37019
28:12:57,440 --> 28:13:05,040
caracteristicile noastre în X. Și astfel, um

37020
28:13:01,120 --> 28:13:06,872
cel mai eficient mod de a face asta este um

37021
28:13:05,040 --> 28:13:08,400
cel mai eficient mod de a face asta este

37022
28:13:06,872 --> 28:13:12,080
la

37023
28:13:08,400 --> 28:13:13,680
luați-ne datele și aruncați

37024
28:13:12,080 --> 28:13:16,232
coloana cu valoarea medie a casei pentru că asta este

37025
28:13:13,680 --> 28:13:18,320
coloana noastră de etichete. Deci doar scoatem

37026
28:13:16,232 --> 28:13:20,552
că. Restul datelor sunt ale noastre

37027
28:13:18,320 --> 28:13:22,232
caracteristici. Deci asta este ceea ce

37028
28:13:20,552 --> 28:13:24,800
acest X este, nu? Este totul al nostru

37029
28:13:22,232 --> 28:13:27,040
date caracteristice. Toate coloanele noastre, adică

37030
28:13:24,800 --> 28:13:30,080
nu coloana de etichete este în esență ceea ce

37031
28:13:27,040 --> 28:13:34,480
asta face. Și apoi Y este eticheta noastră

37032
28:13:30,080 --> 28:13:38,080
coloană din datele noastre originale,

37033
28:13:34,480 --> 28:13:41,040
nu? Y este coloana noastră de etichete. Și așa

37034
28:13:38,080 --> 28:13:44,400
aceasta va conține toate noastre

37035
28:13:41,040 --> 28:13:47,912
etichete care este valoarea mediană a casei.

37036
28:13:44,400 --> 28:13:50,800
X X conține fiecare coloană, cu excepția uneia

37037
28:13:47,912 --> 28:13:54,872
vom merge așa că în cele din urmă

37038
28:13:50,800 --> 28:13:57,912
decide că dar X conține um X este

37039
28:13:54,872 --> 28:14:00,400
tot ceea ce nu este dependent de noi

37040
28:13:57,912 --> 28:14:02,400
variabilă care este ceea ce prezicem.

37041
28:14:00,400 --> 28:14:04,720
Deci eliminăm ceea ce încercăm

37042
28:14:02,400 --> 28:14:06,720
prezice de la X. X ar trebui să fie totul

37043
28:14:04,720 --> 28:14:09,680
altfel. Așa va fi întotdeauna

37044
28:14:06,720 --> 28:14:12,320
fii. X este X va fi întotdeauna tot

37045
28:14:09,680 --> 28:14:15,912
acele variabile independente pe care le suntem

37046
28:14:12,320 --> 28:14:18,400
folosind pentru a prezice valoarea medie a casei.

37047
28:14:15,912 --> 28:14:20,232
Deci vom prezice mediana

37048
28:14:18,400 --> 28:14:22,160
valoarea casei. Trebuie să-l scoatem din

37049
28:14:20,232 --> 28:14:24,480
X.

37050
28:14:22,160 --> 28:14:28,120
Deci luăm totul, dar

37051
28:14:24,480 --> 28:14:28,120
acea coloană.

37052
28:14:29,912 --> 28:14:35,120
Deci este întregul cadru de date. Este

37053
28:14:32,080 --> 28:14:39,720
întreg cadrul de date minus această coloană

37054
28:14:35,120 --> 28:14:39,720
doar cu variabila dependentă. Corect.

37055
28:14:39,760 --> 28:14:42,000
Exact corect. Înlăturarea dependentului

37056
28:14:41,120 --> 28:14:44,720
variabilă și păstrând toate cele

37057
28:14:42,000 --> 28:14:47,512
independenţă. Este exact.

37058
28:14:44,720 --> 28:14:49,040
Exact corect. Deci gândește-te la asta

37059
28:14:47,512 --> 28:14:50,640
termenii modelului. Să ne întoarcem la

37060
28:14:49,040 --> 28:14:53,832
caracteristici. Corect. Gândește-te la asta în termeni

37061
28:14:50,640 --> 28:14:57,040
a modelului. Încercăm să anticipăm

37062
28:14:53,832 --> 28:15:00,000
aceasta aceasta valoare. Construim un model

37063
28:14:57,040 --> 28:15:04,160
pentru a încerca să prezic asta. Deci mergem

37064
28:15:00,000 --> 28:15:07,440
pentru a te asigura că x este totul, în afară de asta

37065
28:15:04,160 --> 28:15:09,832
corect. Deci acesta este de fapt doar y.

37066
28:15:07,440 --> 28:15:12,640
Asta e eticheta noastră. Asta e dependenta noastră

37067
28:15:09,832 --> 28:15:15,912
variabilă. Corect? Asta e y. Totul

37068
28:15:12,640 --> 28:15:21,160
restul este aparține lui x. Orice altceva

37069
28:15:15,912 --> 28:15:21,160
aparține lui x incluzând toate acestea.

37070
28:15:22,800 --> 28:15:26,080
Corect? Îl alegem pe acesta să fie y

37071
28:15:24,800 --> 28:15:29,760
pentru că construim un model pentru

37072
28:15:26,080 --> 28:15:32,400
prezice asta. Asta e eticheta noastră.

37073
28:15:29,760 --> 28:15:34,720
În regulă. Deci, avem noi folosim X și

37074
28:15:32,400 --> 28:15:37,512
Y pentru a face testul de tren. Deci, noi

37075
28:15:34,720 --> 28:15:38,872
au caracteristicile noastre de antrenament și ale noastre

37076
28:15:37,512 --> 28:15:42,080
funcțiile de testare și apoi antrenamentul nostru

37077
28:15:38,872 --> 28:15:44,640
etichetă și etichete de testare aici. Um, drăguță

37078
28:15:42,080 --> 28:15:47,120
standard acolo.

37079
28:15:44,640 --> 28:15:50,232
Bine. Deci, asta este noutatea dacă

37080
28:15:47,120 --> 28:15:52,800
vrem să facem validare k-fold uh, ce

37081
28:15:50,232 --> 28:15:54,872
vom face este să creăm un kfold

37082
28:15:52,800 --> 28:15:57,512
obiect. Deci, avem acest kfold de la

37083
28:15:54,872 --> 28:16:02,080
scikitlearn pe care l-am importat deja. noi

37084
28:15:57,512 --> 28:16:04,400
vom crea un kfold um unde noi

37085
28:16:02,080 --> 28:16:07,360
vom specifica câte pliuri avem

37086
28:16:04,400 --> 28:16:10,960
vreau. Deci asta este in uh inslits

37087
28:16:07,360 --> 28:16:14,232
parametru așa cum spune asta, asta merge

37088
28:16:10,960 --> 28:16:16,640
să fie uh uh în acest caz vom merge

37089
28:16:14,232 --> 28:16:18,960
face 10 pliuri. Este destul de standard. Deci

37090
28:16:16,640 --> 28:16:20,800
Cred că numărul tipic de pliuri care

37091
28:16:18,960 --> 28:16:24,232
Am văzut și am lucrat în interiorul meu

37092
28:16:20,800 --> 28:16:29,120
cariera mea este de obicei cinci sau zece.

37093
28:16:24,232 --> 28:16:31,440
Cinci sau 10 pliuri este standardul.

37094
28:16:29,120 --> 28:16:33,680
Bine. Deci, facem 10 falduri în asta

37095
28:16:31,440 --> 28:16:35,832
caz și setăm o stare aleatorie

37096
28:16:33,680 --> 28:16:37,440
pentru că o să facem amestecare. Deci,

37097
28:16:35,832 --> 28:16:39,120
pentru a produce acele pliuri, suntem

37098
28:16:37,440 --> 28:16:42,000
mergând să amestecați mai întâi datele și apoi

37099
28:16:39,120 --> 28:16:44,232
împărțiți-l în cinci ori, nu? Deci,

37100
28:16:42,000 --> 28:16:48,960
acest obiect kffold va fi

37101
28:16:44,232 --> 28:16:50,960
reușiți să creați aceste divizări pentru noi,

37102
28:16:48,960 --> 28:16:53,192
nu? Acestea chiar se despart. eu stiu eu

37103
28:16:50,960 --> 28:16:55,512
nici măcar nu l-am desenat, dar merge

37104
28:16:53,192 --> 28:16:57,192
să gestioneze aceste cinci pliuri pentru noi și

37105
28:16:55,512 --> 28:16:59,680
va amesteca datele și

37106
28:16:57,192 --> 28:17:01,440
atribuie-le acestor pliuri diferite și

37107
28:16:59,680 --> 28:17:04,232
suntem și atunci ceea ce vom face este

37108
28:17:01,440 --> 28:17:05,512
folosiți-le pentru a ne antrena.

37109
28:17:04,232 --> 28:17:09,832
Vom executa crucea

37110
28:17:05,512 --> 28:17:12,552
validare folosind acest obiect kfold.

37111
28:17:09,832 --> 28:17:15,832
Bine, așa că creăm kfoldul

37112
28:17:12,552 --> 28:17:18,160
inițializam și modelul nostru. Deci,

37113
28:17:15,832 --> 28:17:20,000
desigur, pentru a antrena ceva

37114
28:17:18,160 --> 28:17:22,080
uh, în pliurile K, vom avea nevoie de un

37115
28:17:20,000 --> 28:17:24,232
model. În acest caz, folosim liniar

37116
28:17:22,080 --> 28:17:26,552
regresie, nu? Care este care este

37117
28:17:24,232 --> 28:17:29,360
modelul pe care l-am studiat până acum. Deci,

37118
28:17:26,552 --> 28:17:31,760
ai o regresie liniară. Hm acum,

37119
28:17:29,360 --> 28:17:34,480
uite ce usor va fi in ordine

37120
28:17:31,760 --> 28:17:38,800
pentru a executa validarea încrucișată. Tot ce ne trebuie

37121
28:17:34,480 --> 28:17:42,080
a face este um tot ce trebuie să facem este să creăm

37122
28:17:38,800 --> 28:17:44,160
o funcție de scor încrucișat pentru fișiere

37123
28:17:42,080 --> 28:17:46,480
um sau ar trebui să spun că folosiți fișierul încrucișat

37124
28:17:44,160 --> 28:17:48,640
funcția de scor de la scikitlearn. Deci noi

37125
28:17:46,480 --> 28:17:51,832
folosiți asta cu modelul pe care vrem

37126
28:17:48,640 --> 28:17:54,232
tren. Deci modelul nostru merge primul. Deci

37127
28:17:51,832 --> 28:17:57,192
acesta este obiectul de regresie liniară.

37128
28:17:54,232 --> 28:18:00,320
Apoi datele noastre. Deci, caracteristicile noastre suplimentare

37129
28:17:57,192 --> 28:18:03,192
și eticheta noastră pentru formarea noastră.

37130
28:18:00,320 --> 28:18:05,040
Și apoi lasă-mă să trec peste asta pentru a

37131
28:18:03,192 --> 28:18:10,960
al doilea. Voi explica ce este asta într-un

37132
28:18:05,040 --> 28:18:12,720
al doilea. Hm, dar apoi folosim uh

37133
28:18:10,960 --> 28:18:14,800
tehnica de validare încrucișată este a noastră

37134
28:18:12,720 --> 28:18:17,512
K-fold. Deci aici este locul nostru K-fold

37135
28:18:14,800 --> 28:18:20,000
obiectul merge în parametrul CV care este

37136
28:18:17,512 --> 28:18:21,832
validare încrucișată. Deci ce cruce

37137
28:18:20,000 --> 28:18:24,400
strategia de validare folositi? Suntem

37138
28:18:21,832 --> 28:18:27,280
folosind Kfold și K-fold pe care îl folosim

37139
28:18:24,400 --> 28:18:29,600
acesta este cel pe care l-am definit aici KF. Deci

37140
28:18:27,280 --> 28:18:34,160
punem asta chiar aici pentru asta.

37141
28:18:29,600 --> 28:18:36,000
Și apoi în locuri de muncă ne permite

37142
28:18:34,160 --> 28:18:38,160
paralelizează acest lucru. Deci, dacă îl setăm

37143
28:18:36,000 --> 28:18:41,192
unul negativ care este că asta este

37144
28:18:38,160 --> 28:18:43,512
implicit um, o va face de fapt

37145
28:18:41,192 --> 28:18:46,480
antrenați-vă prin diferite combinații

37146
28:18:43,512 --> 28:18:48,000
în paralel um care o accelerează. Deci

37147
28:18:46,480 --> 28:18:52,720
vrei să vrei să păstrezi asta

37148
28:18:48,000 --> 28:18:55,280
unul negativ dacă poți. Deci acum lasă

37149
28:18:52,720 --> 28:19:00,160
descriu punctajul. Deci ce asta

37150
28:18:55,280 --> 28:19:03,192
înseamnă că am introdus în metrica noastră aici. Hm

37151
28:19:00,160 --> 28:19:06,080
și astfel puteți pune o eroare absolută,

37152
28:19:03,192 --> 28:19:09,360
puteți introduce o eroare pătrată medie. Hm

37153
28:19:06,080 --> 28:19:11,760
acestea sunt cele două pe care le putem folosi. Şi

37154
28:19:09,360 --> 28:19:15,120
um motivul pentru care are un negativ

37155
28:19:11,760 --> 28:19:19,040
în fața ei este pentru că vrem să găsim

37156
28:19:15,120 --> 28:19:21,440
cel care are cel mai mic punctaj.

37157
28:19:19,040 --> 28:19:24,000
Acesta va fi cel mai bun model al nostru este

37158
28:19:21,440 --> 28:19:26,720
unul care are cel mai mic punctaj. Deci, noi

37159
28:19:24,000 --> 28:19:29,040
ia valoarea absolută.

37160
28:19:26,720 --> 28:19:32,552
Îmi pare rău. Luăm abdomenul și

37161
28:19:29,040 --> 28:19:36,320
metrică și luăm negativul acesteia.

37162
28:19:32,552 --> 28:19:39,512
Pentru că cel mai mare punctaj este

37163
28:19:36,320 --> 28:19:41,760
va fi cel mai aproape de zero. Um asa

37164
28:19:39,512 --> 28:19:44,800
este doar un noi folosim noi folosim

37165
28:19:41,760 --> 28:19:47,512
negativ al metricii. Hm

37166
28:19:44,800 --> 28:19:50,872
pentru că pe linia numerică ca și

37167
28:19:47,512 --> 28:19:53,832
cel mai mare punctaj um ar trebui să fie

37168
28:19:50,872 --> 28:19:55,760
cel puțin um sau ar trebui să spun maxim

37169
28:19:53,832 --> 28:19:57,512
negativ pe care îl putem obține. Asta merge

37170
28:19:55,760 --> 28:20:00,720
să fie cel mai aproape de zero. Deci dacă aici e

37171
28:19:57,512 --> 28:20:04,080
zero, acesta va fi ca și cum -1 este mai bine

37172
28:20:00,720 --> 28:20:08,480
decât -10. Corect? Deci ceva care

37173
28:20:04,080 --> 28:20:12,400
punctează um maximul negativ uh

37174
28:20:08,480 --> 28:20:14,800
eroarea absolută ar fi cea mai apropiată de zero.

37175
28:20:12,400 --> 28:20:17,120
Și ceva care are mai mult se va întâmpla

37176
28:20:14,800 --> 28:20:19,440
fi de partea asta.

37177
28:20:17,120 --> 28:20:22,960
Deci acesta este doar motivul pentru care avem nevoie de asta

37178
28:20:19,440 --> 28:20:27,760
este doar pentru a ține evidența scorurilor

37179
28:20:22,960 --> 28:20:29,832
de fiecare individ um fold. Bine.

37180
28:20:27,760 --> 28:20:31,832
Deci, motivul pentru care putem face asta

37181
28:20:29,832 --> 28:20:35,512
este la sfârșit putem să vedem care

37182
28:20:31,832 --> 28:20:37,360
care combinație a funcționat cel mai bine. um

37183
28:20:35,512 --> 28:20:41,040
va fi cel care are

37184
28:20:37,360 --> 28:20:45,080
cea mai mare uh cea mai mare valoare a negativului

37185
28:20:41,040 --> 28:20:45,080
care este cel mai aproape de zero.

37186
28:20:48,800 --> 28:20:54,000
Asta e doar o convenție.

37187
28:20:51,440 --> 28:20:56,000
Da, doar pentru că este pentru că

37188
28:20:54,000 --> 28:20:58,400
validarea încrucișată urmărește

37189
28:20:56,000 --> 28:21:00,640
maximizați metrica. Deci, orice are

37190
28:20:58,400 --> 28:21:03,120
cel mai bun punctaj

37191
28:21:00,640 --> 28:21:05,912
oricine are cel mai bun punctaj este

37192
28:21:03,120 --> 28:21:09,120
considerată cea mai bună performanță. Hm

37193
28:21:05,912 --> 28:21:11,760
dar folosim ceva unde

37194
28:21:09,120 --> 28:21:13,600
mai jos este mai bine. Deci luăm

37195
28:21:11,760 --> 28:21:17,280
negativ și ca cel mai înalt

37196
28:21:13,600 --> 28:21:18,960
negativ ar fi cel mai aproape de zero,

37197
28:21:17,280 --> 28:21:22,600
nu? Cel mai mare negativ va fi

37198
28:21:18,960 --> 28:21:22,600
fi cel mai aproape de zero.

37199
28:21:22,872 --> 28:21:29,680
Așa că așa este, doar pentru că place

37200
28:21:25,360 --> 28:21:32,552
dorim ca scorul mai mic să fie cel mai bun.

37201
28:21:29,680 --> 28:21:36,720
Cel mai mic scor ar trebui să fie cel mai bun.

37202
28:21:32,552 --> 28:21:38,552
Deci luăm negativul. Hm și așa

37203
28:21:36,720 --> 28:21:43,832
ceva mai negativ se întâmplă

37204
28:21:38,552 --> 28:21:45,832
sa fie mai rau. Da, acesta este motivul.

37205
28:21:43,832 --> 28:21:47,680
Deci ceva care este în jos în acest fel este

37206
28:21:45,832 --> 28:21:51,192
va fi mai rau.

37207
28:21:47,680 --> 28:21:53,360
Bine. Deci rulează asta

37208
28:21:51,192 --> 28:21:55,440
și ceea ce puteți vedea este dacă noi de fapt

37209
28:21:53,360 --> 28:21:57,440
tipărim asta, dacă tipărim

37210
28:21:55,440 --> 28:22:00,680
Scoruri de k-fold, ceea ce ar trebui să obținem este 10

37211
28:21:57,440 --> 28:22:00,680
scoruri diferite.

37212
28:22:01,192 --> 28:22:07,192
Și puteți vedea că avem 10 diferite

37213
28:22:04,640 --> 28:22:08,800
uh scoruri aici, care sunt toate negative

37214
28:22:07,192 --> 28:22:12,480
pentru că luăm negativul

37215
28:22:08,800 --> 28:22:17,280
absolut al erorii absolute medii. Hm

37216
28:22:12,480 --> 28:22:20,000
deci ceea ce am căuta aici este

37217
28:22:17,280 --> 28:22:22,232
um, vrem să luăm media acestora

37218
28:22:20,000 --> 28:22:24,720
scoruri dar iau valoarea absolută a

37219
28:22:22,232 --> 28:22:26,872
pentru a obține cele mai bune performanțe. Deci

37220
28:22:24,720 --> 28:22:29,360
aceasta este capturarea ca acesta este scorul

37221
28:22:26,872 --> 28:22:30,800
pe prima combinație de pliuri. Aceasta este

37222
28:22:29,360 --> 28:22:32,960
scorul de pe al doilea fold

37223
28:22:30,800 --> 28:22:35,600
combinație. Acesta este scorul pe

37224
28:22:32,960 --> 28:22:38,320
a treia combinație de ori și mai departe și mai departe și

37225
28:22:35,600 --> 28:22:42,400
pe. Și acestea sunt erorile absolute.

37226
28:22:38,320 --> 28:22:45,360
Bine, acestea sunt erorile absolute. um,

37227
28:22:42,400 --> 28:22:47,192
deci dacă ne uităm la calculul uh

37228
28:22:45,360 --> 28:22:49,120
medie, care apropo, nu avem nevoie

37229
28:22:47,192 --> 28:22:52,640
acest import pentru că folosim

37230
28:22:49,120 --> 28:22:55,680
medie numpy. Deci e bine. Hm, noi

37231
28:22:52,640 --> 28:23:00,640
poate lua valoarea absolută a acelor um

37232
28:22:55,680 --> 28:23:04,232
și aruncați o privire asupra MSE medie

37233
28:23:00,640 --> 28:23:07,360
sau scuze MAE. Acum vreau să te gândești

37234
28:23:04,232 --> 28:23:09,360
despre asta această performanță medie.

37235
28:23:07,360 --> 28:23:11,360
Deci aceasta este performanța noastră chiar aici

37236
28:23:09,360 --> 28:23:13,760
validarea încrucișată.

37237
28:23:11,360 --> 28:23:16,800
Aceasta este media noastră

37238
28:23:13,760 --> 28:23:18,400
M AE în toată țara noastră

37239
28:23:16,800 --> 28:23:21,440
combinatii. Deci asta este un

37240
28:23:18,400 --> 28:23:24,480
indicator al performanței noastre, nu? Hm

37241
28:23:21,440 --> 28:23:29,192
pentru validarea încrucișată.

37242
28:23:24,480 --> 28:23:33,760
Acum care sunt unitățile originalului nostru

37243
28:23:29,192 --> 28:23:36,872
uh, valoarea mediană inițială? Ei sunt

37244
28:23:33,760 --> 28:23:40,080
deja în mii, nu? Deci dacă

37245
28:23:36,872 --> 28:23:43,600
mergem la acea funcție, sunt deja

37246
28:23:40,080 --> 28:23:48,000
în aceste sute de mii. Deci asta

37247
28:23:43,600 --> 28:23:50,232
nu este o eroare foarte bună. Este amabil

37248
28:23:48,000 --> 28:23:52,232
de mare, nu? Pentru că este în asta

37249
28:23:50,232 --> 28:23:55,360
49.000.

37250
28:23:52,232 --> 28:23:59,760
Um, atât de departe suntem

37251
28:23:55,360 --> 28:24:02,720
valoarea absolută în medie este de 49.000 um

37252
28:23:59,760 --> 28:24:06,480
dolari pe valoarea mediană. Nu este

37253
28:24:02,720 --> 28:24:09,040
foarte bine. Deci acest scor

37254
28:24:06,480 --> 28:24:12,400
acest scor este

37255
28:24:09,040 --> 28:24:14,552
nu foarte bine. Deci acest model nu este

37256
28:24:12,400 --> 28:24:17,760
făcând atât de bine și putem vedea asta

37257
28:24:14,552 --> 28:24:22,320
comparând această eroare cu a noastră reală

37258
28:24:17,760 --> 28:24:25,680
date. Deci asta este în jur de 50.000

37259
28:24:22,320 --> 28:24:28,720
și valorile medii ale casei noastre sunt în

37260
28:24:25,680 --> 28:24:31,360
sutele de mii. Deci, în medie

37261
28:24:28,720 --> 28:24:34,640
avem 50.000 de reduceri când facem o

37262
28:24:31,360 --> 28:24:36,232
predictie. Aceasta este o sumă semnificativă,

37263
28:24:34,640 --> 28:24:39,512
nu? Aceasta este o sumă semnificativă

37264
28:24:36,232 --> 28:24:43,512
medie, atunci când sunt datele noastre

37265
28:24:39,512 --> 28:24:46,400
despre sutele de mii de aici.

37266
28:24:43,512 --> 28:24:49,440
Deci suntem um avem un semnificativ

37267
28:24:46,400 --> 28:24:52,000
cantitatea de eroare 50.000 în raport cu h

37268
28:24:49,440 --> 28:24:54,640
la unitățile noastre în care se află datele noastre.

37269
28:24:52,000 --> 28:24:57,512
nu? Deci acest scor nu este foarte

37270
28:24:54,640 --> 28:24:59,120
bine. Hm

37271
28:24:57,512 --> 28:25:00,720
și așa vedem că de pe cruce

37272
28:24:59,120 --> 28:25:03,040
validare. Deci uite ce usoara este crucea

37273
28:25:00,720 --> 28:25:04,800
valabil este. Din nou, facem doar fișiere încrucișate

37274
28:25:03,040 --> 28:25:08,000
scor. Am pus în modelul nostru. Am pus

37275
28:25:04,800 --> 28:25:10,960
datele noastre. Am introdus validarea încrucișată

37276
28:25:08,000 --> 28:25:13,040
uh strategie aici care este kfold. Iar noi

37277
28:25:10,960 --> 28:25:15,360
poate genera aceste valori pentru toate

37278
28:25:13,040 --> 28:25:17,280
combinațiile de pliuri. Deci asta este

37279
28:25:15,360 --> 28:25:19,680
funcția se ocupă de rotație

37280
28:25:17,280 --> 28:25:22,480
acelea și făcând fiecare combo cu doar

37281
28:25:19,680 --> 28:25:25,040
cele 10 combinații diferite de aici

37282
28:25:22,480 --> 28:25:26,800
cel al pliurilor.

37283
28:25:25,040 --> 28:25:28,232
10 cazuri diferite în care aveți

37284
28:25:26,800 --> 28:25:30,960
știi că 10 pliuri diferite sunt cele

37285
28:25:28,232 --> 28:25:33,192
care sunt lăsate în afara evaluării.

37286
28:25:30,960 --> 28:25:35,912
Um, deci gestionează asta pentru noi

37287
28:25:33,192 --> 28:25:42,552
aceste date folosind aceste date de antrenament

37288
28:25:35,912 --> 28:25:46,192
aici. Um și noi uh le generăm

37289
28:25:42,552 --> 28:25:46,192
generează aceste scoruri.

37290
28:25:46,640 --> 28:25:52,720
Bine. Deci asta este kf fold. Nu e greu

37291
28:25:48,800 --> 28:25:54,800
a face. Tot ce trebuie să faci este să folosești

37292
28:25:52,720 --> 28:25:57,192
un scor de fișier încrucișat. Și ne-am putea schimba

37293
28:25:54,800 --> 28:25:58,480
asta înseamnă o eroare pătrată. Ăsta ești tu

37294
28:25:57,192 --> 28:26:03,440
știm că am putea face și asta. That'd be

37295
28:25:58,480 --> 28:26:05,120
pretty easy. Hm, deci nu ar fi nicio problemă.

37296
28:26:03,440 --> 28:26:07,280
Se întâmplă să folosim absolutul

37297
28:26:05,120 --> 28:26:09,600
eroare aici. Of course, we could use

37298
28:26:07,280 --> 28:26:12,080
squared error.

37299
28:26:09,600 --> 28:26:14,640
Ați reușit să faceți asta să ruleze?

37300
28:26:12,080 --> 28:26:17,120
K-fold scores.

37301
28:26:14,640 --> 28:26:19,040
Produce o matrice de 10 10 diferite

37302
28:26:17,120 --> 28:26:21,360
scoruri, care ar trebui să aibă sens deoarece

37303
28:26:19,040 --> 28:26:23,360
acestea sunt acestea sunt um noi suntem

37304
28:26:21,360 --> 28:26:25,360
împărțirea datelor noastre în 10 diferite

37305
28:26:23,360 --> 28:26:27,680
folds,

37306
28:26:25,360 --> 28:26:29,832
nu?

37307
28:26:27,680 --> 28:26:31,912
10 different folds. than leaving one out

37308
28:26:29,832 --> 28:26:33,512
pentru a ne face evaluarea. Deci cel care

37309
28:26:31,912 --> 28:26:35,832
este lăsat afară de fiecare dată este ceea ce este

37310
28:26:33,512 --> 28:26:37,360
producerea acestor scoruri. Deci este 10

37311
28:26:35,832 --> 28:26:41,232
diferiți sunt lăsați afară când noi

37312
28:26:37,360 --> 28:26:41,232
rotiți prin toate combinațiile.

37313
28:26:42,232 --> 28:26:46,760
Și astfel facem media acestor scoruri

37314
28:26:51,360 --> 28:26:58,360
și primim această sumă. Ne ocupăm

37315
28:26:53,192 --> 28:26:58,360
50.000 de erori în medie.

37316
28:27:02,480 --> 28:27:05,512
Um, ce crezi că ar fi ceea ce faci

37317
28:27:04,232 --> 28:27:07,832
crezi ca ar fi acceptabil? Deci, dacă

37318
28:27:05,512 --> 28:27:09,440
dacă prezicem prețul, de exemplu

37319
28:27:07,832 --> 28:27:12,232
dacă suntem agent imobiliar și suntem

37320
28:27:09,440 --> 28:27:14,720
prezicerea acestor preţuri şi ele

37321
28:27:12,232 --> 28:27:16,160
de obicei sunt

37322
28:27:14,720 --> 28:27:18,400
Da, aproape de zero ar fi grozav.

37323
28:27:16,160 --> 28:27:20,320
Ar fi fantastic. Mai aproape de zero

37324
28:27:18,400 --> 28:27:23,320
ar fi mai bine. Media este um

37325
28:27:20,320 --> 28:27:23,320
206.000.

37326
28:27:23,760 --> 28:27:29,360
Deci 50.000 este un procent decent din

37327
28:27:26,400 --> 28:27:32,400
că. Ca să știi că o poți calcula

37328
28:27:29,360 --> 28:27:35,680
drept procentual. Deci 50.000 este a

37329
28:27:32,400 --> 28:27:38,480
procent decent din asta. Hm, probabil

37330
28:27:35,680 --> 28:27:43,280
vrei ca acesta să fie mai mic de 20.000

37331
28:27:38,480 --> 28:27:48,000
ar fi o eroare de aproximativ 10%. 20.000

37332
28:27:43,280 --> 28:27:51,000
corect? Deci poate 30.000 undeva în

37333
28:27:48,000 --> 28:27:51,000
Acolo.

37334
28:27:52,232 --> 28:27:56,960
Da. 10% ar fi o eroare de 5%. 10.000

37335
28:27:55,120 --> 28:27:59,040
ar fi o eroare de 5%. Este adevărat. Asta e

37336
28:27:56,960 --> 28:28:00,960
adevărat. Deci asta ar fi asa

37337
28:27:59,040 --> 28:28:03,600
mult mai bine. Deci fiind mai aproape de zero,

37338
28:28:00,960 --> 28:28:06,800
desigur, cu cât este mai mic, cu atât mai bine.

37339
28:28:03,600 --> 28:28:08,480
Desigur. Hm, dar da, aș spune an

37340
28:28:06,800 --> 28:28:11,680
procentul acceptabil de eroare este

37341
28:28:08,480 --> 28:28:14,480
probabil 20%.

37342
28:28:11,680 --> 28:28:16,552
Probabil 20%, ceea ce ar fi

37343
28:28:14,480 --> 28:28:19,440
40.000 sau mai puțin ar fi probabil

37344
28:28:16,552 --> 28:28:21,360
acceptabil.

37345
28:28:19,440 --> 28:28:26,400
De obicei când noi de obicei când construiești

37346
28:28:21,360 --> 28:28:29,120
modelele um 80% precizie este de obicei uh

37347
28:28:26,400 --> 28:28:31,912
considerat decent.

37348
28:28:29,120 --> 28:28:35,680
De obicei considerat decent

37349
28:28:31,912 --> 28:28:39,000
80%. Deci, aș spune că ar fi 40.000 sau mai puțin

37350
28:28:35,680 --> 28:28:39,000
un fel de ideal.

37351
28:28:40,960 --> 28:28:45,440
Are sens?

37352
28:28:42,960 --> 28:28:46,800
sa raspund la intrebare?

37353
28:28:45,440 --> 28:28:49,360
E o întrebare bună. Ce valoare este

37354
28:28:46,800 --> 28:28:52,480
acceptabil? Cred că probabil mai puțin de

37355
28:28:49,360 --> 28:28:56,320
40.000 ar fi ideal. Așa este

37356
28:28:52,480 --> 28:28:59,440
eroare de aproximativ 20%.

37357
28:28:56,320 --> 28:29:01,680
În regulă, deci este K-fold. Hai să facem

37358
28:28:59,440 --> 28:29:03,680
doar o reținere obișnuită acum. Deci asta este

37359
28:29:01,680 --> 28:29:06,480
folosind doar datele noastre de instruire și testare.

37360
28:29:03,680 --> 28:29:09,512
Um facand model.pot si calculeaza an

37361
28:29:06,480 --> 28:29:12,320
MSE pe datele de testare. Deci asta este

37362
28:29:09,512 --> 28:29:15,600
doar um ține strategia aici unde

37363
28:29:12,320 --> 28:29:17,680
doar că asta este mai puțin robust, dar

37364
28:29:15,600 --> 28:29:22,000
este mult mai rapid de făcut și mai ușor de făcut

37365
28:29:17,680 --> 28:29:26,872
pus la punct. Corect? Deci, asta folosește

37366
28:29:22,000 --> 28:29:30,800
ține strategia. Deci doar un obișnuit

37367
28:29:26,872 --> 28:29:32,480
um test de tren împărțit.

37368
28:29:30,800 --> 28:29:34,800
Vom reconstrui modelul? nu,

37369
28:29:32,480 --> 28:29:38,080
nu neapărat. Sunt câteva lucruri noi

37370
28:29:34,800 --> 28:29:41,192
ar putea face cel mai probabil. Și ca un singur lucru

37371
28:29:38,080 --> 28:29:42,720
nu am făcut a fost să ne mărim caracteristicile.

37372
28:29:41,192 --> 28:29:45,440
Ține minte că am spus că e frumos

37373
28:29:42,720 --> 28:29:47,600
lucru important de făcut este să ne mărim

37374
28:29:45,440 --> 28:29:49,040
caracteristici. Noi nu am făcut asta. Așa că

37375
28:29:47,600 --> 28:29:50,960
ar fi o îmbunătățire a acestui fapt

37376
28:29:49,040 --> 28:29:53,600
vom merge la Deci chiar cred

37377
28:29:50,960 --> 28:29:55,040
o vom face mai târziu. Da. Deci cred ca noi

37378
28:29:53,600 --> 28:29:57,512
chiar o să fac asta acum că sunt

37379
28:29:55,040 --> 28:29:59,600
gândindu-mă la asta. Da. Unul dintre

37380
28:29:57,512 --> 28:30:01,512
ceea ce putem face este să scalam aceste caracteristici

37381
28:29:59,600 --> 28:30:03,760
folosind ca un scaler minmax sau un standard

37382
28:30:01,512 --> 28:30:06,872
scaler. asta chiar ne va ajuta

37383
28:30:03,760 --> 28:30:09,872
asta ne va ajuta să facem mai bine

37384
28:30:06,872 --> 28:30:09,872
previziuni.

37385
28:30:10,872 --> 28:30:16,232
Așa că acesta este un lucru pe care l-am putea face. Hm

37386
28:30:13,600 --> 28:30:18,960
dar da, vom încerca să vedem dacă

37387
28:30:16,232 --> 28:30:20,800
poate deveni mai bine.

37388
28:30:18,960 --> 28:30:22,640
Ar trebui să-l ajute. Da, de obicei tu

37389
28:30:20,800 --> 28:30:24,080
vrei să scalați doriți să scalați

37390
28:30:22,640 --> 28:30:26,000
date. E ceva în care nu am făcut

37391
28:30:24,080 --> 28:30:27,832
pasul nostru de pregătire. Am făcut multe

37392
28:30:26,000 --> 28:30:30,000
lucrurile pe care ar trebui să le facem. Am eliminat nles

37393
28:30:27,832 --> 28:30:33,512
și am făcut o codificare fierbinte pentru

37394
28:30:30,000 --> 28:30:36,720
caracteristică de proximitate ca aceasta. Hm

37395
28:30:33,512 --> 28:30:38,640
acestea sunt bune de făcut, dar nu am scalat

37396
28:30:36,720 --> 28:30:40,552
pe oricare dintre acestea altele nu am scalat niciuna

37397
28:30:38,640 --> 28:30:44,160
dintre caracteristicile corecte nu le-am scalat

37398
28:30:40,552 --> 28:30:46,640
oricare dintre ei. Hm, tu va avea un

37399
28:30:44,160 --> 28:30:49,512
efect. De obicei, atunci când o scalam

37400
28:30:46,640 --> 28:30:51,680
va fi un model mai bun.

37401
28:30:49,512 --> 28:30:55,600
Va învăța puțin mai bine dacă

37402
28:30:51,680 --> 28:30:58,552
putem scala datele. Hm, așa

37403
28:30:55,600 --> 28:31:01,440
ca acestea

37404
28:30:58,552 --> 28:31:03,832
um parcă vârstele nu știi drastic

37405
28:31:01,440 --> 28:31:06,232
diferit decât ca la scară decât total

37406
28:31:03,832 --> 28:31:08,320
dormitoare sau venituri

37407
28:31:06,232 --> 28:31:10,232
uh genul ăsta de lucruri. Deci noi de obicei

37408
28:31:08,320 --> 28:31:13,232
doresc ca acestea să fie la o scară similară

37409
28:31:10,232 --> 28:31:13,232
interval.

37410
28:31:13,360 --> 28:31:18,480
Deci vom face, cred că vom scala

37411
28:31:15,680 --> 28:31:21,512
ele apar peste putin si ar trebui

37412
28:31:18,480 --> 28:31:22,800
ajuta modelul.

37413
28:31:21,512 --> 28:31:25,040
Am mai vorbit despre asta, nu?

37414
28:31:22,800 --> 28:31:26,320
De obicei, scalarea este o idee bună de făcut

37415
28:31:25,040 --> 28:31:29,320
când vă pregătiți datele pentru

37416
28:31:26,320 --> 28:31:29,320
modelare.

37417
28:31:29,600 --> 28:31:33,192
Nu, vrei să vrei să-ți scalezi

37418
28:31:31,440 --> 28:31:34,552
și datele de testare. Ai de gând să faci

37419
28:31:33,192 --> 28:31:36,232
ambele. Îți vei scala

37420
28:31:34,552 --> 28:31:38,080
date de antrenament. Îl vei scala.

37421
28:31:36,232 --> 28:31:40,960
Deci asta este de fapt un punct bun pentru tine

37422
28:31:38,080 --> 28:31:43,040
aduceți în discuție orice transformări pe care le faceți

37423
28:31:40,960 --> 28:31:45,360
pe pregătirea dumneavoastră pentru a vă construi modelul,

37424
28:31:43,040 --> 28:31:48,000
ar trebui să faci, de asemenea, pe setul de testare așa

37425
28:31:45,360 --> 28:31:49,192
primești o comparație între mere și mere.

37426
28:31:48,000 --> 28:31:51,360
Ar trebui să faci mereu la fel

37427
28:31:49,192 --> 28:31:54,872
transformări.

37428
28:31:51,360 --> 28:31:56,640
Da. Scalarea datelor l-ar afecta pe K? Da,

37429
28:31:54,872 --> 28:31:58,872
ar putea. S-ar putea face mai bine. Ea

37430
28:31:56,640 --> 28:32:00,552
ar putea uh Da, ar trebui să aibă impact. Noi

37431
28:31:58,872 --> 28:32:01,832
ar trebui să obțineți un model mai bun. Deci, când noi

37432
28:32:00,552 --> 28:32:04,400
faceți diferitele pliuri, vom obține

37433
28:32:01,832 --> 28:32:08,040
diferit, vom obține scoruri mai bune. Da,

37434
28:32:04,400 --> 28:32:08,040
va avea impact

37435
28:32:08,800 --> 28:32:12,400
Da, dacă sunt așa, e bine

37436
28:32:11,440 --> 28:32:14,320
punct. Dacă vor folosi noastre

37437
28:32:12,400 --> 28:32:16,232
model, atunci da, trebuie să scala

37438
28:32:14,320 --> 28:32:17,760
date de asemenea. Dacă ei vor face dacă noi

37439
28:32:16,232 --> 28:32:21,120
construiți modelul pornind de la presupunerea că

37440
28:32:17,760 --> 28:32:22,800
intrarea este scalată, atunci da, au

37441
28:32:21,120 --> 28:32:28,120
pentru a-și scala și datele atunci când sunt

37442
28:32:22,800 --> 28:32:28,120
folosind-o cu modelul nostru. Este adevărat.

37443
28:32:29,680 --> 28:32:33,280
Adică, nu chiar. Îți voi arăta de ce.

37444
28:32:32,320 --> 28:32:36,400
Există ceva care se întâmplă de fapt

37445
28:32:33,280 --> 28:32:38,480
ca să fie mai ușor

37446
28:32:36,400 --> 28:32:40,000
automatizați realizarea scalării pentru ei. Deci,

37447
28:32:38,480 --> 28:32:42,480
ei nu ei nu trebuie să facă

37448
28:32:40,000 --> 28:32:44,160
scalare manuală. doar va fi

37449
28:32:42,480 --> 28:32:45,832
se întâmplă automat când folosesc

37450
28:32:44,160 --> 28:32:47,280
model. Am de gând să-ți arăt ceva

37451
28:32:45,832 --> 28:32:49,680
asta va automatiza ceea ce este

37452
28:32:47,280 --> 28:32:52,080
va fi numită conductă.

37453
28:32:49,680 --> 28:32:53,912
Deci acea parte va fi automatizată și ei

37454
28:32:52,080 --> 28:32:57,280
nu va trebui să facă asta. Deci nu va fi

37455
28:32:53,912 --> 28:32:58,960
grele pentru utilizator. Nu, în teorie este,

37456
28:32:57,280 --> 28:33:00,800
dar

37457
28:32:58,960 --> 28:33:02,800
are un instrument cu adevărat util pentru a o face

37458
28:33:00,800 --> 28:33:04,800
ușor să faci asta. Așa că mă duc la sunt

37459
28:33:02,800 --> 28:33:07,760
ne va arata ca mai tarziu in

37460
28:33:04,800 --> 28:33:09,760
caietul.

37461
28:33:07,760 --> 28:33:12,000
Nu, datele de date nu sunt pentru un singur

37462
28:33:09,760 --> 28:33:14,480
casa. Este ca un cartier. Aşa

37463
28:33:12,000 --> 28:33:16,480
există un anumit număr de gospodării

37464
28:33:14,480 --> 28:33:18,400
in cartier. Și acesta este

37465
28:33:16,480 --> 28:33:21,120
prezicem valoarea medie a casei

37466
28:33:18,400 --> 28:33:22,480
din acel cartier.

37467
28:33:21,120 --> 28:33:23,760
Da. Deci, există o certitudine

37468
28:33:22,480 --> 28:33:26,720
numărul de gospodării. Există acolo

37469
28:33:23,760 --> 28:33:28,000
ca un venit mediu, o populație,

37470
28:33:26,720 --> 28:33:32,080
un anumit număr de oameni care trăiesc

37471
28:33:28,000 --> 28:33:34,232
acolo. Apropierea în general de unde

37472
28:33:32,080 --> 28:33:37,480
acea locație este. Are și o latitudine

37473
28:33:34,232 --> 28:33:37,480
si longitudine.

37474
28:33:38,720 --> 28:33:43,512
Deci,

37475
28:33:41,192 --> 28:33:47,720
și o vârstă medie în acel cartier.

37476
28:33:43,512 --> 28:33:47,720
Deci, da, nu este doar o singură casă.

37477
28:33:54,800 --> 28:34:00,320
Bine, să ne întoarcem la asta a fost reținerea

37478
28:33:58,320 --> 28:34:02,320
out strategia. Deci, acest lucru este mult mai simplu.

37479
28:34:00,320 --> 28:34:05,512
Acesta este doar model.fit, nu? Aceasta este

37480
28:34:02,320 --> 28:34:07,912
doar model.potrivește pe datele de antrenament uh.

37481
28:34:05,512 --> 28:34:10,552
Și apoi putem prezice la test

37482
28:34:07,912 --> 28:34:12,400
caracteristici și generați predicții de testare.

37483
28:34:10,552 --> 28:34:15,040
Și apoi ne putem calcula eroarea

37484
28:34:12,400 --> 28:34:16,960
aceia um le putem calcula eroarea

37485
28:34:15,040 --> 28:34:21,120
printre predicțiile de testare și noastre

37486
28:34:16,960 --> 28:34:23,912
testează eticheta. Deci acesta este mijlocul nostru util

37487
28:34:21,120 --> 28:34:27,440
funcția de eroare pătrată, nu? Pentru a

37488
28:34:23,912 --> 28:34:33,192
calculați MSE. Hai să vedem ce

37489
28:34:27,440 --> 28:34:36,160
MSE este. Deci MSE este chiar aici.

37490
28:34:33,192 --> 28:34:38,320
Acum ceea ce am putea face este să luăm

37491
28:34:36,160 --> 28:34:39,832
MSE

37492
28:34:38,320 --> 28:34:42,232
și putem lua rădăcina pătrată a acesteia.

37493
28:34:39,832 --> 28:34:45,760
Deci, să facem asta de fapt. Hai să facem

37494
28:34:42,232 --> 28:34:48,080
MP. Rădăcina pătrată a

37495
28:34:45,760 --> 28:34:51,080
um test

37496
28:34:48,080 --> 28:34:51,080
MSE

37497
28:34:51,280 --> 28:34:59,600
și obținem 67 obținem 67.000.

37498
28:34:56,640 --> 28:35:01,192
Deci este destul de mare în acest sens. Deci când

37499
28:34:59,600 --> 28:35:03,512
abia acum ne uităm la diferența de

37500
28:35:01,192 --> 28:35:05,280
asta, nu? Când doar facem un tren

37501
28:35:03,512 --> 28:35:08,280
diviziunea de testare,

37502
28:35:05,280 --> 28:35:08,280
um

37503
28:35:08,320 --> 28:35:12,640
când facem doar un test de tren, noi

37504
28:35:10,552 --> 28:35:14,320
obține un scor mai rău pentru că nu este ca

37505
28:35:12,640 --> 28:35:17,192
nu este la fel de robust, nu? Nu suntem

37506
28:35:14,320 --> 28:35:20,080
arătând asta multora dintre celelalte uh

37507
28:35:17,192 --> 28:35:23,512
pliuri. Deci, primim mult mai multe erori

37508
28:35:20,080 --> 28:35:25,760
mod pe datele de testare.

37509
28:35:23,512 --> 28:35:27,600
Deci, asta este de fapt mai rău

37510
28:35:25,760 --> 28:35:30,600
performanță doar făcând testul trenului

37511
28:35:27,600 --> 28:35:30,600
despicat.

37512
28:35:30,872 --> 28:35:34,600
Aceasta este cu adevărat mai mare.

37513
28:35:42,960 --> 28:35:46,872
Da, putem. Putem. ma duc la sunt

37514
28:35:45,120 --> 28:35:50,960
ne va arăta cum se face scalarea

37515
28:35:46,872 --> 28:35:53,192
se va face automat. Da, putem.

37516
28:35:50,960 --> 28:35:57,232
Există un instrument foarte ușor de făcut

37517
28:35:53,192 --> 28:35:57,232
face asta o va scala automat.

37518
28:36:00,160 --> 28:36:05,160
Va fi mai târziu în acest caiet.

37519
28:36:01,600 --> 28:36:05,160
O să ni-l arăt.

37520
28:36:10,480 --> 28:36:14,872
În regulă. Deci, ca să recapitulez asta, asta

37521
28:36:12,160 --> 28:36:16,480
se potrivește modelului.

37522
28:36:14,872 --> 28:36:18,080
Acesta se potrivește modelului. Aceasta este

37523
28:36:16,480 --> 28:36:20,000
făcând predicții, nu?

37524
28:36:18,080 --> 28:36:21,912
Model.predic.

37525
28:36:20,000 --> 28:36:24,000
Deci, asta face previziunile. Şi

37526
28:36:21,912 --> 28:36:25,832
atunci aceasta este calcularea erorii,

37527
28:36:24,000 --> 28:36:27,512
eroare pătrată medie, care se uită la

37528
28:36:25,832 --> 28:36:29,440
etichetele noastre de testare versus testul nostru

37529
28:36:27,512 --> 28:36:32,000
previziuni, nu? Și aceasta este

37530
28:36:29,440 --> 28:36:34,320
calculând distanța, media

37531
28:36:32,000 --> 28:36:36,160
distanta de aceste valori la acestea

37532
28:36:34,320 --> 28:36:38,000
valori,

37533
28:36:36,160 --> 28:36:40,480
nu?

37534
28:36:38,000 --> 28:36:43,280
Și apoi putem calcula și R pătratul

37535
28:36:40,480 --> 28:36:46,800
R R pătrat și vedem că nu este a

37536
28:36:43,280 --> 28:36:48,800
foarte bun R squar 65 uh nu este un foarte

37537
28:36:46,800 --> 28:36:50,640
model grozav

37538
28:36:48,800 --> 28:36:53,120
um pentru că ar fi mai aproape de unul

37539
28:36:50,640 --> 28:36:54,872
mai bine. Deci asta este tot nu este

37540
28:36:53,120 --> 28:36:56,400
foarte bine.

37541
28:36:54,872 --> 28:36:58,872
Știm că știam asta de pe cruce

37542
28:36:56,400 --> 28:37:01,360
scorul fișierului, dar asta doar face um

37543
28:36:58,872 --> 28:37:03,760
asta face doar o reținere uh unde

37544
28:37:01,360 --> 28:37:05,512
facem un tren și test split. Corect? Deci

37545
28:37:03,760 --> 28:37:08,480
este un pic mai simplu, dar nu este

37546
28:37:05,512 --> 28:37:10,800
la fel de robust. um,

37547
28:37:08,480 --> 28:37:14,232
nu este chiar la fel de robust ca crucea

37548
28:37:10,800 --> 28:37:17,360
supapă, dar funcționează. Hm, este, știi,

37549
28:37:14,232 --> 28:37:19,912
putem rezista. um,

37550
28:37:17,360 --> 28:37:22,480
putem rezista foarte repede

37551
28:37:19,912 --> 28:37:24,480
evaluăm un model și vedem dacă trebuie

37552
28:37:22,480 --> 28:37:28,512
faceți orice ajustări.

37553
28:37:24,480 --> 28:37:28,512
Este puțin mai rapid de alergat.

37554
28:37:30,800 --> 28:37:33,912
Bine. Și vreo întrebare despre el? O face

37555
28:37:32,800 --> 28:37:37,680
ai sens ce facem aici?

37556
28:37:33,912 --> 28:37:40,400
Model.fit fit to train it prezice to get

37557
28:37:37,680 --> 28:37:41,912
previziunile noastre. Um asta e frumos

37558
28:37:40,400 --> 28:37:44,160
standard, nu? A te antrena este

37559
28:37:41,912 --> 28:37:47,192
model.pot si apoi sa foloseasca modelul pentru

37560
28:37:44,160 --> 28:37:49,912
prezicem prezicem pe caracteristicile de testare.

37561
28:37:47,192 --> 28:37:53,832
Hm, deci asta se transmite pe toate noastre

37562
28:37:49,912 --> 28:37:55,440
caracteristici în acest model pentru a genera

37563
28:37:53,832 --> 28:37:56,720
previziuni pentru fiecare rând. Asta e

37564
28:37:55,440 --> 28:37:58,800
ceva ce vreau să subliniez

37565
28:37:56,720 --> 28:38:02,800
poate fi un pic confuz este asta

37566
28:37:58,800 --> 28:38:04,960
un cadru de date. Deci trecem într-o

37567
28:38:02,800 --> 28:38:07,912
grămadă de rânduri de caracteristici cu coloane,

37568
28:38:04,960 --> 28:38:10,160
nu? Deci trecem într-o grămadă de

37569
28:38:07,912 --> 28:38:12,552
date care arată astfel. Și ce

37570
28:38:10,160 --> 28:38:14,872
facem este în esență să facem a

37571
28:38:12,552 --> 28:38:17,512
predicție pentru fiecare rând. Deci asta va

37572
28:38:14,872 --> 28:38:19,760
generează o predicție. Acest rând va

37573
28:38:17,512 --> 28:38:21,600
generează o predicție. Acest rând va

37574
28:38:19,760 --> 28:38:24,640
generează o predicție și mai departe și mai departe și

37575
28:38:21,600 --> 28:38:27,360
pe. Deci această predicție o va prezice

37576
28:38:24,640 --> 28:38:29,360
pentru fiecare rând. Și așa ajungem

37577
28:38:27,360 --> 28:38:32,160
această colecție de predicții aici pt

37578
28:38:29,360 --> 28:38:35,040
fiecare rând. și le comparăm cu

37579
28:38:32,160 --> 28:38:37,600
etichetele pe care le avem pentru acele rânduri

37580
28:38:35,040 --> 28:38:40,480
din învățarea noastră supravegheată,

37581
28:38:37,600 --> 28:38:42,320
nu? Din setul nostru de date. Deci asta e

37582
28:38:40,480 --> 28:38:44,552
învățare cu adevărat supravegheată, nu? Noi

37583
28:38:42,320 --> 28:38:47,912
avem exemplele și facem o comparație

37584
28:38:44,552 --> 28:38:52,040
cele la ceea ce modelul nostru prezice

37585
28:38:47,912 --> 28:38:52,040
pentru a obține performanța noastră.

37586
28:38:56,960 --> 28:39:01,760
În regulă.

37587
28:38:58,720 --> 28:39:03,760
Deci hai să încercăm pe celălalt așa

37588
28:39:01,760 --> 28:39:05,680
o poti vedea. Pe cel lăsat afară. Acum

37589
28:39:03,760 --> 28:39:07,120
validarea încrucișată este exclusă

37590
28:39:05,680 --> 28:39:10,640
de fapt va funcționa în același mod

37591
28:39:07,120 --> 28:39:13,120
în cazul în care am pus în lăsați unul afară um

37592
28:39:10,640 --> 28:39:14,960
strategie în interiorul scorului de fișier încrucișat.

37593
28:39:13,120 --> 28:39:17,192
Acum, aici nu trebuie să specificăm cum

37594
28:39:14,960 --> 28:39:18,320
multe falduri există pentru că știm cum

37595
28:39:17,192 --> 28:39:21,280
multe vor fi. O să fie

37596
28:39:18,320 --> 28:39:22,400
fie numărul de puncte de date, nu? Deci

37597
28:39:21,280 --> 28:39:25,680
care de fapt va fi destul de

37598
28:39:22,400 --> 28:39:28,232
mare pentru că sunt 20.000 de rânduri. Deci

37599
28:39:25,680 --> 28:39:33,360
asta va fi extrem de

37600
28:39:28,232 --> 28:39:37,760
extrem de intens pentru că suntem

37601
28:39:33,360 --> 28:39:40,800
făcând um știi 20.000 de exemple și

37602
28:39:37,760 --> 28:39:43,280
lăsând un exemplu să fie al nostru

37603
28:39:40,800 --> 28:39:47,040
validare și apoi face asta peste tot

37604
28:39:43,280 --> 28:39:48,800
la fiecare 20.000 de exemple.

37605
28:39:47,040 --> 28:39:51,120
Așa că am putea să o facem doar ca să vedem cum

37606
28:39:48,800 --> 28:39:53,280
funcționează. Avem din nou plecarea asta

37607
28:39:51,120 --> 28:39:56,480
unul afară. Noi generăm scorul nostru încrucișat

37608
28:39:53,280 --> 28:39:58,800
din modelul nostru datele noastre și apoi aceleași

37609
28:39:56,480 --> 28:40:00,552
punctaj pe care le aveam înainte și dar asta

37610
28:39:58,800 --> 28:40:03,360
momentul în care ne schimbăm fișierul încrucișat să fie

37611
28:40:00,552 --> 28:40:06,640
în loc de obiectul nostru kfold avem nostru

37612
28:40:03,360 --> 28:40:09,192
omite un obiect care este acesta

37613
28:40:06,640 --> 28:40:12,960
și apoi am putea rula asta. Putem

37614
28:40:09,192 --> 28:40:14,872
calculăm media noastră uh la toate

37615
28:40:12,960 --> 28:40:16,480
pliurile. Acum asta va fi mult

37616
28:40:14,872 --> 28:40:19,192
mai mare dintr-o matrice. Va fi o

37617
28:40:16,480 --> 28:40:22,872
20.000 de dimensiuni și o vom face

37618
28:40:19,192 --> 28:40:22,872
calculați media peste el.

37619
28:40:23,360 --> 28:40:27,192
Deci, hai să facem asta. Va dura o

37620
28:40:25,440 --> 28:40:28,552
moment pentru că sunt multe. Deci, dacă tu

37621
28:40:27,192 --> 28:40:30,872
observă-l când alergi, se va întâmpla

37622
28:40:28,552 --> 28:40:34,080
ia-ți puțin timp să alergi pentru că

37623
28:40:30,872 --> 28:40:37,760
se desfășoară pe toate cele 20.000 de exemple

37624
28:40:34,080 --> 28:40:41,040
și lăsând unul afară. Deci, ai 20.000

37625
28:40:37,760 --> 28:40:43,192
și apoi unul lăsat să testeze

37626
28:40:41,040 --> 28:40:47,400
împotriva. Deci, este destul de intensiv. tu

37627
28:40:43,192 --> 28:40:47,400
pot vedea că durează mult mai mult timp.

37628
28:40:52,000 --> 28:40:57,480
Încă mai rulează. Durează ceva timp.

37629
28:41:03,912 --> 28:41:10,400
Bine, lasă-l să curgă. Încă aleargă.

37630
28:41:08,720 --> 28:41:11,760
Deci, dacă încercați să rulați asta, este

37631
28:41:10,400 --> 28:41:13,192
va dura puțin timp.

37632
28:41:11,760 --> 28:41:16,000
Sper că asta are sens de ce este

37633
28:41:13,192 --> 28:41:19,280
durează atât de mult, nu? Este pentru că este

37634
28:41:16,000 --> 28:41:21,680
în loc să faci 10 pliuri, este

37635
28:41:19,280 --> 28:41:23,912
punând fiecare punct de date, dar unul este

37636
28:41:21,680 --> 28:41:27,280
set de antrenament și apoi repetarea

37637
28:41:23,912 --> 28:41:31,232
toate cele 20.000 de puncte.

37638
28:41:27,280 --> 28:41:31,232
Acest lucru durează ceva timp.

37639
28:41:44,400 --> 28:41:48,360
Să vedem ce avem

37640
28:41:49,120 --> 28:41:54,912
RAM Memoria noastră este puțin crescută.

37641
28:42:00,232 --> 28:42:04,872
bine,

37642
28:42:02,480 --> 28:42:07,120
încă alergând. E în regulă. Îl voi lăsa

37643
28:42:04,872 --> 28:42:10,912
alerga.

37644
28:42:07,120 --> 28:42:10,912
Întoarce-te când s-a terminat.

37645
28:42:15,040 --> 28:42:18,960
Da, exact. Acesta este pentru asta

37646
28:42:17,440 --> 28:42:21,680
asta ne oferă o performanță

37647
28:42:18,960 --> 28:42:24,080
evaluarea. Aceasta este ca media

37648
28:42:21,680 --> 28:42:26,640
eroare în toate diferitele noastre uh

37649
28:42:24,080 --> 28:42:28,232
pliuri. Acum, acesta este cazul extrem

37650
28:42:26,640 --> 28:42:31,360
unde avem numărul de pliuri egal

37651
28:42:28,232 --> 28:42:33,360
numărul de puncte.

37652
28:42:31,360 --> 28:42:35,512
Corect? Deci este un caz extrem, dar da

37653
28:42:33,360 --> 28:42:39,232
este la fel ca kfold. Ne oferă

37654
28:42:35,512 --> 28:42:39,232
acea estimare a performanței.

37655
28:42:44,080 --> 28:42:50,480
Bine. Cam la fel. Corect. Aceasta

37656
28:42:47,440 --> 28:42:52,800
este încă în jur de 50.000.

37657
28:42:50,480 --> 28:42:55,192
Nu e mare diferență, nu? Inca drept

37658
28:42:52,800 --> 28:42:57,912
pe acolo. Dar uite cât mai mult

37659
28:42:55,192 --> 28:42:59,680
a luat. A durat 2 minute. The

37660
28:42:57,912 --> 28:43:02,960
celălalt a fost destul de instantaneu, nu? Deci

37661
28:42:59,680 --> 28:43:09,120
aceasta a durat aproximativ 2 minute pentru a rula.

37662
28:43:02,960 --> 28:43:11,912
Deci cu siguranță uh

37663
28:43:09,120 --> 28:43:14,400
da, cu siguranță nu vreau să rulez asta

37664
28:43:11,912 --> 28:43:16,400
uh prea des. Cred că este

37665
28:43:14,400 --> 28:43:17,912
în general, preferă să facă k-fold. Dacă

37666
28:43:16,400 --> 28:43:19,680
vei face validare încrucișată,

37667
28:43:17,912 --> 28:43:22,720
în general, doresc să facă k-fold sau doar

37668
28:43:19,680 --> 28:43:24,720
obișnuit hold out tren test împărțire. Uh

37669
28:43:22,720 --> 28:43:26,552
în general, mai bine decât să lași unul

37670
28:43:24,720 --> 28:43:29,360
afară. Doar că va dura prea mult

37671
28:43:26,552 --> 28:43:33,000
și um rezultă cam de același tip

37672
28:43:29,360 --> 28:43:33,000
de scor ca kfold.

37673
28:43:41,912 --> 28:43:47,680
Bine,

37674
28:43:44,160 --> 28:43:51,800
orice întrebări despre cruce

37675
28:43:47,680 --> 28:43:51,800
validare pe care tocmai am făcut-o.

37676
28:44:08,080 --> 28:44:12,400
bine,

37677
28:44:10,080 --> 28:44:14,080
bine. Și după cum se spune aici că

37678
28:44:12,400 --> 28:44:15,600
kfold stratificat este de obicei folosit pentru

37679
28:44:14,080 --> 28:44:17,120
clasificare. Din nou, nu facem

37680
28:44:15,600 --> 28:44:19,512
clasificare încă. Asta înseamnă a merge la

37681
28:44:17,120 --> 28:44:20,960
fi la lecția a patra. Deci, nu avem nevoie

37682
28:44:19,512 --> 28:44:23,760
iti faci prea multe griji pentru asta. Doar pentru

37683
28:44:20,960 --> 28:44:25,832
regresie, um k-fold regulat este

37684
28:44:23,760 --> 28:44:28,232
preferat, nu? Pentru că nu avem nevoie

37685
28:44:25,832 --> 28:44:31,360
să vă faceți griji pentru distribuire

37686
28:44:28,232 --> 28:44:34,080
categorii dintre pliurile noastre uh în oricare

37687
28:44:31,360 --> 28:44:36,160
probleme de regresie.

37688
28:44:34,080 --> 28:44:37,912
Și după cum vedem, eroarea este cam mare.

37689
28:44:36,160 --> 28:44:40,552
Vor fi niște lucruri noi

37690
28:44:37,912 --> 28:44:42,232
pot face pentru a îmbunătăți ceea ce va fi uh

37691
28:44:40,552 --> 28:44:45,192
mai târziu vom afla mai multe

37692
28:44:42,232 --> 28:44:47,760
modele avansate. Acest lucru semnalează că

37693
28:44:45,192 --> 28:44:50,960
performanta este proasta. Probabil avem nevoie de o

37694
28:44:47,760 --> 28:44:52,960
model mai complex. Un lucru noi

37695
28:44:50,960 --> 28:44:55,192
am putea încerca înainte de a încerca un model complex

37696
28:44:52,960 --> 28:44:57,512
este să faci scalare. Vom încerca să facem

37697
28:44:55,192 --> 28:45:00,720
scalare. O să ne arăt cum putem

37698
28:44:57,512 --> 28:45:04,872
face asta urmând într-un frumos

37699
28:45:00,720 --> 28:45:06,480
modă simplificată. Hm, dar afară

37700
28:45:04,872 --> 28:45:07,912
de asta, dacă tot am avut rău

37701
28:45:06,480 --> 28:45:10,640
performanță, probabil că ar trebui să o folosim

37702
28:45:07,912 --> 28:45:13,360
un model mai avansat. Și vom învăța

37703
28:45:10,640 --> 28:45:15,600
despre modele mai avansate uh în

37704
28:45:13,360 --> 28:45:17,760
următoarea lecție. Și ceea ce este grozav este o parte

37705
28:45:15,600 --> 28:45:19,912
acele modele avansate pot fi de fapt

37706
28:45:17,760 --> 28:45:21,680
folosit pentru regresie. Deci au

37707
28:45:19,912 --> 28:45:23,280
variații care pot fi folosite pentru ambele

37708
28:45:21,680 --> 28:45:25,760
clasificare și regresie, care este

37709
28:45:23,280 --> 28:45:30,400
destul de misto. Așa că le voi sublinia

37710
28:45:25,760 --> 28:45:33,440
când ajungem la ei. Bine.

37711
28:45:30,400 --> 28:45:36,872
Deci despre ce vreau să vorbesc acum este a

37712
28:45:33,440 --> 28:45:38,640
felul în care putem combate supraadaptarea. Deci dacă noi

37713
28:45:36,872 --> 28:45:43,512
au supraajustare care nu uitați că este

37714
28:45:38,640 --> 28:45:45,680
cazul în care uh, vedem bine

37715
28:45:43,512 --> 28:45:47,832
performanţă pe datele de antrenament dar

37716
28:45:45,680 --> 28:45:49,832
atunci nu se generalizează la

37717
28:45:47,832 --> 28:45:52,720
datele de testare. Obținem performanțe slabe

37718
28:45:49,832 --> 28:45:55,680
pe datele testului. Um, există o

37719
28:45:52,720 --> 28:45:58,480
lasa acolo. Asta ar semnala

37720
28:45:55,680 --> 28:46:00,000
supraadaptare.

37721
28:45:58,480 --> 28:46:03,192
supraadaptare

37722
28:46:00,000 --> 28:46:06,480
și o modalitate de a combate supraadaptarea

37723
28:46:03,192 --> 28:46:09,600
este să faci ceva numit regularizare

37724
28:46:06,480 --> 28:46:13,360
despre care vom vorbi în continuare. Deci

37725
28:46:09,600 --> 28:46:15,912
ideea cheie în regularizare

37726
28:46:13,360 --> 28:46:19,680
este să

37727
28:46:15,912 --> 28:46:21,832
ne schimbăm uh schimbarea felului în care noi

37728
28:46:19,680 --> 28:46:27,040
tren. În esență, la ce vom merge

37729
28:46:21,832 --> 28:46:30,160
este să ne modifici antrenamentul

37730
28:46:27,040 --> 28:46:33,120
uh funcție de eroare sau uneori numită

37731
28:46:30,160 --> 28:46:36,160
funcţia obiectiv sau funcţia de pierdere.

37732
28:46:33,120 --> 28:46:40,640
Vom schimba asta pentru a adăuga un

37733
28:46:36,160 --> 28:46:43,600
penalizare pentru a penaliza complexul excesiv

37734
28:46:40,640 --> 28:46:45,760
complexitate. În esență, felul în care

37735
28:46:43,600 --> 28:46:48,160
vom penaliza este făcând

37736
28:46:45,760 --> 28:46:51,600
sigur marimea coeficientilor

37737
28:46:48,160 --> 28:46:54,640
nu crește prea mult ceea ce ar trebui

37738
28:46:51,600 --> 28:46:56,640
atenuează supraadaptarea deoarece amintiți-vă în

37739
28:46:54,640 --> 28:46:58,232
regresie liniară ceea ce învățăm

37740
28:46:56,640 --> 28:47:01,832
sunt coeficienții corecti

37741
28:46:58,232 --> 28:47:04,232
învăţarea beta 0 beta 1 beta

37742
28:47:01,832 --> 28:47:06,872
2 și mai departe și pe câte beta există

37743
28:47:04,232 --> 28:47:10,080
sunt beta și le învățăm pe toate

37744
28:47:06,872 --> 28:47:11,760
baieti um prin eroarea de regresie

37745
28:47:10,080 --> 28:47:13,832
funcție pe care încercăm să o minimizăm

37746
28:47:11,760 --> 28:47:16,080
funcția de eroare. Așa se antrenează. Noi

37747
28:47:13,832 --> 28:47:21,192
am vorbit despre asta luni.

37748
28:47:16,080 --> 28:47:24,320
Deci ceea ce vom face este

37749
28:47:21,192 --> 28:47:27,832
practic penalizează-i pe acești tipi

37750
28:47:24,320 --> 28:47:31,360
devenind prea mare și ne asigurăm că suntem amabili

37751
28:47:27,832 --> 28:47:34,320
de ține-le mici pentru ca nimeni

37752
28:47:31,360 --> 28:47:36,872
coeficientul are un efect dominant uh asupra

37753
28:47:34,320 --> 28:47:38,720
modelul. Și asta ar trebui să ajute

37754
28:47:36,872 --> 28:47:40,800
supraadaptare și complexitate. Ar trebui

37755
28:47:38,720 --> 28:47:42,552
face modelul mai simplu deoarece toate

37756
28:47:40,800 --> 28:47:44,800
coeficienții vor fi încurajați

37757
28:47:42,552 --> 28:47:47,512
a fi mai mic. Nu vor crește

37758
28:47:44,800 --> 28:47:50,160
prea mare. Um, și asta are

37759
28:47:47,512 --> 28:47:54,120
efectul de a face modelul atât de practic

37760
28:47:50,160 --> 28:47:54,120
simplificați modelul.

37761
28:47:54,800 --> 28:47:58,720
Faceți modelul mai simplu este ceea ce acestea

37762
28:47:57,280 --> 28:48:00,800
tehnicile de regularizare sunt

37763
28:47:58,720 --> 28:48:02,552
în esență, încercarea de a realiza este este

37764
28:48:00,800 --> 28:48:04,320
eliminați complexitatea, faceți-le puțin

37765
28:48:02,552 --> 28:48:07,120
puțin mai simplu, faceți acești coeficienți

37766
28:48:04,320 --> 28:48:10,160
mai mic ca sa poti generaliza putin

37767
28:48:07,120 --> 28:48:13,360
mai bine și și pentru a preveni supraadaptarea. Deci

37768
28:48:10,160 --> 28:48:15,600
vrem să prevenim

37769
28:48:13,360 --> 28:48:19,040
uh supraadaptare,

37770
28:48:15,600 --> 28:48:20,640
corect, este ceea ce vrem să facem. Um asa

37771
28:48:19,040 --> 28:48:22,320
va fi o penalizare și o voi face

37772
28:48:20,640 --> 28:48:24,400
vă arată unde se adaugă acea penalizare

37773
28:48:22,320 --> 28:48:28,232
și cam cum arată.

37774
28:48:24,400 --> 28:48:29,760
Hm, dar pentru a controla nivelul asta

37775
28:48:28,232 --> 28:48:33,040
pedeapsa la care mergem de fapt

37776
28:48:29,760 --> 28:48:35,512
introduceți un alt parametru modelului nostru

37777
28:48:33,040 --> 28:48:38,960
um numit alfa.

37778
28:48:35,512 --> 28:48:42,552
Alpha va mări pedeapsa. Deci

37779
28:48:38,960 --> 28:48:45,760
dacă alfa este cu adevărat mare, asta impune a

37780
28:48:42,552 --> 28:48:48,720
penalizare mai puternică asupra coeficienților um

37781
28:48:45,760 --> 28:48:51,040
ceea ce va face modelul mult mai simplu.

37782
28:48:48,720 --> 28:48:54,640
Deci, cu cât alfa este mai mare, cu atât este mai simplu

37783
28:48:51,040 --> 28:48:57,512
modelul pe care îl vom obține și noi riscul

37784
28:48:54,640 --> 28:49:00,552
cu asta suntem de fapt subadaptați. Deci dacă

37785
28:48:57,512 --> 28:49:02,720
alfa este prea mare, s-ar putea să nu se potrivească

37786
28:49:00,552 --> 28:49:04,800
date de antrenament

37787
28:49:02,720 --> 28:49:08,000
um puțin prea mult pentru că va face

37788
28:49:04,800 --> 28:49:08,960
modelul mult prea simplu. Hm și din nou

37789
28:49:08,000 --> 28:49:12,080
Îți voi arăta ce înseamnă asta

37790
28:49:08,960 --> 28:49:14,320
matematic într-o clipă. Hm, dar mai departe

37791
28:49:12,080 --> 28:49:17,512
pe de altă parte dacă avem un alfa mai mic

37792
28:49:14,320 --> 28:49:20,400
aceasta va avea o pedeapsă mai mică. este o

37793
28:49:17,512 --> 28:49:24,320
termen de pedeapsă mai slab și asta va duce la

37794
28:49:20,400 --> 28:49:27,832
un model care este ceva mai complex.

37795
28:49:24,320 --> 28:49:31,600
Hm care ar putea risca un anumit nivel de

37796
28:49:27,832 --> 28:49:33,192
supraadaptare. Așa că există așa că există

37797
28:49:31,600 --> 28:49:35,280
încă riscul de a se supraadapta dacă tu

37798
28:49:33,192 --> 28:49:37,040
au un alfa scăzut. Și desigur dacă alfa

37799
28:49:35,280 --> 28:49:39,280
merge până la zero, nu există

37800
28:49:37,040 --> 28:49:42,320
pedeapsa deloc. Deci te-ai întors la tine

37801
28:49:39,280 --> 28:49:45,120
regresie liniară originală um care

37802
28:49:42,320 --> 28:49:47,832
ar putea risca o supraadaptare.

37803
28:49:45,120 --> 28:49:50,480
Corect? Deci, în general, doriți să alegeți

37804
28:49:47,832 --> 28:49:52,232
un alfa um efectiv și efectiv

37805
28:49:50,480 --> 28:49:54,552
vom vedea h care este cel mai bun mod

37806
28:49:52,232 --> 28:49:56,080
a alege alfa. De fapt, mergem

37807
28:49:54,552 --> 28:49:58,640
să înveți cum să faci asta. ma duc sa

37808
28:49:56,080 --> 28:50:03,192
arată-ne cum să faci câteva tehnici de reglare

37809
28:49:58,640 --> 28:50:05,760
pentru a alege ce ar trebui să fie alfa. Hm, dar um

37810
28:50:03,192 --> 28:50:08,640
un alfa destul de standard al industriei care

37811
28:50:05,760 --> 28:50:12,232
majoritatea oamenilor este implicit alfa egal

37812
28:50:08,640 --> 28:50:14,480
la unul. Deci doar unul care semnalează

37813
28:50:12,232 --> 28:50:16,080
că ar trebui să existe o pedeapsă. noi

37814
28:50:14,480 --> 28:50:18,000
doar ai alfa egal cu unu este a

37815
28:50:16,080 --> 28:50:19,360
pedeapsa standard. Nu vrem să fie

37816
28:50:18,000 --> 28:50:20,640
prea sus. Nu vrem să fie și așa

37817
28:50:19,360 --> 28:50:23,440
scăzută. De parcă nu vrem să fie un

37818
28:50:20,640 --> 28:50:27,192
fracție. Hm, dar o penalizare de unul este

37819
28:50:23,440 --> 28:50:29,280
de obicei destul de bun.

37820
28:50:27,192 --> 28:50:32,480
Bine, am să-ți arăt unde

37821
28:50:29,280 --> 28:50:34,640
intră în joc într-o clipă.

37822
28:50:32,480 --> 28:50:37,832
Hm, dar întregul scop de a face asta

37823
28:50:34,640 --> 28:50:40,400
este atenuarea suprainstalării, nu? Hm

37824
28:50:37,832 --> 28:50:43,192
asta e și și făcând această pedeapsă

37825
28:50:40,400 --> 28:50:45,360
se numește regularizare. Deci adăugând

37826
28:50:43,192 --> 28:50:48,000
deci trecând dincolo de liniarul obișnuit

37827
28:50:45,360 --> 28:50:51,440
regresie adăugând această penalizare suplimentară la

37828
28:50:48,000 --> 28:50:54,720
la procesul de instruire um să penalizeze

37829
28:50:51,440 --> 28:50:58,320
greutăți mari coeficienți mari

37830
28:50:54,720 --> 28:51:01,912
um este cunoscut sub numele de regularizare.

37831
28:50:58,320 --> 28:51:04,080
Bine. Hm și sunt două comune

37832
28:51:01,912 --> 28:51:05,512
pedepsele care se adaugă. Hm, deci există

37833
28:51:04,080 --> 28:51:07,912
de fapt două variante diferite ale

37834
28:51:05,512 --> 28:51:10,232
pedeapsa. O să-i studiem pe amândoi

37835
28:51:07,912 --> 28:51:12,960
ei și ei sunt cunoscuți

37836
28:51:10,232 --> 28:51:14,960
laso. Deci, dacă luați regresia liniară

37837
28:51:12,960 --> 28:51:17,280
și adăugați un anumit tip de penalizare,

37838
28:51:14,960 --> 28:51:19,360
este cunoscut sub numele de lasso. Dacă adaugi altul

37839
28:51:17,280 --> 28:51:21,760
tip de pedeapsă, este cunoscută sub numele de creastă

37840
28:51:19,360 --> 28:51:23,680
regresie. O să-i studiem pe amândoi

37841
28:51:21,760 --> 28:51:26,400
acestea și care sunt diferențele lor.

37842
28:51:23,680 --> 28:51:29,192
Dar acestea sunt cele două principale

37843
28:51:26,400 --> 28:51:32,232
uh regularizare tech uh modele care

37844
28:51:29,192 --> 28:51:34,400
sunt folosite pentru a lua obișnuit ambele

37845
28:51:32,232 --> 28:51:37,360
acestea iau regresie liniară regulată și

37846
28:51:34,400 --> 28:51:39,192
doar modificați procesul de instruire a

37847
28:51:37,360 --> 28:51:43,760
puțin în moduri diferite. Două

37848
28:51:39,192 --> 28:51:46,800
moduri diferite. um folosind acel alfa

37849
28:51:43,760 --> 28:51:48,640
um să penalizeze puțin termenii

37850
28:51:46,800 --> 28:51:50,000
diferite moduri matematice. Deci suntem

37851
28:51:48,640 --> 28:51:52,480
o să învețe despre acești doi tipi.

37852
28:51:50,000 --> 28:51:54,320
Regresia lasso acolo. Ambele

37853
28:51:52,480 --> 28:51:56,800
sunt doar ramuri ale regresiei liniare.

37854
28:51:54,320 --> 28:51:59,600
Deci modelul de bază este încă liniar

37855
28:51:56,800 --> 28:52:02,960
regresie. Doar adaugă diferite tipuri

37856
28:51:59,600 --> 28:52:05,040
de penalizări la procesul de instruire.

37857
28:52:02,960 --> 28:52:09,440
Deci ambii sunt încă în familie

37858
28:52:05,040 --> 28:52:11,600
de regresie liniară. De fapt, în um in

37859
28:52:09,440 --> 28:52:13,680
scikitlearn, amândoi provin de la ei

37860
28:52:11,600 --> 28:52:16,232
ambele sunt încă din modelul liniar

37861
28:52:13,680 --> 28:52:18,080
familie în interiorul modelului liniar

37862
28:52:16,232 --> 28:52:19,832
modul, care este locul unde regresia liniară

37863
28:52:18,080 --> 28:52:22,552
provine din. Deci există încă liniar

37864
28:52:19,832 --> 28:52:25,680
regresie. Au doar diferite

37865
28:52:22,552 --> 28:52:28,960
stiluri de penalități adăugate acestora. Hm

37866
28:52:25,680 --> 28:52:32,080
pe care o să-l vedem.

37867
28:52:28,960 --> 28:52:34,960
Bine, deci ca să recapitulez

37868
28:52:32,080 --> 28:52:38,160
regularizarea este procesul de adăugare

37869
28:52:34,960 --> 28:52:40,552
o penalizare la antrenament pentru a descuraja

37870
28:52:38,160 --> 28:52:44,800
complexitate. În acest caz, vom merge

37871
28:52:40,552 --> 28:52:47,280
descurajează coeficienții mari.

37872
28:52:44,800 --> 28:52:49,280
Și asta ar trebui să ajute la prevenire

37873
28:52:47,280 --> 28:52:52,480
supraadaptare.

37874
28:52:49,280 --> 28:52:53,912
Și așa că acestea ne vor conduce la

37875
28:52:52,480 --> 28:52:55,192
două ramuri diferite de liniare

37876
28:52:53,912 --> 28:52:56,720
regresie care au două diferite

37877
28:52:55,192 --> 28:52:59,040
pedepsele.

37878
28:52:56,720 --> 28:53:01,832
regresia lasso și creste, ceea ce suntem

37879
28:52:59,040 --> 28:53:03,912
urmează să studiez,

37880
28:53:01,832 --> 28:53:06,080
dar ele funcționează la fel ca

37881
28:53:03,912 --> 28:53:08,232
regresie liniară. Doar vor avea

37882
28:53:06,080 --> 28:53:12,232
termene de penalizare diferite adăugate acestora

37883
28:53:08,232 --> 28:53:15,912
procesul de antrenament um să descurajeze

37884
28:53:12,232 --> 28:53:18,912
descurajați-i din nou pe cei mari

37885
28:53:15,912 --> 28:53:18,912
greutăți.

37886
28:53:20,720 --> 28:53:24,080
Bine, orice întrebări despre regularizare

37887
28:53:22,552 --> 28:53:27,192
înainte de a ne uita prima dată la noi mergem

37888
28:53:24,080 --> 28:53:28,960
să ne uităm la prima noastră variantă de pe on

37889
28:53:27,192 --> 28:53:32,480
prima noastră tehnică de regularizare care

37890
28:53:28,960 --> 28:53:32,480
se va numi regresie lazo.

37891
28:53:48,232 --> 28:53:53,280
Bine, să ne uităm la regresia lasso. Deci

37892
28:53:50,872 --> 28:53:56,480
ce este regresia lasso? Este de fapt

37893
28:53:53,280 --> 28:53:58,160
lasso este scurt pentru cel puțin absolut

37894
28:53:56,480 --> 28:54:03,912
operator de contracție și selecție

37895
28:53:58,160 --> 28:54:07,360
regresie. Hm și asta va funcționa de

37896
28:54:03,912 --> 28:54:09,360
adăugarea unei anumite pedepse la

37897
28:54:07,360 --> 28:54:11,040
model de regresie liniară. Deci, din nou, este

37898
28:54:09,360 --> 28:54:13,360
bazată pe regresia liniară. Asta este

37899
28:54:11,040 --> 28:54:16,480
modelul de bază. Doar că în timpul

37900
28:54:13,360 --> 28:54:21,192
procesul de instruire, mergem la um

37901
28:54:16,480 --> 28:54:23,512
adaugă o pedeapsă care are ca efect

37902
28:54:21,192 --> 28:54:25,600
micsorarea greutatilor. De aceea

37903
28:54:23,512 --> 28:54:28,400
se numește contracție. Încurajează

37904
28:54:25,600 --> 28:54:30,800
greutăți mai mici prin pedeapsa respectivă.

37905
28:54:28,400 --> 28:54:33,512
Și, de asemenea, va micșora unii dintre ei așa

37906
28:54:30,800 --> 28:54:36,232
mult că vor deveni zero. Și așa este

37907
28:54:33,512 --> 28:54:38,400
are are un efect de tip de selecție

37908
28:54:36,232 --> 28:54:40,480
ceea ce înseamnă că unele dintre ele sunt șterse

37909
28:54:38,400 --> 28:54:43,120
afară la zero.

37910
28:54:40,480 --> 28:54:45,912
Și asta înseamnă că orice a mai rămas

37911
28:54:43,120 --> 28:54:48,160
peste este un fel de ceea ce este selectat ca al nostru

37912
28:54:45,912 --> 28:54:50,480
caracteristici pentru că celelalte vor

37913
28:54:48,160 --> 28:54:54,872
li se aplică greutate zero. Aşa

37914
28:54:50,480 --> 28:54:58,232
această penalizare va favoriza cu adevărat micii

37915
28:54:54,872 --> 28:55:00,480
cântărește um și penalizează foarte mare

37916
28:54:58,232 --> 28:55:02,552
greutăți. De fapt, va favoriza micii

37917
28:55:00,480 --> 28:55:06,320
cântăresc atât de mult încât unii dintre ei vor

37918
28:55:02,552 --> 28:55:08,800
de fapt um fi micșorat la zero um în timpul

37919
28:55:06,320 --> 28:55:12,960
procesul de instruire. Și cei care

37920
28:55:08,800 --> 28:55:15,680
au rămas sunt cei care sunt

37921
28:55:12,960 --> 28:55:17,832
cele care sunt ceea ce numim selectate

37922
28:55:15,680 --> 28:55:20,552
pentru că ei sunt cei care rămân în

37923
28:55:17,832 --> 28:55:24,720
in antrenament um dupa ceilalti

37924
28:55:20,552 --> 28:55:27,040
obține uh coeficienți de zero. Hm acum când

37925
28:55:24,720 --> 28:55:29,120
faci o parte din coeficient zero

37926
28:55:27,040 --> 28:55:31,120
tu faci în mod inerent modelul

37927
28:55:29,120 --> 28:55:33,680
mai simplu, chiar există mai puține funcții

37928
28:55:31,120 --> 28:55:35,280
implicat în predicția că sau mai puțin

37929
28:55:33,680 --> 28:55:37,832
caracteristici care au un efect asupra

37930
28:55:35,280 --> 28:55:41,440
predictie. Deci asta face cu siguranță

37931
28:55:37,832 --> 28:55:45,192
model mai simplu. Acest lasso această contracție

37932
28:55:41,440 --> 28:55:48,872
și procesul de selecție face ca

37933
28:55:45,192 --> 28:55:50,320
model mai simplu cu siguranta. Hm

37934
28:55:48,872 --> 28:55:52,000
iar asta ar trebui să se reducă

37935
28:55:50,320 --> 28:55:54,552
supraadaptare. Corect? Dacă faci

37936
28:55:52,000 --> 28:55:56,320
model mai simplu, nu este la fel de complex. Ea

37937
28:55:54,552 --> 28:55:59,440
are mai puține șanse să memoreze

37938
28:55:56,320 --> 28:56:03,192
date de instruire și nu generalizarea peste

37939
28:55:59,440 --> 28:56:05,440
pentru a testa datele. Deci întregul nostru obiectiv cu uh

37940
28:56:03,192 --> 28:56:08,552
regularizarea este să ne facem modelul

37941
28:56:05,440 --> 28:56:10,552
mai bine la generalizare, nu? Peste la

37942
28:56:08,552 --> 28:56:12,400
date de testare din antrenamentul original

37943
28:56:10,552 --> 28:56:15,440
date.

37944
28:56:12,400 --> 28:56:18,480
Hm, deci cum se întâmplă asta? Trebuie

37945
28:56:15,440 --> 28:56:20,640
întoarce-te la

37946
28:56:18,480 --> 28:56:22,640
uh proces de antrenament. Dacă voi băieți

37947
28:56:20,640 --> 28:56:24,872
amintiți-vă, am scris această ecuație a

37948
28:56:22,640 --> 28:56:27,040
puțin mai devreme, care este

37949
28:56:24,872 --> 28:56:28,800
distanta. Aceasta este suma pătratului

37950
28:56:27,040 --> 28:56:30,400
distanța dintre etichetele noastre și ale noastre

37951
28:56:28,800 --> 28:56:32,720
predictie.

37952
28:56:30,400 --> 28:56:34,232
Aceasta este practic eroarea pătratică medie

37953
28:56:32,720 --> 28:56:36,640
uh calcul pe care încercăm

37954
28:56:34,232 --> 28:56:38,960
reduce atunci când construim modelul nostru folosind

37955
28:56:36,640 --> 28:56:41,440
date de antrenament. Hm, deci asta este doar în

37956
28:56:38,960 --> 28:56:45,832
regresie liniară standard. Acesta este

37957
28:56:41,440 --> 28:56:47,680
um uh suma de pătrate uh distanță, nu?

37958
28:56:45,832 --> 28:56:50,080
Deci acesta este modelul

37959
28:56:47,680 --> 28:56:51,600
încercând să minimizeze atunci când le învață

37960
28:56:50,080 --> 28:56:53,832
coeficienți.

37961
28:56:51,600 --> 28:56:58,360
Deci, când învață acești coeficienți,

37962
28:56:53,832 --> 28:56:58,360
încearcă să-l minimizeze pe tipul ăsta

37963
28:56:58,552 --> 28:57:03,832
minimiza. Încearcă să găsească beta-urile

37964
28:57:01,192 --> 28:57:05,912
care minimizează această cantitate

37965
28:57:03,832 --> 28:57:08,720
din punct de vedere matematic. Asta face.

37966
28:57:05,912 --> 28:57:11,120
Um și există un algoritm care

37967
28:57:08,720 --> 28:57:12,640
va descoperi care sunt cele mai bune beta

37968
28:57:11,120 --> 28:57:14,800
care minimizează efectiv utilizările care dă

37969
28:57:12,640 --> 28:57:15,912
noi o linie cea mai potrivită, nu? Asta e

37970
28:57:14,800 --> 28:57:17,832
despre ce am tot vorbit

37971
28:57:15,912 --> 28:57:21,280
regresie.

37972
28:57:17,832 --> 28:57:22,872
Acum, în regularizare,

37973
28:57:21,280 --> 28:57:24,872
iată, apropo, aici este același lucru

37974
28:57:22,872 --> 28:57:28,080
lucru, dar tocmai am introdus modelul nostru

37975
28:57:24,872 --> 28:57:29,760
pentru previziuni. Acesta este modelul nostru.

37976
28:57:28,080 --> 28:57:32,232
Doar un mod fantezist de a ne scrie

37977
28:57:29,760 --> 28:57:36,480
model, nu? Este beta 0 plus toate

37978
28:57:32,232 --> 28:57:38,720
dintre aceste beta. Deci, beta 1 x1 plus beta

37979
28:57:36,480 --> 28:57:41,912
2 x2

37980
28:57:38,720 --> 28:57:43,600
plus și mai departe și mai departe, nu? Asta e

37981
28:57:41,912 --> 28:57:45,280
asta înseamnă asta. Dacă ești

37982
28:57:43,600 --> 28:57:47,440
nefamiliarizat cu notația sigma, ea

37983
28:57:45,280 --> 28:57:52,232
înseamnă doar suma. Deci este suma tuturor

37984
28:57:47,440 --> 28:57:54,320
băieții ăștia sau acest termen. Um, deci asta este

37985
28:57:52,232 --> 28:57:57,320
acesta aici este doar un liniar obișnuit

37986
28:57:54,320 --> 28:57:57,320
regresie

37987
28:57:58,960 --> 28:58:05,040
uh antrenamentul regulat de regresie liniară

37988
28:58:01,680 --> 28:58:07,600
antrenament. Deci noi procesul de formare

37989
28:58:05,040 --> 28:58:09,912
rezolvă acești parametri, nu? Ea

37990
28:58:07,600 --> 28:58:11,600
rezolvă aceste greutăți. Descoperim

37991
28:58:09,912 --> 28:58:13,440
care sunt acestea minimizând acest lucru

37992
28:58:11,600 --> 28:58:18,000
cantitate. Asta e tot antrenamentul

37993
28:58:13,440 --> 28:58:23,280
proces. Hm, dar când facem lasso,

37994
28:58:18,000 --> 28:58:27,160
adăugăm o penalizare care este aceasta.

37995
28:58:23,280 --> 28:58:27,160
Iată pedeapsa noastră.

37996
28:58:27,760 --> 28:58:34,320
Deci, practic, luăm liniarul nostru

37997
28:58:31,360 --> 28:58:37,192
antrenament de regresie care este acesta și noi

37998
28:58:34,320 --> 28:58:40,160
adăugați o penalizare care este aceasta. Iar tu

37999
28:58:37,192 --> 28:58:42,960
pot vedea exact ce pedeapsă atunci când

38000
28:58:40,160 --> 28:58:45,360
atunci când minimizați această penalizare. Este

38001
28:58:42,960 --> 28:58:46,872
când aceste greutăți sunt mici. Deci asta

38002
28:58:45,360 --> 28:58:50,232
încurajează

38003
28:58:46,872 --> 28:58:53,872
Deci minimizarea acestei cantități încurajează

38004
28:58:50,232 --> 28:58:53,872
greutăți mici

38005
28:58:53,912 --> 28:58:59,680
încurajează beta-urile mici

38006
28:58:57,360 --> 28:59:04,000
beta I

38007
28:58:59,680 --> 28:59:07,040
corect sau în acest caz beta j îmi pare rău

38008
28:59:04,000 --> 28:59:11,080
acest lucru încurajează beta mică js uh pentru că

38009
28:59:07,040 --> 28:59:11,080
vrem ca acest lucru să fie minimizat

38010
28:59:11,280 --> 28:59:16,320
minimizat

38011
28:59:13,832 --> 28:59:18,960
Deci, ce va face asta să fie minim

38012
28:59:16,320 --> 28:59:20,800
este desigur linia cea mai potrivită și

38013
28:59:18,960 --> 28:59:24,000
greutăți mici, nu? Urmează să facă

38014
28:59:20,800 --> 28:59:26,160
vor reduce această eroare

38015
28:59:24,000 --> 28:59:28,480
majoritatea.

38016
28:59:26,160 --> 28:59:30,640
Deci, um, și aici este alfa noastră, nu?

38017
28:59:28,480 --> 28:59:33,192
Iată alfa noastră. Deci, puteți încuraja

38018
28:59:30,640 --> 28:59:36,800
o penalizare mai mare cu un alfa mai mare sau

38019
28:59:33,192 --> 28:59:39,280
o pedeapsă mai mică. Dacă alfa este egal cu zero,

38020
28:59:36,800 --> 28:59:41,440
ce se intampla cu acel termen? Doar merge

38021
28:59:39,280 --> 28:59:45,360
departe. Deci, dacă alfa este egal cu zero, există

38022
28:59:41,440 --> 28:59:47,280
nicio penalizare și ne-am întors

38023
28:59:45,360 --> 28:59:50,000
înapoi la normal

38024
28:59:47,280 --> 28:59:51,440
regresie liniară.

38025
28:59:50,000 --> 28:59:52,640
Avem doar o regresie liniară regulată

38026
28:59:51,440 --> 28:59:56,000
pentru că nu avem nicio penalizare în acel moment

38027
28:59:52,640 --> 28:59:59,360
când alfa este egal cu zero. Deci, cu cât este mai mic

38028
28:59:56,000 --> 29:00:03,040
alpha este, cu atât suntem mai puțin penalizați

38029
28:59:59,360 --> 29:00:04,800
executarea şi în regularizare.

38030
29:00:03,040 --> 29:00:07,360
Bine.

38031
29:00:04,800 --> 29:00:10,320
Acum, ceea ce se întâmplă este în realitate când tu

38032
29:00:07,360 --> 29:00:12,080
antrenează-te cu lazo. Deci, acesta este lasso

38033
29:00:10,320 --> 29:00:14,720
această pedeapsă specială. Aceasta se numește

38034
29:00:12,080 --> 29:00:17,912
pedeapsa cu lasso

38035
29:00:14,720 --> 29:00:19,832
sau uneori oamenii numesc asta L1

38036
29:00:17,912 --> 29:00:23,120
pedeapsa.

38037
29:00:19,832 --> 29:00:26,232
Um L1 vine doar din faptul că asta

38038
29:00:23,120 --> 29:00:28,232
este prima putere sau valoare absolută. Hm

38039
29:00:26,232 --> 29:00:31,600
deci nu este o penalizare la pătrat, este un

38040
29:00:28,232 --> 29:00:35,912
o singură pedeapsă de putere

38041
29:00:31,600 --> 29:00:38,640
um acolo. Dar când adaugi acest lasso

38042
29:00:35,912 --> 29:00:40,552
pedeapsă, ceea ce se poate întâmpla este că se întâmplă

38043
29:00:38,640 --> 29:00:42,960
pentru că pentru că minimizi

38044
29:00:40,552 --> 29:00:46,080
asta, încurajează unele dintre acestea

38045
29:00:42,960 --> 29:00:48,480
greutățile să devină zero.

38046
29:00:46,080 --> 29:00:51,760
Deci unele dacă chiar încerci să obții

38047
29:00:48,480 --> 29:00:54,640
cea mai mică cantitate din aceasta,

38048
29:00:51,760 --> 29:00:57,280
cu cât mai jos, cu atât mai bine.

38049
29:00:54,640 --> 29:00:58,640
Ceea ce face acest lucru mai jos este, desigur

38050
29:00:57,280 --> 29:01:01,280
dacă unele dintre acestea dispar dacă unele dintre

38051
29:00:58,640 --> 29:01:03,600
acestea merg la zero, apoi asta desigur

38052
29:01:01,280 --> 29:01:05,832
va coborî acest lucru la fel de mult ca noi la fel de mult ca

38053
29:01:03,600 --> 29:01:08,080
posibil corect deci ce se întâmplă în timpul

38054
29:01:05,832 --> 29:01:10,080
instruirea este unele dintre acestea

38055
29:01:08,080 --> 29:01:12,640
coeficienți de fapt sunt încurajați

38056
29:01:10,080 --> 29:01:15,280
a fi mic din cauza acestei pedepse dar

38057
29:01:12,640 --> 29:01:18,320
unii dintre ei vor deveni de fapt voință

38058
29:01:15,280 --> 29:01:20,960
deveni de fapt zero um pentru a obține

38059
29:01:18,320 --> 29:01:22,552
cel mai bun model din care se potrivește cel mai bine

38060
29:01:20,960 --> 29:01:24,552
acestea vor deveni de fapt atât de mici încât

38061
29:01:22,552 --> 29:01:27,440
practic vor deveni zero

38062
29:01:24,552 --> 29:01:30,480
Și asta înseamnă că acea caracteristică

38063
29:01:27,440 --> 29:01:33,040
practic nu mai are efect. Este

38064
29:01:30,480 --> 29:01:34,800
a fost că modelul a fost simplificat,

38065
29:01:33,040 --> 29:01:38,040
nu? Această caracteristică nu mai are cu adevărat

38066
29:01:34,800 --> 29:01:38,040
un efect.

38067
29:01:40,480 --> 29:01:46,160
Așa că doar să strig alfa din nou, um

38068
29:01:42,960 --> 29:01:48,320
dacă alfa zero ceva cod, practic

38069
29:01:46,160 --> 29:01:50,000
ai regresia ta liniară, ești

38070
29:01:48,320 --> 29:01:51,832
înapoi la regresia liniară deoarece alfa

38071
29:01:50,000 --> 29:01:54,080
0 doar șterge asta și tu ești

38072
29:01:51,832 --> 29:01:56,480
înapoi la regresia liniară.

38073
29:01:54,080 --> 29:01:58,480
um dacă alfa este infinit. Acum, dacă alfa este

38074
29:01:56,480 --> 29:02:00,480
infinitul este o extremă. Deci, dacă alfa

38075
29:01:58,480 --> 29:02:02,480
este infinitul singurul mod de a face asta

38076
29:02:00,480 --> 29:02:05,120
minimize este dacă toți coeficienții tăi sunt

38077
29:02:02,480 --> 29:02:07,912
zero. Dacă fiecare beta este zero, atunci aceasta

38078
29:02:05,120 --> 29:02:09,680
va reduce eroarea la fel de mult ca

38079
29:02:07,912 --> 29:02:12,160
posibil. Deci practic nu ai

38080
29:02:09,680 --> 29:02:14,960
model. Deci dacă toți coeficienții sunt zero

38081
29:02:12,160 --> 29:02:17,512
nu ai model si asta e inutil. Deci

38082
29:02:14,960 --> 29:02:19,360
nu vrei pedeapsa ta, nu vrei

38083
29:02:17,512 --> 29:02:20,720
vrei ca alfa ta să fie uriașă asta

38084
29:02:19,360 --> 29:02:22,320
spune. Nici tu nu-ți dorești

38085
29:02:20,720 --> 29:02:23,832
alfa să fie mic. practic te-ai intors

38086
29:02:22,320 --> 29:02:27,512
la regresia liniară. Deci vrei

38087
29:02:23,832 --> 29:02:31,832
ceva la mijloc. Hm și tipicul

38088
29:02:27,512 --> 29:02:35,360
valoarea tipică este alfa egal cu 1.

38089
29:02:31,832 --> 29:02:38,960
Tipic este alfa egal cu 1

38090
29:02:35,360 --> 29:02:40,960
pentru a avea un anumit nivel de penalizare acolo. Deci

38091
29:02:38,960 --> 29:02:43,960
doar o pedeapsă obișnuită

38092
29:02:40,960 --> 29:02:43,960
termen.

38093
29:02:48,400 --> 29:02:52,640
Dar de fapt vom avea o cale

38094
29:02:50,320 --> 29:02:55,800
pentru a testa și a evalua care sunt alfa

38095
29:02:52,640 --> 29:02:55,800
cel mai bun.

38096
29:03:07,440 --> 29:03:12,000
um,

38097
29:03:08,960 --> 29:03:13,760
practic poți, da poți avea un

38098
29:03:12,000 --> 29:03:16,232
poți avea un penalty care este aproape de

38099
29:03:13,760 --> 29:03:18,160
zero. Puteți scăpa de asta dacă doar a

38100
29:03:16,232 --> 29:03:20,552
regresia liniară regulată efectuează

38101
29:03:18,160 --> 29:03:23,040
destul de bine. Practic poți avea nu

38102
29:03:20,552 --> 29:03:26,320
pedeapsa in acest caz.

38103
29:03:23,040 --> 29:03:28,160
Da. Deci mai aproape de zero sau așa cum ar putea fi

38104
29:03:26,320 --> 29:03:30,480
asta adăugând un pic de penalizare

38105
29:03:28,160 --> 29:03:32,400
ajută de fapt supraadaptarea și asta

38106
29:03:30,480 --> 29:03:34,640
ar putea fi chiar mic. Un lucru care

38107
29:03:32,400 --> 29:03:39,320
practic o să facem este să avem o

38108
29:03:34,640 --> 29:03:39,320
strategie de a încerca diferite alfa.

38109
29:03:40,640 --> 29:03:47,280
încercați diferite alfa

38110
29:03:43,192 --> 29:03:49,440
și evaluează performanța

38111
29:03:47,280 --> 29:03:51,192
și apoi putem decide care, așa că este

38112
29:03:49,440 --> 29:03:52,800
ceea ce vom face este să avem o

38113
29:03:51,192 --> 29:03:56,000
strategie de a conecta doar diferite

38114
29:03:52,800 --> 29:03:58,232
alfa generează asemenea antrenează modelul

38115
29:03:56,000 --> 29:04:00,232
și apoi vezi care este performanța sa și

38116
29:03:58,232 --> 29:04:03,192
vezi dacă acele alfa sunt bune ce ce

38117
29:04:00,232 --> 29:04:04,720
care alfa este cel mai bun pe care îl putem evalua

38118
29:04:03,192 --> 29:04:06,400
că

38119
29:04:04,720 --> 29:04:10,280
pentru că putem antrena modelul și vedem

38120
29:04:06,400 --> 29:04:10,280
care este performanța

38121
29:04:11,280 --> 29:04:15,912
corect.

38122
29:04:14,232 --> 29:04:19,232
Da. Da. Deci, vom face asta. Vom face

38123
29:04:15,912 --> 29:04:19,232
practica asta.

38124
29:04:24,320 --> 29:04:28,872
Bine. Mare. Orice alte întrebări despre

38125
29:04:26,552 --> 29:04:30,800
această regresie lazo? Deci, amintiți-vă asta

38126
29:04:28,872 --> 29:04:33,040
este regresia liniară aici. Acesta este

38127
29:04:30,800 --> 29:04:35,832
așa te antrenezi pentru a găsi

38128
29:04:33,040 --> 29:04:40,232
beta în regresie liniară. Deci asta este

38129
29:04:35,832 --> 29:04:42,160
doar regresie liniară uh um antrenament

38130
29:04:40,232 --> 29:04:44,480
functioneaza acolo.

38131
29:04:42,160 --> 29:04:47,280
Adăugăm o penalizare care este aceasta

38132
29:04:44,480 --> 29:04:49,512
pedeapsa cu lasso

38133
29:04:47,280 --> 29:04:52,960
pedeapsă cu lasso, chiar adăugăm

38134
29:04:49,512 --> 29:04:56,000
că aceasta este cunoscută sub denumirea de regularizare

38135
29:04:52,960 --> 29:04:57,832
iar scopul regularizării este de a

38136
29:04:56,000 --> 29:05:00,640
a preveni supraadaptarea. Deci adăugați un

38137
29:04:57,832 --> 29:05:03,040
penalizare aici asta face modelul

38138
29:05:00,640 --> 29:05:06,160
mai simplu, ceea ce previne supraadaptarea.

38139
29:05:03,040 --> 29:05:09,160
te ajută să generalizezi mai bine atunci când este

38140
29:05:06,160 --> 29:05:09,160
mai simplu.

38141
29:05:16,480 --> 29:05:19,600
Aveți întrebări conceptuale despre asta?

38142
29:05:18,080 --> 29:05:25,160
Vom face un exemplu de cod cu el

38143
29:05:19,600 --> 29:05:25,160
urmează, dar vreo întrebare despre asta?

38144
29:05:37,360 --> 29:05:41,440
Uh da, tu tu, așa că asta e chestia,

38145
29:05:39,680 --> 29:05:44,232
Ronald, ai putea fi dispus

38146
29:05:41,440 --> 29:05:46,800
sacrifica o oarecare precizie pentru a

38147
29:05:44,232 --> 29:05:48,552
generalizează la date nevăzute deoarece

38148
29:05:46,800 --> 29:05:51,120
amintiți-vă că asta încercăm cu adevărat

38149
29:05:48,552 --> 29:05:52,872
este posibil să fim dispuși

38150
29:05:51,120 --> 29:05:54,720
sacrifica o oarecare precizie pe acest antrenament

38151
29:05:52,872 --> 29:05:57,680
date pentru ca acestea să funcționeze mai bine

38152
29:05:54,720 --> 29:05:59,680
pe datele testului, nu? putem fi

38153
29:05:57,680 --> 29:06:02,640
dispus să facă asta. Asta e vointa

38154
29:05:59,680 --> 29:06:05,120
este un sacrificiu ok

38155
29:06:02,640 --> 29:06:07,760
atâta timp ca dacă se generalizează

38156
29:06:05,120 --> 29:06:09,600
mai bine. Asta ne dorim. Asta este

38157
29:06:07,760 --> 29:06:13,040
noi încercăm să facem aici este să adăugăm o

38158
29:06:09,600 --> 29:06:16,552
penalizare, simplificați modelul și

38159
29:06:13,040 --> 29:06:20,000
ajută-l să se generalizeze mai bine la noi și

38160
29:06:16,552 --> 29:06:21,360
date nevăzute. Corect?

38161
29:06:20,000 --> 29:06:25,192
Asta e poza cu care am folosit-o

38162
29:06:21,360 --> 29:06:27,680
cu trenul um și diviziunea de testare.

38163
29:06:25,192 --> 29:06:30,800
Unde este pătratul?

38164
29:06:27,680 --> 29:06:36,320
Deci în model nu există pătrat. Deci

38165
29:06:30,800 --> 29:06:38,800
rețineți că modelul este modelul acesta

38166
29:06:36,320 --> 29:06:43,912
um ecuație uh care nu are pătrate

38167
29:06:38,800 --> 29:06:50,080
asta, nu? Este beta 0 plus beta 1 x1

38168
29:06:43,912 --> 29:06:52,080
plus beta 2 x2 plus beta n xn.

38169
29:06:50,080 --> 29:06:55,680
Aceasta este regresia liniară

38170
29:06:52,080 --> 29:06:58,160
model. Acesta este acum, acesta este

38171
29:06:55,680 --> 29:07:01,280
model dar aceasta este ecuația care

38172
29:06:58,160 --> 29:07:03,360
ne ajută să ne antrenăm și să găsim beta-urile. Aceasta

38173
29:07:01,280 --> 29:07:07,280
acesta este ceea ce găsim beta-urile

38174
29:07:03,360 --> 29:07:10,080
cu. Deci vom continua. Am fost

38175
29:07:07,280 --> 29:07:13,192
vorbind despre regresia lasso care

38176
29:07:10,080 --> 29:07:16,160
uh adaugă că este nevoie de regresie liniară corect

38177
29:07:13,192 --> 29:07:20,480
care este această optimizare și adaugă în a

38178
29:07:16,160 --> 29:07:23,600
pedeapsa um scalată de alfa. Hm, și

38179
29:07:20,480 --> 29:07:26,872
ce face asta pentru a minimiza acest lucru

38180
29:07:23,600 --> 29:07:30,000
întreg, încurajează acestea să fie

38181
29:07:26,872 --> 29:07:32,320
mic posibil. Hm, ceea ce face

38182
29:07:30,000 --> 29:07:35,280
modelul mai simplu, nu? Greutățile

38183
29:07:32,320 --> 29:07:37,440
nu devii prea mare și complex. um,

38184
29:07:35,280 --> 29:07:39,040
ei tind să rămână mici. De fapt,

38185
29:07:37,440 --> 29:07:41,360
unii dintre ei pot merge chiar până la

38186
29:07:39,040 --> 29:07:43,192
zero. Hm, ceea ce face modelul uniform

38187
29:07:41,360 --> 29:07:47,280
mai simplu,

38188
29:07:43,192 --> 29:07:48,800
nu? Um, deci haideți să exersăm folosirea lui

38189
29:07:47,280 --> 29:07:51,040
în cod. De fapt, este foarte ușor

38190
29:07:48,800 --> 29:07:55,040
folosi. Va fi în esență

38191
29:07:51,040 --> 29:07:58,000
același stil și cod ca liniar

38192
29:07:55,040 --> 29:08:01,912
regresie, doar că mergem

38193
29:07:58,000 --> 29:08:06,640
trebuie să punem parametrul nostru alfa

38194
29:08:01,912 --> 29:08:10,552
atunci când folosim lassoul. Deci iată-ne

38195
29:08:06,640 --> 29:08:12,000
um din familia modelului liniar dreapta

38196
29:08:10,552 --> 29:08:13,512
ceea ce are sens. Este un liniar

38197
29:08:12,000 --> 29:08:15,912
ram de regresie care are aceasta

38198
29:08:13,512 --> 29:08:19,120
penalizare în ea în timpul antrenamentului. um noi

38199
29:08:15,912 --> 29:08:22,480
ne apucă regresia lasso. Um asta

38200
29:08:19,120 --> 29:08:23,760
are de asemenea o versiune a lassoului care

38201
29:08:22,480 --> 29:08:26,232
vom arunca o privire la asta

38202
29:08:23,760 --> 29:08:29,440
folosit pentru validarea încrucișată care este

38203
29:08:26,232 --> 29:08:31,600
chiar e convenabil. Asa a fost

38204
29:08:29,440 --> 29:08:34,080
un lasso de validare încrucișată care este a

38205
29:08:31,600 --> 29:08:37,440
combinație cu adevărat convenabilă de

38206
29:08:34,080 --> 29:08:39,680
practic cross val scor și lasso um

38207
29:08:37,440 --> 29:08:42,552
toate într-una. Deci chiar este

38208
29:08:39,680 --> 29:08:45,600
placut sa folosesti asa. Hm, deci vom lua o

38209
29:08:42,552 --> 29:08:47,280
uita-te la acel exemplu. Hm, dar suntem

38210
29:08:45,600 --> 29:08:50,000
importând-o. Principalul lucru este să

38211
29:08:47,280 --> 29:08:51,440
fii modelul lasso aici. Hm, mergem

38212
29:08:50,000 --> 29:08:54,232
pentru a utiliza un set de date diferit

38213
29:08:51,440 --> 29:08:56,400
acesta. Deci, nu datele oceanului, dar

38214
29:08:54,232 --> 29:09:01,912
asta lovește date, care este o minge de baseball

38215
29:08:56,400 --> 29:09:03,680
set de date. Um, deci are 322 de rânduri cu

38216
29:09:01,912 --> 29:09:06,552
20 de coloane diferite și arată ca

38217
29:09:03,680 --> 29:09:08,480
aceasta. Deci, vrei să-l descarci.

38218
29:09:06,552 --> 29:09:11,440
Sper că aveți acces la

38219
29:09:08,480 --> 29:09:13,512
acela.

38220
29:09:11,440 --> 29:09:16,800
um,

38221
29:09:13,512 --> 29:09:19,600
asa ca il voi incarca in

38222
29:09:16,800 --> 29:09:23,400
aceasta.

38223
29:09:19,600 --> 29:09:23,400
Așa că dă-mi un moment.

38224
29:09:25,680 --> 29:09:32,800
E asta. Și apoi putem rula asta.

38225
29:09:29,760 --> 29:09:36,160
Bine. Deci afișăm datele și

38226
29:09:32,800 --> 29:09:37,280
deci are numele lovitorilor și

38227
29:09:36,160 --> 29:09:38,872
apoi are o grămadă de diferite

38228
29:09:37,280 --> 29:09:40,160
statistici. Toate acestea sunt baseball

38229
29:09:38,872 --> 29:09:42,080
statistici.

38230
29:09:40,160 --> 29:09:44,232
Hm, dacă nu ești familiarizat cu ei,

38231
29:09:42,080 --> 29:09:49,160
e în regulă. Nu e mare lucru. um,

38232
29:09:44,232 --> 29:09:49,160
dar aici doar statistici de baseball diferite.

38233
29:09:49,360 --> 29:09:52,960
Bine. Ați reușit să încărcați asta?

38234
29:09:51,440 --> 29:09:54,400
Hm, dacă te urmărești, ai fost

38235
29:09:52,960 --> 29:09:58,552
reusesti sa incarci asta? Ar trebui să fii

38236
29:09:54,400 --> 29:09:59,680
acces la aceste date. Lovitorii CSV.

38237
29:09:58,552 --> 29:10:02,000
Acesta este cel pentru care vom folosi

38238
29:09:59,680 --> 29:10:06,120
modelul lasso

38239
29:10:02,000 --> 29:10:06,120
pentru a construi un model lasso.

38240
29:10:12,872 --> 29:10:15,872
Da.

38241
29:10:19,192 --> 29:10:25,600
Bine. Capabil să îl încarce pe acela. Perfect.

38242
29:10:22,800 --> 29:10:28,720
Bine. Deci, capabil să-l încărcați. Hm, și

38243
29:10:25,600 --> 29:10:31,832
ne uităm la cap. Um, deci

38244
29:10:28,720 --> 29:10:33,440
de fapt o să renunțăm la asta

38245
29:10:31,832 --> 29:10:35,600
coloană fără nume pentru că nu ne pasă

38246
29:10:33,440 --> 29:10:37,360
despre numele lor. este de fapt doar

38247
29:10:35,600 --> 29:10:40,720
numele batetorului care nu va fi

38248
29:10:37,360 --> 29:10:44,000
util în modelare. Așa și amintește-ți

38249
29:10:40,720 --> 29:10:47,120
asta este în general adevărat ca un ID, un utilizator

38250
29:10:44,000 --> 29:10:48,720
ID, cum ar fi un ID de client, un nume, asta e

38251
29:10:47,120 --> 29:10:50,080
de obicei nu va fi de folos în niciuna

38252
29:10:48,720 --> 29:10:52,320
un fel de modelare. Deci suntem de fapt doar

38253
29:10:50,080 --> 29:10:54,720
o să aruncăm acea coloană și suntem

38254
29:10:52,320 --> 29:10:56,640
o să o facă pe loc.

38255
29:10:54,720 --> 29:10:59,760
Și accesul este egal cu 1 înseamnă că renunțăm

38256
29:10:56,640 --> 29:11:02,000
acea coloană. Um, deci vom renunța

38257
29:10:59,760 --> 29:11:03,760
asta și nu ar trebui să mai avem asta

38258
29:11:02,000 --> 29:11:05,832
coloană și îi avem pe toți acești tipi

38259
29:11:03,760 --> 29:11:10,232
acum. Deci vrei să rulezi asta. Aceasta va

38260
29:11:05,832 --> 29:11:14,080
arunca asta. Um, asta va scădea picăturile

38261
29:11:10,232 --> 29:11:18,000
coloană pe loc.

38262
29:11:14,080 --> 29:11:21,760
Um, și acum putem vedea că avem toți

38263
29:11:18,000 --> 29:11:24,480
avem aceste date unde avem asta

38264
29:11:21,760 --> 29:11:26,320
datele de unde sunt acum eliminate. Deci, asta

38265
29:11:24,480 --> 29:11:30,160
acea coloană a dispărut și acum avem

38266
29:11:26,320 --> 29:11:32,800
tipii astia. Um, observi ceva

38267
29:11:30,160 --> 29:11:36,280
despre asta

38268
29:11:32,800 --> 29:11:36,280
din informatii?

38269
29:11:38,160 --> 29:11:42,480
Se pare că avem câteva categorice

38270
29:11:39,680 --> 29:11:44,872
caracteristici, câteva dintre ele, liga și

38271
29:11:42,480 --> 29:11:47,832
diviziune

38272
29:11:44,872 --> 29:11:50,832
și ligă nouă. Despre ce observi

38273
29:11:47,832 --> 29:11:50,832
aceasta

38274
29:11:56,232 --> 29:12:00,400
nule? Da. Deci, cu siguranță există

38275
29:11:57,760 --> 29:12:04,040
niște date lipsesc acolo că suntem

38276
29:12:00,400 --> 29:12:04,040
va avea de-a face cu.

38277
29:12:05,832 --> 29:12:11,192
Deci, se pare că există

38278
29:12:09,680 --> 29:12:15,280
59.

38279
29:12:11,192 --> 29:12:17,912
Sunt 59. Acum am putea

38280
29:12:15,280 --> 29:12:19,760
alternativă pentru a face asta este că am putea uh

38281
29:12:17,912 --> 29:12:21,832
am putea folosi codul nostru obișnuit unde

38282
29:12:19,760 --> 29:12:24,720
facem dfis

38283
29:12:21,832 --> 29:12:29,360
uh este nul.

38284
29:12:24,720 --> 29:12:31,760
Um și apoi facem uh dot suma la total

38285
29:12:29,360 --> 29:12:34,640
cei de pe diferitele noastre coloane.

38286
29:12:31,760 --> 29:12:37,280
Și putem vedea că avem 59 de

38287
29:12:34,640 --> 29:12:38,800
cei din coloana de salarii. Asta e

38288
29:12:37,280 --> 29:12:41,800
este modul standard de a face asta,

38289
29:12:38,800 --> 29:12:41,800
nu?

38290
29:12:42,160 --> 29:12:48,120
mod standard de a face asta. Și avem

38291
29:12:43,832 --> 29:12:48,120
deci avem 59 dintre ele.

38292
29:12:53,120 --> 29:13:00,120
59 dintre acestea. Deci trebuie să ne ocupăm de asta.

38293
29:12:55,760 --> 29:13:00,120
Aveți idei despre cum să o faceți?

38294
29:13:02,232 --> 29:13:08,160
Aveți idei despre cum să o faceți? Aceasta

38295
29:13:04,720 --> 29:13:09,832
este acum acesta este 59 din 300.

38296
29:13:08,160 --> 29:13:11,192
Deci,

38297
29:13:09,832 --> 29:13:12,960
ce parere aveti despre asta? Este

38298
29:13:11,192 --> 29:13:16,232
puțin diferit de 200 din

38299
29:13:12,960 --> 29:13:20,832
20.000. Puțin diferit. Avem

38300
29:13:16,232 --> 29:13:20,832
Avem aproximativ 60 din 300.

38301
29:13:21,040 --> 29:13:24,760
Există o sumă decentă.

38302
29:13:25,280 --> 29:13:29,720
Aveți vreo idee despre cum să o gestionați?

38303
29:13:30,640 --> 29:13:35,680
Înlocui. Da, ar trebui să înlocuim. Ce să faci

38304
29:13:32,800 --> 29:13:38,400
crezi că ar trebui să înlocuim cu?

38305
29:13:35,680 --> 29:13:41,400
Este un plutitor. Este o virgulă flotantă

38306
29:13:38,400 --> 29:13:41,400
valoare.

38307
29:13:49,512 --> 29:13:52,872
Apropo, ceva unic în asta

38308
29:13:51,360 --> 29:13:56,872
asta e puțin diferit decât de obicei,

38309
29:13:52,872 --> 29:13:58,480
de asemenea, este că acesta este de fapt

38310
29:13:56,872 --> 29:14:00,080
coloana pe care o vom folosi ca etichetă.

38311
29:13:58,480 --> 29:14:04,552
Deci, de fapt, vom prezice

38312
29:14:00,080 --> 29:14:07,360
salariu bazat pe uh pe baza um

38313
29:14:04,552 --> 29:14:09,600
restul caracteristicilor. Deci, cu siguranță

38314
29:14:07,360 --> 29:14:11,040
trebuie să completați aceste nles, nu?

38315
29:14:09,600 --> 29:14:12,800
Pentru că de fapt vor fi

38316
29:14:11,040 --> 29:14:15,040
etichete.

38317
29:14:12,800 --> 29:14:16,552
Ne lipsesc niște etichete din partea noastră

38318
29:14:15,040 --> 29:14:17,832
date.

38319
29:14:16,552 --> 29:14:22,120
Trebuie neapărat să le completăm.

38320
29:14:17,832 --> 29:14:22,120
Da. Deci, o să le înlocuim.

38321
29:14:29,192 --> 29:14:32,872
În regulă. Deci, vom înlocui

38322
29:14:31,360 --> 29:14:34,320
ei jos. Asta va fi

38323
29:14:32,872 --> 29:14:37,120
venind. Ne vom întoarce și

38324
29:14:34,320 --> 29:14:40,480
înlocuiți-le. înainte să le înlocuim,

38325
29:14:37,120 --> 29:14:42,960
de fapt o să ne luăm pe unul

38326
29:14:40,480 --> 29:14:49,680
codificări fierbinți pentru cele trei diferite

38327
29:14:42,960 --> 29:14:52,872
caracteristicile pe care le avem. Hm, deci primim

38328
29:14:49,680 --> 29:14:55,912
prosti cu asta. Acum, bineînțeles că noi

38329
29:14:52,872 --> 29:14:57,680
nu trebuie să facem asta dacă facem asta

38330
29:14:55,912 --> 29:15:01,512
cod pe care nu trebuie să-l facem dacă trecem

38331
29:14:57,680 --> 29:15:04,320
în dype aici

38332
29:15:01,512 --> 29:15:08,320
um, care este uh, atunci nu trebuie să facem

38333
29:15:04,320 --> 29:15:11,192
aceasta. Deci putem comenta asta.

38334
29:15:08,320 --> 29:15:13,120
Acum, ce vreau să observați

38335
29:15:11,192 --> 29:15:15,912
aceasta este alternativa la ceea ce noi

38336
29:15:13,120 --> 29:15:17,912
am făcut înainte acolo unde suntem intenționat drepți

38337
29:15:15,912 --> 29:15:20,720
făcând aceste coloane nu toate datele

38338
29:15:17,912 --> 29:15:26,232
cadru dar doar făcând aceste coloane și

38339
29:15:20,720 --> 29:15:27,680
atunci putem um concatena aceste acestea

38340
29:15:26,232 --> 29:15:30,800
unul fierbinte codificări. Vom merge

38341
29:15:27,680 --> 29:15:33,440
se concatenează înapoi la cadrul de date.

38342
29:15:30,800 --> 29:15:36,232
Corect? Deci dacă ne facem manechinele și apoi

38343
29:15:33,440 --> 29:15:39,280
faceți informații despre dummies.info. Um, putem vedea

38344
29:15:36,232 --> 29:15:43,320
că ajungem cu șase coloane noi. Şi

38345
29:15:39,280 --> 29:15:43,320
de fapt, putem face manechine.head

38346
29:15:43,832 --> 29:15:48,232
și uită-te la care sunt acestea.

38347
29:15:45,912 --> 29:15:51,600
Corect? Deci, acestea sunt liga A, liga

38348
29:15:48,232 --> 29:15:54,640
uh, N, divizia E, W, divizia W, nou

38349
29:15:51,600 --> 29:15:56,480
liga A, noua ligă N.

38350
29:15:54,640 --> 29:16:00,640
Bine.

38351
29:15:56,480 --> 29:16:02,552
Deci, acestea sunt uh, acestea sunt ale noastre

38352
29:16:00,640 --> 29:16:04,400
codificări fierbinți pentru aceste trei diferite

38353
29:16:02,552 --> 29:16:06,000
caracteristici care sunt șiruri, nu? Deci,

38354
29:16:04,400 --> 29:16:07,912
acele trăsături erau șiruri. Dacă

38355
29:16:06,000 --> 29:16:10,320
te duci înapoi, alea au fost singurele noastre

38356
29:16:07,912 --> 29:16:11,912
caracteristicile șirului pe care le aveam. Deci, avem unul

38357
29:16:10,320 --> 29:16:14,080
le-am codificat la cald, astfel încât să le putem folosi în

38358
29:16:11,912 --> 29:16:17,912
modelul nostru. Ceea ce trebuie să facem este doar

38359
29:16:14,080 --> 29:16:19,440
concatenați acest lucru înapoi la cadrul nostru de date.

38360
29:16:17,912 --> 29:16:23,232
Corect? Deci, trebuie doar să ne concatenăm

38361
29:16:19,440 --> 29:16:23,232
înapoi în datele noastre.

38362
29:16:28,160 --> 29:16:35,120
Bine. Deci, ceea ce vom face atunci este

38363
29:16:31,680 --> 29:16:37,440
o să ne apucăm

38364
29:16:35,120 --> 29:16:39,912
ia-l pe Y drept salariu. Si bineinteles,

38365
29:16:37,440 --> 29:16:42,080
vom completa nles pe acel Y

38366
29:16:39,912 --> 29:16:45,912
apar în scurt timp. Dar o să facem

38367
29:16:42,080 --> 29:16:48,552
luați Y ca salariu și X nou. Acum

38368
29:16:45,912 --> 29:16:51,440
înainte de a construi un X complet, vom merge

38369
29:16:48,552 --> 29:16:54,552
aruncați o privire la X numeric ca date noastre

38370
29:16:51,440 --> 29:16:57,192
cadru minus aceste coloane. Motivul

38371
29:16:54,552 --> 29:17:00,080
facem minus acelea pentru că noi

38372
29:16:57,192 --> 29:17:02,232
ne vor concatena manechinul

38373
29:17:00,080 --> 29:17:05,040
variabilele înapoi în asta care merg

38374
29:17:02,232 --> 29:17:07,040
pentru a-i înlocui pe acești tipi. Deci vom merge

38375
29:17:05,040 --> 29:17:09,512
înlocuiți-le oricum cu cea fierbinte

38376
29:17:07,040 --> 29:17:12,160
codificări. Nu vrem corzile. Deci

38377
29:17:09,512 --> 29:17:13,440
o să scăpăm de acestea. Şi

38378
29:17:12,160 --> 29:17:15,120
vom scăpa și de

38379
29:17:13,440 --> 29:17:17,192
salariu pentru că asta va fi parte

38380
29:17:15,120 --> 29:17:22,120
a noastră este doar o etichetă. Deci noi nu

38381
29:17:17,192 --> 29:17:22,120
vreau ca în X, eventualul X.

38382
29:17:24,872 --> 29:17:30,552
Sunteți capabili să rulați asta?

38383
29:17:28,872 --> 29:17:32,960
Sper că nu merg prea repede. Voi băieți

38384
29:17:30,552 --> 29:17:34,552
capabil să ruleze asta? Și face

38385
29:17:32,960 --> 29:17:36,960
sens? Ceea ce facem este să punem

38386
29:17:34,552 --> 29:17:38,232
etichetele noastre în Y, care este ceea ce noi

38387
29:17:36,960 --> 29:17:40,160
de obicei fac. Deci, vom prezice

38388
29:17:38,232 --> 29:17:42,160
salariul

38389
29:17:40,160 --> 29:17:44,480
și ne pregătim să construim X.

38390
29:17:42,160 --> 29:17:46,720
Dar înainte să vrem mai întâi să scăpăm de

38391
29:17:44,480 --> 29:17:49,120
acelea încinge sforile. Aceasta este

38392
29:17:46,720 --> 29:17:51,360
scăpând de sfori

38393
29:17:49,120 --> 29:17:52,552
și asta înseamnă a scăpa de etichetă.

38394
29:17:51,360 --> 29:17:54,320
Și asta va face parte din a noastră

38395
29:17:52,552 --> 29:17:56,960
caracteristici. Ceea ce trebuie să facem este să construim

38396
29:17:54,320 --> 29:17:59,280
X-ul nostru final prin concatenarea manechinelor noastre

38397
29:17:56,960 --> 29:18:00,872
cu asta. Vedeți asta băieți? Suntem

38398
29:17:59,280 --> 29:18:04,000
urmând să ne concateneze manechinele cu

38399
29:18:00,872 --> 29:18:06,320
asta pentru a construi finalul nostru X.

38400
29:18:04,000 --> 29:18:09,120
Dar înainte de a face asta, trebuie

38401
29:18:06,320 --> 29:18:11,912
scăpați de aceste coloane de șir aici. Aşa

38402
29:18:09,120 --> 29:18:15,600
le scăpăm

38403
29:18:11,912 --> 29:18:18,720
aruncându-le din cadrul de date uh

38404
29:18:15,600 --> 29:18:20,400
și obținerea unui uh x numeric numeric

38405
29:18:18,720 --> 29:18:22,872
aici.

38406
29:18:20,400 --> 29:18:25,440
Puteți vedea că coloanele sunt doar

38407
29:18:22,872 --> 29:18:27,120
tipii astia de aici. Deci rezultatele noi

38408
29:18:25,440 --> 29:18:30,800
trebuie să ne concatenăm avem nevoie

38409
29:18:27,120 --> 29:18:32,800
concatena acest tip în asta și

38410
29:18:30,800 --> 29:18:35,800
atunci asta va fi deplinul nostru x tot al nostru

38411
29:18:32,800 --> 29:18:35,800
caracteristici.

38412
29:18:37,120 --> 29:18:42,320
Bine. Deci puteți vedea că x va fi

38413
29:18:40,320 --> 29:18:46,832
pd.con

38414
29:18:42,320 --> 29:18:46,832
de asta cu manechinele noastre.

38415
29:18:46,872 --> 29:18:53,192
Asta cu manechinele noastre. Și um

38416
29:18:51,280 --> 29:18:55,120
în loc să fac asta, de fapt sunt

38417
29:18:53,192 --> 29:18:56,800
o să fac manechinele complete. Noi nu

38418
29:18:55,120 --> 29:18:59,192
trebuie să

38419
29:18:56,800 --> 29:19:01,120
alege doar câteva coloane. Suntem

38420
29:18:59,192 --> 29:19:05,192
de fapt, ne vom descurca complet

38421
29:19:01,120 --> 29:19:08,800
aici și um do x este egal cu 1. Acum, the

38422
29:19:05,192 --> 29:19:12,552
motivul pentru care acesta este cazul este pentru că um

38423
29:19:08,800 --> 29:19:15,912
aceasta va scăpa de o coloană per

38424
29:19:12,552 --> 29:19:17,760
caracteristică și, practic, presupuneți că dacă dvs

38425
29:19:15,912 --> 29:19:19,680
ai un dacă ai zero, celălalt

38426
29:19:17,760 --> 29:19:22,960
ar trebui să fie unul. Dacă ai unul,

38427
29:19:19,680 --> 29:19:24,960
celălalt ar trebui să fie zero. Um asa e

38428
29:19:22,960 --> 29:19:28,080
practic face această presupunere pentru că

38429
29:19:24,960 --> 29:19:30,552
avem doar două dintre ele. Așa oricând

38430
29:19:28,080 --> 29:19:33,120
există unul, celălalt ar trebui să fie zero.

38431
29:19:30,552 --> 29:19:35,680
Um, ca să poți scăpa doar având

38432
29:19:33,120 --> 29:19:38,552
acestea trei, dar eu cred că face

38433
29:19:35,680 --> 29:19:41,040
mai logic să trebuie doar să ai tot

38434
29:19:38,552 --> 29:19:43,120
manechine,

38435
29:19:41,040 --> 29:19:44,720
dar prin procesul de eliminare, poți

38436
29:19:43,120 --> 29:19:47,040
scapă folosind doar două dintre ele

38437
29:19:44,720 --> 29:19:48,552
pentru că oricând ai un zero,

38438
29:19:47,040 --> 29:19:51,600
celălalt ar trebui să fie cealaltă caracteristică

38439
29:19:48,552 --> 29:19:53,760
ar fi fost ar fi fost unul,

38440
29:19:51,600 --> 29:19:54,960
nu? Și invers, când există o

38441
29:19:53,760 --> 29:19:57,960
una, cealaltă caracteristică ar fi fost a

38442
29:19:54,960 --> 29:19:57,960
zero.

38443
29:20:00,480 --> 29:20:04,912
Așa că o facem.

38444
29:20:11,600 --> 29:20:16,160
Și poți să vezi toate ale noastre uh toate ale noastre

38445
29:20:14,080 --> 29:20:19,160
o caracteristică de codificare fierbinte ajunge înapoi în

38446
29:20:16,160 --> 29:20:19,160
acolo.

38447
29:20:20,552 --> 29:20:25,192
Deci acesta este codul pe care îl vreau pe voi

38448
29:20:22,480 --> 29:20:27,912
a alerga. Cred că are mai mult sens. Ea

38449
29:20:25,192 --> 29:20:30,000
urmărește ceea ce am făcut.

38450
29:20:27,912 --> 29:20:32,720
um, care ne va concatena manechinele

38451
29:20:30,000 --> 29:20:34,800
înapoi la caracteristicile noastre aici pentru a construi

38452
29:20:32,720 --> 29:20:38,480
X-ul nostru complet. Deci acum X este tot al nostru

38453
29:20:34,800 --> 29:20:44,080
caracteristici. Amintește-ți X

38454
29:20:38,480 --> 29:20:46,000
X conține toate caracteristicile noastre

38455
29:20:44,080 --> 29:20:49,280
acum.

38456
29:20:46,000 --> 29:20:54,120
Deci X conține toate caracteristicile noastre și așa

38457
29:20:49,280 --> 29:20:54,120
avem toate astea acum.

38458
29:20:56,000 --> 29:21:00,000
Bine. Ați fost capabili să conduceți asta

38459
29:20:57,360 --> 29:21:03,360
unul?

38460
29:21:00,000 --> 29:21:06,872
La naiba. Avem y, avem x. Noi încă

38461
29:21:03,360 --> 29:21:11,000
trebuie să se ocupe de nles-ul din y. Așa că

38462
29:21:06,872 --> 29:21:11,000
ceva cu care mai trebuie să ne confruntăm.

38463
29:21:14,000 --> 29:21:18,192
Dar sper să ai asta. Acum

38464
29:21:18,960 --> 29:21:25,040
toate acestea sunt numerice.

38465
29:21:21,832 --> 29:21:27,600
Deci asta ar trebui să fie bine cu modelul.

38466
29:21:25,040 --> 29:21:31,192
Acesta este un lucru despre X este că ar trebui

38467
29:21:27,600 --> 29:21:33,192
tu X-ul nostru ar trebui să aibă toate cifrele

38468
29:21:31,192 --> 29:21:36,640
caracteristici, nu? Pentru că va fi

38469
29:21:33,192 --> 29:21:38,552
intră într-un model pentru a învăța acele beta.

38470
29:21:36,640 --> 29:21:40,872
Deci trebuie să aibă toate cifrele

38471
29:21:38,552 --> 29:21:41,760
caracteristici,

38472
29:21:40,872 --> 29:21:43,760
nu? Acestea vor fi toate

38473
29:21:41,760 --> 29:21:45,360
numeric, ceea ce are sens. Ne schimbam

38474
29:21:43,760 --> 29:21:49,080
am făcut o codificare fierbinte pentru a schimba totul

38475
29:21:45,360 --> 29:21:49,080
tipii ăia la numeric.

38476
29:21:55,680 --> 29:21:59,800
Îmi pare rău, derulez în jos.

38477
29:22:00,232 --> 29:22:05,640
Bine, completăm zero mai târziu. Bine.

38478
29:22:13,760 --> 29:22:16,720
Bine.

38479
29:22:15,280 --> 29:22:17,912
Aveți întrebări până acum? Deci, suntem doar

38480
29:22:16,720 --> 29:22:19,680
pregătirea datelor noastre. Nu am făcut-o

38481
29:22:17,912 --> 29:22:22,872
am aplicat lasso-ul încă, dar suntem doar

38482
29:22:19,680 --> 29:22:25,600
făcând niște pregătiri. Acum, sper că voi băieți

38483
29:22:22,872 --> 29:22:28,232
recunoașteți că acestea sunt niște standarde

38484
29:22:25,600 --> 29:22:31,040
pașii pe care îi facem atunci când facem

38485
29:22:28,232 --> 29:22:34,000
modelare. Trebuie să pregătim aceste date

38486
29:22:31,040 --> 29:22:35,832
trepte. Sunt necesare. Și așa, dacă este

38487
29:22:34,000 --> 29:22:39,192
se pare că e multă muncă, asta e

38488
29:22:35,832 --> 29:22:41,280
pentru că este. Este munca pe care o faci

38489
29:22:39,192 --> 29:22:47,080
pregătiți-vă datele pentru a vă pregăti

38490
29:22:41,280 --> 29:22:47,080
modelare. Trebuie să faci asta. Bine.

38491
29:22:47,192 --> 29:22:52,552
Deci, facem asta aici. Hm, acum suntem

38492
29:22:50,640 --> 29:22:54,232
ne vom face testul de tren pentru că

38493
29:22:52,552 --> 29:22:56,800
doar o să facem, uh, o să facem

38494
29:22:54,232 --> 29:22:58,320
rezista aici. Deci, facem o

38495
29:22:56,800 --> 29:23:00,720
test tren împărțit cu aproximativ cu un test

38496
29:22:58,320 --> 29:23:04,160
dimensiunea de aproximativ 0,25. Deci, din nou, oriunde

38497
29:23:00,720 --> 29:23:08,160
între 0,2 și 3 ar fi în regulă.

38498
29:23:04,160 --> 29:23:10,232
Um, deci uh

38499
29:23:08,160 --> 29:23:11,832
este alegerea noastră. Am putea face 0 2. Noi

38500
29:23:10,232 --> 29:23:14,000
puteam face 3. Am putea face oriunde în

38501
29:23:11,832 --> 29:23:17,760
intre acolo. Facem 0,25. Asta e

38502
29:23:14,000 --> 29:23:21,192
amenda. E în regulă. Deci, noi construim

38503
29:23:17,760 --> 29:23:23,120
testul nostru de tren s-a împărțit chiar acolo. Um, deci

38504
29:23:21,192 --> 29:23:27,280
destul de simplu și am văzut asta

38505
29:23:23,120 --> 29:23:30,400
de multe ori cu X-ul și Y-ul nostru

38506
29:23:27,280 --> 29:23:33,640
cadre de date. Acolo avem trenul nostru

38507
29:23:30,400 --> 29:23:33,640
divizarea testului.

38508
29:23:33,832 --> 29:23:38,800
Bine.

38509
29:23:35,680 --> 29:23:41,760
Hm, acum ceea ce vom face este să ne facem

38510
29:23:38,800 --> 29:23:43,120
scalarea noastră. Deci, noi nu am făcut asta

38511
29:23:41,760 --> 29:23:45,832
data trecută, dar vom face asta

38512
29:23:43,120 --> 29:23:50,232
acum ca uh pentru că ar trebui să intrăm în

38513
29:23:45,832 --> 29:23:54,000
obiceiul de a face asta. Um este um suntem

38514
29:23:50,232 --> 29:23:56,080
mergi să mergi mai departe și să ne scalăm

38515
29:23:54,000 --> 29:23:59,360
caracteristici și vom folosi

38516
29:23:56,080 --> 29:24:02,232
Scaler standard aici pentru a face asta

38517
29:23:59,360 --> 29:24:04,320
scalare. Bine. Acum, am putea folosi minmax

38518
29:24:02,232 --> 29:24:06,960
scaler. E bine și asta. Doar suntem

38519
29:24:04,320 --> 29:24:11,360
voi folosi aici scalerul standard.

38520
29:24:06,960 --> 29:24:14,872
Um și amintiți-vă că vom face uh um

38521
29:24:11,360 --> 29:24:18,800
utilizați scalatorul standard de la sklearn și

38522
29:24:14,872 --> 29:24:23,760
ne vom transforma caracteristicile uh

38523
29:24:18,800 --> 29:24:27,360
uh conform nostru um conform nostru

38524
29:24:23,760 --> 29:24:29,832
date de antrenament. Deci avem noastre

38525
29:24:27,360 --> 29:24:33,680
pre-procesare scaler standard aici. Deci

38526
29:24:29,832 --> 29:24:36,800
importăm acel tip și apoi construim

38527
29:24:33,680 --> 29:24:39,912
scalatorul nostru standard și montați-l pe

38528
29:24:36,800 --> 29:24:44,232
date de antrenament numai pe cifre

38529
29:24:39,912 --> 29:24:48,160
Caracteristici. Um deci asta va fi

38530
29:24:44,232 --> 29:24:50,552
fiți toți acești tipi. Așa facem

38531
29:24:48,160 --> 29:24:53,440
scalarea pe toți acești tipi. Acum

38532
29:24:50,552 --> 29:24:56,160
ceva de remarcat este că nu suntem

38533
29:24:53,440 --> 29:24:58,552
scalarea tuturor acestor codificări fierbinți

38534
29:24:56,160 --> 29:25:01,040
în principal pentru că nu are sens să

38535
29:24:58,552 --> 29:25:03,680
scala-le cu adevărat. Sunt zero sau unu.

38536
29:25:01,040 --> 29:25:06,232
Nu trebuie să fie scalate, nu?

38537
29:25:03,680 --> 29:25:07,680
Sunt deja zero și unu. Deci sunt

38538
29:25:06,232 --> 29:25:09,760
nu trebuie să fie chiar dacă am fi noi

38539
29:25:07,680 --> 29:25:11,280
făcând scalare minmax, se va pune

38540
29:25:09,760 --> 29:25:14,080
ele între zero și unu. Nu ar fi

38541
29:25:11,280 --> 29:25:15,680
afectează-l cu adevărat, nu? Deci astea

38542
29:25:14,080 --> 29:25:17,600
caracteristici de codare fierbinți, nu mergem

38543
29:25:15,680 --> 29:25:20,000
la scară pentru că sunt mereu

38544
29:25:17,600 --> 29:25:22,160
va fi zero sau unu.

38545
29:25:20,000 --> 29:25:24,080
Nu este nevoie să le scalați cu adevărat.

38546
29:25:22,160 --> 29:25:27,040
Hm, dar vom mări toate

38547
29:25:24,080 --> 29:25:30,400
alte caracteristici aici care sunt plutitoare.

38548
29:25:27,040 --> 29:25:33,192
Deci ăștia sunt tipii de aici. Acestea

38549
29:25:30,400 --> 29:25:34,960
caracteristicile numerice pe care le vom scala.

38550
29:25:33,192 --> 29:25:36,640
Bine.

38551
29:25:34,960 --> 29:25:38,640
Nu e nevoie, nu prea avem nevoie

38552
29:25:36,640 --> 29:25:42,360
scala cea mai caldă codificare. Uh, este

38553
29:25:38,640 --> 29:25:42,360
aproape deja scalat.

38554
29:25:46,080 --> 29:25:51,120
Oh, ar trebui să schimbi asta. Hm, du-te înapoi

38555
29:25:48,480 --> 29:25:53,280
și reluați înapoi și reluați asta, dar

38556
29:25:51,120 --> 29:25:55,512
asigurați-vă că aveți tipul de date ca int

38557
29:25:53,280 --> 29:25:57,192
aici.

38558
29:25:55,512 --> 29:25:59,912
Asigurați-vă că adăugați asta acolo

38559
29:25:57,192 --> 29:26:03,360
schimbați-l în întreg și rulați din nou

38560
29:25:59,912 --> 29:26:04,960
asta și apoi reluați reexecuția

38561
29:26:03,360 --> 29:26:07,680
concatenare.

38562
29:26:04,960 --> 29:26:10,000
Deci, asigură-te că rulezi asta

38563
29:26:07,680 --> 29:26:14,320
și apoi asigurați-vă că reluați acest lucru și

38564
29:26:10,000 --> 29:26:17,320
reluați partea de concatenare care este uh

38565
29:26:14,320 --> 29:26:17,320
aceasta

38566
29:26:27,832 --> 29:26:34,480
Bine. Deci, mergem mai departe și ne potrivim

38567
29:26:32,320 --> 29:26:36,960
scalator la aceste date și apoi mergem

38568
29:26:34,480 --> 29:26:40,320
pentru a ne transforma caracteristicile de antrenament,

38569
29:26:36,960 --> 29:26:42,720
acele caracteristici numerice. um suntem si

38570
29:26:40,320 --> 29:26:46,080
atunci le vom transforma

38571
29:26:42,720 --> 29:26:48,080
caracteristici uh uh caracteristicile de testare din

38572
29:26:46,080 --> 29:26:50,400
la fel. Deci vom efectua

38573
29:26:48,080 --> 29:26:52,160
aceeași transformare de la scaler în continuare

38574
29:26:50,400 --> 29:26:53,912
datele de testare. Deci asta e ceva

38575
29:26:52,160 --> 29:26:59,280
foarte important vreau să remarc aici este

38576
29:26:53,912 --> 29:27:02,400
că scalam întotdeauna atât antrenamentul

38577
29:26:59,280 --> 29:27:03,440
și date de testare. Întotdeauna le mărim pe amândouă. De

38578
29:27:02,400 --> 29:27:07,360
desigur, vom antrena modelul

38579
29:27:03,440 --> 29:27:10,400
asupra datelor de antrenament. Hm, dar suntem

38580
29:27:07,360 --> 29:27:12,720
îl voi testa și la testare

38581
29:27:10,400 --> 29:27:14,720
date și trebuie, de asemenea, scalate

38582
29:27:12,720 --> 29:27:17,192
pentru că modelul nostru pe care îl construim merge

38583
29:27:14,720 --> 29:27:19,360
să-și asume caracteristici la scară. The

38584
29:27:17,192 --> 29:27:22,400
coeficienții pe care îi învață vor ajunge

38585
29:27:19,360 --> 29:27:26,640
să-și asume caracteristici la scară.

38586
29:27:22,400 --> 29:27:29,600
Deci, trebuie să ne scalam și datele de testare

38587
29:27:26,640 --> 29:27:32,600
in acelasi fel. Deci, facem asta ca

38588
29:27:29,600 --> 29:27:32,600
bine.

38589
29:27:33,280 --> 29:27:39,040
Așadar, am scalat asta și acum avem uh-ul nostru

38590
29:27:37,120 --> 29:27:41,440
caracteristicile de instruire și testare au fost

38591
29:27:39,040 --> 29:27:42,960
scalat.

38592
29:27:41,440 --> 29:27:45,280
Nu, nu am înlocuit. Vom merge

38593
29:27:42,960 --> 29:27:48,160
face asta. Încă nu am făcut-o. Vom merge

38594
29:27:45,280 --> 29:27:51,192
fă asta într-un minut. Da, noi

38595
29:27:48,160 --> 29:27:53,832
nu am facut asta. Hm, acesta este

38596
29:27:51,192 --> 29:27:55,280
eticheta. Neapărat trebuie să înlocuim

38597
29:27:53,832 --> 29:27:56,872
NLES. Doar că nu am făcut-o încă

38598
29:27:55,280 --> 29:27:58,960
pentru că nu este în caracteristici și

38599
29:27:56,872 --> 29:28:00,872
facem toate lucrurile noastre uh uh

38600
29:27:58,960 --> 29:28:04,040
pre-procesare la pre-procesarea noastră către

38601
29:28:00,872 --> 29:28:04,040
caracteristicile noastre.

38602
29:28:10,400 --> 29:28:16,280
Da. Deci, cu siguranță avem nevoie

38603
29:28:12,400 --> 29:28:16,280
mergem într-un minut.

38604
29:28:16,720 --> 29:28:20,400
Bine. Deci, dacă te uiți la date acum,

38605
29:28:18,480 --> 29:28:23,280
totul a fost scalat. Deci, acestea sunt toate

38606
29:28:20,400 --> 29:28:28,232
um zcore. Acestea sunt toate pe mult

38607
29:28:23,280 --> 29:28:29,832
scala mai bine acum. Hm, și aceștia suntem noi

38608
29:28:28,232 --> 29:28:34,080
încă mai avem caracteristicile noastre de codare fierbinți

38609
29:28:29,832 --> 29:28:36,552
care sunt zero sau unu. Deci scalarea asta

38610
29:28:34,080 --> 29:28:39,280
ar trebui să conducă la un model mai bun decât dacă am

38611
29:28:36,552 --> 29:28:43,480
nu a scalat. Deci scalarea este cu adevărat

38612
29:28:39,280 --> 29:28:43,480
important. Putem vedea asta aici.

38613
29:28:46,552 --> 29:28:50,960
Bine.

38614
29:28:48,400 --> 29:28:53,120
Acum, lasă-mă să vă întreb, băieți, ați fost

38615
29:28:50,960 --> 29:28:55,760
capabil să ruleze scalarea? Ești prins

38616
29:28:53,120 --> 29:28:59,640
pana aici? Dacă te urmărești,

38617
29:28:55,760 --> 29:28:59,640
ai reușit să rulezi scalarea?

38618
29:29:08,800 --> 29:29:12,832
Bine, grozav. Mare.

38619
29:29:16,800 --> 29:29:19,512
Minunat.

38620
29:29:19,760 --> 29:29:28,232
Bine. Deci, ce vom face acum

38621
29:29:22,872 --> 29:29:32,080
este înlocuiți NLES în uh înlocuiți NLES

38622
29:29:28,232 --> 29:29:35,120
prin calcularea medianei datelor.

38623
29:29:32,080 --> 29:29:39,192
Deci, ceea ce vreau să observați este că noi

38624
29:29:35,120 --> 29:29:42,872
iau NLES acum, asta e asta

38625
29:29:39,192 --> 29:29:45,760
este intenționat este luăm intenționat

38626
29:29:42,872 --> 29:29:47,680
NLES um din mediană

38627
29:29:45,760 --> 29:29:49,680
calculul. Așa că omitem NLES

38628
29:29:47,680 --> 29:29:51,280
când calculăm mediana pentru că noi

38629
29:29:49,680 --> 29:29:53,280
nu vreau ca acele NLES să afecteze

38630
29:29:51,280 --> 29:29:56,800
calcul median.

38631
29:29:53,280 --> 29:29:59,280
Deci calculăm un salariu mediu aici

38632
29:29:56,800 --> 29:30:03,360
și apoi ne umplem NLES-ul cu

38633
29:29:59,280 --> 29:30:06,800
salariul mediu um din datele de formare.

38634
29:30:03,360 --> 29:30:10,552
Deci aceasta este alegerea noastră. Aceasta este o alegere

38635
29:30:06,800 --> 29:30:14,960
um să folosești mediana și este, de asemenea, a

38636
29:30:10,552 --> 29:30:18,640
alegerea de a utiliza mediana setului de antrenament

38637
29:30:14,960 --> 29:30:20,640
atât pentru tren cât și pentru test. Ce am putea

38638
29:30:18,640 --> 29:30:24,480
am făcut aceasta este o alternativă pe care noi

38639
29:30:20,640 --> 29:30:28,480
ar fi putut face este să folosești întreaga coloană

38640
29:30:24,480 --> 29:30:31,440
și apoi folosiți mediana tuturor

38641
29:30:28,480 --> 29:30:34,480
date de înlocuit. Asta chiar depinde de noi.

38642
29:30:31,440 --> 29:30:37,600
Hm, acesta este un mod de a face asta. Am putea

38643
29:30:34,480 --> 29:30:41,280
am făcut înainte de a face despărțirea. Noi

38644
29:30:37,600 --> 29:30:44,080
ar fi putut completa cu mediana

38645
29:30:41,280 --> 29:30:46,400
mai devreme. Am ales să o facem aici în principal

38646
29:30:44,080 --> 29:30:48,480
deoarece nu afectează caracteristicile.

38647
29:30:46,400 --> 29:30:50,480
Deci am fi putut face asta mai devreme și

38648
29:30:48,480 --> 29:30:53,280
am făcut-o înainte să facem despărțirea și

38649
29:30:50,480 --> 29:30:54,960
a umplut NAS. Um, chiar nu este

38650
29:30:53,280 --> 29:30:58,552
nu contează atât de mult cum facem

38651
29:30:54,960 --> 29:31:00,400
ea. Hm, dar trebuie să completăm NLES.

38652
29:30:58,552 --> 29:31:02,960
Nu putem ca acestea să fie nule când noi

38653
29:31:00,400 --> 29:31:06,080
când îl punem în modelul nostru. Deci unii

38654
29:31:02,960 --> 29:31:08,320
modul în care trebuie să completăm valorile nule. Hm și așa

38655
29:31:06,080 --> 29:31:12,232
în această strategie completăm y

38656
29:31:08,320 --> 29:31:14,400
antrenează-te cu salariul mediu de la noi

38657
29:31:12,232 --> 29:31:16,320
date de antrenament. Și la fel suntem și noi

38658
29:31:14,400 --> 29:31:18,480
completând cu salariul median al

38659
29:31:16,320 --> 29:31:21,912
de asemenea, datele de antrenament. Dar asta este o

38660
29:31:18,480 --> 29:31:25,360
alegere. Am putea completa cu media

38661
29:31:21,912 --> 29:31:27,600
cu media. Am putea completa

38662
29:31:25,360 --> 29:31:29,360
cu am putea să o facem cu toate

38663
29:31:27,600 --> 29:31:31,440
date împreună înainte de a le împărți. noi

38664
29:31:29,360 --> 29:31:34,400
ar fi putut completa cu toate cele

38665
29:31:31,440 --> 29:31:36,480
mediană pe întregul set de date. Hm

38666
29:31:34,400 --> 29:31:40,800
fie unul functioneaza. Poți să o faci fie

38667
29:31:36,480 --> 29:31:42,320
așa, dar am făcut-o mai târziu aici

38668
29:31:40,800 --> 29:31:44,160
arata ca nu afecteaza cu adevarat

38669
29:31:42,320 --> 29:31:46,552
caracteristici. Deci, putem alege când facem

38670
29:31:44,160 --> 29:31:48,720
asta, nu? Nu afectează

38671
29:31:46,552 --> 29:31:50,480
caracteristici la toate. Deci, putem face totul

38672
29:31:48,720 --> 29:31:54,960
preprocesarea noastră asupra caracteristicilor și

38673
29:31:50,480 --> 29:31:58,832
apoi faceți eticheta noastră completând NLES um

38674
29:31:54,960 --> 29:31:58,832
dacă dacă le avem.

38675
29:32:00,232 --> 29:32:07,552
uh x numeric. Asigură-te că ești

38676
29:32:03,440 --> 29:32:07,552
rulând asta

38677
29:32:07,832 --> 29:32:17,760
uh x numeric a fost definit aici

38678
29:32:12,720 --> 29:32:19,832
când îl despărțim de

38679
29:32:17,760 --> 29:32:21,192
când am lăsat aceste coloane aici.

38680
29:32:19,832 --> 29:32:23,760
Așa că asigură-te că rulezi asta. Aceasta

38681
29:32:21,192 --> 29:32:25,912
este x numeric.

38682
29:32:23,760 --> 29:32:29,360
E definit acolo.

38683
29:32:25,912 --> 29:32:31,832
Deci, du-te înapoi în această celulă

38684
29:32:29,360 --> 29:32:35,832
unde despărțim yul și noi și noi

38685
29:32:31,832 --> 29:32:39,552
au x aici x numeric.

38686
29:32:35,832 --> 29:32:39,552
Asigurați-vă că rulați asta.

38687
29:32:44,400 --> 29:32:51,872
Asigurați-vă că rulați asta. Și atunci poți

38688
29:32:46,232 --> 29:32:51,872
rulează acestea. Apoi rulați asta pentru a construi x.

38689
29:32:59,512 --> 29:33:04,800
În regulă.

38690
29:33:01,440 --> 29:33:06,640
Suntem până aici cu această completare

38691
29:33:04,800 --> 29:33:09,192
etichetele?

38692
29:33:06,640 --> 29:33:11,120
Pentru că atunci ne putem construi modelul

38693
29:33:09,192 --> 29:33:14,960
odată ce ajungem până aici. Am scalat

38694
29:33:11,120 --> 29:33:19,080
totul. Am completat NLES-ul nostru.

38695
29:33:14,960 --> 29:33:19,080
Avem o codificare fierbinte.

38696
29:33:21,192 --> 29:33:25,440
Da, este. De aceea știi că asta este

38697
29:33:23,120 --> 29:33:27,760
de ce petrecem mult timp pe model

38698
29:33:25,440 --> 29:33:29,512
despre pregătirea datelor cu panda, nu?

38699
29:33:27,760 --> 29:33:31,912
De aceea am făcut toată treaba cu panda

38700
29:33:29,512 --> 29:33:34,480
cu siguranta. Da, este mult de lucru

38701
29:33:31,912 --> 29:33:37,360
înainte de a putea construi un model.

38702
29:33:34,480 --> 29:33:38,872
Da, băieți, observați asta

38703
29:33:37,360 --> 29:33:41,912
modelarea este relativ usoara. Este

38704
29:33:38,872 --> 29:33:43,832
doar o potrivire si prezice. Modelarea este

38705
29:33:41,912 --> 29:33:47,680
de fapt foarte usor. Sunt toate celelalte

38706
29:33:43,832 --> 29:33:50,400
munca care este mai implicată, nu?

38707
29:33:47,680 --> 29:33:53,832
mai mult cod.

38708
29:33:50,400 --> 29:33:55,680
Modelarea în sine este foarte ușoară.

38709
29:33:53,832 --> 29:33:58,640
Doar că este doar o linie de like

38710
29:33:55,680 --> 29:34:03,080
ffit.

38711
29:33:58,640 --> 29:34:03,080
Da, destul de ușor de făcut.

38712
29:34:03,280 --> 29:34:09,232
Și apoi faci o evaluare care este a

38713
29:34:06,000 --> 29:34:09,232
cuplu de linii.

38714
29:34:27,760 --> 29:34:32,480
Da. Acestea sunt toate acestea sunt

38715
29:34:30,480 --> 29:34:34,640
pașii comuni. Toți acești pași suntem

38716
29:34:32,480 --> 29:34:37,360
a face sunt foarte foarte prototipice în

38717
29:34:34,640 --> 29:34:38,960
construirea modelului este să ne întoarcem

38718
29:34:37,360 --> 29:34:43,280
prin asta să vedem ce am făcut, nu?

38719
29:34:38,960 --> 29:34:45,192
Ne-am importat datele. Hm, analizăm noi

38720
29:34:43,280 --> 29:34:48,960
a renunțat la această coloană de nume pentru că este

38721
29:34:45,192 --> 29:34:52,800
nu ne este de folos. Așa că am renunțat la asta. Hm

38722
29:34:48,960 --> 29:34:54,320
am completat în cele din urmă NLES. Hm dar

38723
29:34:52,800 --> 29:34:55,512
știi dacă au existat nuluri în nostru

38724
29:34:54,320 --> 29:34:57,600
caracteristici cu care ar trebui să ne confruntăm

38725
29:34:55,512 --> 29:35:00,080
acelea de asemenea prin înlocuirea lor sau

38726
29:34:57,600 --> 29:35:01,912
aruncând rândurile așa cum am făcut mai devreme.

38727
29:35:00,080 --> 29:35:04,320
Hm

38728
29:35:01,912 --> 29:35:05,760
și apoi facem o codificare fierbinte pentru că

38729
29:35:04,320 --> 29:35:07,280
bineînțeles că nu putem avea niciun șir

38730
29:35:05,760 --> 29:35:09,280
coloane care intră în modelele noastre. Avem un

38731
29:35:07,280 --> 29:35:13,440
o codificare fierbinte.

38732
29:35:09,280 --> 29:35:16,320
Atunci ne construim X și Y cu ajutorul

38733
29:35:13,440 --> 29:35:19,512
concatenând înapoi pe cel codificat la cald

38734
29:35:16,320 --> 29:35:22,080
la caracteristicile numerice.

38735
29:35:19,512 --> 29:35:23,680
Apoi antrenăm diviziunea de test. Corect? Asta e

38736
29:35:22,080 --> 29:35:27,280
destul de comun. Sau am putea face cruce

38737
29:35:23,680 --> 29:35:30,000
validare oricum. O cruce kfold

38738
29:35:27,280 --> 29:35:31,192
validare. Apoi scalam. Deci nu am făcut-o

38739
29:35:30,000 --> 29:35:33,912
fă asta ultima dată, dar asta e ceva

38740
29:35:31,192 --> 29:35:37,440
ar trebui să ne obișnuim să scalam

38741
29:35:33,912 --> 29:35:39,512
um caracteristicile noastre. Așa că facem asta. Și acum

38742
29:35:37,440 --> 29:35:44,400
suntem gata să modelăm. Deci acum suntem gata

38743
29:35:39,512 --> 29:35:48,000
a modela. Deci asta e partea asta.

38744
29:35:44,400 --> 29:35:50,552
Bine. Deci hai sa facem modelul. Hăi

38745
29:35:48,000 --> 29:35:52,552
modelul este de fapt destul de ușor de realizat.

38746
29:35:50,552 --> 29:35:54,720
Deci vom folosi un laso. Deci noi

38747
29:35:52,552 --> 29:35:56,552
au un model lasso aici. Observă ce

38748
29:35:54,720 --> 29:35:59,192
ne setăm alfa la. Deci marele

38749
29:35:56,552 --> 29:36:00,720
parametrul de care avem cu adevărat nevoie, ignorați acest lucru

38750
29:35:59,192 --> 29:36:02,080
iterații. De fapt, nu prea

38751
29:36:00,720 --> 29:36:04,872
nevoie de noi nu avem nevoie de asta

38752
29:36:02,080 --> 29:36:06,552
parametrul. Um, deci ignora-l pentru

38753
29:36:04,872 --> 29:36:09,360
moment. Dar cel mare care suntem

38754
29:36:06,552 --> 29:36:11,600
setarea aici este alfa. Deci când noi

38755
29:36:09,360 --> 29:36:13,440
am făcut regresie liniară, nu am avut nevoie

38756
29:36:11,600 --> 29:36:15,360
orice parametri să intre în interiorul liniarului

38757
29:36:13,440 --> 29:36:17,600
obiect de regresie. Nu aveam nevoie de niciunul

38758
29:36:15,360 --> 29:36:20,000
parametri, nu? Pentru că există

38759
29:36:17,600 --> 29:36:22,960
într-adevăr fără parametri ai acestuia. Dar pentru

38760
29:36:20,000 --> 29:36:24,872
lasso, cel important este alfa.

38761
29:36:22,960 --> 29:36:29,192
Și deci trebuie să știm ce să setăm alfa

38762
29:36:24,872 --> 29:36:31,512
la. Hm, să începem cu alfa egal cu 1.

38763
29:36:29,192 --> 29:36:35,192
Acesta este un bun loc de plecare. Deci a

38764
29:36:31,512 --> 29:36:38,320
punct de plecare tipic

38765
29:36:35,192 --> 29:36:39,832
pentru alfa

38766
29:36:38,320 --> 29:36:43,600
um

38767
29:36:39,832 --> 29:36:45,832
este uh este unul. Deci este un tipic

38768
29:36:43,600 --> 29:36:48,960
punct de plecare. Și astfel putem seta alfa

38769
29:36:45,832 --> 29:36:51,512
egal cu unu. Această iterație maximă este

38770
29:36:48,960 --> 29:36:53,192
parametrul care guvernează

38771
29:36:51,512 --> 29:36:56,232
procesul de instruire pentru că este

38772
29:36:53,192 --> 29:36:59,040
iterativ. Deci dacă dintr-un motiv oarecare noi

38773
29:36:56,232 --> 29:37:01,680
nu poate converge către beta-urile potrivite și

38774
29:36:59,040 --> 29:37:04,720
l-am rulat timp de 10.000 de pași odată ce am

38775
29:37:01,680 --> 29:37:07,040
treci 10.000 de pași, se va opri și

38776
29:37:04,720 --> 29:37:09,120
doar dă-ne beta-urile în acel moment.

38777
29:37:07,040 --> 29:37:12,000
Dar probabil că nu va lovi niciodată asta

38778
29:37:09,120 --> 29:37:15,040
număr. Va converge înainte de atunci. Deci

38779
29:37:12,000 --> 29:37:16,400
nu trebuie să specificăm

38780
29:37:15,040 --> 29:37:18,640
ea. Deci, de fapt, voi primi

38781
29:37:16,400 --> 29:37:21,512
scapa de ea. Hm, nu e chiar mare

38782
29:37:18,640 --> 29:37:24,480
afacere. Ar trebui să converge înainte de atunci.

38783
29:37:21,512 --> 29:37:26,640
Hm, dar dacă vrem să setăm ca a

38784
29:37:24,480 --> 29:37:30,000
dimensiunea maximă a pasului în optimizare,

38785
29:37:26,640 --> 29:37:32,000
cu siguranță am putea acolo. Uh, dar nu

38786
29:37:30,000 --> 29:37:33,912
prea preocupat de asta. Dar

38787
29:37:32,000 --> 29:37:36,800
iată lasoul nostru. Și atunci suntem doar

38788
29:37:33,912 --> 29:37:38,320
vom face o potrivire pe datele noastre. Deci, uite

38789
29:37:36,800 --> 29:37:42,360
ce usor este. Exact ca un liniar

38790
29:37:38,320 --> 29:37:42,360
regresie, lasso.fit,

38791
29:37:42,400 --> 29:37:47,552
nu? Deci, ne potrivim. um,

38792
29:37:50,800 --> 29:37:56,160
Oh, nu eu am condus asta. Îmi pare rău. am primit

38793
29:37:52,960 --> 29:37:57,680
pentru a rula asta. Bine. De fapt, asta este un

38794
29:37:56,160 --> 29:37:59,512
bun exemplu a ceea ce se întâmplă când tu

38795
29:37:57,680 --> 29:38:02,080
nu atunci când ai nles, nu? Deci, asta

38796
29:37:59,512 --> 29:38:04,160
spune că nulul nostru conține nan. Asta e

38797
29:38:02,080 --> 29:38:06,400
pentru că nu am condus asta. Dar acum că

38798
29:38:04,160 --> 29:38:09,040
ar trebui completat. Acum, ar trebui să fim

38799
29:38:06,400 --> 29:38:12,040
capabil să ruleze asta. Bine, perfect. Deci

38800
29:38:09,040 --> 29:38:12,040
aleargă.

38801
29:38:16,640 --> 29:38:20,872
Bine. Deci puteți vedea ce interceptare

38802
29:38:18,720 --> 29:38:23,360
este. Acesta este unul dintre coeficienții noștri,

38803
29:38:20,872 --> 29:38:24,800
nu? Interceptarea este 457. Și uite

38804
29:38:23,360 --> 29:38:27,912
acum ce este cu adevărat interesant la

38805
29:38:24,800 --> 29:38:32,000
coeficienți este uita-te la ceea ce unele dintre

38806
29:38:27,912 --> 29:38:34,480
coeficienţii sunt. Unii dintre ei sunt

38807
29:38:32,000 --> 29:38:36,480
de fapt zero, ceea ce este într-adevăr atât de puțin

38808
29:38:34,480 --> 29:38:39,600
dintre ei au ajuns să fie la zero, adică

38809
29:38:36,480 --> 29:38:42,960
foarte foarte interesant. asta inseamna ca

38810
29:38:39,600 --> 29:38:46,080
acele caracteristici sunt anulate și

38811
29:38:42,960 --> 29:38:48,720
practic nu fac parte din model

38812
29:38:46,080 --> 29:38:50,480
ceea ce este cu adevărat interesant. Hm, deci noi

38813
29:38:48,720 --> 29:38:53,800
au toți acești coeficienți și o parte din

38814
29:38:50,480 --> 29:38:53,800
ele sunt zero.

38815
29:38:56,800 --> 29:39:01,832
Da, negativ0 este doar din cauza

38816
29:38:59,832 --> 29:39:03,600
convergență așa cum au început

38817
29:39:01,832 --> 29:39:07,120
negativ și și-au făcut drum până la

38818
29:39:03,600 --> 29:39:09,832
zero. ea. Z negativ înseamnă doar

38819
29:39:07,120 --> 29:39:12,000
zero, dar tocmai veneau de la

38820
29:39:09,832 --> 29:39:14,320
erau ca micile negative și s-au încheiat

38821
29:39:12,000 --> 29:39:16,480
sus la zero

38822
29:39:14,320 --> 29:39:18,080
în timpul procesului de instruire. Au fost

38823
29:39:16,480 --> 29:39:20,800
negativ la un moment dat și a ajuns

38824
29:39:18,080 --> 29:39:23,600
zero. Hm

38825
29:39:20,800 --> 29:39:29,160
deci da, 0 negativ doar înseamnă evident

38826
29:39:23,600 --> 29:39:29,160
zero. E încă zero acolo.

38827
29:39:34,552 --> 29:39:39,680
Deci, ceea ce este interesant sunt unele dintre acestea

38828
29:39:36,480 --> 29:39:41,600
caracteristicile au ajuns să fie zero, ceea ce

38829
29:39:39,680 --> 29:39:43,760
de obicei nu vezi într-un liniar

38830
29:39:41,600 --> 29:39:45,440
regresie. Deci, dacă ar fi să antrenăm asta

38831
29:39:43,760 --> 29:39:47,680
folosind o regresie liniară am de obicei

38832
29:39:45,440 --> 29:39:49,912
nu aș vedea asta, dar unele dintre acestea

38833
29:39:47,680 --> 29:39:53,192
s-a dovedit a fi zero pentru că din nou

38834
29:39:49,912 --> 29:39:55,912
încurajăm acele beta să fie

38835
29:39:53,192 --> 29:40:00,720
mici. îi încurajăm să fie uh

38836
29:39:55,912 --> 29:40:02,480
mic și așa știi ce se întâmplă

38837
29:40:00,720 --> 29:40:04,232
unele dintre ele pot fi reduse până la capăt

38838
29:40:02,480 --> 29:40:06,480
până la zero, adică acele caracteristici

38839
29:40:04,232 --> 29:40:09,360
nu contribui, este foarte simplu

38840
29:40:06,480 --> 29:40:12,400
model în acel moment exact așa că am luat

38841
29:40:09,360 --> 29:40:14,320
ceva complex care include toate

38842
29:40:12,400 --> 29:40:16,232
aceste caracteristici și de fapt le-a redus

38843
29:40:14,320 --> 29:40:18,320
în ceva simplu care include doar

38844
29:40:16,232 --> 29:40:21,120
aceste caracteristici

38845
29:40:18,320 --> 29:40:24,720
corect

38846
29:40:21,120 --> 29:40:26,872
deci asta face, acum trebuie

38847
29:40:24,720 --> 29:40:29,120
evaluați acest lucru pentru a vedea cât de bun este un model

38848
29:40:26,872 --> 29:40:32,480
este. Dar asta se spune

38849
29:40:29,120 --> 29:40:34,640
aici în acest text este că um un pozitiv

38850
29:40:32,480 --> 29:40:36,800
coeficientul uh indică faptul că

38851
29:40:34,640 --> 29:40:38,800
variabila independenta creste

38852
29:40:36,800 --> 29:40:40,480
variabila dependenta creste si ea.

38853
29:40:38,800 --> 29:40:43,040
Coeficientul negativ înseamnă ca

38854
29:40:40,480 --> 29:40:44,960
variabila independenta creste dependenta

38855
29:40:43,040 --> 29:40:49,192
scade deoarece reduce

38856
29:40:44,960 --> 29:40:51,040
valoare. Um și lasso este cunoscut pentru caracteristică

38857
29:40:49,192 --> 29:40:53,280
selecție prin micșorarea unora dintre ele la

38858
29:40:51,040 --> 29:40:55,512
zero eliminând efectiv acelea

38859
29:40:53,280 --> 29:40:57,680
variabilele din modelul din

38860
29:40:55,512 --> 29:40:59,360
dreapta ecuației

38861
29:40:57,680 --> 29:41:03,160
um

38862
29:40:59,360 --> 29:41:03,160
deci asta se intampla

38863
29:41:03,832 --> 29:41:07,872
unele dintre ele ajung să fie zero

38864
29:41:07,912 --> 29:41:13,912
ați fost capabili să rulați asta

38865
29:41:10,552 --> 29:41:17,552
lasso uh fit care este antrenamentul

38866
29:41:13,912 --> 29:41:17,552
Controlul lassoului.

38867
29:41:32,480 --> 29:41:36,720
Nu, nu asigură că nu există

38868
29:41:34,000 --> 29:41:38,400
supraadaptare, dar ajută la supraadaptare.

38869
29:41:36,720 --> 29:41:40,080
Ar trebui să ajute prin realizarea

38870
29:41:38,400 --> 29:41:42,160
model mai simplu. Și acesta este cu siguranță un

38871
29:41:40,080 --> 29:41:43,760
model mai simplu pentru că îndepărtează unele

38872
29:41:42,160 --> 29:41:46,000
a caracteristicilor din model

38873
29:41:43,760 --> 29:41:47,600
in esenta, nu? Pentru că unele dintre

38874
29:41:46,000 --> 29:41:50,000
caracteristicile nu vor contribui.

38875
29:41:47,600 --> 29:41:51,600
Este un model mai simplu.

38876
29:41:50,000 --> 29:41:53,600
Nu înseamnă că nu există

38877
29:41:51,600 --> 29:41:55,600
va fi orice supraadaptare, dar asta

38878
29:41:53,600 --> 29:41:59,912
ajută la prevenirea acestuia. Asta este

38879
29:41:55,600 --> 29:42:02,232
conceput pentru a ajuta la prevenirea acesteia.

38880
29:41:59,912 --> 29:42:04,640
Da. Deci coeficient mai mare. Da. The

38881
29:42:02,232 --> 29:42:06,400
coeficient mai mare înseamnă că este mai mult

38882
29:42:04,640 --> 29:42:09,440
caracteristică importantă față de

38883
29:42:06,400 --> 29:42:12,160
predictie. Da. Asta înseamnă

38884
29:42:09,440 --> 29:42:14,320
cu siguranta. Cu cât este mai mare magnitudinea, cu atât

38885
29:42:12,160 --> 29:42:19,232
mai mult un contribuitor la asta

38886
29:42:14,320 --> 29:42:19,232
predictie. Uh este. Da.

38887
29:42:23,600 --> 29:42:27,832
Și nu este doar că ar putea fi

38888
29:42:25,280 --> 29:42:30,400
mai mare pozitiv sau negativ acolo. Ca

38889
29:42:27,832 --> 29:42:32,232
un negativ mai mare este, de asemenea, destul de mare

38890
29:42:30,400 --> 29:42:33,912
factor,

38891
29:42:32,232 --> 29:42:37,960
nu? Deci, vrei să te gândești la asta

38892
29:42:33,912 --> 29:42:37,960
din punct de vedere al valorii absolute.

38893
29:42:41,912 --> 29:42:45,512
nu garanteaza dar ajuta. Da, asta

38894
29:42:43,832 --> 29:42:47,760
nu garanteaza dar este proiectat

38895
29:42:45,512 --> 29:42:51,232
pentru a ajuta la supraadaptare, ajuta la prevenirea acesteia.

38896
29:42:47,760 --> 29:42:51,232
Da, absolut.

38897
29:43:13,120 --> 29:43:19,040
Bine.

38898
29:43:15,280 --> 29:43:22,640
Deci haideți să facem o evaluare. Hm deci hai

38899
29:43:19,040 --> 29:43:25,640
face în acest caz vom face noastre

38900
29:43:22,640 --> 29:43:25,640
prezice

38901
29:43:42,800 --> 29:43:47,512
Oh da. Nu sunt sigur de ce este asta

38902
29:43:45,680 --> 29:43:50,512
caz.

38903
29:43:47,512 --> 29:43:50,512
Interesant.

38904
29:44:07,912 --> 29:44:14,832
Am putea încerca să creștem um max

38905
29:44:11,832 --> 29:44:14,832
iterații.

38906
29:44:23,512 --> 29:44:27,760
Bine, de aceea. Da. Deci atunci primești

38907
29:44:25,600 --> 29:44:29,512
care rezultă cu cel mai mare max

38908
29:44:27,760 --> 29:44:33,440
iterații.

38909
29:44:29,512 --> 29:44:35,120
Acolo nu se taie.

38910
29:44:33,440 --> 29:44:37,280
Cred că de aceea probabil ai plecat

38911
29:44:35,120 --> 29:44:38,960
asta acolo,

38912
29:44:37,280 --> 29:44:41,960
ceea ce este bine. Primești cam la fel

38913
29:44:38,960 --> 29:44:41,960
numere.

38914
29:44:46,800 --> 29:44:49,800
Da.

38915
29:44:56,232 --> 29:44:59,760
În regulă. Să evaluăm asta. Deci,

38916
29:44:57,680 --> 29:45:01,512
vom face o evaluare. eu

38917
29:44:59,760 --> 29:45:04,552
vreau să vedeți din nou. Ar trebui

38918
29:45:01,512 --> 29:45:07,040
Obișnuiește-te să faci evaluare,

38919
29:45:04,552 --> 29:45:09,360
care ne ia modelul și prezice

38920
29:45:07,040 --> 29:45:11,440
asupra antrenamentului și prezicerea asupra

38921
29:45:09,360 --> 29:45:15,280
seturi de testare, nu? Așa că prezicem asupra

38922
29:45:11,440 --> 29:45:22,000
tren și calculați MSE-ul nostru

38923
29:45:15,280 --> 29:45:25,040
și calculăm scorul nostru R2 um sau R

38924
29:45:22,000 --> 29:45:26,720
scor pătrat ar trebui să spun. Dar din nou

38925
29:45:25,040 --> 29:45:30,160
MSE este cel la care ne vom duce cu adevărat

38926
29:45:26,720 --> 29:45:32,800
utilizați mai ales. Hm, dar calculăm așa facem

38927
29:45:30,160 --> 29:45:34,640
predicțiile noastre și apoi le comparăm

38928
29:45:32,800 --> 29:45:36,160
în eroarea noastră pătrată medie cu nostru

38929
29:45:34,640 --> 29:45:40,400
etichete

38930
29:45:36,160 --> 29:45:42,320
și mergem înainte și facem același lucru

38931
29:45:40,400 --> 29:45:44,232
cu testul. Corect? Așa că facem uh

38932
29:45:42,320 --> 29:45:47,440
laso.predic

38933
29:45:44,232 --> 29:45:51,040
pe funcțiile noastre de testare și mergem înainte și

38934
29:45:47,440 --> 29:45:52,960
comparați asta cu etichetele de testare. Şi

38935
29:45:51,040 --> 29:45:55,832
deci ceea ce facem acolo este generarea

38936
29:45:52,960 --> 29:45:58,232
MSE-ul nostru.

38937
29:45:55,832 --> 29:46:01,280
Deci, aruncăm o privire la MSE-ul nostru și noi

38938
29:45:58,232 --> 29:46:05,192
primești 84.000

38939
29:46:01,280 --> 29:46:08,872
MSE. Um, și așa, desigur, am putea

38940
29:46:05,192 --> 29:46:14,080
ia um ce am putea face cu asta

38941
29:46:08,872 --> 29:46:19,440
este să aruncați o privire la um MSE pe uh

38942
29:46:14,080 --> 29:46:25,480
am putea face um MP. Rădăcină pătrată

38943
29:46:19,440 --> 29:46:25,480
și faceți rădăcina pătrată a testului MSE.

38944
29:46:25,912 --> 29:46:32,000
și obținem 340. Deci asta ar fi în

38945
29:46:29,192 --> 29:46:34,872
unitățile etichetei noastre. Deci, ne întoarcem

38946
29:46:32,000 --> 29:46:39,232
și uită-te la eticheta noastră pentru câteva dintre ele

38947
29:46:34,872 --> 29:46:39,232
aceia um

38948
29:46:48,800 --> 29:46:54,400
deci suntem în 300 de ani și datele noastre sunt

38949
29:46:52,552 --> 29:46:56,400
ca chiar în jurul anului 500. Deci, de

38950
29:46:54,400 --> 29:46:59,440
desigur, dacă am descrie asta am putea

38951
29:46:56,400 --> 29:47:01,360
vezi care sunt statisticile. Deci,

38952
29:46:59,440 --> 29:47:02,552
am putea face df.descrie descrie si

38953
29:47:01,360 --> 29:47:04,720
generează asta. Dar asta nu pare

38954
29:47:02,552 --> 29:47:07,760
ca o eroare foarte bună, nu? Dacă acestea

38955
29:47:04,720 --> 29:47:09,760
sunt în anii 400, um asta nu este a

38956
29:47:07,760 --> 29:47:12,320
eroare foarte buna.

38957
29:47:09,760 --> 29:47:13,912
Deci, din nou, nu este un model foarte grozav.

38958
29:47:12,320 --> 29:47:16,960
Dar un lucru pe care vreau să-l vezi este că

38959
29:47:13,912 --> 29:47:18,720
este că nu este supraadaptat.

38960
29:47:16,960 --> 29:47:21,192
Hm, dacă ceva, de fapt este

38961
29:47:18,720 --> 29:47:23,912
underfitting, ceea ce este acest tip de

38962
29:47:21,192 --> 29:47:29,040
um MSE sugerează, nu? deoarece noastre

38963
29:47:23,912 --> 29:47:32,040
eroare aici este 84, scuzați-mă, 84.000.

38964
29:47:29,040 --> 29:47:32,040
Hm

38965
29:47:34,160 --> 29:47:41,440
Zona noastră aici este de 84.000

38966
29:47:38,232 --> 29:47:43,120
scuzați-mă și pe setul de testare este

38967
29:47:41,440 --> 29:47:48,320
116.000.

38968
29:47:43,120 --> 29:47:51,040
Deci aceste două erori sunt ambele rele. Deci

38969
29:47:48,320 --> 29:47:53,192
nu este supraadaptat. Acesta este de fapt

38970
29:47:51,040 --> 29:47:56,400
submontare. Deci nu este prea potrivit,

38971
29:47:53,192 --> 29:47:57,912
de fapt este insuficient. Hm, și așa

38972
29:47:56,400 --> 29:48:00,552
asta e riscul cu ceva de genul

38973
29:47:57,912 --> 29:48:03,832
laso este că face modelul a

38974
29:48:00,552 --> 29:48:06,552
cam prea simplu și riscăm de fapt

38975
29:48:03,832 --> 29:48:09,680
underfitting, ceea ce se întâmplă. Noi

38976
29:48:06,552 --> 29:48:12,080
au prea multe erori în ambele

38977
29:48:09,680 --> 29:48:14,160
antrenament și setul de testare. Supramontare

38978
29:48:12,080 --> 29:48:16,160
atunci când facem, avem foarte bine

38979
29:48:14,160 --> 29:48:18,720
performanță pe platoul de antrenament, dar proastă

38980
29:48:16,160 --> 29:48:20,480
performanță pe setul de testare. Nu suntem

38981
29:48:18,720 --> 29:48:24,000
supraadaptare.

38982
29:48:20,480 --> 29:48:26,080
Suntem nepotriviți pentru că noi

38983
29:48:24,000 --> 29:48:28,552
performanța nu este bună în nici un caz. Chiar și

38984
29:48:26,080 --> 29:48:32,360
acest R pătrat este destul de scăzut. Nu este

38985
29:48:28,552 --> 29:48:32,360
chiar si la 50%.

38986
29:48:36,232 --> 29:48:40,960
Bine, așa că facem noi

38987
29:48:39,280 --> 29:48:43,440
evaluare și din nou evaluarea doar

38988
29:48:40,960 --> 29:48:45,360
se rezumă la a face previziuni şi

38989
29:48:43,440 --> 29:48:47,912
calculând eroarea noastră printre acestea

38990
29:48:45,360 --> 29:48:53,640
predicții pentru etichetele noastre. Asta e mereu

38991
29:48:47,912 --> 29:48:53,640
what the uh evaluation is going to be

38992
29:48:54,480 --> 29:48:57,720
pentru MSE.

38993
29:48:57,912 --> 29:49:03,592
Care este MSE ideal? ce crezi

38994
29:49:00,640 --> 29:49:05,832
ar trebui sa fie? What is So, think about it

38995
29:49:03,592 --> 29:49:10,640
ca asta. MSE reprezintă

38996
29:49:05,832 --> 29:49:13,360
average distance between our predictions

38997
29:49:10,640 --> 29:49:16,160
si etichetele.

38998
29:49:13,360 --> 29:49:18,480
So, if we're getting it right all the

38999
29:49:16,160 --> 29:49:20,480
time, what's that distance going to be

39000
29:49:18,480 --> 29:49:23,760
dacă avem întotdeauna dreptate? Ce este al nostru

39001
29:49:20,480 --> 29:49:26,160
distance from what's our distance from

39002
29:49:23,760 --> 29:49:29,680
our predictions to our labels going to

39003
29:49:26,160 --> 29:49:31,760
be if we're always getting it right?

39004
29:49:29,680 --> 29:49:33,912
Zero. Yeah, there's not going to be any

39005
29:49:31,760 --> 29:49:35,760
distanţă. O să fie corect. Este

39006
29:49:33,912 --> 29:49:37,512
va fi perfect aliniat, nu?

39007
29:49:35,760 --> 29:49:41,040
Nu va fi nicio distanţă acolo.

39008
29:49:37,512 --> 29:49:43,760
Deci, da, un MSE ideal este zero. Asta e

39009
29:49:41,040 --> 29:49:46,400
un MSE ideal.

39010
29:49:43,760 --> 29:49:49,912
Deci, orice se apropie de cel mai mic

39011
29:49:46,400 --> 29:49:53,360
cu atât mai bine pentru MSE. Cu cât este mai mic

39012
29:49:49,912 --> 29:49:56,320
mai bine. Um, pentru acest R pătrat, uh, este

39013
29:49:53,360 --> 29:49:58,720
este o scară între 0 și unu unde unu

39014
29:49:56,320 --> 29:50:02,480
este cel mai bun. Deci, unul ar fi perfect

39015
29:49:58,720 --> 29:50:05,280
predicții aliniate. Um, deci și din nou,

39016
29:50:02,480 --> 29:50:07,120
aceasta este, de fapt, înmulțim cu 100

39017
29:50:05,280 --> 29:50:10,552
pentru a obține uh pentru că este un număr

39018
29:50:07,120 --> 29:50:14,192
intre 0 si unu. Deci obținem aproximativ 47%

39019
29:50:10,552 --> 29:50:14,192
ceea ce nu este bine.

39020
29:50:21,832 --> 29:50:24,832
Bine.

39021
29:50:36,552 --> 29:50:42,832
În regulă. Orice întrebări despre asta

39022
29:50:39,832 --> 29:50:42,832
evaluare?

39023
29:50:54,000 --> 29:50:58,960
În regulă. Vreau să-ți arăt ceva

39024
29:50:56,080 --> 29:51:01,280
care este

39025
29:50:58,960 --> 29:51:03,120
Da, asta e adevărat. Amploarea acesteia

39026
29:51:01,280 --> 29:51:05,192
contează pe date pentru că ar trebui să fim

39027
29:51:03,120 --> 29:51:07,912
ar trebui să interpretați întotdeauna MSE în

39028
29:51:05,192 --> 29:51:12,232
scara de

39029
29:51:07,912 --> 29:51:14,960
um etichetele tale pentru că etichetele tale

39030
29:51:12,232 --> 29:51:17,832
ca în acest caz etichetele noastre, știți

39031
29:51:14,960 --> 29:51:20,080
am putea lua uh de exemplu am putea

39032
29:51:17,832 --> 29:51:22,480
ușor să facem de fapt asta hai să luăm

39033
29:51:20,080 --> 29:51:25,680
media

39034
29:51:22,480 --> 29:51:29,232
să luăm media etichetelor noastre

39035
29:51:25,680 --> 29:51:29,232
datele de antrenament

39036
29:51:29,760 --> 29:51:35,760
și am putut vedea care sunt acestea. um,

39037
29:51:32,720 --> 29:51:38,232
deci media este 500,

39038
29:51:35,760 --> 29:51:41,440
nu? Media este 500. Și uite

39039
29:51:38,232 --> 29:51:43,360
care este rădăcina noastră pătrată a MSE,

39040
29:51:41,440 --> 29:51:47,912
care se află în aceleași unități cu noi

39041
29:51:43,360 --> 29:51:50,960
original. Um, deci avem destul de mult

39042
29:51:47,912 --> 29:51:53,280
de eroare. 340 când unitățile noastre au dreptate

39043
29:51:50,960 --> 29:51:57,400
in jur de 500.

39044
29:51:53,280 --> 29:51:57,400
Deci este o eroare destul de mare.

39045
29:52:03,592 --> 29:52:10,000
Da, MSE de zero înseamnă că suntem noi

39046
29:52:06,800 --> 29:52:13,912
previziunile sunt aproape identice cu cele ale

39047
29:52:10,000 --> 29:52:18,192
etichete de testare. Da, asta este MSE

39048
29:52:13,912 --> 29:52:18,192
zero înseamnă. Există distanță zero.

39049
29:52:18,720 --> 29:52:23,160
Deci, mai aproape de zero, cu atât mai bine.

39050
29:52:27,512 --> 29:52:34,000
Dar am vorbit despre asta așa cum ești cu adevărat

39051
29:52:29,760 --> 29:52:37,680
deci regula de bază ar trebui să fie ceea ce este

39052
29:52:34,000 --> 29:52:40,400
RMSSE dvs. ca procent din dvs

39053
29:52:37,680 --> 29:52:45,832
valoare tipică. Deci valoarea ta tipică este

39054
29:52:40,400 --> 29:52:47,912
în anii 500. RMSSE este 340.

39055
29:52:45,832 --> 29:52:51,832
Este foarte mare. Asta sa terminat

39056
29:52:47,912 --> 29:52:54,400
cam 60% din acea valoare.

39057
29:52:51,832 --> 29:52:56,640
Deci sunt doar multe. E prea mult

39058
29:52:54,400 --> 29:53:00,320
eroare. Ce ne-ar plăcea acest RMSSE

39059
29:52:56,640 --> 29:53:05,760
be este sub 20% din valoarea tipică. Deci

39060
29:53:00,320 --> 29:53:08,320
asta înseamnă că în medie suntem 20% sau mai puțin

39061
29:53:05,760 --> 29:53:10,400
off în predicția noastră. Asta ar fi

39062
29:53:08,320 --> 29:53:14,232
bine. Ar fi destul de bine. Asta

39063
29:53:10,400 --> 29:53:16,400
înseamnă că avem o precizie de 80%,

39064
29:53:14,232 --> 29:53:17,680
nu? Ar fi destul de ideal. Deci tu

39065
29:53:16,400 --> 29:53:20,160
trebuie să mă gândesc la asta în acest sens

39066
29:53:17,680 --> 29:53:23,592
RMSSE, care este în aceleași unități cu

39067
29:53:20,160 --> 29:53:27,000
etichetele tale.

39068
29:53:23,592 --> 29:53:27,000
Acesta este

39069
29:53:27,760 --> 29:53:34,232
RMSSE

39070
29:53:30,160 --> 29:53:37,232
care este în aceleași unități ca și

39071
29:53:34,232 --> 29:53:37,232
etichete.

39072
29:53:37,440 --> 29:53:42,320
Deci și apoi pentru a interpreta asta avem

39073
29:53:40,232 --> 29:53:45,512
340

39074
29:53:42,320 --> 29:53:47,280
este comparat cu

39075
29:53:45,512 --> 29:53:52,000
tipic

39076
29:53:47,280 --> 29:53:55,592
unitatea salarială de 500

39077
29:53:52,000 --> 29:53:58,552
corect, deci acesta este uh destul de puțin când

39078
29:53:55,592 --> 29:54:01,680
valoarea tipică este 500 și suntem opriți

39079
29:53:58,552 --> 29:54:04,720
medie cu 340 de unități

39080
29:54:01,680 --> 29:54:06,400
este atât de mult relativ la tipic

39081
29:54:04,720 --> 29:54:08,720
valoare

39082
29:54:06,400 --> 29:54:11,120
doar asta e. Asta e multă eroare.

39083
29:54:08,720 --> 29:54:13,192
Nu este un model foarte bun, nu?

39084
29:54:11,120 --> 29:54:16,192
Este insuficient. Este cu siguranță

39085
29:54:13,192 --> 29:54:16,192
submontare.

39086
29:54:25,360 --> 29:54:29,592
Da. Deci, asta e o întrebare grozavă. Ce

39087
29:54:26,960 --> 29:54:32,832
ar trebui sa facem de aici? Deci, pentru că

39088
29:54:29,592 --> 29:54:32,832
suntem subadaptați

39089
29:54:37,912 --> 29:54:45,120
ar trebui să folosim un model mai complex.

39090
29:54:42,720 --> 29:54:47,120
Deci vom învăța despre acestea

39091
29:54:45,120 --> 29:54:48,320
în lecția patru, dar ar trebui să folosim

39092
29:54:47,120 --> 29:54:50,320
ceva diferit. Acest liniar

39093
29:54:48,320 --> 29:54:55,400
regresia este încă prea elementară. Chiar și cu

39094
29:54:50,320 --> 29:54:55,400
lasso, e încă prea de bază.

39095
29:54:56,960 --> 29:55:00,640
Da, suntem nepotriviți pentru că noi Dar

39096
29:54:59,120 --> 29:55:02,400
s-ar putea, de asemenea, să fim nepotriviți

39097
29:55:00,640 --> 29:55:04,960
o regresie liniară regulată. Ar trebui

39098
29:55:02,400 --> 29:55:08,400
testa asta. Hm, și poate că ar fi

39099
29:55:04,960 --> 29:55:10,080
un exercițiu pentru voi, băieți, să testați asta

39100
29:55:08,400 --> 29:55:12,872
afară singur. Nu ar trebui să fie greu

39101
29:55:10,080 --> 29:55:15,760
face. Ai deja toate datele

39102
29:55:12,872 --> 29:55:17,120
scalat. Tu Deci, vezi cum ai face

39103
29:55:15,760 --> 29:55:18,720
face asta? Ai veni doar aici și

39104
29:55:17,120 --> 29:55:21,440
construiți o regresie liniară mai degrabă decât a

39105
29:55:18,720 --> 29:55:22,872
lasso și dofit și atunci ai face-o

39106
29:55:21,440 --> 29:55:26,000
evaluează-l la fel cu a

39107
29:55:22,872 --> 29:55:29,680
dotpredict. Este foarte ușor să faci asta.

39108
29:55:26,000 --> 29:55:32,320
Și apoi putem compara asta cu

39109
29:55:29,680 --> 29:55:34,232
aceasta. Nu ar trebui să fie atât de greu de făcut

39110
29:55:32,320 --> 29:55:35,912
asta, nu?

39111
29:55:34,232 --> 29:55:38,872
Și ceva pentru care ați putea face

39112
29:55:35,912 --> 29:55:41,040
sigur. um,

39113
29:55:38,872 --> 29:55:44,160
se construiește regresia liniară și

39114
29:55:41,040 --> 29:55:46,480
compara de fapt și vezi ce fel de

39115
29:55:44,160 --> 29:55:48,080
diferența pe care o face. Adică, noi sincer

39116
29:55:46,480 --> 29:55:52,320
am putea să o facem singuri. Am putea să o facem

39117
29:55:48,080 --> 29:55:56,160
chiar acum. Poate că merită să încerci asta.

39118
29:55:52,320 --> 29:55:59,640
Deci, să construim o regresie liniară

39119
29:55:56,160 --> 29:55:59,640
pentru comparație.

39120
29:56:00,480 --> 29:56:08,232
Deci avem regresia noastră liniară

39121
29:56:04,232 --> 29:56:12,320
uh este regresia liniară și apoi facem

39122
29:56:08,232 --> 29:56:16,000
ffit regresie liniară.fit fit

39123
29:56:12,320 --> 29:56:21,592
corect, așa că asta o va antrena um și

39124
29:56:16,000 --> 29:56:24,552
atunci îl putem evalua astfel încât lin MSE este

39125
29:56:21,592 --> 29:56:27,760
eroare pătrată medie

39126
29:56:24,552 --> 29:56:32,320
și apoi putem face um, hai să facem nostru

39127
29:56:27,760 --> 29:56:34,872
antrenament hai sa facem antrenamentul si apoi

39128
29:56:32,320 --> 29:56:37,912
hai sa prezicem

39129
29:56:34,872 --> 29:56:40,960
de fapt, lasă-mă să fac asta aici

39130
29:56:37,912 --> 29:56:43,760
uh y predictie

39131
29:56:40,960 --> 29:56:45,760
tren

39132
29:56:43,760 --> 29:56:50,872
liniară

39133
29:56:45,760 --> 29:56:52,552
este egal cu um regresie liniară.predic

39134
29:56:50,872 --> 29:56:55,872
și apoi vom prezice asupra noastră

39135
29:56:52,552 --> 29:56:55,872
caracteristici de antrenament.

39136
29:56:57,680 --> 29:57:00,720
Bine, băieți, vedeți ce fac?

39137
29:56:58,960 --> 29:57:02,872
Construiesc o regresie liniară pentru

39138
29:57:00,720 --> 29:57:05,192
comparatie.

39139
29:57:02,872 --> 29:57:06,872
Fac dofit aici ca să-l antrenez și

39140
29:57:05,192 --> 29:57:09,280
apoi fac niște predicții asupra

39141
29:57:06,872 --> 29:57:10,872
set de antrenament și vom evalua

39142
29:57:09,280 --> 29:57:14,552
acelea. O să-l înlocuiesc aici

39143
29:57:10,872 --> 29:57:17,360
cu y prred

39144
29:57:14,552 --> 29:57:21,720
tren

39145
29:57:17,360 --> 29:57:21,720
liniară. Deci aceste previziuni

39146
29:57:42,320 --> 29:57:47,480
Bine. Deci, dacă doriți acest cod, eu

39147
29:57:44,000 --> 29:57:47,480
se poate lipi.

39148
29:57:55,592 --> 29:58:01,280
Deci, să vedem pentru ce RMSSE doar a

39149
29:57:58,320 --> 29:58:03,832
modelul liniar este.

39150
29:58:01,280 --> 29:58:06,480
Este un pic mai bine. E mai bine

39151
29:58:03,832 --> 29:58:10,320
cu siguranta.

39152
29:58:06,480 --> 29:58:13,760
Deci 289 este mai bun decât acest 340. Este

39153
29:58:10,320 --> 29:58:17,120
mai bine. Se apropie de zero.

39154
29:58:13,760 --> 29:58:18,400
Totuși, este încă insuficient,

39155
29:58:17,120 --> 29:58:21,280
nu? Și asta este doar la antrenament

39156
29:58:18,400 --> 29:58:25,000
set. Să ne uităm la Să facem la fel

39157
29:58:21,280 --> 29:58:25,000
lucru, dar pe

39158
29:58:25,280 --> 29:58:31,280
Să schimbăm asta. Să schimbăm asta

39159
29:58:27,280 --> 29:58:35,912
pentru um test.

39160
29:58:31,280 --> 29:58:40,592
Și apoi să facem un test.

39161
29:58:35,912 --> 29:58:40,592
Și apoi să facem un test

39162
29:58:41,120 --> 29:58:44,120
test.

39163
29:58:44,552 --> 29:58:50,120
si apoi

39164
29:58:47,120 --> 29:58:50,120
test.

39165
29:58:58,000 --> 29:59:02,160
Bine, deci acesta este un test de producție

39166
29:58:59,512 --> 29:59:07,160
predicții pe setul de testare.

39167
29:59:02,160 --> 29:59:07,160
Generăm un test MSE

39168
29:59:07,440 --> 29:59:12,800
și apoi facem testul MSE

39169
29:59:10,872 --> 29:59:14,552
care folosește etichetele de testare și noastre

39170
29:59:12,800 --> 29:59:15,912
predicții de testare

39171
29:59:14,552 --> 29:59:17,592
și apoi luăm rădăcina pătrată a acesteia

39172
29:59:15,912 --> 29:59:20,480
pentru RMSSE și apoi vom face

39173
29:59:17,592 --> 29:59:23,040
generează asta. Deci este încă sub formă.

39174
29:59:20,480 --> 29:59:25,832
Vreau să spun că asta este încă mare. Aceasta este încă

39175
29:59:23,040 --> 29:59:27,360
mare um pe setul de testare și versus pe

39176
29:59:25,832 --> 29:59:29,912
setul de antrenament. Deci tot e frumos

39177
29:59:27,360 --> 29:59:31,360
înalt. Hm, chiar și liniarul de bază

39178
29:59:29,912 --> 29:59:34,160
regresia este sub este încă

39179
29:59:31,360 --> 29:59:37,440
submontare. Încă nepotrivit, nu?

39180
29:59:34,160 --> 29:59:39,440
Chiar și fără lasso, care este lasso

39181
29:59:37,440 --> 29:59:42,232
ar trebui să ajute la supraajustare.

39182
29:59:39,440 --> 29:59:44,320
Cu siguranță nu este supraadaptat. um,

39183
29:59:42,232 --> 29:59:46,400
este cu siguranță nepotrivit,

39184
29:59:44,320 --> 29:59:47,912
dar acesta este un semnal că este oarecum

39185
29:59:46,400 --> 29:59:49,760
supraadaptare deoarece aceasta este performantă

39186
29:59:47,912 --> 29:59:53,120
mai bine pe datele de antrenament și apoi

39187
29:59:49,760 --> 29:59:57,400
se înrăutățește pe datele testului.

39188
29:59:53,120 --> 29:59:57,400
Cu siguranță devine mai rău, nu?

39189
30:00:03,440 --> 30:00:07,000
Ați urmărit?

39190
30:00:07,760 --> 30:00:12,000
Doar rulez asta deasupra, alerg

39191
30:00:09,760 --> 30:00:13,832
asta deasupra asta. Nu contează unde

39192
30:00:12,000 --> 30:00:16,832
ai pus-o. Am putea să-l mutăm

39193
30:00:13,832 --> 30:00:16,832
jos.

39194
30:00:20,800 --> 30:00:25,912
Am putea să-l mutăm în jos, tocmai am alergat

39195
30:00:23,360 --> 30:00:27,760
tocmai am ales o celulă nouă chiar aici.

39196
30:00:25,912 --> 30:00:29,512
și l-a alergat. Dar l-am putea muta.

39197
30:00:27,760 --> 30:00:32,512
De fapt, hai să facem asta. Să-l mutăm

39198
30:00:29,512 --> 30:00:32,512
jos

39199
30:00:33,440 --> 30:00:36,440
la

39200
30:00:36,480 --> 30:00:40,592
după evaluarea cu lazo.

39201
30:00:41,832 --> 30:00:47,592
Bine. Deci, tocmai l-am mutat acolo.

39202
30:00:44,720 --> 30:00:49,592
Și apoi să ne mișcăm

39203
30:00:47,592 --> 30:00:52,720
asta jos.

39204
30:00:49,592 --> 30:00:56,320
Deci, l-am pus aici după um

39205
30:00:52,720 --> 30:00:59,120
după aceasta. Deci acesta este um asta este

39206
30:00:56,320 --> 30:01:02,720
practic funcţia obiectivă drept

39207
30:00:59,120 --> 30:01:05,592
a procesului de instruire. Deci, în timpul

39208
30:01:02,720 --> 30:01:08,160
algoritm care rulează atunci când apelăm ffit in

39209
30:01:05,592 --> 30:01:10,872
scikitlearn le va găsi pe acestea

39210
30:01:08,160 --> 30:01:14,232
betas corect, de fapt o să învețe

39211
30:01:10,872 --> 30:01:16,480
care sunt aceste cele mai bune beta pentru modelul nostru.

39212
30:01:14,232 --> 30:01:19,512
Um, acesta este modelul nostru aici, chiar este

39213
30:01:16,480 --> 30:01:23,040
combinație de beta înmulțit cu caracteristicile noastre

39214
30:01:19,512 --> 30:01:26,960
um plus o interceptare beta. Uh, așa e

39215
30:01:23,040 --> 30:01:30,232
modelul nostru, dar îi penalizăm pe cei mari

39216
30:01:26,960 --> 30:01:33,440
uh ponderi în valoare absolută cu um

39217
30:01:30,232 --> 30:01:37,120
adăugând un termen de penalizare ca acesta um unde

39218
30:01:33,440 --> 30:01:39,360
alfa este un anumit nivel de penalizare pe care noi

39219
30:01:37,120 --> 30:01:41,360
doresc să ofere. De obicei, alfa este egal cu 1

39220
30:01:39,360 --> 30:01:43,192
este în regulă. Dar, de fapt, ceea ce suntem

39221
30:01:41,360 --> 30:01:44,720
o să învețe să termin asta

39222
30:01:43,192 --> 30:01:46,400
secțiunea este că va exista o

39223
30:01:44,720 --> 30:01:49,592
mod sistematic prin care putem testa diferite

39224
30:01:46,400 --> 30:01:52,232
alphas um care reprezintă nivelul de

39225
30:01:49,592 --> 30:01:54,232
pedeapsa pe care vrem să o aplicăm lasso sau

39226
30:01:52,232 --> 30:01:57,912
chiar creasta

39227
30:01:54,232 --> 30:01:59,680
uh regresie. Deci ăsta era lassoul și

39228
30:01:57,912 --> 30:02:02,720
um, dacă vă amintiți că l-ați folosit

39229
30:01:59,680 --> 30:02:06,320
super usor. Am lucrat prin asta

39230
30:02:02,720 --> 30:02:09,592
problemă cu aceste date de baseball

39231
30:02:06,320 --> 30:02:12,080
și am avut uh

39232
30:02:09,592 --> 30:02:16,960
să vedem derulând în jos, ne despărțim

39233
30:02:12,080 --> 30:02:19,192
datele noastre numerice și am făcut una

39234
30:02:16,960 --> 30:02:21,192
hot a codificat datele noastre categorice

39235
30:02:19,192 --> 30:02:24,320
a combinat-o înapoi împreună. Să sperăm

39236
30:02:21,192 --> 30:02:26,480
că sună un sonerie acolo. Hm și noi

39237
30:02:24,320 --> 30:02:28,640
de fapt, am scalat datele noastre, ceea ce este frumos

39238
30:02:26,480 --> 30:02:30,640
standardul de făcut este să facem un fel de

39239
30:02:28,640 --> 30:02:32,872
scalarea la caracteristicile noastre în special ale noastre

39240
30:02:30,640 --> 30:02:34,480
caracteristicile numerice care doresc să fie scalate

39241
30:02:32,872 --> 30:02:37,512
acelea într-un fel fie că este minmax

39242
30:02:34,480 --> 30:02:39,912
scară sau scaler standard vreau să fac

39243
30:02:37,512 --> 30:02:44,400
asta și așa am făcut pentru acest exemplu

39244
30:02:39,912 --> 30:02:45,760
și apoi am rulat regresia lasso

39245
30:02:44,400 --> 30:02:47,680
care este destul de ușor de folosit. Tu doar

39246
30:02:45,760 --> 30:02:51,120
folosiți obiectul lasso și alegeți un

39247
30:02:47,680 --> 30:02:54,232
alfa aici. Um, din nou, vom face

39248
30:02:51,120 --> 30:02:56,720
au o modalitate de a testa diferite alfa

39249
30:02:54,232 --> 30:02:59,512
ar putea fi candidați și putem vedea

39250
30:02:56,720 --> 30:03:03,832
care este cel mai bun. Hm, deci plec

39251
30:02:59,512 --> 30:03:05,512
pentru a ne arăta că astăzi va apărea în curând.

39252
30:03:03,832 --> 30:03:08,400
Dar asta a fost lassoul. Dacă tu

39253
30:03:05,512 --> 30:03:10,400
Băieți țineți minte, noi am făcut asta. Um, asta e

39254
30:03:08,400 --> 30:03:12,232
am comparat asta cu un liniar de bază

39255
30:03:10,400 --> 30:03:14,400
regresie care este atât de frumoasă

39256
30:03:12,232 --> 30:03:16,000
simplu doar o potrivire si apoi

39257
30:03:14,400 --> 30:03:19,680
prezice și apoi putem genera medie

39258
30:03:16,000 --> 30:03:21,680
eroare pătrată. Hm, încă nu este foarte bun

39259
30:03:19,680 --> 30:03:25,120
eroare pătrată medie pe aceste date, este

39260
30:03:21,680 --> 30:03:27,120
încă destul de mare. Um, deci este încă

39261
30:03:25,120 --> 30:03:29,440
nu, indiferent de modelul pe care îl folosim, este

39262
30:03:27,120 --> 30:03:30,872
încă nu foarte bine, dar măcar putem

39263
30:03:29,440 --> 30:03:33,360
exersați să faceți acea comparație. Asta e

39264
30:03:30,872 --> 30:03:34,960
ce am facut ultima data. Am făcut asta pe

39265
30:03:33,360 --> 30:03:36,480
miercuri.

39266
30:03:34,960 --> 30:03:38,552
Hm

39267
30:03:36,480 --> 30:03:40,080
si apoi

39268
30:03:38,552 --> 30:03:43,832
am văzut că efectul diferit

39269
30:03:40,080 --> 30:03:46,232
alphas am avut un lasso um

39270
30:03:43,832 --> 30:03:48,552
am avut o validare încrucișată cu lasso

39271
30:03:46,232 --> 30:03:50,800
exemplu aici. Deci, dincolo de simpla folosire a unui

39272
30:03:48,552 --> 30:03:53,760
model lasso obișnuit pe care îl învață

39273
30:03:50,800 --> 30:03:56,320
are un cv lasso care vă permite să încercați

39274
30:03:53,760 --> 30:03:58,320
scoateți diferite alfa cu cruce

39275
30:03:56,320 --> 30:04:01,440
validare și afli ce

39276
30:03:58,320 --> 30:04:03,040
cel mai bun alfa este. Hm, acum suntem de fapt

39277
30:04:01,440 --> 30:04:05,120
va avea o strategie diferită

39278
30:04:03,040 --> 30:04:08,720
asta în loc să alegi la întâmplare

39279
30:04:05,120 --> 30:04:11,360
cele, putem de fapt să furnizăm mai multe

39280
30:04:08,720 --> 30:04:13,680
parametrii pe care ar putea dori să-i testăm

39281
30:04:11,360 --> 30:04:16,080
câte pot suporta modelele. Şi

39282
30:04:13,680 --> 30:04:18,160
în unele modele mai complexe vor avea

39283
30:04:16,080 --> 30:04:21,512
mai mult de un parametru, cum ar fi doar lasso

39284
30:04:18,160 --> 30:04:23,192
are alfa. Hm, și tehnic

39285
30:04:21,512 --> 30:04:26,080
are iterațiile sale maxime, dar într-adevăr

39286
30:04:23,192 --> 30:04:27,760
singurul care contează este acest alfa.

39287
30:04:26,080 --> 30:04:32,160
Alte modele au multe altele

39288
30:04:27,760 --> 30:04:34,400
hiperparametri pe care îi putem schimba

39289
30:04:32,160 --> 30:04:37,192
și așa vrem o modalitate de a sistematic

39290
30:04:34,400 --> 30:04:39,512
testați acele combinații diferite

39291
30:04:37,192 --> 30:04:41,760
și să vedem care dintre ele duce la cel mai bun

39292
30:04:39,512 --> 30:04:44,400
uh versiunea acelui model. Să spunem că

39293
30:04:41,760 --> 30:04:48,480
cele mai bune rezultate. Deci vom merge

39294
30:04:44,400 --> 30:04:50,232
explorează asta ce urmează. Deci am avut lasso.

39295
30:04:48,480 --> 30:04:52,960
Acum, aici ne-am încheiat ultima dată.

39296
30:04:50,232 --> 30:04:55,360
Am avut regresia crestei. Dacă voi băieți

39297
30:04:52,960 --> 30:04:58,320
amintiți-vă, acesta este doar puțin

39298
30:04:55,360 --> 30:05:01,680
pedeapsa diferita. um,

39299
30:04:58,320 --> 30:05:03,912
este nevoie de ce am desenat-o pentru noi. Ea

39300
30:05:01,680 --> 30:05:06,480
primește aceeași pedeapsă pe care o aveam înainte.

39301
30:05:03,912 --> 30:05:09,192
Deci, are acea sumă reziduală de

39302
30:05:06,480 --> 30:05:11,440
eroarea pătratelor, care este cea principală

39303
30:05:09,192 --> 30:05:13,912
folosit pentru regresia liniară, dar are a

39304
30:05:11,440 --> 30:05:17,912
penalizare cu un alfa și apoi are

39305
30:05:13,912 --> 30:05:22,640
suma pătratelor beta

39306
30:05:17,912 --> 30:05:24,720
pătrate beta. Deci penalizeaza are a

39307
30:05:22,640 --> 30:05:26,552
penalizare dar penalizează ușor

39308
30:05:24,720 --> 30:05:28,640
diferit unde folosește pătratul nu

39309
30:05:26,552 --> 30:05:30,480
valoarea absolută. Asta e creasta

39310
30:05:28,640 --> 30:05:33,120
regresie. Și asta are similar

39311
30:05:30,480 --> 30:05:34,720
efectul dvs. nu pentru a minimiza

39312
30:05:33,120 --> 30:05:38,000
acest drept pentru că scopul nostru în antrenament

39313
30:05:34,720 --> 30:05:41,360
un model era să minimizeze acest lucru

39314
30:05:38,000 --> 30:05:44,720
minimizați această cantitate și găsiți

39315
30:05:41,360 --> 30:05:46,400
cele mai bune beta care minimizează acest lucru. Um asa

39316
30:05:44,720 --> 30:05:50,320
în general da vrei să încurajezi

39317
30:05:46,400 --> 30:05:52,320
valori mai mici, dar um odată ce obții

39318
30:05:50,320 --> 30:05:56,640
valori care sunt o fracție dacă pătrați

39319
30:05:52,320 --> 30:06:01,832
ei chiar devin mai mici. Um asa uh

39320
30:05:56,640 --> 30:06:03,360
nu este, nu este necesar

39321
30:06:01,832 --> 30:06:05,360
micșorați-le până la zero. Ei

39322
30:06:03,360 --> 30:06:08,480
vor deveni mai mici de îndată ce vor fi amabili

39323
30:06:05,360 --> 30:06:12,080
de sub unu. Ca să nu se încurajeze

39324
30:06:08,480 --> 30:06:13,680
să dispară complet uh ca

39325
30:06:12,080 --> 30:06:15,912
valoarea absolută face. E doar puțin

39326
30:06:13,680 --> 30:06:18,320
minimizare diferită. Hm, ce noi

39327
30:06:15,912 --> 30:06:19,760
vezi cu creasta este noi nu vedem

39328
30:06:18,320 --> 30:06:21,512
caracteristicile sunt cam șterse

39329
30:06:19,760 --> 30:06:24,400
complet așa cum facem cu un lasso. În

39330
30:06:21,512 --> 30:06:26,080
lasso sunt încurajați să fie

39331
30:06:24,400 --> 30:06:28,400
deveni zero pentru că asta este un fel de

39332
30:06:26,080 --> 30:06:30,000
singura modalitate de a minimiza o valoare absolută.

39333
30:06:28,400 --> 30:06:32,872
Dar cu pătrate pot continua să obțină

39334
30:06:30,000 --> 30:06:35,680
din ce în ce mai mic și mai mic um

39335
30:06:32,872 --> 30:06:38,000
fracții și nu trebuie să devină

39336
30:06:35,680 --> 30:06:39,832
zero. Nu este la fel de dur de a de a

39337
30:06:38,000 --> 30:06:41,360
pedeapsa.

39338
30:06:39,832 --> 30:06:45,912
um,

39339
30:06:41,360 --> 30:06:50,000
deci, uh, creasta a fost ușor de folosit ca

39340
30:06:45,912 --> 30:06:52,960
bine. Hm, și are și un alfa care

39341
30:06:50,000 --> 30:06:55,360
putem seta. Deci, este literalmente la fel

39342
30:06:52,960 --> 30:06:57,512
cod exact, doar un alt model.

39343
30:06:55,360 --> 30:06:59,280
Există o pedeapsă ușor diferită și

39344
30:06:57,512 --> 30:07:00,960
rezultă diferiți coeficienți.

39345
30:06:59,280 --> 30:07:02,640
Observați că niciunul dintre ei nu este exact

39346
30:07:00,960 --> 30:07:05,280
zero. Ca și cu lassoul, poți obține

39347
30:07:02,640 --> 30:07:08,080
cele care sunt exact zero. Nu vedem

39348
30:07:05,280 --> 30:07:10,480
că cu creasta. Îți amintești asta?

39349
30:07:08,080 --> 30:07:12,000
Hm, deci am subliniat asta ultimul

39350
30:07:10,480 --> 30:07:15,040
timp. Observați că coeficienții nu sunt

39351
30:07:12,000 --> 30:07:17,912
zero. Hm și apoi o putem evalua. Deci

39352
30:07:15,040 --> 30:07:19,512
am făcut calculul MSE, care este a

39353
30:07:17,912 --> 30:07:21,760
lucru destul de standard în care ne folosim

39354
30:07:19,512 --> 30:07:25,440
model pentru a prezice pe un set de antrenament,

39355
30:07:21,760 --> 30:07:27,512
prezice pe un set de testare, evaluează-le um

39356
30:07:25,440 --> 30:07:29,680
calculând metrica ca media

39357
30:07:27,512 --> 30:07:31,440
eroare squed și putem vedea dacă suntem

39358
30:07:29,680 --> 30:07:33,280
supraadaptare, subadaptare. Aceasta este

39359
30:07:31,440 --> 30:07:34,480
cu siguranță același tip de poveste pe care o avem noi

39360
30:07:33,280 --> 30:07:36,320
vazut cu toate aceste modele este

39361
30:07:34,480 --> 30:07:38,800
insuficient pentru că eroarea este atât de mare

39362
30:07:36,320 --> 30:07:40,400
peste ambele seturi

39363
30:07:38,800 --> 30:07:42,552
pe parcursul antrenamentelor și testelor. Deci este

39364
30:07:40,400 --> 30:07:44,320
cu siguranță insuficientă.

39365
30:07:42,552 --> 30:07:46,320
Hm

39366
30:07:44,320 --> 30:07:49,832
și același lucru ca lasso, are o cruce

39367
30:07:46,320 --> 30:07:52,232
validare uh variație pe care

39368
30:07:49,832 --> 30:07:56,000
vă permite să încercați diferite alfa

39369
30:07:52,232 --> 30:08:00,000
și um face diferite pliuri. Deci de 10 ori,

39370
30:07:56,000 --> 30:08:03,832
cinci ori, orice și calculează um

39371
30:08:00,000 --> 30:08:06,832
încercați să găsiți cel mai bun alfa în acest fel.

39372
30:08:03,832 --> 30:08:06,832
Bine.

39373
30:08:07,592 --> 30:08:12,720
În regulă.

39374
30:08:09,680 --> 30:08:15,760
Orice întrebări despre asta sunt până acum de la ultima

39375
30:08:12,720 --> 30:08:18,872
e timpul să o revizuiești puțin?

39376
30:08:15,760 --> 30:08:20,320
Sper să fie așa

39377
30:08:18,872 --> 30:08:23,832
să-ți revină puțin memoria

39378
30:08:20,320 --> 30:08:25,592
creasta și laso. Um, știi, unde

39379
30:08:23,832 --> 30:08:27,912
o vom ridica astăzi este să

39380
30:08:25,592 --> 30:08:29,592
termină această lecție cu încă una

39381
30:08:27,912 --> 30:08:32,000
model,

39382
30:08:29,592 --> 30:08:34,400
care va fi o combinație de

39383
30:08:32,000 --> 30:08:37,040
creasta și laso. Deci, chiar poți

39384
30:08:34,400 --> 30:08:40,552
combinați-le împreună

39385
30:08:37,040 --> 30:08:41,832
într-un mod liniar, acele penalități.

39386
30:08:40,552 --> 30:08:43,512
Deci, le poți avea pe amândouă

39387
30:08:41,832 --> 30:08:47,512
pedepsele, valoarea absolută și

39388
30:08:43,512 --> 30:08:49,360
pătrat. Și când ai ambele penalizări

39389
30:08:47,512 --> 30:08:53,120
um, acesta este un model special numit

39390
30:08:49,360 --> 30:08:57,192
plasă elastică uh regresie sau plasă elastică

39391
30:08:53,120 --> 30:08:59,592
model. Hm, deci aceasta este o combinație de

39392
30:08:57,192 --> 30:09:01,280
laso și creasta împreună. Deci ai

39393
30:08:59,592 --> 30:09:03,360
lasso, ai creasta și apoi ai

39394
30:09:01,280 --> 30:09:06,800
plasă elastică care le combină pe ambele

39395
30:09:03,360 --> 30:09:08,552
pedepsele. Lasă-mă să-ți arăt

39396
30:09:06,800 --> 30:09:13,360
ecuație.

39397
30:09:08,552 --> 30:09:15,832
Deci aici este uh, aici este

39398
30:09:13,360 --> 30:09:20,080
model. Acesta este același lucru pe care îl avem și noi

39399
30:09:15,832 --> 30:09:22,080
întotdeauna a avut. Acesta este modelul nostru obișnuit

39400
30:09:20,080 --> 30:09:25,040
potrivire pentru liniar. Acesta este un element de bază

39401
30:09:22,080 --> 30:09:26,400
regresie liniară um funcţie de pierdere sau

39402
30:09:25,040 --> 30:09:29,120
funcția obiectivă pe care încercăm să o facem

39403
30:09:26,400 --> 30:09:30,640
minimizați pentru a găsi beta-urile. Observați cum

39404
30:09:29,120 --> 30:09:32,160
avem totuși ambele penalizări

39405
30:09:30,640 --> 30:09:34,080
de data asta. Deci, în loc să ai doar unul

39406
30:09:32,160 --> 30:09:38,000
din penalități, de fapt le avem pe amândouă.

39407
30:09:34,080 --> 30:09:40,960
Deci avem penalty lasso

39408
30:09:38,000 --> 30:09:44,800
și apoi avem pedeapsa de creastă aici.

39409
30:09:40,960 --> 30:09:47,040
Deci, de fapt, le folosim pe amândouă și um

39410
30:09:44,800 --> 30:09:51,832
încercați să găsiți un echilibru de minimizare

39411
30:09:47,040 --> 30:09:53,440
acele două, acele două penalități.

39412
30:09:51,832 --> 30:09:55,120
Bine. Și observați cum ei în loc de

39413
30:09:53,440 --> 30:09:58,480
doar un singur alfa, avem într-un fel o

39414
30:09:55,120 --> 30:10:01,120
echilibru pe ambele.

39415
30:09:58,480 --> 30:10:03,440
Deci îl putem cântări efectiv pe lasso

39416
30:10:01,120 --> 30:10:07,120
mai mult. Putem cântări creasta încă una.

39417
30:10:03,440 --> 30:10:08,720
Le putem cântări la fel. Putem

39418
30:10:07,120 --> 30:10:10,320
schimbă asta la fel de mult ca noi

39419
30:10:08,720 --> 30:10:14,720
vreau. Deci au două greutăți diferite

39420
30:10:10,320 --> 30:10:19,912
acolo că ar putea fi.

39421
30:10:14,720 --> 30:10:21,440
Acum, ceea ce se întâmplă în realitate este uh

39422
30:10:19,912 --> 30:10:24,800
vom vedea asta în modelul este

39423
30:10:21,440 --> 30:10:28,000
că de obicei, ceea ce se întâmplă sunt acestea

39424
30:10:24,800 --> 30:10:32,000
se combină într-o fracție. Deci există

39425
30:10:28,000 --> 30:10:35,120
de obicei un raport de lambda 1 la lambda 2

39426
30:10:32,000 --> 30:10:38,400
și aceasta este cunoscută sub numele de um asta este

39427
30:10:35,120 --> 30:10:40,872
cunoscut uneori ca raportul L1

39428
30:10:38,400 --> 30:10:42,640
și acesta este un parametru

39429
30:10:40,872 --> 30:10:45,440
în interiorul modelului pe care îl vom putea

39430
30:10:42,640 --> 30:10:47,280
setați împreună cu alfa. Deci vom fi

39431
30:10:45,440 --> 30:10:52,320
capabil să seteze un alfa și apoi asta

39432
30:10:47,280 --> 30:10:56,800
raport. Ideea este că um

39433
30:10:52,320 --> 30:10:59,360
raportul ne va permite să controlăm care

39434
30:10:56,800 --> 30:11:03,832
unul este mai dominant. Deci, dacă acest număr

39435
30:10:59,360 --> 30:11:06,640
este mai mare decât va face această penalizare cu lasso

39436
30:11:03,832 --> 30:11:09,040
va fi ponderat mai mult. Dacă acest raport este

39437
30:11:06,640 --> 30:11:11,912
mai mic dacă este mai mic de unul pt

39438
30:11:09,040 --> 30:11:16,080
exemplu care înseamnă că creasta um

39439
30:11:11,912 --> 30:11:18,872
regresia este mai dominantă. Hm dar

39440
30:11:16,080 --> 30:11:23,192
deci vom avea asta o să avem cu adevărat

39441
30:11:18,872 --> 30:11:26,160
asta si asta la dispozitia noastra si alfa

39442
30:11:23,192 --> 30:11:28,720
este um

39443
30:11:26,160 --> 30:11:33,760
alpha este un fel ca un a pe care îl poți gândi

39444
30:11:28,720 --> 30:11:37,592
din el ca o scară care este lambda 1

39445
30:11:33,760 --> 30:11:40,160
cam ca lambda 1 plus lambda 2 um

39446
30:11:37,592 --> 30:11:43,440
combinate pentru a egala alfa.

39447
30:11:40,160 --> 30:11:46,720
Deci este ca nivelul nostru total de penalizare

39448
30:11:43,440 --> 30:11:48,232
um nivelul nostru total de pedeapsă și putem

39449
30:11:46,720 --> 30:11:51,440
setați asta egal cu unu. O putem seta

39450
30:11:48,232 --> 30:11:53,280
egal cu orice ne dorim. Hm și așa

39451
30:11:51,440 --> 30:11:55,832
acestea vor fi în acest raport și acolo va fi

39452
30:11:53,280 --> 30:11:58,232
să fie un nivel total de penalizare pe care îl putem

39453
30:11:55,832 --> 30:12:00,872
aplica. Deci modelul va folosi efectiv

39454
30:11:58,232 --> 30:12:02,552
acești doi parametri atunci când facem

39455
30:12:00,872 --> 30:12:05,192
ea. Dar așa sunt ei așa sunt

39456
30:12:02,552 --> 30:12:08,720
toate sunt legate.

39457
30:12:05,192 --> 30:12:10,552
Bine. Deci Ridge folosește ambele penalizări.

39458
30:12:08,720 --> 30:12:12,400
Asta e singura diferență dintre lasso

39459
30:12:10,552 --> 30:12:15,440
sau scuze plasa elastica foloseste ambele

39460
30:12:12,400 --> 30:12:21,440
pedepsele. Un lucru vreau să faci

39461
30:12:15,440 --> 30:12:23,512
Observația este că dacă vrem

39462
30:12:21,440 --> 30:12:25,280
ar putea seta acest raport L1 până la

39463
30:12:23,512 --> 30:12:30,080
zero.

39464
30:12:25,280 --> 30:12:32,400
Um, care dacă facem asta este singurul

39465
30:12:30,080 --> 30:12:34,480
modul în care acest raport L1 ar putea fi zero ar fi

39466
30:12:32,400 --> 30:12:36,552
dacă lambda 1 este zero. Deci ar fi doar

39467
30:12:34,480 --> 30:12:39,192
reveniți la regresia crestei. Deci

39468
30:12:36,552 --> 30:12:40,960
complet dacă dacă acesta este zero, aceasta va

39469
30:12:39,192 --> 30:12:46,000
ștergeți acest termen și vom reveni la

39470
30:12:40,960 --> 30:12:49,000
creastă dacă raportul L1 este zero.

39471
30:12:46,000 --> 30:12:49,000
Bine.

39472
30:12:50,960 --> 30:12:57,360
În regulă. Deci avem o plasă elastică

39473
30:12:53,832 --> 30:12:59,120
model. Acum este folosit exact la fel

39474
30:12:57,360 --> 30:13:03,680
așa cum am procedat cu celelalte modele din

39475
30:12:59,120 --> 30:13:06,232
cod. Deci avem plasă elastică um uh de la

39476
30:13:03,680 --> 30:13:09,512
familia de modele liniare scikitlearn doar

39477
30:13:06,232 --> 30:13:12,160
exact acolo unde am avut regresia liniară

39478
30:13:09,512 --> 30:13:15,280
creasta lassoului toate acestea au venit din asta

39479
30:13:12,160 --> 30:13:16,872
modelul liniar um plasă elastică vine și el

39480
30:13:15,280 --> 30:13:21,440
de acolo și apoi validarea încrucișată

39481
30:13:16,872 --> 30:13:23,832
De acolo vine și versiunea

39482
30:13:21,440 --> 30:13:26,480
deci să vedem când ne construim modelul

39483
30:13:23,832 --> 30:13:28,080
va fi foarte foarte simplu

39484
30:13:26,480 --> 30:13:31,192
lucruri ușoare pentru că este același cod

39485
30:13:28,080 --> 30:13:34,552
că avem întotdeauna um doar folosim

39486
30:13:31,192 --> 30:13:37,120
plasă elastică. Am stabilit un alfa alfa

39487
30:13:34,552 --> 30:13:39,120
egal cu 1 este destul de standard, la fel ca

39488
30:13:37,120 --> 30:13:42,320
este în ultima creastă adică

39489
30:13:39,120 --> 30:13:44,480
standardul industriei este unul și apoi un L

39490
30:13:42,320 --> 30:13:45,832
Raportul L1 de.5

39491
30:13:44,480 --> 30:13:51,280
asta e si destul de standard. Ce

39492
30:13:45,832 --> 30:13:54,552
Raportul L1 de.5 este un fel de um

39493
30:13:51,280 --> 30:13:58,640
uh cam asta înseamnă că lambda

39494
30:13:54,552 --> 30:14:00,960
Raportul 1 la lambda 2 este 1/2. Um, deci

39495
30:13:58,640 --> 30:14:03,680
asta e un raport destul de standard

39496
30:14:00,960 --> 30:14:05,192
de asemenea. Dar din nou, am putea seta asta

39497
30:14:03,680 --> 30:14:08,720
egale cu unu și ar fi oarecum

39498
30:14:05,192 --> 30:14:12,872
egal ponderate. Hm, raportul L1 de jumătate

39499
30:14:08,720 --> 30:14:14,552
înseamnă că creasta uh se referă la

39500
30:14:12,872 --> 30:14:19,360
Penalizarea creastă este puțin mai mare

39501
30:14:14,552 --> 30:14:21,120
ponderat în acea situație.

39502
30:14:19,360 --> 30:14:24,480
Bine.

39503
30:14:21,120 --> 30:14:26,720
Deci, odată ce avem acest model, putem

39504
30:14:24,480 --> 30:14:30,160
face ffit și putem rula asta pe nostru

39505
30:14:26,720 --> 30:14:32,000
date de antrenament și putem obține că putem

39506
30:14:30,160 --> 30:14:33,832
aflați cum sunt parametrii noștri

39507
30:14:32,000 --> 30:14:35,192
coeficienții noștri și interceptările noastre. Al nostru

39508
30:14:33,832 --> 30:14:36,552
modelul va avea asta, dar mai mult

39509
30:14:35,192 --> 30:14:38,400
important, putem folosi modelul nostru pentru

39510
30:14:36,552 --> 30:14:42,872
prezice corect, astfel încât să putem prezice asupra

39511
30:14:38,400 --> 30:14:46,912
set de testare. Lasă-mă să mă întorc și să ne încarc

39512
30:14:42,872 --> 30:14:46,912
date și chiar rulați acest lucru.

39513
30:14:47,120 --> 30:14:53,960
Deci, vom folosi același lucru

39514
30:14:48,400 --> 30:14:53,960
date pe care le-am făcut pentru uh lasso,

39515
30:14:54,320 --> 30:14:58,960
care este derularea înapoi în sus, așa că eu

39516
30:14:57,040 --> 30:15:01,960
îl pot încărca. Sunt datele de baseball

39517
30:14:58,960 --> 30:15:01,960
aici.

39518
30:15:02,320 --> 30:15:05,320
um,

39519
30:15:05,360 --> 30:15:10,160
pur și simplu rulează-l de acolo.

39520
30:15:07,760 --> 30:15:13,552
Acesta este hitters.csv. Deci, sper ca tu

39521
30:15:10,160 --> 30:15:13,552
au pe acela.

39522
30:15:22,160 --> 30:15:25,872
Lasă-mă să încarc asta.

39523
30:15:30,232 --> 30:15:34,720
Bine, așa că am încărcat asta și apoi asta

39524
30:15:32,160 --> 30:15:38,832
ar trebui să se încarce.

39525
30:15:34,720 --> 30:15:38,832
Aruncă acea coloană fără nume.

39526
30:15:41,832 --> 30:15:45,800
Ne vom lua manechinele

39527
30:15:50,800 --> 30:15:55,400
și apoi concatenează cele divizate

39528
30:15:56,080 --> 30:16:00,000
scara. Eu doar reluez lucrurile. Im

39529
30:15:58,480 --> 30:16:02,232
reluând lucrurile astfel încât să ne vedem modelul

39530
30:16:00,000 --> 30:16:04,080
încă o dată.

39531
30:16:02,232 --> 30:16:07,680
Așa că reluați asta. Aruncă o privire la asta. Asta

39532
30:16:04,080 --> 30:16:10,960
arata bine. si apoi

39533
30:16:07,680 --> 30:16:14,720
completați nles-urile de pe acelea.

39534
30:16:10,960 --> 30:16:18,760
Bine. Deci, ar trebui să fim capabili să ne conducem

39535
30:16:14,720 --> 30:16:18,760
plasă elastică acum.

39536
30:16:23,280 --> 30:16:28,080
Bine. Deci, să importăm asta și apoi

39537
30:16:26,160 --> 30:16:31,360
hai să ne construim modelul. Deci, iată-ne.

39538
30:16:28,080 --> 30:16:33,280
Ne construim modelul și interceptarea este

39539
30:16:31,360 --> 30:16:37,800
că. Acum, desigur, ne putem uita la noi

39540
30:16:33,280 --> 30:16:37,800
coeficienți. Să ne uităm la asta.

39541
30:16:39,440 --> 30:16:43,912
Uită-te la coeficienții noștri. Deci amintiți-vă

39542
30:16:41,280 --> 30:16:46,552
coeficienții sunt uh beta. Aceste

39543
30:16:43,912 --> 30:16:49,040
sunt beta-urile noastre care sunt în modelul nostru. Hm

39544
30:16:46,552 --> 30:16:51,280
ca să le putem arunca o privire. Acum um

39545
30:16:49,040 --> 30:16:52,480
ei sunt undeva la mijloc. Este

39546
30:16:51,280 --> 30:16:54,480
nu un lasso plin unde vom merge

39547
30:16:52,480 --> 30:16:57,912
vezi ca unele dintre acestea sunt zero. Nu este o

39548
30:16:54,480 --> 30:16:59,192
creasta plină. Hm, deci coeficienții noi

39549
30:16:57,912 --> 30:17:01,440
get sunt diferite. Sunt undeva în

39550
30:16:59,192 --> 30:17:03,912
între acolo acele două modele care

39551
30:17:01,440 --> 30:17:09,000
am construit deja. Deci nu chiar

39552
30:17:03,912 --> 30:17:09,000
aceeași um undeva la mijloc acolo.

39553
30:17:10,552 --> 30:17:15,912
Um și apoi ne putem folosi modelul pentru a face

39554
30:17:12,640 --> 30:17:18,232
predicții și și calculează MSE

39555
30:17:15,912 --> 30:17:20,000
uh sau RMSSE ar trebui să spun și eu. Deci

39556
30:17:18,232 --> 30:17:21,280
putem lua eroarea pătratică medie, trece

39557
30:17:20,000 --> 30:17:24,552
că în rădăcina pătrată și calculați

39558
30:17:21,280 --> 30:17:26,720
RMSSE. Deci încă destul de rău. Um asta este

39559
30:17:24,552 --> 30:17:28,800
chiar în jurul acelui interval de 300 de ce

39560
30:17:26,720 --> 30:17:31,120
am primit pentru celălalt RMSSE al nostru. Deci,

39561
30:17:28,800 --> 30:17:34,000
nu e ca și cum plasa elastică ar fi mai bună

39562
30:17:31,120 --> 30:17:36,552
decât cele altele ca liniare sau lasso sau

39563
30:17:34,000 --> 30:17:38,552
creasta. Și asta nu este surprinzător pentru că

39564
30:17:36,552 --> 30:17:40,160
este doar adăugarea acestor penalități suplimentare.

39565
30:17:38,552 --> 30:17:42,872
Nu ne așteptăm să ajungă magic

39566
30:17:40,160 --> 30:17:46,000
mai bine. De fapt, este ceva mai complex

39567
30:17:42,872 --> 30:17:47,512
atunci când le adăugăm când le adăugăm,

39568
30:17:46,000 --> 30:17:49,192
de fapt o reducem și o facem

39569
30:17:47,512 --> 30:17:51,440
mai simplu. Și mai avem nevoie de ceva

39570
30:17:49,192 --> 30:17:56,400
complex, ar trebui să spun. Deci, facem

39571
30:17:51,440 --> 30:17:58,800
este mai simplu um făcând penalizare

39572
30:17:56,400 --> 30:18:01,192
greutățile noastre un pic mai mult. Și așa

39573
30:17:58,800 --> 30:18:03,120
încă nu se potrivește. Nu este

39574
30:18:01,192 --> 30:18:05,512
chiar surprinzător, nu? Încă nu este

39575
30:18:03,120 --> 30:18:07,280
într-adevăr o potrivire grozavă.

39576
30:18:05,512 --> 30:18:10,400
Și putem, putem chiar să verificăm

39577
30:18:07,280 --> 30:18:12,000
că. Știm că RMSSE nostru este destul de prost.

39578
30:18:10,400 --> 30:18:15,040
Hm, dar putem verifica cu asta

39579
30:18:12,000 --> 30:18:16,720
Scorul R2. Și, știi, încă nu este

39580
30:18:15,040 --> 30:18:18,720
bun. Amintiți-vă, unul ar fi cu adevărat

39581
30:18:16,720 --> 30:18:23,960
bine. Ar fi ca un liniar perfect

39582
30:18:18,720 --> 30:18:23,960
model. Asta e încă destul de rău.

39583
30:18:26,160 --> 30:18:31,120
Bine, așa cum am spus, controalele alfa

39584
30:18:28,800 --> 30:18:34,720
puterea generală. Hm, deci cu cât mai sus

39585
30:18:31,120 --> 30:18:37,440
alfa, cu atât mai multă penalizare generală

39586
30:18:34,720 --> 30:18:40,232
furnizăm, ceea ce face modelul

39587
30:18:37,440 --> 30:18:43,760
mai simplu. um,

39588
30:18:40,232 --> 30:18:47,440
uh, dar raportul L1 um determină

39589
30:18:43,760 --> 30:18:51,120
amestec sau acel raport de lambda, cel

39590
30:18:47,440 --> 30:18:55,040
lasso la creastă. Hm, dacă îl ai

39591
30:18:51,120 --> 30:18:59,440
fi um exact zero, le revii pe toate

39592
30:18:55,040 --> 30:19:00,960
drumul înapoi la um dacă tu dacă îl pui

39593
30:18:59,440 --> 30:19:02,800
la zero, revii tot drumul înapoi la

39594
30:19:00,960 --> 30:19:04,872
creasta unu ar fi până la pură

39595
30:19:02,800 --> 30:19:09,552
lassos. Undeva la mijloc ca unul

39596
30:19:04,872 --> 30:19:09,552
jumatate este buna.

39597
30:19:15,192 --> 30:19:21,040
bine,

39598
30:19:17,680 --> 30:19:23,120
deci acesta este un alt exemplu de încercare

39599
30:19:21,040 --> 30:19:25,280
diferite valori ale alfa din CV la

39600
30:19:23,120 --> 30:19:26,872
vezi care funcționează. Acum, din nou, sunt

39601
30:19:25,280 --> 30:19:29,360
ne va arata intr-un minut a

39602
30:19:26,872 --> 30:19:31,440
modalitate sistematică de a face acest lucru, dar asta este

39603
30:19:29,360 --> 30:19:36,320
doar încercând diferite alfa

39604
30:19:31,440 --> 30:19:39,280
ne-am instalat în acest uh în acest um

39605
30:19:36,320 --> 30:19:42,320
uh gama. Deci avem valori diferite

39606
30:19:39,280 --> 30:19:44,080
între minus2 și două um

39607
30:19:42,320 --> 30:19:47,280
logaritmic.

39608
30:19:44,080 --> 30:19:49,512
Deci acestea sunt valori logaritmice

39609
30:19:47,280 --> 30:19:52,320
sunt între acesta între minus2 și doi

39610
30:19:49,512 --> 30:19:54,640
și alegem 100 de alfa diferite și

39611
30:19:52,320 --> 30:19:58,160
apoi alegem 100 de um L1 diferite

39612
30:19:54,640 --> 30:20:00,720
rapoarte intre 0,01 si unu si alergam

39613
30:19:58,160 --> 30:20:02,872
că rulăm această validare încrucișată

39614
30:20:00,720 --> 30:20:05,760
cu 10 pliuri. Deci asta este destul de puțin.

39615
30:20:02,872 --> 30:20:09,440
Deci facem 10 falduri și încercăm

39616
30:20:05,760 --> 30:20:11,120
100 de opțiuni diferite. Uh fiecare

39617
30:20:09,440 --> 30:20:13,680
când facem o opțiune, încercăm 10

39618
30:20:11,120 --> 30:20:17,320
pliuri pentru a-l evalua. Deci, va fi

39619
30:20:13,680 --> 30:20:17,320
ia un minut pentru a alerga.

39620
30:20:26,960 --> 30:20:30,960
Încă mai rulează aici. Dar din nou, ce

39621
30:20:29,280 --> 30:20:34,400
asta face este să încerci diferit

39622
30:20:30,960 --> 30:20:36,400
alphas și va face o cruce

39623
30:20:34,400 --> 30:20:38,872
validare. Și voi băieți țineți minte

39624
30:20:36,400 --> 30:20:43,512
validarea încrucișată t-fold este locul în care luăm

39625
30:20:38,872 --> 30:20:46,552
datele noastre și le împărțim în 10 ori

39626
30:20:43,512 --> 30:20:48,552
și apoi ne antrenăm pe nouă dintre ele

39627
30:20:46,552 --> 30:20:51,360
și apoi testați pe pliul rămas și

39628
30:20:48,552 --> 30:20:54,400
apoi rotim toate pliurile de 10 ori.

39629
30:20:51,360 --> 30:20:58,872
și că facem o medie a celor pătrate medii

39630
30:20:54,400 --> 30:21:02,640
valorile de eroare împreună împotriva acestora

39631
30:20:58,872 --> 30:21:05,832
10 opțiuni de pliere diferite de generat

39632
30:21:02,640 --> 30:21:07,832
un practic ca o performanță medie

39633
30:21:05,832 --> 30:21:09,760
pentru acea valoare a alfa. Și facem

39634
30:21:07,832 --> 30:21:12,232
că de 100 de ori pentru toate acestea diferite

39635
30:21:09,760 --> 30:21:13,912
100 de alfa care există și 100

39636
30:21:12,232 --> 30:21:17,160
diferite rapoarte L1 pe care le încercăm

39637
30:21:13,912 --> 30:21:17,160
cu ei.

39638
30:21:19,912 --> 30:21:26,320
Deci este destul de puțină procesare, dar

39639
30:21:22,720 --> 30:21:28,400
uh s-a terminat.

39640
30:21:26,320 --> 30:21:30,480
Deci putem vedea care este cel mai bun alfa al nostru și

39641
30:21:28,400 --> 30:21:34,400
cel mai bun raport al nostru. Deci primim ce este mai bun

39642
30:21:30,480 --> 30:21:37,280
alfa este cel mai bun raport este acesta. Hm

39643
30:21:34,400 --> 30:21:39,912
și prin urmare putem construi un model

39644
30:21:37,280 --> 30:21:44,480
cu cei cu doar acești doi tipi ca

39645
30:21:39,912 --> 30:21:46,320
alfa și L1 și vezi cum asta

39646
30:21:44,480 --> 30:21:48,400
execută.

39647
30:21:46,320 --> 30:21:50,480
Construim acel model și apoi prezicem

39648
30:21:48,400 --> 30:21:52,720
pe setul de testare și generăm

39649
30:21:50,480 --> 30:21:54,400
RMSSE. E doar un pic mai bine.

39650
30:21:52,720 --> 30:21:56,400
Încă nu este. Este doar un pic

39651
30:21:54,400 --> 30:22:00,160
mai bine, dar tot nu e bine, nu?

39652
30:21:56,400 --> 30:22:03,760
Este încă 338. Este mult prea mare.

39653
30:22:00,160 --> 30:22:07,680
Amintiți-vă, acesta este RMSSE, deci este în

39654
30:22:03,760 --> 30:22:10,080
unități ale variabilei noastre țintă. Deci,

39655
30:22:07,680 --> 30:22:12,320
este în unitățile de, dacă ne întoarcem la

39656
30:22:10,080 --> 30:22:14,320
datele noastre, de fapt, le pot imprima

39657
30:22:12,320 --> 30:22:17,960
aici afară.

39658
30:22:14,320 --> 30:22:17,960
um acest RMSSE.

39659
30:22:18,480 --> 30:22:22,800
Dacă fac asta, am putea arunca o privire

39660
30:22:20,320 --> 30:22:27,192
la um DF

39661
30:22:22,800 --> 30:22:28,720
sau aș putea să mă uit la testul Y

39662
30:22:27,192 --> 30:22:30,320
și puteți vedea unele dintre aceste valori.

39663
30:22:28,720 --> 30:22:31,912
Acestea sunt aceste valori salariale în

39664
30:22:30,320 --> 30:22:36,232
sute, nu? Unii dintre ei sunt în

39665
30:22:31,912 --> 30:22:38,400
mii. Hm, dar o eroare de genul 338

39666
30:22:36,232 --> 30:22:39,912
este prea mare. Asta e foarte mare

39667
30:22:38,400 --> 30:22:42,720
eroare. Asta înseamnă că ne-am stinge

39668
30:22:39,912 --> 30:22:46,080
medie de 300 când valorile noastre dacă noi

39669
30:22:42,720 --> 30:22:48,552
doar face răul

39670
30:22:46,080 --> 30:22:52,320
um

39671
30:22:48,552 --> 30:22:55,280
este doar 550 ca în medie este 550, dar noi

39672
30:22:52,320 --> 30:22:57,360
au această cantitate de eroare în medie um

39673
30:22:55,280 --> 30:22:59,360
deci este mult prea mare

39674
30:22:57,360 --> 30:23:02,000
proporția de eroare corectă nu este a

39675
30:22:59,360 --> 30:23:07,640
model foarte bun si din nou putem verifica

39676
30:23:02,000 --> 30:23:07,640
că uitându-se la acest R2 pentru.

39677
30:23:11,912 --> 30:23:15,800
Deci, dacă mergem aici,

39678
30:23:20,080 --> 30:23:25,440
inca nu foarte bine.

39679
30:23:23,680 --> 30:23:26,552
Iată câțiva dintre coeficienții noștri. Deci

39680
30:23:25,440 --> 30:23:28,400
amintiți-vă, puteți oricând să vă luați

39681
30:23:26,552 --> 30:23:31,592
coeficienți și aliniați-i la dvs

39682
30:23:28,400 --> 30:23:33,440
coloanele dvs. de date. Ca să poți

39683
30:23:31,592 --> 30:23:36,160
obțineți o idee despre ce coeficient îi aparține

39684
30:23:33,440 --> 30:23:37,680
cu ce caracteristică. Deci asta e tot ce suntem

39685
30:23:36,160 --> 30:23:39,360
a face aici este doar a crea o serie

39686
30:23:37,680 --> 30:23:40,640
unde acei coeficienți în loc de doar

39687
30:23:39,360 --> 30:23:42,960
imprimând coeficienții, suntem

39688
30:23:40,640 --> 30:23:45,280
aliniindu-le de fapt până la coloane.

39689
30:23:42,960 --> 30:23:47,680
Așa că asta ne spune că ne amintim mai mare

39690
30:23:45,280 --> 30:23:50,552
este cu atât mai multă influență are

39691
30:23:47,680 --> 30:23:52,800
pe pe rezultatul final. Hm fie

39692
30:23:50,552 --> 30:23:55,592
așa, așa că asta are un mare negativ

39693
30:23:52,800 --> 30:23:58,592
influență. Hm, asta are un mare pozitiv

39694
30:23:55,592 --> 30:23:58,592
influență.

39695
30:24:02,480 --> 30:24:07,280
Bine, lasă-mă să mă opresc acolo. Orice întrebări

39696
30:24:05,360 --> 30:24:11,832
despre

39697
30:24:07,280 --> 30:24:13,832
model plasa elastica?

39698
30:24:11,832 --> 30:24:16,552
Acesta este un model cu adevărat

39699
30:24:13,832 --> 30:24:18,000
unul bun de folosit atunci când construiți un

39700
30:24:16,552 --> 30:24:20,232
regresia liniară și este performantă

39701
30:24:18,000 --> 30:24:21,832
Ei bine, dar este prea potrivit. Acesta este un

39702
30:24:20,232 --> 30:24:23,760
unul foarte bun de folosit pentru că poți

39703
30:24:21,832 --> 30:24:25,440
echilibru

39704
30:24:23,760 --> 30:24:28,552
lasso și creasta de care poți obține tot ce este mai bun

39705
30:24:25,440 --> 30:24:31,592
ambele lumi. Deci strategia principală este

39706
30:24:28,552 --> 30:24:33,680
dacă utilizați o regresie liniară și

39707
30:24:31,592 --> 30:24:36,160
vezi supraadaptare

39708
30:24:33,680 --> 30:24:39,512
Adică, are performanțe decente

39709
30:24:36,160 --> 30:24:41,680
deci pe setul de antrenament

39710
30:24:39,512 --> 30:24:44,232
funcționează bine, dar apoi pe

39711
30:24:41,680 --> 30:24:45,680
set de testare ca și cum știi că nu este

39712
30:24:44,232 --> 30:24:47,512
submontare. se comporta destul de mult

39713
30:24:45,680 --> 30:24:51,512
bine pe platoul de antrenament, dar mai departe

39714
30:24:47,512 --> 30:24:54,232
setul de testare este um performanța este mult

39715
30:24:51,512 --> 30:24:55,760
mai rău. Asta e supraadaptare. Dacă ești

39716
30:24:54,232 --> 30:24:58,232
supraajustat, atunci acesta este un model grozav

39717
30:24:55,760 --> 30:25:00,232
să folosim pentru că putem încerca practic

39718
30:24:58,232 --> 30:25:03,592
prin rotirea prin diferite alfa și

39719
30:25:00,232 --> 30:25:06,480
diferite rapoarte L1, putem încerca

39720
30:25:03,592 --> 30:25:08,872
diferite forţe ale pedepsei şi

39721
30:25:06,480 --> 30:25:11,040
diferite variații pe lasso și creastă

39722
30:25:08,872 --> 30:25:13,760
împreună. Acesta este un model foarte bun

39723
30:25:11,040 --> 30:25:17,192
de folosit pentru acele cazuri supraadaptate în care

39724
30:25:13,760 --> 30:25:20,080
regresia liniară se descurcă decent

39725
30:25:17,192 --> 30:25:22,960
um, dar este prea potrivit.

39726
30:25:20,080 --> 30:25:25,040
Corect? Până acum nu am derulat acest caz

39727
30:25:22,960 --> 30:25:28,320
pentru că până acum indiferent de model

39728
30:25:25,040 --> 30:25:31,360
l-am folosit întotdeauna este insuficient. Deci

39729
30:25:28,320 --> 30:25:33,440
oricând avem acele cazuri nepotrivite

39730
30:25:31,360 --> 30:25:36,800
semnalează că ar trebui probabil doar

39731
30:25:33,440 --> 30:25:38,960
folosim un model mai complex și noi nu

39732
30:25:36,800 --> 30:25:42,552
am aflat încă despre acestea.

39733
30:25:38,960 --> 30:25:45,512
um, vom veni în lecția a patra, dar

39734
30:25:42,552 --> 30:25:46,720
um asta e pentru aceste date. Asta e ultim

39735
30:25:45,512 --> 30:25:48,232
în cele din urmă ceea ce am vrea să facem este

39736
30:25:46,720 --> 30:25:50,872
probabil folosiți un model mai avansat

39737
30:25:48,232 --> 30:25:52,640
pentru că nu se potrivește, doar folosind

39738
30:25:50,872 --> 30:25:54,800
o regresie liniară și apoi folosind

39739
30:25:52,640 --> 30:25:56,720
variațiile de supraadaptare ale liniare

39740
30:25:54,800 --> 30:25:59,720
regresie ca creasta lasso și elastic

39741
30:25:56,720 --> 30:25:59,720
net.

39742
30:26:03,120 --> 30:26:06,120
Bine.

39743
30:26:06,960 --> 30:26:12,440
Orice întrebări despre asta pe elastic atunci

39744
30:26:15,440 --> 30:26:21,400
televizorul? Da, noi Da, cred că am

39745
30:26:17,360 --> 30:26:21,400
ea. Îl pot împărtăși cu tine.

39746
30:26:24,480 --> 30:26:29,960
Am spus asta si acum nu il gasesc. eu

39747
30:26:26,400 --> 30:26:29,960
am crezut că am.

39748
30:26:35,760 --> 30:26:39,912
Nu-l am. Am crezut că am, dar

39749
30:26:37,912 --> 30:26:43,960
Eu nu.

39750
30:26:39,912 --> 30:26:43,960
Dacă cineva îl are pe acela.

39751
30:26:45,440 --> 30:26:51,400
Da, mă voi mai uita o dată. m-am gândit

39752
30:26:47,680 --> 30:26:51,400
Pe acela l-am avut.

39753
30:26:51,680 --> 30:26:54,680
Unul,

39754
30:26:57,512 --> 30:27:03,080
da, nu este acolo. l-am avut. Lasă

39755
30:26:59,912 --> 30:27:03,080
văd eu.

39756
30:27:12,080 --> 30:27:17,320
Da, nici eu nu-l am. m-am gândit

39757
30:27:13,592 --> 30:27:17,320
L-am avut aici.

39758
30:27:22,232 --> 30:27:26,192
Da, nu am pe acela.

39759
30:27:27,040 --> 30:27:30,720
Pe acela nu-l am. și va trebui

39760
30:27:28,232 --> 30:27:34,080
găsește-l. Am aceste date de marketing.

39761
30:27:30,720 --> 30:27:35,760
Nu cred că acesta este același.

39762
30:27:34,080 --> 30:27:36,960
Am aceste date de marketing. Eu nu

39763
30:27:35,760 --> 30:27:40,440
crezi că este cel potrivit, dar poți

39764
30:27:36,960 --> 30:27:40,440
arunca o privire la ea.

39765
30:27:41,592 --> 30:27:45,760
Nu, folosim Deci, pentru acest exemplu,

39766
30:27:43,760 --> 30:27:48,552
folosim același set de date pentru lovitori

39767
30:27:45,760 --> 30:27:52,760
pe care l-am folosit mai devreme pentru lasso.

39768
30:27:48,552 --> 30:27:52,760
Nu, asta e una mai devreme.

39769
30:27:54,872 --> 30:28:01,280
Asta chiar de la începutul

39770
30:27:58,160 --> 30:28:04,280
caietul. Deci asta e din asta

39771
30:28:01,280 --> 30:28:04,280
unul.

39772
30:28:05,912 --> 30:28:09,192
Oh, asta Oh, aici este locul. Îmi pare rău.

39773
30:28:08,000 --> 30:28:12,192
Aici este. Îl poți găsi

39774
30:28:09,192 --> 30:28:12,192
aici.

39775
30:28:14,160 --> 30:28:18,192
Asta e corect. Era de la o adresă URL.

39776
30:28:20,080 --> 30:28:23,760
A fost folosit chiar la începutul anului

39777
30:28:21,680 --> 30:28:27,832
caietul.

39778
30:28:23,760 --> 30:28:30,000
Și noi am făcut asta.

39779
30:28:27,832 --> 30:28:31,120
Bine.

39780
30:28:30,000 --> 30:28:34,280
Asta e corect. De aceea nu am avut

39781
30:28:31,120 --> 30:28:34,280
s-a descărcat.

39782
30:28:35,592 --> 30:28:38,592
Bine.

39783
30:28:39,680 --> 30:28:43,360
În regulă. Orice alte întrebări despre

39784
30:28:41,360 --> 30:28:47,760
plasă elastică înainte de a mă mișca mă duc

39785
30:28:43,360 --> 30:28:50,552
treceți la uh găsirea lor sistematică

39786
30:28:47,760 --> 30:28:51,912
modalitate de a găsi cei mai buni hiperparametri.

39787
30:28:50,552 --> 30:28:54,320
Am să vă arăt câteva

39788
30:28:51,912 --> 30:28:56,720
strategii pentru a face asta. Hm, până acum

39789
30:28:54,320 --> 30:28:59,120
tocmai am rulat CV cu ceva aleatoriu

39790
30:28:56,720 --> 30:29:00,800
alegeri. Um, am să-ți arăt o

39791
30:28:59,120 --> 30:29:02,320
abordare mai bună, mai sistematică. Asta e

39792
30:29:00,800 --> 30:29:05,680
un fel de standard industrial pentru a face

39793
30:29:02,320 --> 30:29:07,120
acordarea. Hm, deci o să mă duc

39794
30:29:05,680 --> 30:29:10,832
arata asta in continuare. Dar orice întrebări despre

39795
30:29:07,120 --> 30:29:10,832
plasa elastica?

39796
30:29:13,360 --> 30:29:17,760
Bine. Și din nou, așa cum știți

39797
30:29:16,080 --> 30:29:21,512
scikitlearn vă face cu adevărat ușor

39798
30:29:17,760 --> 30:29:24,160
băieți pentru că pur și simplu se comportă la fel

39799
30:29:21,512 --> 30:29:26,800
la fel ca orice alt model. Folosești

39800
30:29:24,160 --> 30:29:29,760
obiect și apoi faci ffit și prezici

39801
30:29:26,800 --> 30:29:32,232
nu? Deci ffit-ul o va antrena

39802
30:29:29,760 --> 30:29:34,480
um și prezicerea vă va permite

39803
30:29:32,232 --> 30:29:36,800
să folosească acel model pentru a prezice. Este este

39804
30:29:34,480 --> 30:29:39,192
super usor asa. Fiecare scikitlearn

39805
30:29:36,800 --> 30:29:41,040
modelul este așa dofitit și prezice.

39806
30:29:39,192 --> 30:29:45,000
Deci oferă o modalitate foarte simplă de a

39807
30:29:41,040 --> 30:29:45,000
utilizați practic fiecare model.

39808
30:29:47,512 --> 30:29:51,192
bine,

39809
30:29:49,512 --> 30:29:54,640
hai să vorbim despre hai să terminăm asta

39810
30:29:51,192 --> 30:29:55,912
lecție cu câteva lucruri. Um, unul dintre

39811
30:29:54,640 --> 30:29:59,192
acele lucruri vor fi

39812
30:29:55,912 --> 30:30:01,912
reglare hiperparametrică. Deci ce este asta?

39813
30:29:59,192 --> 30:30:05,040
Reglajul hiperparametrului este a

39814
30:30:01,912 --> 30:30:08,400
modalitate sistematică de a găsi cele mai bune

39815
30:30:05,040 --> 30:30:10,960
parametrii într-un model de învățare automată.

39816
30:30:08,400 --> 30:30:13,280
Deci o mulțime de modele de învățare automată au

39817
30:30:10,960 --> 30:30:15,832
ceea ce se numesc hiperparametri.

39818
30:30:13,280 --> 30:30:17,912
Acestea nu sunt beta-urile pe care le învățăm

39819
30:30:15,832 --> 30:30:20,552
în timpul antrenamentului din care s-a învățat

39820
30:30:17,912 --> 30:30:23,440
datele. Acestea sunt setările pe care le setăm noi

39821
30:30:20,552 --> 30:30:26,000
dinainte ca alfa. Asta este o

39822
30:30:23,440 --> 30:30:28,552
exemplu perfect cum ar fi raportul alfa L1 în

39823
30:30:26,000 --> 30:30:30,400
în plasa elastică. Noi le-am instalat

39824
30:30:28,552 --> 30:30:31,912
din timp și în funcție de ceea ce noi

39825
30:30:30,400 --> 30:30:34,320
alegeți pentru cei pe care îi avem diferiți

39826
30:30:31,912 --> 30:30:37,832
performanta, nu? Și așa ce noi

39827
30:30:34,320 --> 30:30:40,320
nevoie cu adevărat este o modalitate sistematică de a găsi

39828
30:30:37,832 --> 30:30:42,960
cele mai bune setări pentru acestea

39829
30:30:40,320 --> 30:30:48,232
hiperparametrii pe măsură ce ne antrenăm

39830
30:30:42,960 --> 30:30:50,872
modele. Hm, ideea principală

39831
30:30:48,232 --> 30:30:54,480
în spatele acestui proces, totuși, se va

39832
30:30:50,872 --> 30:30:57,512
fie să încerce sistematic diferite

39833
30:30:54,480 --> 30:30:59,912
combinații câte vrem să încercăm.

39834
30:30:57,512 --> 30:31:02,960
Și așa vom face, practic

39835
30:30:59,912 --> 30:31:06,640
au o strategie de reglare care merge

39836
30:31:02,960 --> 30:31:08,960
să epuizeze toate combinaţiile celor

39837
30:31:06,640 --> 30:31:11,512
hiperparametrii pe care vrem să-i încercăm

39838
30:31:08,960 --> 30:31:14,800
până îl găsim pe cel care execută

39839
30:31:11,512 --> 30:31:19,192
cel mai bun. Hm și și acea strategie este cunoscută

39840
30:31:14,800 --> 30:31:22,960
ca căutare în grilă. Hm și în esență ce

39841
30:31:19,192 --> 30:31:25,592
face este că stabilește o grilă unde

39842
30:31:22,960 --> 30:31:27,360
care este practic ca o matrice de spus

39843
30:31:25,592 --> 30:31:30,872
bine ce parametri vrei

39844
30:31:27,360 --> 30:31:33,760
incerci? Vreau să încerc alpha și vreau

39845
30:31:30,872 --> 30:31:37,512
pentru a încerca raportul L1

39846
30:31:33,760 --> 30:31:39,832
um raportul L1 ca să zicem că vreau să încerc

39847
30:31:37,512 --> 30:31:41,440
aceşti doi. Așa că le-am configurat într-o grilă

39848
30:31:39,832 --> 30:31:43,040
unde spunem: „Bine, vreau să încerc asta

39849
30:31:41,440 --> 30:31:44,960
valoare. Vreau să încerc această valoare. vreau

39850
30:31:43,040 --> 30:31:47,040
pentru a încerca această valoare. Acesta, acesta,

39851
30:31:44,960 --> 30:31:49,680
acesta, și mai departe și câte vrem

39852
30:31:47,040 --> 30:31:52,800
să încerc”. Așa că am putea să le punem la punct

39853
30:31:49,680 --> 30:31:55,120
sistematic ca un um a liniar

39854
30:31:52,800 --> 30:31:58,872
distanțate liniar așa cum vreau să încerc fiecare

39855
30:31:55,120 --> 30:32:01,680
alfa între 0 și 10 distanță de

39856
30:31:58,872 --> 30:32:03,832
unul. Orice, știi, putem stabili

39857
30:32:01,680 --> 30:32:05,680
până în diferite game ale acestora, dar asta este

39858
30:32:03,832 --> 30:32:07,512
va fi în această grilă. Și apoi

39859
30:32:05,680 --> 30:32:08,872
Raportul L1, același lucru. Putem încerca

39860
30:32:07,512 --> 30:32:12,400
valori diferite ale acestora pe care le dorim

39861
30:32:08,872 --> 30:32:16,232
să încerce. Să spunem că sunt multe dintre acestea.

39862
30:32:12,400 --> 30:32:20,320
Poate la fiecare zecime între 0 și unu

39863
30:32:16,232 --> 30:32:21,680
Vreau să încerc. Așa că ai configurat-o

39864
30:32:20,320 --> 30:32:23,680
parametrii și puteți seta cât mai mulți

39865
30:32:21,680 --> 30:32:25,440
vrei în grilă. Și apoi

39866
30:32:23,680 --> 30:32:27,760
în esență, ceea ce ai de gând să faci

39867
30:32:25,440 --> 30:32:29,760
face căutarea în grilă este că vei lucra

39868
30:32:27,760 --> 30:32:31,040
drumul tău prin fiecare combinație de

39869
30:32:29,760 --> 30:32:33,440
acelea. Ai de gând să încerci asta

39870
30:32:31,040 --> 30:32:34,960
combo. Ai de gând să încerci asta

39871
30:32:33,440 --> 30:32:36,800
combo. Ai de gând să încerci asta

39872
30:32:34,960 --> 30:32:40,400
combo.

39873
30:32:36,800 --> 30:32:43,592
acest combo. Deci prima valoare a lui alfa

39874
30:32:40,400 --> 30:32:45,760
cu fiecare raport L1 posibil, apoi mergeți la

39875
30:32:43,592 --> 30:32:48,552
următorul, încercați următoarea valoare a

39876
30:32:45,760 --> 30:32:51,832
alfa cu fiecare raport L1, și mai departe

39877
30:32:48,552 --> 30:32:54,400
și mai departe. Deci o să încercăm

39878
30:32:51,832 --> 30:32:56,552
toate combo-urile

39879
30:32:54,400 --> 30:32:58,720
în grilă.

39880
30:32:56,552 --> 30:33:02,232
Vom încerca toate combo-urile și suntem

39881
30:32:58,720 --> 30:33:05,360
va găsi cel mai mic MSE

39882
30:33:02,232 --> 30:33:07,192
combinație. găsiți cel mai jos

39883
30:33:05,360 --> 30:33:08,800
MSE

39884
30:33:07,192 --> 30:33:11,512
combo.

39885
30:33:08,800 --> 30:33:14,480
Deci, orice duce la cel mai bun model este

39886
30:33:11,512 --> 30:33:16,800
vor fi parametrii um care sunt

39887
30:33:14,480 --> 30:33:20,232
care sunt considerate a fi cele mai bune. Iar cel

39888
30:33:16,800 --> 30:33:22,232
ideea este odată ce i-am găsit pe cei pe care îi cunoaștem

39889
30:33:20,232 --> 30:33:24,400
pe care îl putem folosi putem merge înainte și

39890
30:33:22,232 --> 30:33:28,760
antrenează un model cu cele mai bune alfa și

39891
30:33:24,400 --> 30:33:28,760
len ratio și mai departe și mai departe și mai departe.

39892
30:33:34,400 --> 30:33:39,592
Da, când primești un Deci asta se întoarce

39893
30:33:36,320 --> 30:33:41,192
la eroare. Amintiți-vă că pentru a

39894
30:33:39,592 --> 30:33:44,160
regresie,

39895
30:33:41,192 --> 30:33:46,232
eroarea este această măsurătoare a cât de departe

39896
30:33:44,160 --> 30:33:49,040
am plecat, nu? Deci dacă avem o grămadă

39897
30:33:46,232 --> 30:33:52,640
de puncte și tragem potrivim o linie

39898
30:33:49,040 --> 30:33:54,960
prin acolo, MSE-ul măsoară

39899
30:33:52,640 --> 30:33:56,960
distanta asta, nu? Deci ce faci

39900
30:33:54,960 --> 30:33:59,280
crezi că este o distanță bună? Ca și cum ai nostru

39901
30:33:56,960 --> 30:34:02,080
modelul este perfect,

39902
30:33:59,280 --> 30:34:05,440
care este cea mai bună distanță de la noi

39903
30:34:02,080 --> 30:34:09,192
previziuni la punctele reale? Zero.

39904
30:34:05,440 --> 30:34:13,120
Da. Deci, cu cât mai jos, cu atât mai bine. Mai jos

39905
30:34:09,192 --> 30:34:15,280
cu atât mai bine. Hm, pentru un R RMSSE,

39906
30:34:13,120 --> 30:34:19,912
mai mic cu cât mai aproape de zero, cu atât mai bine.

39907
30:34:15,280 --> 30:34:22,000
Cu toate acestea, RMSSE poate fi unitățile sale

39908
30:34:19,912 --> 30:34:23,592
sunt interpretate în unitățile noastre

39909
30:34:22,000 --> 30:34:26,800
tinta.

39910
30:34:23,592 --> 30:34:28,800
Deci ceea ce este considerat a fi bun este relativ

39911
30:34:26,800 --> 30:34:31,512
spre ținta noastră. Ca să spunem ținta noastră

39912
30:34:28,800 --> 30:34:34,872
este în mii. De parcă are o medie în

39913
30:34:31,512 --> 30:34:39,280
miile. Dacă producem un MSE de

39914
30:34:34,872 --> 30:34:41,912
50 sau scuze un RMSSE de 50, asta e

39915
30:34:39,280 --> 30:34:43,912
destul de bine, nu? Pentru că unitățile noastre

39916
30:34:41,912 --> 30:34:47,280
sunt în mii

39917
30:34:43,912 --> 30:34:49,592
și suntem doar în medie, ne-am îndepărtat

39918
30:34:47,280 --> 30:34:51,680
50 de unitati,

39919
30:34:49,592 --> 30:34:55,360
nu? Distanța noastră este de aproximativ 50

39920
30:34:51,680 --> 30:34:58,320
unitati. E destul de bine. Deci RMSSE

39921
30:34:55,360 --> 30:35:00,800
este relativ la variabila țintă.

39922
30:34:58,320 --> 30:35:02,480
Are sens? Da. Depinde

39923
30:35:00,800 --> 30:35:05,280
pe tinta. Depinde ce esti

39924
30:35:02,480 --> 30:35:07,680
încercând să prezică.

39925
30:35:05,280 --> 30:35:09,592
Deci, de aceea am primit RMSSE care erau în

39926
30:35:07,680 --> 30:35:11,912
anii 300 pentru acei lovitori, dar

39927
30:35:09,592 --> 30:35:15,512
media a fost media țintei

39928
30:35:11,912 --> 30:35:18,000
a fost în anii 500. Deci e foarte rău

39929
30:35:15,512 --> 30:35:21,512
proporția de eroare relativă la

39930
30:35:18,000 --> 30:35:24,080
valoarea țintă medie, nu? Dacă noastre

39931
30:35:21,512 --> 30:35:27,680
RMSSE a fost 300,

39932
30:35:24,080 --> 30:35:30,400
dar ținta era în anii 500,

39933
30:35:27,680 --> 30:35:32,160
este prea multă eroare. Mult prea mult

39934
30:35:30,400 --> 30:35:36,080
eroare, nu? E prea mare

39935
30:35:32,160 --> 30:35:39,360
valoare. Hm, previziunile noastre sunt abia în dezactivare

39936
30:35:36,080 --> 30:35:42,640
mult prea mult din punct de vedere al distanței respective.

39937
30:35:39,360 --> 30:35:44,800
Deci, acesta ar fi că acesta a fost un model prost.

39938
30:35:42,640 --> 30:35:47,280
A fost insuficient.

39939
30:35:44,800 --> 30:35:49,912
Știm asta de la RMSSE. Deci

39940
30:35:47,280 --> 30:35:52,480
da, RMSSE mai aproape de zero, nu

39941
30:35:49,912 --> 30:35:56,640
contează ce este bine,

39942
30:35:52,480 --> 30:35:58,480
zero este a fi perfect. Hm, dar asta

39943
30:35:56,640 --> 30:36:01,120
știi ce e bine, trebuie să știi ce

39944
30:35:58,480 --> 30:36:03,912
ținta ta este în medie și apoi gândește-te

39945
30:36:01,120 --> 30:36:06,400
din aceasta ca un fel de raport cu aceea

39946
30:36:03,912 --> 30:36:10,512
tinta medie. Cred că asta e cel mai bun

39947
30:36:06,400 --> 30:36:10,512
mod de a gândi la asta.

39948
30:36:17,512 --> 30:36:25,040
Bine, deci revenirea la această idee de grilă este

39949
30:36:22,080 --> 30:36:28,640
deci grila este, practic, așezată

39950
30:36:25,040 --> 30:36:30,552
toate combinațiile de parametri posibile și

39951
30:36:28,640 --> 30:36:33,592
încercându-le pe toate prin potrivire şi

39952
30:36:30,552 --> 30:36:36,000
prezicerea până la și generarea unui a

39953
30:36:33,592 --> 30:36:38,480
metrica ca un MSE

39954
30:36:36,000 --> 30:36:42,320
până îl găsim pe cel cu cel mai mic

39955
30:36:38,480 --> 30:36:44,960
MSE. Așa că găsiți cea mai mică combinație MSE

39956
30:36:42,320 --> 30:36:47,440
si asta va fi cel mai bun

39957
30:36:44,960 --> 30:36:49,832
acesta va fi cel mai bun combo. Și apoi dacă

39958
30:36:47,440 --> 30:36:51,832
noi odată ce știm cea mai bună combinație pe care o putem

39959
30:36:49,832 --> 30:36:54,960
folosiți că putem folosi acel alfa pe care îl putem

39960
30:36:51,832 --> 30:36:56,800
folosește acel raport L1 și folosește acel model

39961
30:36:54,960 --> 30:36:59,360
mergând înainte. Putem le putem folosi

39962
30:36:56,800 --> 30:37:02,552
parametrii din modelul nostru. Deci asta

39963
30:36:59,360 --> 30:37:05,912
strategie are un nume. Este cunoscut ca

39964
30:37:02,552 --> 30:37:08,400
căutare în grilă. Deci este un hiperparametru

39965
30:37:05,912 --> 30:37:11,120
proces de reglare care încearcă toate

39966
30:37:08,400 --> 30:37:15,120
combinatii.

39967
30:37:11,120 --> 30:37:17,360
Deci, care este beneficiul

39968
30:37:15,120 --> 30:37:18,872
asta este că putem testa o mulțime de

39969
30:37:17,360 --> 30:37:21,192
diferite combo combo ale acestora

39970
30:37:18,872 --> 30:37:23,832
parametri precum alfa și L1. Deci noi

39971
30:37:21,192 --> 30:37:26,080
pot fi siguri care este cel mai bun model,

39972
30:37:23,832 --> 30:37:27,680
corect? Deci putem alege alfa și L1

39973
30:37:26,080 --> 30:37:29,360
perfect pentru că încercăm o

39974
30:37:27,680 --> 30:37:32,640
o grămadă de combinații diferite pe

39975
30:37:29,360 --> 30:37:34,552
date pentru a vedea care este cel mai bun. Ce este

39976
30:37:32,640 --> 30:37:37,040
dezavantajul?

39977
30:37:34,552 --> 30:37:40,400
E scump, nu? Este o

39978
30:37:37,040 --> 30:37:43,592
căutare exhaustivă. Deci, dacă ai multe

39979
30:37:40,400 --> 30:37:46,160
parametri diferiți și încerci

39980
30:37:43,592 --> 30:37:48,160
din multe combinații diferite, se poate

39981
30:37:46,160 --> 30:37:49,680
obține exponențial

39982
30:37:48,160 --> 30:37:53,120
scump

39983
30:37:49,680 --> 30:37:56,000
pentru a efectua această căutare. Bine, deci grilă

39984
30:37:53,120 --> 30:37:57,760
căutarea este grozavă cu excepția faptului că

39985
30:37:56,000 --> 30:38:00,160
poate fi scump dacă ai multe

39986
30:37:57,760 --> 30:38:02,000
parametrii cu intervale foarte largi

39987
30:38:00,160 --> 30:38:03,832
pe care îl cauți pentru că asta

39988
30:38:02,000 --> 30:38:06,480
sunt multe combinații pe care trebuie să le faci

39989
30:38:03,832 --> 30:38:08,872
test, nu? Și mai ales dacă ai

39990
30:38:06,480 --> 30:38:10,960
multe date, asta va fi

39991
30:38:08,872 --> 30:38:13,512
scump

39992
30:38:10,960 --> 30:38:16,080
um de făcut.

39993
30:38:13,512 --> 30:38:17,760
Deci vom exersa să facem grila

39994
30:38:16,080 --> 30:38:19,192
caută, dar asta este pro și

39995
30:38:17,760 --> 30:38:20,720
con. Pro este că putem încerca

39996
30:38:19,192 --> 30:38:23,120
toate aceste combinatii si vezi care

39997
30:38:20,720 --> 30:38:24,800
unul e cel mai bun. Dezavantajul este că se poate

39998
30:38:23,120 --> 30:38:27,680
fi scump să faci asta dacă ai un

39999
30:38:24,800 --> 30:38:32,232
o mulțime de parametri pe care doriți

40000
30:38:27,680 --> 30:38:34,000
acordați-vă modelul și aveți foarte multe

40001
30:38:32,232 --> 30:38:36,960
uh, multe alegeri diferite pe care le ai

40002
30:38:34,000 --> 30:38:39,360
încercând să evalueze pentru acestea și doar

40003
30:38:36,960 --> 30:38:42,160
creează o colecție foarte mare de

40004
30:38:39,360 --> 30:38:45,440
combinații pe care trebuie să le încerci,

40005
30:38:42,160 --> 30:38:48,552
nu? Ăsta e singurul dezavantaj

40006
30:38:45,440 --> 30:38:50,640
căutare în grilă.

40007
30:38:48,552 --> 30:38:54,000
Acum la capătul opus al spectrului

40008
30:38:50,640 --> 30:38:58,080
din aceasta este o căutare aleatorie sau aleatorie

40009
30:38:54,000 --> 30:39:03,192
caută și asta va fi practic doar um

40010
30:38:58,080 --> 30:39:05,512
faceți o eșantionare a acelor parametri din

40011
30:39:03,192 --> 30:39:08,480
um fel de fix uh specificat

40012
30:39:05,512 --> 30:39:11,592
distributie. Deci, în esență, ceea ce faci

40013
30:39:08,480 --> 30:39:14,872
în mod similar, definiți gama dvs. Deci

40014
30:39:11,592 --> 30:39:18,080
spui că vreau să mă uit la alphas um

40015
30:39:14,872 --> 30:39:20,400
între zero sau scuze între să zicem

40016
30:39:18,080 --> 30:39:22,640
da, de la 0 la 10. Vreau să mă uit la o grămadă

40017
30:39:20,400 --> 30:39:25,832
de diferite alphas um și vreau

40018
30:39:22,640 --> 30:39:29,680
uită-te la o grămadă de rapoarte L1 diferite

40019
30:39:25,832 --> 30:39:33,512
care sunt intre 0 si 1

40020
30:39:29,680 --> 30:39:37,280
0 la unu și um ceea ce facem este să spunem

40021
30:39:33,512 --> 30:39:40,000
bine, voi restricționa doar testarea

40022
30:39:37,280 --> 30:39:43,040
20 30 40 de ori. Nu am de gând să fac totul

40023
30:39:40,000 --> 30:39:46,000
combinatii posibile. Doar mă duc

40024
30:39:43,040 --> 30:39:48,000
eșantionați aleatoriu ceva din acest interval

40025
30:39:46,000 --> 30:39:50,872
și eșantionați la întâmplare ceva în asta

40026
30:39:48,000 --> 30:39:53,440
gamă. Și așa, și voi face spectacol

40027
30:39:50,872 --> 30:39:56,800
care experimentează de un număr fix de ori.

40028
30:39:53,440 --> 30:40:00,320
Deci, să presupunem că am setat eșantionarea uh

40029
30:39:56,800 --> 30:40:02,000
unde o să fac doar 20

40030
30:40:00,320 --> 30:40:04,800
evaluări.

40031
30:40:02,000 --> 30:40:08,400
Și așa, de 20 de ori vom alege un

40032
30:40:04,800 --> 30:40:13,080
combo la întâmplare. Deci, am să aleg un

40033
30:40:08,400 --> 30:40:13,080
alpha și voi alege un raport L1.

40034
30:40:14,000 --> 30:40:20,960
Raportul L1.

40035
30:40:16,160 --> 30:40:24,320
Și um suntem, doar mergem la uh

40036
30:40:20,960 --> 30:40:28,000
eșantionați aleatoriu din acest interval.

40037
30:40:24,320 --> 30:40:29,680
Hm și le vom folosi și le vom testa

40038
30:40:28,000 --> 30:40:31,120
cei afară. Și apoi este, dar altfel

40039
30:40:29,680 --> 30:40:34,800
este la fel cu căutarea în grilă. Tot ceea ce

40040
30:40:31,120 --> 30:40:37,832
este cel mai mic MSE. Um, deci orice ar fi

40041
30:40:34,800 --> 30:40:40,400
cel mai mic MSE este cel mai bun.

40042
30:40:37,832 --> 30:40:42,800
Deci le evaluăm, eșantionăm, noi

40043
30:40:40,400 --> 30:40:45,832
antrenează modelul, evaluează-l. Oricare ar fi

40044
30:40:42,800 --> 30:40:49,760
este cel mai mic MSE

40045
30:40:45,832 --> 30:40:52,960
este cel mai bun este cel mai bun combo. Acum

40046
30:40:49,760 --> 30:40:56,552
care este beneficiul acestui lucru este că este a

40047
30:40:52,960 --> 30:40:59,120
experiment mult mai controlat în

40048
30:40:56,552 --> 30:41:00,872
simt că nu vom repeta

40049
30:40:59,120 --> 30:41:03,192
prin fiecare combinație posibilă în

40050
30:41:00,872 --> 30:41:05,040
grila. unde practic am înființat o

40051
30:41:03,192 --> 30:41:06,872
un număr fix de ori vom încerca

40052
30:41:05,040 --> 30:41:08,872
lucruri afară.

40053
30:41:06,872 --> 30:41:10,400
Riscul de a face asta este că ești

40054
30:41:08,872 --> 30:41:12,720
nu

40055
30:41:10,400 --> 30:41:14,400
nu explorezi toate combinațiile,

40056
30:41:12,720 --> 30:41:17,912
nu? Pentru că eșantionați aleatoriu,

40057
30:41:14,400 --> 30:41:21,280
s-ar putea să ai ghinion și s-ar putea să nu

40058
30:41:17,912 --> 30:41:22,960
se poticnește în cele mai bune. Tu poți face

40059
30:41:21,280 --> 30:41:25,760
eșantioane și află care este

40060
30:41:22,960 --> 30:41:27,680
cel mai bun dintre mostrele tale, dar poți

40061
30:41:25,760 --> 30:41:29,680
nu acoperă toate combinațiile.

40062
30:41:27,680 --> 30:41:32,720
Are sens? Căutarea în grilă este

40063
30:41:29,680 --> 30:41:35,280
o să încerc fiecare combo. Aleatoriu

40064
30:41:32,720 --> 30:41:36,800
căutarea le va eșantiona aleatoriu

40065
30:41:35,280 --> 30:41:38,552
combo-uri.

40066
30:41:36,800 --> 30:41:40,480
Deci, nu va încerca fiecare

40067
30:41:38,552 --> 30:41:43,192
unul. Va încerca un număr limitat,

40068
30:41:40,480 --> 30:41:46,160
oricât de multe ai configura. Acum, dacă ai setat

40069
30:41:43,192 --> 30:41:47,832
acest număr foarte, foarte, foarte mare,

40070
30:41:46,160 --> 30:41:50,640
acum începi să te apropii de o grilă

40071
30:41:47,832 --> 30:41:52,640
caută pentru că acum eșantionezi așa

40072
30:41:50,640 --> 30:41:56,552
multe dintre acele combo-uri pe care le ai practic

40073
30:41:52,640 --> 30:41:58,000
le încerc pe toate în acel moment,

40074
30:41:56,552 --> 30:42:00,640
nu?

40075
30:41:58,000 --> 30:42:02,640
Hm

40076
30:42:00,640 --> 30:42:04,720
așa că așa este căutarea aleatorie.

40077
30:42:02,640 --> 30:42:07,512
Deci, apropo, ambele folosesc cruce

40078
30:42:04,720 --> 30:42:09,360
validare în sensul că atunci când tu

40079
30:42:07,512 --> 30:42:11,680
evaluează cazarea în care ești de fapt

40080
30:42:09,360 --> 30:42:14,160
făcând-o cu validare încrucișată. Deci când

40081
30:42:11,680 --> 30:42:16,232
faci o evaluare, vei face

40082
30:42:14,160 --> 30:42:19,680
probabil 10 sau cinci ori unde tu

40083
30:42:16,232 --> 30:42:21,912
împărțiți datele și apoi le testați

40084
30:42:19,680 --> 30:42:22,960
restul pliurilor și evaluează sau

40085
30:42:21,912 --> 30:42:24,800
antrenează-l pe restul pliurilor,

40086
30:42:22,960 --> 30:42:29,360
evaluează-l pe una dintre ele și generează

40087
30:42:24,800 --> 30:42:31,280
un MSE mediu pentru a obține evaluarea dvs.

40088
30:42:29,360 --> 30:42:34,480
Deci, fiecare evaluare folosește cruce

40089
30:42:31,280 --> 30:42:35,912
validare. De aceea este și

40090
30:42:34,480 --> 30:42:38,160
sper că puteți vedea de ce ar fi asta

40091
30:42:35,912 --> 30:42:40,320
atât de scump pentru o rețea foarte mare,

40092
30:42:38,160 --> 30:42:42,232
nu? pentru că încerci multe

40093
30:42:40,320 --> 30:42:44,552
diferite combinații

40094
30:42:42,232 --> 30:42:47,192
și fiecare combinație va face a

40095
30:42:44,552 --> 30:42:50,320
procedura de validare încrucișată. Deci, este

40096
30:42:47,192 --> 30:42:52,232
mergi să mă antrenez de 10 ori și să testezi împotriva

40097
30:42:50,320 --> 30:42:53,592
10 pliuri diferite și medii ale acestora

40098
30:42:52,232 --> 30:42:55,832
împreună. Va fi frumos

40099
30:42:53,592 --> 30:42:58,480
operare costisitoare

40100
30:42:55,832 --> 30:43:00,000
pentru o grilă foarte mare, corect, de

40101
30:42:58,480 --> 30:43:01,760
parametrii.

40102
30:43:00,000 --> 30:43:04,800
Hm, dar acestea sunt cele două tipuri de

40103
30:43:01,760 --> 30:43:07,592
abordări sistematice pe care le avem la încercare

40104
30:43:04,800 --> 30:43:08,800
scoateți diferiți hiperparametri. Ține minte

40105
30:43:07,592 --> 30:43:11,280
acele lucruri se numesc

40106
30:43:08,800 --> 30:43:14,552
hiperparametrii. Acestea sunt alegerile

40107
30:43:11,280 --> 30:43:17,192
pe care le avem înainte de a ne antrena modelul.

40108
30:43:14,552 --> 30:43:18,480
Hm acele alegeri pe care le avem care afectează

40109
30:43:17,192 --> 30:43:20,640
performanța modelului ca

40110
30:43:18,480 --> 30:43:23,440
alfa, rapoartele L1, genul ăsta de

40111
30:43:20,640 --> 30:43:24,720
lucruri. Avem control asupra ce

40112
30:43:23,440 --> 30:43:26,960
vor fi. Acesta este un

40113
30:43:24,720 --> 30:43:29,040
abordare sistematică pentru a afla ce

40114
30:43:26,960 --> 30:43:31,512
cel mai bun

40115
30:43:29,040 --> 30:43:34,000
uh valoarea acelor parametri va ajunge

40116
30:43:31,512 --> 30:43:37,000
fiți pe datele noastre,

40117
30:43:34,000 --> 30:43:37,000
nu?

40118
30:43:37,592 --> 30:43:42,480
Bine. Deci, înainte de a practica asta, suntem

40119
30:43:40,000 --> 30:43:44,080
mergi să exersezi mai întâi o căutare în grilă.

40120
30:43:42,480 --> 30:43:47,400
um,

40121
30:43:44,080 --> 30:43:47,400
orice intrebari?

40122
30:43:54,232 --> 30:43:57,832
Nu știu dacă are încorporat

40123
30:43:56,080 --> 30:43:59,120
E o întrebare bună. prin limita de timp. eu

40124
30:43:57,832 --> 30:44:00,872
nu stiu daca are un mod incorporat de

40125
30:43:59,120 --> 30:44:05,832
făcând-o, dar cu siguranță ai putea configura

40126
30:44:00,872 --> 30:44:07,192
ca o buclă um să-ți placă să înfășoare

40127
30:44:05,832 --> 30:44:08,720
în jur, știi ce vreau să spun? Ca tine

40128
30:44:07,192 --> 30:44:11,760
ar putea configura o buclă în care să verificați

40129
30:44:08,720 --> 30:44:12,872
timp. Dacă este dacă dacă timpul s-a scurs ca

40130
30:44:11,760 --> 30:44:15,760
tu faci căutarea, dacă e timpul

40131
30:44:12,872 --> 30:44:18,480
scurs este mai mare decât timpul

40132
30:44:15,760 --> 30:44:20,640
limită, atunci puteți să vă întrerupeți mai devreme.

40133
30:44:18,480 --> 30:44:22,160
Deci nu este greu să implementezi asta,

40134
30:44:20,640 --> 30:44:25,120
dar nu stiu daca are asa construit

40135
30:44:22,160 --> 30:44:26,400
în. Nu cred că are

40136
30:44:25,120 --> 30:44:29,040
pentru că nu cred că îi pasă cu adevărat

40137
30:44:26,400 --> 30:44:30,720
cât durează fiecare evaluare. Sale

40138
30:44:29,040 --> 30:44:33,280
doar o să le epuizez pe toate

40139
30:44:30,720 --> 30:44:36,640
mai ales într-o căutare în grilă.

40140
30:44:33,280 --> 30:44:38,960
Dar da, probabil că există o cale

40141
30:44:36,640 --> 30:44:41,960
setați manual un timp de timp

40142
30:44:38,960 --> 30:44:41,960
buclă.

40143
30:44:44,960 --> 30:44:52,232
Deci hiperparametrii sunt setări care

40144
30:44:49,120 --> 30:44:53,832
avem pe modelul în sine și într-adevăr

40145
30:44:52,232 --> 30:44:56,640
bun exemplu în acest sens este ca alfa

40146
30:44:53,832 --> 30:45:00,800
și raportul L1 în rețeaua elastică.

40147
30:44:56,640 --> 30:45:02,960
Deci nu sunt lucruri pe care noi le învățăm

40148
30:45:00,800 --> 30:45:05,360
din date direct ca beta în

40149
30:45:02,960 --> 30:45:08,720
modelul ca ăia se antrenează

40150
30:45:05,360 --> 30:45:11,592
direct făcând um pătrate de închiriere

40151
30:45:08,720 --> 30:45:14,080
procesează corect, făcând acel gradient

40152
30:45:11,592 --> 30:45:16,960
coborâre și toată optimizarea aia.

40153
30:45:14,080 --> 30:45:19,280
Deci astea nu se învață din asta.

40154
30:45:16,960 --> 30:45:21,512
Sunt de fapt setate din timp. Şi

40155
30:45:19,280 --> 30:45:23,592
deci ceea ce spunem este

40156
30:45:21,512 --> 30:45:25,440
cel mai bun mod de a înțelege efectele

40157
30:45:23,592 --> 30:45:27,440
dintre acestea este să încerce diferite

40158
30:45:25,440 --> 30:45:30,232
combinații ale acestora până când aterizăm

40159
30:45:27,440 --> 30:45:32,720
cel mai bun. Corect? Deci hiperparametri

40160
30:45:30,232 --> 30:45:35,360
sunt acele optiuni pe care le avem in model

40161
30:45:32,720 --> 30:45:40,232
ca alfa ca alfa și l1

40162
30:45:35,360 --> 30:45:42,552
raportul în rețeaua elastică. Multe modele

40163
30:45:40,232 --> 30:45:44,720
au hiperparametri. De fapt, suntem

40164
30:45:42,552 --> 30:45:46,552
voi vedea asta în modelele viitoare

40165
30:45:44,720 --> 30:45:48,000
că studiem. au opțiuni care

40166
30:45:46,552 --> 30:45:49,760
puteți seta care să le afecteze

40167
30:45:48,000 --> 30:45:52,080
performanta.

40168
30:45:49,760 --> 30:45:53,912
Și, deci, aceasta este doar o strategie

40169
30:45:52,080 --> 30:45:57,640
evalua acele opțiuni diferite pentru a vedea

40170
30:45:53,912 --> 30:45:57,640
care este cel mai bun.

40171
30:46:05,760 --> 30:46:12,720
Da. Deci din nou, hiperparametrii, aceia

40172
30:46:08,320 --> 30:46:16,552
sunt setări pe modelul în sine, asta

40173
30:46:12,720 --> 30:46:16,552
afectează performanța acestuia.

40174
30:46:16,720 --> 30:46:20,480
Și, practic, le avem pe cele două

40175
30:46:18,400 --> 30:46:22,000
strategii aici. Putem configura un

40176
30:46:20,480 --> 30:46:24,800
grilă exhaustivă și căutați prin toate

40177
30:46:22,000 --> 30:46:28,640
dintre acestea până când găsim cel mai mic MSE uh

40178
30:46:24,800 --> 30:46:30,400
opțiune sau putem eșantiona aleatoriu

40179
30:46:28,640 --> 30:46:32,480
posibile opțiuni, încercați-le și vedeți

40180
30:46:30,400 --> 30:46:37,120
care este și cel mai jos. Și fă

40181
30:46:32,480 --> 30:46:38,800
că un număr fix de ori. Hm

40182
30:46:37,120 --> 30:46:42,400
un fel de număr fix de încercări

40183
30:46:38,800 --> 30:46:44,320
aproape. um care are riscul de a nu

40184
30:46:42,400 --> 30:46:46,960
încercând fiecare opțiune dar dar

40185
30:46:44,320 --> 30:46:49,280
sper să încerci suficient cât ai făcut

40186
30:46:46,960 --> 30:46:52,320
ai explorat puțin spațiul și obții

40187
30:46:49,280 --> 30:46:54,160
unele alegeri de calitate acolo, dar nu

40188
30:46:52,320 --> 30:46:55,912
garanții corecte, nicio garanție că încercați

40189
30:46:54,160 --> 30:46:59,720
tot ceea ce este o căutare în grilă

40190
30:46:55,912 --> 30:46:59,720
o va face voi încerca totul

40191
30:47:01,120 --> 30:47:08,872
bine acum, din fericire, conform scikitlearn obișnuit

40192
30:47:06,320 --> 30:47:13,512
are pentru ce să gestioneze acest proces

40193
30:47:08,872 --> 30:47:16,480
noi în ceea ce privește căutarea în grilă. Um asa in

40194
30:47:13,512 --> 30:47:18,000
astfel nu va trebui să gestionăm asta

40195
30:47:16,480 --> 30:47:20,320
ne procesăm pe noi înșine. Ne putem baza doar pe

40196
30:47:18,000 --> 30:47:23,040
scikitlearn. Și așa dacă faci

40197
30:47:20,320 --> 30:47:25,832
reglarea hiperparametrului asta se întâmplă

40198
30:47:23,040 --> 30:47:28,232
să provină din modulul de selecție a modelului

40199
30:47:25,832 --> 30:47:30,080
în interiorul sklearn. Deci vom merge

40200
30:47:28,232 --> 30:47:32,720
import de la skarn modelul

40201
30:47:30,080 --> 30:47:35,680
modul de selecție. Avem grila noastră

40202
30:47:32,720 --> 30:47:37,680
validarea încrucișată a căutării.

40203
30:47:35,680 --> 30:47:40,320
Bine. Asta înseamnă CV-ul.

40204
30:47:37,680 --> 30:47:41,440
validarea încrucișată a căutării în grilă. Deci, asta

40205
30:47:40,320 --> 30:47:43,912
va face acea căutare în grilă

40206
30:47:41,440 --> 30:47:46,480
strategie. Um, o să o punem la punct

40207
30:47:43,912 --> 30:47:48,080
cu dicționarul nostru în esență de

40208
30:47:46,480 --> 30:47:49,592
alegeri. Deci, vom spune, hei,

40209
30:47:48,080 --> 30:47:52,400
iată alfa pe care vreau să le încerc. Iată

40210
30:47:49,592 --> 30:47:55,760
rapoartele L1 pe care vreau să le încerc. Hm, și

40211
30:47:52,400 --> 30:47:57,680
iată celelalte setări ale mele, cum ar fi uh cum

40212
30:47:55,760 --> 30:47:59,360
multe pliuri pe care vreau să le folosesc, ceea ce la întâmplare

40213
30:47:57,680 --> 30:48:02,552
starea este pentru amestecare. Deci, vom face

40214
30:47:59,360 --> 30:48:04,480
pune la punct toate astea. um,

40215
30:48:02,552 --> 30:48:06,720
și apoi vom rula căutarea în grilă.

40216
30:48:04,480 --> 30:48:09,120
Și atunci ceea ce ar trebui să iasă din asta este

40217
30:48:06,720 --> 30:48:11,280
cele mai bune opțiuni pentru parametrii noștri de la

40218
30:48:09,120 --> 30:48:13,680
grila. Și apoi le putem folosi

40219
30:48:11,280 --> 30:48:16,720
mergând mai departe în putem construi a

40220
30:48:13,680 --> 30:48:19,512
model cu cele mai bune opțiuni, nu? Deci

40221
30:48:16,720 --> 30:48:20,872
chiar facem o evaluare aici

40222
30:48:19,512 --> 30:48:23,592
a ceea ce vor fi cele mai bune

40223
30:48:20,872 --> 30:48:26,232
alfa, cele mai bune1 rapoarte din datele noastre

40224
30:48:23,592 --> 30:48:28,400
setat, nu? Și singura modalitate de a face cu adevărat

40225
30:48:26,232 --> 30:48:30,320
știi că este să le evaluezi pentru că

40226
30:48:28,400 --> 30:48:32,080
nu sunt lucruri care se învață

40227
30:48:30,320 --> 30:48:33,832
în timpul antrenamentului. Să sperăm că

40228
30:48:32,080 --> 30:48:36,320
are sens, nu? Nu sunt lucruri

40229
30:48:33,832 --> 30:48:38,160
că învăţăm direct din antrenament.

40230
30:48:36,320 --> 30:48:39,912
Sunt lucruri pe care trebuie să le stabilim și

40231
30:48:38,160 --> 30:48:43,320
apoi evaluează și vezi cum

40232
30:48:39,912 --> 30:48:43,320
afectează lucrurile.

40233
30:48:43,760 --> 30:48:49,120
Bine. Deci, avem un CV de căutare în grilă. Asta e

40234
30:48:45,832 --> 30:48:50,800
va fi instrumentul nostru principal de făcut

40235
30:48:49,120 --> 30:48:53,192
evaluările diferitelor

40236
30:48:50,800 --> 30:48:56,080
opțiunile de hiperparametri.

40237
30:48:53,192 --> 30:48:59,832
CV-ul de căutare în grilă. Um, ne vom instala

40238
30:48:56,080 --> 30:49:01,440
obiectul nostru de validare încrucișată aici. Acum

40239
30:48:59,832 --> 30:49:04,160
Vreau să fii atent la asta

40240
30:49:01,440 --> 30:49:06,232
că um este puțin diferit

40241
30:49:04,160 --> 30:49:08,080
versiune decât kfold pe care o aveam mai devreme.

40242
30:49:06,232 --> 30:49:09,592
Deci am folosit kfold înainte cu a

40243
30:49:08,080 --> 30:49:12,232
un anumit număr de pliuri. Asta ar fi

40244
30:49:09,592 --> 30:49:14,720
10 ori și putem seta o stare aleatorie

40245
30:49:12,232 --> 30:49:16,232
pentru amestecul um care se întâmplă în

40246
30:49:14,720 --> 30:49:17,680
pliuri.

40247
30:49:16,232 --> 30:49:19,912
Dar aceasta este de fapt un pic diferit

40248
30:49:17,680 --> 30:49:23,680
variație pe ea unde se repetă

40249
30:49:19,912 --> 30:49:26,872
kfold unde facem trei încercări repetate.

40250
30:49:23,680 --> 30:49:29,680
Acum de ce am face asta? Trebuie să fie

40251
30:49:26,872 --> 30:49:31,280
extra extra foarte atent cu

40252
30:49:29,680 --> 30:49:33,120
amestecând.

40253
30:49:31,280 --> 30:49:36,640
Deci asta înseamnă că facem trei

40254
30:49:33,120 --> 30:49:38,232
amestecuri diferite. Deci facem k-fold, noi

40255
30:49:36,640 --> 30:49:39,760
repeta de fapt de trei ori cu

40256
30:49:38,232 --> 30:49:43,192
trei amestecuri diferite. Asta-i tot

40257
30:49:39,760 --> 30:49:46,320
asta înseamnă. Deci k-fold repetat este

40258
30:49:43,192 --> 30:49:49,912
de fapt, puțin dincolo de baza

40259
30:49:46,320 --> 30:49:52,720
kfold. Ce va face kfold de bază va

40260
30:49:49,912 --> 30:49:54,960
ne vom amesteca și apoi ne vom despărți

40261
30:49:52,720 --> 30:49:57,360
în 10 împărțiri și apoi antrenează-te pe nouă dintre

40262
30:49:54,960 --> 30:49:59,760
acelea. testați pe celălalt și rotiți

40263
30:49:57,360 --> 30:50:02,080
prin toate despărțirile.

40264
30:49:59,760 --> 30:50:04,232
De fapt, vom face acest proces

40265
30:50:02,080 --> 30:50:06,872
de trei ori diferite cu trei

40266
30:50:04,232 --> 30:50:09,512
amestecuri diferite. Deci asta și noi suntem

40267
30:50:06,872 --> 30:50:13,280
mergând la o medie de 30 de rezultate în loc de

40268
30:50:09,512 --> 30:50:16,000
doar 10. Deci kfold repetat tocmai merge

40269
30:50:13,280 --> 30:50:18,080
ab deasupra si dincolo de a face in plus pentru

40270
30:50:16,000 --> 30:50:19,760
repetați kfoldul de trei ori diferite.

40271
30:50:18,080 --> 30:50:21,512
În acest caz, doar trei. Am putea face

40272
30:50:19,760 --> 30:50:24,960
mai mult.

40273
30:50:21,512 --> 30:50:27,832
Dar acum este necesar de făcut? tu

40274
30:50:24,960 --> 30:50:30,640
ar putea argumenta nu neapărat. Hm, dar asta

40275
30:50:27,832 --> 30:50:33,680
oferă doar un plus de robustețe

40276
30:50:30,640 --> 30:50:36,000
dincolo de simpla noastră amestecare și

40277
30:50:33,680 --> 30:50:37,912
apoi împărțirea și apoi rotirea celor

40278
30:50:36,000 --> 30:50:40,640
pliuri. Corect? O facem de fapt

40279
30:50:37,912 --> 30:50:43,280
trei amestecuri diferite. Hm, deci suntem

40280
30:50:40,640 --> 30:50:45,360
repetându-ne kfoldul de trei ori uh pt

40281
30:50:43,280 --> 30:50:48,000
de fiecare dată este lucrul pe care îl facem

40282
30:50:45,360 --> 30:50:49,440
asta pentru fiecare evaluare. Așa este

40283
30:50:48,000 --> 30:50:52,760
va fi mai scump decât doar o

40284
30:50:49,440 --> 30:50:52,760
kfold de bază.

40285
30:51:06,000 --> 30:51:12,000
Deci avem trei teste diferite de K-fold

40286
30:51:08,720 --> 30:51:13,832
ceea ce facem în esență.

40287
30:51:12,000 --> 30:51:15,592
Bine, sper că are sens. Aceasta

40288
30:51:13,832 --> 30:51:16,720
este pliul K repetat. Nu am făcut-o

40289
30:51:15,592 --> 30:51:19,120
chiar am văzut asta înainte. Avem doar

40290
30:51:16,720 --> 30:51:21,912
a lucrat cu Kfold, care ar primi

40291
30:51:19,120 --> 30:51:24,320
scăpa de această opțiune de repetă și doar au

40292
30:51:21,912 --> 30:51:26,480
uh 10 împărțiri într-o stare aleatorie pentru

40293
30:51:24,320 --> 30:51:29,360
pentru singura amestecare pe care o facem. Deci noi

40294
30:51:26,480 --> 30:51:32,080
pot recrea aceeași amestecare fiecare

40295
30:51:29,360 --> 30:51:34,640
timp. Hm, dar acum chiar o vom face

40296
30:51:32,080 --> 30:51:37,440
fă trei amestecări aleatorii, trei

40297
30:51:34,640 --> 30:51:38,800
diferite încercări. Deci o amestecare creează

40298
30:51:37,440 --> 30:51:40,872
și apoi creați cele 10 împărțiri,

40299
30:51:38,800 --> 30:51:44,800
evaluați, apoi întoarceți-vă și faceți altul

40300
30:51:40,872 --> 30:51:48,232
amestecare, alte 10 împărțiri noi. Deci, unul

40301
30:51:44,800 --> 30:51:50,232
lucru care ar trebui să fie clar este că noi

40302
30:51:48,232 --> 30:51:52,800
obține diferite împărțiri de fiecare dată pentru că

40303
30:51:50,232 --> 30:51:54,552
o să amestecăm o dată, nu?

40304
30:51:52,800 --> 30:51:56,640
Vom amesteca o dată și vom genera

40305
30:51:54,552 --> 30:51:58,480
despărțirile noastre

40306
30:51:56,640 --> 30:52:00,000
și apoi vom amesteca din nou,

40307
30:51:58,480 --> 30:52:01,912
generează aceste divizări care urmează să

40308
30:52:00,000 --> 30:52:04,080
fi diferit și apoi amestecă încă unul

40309
30:52:01,912 --> 30:52:06,720
timp pentru trei timpi diferite,

40310
30:52:04,080 --> 30:52:08,552
nu? Și apoi obține aceste împărțiri și

40311
30:52:06,720 --> 30:52:11,040
atunci vom obține 10 metrici aici,

40312
30:52:08,552 --> 30:52:14,320
10 metrici aici, 10 metrici aici și

40313
30:52:11,040 --> 30:52:17,912
apoi media toate acestea împreună.

40314
30:52:14,320 --> 30:52:22,872
Deci, este puțin mai mult decât să urce în plus

40315
30:52:17,912 --> 30:52:24,960
deasupra și dincolo pentru un kfold. Bine.

40316
30:52:22,872 --> 30:52:28,800
În regulă. Deci, aici vine distracția

40317
30:52:24,960 --> 30:52:30,872
când faci căutare în grilă. Acum, grila

40318
30:52:28,800 --> 30:52:34,480
este de fapt doar un dicționar. Este o

40319
30:52:30,872 --> 30:52:36,080
Dicționar Python unde declari ce

40320
30:52:34,480 --> 30:52:39,040
parametrii tăi vor fi în interior

40321
30:52:36,080 --> 30:52:42,160
dicționarul și ați configurat o serie de

40322
30:52:39,040 --> 30:52:44,800
valorile pe care le duci sau o listă. Se poate

40323
30:52:42,160 --> 30:52:47,760
fi o listă. Poate fi o gamă

40324
30:52:44,800 --> 30:52:50,080
ci o declarație a ceea ce ești

40325
30:52:47,760 --> 30:52:52,872
merg să testeze și să evalueze în interiorul

40326
30:52:50,080 --> 30:52:55,912
căutarea dvs. în grilă. Deci grila este

40327
30:52:52,872 --> 30:52:58,080
inițializat ca un dicționar gol.

40328
30:52:55,912 --> 30:53:00,480
Și atunci ceea ce facem este să spunem bine în mine

40329
30:52:58,080 --> 30:53:02,640
grilă Vreau să verific diferite alfa.

40330
30:53:00,480 --> 30:53:06,080
Deci vom adăuga o colecție de

40331
30:53:02,640 --> 30:53:10,480
alfa aici pe care le vom testa.

40332
30:53:06,080 --> 30:53:16,232
Așa că lasă-mă să fac un comentariu acolo. Adăugăm un

40333
30:53:10,480 --> 30:53:20,400
adăugați o serie de alfa pentru a testa. Și asta

40334
30:53:16,232 --> 30:53:23,440
intervalul este un acesta este la fel ca Python

40335
30:53:20,400 --> 30:53:26,960
interval. Hm

40336
30:53:23,440 --> 30:53:29,832
asta este la fel ca o gamă Python um uh

40337
30:53:26,960 --> 30:53:34,160
operator aici unde va fi aceasta

40338
30:53:29,832 --> 30:53:37,832
uh, de fiecare dată, așa că va fi fiecare

40339
30:53:34,160 --> 30:53:43,760
uh valoare între

40340
30:53:37,832 --> 30:53:45,360
zero și unu um uh pași cu un pas

40341
30:53:43,760 --> 30:53:49,680
dimensiune

40342
30:53:45,360 --> 30:53:53,280
de 0,1. Deci o să încerce o grămadă de

40343
30:53:49,680 --> 30:53:54,872
alfe diferite între uh zero și

40344
30:53:53,280 --> 30:53:57,040
0,1

40345
30:53:54,872 --> 30:53:59,040
scuze 0 și un pas cu 0.1. Deci este

40346
30:53:57,040 --> 30:54:02,480
mergând să încerce zero.1

40347
30:53:59,040 --> 30:54:04,400
2.3 punctul 4.5 6 până la

40348
30:54:02,480 --> 30:54:06,000
unul.

40349
30:54:04,400 --> 30:54:08,080
Deci asta va face și este a

40350
30:54:06,000 --> 30:54:11,360
interval numpy. Deci sunt doar toate acestea

40351
30:54:08,080 --> 30:54:14,080
zecimale între 0 și unu.

40352
30:54:11,360 --> 30:54:16,552
Puteți folosi oricare dintre acestea este valid.

40353
30:54:14,080 --> 30:54:18,800
Da, poți să faci asta

40354
30:54:16,552 --> 30:54:21,912
creați un dicționar sau puteți utiliza

40355
30:54:18,800 --> 30:54:25,440
cuvânt cheie um dict. Puteți folosi oricare dintre ele.

40356
30:54:21,912 --> 30:54:26,960
Oricare funcționează.

40357
30:54:25,440 --> 30:54:29,512
Indiferent ce vrei să folosești.

40358
30:54:26,960 --> 30:54:33,040
Sunt la fel.

40359
30:54:29,512 --> 30:54:37,120
Da. Motivul pentru care oamenii preferă

40360
30:54:33,040 --> 30:54:39,760
dicționarul este pentru că um seturile sunt

40361
30:54:37,120 --> 30:54:41,680
creat cu aceleași bretele.

40362
30:54:39,760 --> 30:54:43,832
Deci, arată clar ce ești

40363
30:54:41,680 --> 30:54:46,232
creând ca dicționar. Dacă utilizați dacă

40364
30:54:43,832 --> 30:54:48,552
folosesti asta, acesta este singurul avantaj

40365
30:54:46,232 --> 30:54:50,720
este pur și simplu evident ceea ce ești

40366
30:54:48,552 --> 30:54:54,000
realizarea. Pentru că tehnic poți

40367
30:54:50,720 --> 30:54:57,000
face un set cu bretele ca

40368
30:54:54,000 --> 30:54:57,000
bine.

40369
30:54:59,120 --> 30:55:05,040
Da,

40370
30:55:02,000 --> 30:55:07,592
nu vă faceți griji. Bine, deci avem al nostru

40371
30:55:05,040 --> 30:55:09,120
alfa aici. Deci ce vreau să faci

40372
30:55:07,592 --> 30:55:12,080
observația este că vom încerca

40373
30:55:09,120 --> 30:55:13,912
alfa diferite și suntem asta este

40374
30:55:12,080 --> 30:55:16,160
singurul parametru pe care vom încerca

40375
30:55:13,912 --> 30:55:18,552
regresia noastră de creastă. Deci vom merge

40376
30:55:16,160 --> 30:55:21,440
vom încerca Ridge, dar încercați

40377
30:55:18,552 --> 30:55:24,400
alfa diferite în acest interval um

40378
30:55:21,440 --> 30:55:27,512
în căutarea noastră în grilă. Deci căutarea în grilă

40379
30:55:24,400 --> 30:55:29,040
CV-ul preia un model. Ia în nostru

40380
30:55:27,512 --> 30:55:30,800
dicționar grid care este într-adevăr

40381
30:55:29,040 --> 30:55:34,000
critică. Avem nevoie de acel dicționar

40382
30:55:30,800 --> 30:55:36,872
declarăm ce vom încerca.

40383
30:55:34,000 --> 30:55:39,760
um avem nevoie de un punctaj de spus pentru a găsi

40384
30:55:36,872 --> 30:55:42,640
cel mai bun. Acum amintiți-vă că folosește negativul

40385
30:55:39,760 --> 30:55:46,160
pentru a găsi cel mai jos care va fi

40386
30:55:42,640 --> 30:55:49,680
cea mai puțin negativă opțiune.

40387
30:55:46,160 --> 30:55:51,192
Altfel nu s-ar baza doar

40388
30:55:49,680 --> 30:55:54,320
asupra optimizării pe care ar căuta-o

40389
30:55:51,192 --> 30:55:56,000
cea mai mare valoare. Um deci cel mai înalt

40390
30:55:54,320 --> 30:55:59,360
ar fi cel mai aproape de zero în acest sens

40391
30:55:56,000 --> 30:56:02,000
situatie. Hm, deci folosim negativ și

40392
30:55:59,360 --> 30:56:05,760
din nou am putea folosi eroarea pătrată. Este

40393
30:56:02,000 --> 30:56:09,360
folosind absolut. Am putea folosi um pătrat

40394
30:56:05,760 --> 30:56:11,360
uh, fie unul funcționează.

40395
30:56:09,360 --> 30:56:15,440
Mai tipic ar fi probabil

40396
30:56:11,360 --> 30:56:17,280
eroare pătrată, dar absolut este bine.

40397
30:56:15,440 --> 30:56:20,320
Aici avem kfoldul nostru repetat.

40398
30:56:17,280 --> 30:56:22,960
Așa că transmitem în um nostru cum facem CV-ul.

40399
30:56:20,320 --> 30:56:24,160
Poate fi un obiect kfold. Ea

40400
30:56:22,960 --> 30:56:26,872
poate fi de fapt doar un număr întreg, care

40401
30:56:24,160 --> 30:56:29,912
este să spunem că vreau doar să fac 10 împărțiri sau

40402
30:56:26,872 --> 30:56:32,080
cinci împărțiri um to a face fiecare

40403
30:56:29,912 --> 30:56:33,680
evaluarea. Dar acestea sunt cele goale

40404
30:56:32,080 --> 30:56:37,360
minim de care aveți nevoie cu adevărat

40405
30:56:33,680 --> 30:56:39,280
modelul și grila și CV-ul dvs. Hm ce

40406
30:56:37,360 --> 30:56:41,440
metrica pe care o utilizați pentru a evalua ce este

40407
30:56:39,280 --> 30:56:43,360
va fi cel mai bun. Și apoi acest sfârșit

40408
30:56:41,440 --> 30:56:44,872
locuri de muncă este să paralelizeze. Daca il ai

40409
30:56:43,360 --> 30:56:46,800
setat la minus unu, va fi

40410
30:56:44,872 --> 30:56:49,192
voi încerca toate opțiunile de grilă în

40411
30:56:46,800 --> 30:56:52,800
paralel. Um, ceea ce este frumos. Merge

40412
30:56:49,192 --> 30:56:57,760
pentru a ajuta la accelerarea căutării generale.

40413
30:56:52,800 --> 30:57:01,760
Bine. Deci, permiteți-mi să notez asta ca n

40414
30:56:57,760 --> 30:57:06,720
locuri de muncă este egal cu minus unu.

40415
30:57:01,760 --> 30:57:08,872
încearcă combo-urile în paralel.

40416
30:57:06,720 --> 30:57:10,800
Deci, în această situație, de fapt nu o facem

40417
30:57:08,872 --> 30:57:12,800
au mai mult de un parametru. Doar noi

40418
30:57:10,800 --> 30:57:14,320
au alfa. Deci suntem cu adevărat doar

40419
30:57:12,800 --> 30:57:16,232
ne va lucra sistematic

40420
30:57:14,320 --> 30:57:19,512
drum prin fiecare alfa și evaluare

40421
30:57:16,232 --> 30:57:22,080
care este cel mai bun drept cu asta.

40422
30:57:19,512 --> 30:57:23,760
Și observați că pentru a utiliza acest lucru

40423
30:57:22,080 --> 30:57:27,040
căutare în grilă, tot ce trebuie să facem este să sunăm

40424
30:57:23,760 --> 30:57:29,680
căutare.potrivire. Deci funcționează cam ca

40425
30:57:27,040 --> 30:57:32,160
orice alt model o face, nu? Este

40426
30:57:29,680 --> 30:57:34,872
căutare grilă.potrivire.

40427
30:57:32,160 --> 30:57:38,720
Și transmitem datele noastre.

40428
30:57:34,872 --> 30:57:40,480
Și noi umm odată ce suntem odată acest tipărit

40429
30:57:38,720 --> 30:57:42,000
după rezultatele, obții rezultate

40430
30:57:40,480 --> 30:57:45,360
obiect

40431
30:57:42,000 --> 30:57:47,592
um care are cel mai bun scor și apoi a

40432
30:57:45,360 --> 30:57:50,160
dicționar cu cei mai buni parametri ai tăi.

40433
30:57:47,592 --> 30:57:52,960
Deci, oricare ar fi fost cel mai bun membru al grilei

40434
30:57:50,160 --> 30:57:56,480
sau membrii grilei, imprimă asta

40435
30:57:52,960 --> 30:57:58,800
și tu poți Deci, pentru că din asta, putem um

40436
30:57:56,480 --> 30:58:03,320
luați cel mai bun alfa al nostru, care este

40437
30:57:58,800 --> 30:58:03,320
hai să confirmăm ce ajunge să fie.

40438
30:58:06,640 --> 30:58:12,760
Hopa! Trebuie să importăm kfold repetat.

40439
30:58:17,592 --> 30:58:21,400
Deci o vom importa.

40440
30:58:24,160 --> 30:58:30,912
Oh, nu am făcut-o. Să facem de la

40441
30:58:27,912 --> 30:58:30,912
sklearn.liniar

40442
30:58:32,480 --> 30:58:39,080
model import ridge.

40443
30:58:36,080 --> 30:58:39,080
Bine.

40444
30:58:44,232 --> 30:58:48,872
Bine. Deci, a finalizat căutarea și

40445
30:58:46,960 --> 30:58:52,400
ceea ce am găsit este că acesta este cel mai bun scor

40446
30:58:48,872 --> 30:58:56,720
este 238 pentru eroarea absolută medie și

40447
30:58:52,400 --> 30:58:59,192
cel mai bun alfa pe care l-am primit a fost 0,9. Deci,

40448
30:58:56,720 --> 30:59:01,512
cel mai bun alfa care a funcționat aici, acela

40449
30:58:59,192 --> 30:59:04,800
care ne-a dat cel mai bun punctaj a fost de fapt

40450
30:59:01,512 --> 30:59:07,592
0,9 ca alfa. Deci ceea ce a făcut este

40451
30:59:04,800 --> 30:59:10,480
a încercat totul între acest interval

40452
30:59:07,592 --> 30:59:13,512
iar 0,9 a fost cel mai bun. Deci s-a încrucișat

40453
30:59:10,480 --> 30:59:15,592
validarea a încercat fiecare combo

40454
30:59:13,512 --> 30:59:17,360
în grila noastră.

40455
30:59:15,592 --> 30:59:20,160
Deci, dacă vrem, am putea imprima

40456
30:59:17,360 --> 30:59:23,832
afară

40457
30:59:20,160 --> 30:59:27,960
tipăriți grila noastră ca să putem vedea

40458
30:59:23,832 --> 30:59:27,960
care au fost combinațiile noastre.

40459
30:59:29,360 --> 30:59:36,440
Deci, i-a încercat pe toți acești tipi și

40460
30:59:32,000 --> 30:59:36,440
cel mai bun pe care l-am avut a fost 0,9.

40461
30:59:40,872 --> 30:59:46,160
Bine, foarte frumos cum funcționează. Şi

40462
30:59:44,000 --> 30:59:48,552
dacă am avea alți parametri, ca dacă am avea

40463
30:59:46,160 --> 30:59:50,160
făceam o plasă elastică, am putea adăuga

40464
30:59:48,552 --> 30:59:53,592
acelea în dicționarul nostru și ar fi

40465
30:59:50,160 --> 30:59:56,160
faceți toate combinațiile dintre acestea. Deci dacă noi

40466
30:59:53,592 --> 30:59:58,720
am făcut-o, de exemplu, pentru a adăuga la noi

40467
30:59:56,160 --> 31:00:01,280
grid am putea face grid

40468
30:59:58,720 --> 31:00:02,800
um raportul L1

40469
31:00:01,280 --> 31:00:04,800
asta ar fi ca o plasă elastică

40470
31:00:02,800 --> 31:00:06,640
chiar acum regresia crestei de la sine

40471
31:00:04,800 --> 31:00:09,592
nu are un parametru de raport L1 dar

40472
31:00:06,640 --> 31:00:11,360
doar ca exemplu, am putea încerca

40473
31:00:09,592 --> 31:00:14,800
game diferite

40474
31:00:11,360 --> 31:00:17,040
um interval similar diferit unul um poate

40475
31:00:14,800 --> 31:00:18,160
o listă exactă a ceea ce vrem să facem. Deci

40476
31:00:17,040 --> 31:00:22,160
aceasta va încerca altele diferite

40477
31:00:18,160 --> 31:00:24,480
intre 0 si unu. Și așa este

40478
31:00:22,160 --> 31:00:27,280
voi încerca fiecare combinație de

40479
31:00:24,480 --> 31:00:29,832
astea din aceasta grila.

40480
31:00:27,280 --> 31:00:32,320
Bine, dacă am făcut asta. Dar din nou, asta

40481
31:00:29,832 --> 31:00:35,912
regresia crestei nu are un L1

40482
31:00:32,320 --> 31:00:38,320
raport. Plasa elastica face. Astfel încât

40483
31:00:35,912 --> 31:00:40,480
Regresia crestei are doar un alfa to to

40484
31:00:38,320 --> 31:00:44,192
ca hiperparametru. Deci suntem doar

40485
31:00:40,480 --> 31:00:44,192
testându-l pe acela.

40486
31:00:45,680 --> 31:00:51,440
Bine, deci acesta este CV-ul de căutare în grilă.

40487
31:00:49,360 --> 31:00:53,192
Destul de util. Acest lucru este destul de util în

40488
31:00:51,440 --> 31:00:55,280
făcând din nou reglajul parametrilor când tu

40489
31:00:53,192 --> 31:00:58,800
doresc să încerce game diferite

40490
31:00:55,280 --> 31:01:01,360
valorile și le puteți evalua pe cele pentru a le vedea

40491
31:00:58,800 --> 31:01:04,080
care este cel mai bun al tău și apoi putem

40492
31:01:01,360 --> 31:01:06,080
folosește cel mai bine în viitor. Deci putem

40493
31:01:04,080 --> 31:01:09,760
de exemplu, asta face acest cod

40494
31:01:06,080 --> 31:01:12,400
dedesubt se află cel mai bun. Um tu

40495
31:01:09,760 --> 31:01:15,040
o poti face in felul acesta sau o poti face um

40496
31:01:12,400 --> 31:01:18,040
alternativa este să faci rezultate.b cel mai bine

40497
31:01:15,040 --> 31:01:18,040
parametrii

40498
31:01:18,640 --> 31:01:23,040
și apoi o poți prinde așa

40499
31:01:21,440 --> 31:01:26,720
alfa.

40500
31:01:23,040 --> 31:01:29,040
În orice caz, puteți obține sau vă place asta

40501
31:01:26,720 --> 31:01:31,120
um și acesta este doar un dicționar,

40502
31:01:29,040 --> 31:01:34,000
nu? Și poți să-ți iei alfa. Deci

40503
31:01:31,120 --> 31:01:36,720
asta este 0,9 um și putem trece de asta

40504
31:01:34,000 --> 31:01:39,440
alfa în regresia crestei și du-te

40505
31:01:36,720 --> 31:01:41,592
înapoi și remontați-l la datele noastre um și

40506
31:01:39,440 --> 31:01:44,320
apoi folosiți acel model în continuare. Deci

40507
31:01:41,592 --> 31:01:46,480
căutarea în grilă doar evaluează

40508
31:01:44,320 --> 31:01:50,720
acele opțiuni diferite, vă spune

40509
31:01:46,480 --> 31:01:52,720
care este cel mai bun după acest scor,

40510
31:01:50,720 --> 31:01:54,320
nu?

40511
31:01:52,720 --> 31:01:56,872
Și ar trebui, apropo, ar trebui

40512
31:01:54,320 --> 31:01:59,280
interpretează acest scor în sens pozitiv

40513
31:01:56,872 --> 31:02:02,320
sens. Este doar negativ pentru că suntem

40514
31:01:59,280 --> 31:02:04,872
făcând intenționat negativ pentru a afla

40515
31:02:02,320 --> 31:02:06,872
care este cea mai mica varianta, nu?

40516
31:02:04,872 --> 31:02:08,800
Pentru că cu cât mai jos este cu atât mai bine. Deci noi

40517
31:02:06,872 --> 31:02:10,800
facem intenționat negativ să o facem

40518
31:02:08,800 --> 31:02:15,592
orice este cel mai puțin negativ este

40519
31:02:10,800 --> 31:02:18,800
învingător. Mai negativ este mai rău.

40520
31:02:15,592 --> 31:02:21,120
Deci este versiunea cu adevărat pozitivă a

40521
31:02:18,800 --> 31:02:24,160
este rezultatul adevărat pentru

40522
31:02:21,120 --> 31:02:26,872
eroare. Hm și sunt un instrument de la

40523
31:02:24,160 --> 31:02:29,040
scikitlearn pentru a vă pune împreună modelul

40524
31:02:26,872 --> 31:02:32,640
cu pașii dvs. de preprocesare. Deci ei

40525
31:02:29,040 --> 31:02:34,640
să se automatizeze împreună. Hm și

40526
31:02:32,640 --> 31:02:36,480
ele combină totul într-un fel de a

40527
31:02:34,640 --> 31:02:38,480
eficientizați procesul. Ai să vezi

40528
31:02:36,480 --> 31:02:42,720
cum arată, dar este cu adevărat

40529
31:02:38,480 --> 31:02:45,192
caracteristică bună a lui scikitlearn. De ce

40530
31:02:42,720 --> 31:02:48,480
ne-ar păsa de conducte? Ei ajută

40531
31:02:45,192 --> 31:02:50,320
organizăm codul nostru, astfel încât să ne asigurăm

40532
31:02:48,480 --> 31:02:52,552
că practic întotdeauna rulăm

40533
31:02:50,320 --> 31:02:56,000
pașii de preprocesare înainte de a ne antrena și

40534
31:02:52,552 --> 31:02:58,000
utilizați un model pentru cu predicțiile. um,

40535
31:02:56,000 --> 31:03:00,720
așa că adună acești pași împreună,

40536
31:02:58,000 --> 31:03:02,000
minimizează riscul de a uita un pas

40537
31:03:00,720 --> 31:03:04,320
pentru că unul dintre lucrurile care pot

40538
31:03:02,000 --> 31:03:05,832
se întâmplă atunci când faci preprocesare, dacă

40539
31:03:04,320 --> 31:03:07,912
o faci pe setul de antrenament, tu

40540
31:03:05,832 --> 31:03:09,440
trebuie să o facă și pe noi date de testare

40541
31:03:07,912 --> 31:03:11,120
când îl pui prin modelul tău

40542
31:03:09,440 --> 31:03:13,760
pentru că modelul tău se antrenează împotriva

40543
31:03:11,120 --> 31:03:15,760
acele date preprocesate.

40544
31:03:13,760 --> 31:03:17,512
Deci pentru a te asigura că niciodată

40545
31:03:15,760 --> 31:03:19,912
uitați asta, le puteți combina pe toate

40546
31:03:17,512 --> 31:03:22,800
împreună într-o conductă care urmează să

40547
31:03:19,912 --> 31:03:25,040
face lucrurile cu adevărat ușor de utilizat

40548
31:03:22,800 --> 31:03:29,360
și și asigurați-vă că acești pași

40549
31:03:25,040 --> 31:03:32,480
se întâmplă într-un mod repetabil. Hm și asta

40550
31:03:29,360 --> 31:03:34,552
face lucrurile mai ușor să implementezi asta

40551
31:03:32,480 --> 31:03:37,680
model la fel pentru că totul este

40552
31:03:34,552 --> 31:03:40,320
împreună într-o singură conductă. Deci în interior

40553
31:03:37,680 --> 31:03:43,280
industria, am văzut asta de multe. Hm

40554
31:03:40,320 --> 31:03:45,592
știi, oamenii își vor face inițiala

40555
31:03:43,280 --> 31:03:47,592
etapele de explorare și modelul inițial

40556
31:03:45,592 --> 31:03:50,552
clădire. Ei nu pot folosi conducte

40557
31:03:47,592 --> 31:03:53,280
imediat, dar pe măsură ce le-au găsit

40558
31:03:50,552 --> 31:03:54,872
model, în general îl vor muta

40559
31:03:53,280 --> 31:03:57,040
o conductă și toți pașii lor în a

40560
31:03:54,872 --> 31:03:58,960
conductă, astfel încât să fie mai ușor de lucrat

40561
31:03:57,040 --> 31:04:02,640
cu um când ești când ești

40562
31:03:58,960 --> 31:04:06,000
desfășurându-l și folosind-o efectiv

40563
31:04:02,640 --> 31:04:07,512
în lumea reală. Um, deci iată ce a

40564
31:04:06,000 --> 31:04:10,480
conducta arată în general ca. Este de la

40565
31:04:07,512 --> 31:04:13,360
scikitlearn. Este acest obiect de conductă.

40566
31:04:10,480 --> 31:04:15,280
Hm, iar conducta este alcătuită din trepte

40567
31:04:13,360 --> 31:04:20,160
că vom vedea că sunt

40568
31:04:15,280 --> 31:04:22,720
diverse um uh practic um feluri de

40569
31:04:20,160 --> 31:04:26,640
preprocesare pe care am mai văzut-o ca o

40570
31:04:22,720 --> 31:04:28,480
scaler sau um completând valorile lipsă.

40571
31:04:26,640 --> 31:04:31,440
Genul ăla de lucruri pe care le putem pune aici

40572
31:04:28,480 --> 31:04:33,120
pașii care este practic o listă. um

40573
31:04:31,440 --> 31:04:34,800
pașii va fi doar o listă de

40574
31:04:33,120 --> 31:04:38,480
funcții scikitlearn pe care le putem aplica

40575
31:04:34,800 --> 31:04:40,160
la date. Unul dintre acestea fiind model. Hm

40576
31:04:38,480 --> 31:04:43,040
și apoi ori de câte ori folosim conducta,

40577
31:04:40,160 --> 31:04:45,760
practic, știi că se va întâmpla

40578
31:04:43,040 --> 31:04:47,760
fi ceva de genul pipeline.fit

40579
31:04:45,760 --> 31:04:50,640
sau conductă.predic.

40580
31:04:47,760 --> 31:04:53,120
Deci conducta se comportă ca un

40581
31:04:50,640 --> 31:04:54,800
model. Doar că va conține multe

40582
31:04:53,120 --> 31:04:56,400
mai mulți pași decât atât ca

40583
31:04:54,800 --> 31:04:59,912
pașii de preprocesare cu care am lucrat

40584
31:04:56,400 --> 31:05:02,000
înainte. Hm, și are și câteva

40585
31:04:59,912 --> 31:05:04,160
capabilități de stocare în cache. Deci poți

40586
31:05:02,000 --> 31:05:06,720
cum ar fi stocarea în cache a unor date

40587
31:05:04,160 --> 31:05:09,440
memorie. Um, așa că dacă reutilizați

40588
31:05:06,720 --> 31:05:11,440
previziunile, merg mai repede.

40589
31:05:09,440 --> 31:05:13,360
Hm, deci există câteva opțiuni pentru asta

40590
31:05:11,440 --> 31:05:15,592
de asemenea. Nu sunt prea îngrijorat de asta la

40591
31:05:13,360 --> 31:05:17,760
această etapă, dar principalul este să meargă

40592
31:05:15,592 --> 31:05:20,480
să ne umplem pașii și apoi

40593
31:05:17,760 --> 31:05:22,320
folosind conducta.

40594
31:05:20,480 --> 31:05:25,440
Bine.

40595
31:05:22,320 --> 31:05:27,120
Um, deci câteva fragmente importante din

40596
31:05:25,440 --> 31:05:28,800
informațiile despre conductă sunt că

40597
31:05:27,120 --> 31:05:31,512
va fi o secvență de date

40598
31:05:28,800 --> 31:05:34,080
transformări care vor avea la

40599
31:05:31,512 --> 31:05:35,592
chiar la capătul conductei modelul

40600
31:05:34,080 --> 31:05:38,800
pentru că bineînțeles că o să facem

40601
31:05:35,592 --> 31:05:43,192
transformări și apoi antrenează un model

40602
31:05:38,800 --> 31:05:46,960
sau prezice cu un model. Deci fiecare

40603
31:05:43,192 --> 31:05:48,320
Oh, mă auziți băieți? bine,

40604
31:05:46,960 --> 31:05:49,760
neputând să mă audă. Mulțumesc că ai permis

40605
31:05:48,320 --> 31:05:53,120
eu stiu. Ați putut băieți

40606
31:05:49,760 --> 31:05:53,120
m-ai auzit pana acum?

40607
31:05:55,120 --> 31:06:00,160
Bine. Asigurați-vă că. Da, poate fi activat

40608
31:05:56,720 --> 31:06:04,400
internetul dvs. sau dvs. uh Da, asta

40609
31:06:00,160 --> 31:06:06,720
pare ca e bine. Deci,

40610
31:06:04,400 --> 31:06:08,480
nu, nu mă auzi. Verificați-vă

40611
31:06:06,720 --> 31:06:11,192
volum. Verifică-ți căștile dacă ești

40612
31:06:08,480 --> 31:06:13,040
purtând căști. Oh, fără probleme. bine,

40613
31:06:11,192 --> 31:06:17,360
perfect.

40614
31:06:13,040 --> 31:06:19,192
Bine. Da, problemă de internet local. Da.

40615
31:06:17,360 --> 31:06:20,400
Bine.

40616
31:06:19,192 --> 31:06:22,552
Anunță-mă mereu. anunta-ma mereu

40617
31:06:20,400 --> 31:06:26,400
pentru că s-ar putea să fie cazul

40618
31:06:22,552 --> 31:06:29,360
eu. Deci, um, întotdeauna asigură-te că

40619
31:06:26,400 --> 31:06:32,960
anunta-ma. Hm, dar sună ca da,

40620
31:06:29,360 --> 31:06:35,440
poate doriți să verificați asta. Hm

40621
31:06:32,960 --> 31:06:37,680
Deci, bine, ceea ce spuneam este fiecare

40622
31:06:35,440 --> 31:06:39,592
conducta va avea un uh a

40623
31:06:37,680 --> 31:06:42,640
succesiune de pași care merg mai întâi și apoi

40624
31:06:39,592 --> 31:06:45,360
modelul de la final. Hăi, ordinul

40625
31:06:42,640 --> 31:06:48,232
chiar contează. Hm

40626
31:06:45,360 --> 31:06:49,832
Deci ordinea contează în acest sens

40627
31:06:48,232 --> 31:06:52,160
că vrem ca transformările noastre să meargă

40628
31:06:49,832 --> 31:06:53,912
mai întâi. Lucruri precum scalarea, lucruri de genul

40629
31:06:52,160 --> 31:06:57,912
completând valorile lipsă, le vrem

40630
31:06:53,912 --> 31:06:59,912
să fim primii și apoi ne dorim

40631
31:06:57,912 --> 31:07:01,832
modelul să fie ultimul pentru că noi le vrem

40632
31:06:59,912 --> 31:07:04,960
transformări care să aibă loc înainte de

40633
31:07:01,832 --> 31:07:06,232
antrenament sau înainte de predicție. Deci

40634
31:07:04,960 --> 31:07:09,120
de obicei, ceea ce veți vedea în acestea

40635
31:07:06,232 --> 31:07:11,592
conductele este un model la sfârșit, nu?

40636
31:07:09,120 --> 31:07:14,480
un model care va fi la sfârșitul

40637
31:07:11,592 --> 31:07:16,552
conducta pentru că dorim practic

40638
31:07:14,480 --> 31:07:18,320
etapele noastre de procesare apoi formarea noastră

40639
31:07:16,552 --> 31:07:22,320
sau etapele de procesare apoi noastre

40640
31:07:18,320 --> 31:07:23,680
previziuni. Hm, deci totul în

40641
31:07:22,320 --> 31:07:26,480
conducta totuși va fi de la

40642
31:07:23,680 --> 31:07:28,160
scikitlearn. Uh, așa se ajunge

40643
31:07:26,480 --> 31:07:29,440
automatizate în sensul că toate acestea

40644
31:07:28,160 --> 31:07:31,440
lucrurile vor fi potrivite şi

40645
31:07:29,440 --> 31:07:34,872
transforma funcțiile încorporate în ele astfel

40646
31:07:31,440 --> 31:07:36,960
conducta le poate folosi. Uh, și apoi

40647
31:07:34,872 --> 31:07:39,360
ultimul pas va fi un model

40648
31:07:36,960 --> 31:07:40,872
care are o potrivire și o previziune. Deci este

40649
31:07:39,360 --> 31:07:41,912
destul de standard că ultima parte a

40650
31:07:40,872 --> 31:07:45,360
conducta va fi doar a

40651
31:07:41,912 --> 31:07:50,720
model. um,

40652
31:07:45,360 --> 31:07:52,080
uh, ca să putem um, pe măsură ce facem mai mult

40653
31:07:50,720 --> 31:07:53,912
modeling, ne vom juca

40654
31:07:52,080 --> 31:07:55,440
cu conductele destul de putin si vezi

40655
31:07:53,912 --> 31:07:57,360
cum putem schimba unele dintre ele

40656
31:07:55,440 --> 31:07:59,592
parametrii. ca daca vrem sa schimbam o

40657
31:07:57,360 --> 31:08:02,160
parametrul modelului um putem de fapt

40658
31:07:59,592 --> 31:08:05,360
Ajustează-l pentru a face lucruri precum uh grid

40659
31:08:02,160 --> 31:08:07,040
căutare sau validare încrucișată. Deci suntem

40660
31:08:05,360 --> 31:08:09,832
merg să văd câteva exemple de unele

40661
31:08:07,040 --> 31:08:11,760
conducte, dar pentru acum mai ales ce

40662
31:08:09,832 --> 31:08:14,400
Vom vedea cum să construim unul

40663
31:08:11,760 --> 31:08:16,720
și apoi cum să folosești unul. Și apoi ca noi

40664
31:08:14,400 --> 31:08:18,160
intră în lecția a patra, vom lua câteva

40665
31:08:16,720 --> 31:08:19,512
mai multă practică cu conductele pentru că

40666
31:08:18,160 --> 31:08:22,480
vom începe să le folosim destul de a

40667
31:08:19,512 --> 31:08:25,592
mai degrabă să ne construim modelele

40668
31:08:22,480 --> 31:08:27,120
faceți pași manuali uh tot manualul

40669
31:08:25,592 --> 31:08:29,192
preprocesare

40670
31:08:27,120 --> 31:08:31,760
și apoi construim un model

40671
31:08:29,192 --> 31:08:35,232
de acolo. Vom include doar totul

40672
31:08:31,760 --> 31:08:35,232
împreună într-o conductă.

40673
31:08:35,280 --> 31:08:39,280
Bine, deci exemplul pe care îl vom face

40674
31:08:36,872 --> 31:08:40,720
este cu această locuință cu ocean

40675
31:08:39,280 --> 31:08:45,360
apropierea. Deci ne-am uitat de fapt

40676
31:08:40,720 --> 31:08:47,912
acest set de date înainte. Deci avem uh

40677
31:08:45,360 --> 31:08:49,912
acest set de date de proximitate oceanului care are

40678
31:08:47,912 --> 31:08:52,080
caracteristica ca cât de aproape este de

40679
31:08:49,912 --> 31:08:54,960
oceanul ca golful sau mai puțin decât

40680
31:08:52,080 --> 31:08:56,552
1 oră. Amintiți-vă că am avut asta și a avut

40681
31:08:54,960 --> 31:08:58,640
valoarea medie a casei pentru diferite

40682
31:08:56,552 --> 31:09:00,400
cartiere. Deci mergem la lucru

40683
31:08:58,640 --> 31:09:04,160
cu aia din nou. Lasă-mă să mă asigur că eu

40684
31:09:00,400 --> 31:09:05,592
ai-l încărcat.

40685
31:09:04,160 --> 31:09:09,872
Ar trebui să aveți asta. Ar trebui

40686
31:09:05,592 --> 31:09:09,872
fi în seturile tale de date.

40687
31:09:10,000 --> 31:09:15,400
O să-l încarc aici în caz că

40688
31:09:11,760 --> 31:09:15,400
totusi nu il ai.

40689
31:09:22,720 --> 31:09:26,480
Acesta folosește multi-threading? cred eu

40690
31:09:24,160 --> 31:09:29,360
o face. Da, cred că pentru a o face

40691
31:09:26,480 --> 31:09:31,680
poate face uh um cred că poate face

40692
31:09:29,360 --> 31:09:35,040
procesare în paralel pentru unele dintre

40693
31:09:31,680 --> 31:09:37,832
trepte de conductă. Hm, acum folosește asta

40694
31:09:35,040 --> 31:09:40,000
tot timpul? Nu neapărat pentru că

40695
31:09:37,832 --> 31:09:41,912
unele dintre ele sunt de natură secvenţială unde

40696
31:09:40,000 --> 31:09:43,280
trebuie să faci un pas și apoi faci

40697
31:09:41,912 --> 31:09:44,800
următorul pas și apoi îl faci pe următorul

40698
31:09:43,280 --> 31:09:46,640
pas. Deci nu e ca și cum le poți face

40699
31:09:44,800 --> 31:09:48,640
în paralel.

40700
31:09:46,640 --> 31:09:50,872
În ceea ce privește lucrurile pe care trebuie să le știi

40701
31:09:48,640 --> 31:09:55,280
ieșirea unui pas pentru a calcula

40702
31:09:50,872 --> 31:09:58,640
rezultatul pasului următor. Um asa e

40703
31:09:55,280 --> 31:10:00,400
poate, dar nu se pretează întotdeauna

40704
31:09:58,640 --> 31:10:03,040
bine. Lucru care va folosi

40705
31:10:00,400 --> 31:10:05,680
multi-threading este ca antrenamentul

40706
31:10:03,040 --> 31:10:08,960
procesul poate fi paralelizat

40707
31:10:05,680 --> 31:10:11,592
cum poate fi um și pentru unii

40708
31:10:08,960 --> 31:10:14,592
modelele pot fi paralelizate nu toate

40709
31:10:11,592 --> 31:10:14,592
model

40710
31:10:15,760 --> 31:10:20,480
ea. Deci răspunsul lung este sau scurt

40711
31:10:18,320 --> 31:10:21,592
raspunsul este ca depinde

40712
31:10:20,480 --> 31:10:22,800
depinde de ce fel de transformări

40713
31:10:21,592 --> 31:10:24,480
faci si ce fel de model

40714
31:10:22,800 --> 31:10:27,960
tu folosești. dacă într-adevăr poți lua

40715
31:10:24,480 --> 31:10:27,960
avantaj de asta.

40716
31:10:31,040 --> 31:10:36,960
Bine, deci încărcăm datele aici și luăm

40717
31:10:33,832 --> 31:10:38,640
o privire la asta. Ai, băieți

40718
31:10:36,960 --> 31:10:40,320
acest set de date? Poți să-l încarci

40719
31:10:38,640 --> 31:10:43,800
in? Dacă te urmărești, ești

40720
31:10:40,320 --> 31:10:43,800
reusesti sa il incarci?

40721
31:10:48,640 --> 31:10:51,760
Bine.

40722
31:10:50,232 --> 31:10:53,680
Și din nou, am lucrat cu asta

40723
31:10:51,760 --> 31:10:56,400
date înainte, așa că sperăm că este oarecum

40724
31:10:53,680 --> 31:10:58,000
familiar. Amintiți-vă, fiecare rând reprezintă

40725
31:10:56,400 --> 31:11:00,160
un cartier, și are un noi mergem

40726
31:10:58,000 --> 31:11:04,160
pentru a ajunge să încerce să prezică această mediană

40727
31:11:00,160 --> 31:11:06,720
valoarea casei ca variabilă țintă,

40728
31:11:04,160 --> 31:11:08,720
variabila noastră dependentă. Hm și suntem

40729
31:11:06,720 --> 31:11:11,760
va folosi restul acestor caracteristici.

40730
31:11:08,720 --> 31:11:13,760
Amintiți-vă că această funcție este inclusă

40731
31:11:11,760 --> 31:11:15,592
special va trebui să fie unul fierbinte

40732
31:11:13,760 --> 31:11:17,440
codificat,

40733
31:11:15,592 --> 31:11:19,760
nu? Va fi unul codificat la cald

40734
31:11:17,440 --> 31:11:22,480
pentru că în prezent este un șir. iar noi

40735
31:11:19,760 --> 31:11:24,080
trebuie să transformi asta într-un număr numeric

40736
31:11:22,480 --> 31:11:26,872
caracteristică care este cea codificată la cald

40737
31:11:24,080 --> 31:11:28,800
caracteristică. Așa că va trebui să facem asta

40738
31:11:26,872 --> 31:11:30,800
dar vom face asta ca parte a

40739
31:11:28,800 --> 31:11:32,232
conducta noastră.

40740
31:11:30,800 --> 31:11:35,120
Bine. Deci vom putea include asta

40741
31:11:32,232 --> 31:11:39,232
în conducta noastră pași uh pentru a face unul

40742
31:11:35,120 --> 31:11:39,232
codificare fierbinte, ceea ce este frumos.

40743
31:11:39,280 --> 31:11:44,232
În regulă. Deci ne vom despărți

40744
31:11:41,120 --> 31:11:48,160
datele noastre sunt așa cum facem în mod normal. Deci suntem

40745
31:11:44,232 --> 31:11:50,080
Vom crea caracteristica noastră, uh datele

40746
31:11:48,160 --> 31:11:52,320
cadru care este totul în afară de asta

40747
31:11:50,080 --> 31:11:54,640
valoarea medie a casei. Așa că mergem înainte și

40748
31:11:52,320 --> 31:11:56,640
aruncați acea coloană și apoi ținta noastră este

40749
31:11:54,640 --> 31:12:00,640
valoarea medie a casei. Deci este doar

40750
31:11:56,640 --> 31:12:03,192
acea coloană de aici. Destul de standard. Hm

40751
31:12:00,640 --> 31:12:07,440
și apoi vom antrena diviziunea de test

40752
31:12:03,192 --> 31:12:10,480
și împărțiți-l în 30%

40753
31:12:07,440 --> 31:12:11,680
uh date de testare. Și din nou arătați la întâmplare

40754
31:12:10,480 --> 31:12:14,640
poți alege orice vrei să fii. că

40755
31:12:11,680 --> 31:12:16,320
afectează doar amestecarea. Um, deci

40756
31:12:14,640 --> 31:12:17,680
orice nu contează cu adevărat ce este

40757
31:12:16,320 --> 31:12:19,832
este. Doar ca atunci când reluați

40758
31:12:17,680 --> 31:12:22,720
asta, obțineți același rezultat în in

40759
31:12:19,832 --> 31:12:27,160
amestecul.

40760
31:12:22,720 --> 31:12:27,160
Bine, deci avem trenul și testul nostru.

40761
31:12:27,512 --> 31:12:32,232
Deci vrei să te asiguri că le conduci.

40762
31:12:30,640 --> 31:12:35,120
Bine, deci ceea ce vom face este

40763
31:12:32,232 --> 31:12:38,800
aruncați o privire la datele noastre

40764
31:12:35,120 --> 31:12:41,120
și vedem dacă avem valori nule. um,

40765
31:12:38,800 --> 31:12:42,640
dacă vă amintiți aceste date cu adevărat

40766
31:12:41,120 --> 31:12:46,000
avea valori nule. O poți vedea

40767
31:12:42,640 --> 31:12:48,960
aici în acest tip acest tip și exact cum

40768
31:12:46,000 --> 31:12:53,760
multe sunt din aceasta suma. Deci

40769
31:12:48,960 --> 31:12:55,360
avem um 162 nles în aceste date. Uh

40770
31:12:53,760 --> 31:12:57,360
și acestea sunt doar date de antrenament. Deci de

40771
31:12:55,360 --> 31:13:00,000
desigur, știți că datele de testare ar putea avea

40772
31:12:57,360 --> 31:13:01,680
că și acolo. Um deci asta e

40773
31:13:00,000 --> 31:13:03,680
ceva ce vom dori să facem

40774
31:13:01,680 --> 31:13:05,192
sigur că completăm spațiile libere pentru orice date

40775
31:13:03,680 --> 31:13:08,000
set pe care îl folosim indiferent dacă folosim

40776
31:13:05,192 --> 31:13:09,512
set de antrenament sau de testare. Um, parcă am fi

40777
31:13:08,000 --> 31:13:10,720
făcând antrenament, vrem să fim siguri

40778
31:13:09,512 --> 31:13:12,552
care se completează. Dacă o facem

40779
31:13:10,720 --> 31:13:16,080
predicții cu setul de testare, vreau să

40780
31:13:12,552 --> 31:13:21,512
asigură-te că se completează. Hm, deci noi

40781
31:13:16,080 --> 31:13:25,040
ar trebui să facem asta. Hm, acum

40782
31:13:21,512 --> 31:13:29,832
ceea ce vom face este să folosim aceste date

40783
31:13:25,040 --> 31:13:31,680
pentru a ne ajuta să ne antrenăm conducta sau să folosim

40784
31:13:29,832 --> 31:13:33,832
cu conducta noastră. Trebuie să construim

40785
31:13:31,680 --> 31:13:36,000
conducta noastră. Până acum, tocmai ne-am despărțit

40786
31:13:33,832 --> 31:13:38,000
în afară de datele noastre. Nu am făcut nimic

40787
31:13:36,000 --> 31:13:42,232
cu pașii noștri de procesare în modelul nostru

40788
31:13:38,000 --> 31:13:43,680
încă. Hm atât de aproximativ

40789
31:13:42,232 --> 31:13:45,592
acesta ar trebui să fie fluxul nostru

40790
31:13:43,680 --> 31:13:47,592
conductă. Ceea ce ar trebui să se întâmple suntem noi

40791
31:13:45,592 --> 31:13:49,120
ar trebui să facă un anumit tip de caracteristică

40792
31:13:47,592 --> 31:13:52,400
scalare

40793
31:13:49,120 --> 31:13:53,760
um, un fel de caracteristică um

40794
31:13:52,400 --> 31:13:57,592
manipulare. Deci asta ar putea fi

40795
31:13:53,760 --> 31:14:01,912
inginerie, asta ar putea fi

40796
31:13:57,592 --> 31:14:03,912
să faci cea mai caldă codificare. Um asa

40797
31:14:01,912 --> 31:14:06,320
extragerea de noi caracteristici ca una fierbinte

40798
31:14:03,912 --> 31:14:09,680
codificare,

40799
31:14:06,320 --> 31:14:11,360
o codificare fierbinte. O să fim

40800
31:14:09,680 --> 31:14:13,912
făcând asta și, apropo, asta este

40801
31:14:11,360 --> 31:14:16,080
împărțit în aceasta este atunci când folosim nostru

40802
31:14:13,912 --> 31:14:17,760
conductă pentru antrenament.

40803
31:14:16,080 --> 31:14:20,320
O să arate așa unde noi

40804
31:14:17,760 --> 31:14:23,512
facem scalarea noastră, facem o codificare fierbinte.

40805
31:14:20,320 --> 31:14:24,800
Avem modelul nostru aici. Um asa ca

40806
31:14:23,512 --> 31:14:26,320
ar putea fi o regresie liniară, asta ar putea

40807
31:14:24,800 --> 31:14:28,400
fi un lasso, asta ar putea fi o creastă, ea

40808
31:14:26,320 --> 31:14:30,720
ar putea fi plasă elastică. Indiferent de modelul nostru

40809
31:14:28,400 --> 31:14:33,440
ajunge să folosești va fi ultimul în

40810
31:14:30,720 --> 31:14:36,000
conductă. Și vom rula asta

40811
31:14:33,440 --> 31:14:39,000
conductă. Până la urmă, o să alergăm

40812
31:14:36,000 --> 31:14:39,000
pipeline.fit,

40813
31:14:40,552 --> 31:14:44,640
nu? Vom face o criză

40814
31:14:41,912 --> 31:14:47,280
funcția. și obținem un model montat ca

40815
31:14:44,640 --> 31:14:50,872
rezultatul acestei conducte.

40816
31:14:47,280 --> 31:14:54,440
Apoi când îl folosim când îl folosim

40817
31:14:50,872 --> 31:14:54,440
model pentru predicție,

40818
31:14:54,960 --> 31:14:59,912
folosim modelul nostru pentru predicție în acest sens

40819
31:14:56,720 --> 31:15:02,232
partea inferioară, este aceeași conductă, aceeași

40820
31:14:59,912 --> 31:15:04,552
conducta exactă, dar acest model are

40821
31:15:02,232 --> 31:15:07,120
acum a fost instruit.

40822
31:15:04,552 --> 31:15:08,960
Deci acum avem un model antrenat aici. Deci

40823
31:15:07,120 --> 31:15:11,120
mare lucru despre conductă este

40824
31:15:08,960 --> 31:15:13,440
este la fel, aceasta este aceeași conductă

40825
31:15:11,120 --> 31:15:15,680
pe care le folosim aici. Deci este doar

40826
31:15:13,440 --> 31:15:17,360
mergând la ea va repeta aceleași

40827
31:15:15,680 --> 31:15:19,280
transformări. O să ne facă

40828
31:15:17,360 --> 31:15:21,912
scalare. O să ne facă fierbinte

40829
31:15:19,280 --> 31:15:23,512
codificare. Va folosi modelul nostru

40830
31:15:21,912 --> 31:15:26,080
și va genera predicții

40831
31:15:23,512 --> 31:15:28,000
și generează uh putem, putem face

40832
31:15:26,080 --> 31:15:30,800
previziuni. Putem face evaluarea ca

40833
31:15:28,000 --> 31:15:34,872
o validare transversală. O putem folosi

40834
31:15:30,800 --> 31:15:37,440
oricum vrem să-l folosim. Dar observă

40835
31:15:34,872 --> 31:15:39,040
că conducta îl face consistent

40836
31:15:37,440 --> 31:15:41,760
între antrenament și test. Noi folosim

40837
31:15:39,040 --> 31:15:44,232
exact aceleasi transformari

40838
31:15:41,760 --> 31:15:46,000
iar modelul este ultimul. Este fie

40839
31:15:44,232 --> 31:15:47,832
fiind instruit sau pentru care este folosit

40840
31:15:46,000 --> 31:15:50,160
predictie dar este ultima. Al nostru

40841
31:15:47,832 --> 31:15:52,000
transformările sunt în faţă care sunt

40842
31:15:50,160 --> 31:15:54,872
lucruri precum scalarea noastră, lucruri precum noastre

40843
31:15:52,000 --> 31:15:57,512
o codificare fierbinte, nu? Acelea se întâmplă

40844
31:15:54,872 --> 31:15:59,440
mai întâi. Indiferent ce date punem

40845
31:15:57,512 --> 31:16:00,800
prin acolo, punem datele noastre de antrenament

40846
31:15:59,440 --> 31:16:02,000
prin acolo, am pus datele noastre de testare

40847
31:16:00,800 --> 31:16:05,360
prin acolo, vor trece

40848
31:16:02,000 --> 31:16:08,320
prin aceiași pași,

40849
31:16:05,360 --> 31:16:09,832
nu?

40850
31:16:08,320 --> 31:16:11,192
Deci acesta este designul

40851
31:16:09,832 --> 31:16:16,320
conductă. Asta ar trebui să facă

40852
31:16:11,192 --> 31:16:18,232
face. Deci treaba noastră este să creăm acești pași.

40853
31:16:16,320 --> 31:16:20,640
Așa că trebuie să le creăm relevante

40854
31:16:18,232 --> 31:16:23,360
pași și apoi pune-le împreună în

40855
31:16:20,640 --> 31:16:24,872
această conductă. Bine, așa se întâmplă

40856
31:16:23,360 --> 31:16:27,192
fie codul pe care îl vom vedea să apară

40857
31:16:24,872 --> 31:16:29,120
vom construi acești pași

40858
31:16:27,192 --> 31:16:32,120
și apoi puneți-le împreună în

40859
31:16:29,120 --> 31:16:32,120
conductă.

40860
31:16:38,640 --> 31:16:42,232
Ai întrebări despre această diagramă? Face

40861
31:16:41,040 --> 31:16:44,160
are sens ceea ce încercăm să facem

40862
31:16:42,232 --> 31:16:46,552
cu conducta asta? Vrem să avem

40863
31:16:44,160 --> 31:16:49,512
pași repetabili în timpul antrenamentului,

40864
31:16:46,552 --> 31:16:52,512
în timpul unui proces de predicție.

40865
31:16:49,512 --> 31:16:52,512
Bine.

40866
31:16:55,832 --> 31:16:58,832
În regulă.

40867
31:17:01,832 --> 31:17:07,592
În regulă. Deci, um, câteva lucruri

40868
31:17:04,720 --> 31:17:09,512
vom avea nevoie este, uh, mai întâi de

40869
31:17:07,592 --> 31:17:11,120
toți, să notăm ce pași suntem

40870
31:17:09,512 --> 31:17:12,720
de fapt o să facă. Vom merge

40871
31:17:11,120 --> 31:17:13,912
trebuie să se ocupe de valorile lipsă. Deci,

40872
31:17:12,720 --> 31:17:16,400
o să completăm vom completa

40873
31:17:13,912 --> 31:17:19,440
nevoie de o etapă de pre-procesare pre-procesare

40874
31:17:16,400 --> 31:17:22,320
care completează orice nles. Avem mereu nevoie

40875
31:17:19,440 --> 31:17:24,640
asta, nu? Deci, dacă există nles, suntem

40876
31:17:22,320 --> 31:17:26,640
o să le completez cumva.

40877
31:17:24,640 --> 31:17:30,400
Vom defini cum facem asta în

40878
31:17:26,640 --> 31:17:33,832
suntem în pasul nostru. Hm, și trebuie și noi

40879
31:17:30,400 --> 31:17:36,160
o codificare fierbinte. Și trebuie să creștem,

40880
31:17:33,832 --> 31:17:37,912
nu? Aceștia sunt pași destul de standard

40881
31:17:36,160 --> 31:17:40,080
cu care ne-am ocupat oricând suntem

40882
31:17:37,912 --> 31:17:42,160
construind aceste modele, nu? Deci, drăguță

40883
31:17:40,080 --> 31:17:44,400
lucruri standard. completați nles unul fierbinte

40884
31:17:42,160 --> 31:17:47,440
codifica orice date categorice

40885
31:17:44,400 --> 31:17:51,120
oricât avem și apoi mergem înainte

40886
31:17:47,440 --> 31:17:53,192
și um standardizați care este scalarea.

40887
31:17:51,120 --> 31:17:56,000
Deci, acesta este doar același cuvânt

40888
31:17:53,192 --> 31:17:59,440
scalarea caracteristicilor noastre numerice. Deci suntem

40889
31:17:56,000 --> 31:18:01,592
pe care le vom defini. Hm

40890
31:17:59,440 --> 31:18:03,360
de aceea vom merge înainte

40891
31:18:01,592 --> 31:18:06,160
și import din preprocesare. Suntem

40892
31:18:03,360 --> 31:18:07,760
vom importa scalatorul nostru. Hm din nou noi

40893
31:18:06,160 --> 31:18:11,280
ar putea folosi minmax scaler aici. Suntem

40894
31:18:07,760 --> 31:18:13,512
va folosi scaler standard. Hm, dar noi

40895
31:18:11,280 --> 31:18:17,760
ar putea folosi minmax. Avem unul nostru

40896
31:18:13,512 --> 31:18:22,320
codificator fierbinte aici. Acum, de obicei, când o facem

40897
31:18:17,760 --> 31:18:26,160
oneh codificare fierbinte folosim manechine pd.get.

40898
31:18:22,320 --> 31:18:27,512
Aceasta face același lucru ca și asta. Dar

40899
31:18:26,160 --> 31:18:29,120
pentru că vom construi o

40900
31:18:27,512 --> 31:18:32,640
conducta ne dorim de fapt

40901
31:18:29,120 --> 31:18:34,640
versiunea scikitlearn a manechinelor git. Deci

40902
31:18:32,640 --> 31:18:37,280
aceasta este versiunea scikitlearn a git

40903
31:18:34,640 --> 31:18:39,760
manechine aici. Și trebuie să-l folosim

40904
31:18:37,280 --> 31:18:41,120
acea versiune în curs de desfăşurare pentru că

40905
31:18:39,760 --> 31:18:43,680
totul în conductă trebuie să fie

40906
31:18:41,120 --> 31:18:46,720
un obiect sklearn. Trebuie să fie un

40907
31:18:43,680 --> 31:18:49,832
instrument sau obiect sklearn.

40908
31:18:46,720 --> 31:18:51,360
Deci, în loc să folosești panda get

40909
31:18:49,832 --> 31:18:55,440
nebunilor, folosim un codificator fierbinte

40910
31:18:51,360 --> 31:18:58,400
care face același lucru. Bine. În

40911
31:18:55,440 --> 31:19:04,120
de fapt, doar asta practic doar folosește

40912
31:18:58,400 --> 31:19:04,120
pd.get dummies um sub capotă.

40913
31:19:04,720 --> 31:19:08,160
Bine. Deci, folosește doar asta. Uh,

40914
31:19:06,552 --> 31:19:10,480
oricum, este doar codul care se bazează pe

40915
31:19:08,160 --> 31:19:12,640
se bazează pe asta.

40916
31:19:10,480 --> 31:19:15,680
Acum, ceea ce este cu adevărat frumos aici este că suntem

40917
31:19:12,640 --> 31:19:17,280
va folosi și de la sklearn.impute,

40918
31:19:15,680 --> 31:19:20,800
vom folosi un simplu imper. Acum,

40919
31:19:17,280 --> 31:19:22,960
ceea ce este acesta este un mod automat de umplere

40920
31:19:20,800 --> 31:19:27,280
în valori lipsă. Deci, aceasta este o fantezie

40921
31:19:22,960 --> 31:19:30,960
mod de a face practic umplerea na

40922
31:19:27,280 --> 31:19:33,360
pe un cadru de date. Deci, simplu imputer um

40923
31:19:30,960 --> 31:19:35,192
practic vom completa

40924
31:19:33,360 --> 31:19:37,360
spatii libere. Ce vom face când vom

40925
31:19:35,192 --> 31:19:39,512
a crea acest obiect înseamnă a-i oferi o strategie

40926
31:19:37,360 --> 31:19:41,832
despre cum să completezi spațiile libere. Ar trebui să folosiți

40927
31:19:39,512 --> 31:19:43,280
media? Ar trebui să folosiți mediana?

40928
31:19:41,832 --> 31:19:45,680
Ar trebui să folosești maximul? Ar trebui să folosească

40929
31:19:43,280 --> 31:19:47,760
bărbați? Ar trebui să utilizați o valoare implicită?

40930
31:19:45,680 --> 31:19:50,000
Îi vom spune ce să facem

40931
31:19:47,760 --> 31:19:52,160
acest obiect.

40932
31:19:50,000 --> 31:19:54,720
Bine. Deci, vom fi așa că suntem

40933
31:19:52,160 --> 31:19:56,480
vom folosi acest lucru ca instrument automatizat

40934
31:19:54,720 --> 31:19:58,872
pentru completarea valorilor lipsă. Deci,

40935
31:19:56,480 --> 31:20:00,480
asta e chiar frumos. are. Deci asta este

40936
31:19:58,872 --> 31:20:03,592
va fi o parte critică a noastră

40937
31:20:00,480 --> 31:20:06,160
conductează un imputer care se va umple

40938
31:20:03,592 --> 31:20:09,800
în valori lipsă.

40939
31:20:06,160 --> 31:20:09,800
Deci avem asta

40940
31:20:11,760 --> 31:20:17,120
da, codificare pentru a reduce codarea. Exact.

40941
31:20:14,232 --> 31:20:18,552
Avem conducta noastră acum. Deci avem

40942
31:20:17,120 --> 31:20:20,000
conducta noastră. Deci conducta noastră merge

40943
31:20:18,552 --> 31:20:23,040
să țină totul. Deci avem nevoie de

40944
31:20:20,000 --> 31:20:25,832
obiectul conductei um să țină totul

40945
31:20:23,040 --> 31:20:27,760
și asta vine de la sklearn.pipeline.

40946
31:20:25,832 --> 31:20:29,592
Um, deci totul va merge de fapt

40947
31:20:27,760 --> 31:20:33,832
într-un obiect conductă. Vom merge

40948
31:20:29,592 --> 31:20:36,160
vezi cum arata. Hm, și în sfârșit,

40949
31:20:33,832 --> 31:20:38,320
vom merge la de la skarn.compose, suntem

40950
31:20:36,160 --> 31:20:40,960
va folosi un transformator de coloană. The

40951
31:20:38,320 --> 31:20:44,080
motivul pentru care vom face asta este pentru că

40952
31:20:40,960 --> 31:20:46,160
vom specifica pentru unele coloane

40953
31:20:44,080 --> 31:20:48,000
ca și caracteristicile numerice, ar trebui

40954
31:20:46,160 --> 31:20:50,400
fi scalare.

40955
31:20:48,000 --> 31:20:53,280
Pentru unele coloane ca categoria categorica

40956
31:20:50,400 --> 31:20:55,912
caracteristici, ar trebui să fim o codificare fierbinte.

40957
31:20:53,280 --> 31:20:58,720
Așa că transformatorul de coloană ne va permite

40958
31:20:55,912 --> 31:21:00,720
pentru a mapa diferite transformări la

40959
31:20:58,720 --> 31:21:02,960
diferite secțiuni de coloane care este

40960
31:21:00,720 --> 31:21:05,280
cu adevărat util. Deci asta merge de fapt

40961
31:21:02,960 --> 31:21:07,912
pentru a fi o parte critică a conductei noastre către

40962
31:21:05,280 --> 31:21:10,800
aplicați pentru a ne asigura că aplicăm acest lucru numai pentru

40963
31:21:07,912 --> 31:21:14,080
caracteristici numerice și aplicați numai acest lucru

40964
31:21:10,800 --> 31:21:18,552
la trăsăturile categoriale. Corect? Deci asta

40965
31:21:14,080 --> 31:21:20,872
transformatorul de coloană ne va ajuta să facem

40966
31:21:18,552 --> 31:21:24,232
aplicați preprocesarea anumitor

40967
31:21:20,872 --> 31:21:26,640
coloane. Așa cum este apropierea oceanului

40968
31:21:24,232 --> 31:21:28,552
singurul care chiar are nevoie de asta dar

40969
31:21:26,640 --> 31:21:31,120
orice altă coloană va avea nevoie de asta

40970
31:21:28,552 --> 31:21:32,400
toate caracteristicile numerice.

40971
31:21:31,120 --> 31:21:34,160
Deci vom folosi această coloană

40972
31:21:32,400 --> 31:21:36,400
transformator și din nou o să vedem

40973
31:21:34,160 --> 31:21:37,912
cum arată asta, dar încerc doar să dau

40974
31:21:36,400 --> 31:21:41,160
ai o idee despre motivul pentru care le importăm pe toate

40975
31:21:37,912 --> 31:21:41,160
aceste lucruri.

40976
31:21:43,120 --> 31:21:48,320
Bine, deci să le importăm.

40977
31:21:46,720 --> 31:21:50,160
Uh, aici se menționează despre coloană

40978
31:21:48,320 --> 31:21:53,192
transformator. Tocmai am vorbit despre asta. Ea

40979
31:21:50,160 --> 31:21:54,720
ne permite să avem o anumită coloană sau

40980
31:21:53,192 --> 31:21:57,832
grup de coloane ia dreapta

40981
31:21:54,720 --> 31:22:00,872
transformare. Deci din nou, uh, uitându-mă

40982
31:21:57,832 --> 31:22:02,080
înaintea conductei noastre, cea numerică

40983
31:22:00,872 --> 31:22:05,120
caracteristicile sunt cele care vor

40984
31:22:02,080 --> 31:22:06,160
nevoie de scalare, dar categoric

40985
31:22:05,120 --> 31:22:07,760
caracteristicile sunt cele care vor

40986
31:22:06,160 --> 31:22:09,440
nevoie de o codificare fierbinte. Oricum multe

40987
31:22:07,760 --> 31:22:10,800
categoriile există, în acest caz,

40988
31:22:09,440 --> 31:22:14,080
într-adevăr există doar unul, care este acela

40989
31:22:10,800 --> 31:22:16,320
apropierea oceanului. pentru a reveni la datele noastre.

40990
31:22:14,080 --> 31:22:18,720
Hm, poți vedea chiar asta în informații,

40991
31:22:16,320 --> 31:22:20,720
este doar acela. Hm, și vedem

40992
31:22:18,720 --> 31:22:22,640
asta aici, nu? Doar acest șir

40993
31:22:20,720 --> 31:22:25,280
coloană care ar trebui să fie una codificată la cald.

40994
31:22:22,640 --> 31:22:27,912
Toți acești tipi ar trebui să fie scalați,

40995
31:22:25,280 --> 31:22:29,680
nu? Toate ar trebui să fie uh uh standard

40996
31:22:27,912 --> 31:22:32,320
scalat.

40997
31:22:29,680 --> 31:22:35,320
Deci, acest lucru ne va permite să le specificăm

40998
31:22:32,320 --> 31:22:35,320
distincții.

40999
31:22:36,640 --> 31:22:42,400
În regulă. Deci, să începem

41000
31:22:40,960 --> 31:22:43,360
construirea conductei noastre. Deci, asta merge

41001
31:22:42,400 --> 31:22:48,480
sa fie cu adevarat cool. Vom construi

41002
31:22:43,360 --> 31:22:50,552
afară din conductă. Hm, hai să ne extragem

41003
31:22:48,480 --> 31:22:52,232
datele numerice și datele noastre categoriale.

41004
31:22:50,552 --> 31:22:53,680
Acum, acesta este un mod foarte frumos de a face

41005
31:22:52,232 --> 31:22:58,160
că nu sunt sigur că l-am văzut

41006
31:22:53,680 --> 31:23:00,720
înainte. Um, deci ceea ce face asta este că vom face

41007
31:22:58,160 --> 31:23:04,640
luați cadrul nostru de date, în special al nostru

41008
31:23:00,720 --> 31:23:06,160
cadrul de date de antrenament și selectați nostru

41009
31:23:04,640 --> 31:23:08,400
date.

41010
31:23:06,160 --> 31:23:12,000
Aceasta este ceea ce face acest dtypes selectat

41011
31:23:08,400 --> 31:23:15,120
selectați datele din acesta. Hm, care include

41012
31:23:12,000 --> 31:23:18,872
numai coloanele tip obiect. Deci numai

41013
31:23:15,120 --> 31:23:21,912
tipurile de obiecte. Acum ce este asta? The

41014
31:23:18,872 --> 31:23:24,872
tipul de obiect este șirul, nu? Deci

41015
31:23:21,912 --> 31:23:27,360
aceasta ar trebui să selecteze numai această coloană

41016
31:23:24,872 --> 31:23:30,480
pentru că este în include.

41017
31:23:27,360 --> 31:23:33,760
Aici includem numai tipuri de obiecte

41018
31:23:30,480 --> 31:23:36,320
rezultatul. Și așa ar trebui doar să aibă

41019
31:23:33,760 --> 31:23:39,832
singura noastră coloană categorică, care este

41020
31:23:36,320 --> 31:23:43,592
apropierea oceanului. Deci pisica de locuințe se duce

41021
31:23:39,832 --> 31:23:46,720
pentru a avea o referință la uh, se întâmplă

41022
31:23:43,592 --> 31:23:50,160
a fi o listă care are o practic justă

41023
31:23:46,720 --> 31:23:52,480
caracteristica noastră de apropiere a oceanului deoarece aceasta

41024
31:23:50,160 --> 31:23:56,960
select dtypes se va asigura că doar noi

41025
31:23:52,480 --> 31:24:00,320
alege tipuri de obiecte și um

41026
31:23:56,960 --> 31:24:04,720
apuca acele coloane. Deci aceasta este o modalitate de a

41027
31:24:00,320 --> 31:24:08,160
prinde bine trăsăturile noastre categorice

41028
31:24:04,720 --> 31:24:10,720
aici prin includerea tipurilor de obiecte. Acum

41029
31:24:08,160 --> 31:24:12,640
pe reversul, putem exclude obiectul

41030
31:24:10,720 --> 31:24:15,440
tipări și obține orice altceva. Deci asta

41031
31:24:12,640 --> 31:24:18,480
va fi toate celelalte coloane care

41032
31:24:15,440 --> 31:24:21,760
exclude obiectul. Deci asta este

41033
31:24:18,480 --> 31:24:25,040
excluzând acest sens ar trebui să obținem tot

41034
31:24:21,760 --> 31:24:27,912
a caracteristicilor noastre numerice astfel. Deci

41035
31:24:25,040 --> 31:24:31,440
acestea vor fi toate cifrele noastre

41036
31:24:27,912 --> 31:24:34,160
prin excluderea tipului de obiect şi acesta

41037
31:24:31,440 --> 31:24:38,640
va fi numărul nostru de locuințe care este scurt

41038
31:24:34,160 --> 31:24:42,552
pentru numeric. Deci asta exclude

41039
31:24:38,640 --> 31:24:46,872
tipul de obiect uh

41040
31:24:42,552 --> 31:24:49,040
adică toate numerice

41041
31:24:46,872 --> 31:24:52,640
caracteristici

41042
31:24:49,040 --> 31:24:55,512
corect toate caracteristicile numerice acolo.

41043
31:24:52,640 --> 31:24:58,232
Bine.

41044
31:24:55,512 --> 31:24:59,760
Deci, dacă ar fi să uh, să verificăm

41045
31:24:58,232 --> 31:25:03,800
aceasta. Să verificăm asta. Dacă noi

41046
31:24:59,760 --> 31:25:03,800
trebuiau să imprime carcasa

41047
31:25:03,912 --> 31:25:10,232
pisică, ăsta ar trebui să fie doar oceanul

41048
31:25:07,192 --> 31:25:12,232
caracteristica de proximitate, care este. Deci, doar

41049
31:25:10,232 --> 31:25:14,640
acela. Dacă ar fi să tipărim

41050
31:25:12,232 --> 31:25:17,280
numărul locuinței, acesta ar trebui să fie tot

41051
31:25:14,640 --> 31:25:19,680
caracteristici numerice, care sunt toate acestea

41052
31:25:17,280 --> 31:25:23,440
baieti. Deci este doar o referire la acestea

41053
31:25:19,680 --> 31:25:25,760
coloane ca să le putem folosi

41054
31:25:23,440 --> 31:25:27,512
mai târziu, când mapam asta

41055
31:25:25,760 --> 31:25:30,000
transform trebuie să meargă la această coloană

41056
31:25:27,512 --> 31:25:32,872
cum ar fi cea la care trebuie să meargă codificarea fierbinte

41057
31:25:30,000 --> 31:25:36,480
această coloană și scalarea trebuie să meargă

41058
31:25:32,872 --> 31:25:39,040
la aceste coloane chiar așa că le avem

41059
31:25:36,480 --> 31:25:44,120
uh, numele acelor coloane deja la noi

41060
31:25:39,040 --> 31:25:44,120
eliminarea. Deci, doar facem asta.

41061
31:25:44,160 --> 31:25:51,000
Și acesta este doar un

41062
31:25:47,440 --> 31:25:51,000
verificare simplă.

41063
31:25:51,832 --> 31:25:56,040
Uh, sunteți capabili să conduceți asta?

41064
31:25:57,120 --> 31:26:03,480
Dacă mă urmărești, lasă-mă să fac o pauză

41065
31:25:58,640 --> 31:26:03,480
acolo. Asigură-te că nu merg prea repede.

41066
31:26:06,640 --> 31:26:11,280
Uh, deci problema cu un anume

41067
31:26:09,512 --> 31:26:14,232
tipul de date ca acesta nu este niciunul dintre acestea

41068
31:26:11,280 --> 31:26:16,960
furnici. De fapt, toate sunt plutitoare. Deci noi

41069
31:26:14,232 --> 31:26:20,680
a plutit. Cred că ar trebui să funcționeze. Dar

41070
31:26:16,960 --> 31:26:20,680
da, asta e ideea.

41071
31:26:21,912 --> 31:26:28,040
Mare. Mă bucur să aud asta chiar acolo

41072
31:26:23,440 --> 31:26:28,040
cu mine. Mare. Mă bucur să aud asta.

41073
31:26:34,232 --> 31:26:39,832
Bine. Deci, avem coloanele alese

41074
31:26:36,232 --> 31:26:42,552
aici, pe care o vom folosi mai târziu.

41075
31:26:39,832 --> 31:26:46,232
Bine.

41076
31:26:42,552 --> 31:26:50,640
În regulă. Deci, hai să mergem înainte și să construim

41077
31:26:46,232 --> 31:26:55,440
parcurgeți pașii noștri pentru fiecare dintre aceste tipuri.

41078
31:26:50,640 --> 31:26:57,120
Deci, pentru caracteristicile noastre numerice, haideți

41079
31:26:55,440 --> 31:26:58,800
construiți etapele noastre de conductă. Deci ce

41080
31:26:57,120 --> 31:27:01,680
vom face este să construim o

41081
31:26:58,800 --> 31:27:05,192
conductă numerică. Și va fi

41082
31:27:01,680 --> 31:27:08,232
o conductă cu o listă

41083
31:27:05,192 --> 31:27:11,040
de tupilele. Și motivul pentru care acestea sunt

41084
31:27:08,232 --> 31:27:13,912
tupilele este pentru că fiecare tupil are o

41085
31:27:11,040 --> 31:27:16,080
nume. Deci, acesta este un nume pe care îl putem

41086
31:27:13,912 --> 31:27:18,400
poate fi orice ne dorim să fie. Deci

41087
31:27:16,080 --> 31:27:19,760
o numim imputer. Am putea suna

41088
31:27:18,400 --> 31:27:21,832
este orice ne dorim. L-am putea numi

41089
31:27:19,760 --> 31:27:25,280
completați spațiile libere. L-am putea numi

41090
31:27:21,832 --> 31:27:26,960
umplere nulă. Spune-i cum vrei.

41091
31:27:25,280 --> 31:27:30,232
Îi spunem imputer pentru că este

41092
31:27:26,960 --> 31:27:33,360
acesta este un nume destul de ușor pentru asta. An

41093
31:27:30,232 --> 31:27:36,080
nume exact la ceea ce face. Hm dar

41094
31:27:33,360 --> 31:27:39,192
important este după nume

41095
31:27:36,080 --> 31:27:41,512
dai, pui în scikitlearn

41096
31:27:39,192 --> 31:27:44,800
obiectul pe care îl veți folosi

41097
31:27:41,512 --> 31:27:48,800
operați asupra datelor dvs. Deci, în acest caz,

41098
31:27:44,800 --> 31:27:51,912
folosim un simplu impery

41099
31:27:48,800 --> 31:27:55,512
de mediană. Acum asta e o alegere. Am putea

41100
31:27:51,912 --> 31:27:58,232
utilizați o strategie de medie, max.

41101
31:27:55,512 --> 31:28:02,320
Am putea să-i oferim o constantă

41102
31:27:58,232 --> 31:28:04,800
valoare implicită. Dar ceea ce înseamnă asta suntem noi

41103
31:28:02,320 --> 31:28:07,280
vom completa orice spații libere în care găsim

41104
31:28:04,800 --> 31:28:09,360
acele coloane cu valoarea mediană de

41105
31:28:07,280 --> 31:28:11,280
acea coloană. Aceasta este strategia pentru

41106
31:28:09,360 --> 31:28:13,120
imper. Deci e destul de misto. Aceasta este

41107
31:28:11,280 --> 31:28:17,280
un fel de mod automat de a completa

41108
31:28:13,120 --> 31:28:19,280
spații libere folosind pentru orice coloană folosind-o

41109
31:28:17,280 --> 31:28:21,120
mediană,

41110
31:28:19,280 --> 31:28:23,360
nu? Și așa am putea schimba asta. Noi

41111
31:28:21,120 --> 31:28:26,160
ar putea pune înseamnă aici sau max sau min sau

41112
31:28:23,360 --> 31:28:28,400
orice. Hm

41113
31:28:26,160 --> 31:28:31,680
dar completăm golul pe oricare

41114
31:28:28,400 --> 31:28:33,592
coloana cu mediana ei. Și motivul

41115
31:28:31,680 --> 31:28:35,760
acest lucru funcționează pentru că o vom face

41116
31:28:33,592 --> 31:28:39,440
aplicați această conductă numai la acestea

41117
31:28:35,760 --> 31:28:41,280
caracteristici numerice. Deci e bine.

41118
31:28:39,440 --> 31:28:42,960
Nu o vom aplica la

41119
31:28:41,280 --> 31:28:45,360
caracteristici categoriale. Vom merge

41120
31:28:42,960 --> 31:28:48,320
aplicați-l numai la acelea numerice. Deci

41121
31:28:45,360 --> 31:28:51,280
ar trebui să aibă o valoare mediană, nu? Aşa

41122
31:28:48,320 --> 31:28:53,512
că e perfect. Deci mergem

41123
31:28:51,280 --> 31:28:56,960
să ne uităm acum la cum construim

41124
31:28:53,512 --> 31:28:59,512
treptele. Avem o listă cu tupilele.

41125
31:28:56,960 --> 31:29:02,720
Iată un tupil

41126
31:28:59,512 --> 31:29:05,912
care este imper cu un simplu imper

41127
31:29:02,720 --> 31:29:07,760
de strategie mediană. Și atunci putem avea

41128
31:29:05,912 --> 31:29:10,480
câte tupili vrem care

41129
31:29:07,760 --> 31:29:14,400
reprezintă etapele de prelucrare. Așa că fiecare lăsare

41130
31:29:10,480 --> 31:29:16,320
scriu asta. Fiecare tupil

41131
31:29:14,400 --> 31:29:18,800
reprezintă

41132
31:29:16,320 --> 31:29:22,720
o preprocesare

41133
31:29:18,800 --> 31:29:26,800
pășiți pe datele noastre.

41134
31:29:22,720 --> 31:29:29,592
Bine, deci avem un pas de calcul numit

41135
31:29:26,800 --> 31:29:31,440
imputer și motivul pentru care are un nume este

41136
31:29:29,592 --> 31:29:33,512
doar pentru a-l putea referi în

41137
31:29:31,440 --> 31:29:37,040
conductă dacă este necesar. Deci tu asa

41138
31:29:33,512 --> 31:29:39,512
are ca un nume de referință um că tu

41139
31:29:37,040 --> 31:29:41,832
da-i. Hm, dar asta este cu atât mai mult

41140
31:29:39,512 --> 31:29:44,552
parte importantă este scikitlearn-ul propriu-zis

41141
31:29:41,832 --> 31:29:46,480
obiectul care face procesarea. Deci

41142
31:29:44,552 --> 31:29:48,320
în acest caz un simplu computer dar

41143
31:29:46,480 --> 31:29:50,000
observați că avem un pas secundar

41144
31:29:48,320 --> 31:29:51,912
care este scalarea noastră. Acum asta face

41145
31:29:50,000 --> 31:29:54,160
sens. Acesta este ceva ce ar trebui să fim

41146
31:29:51,912 --> 31:29:57,440
a face cu caracteristicile noastre este că ar trebui să fim

41147
31:29:54,160 --> 31:30:00,720
scalandu-le. Deci aici spunem bine

41148
31:29:57,440 --> 31:30:03,192
să completăm mai întâi orice spații libere.

41149
31:30:00,720 --> 31:30:06,160
Apropo comanda

41150
31:30:03,192 --> 31:30:10,232
contează.

41151
31:30:06,160 --> 31:30:13,680
Deci, și ceea ce vreau să spun prin asta este

41152
31:30:10,232 --> 31:30:17,680
simplu imper

41153
31:30:13,680 --> 31:30:20,232
este înaintea scalerului. Acum, asta e

41154
31:30:17,680 --> 31:30:22,320
important pentru că ceea ce înseamnă asta suntem noi

41155
31:30:20,232 --> 31:30:25,192
ar trebui să completeze orice spații libere înainte

41156
31:30:22,320 --> 31:30:27,680
încercăm să scalam.

41157
31:30:25,192 --> 31:30:30,480
Deci, acea ordine contează de fapt. Suntem

41158
31:30:27,680 --> 31:30:33,040
urmând a completa spațiile libere mai întâi în aceasta

41159
31:30:30,480 --> 31:30:38,640
lista. Asta e primul. O să umplem

41160
31:30:33,040 --> 31:30:41,512
în spaţii libere. Apoi vom scala

41161
31:30:38,640 --> 31:30:44,080
chiar atunci scalam ceea ce are sens

41162
31:30:41,512 --> 31:30:45,912
corect, așa că mai întâi completăm spațiile libere

41163
31:30:44,080 --> 31:30:50,512
aplicăm scaler-ul pentru a ne scala

41164
31:30:45,912 --> 31:30:50,512
caracteristici, așa că aceștia sunt cei doi pași ai noștri

41165
31:30:50,872 --> 31:30:57,192
atât de simplu, construim

41166
31:30:54,640 --> 31:30:59,120
cei doi pași ai noștri acum, acesta este doar unul

41167
31:30:57,192 --> 31:31:01,912
piesa de puzzle pe care urmează să o punem

41168
31:30:59,120 --> 31:31:04,000
această conductă împreună cu cea fierbinte

41169
31:31:01,912 --> 31:31:07,512
codificarea care va apărea

41170
31:31:04,000 --> 31:31:10,800
în continuare și construim conducta noastră finală.

41171
31:31:07,512 --> 31:31:12,872
Dar aceasta este o conductă care are două

41172
31:31:10,800 --> 31:31:15,680
pași care vor fi de fapt utilizați cu a

41173
31:31:12,872 --> 31:31:17,680
o conductă mai mare vine acolo unde facem noi

41174
31:31:15,680 --> 31:31:20,160
o codificare fierbinte la categoriile noastre și

41175
31:31:17,680 --> 31:31:24,800
apoi punem un model acolo la final

41176
31:31:20,160 --> 31:31:28,160
pentru a antrena și și a utiliza pentru predicție. Aşa

41177
31:31:24,800 --> 31:31:30,960
um conductele pot fi de fapt compuse este

41178
31:31:28,160 --> 31:31:33,440
este ceva de realizat că există asta

41179
31:31:30,960 --> 31:31:34,720
putem avea o conductă care conține a

41180
31:31:33,440 --> 31:31:36,080
câțiva pași. Putem avea o altă conductă

41181
31:31:34,720 --> 31:31:38,400
aici care conține câțiva pași și

41182
31:31:36,080 --> 31:31:40,720
le putem pune de fapt

41183
31:31:38,400 --> 31:31:43,120
împreună într-o conductă finală care are

41184
31:31:40,720 --> 31:31:45,760
ambele conducte au fuzionat

41185
31:31:43,120 --> 31:31:47,760
împreună. Bine. Deci o să vedem

41186
31:31:45,760 --> 31:31:49,832
care apare când ne construim

41187
31:31:47,760 --> 31:31:52,320
cel final. Ultimul nostru, după cum poți

41188
31:31:49,832 --> 31:31:54,080
imagina, trebuie să se ocupe de această cartografiere a

41189
31:31:52,320 --> 31:31:57,192
practic spunând, hai să facem una fierbinte

41190
31:31:54,080 --> 31:32:00,960
codificarea acestor tipi și apoi faceți asta

41191
31:31:57,192 --> 31:32:03,440
conductă aici la aceste numerice

41192
31:32:00,960 --> 31:32:05,440
caracteristici. Asta este conducta noastră finală

41193
31:32:03,440 --> 31:32:08,872
trebuie să se descurce și o va face. Suntem

41194
31:32:05,440 --> 31:32:12,480
o să construiască asta.

41195
31:32:08,872 --> 31:32:15,440
Dar lasă-mă să mă opresc aici. Ați fost, băieți

41196
31:32:12,480 --> 31:32:18,552
capabil să ruleze asta? Ești cu mine

41197
31:32:15,440 --> 31:32:20,480
aceasta conducta de aici?

41198
31:32:18,552 --> 31:32:24,320
Are sens? Acei doi pași

41199
31:32:20,480 --> 31:32:27,280
unul completează spațiile libere cu o mediană

41200
31:32:24,320 --> 31:32:30,160
orice coloană. Deci unde este asta

41201
31:32:27,280 --> 31:32:32,480
asta este ceea ce este atât de uimitor despre asta

41202
31:32:30,160 --> 31:32:36,872
aceasta va căuta automat

41203
31:32:32,480 --> 31:32:39,040
pentru nles si daca dai peste o coloana

41204
31:32:36,872 --> 31:32:42,080
cu un nul, va folosi

41205
31:32:39,040 --> 31:32:44,400
mediana acelei coloane

41206
31:32:42,080 --> 31:32:47,552
pentru a completa golul, nu? Pentru a completa

41207
31:32:44,400 --> 31:32:47,552
acele nles.

41208
31:32:58,872 --> 31:33:05,512
bine,

41209
31:33:01,192 --> 31:33:07,912
grozav. Mă bucur să aud. Mă bucur să aud.

41210
31:33:05,512 --> 31:33:13,040
Bine.

41211
31:33:07,912 --> 31:33:17,360
În regulă. Deci acum vom pune

41212
31:33:13,040 --> 31:33:20,552
aceasta împreună cu un transformator de coloană

41213
31:33:17,360 --> 31:33:24,232
pentru a spune practic ce pași urmează

41214
31:33:20,552 --> 31:33:27,592
fi mapat pe ce coloane.

41215
31:33:24,232 --> 31:33:29,592
Așa că acum poți vedea ce facem

41216
31:33:27,592 --> 31:33:31,760
aici se folosește transformatorul de coloană

41217
31:33:29,592 --> 31:33:35,680
care va fi o listă de tupili

41218
31:33:31,760 --> 31:33:37,592
din nou. Deci aceasta este o altă listă

41219
31:33:35,680 --> 31:33:41,832
tupilele.

41220
31:33:37,592 --> 31:33:44,080
Dar lucrul important este um

41221
31:33:41,832 --> 31:33:47,040
fiecare tupil

41222
31:33:44,080 --> 31:33:50,232
are un nume

41223
31:33:47,040 --> 31:33:52,400
urmat de deci are un nume uh care

41224
31:33:50,232 --> 31:33:54,080
din nou este generic. Poți spune

41225
31:33:52,400 --> 31:33:55,360
orice vrei tu să fie. Deci aici

41226
31:33:54,080 --> 31:33:56,640
scurtăm acest lucru la

41227
31:33:55,360 --> 31:33:59,120
numerice. Aceasta este prescurtarea pentru

41228
31:33:56,640 --> 31:34:03,360
categoric. Dar lucrul important este

41229
31:33:59,120 --> 31:34:06,360
este urmată de o conductă

41230
31:34:03,360 --> 31:34:06,360
slashstep

41231
31:34:06,480 --> 31:34:15,040
urmată de un pas de conductă

41232
31:34:09,192 --> 31:34:19,760
um urmat de un uh urmat de o listă

41233
31:34:15,040 --> 31:34:22,080
de coloane la care se aplică. Deci tu

41234
31:34:19,760 --> 31:34:24,400
pot vedea acest model aici. Ce suntem

41235
31:34:22,080 --> 31:34:26,960
a spune că vom aplica asta

41236
31:34:24,400 --> 31:34:29,040
conducta numerică pe care tocmai am definit-o. Deci

41237
31:34:26,960 --> 31:34:32,000
aceasta este salvată într-o conductă numerică

41238
31:34:29,040 --> 31:34:34,872
obiect aici. Vom aplica asta

41239
31:34:32,000 --> 31:34:36,960
la acele caracteristici numerice. Deci asta este

41240
31:34:34,872 --> 31:34:39,832
acea lista

41241
31:34:36,960 --> 31:34:41,912
de caracteristici numerice aici. Deci asta e

41242
31:34:39,832 --> 31:34:44,320
cum facem maparea. Avem un tupil

41243
31:34:41,912 --> 31:34:46,640
aici care spune bine, aplicați acești pași la

41244
31:34:44,320 --> 31:34:49,360
aceste coloane.

41245
31:34:46,640 --> 31:34:52,232
Alea merg împreună în acel tupol, nu?

41246
31:34:49,360 --> 31:34:55,440
Aplicați acești pași la acest lucru

41247
31:34:52,232 --> 31:34:58,080
coloane. Și apoi aplicați acest pas. Acum

41248
31:34:55,440 --> 31:34:59,592
care este pasul? Acesta este unul fierbinte

41249
31:34:58,080 --> 31:35:04,232
codificator

41250
31:34:59,592 --> 31:35:09,040
care va codifica acelea

41251
31:35:04,232 --> 31:35:11,592
caracteristici și va ignora um

41252
31:35:09,040 --> 31:35:16,232
practic nles pentru moment. Asta e o alegere

41253
31:35:11,592 --> 31:35:19,192
dar va ignora practic

41254
31:35:16,232 --> 31:35:23,040
ignorați nles și sări peste ele

41255
31:35:19,192 --> 31:35:25,192
deocamdată. Acum știm că nu există NLES

41256
31:35:23,040 --> 31:35:28,232
pentru că am făcut deja un is NA de la

41257
31:35:25,192 --> 31:35:30,000
înainte și știm că nu există niciun NLES

41258
31:35:28,232 --> 31:35:32,080
în acea apropiere a oceanului. Deci asta nu este

41259
31:35:30,000 --> 31:35:34,640
va fi o problemă. Dar asta este

41260
31:35:32,080 --> 31:35:37,680
asta ar face.

41261
31:35:34,640 --> 31:35:40,552
Dar avem aici un codificator fierbinte care

41262
31:35:37,680 --> 31:35:43,512
vom aplica la categoria noastră

41263
31:35:40,552 --> 31:35:46,000
caracteristici. Acum, desigur, asta este doar

41264
31:35:43,512 --> 31:35:47,832
caracteristica de apropiere a oceanului dar asta dar

41265
31:35:46,000 --> 31:35:50,480
din nou vezi modelul în tupil

41266
31:35:47,832 --> 31:35:53,832
se aplică această transformare care este una

41267
31:35:50,480 --> 31:35:55,680
codificarea fierbinte la această coloană aplică acestea

41268
31:35:53,832 --> 31:35:59,040
transformări numerice care este un întreg

41269
31:35:55,680 --> 31:36:02,800
conductă. Deci sunt doi pași într-un

41270
31:35:59,040 --> 31:36:05,512
conductă de um

41271
31:36:02,800 --> 31:36:08,080
uh un imputer și un scaler vor face

41272
31:36:05,512 --> 31:36:10,080
fi aplicat la aceasta

41273
31:36:08,080 --> 31:36:12,160
chiar frumos. Deci acestea vor fi

41274
31:36:10,080 --> 31:36:14,080
toate împreună în acest transformator de coloană.

41275
31:36:12,160 --> 31:36:16,160
Și acesta este modul nostru de a semnala asta pentru

41276
31:36:14,080 --> 31:36:18,872
aceste caracteristici numerice, folosiți acestea

41277
31:36:16,160 --> 31:36:21,280
trepte. Pentru caracteristicile noastre categorice, utilizați

41278
31:36:18,872 --> 31:36:23,040
acest pas. Și știi, dacă am avea

41279
31:36:21,280 --> 31:36:25,360
mai mult de un pas, am aplicat

41280
31:36:23,040 --> 31:36:27,120
categoric. Am putea construi o conductă

41281
31:36:25,360 --> 31:36:29,280
pentru categoric și ar și face

41282
31:36:27,120 --> 31:36:32,000
acelasi lucru. Avem mai mult de unul

41283
31:36:29,280 --> 31:36:33,592
pas aici. Și deci este o bună practică

41284
31:36:32,000 --> 31:36:35,912
când ai mai mult de un pas până la doar

41285
31:36:33,592 --> 31:36:37,192
pune asta în conductă pentru că avem

41286
31:36:35,912 --> 31:36:39,912
mai mult de un pas. Vom pune doar asta

41287
31:36:37,192 --> 31:36:42,320
în această listă în interiorul conductei și

41288
31:36:39,912 --> 31:36:45,192
putem mapa acea conductă la acelea

41289
31:36:42,320 --> 31:36:48,960
caracteristici. Aici avem doar un pas. Aşa

41290
31:36:45,192 --> 31:36:51,192
este în regulă să pun asta acolo și

41291
31:36:48,960 --> 31:36:54,720
aplicați asta la trăsăturile categoriale.

41292
31:36:51,192 --> 31:36:56,160
Dar dacă am avea mai mult de un pas, um-l

41293
31:36:54,720 --> 31:36:57,680
ar fi o bună practică să puneți asta într-o

41294
31:36:56,160 --> 31:36:58,872
conductă

41295
31:36:57,680 --> 31:37:00,080
ceea ce facem noi aici. Corect? Aceasta

41296
31:36:58,872 --> 31:37:03,760
conducta este mapată la acestea

41297
31:37:00,080 --> 31:37:07,000
caracteristici. Acest pas i se aplică

41298
31:37:03,760 --> 31:37:07,000
această caracteristică.

41299
31:37:08,160 --> 31:37:13,280
bine,

41300
31:37:10,720 --> 31:37:15,512
ce zici de asta? Sunteți capabili să alergați?

41301
31:37:13,280 --> 31:37:17,440
acela? Are sens ceea ce noi?

41302
31:37:15,512 --> 31:37:19,040
v-ați înființat până acum? Deci, suntem aproape

41303
31:37:17,440 --> 31:37:20,960
acolo. Aproape avem finala noastră

41304
31:37:19,040 --> 31:37:23,440
conductă. Avem preprocesarea noastră

41305
31:37:20,960 --> 31:37:24,960
practic făcut pentru a spune numărul nostru

41306
31:37:23,440 --> 31:37:27,192
caracteristicile ar trebui procesate cu asta

41307
31:37:24,960 --> 31:37:29,360
altă conductă și categoria noastră

41308
31:37:27,192 --> 31:37:31,040
caracteristicile ar trebui să fie unul codificat la cald.

41309
31:37:29,360 --> 31:37:34,872
Ne apropiem. Singurul lucru

41310
31:37:31,040 --> 31:37:36,640
chiar ne lipsește aici este un model.

41311
31:37:34,872 --> 31:37:39,440
Singurul lucru care ne lipsește cu adevărat este

41312
31:37:36,640 --> 31:37:42,000
să avem pregătirea noastră finală pentru model

41313
31:37:39,440 --> 31:37:44,640
conducta este de a include de fapt un model

41314
31:37:42,000 --> 31:37:46,400
care ar trebui să vină la sfârșit.

41315
31:37:44,640 --> 31:37:49,120
Corect? Așa ar trebui să facem

41316
31:37:46,400 --> 31:37:52,232
mai întâi acești pași

41317
31:37:49,120 --> 31:37:54,080
apoi facem modelare pe care o cunoaștem corect

41318
31:37:52,232 --> 31:37:55,680
noi am făcut asta de multe ori. Noi am

41319
31:37:54,080 --> 31:37:58,912
ne-am făcut preprocesarea și apoi o facem

41320
31:37:55,680 --> 31:37:58,912
modelarea noastră.

41321
31:38:00,080 --> 31:38:03,800
Aveți întrebări despre asta?

41322
31:38:17,280 --> 31:38:21,960
Bine.

41323
31:38:18,960 --> 31:38:21,960
Fantastic.

41324
31:38:22,320 --> 31:38:28,400
În regulă.

41325
31:38:25,360 --> 31:38:31,680
Deci, dacă am vrut să vedem dacă am vrut

41326
31:38:28,400 --> 31:38:33,832
să testăm asta până acum, am putea. Deci, noi

41327
31:38:31,680 --> 31:38:36,720
ar putea rula preprocesarea și

41328
31:38:33,832 --> 31:38:39,592
executați de fapt o transformare potrivită pe datele noastre

41329
31:38:36,720 --> 31:38:41,120
și asta va aplica practic asta

41330
31:38:39,592 --> 31:38:44,232
conductă către date. Acum, asta ar fi

41331
31:38:41,120 --> 31:38:47,912
o verificare a sanităţii mentale. Acesta este un bun Acesta este un

41332
31:38:44,232 --> 31:38:52,720
un fel bun de um Aceasta este o bună minte

41333
31:38:47,912 --> 31:38:55,040
verificați dacă pre-procesarea noastră

41334
31:38:52,720 --> 31:38:57,512
lucrări. Deci, face ceea ce ne așteptam

41335
31:38:55,040 --> 31:38:59,040
a face. Nu este conducta noastră finală

41336
31:38:57,512 --> 31:39:01,592
pentru că nu avem modelul nostru acolo

41337
31:38:59,040 --> 31:39:03,680
totuși, dar asta este doar pentru a ne asigura că toate

41338
31:39:01,592 --> 31:39:07,592
dintre caracteristici se comportă ca

41339
31:39:03,680 --> 31:39:09,512
ne asteptam. Deci, putem uh putem face asta

41340
31:39:07,592 --> 31:39:11,912
și putem arunca o privire la um

41341
31:39:09,512 --> 31:39:13,760
rezultate. Asta arată destul de bine. aceasta

41342
31:39:11,912 --> 31:39:15,440
toate caracteristicile noastre numerice au ajuns

41343
31:39:13,760 --> 31:39:17,680
scalat

41344
31:39:15,440 --> 31:39:19,192
care este destul de bun și avem unul fierbinte

41345
31:39:17,680 --> 31:39:22,480
caracteristici codificate pentru acel ocean

41346
31:39:19,192 --> 31:39:24,320
apropiere de aici.

41347
31:39:22,480 --> 31:39:27,120
Bine, așa că arată frumos, așa arată

41348
31:39:24,320 --> 31:39:29,280
rezonabil de aplicarea acelor pași

41349
31:39:27,120 --> 31:39:31,680
spre coloanele din dreapta. Dar acesta este un bun

41350
31:39:29,280 --> 31:39:35,592
un fel de verificare a stării de spirit pentru a ne rula potrivirea

41351
31:39:31,680 --> 31:39:37,912
transforma datele noastre pentru a le asigura

41352
31:39:35,592 --> 31:39:40,552
pași se întâmplă de fapt și ei

41353
31:39:37,912 --> 31:39:44,640
sunt. Puteți vedea aici rezultatul

41354
31:39:40,552 --> 31:39:46,080
scalare și uh cea mai caldă codificare.

41355
31:39:44,640 --> 31:39:49,080
Pentru ca totul să arate frumos

41356
31:39:46,080 --> 31:39:49,080
rezonabil,

41357
31:39:49,832 --> 31:39:56,800
nu? Și ceea ce ar trebui să facem este

41358
31:39:55,040 --> 31:39:58,480
asigurați-vă că nu există valori nule în asta

41359
31:39:56,800 --> 31:40:01,592
care nu ar trebui să existe pentru că am făcut-o

41360
31:39:58,480 --> 31:40:05,832
imputerul. Deci ar trebui să facem uh este

41361
31:40:01,592 --> 31:40:08,832
na punct

41362
31:40:05,832 --> 31:40:08,832
suma

41363
31:40:09,440 --> 31:40:13,832
Și nu mai există NLES. Astfel încât

41364
31:40:11,912 --> 31:40:17,280
arata destul de bine, nu? Aceia au primit

41365
31:40:13,832 --> 31:40:20,000
completat uh făcându-ne pașii. Al nostru

41366
31:40:17,280 --> 31:40:24,232
pașii conductei executați foarte frumos

41367
31:40:20,000 --> 31:40:25,760
datele noastre de antrenament. Hm și și am fost

41368
31:40:24,232 --> 31:40:27,192
oprit și alergat. Și nu e nimic

41369
31:40:25,760 --> 31:40:30,552
unic în ceea ce privește datele de antrenament. Am putea

41370
31:40:27,192 --> 31:40:32,640
faceți acest lucru și pentru datele noastre de testare

41371
31:40:30,552 --> 31:40:34,320
și verificați dacă acești pași rulează

41372
31:40:32,640 --> 31:40:35,912
și ar face-o, nu? Nu e nimic

41373
31:40:34,320 --> 31:40:39,192
într-adevăr atât de special despre rularea ei

41374
31:40:35,912 --> 31:40:40,720
datele de antrenament. Um, ar trebui, de asemenea

41375
31:40:39,192 --> 31:40:43,192
lucrați și la funcțiile de testare și

41376
31:40:40,720 --> 31:40:45,680
o face. Puteți verifica asta pentru

41377
31:40:43,192 --> 31:40:48,680
te.

41378
31:40:45,680 --> 31:40:48,680
Bine.

41379
31:40:50,800 --> 31:40:56,592
În regulă. Deci, e destul de misto. Noi

41380
31:40:52,232 --> 31:40:56,592
pot verifica tot ce funcționează.

41381
31:41:01,120 --> 31:41:06,000
Aveți întrebări despre asta?

41382
31:41:04,480 --> 31:41:08,960
Aproape am ajuns cu plinul nostru

41383
31:41:06,000 --> 31:41:10,232
conductă. Acesta este acesta nu este

41384
31:41:08,960 --> 31:41:13,040
conductă completă, dar asta este ceva

41385
31:41:10,232 --> 31:41:14,400
care va rula pe durata întregii conducte.

41386
31:41:13,040 --> 31:41:16,480
Desigur, caracteristicile noastre vor fi

41387
31:41:14,400 --> 31:41:19,040
transformată conform acelor paşi şi

41388
31:41:16,480 --> 31:41:22,640
atunci va fi introdus în modelul nostru

41389
31:41:19,040 --> 31:41:24,320
fie prezice, fie antrenează cu. Hm

41390
31:41:22,640 --> 31:41:29,040
deci hai sa facem asta. Să construim de fapt

41391
31:41:24,320 --> 31:41:30,400
Descoperă modelul nostru final aici. Deci este

41392
31:41:29,040 --> 31:41:34,000
de fapt va fi foarte ușor de făcut.

41393
31:41:30,400 --> 31:41:36,480
Tot ce trebuie să facem este să punem în noi

41394
31:41:34,000 --> 31:41:39,440
model. Deci aici vom importa

41395
31:41:36,480 --> 31:41:41,040
model de creasta aici. Acum am putea folosi oricare

41396
31:41:39,440 --> 31:41:43,832
am putea folosi regresia liniară, am putea

41397
31:41:41,040 --> 31:41:47,680
folosiți lasso, am putea folosi plasă elastică. Hm

41398
31:41:43,832 --> 31:41:51,280
doar o să folosim Ridge um uh um

41399
31:41:47,680 --> 31:41:55,680
doar pentru a-l testa. Și mergem

41400
31:41:51,280 --> 31:41:58,400
să punem acum o conductă finală. Deci

41401
31:41:55,680 --> 31:42:00,800
ne vom folosi conducta. Și așa

41402
31:41:58,400 --> 31:42:03,280
vom crea unul nou aici.

41403
31:42:00,800 --> 31:42:05,512
și mapați pre-procesarea noastră la nostru

41404
31:42:03,280 --> 31:42:08,000
preprocesare pe care am construit-o deja.

41405
31:42:05,512 --> 31:42:10,552
Deci, acesta este un transformator de coloană care

41406
31:42:08,000 --> 31:42:12,720
are deja toți pașii noștri. Și apoi

41407
31:42:10,552 --> 31:42:14,960
observați ce vine după ce este doar

41408
31:42:12,720 --> 31:42:16,800
model. Acum, asta e destul de simplu,

41409
31:42:14,960 --> 31:42:19,832
dar are sens să vină

41410
31:42:16,800 --> 31:42:21,592
dupa acel model. Hm, și bineînțeles,

41411
31:42:19,832 --> 31:42:24,720
acesta este un nume generic. Am putea, putem

41412
31:42:21,592 --> 31:42:28,160
numim cum vrem noi. um model

41413
31:42:24,720 --> 31:42:31,832
Ridge este destul de rezonabil pentru că

41414
31:42:28,160 --> 31:42:35,192
este o regresie de creastă, dar uh de

41415
31:42:31,832 --> 31:42:38,960
bineînțeles că am putea schimba asta.

41416
31:42:35,192 --> 31:42:42,160
Bine, deci asta construiește ultima noastră um

41417
31:42:38,960 --> 31:42:45,760
conductă. Deci acum avem o conductă și

41418
31:42:42,160 --> 31:42:47,440
ceea ce este grozav la asta este acest semnal

41419
31:42:45,760 --> 31:42:49,760
că toți acești pași ar trebui să fie

41420
31:42:47,440 --> 31:42:52,160
finalizat înainte de a face ceva cu

41421
31:42:49,760 --> 31:42:54,640
acest model. Deci toate acele procesări

41422
31:42:52,160 --> 31:42:57,760
pașii vor rula și apoi suntem

41423
31:42:54,640 --> 31:42:59,760
va face ffit sau prezice și că așa

41424
31:42:57,760 --> 31:43:01,912
asta e chiar grozav. Se asigură că toate

41425
31:42:59,760 --> 31:43:04,640
acei pași merg împreună fiecare

41426
31:43:01,912 --> 31:43:06,640
o singură dată numim prezice cu asta

41427
31:43:04,640 --> 31:43:10,320
cu acest model. Deci doar o să facem

41428
31:43:06,640 --> 31:43:12,872
utilizați conducta în locul modelului

41429
31:43:10,320 --> 31:43:15,832
pentru a se asigura că toți acești pași sunt

41430
31:43:12,872 --> 31:43:17,760
alergând împreună. Și acesta este asta al nostru

41431
31:43:15,832 --> 31:43:19,832
este un fel de conducta noastră finală pe care noi

41432
31:43:17,760 --> 31:43:22,232
ar folosi uh cu ceva de genul

41433
31:43:19,832 --> 31:43:24,960
ffit sau prezice.

41434
31:43:22,232 --> 31:43:30,080
Așa că lasă-mă să notez asta.

41435
31:43:24,960 --> 31:43:36,960
Acum putem folosi doar această conductă finală

41436
31:43:30,080 --> 31:43:40,480
ca un model obișnuit, adică pipeline.fit

41437
31:43:36,960 --> 31:43:43,192
sau conductă.predic.

41438
31:43:40,480 --> 31:43:47,192
L-am putea folosi în orice mod

41439
31:43:43,192 --> 31:43:48,960
uh to a instrui conducta ar fi

41440
31:43:47,192 --> 31:43:50,480
acest tip și apoi folosește conducta pentru

41441
31:43:48,960 --> 31:43:52,080
prezice ar fi asta. Și ce noi

41442
31:43:50,480 --> 31:43:54,480
ar trebui să realizeze este sub capotă acestea

41443
31:43:52,080 --> 31:43:57,192
mai întâi parcurg pașii și apoi noi

41444
31:43:54,480 --> 31:44:00,912
antrenează-l sau acești pași rulează mai întâi atunci

41445
31:43:57,192 --> 31:44:00,912
îl folosim pentru predicție.

41446
31:44:04,400 --> 31:44:09,192
Bine.

41447
31:44:06,400 --> 31:44:12,160
Întrebări despre asta? Are sens?

41448
31:44:09,192 --> 31:44:14,640
Pe această conductă finală aici, este doar

41449
31:44:12,160 --> 31:44:16,400
acum este foarte tare pentru că avem

41450
31:44:14,640 --> 31:44:19,280
o conductă

41451
31:44:16,400 --> 31:44:21,192
alcătuit dintr-o conductă într-adevăr,

41452
31:44:19,280 --> 31:44:22,872
nu? O conductă formată dintr-o conductă.

41453
31:44:21,192 --> 31:44:26,552
Dar asta îți permite scikitlearn să faci

41454
31:44:22,872 --> 31:44:29,592
că să compun conducte în acest fel.

41455
31:44:26,552 --> 31:44:32,592
Asta e destul de normal

41456
31:44:29,592 --> 31:44:32,592
acolo.

41457
31:44:39,832 --> 31:44:44,080
Bine,

41458
31:44:41,512 --> 31:44:46,552
ceea ce vreau să vă arăt este că putem

41459
31:44:44,080 --> 31:44:48,640
utilizați de fapt această conductă într-o rețea

41460
31:44:46,552 --> 31:44:51,040
caută. Deci este destul de uimitor. Putem

41461
31:44:48,640 --> 31:44:53,912
folosiți această conductă în orice mod pe care îl putem folosi

41462
31:44:51,040 --> 31:44:56,640
un mo ca un model obișnuit. Este doar

41463
31:44:53,912 --> 31:44:58,480
pe care acum pașii noștri de preprocesare au

41464
31:44:56,640 --> 31:45:01,192
cam fost ambalate împreună cu noastre

41465
31:44:58,480 --> 31:45:03,040
model pentru a se asigura că rulează întotdeauna

41466
31:45:01,192 --> 31:45:07,592
oricând facem orice procesare cu aceasta

41467
31:45:03,040 --> 31:45:09,440
model. Hm, de exemplu, putem face a

41468
31:45:07,592 --> 31:45:11,760
căutare în grilă la fel cum am făcut cu a

41469
31:45:09,440 --> 31:45:14,720
obișnuit cu doar un model corect

41470
31:45:11,760 --> 31:45:17,680
doar cu asta. Hm, putem face la fel

41471
31:45:14,720 --> 31:45:20,872
chestia cu toată conducta. Um, deci

41472
31:45:17,680 --> 31:45:24,320
singura captură este pe care vrei să o faci

41473
31:45:20,872 --> 31:45:26,960
sigur că în grila ta numești lucrurile în

41474
31:45:24,320 --> 31:45:30,000
mod adecvat în interiorul tău uh

41475
31:45:26,960 --> 31:45:34,720
cheile din dicționarul dvs. Deci uh pentru

41476
31:45:30,000 --> 31:45:36,480
exemplu, în interiorul grilei, suntem

41477
31:45:34,720 --> 31:45:39,192
urmând să configureze alfa care ar fi

41478
31:45:36,480 --> 31:45:41,912
folosit cu aceasta regresie creste de

41479
31:45:39,192 --> 31:45:44,232
făcând referire la numele său. Deci acesta este modelul

41480
31:45:41,912 --> 31:45:46,320
creasta este acesta este numele modelului

41481
31:45:44,232 --> 31:45:48,720
în interiorul conductei. Deci vrei

41482
31:45:46,320 --> 31:45:51,592
asigurați-vă că asta merge primul.

41483
31:45:48,720 --> 31:45:53,680
Și apoi ceea ce face scikitlearn este asta

41484
31:45:51,592 --> 31:45:57,440
recunoaște parametrii care îi aparțin

41485
31:45:53,680 --> 31:46:00,720
acest model utilizând o liniuță de subliniere dublă.

41486
31:45:57,440 --> 31:46:05,760
Deci, astfel încât să aveți subliniere subliniere

41487
31:46:00,720 --> 31:46:08,080
alfa um aici. Deci dublu

41488
31:46:05,760 --> 31:46:11,440
subliniază

41489
31:46:08,080 --> 31:46:17,360
semnalează un parametru

41490
31:46:11,440 --> 31:46:19,832
aparținând modelului creasta. în în în

41491
31:46:17,360 --> 31:46:22,552
conductă.

41492
31:46:19,832 --> 31:46:24,232
Bine, deci avem un model de creastă este doar un

41493
31:46:22,552 --> 31:46:26,720
referință la modelul din conducta noastră.

41494
31:46:24,232 --> 31:46:28,960
Acesta este cel pe care îl vom testa

41495
31:46:26,720 --> 31:46:31,760
aceşti parametri cu. Şi

41496
31:46:28,960 --> 31:46:36,640
underscore_pha este doar o modalitate de a spune asta

41497
31:46:31,760 --> 31:46:38,640
alfa aparține acestui model. Bine, asta

41498
31:46:36,640 --> 31:46:42,400
aparține, așa că va fi folosit cu

41499
31:46:38,640 --> 31:46:44,400
acel model în conducta noastră. Hm altfel

41500
31:46:42,400 --> 31:46:46,160
va funcționa exact la fel.

41501
31:46:44,400 --> 31:46:48,720
Doar că trebuie să aliniem această denumire

41502
31:46:46,160 --> 31:46:51,680
convenția de scikitlearn.

41503
31:46:48,720 --> 31:46:54,400
Trebuie doar să faci referire la asta

41504
31:46:51,680 --> 31:46:58,160
indiferent de numele pe care l-ai dat aici și atunci

41505
31:46:54,400 --> 31:47:01,512
parametru de subliniere. Deci raportul L1 alfa

41506
31:46:58,160 --> 31:47:05,760
orice drept ar merge acolo.

41507
31:47:01,512 --> 31:47:09,192
Bine. Deci există un interval de la 0,1 la

41508
31:47:05,760 --> 31:47:12,720
dimensiunea de două trepte de 0,1

41509
31:47:09,192 --> 31:47:14,800
um și apoi facem CV-ul nostru de căutare în grilă. Deci

41510
31:47:12,720 --> 31:47:18,232
aceasta este exact aceeași configurație ca și noi

41511
31:47:14,800 --> 31:47:20,800
înainte. Doar că modelul nostru este acum

41512
31:47:18,232 --> 31:47:23,760
conducta. Deci conducta noastră merge

41513
31:47:20,800 --> 31:47:26,232
acolo. Avem grila

41514
31:47:23,760 --> 31:47:28,800
acolo. Avem ca scorul nostru este același,

41515
31:47:26,232 --> 31:47:31,192
știi, eroare absolută negativă. Hm

41516
31:47:28,800 --> 31:47:34,480
folosim validarea încrucișată de cinci ori

41517
31:47:31,192 --> 31:47:35,680
și paralelizăm această căutare. um,

41518
31:47:34,480 --> 31:47:40,480
așa că vom căuta printre acestea

41519
31:47:35,680 --> 31:47:45,192
alfa și practic se potrivesc asta cu noi

41520
31:47:40,480 --> 31:47:47,680
um date și găsiți cele mai bune um găsiți

41521
31:47:45,192 --> 31:47:49,040
cel mai bun alfa.

41522
31:47:47,680 --> 31:47:51,592
Așa că le va încerca pe toate

41523
31:47:49,040 --> 31:47:54,640
combinații și încercați să veniți cu

41524
31:47:51,592 --> 31:47:57,912
cel mai bun alfa.

41525
31:47:54,640 --> 31:48:00,080
Deci, se pare că cel mai bun alfa a fost 0,1 pentru

41526
31:47:57,912 --> 31:48:04,480
creasta.

41527
31:48:00,080 --> 31:48:08,800
Bine, este cel mai bun. Deci atunci umm dacă noi

41528
31:48:04,480 --> 31:48:11,192
am vrut să putem prezice folosirea

41529
31:48:08,800 --> 31:48:14,320
modelul um care ar fi făcut

41530
31:48:11,192 --> 31:48:18,400
ceva de genul acesta. Hm și am putea

41531
31:48:14,320 --> 31:48:21,400
de asemenea, întoarce-te și fă ceva ca noi

41532
31:48:18,400 --> 31:48:21,400
putea

41533
31:48:22,960 --> 31:48:30,512
acum folosește acest parametru. Deci am putea face

41534
31:48:27,512 --> 31:48:30,512
model

41535
31:48:30,640 --> 31:48:34,440
um este egal cu creasta

41536
31:48:35,280 --> 31:48:41,440
și apoi am putea pune în alfa

41537
31:48:38,960 --> 31:48:43,512
um alfa este cel mai bun rezultat al nostru

41538
31:48:41,440 --> 31:48:46,320
parametrii și apoi obținem acel model

41539
31:48:43,512 --> 31:48:49,640
ridge alpha și apoi ne reconstruim doar

41540
31:48:46,320 --> 31:48:49,640
conducta noastră

41541
31:48:50,480 --> 31:48:57,120
este egală cu conducta și apoi am introdus

41542
31:48:54,232 --> 31:49:00,400
acest nou model aici. Deci am putea face

41543
31:48:57,120 --> 31:49:04,480
aceasta. Acest lucru ar fi să se întoarcă înapoi și doar

41544
31:49:00,400 --> 31:49:07,512
punem aici cel mai bun alfa al nostru pentru

41545
31:49:04,480 --> 31:49:09,040
acest model și apoi să ne asigurăm că

41546
31:49:07,512 --> 31:49:10,720
parte a conductei noastre. Deci suntem doar

41547
31:49:09,040 --> 31:49:14,040
suprascriind acea conductă cu cele mai bune

41548
31:49:10,720 --> 31:49:14,040
model acolo

41549
31:49:16,872 --> 31:49:22,680
pentru a obține cel mai bun model în conducta noastră.

41550
31:49:23,120 --> 31:49:26,232
bine,

41551
31:49:24,720 --> 31:49:30,080
deci asta e tot ce face este doar

41552
31:49:26,232 --> 31:49:34,192
inițializarea unui nou um permiteți-mi de fapt eu

41553
31:49:30,080 --> 31:49:34,192
pot pune acest cod aici.

41554
31:49:36,320 --> 31:49:40,552
Acest lucru este de fapt doar obținerea asta este

41555
31:49:38,160 --> 31:49:43,512
tocmai obținem un model cu cel mai bun alfa

41556
31:49:40,552 --> 31:49:45,592
și apoi reinserând asta în nostru

41557
31:49:43,512 --> 31:49:47,912
uh, doar suprascriem finala noastră

41558
31:49:45,592 --> 31:49:50,640
conductă acolo cu cel mai bun model care

41559
31:49:47,912 --> 31:49:53,280
avem.

41560
31:49:50,640 --> 31:49:55,440
Atât de grozav că conducta poate fi folosită

41561
31:49:53,280 --> 31:49:57,512
practic exact ca un model, nu?

41562
31:49:55,440 --> 31:50:00,800
Se întâmplă chiar aici, în grilă

41563
31:49:57,512 --> 31:50:04,000
caută și fiind folosit în întregime ca un

41564
31:50:00,800 --> 31:50:06,400
model de bază. Deci ne potrivim

41565
31:50:04,000 --> 31:50:08,232
și asta ne permite să-l folosim. Noi

41566
31:50:06,400 --> 31:50:10,400
ar putea să prezică. Am putea chiar să facem

41567
31:50:08,232 --> 31:50:13,192
pipeline.predic o dată am putea merge

41568
31:50:10,400 --> 31:50:14,960
înapoi și face conducta finală.fit

41569
31:50:13,192 --> 31:50:20,960
um cu asta și apoi final

41570
31:50:14,960 --> 31:50:20,960
conductă.prevăză cu aceasta și evaluează

41571
31:50:21,280 --> 31:50:25,680
bine,

41572
31:50:23,280 --> 31:50:27,832
atât de grozav că poate fi folosită conducta

41573
31:50:25,680 --> 31:50:30,320
practic exact ca un model

41574
31:50:27,832 --> 31:50:34,320
ar fi orice fel în care am folosi un model.fit

41575
31:50:30,320 --> 31:50:37,040
model.predict, putem folosi o conductă.

41576
31:50:34,320 --> 31:50:39,440
Deci căutarea în grilă este, de exemplu, ceva

41577
31:50:37,040 --> 31:50:41,040
care poate folosi un model acolo. Hm dar

41578
31:50:39,440 --> 31:50:43,280
în loc de doar un model, ne asigurăm

41579
31:50:41,040 --> 31:50:45,120
avem pașii noștri de preprocesare

41580
31:50:43,280 --> 31:50:47,040
incluse în acest model

41581
31:50:45,120 --> 31:50:50,040
conductă.

41582
31:50:47,040 --> 31:50:50,040
Oricare

41583
31:50:50,552 --> 31:50:57,552
întrebări pe

41584
31:50:52,960 --> 31:50:57,552
uh acest exemplu de pana acum?

41585
31:50:58,640 --> 31:51:04,760
Ați reușit să o duceți până aici?

41586
31:51:00,720 --> 31:51:04,760
Ați reușit să rulați căutarea în grilă?

41587
31:51:16,232 --> 31:51:19,552
Bine, grozav.

41588
31:51:25,512 --> 31:51:30,000
Bine.

41589
31:51:27,912 --> 31:51:31,360
Bine. Deci, asta este doar

41590
31:51:30,000 --> 31:51:34,720
arătându-ți ce se întâmplă de fapt

41591
31:51:31,360 --> 31:51:36,480
sub capotă e, știi,

41592
31:51:34,720 --> 31:51:40,320
facem niște scalare. Facem

41593
31:51:36,480 --> 31:51:43,832
cineva de codificare fierbinte um

41594
31:51:40,320 --> 31:51:46,872
și facem ceva uh facem a

41595
31:51:43,832 --> 31:51:50,400
model aici. Și asta face parte din a noastră

41596
31:51:46,872 --> 31:51:52,000
conductă. Um, și apoi putem folosi

41597
31:51:50,400 --> 31:51:54,480
conductă cum vrem noi. Deci pentru

41598
31:51:52,000 --> 31:51:57,192
de exemplu, știu că nu este aici, dar pentru

41599
31:51:54,480 --> 31:52:00,320
un exemplu, am putea folosi um odată ce o facem

41600
31:51:57,192 --> 31:52:05,440
odată ce avem această conductă finală, um noi

41601
31:52:00,320 --> 31:52:09,280
can poate folosi um final

41602
31:52:05,440 --> 31:52:11,280
conductă pentru a prezice. Deci putem face um

41603
31:52:09,280 --> 31:52:14,872
previziuni

41604
31:52:11,280 --> 31:52:16,640
egal final

41605
31:52:14,872 --> 31:52:18,800
conductă.predic

41606
31:52:16,640 --> 31:52:22,080
și apoi putem transmite datele noastre de testare.

41607
31:52:18,800 --> 31:52:25,120
Acum, ceea ce se întâmplă cu asta este odată ce avem

41608
31:52:22,080 --> 31:52:27,512
a rulat conducta noastră.fit we have a

41609
31:52:25,120 --> 31:52:30,320
conductă antrenată și apoi când alergăm

41610
31:52:27,512 --> 31:52:32,640
această conductă finală. prezice uh aceste date

41611
31:52:30,320 --> 31:52:33,592
va fi transformat.

41612
31:52:32,640 --> 31:52:35,832
O să treacă prin acelea

41613
31:52:33,592 --> 31:52:39,280
pași de transformare și apoi am face

41614
31:52:35,832 --> 31:52:40,872
aplica modelul nostru la el la sfarsit uh to

41615
31:52:39,280 --> 31:52:42,720
să facem acele previziuni și apoi noi

41616
31:52:40,872 --> 31:52:46,000
poate evalua acele previziuni care este

41617
31:52:42,720 --> 31:52:49,000
cam ce facem aici.

41618
31:52:46,000 --> 31:52:49,000
Corect?

41619
31:52:52,640 --> 31:52:55,640
Bine.

41620
31:52:56,480 --> 31:53:02,320
În regulă. Deci, în concluzie, avem

41621
31:52:59,680 --> 31:53:04,872
am trecut prin multe chestii aici. um,

41622
31:53:02,320 --> 31:53:08,080
am trecut prin regresie, am trecut

41623
31:53:04,872 --> 31:53:09,760
efectuat regularizarea pe regresie.

41624
31:53:08,080 --> 31:53:11,760
Deci sperăm că avem o bază bună

41625
31:53:09,760 --> 31:53:13,760
pe regresie. Hm, la ce mergem

41626
31:53:11,760 --> 31:53:15,760
a face un pic este de fapt a face ceva

41627
31:53:13,760 --> 31:53:16,872
practică suplimentară cu regresie pe a

41628
31:53:15,760 --> 31:53:20,080
noua problema. Vom face o

41629
31:53:16,872 --> 31:53:23,360
problema capstone și faceți ceva suplimentar

41630
31:53:20,080 --> 31:53:27,280
regresie lucra cu asta. Hm, deci vom face

41631
31:53:23,360 --> 31:53:28,720
face asta în continuare. Hm, dar celălalt lucru noi

41632
31:53:27,280 --> 31:53:30,080
învățat este cum să evaluezi

41633
31:53:28,720 --> 31:53:32,320
regresie folosind lucruri precum mediul

41634
31:53:30,080 --> 31:53:35,192
eroare pătrat, RMSSE care este pătrat

41635
31:53:32,320 --> 31:53:38,400
rădăcina asta. Um care este care este

41636
31:53:35,192 --> 31:53:40,320
foarte tare. Deci avem un sentiment de asta

41637
31:53:38,400 --> 31:53:42,960
eroare care este distanța noastră de a noastră

41638
31:53:40,320 --> 31:53:45,680
predicție la valoarea reală. Asta e

41639
31:53:42,960 --> 31:53:48,872
intotdeauna ce astea uh asta e mereu ce

41640
31:53:45,680 --> 31:53:50,640
lucrurile astea merg așa, nu?

41641
31:53:48,872 --> 31:53:53,360
Aceasta înseamnă valoarea de eroare absolută de la

41642
31:53:50,640 --> 31:53:55,680
scikitlearn calculează media

41643
31:53:53,360 --> 31:53:58,320
distanța de la aceste predicții la acestea

41644
31:53:55,680 --> 31:54:00,960
Testează etichetele pe care le avem, nu? Aceia

41645
31:53:58,320 --> 31:54:03,280
valori reale. Hm, și asta ne oferă o

41646
31:54:00,960 --> 31:54:04,800
simțul în medie cât de departe sunt noștri

41647
31:54:03,280 --> 31:54:07,512
previziuni

41648
31:54:04,800 --> 31:54:10,320
um să vedem cât de bun este un model

41649
31:54:07,512 --> 31:54:12,720
au, nu? Și ar trebui să evaluăm

41650
31:54:10,320 --> 31:54:16,552
acea eroare în general

41651
31:54:12,720 --> 31:54:19,040
um, față de amploarea țintelor noastre

41652
31:54:16,552 --> 31:54:23,192
vezi, știi,

41653
31:54:19,040 --> 31:54:25,280
uh cât de departe suntem de obicei.

41654
31:54:23,192 --> 31:54:27,680
Bine. Orice întrebări despre asta

41655
31:54:25,280 --> 31:54:30,232
lectie despre regresie? Orice noi

41656
31:54:27,680 --> 31:54:32,960
acoperit până în acest punct? Vom merge

41657
31:54:30,232 --> 31:54:35,760
mai exersează cu următorul

41658
31:54:32,960 --> 31:54:39,832
vom face capstone. Așa că ajungem așa

41659
31:54:35,760 --> 31:54:39,832
mai faceți doar câteva probleme de regresie.

41660
31:54:47,512 --> 31:54:50,872
Da, este un alt scor prost.

41661
31:54:49,192 --> 31:54:54,800
Este puțin greu de interpretat asta

41662
31:54:50,872 --> 31:54:57,680
deşi pentru că este m ae. Um, deci unul

41663
31:54:54,800 --> 31:55:00,000
ceea ce am putea face este să calculăm media

41664
31:54:57,680 --> 31:55:02,800
eroare pătrat și apoi luați pătratul

41665
31:55:00,000 --> 31:55:05,832
root al acestuia pentru a obține RMSSE care este a

41666
31:55:02,800 --> 31:55:08,400
mult mai bine uh metrica de evaluare în

41667
31:55:05,832 --> 31:55:11,360
termenii țintei noastre. Hm ca să putem

41668
31:55:08,400 --> 31:55:14,320
de fapt rula asta. Dacă ne întoarcem aici

41669
31:55:11,360 --> 31:55:17,912
și am putea genera, de exemplu, noi

41670
31:55:14,320 --> 31:55:20,000
ar putea genera MSE care este media

41671
31:55:17,912 --> 31:55:21,512
pătrat

41672
31:55:20,000 --> 31:55:25,040
eroare

41673
31:55:21,512 --> 31:55:28,960
și este aceeași funcție exactă

41674
31:55:25,040 --> 31:55:30,800
de a folosi predicțiile noastre.

41675
31:55:28,960 --> 31:55:32,720
Hm

41676
31:55:30,800 --> 31:55:36,512
și apoi am putea pur și simplu să tipărim asta.

41677
31:55:32,720 --> 31:55:36,512
Eroare medie pătratică.

41678
31:55:36,552 --> 31:55:43,440
Deci avem eroare pătrată medie și apoi

41679
31:55:38,160 --> 31:55:46,232
ceea ce putem face este să luăm MP-ul.

41680
31:55:43,440 --> 31:55:49,120
rădăcină pătrată a acesteia.

41681
31:55:46,232 --> 31:55:50,872
Astfel, putem genera RMSSE.

41682
31:55:49,120 --> 31:55:55,192
Deci da, vreau să spun că e destul de rău.

41683
31:55:50,872 --> 31:55:58,640
E destul de rău. Uh, acum hai să facem

41684
31:55:55,192 --> 31:56:00,480
du-te înapoi și uită-te la noi

41685
31:55:58,640 --> 31:56:03,760
uh date totusi. Deci haideți să aruncăm o privire la

41686
31:56:00,480 --> 31:56:05,832
media pentru y-ul nostru. Amintește-ți una

41687
31:56:03,760 --> 31:56:08,640
lucru pe care ar trebui să-l facem este să luăm o

41688
31:56:05,832 --> 31:56:11,832
uită-te la ce e să aruncăm o privire

41689
31:56:08,640 --> 31:56:14,232
at y test mean

41690
31:56:11,832 --> 31:56:18,480
pentru a obține o valoare medie. Deci media

41691
31:56:14,232 --> 31:56:21,440
valoarea este în anii 200.000. Deci

41692
31:56:18,480 --> 31:56:23,512
asta nu este asta nu este groaznic. Aceasta este

41693
31:56:21,440 --> 31:56:25,680
70.000. Este încă o cantitate decentă de

41694
31:56:23,512 --> 31:56:28,080
eroare. Nu este la fel de rău ca modelele noi

41695
31:56:25,680 --> 31:56:32,720
au înainte totuși, nu? Acesta este un

41696
31:56:28,080 --> 31:56:36,232
prețul mediu mediu al casei este în

41697
31:56:32,720 --> 31:56:39,592
intervalul 206.000 și eroarea noastră este oprită

41698
31:56:36,232 --> 31:56:41,440
cu aproximativ 70.000,

41699
31:56:39,592 --> 31:56:47,512
nu?

41700
31:56:41,440 --> 31:56:50,160
Deci, nu e bine. Hm, dar nu este

41701
31:56:47,512 --> 31:56:52,640
or ca la fel de rău ca nu este ca

41702
31:56:50,160 --> 31:56:54,640
oribil, așa cum am văzut până acum. Corect.

41703
31:56:52,640 --> 31:56:56,720
Acesta este un model puțin mai bun.

41704
31:56:54,640 --> 31:56:59,832
Un pic mai bine. mai aproape de zero

41705
31:56:56,720 --> 31:57:02,640
ar fi mai bine, nu? Hm, dar

41706
31:56:59,832 --> 31:57:06,720
mai mic cu atât mai bine. Dar amintește-ți asta

41707
31:57:02,640 --> 31:57:09,280
este um acestea chiar absolut mediul

41708
31:57:06,720 --> 31:57:14,000
eroarea este din punct de vedere tehnic în unități similare

41709
31:57:09,280 --> 31:57:17,760
ca uh um

41710
31:57:14,000 --> 31:57:19,912
ca țintă. Deci 50.000 60.000 aici

41711
31:57:17,760 --> 31:57:24,320
70.000 este încă o sumă decentă

41712
31:57:19,912 --> 31:57:25,760
eroare în termeni de 200.000.

41713
31:57:24,320 --> 31:57:27,192
Până acum am venit doar cu modele

41714
31:57:25,760 --> 31:57:28,800
și testați acuratețea lor cu disponibile

41715
31:57:27,192 --> 31:57:31,040
date. Nu am folosit un model pentru a face

41716
31:57:28,800 --> 31:57:33,680
previziuni complet noi despre Nu, noi

41717
31:57:31,040 --> 31:57:36,552
nu am facut asta. Numai că știm cum

41718
31:57:33,680 --> 31:57:38,640
a face asta. Așa ar fi să faci

41719
31:57:36,552 --> 31:57:40,480
previziunile asupra datelor noi ar fi exact

41720
31:57:38,640 --> 31:57:43,280
cum le punem la dispoziție

41721
31:57:40,480 --> 31:57:45,680
date pentru că de fapt facem asta toate

41722
31:57:43,280 --> 31:57:47,440
timp. Dacă ne întoarcem la modelul nostru

41723
31:57:45,680 --> 31:57:49,912
clădire,

41724
31:57:47,440 --> 31:57:53,360
um, arată exact așa, nu?

41725
31:57:49,912 --> 31:57:56,080
unde luăm, de exemplu, facem

41726
31:57:53,360 --> 31:57:58,400
predicții tot timpul pe datele de testare

41727
31:57:56,080 --> 31:58:02,720
care nu a fost niciodată implicat în antrenament.

41728
31:57:58,400 --> 31:58:06,000
Deci parcă aceste date imită noi

41729
31:58:02,720 --> 31:58:08,960
date pe care nu le-am mai văzut până acum. Deci dacă

41730
31:58:06,000 --> 31:58:11,760
am avut noi date brute, așa ar fi

41731
31:58:08,960 --> 31:58:14,000
ar fi exact același proces. cel nou

41732
31:58:11,760 --> 31:58:15,360
acum, cu conducta noastră, o face un

41733
31:58:14,000 --> 31:58:17,040
putin mai usor pentru ca cu

41734
31:58:15,360 --> 31:58:19,360
conductă

41735
31:58:17,040 --> 31:58:21,280
um, datele brute vor trece prin acestea

41736
31:58:19,360 --> 31:58:22,872
transformări pe care ar trebui să le corecteze

41737
31:58:21,280 --> 31:58:24,640
datele brute ar trebui pentru că dacă este

41738
31:58:22,872 --> 31:58:26,232
datele lipsă trebuie completate dacă

41739
31:58:24,640 --> 31:58:29,912
are categorice trebuie să fie unul

41740
31:58:26,232 --> 31:58:33,192
codificat la cald, așa că acesta este scopul

41741
31:58:29,912 --> 31:58:37,040
conducta este de fapt să ne asigurăm că

41742
31:58:33,192 --> 31:58:40,400
dacă avem de-a face cu date brute, acelea

41743
31:58:37,040 --> 31:58:43,592
pot avea loc pași pe datele dinaintea acesteia

41744
31:58:40,400 --> 31:58:45,680
intră în model. Corect?

41745
31:58:43,592 --> 31:58:47,280
Deci noi așa

41746
31:58:45,680 --> 31:58:48,800
acesta este un fel de scop al

41747
31:58:47,280 --> 31:58:51,440
conductă

41748
31:58:48,800 --> 31:58:56,000
este să ne asigurăm că parcurgem acești pași

41749
31:58:51,440 --> 31:58:58,480
înainte de a-l folosi folosind un model cu el.

41750
31:58:56,000 --> 31:59:00,400
Dar, în cele din urmă, așa este

41751
31:58:58,480 --> 31:59:02,720
modelul scikitlearn se va descurca

41752
31:59:00,400 --> 31:59:05,680
prezice chiar dacă este o conductă

41753
31:59:02,720 --> 31:59:08,080
corect, va fi uh, pur și simplu mergem

41754
31:59:05,680 --> 31:59:10,400
înapoi aici va fi um

41755
31:59:08,080 --> 31:59:11,360
prezice că va fi mereu așa

41756
31:59:10,400 --> 31:59:14,320
date noi

41757
31:59:11,360 --> 31:59:16,000
>> salut tuturor în această sesiune vom face

41758
31:59:14,320 --> 31:59:17,512
acoperă toate cele importante supravegheate şi

41759
31:59:16,000 --> 31:59:18,960
algoritmi de învăţare nesupravegheată care

41760
31:59:17,512 --> 31:59:21,760
sunt utilizate pe scară largă cu hands-on

41761
31:59:18,960 --> 31:59:23,440
demonstrații în Python instructorii noștri

41762
31:59:21,760 --> 31:59:25,280
cu experiență bogată în învățarea automată

41763
31:59:23,440 --> 31:59:26,872
ne va duce prin acest curs dar

41764
31:59:25,280 --> 31:59:28,320
înainte de a începe, asigurați-vă că

41765
31:59:26,872 --> 31:59:29,592
abonați-vă la canalul SimplyLearn și

41766
31:59:28,320 --> 31:59:31,760
apăsați pictograma clopoțel pentru a nu rata niciodată un

41767
31:59:29,592 --> 31:59:33,512
actualizare.

41768
31:59:31,760 --> 31:59:35,040
Deci, vom începe prin a înțelege

41769
31:59:33,512 --> 31:59:37,040
elementele de bază ale învățării automate dintr-un scurt

41770
31:59:35,040 --> 31:59:38,232
video animat urmat de

41771
31:59:37,040 --> 31:59:40,960
diferența dintre supravegheat și

41772
31:59:38,232 --> 31:59:43,120
învăţare nesupravegheată. Vom sări apoi

41773
31:59:40,960 --> 31:59:45,192
în învățarea diferiților algoritmi

41774
31:59:43,120 --> 31:59:47,680
de la zero. Deci, vom înțelege

41775
31:59:45,192 --> 31:59:50,000
regresie liniară, regresie logistică,

41776
31:59:47,680 --> 31:59:52,320
arbore de decizie și pădure aleatoare. Vom face

41777
31:59:50,000 --> 31:59:53,912
apoi uită-te la mașinile vector suport și

41778
31:59:52,320 --> 31:59:56,400
K algoritm de cel mai apropiat vecin cu a

41779
31:59:53,912 --> 31:59:58,232
demonstrație practică în Python.

41780
31:59:56,400 --> 32:00:00,000
În cele din urmă, ne vom face o idee despre

41781
31:59:58,232 --> 32:00:01,912
algoritmi de învățare nesupravegheată precum

41782
32:00:00,000 --> 32:00:04,400
K înseamnă grupare și principal

41783
32:00:01,912 --> 32:00:06,232
analiza componentelor. Vom concluziona

41784
32:00:04,400 --> 32:00:09,280
această sesiune cu regularizare în

41785
32:00:06,232 --> 32:00:11,440
învățarea automată. Deci, să începem.

41786
32:00:09,280 --> 32:00:13,832
>> Știm că oamenii învață din trecutul lor

41787
32:00:11,440 --> 32:00:16,552
urmează experiențe și mașini

41788
32:00:13,832 --> 32:00:18,800
instructiuni date de oameni.

41789
32:00:16,552 --> 32:00:20,400
Dar dacă oamenii pot antrena

41790
32:00:18,800 --> 32:00:22,480
mașinile să învețe din datele lor trecute

41791
32:00:20,400 --> 32:00:24,480
și fă ceea ce oamenii pot face și multe

41792
32:00:22,480 --> 32:00:26,232
mai repede? Ei bine, asta se numește mașină

41793
32:00:24,480 --> 32:00:28,320
învăţare. Dar este mult mai mult decât doar

41794
32:00:26,232 --> 32:00:30,552
învăţarea. Este și despre înțelegere

41795
32:00:28,320 --> 32:00:33,592
și raționament. Așa că astăzi vom învăța

41796
32:00:30,552 --> 32:00:36,080
despre elementele de bază ale învățării automate. Deci

41797
32:00:33,592 --> 32:00:38,000
acesta este Paul. Îi place să asculte noi

41798
32:00:36,080 --> 32:00:40,080
cântece.

41799
32:00:38,000 --> 32:00:42,320
Fie îi plac, fie nu îi plac.

41800
32:00:40,080 --> 32:00:46,800
Paul decide acest lucru pe baza

41801
32:00:42,320 --> 32:00:49,360
tempo-ul, genul, intensitatea melodiei și

41802
32:00:46,800 --> 32:00:52,000
genul vocii. Pentru simplitate, haideți

41803
32:00:49,360 --> 32:00:55,440
folosește doar tempo și intensitatea deocamdată.

41804
32:00:52,000 --> 32:00:58,160
Deci, aici tempo este pe axa x, variind

41805
32:00:55,440 --> 32:01:01,120
de la relaxat la rapid, în timp ce intensitate

41806
32:00:58,160 --> 32:01:04,552
este pe axa y, variind de la lumină la

41807
32:01:01,120 --> 32:01:07,760
avântându-se. Vedem că lui Paul îi place cântecul

41808
32:01:04,552 --> 32:01:10,720
cu un tempo rapid și o intensitate vertiginoasă

41809
32:01:07,760 --> 32:01:13,192
în timp ce îi displace cântecul cu relaxat

41810
32:01:10,720 --> 32:01:15,360
tempo și intensitatea luminii. Deci acum noi

41811
32:01:13,192 --> 32:01:17,592
cunoaște alegerile lui Paul. Să spunem Paul

41812
32:01:15,360 --> 32:01:20,872
ascultă o melodie nouă. Să-l numim ca

41813
32:01:17,592 --> 32:01:23,280
cântecul A. Cântecul A are tempo rapid și a

41814
32:01:20,872 --> 32:01:25,680
intensitate crescândă. Deci se află undeva

41815
32:01:23,280 --> 32:01:27,912
aici. Privind datele, poți ghici

41816
32:01:25,680 --> 32:01:30,480
dacă lui Paul îi va plăcea sau nu cântecul?

41817
32:01:27,912 --> 32:01:32,720
Corecta. Deci lui Paul îi place acest cântec. De

41818
32:01:30,480 --> 32:01:35,192
Privind alegerile din trecut ale lui Paul, am fost

41819
32:01:32,720 --> 32:01:37,832
capabil să clasifice cântecul necunoscut foarte

41820
32:01:35,192 --> 32:01:40,480
usor, nu? Să spunem acum Paul

41821
32:01:37,832 --> 32:01:44,552
ascultă o melodie nouă. Să-l etichetăm ca

41822
32:01:40,480 --> 32:01:47,360
cântecul B. Deci cântecul B se află undeva aici

41823
32:01:44,552 --> 32:01:50,080
cu tempo mediu și intensitate medie.

41824
32:01:47,360 --> 32:01:52,320
Nici relaxat, nici rapid, nici ușor

41825
32:01:50,080 --> 32:01:54,480
nici avântându-se. Acum, poți ghici dacă

41826
32:01:52,320 --> 32:01:56,872
Lui Paul îi place sau nu? Nu pot ghici

41827
32:01:54,480 --> 32:01:59,192
dacă lui Pavel îi va plăcea sau nu.

41828
32:01:56,872 --> 32:02:02,000
Sunt alegerile neclare? Corecta. Noi

41829
32:01:59,192 --> 32:02:04,320
putea clasifica cu ușurință cântecul A. Dar când

41830
32:02:02,000 --> 32:02:06,800
alegerea a devenit complicată ca în

41831
32:02:04,320 --> 32:02:08,552
cazul cântecului B. Da. Și acolo

41832
32:02:06,800 --> 32:02:11,280
Învățarea automată intră. Să vedem

41833
32:02:08,552 --> 32:02:13,512
cum. În același exemplu pentru cântecul B, dacă

41834
32:02:11,280 --> 32:02:15,912
desenăm un cerc în jurul cântecului B, noi

41835
32:02:13,512 --> 32:02:18,640
vezi ca sunt patru voturi pentru like

41836
32:02:15,912 --> 32:02:20,872
în timp ce un vot pentru antipatie. Dacă mergem

41837
32:02:18,640 --> 32:02:22,640
pentru majoritatea voturilor, putem spune că

41838
32:02:20,872 --> 32:02:24,400
Cu siguranță lui Paul îi va plăcea melodia.

41839
32:02:22,640 --> 32:02:26,400
Asta e tot. Aceasta a fost o mașină de bază

41840
32:02:24,400 --> 32:02:28,480
algoritm de învățare de asemenea. Se numeste K

41841
32:02:26,400 --> 32:02:30,872
vecinii cei mai apropiati. Deci acesta este doar un

41842
32:02:28,480 --> 32:02:33,592
mic exemplu într-una dintre multele mașini

41843
32:02:30,872 --> 32:02:36,640
algoritmi de învățare destul de ușor corect

41844
32:02:33,592 --> 32:02:39,120
crede-mă, dar ce se întâmplă când

41845
32:02:36,640 --> 32:02:40,960
alegerile devin complicate ca în

41846
32:02:39,120 --> 32:02:43,120
cazul cântecului B, atunci mașină

41847
32:02:40,960 --> 32:02:45,192
învățarea vine în ea învață datele

41848
32:02:43,120 --> 32:02:47,440
construiește modelul de predicție și când

41849
32:02:45,192 --> 32:02:49,912
un nou punct de date vine cu ușurință

41850
32:02:47,440 --> 32:02:52,480
prezice pentru ea mai mult datele mai bine

41851
32:02:49,912 --> 32:02:54,480
modelul mai mare va fi precizia acolo

41852
32:02:52,480 --> 32:02:56,800
sunt multe moduri în care mașina

41853
32:02:54,480 --> 32:02:58,800
învață că poate fi fie supravegheat

41854
32:02:56,800 --> 32:03:00,480
învăţarea învăţării nesupravegheate sau

41855
32:02:58,800 --> 32:03:02,960
învăţarea prin întărire. Să mai întâi

41856
32:03:00,480 --> 32:03:05,192
înțelege rapid învățarea supravegheată.

41857
32:03:02,960 --> 32:03:07,592
Să presupunem că prietenul tău îți dă 1 milion

41858
32:03:05,192 --> 32:03:10,872
monede din trei monede diferite. Spune

41859
32:03:07,592 --> 32:03:12,960
1 rupie, 1 și 1 dirham. Fiecare monedă are

41860
32:03:10,872 --> 32:03:16,800
greutăți diferite. De exemplu, o monedă

41861
32:03:12,960 --> 32:03:19,512
de 1 rupia cantareste 3 g. 1 euro cantareste 7 g

41862
32:03:16,800 --> 32:03:21,832
iar 1 dirham cântărește 4 g. Modelul tău va

41863
32:03:19,512 --> 32:03:24,160
prezice moneda monedei. Aici

41864
32:03:21,832 --> 32:03:26,320
greutatea ta devine caracteristica monedelor

41865
32:03:24,160 --> 32:03:28,000
în timp ce moneda devine eticheta lor. Când

41866
32:03:26,320 --> 32:03:30,720
furnizați aceste date mașinii

41867
32:03:28,000 --> 32:03:33,120
model de învățare, învață care caracteristică

41868
32:03:30,720 --> 32:03:35,680
este asociat cu ce etichetă. Pentru

41869
32:03:33,120 --> 32:03:38,400
de exemplu, va învăța că dacă o monedă este

41870
32:03:35,680 --> 32:03:40,000
de 3 g, va fi o monedă de 1 rupia. Să

41871
32:03:38,400 --> 32:03:42,080
dă o monedă nouă mașinii. Pe

41872
32:03:40,000 --> 32:03:44,160
baza greutății noii monede,

41873
32:03:42,080 --> 32:03:46,800
modelul dvs. va prezice moneda.

41874
32:03:44,160 --> 32:03:48,720
Prin urmare, învățarea supravegheată folosește eticheta

41875
32:03:46,800 --> 32:03:50,872
date pentru antrenarea modelului. Aici,

41876
32:03:48,720 --> 32:03:53,120
mașina cunoștea caracteristicile obiectului

41877
32:03:50,872 --> 32:03:55,120
precum și etichetele asociate cu

41878
32:03:53,120 --> 32:03:57,040
acele caracteristici. În această notă, să ne mișcăm

41879
32:03:55,120 --> 32:03:58,720
la învățare nesupravegheată și pentru a vedea

41880
32:03:57,040 --> 32:04:00,720
diferenta. Să presupunem că ai cricket

41881
32:03:58,720 --> 32:04:02,872
setul de date al diverșilor jucători cu lor

41882
32:04:00,720 --> 32:04:05,040
scorurile și wicketurile respective luate.

41883
32:04:02,872 --> 32:04:07,192
Când transmitem acest set de date către

41884
32:04:05,040 --> 32:04:09,280
mașină, mașina identifică

41885
32:04:07,192 --> 32:04:10,960
modelul performanței jucătorului. Deci, asta

41886
32:04:09,280 --> 32:04:13,120
trasează aceste date cu respectivele

41887
32:04:10,960 --> 32:04:14,872
wickets pe axa x în timp ce rulează pe

41888
32:04:13,120 --> 32:04:16,960
axa y. Privind datele,

41889
32:04:14,872 --> 32:04:18,960
vei vedea clar că sunt două

41890
32:04:16,960 --> 32:04:21,280
clustere. Singurul grup sunt

41891
32:04:18,960 --> 32:04:23,832
jucători care au marcat puncte mari și au luat

41892
32:04:21,280 --> 32:04:26,080
mai puține wicket-uri în timp ce celălalt grup este

41893
32:04:23,832 --> 32:04:28,552
dintre jucătorii care au înscris mai puține puncte dar

41894
32:04:26,080 --> 32:04:30,872
a luat multe wickets. Deci aici interpretăm

41895
32:04:28,552 --> 32:04:32,800
aceste două ciorchini ca batsmen și

41896
32:04:30,872 --> 32:04:34,720
bowlieri. Punctul important de remarcat

41897
32:04:32,800 --> 32:04:37,192
iată că nu existau etichete ale

41898
32:04:34,720 --> 32:04:39,680
baterii şi bowlieri. De aici și învățarea

41899
32:04:37,192 --> 32:04:41,440
cu date neetichetate este nesupravegheată

41900
32:04:39,680 --> 32:04:43,280
învăţarea. Așa că am văzut învățarea supravegheată

41901
32:04:41,440 --> 32:04:45,192
unde au fost etichetate datele și

41902
32:04:43,280 --> 32:04:47,120
învățarea nesupravegheată unde se aflau datele

41903
32:04:45,192 --> 32:04:48,720
neetichetat. Și apoi există

41904
32:04:47,120 --> 32:04:50,640
învăţarea prin întărire care este a

41905
32:04:48,720 --> 32:04:52,400
învăţare bazată pe recompense sau putem spune asta

41906
32:04:50,640 --> 32:04:54,232
funcționează pe principiul feedback-ului.

41907
32:04:52,400 --> 32:04:56,552
Aici să presupunem că oferiți sistemul

41908
32:04:54,232 --> 32:04:59,280
cu o imagine a unui câine și cere-i să

41909
32:04:56,552 --> 32:05:01,192
identificați-l. Sistemul îl identifică ca

41910
32:04:59,280 --> 32:05:03,192
o pisica. Deci oferi un feedback negativ

41911
32:05:01,192 --> 32:05:04,872
la aparat spunându-i că e al unui câine

41912
32:05:03,192 --> 32:05:06,872
imagine. Mașina va învăța de la

41913
32:05:04,872 --> 32:05:09,120
feedback și, în sfârșit, dacă apare

41914
32:05:06,872 --> 32:05:11,120
orice altă imagine a unui câine, va putea

41915
32:05:09,120 --> 32:05:13,120
pentru a o clasifica corect. Adică

41916
32:05:11,120 --> 32:05:14,800
învăţarea prin întărire. A generaliza

41917
32:05:13,120 --> 32:05:16,960
model de învățare automată, să vedem a

41918
32:05:14,800 --> 32:05:18,552
organigramă. Intrarea este dată unei mașini

41919
32:05:16,960 --> 32:05:20,160
model de învățare care oferă apoi cel

41920
32:05:18,552 --> 32:05:22,232
ieșire conform algoritmului

41921
32:05:20,160 --> 32:05:24,872
aplicat. Dacă este corect, luăm

41922
32:05:22,232 --> 32:05:26,640
ieșire ca rezultat final. Altfel noi

41923
32:05:24,872 --> 32:05:29,680
oferi feedback la modelul de instruire

41924
32:05:26,640 --> 32:05:31,360
și cereți-i să prezică până învață. eu

41925
32:05:29,680 --> 32:05:33,192
sper că ai înțeles supravegheat și

41926
32:05:31,360 --> 32:05:35,120
învăţare nesupravegheată. Deci haideți să luăm un

41927
32:05:33,192 --> 32:05:37,040
test rapid. Trebuie să determinați

41928
32:05:35,120 --> 32:05:38,960
dacă scenariile date utilizează

41929
32:05:37,040 --> 32:05:41,192
învăţare supravegheată sau nesupravegheată.

41930
32:05:38,960 --> 32:05:43,360
Simplu, nu? Scenariul unu. Facebook

41931
32:05:41,192 --> 32:05:46,720
recunoaște prietenul tău într-o poză din

41932
32:05:43,360 --> 32:05:49,360
un album de fotografii etichetate.

41933
32:05:46,720 --> 32:05:51,440
Scenariul doi, Netflix recomandă noi

41934
32:05:49,360 --> 32:05:53,040
filme bazate pe filmul trecut al cuiva

41935
32:05:51,440 --> 32:05:55,680
alegeri.

41936
32:05:53,040 --> 32:05:58,080
Scenariul trei, analiza datelor bancare pentru

41937
32:05:55,680 --> 32:06:00,400
tranzacții suspecte și semnalarea

41938
32:05:58,080 --> 32:06:02,552
tranzacții frauduloase. Gândește cu înțelepciune și

41939
32:06:00,400 --> 32:06:04,720
comentează mai jos răspunsurile tale. Mergând mai departe,

41940
32:06:02,552 --> 32:06:06,640
nu te întrebi uneori cum este

41941
32:06:04,720 --> 32:06:08,480
învățarea automată este posibilă în zilele noastre

41942
32:06:06,640 --> 32:06:11,192
epoca? Ei bine, asta pentru că astăzi avem

41943
32:06:08,480 --> 32:06:13,680
date uriașe disponibile. Al tuturor

41944
32:06:11,192 --> 32:06:15,512
online fie efectuând o tranzacție, fie

41945
32:06:13,680 --> 32:06:17,760
doar navigând pe internet și atât

41946
32:06:15,512 --> 32:06:20,160
generând o cantitate imensă de date fiecare

41947
32:06:17,760 --> 32:06:22,232
minut. Și acele date sunt prietenul meu

41948
32:06:20,160 --> 32:06:24,232
cheia analizei. De asemenea, memoria

41949
32:06:22,232 --> 32:06:26,232
capabilitățile de manipulare ale computerelor au

41950
32:06:24,232 --> 32:06:29,120
crescut în mare măsură ceea ce îi ajută să

41951
32:06:26,232 --> 32:06:31,760
procesează o cantitate atât de mare de date la îndemână

41952
32:06:29,120 --> 32:06:34,320
fără nicio întârziere. Și da, computere

41953
32:06:31,760 --> 32:06:36,080
acum au puteri de calcul mari. Deci

41954
32:06:34,320 --> 32:06:37,912
există o mulțime de aplicații ale

41955
32:06:36,080 --> 32:06:39,680
învățare automată acolo. Pentru a numi un

41956
32:06:37,912 --> 32:06:41,512
puține, învățarea automată este folosită în

41957
32:06:39,680 --> 32:06:43,280
asistență medicală acolo unde sunt diagnostice

41958
32:06:41,512 --> 32:06:45,280
prezis pentru evaluarea medicului. The

41959
32:06:43,280 --> 32:06:47,440
analiza sentimentelor pe care giganții tehnologiei

41960
32:06:45,280 --> 32:06:49,120
fac pe rețelele sociale este alta

41961
32:06:47,440 --> 32:06:51,040
aplicație interesantă a mașinii

41962
32:06:49,120 --> 32:06:53,040
învăţarea. Detectarea fraudelor în finanțe

41963
32:06:51,040 --> 32:06:54,960
sector și, de asemenea, pentru a anticipa clientul

41964
32:06:53,040 --> 32:06:57,040
abandon în sectorul comerțului electronic. în timp ce

41965
32:06:54,960 --> 32:06:59,512
rezervarea unui taxi, trebuie să fi întâlnit

41966
32:06:57,040 --> 32:07:01,592
caută adesea prețuri acolo unde scrie

41967
32:06:59,512 --> 32:07:03,592
târgul călătoriei dvs. a fost actualizat.

41968
32:07:01,592 --> 32:07:06,480
Continuați rezervarea. Da, te rog. Im

41969
32:07:03,592 --> 32:07:08,480
întârzierea la birou. Ei bine, asta e un

41970
32:07:06,480 --> 32:07:10,960
model interesant de învățare automată care

41971
32:07:08,480 --> 32:07:12,640
este folosit de gigantul global al taximetriei Uber și

41972
32:07:10,960 --> 32:07:14,872
altele unde au diferential

41973
32:07:12,640 --> 32:07:16,960
stabilirea prețurilor în timp real în funcție de cerere,

41974
32:07:14,872 --> 32:07:19,592
numărul de mașini disponibile, rău

41975
32:07:16,960 --> 32:07:21,912
vremea, ora de vârf etc. Deci folosesc

41976
32:07:19,592 --> 32:07:24,640
modelul de prețuri de căutare pentru a se asigura că

41977
32:07:21,912 --> 32:07:27,120
cei care au nevoie de un taxi pot lua unul. De asemenea,

41978
32:07:24,640 --> 32:07:29,120
folosește modelarea predictivă pentru a prezice

41979
32:07:27,120 --> 32:07:31,192
unde cererea va fi mare cu a

41980
32:07:29,120 --> 32:07:33,040
obiectivul că șoferii pot avea grijă de

41981
32:07:31,192 --> 32:07:35,280
cererea și prețurile de căutare pot fi

41982
32:07:33,040 --> 32:07:37,760
minimizat. Mare. Hei Siri, poți

41983
32:07:35,280 --> 32:07:39,592
Amintește-mi să rezerv un taxi la 18:00. astăzi?

41984
32:07:37,760 --> 32:07:40,400
>> Bine, vă reamintesc.

41985
32:07:39,592 --> 32:07:41,280
>> Mulțumesc.

41986
32:07:40,400 --> 32:07:43,360
>> Nicio problemă.

41987
32:07:41,280 --> 32:07:45,592
>> Comentează mai jos câteva interesante de zi cu zi

41988
32:07:43,360 --> 32:07:48,400
exemple în jurul tău unde sunt mașinile

41989
32:07:45,592 --> 32:07:51,040
învățând și făcând locuri de muncă uimitoare. Bună

41990
32:07:48,400 --> 32:07:52,960
băieți, acesta este Acha de la SimplyLearn și

41991
32:07:51,040 --> 32:07:55,120
vom vorbi despre cele două tipuri

41992
32:07:52,960 --> 32:07:57,440
de învățare automată supravegheată și

41993
32:07:55,120 --> 32:07:59,440
învăţarea nesupravegheată tipurile lor şi

41994
32:07:57,440 --> 32:08:01,440
aplicatii. Dar înainte să vorbim despre

41995
32:07:59,440 --> 32:08:02,960
ei, să înțelegem repede ce este

41996
32:08:01,440 --> 32:08:05,120
învățarea automată. Aceste zile

41997
32:08:02,960 --> 32:08:07,280
aplicațiile folosesc inteligența artificială

41998
32:08:05,120 --> 32:08:10,080
în învățarea automată pentru a optimiza vorbirea

41999
32:08:07,280 --> 32:08:12,640
recunoaștere. De obicei, o întreb pe Siri lucruri pe care eu

42000
32:08:10,080 --> 32:08:14,800
Vreau să știu ca hei Siri cât de departe este

42001
32:08:12,640 --> 32:08:17,120
cel mai apropiat metrou? Deci ori de câte ori întrebăm

42002
32:08:14,800 --> 32:08:19,592
ceva pentru Siri, un discurs puternic

42003
32:08:17,120 --> 32:08:21,912
recunoașterea începe și transformă

42004
32:08:19,592 --> 32:08:23,832
audio în textul corespunzător

42005
32:08:21,912 --> 32:08:26,232
formular care este apoi trimis la Apple

42006
32:08:23,832 --> 32:08:28,320
servere pentru prelucrare ulterioară. Apoi

42007
32:08:26,232 --> 32:08:31,120
algoritmi de procesare a limbajului neuronal

42008
32:08:28,320 --> 32:08:33,192
sunt rulate pentru a înțelege intenția utilizatorului

42009
32:08:31,120 --> 32:08:35,040
și apoi în cele din urmă Siri îți spune

42010
32:08:33,192 --> 32:08:37,040
răspuns. Ei bine, asta este mașina

42011
32:08:35,040 --> 32:08:39,912
învăţarea este totul despre. realizarea

42012
32:08:37,040 --> 32:08:42,160
mașinile învață și acționează ca oamenii prin

42013
32:08:39,912 --> 32:08:44,552
hrănindu-i cu date și informații

42014
32:08:42,160 --> 32:08:46,720
fără a fi programat în mod explicit. Ca

42015
32:08:44,552 --> 32:08:48,800
am văzut în exemplul anterior, când

42016
32:08:46,720 --> 32:08:51,192
datele vin, mașinile imediat

42017
32:08:48,800 --> 32:08:53,912
începe să analizeze datele și în cele din urmă

42018
32:08:51,192 --> 32:08:56,232
se antrenează și o învață. Acum

42019
32:08:53,912 --> 32:08:58,080
când intră un nou punct de date, mașină

42020
32:08:56,232 --> 32:09:00,480
face cu acurateţe predicţie şi

42021
32:08:58,080 --> 32:09:02,232
decizii bazate pe date din trecut. Acum

42022
32:09:00,480 --> 32:09:03,592
că știi ce este învățarea automată,

42023
32:09:02,232 --> 32:09:05,360
să vorbim despre supravegheat şi

42024
32:09:03,592 --> 32:09:07,360
învăţare nesupravegheată. Supravegheat

42025
32:09:05,360 --> 32:09:09,440
învățarea așa cum sugerează și numele lucrează

42026
32:09:07,360 --> 32:09:11,280
sub supraveghere, adică este a

42027
32:09:09,440 --> 32:09:13,592
învățarea în care este antrenată mașina

42028
32:09:11,280 --> 32:09:15,360
cu date care sunt bine etichetate și apoi

42029
32:09:13,592 --> 32:09:18,000
prezice cu ajutorul datelor etichetei

42030
32:09:15,360 --> 32:09:19,912
set. Dar ce este un set de date de etichetă? Date

42031
32:09:18,000 --> 32:09:22,800
pentru care cunoști deja ținta

42032
32:09:19,912 --> 32:09:25,120
răspunsul se numește date de etichetă. Ca si eu

42033
32:09:22,800 --> 32:09:28,800
arata o imagine si iti spune ca este

42034
32:09:25,120 --> 32:09:30,720
un câine, atunci este o etichetă de date. În timp ce dacă eu

42035
32:09:28,800 --> 32:09:32,800
arata o imagine fara sa iti spuna

42036
32:09:30,720 --> 32:09:35,440
ce anume este, atunci este un

42037
32:09:32,800 --> 32:09:37,832
date neetichetate. Acum să spunem că avem

42038
32:09:35,440 --> 32:09:39,832
imagini care sunt etichetate ca lingură sau

42039
32:09:37,832 --> 32:09:41,912
cuțit. Apoi îl alimentam la mașină

42040
32:09:39,832 --> 32:09:43,912
care analizeaza si invata cele

42041
32:09:41,912 --> 32:09:46,320
asocierea acestor imagini cu ei

42042
32:09:43,912 --> 32:09:50,480
etichete bazate pe caracteristicile sale, cum ar fi

42043
32:09:46,320 --> 32:09:52,480
forma, dimensiunea, claritatea etc. Acum, când a

42044
32:09:50,480 --> 32:09:54,640
noua imagine este alimentată la mașină fără

42045
32:09:52,480 --> 32:09:56,160
orice etichetă cu ajutorul datelor din trecut

42046
32:09:54,640 --> 32:09:58,640
mașina este capabilă să prezică

42047
32:09:56,160 --> 32:10:00,872
cu acuratețe și spuneți că este o lingură.

42048
32:09:58,640 --> 32:10:02,720
Prin urmare, în învățarea automată supravegheată

42049
32:10:00,872 --> 32:10:04,552
algoritmul învață modelul să învețe

42050
32:10:02,720 --> 32:10:07,040
din exemplul etichetat că noi

42051
32:10:04,552 --> 32:10:09,360
oferi. Deci învățarea supravegheată poate fi

42052
32:10:07,040 --> 32:10:11,192
împărțit în continuare în clasificare și

42053
32:10:09,360 --> 32:10:13,280
regresie. Este o clasificare

42054
32:10:11,192 --> 32:10:16,000
problemă când variabila de ieșire este

42055
32:10:13,280 --> 32:10:19,040
categoric, cum ar fi roșu sau albastru, boală

42056
32:10:16,000 --> 32:10:20,960
sau nicio boală, bărbat sau femeie. întrucât

42057
32:10:19,040 --> 32:10:23,760
este o problemă de regresie atunci când

42058
32:10:20,960 --> 32:10:26,720
variabila de ieșire este reală sau continuă

42059
32:10:23,760 --> 32:10:29,280
valoare. De exemplu, salariul bazat pe muncă

42060
32:10:26,720 --> 32:10:31,280
experiență, greutate în funcție de înălțime. Aşa

42061
32:10:29,280 --> 32:10:34,160
creează un model predictiv care arată

42062
32:10:31,280 --> 32:10:36,232
tendințe în date. Așa că acum, dacă spun că voi

42063
32:10:34,160 --> 32:10:38,872
primește sau nu o creștere de salariu, asta e

42064
32:10:36,232 --> 32:10:41,040
clasificare. Dar dacă spun cât

42065
32:10:38,872 --> 32:10:42,960
Voi primi o creștere de salariu, adică

42066
32:10:41,040 --> 32:10:44,552
regresie. Acum să înțelegem

42067
32:10:42,960 --> 32:10:46,872
clasificare cu ajutorul unui

42068
32:10:44,552 --> 32:10:49,680
exemplu. Pentru a prezice dacă an

42069
32:10:46,872 --> 32:10:51,832
e-mailul este un spam sau nu, mai întâi trebuie

42070
32:10:49,680 --> 32:10:54,160
învățați mașina noastră cum arată un mesaj spam

42071
32:10:51,832 --> 32:10:57,040
ca. Acest lucru se face pe baza multor

42072
32:10:54,160 --> 32:10:59,280
filtrele de spam, cum ar fi revizuirea mai întâi a

42073
32:10:57,040 --> 32:11:01,512
conținutul e-mailului, apoi examinați

42074
32:10:59,280 --> 32:11:03,760
antet de e-mail și căutați dacă conține

42075
32:11:01,512 --> 32:11:08,552
orice informație falsificată. Acest lucru este făcut

42076
32:11:03,760 --> 32:11:12,160
pe baza unor cuvinte cheie, cum ar fi loteria gratuită

42077
32:11:08,552 --> 32:11:14,800
revendicarea premiului etc. Apoi lista neagră generală

42078
32:11:12,160 --> 32:11:18,000
filtre pentru a opri e-mailurile care provin de la

42079
32:11:14,800 --> 32:11:20,872
deja pe lista neagră de spammeri cunoscuți și

42080
32:11:18,000 --> 32:11:23,680
etc. Deci toate aceste filtre marchează

42081
32:11:20,872 --> 32:11:26,160
e-mail cunoscut sub numele de scor de spam. The

42082
32:11:23,680 --> 32:11:28,400
reduceți scorul total de spam al e-mailului,

42083
32:11:26,160 --> 32:11:31,280
este mai probabil ca e-mailul să o facă

42084
32:11:28,400 --> 32:11:34,552
aterizează în căsuțele de e-mail ale abonaților. Deci bazat pe

42085
32:11:31,280 --> 32:11:37,360
etichetele de conținut și scorul de spam al

42086
32:11:34,552 --> 32:11:40,160
noi e-mailuri primite, algoritmul decide

42087
32:11:37,360 --> 32:11:42,320
dacă ar trebui să aterizeze în inbox sau în

42088
32:11:40,160 --> 32:11:44,480
dosarul spam. Acum haideți repede

42089
32:11:42,320 --> 32:11:46,800
înțelege regresia. Deci să spunem noi

42090
32:11:44,480 --> 32:11:49,280
au două variabile, adică temperatura

42091
32:11:46,800 --> 32:11:51,760
și umiditatea unde temperatura este

42092
32:11:49,280 --> 32:11:54,000
variabila independenta si umiditatea este

42093
32:11:51,760 --> 32:11:56,552
variabilă dependentă, cum ar fi

42094
32:11:54,000 --> 32:11:58,872
temperatura crește umiditatea scade

42095
32:11:56,552 --> 32:12:01,040
deci sunt corelate. Când ne hrănim

42096
32:11:58,872 --> 32:12:02,552
aceste date la un model de regresie va

42097
32:12:01,040 --> 32:12:05,592
înţelege relaţia dintre

42098
32:12:02,552 --> 32:12:07,680
aceste două variabile și cum o variabilă

42099
32:12:05,592 --> 32:12:10,160
depinde de celălalt. După mașină

42100
32:12:07,680 --> 32:12:12,800
este antrenat poate prezice cu ușurință

42101
32:12:10,160 --> 32:12:15,512
umiditatea în funcție de temperatura dată.

42102
32:12:12,800 --> 32:12:17,440
Ei bine, a fost vorba despre regresie. Acum,

42103
32:12:15,512 --> 32:12:19,760
să vedem câteva aplicații din viața reală

42104
32:12:17,440 --> 32:12:21,592
unde se foloseşte învăţarea supravegheată. Deci,

42105
32:12:19,760 --> 32:12:24,160
învățarea supravegheată este utilizată în risc

42106
32:12:21,592 --> 32:12:26,640
evaluare pentru a evalua riscul financiar

42107
32:12:24,160 --> 32:12:28,400
servicii sau un domeniu de asigurare la

42108
32:12:26,640 --> 32:12:30,480
minimiza portofoliul de risc al

42109
32:12:28,400 --> 32:12:32,400
companiilor. Clasificarea imaginilor.

42110
32:12:30,480 --> 32:12:34,640
Facebook vă recunoaște prietenul într-un

42111
32:12:32,400 --> 32:12:36,800
imagine dintr-un album de fotografii de tact.

42112
32:12:34,640 --> 32:12:38,320
Deci, clasificarea imaginilor este una dintre cele

42113
32:12:36,800 --> 32:12:40,400
cazuri cheie de utilizare a demonstrației

42114
32:12:38,320 --> 32:12:43,192
algoritmi de învățare automată supravegheați.

42115
32:12:40,400 --> 32:12:46,160
În mod evident, sunt multe altele în toate acestea

42116
32:12:43,192 --> 32:12:48,320
precum rețelele neuronale convoluționale etc.

42117
32:12:46,160 --> 32:12:50,720
Detectarea fraudei dacă tranzacțiile

42118
32:12:48,320 --> 32:12:53,192
realizate de utilizator sunt autentice sau nu

42119
32:12:50,720 --> 32:12:55,280
și recunoașterea vizuală capacitatea de a

42120
32:12:53,192 --> 32:12:58,232
model de învățare automată pentru a identifica

42121
32:12:55,280 --> 32:13:00,552
obiectele plasează oamenii și acțiunile în

42122
32:12:58,232 --> 32:13:02,800
imagini. Acum să vorbim repede despre

42123
32:13:00,552 --> 32:13:04,960
învăţare nesupravegheată. În nesupravegheat

42124
32:13:02,800 --> 32:13:06,960
învăţare, nu există nicio supraveghere care

42125
32:13:04,960 --> 32:13:09,680
nu se va acorda nicio formare

42126
32:13:06,960 --> 32:13:12,400
mașină care îi permite să acționeze asupra datelor

42127
32:13:09,680 --> 32:13:14,872
care nu este etichetat. Prin urmare, mașină

42128
32:13:12,400 --> 32:13:17,192
încearcă să identifice tipare și dă

42129
32:13:14,872 --> 32:13:19,512
răspuns. Să luăm un exemplu similar

42130
32:13:17,192 --> 32:13:21,360
ca înainte. Dar de data asta nu spunem

42131
32:13:19,512 --> 32:13:24,232
aparatul fie că este o lingură sau o

42132
32:13:21,360 --> 32:13:27,192
cuțit. Aparatul identifică modele

42133
32:13:24,232 --> 32:13:30,232
din setul dat și le grupează pe baza

42134
32:13:27,192 --> 32:13:32,400
pe modelele, asemănările lor etc.

42135
32:13:30,232 --> 32:13:34,552
Din nou, învățarea nesupravegheată poate fi

42136
32:13:32,400 --> 32:13:36,960
grupate în continuare în clustering și

42137
32:13:34,552 --> 32:13:39,440
asociere. Clustering este practic

42138
32:13:36,960 --> 32:13:41,680
unde mașina formează grupuri pe baza

42139
32:13:39,440 --> 32:13:44,000
comportamentul datelor. În al doilea rând,

42140
32:13:41,680 --> 32:13:45,912
asociere. Este o mașină bazată pe reguli

42141
32:13:44,000 --> 32:13:48,400
învăţând să descopere interesante

42142
32:13:45,912 --> 32:13:51,040
relația dintre variabilele din datele mari

42143
32:13:48,400 --> 32:13:54,000
seturi. De exemplu, ce client a făcut

42144
32:13:51,040 --> 32:13:56,872
achizițiile de produse similare se grupează.

42145
32:13:54,000 --> 32:13:59,192
În timp ce asocierea este ce produse

42146
32:13:56,872 --> 32:14:00,800
au fost cumpărate împreună. Acum hai

42147
32:13:59,192 --> 32:14:03,280
înţelege clusteringul cu ajutorul

42148
32:14:00,800 --> 32:14:05,680
un exemplu. Pentru a-și reduce rata de abandon,

42149
32:14:03,280 --> 32:14:08,160
o companie de telecomunicații studiază comportamentul

42150
32:14:05,680 --> 32:14:11,192
a clienților pe baza apelului mediu

42151
32:14:08,160 --> 32:14:13,192
durata și utilizarea internetului și observă

42152
32:14:11,192 --> 32:14:15,360
asta in timp ce unii clienti apeleaza durata

42153
32:14:13,192 --> 32:14:17,512
este destul de mare, altele au grele

42154
32:14:15,360 --> 32:14:19,912
utilizarea internetului. Clienții sunt

42155
32:14:17,512 --> 32:14:22,232
grupate pe baza comportamentului lor observat

42156
32:14:19,912 --> 32:14:24,800
și se adoptă o strategie de minimizare

42157
32:14:22,232 --> 32:14:27,512
rata de abandon și maximizarea profitului prin

42158
32:14:24,800 --> 32:14:28,872
promoții și campanii adecvate. Ca

42159
32:14:27,512 --> 32:14:31,120
puteți vedea în graficul din dreapta

42160
32:14:28,872 --> 32:14:33,280
partea de mână, clienții din grupa A utilizează

42161
32:14:31,120 --> 32:14:35,912
mai multe date și, de asemenea, au mare

42162
32:14:33,280 --> 32:14:38,400
calificare. Clienții din grupa B sunt grei

42163
32:14:35,912 --> 32:14:41,120
utilizatorii de internet în timp ce clienții grupului C

42164
32:14:38,400 --> 32:14:43,592
au o calitate înaltă. Deci grupa B va fi

42165
32:14:41,120 --> 32:14:45,832
date mai multe planuri de beneficii în timp ce

42166
32:14:43,592 --> 32:14:48,000
Grupului C li se vor acorda tarife de apel mai ieftine

42167
32:14:45,832 --> 32:14:50,080
să le cumpere loialitatea. Deci acesta a fost

42168
32:14:48,000 --> 32:14:52,160
exemplu de grupare. Acum hai

42169
32:14:50,080 --> 32:14:54,552
înțelege asocierea cu altul

42170
32:14:52,160 --> 32:14:56,872
exemplu. Să presupunem că se adresează clientul unu

42171
32:14:54,552 --> 32:15:00,232
un supermarket și cumpără aceste produse.

42172
32:14:56,872 --> 32:15:03,440
spune pâine, lapte, fructe, grâu. Apoi

42173
32:15:00,232 --> 32:15:06,640
clientul doi merge și cumpără pâine, lapte,

42174
32:15:03,440 --> 32:15:09,832
orez și unt. Acum când clientul trei

42175
32:15:06,640 --> 32:15:12,400
merge și cumpără pâine, este foarte probabil

42176
32:15:09,832 --> 32:15:14,480
că va cumpăra și lapte. Prin urmare

42177
32:15:12,400 --> 32:15:16,720
relatia se stabileste pe baza

42178
32:15:14,480 --> 32:15:19,120
comportamentul și recomandările clienților

42179
32:15:16,720 --> 32:15:20,960
sunt realizate. Acum să ne uităm la unele reale

42180
32:15:19,120 --> 32:15:23,192
aplicații de viață nesupravegheate

42181
32:15:20,960 --> 32:15:25,040
învăţarea. Analiza coșului de piață este a

42182
32:15:23,192 --> 32:15:26,872
model de învățare automată bazat pe

42183
32:15:25,040 --> 32:15:28,872
algoritm că dacă cumperi un anumit

42184
32:15:26,872 --> 32:15:30,960
grup de articole, sunteți mai puțin sau mai mult

42185
32:15:28,872 --> 32:15:32,960
probabil să cumpere un alt grup de articole.

42186
32:15:30,960 --> 32:15:35,360
Gruparea semantică. Din punct de vedere semantic

42187
32:15:32,960 --> 32:15:37,360
cuvinte similare au un context similar.

42188
32:15:35,360 --> 32:15:39,592
Oamenii își postează întrebările pe site-uri web în

42189
32:15:37,360 --> 32:15:42,160
propriile lor moduri. Gruparea semantică

42190
32:15:39,592 --> 32:15:44,640
grupează toate răspunsurile într-un grup cu

42191
32:15:42,160 --> 32:15:47,040
același sens pentru a se asigura că clientul

42192
32:15:44,640 --> 32:15:49,360
găsește rapid informațiile pe care le doresc

42193
32:15:47,040 --> 32:15:51,760
si usor. Joacă un rol important

42194
32:15:49,360 --> 32:15:54,232
în regăsirea informaţiilor. Navigare bună

42195
32:15:51,760 --> 32:15:56,160
experiență și înțelegere. Livrare

42196
32:15:54,232 --> 32:15:58,080
optimizarea magazinului. Învățare automată

42197
32:15:56,160 --> 32:16:00,872
modelele sunt folosite pentru a prezice cererea

42198
32:15:58,080 --> 32:16:03,040
și ține pasul cu aprovizionarea, de asemenea, pentru a deschide

42199
32:16:00,872 --> 32:16:04,872
magazine unde cererea este mai mare şi

42200
32:16:03,040 --> 32:16:07,280
optimizarea rutelor pentru mai eficient

42201
32:16:04,872 --> 32:16:09,440
livrări conform datelor anterioare și

42202
32:16:07,280 --> 32:16:11,440
comportament. Putem folosi și nesupravegheat

42203
32:16:09,440 --> 32:16:13,592
modele de învățare automată pentru a identifica

42204
32:16:11,440 --> 32:16:15,512
zone predispuse la accidente pe baza

42205
32:16:13,592 --> 32:16:17,832
intensitatea acelor accidente și a

42206
32:16:15,512 --> 32:16:19,832
zona pentru a introduce siguranta

42207
32:16:17,832 --> 32:16:21,680
măsuri. Până acum sper că ai făcut-o

42208
32:16:19,832 --> 32:16:24,000
înțeles supravegheat și nesupravegheat

42209
32:16:21,680 --> 32:16:25,832
învăţarea. Pentru o recapitulare rapidă, să vedem a

42210
32:16:24,000 --> 32:16:27,680
putine diferente intre cele doua. The

42211
32:16:25,832 --> 32:16:29,592
cea mai fundamentală diferență este că

42212
32:16:27,680 --> 32:16:31,680
învăţarea supervizată utilizări cunoscute şi

42213
32:16:29,592 --> 32:16:33,912
date etichetate și învățare nesupravegheată

42214
32:16:31,680 --> 32:16:36,000
utilizează date neetichetate ca intrare.

42215
32:16:33,912 --> 32:16:38,160
În al doilea rând, învățarea supravegheată urmează a

42216
32:16:36,000 --> 32:16:40,720
mecanism de feedback în timp ce nu este supravegheat

42217
32:16:38,160 --> 32:16:42,872
învăţarea nu. De asemenea, cel mai mult

42218
32:16:40,720 --> 32:16:44,872
algoritmi folosiți în mod obișnuit în supraveghere

42219
32:16:42,872 --> 32:16:47,760
învățarea sunt arbore de decizie, logistică

42220
32:16:44,872 --> 32:16:50,000
regresie, mașină vector suport etc.

42221
32:16:47,760 --> 32:16:51,832
Și în învățarea nesupravegheată există K

42222
32:16:50,000 --> 32:16:54,552
înseamnă grupare, ierarhic

42223
32:16:51,832 --> 32:16:55,040
clustering, algoritm a priori și multe

42224
32:16:54,552 --> 32:16:57,360
mai mult.

42225
32:16:55,040 --> 32:16:59,592
>> Bine ați venit la regresia liniară. Numele meu este

42226
32:16:57,360 --> 32:17:01,760
Richard Kersner. Sunt cu SimplyLearn.

42227
32:16:59,592 --> 32:17:04,232
Să ne uităm la un exemplu de utilizare comună

42228
32:17:01,760 --> 32:17:06,320
pentru regresia liniară, estimarea profitului

42229
32:17:04,232 --> 32:17:08,160
a unei companii. Dacă aveam de gând să investesc

42230
32:17:06,320 --> 32:17:10,160
într-o companie, aș dori să știu cum

42231
32:17:08,160 --> 32:17:11,680
multi bani pe care ma asteptam sa ii fac. Deci

42232
32:17:10,160 --> 32:17:14,320
vom arunca o privire asupra unei aventuri

42233
32:17:11,680 --> 32:17:16,400
firma capitalistă și încercați să înțelegeți

42234
32:17:14,320 --> 32:17:18,720
în ce companii ar trebui să investească.

42235
32:17:16,400 --> 32:17:20,800
Deci vom lua ideea de care avem nevoie

42236
32:17:18,720 --> 32:17:22,800
decide companiile în care să investească. Noi

42237
32:17:20,800 --> 32:17:24,400
trebuie să prezică profitul companiei

42238
32:17:22,800 --> 32:17:27,120
face și o vom face pe baza

42239
32:17:24,400 --> 32:17:29,912
cheltuielile firmei şi chiar doar a

42240
32:17:27,120 --> 32:17:31,512
cheltuială specifică. În acest caz avem

42241
32:17:29,912 --> 32:17:33,832
compania noastră, avem diferit

42242
32:17:31,512 --> 32:17:35,440
cheltuieli. Deci avem RandD-ul nostru, care este

42243
32:17:33,832 --> 32:17:37,832
cercetarea și dezvoltarea dvs. Avem

42244
32:17:35,440 --> 32:17:39,832
marketingul nostru. Uh, am putea avea

42245
32:17:37,832 --> 32:17:41,912
locație. S-ar putea să avem ce fel de

42246
32:17:39,832 --> 32:17:43,832
administratia prin care trece. Bazat

42247
32:17:41,912 --> 32:17:45,680
pe toate aceste informații diferite, noi

42248
32:17:43,832 --> 32:17:48,000
ar dori să calculeze profitul. Acum,

42249
32:17:45,680 --> 32:17:50,400
de fapt, sunt de obicei aproximativ 23

42250
32:17:48,000 --> 32:17:52,552
la 27 de markere diferite pe care le arată

42251
32:17:50,400 --> 32:17:54,160
la dacă sunt un investitor greoi.

42252
32:17:52,552 --> 32:17:56,160
Vom arunca o privire doar la unul

42253
32:17:54,160 --> 32:17:58,080
unul de bază. O să intrăm și

42254
32:17:56,160 --> 32:18:00,320
pentru simplitate, să luăm în considerare un singur

42255
32:17:58,080 --> 32:18:02,232
variabilă, RandD, și aflați care

42256
32:18:00,320 --> 32:18:04,080
companiile în care să investească pe baza asta.

42257
32:18:02,232 --> 32:18:06,480
Deci, luăm RandD-ul nostru și complotăm

42258
32:18:04,080 --> 32:18:07,912
profitul bazat pe cheltuielile RandD,

42259
32:18:06,480 --> 32:18:09,592
câți bani au băgat în

42260
32:18:07,912 --> 32:18:11,592
cercetare si dezvoltare. Și apoi noi

42261
32:18:09,592 --> 32:18:13,832
uită-te la profitul care vine cu asta.

42262
32:18:11,592 --> 32:18:15,280
Putem prezice o linie pentru a estima

42263
32:18:13,832 --> 32:18:16,640
profit. Deci putem trage o linie la dreapta

42264
32:18:15,280 --> 32:18:18,232
prin date. Și când te uiți la

42265
32:18:16,640 --> 32:18:20,480
asta, poți vedea cât investesc

42266
32:18:18,232 --> 32:18:22,000
în RandD este un bun indicator despre cum

42267
32:18:20,480 --> 32:18:23,760
mult profit vor avea. Noi

42268
32:18:22,000 --> 32:18:26,232
pot observa, de asemenea, că companiile cheltuiesc

42269
32:18:23,760 --> 32:18:27,912
mai multe despre RandD face profit bun. Deci haideți

42270
32:18:26,232 --> 32:18:30,720
investiți în cei care cheltuiesc mai mult

42271
32:18:27,912 --> 32:18:32,160
rata în RandD lor. Ce este pentru tine?

42272
32:18:30,720 --> 32:18:34,080
În primul rând, vom avea o introducere

42273
32:18:32,160 --> 32:18:36,080
învățarea automată urmată de învățarea automată

42274
32:18:34,080 --> 32:18:38,480
algoritmi de învățare. Acestea vor fi

42275
32:18:36,080 --> 32:18:40,480
specific regresiei liniare şi unde

42276
32:18:38,480 --> 32:18:42,000
se incadreaza in modelul mai mare. Apoi

42277
32:18:40,480 --> 32:18:44,232
vom arunca o privire asupra aplicațiilor de

42278
32:18:42,000 --> 32:18:46,400
regresie liniară, înțelegere liniară

42279
32:18:44,232 --> 32:18:48,232
regresie și liniară multiplă

42280
32:18:46,400 --> 32:18:50,320
regresie. În cele din urmă, ne vom rula

42281
32:18:48,232 --> 32:18:53,120
mâneci și faceți puțină programare

42282
32:18:50,320 --> 32:18:55,440
estimarea profitului de caz al companiilor.

42283
32:18:53,120 --> 32:18:56,960
Să mergem înainte și să sărim. Să începem

42284
32:18:55,440 --> 32:18:58,800
cu introducerea noastră în mașină

42285
32:18:56,960 --> 32:19:00,640
învățând împreună cu o mașină

42286
32:18:58,800 --> 32:19:02,552
algoritmi de învățare și unde se potrivește

42287
32:19:00,640 --> 32:19:04,000
în cu regresie liniară. Să ne uităm la

42288
32:19:02,552 --> 32:19:05,912
un alt exemplu de învățare automată.

42289
32:19:04,000 --> 32:19:08,160
Pe baza cantității de precipitații, cum

42290
32:19:05,912 --> 32:19:10,552
cat ar fi randamentul recoltei? Deci noi aici

42291
32:19:08,160 --> 32:19:12,000
avem recoltele noastre, avem precipitațiile noastre,

42292
32:19:10,552 --> 32:19:14,480
și vrem să știm cât de mult mergem

42293
32:19:12,000 --> 32:19:16,160
pentru a obține din culturile noastre anul acesta. Deci

42294
32:19:14,480 --> 32:19:18,480
vom introduce două variabile,

42295
32:19:16,160 --> 32:19:20,720
independenta si dependenta. The

42296
32:19:18,480 --> 32:19:22,720
variabilă independentă este o variabilă a cărei

42297
32:19:20,720 --> 32:19:24,160
valoarea nu se modifică prin efectul

42298
32:19:22,720 --> 32:19:26,160
alte variabile și este obișnuit să

42299
32:19:24,160 --> 32:19:28,640
manipularea variabilei dependente. Este

42300
32:19:26,160 --> 32:19:30,872
adesea notat cu X. În exemplul nostru,

42301
32:19:28,640 --> 32:19:32,552
precipitațiile sunt variabila independentă.

42302
32:19:30,872 --> 32:19:34,552
Acesta este un exemplu minunat pentru că tu

42303
32:19:32,552 --> 32:19:36,552
putem vedea cu ușurință că nu putem controla

42304
32:19:34,552 --> 32:19:38,872
ploaia, dar ploaia controlează

42305
32:19:36,552 --> 32:19:40,400
recolta. Deci vorbim despre independent

42306
32:19:38,872 --> 32:19:42,000
variabilă care controlează dependenta

42307
32:19:40,400 --> 32:19:43,832
variabilă. Să definim dependent

42308
32:19:42,000 --> 32:19:46,160
variabilă ca variabilă a cărei valoare

42309
32:19:43,832 --> 32:19:48,400
schimbare atunci când există vreo manipulare în

42310
32:19:46,160 --> 32:19:50,400
valorile variabilelor independente.

42311
32:19:48,400 --> 32:19:52,160
Este adesea notat cu y. Și poți

42312
32:19:50,400 --> 32:19:54,160
vezi aici randamentul recoltei noastre este dependent

42313
32:19:52,160 --> 32:19:56,160
variabilă și este dependentă de

42314
32:19:54,160 --> 32:19:57,832
cantitatea de precipitații primită. Acum că

42315
32:19:56,160 --> 32:19:59,760
ne-am uitat la o viață reală

42316
32:19:57,832 --> 32:20:02,720
de exemplu, haideți să intrăm puțin în

42317
32:19:59,760 --> 32:20:04,552
teorie și câteva definiții despre mașină

42318
32:20:02,720 --> 32:20:06,800
învățați și vedeți cum se potrivește

42319
32:20:04,552 --> 32:20:09,912
cu regresie liniară. numeric şi

42320
32:20:06,800 --> 32:20:11,832
valori categorice. Să luăm datele noastre

42321
32:20:09,912 --> 32:20:14,160
intră și asta e oarecum întâmplător

42322
32:20:11,832 --> 32:20:16,080
date din orice fel de proiect. Vrem

42323
32:20:14,160 --> 32:20:19,360
pentru a o împărţi în numerice şi

42324
32:20:16,080 --> 32:20:23,280
categoric. Deci numerice sunt numerele,

42325
32:20:19,360 --> 32:20:26,400
vârsta, salariul, înălțimea, unde categoric

42326
32:20:23,280 --> 32:20:29,040
ar fi o descriere, culoarea, a

42327
32:20:26,400 --> 32:20:30,960
rasa câinelui, genul. Categoric este

42328
32:20:29,040 --> 32:20:34,232
limitat la articole foarte specifice unde

42329
32:20:30,960 --> 32:20:36,000
numeric este o serie de informații. Acum

42330
32:20:34,232 --> 32:20:38,640
că ai văzut diferența între

42331
32:20:36,000 --> 32:20:40,400
date numerice și categoriale, haideți

42332
32:20:38,640 --> 32:20:42,640
aruncați o privire la o altă mașină

42333
32:20:40,400 --> 32:20:43,760
învățarea definițiilor. Când ne uităm la

42334
32:20:42,640 --> 32:20:46,160
învățarea noastră automată diferită

42335
32:20:43,760 --> 32:20:50,080
algoritmi, îi putem împărți în

42336
32:20:46,160 --> 32:20:51,912
trei zone. Supravegheat, nesupravegheat,

42337
32:20:50,080 --> 32:20:54,720
întărire. O să ne uităm doar

42338
32:20:51,912 --> 32:20:56,320
la supravegheat astăzi. Mijloace nesupravegheate

42339
32:20:54,720 --> 32:20:58,640
nu avem răspunsurile și suntem doar

42340
32:20:56,320 --> 32:21:01,040
gruparea lucrurilor. Întărirea este locul unde

42341
32:20:58,640 --> 32:21:03,360
oferim feedback pozitiv și negativ

42342
32:21:01,040 --> 32:21:04,872
la algoritmul nostru pentru a-l programa. și acesta

42343
32:21:03,360 --> 32:21:06,480
nu are informatiile decat dupa

42344
32:21:04,872 --> 32:21:07,912
faptul. Dar astăzi doar căutăm

42345
32:21:06,480 --> 32:21:10,400
la supravegheat pentru că acolo

42346
32:21:07,912 --> 32:21:12,552
regresia liniară se încadrează în. În supravegheat

42347
32:21:10,400 --> 32:21:14,800
date, avem datele noastre deja acolo și

42348
32:21:12,552 --> 32:21:17,040
răspunsurile noastre pentru un grup. Și apoi folosim

42349
32:21:14,800 --> 32:21:19,192
asta să ne programăm modelul și să vină

42350
32:21:17,040 --> 32:21:21,040
cu un răspuns. Cele mai frecvente două utilizări

42351
32:21:19,192 --> 32:21:23,120
căci asta se face prin regresie şi

42352
32:21:21,040 --> 32:21:24,400
clasificare. Acum, facem liniar

42353
32:21:23,120 --> 32:21:27,440
regresie. Deci, doar o să facem

42354
32:21:24,400 --> 32:21:29,120
concentrați-vă pe partea de regresie. Și în

42355
32:21:27,440 --> 32:21:31,440
regresie avem liniară simplă

42356
32:21:29,120 --> 32:21:34,320
regresie, avem liniară multiplă

42357
32:21:31,440 --> 32:21:36,552
regresie și avem liniară polomială

42358
32:21:34,320 --> 32:21:38,720
regresie. Acum, pe aceste trei simple

42359
32:21:36,552 --> 32:21:40,320
regresia liniară este exemplele pe care le avem

42360
32:21:38,720 --> 32:21:42,232
ne-am uitat până acum acolo unde avem multe

42361
32:21:40,320 --> 32:21:44,800
date și tragem o linie dreaptă prin

42362
32:21:42,232 --> 32:21:47,360
ea. Regresia liniară multiplă înseamnă noi

42363
32:21:44,800 --> 32:21:49,592
au mai multe variabile. Amintește-ți unde

42364
32:21:47,360 --> 32:21:51,280
am avut ploile și recoltele. Noi

42365
32:21:49,592 --> 32:21:53,512
ar putea adăuga variabile suplimentare acolo

42366
32:21:51,280 --> 32:21:55,440
cum ar fi câtă mâncare dăm recoltele noastre?

42367
32:21:53,512 --> 32:21:57,680
Când le recoltăm? Acestea ar fi

42368
32:21:55,440 --> 32:21:59,040
informații suplimentare adăugați în nostru

42369
32:21:57,680 --> 32:22:00,640
model și de aceea este multiplu

42370
32:21:59,040 --> 32:22:02,640
regresie liniară. Și în sfârșit avem

42371
32:22:00,640 --> 32:22:04,720
regresie liniară polomială adică

42372
32:22:02,640 --> 32:22:06,872
în loc să tragem o linie putem trage a

42373
32:22:04,720 --> 32:22:08,960
linie curba prin ea. Acum că vezi

42374
32:22:06,872 --> 32:22:11,040
unde modelul de regresie se încadrează în

42375
32:22:08,960 --> 32:22:12,640
algoritmi de învățare automată și suntem

42376
32:22:11,040 --> 32:22:14,480
privind în mod specific la liniar

42377
32:22:12,640 --> 32:22:16,800
regresie. Să mergem înainte și să luăm un

42378
32:22:14,480 --> 32:22:18,872
uitați-vă la aplicații pentru liniar

42379
32:22:16,800 --> 32:22:21,512
regresie. Să ne uităm la câteva

42380
32:22:18,872 --> 32:22:23,912
aplicatii ale regresiei liniare.

42381
32:22:21,512 --> 32:22:26,000
Creșterea economică utilizată pentru a determina

42382
32:22:23,912 --> 32:22:28,000
creșterea economică a unei țări sau a unui stat

42383
32:22:26,000 --> 32:22:31,120
în trimestrul următor poate fi folosit și

42384
32:22:28,000 --> 32:22:33,120
pentru a prezice PIB-ul unei țări. Produs

42385
32:22:31,120 --> 32:22:34,960
prețul poate fi folosit pentru a prezice ce ar fi

42386
32:22:33,120 --> 32:22:36,232
să fie prețul unui produs în viitor.

42387
32:22:34,960 --> 32:22:38,480
Putem ghici dacă va crește

42388
32:22:36,232 --> 32:22:40,640
sau jos sau ar trebui să cumpăr azi. Locuințe

42389
32:22:38,480 --> 32:22:42,552
vânzări pentru a estima numărul de case a

42390
32:22:40,640 --> 32:22:44,640
constructor ar vinde și ce preț în

42391
32:22:42,552 --> 32:22:46,480
lunile viitoare. Predicții de scor.

42392
32:22:44,640 --> 32:22:48,640
Febra de cricket pentru a prezice numărul de

42393
32:22:46,480 --> 32:22:50,160
rulează un jucător ar înscrie în viitor

42394
32:22:48,640 --> 32:22:52,552
potriviri bazate pe precedentul

42395
32:22:50,160 --> 32:22:54,552
performanta. Sunt sigur că vă puteți da seama

42396
32:22:52,552 --> 32:22:57,360
alte aplicații pe care le-ați putea folosi liniare

42397
32:22:54,552 --> 32:22:59,680
regresie pentru. Deci hai să sărim înăuntru și

42398
32:22:57,360 --> 32:23:01,912
să înțelegem regresia liniară și

42399
32:22:59,680 --> 32:23:04,800
sapă în teorie. Înțelegerea

42400
32:23:01,912 --> 32:23:07,120
regresie liniară. Regresia liniară este

42401
32:23:04,800 --> 32:23:09,512
modelul statistic folosit pentru a prezice

42402
32:23:07,120 --> 32:23:11,912
relaţia dintre independenţi şi

42403
32:23:09,512 --> 32:23:14,800
variabile dependente examinând două

42404
32:23:11,912 --> 32:23:16,720
factori. Primul important este

42405
32:23:14,800 --> 32:23:18,640
care sunt variabilele în special

42406
32:23:16,720 --> 32:23:20,640
predictori semnificativi ai rezultatului

42407
32:23:18,640 --> 32:23:22,080
variabilă. Și al doilea că noi

42408
32:23:20,640 --> 32:23:24,232
trebuie să te uiți îndeaproape este cum

42409
32:23:22,080 --> 32:23:25,912
semnificativă este linia de regresie la

42410
32:23:24,232 --> 32:23:28,720
face previziuni cu cea mai mare

42411
32:23:25,912 --> 32:23:30,800
posibila precizie. Dacă este inexact,

42412
32:23:28,720 --> 32:23:32,640
nu-l putem folosi. Deci, este foarte important

42413
32:23:30,800 --> 32:23:35,040
aflăm cea mai precisă linie noi

42414
32:23:32,640 --> 32:23:37,760
poate obține. Deoarece regresia liniară este

42415
32:23:35,040 --> 32:23:39,192
bazat pe trasarea unei linii prin date,

42416
32:23:37,760 --> 32:23:41,680
vom sări înapoi și vom arunca o privire

42417
32:23:39,192 --> 32:23:43,592
la o anumită geometrie uklitiană. Cel mai simplu

42418
32:23:41,680 --> 32:23:45,760
forma unei regresii liniare simple

42419
32:23:43,592 --> 32:23:49,040
ecuație cu una dependentă și una

42420
32:23:45,760 --> 32:23:52,480
variabila independentă este reprezentată de y

42421
32:23:49,040 --> 32:23:54,320
= m * x c. Și dacă te uiți la noastre

42422
32:23:52,480 --> 32:24:00,080
model aici, am trasat două puncte pe

42423
32:23:54,320 --> 32:24:02,160
aici. Uh x1 și y1, x2 și y2. y fiind

42424
32:24:00,080 --> 32:24:05,120
variabila dependentă, amintiți-vă că

42425
32:24:02,160 --> 32:24:08,552
de înainte. Iar x fiind independentul

42426
32:24:05,120 --> 32:24:11,512
variabilă. Deci y depinde de orice este x.

42427
32:24:08,552 --> 32:24:15,040
M în acest caz este panta dreptei

42428
32:24:11,512 --> 32:24:19,832
unde M este egal cu diferența în Y2

42429
32:24:15,040 --> 32:24:22,552
- Y1 și X2 - X1. Și în sfârșit avem C

42430
32:24:19,832 --> 32:24:25,280
care este coeficientul dreptei sau

42431
32:24:22,552 --> 32:24:27,360
unde se întâmplă să traverseze axa zero.

42432
32:24:25,280 --> 32:24:29,680
Să ne întoarcem și să ne uităm la un exemplu noi

42433
32:24:27,360 --> 32:24:31,440
folosit mai devreme de regresie liniară. Suntem

42434
32:24:29,680 --> 32:24:33,680
se va întoarce la trasarea sumei

42435
32:24:31,440 --> 32:24:36,720
a randamentului culturii în funcție de cantitatea de

42436
32:24:33,680 --> 32:24:39,192
precipitatii. Și aici avem ploile noastre.

42437
32:24:36,720 --> 32:24:41,360
Amintiți-vă, nu putem schimba precipitațiile. Şi

42438
32:24:39,192 --> 32:24:43,120
avem recolta noastră, adică

42439
32:24:41,360 --> 32:24:44,872
dependent de precipitatii. Deci, avem

42440
32:24:43,120 --> 32:24:46,960
independenta si dependenta noastra

42441
32:24:44,872 --> 32:24:49,192
variabile. O să luăm asta și

42442
32:24:46,960 --> 32:24:50,720
trageți o linie prin ea cât de bine putem

42443
32:24:49,192 --> 32:24:52,480
prin mijlocul datelor. Și apoi

42444
32:24:50,720 --> 32:24:55,360
ne uităm la asta. Punem punctul roșu

42445
32:24:52,480 --> 32:24:56,872
y ais este cantitatea de recoltă a culturii

42446
32:24:55,360 --> 32:24:59,360
vă puteți aștepta pentru suma de

42447
32:24:56,872 --> 32:25:00,960
precipitații reprezentate de punctul verde.

42448
32:24:59,360 --> 32:25:03,280
Deci, dacă avem o idee care sunt precipitațiile

42449
32:25:00,960 --> 32:25:05,040
este pentru anul acesta și ce se întâmplă,

42450
32:25:03,280 --> 32:25:06,640
atunci putem ghici cât de bune sunt recoltele noastre

42451
32:25:05,040 --> 32:25:08,320
va fi. și am creat un frumos

42452
32:25:06,640 --> 32:25:10,552
linie chiar prin mijloc pentru a ne oferi

42453
32:25:08,320 --> 32:25:12,320
o formulă matematică frumoasă. Să luăm

42454
32:25:10,552 --> 32:25:15,192
aruncă o privire și vezi cum arată matematica

42455
32:25:12,320 --> 32:25:17,680
în spatele acestui lucru. Să ne uităm la intuiție

42456
32:25:15,192 --> 32:25:20,232
în spatele liniei de regresie. Acum, înainte

42457
32:25:17,680 --> 32:25:22,320
ne scufundăm în matematică și formule

42458
32:25:20,232 --> 32:25:25,680
care stau în spatele asta și a ceea ce se întâmplă

42459
32:25:22,320 --> 32:25:28,000
în culise, vreau să rețineți

42460
32:25:25,680 --> 32:25:30,400
că atunci când intrăm în studiul de caz și

42461
32:25:28,000 --> 32:25:31,832
aplicăm de fapt niște scripturi Python

42462
32:25:30,400 --> 32:25:33,680
că această matematică pe care o vei vedea

42463
32:25:31,832 --> 32:25:34,960
aici se face deja automat pentru

42464
32:25:33,680 --> 32:25:37,680
tu. Nu trebuie să-l ai

42465
32:25:34,960 --> 32:25:40,000
memorat. Este, totuși, bine să ai

42466
32:25:37,680 --> 32:25:41,832
o idee ce se întâmplă deci dacă oamenii

42467
32:25:40,000 --> 32:25:43,680
referiți la diferiți termeni, veți

42468
32:25:41,832 --> 32:25:46,080
stiu despre ce vorbesc. Să

42469
32:25:43,680 --> 32:25:48,000
luați în considerare un set de date eșantion cu cinci

42470
32:25:46,080 --> 32:25:49,680
rânduri și aflați cum să desenați

42471
32:25:48,000 --> 32:25:51,512
linie de regresie. O să facem doar

42472
32:25:49,680 --> 32:25:53,040
cinci rânduri pentru că dacă ne-a plăcut

42473
32:25:51,512 --> 32:25:55,192
precipitatii cu sute de puncte de

42474
32:25:53,040 --> 32:25:57,120
date, ar fi foarte greu de văzut

42475
32:25:55,192 --> 32:25:58,552
ce se întâmplă cu matematica.

42476
32:25:57,120 --> 32:26:01,040
Deci, vom merge mai departe și vom crea propria noastră

42477
32:25:58,552 --> 32:26:03,440
două seturi de date. Și avem a noastră

42478
32:26:01,040 --> 32:26:07,592
variabila independentă x și dependenta noastră

42479
32:26:03,440 --> 32:26:12,320
variabila y. Și când x era 1, obținem y =

42480
32:26:07,592 --> 32:26:14,872
2. Când x era uh 2, y era 4. Și așa mai departe

42481
32:26:12,320 --> 32:26:17,680
si asa mai departe. Dacă mergem înainte și complotăm asta

42482
32:26:14,872 --> 32:26:19,512
date pe un grafic, putem vedea cum se formează

42483
32:26:17,680 --> 32:26:21,280
o linie frumoasă prin mijloc. Poți

42484
32:26:19,512 --> 32:26:23,512
vezi unde este un fel de grupat

42485
32:26:21,280 --> 32:26:25,832
în sus spre dreapta. Următorul lucru noi

42486
32:26:23,512 --> 32:26:28,232
Vrei să știi despre ce înseamnă

42487
32:26:25,832 --> 32:26:30,080
fiecare dintre datele care vin, x și

42488
32:26:28,232 --> 32:26:32,232
y. Mijloacele nu înseamnă nimic

42489
32:26:30,080 --> 32:26:34,400
altele decât media. Deci, adunăm

42490
32:26:32,232 --> 32:26:39,280
toate numerele și împărțiți la total.

42491
32:26:34,400 --> 32:26:41,592
Deci, 1 2 3 4 5 peste 5 este egal cu 3.

42492
32:26:39,280 --> 32:26:43,280
Și la fel pentru y, obținem patru. Dacă noi

42493
32:26:41,592 --> 32:26:46,232
merge mai departe și complotează mijloacele pe

42494
32:26:43,280 --> 32:26:48,400
grafic, vom vedea că obținem 3a 4, care

42495
32:26:46,232 --> 32:26:50,552
trasează o linie frumoasă la mijloc, a

42496
32:26:48,400 --> 32:26:52,320
estimare buna. Aici, vom săpă

42497
32:26:50,552 --> 32:26:54,720
mai adânc în matematica din spatele

42498
32:26:52,320 --> 32:26:56,720
linie de regresie. Acum, amintește-ți înainte de mine

42499
32:26:54,720 --> 32:26:59,120
a spus că nu trebuie să ai toate astea

42500
32:26:56,720 --> 32:27:00,480
formule memorate sau înțelese pe deplin

42501
32:26:59,120 --> 32:27:02,400
ei, chiar dacă vom intra în

42502
32:27:00,480 --> 32:27:04,400
putin mai multe detalii despre cum functioneaza.

42503
32:27:02,400 --> 32:27:05,912
Și dacă nu ești expert în matematică și tu

42504
32:27:04,400 --> 32:27:08,000
nu stiu daca nu l-ai vazut niciodata

42505
32:27:05,912 --> 32:27:10,720
caracter sigma înainte, care arată a

42506
32:27:08,000 --> 32:27:12,552
puțin ca un e care s-a deschis,

42507
32:27:10,720 --> 32:27:14,480
asta înseamnă doar însumare. Asta-i tot

42508
32:27:12,552 --> 32:27:15,760
adică. Deci, când vezi sigma

42509
32:27:14,480 --> 32:27:17,592
caracter, înseamnă doar că adăugăm

42510
32:27:15,760 --> 32:27:19,760
totul în acel rând. Și pentru

42511
32:27:17,592 --> 32:27:21,592
computere, acest lucru este grozav pentru că, ca a

42512
32:27:19,760 --> 32:27:24,080
programator, puteți repeta cu ușurință

42513
32:27:21,592 --> 32:27:26,080
prin fiecare dintre punctele XY și creați

42514
32:27:24,080 --> 32:27:27,760
toate informațiile de care aveți nevoie. Deci în

42515
32:27:26,080 --> 32:27:29,680
jumătatea de sus, puteți vedea unde ne-am rupt

42516
32:27:27,760 --> 32:27:31,280
că jos în bucăți. Și după cum merge

42517
32:27:29,680 --> 32:27:33,512
prin primele două puncte, ea

42518
32:27:31,280 --> 32:27:36,232
calculează valoarea pătrată a lui X, the

42519
32:27:33,512 --> 32:27:38,080
valoarea pătrată a lui Y și X * Y. Și apoi

42520
32:27:36,232 --> 32:27:40,552
ia tot X și le adună. Toate

42521
32:27:38,080 --> 32:27:42,872
din Y le adună. Toate X squar adaugă

42522
32:27:40,552 --> 32:27:45,280
le sus. Și așa mai departe și așa mai departe. Iar tu

42523
32:27:42,872 --> 32:27:47,040
putem vedea că avem suma egală cu 15.

42524
32:27:45,280 --> 32:27:50,400
Suma este egală cu 20. tot în sus

42525
32:27:47,040 --> 32:27:52,160
la x * y unde suma este egală cu 66. Aceasta

42526
32:27:50,400 --> 32:27:54,480
totul vine din formula noastră pentru

42527
32:27:52,160 --> 32:27:57,592
calculând o dreaptă unde y

42528
32:27:54,480 --> 32:28:00,160
este egal cu panta* x plus coeficientul

42529
32:27:57,592 --> 32:28:02,480
c. Așa că coborâm mai jos și mergem

42530
32:28:00,160 --> 32:28:04,080
pentru a calcula mai mult ca mediile de

42531
32:28:02,480 --> 32:28:06,000
acestea și vom explica exact

42532
32:28:04,080 --> 32:28:07,592
ce este asta într-un minut și unde

42533
32:28:06,000 --> 32:28:09,512
din acea informație provine. Se numește

42534
32:28:07,592 --> 32:28:11,120
pătratul înseamnă eroare, dar vom merge

42535
32:28:09,512 --> 32:28:12,400
în asta în detaliu în câteva minute.

42536
32:28:11,120 --> 32:28:14,800
Tot ce trebuie să faci este să te uiți la

42537
32:28:12,400 --> 32:28:17,512
formula și vedem cum am procedat

42538
32:28:14,800 --> 32:28:20,640
calculându-l linie cu linie în loc de

42539
32:28:17,512 --> 32:28:22,872
încercând să avem un set imens de numere

42540
32:28:20,640 --> 32:28:25,832
împins în ea. Și aici jos vei vedea

42541
32:28:22,872 --> 32:28:27,120
unde panta m este egală și apoi

42542
32:28:25,832 --> 32:28:29,680
partea de sus dacă citiți

42543
32:28:27,120 --> 32:28:34,400
între paranteze aveți numărul de date

42544
32:28:29,680 --> 32:28:36,320
puncte ori suma lui x * y pe care noi

42545
32:28:34,400 --> 32:28:38,640
a calculat câte o linie acolo. Şi

42546
32:28:36,320 --> 32:28:41,192
asta e doar 66. si ia toate astea

42547
32:28:38,640 --> 32:28:43,360
și o scădeți din suma lui x

42548
32:28:41,192 --> 32:28:45,912
ori suma lui y și acelea au ambele

42549
32:28:43,360 --> 32:28:48,232
fost calculat. Deci ai 15 * 20. Și

42550
32:28:45,912 --> 32:28:51,360
în partea de jos avem numărul de

42551
32:28:48,232 --> 32:28:54,960
linii înmulțite cu suma lui x^2 cu ușurință

42552
32:28:51,360 --> 32:28:57,040
calculat ca 86 pentru suma minus voi

42553
32:28:54,960 --> 32:29:00,000
luați toate acestea și scădeți suma de

42554
32:28:57,040 --> 32:29:02,080
x^2. Și ajungem pe măsură ce întâlnim

42555
32:29:00,000 --> 32:29:03,680
cu formula noastră. Puteți conecta toate

42556
32:29:02,080 --> 32:29:05,280
acele numere care este foarte ușor de făcut

42557
32:29:03,680 --> 32:29:07,192
pe computer. Nu trebuie să faci

42558
32:29:05,280 --> 32:29:09,592
matematica pe o bucată de hârtie sau

42559
32:29:07,192 --> 32:29:11,680
calculator. Și vei obține o pantă de 6

42560
32:29:09,592 --> 32:29:12,960
și vei obține coeficientul C. Dacă

42561
32:29:11,680 --> 32:29:14,400
continuați să urmați asta

42562
32:29:12,960 --> 32:29:17,360
formulă, vei vedea că iese ca

42563
32:29:14,400 --> 32:29:19,440
egal cu 2,2. Continuând mai adânc în

42564
32:29:17,360 --> 32:29:21,760
ce se întâmplă în culise, haideți

42565
32:29:19,440 --> 32:29:23,832
aflați valorile prezise ale lui y pt

42566
32:29:21,760 --> 32:29:28,160
valorile corespunzătoare ale lui x folosind

42567
32:29:23,832 --> 32:29:30,320
ecuație liniară unde m=6 și c = 2,2.

42568
32:29:28,160 --> 32:29:32,000
Vom lua aceste valori și

42569
32:29:30,320 --> 32:29:35,192
o să mergem înainte și să le complotăm.

42570
32:29:32,000 --> 32:29:39,360
O să le prezicem. Deci y =6 * x

42571
32:29:35,192 --> 32:29:41,440
= 1 2,2 = 2,8 așa mai departe și așa mai departe. Şi

42572
32:29:39,360 --> 32:29:44,400
aici punctele albastre reprezintă

42573
32:29:41,440 --> 32:29:46,720
valorile reale ale y și punctele maro

42574
32:29:44,400 --> 32:29:48,552
reprezintă valorile yv prezise pe baza

42575
32:29:46,720 --> 32:29:50,872
pe modelul creat de noi. Distanța

42576
32:29:48,552 --> 32:29:54,232
între valorile reale și cele prognozate

42577
32:29:50,872 --> 32:29:56,400
este cunoscut ca reziduuri sau erori. The

42578
32:29:54,232 --> 32:29:59,440
linia cea mai potrivită ar trebui să aibă cea mai mică sumă

42579
32:29:56,400 --> 32:30:01,680
de pătrate ale acestor erori cunoscute și ca

42580
32:29:59,440 --> 32:30:04,552
egal. Dacă le punem într-un frumos

42581
32:30:01,680 --> 32:30:06,720
grafic unde poți vedea X și poți

42582
32:30:04,552 --> 32:30:08,800
vezi Y care au fost valorile reale și

42583
32:30:06,720 --> 32:30:11,192
poți vedea Y a prezis că poți ușor

42584
32:30:08,800 --> 32:30:12,720
vezi unde luăm Y minus Y prezis

42585
32:30:11,192 --> 32:30:14,480
și primim un răspuns. Ce este

42586
32:30:12,720 --> 32:30:18,000
diferența dintre cele două și dacă noi

42587
32:30:14,480 --> 32:30:20,160
pătrat că predicția Y - Y pătrat we

42588
32:30:18,000 --> 32:30:23,592
poate apoi să însumeze acele valori pătrate.

42589
32:30:20,160 --> 32:30:25,360
De aici obținem 64 plus .36  

42590
32:30:23,592 --> 32:30:28,320
1 până la capăt până avem un

42591
32:30:25,360 --> 32:30:30,160
însumarea este egală cu 2,4. Deci suma de

42592
32:30:28,320 --> 32:30:32,552
erori pătrate pentru această linie de regresie

42593
32:30:30,160 --> 32:30:34,320
este 2,4. Verificăm această eroare pentru fiecare

42594
32:30:32,552 --> 32:30:37,192
linie și încheie linia cea mai potrivită

42595
32:30:34,320 --> 32:30:39,680
având cea mai mică valoare e. Într-un frumos

42596
32:30:37,192 --> 32:30:41,440
reprezentare grafică, putem vedea

42597
32:30:39,680 --> 32:30:43,192
aici, unde continuăm să mișcăm această linie

42598
32:30:41,440 --> 32:30:45,280
prin punctele de date pentru a vă asigura că

42599
32:30:43,192 --> 32:30:47,760
linia cea mai potrivită are cel mai mic pătrat

42600
32:30:45,280 --> 32:30:50,080
distanța dintre punctele de date și

42601
32:30:47,760 --> 32:30:52,800
linie de regresie. Acum ne-am uitat doar la

42602
32:30:50,080 --> 32:30:55,120
cea mai des folosită formulă pentru

42603
32:30:52,800 --> 32:30:57,040
minimizarea distantei. Sunt o mulțime

42604
32:30:55,120 --> 32:30:59,360
modalități de a minimiza distanța dintre

42605
32:30:57,040 --> 32:31:02,320
linia și punctele de date ca suma de

42606
32:30:59,360 --> 32:31:04,960
erori pătrate, suma erorilor absolute,

42607
32:31:02,320 --> 32:31:06,800
eroare pătrată medie, etc

42608
32:31:04,960 --> 32:31:09,760
vrei să ia din asta este orice

42609
32:31:06,800 --> 32:31:11,760
formula este folosită, puteți cu ușurință

42610
32:31:09,760 --> 32:31:13,760
folosind o programare pe calculator și

42611
32:31:11,760 --> 32:31:16,080
iterând prin date calculați

42612
32:31:13,760 --> 32:31:17,912
diferite părți ale acestuia. Așa, acestea

42613
32:31:16,080 --> 32:31:20,400
formule complicate pe care le vezi cu

42614
32:31:17,912 --> 32:31:22,960
diferite însumări și valori absolute

42615
32:31:20,400 --> 32:31:24,960
sunt ușor de calculat o bucată la un moment dat.

42616
32:31:22,960 --> 32:31:28,080
Până în acest moment, am fost doar

42617
32:31:24,960 --> 32:31:29,832
privind două valori, X și Y. Ei bine, în

42618
32:31:28,080 --> 32:31:31,512
lumea reală, este foarte rar ca tu

42619
32:31:29,832 --> 32:31:33,280
ai doar două valori când ești

42620
32:31:31,512 --> 32:31:36,080
găsirea unei soluții. Deci, să ne mișcăm

42621
32:31:33,280 --> 32:31:38,320
la subiectul următor, liniar multiplu

42622
32:31:36,080 --> 32:31:39,912
regresie. Să aruncăm o scurtă privire la

42623
32:31:38,320 --> 32:31:41,832
ce se întâmplă când ai mai multe

42624
32:31:39,912 --> 32:31:43,760
intrări. Deci, în liniară multiplă

42625
32:31:41,832 --> 32:31:45,440
regresie, avem uh bine, vom începe

42626
32:31:43,760 --> 32:31:49,280
cu regresia liniară simplă unde

42627
32:31:45,440 --> 32:31:51,512
am avut y = m x c și încercăm

42628
32:31:49,280 --> 32:31:53,280
găsiți valoarea lui y. Acum cu multiple

42629
32:31:51,512 --> 32:31:55,360
regresia liniară avem multiplu

42630
32:31:53,280 --> 32:32:00,000
variabile care vin. Deci, în loc de

42631
32:31:55,360 --> 32:32:02,400
având doar x avem x1 x2 x3 și

42632
32:32:00,000 --> 32:32:04,400
în loc să aibă o singură pantă fiecare

42633
32:32:02,400 --> 32:32:08,000
variabila are propria panta atasata

42634
32:32:04,400 --> 32:32:09,440
ea. După cum puteți vedea aici avem m1 m2 m3

42635
32:32:08,000 --> 32:32:11,280
și încă mai avem single-ul

42636
32:32:09,440 --> 32:32:13,592
coeficient. Deci când ai de-a face cu

42637
32:32:11,280 --> 32:32:15,440
regresie liniară multiplă, practic

42638
32:32:13,592 --> 32:32:18,800
ia-ți singura regresie liniară și

42639
32:32:15,440 --> 32:32:24,320
l-ai întins. Deci aveți y = m1 *

42640
32:32:18,800 --> 32:32:25,680
x1 m2 * x2 așa mai departe până la m x la

42641
32:32:24,320 --> 32:32:28,080
al n-lea și apoi adăugați dvs

42642
32:32:25,680 --> 32:32:30,232
coeficient acolo. Implementarea

42643
32:32:28,080 --> 32:32:32,320
regresie liniară. Acum intrăm în mine

42644
32:32:30,232 --> 32:32:34,480
partea preferată. Să înțelegem cum

42645
32:32:32,320 --> 32:32:36,800
regresia liniară multiplă funcționează prin

42646
32:32:34,480 --> 32:32:38,872
implementându-l în Python. Dacă tu

42647
32:32:36,800 --> 32:32:41,912
amintiți-vă înainte să ne uităm la o

42648
32:32:38,872 --> 32:32:43,512
companie și doar pe baza încercărilor sale RandD

42649
32:32:41,912 --> 32:32:44,960
pentru a-și afla profitul. Vom merge

42650
32:32:43,512 --> 32:32:46,640
începe să te uiți la cheltuielile

42651
32:32:44,960 --> 32:32:48,232
companie. Ne vom întoarce la asta.

42652
32:32:46,640 --> 32:32:50,000
O să-i prezicem profitul, dar

42653
32:32:48,232 --> 32:32:51,832
în loc să-l prezice doar pe

42654
32:32:50,000 --> 32:32:54,080
RandD, ne vom uita la altele

42655
32:32:51,832 --> 32:32:56,640
factori precum costurile de administrare,

42656
32:32:54,080 --> 32:32:58,080
costurile de marketing și așa mai departe. Și de la

42657
32:32:56,640 --> 32:32:59,440
acolo, o să vedem dacă putem

42658
32:32:58,080 --> 32:33:01,120
afli care este profitul asta

42659
32:32:59,440 --> 32:33:03,040
compania va fi. Pentru a începe noastre

42660
32:33:01,120 --> 32:33:05,360
codificare, vom începe cu

42661
32:33:03,040 --> 32:33:06,480
importul unor biblioteci de bază. Şi

42662
32:33:05,360 --> 32:33:08,232
ne vom uita prin

42663
32:33:06,480 --> 32:33:09,592
date înainte de a face orice fel de liniară

42664
32:33:08,232 --> 32:33:10,960
regresie. O să aruncăm o privire

42665
32:33:09,592 --> 32:33:13,440
la date pentru a vedea ce jucăm

42666
32:33:10,960 --> 32:33:15,592
cu. Apoi vom merge mai departe și vom formata

42667
32:33:13,440 --> 32:33:17,280
date în formatul pe care trebuie să-l putem

42668
32:33:15,592 --> 32:33:18,640
rulați-l în modelul de regresie liniară.

42669
32:33:17,280 --> 32:33:21,192
Și apoi de acolo vom merge înainte și

42670
32:33:18,640 --> 32:33:22,800
rezolvă-l și vezi doar cât de valid nostru

42671
32:33:21,192 --> 32:33:24,960
solutia este. Deci, să începem cu

42672
32:33:22,800 --> 32:33:27,592
importul bibliotecilor de bază. Acum sunt

42673
32:33:24,960 --> 32:33:30,232
o să facă asta în Anaconda

42674
32:33:27,592 --> 32:33:32,080
Notebook Jupyter, un IDE foarte popular. eu

42675
32:33:30,232 --> 32:33:34,552
bucură-te de el pentru că este atât de vizual

42676
32:33:32,080 --> 32:33:36,640
uite și atât de ușor de folosit. Oricare

42677
32:33:34,552 --> 32:33:38,800
ID-ul pentru Python va funcționa foarte bine pentru

42678
32:33:36,640 --> 32:33:41,040
aceasta. Așa că dezvăluie Python-ul tău preferat

42679
32:33:38,800 --> 32:33:42,960
IDE. Deci, iată-ne în Jupyter-ul nostru

42680
32:33:41,040 --> 32:33:44,872
caietul. Lasă-mă să merg înainte și să-l lipesc

42681
32:33:42,960 --> 32:33:46,400
prima bucată de cod acolo. Și haideți

42682
32:33:44,872 --> 32:33:48,160
umblă prin ce biblioteci suntem

42683
32:33:46,400 --> 32:33:51,040
import. În primul rând, vom importa

42684
32:33:48,160 --> 32:33:53,440
numpy ca np. Și apoi vreau să sari peste

42685
32:33:51,040 --> 32:33:55,832
o linie și uită-te la import panda ca

42686
32:33:53,440 --> 32:33:56,960
pd. Acestea sunt instrumente foarte comune pe care dvs

42687
32:33:55,832 --> 32:33:59,120
nevoie cu cea mai mare parte din liniar

42688
32:33:56,960 --> 32:34:01,912
regresie. Numpy, care înseamnă

42689
32:33:59,120 --> 32:34:03,280
numărul python, este de obicei notat ca np,

42690
32:34:01,912 --> 32:34:05,120
și aproape că trebuie să ai asta pentru

42691
32:34:03,280 --> 32:34:06,640
cutia ta de instrumente sklearn. Deci, tu mereu

42692
32:34:05,120 --> 32:34:08,552
importa asta chiar de la început.

42693
32:34:06,640 --> 32:34:10,552
panda. Deși nu trebuie să ai

42694
32:34:08,552 --> 32:34:12,800
este pentru bibliotecile tale sklearn, o face

42695
32:34:10,552 --> 32:34:14,872
o muncă atât de minunată de a importa date,

42696
32:34:12,800 --> 32:34:16,872
setându-l într-un cadru de date, astfel încât noi

42697
32:34:14,872 --> 32:34:18,640
îl poate manipula destul de ușor și acesta

42698
32:34:16,872 --> 32:34:20,160
are o mulțime de instrumente, de asemenea, pe lângă

42699
32:34:18,640 --> 32:34:21,832
că. Deci, de obicei, ne place să folosim

42700
32:34:20,160 --> 32:34:23,592
panda când putem și vă voi arăta

42701
32:34:21,832 --> 32:34:26,232
cum arată. Ceilalți trei

42702
32:34:23,592 --> 32:34:28,080
liniile sunt pentru noi pentru a obține o imagine a acestui lucru

42703
32:34:26,232 --> 32:34:30,872
date și aruncați o privire la ele. Deci suntem

42704
32:34:28,080 --> 32:34:35,592
mergi la import mapplot library.pipplot

42705
32:34:30,872 --> 32:34:37,680
ca plt si apoi maritim ca sns. Seabor

42706
32:34:35,592 --> 32:34:39,192
funcționează cu biblioteca mattplot. Deci tu

42707
32:34:37,680 --> 32:34:41,192
trebuie să importe întotdeauna biblioteca mapplot

42708
32:34:39,192 --> 32:34:42,480
iar apoi se așează marinarul deasupra ei. Şi

42709
32:34:41,192 --> 32:34:44,400
vom arunca o privire la ce arată

42710
32:34:42,480 --> 32:34:46,320
ca. Ai putea să folosești oricare dintre ele

42711
32:34:44,400 --> 32:34:48,080
trasarea bibliotecilor dorite. Sunt toate

42712
32:34:46,320 --> 32:34:49,592
feluri de moduri de a privi datele. Acestea

42713
32:34:48,080 --> 32:34:52,232
sunt doar foarte comune. Iar cel

42714
32:34:49,592 --> 32:34:53,760
seabor este atât de ușor de folosit. Doar arată

42715
32:34:52,232 --> 32:34:55,120
frumos. Este o reprezentare frumoasă

42716
32:34:53,760 --> 32:34:57,440
pe care chiar le poți lua și arăta

42717
32:34:55,120 --> 32:35:01,040
cineva. Iar linia finală este

42718
32:34:57,440 --> 32:35:03,512
bibliotecă mattplot amberigned inline. Că

42719
32:35:01,040 --> 32:35:05,680
este doar pentru că fac un IDE inline.

42720
32:35:03,512 --> 32:35:08,720
Interfața mea în Anaconda Jupiter

42721
32:35:05,680 --> 32:35:10,000
caietul necesită să pun asta acolo sau

42722
32:35:08,720 --> 32:35:11,592
nu vei vedea graficul când

42723
32:35:10,000 --> 32:35:12,800
apare. Să mergem înainte și să alergăm

42724
32:35:11,592 --> 32:35:13,832
aceasta. Nu va fi așa

42725
32:35:12,800 --> 32:35:15,512
interesant pentru că tocmai ne aşezăm

42726
32:35:13,832 --> 32:35:17,760
sus variabile. De fapt, nu se va întâmpla

42727
32:35:15,512 --> 32:35:19,832
facem orice putem vedea, dar este

42728
32:35:17,760 --> 32:35:22,800
importând aceste biblioteci diferite și

42729
32:35:19,832 --> 32:35:24,552
setare. Următorul pas este încărcarea datelor

42730
32:35:22,800 --> 32:35:27,280
setați și extrageți independent și

42731
32:35:24,552 --> 32:35:29,592
variabile dependente. Acum, aici, în

42732
32:35:27,280 --> 32:35:32,320
slide, veți vedea că companiile sunt egale cu PD

42733
32:35:29,592 --> 32:35:34,320
citește CSV. Și are o coadă lungă acolo

42734
32:35:32,320 --> 32:35:36,320
cu dosarul la final. 10,00

42735
32:35:34,320 --> 32:35:38,552
companii.csv. Va trebui

42736
32:35:36,320 --> 32:35:41,040
schimbați acest lucru pentru a se potrivi cu orice configurație

42737
32:35:38,552 --> 32:35:43,360
au. Și fișierul în sine, poți

42738
32:35:41,040 --> 32:35:45,680
cerere. Mergeți la comentariu

42739
32:35:43,360 --> 32:35:47,440
sub acest videoclip și pune o notă acolo

42740
32:35:45,680 --> 32:35:48,872
și SimplyLearn va încerca să intre

42741
32:35:47,440 --> 32:35:50,400
contactați-vă și vă furnizați

42742
32:35:48,872 --> 32:35:52,160
acel fișier, astfel încât să puteți încerca această codare

42743
32:35:50,400 --> 32:35:53,592
pe tine însuți. Deci, vom adăuga asta

42744
32:35:52,160 --> 32:35:55,280
cod aici. Și o să vedem

42745
32:35:53,592 --> 32:35:57,592
că am companii egale

42746
32:35:55,280 --> 32:35:59,680
PD.reader_csv.

42747
32:35:57,592 --> 32:36:03,232
Și am schimbat această cale pentru a se potrivi cu mine

42748
32:35:59,680 --> 32:36:03,232
calculator. C/simplylearn/1000

42749
32:36:03,440 --> 32:36:07,512
companii.csv. Și apoi acolo dedesubt,

42750
32:36:05,512 --> 32:36:09,832
vom seta x egal cu

42751
32:36:07,512 --> 32:36:12,232
companiile aflate sub locația i. Şi

42752
32:36:09,832 --> 32:36:14,400
pentru că aceasta este companii este o date pd

42753
32:36:12,232 --> 32:36:16,640
set, pot folosi această notație frumoasă care

42754
32:36:14,400 --> 32:36:19,120
spune luați fiecare rând, asta este

42755
32:36:16,640 --> 32:36:20,800
două puncte primele două puncte sunt virgulă, cu excepția

42756
32:36:19,120 --> 32:36:22,480
pentru ultima coloană. Asta e ceea ce

42757
32:36:20,800 --> 32:36:24,552
a doua parte este în cazul în care avem un colon

42758
32:36:22,480 --> 32:36:27,440
minus unu și vrem valorile setate

42759
32:36:24,552 --> 32:36:29,280
acolo. Deci x nu mai este un set de date

42760
32:36:27,440 --> 32:36:31,120
un set de date panda, dar putem cu ușurință

42761
32:36:29,280 --> 32:36:33,680
extrageți datele din datele noastre panda

42762
32:36:31,120 --> 32:36:36,320
setați cu această notație și apoi suntem

42763
32:36:33,680 --> 32:36:37,680
urmând să setați egal cu ultimul rând. Ei bine

42764
32:36:36,320 --> 32:36:39,760
întrebarea va fi ce suntem

42765
32:36:37,680 --> 32:36:41,360
se uita de fapt? Deci hai să mergem înainte

42766
32:36:39,760 --> 32:36:43,512
și uită-te la asta și mergem

42767
32:36:41,360 --> 32:36:45,440
să se uite la companii.

42768
32:36:43,512 --> 32:36:47,120
Care enumeră primele cinci rânduri de date

42769
32:36:45,440 --> 32:36:48,400
și voi deschide fișierul în doar o

42770
32:36:47,120 --> 32:36:50,000
al doilea ca să poți vedea unde este

42771
32:36:48,400 --> 32:36:52,320
provenind din. Dar să ne uităm la date

42772
32:36:50,000 --> 32:36:54,480
aici până la drumul panda

42773
32:36:52,320 --> 32:36:56,480
o vede. Când voi apăsa Run, o să vezi

42774
32:36:54,480 --> 32:36:58,232
îl desparte într-o configurație plăcută. Aceasta este

42775
32:36:56,480 --> 32:36:59,440
ce panda, unul dintre lucrurile sunt panda

42776
32:36:58,232 --> 32:37:01,680
foarte bine este că arată exact ca

42777
32:36:59,440 --> 32:37:03,680
o foaie de calcul Excel. Ai rândurile tale

42778
32:37:01,680 --> 32:37:05,280
și amintiți-vă când programăm, noi

42779
32:37:03,680 --> 32:37:08,000
începe întotdeauna cu zero. Nu începem

42780
32:37:05,280 --> 32:37:11,760
cu unul. Deci arată primele cinci

42781
32:37:08,000 --> 32:37:14,320
rândurile 0 1 2 3 4 și apoi arată dvs

42782
32:37:11,760 --> 32:37:17,040
coloane diferite. RandD cheltuiește,

42783
32:37:14,320 --> 32:37:19,760
administrare, cheltuieli de marketing, stat,

42784
32:37:17,040 --> 32:37:21,680
profit. Se notează chiar că topul sunt

42785
32:37:19,760 --> 32:37:23,680
nume de coloane. Nu s-a spus niciodată că,

42786
32:37:21,680 --> 32:37:25,360
dar Pandas este capabil să recunoască o mulțime de

42787
32:37:23,680 --> 32:37:26,960
lucruri care nu sunt la fel ca

42788
32:37:25,360 --> 32:37:29,040
rânduri de date. De ce nu mergem înainte și

42789
32:37:26,960 --> 32:37:31,040
deschideți acest fișier într-un CSV ca să puteți

42790
32:37:29,040 --> 32:37:33,040
vezi de fapt datele brute. Deci aici am

42791
32:37:31,040 --> 32:37:36,000
l-a deschis ca editor de text. Iar tu

42792
32:37:33,040 --> 32:37:39,280
putem vedea în partea de sus că RandD cheltuiește,

42793
32:37:36,000 --> 32:37:41,280
administrare, cheltuieli de marketing, stat,

42794
32:37:39,280 --> 32:37:42,800
profit, întoarcere de transport. nu stiu

42795
32:37:41,280 --> 32:37:45,192
despre tine, dar aș înnebuni încercând

42796
32:37:42,800 --> 32:37:47,280
citeste astfel de fisiere. De aceea folosim

42797
32:37:45,192 --> 32:37:48,960
pandale. Ai putea deschide și asta

42798
32:37:47,280 --> 32:37:50,640
într-un Excel și l-ar separa

42799
32:37:48,960 --> 32:37:51,912
deoarece este o variabilă separată prin virgulă

42800
32:37:50,640 --> 32:37:53,280
dosar. Dar nu vrem să ne uităm la asta

42801
32:37:51,912 --> 32:37:55,040
unul. Vrem să ne uităm la ceva ce putem

42802
32:37:53,280 --> 32:37:57,192
citeste destul de usor. Deci, să ne întoarcem

42803
32:37:55,040 --> 32:37:59,440
și aruncați o privire la partea de sus, the

42804
32:37:57,192 --> 32:38:01,760
primele cinci rânduri. Acum, la fel de frumos ca asta

42805
32:37:59,440 --> 32:38:03,680
formatul este locul în care pot vedea datele

42806
32:38:01,760 --> 32:38:05,440
pentru mine nu înseamnă foarte mult. Poate

42807
32:38:03,680 --> 32:38:08,080
ești expert în afaceri și

42808
32:38:05,440 --> 32:38:11,080
investiții și înțelegi ce

42809
32:38:08,080 --> 32:38:11,080
165.34920 USD

42810
32:38:11,912 --> 32:38:17,120
comparativ cu costul de administrare al

42811
32:38:14,160 --> 32:38:19,680
136.897,80 USD

42812
32:38:17,120 --> 32:38:23,160
așa mai departe ajută la crearea profitului

42813
32:38:19,680 --> 32:38:23,160
de 192.26183 USD.

42814
32:38:23,680 --> 32:38:27,912
Nu are niciun sens pentru mine. Nu

42815
32:38:26,000 --> 32:38:29,440
joc de cuvinte. Deci, să revenim aici

42816
32:38:27,912 --> 32:38:30,872
și aruncați o privire la următorul nostru set de coduri

42817
32:38:29,440 --> 32:38:32,320
unde o vom reprezenta grafic ca să putem

42818
32:38:30,872 --> 32:38:35,040
obțineți o mai bună înțelegere a datelor noastre

42819
32:38:32,320 --> 32:38:37,360
si ce inseamna. Deci în acest moment suntem

42820
32:38:35,040 --> 32:38:39,512
va folosi o singură linie de cod pentru a

42821
32:38:37,360 --> 32:38:41,120
obțineți o mulțime de informații ca să putem vedea

42822
32:38:39,512 --> 32:38:43,440
unde mergem cu asta. Să mergem

42823
32:38:41,120 --> 32:38:45,280
înainte și lipiți asta în uh

42824
32:38:43,440 --> 32:38:47,280
caiet și vedem ce avem de făcut. Şi

42825
32:38:45,280 --> 32:38:50,320
deci avem vizualizarea și din nou

42826
32:38:47,280 --> 32:38:51,912
folosim SNS care este panda. Ca tine

42827
32:38:50,320 --> 32:38:55,120
pot vedea, am importat mapplotul

42828
32:38:51,912 --> 32:38:57,832
library.pipplot ca plt, care apoi

42829
32:38:55,120 --> 32:39:00,552
se folosește marinar și am importat marinarul

42830
32:38:57,832 --> 32:39:03,832
ca sns. Și apoi acea linie finală de cod

42831
32:39:00,552 --> 32:39:05,512
ne ajută să arătăm acest lucru în um inline

42832
32:39:03,832 --> 32:39:06,960
codificare. Fără asta, nu ar fi

42833
32:39:05,512 --> 32:39:08,552
afișa și l-ați putea afișa la a

42834
32:39:06,960 --> 32:39:10,552
dosar și alte mijloace. Și asta e harta

42835
32:39:08,552 --> 32:39:12,080
bibliotecă de parcele în linie cu semnul chihlimbar

42836
32:39:10,552 --> 32:39:14,320
la început. Deci iată-ne jos

42837
32:39:12,080 --> 32:39:16,080
la o singură linie de cod. Seabor este

42838
32:39:14,320 --> 32:39:18,800
grozav pentru că recunoaște de fapt

42839
32:39:16,080 --> 32:39:20,480
cadru de date panda. Deci pot doar să iau

42840
32:39:18,800 --> 32:39:22,400
companii.core

42841
32:39:20,480 --> 32:39:25,120
pentru coordonate și pot corecta

42842
32:39:22,400 --> 32:39:27,360
în mare născut. Și când rulăm asta,

42843
32:39:25,120 --> 32:39:28,720
primim acest complot frumos. Și haideți

42844
32:39:27,360 --> 32:39:31,512
aruncați o privire la ce complot

42845
32:39:28,720 --> 32:39:32,800
înseamnă. Dacă te uiți la acest complot al meu,

42846
32:39:31,512 --> 32:39:34,400
culorile sunt probabil un pic

42847
32:39:32,800 --> 32:39:36,960
mai violet și albastru decât originalul

42848
32:39:34,400 --> 32:39:38,800
unul. Avem coloanele și

42849
32:39:36,960 --> 32:39:40,232
rânduri. Avem cheltuieli pentru cercetare și dezvoltare. Avem

42850
32:39:38,800 --> 32:39:42,160
administrare. Avem marketing

42851
32:39:40,232 --> 32:39:44,320
cheltuieli si profit. Și dacă traversezi

42852
32:39:42,160 --> 32:39:46,232
indexați oricare două dintre acestea, deoarece suntem

42853
32:39:44,320 --> 32:39:48,160
interesat de profit, dacă încrucișați

42854
32:39:46,232 --> 32:39:49,832
profit cu profit, se va arăta

42855
32:39:48,160 --> 32:39:52,232
sus, dacă te uiți la scara de pe

42856
32:39:49,832 --> 32:39:54,320
corect, sus în întuneric. De ce? Pentru că

42857
32:39:52,232 --> 32:39:57,592
sunt aceleasi date. Au un

42858
32:39:54,320 --> 32:40:00,400
corespondenta exacta. Deci cheltuielile RandD sunt

42859
32:39:57,592 --> 32:40:01,832
va fi la fel cu cheltuielile RandD.

42860
32:40:00,400 --> 32:40:03,680
Și același lucru cu administrația

42861
32:40:01,832 --> 32:40:06,960
costuri. Dar chiar la mijloc, tu

42862
32:40:03,680 --> 32:40:09,440
obțineți acest rând întunecat sau diagonală întunecată

42863
32:40:06,960 --> 32:40:11,512
rândul care arată că acesta este cel mai înalt

42864
32:40:09,440 --> 32:40:13,680
date corespunzătoare. Exact asta este

42865
32:40:11,512 --> 32:40:16,080
la fel. Și pe măsură ce devine mai ușor, există

42866
32:40:13,680 --> 32:40:18,400
mai puține conexiuni între date. Deci noi

42867
32:40:16,080 --> 32:40:20,800
se poate vedea cu profit, evident profitul este

42868
32:40:18,400 --> 32:40:23,192
la fel ca profitul. Și în continuare, are un

42869
32:40:20,800 --> 32:40:25,280
corelație foarte mare cu cheltuielile RandD,

42870
32:40:23,192 --> 32:40:27,592
la care ne-am uitat mai devreme. Și are o

42871
32:40:25,280 --> 32:40:29,592
conexiune ceva mai mică cu marketingul

42872
32:40:27,592 --> 32:40:31,512
cheltuieli și cu atât mai puțin la câți bani

42873
32:40:29,592 --> 32:40:33,592
am pus in administratie. Deci acum

42874
32:40:31,512 --> 32:40:35,360
că ne uităm bine la date,

42875
32:40:33,592 --> 32:40:37,592
hai să mergem mai departe și să sapă și să creăm

42876
32:40:35,360 --> 32:40:39,760
o regresie liniară reală utilă

42877
32:40:37,592 --> 32:40:42,160
modele astfel încât să putem prezice valori şi

42878
32:40:39,760 --> 32:40:43,912
avea un profit mai bun. Acum că am

42879
32:40:42,160 --> 32:40:45,512
aruncat o privire la vizualizarea de

42880
32:40:43,912 --> 32:40:47,280
aceste date, vom trece la

42881
32:40:45,512 --> 32:40:49,512
pasul următor. În loc să ai doar un

42882
32:40:47,280 --> 32:40:52,552
imagine frumoasă, trebuie să generăm câteva

42883
32:40:49,512 --> 32:40:54,160
date hard, unele valori hard. Deci haideți

42884
32:40:52,552 --> 32:40:56,320
vezi cum arata. Vom merge

42885
32:40:54,160 --> 32:40:58,960
configurați modelul nostru de regresie liniară în

42886
32:40:56,320 --> 32:41:01,040
doi pasi. Prima este că trebuie

42887
32:40:58,960 --> 32:41:02,640
pregătiți unele dintre datele noastre astfel încât să se potrivească

42888
32:41:01,040 --> 32:41:04,480
corect. Și hai să mergem înainte și să lipim

42889
32:41:02,640 --> 32:41:05,832
acest cod în blocnotesul nostru Jupyter. Şi

42890
32:41:04,480 --> 32:41:08,552
ceea ce aducem este că vom face

42891
32:41:05,832 --> 32:41:10,000
aduceți preprocesarea sklearn

42892
32:41:08,552 --> 32:41:13,120
unde vom importa eticheta

42893
32:41:10,000 --> 32:41:14,720
codificatorul și un codificator fierbinte. A folosi

42894
32:41:13,120 --> 32:41:16,800
codificatorul de etichetă, îl vom crea

42895
32:41:14,720 --> 32:41:19,360
o variabilă numită codificator de etichetă și setată

42896
32:41:16,800 --> 32:41:21,360
este egal cu capitalul L eticheta capital E

42897
32:41:19,360 --> 32:41:24,000
codificator. Acest lucru creează o clasă pe care noi

42898
32:41:21,360 --> 32:41:25,832
poate reutiliza pentru transferul etichetelor

42899
32:41:24,000 --> 32:41:27,592
înainte și înapoi. Acum cam acum ar trebui

42900
32:41:25,832 --> 32:41:29,192
întrebați despre ce etichete vorbim.

42901
32:41:27,592 --> 32:41:31,040
Să aruncăm o privire asupra datelor pe care le avem

42902
32:41:29,192 --> 32:41:32,640
procesat înainte și vezi ce sunt

42903
32:41:31,040 --> 32:41:34,552
vorbind despre aici. Dacă vă amintiți când

42904
32:41:32,640 --> 32:41:37,040
am făcut firmele.cap și am tipărit

42905
32:41:34,552 --> 32:41:39,592
primele cinci rânduri de date. Avem al nostru

42906
32:41:37,040 --> 32:41:42,160
coloane care trec peste. Avem coloana

42907
32:41:39,592 --> 32:41:44,400
zero, care reprezintă cheltuielile RandD, coloana unu

42908
32:41:42,160 --> 32:41:46,800
care este administrația, coloana a doua

42909
32:41:44,400 --> 32:41:49,040
care este cheltuielile de marketing și coloana

42910
32:41:46,800 --> 32:41:51,192
trei este starea. Și vei vedea mai jos

42911
32:41:49,040 --> 32:41:53,592
afirmăm că avem New York, California,

42912
32:41:51,192 --> 32:41:55,592
Florida. Acum să facem o regresie liniară

42913
32:41:53,592 --> 32:41:57,592
model, nu știe cum să proceseze

42914
32:41:55,592 --> 32:41:58,872
New York. Știe cum să proceseze a

42915
32:41:57,592 --> 32:42:00,400
număr. Deci primul lucru la care mergem

42916
32:41:58,872 --> 32:42:02,480
de făcut este că vom schimba acel Nou

42917
32:42:00,400 --> 32:42:04,232
York, California și Florida. Și suntem

42918
32:42:02,480 --> 32:42:06,400
le voi schimba în numere. Asta e

42919
32:42:04,232 --> 32:42:09,592
ce face această linie de cod aici. X

42920
32:42:06,400 --> 32:42:11,680
este egal și apoi are colonul, 3 in

42921
32:42:09,592 --> 32:42:13,512
paranteze. Prima parte, colonul,

42922
32:42:11,680 --> 32:42:15,360
virgulă, înseamnă că ne vom uita

42923
32:42:13,512 --> 32:42:17,040
toate rândurile diferite. Deci mergem

42924
32:42:15,360 --> 32:42:18,872
să-i țină pe toți împreună. Dar singurul

42925
32:42:17,040 --> 32:42:20,232
rândul pe care îl vom edita este al treilea

42926
32:42:18,872 --> 32:42:22,160
rând. Și acolo, o să luăm

42927
32:42:20,232 --> 32:42:25,360
codificatorul de etichetă și ne vom potrivi

42928
32:42:22,160 --> 32:42:26,640
și transformați x și al treilea rând.

42929
32:42:25,360 --> 32:42:28,000
Deci, vom lua al treilea rând,

42930
32:42:26,640 --> 32:42:29,912
o vom seta egal cu a

42931
32:42:28,000 --> 32:42:31,760
transformare. Și acea transformare

42932
32:42:29,912 --> 32:42:34,960
practic îi spune că în loc de

42933
32:42:31,760 --> 32:42:36,800
având un New York, are zero sau a

42934
32:42:34,960 --> 32:42:39,512
unul sau doi. Și apoi, în sfârșit, avem nevoie

42935
32:42:36,800 --> 32:42:42,000
pentru a face un encoder fierbinte, care este egal

42936
32:42:39,512 --> 32:42:44,232
un codificator fierbinte caracteristici categorice

42937
32:42:42,000 --> 32:42:46,552
este egal cu trei. Și apoi luăm X și

42938
32:42:44,232 --> 32:42:49,760
mergem înainte și facem asta egal cu unul fierbinte

42939
32:42:46,552 --> 32:42:52,080
encoder fit transforma X în matrice. Aceasta

42940
32:42:49,760 --> 32:42:54,160
transformarea finală ne pregătește datele pentru

42941
32:42:52,080 --> 32:42:56,232
noi. Deci, este complet setat în felul în care noi

42942
32:42:54,160 --> 32:42:57,832
nevoie de el ca doar un rând de numere. Chiar și

42943
32:42:56,232 --> 32:43:00,160
deși nu este aici, hai să mergem înainte

42944
32:42:57,832 --> 32:43:01,912
și imprimați X și aruncați o privire ce

42945
32:43:00,160 --> 32:43:04,480
aceste date fac. Vei vedea că am un

42946
32:43:01,912 --> 32:43:06,400
matrice de matrice și apoi fiecare matrice este a

42947
32:43:04,480 --> 32:43:08,480
rând de numere. Și dacă merg înainte și

42948
32:43:06,400 --> 32:43:10,480
doar fă rândul zero, vei vedea că am un

42949
32:43:08,480 --> 32:43:12,720
frumos rând organizat de numere pe care

42950
32:43:10,480 --> 32:43:14,000
computerul acum înțelege. Vom merge înainte

42951
32:43:12,720 --> 32:43:15,280
și scoate asta acolo pentru că

42952
32:43:14,000 --> 32:43:18,160
nu înseamnă foarte mult pentru noi. Este

42953
32:43:15,280 --> 32:43:21,440
doar un rând de numere. Următorul la setare

42954
32:43:18,160 --> 32:43:24,320
până la datele noastre, avem manechin de evitare

42955
32:43:21,440 --> 32:43:26,080
capcană variabilă. Acest lucru este foarte important.

42956
32:43:24,320 --> 32:43:28,400
De ce? Pentru că al computerului

42957
32:43:26,080 --> 32:43:30,400
ne-a transformat automat antetul

42958
32:43:28,400 --> 32:43:31,512
în configurare și este automat

42959
32:43:30,400 --> 32:43:34,552
transformat toate acestea diferite

42960
32:43:31,512 --> 32:43:37,832
variabile. Deci, când am făcut codificatorul,

42961
32:43:34,552 --> 32:43:39,912
codificatorul a creat două coloane. Şi

42962
32:43:37,832 --> 32:43:41,592
ceea ce trebuie să facem este doar să avem unul

42963
32:43:39,912 --> 32:43:43,280
deoarece are atât variabila cât și

42964
32:43:41,592 --> 32:43:45,192
nume. Asta este această bucată de cod

42965
32:43:43,280 --> 32:43:49,120
face aici. Să mergem mai departe și să lipim asta

42966
32:43:45,192 --> 32:43:51,592
aici. Și avem x= x două puncte, unul

42967
32:43:49,120 --> 32:43:54,080
colon. Tot ce se face este eliminarea

42968
32:43:51,592 --> 32:43:55,912
acea coloană în plus pe care o punem acolo

42969
32:43:54,080 --> 32:43:57,680
când am făcut singurul nostru codificator fierbinte și al nostru

42970
32:43:55,912 --> 32:43:59,760
codificarea etichetei. Să mergem înainte și să alergăm

42971
32:43:57,680 --> 32:44:01,832
că. Și acum ajungem să ne creăm

42972
32:43:59,760 --> 32:44:03,440
model de regresie liniară. Și să vedem

42973
32:44:01,832 --> 32:44:06,000
cum arată aici. Și suntem

42974
32:44:03,440 --> 32:44:08,640
va face asta în doi pași. Primul

42975
32:44:06,000 --> 32:44:11,912
pasul va fi împărțirea

42976
32:44:08,640 --> 32:44:14,000
date. Acum, ori de câte ori creăm un uh

42977
32:44:11,912 --> 32:44:15,512
model predictiv de date, ne dorim întotdeauna

42978
32:44:14,000 --> 32:44:17,832
să-l despart. Deci, avem un antrenament

42979
32:44:15,512 --> 32:44:19,680
set și avem un set de testare. Asta e

42980
32:44:17,832 --> 32:44:21,680
foarte important. Altfel, am fi foarte

42981
32:44:19,680 --> 32:44:23,592
lipsit de etică fără a-l testa pentru a vedea cum

42982
32:44:21,680 --> 32:44:25,040
bună potrivirea noastră este. Și apoi vom merge înainte

42983
32:44:23,592 --> 32:44:27,512
și creați multiplu liniarul nostru

42984
32:44:25,040 --> 32:44:29,120
model de regresie și antrenați-l și setați-l

42985
32:44:27,512 --> 32:44:30,800
sus. Să mergem mai departe și să lipim asta în continuare

42986
32:44:29,120 --> 32:44:32,552
bucată de cod aici. Și voi merge înainte

42987
32:44:30,800 --> 32:44:34,400
și micșorați-l cu o dimensiune sau două, astfel încât

42988
32:44:32,552 --> 32:44:37,360
toate se potrivesc pe o singură linie. Deci din

42989
32:44:34,400 --> 32:44:40,232
selecția modulului sklearn, vom face

42990
32:44:37,360 --> 32:44:42,000
divizarea testului trenului de import. Și vei vedea

42991
32:44:40,232 --> 32:44:44,160
că am creat patru complet

42992
32:44:42,000 --> 32:44:48,480
variabile diferite. Avem capitalul X

42993
32:44:44,160 --> 32:44:51,912
tren capital X test mai mic Y tren

42994
32:44:48,480 --> 32:44:53,592
testul de stergere mic Y. Acesta este standardul

42995
32:44:51,912 --> 32:44:56,400
modul în care de obicei se referă la acestea

42996
32:44:53,592 --> 32:44:58,400
când facem diferite modele.

42997
32:44:56,400 --> 32:45:00,320
de obicei vezi că un X mare și vezi

42998
32:44:58,400 --> 32:45:02,800
trenul și testul și literele mici

42999
32:45:00,320 --> 32:45:04,720
Y. Ceea ce este asta este X sunt datele noastre

43000
32:45:02,800 --> 32:45:07,040
in. Asta e rotirea noastră RandD, a noastră

43001
32:45:04,720 --> 32:45:09,280
administrare, marketingul nostru. Și apoi

43002
32:45:07,040 --> 32:45:10,720
Y, pe care îl antrenăm, este răspunsul.

43003
32:45:09,280 --> 32:45:12,960
Acesta este profitul pentru că vrem

43004
32:45:10,720 --> 32:45:14,480
cunoașteți profitul unei entități necunoscute. Deci

43005
32:45:12,960 --> 32:45:16,640
pentru asta o să tragem

43006
32:45:14,480 --> 32:45:20,480
acest tutorial. Următoarea parte, trenul,

43007
32:45:16,640 --> 32:45:22,720
testare, împărțire. Luăm X și luăm Y.

43008
32:45:20,480 --> 32:45:25,192
Noi le-am creat deja. X are

43009
32:45:22,720 --> 32:45:26,800
coloane cu datele din el și Y are a

43010
32:45:25,192 --> 32:45:30,000
coloană cu profit în ea. Și atunci suntem

43011
32:45:26,800 --> 32:45:33,512
va seta dimensiunea testului este egală cu 0,2.

43012
32:45:30,000 --> 32:45:34,720
Asta înseamnă practic 20%. Deci 20% din

43013
32:45:33,512 --> 32:45:36,800
rândurile vor fi testate. Mergem

43014
32:45:34,720 --> 32:45:38,720
pentru a le da deoparte. Deci de când

43015
32:45:36,800 --> 32:45:41,040
folosim o mie de linii de date,

43016
32:45:38,720 --> 32:45:42,480
asta înseamnă că 200 din acele linii suntem

43017
32:45:41,040 --> 32:45:44,160
o să țină deoparte pentru a testa

43018
32:45:42,480 --> 32:45:46,160
pentru mai târziu. Și apoi starea aleatorie

43019
32:45:44,160 --> 32:45:48,160
este egal cu zero. Vom randomiza

43020
32:45:46,160 --> 32:45:50,480
pe care le alege pentru a reține

43021
32:45:48,160 --> 32:45:51,912
lateral. Vom merge înainte și vom rula asta. Este

43022
32:45:50,480 --> 32:45:54,160
nu prea interesant pentru că este decor

43023
32:45:51,912 --> 32:45:55,440
sus variabilele noastre. Dar următorul pas este

43024
32:45:54,160 --> 32:45:57,280
pasul următor îl creăm de fapt

43025
32:45:55,440 --> 32:45:59,192
model de regresie liniară. Acum că am primit

43026
32:45:57,280 --> 32:46:01,040
la modelul de regresie liniară, obținem

43027
32:45:59,192 --> 32:46:02,400
următoarea piesă a puzzle-ului. Să mergem

43028
32:46:01,040 --> 32:46:04,232
înainte și pune acel cod acolo și

43029
32:46:02,400 --> 32:46:05,832
treci prin ea. Deci iată-ne. Suntem

43030
32:46:04,232 --> 32:46:07,592
o să-l lipesc acolo. Și să mergem

43031
32:46:05,832 --> 32:46:09,192
înainte și uh, deoarece acesta este un mai scurt

43032
32:46:07,592 --> 32:46:10,552
linie de cod, haideți să mărim acolo, astfel încât

43033
32:46:09,192 --> 32:46:13,592
poate vedea bine. Și avem de la

43034
32:46:10,552 --> 32:46:15,680
modelul sklearn.linear_model,

43035
32:46:13,592 --> 32:46:17,440
vom importa regresia liniară.

43036
32:46:15,680 --> 32:46:19,592
Acum, nu știu dacă îți amintești de

43037
32:46:17,440 --> 32:46:20,960
mai devreme când făceam toate calculele.

43038
32:46:19,592 --> 32:46:22,480
Să mergem înainte și să întoarcem înapoi acolo și

43039
32:46:20,960 --> 32:46:24,320
arunca o privire la asta. Îți amintești

43040
32:46:22,480 --> 32:46:25,592
aici aveam această formulă lungă

43041
32:46:24,320 --> 32:46:28,400
jos și făceam toate astea

43042
32:46:25,592 --> 32:46:30,800
însumare și apoi ne-am uitat și la

43043
32:46:28,400 --> 32:46:32,640
stabilindu-l cu diferitele linii

43044
32:46:30,800 --> 32:46:34,800
și apoi ne-am uitat și noi până în jos

43045
32:46:32,640 --> 32:46:36,160
la regresia liniară multiplă unde

43046
32:46:34,800 --> 32:46:38,720
adăugăm toate acele formule

43047
32:46:36,160 --> 32:46:40,400
împreună. Toate acestea sunt împachetate în

43048
32:46:38,720 --> 32:46:42,000
aceasta singura sectiune. Deci ce se întâmplă

43049
32:46:40,400 --> 32:46:44,160
iată că voi crea o variabilă

43050
32:46:42,000 --> 32:46:46,160
numit regresor. Și regresorul

43051
32:46:44,160 --> 32:46:47,832
este egală cu regresia liniară. Asta este o

43052
32:46:46,160 --> 32:46:50,080
model de regresie liniară care are toate

43053
32:46:47,832 --> 32:46:51,680
acea matematică încorporată. Deci nu trebuie

43054
32:46:50,080 --> 32:46:53,280
au totul memorat sau trebuie să calculeze

43055
32:46:51,680 --> 32:46:54,800
acesta individual. Și apoi facem

43056
32:46:53,280 --> 32:46:57,832
regresor.fit.

43057
32:46:54,800 --> 32:46:59,760
În acest caz, facem xrain și y train

43058
32:46:57,832 --> 32:47:02,000
pentru că folosim datele de antrenament. X

43059
32:46:59,760 --> 32:47:03,680
fiind datele în și y fiind profit

43060
32:47:02,000 --> 32:47:06,000
la ce ne uităm. Și asta face totul

43061
32:47:03,680 --> 32:47:07,832
acea matematică pentru noi. Deci într-un singur clic

43062
32:47:06,000 --> 32:47:10,080
și o linie, am creat întregul

43063
32:47:07,832 --> 32:47:12,160
modelul de regresie liniară și ne potrivim

43064
32:47:10,080 --> 32:47:13,440
date la modelul de regresie liniară. Şi

43065
32:47:12,160 --> 32:47:15,760
puteți vedea că atunci când rulez

43066
32:47:13,440 --> 32:47:18,320
regresor, dă o ieșire liniară

43067
32:47:15,760 --> 32:47:20,720
regresie. Se spune că copia X este adevărată,

43068
32:47:18,320 --> 32:47:22,800
fit intercept este egal cu adevărat, în locuri de muncă egal

43069
32:47:20,720 --> 32:47:24,640
1, normalizarea este egală cu fals. Este doar

43070
32:47:22,800 --> 32:47:26,160
oferindu-ti cateva informatii generale despre

43071
32:47:24,640 --> 32:47:28,320
ce se întâmplă cu acel regresor

43072
32:47:26,160 --> 32:47:30,320
model. Acum că ne-am creat liniarul

43073
32:47:28,320 --> 32:47:32,640
model de regresie, să mergem mai departe și să folosim

43074
32:47:30,320 --> 32:47:35,440
ea. Și dacă vă amintiți, am păstrat o grămadă

43075
32:47:32,640 --> 32:47:37,512
de date deoparte. Deci, vom face un Y

43076
32:47:35,440 --> 32:47:39,832
prezice variabila și vom pune

43077
32:47:37,512 --> 32:47:41,832
în testul X. Și să vedem ce anume

43078
32:47:39,832 --> 32:47:44,080
arata ca. Derulează puțin în sus.

43079
32:47:41,832 --> 32:47:47,192
Lipiți asta aici. Prezicerea testului

43080
32:47:44,080 --> 32:47:49,360
stabiliți rezultate. Deci, aici avem Y prezice

43081
32:47:47,192 --> 32:47:52,232
este egal cu regresor.predict

43082
32:47:49,360 --> 32:47:54,640
Testul X intră. Și asta ne dă Y

43083
32:47:52,232 --> 32:47:56,552
prezice. Acum, pentru că sunt în Jupiter în

43084
32:47:54,640 --> 32:47:58,552
linie, pot doar să pun variabila

43085
32:47:56,552 --> 32:48:00,800
acolo. Și când am apăsat butonul de alergare,

43086
32:47:58,552 --> 32:48:03,912
va tipări acea matrice. aș fi putut

43087
32:48:00,800 --> 32:48:05,680
la fel de ușor de făcut print și prezice. Deci

43088
32:48:03,912 --> 32:48:07,440
dacă sunteți într-un IDE diferit, nu este

43089
32:48:05,680 --> 32:48:09,280
o configurație în linie ca Jupyter

43090
32:48:07,440 --> 32:48:11,512
notebook, o poți face astfel. Imprimați

43091
32:48:09,280 --> 32:48:13,760
y prezice. Și vei vedea asta pentru

43092
32:48:11,512 --> 32:48:16,160
200 de variabile de testare diferite pe care le-am oprit

43093
32:48:13,760 --> 32:48:18,080
în lateral, va produce 200

43094
32:48:16,160 --> 32:48:20,232
răspunsuri. Asta spune profitul

43095
32:48:18,080 --> 32:48:22,640
sunt pentru acele 200 de predicții. Dar haideți

43096
32:48:20,232 --> 32:48:24,000
nu te opri aici. Să continuăm și

43097
32:48:22,640 --> 32:48:26,552
aruncă o privire. O să luăm

43098
32:48:24,000 --> 32:48:28,552
doar un scurt detaliu aici și calcul

43099
32:48:26,552 --> 32:48:30,400
coeficienții și interceptele.

43100
32:48:28,552 --> 32:48:32,400
Acest lucru ne oferă o clipă rapidă la ceea ce este

43101
32:48:30,400 --> 32:48:34,400
mergând în spatele liniei. Vom merge

43102
32:48:32,400 --> 32:48:36,320
faceți un mic ocol aici și mergem

43103
32:48:34,400 --> 32:48:38,080
să fie calculul coeficientului și

43104
32:48:36,320 --> 32:48:40,872
interceptări. Deci, puteți vedea care sunt acestea

43105
32:48:38,080 --> 32:48:42,800
arata ca. Ce e cu adevărat frumos la noi

43106
32:48:40,872 --> 32:48:44,640
regresorul pe care l-am creat este deja

43107
32:48:42,800 --> 32:48:47,592
coeficienții pentru noi. Și putem

43108
32:48:44,640 --> 32:48:49,680
pur și simplu imprimați regresor.coeficient

43109
32:48:47,592 --> 32:48:51,680
subliniere. Când voi rula asta, vei vedea

43110
32:48:49,680 --> 32:48:54,320
coeficienții noștri aici. Și dacă putem face

43111
32:48:51,680 --> 32:48:57,040
coeficientul regresor, putem de asemenea

43112
32:48:54,320 --> 32:48:58,872
faceți interceptarea regresorului. Și haideți

43113
32:48:57,040 --> 32:49:00,640
rulează asta și aruncă o privire la asta. Aceasta

43114
32:48:58,872 --> 32:49:02,480
toate provin din regresia multiplă

43115
32:49:00,640 --> 32:49:04,080
model. Și ne vom întoarce ca să poți

43116
32:49:02,480 --> 32:49:05,760
amintește-ți unde se duce asta

43117
32:49:04,080 --> 32:49:10,000
vine de la. Puteți vedea

43118
32:49:05,760 --> 32:49:12,640
formula aici jos unde y = m1 * x1 m2

43119
32:49:10,000 --> 32:49:14,640
* x2 și așa mai departe și așa mai departe plus c

43120
32:49:12,640 --> 32:49:18,160
coeficient. Deci aceste variabile se potrivesc

43121
32:49:14,640 --> 32:49:21,440
chiar în această formulă. Y equ= panta 1

43122
32:49:18,160 --> 32:49:23,912
* coloana 1 variabila plus panta 2 *

43123
32:49:21,440 --> 32:49:26,080
coloana 2 variabilă până la m

43124
32:49:23,912 --> 32:49:28,872
în n și x la n c

43125
32:49:26,080 --> 32:49:32,720
coeficient sau în acest caz aveți -

43126
32:49:28,872 --> 32:49:34,320
8.89 8 9 la puterea a doi etc etc

43127
32:49:32,720 --> 32:49:36,232
ori prima coloană și a doua

43128
32:49:34,320 --> 32:49:39,680
coloana și a treia coloană și apoi a noastră

43129
32:49:36,232 --> 32:49:41,192
interceptarea este cea în minus3009

43130
32:49:39,680 --> 32:49:42,872
punct. Băiete, devine cam complicat

43131
32:49:41,192 --> 32:49:44,800
când te uiți la ea. Acesta este motivul pentru care noi

43132
32:49:42,872 --> 32:49:46,400
nu mai face asta cu mana. Aceasta este

43133
32:49:44,800 --> 32:49:48,400
de ce avem computer pentru a face acestea

43134
32:49:46,400 --> 32:49:50,480
calcule uşor de înţeles şi

43135
32:49:48,400 --> 32:49:52,160
calcula. Acum, ți-am spus că a fost un

43136
32:49:50,480 --> 32:49:54,080
scurt ocol şi venim spre

43137
32:49:52,160 --> 32:49:55,680
sfârșitul scenariului nostru. După cum vă amintiți

43138
32:49:54,080 --> 32:49:57,360
de la început, am spus dacă suntem

43139
32:49:55,680 --> 32:49:59,192
Vom împărți aceste informații, noi

43140
32:49:57,360 --> 32:50:01,192
trebuie să vă asigurați că este un model valid,

43141
32:49:59,192 --> 32:50:03,680
că acest model funcționează și înțelege cum

43142
32:50:01,192 --> 32:50:05,680
bine ca functioneaza. Deci calculând R

43143
32:50:03,680 --> 32:50:08,232
valoare pătrată, asta vom face

43144
32:50:05,680 --> 32:50:09,832
folosiți pentru a prezice cât de bună predicția noastră

43145
32:50:08,232 --> 32:50:11,440
este. Și să aruncăm o privire la ce anume

43146
32:50:09,832 --> 32:50:14,320
arata ca in cod. Și așa mergem

43147
32:50:11,440 --> 32:50:16,800
pentru a utiliza acest lucru de la sklearn.metrics.

43148
32:50:14,320 --> 32:50:18,960
Vom importa scorul R2. Asta e

43149
32:50:16,800 --> 32:50:22,320
valoarea R pătrat. Ne uităm la

43150
32:50:18,960 --> 32:50:26,480
eroarea. Deci, în scorul R2, luăm

43151
32:50:22,320 --> 32:50:28,320
testul nostru Y versus predicția noastră Y. testul Y

43152
32:50:26,480 --> 32:50:29,760
sunt valorile reale pe care le testăm. Asta

43153
32:50:28,320 --> 32:50:32,000
a fost cel care ne-a fost dat. Deci noi

43154
32:50:29,760 --> 32:50:34,480
stiu ca sunt adevarate. Y-ul prezice acelea

43155
32:50:32,000 --> 32:50:36,480
200 de valori este ceea ce credem că este adevărat.

43156
32:50:34,480 --> 32:50:39,192
Și când mergem înainte și rulăm asta, noi

43157
32:50:36,480 --> 32:50:41,680
vezi că obținem un 9352.

43158
32:50:39,192 --> 32:50:43,680
Acesta este scorul R2. Acum, nu este

43159
32:50:41,680 --> 32:50:46,552
exact un procentaj drept. Deci este

43160
32:50:43,680 --> 32:50:49,760
nu spun că este corect în proporție de 93%, dar o faci

43161
32:50:46,552 --> 32:50:51,440
vreau asta în anii 90 de sus. O și mai sus

43162
32:50:49,760 --> 32:50:53,912
arată că acest lucru este foarte valid

43163
32:50:51,440 --> 32:50:57,592
predicție bazată pe scorul R2. Și dacă

43164
32:50:53,912 --> 32:50:59,440
Valoarea R pătrat de N1 sau 92 după cum am ajuns

43165
32:50:57,592 --> 32:51:01,280
modelul nostru nu uita că are o aleatorie

43166
32:50:59,440 --> 32:51:03,592
generația implicată. Acest lucru demonstrează

43167
32:51:01,280 --> 32:51:06,320
modelul este un model bun, ceea ce înseamnă

43168
32:51:03,592 --> 32:51:08,320
succes. Yay. Ne-am antrenat cu succes

43169
32:51:06,320 --> 32:51:10,400
modelul nostru cu anumiţi predictori şi

43170
32:51:08,320 --> 32:51:12,720
a estimat profitul companiilor

43171
32:51:10,400 --> 32:51:15,040
folosind regresia liniară. Ce este

43172
32:51:12,720 --> 32:51:17,760
regresie logistică? Să zicem că avem

43173
32:51:15,040 --> 32:51:20,000
pentru a construi un model predictiv sau o mașină

43174
32:51:17,760 --> 32:51:23,040
model de învățare pentru a prezice dacă

43175
32:51:20,000 --> 32:51:24,960
pasagerii navei Titanic au

43176
32:51:23,040 --> 32:51:26,800
a supraviețuit sau nu naufragiului. Deci cum

43177
32:51:24,960 --> 32:51:29,760
facem asta? Deci folosim logistica

43178
32:51:26,800 --> 32:51:32,400
regresie pentru a construi un model pentru aceasta.

43179
32:51:29,760 --> 32:51:34,640
Cum folosim regresia logistică? Deci noi

43180
32:51:32,400 --> 32:51:36,872
au informații despre

43181
32:51:34,640 --> 32:51:39,192
pasageri, actul lor de identitate, dacă au

43182
32:51:36,872 --> 32:51:42,160
au supraviețuit sau nu, clasa și numele lor

43183
32:51:39,192 --> 32:51:44,160
și așa mai departe și așa mai departe. Și folosim asta

43184
32:51:42,160 --> 32:51:46,232
informații despre care știm deja

43185
32:51:44,160 --> 32:51:48,872
indiferent dacă persoana a supraviețuit sau nu.

43186
32:51:46,232 --> 32:51:52,232
Acestea sunt informațiile etichetate și noi

43187
32:51:48,872 --> 32:51:54,552
ajuta sistemul să se antreneze pe baza acestui lucru

43188
32:51:52,232 --> 32:51:56,720
informații cu bazate pe acest etichetat

43189
32:51:54,552 --> 32:51:58,640
date. Acest lucru este cunoscut sub numele de date etichetate. Şi

43190
32:51:56,720 --> 32:52:01,120
în timpul procesului de construire a

43191
32:51:58,640 --> 32:52:03,512
model, probabil vom elimina unele dintre ele

43192
32:52:01,120 --> 32:52:05,440
parametrii neesenţiali sau

43193
32:52:03,512 --> 32:52:07,512
atribute aici. Noi luăm doar acelea

43194
32:52:05,440 --> 32:52:09,360
atribute care sunt cu adevărat necesare

43195
32:52:07,512 --> 32:52:12,400
face aceste previziuni. Și odată noi

43196
32:52:09,360 --> 32:52:14,080
antrenăm modelul, rulăm noi date

43197
32:52:12,400 --> 32:52:16,480
acesta prin care modelul va prezice

43198
32:52:14,080 --> 32:52:18,232
dacă pasagerul a supraviețuit sau

43199
32:52:16,480 --> 32:52:20,000
nu. În regulă. Ce este logistica

43200
32:52:18,232 --> 32:52:22,720
regresie? După cum am menționat mai devreme,

43201
32:52:20,000 --> 32:52:25,440
regresia logistică este un algoritm pentru

43202
32:52:22,720 --> 32:52:27,680
efectuând clasificarea binară. Deci

43203
32:52:25,440 --> 32:52:30,320
hai sa luam un exemplu si sa vedem cum se face asta

43204
32:52:27,680 --> 32:52:32,720
lucrări. Să presupunem că mașina ta nu a fost

43205
32:52:30,320 --> 32:52:34,960
service de câțiva ani și acum

43206
32:52:32,720 --> 32:52:37,120
vrei să afli dacă se va întâmpla

43207
32:52:34,960 --> 32:52:39,512
strica in viitorul apropiat. Deci asta

43208
32:52:37,120 --> 32:52:41,832
este ca o problemă de clasificare. Găsiți

43209
32:52:39,512 --> 32:52:44,720
a afla dacă mașina ta se va defecta sau

43210
32:52:41,832 --> 32:52:47,120
nu. Deci, cum vom face asta

43211
32:52:44,720 --> 32:52:50,640
clasificare? Deci, iată cum arată.

43212
32:52:47,120 --> 32:52:52,960
Dacă trasăm informațiile de-a lungul X

43213
32:52:50,640 --> 32:52:55,192
iar axa Y, X este numărul de ani

43214
32:52:52,960 --> 32:52:58,320
de când s-a efectuat ultimul serviciu şi

43215
32:52:55,192 --> 32:53:00,720
Y este probabilitatea mașinii tale

43216
32:52:58,320 --> 32:53:03,120
stricandu-se. Și să spunem asta

43217
32:53:00,720 --> 32:53:06,320
informația a fost mai degrabă aceste date

43218
32:53:03,120 --> 32:53:09,192
colectate de la mai mulți utilizatori de mașini. Este

43219
32:53:06,320 --> 32:53:11,832
nu doar mașina dvs., ci mai mulți utilizatori de mașini.

43220
32:53:09,192 --> 32:53:15,280
Deci acestea sunt datele noastre etichetate. Deci datele

43221
32:53:11,832 --> 32:53:18,160
a fost colectat și um pentru pentru

43222
32:53:15,280 --> 32:53:20,160
numărul de ani și când s-a stricat mașina

43223
32:53:18,160 --> 32:53:22,480
jos și care era probabilitatea și

43224
32:53:20,160 --> 32:53:26,320
care a fost trasat de-a lungul x și y

43225
32:53:22,480 --> 32:53:29,592
axa. Deci aceasta oferă o idee sau de la

43226
32:53:26,320 --> 32:53:31,760
acest grafic putem afla dacă dvs

43227
32:53:29,592 --> 32:53:34,720
masina se strica sau nu. Vom vedea

43228
32:53:31,760 --> 32:53:37,280
cum. Deci, în primul rând, probabilitatea poate

43229
32:53:34,720 --> 32:53:39,912
treci de la 0 la unu. După cum știți cu toții

43230
32:53:37,280 --> 32:53:43,512
probabilitatea poate fi între 0 și unu.

43231
32:53:39,912 --> 32:53:46,480
Și după cum ne putem imagina, este intuitiv ca

43232
32:53:43,512 --> 32:53:49,760
bine. Pe măsură ce numărul de ani este pe

43233
32:53:46,480 --> 32:53:52,552
partea inferioară poate 1 an, 2 ani sau 3

43234
32:53:49,760 --> 32:53:54,720
ani până după serviciu șansele

43235
32:53:52,552 --> 32:53:57,040
a mașinii tale stricate sunt foarte

43236
32:53:54,720 --> 32:53:58,800
limitat. Corect? Deci, de exemplu, șanse

43237
32:53:57,040 --> 32:54:00,872
a mașinii tale care se defectează sau

43238
32:53:58,800 --> 32:54:03,440
probabilitatea ca mașina dvs. să se defecteze

43239
32:54:00,872 --> 32:54:06,640
în termen de 2 ani de la ultimul serviciu sunt

43240
32:54:03,440 --> 32:54:09,832
0,1 probabilitate. La fel este 3 ani

43241
32:54:06,640 --> 32:54:12,800
poate.3 și așa mai departe. Dar ca număr de

43242
32:54:09,832 --> 32:54:15,440
ani creste sa zicem daca a fost 6 sau

43243
32:54:12,800 --> 32:54:17,192
7 ani este aproape o certitudine că

43244
32:54:15,440 --> 32:54:19,512
mașina ta se va strica. Adică

43245
32:54:17,192 --> 32:54:21,760
ceea ce arată acest grafic. Deci acesta este un

43246
32:54:19,512 --> 32:54:24,800
exemplu de aplicare a

43247
32:54:21,760 --> 32:54:27,280
algoritm de clasificare și vom vedea

43248
32:54:24,800 --> 32:54:29,280
în mici detalii cât de exact logistică

43249
32:54:27,280 --> 32:54:31,192
aici se aplică regresia. încă unul

43250
32:54:29,280 --> 32:54:34,800
lucru care trebuie adăugat aici este că

43251
32:54:31,192 --> 32:54:37,120
rezultatul variabilelor dependente este discret.

43252
32:54:34,800 --> 32:54:40,160
Deci, dacă vorbim despre dacă

43253
32:54:37,120 --> 32:54:42,640
masina se strica sau nu. Deci

43254
32:54:40,160 --> 32:54:44,552
este o valoare discretă. Y pe care noi

43255
32:54:42,640 --> 32:54:46,400
vorbim despre variabila dependentă

43256
32:54:44,552 --> 32:54:48,080
că vorbim despre ceea ce suntem

43257
32:54:46,400 --> 32:54:51,040
Privind este dacă mașina merge

43258
32:54:48,080 --> 32:54:53,040
a strica sau nu da sau nu adică

43259
32:54:51,040 --> 32:54:56,000
despre ce vorbim. Deci aici

43260
32:54:53,040 --> 32:54:58,160
rezultatul este discret și nu continuu

43261
32:54:56,000 --> 32:55:00,960
valoare. Deci, așa este logistica

43262
32:54:58,160 --> 32:55:03,280
curba de regresie arată. Lasă-mă să explic a

43263
32:55:00,960 --> 32:55:07,280
putin ce anume si cum anume

43264
32:55:03,280 --> 32:55:10,160
vom stabili clasa

43265
32:55:07,280 --> 32:55:12,400
rezultatul mai degrabă. Deci pentru o logistică

43266
32:55:10,160 --> 32:55:14,552
curba de regresie trebuie să fie un prag

43267
32:55:12,400 --> 32:55:16,720
set spunând că pentru că acesta este un

43268
32:55:14,552 --> 32:55:19,280
calculul probabilității rețineți că acesta este

43269
32:55:16,720 --> 32:55:22,400
un calcul de probabilitate și

43270
32:55:19,280 --> 32:55:25,280
probabilitatea în sine nu va fi zero sau

43271
32:55:22,400 --> 32:55:28,000
unul dar bazat pe probabilitatea de care avem nevoie

43272
32:55:25,280 --> 32:55:29,760
pentru a decide care ar trebui să fie rezultatul. Deci

43273
32:55:28,000 --> 32:55:32,960
trebuie să existe un prag ca pt

43274
32:55:29,760 --> 32:55:35,512
exemplu 0,5 poate fi pragul let's

43275
32:55:32,960 --> 32:55:38,480
spune in acest caz. Deci orice valoare a

43276
32:55:35,512 --> 32:55:41,760
probabilitatea sub 0,5 este considerată a

43277
32:55:38,480 --> 32:55:44,552
fi zero și orice valoare de mai sus.5 este

43278
32:55:41,760 --> 32:55:46,480
considerat a fi unul. Deci o ieșire de

43279
32:55:44,552 --> 32:55:48,960
sa zicem8

43280
32:55:46,480 --> 32:55:51,512
va însemna că mașina se va strica.

43281
32:55:48,960 --> 32:55:54,960
Deci, aceasta este considerată o ieșire de 1

43282
32:55:51,512 --> 32:55:57,280
și să presupunem că o ieșire de 29 este

43283
32:55:54,960 --> 32:55:59,512
considerat zero, ceea ce înseamnă că

43284
32:55:57,280 --> 32:56:02,080
masina nu se va strica. Deci asta este

43285
32:55:59,512 --> 32:56:04,480
modul în care funcţionează regresia logistică. Acum hai

43286
32:56:02,080 --> 32:56:06,872
face o comparație rapidă între logistică

43287
32:56:04,480 --> 32:56:09,592
regresie şi regresie liniară deoarece

43288
32:56:06,872 --> 32:56:11,912
ambele au termenul regresie în

43289
32:56:09,592 --> 32:56:13,760
ei. Deci poate provoca confuzie. Deci

43290
32:56:11,912 --> 32:56:15,512
să încercăm să eliminăm această confuzie. Deci

43291
32:56:13,760 --> 32:56:18,872
ce este regresia liniară? Linear

43292
32:56:15,512 --> 32:56:21,680
regresia este un proces este din nou o

43293
32:56:18,872 --> 32:56:24,160
algoritm pentru învățare supravegheată.

43294
32:56:21,680 --> 32:56:25,592
Totuși, aici vei găsi un

43295
32:56:24,160 --> 32:56:27,440
valoare continuă. Ai de gând să

43296
32:56:25,592 --> 32:56:30,160
determina o valoare continuă. S-ar putea

43297
32:56:27,440 --> 32:56:32,000
să fie prețul unei proprietăți imobiliare.

43298
32:56:30,160 --> 32:56:33,760
Ar putea fi drumeția ta, câtă drumeție

43299
32:56:32,000 --> 32:56:36,160
vei primi sau ar putea fi o

43300
32:56:33,760 --> 32:56:38,160
pretul actiunilor. Toate acestea sunt continue

43301
32:56:36,160 --> 32:56:40,480
valorile. Acestea nu sunt discrete în comparație

43302
32:56:38,160 --> 32:56:42,400
la un fel de răspuns da sau nu care

43303
32:56:40,480 --> 32:56:44,720
cautam in logistica

43304
32:56:42,400 --> 32:56:47,512
regresie. Deci acesta este un exemplu de a

43305
32:56:44,720 --> 32:56:49,912
regresie liniară. Să spunem echipa de HR

43306
32:56:47,512 --> 32:56:51,440
a unei companii încearcă să afle ce

43307
32:56:49,912 --> 32:56:53,360
ar trebui să fie creșterea salariului unui

43308
32:56:51,440 --> 32:56:55,192
angajat. Deci ei colectează toate

43309
32:56:53,360 --> 32:56:57,192
detalii despre angajații lor existenți,

43310
32:56:55,192 --> 32:56:59,592
ratingurile lor și creșterile salariale,

43311
32:56:57,192 --> 32:57:01,912
ceea ce a fost dat și asta este

43312
32:56:59,592 --> 32:57:04,872
informații etichetate care sunt disponibile

43313
32:57:01,912 --> 32:57:06,872
iar sistemul învață din asta. Este

43314
32:57:04,872 --> 32:57:09,592
instruit și învață din acest etichetat

43315
32:57:06,872 --> 32:57:11,760
informații astfel încât atunci când un angajați noi

43316
32:57:09,592 --> 32:57:13,280
informațiile sunt furnizate pe baza ratingului

43317
32:57:11,760 --> 32:57:15,192
va determina care ar trebui să fie

43318
32:57:13,280 --> 32:57:18,320
înalt. Deci aceasta este o regresie liniară

43319
32:57:15,192 --> 32:57:21,832
problemă și un exemplu de regresie liniară.

43320
32:57:18,320 --> 32:57:25,192
Acum salariul este o valoare continuă. tu

43321
32:57:21,832 --> 32:57:29,360
poate obține 5.000, 5.500,

43322
32:57:25,192 --> 32:57:32,232
5.600. Nu este discret ca o pisica sau

43323
32:57:29,360 --> 32:57:34,480
un câine sau un măr sau o banană. Acestea sunt

43324
32:57:32,232 --> 32:57:37,120
discret sau un da sau un nu. Acestea sunt

43325
32:57:34,480 --> 32:57:40,080
valori discrete, nu? Deci aici unde

43326
32:57:37,120 --> 32:57:42,640
încerci să găsești valori continue

43327
32:57:40,080 --> 32:57:44,800
este locul în care folosim regresia liniară. Deci

43328
32:57:42,640 --> 32:57:47,592
să spunem doar pentru a extinde acest lucru

43329
32:57:44,800 --> 32:57:49,760
scenariu, acum vrem să aflăm

43330
32:57:47,592 --> 32:57:53,192
dacă acest angajat va primi o

43331
32:57:49,760 --> 32:57:55,360
promovare sau nu. Deci vrem să aflăm

43332
32:57:53,192 --> 32:57:58,480
este o problemă discretă, nu? Un da

43333
32:57:55,360 --> 32:58:01,512
sau nici un fel de problema. In acest caz,

43334
32:57:58,480 --> 32:58:04,000
de fapt nu putem folosi regresia liniară

43335
32:58:01,512 --> 32:58:06,160
chiar dacă este posibil să avem date etichetate. Aşa

43336
32:58:04,000 --> 32:58:08,160
acestea sunt datele etichetei. Deci, pe baza

43337
32:58:06,160 --> 32:58:11,592
evaluarea angajaților acestea sunt evaluările

43338
32:58:08,160 --> 32:58:13,680
și apoi unii au primit promovarea

43339
32:58:11,592 --> 32:58:16,480
și acestea sunt evaluările pentru care oamenii

43340
32:58:13,680 --> 32:58:18,872
nu a primit promovare care este un nu și

43341
32:58:16,480 --> 32:58:21,512
acesta este ratingul pentru care au primit oamenii

43342
32:58:18,872 --> 32:58:23,912
promovarea despre care tocmai am trasat datele

43343
32:58:21,512 --> 32:58:26,320
dacă o persoană are un angajat are

43344
32:58:23,912 --> 32:58:28,400
am promovat sau nu da nu drept asa

43345
32:58:26,320 --> 32:58:30,552
nu există nimic între ele și ce este

43346
32:58:28,400 --> 32:58:32,480
angajații evaluează bine și evaluează

43347
32:58:30,552 --> 32:58:35,192
poate fi continuu, ceea ce nu este o problemă

43348
32:58:32,480 --> 32:58:37,440
dar ieșirea este discretă în În acest

43349
32:58:35,192 --> 32:58:40,480
Dacă angajatul a primit promovare da

43350
32:58:37,440 --> 32:58:43,192
nu bine, deci dacă încercăm să complotăm asta și noi

43351
32:58:40,480 --> 32:58:45,280
încercați să găsiți o linie dreaptă așa

43352
32:58:43,192 --> 32:58:47,440
ar arăta și după cum puteți vedea

43353
32:58:45,280 --> 32:58:49,192
nu arată foarte bine pentru că arată

43354
32:58:47,440 --> 32:58:51,360
parca vor fi multe erori

43355
32:58:49,192 --> 32:58:54,400
eroare pătratică medie dacă vă amintiți

43356
32:58:51,360 --> 32:58:57,680
pentru regresia liniară ar fi foarte foarte

43357
32:58:54,400 --> 32:59:00,800
mare și, de asemenea, valorile nu pot merge

43358
32:58:57,680 --> 32:59:02,960
dincolo de zero sau dincolo de unu. Deci graficul

43359
32:59:00,800 --> 32:59:06,232
probabil ar trebui să arate oarecum așa

43360
32:59:02,960 --> 32:59:09,280
tăiat la 0 și unu. Dar totusi

43361
32:59:06,232 --> 32:59:12,080
linia dreaptă nu pare corectă.

43362
32:59:09,280 --> 32:59:14,080
Prin urmare, în loc să folosiți un liniar

43363
32:59:12,080 --> 32:59:16,160
ecuația pe care trebuie să o găsim

43364
32:59:14,080 --> 32:59:19,120
ceva diferit și deci cel

43365
32:59:16,160 --> 32:59:21,040
modelul de regresie logistică arată oarecum

43366
32:59:19,120 --> 32:59:23,592
ca asta. Deci calculăm

43367
32:59:21,040 --> 32:59:25,760
probabilitate și dacă reprezentăm că

43368
32:59:23,592 --> 32:59:27,280
probabilitatea nu sub forma a

43369
32:59:25,760 --> 32:59:28,872
linie dreaptă, dar trebuie să folosim unele

43370
32:59:27,280 --> 32:59:31,592
altă ecuație. Și vom vedea foarte

43371
32:59:28,872 --> 32:59:34,160
în curând care este acea ecuație. Atunci este o

43372
32:59:31,592 --> 32:59:35,912
proces treptat. Corect? Deci vezi aici

43373
32:59:34,160 --> 32:59:38,640
persoanele cu unele dintre aceste evaluări sunt

43374
32:59:35,912 --> 32:59:41,680
nu primesc nicio promoție și apoi

43375
32:59:38,640 --> 32:59:44,320
încet uh, la un anumit rating ei primesc

43376
32:59:41,680 --> 32:59:47,360
promovare. Deci, acesta este un proces gradual

43377
32:59:44,320 --> 32:59:49,912
și așa este matematica din spate

43378
32:59:47,360 --> 32:59:53,280
regresia logistică arată. Așa suntem

43379
32:59:49,912 --> 32:59:55,280
încercând să găsească șansele pentru un anume

43380
32:59:53,280 --> 32:59:57,912
eveniment care are loc și aceasta este formula

43381
32:59:55,280 --> 33:00:00,640
pentru găsirea șanselor. Deci probabilitatea

43382
32:59:57,912 --> 33:00:03,192
a unui eveniment care se petrece împărțit de

43383
33:00:00,640 --> 33:00:05,512
probabilitatea ca evenimentul să nu se întâmple.

43384
33:00:03,192 --> 33:00:07,360
Deci P dacă este probabilitatea ca

43385
33:00:05,512 --> 33:00:09,592
probabilitatea de întâmplare a evenimentului

43386
33:00:07,360 --> 33:00:11,512
persoană care primește o promovare și se împarte

43387
33:00:09,592 --> 33:00:15,192
prin probabilitatea persoanei nu

43388
33:00:11,512 --> 33:00:17,760
obțineți o promovare care este 1 minus P.

43389
33:00:15,192 --> 33:00:21,192
Deci, așa măsori șansele. Acum

43390
33:00:17,760 --> 33:00:24,232
valorile cotelor variază de la 0 la

43391
33:00:21,192 --> 33:00:27,192
infinit. Deci atunci când această probabilitate este

43392
33:00:24,232 --> 33:00:29,040
zero, atunci cota va fi valoarea lui

43393
33:00:27,192 --> 33:00:32,080
cota este egală cu zero și când

43394
33:00:29,040 --> 33:00:35,360
probabilitatea devine 1 apoi valoarea lui

43395
33:00:32,080 --> 33:00:37,280
cota este 1 cu 0 care va fi infinit

43396
33:00:35,360 --> 33:00:40,800
dar probabilitatea în sine rămâne

43397
33:00:37,280 --> 33:00:42,960
intre 0 si 1. Acum asa se face an

43398
33:00:40,800 --> 33:00:45,832
ecuația unei linii drepte arată. Deci y

43399
33:00:42,960 --> 33:00:48,480
este egal cu beta 0 plus beta 1x unde

43400
33:00:45,832 --> 33:00:51,040
beta 0 este interceptarea y și beta 1 este

43401
33:00:48,480 --> 33:00:54,720
panta dreptei. Dacă luăm

43402
33:00:51,040 --> 33:00:56,720
ecuația cotelor și luați un log al ambelor

43403
33:00:54,720 --> 33:00:59,592
părți, atunci asta ar arăta oarecum

43404
33:00:56,720 --> 33:01:01,912
ca asta. Și termenul logistic este

43405
33:00:59,592 --> 33:01:04,960
de fapt derivat din faptul că noi

43406
33:01:01,912 --> 33:01:07,360
fac asta. Luăm un log de px cu 1

43407
33:01:04,960 --> 33:01:09,360
minus px. Aceasta este o extensie a

43408
33:01:07,360 --> 33:01:12,080
calculul cotelor pe care le-am văzut,

43409
33:01:09,360 --> 33:01:13,832
nu? Și asta este egal cu beta 0 plus

43410
33:01:12,080 --> 33:01:16,000
beta 1x care este ecuația lui

43411
33:01:13,832 --> 33:01:20,080
linie dreaptă. Și acum de aici dacă tu

43412
33:01:16,000 --> 33:01:22,552
Vrem să aflăm valoarea px pe care o vom face

43413
33:01:20,080 --> 33:01:25,280
vezi că putem lua exponențialul pe ambele

43414
33:01:22,552 --> 33:01:28,640
laturi și apoi dacă rezolvăm acea ecuație

43415
33:01:25,280 --> 33:01:33,120
vom obține ecuația lui px astfel

43416
33:01:28,640 --> 33:01:36,080
px este egal cu 1 cu 1 e ^ din minus

43417
33:01:33,120 --> 33:01:37,912
beta 0 beta 1x și amintiți-vă că aceasta este

43418
33:01:36,080 --> 33:01:40,872
nimic altceva decât ecuația dreptei

43419
33:01:37,912 --> 33:01:44,552
care este egal cu y este egal cu beta 0  

43420
33:01:40,872 --> 33:01:46,960
beta 1x. Deci aceasta este ecuația

43421
33:01:44,552 --> 33:01:48,640
cunoscută și sub denumirea de funcție sigmoidă și

43422
33:01:46,960 --> 33:01:50,640
aceasta este ecuația logisticii

43423
33:01:48,640 --> 33:01:53,680
regresie alg. În regulă și dacă asta este

43424
33:01:50,640 --> 33:01:57,040
trasată așa este curba sigmoidă

43425
33:01:53,680 --> 33:01:59,120
obtinut. Deci, să comparăm liniar și

43426
33:01:57,040 --> 33:02:00,960
regresie logistică cum sunt

43427
33:01:59,120 --> 33:02:03,912
diferite unele de altele. Să mergem

43428
33:02:00,960 --> 33:02:07,192
înapoi. Deci regresia liniară este rezolvată sau

43429
33:02:03,912 --> 33:02:10,000
folosit pentru rezolvarea problemelor de regresie şi

43430
33:02:07,192 --> 33:02:12,080
regresia logistică este utilizată pentru a rezolva

43431
33:02:10,000 --> 33:02:14,552
probleme de clasificare. Deci ambele sunt

43432
33:02:12,080 --> 33:02:17,360
numită regresie. Dar regresia liniară

43433
33:02:14,552 --> 33:02:19,680
este folosit pentru rezolvarea problemelor de regresie

43434
33:02:17,360 --> 33:02:22,320
unde prezicem valori continue.

43435
33:02:19,680 --> 33:02:24,640
În timp ce regresia logistică este folosită pentru

43436
33:02:22,320 --> 33:02:27,912
rezolvarea problemelor de clasificare unde noi

43437
33:02:24,640 --> 33:02:29,832
au trebuit să prezică valori discrete. The

43438
33:02:27,912 --> 33:02:31,832
variabile de răspuns în cazul liniare

43439
33:02:29,832 --> 33:02:33,760
regresiile sunt de natură continuă.

43440
33:02:31,832 --> 33:02:36,480
Pe când aici sunt categorice sau

43441
33:02:33,760 --> 33:02:38,720
discretă în natură. Și liniarul

43442
33:02:36,480 --> 33:02:40,480
regresia ajută la estimarea

43443
33:02:38,720 --> 33:02:42,552
variabilă dependentă când există a

43444
33:02:40,480 --> 33:02:44,872
modificarea variabilei independente.

43445
33:02:42,552 --> 33:02:46,960
Pe când aici în cazul logisticii

43446
33:02:44,872 --> 33:02:49,440
regresie ajută la calcularea

43447
33:02:46,960 --> 33:02:51,040
probabilitatea sau posibilitatea a

43448
33:02:49,440 --> 33:02:53,192
eveniment anume care are loc. Și liniară

43449
33:02:51,040 --> 33:02:54,800
regresia după cum sugerează și numele este a

43450
33:02:53,192 --> 33:02:57,040
linie dreaptă. De aceea se numește

43451
33:02:54,800 --> 33:03:00,640
regresie liniară. În timp ce logistică

43452
33:02:57,040 --> 33:03:03,592
regresia este o funcție sigmoidă și

43453
33:03:00,640 --> 33:03:05,440
curba este forma curbei este S.

43454
33:03:03,592 --> 33:03:07,592
Este o curbă în formă de S. Acesta este altul

43455
33:03:05,440 --> 33:03:09,760
exemplu de aplicare a logisticii

43456
33:03:07,592 --> 33:03:12,080
regresie în prognoza vremii.

43457
33:03:09,760 --> 33:03:14,080
Fie că va ploua sau nu.

43458
33:03:12,080 --> 33:03:16,400
Acum rețineți că ambele sunt folosite

43459
33:03:14,080 --> 33:03:18,720
prognoza meteo. Dacă vrem să găsim

43460
33:03:16,400 --> 33:03:21,512
valorile discrete cum ar fi dacă este

43461
33:03:18,720 --> 33:03:23,512
a ploua sau a nu ploua adică a

43462
33:03:21,512 --> 33:03:25,120
problema de clasificare. Folosim logistica

43463
33:03:23,512 --> 33:03:26,720
regresie. Dar dacă vrem să stabilim

43464
33:03:25,120 --> 33:03:29,192
care va fi temperatura

43465
33:03:26,720 --> 33:03:31,360
mâine, atunci vom folosi regresia liniară.

43466
33:03:29,192 --> 33:03:33,120
Așa că țineți cont de faptul că pe vreme

43467
33:03:31,360 --> 33:03:34,960
predicție, de fapt le folosim pe amândouă. Dar

43468
33:03:33,120 --> 33:03:36,480
acestea sunt câteva exemple de logistică

43469
33:03:34,960 --> 33:03:38,480
regresie. Deci vrem să aflăm

43470
33:03:36,480 --> 33:03:40,080
indiferent dacă va fi ploaie sau nu,

43471
33:03:38,480 --> 33:03:42,000
va fi soare sau nu, indiferent dacă

43472
33:03:40,080 --> 33:03:44,720
va ninge sau nu. Acestea sunt toate

43473
33:03:42,000 --> 33:03:47,120
exemple de regresie logistică. Încă câteva

43474
33:03:44,720 --> 33:03:49,912
exemple. Clasificarea obiectelor.

43475
33:03:47,120 --> 33:03:52,160
Acesta este din nou un alt exemplu de

43476
33:03:49,912 --> 33:03:54,080
regresie logistică. Acum aici desigur

43477
33:03:52,160 --> 33:03:57,592
o distincție este că acestea sunt

43478
33:03:54,080 --> 33:04:01,192
clasificare multiclasă. Deci logistic

43479
33:03:57,592 --> 33:04:03,360
regresia nu este folosită în original

43480
33:04:01,192 --> 33:04:05,832
formă dar se folosește într-o formă ușoară

43481
33:04:03,360 --> 33:04:08,320
formă diferită. Deci spunem dacă este

43482
33:04:05,832 --> 33:04:09,912
un câine sau nu un câine. sper ca tu

43483
33:04:08,320 --> 33:04:12,720
intelege. Deci, în loc să spui este a

43484
33:04:09,912 --> 33:04:15,192
câine sau pisică sau elefant convertim asta

43485
33:04:12,720 --> 33:04:18,720
să spunem asta pentru că trebuie să păstrăm

43486
33:04:15,192 --> 33:04:22,000
aceasta la clasificare binară. Așa spunem noi

43487
33:04:18,720 --> 33:04:24,000
este un caine sau nu un caine? Este o pisică sau

43488
33:04:22,000 --> 33:04:26,552
nu o pisica? Așa este modul logistic

43489
33:04:24,000 --> 33:04:28,480
regresia poate fi folosită pentru clasificare

43490
33:04:26,552 --> 33:04:30,232
obiecte. Altfel sunt altele

43491
33:04:28,480 --> 33:04:32,320
tehnici care pot fi folosite pentru

43492
33:04:30,232 --> 33:04:34,480
efectuând clasificarea multiclasă. În

43493
33:04:32,320 --> 33:04:37,440
este utilizată regresia logistică de asistență medicală

43494
33:04:34,480 --> 33:04:40,080
pentru a afla rata de supraviețuire a unui pacient.

43495
33:04:37,440 --> 33:04:42,872
Deci iau mai mulți parametri, cum ar fi

43496
33:04:40,080 --> 33:04:45,192
scorul de traumă și vârsta și așa mai departe și așa

43497
33:04:42,872 --> 33:04:48,000
înainte și încearcă să prezică rata

43498
33:04:45,192 --> 33:04:50,872
de supravieţuire. În regulă. Acum in sfarsit

43499
33:04:48,000 --> 33:04:53,912
hai sa luam un exemplu si sa vedem cum putem

43500
33:04:50,872 --> 33:04:56,000
aplica regresia logistica pentru a prezice

43501
33:04:53,912 --> 33:04:58,640
numărul care este afișat în imagine. Deci

43502
33:04:56,000 --> 33:05:01,760
acesta este de fapt un demo live. o voi face

43503
33:04:58,640 --> 33:05:03,592
te duc în caietul Jupyter și u

43504
33:05:01,760 --> 33:05:05,120
arata codul. Dar înainte de asta lasă-mă

43505
33:05:03,592 --> 33:05:07,040
vă duce prin câteva diapozitive la

43506
33:05:05,120 --> 33:05:10,480
explică ce încercăm să facem. Deci

43507
33:05:07,040 --> 33:05:13,512
să presupunem că aveți o imagine de 8x8 și

43508
33:05:10,480 --> 33:05:16,160
imaginea are un număr 1 2 3 4 și tu

43509
33:05:13,512 --> 33:05:19,280
trebuie să-ți antrenezi modelul pentru a prezice ce

43510
33:05:16,160 --> 33:05:21,280
acest număr este. Deci cum facem asta? Deci

43511
33:05:19,280 --> 33:05:23,192
primul lucru este evident în oricare

43512
33:05:21,280 --> 33:05:25,360
procesul de învățare automată pe care îl instruiți

43513
33:05:23,192 --> 33:05:28,400
model. Deci, în acest caz, folosim

43514
33:05:25,360 --> 33:05:30,720
regresie logistică. Așa și atunci noi

43515
33:05:28,400 --> 33:05:33,440
oferi un set de instruire pentru a instrui

43516
33:05:30,720 --> 33:05:36,080
model și apoi testăm cât de precise sunt

43517
33:05:33,440 --> 33:05:38,640
modelul este cu datele de testare, ceea ce înseamnă

43518
33:05:36,080 --> 33:05:41,120
ca orice proces de învățare automată.

43519
33:05:38,640 --> 33:05:42,720
Am împărțit datele noastre inițiale în două părți

43520
33:05:41,120 --> 33:05:44,640
set de antrenament și set de testare. Cu

43521
33:05:42,720 --> 33:05:46,720
set de antrenament ne antrenăm modelul și apoi

43522
33:05:44,640 --> 33:05:49,592
cu setul de testare testăm modelul

43523
33:05:46,720 --> 33:05:52,640
până vom obține o precizie bună și apoi noi

43524
33:05:49,592 --> 33:05:56,080
folosiți-l pentru deducere. Corect? Așa că

43525
33:05:52,640 --> 33:05:58,232
este metodologia tipică a uh uh

43526
33:05:56,080 --> 33:06:00,400
instruire, testare și apoi implementare

43527
33:05:58,232 --> 33:06:02,960
modele de învățare automată. Deci hai să uh

43528
33:06:00,400 --> 33:06:04,872
uită-te la cod și vezi ce

43529
33:06:02,960 --> 33:06:06,400
facem. Deci nu voi trece la rând

43530
33:06:04,872 --> 33:06:08,552
linie, ci doar să te ia prin câteva dintre

43531
33:06:06,400 --> 33:06:11,192
blocurile. Deci primul lucru pe care îl facem este

43532
33:06:08,552 --> 33:06:14,160
importăm toate bibliotecile și apoi noi

43533
33:06:11,192 --> 33:06:16,232
practic aruncați o privire la imagini și

43534
33:06:14,160 --> 33:06:19,360
vezi care este numărul total de imagini.

43535
33:06:16,232 --> 33:06:21,040
Putem afișa folosind mattplot lip unele

43536
33:06:19,360 --> 33:06:24,000
a imaginilor sau o mostră din acestea

43537
33:06:21,040 --> 33:06:25,832
imagini și apoi împărțim datele

43538
33:06:24,000 --> 33:06:28,872
în antrenament și testare, așa cum am menționat

43539
33:06:25,832 --> 33:06:32,800
mai devreme și putem face câteva explorări

43540
33:06:28,872 --> 33:06:34,872
analiză și apoi ne construim modelul.

43541
33:06:32,800 --> 33:06:37,592
Ne antrenăm modelul cu setul de antrenament

43542
33:06:34,872 --> 33:06:40,480
și apoi îl testăm cu setul nostru de testare

43543
33:06:37,592 --> 33:06:43,040
și aflați cât de precis este modelul nostru

43544
33:06:40,480 --> 33:06:45,192
folosind matricea de confuzie harta termică

43545
33:06:43,040 --> 33:06:48,000
și folosiți harta termică pentru a vizualiza acest lucru

43546
33:06:45,192 --> 33:06:50,480
și vă voi arăta în cod ce

43547
33:06:48,000 --> 33:06:53,592
exact este matricea de confuzie și cum

43548
33:06:50,480 --> 33:06:56,320
poate fi folosit pentru a găsi acuratețea

43549
33:06:53,592 --> 33:06:59,680
în exemplul nostru, obținem o precizie

43550
33:06:56,320 --> 33:07:01,592
de aproximativ 94, ceea ce este destul de bun sau 94%

43551
33:06:59,680 --> 33:07:03,512
care este destul de bine, deci ce

43552
33:07:01,592 --> 33:07:06,640
este matricea de confuzie. Acesta este un

43553
33:07:03,512 --> 33:07:09,192
exemplu de matrice de confuzie și uh

43554
33:07:06,640 --> 33:07:12,800
aceasta este folosită pentru identificarea

43555
33:07:09,192 --> 33:07:15,120
acuratețea unui model de clasificare sau

43556
33:07:12,800 --> 33:07:17,592
ca un model de regresie logistică. Deci

43557
33:07:15,120 --> 33:07:19,832
partea cea mai importantă într-o confuzie

43558
33:07:17,592 --> 33:07:22,000
matricea este că mai întâi de toate ca tine

43559
33:07:19,832 --> 33:07:24,552
se poate vedea că aceasta este o matrice și dimensiunea

43560
33:07:22,000 --> 33:07:27,760
matricea depinde de câte ieșiri

43561
33:07:24,552 --> 33:07:29,680
uh ne asteptam corect. Deci cel

43562
33:07:27,760 --> 33:07:32,960
cea mai importantă parte aici este că

43563
33:07:29,680 --> 33:07:36,640
modelul va fi cel mai precis atunci când avem

43564
33:07:32,960 --> 33:07:39,280
numerele maxime din diagonala sa ca

43565
33:07:36,640 --> 33:07:42,160
în acest caz, de aceea are aproape 93

43566
33:07:39,280 --> 33:07:45,760
94% pentru că diagonalele ar trebui să aibă

43567
33:07:42,160 --> 33:07:47,592
numerele maxime iar celelalte altele

43568
33:07:45,760 --> 33:07:50,080
decât diagonalele celulele altele decât cele

43569
33:07:47,592 --> 33:07:51,680
diagonalele ar trebui să aibă foarte puține numere.

43570
33:07:50,080 --> 33:07:53,912
Deci iată ce se întâmplă. Deci

43571
33:07:51,680 --> 33:07:57,440
este un doi aici. Există există o

43572
33:07:53,912 --> 33:07:59,832
unul aici. Dar majoritatea dintre ei sunt de-a lungul

43573
33:07:57,440 --> 33:08:03,360
diagonală. Asta ce înseamnă asta? Acest

43574
33:07:59,832 --> 33:08:06,320
înseamnă că numărul care a fost alimentat

43575
33:08:03,360 --> 33:08:09,680
este zero și numărul care a fost

43576
33:08:06,320 --> 33:08:11,680
detectat este, de asemenea, zero. Deci cele prezise

43577
33:08:09,680 --> 33:08:14,232
valoarea și valoarea reală sunt aceleași.

43578
33:08:11,680 --> 33:08:16,232
Deci de-a lungul diagonalelor este adevărat.

43579
33:08:14,232 --> 33:08:18,800
Ceea ce înseamnă că hai să luăm asta

43580
33:08:16,232 --> 33:08:21,040
diagonala dreapta. Dacă dacă numărul maxim

43581
33:08:18,800 --> 33:08:24,320
este aici, asta înseamnă că uh ca aici în

43582
33:08:21,040 --> 33:08:26,640
acest caz este 34, ceea ce înseamnă că 34

43583
33:08:24,320 --> 33:08:27,760
a imaginilor care au fost alimentate sau

43584
33:08:26,640 --> 33:08:31,360
mai degrabă de fapt sunt două

43585
33:08:27,760 --> 33:08:33,912
mclasificări acolo. Deci 36 de imagini

43586
33:08:31,360 --> 33:08:36,720
au fost hrănite care au numărul patru și

43587
33:08:33,912 --> 33:08:39,440
dintre care 34 au fost prezise

43588
33:08:36,720 --> 33:08:41,592
corect ca numărul patru și unul are

43589
33:08:39,440 --> 33:08:43,832
fost prezis ca numărul opt și

43590
33:08:41,592 --> 33:08:46,640
altul a fost prezis ca număr

43591
33:08:43,832 --> 33:08:48,872
nouă. Deci acestea sunt două mclasificări.

43592
33:08:46,640 --> 33:08:50,720
Bine. Deci acesta este sensul a spune

43593
33:08:48,872 --> 33:08:52,800
că numărul maxim ar trebui să fie în

43594
33:08:50,720 --> 33:08:55,760
diagonală. Deci, dacă le ai pe toate așa

43595
33:08:52,800 --> 33:08:58,480
pentru un model ideal care să zicem

43596
33:08:55,760 --> 33:09:00,080
Precizie 100%, totul va fi doar în

43597
33:08:58,480 --> 33:09:02,552
diagonala. Nu vor fi numere

43598
33:09:00,080 --> 33:09:05,440
altele decât zero în toate celelalte celule. Deci

43599
33:09:02,552 --> 33:09:08,160
este ca un model 100% precis.

43600
33:09:05,440 --> 33:09:10,872
Bine. Deci, acesta este esenta modului de utilizare

43601
33:09:08,160 --> 33:09:13,280
această matrice. Cum să folosești asta

43602
33:09:10,872 --> 33:09:15,512
matricea de confuzie. Deci știu numele uh

43603
33:09:13,280 --> 33:09:17,760
este o confuzie care sună amuzant

43604
33:09:15,512 --> 33:09:19,440
matrice, dar de fapt nu este foarte

43605
33:09:17,760 --> 33:09:21,512
confuz. Este foarte simplu. Deci

43606
33:09:19,440 --> 33:09:24,080
tu doar complotezi ceea ce a fost

43607
33:09:21,512 --> 33:09:26,080
prezis și ce este etichetat

43608
33:09:24,080 --> 33:09:28,000
informații sau care sunt datele reale

43609
33:09:26,080 --> 33:09:29,760
acesta este cunoscut și sub numele de adevărul de bază

43610
33:09:28,000 --> 33:09:31,912
uneori. Bine, acestea sunt niște fanteziste

43611
33:09:29,760 --> 33:09:34,080
termenii care sunt folosiți. Etichetă așa prezisă

43612
33:09:31,912 --> 33:09:35,592
și eticheta reală asta este tot.

43613
33:09:34,080 --> 33:09:38,320
Bine. Da. Așa că arătăm puțin

43614
33:09:35,592 --> 33:09:40,160
mai multe informații aici. Deci 38 au

43615
33:09:38,320 --> 33:09:41,912
fost prezis și aici veți vedea

43616
33:09:40,160 --> 33:09:44,872
că toate au fost prezise

43617
33:09:41,912 --> 33:09:47,040
corect. Au fost 38 de zerouri și

43618
33:09:44,872 --> 33:09:49,440
valoarea prezisă și valoarea reală

43619
33:09:47,040 --> 33:09:52,552
este exact la fel. Pe când în asta

43620
33:09:49,440 --> 33:09:57,592
cazul corect are uh acolo sunt cred

43621
33:09:52,552 --> 33:10:01,912
37 5 da 42 au fost alimentate cu imaginile

43622
33:09:57,592 --> 33:10:04,720
42 de imagini sunt cu cifra trei și uh

43623
33:10:01,912 --> 33:10:07,040
acuratețea este doar 37 dintre ele au fost

43624
33:10:04,720 --> 33:10:09,512
prezis cu acurateţe. Trei dintre ei au

43625
33:10:07,040 --> 33:10:11,360
a fost prezis ca numărul șapte și doi

43626
33:10:09,512 --> 33:10:13,440
dintre ele au fost prezise ca număr

43627
33:10:11,360 --> 33:10:15,512
opt și așa mai departe și așa mai departe. Bine. Toate

43628
33:10:13,440 --> 33:10:17,912
corect. Deci, cu asta să intrăm în

43629
33:10:15,512 --> 33:10:22,320
Jupyter notebook și a vedea cum codul

43630
33:10:17,912 --> 33:10:25,512
arata. Deci acesta este codul din Jupyter

43631
33:10:22,320 --> 33:10:27,192
caiet pentru regresie logistică. În

43632
33:10:25,512 --> 33:10:31,040
acest demo special, ceea ce mergem

43633
33:10:27,192 --> 33:10:34,640
a face este să ne antrenăm modelul să recunoască

43634
33:10:31,040 --> 33:10:38,480
cifre care sunt imaginile care au

43635
33:10:34,640 --> 33:10:41,760
cifre de la 0 la 5 sau de la 0 la 9

43636
33:10:38,480 --> 33:10:43,280
și um și apoi vom vedea cât de bine

43637
33:10:41,760 --> 33:10:46,320
este instruit și dacă este capabil

43638
33:10:43,280 --> 33:10:48,552
prezice aceste numere corect sau nu.

43639
33:10:46,320 --> 33:10:51,912
Deci, să începem. Deci prima parte

43640
33:10:48,552 --> 33:10:55,280
ca de obicei, importam unele

43641
33:10:51,912 --> 33:10:58,552
biblioteci care sunt necesare și atunci

43642
33:10:55,280 --> 33:11:02,000
ultima linie din acest bloc este de a încărca

43643
33:10:58,552 --> 33:11:06,160
cifrele. Deci hai să mergem înainte și să alergăm

43644
33:11:02,000 --> 33:11:08,720
acest cod. Apoi aici vom vizualiza

43645
33:11:06,160 --> 33:11:11,040
forma acestor cifre. Deci putem

43646
33:11:08,720 --> 33:11:15,120
vedeți aici dacă ne uităm așa

43647
33:11:11,040 --> 33:11:17,912
forma este 1797 pe 64. Acestea sunt ca

43648
33:11:15,120 --> 33:11:20,232
imagini 8 x 8. Deci asta este

43649
33:11:17,912 --> 33:11:22,552
reflectată în această formă. Acum de la

43650
33:11:20,232 --> 33:11:24,640
aici încolo suntem practic din nou

43651
33:11:22,552 --> 33:11:27,680
importând unele dintre bibliotecile care sunt

43652
33:11:24,640 --> 33:11:29,912
necesare ca numpy și hartă complot și noi

43653
33:11:27,680 --> 33:11:33,512
va arunca o privire la unele dintre ele

43654
33:11:29,912 --> 33:11:36,160
exemple de imagini pe care le-am încărcat. Deci th

43655
33:11:33,512 --> 33:11:38,552
acesta, de exemplu, creează o figură

43656
33:11:36,160 --> 33:11:41,592
și apoi mergem înainte și luăm câteva

43657
33:11:38,552 --> 33:11:43,760
mostre de imagini pentru a vedea cum arată. Deci

43658
33:11:41,592 --> 33:11:46,160
Lasă-mă să rulez acest cod și astfel încât

43659
33:11:43,760 --> 33:11:48,720
devine ușor de înțeles. Deci astea sunt

43660
33:11:46,160 --> 33:11:52,480
aproximativ cinci imagini eșantion de imagini pe care noi

43661
33:11:48,720 --> 33:11:54,640
se uită la 0 1 2 3 4. Deci, iată cum

43662
33:11:52,480 --> 33:11:57,912
imaginile asa sunt datele.

43663
33:11:54,640 --> 33:12:00,720
Bine. Și pe baza asta vom face

43664
33:11:57,912 --> 33:12:03,120
antrenează de fapt regresia noastră logistică

43665
33:12:00,720 --> 33:12:06,320
model și apoi îl vom testa și vom vedea

43666
33:12:03,120 --> 33:12:09,040
cât de bine este capabil să recunoască. Deci

43667
33:12:06,320 --> 33:12:12,000
modul în care funcționează este informațiile despre pixeli.

43668
33:12:09,040 --> 33:12:16,232
Deci, după cum puteți vedea aici, acesta este un 8x 8

43669
33:12:12,000 --> 33:12:19,040
un fel de pixeli de imagine și fiecare

43670
33:12:16,232 --> 33:12:20,960
pixel indiferent dacă este activat sau nu

43671
33:12:19,040 --> 33:12:23,592
activat, aceasta este informația

43672
33:12:20,960 --> 33:12:26,232
disponibil pentru fiecare pixel. Acum bazat pe

43673
33:12:23,592 --> 33:12:28,552
tiparul acestei activări şi

43674
33:12:26,232 --> 33:12:31,680
neactivarea diferiților pixeli

43675
33:12:28,552 --> 33:12:34,160
acesta va fi identificat drept zero pentru

43676
33:12:31,680 --> 33:12:37,120
exemplu exact la fel cum puteți vedea

43677
33:12:34,160 --> 33:12:40,320
deci per total fiecare dintre aceste numere

43678
33:12:37,120 --> 33:12:42,232
are de fapt un model diferit al

43679
33:12:40,320 --> 33:12:45,912
activarea pixelilor și asta e cam mult

43680
33:12:42,232 --> 33:12:47,832
că modelul nostru trebuie să învețe pentru care

43681
33:12:45,912 --> 33:12:50,232
număr care este modelul

43682
33:12:47,832 --> 33:12:52,640
activarea pixelilor drept astfel încât

43683
33:12:50,232 --> 33:12:55,440
este ceea ce vom pregăti modelul nostru.

43684
33:12:52,640 --> 33:12:59,040
Bine. Deci primul lucru pe care trebuie să-l facem

43685
33:12:55,440 --> 33:13:01,912
este să ne împărțim datele în formare și

43686
33:12:59,040 --> 33:13:04,720
set de date de testare. Corect? Deci ori de câte ori noi

43687
33:13:01,912 --> 33:13:06,552
efectuați orice antrenament, împărțim datele

43688
33:13:04,720 --> 33:13:08,872
în antrenament și testare. Astfel încât

43689
33:13:06,552 --> 33:13:11,120
setul de date de antrenament este folosit pentru a antrena

43690
33:13:08,872 --> 33:13:14,080
sistem. Deci trecem probabil de asta

43691
33:13:11,120 --> 33:13:16,800
de mai multe ori. Uh și apoi îl testăm

43692
33:13:14,080 --> 33:13:18,800
cu setul de date de testare. Și despărțirea este

43693
33:13:16,800 --> 33:13:20,400
de obicei sub forma de acolo și acolo

43694
33:13:18,800 --> 33:13:22,720
sunt diverse moduri în care vă puteți împărți

43695
33:13:20,400 --> 33:13:25,280
aceste date. Depinde de individ

43696
33:13:22,720 --> 33:13:29,280
preferințe. În cazul nostru, aici suntem

43697
33:13:25,280 --> 33:13:33,680
despicarea sub forma de 23 si 77. Deci

43698
33:13:29,280 --> 33:13:38,000
când spunem dimensiunea testului ca 2023

43699
33:13:33,680 --> 33:13:41,192
asta înseamnă că 23% din toate datele sunt

43700
33:13:38,000 --> 33:13:43,760
folosit pentru testare și restul de 77%

43701
33:13:41,192 --> 33:13:46,640
este folosit pentru antrenament. Deci există o

43702
33:13:43,760 --> 33:13:49,280
o funcție ușor disponibilă care este uh

43703
33:13:46,640 --> 33:13:51,280
numită împărțirea testului trenului. Deci noi nu

43704
33:13:49,280 --> 33:13:53,680
trebuie să scrieți orice cod special pentru

43705
33:13:51,280 --> 33:13:56,640
despicarea. Se va împărți automat

43706
33:13:53,680 --> 33:13:58,720
datele bazate pe proporția pe care noi

43707
33:13:56,640 --> 33:14:00,232
dați aici care este dimensiunea testului. Deci doar noi

43708
33:13:58,720 --> 33:14:02,872
dați automat dimensiunea testului

43709
33:14:00,232 --> 33:14:05,680
Mărimea antrenamentului va fi determinată și uh

43710
33:14:02,872 --> 33:14:09,192
transmitem datele pe care vrem să le împărțim

43711
33:14:05,680 --> 33:14:13,192
iar rezultatele vor fi stocate în x

43712
33:14:09,192 --> 33:14:16,232
train și y train pentru datele de antrenament

43713
33:14:13,192 --> 33:14:18,640
set. Și ce este trenul x? Acestea sunt acestea

43714
33:14:16,232 --> 33:14:22,720
sunt caracteristicile corecte care este ca

43715
33:14:18,640 --> 33:14:25,680
variabila independentă și trenul y este

43716
33:14:22,720 --> 33:14:28,000
etichetați corect deci în acest caz ce se întâmplă

43717
33:14:25,680 --> 33:14:30,720
este că avem valoarea de intrare care este sau

43718
33:14:28,000 --> 33:14:33,360
valoarea caracteristicilor care este în trenul x

43719
33:14:30,720 --> 33:14:36,400
și deoarece aceasta este o dată etichetată pentru

43720
33:14:33,360 --> 33:14:38,960
fiecare dintre ele fiecare dintre observaţiile noi

43721
33:14:36,400 --> 33:14:41,192
au deja informațiile de pe etichetă

43722
33:14:38,960 --> 33:14:43,680
spunând dacă această cifră este zero sau a

43723
33:14:41,192 --> 33:14:46,080
unul sau doi, astfel încât aceasta este ceea ce

43724
33:14:43,680 --> 33:14:48,400
va fi folosit pentru comparație pentru a afla

43725
33:14:46,080 --> 33:14:50,960
dacă sistemul este capabil

43726
33:14:48,400 --> 33:14:52,400
recunoaște-l corect sau există o

43727
33:14:50,960 --> 33:14:54,720
eroare pentru fiecare observație pe care o va face

43728
33:14:52,400 --> 33:14:58,720
comparați cu acest drept, deci acesta este

43729
33:14:54,720 --> 33:15:02,320
eticheta deci la fel este x trenul y trenul

43730
33:14:58,720 --> 33:15:05,120
pentru setul de date de antrenament x test y test

43731
33:15:02,320 --> 33:15:06,872
este pentru setul de date de testare, așa că permiteți-mă

43732
33:15:05,120 --> 33:15:09,280
mergeți mai departe și executați și acest cod

43733
33:15:06,872 --> 33:15:11,592
și apoi putem merge să verificăm repede

43734
33:15:09,280 --> 33:15:14,872
care este câte intrări există

43735
33:15:11,592 --> 33:15:17,680
iar în fiecare dintre acestea so x antrenează forma

43736
33:15:14,872 --> 33:15:22,232
este 1383x

43737
33:15:17,680 --> 33:15:24,552
64 și trenul y are 1383 pentru că există

43738
33:15:22,232 --> 33:15:28,800
uh nimic ca a doua parte nu este

43739
33:15:24,552 --> 33:15:32,232
necesare aici și apoi x forma de testare noi

43740
33:15:28,800 --> 33:15:35,360
vezi este 414, deci de fapt sunt 414

43741
33:15:32,232 --> 33:15:37,192
observații în test și 1383

43742
33:15:35,360 --> 33:15:39,680
observații în tren deci asta

43743
33:15:37,192 --> 33:15:42,872
practic ceea ce sunt aceste patru linii de cod

43744
33:15:39,680 --> 33:15:44,552
spun OK, apoi importăm

43745
33:15:42,872 --> 33:15:47,192
regresie logistică

43746
33:15:44,552 --> 33:15:50,000
bibliotecă și care face parte din

43747
33:15:47,192 --> 33:15:51,512
scikitlearn. Deci noi nu trebuie

43748
33:15:50,000 --> 33:15:53,440
implementează regresia logistică

43749
33:15:51,512 --> 33:15:56,400
proces în sine. Numai pe astea le numim uh

43750
33:15:53,440 --> 33:15:59,440
funcția și uh lasă-mă să merg înainte și

43751
33:15:56,400 --> 33:16:01,680
execută asta astfel încât să avem

43752
33:15:59,440 --> 33:16:04,552
biblioteca de regresie logistică importată.

43753
33:16:01,680 --> 33:16:07,912
Acum creăm o instanță de logistică

43754
33:16:04,552 --> 33:16:10,320
regresie. Corect? Deci regr logistic este a

43755
33:16:07,912 --> 33:16:12,960
este un exemplu de regresie logistică

43756
33:16:10,320 --> 33:16:15,280
și apoi folosim asta pentru antrenamentul nostru

43757
33:16:12,960 --> 33:16:17,360
model. Așa că mai întâi să execut asta

43758
33:16:15,280 --> 33:16:19,592
cod. Deci aceste două rânduri. Deci primul

43759
33:16:17,360 --> 33:16:22,080
line creează practic o instanță de

43760
33:16:19,592 --> 33:16:25,280
modelul de regresie logistică și apoi cel

43761
33:16:22,080 --> 33:16:27,760
a doua linie este locul unde trecem pe lângă noi

43762
33:16:25,280 --> 33:16:31,120
date setul de date de antrenament. Corect? Aceasta

43763
33:16:27,760 --> 33:16:33,832
noștri sunt predictorii și asta este

43764
33:16:31,120 --> 33:16:36,960
ținta noastră. Trecem acest set de date

43765
33:16:33,832 --> 33:16:39,592
să ne antrenăm modelul. În regulă. Deci odata

43766
33:16:36,960 --> 33:16:42,232
facem acest lucru în acest caz, datele nu sunt

43767
33:16:39,592 --> 33:16:44,872
mare, dar în mare uh antrenamentul

43768
33:16:42,232 --> 33:16:47,512
este ceea ce ia de obicei mult timp. Deci

43769
33:16:44,872 --> 33:16:50,000
cheltuim în activități de învățare automată

43770
33:16:47,512 --> 33:16:52,720
în proiecte de învățare automată cheltuim a

43771
33:16:50,000 --> 33:16:54,872
mult timp pentru partea de antrenament.

43772
33:16:52,720 --> 33:16:56,640
Bine. Deci aici setul de date este relativ

43773
33:16:54,872 --> 33:16:59,360
mic deci a fost destul de rapid. Deci toate

43774
33:16:56,640 --> 33:17:02,160
chiar așa că acum modelul nostru a fost antrenat

43775
33:16:59,360 --> 33:17:04,640
folosind setul de date de antrenament și noi

43776
33:17:02,160 --> 33:17:07,192
vreau să văd cât de exact este acest lucru. Deci

43777
33:17:04,640 --> 33:17:10,160
ceea ce vom face este să-l testăm

43778
33:17:07,192 --> 33:17:14,000
probabil chipuri. Așa că lasă-mă mai întâi să încerc

43779
33:17:10,160 --> 33:17:16,000
cât de bine funcționează asta pentru o singură imagine.

43780
33:17:14,000 --> 33:17:19,192
Bine, o voi încerca doar cu unul

43781
33:17:16,000 --> 33:17:21,680
imaginea mea este prima intrare în datele mele de testare

43782
33:17:19,192 --> 33:17:24,160
setează și vezi dacă este corect

43783
33:17:21,680 --> 33:17:26,720
prezice sau nu. Deci și pentru a

43784
33:17:24,160 --> 33:17:29,192
testați-l astfel încât în scopul antrenamentului îl folosim

43785
33:17:26,720 --> 33:17:32,080
metoda potrivirii. Există o metodă numită

43786
33:17:29,192 --> 33:17:34,000
potrivire care este pentru antrenamentul modelului si

43787
33:17:32,080 --> 33:17:37,040
odată terminat antrenamentul dacă vrei

43788
33:17:34,000 --> 33:17:39,760
testați pentru o anumită valoare nouă intrare

43789
33:17:37,040 --> 33:17:42,720
folosești metoda predict. Bine. Deci

43790
33:17:39,760 --> 33:17:46,640
hai sa rulam metoda predict si trecem

43791
33:17:42,720 --> 33:17:50,000
această imagine specială și vedem asta

43792
33:17:46,640 --> 33:17:53,592
forma este sau predicția este patru.

43793
33:17:50,000 --> 33:17:56,800
Deci hai să mai încercăm câteva. Lasă-mă să văd pentru

43794
33:17:53,592 --> 33:17:58,640
următoarele 10 par să fie bine. Asa ca lasa

43795
33:17:56,800 --> 33:18:00,800
eu merg înainte și testează întregul

43796
33:17:58,640 --> 33:18:02,960
set de date. Bine, asta e ceea ce noi

43797
33:18:00,800 --> 33:18:06,480
va face. Așa că acum vrem să aflăm cum

43798
33:18:02,960 --> 33:18:09,360
exact acest lucru ați făcut. Deci noi

43799
33:18:06,480 --> 33:18:11,680
utilizați metoda scorului pentru a afla care este

43800
33:18:09,360 --> 33:18:14,800
procente de precizie și vedem aici

43801
33:18:11,680 --> 33:18:17,192
că a funcționat până la 94%

43802
33:18:14,800 --> 33:18:20,320
exacte. Bine. Deci asta e pe asta

43803
33:18:17,192 --> 33:18:23,680
parte. Acum, ceea ce putem face și noi este că putem

43804
33:18:20,320 --> 33:18:26,552
um vezi și această precizie folosind ceea ce este

43805
33:18:23,680 --> 33:18:29,280
cunoscut sub numele de matrice de confuzie. Deci hai să mergem

43806
33:18:26,552 --> 33:18:32,320
înainte și încearcă și asta. Da

43807
33:18:29,280 --> 33:18:35,440
că putem și vizualiza cât de bine uh

43808
33:18:32,320 --> 33:18:37,680
acest model a făcut. Așa că lasă-mă

43809
33:18:35,440 --> 33:18:39,280
executați această bucată de cod care va

43810
33:18:37,680 --> 33:18:42,960
practic importa unele dintre biblioteci

43811
33:18:39,280 --> 33:18:46,080
care sunt necesare și um noi, practic

43812
33:18:42,960 --> 33:18:48,800
creați o matrice de confuzie o instanță a

43813
33:18:46,080 --> 33:18:52,080
matricea de confuzie prin rularea confuziei

43814
33:18:48,800 --> 33:18:55,440
matrice și transmiterea acestor valori uh. Deci

43815
33:18:52,080 --> 33:18:59,440
avem deci această matrice_confuzie

43816
33:18:55,440 --> 33:19:02,400
metoda ia doi parametri unul este y

43817
33:18:59,440 --> 33:19:04,480
test și celălalt este predicția.

43818
33:19:02,400 --> 33:19:06,872
Deci, ce este un test y? Acestea sunt

43819
33:19:04,480 --> 33:19:10,400
valori etichetate pentru care le știm deja

43820
33:19:06,872 --> 33:19:13,280
setul de date de testare și previziunile sunt

43821
33:19:10,400 --> 33:19:16,000
ceea ce sistemul a prezis pentru

43822
33:19:13,280 --> 33:19:19,760
set de date de testare. Bine. Deci acest lucru este cunoscut

43823
33:19:16,000 --> 33:19:22,800
noi și asta este ceea ce are sistemul uh

43824
33:19:19,760 --> 33:19:24,960
modelul a generat. Deci noi cam

43825
33:19:22,800 --> 33:19:26,720
creați matricea de confuzie și vom face

43826
33:19:24,960 --> 33:19:28,800
tipăriți-l. Și așa este

43827
33:19:26,720 --> 33:19:32,232
matricea de confuzie arată. Ca nume

43828
33:19:28,800 --> 33:19:34,960
sugerează că este o matrice și cheia

43829
33:19:32,232 --> 33:19:38,160
subliniază aici că acuratețea

43830
33:19:34,960 --> 33:19:40,480
modelul este determinat de câte

43831
33:19:38,160 --> 33:19:43,280
numerele sunt acolo în diagonală. The

43832
33:19:40,480 --> 33:19:46,000
mai mult numerele din diagonală, cu atât

43833
33:19:43,280 --> 33:19:48,160
mai bine precizia este. Bine. Și mai întâi

43834
33:19:46,000 --> 33:19:50,960
dintre toate, suma totală a tuturor numerelor

43835
33:19:48,160 --> 33:19:53,912
în toată această matrice este egală cu

43836
33:19:50,960 --> 33:19:55,592
numărul de observații din datele testului

43837
33:19:53,912 --> 33:19:57,192
set. Acesta este primul lucru, nu? Deci

43838
33:19:55,592 --> 33:19:59,440
dacă adunați toate aceste numere, asta

43839
33:19:57,192 --> 33:20:01,680
va fi egal cu numărul de

43840
33:19:59,440 --> 33:20:04,400
observații din setul de date de testare. Şi

43841
33:20:01,680 --> 33:20:06,320
apoi din asta, numărul maxim de

43842
33:20:04,400 --> 33:20:08,552
ar trebui să fie în diagonală. Asta

43843
33:20:06,320 --> 33:20:10,552
înseamnă că precizia este destul de bună. Dacă

43844
33:20:08,552 --> 33:20:12,480
numerele din diagonală sunt mai mici

43845
33:20:10,552 --> 33:20:15,120
iar în toate celelalte locuri sunt multe

43846
33:20:12,480 --> 33:20:17,680
de numere uh, ceea ce înseamnă precizia

43847
33:20:15,120 --> 33:20:19,680
este foarte scăzută. Diagonala indică a

43848
33:20:17,680 --> 33:20:22,000
predicție corectă că aceasta înseamnă că

43849
33:20:19,680 --> 33:20:24,000
valoarea reală este aceeași cu cea a

43850
33:20:22,000 --> 33:20:25,512
valoarea prezisă. Aici din nou valoarea reală

43851
33:20:24,000 --> 33:20:27,680
este aceeași cu valoarea prezisă și așadar

43852
33:20:25,512 --> 33:20:29,912
pe. Corect? Deci, în momentul în care vezi o

43853
33:20:27,680 --> 33:20:32,400
număr aici care înseamnă valoarea reală

43854
33:20:29,912 --> 33:20:34,232
este ceva și valoarea prezisă este

43855
33:20:32,400 --> 33:20:36,160
altceva. Corect? La fel și aici

43856
33:20:34,232 --> 33:20:38,552
valoarea reală este ceva și

43857
33:20:36,160 --> 33:20:41,440
valoarea prezisă este altceva. Deci

43858
33:20:38,552 --> 33:20:45,040
practic așa citim noi

43859
33:20:41,440 --> 33:20:47,592
matricea de confuzie. Acum cum găsim

43860
33:20:45,040 --> 33:20:50,480
precizie? Puteți, de fapt, să adăugați

43861
33:20:47,592 --> 33:20:54,400
valorile totale în diagonală. Așa este

43862
33:20:50,480 --> 33:20:56,640
ca 38 44 43 și așa mai departe și împărțiți

43863
33:20:54,400 --> 33:20:58,800
că prin numărul total de teste

43864
33:20:56,640 --> 33:21:01,192
observații care vă vor oferi

43865
33:20:58,800 --> 33:21:03,592
precizie procentuală folosind o confuzie

43866
33:21:01,192 --> 33:21:06,320
matricea. Acum să vizualizăm asta

43867
33:21:03,592 --> 33:21:09,360
matrice de confuzie într-un pic mai mult

43868
33:21:06,320 --> 33:21:11,912
mod sofisticat folosind o hartă termică.

43869
33:21:09,360 --> 33:21:14,160
Așa că vom crea o hartă termică cu unele

43870
33:21:11,912 --> 33:21:17,120
vom adauga si cateva culori. Este uh

43871
33:21:14,160 --> 33:21:19,192
este ca un mai mult vizual vizual

43872
33:21:17,120 --> 33:21:21,360
atrăgătoare. Deci asta e toată ideea. Deci

43873
33:21:19,192 --> 33:21:25,040
dacă mă lăsăm să rulez această bucată de cod și

43874
33:21:21,360 --> 33:21:28,000
asa arata harta termica. Uh și

43875
33:21:25,040 --> 33:21:30,640
după cum puteți vedea aici diagonalele din nou

43876
33:21:28,000 --> 33:21:32,800
sunt toate valorile sunt aici cele mai multe dintre

43877
33:21:30,640 --> 33:21:35,592
valorile. Deci ceea ce înseamnă în mod rezonabil asta

43878
33:21:32,800 --> 33:21:38,160
pare a fi rezonabil de precis și da

43879
33:21:35,592 --> 33:21:40,480
practic, scorul de precizie este de 94%.

43880
33:21:38,160 --> 33:21:43,120
Acesta este calculat așa cum am menționat de

43881
33:21:40,480 --> 33:21:45,512
adunând toate aceste numere împărțite la

43882
33:21:43,120 --> 33:21:49,192
valorile totale ale testului sau numărul total de

43883
33:21:45,512 --> 33:21:51,832
observații în setul de date de testare. Bine. Deci

43884
33:21:49,192 --> 33:21:54,232
aceasta este matricea de confuzie pentru

43885
33:21:51,832 --> 33:21:57,832
regresie logistică.

43886
33:21:54,232 --> 33:22:00,080
În regulă. Deci acum că am văzut

43887
33:21:57,832 --> 33:22:02,640
matrice de confuzie, să luăm o scurtă

43888
33:22:00,080 --> 33:22:05,760
eșantionați și vedeți cât de bine este sistemul

43889
33:22:02,640 --> 33:22:09,360
a clasificat și vom lua câteva

43890
33:22:05,760 --> 33:22:11,832
exemple de date. Deci dacă vedem aici

43891
33:22:09,360 --> 33:22:14,480
noi am luat la întâmplare câteva dintre ele.

43892
33:22:11,832 --> 33:22:16,552
Deci acesta este numărul patru care este

43893
33:22:14,480 --> 33:22:19,440
valoarea reală și, de asemenea, cea prevăzută

43894
33:22:16,552 --> 33:22:22,080
valoarea ambele sunt patru. Aceasta este o imagine a

43895
33:22:19,440 --> 33:22:24,552
zero. Deci valoarea prezisă este de asemenea

43896
33:22:22,080 --> 33:22:27,592
zero. Valoarea reală este desigur zero.

43897
33:22:24,552 --> 33:22:30,080
Atunci aceasta este imaginea lui nouă. Deci asta

43898
33:22:27,592 --> 33:22:32,320
a fost de asemenea prezis corect 9 şi

43899
33:22:30,080 --> 33:22:34,800
valoarea reală este 9. Și aceasta este imaginea

43900
33:22:32,320 --> 33:22:37,120
de unul. Și din nou asta a fost

43901
33:22:34,800 --> 33:22:40,552
prezis corect ca la fel ca real

43902
33:22:37,120 --> 33:22:43,040
valoare. Bine. Deci aceasta a fost o demonstrație rapidă a

43903
33:22:40,552 --> 33:22:46,400
regresie logistică. Cum se utilizează logistica

43904
33:22:43,040 --> 33:22:48,480
regresie pentru identificarea imaginilor.

43905
33:22:46,400 --> 33:22:50,400
>> Ce este un arbore de decizie? Să mergem

43906
33:22:48,480 --> 33:22:52,400
printr-un exemplu foarte simplu în fața noastră

43907
33:22:50,400 --> 33:22:54,640
sapă adânc. Arborele de decizie este a

43908
33:22:52,400 --> 33:22:56,400
diagramă în formă de arbore utilizată pentru a determina a

43909
33:22:54,640 --> 33:22:58,480
curs de acțiune. Fiecare ramură a

43910
33:22:56,400 --> 33:23:00,400
arborele reprezintă o posibilă decizie sau

43911
33:22:58,480 --> 33:23:02,232
apariție sau reacție. Să începem cu

43912
33:23:00,400 --> 33:23:04,320
o simpla intrebare. Cum să identifici a

43913
33:23:02,232 --> 33:23:06,000
legume aleatorii dintr-o pungă de cumpărături?

43914
33:23:04,320 --> 33:23:07,680
Deci, avem acest grup de legume

43915
33:23:06,000 --> 33:23:09,832
aici. Și putem începe prin a întreba a

43916
33:23:07,680 --> 33:23:12,000
întrebare simplă. Este roșu? Și dacă este

43917
33:23:09,832 --> 33:23:14,160
nu, atunci va fi violet

43918
33:23:12,000 --> 33:23:15,360
fructe în stânga, probabil o vinete.

43919
33:23:14,160 --> 33:23:17,512
Dacă este adevărat, va fi unul dintre

43920
33:23:15,360 --> 33:23:20,160
fructele rosii. Este diametrul mai mare

43921
33:23:17,512 --> 33:23:21,912
decat doi? Dacă este fals, va fi a

43922
33:23:20,160 --> 33:23:24,160
ceea ce pare a fi un chili roșu. Și dacă

43923
33:23:21,912 --> 33:23:26,232
este adevărat, va fi un clopoțel

43924
33:23:24,160 --> 33:23:28,160
ardei din familia ardeiului ardei. Aşa,

43925
33:23:26,232 --> 33:23:30,400
este un ardei capia.

43926
33:23:28,160 --> 33:23:31,832
Probleme pe care arborele de decizie le poate rezolva.

43927
33:23:30,400 --> 33:23:33,760
Deci, să ne uităm la cele două diferite

43928
33:23:31,832 --> 33:23:35,040
categorii poate fi utilizat arborele de decizie

43929
33:23:33,760 --> 33:23:37,512
pe. Poate fi folosit pe

43930
33:23:35,040 --> 33:23:39,280
clasificare, adevăratul fals, da, nu,

43931
33:23:37,512 --> 33:23:41,280
și poate fi folosit pe regresie unde

43932
33:23:39,280 --> 33:23:43,592
ne dăm seama în ce se află următoarea valoare

43933
33:23:41,280 --> 33:23:45,912
o serie de numere sau un grup de date.

43934
33:23:43,592 --> 33:23:49,120
În clasificare, clasificarea

43935
33:23:45,912 --> 33:23:51,592
arbore va determina un set de logic dacă

43936
33:23:49,120 --> 33:23:53,280
apoi condiţii de clasificare a problemelor.

43937
33:23:51,592 --> 33:23:55,592
De exemplu, discriminarea între

43938
33:23:53,280 --> 33:23:58,000
trei tipuri de flori bazate pe anumite

43939
33:23:55,592 --> 33:24:00,320
caracteristici. În regresie, o regresie

43940
33:23:58,000 --> 33:24:02,480
arborele este utilizat când variabila țintă este

43941
33:24:00,320 --> 33:24:04,400
de natură numerică sau continuă. Noi

43942
33:24:02,480 --> 33:24:06,552
potriviți modelul de regresie la țintă

43943
33:24:04,400 --> 33:24:08,960
variabilă folosind fiecare dintre independente

43944
33:24:06,552 --> 33:24:12,480
variabile. Fiecare împărțire se face pe baza

43945
33:24:08,960 --> 33:24:14,640
suma erorii pătrate. Înainte să săpăm

43946
33:24:12,480 --> 33:24:16,480
mai adânc în mecanica

43947
33:24:14,640 --> 33:24:18,480
arborele de decizie, să aruncăm o privire la

43948
33:24:16,480 --> 33:24:20,000
avantajele utilizării unui arbore de decizie și

43949
33:24:18,480 --> 33:24:22,000
vom arunca o privire și la

43950
33:24:20,000 --> 33:24:24,320
dezavantaje. Primul lucru pe care îl vei face

43951
33:24:22,000 --> 33:24:27,192
observația este că este simplu

43952
33:24:24,320 --> 33:24:28,640
înțelege, interpretează și vizualiza. Ea

43953
33:24:27,192 --> 33:24:30,480
chiar strălucește aici pentru că poți vedea

43954
33:24:28,640 --> 33:24:32,640
exact ce se întâmplă într-o decizie

43955
33:24:30,480 --> 33:24:34,480
copac. Este necesar un efort mic pentru date

43956
33:24:32,640 --> 33:24:36,080
pregătire. Deci, nu trebuie să faci

43957
33:24:34,480 --> 33:24:37,592
scalare specială. Sunt multe lucruri

43958
33:24:36,080 --> 33:24:39,832
nu trebuie să vă faceți griji când utilizați

43959
33:24:37,592 --> 33:24:42,160
un arbore de decizie. Se poate descurca pe ambele

43960
33:24:39,832 --> 33:24:44,000
date numerice și categoriale ca noi

43961
33:24:42,160 --> 33:24:46,872
descoperite mai devreme și neliniare

43962
33:24:44,000 --> 33:24:49,440
parametrii nu îi afectează performanța.

43963
33:24:46,872 --> 33:24:51,912
Deci, chiar dacă datele nu se potrivesc ușor

43964
33:24:49,440 --> 33:24:54,640
grafic curbat, îl puteți folosi în continuare pentru

43965
33:24:51,912 --> 33:24:56,800
crea o decizie eficientă sau

43966
33:24:54,640 --> 33:24:59,040
predictie. Dacă e să ne uităm la

43967
33:24:56,800 --> 33:25:00,232
avantajele unui arbore de decizie, noi

43968
33:24:59,040 --> 33:25:02,552
de asemenea, trebuie să înțelegeți

43969
33:25:00,232 --> 33:25:04,400
dezavantajele unui arbore de decizie. The

43970
33:25:02,552 --> 33:25:06,400
primul dezavantaj este supraadaptarea.

43971
33:25:04,400 --> 33:25:08,552
Suprafitting apare atunci când algoritmul

43972
33:25:06,400 --> 33:25:10,872
captează zgomotul în date. Asta înseamnă

43973
33:25:08,552 --> 33:25:13,280
rezolvi pentru un anumit caz

43974
33:25:10,872 --> 33:25:15,512
în loc de o soluţie generală pentru toţi

43975
33:25:13,280 --> 33:25:17,912
datele. Varianta mare. Modelul poate

43976
33:25:15,512 --> 33:25:20,400
devin instabil din cauza micilor variații în

43977
33:25:17,912 --> 33:25:22,320
date. Arborele cu părtinire scăzută. Un extrem de

43978
33:25:20,400 --> 33:25:24,400
arborele de decizie complicat tinde să aibă

43979
33:25:22,320 --> 33:25:26,960
o părtinire scăzută care face dificilă pentru

43980
33:25:24,400 --> 33:25:30,000
modelul să lucreze cu date noi.

43981
33:25:26,960 --> 33:25:32,320
Arborele de decizie termeni importanți. Înainte de noi

43982
33:25:30,000 --> 33:25:35,040
scufundăm mai departe, trebuie să ne uităm la unele

43983
33:25:32,320 --> 33:25:37,192
termeni de bază. Trebuie să avem câteva

43984
33:25:35,040 --> 33:25:38,640
definiții pentru a merge cu arborele nostru de decizie

43985
33:25:37,192 --> 33:25:40,960
în diferitele părți în care vom fi

43986
33:25:38,640 --> 33:25:42,640
folosind. Vom începe cu entropia. Entropie

43987
33:25:40,960 --> 33:25:45,120
este o măsură a aleatoriei sau

43988
33:25:42,640 --> 33:25:47,680
impredictibilitatea setului de date. Pentru

43989
33:25:45,120 --> 33:25:48,720
De exemplu, avem un grup de animale

43990
33:25:47,680 --> 33:25:50,800
această poză. Sunt patru diferite

43991
33:25:48,720 --> 33:25:52,872
feluri de animale. Și acest set de date este

43992
33:25:50,800 --> 33:25:54,232
considerat a avea o entropie mare. tu

43993
33:25:52,872 --> 33:25:55,912
chiar nu pot alege ce fel de

43994
33:25:54,232 --> 33:25:58,960
animalul se bazează pe a privi doar

43995
33:25:55,912 --> 33:26:02,000
cele patru animale ca un pâlc mare de uh

43996
33:25:58,960 --> 33:26:04,400
entitati. Deci, pe măsură ce începem să-l împărțim

43997
33:26:02,000 --> 33:26:07,120
în subgrupe, venim cu noastre

43998
33:26:04,400 --> 33:26:09,760
a doua definiție care este informația

43999
33:26:07,120 --> 33:26:12,232
câștig. Câștigul de informații este o măsură

44000
33:26:09,760 --> 33:26:14,640
de scădere a entropiei după date

44001
33:26:12,232 --> 33:26:16,800
setul este împărțit. Deci, în acest caz, pe baza

44002
33:26:14,640 --> 33:26:19,040
culoarea galbenă, am împărțit un grup

44003
33:26:16,800 --> 33:26:21,440
de animale pe de o parte ca adevărate și acelea

44004
33:26:19,040 --> 33:26:23,120
care nu sunt galbeni ca falsi. Ca si noi

44005
33:26:21,440 --> 33:26:24,960
continuăm pe partea galbenă, ne despărțim

44006
33:26:23,120 --> 33:26:26,960
pe baza înălțimii. Adevărat sau fals

44007
33:26:24,960 --> 33:26:29,280
este egal cu 10. Și pe de altă parte, înălțimea

44008
33:26:26,960 --> 33:26:31,192
este mai mic de 10. Adevărat sau fals? Și ca

44009
33:26:29,280 --> 33:26:33,120
vezi cum am împărțit-o, entropia

44010
33:26:31,192 --> 33:26:35,440
continuă să fie din ce în ce mai puțin și mai puțin.

44011
33:26:33,120 --> 33:26:38,400
Și astfel câștigul nostru de informații este simplu

44012
33:26:35,440 --> 33:26:40,232
entropia E1 din partea de sus și cum este

44013
33:26:38,400 --> 33:26:42,400
schimbat în E2 în partea de jos. Și vom face

44014
33:26:40,232 --> 33:26:44,080
uită-te la matematica mai profundă, deși tu

44015
33:26:42,400 --> 33:26:45,592
chiar nu trebuie să știi o sumă mare

44016
33:26:44,080 --> 33:26:47,360
de matematică când faci de fapt

44017
33:26:45,592 --> 33:26:48,960
programare în Python pentru că va funcționa

44018
33:26:47,360 --> 33:26:50,800
asta pentru tine. Dar ne vom uita la real

44019
33:26:48,960 --> 33:26:51,912
matematică a modului în care calculează entropia.

44020
33:26:50,800 --> 33:26:54,000
În cele din urmă, vrem să știm diferit

44021
33:26:51,912 --> 33:26:55,592
părți ale copacului nostru și ei numesc frunza

44022
33:26:54,000 --> 33:26:57,760
nod. Nodul frunzelor poartă

44023
33:26:55,592 --> 33:26:59,680
clasificare sau decizie. Deci este

44024
33:26:57,760 --> 33:27:02,480
capătul final din partea de jos. The

44025
33:26:59,680 --> 33:27:03,912
nodul de decizie are două sau mai multe ramuri.

44026
33:27:02,480 --> 33:27:06,080
Aici distrugem grupul

44027
33:27:03,912 --> 33:27:08,000
sus în diferite părți. Și în sfârșit,

44028
33:27:06,080 --> 33:27:11,832
aveți nodul rădăcină. Cel mai de sus

44029
33:27:08,000 --> 33:27:13,912
nodul de decizie este cunoscut sub numele de nodul rădăcină.

44030
33:27:11,832 --> 33:27:15,440
Cum funcționează un arbore de decizie? Minune

44031
33:27:13,912 --> 33:27:17,192
ce fel de animale voi primi în

44032
33:27:15,440 --> 33:27:18,872
junglă azi? Poate tu ești vânătorul

44033
33:27:17,192 --> 33:27:20,640
cu pistolul. Sau dacă ești mai interesat

44034
33:27:18,872 --> 33:27:22,480
fotografie, ești fotograf cu

44035
33:27:20,640 --> 33:27:24,800
un aparat de fotografiat. Deci, să ne uităm la acest grup de

44036
33:27:22,480 --> 33:27:26,480
animale și să încercăm să clasificăm

44037
33:27:24,800 --> 33:27:28,960
diferite tipuri de animale pe baza

44038
33:27:26,480 --> 33:27:31,040
caracteristicile lor folosind un arbore de decizie. Deci

44039
33:27:28,960 --> 33:27:32,552
enunțul problemei este de a clasifica

44040
33:27:31,040 --> 33:27:34,232
diferite tipuri de animale pe baza

44041
33:27:32,552 --> 33:27:36,640
caracteristicile lor folosind un arbore de decizie.

44042
33:27:34,232 --> 33:27:38,720
Setul de date arată destul de dezordonat și

44043
33:27:36,640 --> 33:27:40,320
entropia este mare în acest caz. Deci

44044
33:27:38,720 --> 33:27:42,872
să ne uităm la un set de antrenament sau un

44045
33:27:40,320 --> 33:27:44,872
set de date de antrenament și ne uităm la

44046
33:27:42,872 --> 33:27:46,720
culoare. Ne uităm la înălțime și apoi

44047
33:27:44,872 --> 33:27:48,400
avem diferitele noastre animale. Avem

44048
33:27:46,720 --> 33:27:50,400
elefanții noștri, girafele noastre, noștri

44049
33:27:48,400 --> 33:27:52,320
maimuțe și tigrii noștri. Și sunt de

44050
33:27:50,400 --> 33:27:53,832
diferite culori si forme. Să vedem

44051
33:27:52,320 --> 33:27:55,680
cum arată. Și cum facem

44052
33:27:53,832 --> 33:27:58,480
împărțiți datele? Trebuie să încadram

44053
33:27:55,680 --> 33:28:00,400
condiţiile care împărtăşesc datele într-o astfel de

44054
33:27:58,480 --> 33:28:02,960
modul în care câștigul de informații este

44055
33:28:00,400 --> 33:28:05,440
cel mai înalt. Rețineți, câștigul este măsura

44056
33:28:02,960 --> 33:28:08,080
scăderea entropiei după divizare. Deci

44057
33:28:05,440 --> 33:28:09,832
formula pentru entropie este suma

44058
33:28:08,080 --> 33:28:12,720
asa arata acest simbol. Asta

44059
33:28:09,832 --> 33:28:15,592
arata ca un uh e funky e

44060
33:28:12,720 --> 33:28:17,512
de k unde i este egal cu 1 la k. K ar fi

44061
33:28:15,592 --> 33:28:19,832
reprezintă numărul de animale

44062
33:28:17,512 --> 33:28:23,192
diferite animale acolo unde valoarea

44063
33:28:19,832 --> 33:28:26,480
sau valoarea P a lui I ar fi procentul

44064
33:28:23,192 --> 33:28:28,480
din acel animal ori baza logaritmului 2 a

44065
33:28:26,480 --> 33:28:29,912
la fel procentul acelui animal.

44066
33:28:28,480 --> 33:28:32,000
Să încercăm să calculăm entropia pentru

44067
33:28:29,912 --> 33:28:33,512
setul de date curent și aruncați o privire la

44068
33:28:32,000 --> 33:28:35,040
cum arată. Și nu fi

44069
33:28:33,512 --> 33:28:37,120
frică de matematică. Chiar nu

44070
33:28:35,040 --> 33:28:38,640
trebuie să memoreze această matematică. Doar fii

44071
33:28:37,120 --> 33:28:40,640
conștient că este acolo și asta este ceea ce este

44072
33:28:38,640 --> 33:28:43,040
care se petrece pe fundal. Și așa noi

44073
33:28:40,640 --> 33:28:45,192
au trei girafe, doi tigri, unul

44074
33:28:43,040 --> 33:28:46,872
maimuță, doi elefanți, în total opt

44075
33:28:45,192 --> 33:28:49,440
animalele adunate. Și dacă îl conectăm

44076
33:28:46,872 --> 33:28:51,912
în formulă, obținem o entropie care

44077
33:28:49,440 --> 33:28:54,232
este egal cu 3 peste 8. Deci avem trei

44078
33:28:51,912 --> 33:28:56,552
girafe, un total de 8 ori bușteanul.

44079
33:28:54,232 --> 33:29:00,232
De obicei folosesc baza 2 pe jurnal. Aşa

44080
33:28:56,552 --> 33:29:02,232
baza logaritmică 2 din 3 peste 8 plus în acest caz,

44081
33:29:00,232 --> 33:29:04,320
să zicem că sunt elefanții, 2 peste 8.

44082
33:29:02,232 --> 33:29:07,592
Doi elefanți peste un total de 8 timpi

44083
33:29:04,320 --> 33:29:11,360
baza 2 2 peste 8 plus o maimuta peste

44084
33:29:07,592 --> 33:29:15,040
total de 8. log bază 2 1 peste 8 și plus

44085
33:29:11,360 --> 33:29:17,512
2 peste 8 din baza de bușteni de tigri 2 peste 8

44086
33:29:15,040 --> 33:29:19,592
iar dacă îl conectăm la computerul nostru sau

44087
33:29:17,512 --> 33:29:23,512
calculator, evident, nu mă pot autentifica

44088
33:29:19,592 --> 33:29:25,512
capul meu obținem o entropie egală cu.571

44089
33:29:23,512 --> 33:29:27,912
programul va calcula de fapt

44090
33:29:25,512 --> 33:29:30,320
entropia setului de date în mod similar după

44091
33:29:27,912 --> 33:29:31,912
fiecare împărțire pentru a calcula câștigul acum

44092
33:29:30,320 --> 33:29:34,160
nu vom trece prin fiecare set

44093
33:29:31,912 --> 33:29:36,000
unul câte unul pentru a vedea care sunt acele numere

44094
33:29:34,160 --> 33:29:38,000
Vreau doar să știți că acest lucru

44095
33:29:36,000 --> 33:29:39,912
este o formulă sau matematica din spate

44096
33:29:38,000 --> 33:29:41,592
Câștigul poate fi calculat prin găsirea

44097
33:29:39,912 --> 33:29:43,832
diferența entropiei ulterioare

44098
33:29:41,592 --> 33:29:45,440
valori după o divizare. Acum vom încerca

44099
33:29:43,832 --> 33:29:47,360
alege o condiție care ne oferă

44100
33:29:45,440 --> 33:29:49,280
cel mai mare câștig. Vom face asta până la

44101
33:29:47,360 --> 33:29:51,120
împărțirea datelor folosind fiecare condiție

44102
33:29:49,280 --> 33:29:52,552
şi verificând că câştigul din care ieşim

44103
33:29:51,120 --> 33:29:54,320
ei. Condiția care ne oferă

44104
33:29:52,552 --> 33:29:56,160
cel mai mare câștig va fi folosit pentru a face

44105
33:29:54,320 --> 33:29:58,232
prima despicare. Poți ghici ce asta

44106
33:29:56,160 --> 33:30:00,232
prima împărțire va fi doar privind

44107
33:29:58,232 --> 33:30:02,320
imaginea asta? Ca om, probabil că este

44108
33:30:00,232 --> 33:30:04,400
destul de ușor de împărțit. Să vedem dacă

44109
33:30:02,320 --> 33:30:06,640
ai dreptate. Dacă ai ghicit culoarea

44110
33:30:04,400 --> 33:30:08,480
galben, ai dreptate. Să spunem că

44111
33:30:06,640 --> 33:30:10,640
condiție care ne oferă câștigul maxim

44112
33:30:08,480 --> 33:30:12,640
este galben. Deci vom împărți datele

44113
33:30:10,640 --> 33:30:14,480
pe baza culorii galbene. Daca este adevarat,

44114
33:30:12,640 --> 33:30:16,800
acel grup de animale merge spre stânga.

44115
33:30:14,480 --> 33:30:18,960
Dacă este fals, merge spre dreapta. The

44116
33:30:16,800 --> 33:30:21,832
entropie după scindare are

44117
33:30:18,960 --> 33:30:23,360
a scăzut considerabil. Cu toate acestea, noi

44118
33:30:21,832 --> 33:30:25,120
încă mai am nevoie de o divizare la ambele

44119
33:30:23,360 --> 33:30:27,120
ramuri pentru a atinge o valoare de entropie

44120
33:30:25,120 --> 33:30:29,040
egal cu zero. Deci decidem sa ne despartim

44121
33:30:27,120 --> 33:30:30,800
ambele noduri folosind înălțimea ca a

44122
33:30:29,040 --> 33:30:33,192
stare. Din moment ce fiecare ramură acum

44123
33:30:30,800 --> 33:30:35,040
conține un singur tip de etichetă, putem spune

44124
33:30:33,192 --> 33:30:37,280
că entropia în acest caz a ajuns

44125
33:30:35,040 --> 33:30:39,192
cea mai mică valoare. Și aici ne vedeți

44126
33:30:37,280 --> 33:30:40,872
au girafele, tigrii,

44127
33:30:39,192 --> 33:30:42,800
maimuța și elefanții toți despărțiți

44128
33:30:40,872 --> 33:30:44,400
în propriile lor grupuri. Acest copac poate acum

44129
33:30:42,800 --> 33:30:46,720
prezice toate clasele de animale

44130
33:30:44,400 --> 33:30:50,640
prezent în setul de date cu 100%

44131
33:30:46,720 --> 33:30:52,552
precizie. A fost ușor. Credit de caz de utilizare

44132
33:30:50,640 --> 33:30:54,552
previziunea rambursării. Să intrăm în mine

44133
33:30:52,552 --> 33:30:56,160
partea preferată și deschideți ceva Python

44134
33:30:54,552 --> 33:30:58,400
și vezi care este codul de programare și

44135
33:30:56,160 --> 33:31:00,080
scriptul arată ca. Aici, suntem

44136
33:30:58,400 --> 33:31:01,912
va dori sa fac o predictie. Iar noi

44137
33:31:00,080 --> 33:31:03,512
începe cu acest individ aici care este

44138
33:31:01,912 --> 33:31:04,872
cerând să afle cât de bun al lui

44139
33:31:03,512 --> 33:31:06,480
clienţii vor fi, fie

44140
33:31:04,872 --> 33:31:08,480
își vor rambursa împrumutul sau nu

44141
33:31:06,480 --> 33:31:11,040
pentru această bancă. Și de aici, vrem

44142
33:31:08,480 --> 33:31:13,440
generați o declarație de problemă pentru a prezice

44143
33:31:11,040 --> 33:31:14,800
dacă un client va rambursa suma împrumutului sau

44144
33:31:13,440 --> 33:31:16,800
nu. Și apoi vom folosi

44145
33:31:14,800 --> 33:31:18,552
algoritmul arborelui de decizie în Python.

44146
33:31:16,800 --> 33:31:20,552
Să vedem cum arată. Şi

44147
33:31:18,552 --> 33:31:22,552
hai să ne scufundăm în cod. În primul nostru

44148
33:31:20,552 --> 33:31:24,320
câțiva pași de implementare, mergem

44149
33:31:22,552 --> 33:31:26,872
pentru a începe prin a importa necesarul

44150
33:31:24,320 --> 33:31:28,160
pachetele de care avem nevoie de la Python. şi

44151
33:31:26,872 --> 33:31:29,912
ne vom încărca datele și vom lua

44152
33:31:28,160 --> 33:31:31,360
o privire la cum arată datele. Deci,

44153
33:31:29,912 --> 33:31:33,120
primul lucru de care am nevoie este că am nevoie

44154
33:31:31,360 --> 33:31:35,592
ceva pentru a-mi edita Python-ul și a-l rula

44155
33:31:33,120 --> 33:31:39,040
înăuntru. Deci, să ne întoarcem. Și iată-mă

44156
33:31:35,592 --> 33:31:41,440
folosind caietul Anaconda Jupiter.

44157
33:31:39,040 --> 33:31:43,192
Acum, puteți utiliza orice IDE Python care vă place

44158
33:31:41,440 --> 33:31:44,800
să-l rulez, dar găsesc Jupyter

44159
33:31:43,192 --> 33:31:46,872
Notebook-ul este foarte bun pentru a face lucruri

44160
33:31:44,800 --> 33:31:48,552
din mers. Și să mergem înainte și doar

44161
33:31:46,872 --> 33:31:50,640
lipiți acel cod la început. Şi

44162
33:31:48,552 --> 33:31:52,080
înainte de a începe, hai să vorbim puțin

44163
33:31:50,640 --> 33:31:53,280
despre ceea ce aducem noi. Și apoi

44164
33:31:52,080 --> 33:31:54,400
vom face câteva lucruri în

44165
33:31:53,280 --> 33:31:56,160
aici. unde trebuie să fac un cuplu

44166
33:31:54,400 --> 33:31:57,832
schimbări pe măsură ce trecem prin această primă parte

44167
33:31:56,160 --> 33:32:01,360
a importului. Primul lucru pe care îl aducem

44168
33:31:57,832 --> 33:32:03,440
in este numpy ca np. Asta e foarte standard

44169
33:32:01,360 --> 33:32:05,592
când avem de-a face cu matematică,

44170
33:32:03,440 --> 33:32:06,960
mai ales cu uh foarte complicat

44171
33:32:05,592 --> 33:32:08,640
instrumente de învățare automată. Aproape vei

44172
33:32:06,960 --> 33:32:10,720
vezi întotdeauna că numpy vine în locul tău

44173
33:32:08,640 --> 33:32:12,232
num numerele tale. Se numește număr

44174
33:32:10,720 --> 33:32:14,080
piton. Are matematica ta înăuntru

44175
33:32:12,232 --> 33:32:15,592
acolo. În acest caz, chiar am putea

44176
33:32:14,080 --> 33:32:17,120
scoate-l, dar în general vei avea nevoie

44177
33:32:15,592 --> 33:32:18,640
pentru majoritatea lucrurilor tale diferite tu

44178
33:32:17,120 --> 33:32:21,280
lucra cu. Și apoi vom folosi

44179
33:32:18,640 --> 33:32:24,160
panda ca pd. Acesta este, de asemenea, un standard.

44180
33:32:21,280 --> 33:32:26,480
Pandas este o configurație de cadru de date și

44181
33:32:24,160 --> 33:32:28,720
poți asemăna asta cu luarea ta

44182
33:32:26,480 --> 33:32:31,512
datele de bază și stocarea lor într-un mod care

44183
33:32:28,720 --> 33:32:33,592
arată ca o foaie de calcul Excel. Deci ca

44184
33:32:31,512 --> 33:32:35,832
revenim la asta când vezi np sau

44185
33:32:33,592 --> 33:32:37,512
pd, acestea sunt utilizări foarte standard

44186
33:32:35,832 --> 33:32:38,552
să știi că aia sunt panda și o voi face

44187
33:32:37,512 --> 33:32:40,480
să vă arătăm puțin mai mult când noi

44188
33:32:38,552 --> 33:32:41,912
explorați datele într-un minut. Apoi

44189
33:32:40,480 --> 33:32:43,760
va trebui să împărțim datele.

44190
33:32:41,912 --> 33:32:45,832
Așa că voi aduce testul nostru de tren

44191
33:32:43,760 --> 33:32:48,872
și despărțit și asta vine din

44192
33:32:45,832 --> 33:32:50,232
validarea încrucișată a pachetului sklearn. În

44193
33:32:48,872 --> 33:32:52,000
doar un minut, ne vom schimba

44194
33:32:50,232 --> 33:32:54,480
asta și vom trece și peste asta. Şi

44195
33:32:52,000 --> 33:32:56,400
apoi mai este și importul sktree

44196
33:32:54,480 --> 33:32:57,912
clasificator de arbore de decizie. Asta este

44197
33:32:56,400 --> 33:32:58,960
instrumentul real pe care îl folosim. Ține minte, eu

44198
33:32:57,912 --> 33:33:00,320
a spus că nu vă fie frică de

44199
33:32:58,960 --> 33:33:02,232
matematica. Se va face pentru

44200
33:33:00,320 --> 33:33:03,832
tu. Ei bine, clasificatorul arborelui de decizie

44201
33:33:02,232 --> 33:33:05,360
are toată matematica acolo pentru

44202
33:33:03,832 --> 33:33:06,552
tu, așa că nu trebuie să-ți dai seama

44203
33:33:05,360 --> 33:33:08,232
afară din nou. Și apoi avem

44204
33:33:06,552 --> 33:33:10,720
sklearn.metrics

44205
33:33:08,232 --> 33:33:12,232
pentru scorul de precizie. Trebuie să ne înscriem

44206
33:33:10,720 --> 33:33:13,832
configurația noastră. Acesta este motivul pentru care suntem

44207
33:33:12,232 --> 33:33:15,760
împărțindu-l între antrenament și

44208
33:33:13,832 --> 33:33:18,400
date de testare. Și, în sfârșit, mai avem nevoie

44209
33:33:15,760 --> 33:33:20,160
arborele de import sklearn. Și doar asta

44210
33:33:18,400 --> 33:33:22,480
funcția de bază a arborelui care este necesară

44211
33:33:20,160 --> 33:33:23,832
pentru clasificatorul arborelui de decizie. Şi

44212
33:33:22,480 --> 33:33:25,680
în cele din urmă, ne vom încărca datele

44213
33:33:23,832 --> 33:33:27,512
aici jos. Și o să conduc asta și

44214
33:33:25,680 --> 33:33:29,192
o să punem două lucruri aici.

44215
33:33:27,512 --> 33:33:30,720
Unu, vom primi o eroare. Şi

44216
33:33:29,192 --> 33:33:32,800
doi, vom primi un avertisment. Să

44217
33:33:30,720 --> 33:33:35,192
vezi cum arata. Deci primul

44218
33:33:32,800 --> 33:33:36,552
ceea ce am avut este că avem o eroare. De ce este

44219
33:33:35,192 --> 33:33:38,960
aceasta eroare aici? Ei bine, se uită la

44220
33:33:36,552 --> 33:33:41,120
aceasta. Spune că trebuie să citesc un fișier. Şi

44221
33:33:38,960 --> 33:33:43,440
când aceasta a fost scrisă, persoana care

44222
33:33:41,120 --> 33:33:45,912
l-au scris, acesta este drumul lor unde ei

44223
33:33:43,440 --> 33:33:48,160
a stocat fișierul. Deci hai să mergem înainte și

44224
33:33:45,912 --> 33:33:50,720
repara asta.

44225
33:33:48,160 --> 33:33:52,320
Și o să pun aici dosarul meu

44226
33:33:50,720 --> 33:33:54,872
calea. O să-l numesc plin

44227
33:33:52,320 --> 33:33:56,640
nume de fișier. Și vei vedea că este pe C-ul meu

44228
33:33:54,872 --> 33:33:58,552
conduce. Și asta e foarte lung

44229
33:33:56,640 --> 33:34:01,280
configurați aici unde am stocat datele

44230
33:33:58,552 --> 33:34:02,872
fișier 2.csv.

44231
33:34:01,280 --> 33:34:04,320
Nu vă faceți griji prea mult cu privire la calea completă

44232
33:34:02,872 --> 33:34:08,080
pentru că pe computerul tău va fi

44233
33:34:04,320 --> 33:34:11,040
diferite. Fișierul de date.2 CSV a fost

44234
33:34:08,080 --> 33:34:13,512
generate de SimplyLearn. Daca vrei un

44235
33:34:11,040 --> 33:34:16,800
copie a acestuia, puteți comenta mai jos

44236
33:34:13,512 --> 33:34:18,640
și solicitați-l aici pe YouTube.

44237
33:34:16,800 --> 33:34:21,280
Și apoi, dacă o să-i dau un nume,

44238
33:34:18,640 --> 33:34:25,440
numele complet al fișierului, voi merge mai departe

44239
33:34:21,280 --> 33:34:27,680
și schimbați-l aici la complet

44240
33:34:25,440 --> 33:34:31,400
nume de fișier. Deci hai să mergem mai departe și să o rulăm

44241
33:34:27,680 --> 33:34:31,400
acum și vezi ce se întâmplă.

44242
33:34:32,720 --> 33:34:36,440
Și primim un avertisment

44243
33:34:37,040 --> 33:34:41,040
când codificați. Înțelegând acestea

44244
33:34:39,512 --> 33:34:43,120
avertismente diferite și acestea diferite

44245
33:34:41,040 --> 33:34:45,760
erorile care apar este probabil

44246
33:34:43,120 --> 33:34:47,360
cea mai greu lecție de învățat. Deci haideți

44247
33:34:45,760 --> 33:34:49,832
mergeți mai departe și aruncați o privire la asta și folosiți

44248
33:34:47,360 --> 33:34:52,232
asta ca o oportunitate de a înțelege

44249
33:34:49,832 --> 33:34:55,360
ce se întâmplă aici. Daca citesti

44250
33:34:52,232 --> 33:34:57,592
avertisment, se spune că validarea încrucișată este

44251
33:34:55,360 --> 33:34:59,832
amortizate. Deci este un avertisment asupra lui

44252
33:34:57,592 --> 33:35:02,720
fiind îndepărtat și va fi mutat

44253
33:34:59,832 --> 33:35:03,760
în favoarea selecţiei modelului. Deci dacă

44254
33:35:02,720 --> 33:35:06,160
mergem aici sus, avem

44255
33:35:03,760 --> 33:35:07,832
sklearn.validare încrucișată.

44256
33:35:06,160 --> 33:35:10,080
Și dacă cercetezi asta și mergi la

44257
33:35:07,832 --> 33:35:11,680
sklearn site, veți afla că dvs

44258
33:35:10,080 --> 33:35:15,592
de fapt, îl pot schimba chiar acolo

44259
33:35:11,680 --> 33:35:17,512
cu alegerea modelului.

44260
33:35:15,592 --> 33:35:20,960
Și așa, când intru aici și îl conduc

44261
33:35:17,512 --> 33:35:22,720
din nou, asta elimină un avertisment. Ce

44262
33:35:20,960 --> 33:35:24,552
au făcut este că au avut două

44263
33:35:22,720 --> 33:35:26,872
diferiți dezvoltatori îl dezvoltă în două

44264
33:35:24,552 --> 33:35:28,720
diferite ramuri și apoi au decis

44265
33:35:26,872 --> 33:35:31,280
pentru a păstra una dintre acestea și în cele din urmă să obțin

44266
33:35:28,720 --> 33:35:34,320
scapă de celălalt. Asta e tot ce este

44267
33:35:31,280 --> 33:35:36,872
și foarte ușor și rapid de reparat.

44268
33:35:34,320 --> 33:35:40,000
Înainte să mergem mai departe, am mers înainte

44269
33:35:36,872 --> 33:35:41,440
și a deschis datele din acest fișier.

44270
33:35:40,000 --> 33:35:44,080
Amintiți-vă de fișierul de date pe care tocmai l-am

44271
33:35:41,440 --> 33:35:46,232
încărcat aici, data_2.c

44272
33:35:44,080 --> 33:35:47,832
CSV. Să mai vorbim puțin despre

44273
33:35:46,232 --> 33:35:49,512
asta și vezi cum arată ambele

44274
33:35:47,832 --> 33:35:52,000
ca fișier text deoarece este un

44275
33:35:49,512 --> 33:35:54,160
fisierul variabilei cu virgule si in a

44276
33:35:52,000 --> 33:35:56,320
foaie de calcul. Așa arată

44277
33:35:54,160 --> 33:35:58,000
ca fișier text de bază. Puteți vedea la

44278
33:35:56,320 --> 33:36:01,592
sus au creat un antet și este

44279
33:35:58,000 --> 33:36:03,280
a primit 1 2 3 4 cinci coloane și fiecare coloană

44280
33:36:01,592 --> 33:36:04,640
are date în el. Și lasă-mă să întorc asta

44281
33:36:03,280 --> 33:36:06,720
peste pentru că ne vom uita și noi

44282
33:36:04,640 --> 33:36:08,400
asta într-o foaie de calcul reală, așa că tu

44283
33:36:06,720 --> 33:36:10,000
pot vedea cum arată. Și aici

44284
33:36:08,400 --> 33:36:11,760
L-am deschis în biroul deschis

44285
33:36:10,000 --> 33:36:14,320
calc, care este aproape la fel ca

44286
33:36:11,760 --> 33:36:16,320
um Excel și am mărit. Și poți vedea

44287
33:36:14,320 --> 33:36:18,400
avem coloanele și rândurile noastre de

44288
33:36:16,320 --> 33:36:20,960
date. Puțin mai ușor de citit aici.

44289
33:36:18,400 --> 33:36:22,800
Avem un rezultat, da, da, nu. Avem

44290
33:36:20,960 --> 33:36:26,552
plata inițială, ultima plată, credit

44291
33:36:22,800 --> 33:36:28,400
scor, numărul casei. Dacă parcurgem drumul

44292
33:36:26,552 --> 33:36:31,592
jos,

44293
33:36:28,400 --> 33:36:34,800
vom vedea că aceasta ocupă 101 linii

44294
33:36:31,592 --> 33:36:36,720
de cod sau linii de date cu uh the

44295
33:36:34,800 --> 33:36:40,280
primul fiind o coloană și apoi 1.000

44296
33:36:36,720 --> 33:36:40,280
linii de date.

44297
33:36:41,040 --> 33:36:44,800
Acum, ca programator,

44298
33:36:43,360 --> 33:36:46,552
dacă te uiți la o cantitate mică de

44299
33:36:44,800 --> 33:36:48,080
date, de obicei încep prin a le ridica

44300
33:36:46,552 --> 33:36:50,480
în surse diferite ca să văd ce

44301
33:36:48,080 --> 33:36:52,232
eu lucrez cu.

44302
33:36:50,480 --> 33:36:54,720
Dar în date mai mari, nu vei avea asta

44303
33:36:52,232 --> 33:36:56,232
opțiunea. ar fi doar și eu

44304
33:36:54,720 --> 33:36:57,512
mare. Deci trebuie să aduceți fie un

44305
33:36:56,232 --> 33:36:59,680
cantitate mică pe care o puteți privi

44306
33:36:57,512 --> 33:37:01,280
cum facem acum sau putem

44307
33:36:59,680 --> 33:37:03,440
începe să-l privești prin Python

44308
33:37:01,280 --> 33:37:05,512
cod. Deci haideți să mergem mai departe și

44309
33:37:03,440 --> 33:37:07,912
face următorii doi pași pentru a explora

44310
33:37:05,512 --> 33:37:10,400
datele folosind Python. Să mergem înainte

44311
33:37:07,912 --> 33:37:12,080
și vezi cum arată în Python

44312
33:37:10,400 --> 33:37:14,720
imprimați lungimea și forma

44313
33:37:12,080 --> 33:37:16,640
date. Deci, să începem prin a tipări

44314
33:37:14,720 --> 33:37:19,512
lungimea bazei de date. Putem folosi a

44315
33:37:16,640 --> 33:37:22,080
funcție lin simplă din Python. Şi

44316
33:37:19,512 --> 33:37:23,680
când voi rula asta, vei vedea că este a

44317
33:37:22,080 --> 33:37:25,360
mii lungi. Și asta este ceea ce noi

44318
33:37:23,680 --> 33:37:27,280
aşteptat. Sunt o mie de rânduri de

44319
33:37:25,360 --> 33:37:29,192
date acolo. Dacă scadeți

44320
33:37:27,280 --> 33:37:31,912
cap de coloană, iar acesta este unul dintre cele mai frumoase

44321
33:37:29,192 --> 33:37:35,512
lucruri când am făcut datele de echilibru

44322
33:37:31,912 --> 33:37:37,360
de la panda citește CSV, o să vezi asta

44323
33:37:35,512 --> 33:37:40,480
antetul este rândul zero. Deci, asta

44324
33:37:37,360 --> 33:37:42,552
elimină automat un rând și apoi

44325
33:37:40,480 --> 33:37:45,280
arată datele separat. Face un bine

44326
33:37:42,552 --> 33:37:47,040
treaba sortând acele date pentru noi. Şi

44327
33:37:45,280 --> 33:37:49,440
atunci putem folosi o altă funcție.

44328
33:37:47,040 --> 33:37:51,512
Și să aruncăm o privire la asta. Şi

44329
33:37:49,440 --> 33:37:53,280
din nou, vom folosi instrumentele

44330
33:37:51,512 --> 33:37:55,832
în Panda.

44331
33:37:53,280 --> 33:37:58,480
Și din moment ce datele soldului au fost încărcate ca

44332
33:37:55,832 --> 33:38:00,480
un cadru de date Panda,

44333
33:37:58,480 --> 33:38:02,000
putem face o formă pe el. Și să mergem

44334
33:38:00,480 --> 33:38:04,400
înainte și rulează forma și vezi ce

44335
33:38:02,000 --> 33:38:06,080
care arata ca.

44336
33:38:04,400 --> 33:38:07,440
Ceea ce este frumos la formă nu este numai

44337
33:38:06,080 --> 33:38:09,592
îmi dă lungimea datelor,

44338
33:38:07,440 --> 33:38:11,440
avem un th00and linii, mai spune

44339
33:38:09,592 --> 33:38:13,440
eu sunt cinci coloane. Deci când eram noi

44340
33:38:11,440 --> 33:38:15,360
Privind datele, aveam cinci coloane

44341
33:38:13,440 --> 33:38:18,000
de date. Și apoi să mai luăm unul

44342
33:38:15,360 --> 33:38:19,592
pas pentru a explora datele folosind Python.

44343
33:38:18,000 --> 33:38:22,160
Și acum că ne-am uitat la

44344
33:38:19,592 --> 33:38:25,680
lungimea si forma, sa mergem inainte si

44345
33:38:22,160 --> 33:38:27,440
utilizați modulul uh panda pentru cap.

44346
33:38:25,680 --> 33:38:29,360
Un alt lucru frumos în setul de date

44347
33:38:27,440 --> 33:38:31,592
pe care le putem folosi. Deci hai să punem asta

44348
33:38:29,360 --> 33:38:35,360
pe foaia noastră aici. Și avem print

44349
33:38:31,592 --> 33:38:37,760
setul de date și datele de echilibru.cap.

44350
33:38:35,360 --> 33:38:39,760
Și aceasta este o declarație de imprimare a panda

44351
33:38:37,760 --> 33:38:41,360
propriile sale. Deci are propria caracteristică de imprimare

44352
33:38:39,760 --> 33:38:43,040
acolo. Și apoi am mers înainte și

44353
33:38:41,360 --> 33:38:45,680
a dat o etichetă pentru lucrarea noastră de imprimare aici de

44354
33:38:43,040 --> 33:38:48,232
set de date. Doar o simplă declarație tipărită.

44355
33:38:45,680 --> 33:38:49,680
Și noi conducem asta. Și să luăm doar o

44356
33:38:48,232 --> 33:38:51,192
uita-te mai atent la asta. Lasă-mă să măresc

44357
33:38:49,680 --> 33:38:53,192
aici.

44358
33:38:51,192 --> 33:38:55,512
Iată-ne.

44359
33:38:53,192 --> 33:38:59,120
Panda face o treabă atât de minunată

44360
33:38:55,512 --> 33:39:01,120
făcând din aceasta o dată foarte clară și lizibilă

44361
33:38:59,120 --> 33:39:02,960
set. Deci te poți uita la date, tu

44362
33:39:01,120 --> 33:39:05,360
poți să te uiți la anteturile coloanelor, poți

44363
33:39:02,960 --> 33:39:07,280
ai-l când îl pui ca cap,

44364
33:39:05,360 --> 33:39:09,832
imprimă primele cinci rânduri ale

44365
33:39:07,280 --> 33:39:12,320
date. Și întotdeauna începem cu zero. Deci

44366
33:39:09,832 --> 33:39:15,592
avem cinci rânduri. Avem 0 1 2 3 4

44367
33:39:12,320 --> 33:39:17,592
în loc de 1 2 3 4 5. Acesta este un standard

44368
33:39:15,592 --> 33:39:19,040
set de scripting și programare ești tu

44369
33:39:17,592 --> 33:39:20,640
doriți să începeți cu poziția zero.

44370
33:39:19,040 --> 33:39:22,872
Și asta face șeful de date. Ea

44371
33:39:20,640 --> 33:39:24,640
extrage primele cinci rânduri de date. pune

44372
33:39:22,872 --> 33:39:27,680
într-un format frumos pe care îl poți privi

44373
33:39:24,640 --> 33:39:29,360
si priveste. Instrument foarte puternic pentru a vizualiza

44374
33:39:27,680 --> 33:39:31,680
date. Deci, în loc să trebuiască să răstoarne și

44375
33:39:29,360 --> 33:39:34,872
deschideți o foaie de calcul Excel sau deschideți

44376
33:39:31,680 --> 33:39:36,720
Office Cal sau încercarea de a privi un cuvânt

44377
33:39:34,872 --> 33:39:38,800
doc unde totul este strâns împreună

44378
33:39:36,720 --> 33:39:40,552
și greu de citit, acum puteți obține un frumos

44379
33:39:38,800 --> 33:39:42,640
vedere deschisă a ceea ce lucrați.

44380
33:39:40,552 --> 33:39:45,192
Lucrăm cu o formă de o mie

44381
33:39:42,640 --> 33:39:47,360
lung, cinci lățime. Deci avem cinci coloane

44382
33:39:45,192 --> 33:39:48,800
și facem capul complet de date. Poți

44383
33:39:47,360 --> 33:39:50,872
vezi de fapt cum arată aceste date.

44384
33:39:48,800 --> 33:39:52,872
Plata inițială, ultima plată,

44385
33:39:50,872 --> 33:39:54,552
scoruri de credit, numărul casei. Deci haideți

44386
33:39:52,872 --> 33:39:56,400
luați asta acum că am explorat

44387
33:39:54,552 --> 33:39:59,120
date și să începem să cercetăm

44388
33:39:56,400 --> 33:40:02,080
arborele de decizie. Deci, în următorul nostru pas,

44389
33:39:59,120 --> 33:40:05,360
ne vom instrui și ne vom construi datele

44390
33:40:02,080 --> 33:40:06,872
copac. Și pentru a face asta, trebuie să facem mai întâi

44391
33:40:05,360 --> 33:40:08,960
separați datele. Vom merge

44392
33:40:06,872 --> 33:40:10,640
separați în două grupe astfel încât să avem

44393
33:40:08,960 --> 33:40:12,720
ceva care să antreneze efectiv datele

44394
33:40:10,640 --> 33:40:14,400
cu. Și apoi avem câteva date despre

44395
33:40:12,720 --> 33:40:15,912
parte pentru a-l testa pentru a vedea cât de bun nostru

44396
33:40:14,400 --> 33:40:17,360
modelul este. Amintiți-vă cu oricare dintre

44397
33:40:15,912 --> 33:40:19,280
învățare automată, doriți întotdeauna

44398
33:40:17,360 --> 33:40:20,872
au un fel de test setat pentru a cântări

44399
33:40:19,280 --> 33:40:22,960
împotriva ca să știi cât de bun ești

44400
33:40:20,872 --> 33:40:24,872
modelul este atunci când îl distribui. Să

44401
33:40:22,960 --> 33:40:27,832
mergeți mai departe și descompuneți acest cod și

44402
33:40:24,872 --> 33:40:30,232
uită-te la el în bucăți. Deci mai întâi avem

44403
33:40:27,832 --> 33:40:32,640
X și Y al nostru.

44404
33:40:30,232 --> 33:40:35,192
De unde provin X și Y? Ei bine, X este

44405
33:40:32,640 --> 33:40:37,120
vor fi datele noastre și Y va fi

44406
33:40:35,192 --> 33:40:39,512
fi răspunsul sau ținta. Poți

44407
33:40:37,120 --> 33:40:41,912
uită-te la sursă și țintă. In aceasta

44408
33:40:39,512 --> 33:40:43,912
caz, folosim X și Y pentru a desemna

44409
33:40:41,912 --> 33:40:45,192
date în și datele pe care le avem de fapt

44410
33:40:43,912 --> 33:40:46,960
încercând să ghicească care este răspunsul

44411
33:40:45,192 --> 33:40:49,192
a fi. Și astfel, pentru a o separa, putem

44412
33:40:46,960 --> 33:40:53,592
pur și simplu pus în X este egal cu soldul

44413
33:40:49,192 --> 33:40:55,280
valorile datelor. Primele paranteze

44414
33:40:53,592 --> 33:40:57,832
înseamnă că vom selecta toate

44415
33:40:55,280 --> 33:41:00,160
linii din baza de date. Deci, este tot

44416
33:40:57,832 --> 33:41:02,160
date. Și al doilea spune că suntem doar

44417
33:41:00,160 --> 33:41:04,320
ne uităm la coloanele de la 1 la cinci.

44418
33:41:02,160 --> 33:41:06,480
Amintiți-vă, începeți întotdeauna cu zero. Zero

44419
33:41:04,320 --> 33:41:08,552
este un da sau nu. Și asta este dacă

44420
33:41:06,480 --> 33:41:10,232
împrumutul a intrat în plată sau nu. Deci, vrem

44421
33:41:08,552 --> 33:41:12,232
începe cu una. Dacă ne întoarcem aici sus,

44422
33:41:10,232 --> 33:41:15,760
asta e plata inițială și merge

44423
33:41:12,232 --> 33:41:17,680
tot drumul prin numărul casei.

44424
33:41:15,760 --> 33:41:20,080
Ei bine, dacă vrem să ne uităm la uh 1 până la

44425
33:41:17,680 --> 33:41:22,160
cinci, putem face același lucru pentru y,

44426
33:41:20,080 --> 33:41:25,440
care sunt răspunsurile. Și o să mergem

44427
33:41:22,160 --> 33:41:27,680
setați-l doar egal cu rândul zero. Deci,

44428
33:41:25,440 --> 33:41:28,960
este doar rândul zero și apoi e tot

44429
33:41:27,680 --> 33:41:31,120
rânduri care intră acolo. Deci, acum am

44430
33:41:28,960 --> 33:41:34,640
împărțit acest lucru în două date diferite

44431
33:41:31,120 --> 33:41:39,192
seturi. Unul dintre ei cu

44432
33:41:34,640 --> 33:41:39,192
datele care intră și unul cu răspunsurile.

44433
33:41:40,080 --> 33:41:45,280
Apoi, trebuie să împărțim datele.

44434
33:41:43,512 --> 33:41:48,552
Și aici vei vedea că o avem

44435
33:41:45,280 --> 33:41:51,120
împărțit în patru părți diferite. The

44436
33:41:48,552 --> 33:41:56,000
primul este antrenamentul tău X, X

44437
33:41:51,120 --> 33:41:58,800
test, trenul tău Y, testul tău Y.

44438
33:41:56,000 --> 33:42:00,320
Mai simplu spus, avem X care merge unde

44439
33:41:58,800 --> 33:42:02,872
o să-l antrenăm și trebuie

44440
33:42:00,320 --> 33:42:04,960
știi răspunsul cu care să-l antrenezi. Şi

44441
33:42:02,872 --> 33:42:07,360
apoi avem X test unde vom merge

44442
33:42:04,960 --> 33:42:10,320
testează acele date și trebuie să știm în

44443
33:42:07,360 --> 33:42:12,160
sfârşitul ceea ce trebuia să fie Y.

44444
33:42:10,320 --> 33:42:14,000
Și acolo s-a împărțit acest test de tren

44445
33:42:12,160 --> 33:42:16,320
vine în care am încărcat mai devreme în

44446
33:42:14,000 --> 33:42:18,160
module. Acest lucru face totul pentru noi. Şi

44447
33:42:16,320 --> 33:42:21,120
puteți vedea că au stabilit dimensiunea testului egală

44448
33:42:18,160 --> 33:42:22,800
la.3. Deci, aproximativ 30% vor fi folosite

44449
33:42:21,120 --> 33:42:24,960
în test. Și apoi folosim o aleatorie

44450
33:42:22,800 --> 33:42:26,552
stare. Deci este complet aleatoriu care

44451
33:42:24,960 --> 33:42:28,160
rânduri pe care le scoate de acolo. Și apoi

44452
33:42:26,552 --> 33:42:29,912
în cele din urmă ajungem să ne construim efectiv

44453
33:42:28,160 --> 33:42:33,040
arborele de decizie. Și l-au numit

44454
33:42:29,912 --> 33:42:34,960
aici entropia CLF. Asta e realul

44455
33:42:33,040 --> 33:42:37,120
arbore de decizie sau arbore de decizie

44456
33:42:34,960 --> 33:42:39,120
clasificator. Și aici, au adăugat un

44457
33:42:37,120 --> 33:42:41,512
câteva variabile pe care le vom explora

44458
33:42:39,120 --> 33:42:44,000
doar un minut. Și apoi, în sfârșit, avem nevoie

44459
33:42:41,512 --> 33:42:46,800
pentru a potrivi datele la asta. Deci, ne luăm

44460
33:42:44,000 --> 33:42:48,640
Entropia CLF pe care am creat-o și ne potrivim

44461
33:42:46,800 --> 33:42:50,872
trenul X. Și din moment ce știm

44462
33:42:48,640 --> 33:42:52,640
răspunsuri pentru radiografie sau trenul Y, mergem

44463
33:42:50,872 --> 33:42:54,480
înainte și pune-le înăuntru. Și hai să mergem

44464
33:42:52,640 --> 33:42:57,760
înainte și rulați asta. Și ceea ce majoritatea

44465
33:42:54,480 --> 33:42:59,440
Aceste module sklearn fac atunci când setați

44466
33:42:57,760 --> 33:43:01,512
sus variabila, în acest caz, când noi

44467
33:42:59,440 --> 33:43:03,360
setați arborele de decizie egal cu entropie CLF

44468
33:43:01,512 --> 33:43:05,280
clasificator, se tipărește automat

44469
33:43:03,360 --> 33:43:06,872
ce este în acel arbore de decizie. Există o

44470
33:43:05,280 --> 33:43:08,960
multe variabile cu care te poți juca

44471
33:43:06,872 --> 33:43:11,280
aici. Și este destul de dincolo de domeniul de aplicare al

44472
33:43:08,960 --> 33:43:13,040
acest tutorial pentru a parcurge toate acestea

44473
33:43:11,280 --> 33:43:14,800
și cum funcționează. Dar lucrăm la

44474
33:43:13,040 --> 33:43:16,232
entropie. Asta e una dintre variante.

44475
33:43:14,800 --> 33:43:19,280
Am adăugat că este complet a

44476
33:43:16,232 --> 33:43:22,080
stare aleatorie de 100, deci 100%. Iar noi

44477
33:43:19,280 --> 33:43:23,760
au o adâncime maximă de trei. Acum, max

44478
33:43:22,080 --> 33:43:25,280
adâncime, dacă vă amintiți mai sus când noi

44479
33:43:23,760 --> 33:43:27,360
făceau diferitele grafice ale

44480
33:43:25,280 --> 33:43:30,080
animale, înseamnă că va merge doar

44481
33:43:27,360 --> 33:43:31,832
jos trei straturi înainte de a se opri. Şi

44482
33:43:30,080 --> 33:43:33,680
atunci avem mostre minime de frunze

44483
33:43:31,832 --> 33:43:35,440
este cinci. Deci, va avea cel puțin

44484
33:43:33,680 --> 33:43:37,680
cinci frunze la sfârșit. Deci, voi avea la

44485
33:43:35,440 --> 33:43:40,320
cel puțin trei împărțiri sau nu au mai mult de

44486
33:43:37,680 --> 33:43:42,320
trei straturi și cel puțin cinci capăt

44487
33:43:40,320 --> 33:43:45,760
pleacă cu rezultatul final la

44488
33:43:42,320 --> 33:43:47,760
jos. Acum că ne-am creat

44489
33:43:45,760 --> 33:43:49,680
clasificator de arbore de decizie, nu numai

44490
33:43:47,760 --> 33:43:51,360
l-a creat, dar l-a antrenat, hai să mergem

44491
33:43:49,680 --> 33:43:53,360
înainte și aplică-l și vezi ce asta

44492
33:43:51,360 --> 33:43:55,192
arata ca. Deci, hai să mergem înainte și să facem

44493
33:43:53,360 --> 33:43:57,040
o predicție și vezi cum arată

44494
33:43:55,192 --> 33:43:59,592
ca. Vom lipi predicția noastră

44495
33:43:57,040 --> 33:44:01,192
cod aici. Și înainte să-l rulăm,

44496
33:43:59,592 --> 33:44:04,480
hai să aruncăm o privire rapidă la ce este

44497
33:44:01,192 --> 33:44:06,640
fac aici. Avem o variabilă predict

44498
33:44:04,480 --> 33:44:10,320
pe care o să facem. Și mergem

44499
33:44:06,640 --> 33:44:12,320
pentru a folosi entropia noastră variabilă CLF pe care noi

44500
33:44:10,320 --> 33:44:14,400
creat.

44501
33:44:12,320 --> 33:44:17,592
Și apoi vei vedea prezice. Și este

44502
33:44:14,400 --> 33:44:19,832
foarte frecvente în modulele sklearn care

44503
33:44:17,592 --> 33:44:20,720
diferitele lor instrumente au predicția

44504
33:44:19,832 --> 33:44:22,720
când rulezi de fapt un

44505
33:44:20,720 --> 33:44:26,320
predictie. În acest caz, vom merge

44506
33:44:22,720 --> 33:44:28,960
puneți aici datele noastre de test X. Acum, dacă tu

44507
33:44:26,320 --> 33:44:31,760
livrat acest lucru pentru utilizare, un real

44508
33:44:28,960 --> 33:44:33,592
utilizare comercială și a distribuit-o, aceasta

44509
33:44:31,760 --> 33:44:36,160
ar fi noile împrumuturi pe care le acordați

44510
33:44:33,592 --> 33:44:38,960
aici pentru a ghici dacă persoana va merge

44511
33:44:36,160 --> 33:44:40,720
să le plătesc sau nu. In aceasta

44512
33:44:38,960 --> 33:44:42,720
totuși, trebuie să testăm

44513
33:44:40,720 --> 33:44:45,040
date și vedeți cât de bun eșantionul nostru

44514
33:44:42,720 --> 33:44:46,960
este cât de bine face copacul nostru la

44515
33:44:45,040 --> 33:44:49,760
anticiparea plăților împrumutului. Şi

44516
33:44:46,960 --> 33:44:51,912
în cele din urmă, din caietul Anaconda Jupyter

44517
33:44:49,760 --> 33:44:54,552
funcționează ca o linie de comandă pentru Python,

44518
33:44:51,912 --> 33:44:56,480
putem pune pur și simplu y predict en to

44519
33:44:54,552 --> 33:44:58,720
tipăriți-l. As putea la fel de usor sa am

44520
33:44:56,480 --> 33:45:01,192
pune amprenta

44521
33:44:58,720 --> 33:45:02,480
și puneți paranteze în jurul y predic en to

44522
33:45:01,192 --> 33:45:03,912
tipăriți-l. Vom merge înainte și vom face

44523
33:45:02,480 --> 33:45:06,640
că. Nu contează în ce direcție faci

44524
33:45:03,912 --> 33:45:09,680
ea. Și vei vedea chiar aici că asta

44525
33:45:06,640 --> 33:45:11,512
rulează o predicție. Acesta este aproximativ 300

44526
33:45:09,680 --> 33:45:13,680
aici. Amintiți-vă, este 30% din a

44527
33:45:11,512 --> 33:45:16,080
mii. Deci, ar trebui să aveți aproximativ 300

44528
33:45:13,680 --> 33:45:18,480
răspunsuri aici. Și asta îți spune

44529
33:45:16,080 --> 33:45:20,640
care fiecare din acele linii ale ourh

44530
33:45:18,480 --> 33:45:23,760
testul a intrat acolo. Și asta este ceea ce avem

44531
33:45:20,640 --> 33:45:25,120
y prezice a ieșit. Deci, să trecem la

44532
33:45:23,760 --> 33:45:27,360
următorul pas pe care îl vom face

44533
33:45:25,120 --> 33:45:29,272
aceste date și încercați să vă dați seama cum

44534
33:45:27,360 --> 33:45:31,912
bun model pe care il avem. Deci, iată-ne.

44535
33:45:29,272 --> 33:45:33,760
Din moment ce sklearn face toate sarcinile grele

44536
33:45:31,912 --> 33:45:35,680
pentru tine și pentru toată matematica, avem un

44537
33:45:33,760 --> 33:45:37,680
linie simplă de cod pentru a ne spune ce

44538
33:45:35,680 --> 33:45:39,040
precizia este. Și să mergem înainte și

44539
33:45:37,680 --> 33:45:40,480
treci prin asta și vezi ce înseamnă asta

44540
33:45:39,040 --> 33:45:42,320
și cum arată. Să mergem înainte

44541
33:45:40,480 --> 33:45:45,272
și lipiți asta. Și permiteți-mi să măresc a

44542
33:45:42,320 --> 33:45:47,272
putin. Iată-ne.

44543
33:45:45,272 --> 33:45:48,552
Deci ai o imagine completă frumoasă. Şi

44544
33:45:47,272 --> 33:45:51,040
vom vedea aici. Vom face doar o

44545
33:45:48,552 --> 33:45:54,320
precizia imprimării este.

44546
33:45:51,040 --> 33:45:56,960
Și apoi facem scorul de precizie. Şi

44547
33:45:54,320 --> 33:45:58,232
asta a fost ceva ce am importat

44548
33:45:56,960 --> 33:45:59,512
mai devreme. Dacă vă amintiți chiar la

44549
33:45:58,232 --> 33:46:01,360
la început, lasă-mă să parcurg până acolo

44550
33:45:59,512 --> 33:46:03,680
foarte repede, ca să poți vedea unde este

44551
33:46:01,360 --> 33:46:06,160
provenind din. Asta vine de aici

44552
33:46:03,680 --> 33:46:09,360
aici jos de la sklearn.metrics metrics

44553
33:46:06,160 --> 33:46:10,800
scorul de precizie de import. Și ai putea

44554
33:46:09,360 --> 33:46:12,800
probabil rulați un script, creați-vă propriul dvs

44555
33:46:10,800 --> 33:46:15,040
script pentru a face acest lucru foarte ușor. Cum

44556
33:46:12,800 --> 33:46:17,512
exact este? Câți din 300 fac

44557
33:46:15,040 --> 33:46:19,512
avem dreptate? Și așa am pus în yul nostru

44558
33:46:17,512 --> 33:46:22,552
test. Acesta este cel pe care l-am prezis

44559
33:46:19,512 --> 33:46:24,552
pe. Și apoi am pus în y predict en

44560
33:46:22,552 --> 33:46:26,320
astea sunt raspunsurile pe care le avem. Și suntem

44561
33:46:24,552 --> 33:46:27,680
doar o să înmulțesc asta cu 100

44562
33:46:26,320 --> 33:46:29,512
pentru că asta doar ne va oferi un

44563
33:46:27,680 --> 33:46:31,760
raspunde ca zecimal si vrem sa vedem

44564
33:46:29,512 --> 33:46:34,080
aceasta ca procent. Și hai să rulăm asta

44565
33:46:31,760 --> 33:46:35,512
și vezi cum arată. Și dacă tu

44566
33:46:34,080 --> 33:46:38,480
vezi aici, avem o precizie de

44567
33:46:35,512 --> 33:46:40,232
93,666667.

44568
33:46:38,480 --> 33:46:42,720
Deci, când ne uităm la numărul de împrumuturi

44569
33:46:40,232 --> 33:46:46,480
și ne uităm la cât de bine se potrivește modelul nostru,

44570
33:46:42,720 --> 33:46:49,512
putem spune oamenilor că are aproximativ 93,6

44571
33:46:46,480 --> 33:46:52,080
potrivindu-se acestuia. Deci, doar o recapitulare rapidă

44572
33:46:49,512 --> 33:46:54,000
că. Acum avem acuratețea configurată

44573
33:46:52,080 --> 33:46:56,160
aici. Și așa am creat un model

44574
33:46:54,000 --> 33:46:57,832
care utilizează algoritmul arborelui de decizie pentru a

44575
33:46:56,160 --> 33:46:59,680
prezice dacă un client va rambursa

44576
33:46:57,832 --> 33:47:02,080
împrumutul sau nu. Precizia

44577
33:46:59,680 --> 33:47:03,760
modelul este de aproximativ 94,6%.

44578
33:47:02,080 --> 33:47:05,440
Banca poate folosi acum acest model pentru

44579
33:47:03,760 --> 33:47:07,192
decide dacă ar trebui să aprobe

44580
33:47:05,440 --> 33:47:09,272
cerere de împrumut de la un anumit client

44581
33:47:07,192 --> 33:47:11,272
sau nu. Și așa este această informație

44582
33:47:09,272 --> 33:47:12,872
cu adevărat puternic. S-ar putea să nu putem

44583
33:47:11,272 --> 33:47:14,400
pe măsură ce indivizii înțeleg toate acestea

44584
33:47:12,872 --> 33:47:16,000
numere pentru că au mii de

44585
33:47:14,400 --> 33:47:17,912
numere care vin, dar puteți vedea

44586
33:47:16,000 --> 33:47:20,080
că aceasta este o decizie inteligentă pentru

44587
33:47:17,912 --> 33:47:22,232
banca să folosească un instrument ca acesta pentru a ajuta

44588
33:47:20,080 --> 33:47:24,232
ei să prezică cât de bine sunt

44589
33:47:22,232 --> 33:47:25,832
profitul va fi scos din împrumut

44590
33:47:24,232 --> 33:47:27,120
solduri și câte vor

44591
33:47:25,832 --> 33:47:28,960
implicit sau nu. Vom fi

44592
33:47:27,120 --> 33:47:30,720
uitându-se la pădurea întâmplătoare, una dintre

44593
33:47:28,960 --> 33:47:33,192
multe instrumente puternice în mașină

44594
33:47:30,720 --> 33:47:35,680
biblioteca de invatare. Înainte să ne scufundăm în

44595
33:47:33,192 --> 33:47:38,400
subiectul, să începem prin a ne uita la a

44596
33:47:35,680 --> 33:47:40,000
câteva dintre utilizările pentru pădure aleatoare.

44597
33:47:38,400 --> 33:47:43,040
În prezent, este folosit în telecomandă

44598
33:47:40,000 --> 33:47:46,080
simțind. De exemplu, sunt folosite în

44599
33:47:43,040 --> 33:47:48,160
dispozitivele ETM. Dacă ești un pasionat de spațiu,

44600
33:47:46,080 --> 33:47:51,040
acesta este mapperul termic îmbunătățit

44601
33:47:48,160 --> 33:47:53,192
ei folosesc pe sateliți care văd uh departe

44602
33:47:51,040 --> 33:47:55,272
în afara spectrului uman pentru căutare

44603
33:47:53,192 --> 33:47:57,832
la masele de uscat. și dobândesc imagini

44604
33:47:55,272 --> 33:48:00,080
a suprafetei terestre. Precizia este

44605
33:47:57,832 --> 33:48:01,680
mai mare și timpul de antrenament este mai mic decât

44606
33:48:00,080 --> 33:48:03,760
multe alte instrumente de învățare automată

44607
33:48:01,680 --> 33:48:05,512
acolo. De asemenea, detectarea obiectelor,

44608
33:48:03,760 --> 33:48:07,832
se face detectarea obiectelor multiclase

44609
33:48:05,512 --> 33:48:09,440
folosind algoritmi forestieri aleatori. Un bun

44610
33:48:07,832 --> 33:48:11,120
exemplu este un trafic în care încercați

44611
33:48:09,440 --> 33:48:12,872
pentru a sorta diferitele mașini, autobuze,

44612
33:48:11,120 --> 33:48:14,800
si lucruri. Și oferă o mai bună

44613
33:48:12,872 --> 33:48:16,400
detectarea în medii complicate.

44614
33:48:14,800 --> 33:48:19,272
Sunt foarte complicate acolo sus. Şi

44615
33:48:16,400 --> 33:48:20,872
apoi avem un alt exemplu de conectare.

44616
33:48:19,272 --> 33:48:23,120
Și să aruncăm o privire puțin mai atentă

44617
33:48:20,872 --> 33:48:26,232
conectați. Conectați-vă. Ei folosesc o aleatorie

44618
33:48:23,120 --> 33:48:27,832
pădure ca parte a consolei de jocuri și

44619
33:48:26,232 --> 33:48:29,680
ceea ce face este că urmărește un corp

44620
33:48:27,832 --> 33:48:32,080
mișcări și o recreează în

44621
33:48:29,680 --> 33:48:34,400
joc și hai să vedem cum arată.

44622
33:48:32,080 --> 33:48:36,400
Avem un utilizator care efectuează un pas.

44623
33:48:34,400 --> 33:48:39,360
În acest caz, seamănă cu Elvis Presley

44624
33:48:36,400 --> 33:48:41,832
mergand acolo care se inregistreaza apoi asa

44625
33:48:39,360 --> 33:48:43,912
care conectează înregistrează mișcarea și

44626
33:48:41,832 --> 33:48:46,080
apoi marchează utilizatorul pe baza

44627
33:48:43,912 --> 33:48:48,960
precizie. Și se pare că avem uh

44628
33:48:46,080 --> 33:48:51,272
Prince merge pe asta de la Elvis

44629
33:48:48,960 --> 33:48:53,272
Presley către Prince. E minunat. Uh asa e

44630
33:48:51,272 --> 33:48:55,192
marchează baza de utilizator pe precizie. Dacă noi

44631
33:48:53,272 --> 33:48:57,440
uită-te la asta puțin mai de aproape, avem un

44632
33:48:55,192 --> 33:48:59,760
set de antrenament pentru identificarea părților corpului.

44633
33:48:57,440 --> 33:49:02,400
Unde sunt mâinile? Unde sunt picioarele?

44634
33:48:59,760 --> 33:49:04,080
Ce se întâmplă cu cadavrul? Asta

44635
33:49:02,400 --> 33:49:06,720
apoi merge într-o pădure întâmplătoare

44636
33:49:04,080 --> 33:49:09,512
clasificator care învață din el. Odată

44637
33:49:06,720 --> 33:49:11,192
am antrenat clasificatorul, atunci

44638
33:49:09,512 --> 33:49:13,680
identifică părțile corpului în timp ce

44639
33:49:11,192 --> 33:49:16,720
dansul persoanei. Este capabil să reprezinte

44640
33:49:13,680 --> 33:49:18,800
că într-un format de calculator. Și apoi

44641
33:49:16,720 --> 33:49:20,640
pe baza asta, marchează jocul și

44642
33:49:18,800 --> 33:49:22,960
cât de precis ești ca fiind Elvis

44643
33:49:20,640 --> 33:49:26,000
Presley sau Prince în dansul tău. Deci

44644
33:49:22,960 --> 33:49:29,040
de ce pădure la întâmplare? Este întotdeauna important

44645
33:49:26,000 --> 33:49:31,360
pentru a înțelege de ce folosim acest instrument peste

44646
33:49:29,040 --> 33:49:34,400
celelalte. Care sunt beneficiile

44647
33:49:31,360 --> 33:49:36,552
aici? Și așa cu pădurea întâmplătoare,

44648
33:49:34,400 --> 33:49:39,272
prima este că nu există supraajustare. Dacă

44649
33:49:36,552 --> 33:49:41,360
folosiți mai mulți copaci, reduceți

44650
33:49:39,272 --> 33:49:44,400
risc de supraadaptare. Timpul de antrenament este

44651
33:49:41,360 --> 33:49:46,552
mai putin. Suprafitting înseamnă că ne-am potrivit

44652
33:49:44,400 --> 33:49:49,360
datele atât de aproape de ceea ce avem ca noastre

44653
33:49:46,552 --> 33:49:51,192
mostră pe care o luăm pe toate ciudatele

44654
33:49:49,360 --> 33:49:52,800
părți și în loc să prezică

44655
33:49:51,192 --> 33:49:55,360
date generale, preziceți

44656
33:49:52,800 --> 33:49:57,512
lucruri ciudate pe care nu le vrei. Înalt

44657
33:49:55,360 --> 33:49:59,912
precizia rulează eficient pe mari dimensiuni

44658
33:49:57,512 --> 33:50:02,800
baza de date. Pentru date mari, produce

44659
33:49:59,912 --> 33:50:04,960
previziuni foarte precise. În cea de azi

44660
33:50:02,800 --> 33:50:07,272
lumea datelor mari, asta este cu adevărat

44661
33:50:04,960 --> 33:50:09,272
important. Și probabil aici este

44662
33:50:07,272 --> 33:50:11,760
chiar strălucește. Aici este Y aleatoriu

44663
33:50:09,272 --> 33:50:14,000
pădurea chiar intră. Estimă

44664
33:50:11,760 --> 33:50:15,912
date lipsă. Datele din lumea de astăzi sunt

44665
33:50:14,000 --> 33:50:17,760
foarte dezordonat. Deci, când ai o întâmplare

44666
33:50:15,912 --> 33:50:19,912
pădure, poate menține precizia

44667
33:50:17,760 --> 33:50:21,760
când o mare parte a datelor este

44668
33:50:19,912 --> 33:50:23,912
lipsă. Ceea ce înseamnă asta este dacă ai

44669
33:50:21,760 --> 33:50:26,000
date care vin de la cinci sau șase

44670
33:50:23,912 --> 33:50:28,720
zone diferite și poate au luat una

44671
33:50:26,000 --> 33:50:30,160
set de statistici într-o zonă și ei

44672
33:50:28,720 --> 33:50:31,592
a luat un set ușor diferit de

44673
33:50:30,160 --> 33:50:34,320
statistici în celălalt. Deci au

44674
33:50:31,592 --> 33:50:36,232
unele dintre aceleași date partajate, dar una

44675
33:50:34,320 --> 33:50:37,760
lipsește ca numărul uh de

44676
33:50:36,232 --> 33:50:40,080
copii în casă dacă faci

44677
33:50:37,760 --> 33:50:42,000
ceva peste demografie. iar cel

44678
33:50:40,080 --> 33:50:44,000
celuilalt îi lipsește dimensiunea

44679
33:50:42,000 --> 33:50:46,000
casa. Se va uita la ambele

44680
33:50:44,000 --> 33:50:48,160
separat și construiți doi copaci diferiți

44681
33:50:46,000 --> 33:50:50,480
și atunci poate face o treabă foarte bună

44682
33:50:48,160 --> 33:50:52,320
ghicind care dintre ele se potrivește mai bine

44683
33:50:50,480 --> 33:50:55,272
deși îi lipsesc acele date. Lasă-ne

44684
33:50:52,320 --> 33:50:58,400
sapă adânc în teoria exact cum

44685
33:50:55,272 --> 33:51:01,832
funcționează. Și să ne uităm la ce este

44686
33:50:58,400 --> 33:51:04,080
pădure la întâmplare. Pădure aleatoare sau întâmplătoare

44687
33:51:01,832 --> 33:51:05,760
pădurea de decizie este o metodă care

44688
33:51:04,080 --> 33:51:08,000
operează prin construirea de multiple

44689
33:51:05,760 --> 33:51:10,160
arbori de decizie. Decizia lui

44690
33:51:08,000 --> 33:51:12,640
majoritatea copacilor este ales de către

44691
33:51:10,160 --> 33:51:14,080
pădure aleatoare ca decizie finală. Şi

44692
33:51:12,640 --> 33:51:15,912
hai să avem niște grafică drăguță

44693
33:51:14,080 --> 33:51:17,680
aici. Avem un arbore de decizie și ei

44694
33:51:15,912 --> 33:51:20,160
folosește de fapt un copac real pentru a desemna

44695
33:51:17,680 --> 33:51:22,720
arborele de decizie pe care îl iubesc. Și dat un

44696
33:51:20,160 --> 33:51:24,720
la întâmplare un fel de imagine a unui fruct.

44697
33:51:22,720 --> 33:51:26,552
Acest arbore de decizie decide că

44698
33:51:24,720 --> 33:51:28,320
ieșirea este că este un măr. Și avem o

44699
33:51:26,552 --> 33:51:30,080
arborele de decizie și acolo unde avem asta

44700
33:51:28,320 --> 33:51:31,832
poza fructului intră și asta

44701
33:51:30,080 --> 33:51:33,592
unul decide că este o lămâie. Iar cel

44702
33:51:31,832 --> 33:51:35,440
Arborele deciziei trei primește o altă imagine

44703
33:51:33,592 --> 33:51:37,040
și decide că este un măr. Și apoi

44704
33:51:35,440 --> 33:51:39,512
toate acestea se reunesc în ceea ce ei

44705
33:51:37,040 --> 33:51:41,592
numiţi pădurea întâmplătoare. Și asta întâmplător

44706
33:51:39,512 --> 33:51:43,760
pădurea se uită apoi la el și spune: „Bine,

44707
33:51:41,592 --> 33:51:46,552
Am primit două voturi pentru Apple, un vot pentru

44708
33:51:43,760 --> 33:51:49,592
lamaie. Majoritatea sunt mere. Deci

44709
33:51:46,552 --> 33:51:52,480
decizia finală este merele.” A intelege

44710
33:51:49,592 --> 33:51:54,480
cum funcționează pădurea aleatorie, noi mai întâi

44711
33:51:52,480 --> 33:51:56,232
trebuie să sapi puțin mai adânc și să ia o

44712
33:51:54,480 --> 33:51:58,000
uită-te la pădurea întâmplătoare și la real

44713
33:51:56,232 --> 33:52:00,320
arborele de decizie și cum se construiește

44714
33:51:58,000 --> 33:52:02,720
arborele de decizie. Privind mai atent cum

44715
33:52:00,320 --> 33:52:04,480
arborii de decizie individuali funcționează,

44716
33:52:02,720 --> 33:52:06,320
vom merge mai departe și vom continua să folosim

44717
33:52:04,480 --> 33:52:08,720
exemplu de fructe din moment ce vorbim despre

44718
33:52:06,320 --> 33:52:11,192
copaci si paduri. Un arbore de decizie este a

44719
33:52:08,720 --> 33:52:13,272
diagramă în formă de arbore utilizată pentru a determina a

44720
33:52:11,192 --> 33:52:15,192
curs de acțiune. Fiecare ramură a

44721
33:52:13,272 --> 33:52:17,192
arborele reprezintă o posibilă decizie,

44722
33:52:15,192 --> 33:52:18,960
apariție sau reacție. Deci aici noi

44723
33:52:17,192 --> 33:52:20,872
ia un vas cu fructe si daca te uiti la

44724
33:52:18,960 --> 33:52:23,192
că se pare că de la care trec

44725
33:52:20,872 --> 33:52:25,272
de la lamai la portocale. Deci avem portocale,

44726
33:52:23,192 --> 33:52:27,272
cireșe și mere. Și primul

44727
33:52:25,272 --> 33:52:29,040
decizia arborelui de decizie ar putea fi

44728
33:52:27,272 --> 33:52:31,592
este un diametru mai mare sau egal cu

44729
33:52:29,040 --> 33:52:32,872
trei. Și dacă spune fals, știe

44730
33:52:31,592 --> 33:52:34,320
că sunt cireșe pentru că totul

44731
33:52:32,872 --> 33:52:36,160
altceva este mai mare decât atât. Deci toate

44732
33:52:34,320 --> 33:52:38,320
cireșele intră în această decizie. Deci noi

44733
33:52:36,160 --> 33:52:39,760
avem toate acele date pe care le antrenăm. Noi

44734
33:52:38,320 --> 33:52:41,912
se poate uita la asta. Știm că asta este

44735
33:52:39,760 --> 33:52:44,640
ce o să apară. Este culoarea

44736
33:52:41,912 --> 33:52:47,272
portocaliu? Ei bine, merge, hm, portocaliu sau roșu?

44737
33:52:44,640 --> 33:52:49,440
Ei bine, dacă este adevărat, atunci iese ca

44738
33:52:47,272 --> 33:52:52,552
portocala. Și dacă este fals, asta

44739
33:52:49,440 --> 33:52:54,872
lasă mere. Deci, în acest exemplu, acesta

44740
33:52:52,552 --> 33:52:57,360
sortează fructele în bol sau

44741
33:52:54,872 --> 33:52:59,120
imagini ale fructului. Un arbore de decizie.

44742
33:52:57,360 --> 33:53:00,320
Aceștia sunt termeni foarte importanți de știut

44743
33:52:59,120 --> 33:53:01,680
deoarece acestea sunt foarte centrale pentru

44744
33:53:00,320 --> 33:53:04,320
înțelegerea arborelui de decizie și când

44745
33:53:01,680 --> 33:53:06,400
lucrând cu ei. Prima este entropia.

44746
33:53:04,320 --> 33:53:09,120
Totul pe arborele de decizie și cum

44747
33:53:06,400 --> 33:53:11,512
ia o decizie se bazează pe entropie.

44748
33:53:09,120 --> 33:53:14,400
Entropia este o măsură a aleatoriei sau

44749
33:53:11,512 --> 33:53:17,040
impredictibilitatea setului de date. uh

44750
33:53:14,400 --> 33:53:20,232
atunci au și câștig de informații,

44751
33:53:17,040 --> 33:53:22,960
nodul frunză, nodul de decizie și

44752
33:53:20,232 --> 33:53:25,512
nodul rădăcină. Vom acoperi aceste alte patru

44753
33:53:22,960 --> 33:53:28,160
termeni în timp ce coborâm copacul, dar haideți

44754
33:53:25,512 --> 33:53:30,872
începe cu entropia. Deci incepand cu

44755
33:53:28,160 --> 33:53:34,000
entropie, avem aici o cantitate mare de

44756
33:53:30,872 --> 33:53:35,832
aleatorietatea. Ceea ce înseamnă asta este că

44757
33:53:34,000 --> 33:53:38,000
orice iese din această decizie,

44758
33:53:35,832 --> 33:53:40,320
dacă urma să ghicească pe baza asta

44759
33:53:38,000 --> 33:53:42,552
date, nu v-ar putea spune

44760
33:53:40,320 --> 33:53:45,680
fie că este o lămâie sau un măr. ea

44761
33:53:42,552 --> 33:53:47,040
ar spune doar că este un fruct. Uh deci

44762
33:53:45,680 --> 33:53:49,120
primul lucru pe care vrem să-l facem este să vrem

44763
33:53:47,040 --> 33:53:50,872
împărțim asta și luăm inițiala

44764
33:53:49,120 --> 33:53:53,040
set de date. Vom seta crearea unui

44765
33:53:50,872 --> 33:53:54,720
setul de date unu și un set de date doi. Noi doar

44766
33:53:53,040 --> 33:53:57,360
împărțiți-l în două. Și dacă te uiți la

44767
33:53:54,720 --> 33:53:59,512
aceste noi seturi de date după împărțire

44768
33:53:57,360 --> 33:54:02,720
ele, entropia fiecăreia dintre acele seturi

44769
33:53:59,512 --> 33:54:04,160
este mult mai puțin. Deci pentru primul,

44770
33:54:02,720 --> 33:54:05,592
orice va intra acolo, va fi

44771
33:54:04,160 --> 33:54:07,512
sortați acele date și va spune:

44772
33:54:05,592 --> 33:54:09,512
bine, dacă aceste date merg în această direcție,

44773
33:54:07,512 --> 33:54:11,120
probabil că este un măr. Și dacă merge

44774
33:54:09,512 --> 33:54:13,192
în cealaltă direcție, probabil că este

44775
33:54:11,120 --> 33:54:15,680
o lamaie. Deci asta ne aduce până la

44776
33:54:13,192 --> 33:54:17,760
câștig de informații. Este măsura de

44777
33:54:15,680 --> 33:54:20,160
scăderea entropiei după date

44778
33:54:17,760 --> 33:54:23,360
setul este împărțit. Ce înseamnă asta aici este

44779
33:54:20,160 --> 33:54:26,160
că am trecut de la un set care are un

44780
33:54:23,360 --> 33:54:28,552
entropie foarte mare la două seturi inferioare de

44781
33:54:26,160 --> 33:54:31,272
entropie și am adăugat valorile lui

44782
33:54:28,552 --> 33:54:33,272
E1 pentru primul și E2 pentru

44783
33:54:31,272 --> 33:54:36,000
secundele două care sunt mult mai mici. Și așa

44784
33:54:33,272 --> 33:54:38,320
că câștigul de informații este crescut

44785
33:54:36,000 --> 33:54:40,160
foarte mult în acest exemplu. Și așa poți

44786
33:54:38,320 --> 33:54:45,272
constată că grăuntul informaţiei pur şi simplu

44787
33:54:40,160 --> 33:54:48,080
este egal cu decizia E1 minus E2. Asa cum suntem

44788
33:54:45,272 --> 33:54:49,760
coborând lista noastră de definiții,

44789
33:54:48,080 --> 33:54:52,960
ne vom uita la nodul frunzei. Iar cel

44790
33:54:49,760 --> 33:54:55,512
nodul frunză poartă clasificarea sau

44791
33:54:52,960 --> 33:54:58,400
decizia. Așa că ne uităm aici în jos la

44792
33:54:55,512 --> 33:55:00,960
nodul frunzei. Ajungem în sfârșit la platoul nostru

44793
33:54:58,400 --> 33:55:02,552
unul sau setul nostru doi. Când coboară

44794
33:55:00,960 --> 33:55:05,120
acolo și scrie: „Bine, acest obiect este

44795
33:55:02,552 --> 33:55:08,232
a intrat în setul unu”. Dacă a intrat în

44796
33:55:05,120 --> 33:55:09,680
setați unul, va fi împărțit de unii

44797
33:55:08,232 --> 33:55:12,400
înseamnă și ori vom ajunge cu

44798
33:55:09,680 --> 33:55:13,760
mere pe nodul frunzei sau o lămâie pe

44799
33:55:12,400 --> 33:55:16,320
nodul frunzei. Și în dreapta, va fi

44800
33:55:13,760 --> 33:55:18,400
fie un măr, fie lămâi. Acele frunze

44801
33:55:16,320 --> 33:55:20,480
nodurile sunt acele decizii finale sau

44802
33:55:18,400 --> 33:55:22,800
clasificări. Uh asta e

44803
33:55:20,480 --> 33:55:24,800
definiția nodului frunză aici. Dacă

44804
33:55:22,800 --> 33:55:27,120
vom avea o ultimă frunză unde

44805
33:55:24,800 --> 33:55:29,192
luăm decizia, ar trebui să avem o

44806
33:55:27,120 --> 33:55:32,000
nume pentru nodurile de deasupra acestuia. Și ei

44807
33:55:29,192 --> 33:55:34,320
numiți acele noduri de decizie. O decizie

44808
33:55:32,000 --> 33:55:36,720
nod. nodul de decizie are două sau mai multe

44809
33:55:34,320 --> 33:55:39,360
ramuri și puteți vedea aici unde noi

44810
33:55:36,720 --> 33:55:41,192
am cele cinci mere și o lămâie

44811
33:55:39,360 --> 33:55:43,040
iar în celălalt caz cele cinci lămâi

44812
33:55:41,192 --> 33:55:45,592
și un măr. Ei trebuie să facă o

44813
33:55:43,040 --> 33:55:48,000
în funcție de alegerea arborelui în care coboară

44814
33:55:45,592 --> 33:55:51,120
pe un fel de măsurare sau

44815
33:55:48,000 --> 33:55:53,680
informațiile date arborelui. Și asta

44816
33:55:51,120 --> 33:55:56,320
ne duce la ultima noastră definiție. The

44817
33:55:53,680 --> 33:55:58,872
nodul rădăcină, cel mai înalt nod de decizie este

44818
33:55:56,320 --> 33:56:01,040
cunoscut sub numele de nodul rădăcină. Și aceasta este

44819
33:55:58,872 --> 33:56:02,640
unde ai toate datele tale și tu

44820
33:56:01,040 --> 33:56:05,512
ai prima decizie. trebuie să facă

44821
33:56:02,640 --> 33:56:07,272
sau prima împărțire în informații. Deci

44822
33:56:05,512 --> 33:56:10,232
până acum, ne-am uitat la un foarte general

44823
33:56:07,272 --> 33:56:12,080
imagine cu fructele împărțite.

44824
33:56:10,232 --> 33:56:14,640
Să ne uităm și să vedem exact ce anume

44825
33:56:12,080 --> 33:56:17,120
înseamnă să împărțim datele și cum facem

44826
33:56:14,640 --> 33:56:19,592
ia acele decizii acolo. Hai să

44827
33:56:17,120 --> 33:56:22,720
intră acolo și află cum face a

44828
33:56:19,592 --> 33:56:24,960
munca arborelui decizional. Deci hai sa incercam

44829
33:56:22,720 --> 33:56:27,440
înțelegeți acest lucru și să folosim un simplu

44830
33:56:24,960 --> 33:56:29,760
exemplu și vom rămâne cu fructele.

44831
33:56:27,440 --> 33:56:31,592
Avem un castron cu fructe și haideți

44832
33:56:29,760 --> 33:56:34,000
creați o declarație de problemă și

44833
33:56:31,592 --> 33:56:35,912
problema este că vrem să clasificăm

44834
33:56:34,000 --> 33:56:38,232
diferite tipuri de fructe în bol

44835
33:56:35,912 --> 33:56:40,552
bazate pe diferite caracteristici. Datele

44836
33:56:38,232 --> 33:56:42,960
așezat în bol arată destul de dezordonat

44837
33:56:40,552 --> 33:56:45,440
iar entropia este mare în acest caz. Deci

44838
33:56:42,960 --> 33:56:47,592
dacă acest bol a fost factorul nostru de decizie, asta

44839
33:56:45,440 --> 33:56:49,360
nu ar sti ce alegere sa fac. Ea

44840
33:56:47,592 --> 33:56:52,232
are atatea alegeri. Pe care o faci

44841
33:56:49,360 --> 33:56:53,760
alege? Măr, struguri sau lămâi. Și așa

44842
33:56:52,232 --> 33:56:56,720
ne uităm aici. Vom începe

44843
33:56:53,760 --> 33:56:58,320
cu a d un set de antrenament. Deci acesta este al nostru

44844
33:56:56,720 --> 33:57:00,080
datele cu care ne antrenăm datele

44845
33:56:58,320 --> 33:57:01,912
și avem o serie de opțiuni aici. Noi

44846
33:57:00,080 --> 33:57:04,480
au culoarea iar sub culoarea noi

44847
33:57:01,912 --> 33:57:08,640
au roșu galben violet uh avem o

44848
33:57:04,480 --> 33:57:11,272
diametru uh 331 331 și avem o etichetă

44849
33:57:08,640 --> 33:57:13,360
apple lemon grapes apple lemon grapes

44850
33:57:11,272 --> 33:57:15,120
și cum împărțim datele? Trebuie

44851
33:57:13,360 --> 33:57:17,120
încadrați condițiile de împărțire a datelor

44852
33:57:15,120 --> 33:57:20,000
în aşa fel încât informaţia să câştige

44853
33:57:17,120 --> 33:57:22,160
este cel mai înalt. Este foarte important de remarcat

44854
33:57:20,000 --> 33:57:23,592
că căutăm cel mai bun câștig. Noi

44855
33:57:22,160 --> 33:57:25,592
nu vreau să încep pur și simplu să rezolv

44856
33:57:23,592 --> 33:57:27,680
cea mai mică bucată de acolo. Vrem

44857
33:57:25,592 --> 33:57:30,320
împărțiți-l cât mai mult posibil. Și așa

44858
33:57:27,680 --> 33:57:31,440
măsurăm această scădere a entropiei.

44859
33:57:30,320 --> 33:57:33,360
Așa o numesc, entropie.

44860
33:57:31,440 --> 33:57:35,360
Există entropia noastră după despărțire. Şi

44861
33:57:33,360 --> 33:57:37,832
acum vom încerca să alegem o condiție care

44862
33:57:35,360 --> 33:57:39,680
ne oferă cel mai mare câștig. Vom face

44863
33:57:37,832 --> 33:57:41,360
că prin împărțirea datelor folosind fiecare

44864
33:57:39,680 --> 33:57:42,960
starea si verificarea castigului pe care noi

44865
33:57:41,360 --> 33:57:44,800
iesi din ele. Condiţiile care

44866
33:57:42,960 --> 33:57:46,640
dă-ne cel mai mare câștig cu care vei fi obișnuit

44867
33:57:44,800 --> 33:57:48,160
faceți prima împărțire. Deci să luăm un

44868
33:57:46,640 --> 33:57:50,232
uitați-vă la aceste condiții diferite. Noi

44869
33:57:48,160 --> 33:57:51,592
avem culoare, avem diametru, iar dacă avem

44870
33:57:50,232 --> 33:57:52,960
uite dedesubt, avem un cuplu

44871
33:57:51,592 --> 33:57:55,592
valori diferite. este ca avem diametru

44872
33:57:52,960 --> 33:57:57,592
este egal cu 3, culoarea este egală cu galben, roșu,

44873
33:57:55,592 --> 33:58:01,912
diametrul este egal cu 1. Iar când ne uităm la

44874
33:57:57,592 --> 33:58:04,232
asta, vei vedea aici avem 1 2 3

44875
33:58:01,912 --> 33:58:06,480
4 trei. E destul de rezistent

44876
33:58:04,232 --> 33:58:09,512
selecție. Deci, să spunem condiția

44877
33:58:06,480 --> 33:58:12,232
ne oferă un câștig maxim de trei. Deci noi

44878
33:58:09,512 --> 33:58:15,680
au cele mai multe bucăți cad în asta

44879
33:58:12,232 --> 33:58:18,080
interval. Deci prima noastră despărțire de a noastră

44880
33:58:15,680 --> 33:58:20,160
nodul de decizie este împărțim pe baza datelor

44881
33:58:18,080 --> 33:58:23,040
pe diametru. Este mai mare decât sau

44882
33:58:20,160 --> 33:58:25,272
egal cu trei? Dacă nu este, asta este

44883
33:58:23,040 --> 33:58:27,680
fals. Intră în bolul cu struguri. Şi

44884
33:58:25,272 --> 33:58:30,160
dacă este adevărat, intră într-un pliu de bol

44885
33:58:27,680 --> 33:58:32,960
de lamaie si mere. Entropia după

44886
33:58:30,160 --> 33:58:34,480
scindarea a scăzut considerabil. Deci

44887
33:58:32,960 --> 33:58:37,592
acum putem lua două decizii. Dacă tu

44888
33:58:34,480 --> 33:58:39,440
uite, sunt foarte uh, mult mai puțin haos

44889
33:58:37,592 --> 33:58:41,360
mergand acolo. Acest nod are deja

44890
33:58:39,440 --> 33:58:43,192
atinge o valoare a entropiei zero. Ca tine

44891
33:58:41,360 --> 33:58:45,680
pot vedea, există un singur fel de etichetă

44892
33:58:43,192 --> 33:58:48,160
plecat la această ramură. Deci nu mai departe

44893
33:58:45,680 --> 33:58:51,040
împărțirea este necesară pentru acest nod.

44894
33:58:48,160 --> 33:58:53,120
Cu toate acestea, acest nod din dreapta este încă

44895
33:58:51,040 --> 33:58:55,680
necesită o divizare pentru a scădea entropia

44896
33:58:53,120 --> 33:58:57,832
mai departe. Deci, împărțim nodul corect

44897
33:58:55,680 --> 33:58:59,592
mai departe bazat pe culoare. Dacă te uiți la

44898
33:58:57,832 --> 33:59:01,272
asta, dacă l-am împărțit pe culoare, asta

44899
33:58:59,592 --> 33:59:02,320
destul de mult o taie chiar în jos

44900
33:59:01,272 --> 33:59:03,760
mijloc. Și este singurul lucru pe care îl avem

44901
33:59:02,320 --> 33:59:06,480
lăsat în alegerile noastre de culoare și

44902
33:59:03,760 --> 33:59:08,232
diametrul, de asemenea. Și dacă culoarea este

44903
33:59:06,480 --> 33:59:09,832
galben, va merge la dreapta

44904
33:59:08,232 --> 33:59:11,912
castron. Și dacă este fals, va fi

44905
33:59:09,832 --> 33:59:14,080
du-te la bolul din stânga. Deci, entropia în

44906
33:59:11,912 --> 33:59:16,552
acest caz este acum zero. Deci, acum avem

44907
33:59:14,080 --> 33:59:18,160
trei boluri cu entropie zero. Există

44908
33:59:16,552 --> 33:59:20,640
un singur tip de date în fiecare dintre

44909
33:59:18,160 --> 33:59:23,680
bolurile acelea. Deci, putem prezice o lămâie

44910
33:59:20,640 --> 33:59:26,480
cu o precizie de 100%. Și putem prezice

44911
33:59:23,680 --> 33:59:28,872
mărul, de asemenea, cu o precizie de 100% de-a lungul

44912
33:59:26,480 --> 33:59:31,912
cu strugurii noștri acolo sus. Deci, am

44913
33:59:28,872 --> 33:59:33,912
a privit un fel de copac de bază în noi

44914
33:59:31,912 --> 33:59:36,552
pădure. Dar ce vrem cu adevărat să știm

44915
33:59:33,912 --> 33:59:40,160
este cum funcționează o pădure aleatoare ca a

44916
33:59:36,552 --> 33:59:42,720
întreg. Deci pentru a începe pădurea noastră aleatorie

44917
33:59:40,160 --> 33:59:44,640
clasificator, să spunem că avem deja

44918
33:59:42,720 --> 33:59:46,080
a construit trei copaci. Și o să mergem

44919
33:59:44,640 --> 33:59:48,000
începe cu primul copac care arată

44920
33:59:46,080 --> 33:59:49,680
ca asta. La fel cum am făcut în

44921
33:59:48,000 --> 33:59:51,360
exemplu, acest copac se uită la

44922
33:59:49,680 --> 33:59:53,912
diametrul. Dacă este mai mare sau egal

44923
33:59:51,360 --> 33:59:56,400
la trei, e adevărat. Altfel, este

44924
33:59:53,912 --> 33:59:58,160
fals. Deci o parte merge la cea mai mică

44925
33:59:56,400 --> 34:00:01,192
diametrul, o parte devine mai mare

44926
33:59:58,160 --> 34:00:02,960
diametrul. Și dacă culoarea este portocalie,

44927
34:00:01,192 --> 34:00:04,160
va merge la dreapta. Adevărat.

44928
34:00:02,960 --> 34:00:06,320
Acum folosim portocale în loc de

44929
34:00:04,160 --> 34:00:08,800
lămâi. Și dacă este roșu, va fi

44930
34:00:06,320 --> 34:00:10,720
mergi la stanga. Fals. Construim o secundă

44931
34:00:08,800 --> 34:00:12,320
copac foarte asemănător, dar este despicat

44932
34:00:10,720 --> 34:00:15,040
diferit. În loc de primul

44933
34:00:12,320 --> 34:00:16,320
fiind împărțit cu un diametru, acesta

44934
34:00:15,040 --> 34:00:18,320
când l-au creat, dacă te uiți la

44935
34:00:16,320 --> 34:00:21,592
acel prim bol, are mult roșu

44936
34:00:18,320 --> 34:00:22,552
obiecte. Deci spune, culoarea este roșie?

44937
34:00:21,592 --> 34:00:25,192
Pentru că asta ne va aduce

44938
34:00:22,552 --> 34:00:26,480
entropia scade cel mai repede. Și așa, de

44939
34:00:25,192 --> 34:00:28,232
desigur, dacă este adevărat, merge la

44940
34:00:26,480 --> 34:00:30,232
stânga. Dacă este fals, merge la

44941
34:00:28,232 --> 34:00:33,272
corect. Și apoi se uită la formă,

44942
34:00:30,232 --> 34:00:36,400
fals sau adevărat, și așa mai departe și așa mai departe. Şi

44943
34:00:33,272 --> 34:00:38,000
arborele trei este diametrul egal cu unu.

44944
34:00:36,400 --> 34:00:39,912
Și a venit cu asta pentru că există

44945
34:00:38,000 --> 34:00:41,512
multe cireșe în castronul acesta. Așa că

44946
34:00:39,912 --> 34:00:43,120
ar fi cea mai mare scindare de acolo

44947
34:00:41,512 --> 34:00:45,120
este diametrul egal cu unu. Asta e

44948
34:00:43,120 --> 34:00:46,640
va scădea cel mai repede entropia.

44949
34:00:45,120 --> 34:00:48,400
Și după cum puteți vedea, îl împarte în

44950
34:00:46,640 --> 34:00:50,640
adevărat. Dacă devine fals, și ei au făcut-o

44951
34:00:48,400 --> 34:00:53,272
a adăugat o altă categorie, crește în

44952
34:00:50,640 --> 34:00:54,960
vara? Și dacă este fals, merge

44953
34:00:53,272 --> 34:00:56,800
la stânga. Dacă este adevărat, merge

44954
34:00:54,960 --> 34:00:58,160
la dreapta. Să mergem înainte și

44955
34:00:56,800 --> 34:01:00,080
adu acești trei copaci ca să vezi

44956
34:00:58,160 --> 34:01:02,000
toate într-o singură imagine. Deci asta ar fi

44957
34:01:00,080 --> 34:01:04,400
trei copaci complet diferiți

44958
34:01:02,000 --> 34:01:06,960
categorizarea unui fruct. Și să luăm o

44959
34:01:04,400 --> 34:01:08,232
fructe. Acum hai să încercăm asta. Și asta

44960
34:01:06,960 --> 34:01:10,320
fructe, dacă te uiți la el, avem

44961
34:01:08,232 --> 34:01:12,160
l-a înnegrit. Nu poți vedea

44962
34:01:10,320 --> 34:01:13,440
culoare pe ea. Deci lipsesc date.

44963
34:01:12,160 --> 34:01:16,800
Amintește-ți unul dintre lucrurile pe care le-am vorbit

44964
34:01:13,440 --> 34:01:18,400
cam mai devreme este că o pădure întâmplătoare

44965
34:01:16,800 --> 34:01:20,720
funcționează foarte bine dacă lipsești

44966
34:01:18,400 --> 34:01:22,480
date, dacă vă lipsesc piese. Deci asta

44967
34:01:20,720 --> 34:01:24,320
fructul are o imagine, dar poate este o

44968
34:01:22,480 --> 34:01:25,680
persoana avea o cameră alb-negru când

44969
34:01:24,320 --> 34:01:27,512
au făcut poza. Și mergem

44970
34:01:25,680 --> 34:01:29,360
pentru a arunca o privire la asta. Și merge

44971
34:01:27,512 --> 34:01:31,512
ca să pună culoarea acolo,

44972
34:01:29,360 --> 34:01:33,592
deci ignora culoarea de acolo. Dar cel

44973
34:01:31,512 --> 34:01:35,760
diametrul este egal cu trei. O aflăm

44974
34:01:33,592 --> 34:01:37,760
creste vara este egal cu da. Iar cel

44975
34:01:35,760 --> 34:01:39,360
forma este un cerc. Și dacă te duci la

44976
34:01:37,760 --> 34:01:41,272
corect, poți să te uiți la ce unul dintre

44977
34:01:39,360 --> 34:01:43,592
arborii de decizie au făcut-o. Acesta este al treilea

44978
34:01:41,272 --> 34:01:46,400
unul. Este diametrul mai mare decât egal

44979
34:01:43,592 --> 34:01:48,080
la trei? Este o culoare portocalie? Ei bine, asta

44980
34:01:46,400 --> 34:01:49,592
nu prea știe despre asta, dar asta

44981
34:01:48,080 --> 34:01:51,680
Dacă te uiți la valoare, spune adevărat,

44982
34:01:49,592 --> 34:01:54,400
si merge spre dreapta. Arborele doi

44983
34:01:51,680 --> 34:01:57,760
îl clasifică drept cireșe. Este o culoare

44984
34:01:54,400 --> 34:01:59,592
egal roșu? Forma este un cerc? Adevărat.

44985
34:01:57,760 --> 34:02:01,440
Este un cerc. Deci, asta ar privi

44986
34:01:59,592 --> 34:02:02,960
și spune: „O, asta e o cireșă”. Şi

44987
34:02:01,440 --> 34:02:05,272
apoi trecem la celălalt clasificator și

44988
34:02:02,960 --> 34:02:07,440
scrie: „Diametrul este egal cu unul?”

44989
34:02:05,272 --> 34:02:09,512
Ei bine, asta e fals. Crește în

44990
34:02:07,440 --> 34:02:12,080
vara? Adevărat. Deci, coboară și arată

44991
34:02:09,512 --> 34:02:14,320
la ca portocale. Deci, cum se întâmplă acest lucru la întâmplare

44992
34:02:12,080 --> 34:02:16,720
lucrari forestiere? Primul spune că este un

44993
34:02:14,320 --> 34:02:19,040
portocaliu. Al doilea a spus că este o

44994
34:02:16,720 --> 34:02:21,440
cireș. Iar al treilea spune, hm, este

44995
34:02:19,040 --> 34:02:23,192
o portocală. Și poți ghici asta dacă tu

44996
34:02:21,440 --> 34:02:24,960
au două portocale și unul spune că este a

44997
34:02:23,192 --> 34:02:27,272
cireș, uh, când adaugi toate astea

44998
34:02:24,960 --> 34:02:29,592
împreună, spune majoritatea voturilor

44999
34:02:27,272 --> 34:02:31,512
portocaliu. Deci, răspunsul este că este

45000
34:02:29,592 --> 34:02:32,872
clasificată drept portocală, chiar dacă noi

45001
34:02:31,512 --> 34:02:34,960
nu știam culoarea și ne lipsește

45002
34:02:32,872 --> 34:02:37,040
date despre el. Nu știu despre tine, dar

45003
34:02:34,960 --> 34:02:39,680
M-am săturat de fructe. Deci, hai

45004
34:02:37,040 --> 34:02:41,832
comutator. Și ți-am promis că vom începe

45005
34:02:39,680 --> 34:02:43,680
privind un exemplu de caz și intră în

45006
34:02:41,832 --> 34:02:45,832
ceva codare Python. Astăzi, mergem

45007
34:02:43,680 --> 34:02:47,512
pentru a folosi cazul floarea de iris

45008
34:02:45,832 --> 34:02:49,592
analiza.

45009
34:02:47,512 --> 34:02:51,440
Aceasta este partea incitantă în timp ce ne rulăm

45010
34:02:49,592 --> 34:02:53,440
mânecile noastre și de fapt uită-te la unele

45011
34:02:51,440 --> 34:02:55,192
Codare Python. Înainte de a începe

45012
34:02:53,440 --> 34:02:57,512
Codarea Python, trebuie să mergem mai departe și

45013
34:02:55,192 --> 34:02:59,592
creați o declarație de problemă. Mă întreb ce

45014
34:02:57,512 --> 34:03:01,592
specii de iris aparțin acestor flori

45015
34:02:59,592 --> 34:03:03,592
la? Să încercăm să prezicem specia de

45016
34:03:01,592 --> 34:03:06,480
florile folosind învățarea automată în

45017
34:03:03,592 --> 34:03:08,720
Piton. Să vedem cum se poate face. Deci

45018
34:03:06,480 --> 34:03:11,272
aici începem să mergem înainte și să punem în aplicare

45019
34:03:08,720 --> 34:03:13,440
codul nostru Python. Și vei găsi asta

45020
34:03:11,272 --> 34:03:16,080
prima jumătate a implementării noastre este

45021
34:03:13,440 --> 34:03:18,320
totul despre organizarea și explorarea

45022
34:03:16,080 --> 34:03:20,872
date care vin. Să mergem mai departe și să luăm

45023
34:03:18,320 --> 34:03:22,872
acest prim pas, care este încărcarea

45024
34:03:20,872 --> 34:03:24,480
diferite module în Python. Și haideți

45025
34:03:22,872 --> 34:03:26,160
mergeți mai departe și puneți asta în preferatul nostru

45026
34:03:24,480 --> 34:03:28,232
editor, oricare ar fi editorul tău preferat

45027
34:03:26,160 --> 34:03:31,512
este. În acest caz, voi folosi

45028
34:03:28,232 --> 34:03:33,192
caietul Anaconda Jupiter, care este

45029
34:03:31,512 --> 34:03:36,232
una dintre preferatele mele. Cu siguranță, există

45030
34:03:33,192 --> 34:03:38,872
Notepad și Eclipse și zeci de

45031
34:03:36,232 --> 34:03:40,640
altele, sau chiar folosind Python

45032
34:03:38,872 --> 34:03:43,272
fereastra terminalului. oricare dintre acestea va funcționa

45033
34:03:40,640 --> 34:03:45,120
bine să mergi mai departe și să explorezi asta

45034
34:03:43,272 --> 34:03:46,872
Codare Python. Deci, iată-ne. Să mergem

45035
34:03:45,120 --> 34:03:49,272
înainte și întoarce-te la Jupyter-ul nostru

45036
34:03:46,872 --> 34:03:52,400
caietul. Și deja am deschis un

45037
34:03:49,272 --> 34:03:53,912
pagină nouă pentru codul Python 3. Și doar sunt

45038
34:03:52,400 --> 34:03:55,272
voi lipi asta chiar acolo. Şi

45039
34:03:53,912 --> 34:03:57,192
hai sa aruncam o privire si sa vedem ce suntem

45040
34:03:55,272 --> 34:03:58,400
aducând în Python-ul nostru. Primul

45041
34:03:57,192 --> 34:04:02,720
Lucrul pe care îl vom face este de la

45042
34:03:58,400 --> 34:04:04,552
sklearn.data seturi import load iris. Acum,

45043
34:04:02,720 --> 34:04:06,960
acestea nu sunt datele reale. Deci asta este

45044
34:04:04,552 --> 34:04:09,680
doar modulul care ne permite să aducem

45045
34:04:06,960 --> 34:04:11,440
în date, irisul de încărcare. Și irisul

45046
34:04:09,680 --> 34:04:14,640
este atât de popular. Există de atunci

45047
34:04:11,440 --> 34:04:16,232
1936 când Ronald Fiser a publicat o lucrare

45048
34:04:14,640 --> 34:04:18,000
pe ea. Și măsoară

45049
34:04:16,232 --> 34:04:19,912
diferite părți ale florii. Și bazat

45050
34:04:18,000 --> 34:04:21,680
pe acele măsurători, prezicând ce

45051
34:04:19,912 --> 34:04:24,000
un fel de floare este. Și atunci dacă suntem

45052
34:04:21,680 --> 34:04:25,440
voi face un clasificator aleatoriu de pădure,

45053
34:04:24,000 --> 34:04:27,440
trebuie să mergem mai departe și să importam un aleatoriu

45054
34:04:25,440 --> 34:04:30,320
clasificator forestier din sklearn

45055
34:04:27,440 --> 34:04:32,480
modul. Deci sklearn.semble

45056
34:04:30,320 --> 34:04:33,760
importați clasificator de pădure aleatoriu. Şi

45057
34:04:32,480 --> 34:04:36,400
apoi vrem să aducem încă două

45058
34:04:33,760 --> 34:04:38,872
module. Hm, și acestea sunt probabil

45059
34:04:36,400 --> 34:04:42,080
cele mai frecvent utilizate module în Python și

45060
34:04:38,872 --> 34:04:43,760
știința datelor cu oricare dintre um, altele

45061
34:04:42,080 --> 34:04:45,040
modulele pe care le aducem. Și unul este

45062
34:04:43,760 --> 34:04:47,832
vor fi panda. Vom merge

45063
34:04:45,040 --> 34:04:50,232
import panda ca pd. PD este comuna

45064
34:04:47,832 --> 34:04:53,592
termen folosit pentru panda. Și panda este

45065
34:04:50,232 --> 34:04:56,160
practic creează un format de date pentru noi

45066
34:04:53,592 --> 34:04:58,080
unde atunci când creați date panda

45067
34:04:56,160 --> 34:05:00,000
cadru, arată ca un Excel

45068
34:04:58,080 --> 34:05:01,512
foaie de calcul. Și vei vedea asta într-un

45069
34:05:00,000 --> 34:05:03,272
minute când începem să săpăm mai adânc în

45070
34:05:01,512 --> 34:05:05,120
codul. Panda este pur și simplu minunat

45071
34:05:03,272 --> 34:05:06,720
pentru că se joacă frumos cu toate celelalte

45072
34:05:05,120 --> 34:05:09,512
module acolo. Și apoi avem

45073
34:05:06,720 --> 34:05:12,320
Numpy, care este numerele noastre Python. Şi

45074
34:05:09,512 --> 34:05:14,480
numerele pe care Python ne permite să le facem

45075
34:05:12,320 --> 34:05:16,000
diferite seturi matematice aici.

45076
34:05:14,480 --> 34:05:18,232
Vom vedea imediat, mergem

45077
34:05:16,000 --> 34:05:19,832
sa ne luam NP si mergem

45078
34:05:18,232 --> 34:05:22,640
înainte și să semăneze aleatorietatea cu ea

45079
34:05:19,832 --> 34:05:24,960
cu zero. Deci NP.sămânța aleatorie este însămânțarea

45080
34:05:22,640 --> 34:05:26,480
ca zero. Acest cod de fapt nu

45081
34:05:24,960 --> 34:05:28,080
arata orice. Vom merge înainte

45082
34:05:26,480 --> 34:05:29,680
și rulează-l pentru că trebuie să mă asigur că eu

45083
34:05:28,080 --> 34:05:31,760
au toate acestea încărcate. Și atunci haideți

45084
34:05:29,680 --> 34:05:34,872
aruncați o privire la următorul modul de aici.

45085
34:05:31,760 --> 34:05:36,640
Următoarele șase diapozitive, inclusiv aceasta,

45086
34:05:34,872 --> 34:05:38,232
sunt toate despre explorarea datelor.

45087
34:05:36,640 --> 34:05:40,232
Ține minte, ți-am spus că jumătate din asta este

45088
34:05:38,232 --> 34:05:42,232
despre a privi datele și a le obține

45089
34:05:40,232 --> 34:05:44,480
totul gata. Deci, hai să mergem înainte și să luăm

45090
34:05:42,232 --> 34:05:46,232
acest cod chiar aici, scriptul și

45091
34:05:44,480 --> 34:05:47,912
hai să introducem asta în Jupyter-ul nostru

45092
34:05:46,232 --> 34:05:51,440
caietul. Și iată-ne. Am plecat

45093
34:05:47,912 --> 34:05:54,160
înainte și rulați importurile. Acum sunt

45094
34:05:51,440 --> 34:05:55,592
voi lipi codul aici

45095
34:05:54,160 --> 34:05:57,592
și hai să aruncăm o privire și să vedem ce este

45096
34:05:55,592 --> 34:06:00,640
merge mai departe. Primul lucru pe care îl facem este

45097
34:05:57,592 --> 34:06:02,320
de fapt încărcăm datele irisului.

45098
34:06:00,640 --> 34:06:04,400
Și dacă vă amintiți aici, am încărcat

45099
34:06:02,320 --> 34:06:06,320
modulul care îi spune cum să obțină

45100
34:06:04,400 --> 34:06:08,960
datele irisului. Acum, de fapt, atribuim

45101
34:06:06,320 --> 34:06:11,120
acele date la irisul variabil. Și apoi

45102
34:06:08,960 --> 34:06:13,912
vom merge mai departe și vom folosi df

45103
34:06:11,120 --> 34:06:15,680
pentru a defini cadrul de date. Și asta merge

45104
34:06:13,912 --> 34:06:19,360
a egala pd. Și dacă îți amintești asta e

45105
34:06:15,680 --> 34:06:20,872
panda ca pd. Deci ăia sunt pandașii noștri și

45106
34:06:19,360 --> 34:06:24,080
panda dataf frame. Și atunci suntem

45107
34:06:20,872 --> 34:06:26,960
privind datele irisului și coloanele egale

45108
34:06:24,080 --> 34:06:29,192
numele caracteristicilor irisului. Și o să mergem

45109
34:06:26,960 --> 34:06:32,800
face capul DF. Și hai să rulăm asta așa

45110
34:06:29,192 --> 34:06:34,232
poți înțelege ce se întâmplă aici.

45111
34:06:32,800 --> 34:06:36,480
Primul lucru pe care vrei să-l observi este

45112
34:06:34,232 --> 34:06:39,040
că DF-ul nostru a creat ceea ce arată

45113
34:06:36,480 --> 34:06:40,720
ca o foaie de calcul Excel. Și în asta

45114
34:06:39,040 --> 34:06:42,800
Foaia de calcul Excel, am setat

45115
34:06:40,720 --> 34:06:45,040
coloane. Deci, sus, puteți vedea

45116
34:06:42,800 --> 34:06:47,680
cele patru coloane diferite. Și apoi noi

45117
34:06:45,040 --> 34:06:49,592
au datele iris.data de mai jos. Este

45118
34:06:47,680 --> 34:06:51,592
putin confuz fara sa stiu unde

45119
34:06:49,592 --> 34:06:53,832
aceste date provin de la. Deci haideti sa ne uitam

45120
34:06:51,592 --> 34:06:55,592
la imaginea de ansamblu și mă duc

45121
34:06:53,832 --> 34:06:57,360
du-te la imprimare. Am de gând să schimb asta

45122
34:06:55,592 --> 34:06:59,440
pentru o clipă și vom tipări

45123
34:06:57,360 --> 34:07:02,480
toată Iris și vezi cum arată

45124
34:06:59,440 --> 34:07:05,440
ca. Așa că când imprim tot Iris, primesc

45125
34:07:02,480 --> 34:07:07,440
această lungă listă de informații. Iar tu

45126
34:07:05,440 --> 34:07:10,000
puteți derula aici și puteți vedea toate

45127
34:07:07,440 --> 34:07:11,832
diferite titluri acolo. Ce este

45128
34:07:10,000 --> 34:07:13,592
important de observat este că în primul rând

45129
34:07:11,832 --> 34:07:16,160
există paranteze la început. Deci

45130
34:07:13,592 --> 34:07:19,760
acesta este un dicționar Python

45131
34:07:16,160 --> 34:07:23,120
iar într-un dicționar Python veți avea un

45132
34:07:19,760 --> 34:07:25,512
cheie sau o etichetă și această etichetă apare în sus

45133
34:07:23,120 --> 34:07:27,592
orice informație vine după ea. Deci

45134
34:07:25,512 --> 34:07:30,232
nume de caracteristici pe care le-am folosit de fapt

45135
34:07:27,592 --> 34:07:32,872
aici sub coloane este egal cu an

45136
34:07:30,232 --> 34:07:34,960
matrice de sele lungime sele lățime pedală

45137
34:07:32,872 --> 34:07:36,720
lungime lățimea pedalei. Acestea sunt

45138
34:07:34,960 --> 34:07:38,400
nume diferite pe care le au pentru cei patru

45139
34:07:36,720 --> 34:07:40,640
coloane diferite. Și dacă defilezi

45140
34:07:38,400 --> 34:07:42,480
suficient de jos veți vedea și date

45141
34:07:40,640 --> 34:07:44,720
aici jos. Doamne, a venit corect

45142
34:07:42,480 --> 34:07:47,440
spre vârf. Și datele sunt egale cu

45143
34:07:44,720 --> 34:07:48,872
diferitele date pe care le analizăm.

45144
34:07:47,440 --> 34:07:50,320
Acum, sunt multe alte lucruri înăuntru

45145
34:07:48,872 --> 34:07:51,832
aici ca țintă. Vom fi

45146
34:07:50,320 --> 34:07:54,160
trăgând asta într-un minut. Și există

45147
34:07:51,832 --> 34:07:55,912
de asemenea, numele uh numele țintă care

45148
34:07:54,160 --> 34:07:57,832
este mai jos. Și îți vom arăta asta

45149
34:07:55,912 --> 34:08:01,760
tot într-un minut. Hai să mergem înainte și să stabilim

45150
34:07:57,832 --> 34:08:04,872
că înapoi la cap. Și acesta este unul

45151
34:08:01,760 --> 34:08:08,640
a trăsăturilor îngrijite ale panda și panda

45152
34:08:04,872 --> 34:08:11,680
Dataf frames este atunci când faceți df.ad sau the

45153
34:08:08,640 --> 34:08:14,872
panda dataf frame. cap. Acesta va imprima

45154
34:08:11,680 --> 34:08:16,872
primele cinci rânduri ale setului de date în

45155
34:08:14,872 --> 34:08:18,160
acolo împreună cu anteturile dacă aveți

45156
34:08:16,872 --> 34:08:20,232
ei. În acest caz, avem coloana

45157
34:08:18,160 --> 34:08:24,320
antete setate la caracteristici iris. Și în

45158
34:08:20,232 --> 34:08:26,960
aici, veți vedea că avem 0 1 2 3 4.

45159
34:08:24,320 --> 34:08:28,480
În Python, majoritatea tablourilor încep întotdeauna la

45160
34:08:26,960 --> 34:08:31,360
zero. Deci, când te uiți la primul

45161
34:08:28,480 --> 34:08:34,232
cinci, va fi 0 1 2 3 4, nu 1

45162
34:08:31,360 --> 34:08:36,640
2 3 4 5. Deci, acum avem datele noastre despre iris

45163
34:08:34,232 --> 34:08:38,320
importate într-un cadru de date. Să luăm o

45164
34:08:36,640 --> 34:08:41,912
uită-te la următoarea bucată de cod aici.

45165
34:08:38,320 --> 34:08:43,592
Și astfel, în această secțiune de aici a codului,

45166
34:08:41,912 --> 34:08:45,440
vom arunca o privire la

45167
34:08:43,592 --> 34:08:47,272
tinta. Și hai să mergem mai departe și să obținem asta

45168
34:08:45,440 --> 34:08:48,720
în caietul nostru, această bucată de cod,

45169
34:08:47,272 --> 34:08:51,192
ca să putem discuta un pic mai mult

45170
34:08:48,720 --> 34:08:52,720
în detaliu. Deci iată-ne în Jupyter-ul nostru

45171
34:08:51,192 --> 34:08:55,272
caietul. Am de gând să pun codul

45172
34:08:52,720 --> 34:08:57,440
aici. Și înainte de a o alerga, vreau

45173
34:08:55,272 --> 34:09:00,800
uită-te la câteva lucruri care se întâmplă. Deci noi

45174
34:08:57,440 --> 34:09:02,080
au specii DF. Și aceasta este

45175
34:09:00,800 --> 34:09:05,120
interesant pentru că chiar aici vei

45176
34:09:02,080 --> 34:09:07,512
vezi unde am specii de DF între paranteze

45177
34:09:05,120 --> 34:09:09,680
care este codul cheie pentru creare

45178
34:09:07,512 --> 34:09:11,440
altă coloană. Și aici avem

45179
34:09:09,680 --> 34:09:13,680
iris.tinta.

45180
34:09:11,440 --> 34:09:16,640
Acum acestea sunt ambele în configurația panda

45181
34:09:13,680 --> 34:09:18,800
pe aici. Deci în panda putem face oricare

45182
34:09:16,640 --> 34:09:21,912
unul. Aș fi putut face la fel de ușor

45183
34:09:18,800 --> 34:09:23,912
iris și apoi între paranteze ținta

45184
34:09:21,912 --> 34:09:26,480
in functie de ce lucrez. ambele

45185
34:09:23,912 --> 34:09:28,800
sunt acceptabile. Să mergem înainte și

45186
34:09:26,480 --> 34:09:30,552
rulați acest cod și vedeți cum se schimbă.

45187
34:09:28,800 --> 34:09:33,680
Și ceea ce am făcut este că am adăugat

45188
34:09:30,552 --> 34:09:36,232
țintă din setul de date iris ca altul

45189
34:09:33,680 --> 34:09:38,480
coloană de la capăt.

45190
34:09:36,232 --> 34:09:40,872
Acum ce specie este aceasta este ceea ce suntem

45191
34:09:38,480 --> 34:09:42,872
încercând să prezică. Deci avem datele noastre

45192
34:09:40,872 --> 34:09:44,720
care ne spune răspunsul pentru toate acestea

45193
34:09:42,872 --> 34:09:46,400
piese diferite. Și apoi am adăugat un

45194
34:09:44,720 --> 34:09:48,720
coloana cu răspunsul. Deci așa când

45195
34:09:46,400 --> 34:09:50,800
facem configurarea finală, vom avea

45196
34:09:48,720 --> 34:09:52,552
capacitatea de a ne programa neuronale

45197
34:09:50,800 --> 34:09:55,760
rețea să le caute atât de diferite

45198
34:09:52,552 --> 34:09:57,192
date și știu ce este o satossa sau a

45199
34:09:55,760 --> 34:09:59,040
veraricolor pe care îl vom vedea doar în a

45200
34:09:57,192 --> 34:10:00,320
minute sau virginica. Acestea sunt cele trei

45201
34:09:59,040 --> 34:10:03,592
care sunt acolo. Și acum mergem

45202
34:10:00,320 --> 34:10:05,272
pentru a adăuga încă o coloană. Știu că suntem

45203
34:10:03,592 --> 34:10:07,040
organizând toate aceste date iar și iar

45204
34:10:05,272 --> 34:10:09,040
din nou. E cam distractiv. Sunt multe

45205
34:10:07,040 --> 34:10:12,232
a modalităților de organizare. Ce e frumos

45206
34:10:09,040 --> 34:10:15,040
despre a pune totul într-o singură dată

45207
34:10:12,232 --> 34:10:16,800
cadru este, apoi pot face o imprimare și

45208
34:10:15,040 --> 34:10:18,552
îmi arată exact la ce mă uit.

45209
34:10:16,800 --> 34:10:20,160
Și îți voi arăta unde ești

45210
34:10:18,552 --> 34:10:22,000
diferit unde poți modifica asta și

45211
34:10:20,160 --> 34:10:24,872
fă-o ușor diferit. Dar să mergem

45212
34:10:22,000 --> 34:10:26,872
înainte și puneți asta în scenariul nostru până la

45213
34:10:24,872 --> 34:10:29,680
acum. Și iată-ne. O să punem

45214
34:10:26,872 --> 34:10:32,160
asta aici jos și o să alergăm

45215
34:10:29,680 --> 34:10:34,080
că. Și hai să vorbim puțin despre

45216
34:10:32,160 --> 34:10:37,272
ce facem. Acum explorăm

45217
34:10:34,080 --> 34:10:40,000
date. Și una dintre provocări este

45218
34:10:37,272 --> 34:10:42,640
știind cât de bun este modelul tău. Ai făcut-o

45219
34:10:40,000 --> 34:10:44,720
lucru model? Și pentru a face asta, trebuie

45220
34:10:42,640 --> 34:10:46,320
împărțiți datele. Și l-am împărțit în două

45221
34:10:44,720 --> 34:10:48,720
diferite părți. De obicei o numesc

45222
34:10:46,320 --> 34:10:50,400
antrenamentul și testarea. Și așa în

45223
34:10:48,720 --> 34:10:52,480
aici, vom merge înainte și vom pune

45224
34:10:50,400 --> 34:10:55,192
asta în baza noastră de date, astfel încât să îl puteți vedea

45225
34:10:52,480 --> 34:10:56,552
în mod clar. Și l-am setat df. Şi

45226
34:10:55,192 --> 34:10:58,552
amintiți-vă, puteți pune paranteze. Aceasta este

45227
34:10:56,552 --> 34:10:59,592
creând o altă coloană. Este tren. Deci

45228
34:10:58,552 --> 34:11:01,832
vom folosi o parte din ea pentru

45229
34:10:59,592 --> 34:11:04,872
antrenament. Și aceasta este egală cu np. Ține minte

45230
34:11:01,832 --> 34:11:07,120
care înseamnă numpy.random.uniform.

45231
34:11:04,872 --> 34:11:09,272
Deci generăm un număr aleatoriu

45232
34:11:07,120 --> 34:11:12,160
intre zero si unu. Și o să mergem

45233
34:11:09,272 --> 34:11:14,480
faceți-o pentru fiecare dintre rânduri. Acolo

45234
34:11:12,160 --> 34:11:16,480
lungimea df provine. Deci fiecare rând

45235
34:11:14,480 --> 34:11:19,832
primește un număr generat. Și dacă este

45236
34:11:16,480 --> 34:11:22,720
mai putin de 75, e adevarat. Și dacă este

45237
34:11:19,832 --> 34:11:26,160
mai mare de 75, este fals. Aceasta înseamnă

45238
34:11:22,720 --> 34:11:27,760
vom lua 75% din date

45239
34:11:26,160 --> 34:11:29,512
aproximativ pentru că există o aleatorie

45240
34:11:27,760 --> 34:11:32,160
implicat. Și o să folosim asta pentru

45241
34:11:29,512 --> 34:11:33,832
antrenează-l. Și apoi ceilalți 25% suntem

45242
34:11:32,160 --> 34:11:36,000
urmând să țină în lateral și să folosești

45243
34:11:33,832 --> 34:11:37,592
asta pentru a-l testa mai tarziu. Așa că hai să întoarcem

45244
34:11:36,000 --> 34:11:39,760
înapoi și vezi care este pasul următor

45245
34:11:37,592 --> 34:11:41,680
este. Deci acum că ne-am etichetat noastre

45246
34:11:39,760 --> 34:11:44,160
baza de date pentru care este formarea si care

45247
34:11:41,680 --> 34:11:46,960
se testează, hai să mergem mai departe și să rezolvăm asta

45248
34:11:44,160 --> 34:11:48,872
în două variabile diferite, tren și

45249
34:11:46,960 --> 34:11:50,960
test. Și să luăm acest cod și să luăm

45250
34:11:48,872 --> 34:11:53,192
aduceți-l în proiectul nostru. Și aici noi

45251
34:11:50,960 --> 34:11:55,592
du-te. Hai să-l lipim aici jos. Şi

45252
34:11:53,192 --> 34:11:58,000
înainte de a rula asta, să luăm doar un

45253
34:11:55,592 --> 34:12:00,320
Uită-te rapid la ce se întâmplă aici. este

45254
34:11:58,000 --> 34:12:02,320
avem sus, am creat amintiți-vă

45255
34:12:00,320 --> 34:12:04,232
acolo este capul nostru def care imprimă

45256
34:12:02,320 --> 34:12:06,320
primele cinci rânduri și am adăugat o coloană

45257
34:12:04,232 --> 34:12:07,832
este trenul la sfârșit și așa mergem

45258
34:12:06,320 --> 34:12:09,760
să luăm că vom crea două

45259
34:12:07,832 --> 34:12:12,872
variabile vom crea două noi

45260
34:12:09,760 --> 34:12:18,080
cadrele de date se numesc trenul

45261
34:12:12,872 --> 34:12:21,360
numit test 75% în tren 25% în test și

45262
34:12:18,080 --> 34:12:24,400
apoi să rezolvăm asta o să facem

45263
34:12:21,360 --> 34:12:27,360
că făcând df principalele noastre date originale

45264
34:12:24,400 --> 34:12:30,480
cadru cu datele irisului în el și dacă df

45265
34:12:27,360 --> 34:12:32,640
F este trenul egal cu adevărat, asta va fi

45266
34:12:30,480 --> 34:12:35,120
mergi in tren. Și dacă DF este tren

45267
34:12:32,640 --> 34:12:37,592
este egal cu fals, merge în test. Şi

45268
34:12:35,120 --> 34:12:39,592
deci când voi rula asta, vom tipări

45269
34:12:37,592 --> 34:12:41,040
scoateți numărul din fiecare. Să vedem

45270
34:12:39,592 --> 34:12:43,760
cum arată. Și vei vedea

45271
34:12:41,040 --> 34:12:46,160
că pune 118 în modulul de instruire

45272
34:12:43,760 --> 34:12:48,320
și pune 32 în modulul de testare,

45273
34:12:46,160 --> 34:12:49,912
ceea ce ne face să știm că au fost 150

45274
34:12:48,320 --> 34:12:51,272
linii de date aici. Deci dacă te-ai dus

45275
34:12:49,912 --> 34:12:53,272
și te-am uitat la datele originale, tu

45276
34:12:51,272 --> 34:12:56,480
am putut vedea că sunt 150 de linii și

45277
34:12:53,272 --> 34:12:59,512
asta înseamnă aproximativ 75% într-unul și 25% pentru noi

45278
34:12:56,480 --> 34:13:01,192
pentru a testa modelul nostru după aceea. Deci haideți

45279
34:12:59,512 --> 34:13:04,480
reveniți la codul nostru și vedeți unde este

45280
34:13:01,192 --> 34:13:06,400
merge. În următorii doi pași, vrem

45281
34:13:04,480 --> 34:13:09,272
mai faceți ceva cu datele noastre și

45282
34:13:06,400 --> 34:13:10,720
asta îl face ușor de citit pentru oameni. Hm, eu

45283
34:13:09,272 --> 34:13:14,232
Nu știu despre tine, dar urăsc să caut

45284
34:13:10,720 --> 34:13:17,760
la zerouri și unu. Deci, să începem cu

45285
34:13:14,232 --> 34:13:19,832
caracteristicile și hai să mergem înainte și să luăm

45286
34:13:17,760 --> 34:13:23,192
acelea și să le facă lizibile pentru oameni

45287
34:13:19,832 --> 34:13:25,512
și să punem asta în codul nostru.

45288
34:13:23,192 --> 34:13:28,400
Să vedem. Începem. Lipiți-l. Și

45289
34:13:25,512 --> 34:13:31,832
veți vedea aici că am făcut câteva foarte multe

45290
34:13:28,400 --> 34:13:33,680
lucruri de bază. Știm că coloanele

45291
34:13:31,832 --> 34:13:37,360
în cadrul nostru de date, din nou, acesta este un

45292
34:13:33,680 --> 34:13:40,552
chestia cu panda, coloanele DF, și știm

45293
34:13:37,360 --> 34:13:42,552
primii patru dintre ei, 01, 2, 3, asta-i

45294
34:13:40,552 --> 34:13:44,552
fii primii patru vor fi

45295
34:13:42,552 --> 34:13:47,440
caracteristicile sau titlurile acelor coloane.

45296
34:13:44,552 --> 34:13:49,592
Și atunci când voi rula asta, vei vedea în jos

45297
34:13:47,440 --> 34:13:51,760
iată că creează un index, mare

45298
34:13:49,592 --> 34:13:53,760
lungime, lățimea mării, lungimea pedalei și

45299
34:13:51,760 --> 34:13:55,192
latimea pedalei. Și asta ar trebui să fie familiar

45300
34:13:53,760 --> 34:13:57,040
pentru că dacă te uiți aici sus, iată-l pe al nostru

45301
34:13:55,192 --> 34:13:59,912
titlurile coloanelor care trec peste. Și iată

45302
34:13:57,040 --> 34:14:02,000
primii patru. Un lucru vreau să faci

45303
34:13:59,912 --> 34:14:03,512
observați că atunci când vă aflați într-o

45304
34:14:02,000 --> 34:14:05,592
linie de comandă, fie că este vorba despre Jupyter

45305
34:14:03,512 --> 34:14:08,320
notebook sau rulați linia de comandă

45306
34:14:05,592 --> 34:14:10,480
în fereastra terminalului, dacă vrei

45307
34:14:08,320 --> 34:14:13,760
pune-i numele, îl va tipări.

45308
34:14:10,480 --> 34:14:15,512
Acest lucru este la fel ca și imprimarea

45309
34:14:13,760 --> 34:14:17,120
caracteristici.

45310
34:14:15,512 --> 34:14:19,360
Iar scurtul este pe care tocmai l-ai pus

45311
34:14:17,120 --> 34:14:22,552
caracteristici aici. Dacă chiar ești

45312
34:14:19,360 --> 34:14:24,480
scrierea unui cod și salvarea scriptului și

45313
34:14:22,552 --> 34:14:26,480
rulând-o de la distanță, chiar trebuie

45314
34:14:24,480 --> 34:14:27,680
pune amprenta acolo. Dar pentru asta,

45315
34:14:26,480 --> 34:14:30,000
când îl voi rula, o să vezi că îmi dă

45316
34:14:27,680 --> 34:14:31,680
acelasi lucru.

45317
34:14:30,000 --> 34:14:33,272
Dar pentru asta, vrem să mergem înainte și

45318
34:14:31,680 --> 34:14:34,960
îl vom lăsa doar ca caracteristici pentru că

45319
34:14:33,272 --> 34:14:36,320
chiar nu contează. Și aceasta este

45320
34:14:34,960 --> 34:14:37,912
unul dintre lucrurile distractive despre Jupyter

45321
34:14:36,320 --> 34:14:39,680
Notebooks este doar construiesc codul

45322
34:14:37,912 --> 34:14:41,040
pe măsură ce mergem. Și atunci trebuie să mergem înainte

45323
34:14:39,680 --> 34:14:42,480
și creați etichetele pentru celălalt

45324
34:14:41,040 --> 34:14:45,120
parte. Deci, hai să aruncăm o privire și să vedem ce

45325
34:14:42,480 --> 34:14:47,120
că pentru. Ultimul pas în pregătirea noastră

45326
34:14:45,120 --> 34:14:49,360
date înainte de a începe efectiv să rulăm

45327
34:14:47,120 --> 34:14:51,440
antrenamentul și testarea sunt noi

45328
34:14:49,360 --> 34:14:53,832
va merge mai departe și va converti

45329
34:14:51,440 --> 34:14:56,000
speciile de aici în ceva

45330
34:14:53,832 --> 34:14:58,232
computerul înțelege. Deci, să punem asta

45331
34:14:56,000 --> 34:15:00,800
codificați în scriptul nostru și vedeți unde

45332
34:14:58,232 --> 34:15:02,872
ne ia.

45333
34:15:00,800 --> 34:15:05,912
Bine, aici mergem. V-am stabilit egal

45334
34:15:02,872 --> 34:15:09,680
a pd.factoriza

45335
34:15:05,912 --> 34:15:11,440
antrenează specii de zero. Deci, haideți să ne despărțim

45336
34:15:09,680 --> 34:15:14,720
asta jos doar un pic. Avem al nostru

45337
34:15:11,440 --> 34:15:16,160
panda chiar aici. PD factorizați. Ce

45338
34:15:14,720 --> 34:15:18,400
se face factorizat? am de gând să vin

45339
34:15:16,160 --> 34:15:21,440
înapoi la asta în doar o secundă. Să

45340
34:15:18,400 --> 34:15:23,832
uită-te la ce specie de tren este și de ce

45341
34:15:21,440 --> 34:15:26,960
ne uităm la grupul zero

45342
34:15:23,832 --> 34:15:29,360
acolo. Și hai să mergem aici sus. Și iată

45343
34:15:26,960 --> 34:15:30,960
specia noastră.

45344
34:15:29,360 --> 34:15:33,592
Îți amintești asta despre asta? Noi am creat asta

45345
34:15:30,960 --> 34:15:35,680
toată coloana aici pentru specii. Și apoi

45346
34:15:33,592 --> 34:15:37,192
are satossa, satossa, satossa,

45347
34:15:35,680 --> 34:15:39,360
satossa. Și dacă derulați suficient în jos,

45348
34:15:37,192 --> 34:15:41,040
ai vedea si virginica si

45349
34:15:39,360 --> 34:15:42,640
veraricolor.

45350
34:15:41,040 --> 34:15:44,552
Trebuie să transformăm asta în ceva

45351
34:15:42,640 --> 34:15:48,872
computerul înțelege. Zerourile și

45352
34:15:44,552 --> 34:15:51,120
cele. Deci specia trenului de zero

45353
34:15:48,872 --> 34:15:53,272
deoarece aceasta este în formatul a din an

45354
34:15:51,120 --> 34:15:55,912
matrice de matrice. Deci trebuie să ai

45355
34:15:53,272 --> 34:15:58,640
zero la capăt. Și apoi specia este

45356
34:15:55,912 --> 34:16:00,640
doar acea coloană. Intră factorizarea

45357
34:15:58,640 --> 34:16:02,720
acolo și se uită la faptul că există

45358
34:16:00,640 --> 34:16:05,680
doar trei dintre ei. Deci, când rulez asta,

45359
34:16:02,720 --> 34:16:07,680
veți vedea că Y generează o matrice

45360
34:16:05,680 --> 34:16:10,400
asta este egal cu, în acest caz, este

45361
34:16:07,680 --> 34:16:12,232
set de antrenament și este zerouri, unu și

45362
34:16:10,400 --> 34:16:14,960
doi reprezentând cei trei diferiți

45363
34:16:12,232 --> 34:16:16,720
feluri de flori pe care le avem. Deci acum avem

45364
34:16:14,960 --> 34:16:18,720
ceva ce computerul înțelege și

45365
34:16:16,720 --> 34:16:21,512
avem o masă frumoasă pe care o putem citi

45366
34:16:18,720 --> 34:16:23,592
si intelege. Și acum ajungem în sfârșit

45367
34:16:21,512 --> 34:16:27,272
pentru a începe efectiv să predici.

45368
34:16:23,592 --> 34:16:29,040
Deci iată-ne. Avem două rânduri de

45369
34:16:27,272 --> 34:16:31,120
cod. Doamne, asta a fost mult

45370
34:16:29,040 --> 34:16:33,040
lucrează pentru a ajunge la două linii de cod. Dar

45371
34:16:31,120 --> 34:16:34,800
sunt multe în aceste două rânduri de

45372
34:16:33,040 --> 34:16:36,960
cod. Deci haideți să aruncăm o privire și să vedem

45373
34:16:34,800 --> 34:16:39,592
ce se întâmplă aici și pune asta în asta

45374
34:16:36,960 --> 34:16:41,760
scriptul nostru complet pe care îl rulăm. Şi

45375
34:16:39,592 --> 34:16:44,080
hai să lipim asta aici. Și să luăm

45376
34:16:41,760 --> 34:16:46,800
uita-te si vezi ce este asta. Avem

45377
34:16:44,080 --> 34:16:48,640
creăm un CLF variabil. Și suntem

45378
34:16:46,800 --> 34:16:51,360
urmând a seta acest lucru egal cu aleatoriu

45379
34:16:48,640 --> 34:16:52,960
clasificator forestier. Și trecem de doi

45380
34:16:51,360 --> 34:16:55,120
variabile aici. Și sunt multe

45381
34:16:52,960 --> 34:16:56,552
variabile cu care te poți juca. În măsura în care

45382
34:16:55,120 --> 34:16:59,760
aceşti doi sunt îngrijoraţi, sunt foarte

45383
34:16:56,552 --> 34:17:01,592
standard. În locuri de muncă, tot ceea ce face este să

45384
34:16:59,760 --> 34:17:03,360
prioritizează-l. Nu ceva cu adevărat

45385
34:17:01,592 --> 34:17:05,040
îngrijorează-te. De obicei, când faci

45386
34:17:03,360 --> 34:17:07,120
asta pe propriul tău computer, termină

45387
34:17:05,040 --> 34:17:09,440
locuri de muncă este egală cu 2. Dacă lucrați într-o

45388
34:17:07,120 --> 34:17:11,192
date mai mari sau mari și trebuie

45389
34:17:09,440 --> 34:17:12,960
prioritizează-l altfel, asta este

45390
34:17:11,192 --> 34:17:14,400
acel număr este că vă schimbă

45391
34:17:12,960 --> 34:17:16,320
priorități și cum va funcționa

45392
34:17:14,400 --> 34:17:18,080
în întregul sistem și lucruri de genul ăsta.

45393
34:17:16,320 --> 34:17:21,912
Și atunci starea aleatorie este exact așa

45394
34:17:18,080 --> 34:17:24,960
începe. Zero este bine pentru aici.

45395
34:17:21,912 --> 34:17:29,592
Dar hai să mergem mai departe și să rulăm asta.

45396
34:17:24,960 --> 34:17:31,592
Avem și funcții de tren clf.fit, y.

45397
34:17:29,592 --> 34:17:35,272
Și înainte de a-l rula, hai să vorbim despre

45398
34:17:31,592 --> 34:17:37,592
asta un pic mai mult. CLF.fit.

45399
34:17:35,272 --> 34:17:40,640
Deci, ne potrivim, îl antrenăm. Noi

45400
34:17:37,592 --> 34:17:43,040
de fapt ne creează pădurea aleatorie

45401
34:17:40,640 --> 34:17:44,552
clasificator chiar aici. Acesta este codul

45402
34:17:43,040 --> 34:17:46,400
asta face totul. Și o să mergem

45403
34:17:44,552 --> 34:17:48,080
luați setul nostru de antrenament. Ține minte, am păstrat

45404
34:17:46,400 --> 34:17:50,000
testul nostru plecat în lateral. Și suntem

45405
34:17:48,080 --> 34:17:51,592
vom lua setul nostru de antrenament cu

45406
34:17:50,000 --> 34:17:53,912
caracteristici. Și apoi vom merge

45407
34:17:51,592 --> 34:17:57,360
înainte și pune asta înăuntru. Și iată-l pe al nostru

45408
34:17:53,912 --> 34:17:59,592
țintă, Y. Deci, Y este 0, 1 și

45409
34:17:57,360 --> 34:18:02,232
două pe care tocmai le-am creat. Iar cel

45410
34:17:59,592 --> 34:18:04,480
caracteristicile sunt datele reale care intră

45411
34:18:02,232 --> 34:18:07,192
pe care le punem în setul de antrenament. Şi

45412
34:18:04,480 --> 34:18:08,872
hai să mergem înainte și să rulăm asta.

45413
34:18:07,192 --> 34:18:11,440
Și acesta este un lucru destul de interesant

45414
34:18:08,872 --> 34:18:13,440
pentru că a imprimat forța aleatorie

45415
34:18:11,440 --> 34:18:16,320
clasificator

45416
34:18:13,440 --> 34:18:18,080
și tot ce este în jur. Și așa când

45417
34:18:16,320 --> 34:18:20,640
rulezi asta în terminalul tău

45418
34:18:18,080 --> 34:18:22,320
fereastră sau într-un script ca acesta, acesta

45419
34:18:20,640 --> 34:18:24,800
tratează automat asta ca și cum

45420
34:18:22,320 --> 34:18:27,592
când eram aici sus și am tastat y

45421
34:18:24,800 --> 34:18:29,912
și a tipărit y în loc de a tipări y.

45422
34:18:27,592 --> 34:18:32,080
Aceasta face același lucru. Se tratează asta

45423
34:18:29,912 --> 34:18:33,592
ca variabilă și o imprimă. Dar dacă

45424
34:18:32,080 --> 34:18:35,512
de fapt rulați codul dvs.,

45425
34:18:33,592 --> 34:18:37,912
nu ar fi cazul. Și ce este

45426
34:18:35,512 --> 34:18:40,080
imprimat este ne arată toate

45427
34:18:37,912 --> 34:18:41,680
diferite variabile pe care le putem schimba. Şi

45428
34:18:40,080 --> 34:18:44,800
dacă mergem aici, chiar poți vedea

45429
34:18:41,680 --> 34:18:46,232
în locuri de muncă este egal cu 2. Puteți vedea aleatoriu

45430
34:18:44,800 --> 34:18:47,912
starea este egală cu zero. Acestea sunt cele două

45431
34:18:46,232 --> 34:18:50,800
pe care le-am trimis acolo. Chiar ai vrea

45432
34:18:47,912 --> 34:18:51,912
trebuie să sapă adânc pentru a afla toate acestea

45433
34:18:50,800 --> 34:18:53,680
sensuri diferite ale tuturor acestora

45434
34:18:51,912 --> 34:18:55,192
setări diferite aici. Unii dintre ei

45435
34:18:53,680 --> 34:18:56,640
se explică de la sine dacă vreți

45436
34:18:55,192 --> 34:18:58,640
gandeste-te putin la asta. Ca max

45437
34:18:56,640 --> 34:19:00,160
caracteristicile este automată. Deci toate caracteristicile

45438
34:18:58,640 --> 34:19:02,080
pe care îl punem acolo, doar

45439
34:19:00,160 --> 34:19:03,912
urmând să ia automat toate cele patru din

45440
34:19:02,080 --> 34:19:05,760
ei. Orice am trimite, va dura.

45441
34:19:03,912 --> 34:19:07,592
Unele dintre ele ar putea avea atât de multe caracteristici

45442
34:19:05,760 --> 34:19:10,320
pentru că procesezi cuvinte. Acolo

45443
34:19:07,592 --> 34:19:11,512
ar putea fi ca 1,4 milioane de funcții în

45444
34:19:10,320 --> 34:19:12,872
acolo pentru că faci legalitate

45445
34:19:11,512 --> 34:19:14,552
documente și atât de multe diferite

45446
34:19:12,872 --> 34:19:16,080
cuvintele sunt acolo. În acel moment, tu

45447
34:19:14,552 --> 34:19:17,832
probabil doriți să limitați maximul

45448
34:19:16,080 --> 34:19:19,680
caracteristici pe care urmează să le procesați.

45449
34:19:17,832 --> 34:19:20,960
Și nodurile frunzelor, acestea sunt nodurile finale.

45450
34:19:19,680 --> 34:19:22,552
Ține minte, am avut fructele și suntem

45451
34:19:20,960 --> 34:19:24,160
vorbind despre nodurile frunzelor. Ca si eu

45452
34:19:22,552 --> 34:19:25,912
a spus, sunt multe în asta. Suntem

45453
34:19:24,160 --> 34:19:27,440
uitându-mă la o mulțime de lucruri aici. Deci tu

45454
34:19:25,912 --> 34:19:29,120
s-ar putea să existe în acest caz

45455
34:19:27,440 --> 34:19:31,272
probabil cred că doar trei noduri frunze,

45456
34:19:29,120 --> 34:19:32,960
poate patru. S-ar putea să ai mii de

45457
34:19:31,272 --> 34:19:34,480
noduri de frunze, moment în care trebuie

45458
34:19:32,960 --> 34:19:35,912
pune un capac pe asta și spune: „Bine, tu

45459
34:19:34,480 --> 34:19:37,360
nu putem merge decât atât de departe și apoi mergem

45460
34:19:35,912 --> 34:19:39,760
pentru a folosi toate resursele noastre

45461
34:19:37,360 --> 34:19:42,552
procesează asta.” Și asta chiar este

45462
34:19:39,760 --> 34:19:45,192
cele mai multe dintre acestea sunt despre limitare

45463
34:19:42,552 --> 34:19:47,040
procesul și să ne asigurăm că nu facem uh

45464
34:19:45,192 --> 34:19:48,800
copleși un sistem. Și sunt câteva

45465
34:19:47,040 --> 34:19:50,480
alte setări aici. Din nou, nu suntem

45466
34:19:48,800 --> 34:19:52,480
urmând să le trec peste toate. Început cald

45467
34:19:50,480 --> 34:19:54,320
este egal cu fals. sau începe ca și cum ai fi

45468
34:19:52,480 --> 34:19:56,640
programându-l pe rând

45469
34:19:54,320 --> 34:19:58,000
extern, din moment ce nu suntem, nu suntem

45470
34:19:56,640 --> 34:19:59,912
va avea de parcă nu vom avea

45471
34:19:58,000 --> 34:20:01,512
să antrenez continuu acest particular

45472
34:19:59,912 --> 34:20:02,552
copac de învățare și din nou așa cum am spus

45473
34:20:01,512 --> 34:20:04,400
sunt multe lucruri aici înăuntru care

45474
34:20:02,552 --> 34:20:07,272
veți dori să căutați mai multe detalii din

45475
34:20:04,400 --> 34:20:09,272
sklearn-ul și dacă săpiți

45476
34:20:07,272 --> 34:20:11,440
profund și derulează un proiect major aici

45477
34:20:09,272 --> 34:20:13,832
pentru astăzi, deși tot ce trebuie să facem este

45478
34:20:11,440 --> 34:20:16,800
potrivi sau antrena caracteristicile noastre și ținta noastră

45479
34:20:13,832 --> 34:20:18,960
Y. Deci acum avem modelul nostru de antrenament.

45480
34:20:16,800 --> 34:20:20,720
Ce urmează? Dacă vom crea un

45481
34:20:18,960 --> 34:20:23,120
model,

45482
34:20:20,720 --> 34:20:27,120
acum trebuie să-l testăm. Amintiți-vă, am stabilit

45483
34:20:23,120 --> 34:20:28,872
în afară de caracteristicile de testare, grup de testare, 25%

45484
34:20:27,120 --> 34:20:31,360
a datelor. Deci hai să mergem înainte și să luăm

45485
34:20:28,872 --> 34:20:33,360
acest cod și să-l punem în uh

45486
34:20:31,360 --> 34:20:35,760
scenariu și vedeți cum arată.

45487
34:20:33,360 --> 34:20:38,080
Bine, aici mergem. Și o să alergăm

45488
34:20:35,760 --> 34:20:39,832
aceasta.

45489
34:20:38,080 --> 34:20:42,080
Și va ieși cu o grămadă

45490
34:20:39,832 --> 34:20:44,000
de zerouri, unu și doi, care

45491
34:20:42,080 --> 34:20:45,832
reprezintă cele trei tipuri de flori,

45492
34:20:44,000 --> 34:20:47,760
satossa, virginica și

45493
34:20:45,832 --> 34:20:51,272
versa culoare. Și în ce punem noi

45494
34:20:47,760 --> 34:20:53,512
predicția noastră este caracteristicile de testare. si eu

45495
34:20:51,272 --> 34:20:56,232
întotdeauna îmi place să știu ce sunt eu

45496
34:20:53,512 --> 34:20:58,640
ma uit la. Deci, foarte repede, suntem

45497
34:20:56,232 --> 34:21:01,040
o sa fac test

45498
34:20:58,640 --> 34:21:03,360
caracteristici. Și amintiți-vă, caracteristicile este o

45499
34:21:01,040 --> 34:21:05,440
matrice

45500
34:21:03,360 --> 34:21:07,360
de sele

45501
34:21:05,440 --> 34:21:09,592
lățime, lungime pedală, lățime pedală. Deci

45502
34:21:07,360 --> 34:21:11,512
când o punem în acest fel, de fapt

45503
34:21:09,592 --> 34:21:13,760
încarcă toate aceste coloane diferite care

45504
34:21:11,512 --> 34:21:15,592
ne-am încărcat în funcții. Deci dacă am făcut-o

45505
34:21:13,760 --> 34:21:16,800
doar caracteristici, lasă-mă să fac doar funcții

45506
34:21:15,592 --> 34:21:18,960
aici, astfel încât să puteți vedea ce caracteristici

45507
34:21:16,800 --> 34:21:21,592
arata ca. Este doar să te joci

45508
34:21:18,960 --> 34:21:23,912
cu cadrele de date ale lui Panda. Vei vedea

45509
34:21:21,592 --> 34:21:27,680
că este un index. Deci, când pui un

45510
34:21:23,912 --> 34:21:31,512
index în astfel

45511
34:21:27,680 --> 34:21:34,232
în funcții de testare în testare, apoi

45512
34:21:31,512 --> 34:21:36,800
ia acele coloane și creează un Panda

45513
34:21:34,232 --> 34:21:39,440
cadre de date din acele coloane. Și în

45514
34:21:36,800 --> 34:21:42,160
acest caz, vom merge înainte și

45515
34:21:39,440 --> 34:21:43,592
pune-le în prezicerea noastră. Deci, suntem

45516
34:21:42,160 --> 34:21:48,160
urmând a pune fiecare dintre aceste rânduri de

45517
34:21:43,592 --> 34:21:49,440
date, 5.0, 3.4, 1.5, point2 și

45518
34:21:48,160 --> 34:21:53,272
le vom pune pe alea și suntem

45519
34:21:49,440 --> 34:21:55,272
o să prezice ce este noua noastră pădure

45520
34:21:53,272 --> 34:21:57,192
va veni cu clasificatorul. Şi

45521
34:21:55,272 --> 34:22:00,160
asta prezice. Acesta prezice uh

45522
34:21:57,192 --> 34:22:04,000
0000121122.

45523
34:22:00,160 --> 34:22:07,040
și din nou acesta este tipul de floare

45524
34:22:04,000 --> 34:22:10,232
satossa vica si versa culoare. Deci acum

45525
34:22:07,040 --> 34:22:12,480
că am luat funcțiile noastre de testare hai

45526
34:22:10,232 --> 34:22:14,872
explorează asta. Să vedem exact ce

45527
34:22:12,480 --> 34:22:17,192
acele date înseamnă pentru noi. Deci primul

45528
34:22:14,872 --> 34:22:19,360
lucru pe care îl putem face cu previziunile noastre este noi

45529
34:22:17,192 --> 34:22:21,680
poate genera de fapt un diferit

45530
34:22:19,360 --> 34:22:23,272
model de predicție. Când spun diferit,

45531
34:22:21,680 --> 34:22:25,272
o vom vedea diferit. Este

45532
34:22:23,272 --> 34:22:26,800
nu că datele în sine sunt diferite.

45533
34:22:25,272 --> 34:22:29,512
Deci, să luăm următoarea bucată de cod

45534
34:22:26,800 --> 34:22:31,592
și pune-l în scenariul nostru.

45535
34:22:29,512 --> 34:22:33,912
Așa că îl lipim aici și o vei face

45536
34:22:31,592 --> 34:22:36,080
vezi că facem uh prezice și

45537
34:22:33,912 --> 34:22:39,192
am adăugat proba de subliniere pentru

45538
34:22:36,080 --> 34:22:41,272
probabilitate. Deci, există clff-ul nostru

45539
34:22:39,192 --> 34:22:43,680
probabilitate. Așa că îl rulăm

45540
34:22:41,272 --> 34:22:45,272
la fel cum am alergat aici sus, dar asta

45541
34:22:43,680 --> 34:22:47,360
timpul cu asta vom obține o

45542
34:22:45,272 --> 34:22:50,000
rezultat ușor diferit și suntem doar

45543
34:22:47,360 --> 34:22:51,512
mergi să mă uit la primele 10. Deci vei

45544
34:22:50,000 --> 34:22:54,720
vezi aici jos în loc să privești deloc

45545
34:22:51,512 --> 34:22:56,720
dintre ei uh care a fost uh ce 27 vei

45546
34:22:54,720 --> 34:22:59,272
vezi aici jos că acest lucru generează

45547
34:22:56,720 --> 34:23:00,640
un câmp mult mai mare asupra probabilității

45548
34:22:59,272 --> 34:23:04,480
și hai să aruncăm o privire și să vedem ce anume

45549
34:23:00,640 --> 34:23:07,512
arata si ce inseamna asta. Deci când

45550
34:23:04,480 --> 34:23:10,480
facem predict sublinierea probabil pentru

45551
34:23:07,512 --> 34:23:12,872
probabilitatea să genereze trei numere.

45552
34:23:10,480 --> 34:23:14,800
Deci am avut trei noduri frunze la sfârșit

45553
34:23:12,872 --> 34:23:17,760
iar dacă vă amintiţi din toată teoria

45554
34:23:14,800 --> 34:23:21,360
am făcut asta sunt predictorii. Primul

45555
34:23:17,760 --> 34:23:24,232
se prezice unul pentru satossa. Ea

45556
34:23:21,360 --> 34:23:27,192
prezice un zero pentru virginica. Și asta

45557
34:23:24,232 --> 34:23:29,040
prezice un zero pentru versol. Și așa mai departe

45558
34:23:27,192 --> 34:23:30,080
și așa mai departe și așa mai departe. Și haideți să vă

45559
34:23:29,040 --> 34:23:33,592
stii ce? O să schimb asta doar

45560
34:23:30,080 --> 34:23:37,272
un pic. Să ne uităm la 10

45561
34:23:33,592 --> 34:23:38,480
la 20 doar pentru că putem.

45562
34:23:37,272 --> 34:23:40,160
Și începem să intrăm puțin

45563
34:23:38,480 --> 34:23:42,720
diferite de date. Și o să vezi bine

45564
34:23:40,160 --> 34:23:46,400
aici jos se ajunge la acesta. Această linie

45565
34:23:42,720 --> 34:23:48,000
chiar aici. Și această linie are zero 0,5

45566
34:23:46,400 --> 34:23:50,160
0,5.

45567
34:23:48,000 --> 34:23:51,832
Și deci dacă vom vota și noi

45568
34:23:50,160 --> 34:23:53,832
ai două voturi egale, va merge

45569
34:23:51,832 --> 34:23:56,080
cu primul. Deci spune uh

45570
34:23:53,832 --> 34:23:59,680
Satossa are zero voturi, virginica

45571
34:23:56,080 --> 34:24:02,000
primește.5 voturi, VersaColor obține.5 voturi,

45572
34:23:59,680 --> 34:24:04,080
dar să mergem doar cu virginica

45573
34:24:02,000 --> 34:24:05,680
întrucât acești doi sunt egali și așa mai departe și

45574
34:24:04,080 --> 34:24:07,592
așa mai departe în listă. Puteți vedea cum

45575
34:24:05,680 --> 34:24:09,912
ele variază aici. Deci acum ne-am uitat

45576
34:24:07,592 --> 34:24:12,160
la ambele cum să faci o predicție de bază a

45577
34:24:09,912 --> 34:24:14,640
caracteristici și ne-am uitat la predicție

45578
34:24:12,160 --> 34:24:17,040
probabilitate. Să vedem ce urmează

45579
34:24:14,640 --> 34:24:19,680
aici. Deci acum vrem să mergem înainte și

45580
34:24:17,040 --> 34:24:21,680
începeți să mapați numele plantelor. Noi

45581
34:24:19,680 --> 34:24:23,360
doresc să atașeze nume astfel încât să facă o

45582
34:24:21,680 --> 34:24:24,800
putin mai mult sens pentru noi. Și asta este

45583
34:24:23,360 --> 34:24:27,680
ce vom face în următoarele două

45584
34:24:24,800 --> 34:24:30,720
trepte. Vom începe prin a seta

45585
34:24:27,680 --> 34:24:32,720
să ne creăm predicțiile și să le mapam

45586
34:24:30,720 --> 34:24:35,120
numele. Deci, să vedem cum arată

45587
34:24:32,720 --> 34:24:37,912
ca. Și hai să mergem mai departe și să lipim asta

45588
34:24:35,120 --> 34:24:39,440
codați aici și rulați-l. Și asta merge

45589
34:24:37,912 --> 34:24:40,872
împreună cu următoarea bucată de cod. Deci

45590
34:24:39,440 --> 34:24:42,640
vom sări peste asta rapid și apoi

45591
34:24:40,872 --> 34:24:44,640
reveniți puțin la el. Deci, iată

45592
34:24:42,640 --> 34:24:47,592
iris.tinta

45593
34:24:44,640 --> 34:24:49,760
nume.

45594
34:24:47,592 --> 34:24:51,760
Și dacă îți amintești bine, asta

45595
34:24:49,760 --> 34:24:52,872
au fost numele pe care le-am fost

45596
34:24:51,760 --> 34:24:55,192
vorbind despre asta tot timpul,

45597
34:24:52,872 --> 34:24:56,720
Satossa, Vica, VersaColor. Și apoi

45598
34:24:55,192 --> 34:24:58,960
vom merge înainte și vom face

45599
34:24:56,720 --> 34:25:00,232
prezicerea din nou. Am condus-o. Am putea

45600
34:24:58,960 --> 34:25:01,760
tocmai am setat o variabilă egală cu aceasta

45601
34:25:00,232 --> 34:25:02,960
în loc să-l redau de fiecare dată, dar

45602
34:25:01,760 --> 34:25:06,000
mergem înainte și rulăm din nou.

45603
34:25:02,960 --> 34:25:07,832
CLF.caracteristicile de testare predict. Ține minte asta

45604
34:25:06,000 --> 34:25:09,592
returnează zerourile, cele și cele

45605
34:25:07,832 --> 34:25:12,232
doi. Și apoi vom stabili asta

45606
34:25:09,592 --> 34:25:14,080
egal cu previziunile. Deci de data asta suntem

45607
34:25:12,232 --> 34:25:16,400
punându-l de fapt într-o variabilă. Şi

45608
34:25:14,080 --> 34:25:18,552
când rulez asta,

45609
34:25:16,400 --> 34:25:20,480
se distribuie si iese ca un

45610
34:25:18,552 --> 34:25:22,640
matrice. Și matricea este satossa,

45611
34:25:20,480 --> 34:25:24,640
satossa, satossa, satossa, satossa.

45612
34:25:22,640 --> 34:25:27,360
Ne uităm doar la primele cinci. Noi

45613
34:25:24,640 --> 34:25:28,872
ar putea face să facem primele 25

45614
34:25:27,360 --> 34:25:30,872
doar ca să vedem puțin mai multe despre

45615
34:25:28,872 --> 34:25:32,552
acolo. Și o să vezi că începe

45616
34:25:30,872 --> 34:25:34,720
cartografierea lui la toate florile diferite

45617
34:25:32,552 --> 34:25:36,400
tipuri, culoarea versa și virginica

45618
34:25:34,720 --> 34:25:38,400
acolo. Și să vedem cum merge asta

45619
34:25:36,400 --> 34:25:41,592
cu următorul. Deci, să aruncăm o privire

45620
34:25:38,400 --> 34:25:43,272
în partea de sus a speciei noastre aici.

45621
34:25:41,592 --> 34:25:45,120
Și vom lua acest cod și îl vom introduce

45622
34:25:43,272 --> 34:25:47,360
scenariul nostru.

45623
34:25:45,120 --> 34:25:49,192
Și să punem asta aici și să lipim

45624
34:25:47,360 --> 34:25:51,760
ea. Iată-ne. Și vom merge înainte și

45625
34:25:49,192 --> 34:25:54,320
rulează-l. Și să vorbim despre ambele astea

45626
34:25:51,760 --> 34:25:57,360
secțiuni de cod aici și cum merg acestea

45627
34:25:54,320 --> 34:25:59,512
împreună. Primul este al nostru

45628
34:25:57,360 --> 34:26:01,512
previziuni. Și am mers înainte și am făcut uh

45629
34:25:59,512 --> 34:26:03,040
previziuni până la 25. Să facem

45630
34:26:01,512 --> 34:26:05,272
cinci.

45631
34:26:03,040 --> 34:26:06,720
Și așa avem stosis, satossis, stosis,

45632
34:26:05,272 --> 34:26:09,912
satossis. Asta prezicem noi

45633
34:26:06,720 --> 34:26:12,552
din modelul nostru de testare. Și apoi venim

45634
34:26:09,912 --> 34:26:13,680
aici jos și ne uităm la speciile de testat.

45635
34:26:12,552 --> 34:26:15,760
Și ține minte, aș fi putut să fac

45636
34:26:13,680 --> 34:26:17,832
testare.specie.cap.

45637
34:26:15,760 --> 34:26:20,872
Și vei vedea că scrie Satossa, Satossa,

45638
34:26:17,832 --> 34:26:24,800
Satossa, Satossa. Și se potrivesc. Deci

45639
34:26:20,872 --> 34:26:27,440
primul este ceea ce face pădurea noastră

45640
34:26:24,800 --> 34:26:30,232
iar al doilea este ceea ce este real

45641
34:26:27,440 --> 34:26:31,512
datele sunt. Acum trebuie să le combinăm

45642
34:26:30,232 --> 34:26:33,192
ca să putem înțelege ce anume

45643
34:26:31,512 --> 34:26:34,960
înseamnă. Trebuie să știm cât de bun suntem

45644
34:26:33,192 --> 34:26:36,640
pădurea este, cât de bună este la prezice

45645
34:26:34,960 --> 34:26:39,040
caracteristicile. Așa că acolo venim

45646
34:26:36,640 --> 34:26:41,760
la pasul următor, care este foarte distractiv.

45647
34:26:39,040 --> 34:26:43,680
Vom folosi o singură linie de cod

45648
34:26:41,760 --> 34:26:46,232
pentru a combina previziunile noastre și ale noastre

45649
34:26:43,680 --> 34:26:47,912
reale, așa că avem o diagramă frumoasă de căutat

45650
34:26:46,232 --> 34:26:50,000
la. Și hai să mergem mai departe și să punem asta

45651
34:26:47,912 --> 34:26:51,440
scriptul nostru în caietul nostru Jupyter aici.

45652
34:26:50,000 --> 34:26:54,080
Să vedem. Să mergem mai departe și să lipim asta

45653
34:26:51,440 --> 34:26:56,160
in. Și apoi mă duc pentru că sunt pe

45654
34:26:54,080 --> 34:26:57,680
notebook-ul Jupyter, pot face un control

45655
34:26:56,160 --> 34:26:59,760
minus ca să putem vedea întreaga linie

45656
34:26:57,680 --> 34:27:02,400
acolo.

45657
34:26:59,760 --> 34:27:04,232
Iată-ne. redimensionați-l și să luăm o

45658
34:27:02,400 --> 34:27:06,232
uite și vezi ce se întâmplă aici. Suntem

45659
34:27:04,232 --> 34:27:08,400
urmează să creeze în panda. Ține minte PD

45660
34:27:06,232 --> 34:27:11,040
reprezintă panda și facem o

45661
34:27:08,400 --> 34:27:13,512
filă încrucișată. Această funcție necesită două seturi

45662
34:27:11,040 --> 34:27:14,960
de date și creează o diagramă din acestea.

45663
34:27:13,512 --> 34:27:17,592
Deci, când îl voi rula, vei primi un frumos

45664
34:27:14,960 --> 34:27:19,680
grafic aici. Și avem

45665
34:27:17,592 --> 34:27:21,832
specie prezisă.

45666
34:27:19,680 --> 34:27:24,720
Deci peste vârf vei vedea satossa

45667
34:27:21,832 --> 34:27:27,360
versus culoarea virginica si reala

45668
34:27:24,720 --> 34:27:29,680
specie satossa versus color virginica.

45669
34:27:27,360 --> 34:27:31,040
Și astfel modul de a citi această diagramă și

45670
34:27:29,680 --> 34:27:33,120
hai să mergem mai departe și să aruncăm o privire despre cum

45671
34:27:31,040 --> 34:27:35,832
citiți acest grafic aici. Când citești asta

45672
34:27:33,120 --> 34:27:37,832
diagramă, ai Satossa unde se întâlnesc,

45673
34:27:35,832 --> 34:27:39,760
ai versolar unde se intalnesc, si

45674
34:27:37,832 --> 34:27:41,592
ai virginica unde se intalnesc. Şi

45675
34:27:39,760 --> 34:27:44,232
se întâlnesc acolo unde actualul și cel

45676
34:27:41,592 --> 34:27:46,552
prezis de acord. Deci acesta este numărul

45677
34:27:44,232 --> 34:27:49,912
de previziuni precise. Deci in asta

45678
34:27:46,552 --> 34:27:52,000
caz, este egal cu 30. Dacă adăugați 13 5  

45679
34:27:49,912 --> 34:27:54,000
12, primești 30. Și apoi observăm aici

45680
34:27:52,000 --> 34:27:55,592
unde scrie virginica, dar a fost

45681
34:27:54,000 --> 34:27:58,552
ar trebui să fie versol. Aceasta este

45682
34:27:55,592 --> 34:28:01,760
inexacte. Deci acum avem doi doi

45683
34:27:58,552 --> 34:28:03,912
predicții inexacte și 30 exacte

45684
34:28:01,760 --> 34:28:07,760
previziuni. Deci vom spune că modelul

45685
34:28:03,912 --> 34:28:11,040
precizia este de 93. Este doar 30 împărțit

45686
34:28:07,760 --> 34:28:14,720
cu 32. Și dacă o înmulțim cu 100, noi

45687
34:28:11,040 --> 34:28:18,080
pot spune că este 93% precis. Deci noi

45688
34:28:14,720 --> 34:28:20,000
au o precizie de 93% cu modelul nostru. eu

45689
34:28:18,080 --> 34:28:22,320
am vrut să mai adaug un lucru rapid

45690
34:28:20,000 --> 34:28:24,320
aici în scripting-ul nostru înainte de a-l încheia

45691
34:28:22,320 --> 34:28:26,320
Sus. Deci, să revenim la mine

45692
34:28:24,320 --> 34:28:29,040
scenariu. aici. O să luăm

45693
34:28:26,320 --> 34:28:30,320
această linie de cod de sus. eu

45694
34:28:29,040 --> 34:28:34,320
nu știu dacă îți amintești, dar

45695
34:28:30,320 --> 34:28:36,552
prezice este egal cu iris.target_names.

45696
34:28:34,320 --> 34:28:38,000
Deci, îl vom mapa cu numele

45697
34:28:36,552 --> 34:28:40,480
și vom rula predicția.

45698
34:28:38,000 --> 34:28:42,000
Și l-am citit pe funcțiile de testare. Dar,

45699
34:28:40,480 --> 34:28:43,912
știi, nu doar îl testăm. Noi

45700
34:28:42,000 --> 34:28:46,480
doresc să-l implementeze efectiv. Deci, la asta

45701
34:28:43,912 --> 34:28:48,960
punct, aș merge înainte și aș schimba asta.

45702
34:28:46,480 --> 34:28:50,080
Și aceasta este o serie de matrice. Aceasta este

45703
34:28:48,960 --> 34:28:52,400
foarte important când alergi

45704
34:28:50,080 --> 34:28:54,080
astea sa stie asta. Deci, ai nevoie de

45705
34:28:52,400 --> 34:28:56,160
paranteze duble. Și chiar aș putea

45706
34:28:54,080 --> 34:28:58,232
creați date. Poate să facem doar

45707
34:28:56,160 --> 34:29:00,640
doua flori. Deci poate procesez

45708
34:28:58,232 --> 34:29:03,680
vin mai multe date. Și vom pune două

45709
34:29:00,640 --> 34:29:06,080
flori aici. Și apoi eu, de fapt

45710
34:29:03,680 --> 34:29:08,232
vreau să văd care este răspunsul. Deci haideți

45711
34:29:06,080 --> 34:29:11,192
mergeți mai departe și introduceți PRS și imprimați asta

45712
34:29:08,232 --> 34:29:13,192
afară. Și când voi rula asta, vei vedea

45713
34:29:11,192 --> 34:29:15,040
că am prezis acum două flori care

45714
34:29:13,192 --> 34:29:18,160
poate am măsurat în curtea mea din față ca

45715
34:29:15,040 --> 34:29:20,080
VersaColor și VersaColor.

45716
34:29:18,160 --> 34:29:22,720
Nu este surprinzător din moment ce am pus aceleași date

45717
34:29:20,080 --> 34:29:25,912
in pentru fiecare. Acesta ar fi

45718
34:29:22,720 --> 34:29:27,832
produsul final real va fi

45719
34:29:25,912 --> 34:29:30,080
folosit pe date pe care nu le cunoașteți

45720
34:29:27,832 --> 34:29:31,760
raspunde pentru.

45721
34:29:30,080 --> 34:29:33,912
Deci asta o să încheiem

45722
34:29:31,760 --> 34:29:36,480
scripting o parte din aceasta. Prezentarea

45723
34:29:33,912 --> 34:29:38,160
clasificator de bază naiv. Ai avut vreodată

45724
34:29:36,480 --> 34:29:40,720
m-am întrebat cum furnizorul tău de e-mail

45725
34:29:38,160 --> 34:29:42,400
implementează filtrarea spam-ului sau cum online

45726
34:29:40,720 --> 34:29:44,960
canalele de știri realizează text de știri

45727
34:29:42,400 --> 34:29:46,800
clasificare sau modul de performanță al companiilor

45728
34:29:44,960 --> 34:29:48,960
analiza sentimentală a audienței lor

45729
34:29:46,800 --> 34:29:50,232
pe rețelele de socializare? Toate acestea și multe altele sunt

45730
34:29:48,960 --> 34:29:53,680
realizat printr-o învățare automată

45731
34:29:50,232 --> 34:29:56,232
algoritm numit clasificator naiv bay.

45732
34:29:53,680 --> 34:29:58,080
Bun venit la tutorialul Naive Bay. numele meu

45733
34:29:56,232 --> 34:29:59,760
este Richard Kersner. Sunt cu

45734
34:29:58,080 --> 34:30:02,232
Echipa SimplyLearn. Asta e

45735
34:29:59,760 --> 34:30:04,960
www.simplearn.com.

45736
34:30:02,232 --> 34:30:07,512
Obțineți certificare, mergeți înainte. Ce este în el

45737
34:30:04,960 --> 34:30:10,480
pentru tine? Vom începe cu ceea ce este naiv

45738
34:30:07,512 --> 34:30:12,400
golfuri? O prezentare generală de bază a modului în care funcționează.

45739
34:30:10,480 --> 34:30:14,000
Vom intra în golfuri naive și în mașină

45740
34:30:12,400 --> 34:30:16,000
învăţând unde se potriveşte cu celălalt al nostru

45741
34:30:14,000 --> 34:30:18,960
instrumente de învățare automată. De ce avem nevoie

45742
34:30:16,000 --> 34:30:20,960
golfuri naive și înțelegere golfuri naive

45743
34:30:18,960 --> 34:30:22,480
clasificator un mult mai aprofundat despre cum

45744
34:30:20,960 --> 34:30:24,080
matematica merge pe fundal?

45745
34:30:22,480 --> 34:30:26,552
În cele din urmă, vom intra în avantaje

45746
34:30:24,080 --> 34:30:28,480
a clasificatorului naiv de golf în

45747
34:30:26,552 --> 34:30:30,000
configurarea învățării automate. Și atunci vom face

45748
34:30:28,480 --> 34:30:31,832
suflecă-ne mânecile și fă preferatul meu

45749
34:30:30,000 --> 34:30:34,000
parte. De fapt, vom face niște Python

45750
34:30:31,832 --> 34:30:36,720
codificați și faceți niște clasificări de text

45751
34:30:34,000 --> 34:30:38,552
folosind golfurile naive. Ce este naiv

45752
34:30:36,720 --> 34:30:40,800
golfuri? Să începem cu un element de bază

45753
34:30:38,552 --> 34:30:43,440
introducere în teorema Bay numită

45754
34:30:40,800 --> 34:30:44,800
după Thomas Bae din anii 1700 care

45755
34:30:43,440 --> 34:30:47,192
a inventat aceasta prima dată în vest

45756
34:30:44,800 --> 34:30:48,640
literatură. Clasificatorul naiv de golf funcționează

45757
34:30:47,192 --> 34:30:50,872
pe principiul condiționalului

45758
34:30:48,640 --> 34:30:52,720
probabilitatea dată de teorema Bay.

45759
34:30:50,872 --> 34:30:54,232
Înainte de a merge mai departe, haideți să trecem

45760
34:30:52,720 --> 34:30:56,080
unele dintre conceptele simple din

45761
34:30:54,232 --> 34:30:57,760
probabilitatea pe care o vom folosi. Lasă

45762
34:30:56,080 --> 34:31:00,000
luăm în considerare următorul exemplu de

45763
34:30:57,760 --> 34:31:02,000
aruncând două monede. Aici avem două

45764
34:31:00,000 --> 34:31:03,512
sferturi și dacă ne uităm la toate

45765
34:31:02,000 --> 34:31:05,120
posibilități diferite de ceea ce pot

45766
34:31:03,512 --> 34:31:07,440
veniți așa cum înțelegem că ar putea veni

45767
34:31:05,120 --> 34:31:09,832
sus ca capete de cap. vine ca cap, coadă,

45768
34:31:07,440 --> 34:31:12,320
coadă, cap și spune coada. Când faceți

45769
34:31:09,832 --> 34:31:15,040
matematică pe probabilitate, notăm de obicei

45770
34:31:12,320 --> 34:31:16,960
probabilitatea ca un P, un P capital. Deci,

45771
34:31:15,040 --> 34:31:19,440
probabilitatea de a obține două capete egale

45772
34:31:16,960 --> 34:31:21,120
1/4. Puteți vedea în setul nostru de date, noi

45773
34:31:19,440 --> 34:31:23,440
au două capete și asta se întâmplă odată afară

45774
34:31:21,120 --> 34:31:25,760
dintre cele patru posibilităţi. Și apoi

45775
34:31:23,440 --> 34:31:27,592
apare probabilitatea a cel puțin o coadă

45776
34:31:25,760 --> 34:31:29,512
trei/arter a timpului. Vei vedea mai departe

45777
34:31:27,592 --> 34:31:30,800
trei aruncări de monede, avem cozi

45778
34:31:29,512 --> 34:31:32,720
în ele. Și din patru, atât

45779
34:31:30,800 --> 34:31:35,512
trei/4s. Și apoi probabilitatea de

45780
34:31:32,720 --> 34:31:38,160
a doua monedă fiind un cap dat

45781
34:31:35,512 --> 34:31:40,000
prima monedă este coada este 1/2. Iar cel

45782
34:31:38,160 --> 34:31:42,640
probabilitatea de a obține două capete date

45783
34:31:40,000 --> 34:31:44,080
prima monedă este un cap este 1/2. Vom face

45784
34:31:42,640 --> 34:31:45,912
demonstrează că într-un minut și

45785
34:31:44,080 --> 34:31:47,592
să-ți arăt cum funcționează matematica. Acum când

45786
34:31:45,912 --> 34:31:49,192
o facem cu două monede, e ușor

45787
34:31:47,592 --> 34:31:50,800
a vedea. Dar când ai ceva mai mult

45788
34:31:49,192 --> 34:31:53,360
complex, puteți vedea unde acești pro

45789
34:31:50,800 --> 34:31:55,272
aceste formule chiar vin și funcționează.

45790
34:31:53,360 --> 34:31:57,680
Deci teorema de bază ne oferă

45791
34:31:55,272 --> 34:32:00,552
probabilitatea condiționată a unui eveniment A

45792
34:31:57,680 --> 34:32:03,360
dat fiind că a avut loc un alt eveniment B. În

45793
34:32:00,552 --> 34:32:05,512
în acest caz, prima aruncare a monedei va fi B

45794
34:32:03,360 --> 34:32:06,960
iar a doua monedă aruncă A. Acest lucru ar putea

45795
34:32:05,512 --> 34:32:09,360
fi confuz pentru că de fapt am

45796
34:32:06,960 --> 34:32:11,360
inversă ordinea lor și treci de la B

45797
34:32:09,360 --> 34:32:13,360
la A în loc de la A la B. Veți vedea asta

45798
34:32:11,360 --> 34:32:15,680
mult când lucrezi în probabilități.

45799
34:32:13,360 --> 34:32:17,360
Motivul este că căutăm evenimentul A,

45800
34:32:15,680 --> 34:32:18,872
vrem să știm ce este asta. Deci, suntem

45801
34:32:17,360 --> 34:32:21,272
o să-l etichetez cu A, deoarece acesta este al nostru

45802
34:32:18,872 --> 34:32:23,512
se concentreze. Și apoi dat un alt eveniment B

45803
34:32:21,272 --> 34:32:25,592
a avut loc. În teorema Baze, ca

45804
34:32:23,512 --> 34:32:28,400
puteți vedea în stânga, probabilitatea

45805
34:32:25,592 --> 34:32:30,552
de A care apare dat B a avut loc

45806
34:32:28,400 --> 34:32:32,400
este egală cu probabilitatea ca B să apară

45807
34:32:30,552 --> 34:32:34,872
dat A a avut loc ori

45808
34:32:32,400 --> 34:32:36,800
probabilitatea lui A peste probabilitatea de

45809
34:32:34,872 --> 34:32:38,800
B. Această formulă simplă poate fi mutată

45810
34:32:36,800 --> 34:32:40,872
la fel ca orice formulă de algebră.

45811
34:32:38,800 --> 34:32:43,680
Și am putea face probabilitatea lui A

45812
34:32:40,872 --> 34:32:46,080
după data de B ori probabilitatea lui B

45813
34:32:43,680 --> 34:32:47,832
este egală cu probabilitatea lui B dat A

45814
34:32:46,080 --> 34:32:49,512
ori probabilitatea lui A. Puteți cu ușurință

45815
34:32:47,832 --> 34:32:52,160
mutați asta și înmulțiți-o și

45816
34:32:49,512 --> 34:32:53,760
împărțiți-l. Să aplicăm teorema B la

45817
34:32:52,160 --> 34:32:55,592
exemplul nostru. Aici îi avem pe cei doi

45818
34:32:53,760 --> 34:32:58,400
sferturi și vom observa că primul

45819
34:32:55,592 --> 34:33:00,640
două probabilități de a obține două capete

45820
34:32:58,400 --> 34:33:02,552
și cel puțin o coadă calculăm

45821
34:33:00,640 --> 34:33:06,400
direct de pe date. Deci poți ușor

45822
34:33:02,552 --> 34:33:09,040
vezi că avem un exemplu din hh

45823
34:33:06,400 --> 34:33:11,440
patru 1/4 și avem trei cu cozi înăuntru

45824
34:33:09,040 --> 34:33:15,360
ei dându-ne trei sferturi sau 3/4

45825
34:33:11,440 --> 34:33:16,960
75%. A doua condiție a doua uh

45826
34:33:15,360 --> 34:33:18,400
setul trei și patru vom merge

45827
34:33:16,960 --> 34:33:20,160
explorați puțin mai în detaliu.

45828
34:33:18,400 --> 34:33:21,680
Acum, rămânem la un exemplu simplu cu

45829
34:33:20,160 --> 34:33:23,832
două monede pentru că poți ușor

45830
34:33:21,680 --> 34:33:25,360
intelege matematica. Probabilitatea de

45831
34:33:23,832 --> 34:33:26,960
a arunca o coadă nu contează ce

45832
34:33:25,360 --> 34:33:29,040
vine înaintea ei. Și la fel și cu

45833
34:33:26,960 --> 34:33:31,040
capete. Deci, tot va fi de 50% sau

45834
34:33:29,040 --> 34:33:32,872
1/2. Dar când a venit atunci când asta

45835
34:33:31,040 --> 34:33:35,120
probabilitatea devine mai complicată, hai

45836
34:33:32,872 --> 34:33:37,120
spuneți că aveți un zar d6 sau altele

45837
34:33:35,120 --> 34:33:38,960
de exemplu, atunci această formulă chiar vine

45838
34:33:37,120 --> 34:33:41,040
la îndemână. Dar să rămânem la simplu

45839
34:33:38,960 --> 34:33:43,120
exemplu pentru moment. În acest spațiu de probă,

45840
34:33:41,040 --> 34:33:45,192
fie A evenimentul că a doua monedă

45841
34:33:43,120 --> 34:33:47,272
este cap și b fi evenimentul că

45842
34:33:45,192 --> 34:33:48,480
prima monedă este cozile. Din nou, am inversat

45843
34:33:47,272 --> 34:33:49,912
pentru că vrem să știm ce

45844
34:33:48,480 --> 34:33:51,680
va avea loc al doilea eveniment. Deci, suntem

45845
34:33:49,912 --> 34:33:54,232
se va concentra pe A. Și scriem

45846
34:33:51,680 --> 34:33:56,320
asta ca fiind probabilitatea A dată

45847
34:33:54,232 --> 34:33:58,320
B. Și știm asta din formula noastră

45848
34:33:56,320 --> 34:34:00,960
că aceasta este egală cu probabilitatea lui B

45849
34:33:58,320 --> 34:34:02,960
dat A înmulțit probabilitatea ca A să depășească

45850
34:34:00,960 --> 34:34:04,872
probabilitatea lui B. Iar când conectăm

45851
34:34:02,960 --> 34:34:06,640
că în, introducem probabilitatea de

45852
34:34:04,872 --> 34:34:08,640
prima monedă fiind cozile date

45853
34:34:06,640 --> 34:34:10,552
a doua monedă este capete și probabilitatea

45854
34:34:08,640 --> 34:34:12,480
a doua monedă fiind capete date

45855
34:34:10,552 --> 34:34:14,480
prima monedă fiind peste probabilitatea de

45856
34:34:12,480 --> 34:34:16,400
prima monedă fiind cozi. Când conectam

45857
34:34:14,480 --> 34:34:18,552
acele date în și avem probabilitatea

45858
34:34:16,400 --> 34:34:20,400
a primei monede fiind cozile date

45859
34:34:18,552 --> 34:34:22,000
a doua monedă este capete ori

45860
34:34:20,400 --> 34:34:24,232
probabilitatea ca a doua monedă să fie

45861
34:34:22,000 --> 34:34:25,912
trece peste probabilitatea primului

45862
34:34:24,232 --> 34:34:28,160
monedă fiind cozi. Puteți vedea că este o

45863
34:34:25,912 --> 34:34:34,552
formulă simplă de calculat. Avem 1/2

45864
34:34:28,160 --> 34:34:36,800
* 1/2 peste 1/2 sau 1/2 =.5 sau 1/4. Deci

45865
34:34:34,552 --> 34:34:38,320
Teorema B calculează practic

45866
34:34:36,800 --> 34:34:40,480
probabilitatea condiționată a

45867
34:34:38,320 --> 34:34:42,232
producerea unui eveniment bazat pe anterioare

45868
34:34:40,480 --> 34:34:44,000
cunoașterea condițiilor care ar putea fi

45869
34:34:42,232 --> 34:34:45,512
legate de eveniment. Vom explora

45870
34:34:44,000 --> 34:34:47,440
asta în detaliu când luăm o

45871
34:34:45,512 --> 34:34:49,760
exemplu de cumpărături online mai departe în

45872
34:34:47,440 --> 34:34:51,592
acest tutorial. Înțelegerea golfurilor naive

45873
34:34:49,760 --> 34:34:53,360
și învățarea automată. Ca cu oricare dintre

45874
34:34:51,592 --> 34:34:55,360
celelalte instrumente ale noastre de învățare automată, este

45875
34:34:53,360 --> 34:34:57,592
important să înțelegem unde naivii

45876
34:34:55,360 --> 34:34:59,360
golfurile se încadrează în ierarhie. Deci sub

45877
34:34:57,592 --> 34:35:00,872
învățare automată, am supravegheat

45878
34:34:59,360 --> 34:35:02,640
învățând și mai sunt și alte lucruri de genul

45879
34:35:00,872 --> 34:35:04,400
învăţare nesupravegheată. Există, de asemenea

45880
34:35:02,640 --> 34:35:06,160
sistem de recompense. Aceasta se încadrează sub

45881
34:35:04,400 --> 34:35:07,272
învăţare supravegheată. Și apoi sub

45882
34:35:06,160 --> 34:35:09,760
învățare supravegheată, există

45883
34:35:07,272 --> 34:35:10,640
clasificare. Există și regresie.

45884
34:35:09,760 --> 34:35:12,720
Dar vom fi în

45885
34:35:10,640 --> 34:35:15,272
partea de clasificare. Și apoi sub

45886
34:35:12,720 --> 34:35:18,232
clasificarea este golfurile tale naive. Să

45887
34:35:15,272 --> 34:35:20,160
du-te înainte și aruncă o privire unde este naiv

45888
34:35:18,232 --> 34:35:22,552
golfuri folosite. Să ne uităm la câteva dintre utilizări

45889
34:35:20,160 --> 34:35:24,480
scenarii pentru ea. Ca clasificator, noi

45890
34:35:22,552 --> 34:35:27,120
utilizați-l în recunoașterea feței. Este asta

45891
34:35:24,480 --> 34:35:29,120
Cindy sau nu este Cindy sau oricine? Sau

45892
34:35:27,120 --> 34:35:30,872
ar putea fi folosit pentru a identifica părți ale

45893
34:35:29,120 --> 34:35:32,480
fața în care se hrănesc apoi

45894
34:35:30,872 --> 34:35:34,400
o altă parte a recunoașterii feței

45895
34:35:32,480 --> 34:35:36,080
program. Acesta este ochiul. Acesta este

45896
34:35:34,400 --> 34:35:37,832
nasul. Aceasta este gura. Vremea

45897
34:35:36,080 --> 34:35:39,832
predictie. O să fie plouă sau

45898
34:35:37,832 --> 34:35:41,592
însorit? Recunoaștere medicală. Știri

45899
34:35:39,832 --> 34:35:44,000
predictie. Este folosit și în medicină

45900
34:35:41,592 --> 34:35:46,400
diagnostic. Am putea diagnostica pe cineva ca

45901
34:35:44,000 --> 34:35:49,592
fie la fel de mare sau nu la fel de mare

45902
34:35:46,400 --> 34:35:51,760
pentru cancer sau boli de inima sau altele

45903
34:35:49,592 --> 34:35:53,760
afectiuni. Și știrile te clasifică

45904
34:35:51,760 --> 34:35:56,872
uită-te la știrile Google și spune bine

45905
34:35:53,760 --> 34:35:58,720
este aceasta politică sau este o știre mondială

45906
34:35:56,872 --> 34:36:01,760
sau multe din toate acestea sunt făcute cu

45907
34:35:58,720 --> 34:36:03,760
golfuri naive. Înțelegerea golfului naiv

45908
34:36:01,760 --> 34:36:06,480
clasificator. Acum am trecut deja prin

45909
34:36:03,760 --> 34:36:08,400
o înțelegere de bază cu monedele și

45910
34:36:06,480 --> 34:36:10,480
cele două capete și două cozi și cap

45911
34:36:08,400 --> 34:36:12,640
coadă coadă capete etc. Vom face

45912
34:36:10,480 --> 34:36:14,800
doar o scurtă trecere în revistă și amintește-ți

45913
34:36:12,640 --> 34:36:16,960
tu că naiv este clasificatorul de golf

45914
34:36:14,800 --> 34:36:20,000
bazat pe teorema bay care dă a

45915
34:36:16,960 --> 34:36:21,760
probabilitatea condiționată a evenimentului A dat

45916
34:36:20,000 --> 34:36:24,232
evenimentul B. Și acolo este locul

45917
34:36:21,760 --> 34:36:26,400
probabilitatea A dat B este egală cu

45918
34:36:24,232 --> 34:36:28,960
probabilitatea B dată de A ori

45919
34:36:26,400 --> 34:36:30,640
probabilitatea lui A peste probabilitatea lui B.

45920
34:36:28,960 --> 34:36:32,640
Amintiți-vă că aceasta este o funcție algebrică

45921
34:36:30,640 --> 34:36:34,320
astfel încât să putem muta aceste entități diferite

45922
34:36:32,640 --> 34:36:36,552
în jur. Ne-am putea înmulți cu

45923
34:36:34,320 --> 34:36:38,320
probabilitatea lui B. Deci merge spre stânga

45924
34:36:36,552 --> 34:36:40,872
partea de mână și apoi am putea împărți la

45925
34:36:38,320 --> 34:36:42,232
probabilitatea A dat B și la fel ca

45926
34:36:40,872 --> 34:36:44,400
veni cu ușurință o nouă formulă pentru

45927
34:36:42,232 --> 34:36:46,720
probabilitatea ca B. Pentru mine să mă holbeze la

45928
34:36:44,400 --> 34:36:49,040
aceste funcții algebrice cam dă

45929
34:36:46,720 --> 34:36:50,552
mie o usoara durere de cap. E mult mai bine

45930
34:36:49,040 --> 34:36:52,720
să vedem dacă putem înțelege cu adevărat cum

45931
34:36:50,552 --> 34:36:54,160
aceste date se potrivesc într-un tabel. Şi

45932
34:36:52,720 --> 34:36:55,512
hai să mergem mai departe și să începem să-l aplicăm

45933
34:36:54,160 --> 34:36:57,120
niște date reale, ca să puteți vedea ce

45934
34:36:55,512 --> 34:36:59,040
care arata ca. Deci, vom merge

45935
34:36:57,120 --> 34:37:00,320
începe cu problema demo-ului de cumpărături

45936
34:36:59,040 --> 34:37:02,960
declarație. Și amintiți-vă, vom merge

45937
34:37:00,320 --> 34:37:04,320
rezolvați acest lucru mai întâi într-o formă de tabel, astfel încât dvs

45938
34:37:02,960 --> 34:37:06,080
pot vedea cum arată matematica. Şi

45939
34:37:04,320 --> 34:37:07,680
apoi o vom rezolva în Python.

45940
34:37:06,080 --> 34:37:09,592
Și aici, vrem să prezicem dacă

45941
34:37:07,680 --> 34:37:11,680
persoana va cumpăra un produs. sunt

45942
34:37:09,592 --> 34:37:12,800
vor cumpăra sau nu cumpără? Foarte

45943
34:37:11,680 --> 34:37:14,232
important. Dacă conduci o afacere,

45944
34:37:12,800 --> 34:37:16,160
vrei să știi cum să-ți maximizezi

45945
34:37:14,232 --> 34:37:17,832
profiturile sau cel puțin maximizarea

45946
34:37:16,160 --> 34:37:19,120
cumpărarea persoanelor care vin în dvs

45947
34:37:17,832 --> 34:37:21,512
magazin. Și ne vom uita la un

45948
34:37:19,120 --> 34:37:23,040
combinație specifică de diferite

45949
34:37:21,512 --> 34:37:25,120
variabile. În acest caz, vom merge

45950
34:37:23,040 --> 34:37:26,640
uită-te la zi, la reducere și la

45951
34:37:25,120 --> 34:37:28,000
livrare gratuita. Și puteți vedea aici

45952
34:37:26,640 --> 34:37:29,912
sub ziua vrem sa stim daca

45953
34:37:28,000 --> 34:37:31,360
e în ziua săptămânii, știi,

45954
34:37:29,912 --> 34:37:33,592
cineva lucrează, vin după

45955
34:37:31,360 --> 34:37:34,960
lucrează sau poate nu funcționează. weekend,

45956
34:37:33,592 --> 34:37:36,640
puteți vedea culorile strălucitoare venind

45957
34:37:34,960 --> 34:37:39,040
acolo jos, sărbătorind că nu sunt la muncă

45958
34:37:36,640 --> 34:37:41,192
sau vacanță. Și am oferit o reducere

45959
34:37:39,040 --> 34:37:43,040
ziua aceea? Da sau nu. Am oferit gratuit

45960
34:37:41,192 --> 34:37:44,160
livrare in acea zi? Da sau nu. Și de la

45961
34:37:43,040 --> 34:37:45,760
aceasta, vrem să știm dacă

45962
34:37:44,160 --> 34:37:48,080
persoana va cumpăra pe baza acestora

45963
34:37:45,760 --> 34:37:49,832
trăsături astfel încât să le putem maximiza și să le găsim

45964
34:37:48,080 --> 34:37:51,592
cel mai bun sistem pentru a obține pe cineva

45965
34:37:49,832 --> 34:37:53,760
să intrăm să ne cumpărăm bunurile şi

45966
34:37:51,592 --> 34:37:55,360
produse din magazinul nostru. Acum, având o

45967
34:37:53,760 --> 34:37:57,192
vizualul frumos este grozav, dar avem nevoie

45968
34:37:55,360 --> 34:37:59,272
sapă în date. Deci, hai să mergem înainte

45969
34:37:57,192 --> 34:38:01,760
și aruncați o privire la setul de date. Avem

45970
34:37:59,272 --> 34:38:03,680
un mic eșantion de set de date de 30 de rânduri.

45971
34:38:01,760 --> 34:38:05,912
Vă prezentăm primele 15 dintre acestea

45972
34:38:03,680 --> 34:38:08,232
rânduri pentru această demonstrație. Acum, datele reale

45973
34:38:05,912 --> 34:38:10,160
fișier pe care îl puteți solicita. Doar introduceți mai jos

45974
34:38:08,232 --> 34:38:11,680
sub comentariile de pe videoclipul de pe YouTube

45975
34:38:10,160 --> 34:38:13,592
și vă vom trimite mai multe informații

45976
34:38:11,680 --> 34:38:15,592
și îți trimit acel fișier. După cum puteți vedea

45977
34:38:13,592 --> 34:38:18,480
aici, fișierul este foarte simplu coloane

45978
34:38:15,592 --> 34:38:20,232
și rânduri. Avem ziua, reducerea,

45979
34:38:18,480 --> 34:38:22,480
livrarea gratuită, și a făcut persoana

45980
34:38:20,232 --> 34:38:24,232
cumpărare sau nu. Și apoi avem sub

45981
34:38:22,480 --> 34:38:26,720
ziua fie că a fost zi lucrătoare, a

45982
34:38:24,232 --> 34:38:29,040
vacanta, a fost weekend? Acesta este un

45983
34:38:26,720 --> 34:38:30,800
un set destul de simplu de date. Și lung

45984
34:38:29,040 --> 34:38:32,552
înaintea computerelor, oamenii obișnuiau să se uite la

45985
34:38:30,800 --> 34:38:34,640
aceste date și calculați toate acestea prin

45986
34:38:32,552 --> 34:38:36,480
mână. Așa că hai să mergem înainte și să trecem

45987
34:38:34,640 --> 34:38:38,552
asta și vezi cum arată când

45988
34:38:36,480 --> 34:38:40,160
punem asta în tabele. De asemenea, notează în

45989
34:38:38,552 --> 34:38:42,480
lumea de azi, de obicei nu căutăm

45990
34:38:40,160 --> 34:38:44,080
la trei variabile diferite și 30

45991
34:38:42,480 --> 34:38:45,512
rânduri. În zilele noastre, pentru că suntem capabili

45992
34:38:44,080 --> 34:38:48,960
colectăm date atât de mult, de obicei suntem

45993
34:38:45,512 --> 34:38:51,192
uitându-se la 27, 30 de variabile

45994
34:38:48,960 --> 34:38:52,800
sute de rânduri. Primul lucru noi

45995
34:38:51,192 --> 34:38:55,272
vreau să facem este să luăm asta

45996
34:38:52,800 --> 34:38:57,192
date și pe baza setului de date

45997
34:38:55,272 --> 34:38:58,720
care conține ziua celor trei intrări,

45998
34:38:57,192 --> 34:39:00,080
reducere și livrare gratuită, mergem

45999
34:38:58,720 --> 34:39:02,552
pentru a merge înainte și a popula că să

46000
34:39:00,080 --> 34:39:04,800
tabele de frecvență pentru fiecare atribut. Deci,

46001
34:39:02,552 --> 34:39:07,912
vrem să știm dacă au avut o reducere,

46002
34:39:04,800 --> 34:39:09,592
câți oameni cumpără și nu cumpără. Uh

46003
34:39:07,912 --> 34:39:11,680
au avut reducere? Da sau nu. Fă

46004
34:39:09,592 --> 34:39:13,360
avem livrare gratuita? Da sau nu. Pornit

46005
34:39:11,680 --> 34:39:14,720
în acele zile, câți oameni au făcut a

46006
34:39:13,360 --> 34:39:16,160
cumpărat și câți oameni nu au făcut-o? Şi

46007
34:39:14,720 --> 34:39:17,760
la fel cu cele trei zile ale

46008
34:39:16,160 --> 34:39:20,000
saptamana. A fost o zi a săptămânii, un weekend, a

46009
34:39:17,760 --> 34:39:22,320
vacanta? Și au cumpărat? Da sau nu? Ca

46010
34:39:20,000 --> 34:39:25,272
săpăm mai adânc la această masă pentru a noastră

46011
34:39:22,320 --> 34:39:26,720
teorema bay, fie cumpararea evenimentului a. Acum

46012
34:39:25,272 --> 34:39:27,912
Amintește-ți când ne-am uitat la monede, eu

46013
34:39:26,720 --> 34:39:30,232
a spus că vrem cu adevărat să știm ce

46014
34:39:27,912 --> 34:39:32,000
rezultatul este. Persoana a cumpărat sau nu?

46015
34:39:30,232 --> 34:39:33,680
Și acesta este de obicei evenimentul A

46016
34:39:32,000 --> 34:39:35,912
pe care o cauți. Și independentul

46017
34:39:33,680 --> 34:39:38,160
variabile, reducere, livrare gratuită și

46018
34:39:35,912 --> 34:39:40,480
ziua fie B. Deci o vom numi probabilitate

46019
34:39:38,160 --> 34:39:41,912
de B. Acum să calculăm

46020
34:39:40,480 --> 34:39:44,000
tabelul de probabilitate pentru unul dintre

46021
34:39:41,912 --> 34:39:46,160
variabile. Să începem cu ziua, care

46022
34:39:44,000 --> 34:39:48,640
include ziua săptămânii, weekendul și vacanța.

46023
34:39:46,160 --> 34:39:51,512
Și să începem prin a rezuma toate

46024
34:39:48,640 --> 34:39:53,360
rânduri. Deci, avem rândul în ziua săptămânii,

46025
34:39:51,512 --> 34:39:55,680
iar din zilele lucrătoare sunt 9 plus

46026
34:39:53,360 --> 34:39:58,400
2, deci sunt 11 zile lucrătoare. Sunt opt

46027
34:39:55,680 --> 34:39:59,912
zile de weekend și 11 sărbători. wow,

46028
34:39:58,400 --> 34:40:01,832
sunt multe sărbători. Și apoi noi

46029
34:39:59,912 --> 34:40:04,232
doriți să rezumați numărul total de zile.

46030
34:40:01,832 --> 34:40:06,000
Deci, ne uităm la un total de 30 de zile.

46031
34:40:04,232 --> 34:40:08,080
Să începem să extragem câteva informații

46032
34:40:06,000 --> 34:40:10,080
din graficul nostru și vedeți unde duce asta

46033
34:40:08,080 --> 34:40:13,272
noi. Și când completăm graficul de pe

46034
34:40:10,080 --> 34:40:15,760
corect, poți vedea că nouă din 24

46035
34:40:13,272 --> 34:40:18,232
achizitiile se fac in ziua saptamanii, 7 afara

46036
34:40:15,760 --> 34:40:20,480
din 24 de achiziții în weekend și

46037
34:40:18,232 --> 34:40:22,000
opt din 24 de achiziții într-o vacanță.

46038
34:40:20,480 --> 34:40:24,320
Și dintre toți oamenii care intră,

46039
34:40:22,000 --> 34:40:26,400
24 din 30 de achiziții. De asemenea, puteți vedea

46040
34:40:24,320 --> 34:40:28,000
cati oameni nu cumpara. Pe

46041
34:40:26,400 --> 34:40:30,080
în ziua săptămânii, doi din șase nu au făcut-o

46042
34:40:28,000 --> 34:40:31,912
cumpărare și așa mai departe și așa mai departe. Putem

46043
34:40:30,080 --> 34:40:33,272
uita-te si la totaluri si o sa vezi

46044
34:40:31,912 --> 34:40:35,192
în dreapta, am adunat câteva dintre

46045
34:40:33,272 --> 34:40:38,000
formulele. Probabilitatea de a face

46046
34:40:35,192 --> 34:40:40,160
o achiziție în weekend iese 11

46047
34:40:38,000 --> 34:40:41,832
din 30. Deci din cei 30 de oameni care

46048
34:40:40,160 --> 34:40:44,000
a intrat în magazin pe tot parcursul

46049
34:40:41,832 --> 34:40:45,272
weekend, zile lucrătoare și sărbători, 11 of

46050
34:40:44,000 --> 34:40:47,512
acele achiziții au fost făcute pe

46051
34:40:45,272 --> 34:40:49,912
zi lucrătoare. Și apoi puteți vedea și

46052
34:40:47,512 --> 34:40:52,160
probabilitatea ca ei să nu facă a

46053
34:40:49,912 --> 34:40:53,912
cumpărare. Și acest lucru este făcut pentru nu

46054
34:40:52,160 --> 34:40:56,232
contează în ce zi a săptămânii. Așa că sunăm

46055
34:40:53,912 --> 34:40:59,120
acea probabilitate de a nu cumpăra ar fi 6

46056
34:40:56,232 --> 34:41:00,160
peste 30 sau 0,2. Deci există o șansă de 20%.

46057
34:40:59,120 --> 34:41:01,592
că nu vor face o

46058
34:41:00,160 --> 34:41:03,832
cumpărați indiferent în ce zi a săptămânii

46059
34:41:01,592 --> 34:41:06,400
este. Și, în sfârșit, ne uităm la

46060
34:41:03,832 --> 34:41:07,592
probabilitatea lui B dacă A. În acest caz,

46061
34:41:06,400 --> 34:41:10,232
ne vom uita la probabilitate

46062
34:41:07,592 --> 34:41:11,912
a zilei lucrătoare și nu cumpără. Două dintre

46063
34:41:10,232 --> 34:41:13,592
nu cumpărăturile au fost făcute în weekend

46064
34:41:11,912 --> 34:41:15,592
din cei şase oameni care nu au făcut

46065
34:41:13,592 --> 34:41:17,680
cumpărături. Deci, când ne uităm la asta,

46066
34:41:15,592 --> 34:41:21,592
probabilitatea zilei săptămânii fără a

46067
34:41:17,680 --> 34:41:22,960
achiziția va fi.33 sau 33%. Să

46068
34:41:21,592 --> 34:41:25,192
aruncați o privire la asta la diferit

46069
34:41:22,960 --> 34:41:27,120
probabilități. Și pe baza asta

46070
34:41:25,192 --> 34:41:28,960
tabelul probabilității, să mergem mai departe și

46071
34:41:27,120 --> 34:41:31,192
calculați probabilitățile condiționate ca

46072
34:41:28,960 --> 34:41:32,800
mai jos. Primele trei tocmai le-am făcut. The

46073
34:41:31,192 --> 34:41:36,232
probabilitatea de a face o achiziție pe

46074
34:41:32,800 --> 34:41:37,760
ziua săptămânii este 11 din 30 sau aproximativ 36 sau

46075
34:41:36,232 --> 34:41:40,400
37%

46076
34:41:37,760 --> 34:41:41,832
367. Probabilitatea de a nu face a

46077
34:41:40,400 --> 34:41:45,512
cumpărarea nu contează în ce zi

46078
34:41:41,832 --> 34:41:49,440
a săptămânii este de aproximativ.2 sau 20%. Iar cel

46079
34:41:45,512 --> 34:41:51,360
probabilitatea unei zile lucrătoare nu este cumpărată

46080
34:41:49,440 --> 34:41:53,760
aproximativ doi din șase. Deci doi din

46081
34:41:51,360 --> 34:41:56,160
șase dintre achizițiile noastre nu au fost făcute pe

46082
34:41:53,760 --> 34:41:58,480
zi lucrătoare. Și apoi, în sfârșit, luăm P

46083
34:41:56,160 --> 34:42:00,080
de A. Dacă te-ai uitat am păstrat

46084
34:41:58,480 --> 34:42:01,832
simboluri acolo sus. Deci avem P de

46085
34:42:00,080 --> 34:42:04,160
probabilitatea lui B, probabilitatea lui A,

46086
34:42:01,832 --> 34:42:07,680
probabilitatea lui B dacă A. Ar trebui

46087
34:42:04,160 --> 34:42:10,720
amintiți-vă că probabilitatea lui A dacă B

46088
34:42:07,680 --> 34:42:13,192
este egal cu primul ori

46089
34:42:10,720 --> 34:42:15,192
probabilitatea de nu per cumpără peste

46090
34:42:13,192 --> 34:42:17,440
probabilitatea zilei lucrătoare. Deci am putea

46091
34:42:15,192 --> 34:42:19,272
calculează-l atât din tabelul uh

46092
34:42:17,440 --> 34:42:22,320
creat. Putem calcula acest lucru și prin

46093
34:42:19,272 --> 34:42:24,640
formula și obținem.367

46094
34:42:22,320 --> 34:42:28,800
care este egal cu or.33

46095
34:42:24,640 --> 34:42:32,232
*2 peste.367 care este egal cu.179

46096
34:42:28,800 --> 34:42:34,232
sau aproximativ 17 până la 18%. Și asta ar fi

46097
34:42:32,232 --> 34:42:36,480
probabilitatea de a nu se face nicio achiziție

46098
34:42:34,232 --> 34:42:38,800
ziua săptămânii. Și acest lucru este important

46099
34:42:36,480 --> 34:42:41,360
pentru că putem să ne uităm la asta și să spunem ca

46100
34:42:38,800 --> 34:42:43,272
probabilitatea de a cumpăra în ziua săptămânii

46101
34:42:41,360 --> 34:42:45,440
este mai mare decât probabilitatea de a nu

46102
34:42:43,272 --> 34:42:47,360
cumpărând în ziua săptămânii, putem concluziona

46103
34:42:45,440 --> 34:42:49,760
că cel mai probabil clienții vor cumpăra

46104
34:42:47,360 --> 34:42:51,592
produs într-o zi a săptămânii. Acum, am păstrat

46105
34:42:49,760 --> 34:42:53,440
diagrama noastră simplă și doar căutăm

46106
34:42:51,592 --> 34:42:54,800
la un aspect. Deci, ar trebui să poți

46107
34:42:53,440 --> 34:42:56,800
uită-te la masă și vino cu

46108
34:42:54,800 --> 34:42:58,480
aceeași informație sau aceeași concluzie.

46109
34:42:56,800 --> 34:43:01,912
Ar trebui să fie oarecum intuitiv în acest sens

46110
34:42:58,480 --> 34:43:03,512
punct. Apoi, putem lua aceeași configurație.

46111
34:43:01,912 --> 34:43:05,760
Avem tabelele de frecvență ale tuturor

46112
34:43:03,512 --> 34:43:07,832
trei variabile independente. Acum putem

46113
34:43:05,760 --> 34:43:09,512
construiți tabele de probabilitate pentru toți

46114
34:43:07,832 --> 34:43:12,232
trei dintre variabilele pe care le lucrăm

46115
34:43:09,512 --> 34:43:13,912
cu. Ne putem lua ziua așa cum am făcut-o

46116
34:43:12,232 --> 34:43:15,360
înainte. Avem zi de săptămână, weekend și

46117
34:43:13,912 --> 34:43:16,872
vacanta. Și am completat acest tabel.

46118
34:43:15,360 --> 34:43:19,120
Și apoi putem intra și facem asta

46119
34:43:16,872 --> 34:43:21,360
pentru reducere. Da sau nu. Au făcut-o

46120
34:43:19,120 --> 34:43:24,160
cumpara? Da sau nu. Și îl completăm complet

46121
34:43:21,360 --> 34:43:27,192
masă. Deci acum avem probabilitățile noastre

46122
34:43:24,160 --> 34:43:29,120
pentru o reducere și dacă reducerea

46123
34:43:27,192 --> 34:43:31,120
duce sau nu la o achiziție. Iar cel

46124
34:43:29,120 --> 34:43:33,120
probabilitatea de livrare gratuită. Face asta

46125
34:43:31,120 --> 34:43:34,960
duce la o achizitie sau nu? Și aceasta este

46126
34:43:33,120 --> 34:43:37,192
unde începe să devină cu adevărat interesant.

46127
34:43:34,960 --> 34:43:38,872
Să folosim aceste trei tabele de probabilitate

46128
34:43:37,192 --> 34:43:40,720
pentru a calcula dacă un client va

46129
34:43:38,872 --> 34:43:43,680
achizitioneaza un produs pe un anume

46130
34:43:40,720 --> 34:43:46,000
combinație de zi, reducere și gratuită

46131
34:43:43,680 --> 34:43:48,080
livrare sau nu cumpărare. Aici, lasă-ne

46132
34:43:46,000 --> 34:43:50,480
luați o combinație a acestor factori. Zi

46133
34:43:48,080 --> 34:43:52,800
este egal cu vacanță, reducere este egal cu da,

46134
34:43:50,480 --> 34:43:54,552
livrare gratuită este egal cu da. Să săpăm

46135
34:43:52,800 --> 34:43:56,480
mai adânc în matematică și chiar vezi

46136
34:43:54,552 --> 34:43:58,640
cum arată asta. Și o să mergem

46137
34:43:56,480 --> 34:44:01,272
începe cu căutarea probabilității

46138
34:43:58,640 --> 34:44:03,192
dintre ei nu cumpără pe următoarele

46139
34:44:01,272 --> 34:44:05,272
combinatii de zile. Suntem de fapt

46140
34:44:03,192 --> 34:44:08,080
căutând probabilitatea A egală

46141
34:44:05,272 --> 34:44:10,400
nu cumpara. Nicio achiziție. Și probabilitatea noastră

46142
34:44:08,080 --> 34:44:12,480
din B o vom stabili egal cu este a

46143
34:44:10,400 --> 34:44:14,960
vacanta? Au primit reducere? Da.

46144
34:44:12,480 --> 34:44:16,800
Și a fost livrare gratuită? Da. Înainte

46145
34:44:14,960 --> 34:44:19,272
mergem mai departe, să ne uităm la

46146
34:44:16,800 --> 34:44:22,552
ecuația originală. probabilitatea a

46147
34:44:19,272 --> 34:44:24,480
dacă b este egal cu probabilitatea lui b dată

46148
34:44:22,552 --> 34:44:26,552
condiția a și probabilitatea

46149
34:44:24,480 --> 34:44:28,640
ori probabilitatea de a peste

46150
34:44:26,552 --> 34:44:31,592
probabilitatea ca b să apară. Acum asta este

46151
34:44:28,640 --> 34:44:33,192
algebră de bază, astfel încât să putem înmulți aceasta

46152
34:44:31,592 --> 34:44:36,480
informații împreună. Deci când vezi

46153
34:44:33,192 --> 34:44:39,592
probabilitatea unui b dat în aceasta

46154
34:44:36,480 --> 34:44:41,120
în cazul în care condiția este b c și d sau the

46155
34:44:39,592 --> 34:44:43,592
trei variabile diferite pe care le căutăm

46156
34:44:41,120 --> 34:44:45,832
la. Și când vezi probabilitatea de

46157
34:44:43,592 --> 34:44:47,512
B, acestea ar fi condițiile. Suntem

46158
34:44:45,832 --> 34:44:50,232
de fapt îi voi înmulți pe cei trei

46159
34:44:47,512 --> 34:44:51,440
condiții separate. Probabilitatea de

46160
34:44:50,232 --> 34:44:54,400
vei vedea asta în doar o secundă în

46161
34:44:51,440 --> 34:44:57,360
formula multiplicată cu probabilitatea totală pentru A

46162
34:44:54,400 --> 34:44:59,040
peste întreaga probabilitate a lui B. Deci aici

46163
34:44:57,360 --> 34:45:01,912
ne-am întors la asta și o vom face

46164
34:44:59,040 --> 34:45:03,832
am lăsat A egal cu nicio cumpărare. Și suntem

46165
34:45:01,912 --> 34:45:06,232
căutând probabilitatea lui B pe

46166
34:45:03,832 --> 34:45:08,232
condiția A unde A se stabilește pentru trei

46167
34:45:06,232 --> 34:45:10,872
lucruri diferite. Amintiți-vă că este egal

46168
34:45:08,232 --> 34:45:13,832
probabilitatea lui A dată fiind condiția

46169
34:45:10,872 --> 34:45:15,760
B. Și în acest caz, doar înmulțim

46170
34:45:13,832 --> 34:45:17,912
acele trei variabile diferite

46171
34:45:15,760 --> 34:45:21,040
împreună. Deci avem probabilitatea de

46172
34:45:17,912 --> 34:45:23,592
reducerea înmulțită cu probabilitatea de

46173
34:45:21,040 --> 34:45:26,160
timpi de livrare gratuit probabilitatea este

46174
34:45:23,592 --> 34:45:28,640
ziua este egală cu o sărbătoare. Acestea sunt ale noastre

46175
34:45:26,160 --> 34:45:30,400
trei variabile ale probabilității lui A

46176
34:45:28,640 --> 34:45:32,320
dacă B. Și atunci asta va fi

46177
34:45:30,400 --> 34:45:34,320
înmulțit cu probabilitatea acestora

46178
34:45:32,320 --> 34:45:36,232
nu face o achiziție. Și atunci vrem

46179
34:45:34,320 --> 34:45:38,160
pentru a împărți asta la total

46180
34:45:36,232 --> 34:45:39,760
probabilități și se înmulțesc

46181
34:45:38,160 --> 34:45:42,000
împreună. Deci avem probabilitatea de

46182
34:45:39,760 --> 34:45:43,592
o reducere, probabilitatea unui gratuit

46183
34:45:42,000 --> 34:45:45,592
livrarea și probabilitatea acesteia

46184
34:45:43,592 --> 34:45:48,232
fiind în vacanță. Când le conectăm

46185
34:45:45,592 --> 34:45:50,400
numerele în, vedem că unul din șase

46186
34:45:48,232 --> 34:45:53,192
nu au fost achiziționate într-o zi cu reducere,

46187
34:45:50,400 --> 34:45:55,912
două din șase au fost o achiziție nu pe a

46188
34:45:53,192 --> 34:45:58,552
zi de livrare gratuită și trei din șase

46189
34:45:55,912 --> 34:46:01,192
au fost o achiziție nu într-o vacanță. Aceia

46190
34:45:58,552 --> 34:46:03,040
sunt cele trei probabilități ale noastre pentru A și B

46191
34:46:01,192 --> 34:46:04,960
înmulțit. Și atunci asta trebuie să fie

46192
34:46:03,040 --> 34:46:06,480
înmulțit cu probabilitatea unui nu

46193
34:46:04,960 --> 34:46:08,872
cumpărare. Și amintiți-vă problema

46194
34:46:06,480 --> 34:46:10,720
probabilitatea unui noby este peste toate

46195
34:46:08,872 --> 34:46:13,360
date. Deci de acolo scoatem 6

46196
34:46:10,720 --> 34:46:16,800
din 30. Împărțim asta la

46197
34:46:13,360 --> 34:46:19,592
probabilitatea fiecărei categorii peste

46198
34:46:16,800 --> 34:46:22,872
numărul total. Așa că obținem 20 din 30

46199
34:46:19,592 --> 34:46:25,272
au avut o reducere, 23 din 30 au avut un da

46200
34:46:22,872 --> 34:46:27,192
pentru livrare gratuită, iar 11 din 30 au fost

46201
34:46:25,272 --> 34:46:30,080
într-o vacanță. Conectăm toate acele numere

46202
34:46:27,192 --> 34:46:32,480
in, obtinem.178.

46203
34:46:30,080 --> 34:46:34,080
Deci, în matematica noastră de probabilitate, avem

46204
34:46:32,480 --> 34:46:36,800
a.178

46205
34:46:34,080 --> 34:46:38,640
dacă este un refuz pentru o vacanță, a

46206
34:46:36,800 --> 34:46:40,080
reducere și livrare gratuită. Să

46207
34:46:38,640 --> 34:46:42,160
întoarce-l și vezi cum arată

46208
34:46:40,080 --> 34:46:44,160
ca daca avem o achizitie. promit

46209
34:46:42,160 --> 34:46:46,160
aceasta este ultima pagină de matematică înaintea noastră

46210
34:46:44,160 --> 34:46:47,760
sapă în scriptul Python. Deci aici

46211
34:46:46,160 --> 34:46:49,592
noi calculăm probabilitatea

46212
34:46:47,760 --> 34:46:51,360
achiziționați folosind aceeași matematică cu care am făcut-o

46213
34:46:49,592 --> 34:46:52,960
afla dacă nu au cumpărat. Acum vrem

46214
34:46:51,360 --> 34:46:54,480
sa stiu daca au cumparat. Și din nou,

46215
34:46:52,960 --> 34:46:56,400
vom merge pe zi egală cu a

46216
34:46:54,480 --> 34:46:58,552
vacanță, reducere este egală cu da, gratuit

46217
34:46:56,400 --> 34:47:00,480
livrarea este egală cu da și să fie egală

46218
34:46:58,552 --> 34:47:02,000
cumpără. Acum, chiar acum, s-ar putea să fii

46219
34:47:00,480 --> 34:47:04,400
întrebând, de ce le facem pe amândouă

46220
34:47:02,000 --> 34:47:07,680
calcule? De ce de ce am vrea

46221
34:47:04,400 --> 34:47:09,592
cunoașteți nu cumpără și cumpără pentru același lucru

46222
34:47:07,680 --> 34:47:11,272
datele intră? Ei bine, o să arătăm

46223
34:47:09,592 --> 34:47:12,960
tu asta într-o clipă, dar avem

46224
34:47:11,272 --> 34:47:14,640
pentru a avea ambele bucăți de

46225
34:47:12,960 --> 34:47:16,720
informații pentru a ne da seama

46226
34:47:14,640 --> 34:47:18,480
ca procent, spre deosebire de a

46227
34:47:16,720 --> 34:47:20,160
ecuația probabilității. Și vom ajunge

46228
34:47:18,480 --> 34:47:21,760
acea normalizare aici în doar un

46229
34:47:20,160 --> 34:47:23,512
moment. Să mergem înainte și să trecem

46230
34:47:21,760 --> 34:47:25,832
acest calcul. Și după cum puteți vedea

46231
34:47:23,512 --> 34:47:27,832
aici, probabilitatea lui A pe

46232
34:47:25,832 --> 34:47:30,640
condiția lui B, B fiind toate trei

46233
34:47:27,832 --> 34:47:32,320
categorii, am avut reducere cu

46234
34:47:30,640 --> 34:47:34,160
o achiziție, am avut livrare gratuită

46235
34:47:32,320 --> 34:47:36,080
cu o achiziție, și am făcut este o zi

46236
34:47:34,160 --> 34:47:38,232
egală cu vacanța. Și când conectăm asta

46237
34:47:36,080 --> 34:47:40,800
totul în acea formulă și înmulțiți-o

46238
34:47:38,232 --> 34:47:42,480
cu toate acestea, obținem probabilitatea noastră de a

46239
34:47:40,800 --> 34:47:44,400
reducere, probabilitatea unui gratuit

46240
34:47:42,480 --> 34:47:47,512
livrare, probabilitatea ca ziua să fie a

46241
34:47:44,400 --> 34:47:50,400
vacanta ori probabilitatea globala de

46242
34:47:47,512 --> 34:47:52,400
fiind o achiziție împărțită din nou

46243
34:47:50,400 --> 34:47:53,760
înmulțind cele trei variabile. The

46244
34:47:52,400 --> 34:47:55,680
probabilitatea deplină de a exista o

46245
34:47:53,760 --> 34:47:57,360
discount, probabilitatea deplină de a fi

46246
34:47:55,680 --> 34:47:58,960
o livrare gratuita, si complet

46247
34:47:57,360 --> 34:48:00,720
probabilitatea ca o zi să fie egală

46248
34:47:58,960 --> 34:48:05,832
vacanta. Și de aici obținem acest 19

46249
34:48:00,720 --> 34:48:09,360
peste 24 * 21 peste 24 * 8 peste 24 * p

46250
34:48:05,832 --> 34:48:11,912
a unui 24 peste 30 împărțit la

46251
34:48:09,360 --> 34:48:15,040
probabilitatea reducerii la gratuit

46252
34:48:11,912 --> 34:48:17,832
timpi de livrare pe zi sau 20 peste 30 23

46253
34:48:15,040 --> 34:48:20,800
peste 30 * 11 peste 30 si asta ne da

46254
34:48:17,832 --> 34:48:22,400
986 al nostru.

46255
34:48:20,800 --> 34:48:24,320
Deci ce vom face cu astea

46256
34:48:22,400 --> 34:48:25,912
două date pe care tocmai le-am generat?

46257
34:48:24,320 --> 34:48:27,512
Ei bine, haideți să trecem peste ele.

46258
34:48:25,912 --> 34:48:29,512
Avem o probabilitate de cumpărare

46259
34:48:27,512 --> 34:48:31,680
egal.986.

46260
34:48:29,512 --> 34:48:34,080
Avem probabilitatea de a nu cumpăra

46261
34:48:31,680 --> 34:48:36,000
egal.178.

46262
34:48:34,080 --> 34:48:37,832
Deci, în sfârșit, avem un condiționat

46263
34:48:36,000 --> 34:48:38,872
probabilitățile de cumpărare în această zi.

46264
34:48:37,832 --> 34:48:40,400
Să luăm asta

46265
34:48:38,872 --> 34:48:42,480
normalizam-o si o vom lua

46266
34:48:40,400 --> 34:48:44,872
aceste probabilităţi şi le transformă în

46267
34:48:42,480 --> 34:48:46,640
procente. Acest lucru se face pur și simplu de

46268
34:48:44,872 --> 34:48:50,400
luând suma probabilităţilor care

46269
34:48:46,640 --> 34:48:53,192
este egal cu 98686 plus.178

46270
34:48:50,400 --> 34:48:56,480
și aceasta este egală cu 1,164.

46271
34:48:53,192 --> 34:48:58,720
Dacă împărțim fiecare probabilitate la

46272
34:48:56,480 --> 34:49:02,320
suma, obținem procentul. Și așa

46273
34:48:58,720 --> 34:49:04,800
probabilitatea unei achiziții este de 84,71%.

46274
34:49:02,320 --> 34:49:06,800
Și probabilitatea de a nu cumpăra este

46275
34:49:04,800 --> 34:49:09,120
15,29%

46276
34:49:06,800 --> 34:49:11,272
având în vedere aceste trei variabile diferite.

46277
34:49:09,120 --> 34:49:13,272
Deci, dacă este în vacanță, dacă este a

46278
34:49:11,272 --> 34:49:15,440
cu reducere si are livrare gratuita,

46279
34:49:13,272 --> 34:49:16,640
apoi există 84,71%

46280
34:49:15,440 --> 34:49:18,640
șansa pe care clientul o va face

46281
34:49:16,640 --> 34:49:20,232
intrați și faceți o achiziție. Ura,

46282
34:49:18,640 --> 34:49:21,760
ne-au cumpărat lucrurile. Facem

46283
34:49:20,232 --> 34:49:23,272
bani. Dacă dețineți un magazin, asta e

46284
34:49:21,760 --> 34:49:24,552
cum ar fi linia de jos este vrei

46285
34:49:23,272 --> 34:49:26,400
face niște bani ca să-ți poți păstra

46286
34:49:24,552 --> 34:49:27,680
magazin deschis și trăiește. Acum, eu

46287
34:49:26,400 --> 34:49:29,680
ți-am promis că vom fi

46288
34:49:27,680 --> 34:49:31,512
terminând aici matematica cu câteva

46289
34:49:29,680 --> 34:49:33,192
pagini. Deci, vom merge mai departe și

46290
34:49:31,512 --> 34:49:36,480
vom face doi pași. Primul

46291
34:49:33,192 --> 34:49:38,400
pasul este că vreau să înțelegi de ce

46292
34:49:36,480 --> 34:49:40,800
vrei de ce vrei să folosești naivul

46293
34:49:38,400 --> 34:49:42,800
golfuri. Care sunt avantajele naivului

46294
34:49:40,800 --> 34:49:44,320
golfuri? Și apoi, odată ce le înțelegem

46295
34:49:42,800 --> 34:49:46,232
avantaje, ne uităm doar la asta

46296
34:49:44,320 --> 34:49:48,480
pe scurt. Apoi ne vom scufunda în și

46297
34:49:46,232 --> 34:49:51,192
face ceva codare Python. Avantajele

46298
34:49:48,480 --> 34:49:53,912
naiv bay clasificator. Deci să luăm un

46299
34:49:51,192 --> 34:49:55,760
uită-te la cele șase avantaje ale naivului

46300
34:49:53,912 --> 34:49:57,272
clasificator de golf. Și o să mergem

46301
34:49:55,760 --> 34:49:59,440
în jurul acestei roate minunate. Arată ca un

46302
34:49:57,272 --> 34:50:01,512
hârtie origami pliată. Primul este

46303
34:49:59,440 --> 34:50:03,120
foarte simplu si usor de implementat.

46304
34:50:01,512 --> 34:50:05,360
Cu siguranță ai putea trece prin

46305
34:50:03,120 --> 34:50:06,720
mese și faceți acest lucru manual. Trebuie

46306
34:50:05,360 --> 34:50:08,400
fii putin atent pentru ca

46307
34:50:06,720 --> 34:50:10,160
notațiile pot deveni confuze. ai

46308
34:50:08,400 --> 34:50:11,832
toate aceste probabilități diferite și eu

46309
34:50:10,160 --> 34:50:13,512
cu siguranță le încurcă așa cum le-am pus eu

46310
34:50:11,832 --> 34:50:14,800
pe, știi, este pe partea de sus sau pe

46311
34:50:13,512 --> 34:50:16,872
jos? Trebuie să plătim aproape

46312
34:50:14,800 --> 34:50:18,552
atentie la asta. Când îl pui în

46313
34:50:16,872 --> 34:50:19,592
Python, e foarte frumos pentru că tu

46314
34:50:18,552 --> 34:50:21,192
nu trebuie să vă faceți griji pentru nimic din toate acestea.

46315
34:50:19,592 --> 34:50:23,272
L-ai lăsat pe Python să se ocupe de asta

46316
34:50:21,192 --> 34:50:24,872
Modulul Python. Dar înțelegându-l, tu

46317
34:50:23,272 --> 34:50:26,232
îl poți pune pe o masă și poți ușor

46318
34:50:24,872 --> 34:50:28,000
vezi cum functioneaza. Și este un simplu

46319
34:50:26,232 --> 34:50:29,680
funcţie algebrică. Are nevoie de mai puțin

46320
34:50:28,000 --> 34:50:31,912
date de antrenament. Deci dacă ai mai mic

46321
34:50:29,680 --> 34:50:34,232
cantități de date, aceasta este foarte puternică

46322
34:50:31,912 --> 34:50:36,800
instrument pentru asta. Manerile ambele continue

46323
34:50:34,232 --> 34:50:38,800
și date discrete. Este foarte scalabil

46324
34:50:36,800 --> 34:50:40,400
cu număr de predictori și date

46325
34:50:38,800 --> 34:50:42,232
puncte. Deci, după cum puteți vedea, puteți pur și simplu

46326
34:50:40,400 --> 34:50:43,912
continuă să înmulțiți diferite probabilități

46327
34:50:42,232 --> 34:50:46,000
acolo și poți acoperi nu doar

46328
34:50:43,912 --> 34:50:47,440
trei variabile sau seturi diferite. tu

46329
34:50:46,000 --> 34:50:50,232
acum poate extinde acest lucru la și mai mult

46330
34:50:47,440 --> 34:50:52,640
categorii. Numărul cinci, este rapid. Ea

46331
34:50:50,232 --> 34:50:54,800
poate fi folosit în predicții în timp real.

46332
34:50:52,640 --> 34:50:56,552
Acest lucru este atât de important. Acesta este motivul pentru care este

46333
34:50:54,800 --> 34:50:59,192
folosit în multe dintre predicțiile noastre privind

46334
34:50:56,552 --> 34:51:01,832
cărucioare de cumpărături online, recomandări,

46335
34:50:59,192 --> 34:51:03,832
filtrele de spam, pentru că nu există timp

46336
34:51:01,832 --> 34:51:06,232
întârziere, deoarece trebuie să treacă prin și să figureze

46337
34:51:03,832 --> 34:51:07,832
o rețea neuronală sau una dintre celelalte

46338
34:51:06,232 --> 34:51:09,680
mini-configurații în care faci

46339
34:51:07,832 --> 34:51:10,960
clasificare. Și cu siguranță există o

46340
34:51:09,680 --> 34:51:13,272
multe alte instrumente acolo în

46341
34:51:10,960 --> 34:51:15,440
învățare automată care se poate ocupa de acestea,

46342
34:51:13,272 --> 34:51:17,680
dar majoritatea dintre ei nu sunt la fel de rapizi ca

46343
34:51:15,440 --> 34:51:20,400
golfuri naive. Și apoi, în sfârșit, nu este

46344
34:51:17,680 --> 34:51:21,272
sensibil la caracteristicile irelevante. Deci

46345
34:51:20,400 --> 34:51:23,120
preia diferitele tale

46346
34:51:21,272 --> 34:51:25,192
probabilități. Și dacă ești scurt

46347
34:51:23,120 --> 34:51:27,440
date pe o probabilitate, puteți cam

46348
34:51:25,192 --> 34:51:29,592
se ajustează automat pentru asta. Aceia

46349
34:51:27,440 --> 34:51:31,360
formulele sunt foarte automate. Și așa și tu

46350
34:51:29,592 --> 34:51:33,040
poate deveni încă foarte solid

46351
34:51:31,360 --> 34:51:35,040
predictibilitate chiar dacă lipsești

46352
34:51:33,040 --> 34:51:36,960
date sau aveți date care se suprapun pentru

46353
34:51:35,040 --> 34:51:39,832
două zone complet diferite. Vedem noi

46354
34:51:36,960 --> 34:51:42,000
asta mult in a face recensamant si a studia

46355
34:51:39,832 --> 34:51:44,320
de oameni și obiceiuri acolo unde ar putea

46356
34:51:42,000 --> 34:51:45,760
au un studiu care acoperă un aspect

46357
34:51:44,320 --> 34:51:47,680
si alta care se suprapune si

46358
34:51:45,760 --> 34:51:49,912
deoarece cele două se suprapun pot atunci

46359
34:51:47,680 --> 34:51:51,680
prezice necunoscutele pentru grupul care

46360
34:51:49,912 --> 34:51:53,680
nu au făcut al doilea studiu pe sau

46361
34:51:51,680 --> 34:51:55,360
invers. Deci este foarte puternic în

46362
34:51:53,680 --> 34:51:57,440
că nu este sensibil la

46363
34:51:55,360 --> 34:51:59,680
caracteristici irelevante și de fapt poți

46364
34:51:57,440 --> 34:52:01,760
utilizați-l pentru a ajuta la prezicerea caracteristicilor care

46365
34:51:59,680 --> 34:52:03,440
nici măcar nu sunt acolo. Deci acum suntem jos

46366
34:52:01,760 --> 34:52:05,440
la partea mea preferată. Ne vom rostogoli

46367
34:52:03,440 --> 34:52:06,960
în mânecă și facem ceva real

46368
34:52:05,440 --> 34:52:10,160
programare. Vom face folosirea

46369
34:52:06,960 --> 34:52:12,480
clasificarea textului de caz. Acum, aș face-o

46370
34:52:10,160 --> 34:52:14,640
te provoc să te întorci și să ne trimiți un

46371
34:52:12,480 --> 34:52:16,872
notează la notele de mai jos de sub

46372
34:52:14,640 --> 34:52:18,640
video și solicitați datele pentru

46373
34:52:16,872 --> 34:52:20,720
coș de cumpărături. Deci, puteți conecta asta

46374
34:52:18,640 --> 34:52:22,552
în codul Python și faceți asta pe cont propriu

46375
34:52:20,720 --> 34:52:24,232
timp. Deci, puteți trece prin el de atunci

46376
34:52:22,552 --> 34:52:26,480
parcurgem toate informațiile de pe

46377
34:52:24,232 --> 34:52:28,960
ea. Dar, vom face un cod Python

46378
34:52:26,480 --> 34:52:31,192
efectuarea clasificării textelor. Foarte popular

46379
34:52:28,960 --> 34:52:33,120
pentru a face golfurile naive. Deci, suntem

46380
34:52:31,192 --> 34:52:35,440
vom folosi noul nostru instrument pentru a efectua a

46381
34:52:33,120 --> 34:52:37,592
clasificarea text a titlurilor de știri

46382
34:52:35,440 --> 34:52:39,760
și clasifica știrile în diferite subiecte

46383
34:52:37,592 --> 34:52:42,000
pentru un site de știri. După cum puteți vedea aici,

46384
34:52:39,760 --> 34:52:45,040
avem o imagine frumoasă a Știrilor Google

46385
34:52:42,000 --> 34:52:46,400
și apoi înrudite pe subgrupurile din dreapta.

46386
34:52:45,040 --> 34:52:48,320
Nu sunt sigur de unde au tras de fapt

46387
34:52:46,400 --> 34:52:50,160
datele reale de la care vom folosi.

46388
34:52:48,320 --> 34:52:52,000
Este unul dintre seturile standard, dar

46389
34:52:50,160 --> 34:52:54,232
cu siguranță acest lucru poate fi folosit pe oricare dintre noi

46390
34:52:52,000 --> 34:52:56,080
titluri de știri în clasificare. Deci,

46391
34:52:54,232 --> 34:52:58,872
să vedem cum se poate face folosind

46392
34:52:56,080 --> 34:53:00,232
clasificator de bază naiv. Acum, suntem la mine

46393
34:52:58,872 --> 34:53:02,480
partea preferată. De fapt o vom face

46394
34:53:00,232 --> 34:53:04,232
scrieți niște scripturi Python, rulați-ne

46395
34:53:02,480 --> 34:53:06,640
mâneci și vom începe cu

46396
34:53:04,232 --> 34:53:08,480
făcând importurile noastre. Acestea sunt foarte de bază

46397
34:53:06,640 --> 34:53:10,160
importuri, inclusiv grupul nostru de știri. Şi

46398
34:53:08,480 --> 34:53:11,912
vom arunca o privire rapidă la țintă

46399
34:53:10,160 --> 34:53:13,832
nume. Apoi vom merge înainte și

46400
34:53:11,912 --> 34:53:15,592
începeți să ne antrenați setul de date și să puneți

46401
34:53:13,832 --> 34:53:17,272
ea împreună. Vom pune împreună un frumos

46402
34:53:15,592 --> 34:53:19,360
grafic pentru că întotdeauna e bine să ai un

46403
34:53:17,272 --> 34:53:20,640
grafic pentru a arăta ce se întâmplă. Și o dată

46404
34:53:19,360 --> 34:53:22,160
l-am antrenat și v-am arătat a

46405
34:53:20,640 --> 34:53:24,160
grafic a ceea ce se întâmplă, atunci suntem

46406
34:53:22,160 --> 34:53:26,080
Vom explora cum să-l folosești și să vezi

46407
34:53:24,160 --> 34:53:28,232
cum arată. Acum mă duc

46408
34:53:26,080 --> 34:53:30,080
deschide editorul meu preferat sau inline

46409
34:53:28,232 --> 34:53:31,680
editor pentru Python. Nu trebuie să utilizați

46410
34:53:30,080 --> 34:53:34,552
aceasta. Puteți folosi orice editor

46411
34:53:31,680 --> 34:53:36,480
care vă place, indiferent de interfața IDE

46412
34:53:34,552 --> 34:53:39,040
vrei tu. Acesta se întâmplă să fie

46413
34:53:36,480 --> 34:53:40,640
Caiet Anaconda Jupiter. Și mă duc

46414
34:53:39,040 --> 34:53:42,872
pentru a lipi prima bucată de cod

46415
34:53:40,640 --> 34:53:44,160
aici ca să putem trece prin el. Să

46416
34:53:42,872 --> 34:53:45,832
fă-l puțin mai mare pe ecran, așa că

46417
34:53:44,160 --> 34:53:47,912
ai o vedere frumoasă asupra a ceea ce se întâmplă.

46418
34:53:45,832 --> 34:53:50,480
Uh și folosim Python 3, în asta

46419
34:53:47,912 --> 34:53:53,272
cazul 3.5. Deci asta ar funcționa în oricare dintre

46420
34:53:50,480 --> 34:53:55,272
dvs. 3X dacă l-ați configurat corect.

46421
34:53:53,272 --> 34:53:56,800
ar trebui să funcționeze și în multe dintre cele 2x. tu

46422
34:53:55,272 --> 34:53:58,480
trebuie doar să mă asigur că toate

46423
34:53:56,800 --> 34:54:00,232
versiunile modulelor se potrivesc cu dvs

46424
34:53:58,480 --> 34:54:02,640
Versiunea Python. Și aici, vei

46425
34:54:00,232 --> 34:54:05,832
observați că prima linie este procentul dvs

46426
34:54:02,640 --> 34:54:07,760
biblioteca mattplot în linie. Acum, trei dintre

46427
34:54:05,832 --> 34:54:11,512
aceste linii de cod sunt toate despre

46428
34:54:07,760 --> 34:54:14,000
trasarea graficului. Acesta permite

46429
34:54:11,512 --> 34:54:16,080
notebook-ul știe și este configurat în linie că

46430
34:54:14,000 --> 34:54:18,320
vrem ca graficele să apară în acest sens

46431
34:54:16,080 --> 34:54:20,872
pagina. Fără el, într-un caiet ca

46432
34:54:18,320 --> 34:54:23,512
aceasta, care este o interfață de explorator, ea

46433
34:54:20,872 --> 34:54:25,760
nu va apărea. Acum, multe IDE-uri nu

46434
34:54:23,512 --> 34:54:27,512
cere asta. Multe dintre ele, ca pe dacă

46435
34:54:25,760 --> 34:54:29,512
Lucrez la una dintre celelalte configurații ale mele,

46436
34:54:27,512 --> 34:54:31,760
are doar o fereastră pop-up și graficul apare

46437
34:54:29,512 --> 34:54:33,592
acolo sus. Deci, aveți o astfel de configurație

46438
34:54:31,760 --> 34:54:35,592
de asemenea. Dar pentru asta, vrem mattplot

46439
34:54:33,592 --> 34:54:39,040
bibliotecă la rând. Și apoi vom merge

46440
34:54:35,592 --> 34:54:40,800
import numpy ca np. Acesta este numărul

46441
34:54:39,040 --> 34:54:43,512
python, care are multe diferite

46442
34:54:40,800 --> 34:54:46,000
formule din el pe care le folosim pentru ambele

46443
34:54:43,512 --> 34:54:48,000
modulul nostru sklearn. Și îl folosim și noi

46444
34:54:46,000 --> 34:54:49,760
pentru oricare dintre funcțiile matematice superioare în

46445
34:54:48,000 --> 34:54:53,040
piton. Și este foarte comun să vezi asta

46446
34:54:49,760 --> 34:54:55,272
ca NP numpy ca NP. Următoarele două rânduri

46447
34:54:53,040 --> 34:54:56,960
sunt toate despre graficele noastre. ține minte eu

46448
34:54:55,272 --> 34:54:58,160
a spus că trei dintre acestea erau despre graficare.

46449
34:54:56,960 --> 34:54:59,680
Ei bine, avem nevoie de mattplot-ul nostru

46450
34:54:58,160 --> 34:55:02,232
bibliotecă.pipplot

46451
34:54:59,680 --> 34:55:04,640
ca plt. Și veți vedea că plt este a

46452
34:55:02,232 --> 34:55:06,640
configurație foarte comună, așa cum este sns și just

46453
34:55:04,640 --> 34:55:09,192
ca np. Și o să importam

46454
34:55:06,640 --> 34:55:13,120
seabor ca sns si o sa facem

46455
34:55:09,192 --> 34:55:15,272
sns set. Acum seabor stă deasupra

46456
34:55:13,120 --> 34:55:17,040
pipplot și face un lucru foarte frumos

46457
34:55:15,272 --> 34:55:18,320
harta termică. Este foarte bun pentru căldură

46458
34:55:17,040 --> 34:55:19,912
hărți. Și dacă nu ești familiarizat cu

46459
34:55:18,320 --> 34:55:22,640
hărți termice, asta înseamnă doar că îi dăm un

46460
34:55:19,912 --> 34:55:25,040
scara de culori. Termenul provine de la

46461
34:55:22,640 --> 34:55:26,872
mai aprins este roșu, cu atât este mai fierbinte

46462
34:55:25,040 --> 34:55:28,640
o anumită formă de date. Și îl poți seta la

46463
34:55:26,872 --> 34:55:30,552
orice vrei tu. Și asta vom vedea

46464
34:55:28,640 --> 34:55:32,000
mai târziu. Deci acelea vei vedea că acelea

46465
34:55:30,552 --> 34:55:33,832
trei linii de cod aici sunt doar

46466
34:55:32,000 --> 34:55:36,480
importând funcția graph ca să putem

46467
34:55:33,832 --> 34:55:38,000
grafică-l. Și în calitate de cercetător al datelor, tu

46468
34:55:36,480 --> 34:55:39,440
doresc întotdeauna să vă grafic datele și aveți

46469
34:55:38,000 --> 34:55:41,040
un fel de vizual. Este foarte greu

46470
34:55:39,440 --> 34:55:42,552
doar pentru a împinge numere în fața oamenilor

46471
34:55:41,040 --> 34:55:45,440
și se uită la asta și nu înseamnă

46472
34:55:42,552 --> 34:55:47,912
orice. Și apoi din datele sklearn

46473
34:55:45,440 --> 34:55:50,232
seturi, vom importa preluarea 20

46474
34:55:47,912 --> 34:55:52,720
grupuri de știri. Una foarte comună pentru

46475
34:55:50,232 --> 34:55:54,480
analizarea cuvintelor tokenizante și setarea

46476
34:55:52,720 --> 34:55:55,912
să le ridice și să exploreze modul în care funcționează cuvintele

46477
34:55:54,480 --> 34:55:56,800
și cum clasificați diferite

46478
34:55:55,912 --> 34:55:58,800
lucruri când ai de-a face

46479
34:55:56,800 --> 34:56:01,272
documente. Și apoi ne setăm datele

46480
34:55:58,800 --> 34:56:03,512
egal cu 20 de grupuri de știri. Deci al nostru

46481
34:56:01,272 --> 34:56:04,720
variabila de date va avea datele în ea.

46482
34:56:03,512 --> 34:56:07,040
Și vom merge înainte și doar

46483
34:56:04,720 --> 34:56:08,400
tipăriți numele țintei. date.ţintă

46484
34:56:07,040 --> 34:56:11,272
nume. Și să vedem cum arată

46485
34:56:08,400 --> 34:56:14,640
ca. Și veți vedea aici că avem alt

46486
34:56:11,272 --> 34:56:16,232
ateism comp grafică composs

46487
34:56:14,640 --> 34:56:18,480
ferestre.diverse

46488
34:56:16,232 --> 34:56:20,080
și merge până la capăt pentru a vorbi

46489
34:56:18,480 --> 34:56:22,000
politică.vorbire diverse

46490
34:56:20,080 --> 34:56:24,080
religie.diverse. Acestea sunt

46491
34:56:22,000 --> 34:56:26,720
categoriile cărora le-au deja atribuit

46492
34:56:24,080 --> 34:56:27,680
acest grup de știri și se numește fetch 20

46493
34:56:26,720 --> 34:56:29,592
pentru că vei vedea că eu cred

46494
34:56:27,680 --> 34:56:31,760
sunt 20 de subiecte diferite aici sau

46495
34:56:29,592 --> 34:56:33,680
20 de categorii diferite pe măsură ce derulăm

46496
34:56:31,760 --> 34:56:35,040
jos. Acum, am trecut prin cele 20

46497
34:56:33,680 --> 34:56:37,512
diferite categorii și o vom face

46498
34:56:35,040 --> 34:56:39,832
mergeți mai departe și începeți să definiți toate

46499
34:56:37,512 --> 34:56:41,040
categorii și configurați datele noastre. Deci,

46500
34:56:39,832 --> 34:56:43,120
de fapt ajungem aici și mergem

46501
34:56:41,040 --> 34:56:44,872
înainte și obțineți-l, configurați toate datele

46502
34:56:43,120 --> 34:56:47,440
și aruncați o privire la datele noastre. Și haideți

46503
34:56:44,872 --> 34:56:49,912
mutați acest lucru în caietul nostru Jupyter.

46504
34:56:47,440 --> 34:56:51,040
Și să vedem ce face acest cod.

46505
34:56:49,912 --> 34:56:53,440
În primul rând, ne vom seta

46506
34:56:51,040 --> 34:56:54,960
categorii. Acum, dacă ai observat aici sus,

46507
34:56:53,440 --> 34:56:58,320
Aș fi putut seta asta la fel de ușor

46508
34:56:54,960 --> 34:57:00,400
egal cu data.target_names nume țintă

46509
34:56:58,320 --> 34:57:01,592
pentru că este același lucru, dar ne dorim

46510
34:57:00,400 --> 34:57:03,272
să-ți spună oarecum pentru tine, așa că tu

46511
34:57:01,592 --> 34:57:04,720
pot vedea diferitele categorii. Ea

46512
34:57:03,272 --> 34:57:06,000
într-un fel îl face mai vizual, astfel încât să poți

46513
34:57:04,720 --> 34:57:08,080
vezi cum arată datele tale

46514
34:57:06,000 --> 34:57:10,552
fundalul. Odată ce am creat

46515
34:57:08,080 --> 34:57:13,832
categorii, vom deschide un

46516
34:57:10,552 --> 34:57:16,160
garnitură de tren. Deci acest set de date de antrenament

46517
34:57:13,832 --> 34:57:18,480
va intra în 20 de grupuri de știri

46518
34:57:16,160 --> 34:57:20,480
și este un subset acolo numit tren

46519
34:57:18,480 --> 34:57:22,320
iar categoriile sunt egale cu categorii. Deci

46520
34:57:20,480 --> 34:57:24,232
scoatem acele categorii care

46521
34:57:22,320 --> 34:57:25,760
meci. Și apoi, dacă ai un tren,

46522
34:57:24,232 --> 34:57:27,440
ar trebui să aveți și setul de testare. Noi

46523
34:57:25,760 --> 34:57:29,680
au testul echivalează cu 20 de grupuri de știri

46524
34:57:27,440 --> 34:57:32,320
submultul este egal cu testul și categoriile este egal

46525
34:57:29,680 --> 34:57:34,480
categorii. Să coborâm o dimensiune, așa că

46526
34:57:32,320 --> 34:57:35,832
totul se potrivește pe ecranul meu. Iată-ne. Şi

46527
34:57:34,480 --> 34:57:37,760
doar ca să vedem cu adevărat ce se întâmplă

46528
34:57:35,832 --> 34:57:42,080
pornit, să vedem ce se întâmplă când imprimăm

46529
34:57:37,760 --> 34:57:44,640
scoateți o parte din acele date. Deci creează

46530
34:57:42,080 --> 34:57:46,232
tren și sub tren, creează tren

46531
34:57:44,640 --> 34:57:48,720
date. Și o să ne uităm doar la

46532
34:57:46,232 --> 34:57:50,000
piesa de date numărul cinci. Și să mergem

46533
34:57:48,720 --> 34:57:52,160
înainte și rulează asta și vezi ce aia

46534
34:57:50,000 --> 34:57:55,440
arata ca. Și puteți vedea când imprim

46535
34:57:52,160 --> 34:57:57,040
tren.date date numărul cinci sub tren.

46536
34:57:55,440 --> 34:57:58,720
Tipărește unul dintre articole. Aceasta

46537
34:57:57,040 --> 34:58:00,960
este articolul numărul cinci. Poți merge

46538
34:57:58,720 --> 34:58:03,360
prin și citește-l acolo. Și putem

46539
34:58:00,960 --> 34:58:05,120
de asemenea, intră aici și schimbă asta pentru a testa,

46540
34:58:03,360 --> 34:58:06,480
care ar trebui să arate identic pentru că este

46541
34:58:05,120 --> 34:58:08,800
împărțirea datei în diferite

46542
34:58:06,480 --> 34:58:10,800
grupuri. Antrenează-te și testează. Și vom vedea

46543
34:58:08,800 --> 34:58:12,232
testul numărul cinci este diferit

46544
34:58:10,800 --> 34:58:14,320
articol, dar este un alt articol în

46545
34:58:12,232 --> 34:58:16,320
aici. Și poate ești curios și tu

46546
34:58:14,320 --> 34:58:21,040
vreau să văd câte articole sunt

46547
34:58:16,320 --> 34:58:23,832
aici. Am putea face lungimea trenului.

46548
34:58:21,040 --> 34:58:27,760
date. Și dacă vom rula asta, vei vedea

46549
34:58:23,832 --> 34:58:29,512
că datele de antrenament au 11.314

46550
34:58:27,760 --> 34:58:30,872
articole. Deci, nu vom merge

46551
34:58:29,512 --> 34:58:32,960
prin toate acele articole. Asta e mult

46552
34:58:30,872 --> 34:58:34,400
de articole, dar ne putem uita la unul

46553
34:58:32,960 --> 34:58:35,912
dintre ele doar ca să poți vedea ce fel de

46554
34:58:34,400 --> 34:58:37,272
informația iese din el și ce

46555
34:58:35,912 --> 34:58:39,120
ne uităm. Și ne vom uita doar la

46556
34:58:37,272 --> 34:58:41,360
numărul cinci pentru azi. Și aici avem

46557
34:58:39,120 --> 34:58:45,680
ea. Recompensând ID-urile celui de-al doilea amendament,

46558
34:58:41,360 --> 34:58:47,120
VTT, linia 58, rândurile 58 în articol, uh

46559
34:58:45,680 --> 34:58:48,480
etc. Și puteți derula până la capăt

46560
34:58:47,120 --> 34:58:50,080
și vezi toate părțile diferite pentru

46561
34:58:48,480 --> 34:58:51,440
acolo. Acum, ne-am uitat la asta și

46562
34:58:50,080 --> 34:58:52,960
asta e destul de complicat cand te uiti

46563
34:58:51,440 --> 34:58:54,800
la unul dintre aceste articole pentru a încerca să

46564
34:58:52,960 --> 34:58:56,000
dă-ți seama cum cântărești asta. Dacă

46565
34:58:54,800 --> 34:58:58,400
te uiți aici jos, avem diferit

46566
34:58:56,000 --> 34:59:00,160
cuvinte și poate cuvântul de la. Bine,

46567
34:58:58,400 --> 34:59:02,000
din este probabil în toate articolele.

46568
34:59:00,160 --> 34:59:03,760
Deci, nu va avea multe

46569
34:59:02,000 --> 34:59:05,440
adică în măsura în care încercarea de a da seama

46570
34:59:03,760 --> 34:59:06,960
dacă acest articol se potrivește cu unul dintre

46571
34:59:05,440 --> 34:59:09,040
categorii sau nu. Deci, încercând să-mi dau seama

46572
34:59:06,960 --> 34:59:10,800
pe baza în care categorie se încadrează

46573
34:59:09,040 --> 34:59:12,872
aceste cuvinte este locul unde vine provocarea

46574
34:59:10,800 --> 34:59:14,960
in. Acum că ne-am vizualizat datele,

46575
34:59:12,872 --> 34:59:17,040
ne vom scufunda și vom face realitatea

46576
34:59:14,960 --> 34:59:18,800
previziuni. Acesta este adevăratul naiv

46577
34:59:17,040 --> 34:59:20,552
golfuri. Și o să aruncăm altul

46578
34:59:18,800 --> 34:59:22,160
model la tine sau alt modul la tine

46579
34:59:20,552 --> 34:59:23,912
aici într-o secundă. Nu putem intra

46580
34:59:22,160 --> 34:59:26,640
prea multe detalii, dar se ocupă

46581
34:59:23,912 --> 34:59:28,480
lucrând în mod specific cu cuvinte și text

46582
34:59:26,640 --> 34:59:31,040
şi ceea ce ei numesc tokenizarea celor

46583
34:59:28,480 --> 34:59:33,120
cuvinte. Deci, să luăm acest cod și

46584
34:59:31,040 --> 34:59:35,120
hai să trecem la Jupyter-ul nostru

46585
34:59:33,120 --> 34:59:36,480
caiet și parcurge-l. Și aici

46586
34:59:35,120 --> 34:59:38,480
suntem în caietul nostru Jupyter. Să

46587
34:59:36,480 --> 34:59:39,760
lipiți asta acolo. Și pot rula asta

46588
34:59:38,480 --> 34:59:41,680
cod imediat. Nu este

46589
34:59:39,760 --> 34:59:44,480
de fapt o să afișeze ceva încă,

46590
34:59:41,680 --> 34:59:46,320
dar se întâmplă multe aici. Deci

46591
34:59:44,480 --> 34:59:47,832
partea de sus aveam modulul de imprimare de la

46592
34:59:46,320 --> 34:59:49,360
unul mai devreme. Nu știam de ce

46593
34:59:47,832 --> 34:59:51,832
acolo. Deci vom începe cu

46594
34:59:49,360 --> 34:59:53,760
importând pachetele noastre necesare. Şi

46595
34:59:51,832 --> 34:59:55,512
din caracteristicile sklearn

46596
34:59:53,760 --> 34:59:59,040
extraction.ext,

46597
34:59:55,512 --> 35:00:00,480
vom importa vectorzer TF IDF.

46598
34:59:59,040 --> 35:00:03,040
Ți-am spus că vom arunca un modul

46599
35:00:00,480 --> 35:00:04,872
la tine. Nu putem intra prea mult în

46600
35:00:03,040 --> 35:00:06,960
matematica din spatele acestui lucru sau cum funcționează. tu

46601
35:00:04,872 --> 35:00:09,680
poate căuta. Notația pentru

46602
35:00:06,960 --> 35:00:11,440
matematica este de obicei TF.idf.

46603
35:00:09,680 --> 35:00:14,080
Și acesta este doar un mod de a cântări

46604
35:00:11,440 --> 35:00:16,480
cuvinte. și cântărește cuvintele pe baza

46605
35:00:14,080 --> 35:00:18,552
de câte ori sunt utilizate într-un document,

46606
35:00:16,480 --> 35:00:20,320
de câte ori sau câte documente

46607
35:00:18,552 --> 35:00:21,912
sunt folosite în. Și este un bine folosit

46608
35:00:20,320 --> 35:00:23,760
formula. Există de ceva vreme.

46609
35:00:21,912 --> 35:00:25,760
Este puțin confuz să introduci asta

46610
35:00:23,760 --> 35:00:27,592
aici. Uh, dar hai să le anunțăm asta

46611
35:00:25,760 --> 35:00:29,760
pur și simplu intră acolo și cântărește

46612
35:00:27,592 --> 35:00:31,440
cuvinte diferite din document pentru noi.

46613
35:00:29,760 --> 35:00:33,192
În acest fel, nu trebuie să așteptăm. Și dacă

46614
35:00:31,440 --> 35:00:34,552
ai pus o greutate pe el, dacă îți amintești,

46615
35:00:33,192 --> 35:00:36,480
Despre asta vorbeam aici sus

46616
35:00:34,552 --> 35:00:38,160
mai devreme. Dacă toate acestea sunt e-mailuri, ele

46617
35:00:36,480 --> 35:00:40,320
probabil că toți au cuvântul din ele.

46618
35:00:38,160 --> 35:00:41,680
De la probabil are o greutate foarte mică. Ea

46619
35:00:40,320 --> 35:00:43,680
are foarte puțină valoare să vă spună

46620
35:00:41,680 --> 35:00:46,800
despre ce este vorba în acest document. La fel cu

46621
35:00:43,680 --> 35:00:50,232
cuvinte ca într-un articol din articole în

46622
35:00:46,800 --> 35:00:53,680
costul unui poate cost ar putea sau unde

46623
35:00:50,232 --> 35:00:55,120
cuvinte precum distrugerea armelor criminale

46624
35:00:53,680 --> 35:00:56,320
acestea ar putea avea o greutate mai mare

46625
35:00:55,120 --> 35:00:58,160
pentru că descriu un pic mai mult

46626
35:00:56,320 --> 35:00:59,832
ce face articolul. Ei bine, cum

46627
35:00:58,160 --> 35:01:01,760
îţi dai seama toate acele greutăţi din

46628
35:00:59,832 --> 35:01:04,400
articole diferite? Asta este

46629
35:01:01,760 --> 35:01:06,320
modulul face. Asta este TF

46630
35:01:04,400 --> 35:01:07,592
vectorizer va face pentru noi. Şi

46631
35:01:06,320 --> 35:01:10,400
apoi o să ne importăm

46632
35:01:07,592 --> 35:01:14,640
sklearn.na golfuri naive și asta e al nostru

46633
35:01:10,400 --> 35:01:15,832
multinomial NB multinomial naiv bay

46634
35:01:14,640 --> 35:01:17,832
destul de ușor de înțeles că unde

46635
35:01:15,832 --> 35:01:21,760
care vine de la și apoi în sfârșit avem

46636
35:01:17,832 --> 35:01:23,512
conducta skyarn import make pipeline

46637
35:01:21,760 --> 35:01:25,440
acum conducta de fabricație este doar o mișto

46638
35:01:23,512 --> 35:01:28,640
bucată de cod pentru că o vom face

46639
35:01:25,440 --> 35:01:31,040
luați informațiile pe care le primim de la TF

46640
35:01:28,640 --> 35:01:35,592
vectorizator și vom pompa asta

46641
35:01:31,040 --> 35:01:38,160
în multinomul NB. Deci, o conductă

46642
35:01:35,592 --> 35:01:40,480
este doar un mod de a organiza lucrurile

46643
35:01:38,160 --> 35:01:41,760
curgere. Este folosit în mod obișnuit. Probabil tu

46644
35:01:40,480 --> 35:01:43,272
deja am ghicit ce este. Dacă ai

46645
35:01:41,760 --> 35:01:46,232
făcut orice afaceri, ei vorbesc despre

46646
35:01:43,272 --> 35:01:48,000
conductă de vânzări. Dacă faci parte dintr-un echipaj de lucru

46647
35:01:46,232 --> 35:01:49,592
sau manager de proiect, aveți dvs

46648
35:01:48,000 --> 35:01:51,120
canalul de informații care merge

46649
35:01:49,592 --> 35:01:52,960
prin sau proiectele tale și ce trebuie

46650
35:01:51,120 --> 35:01:55,192
se face în ce ordine. Asta e tot

46651
35:01:52,960 --> 35:01:57,192
conducta este. O să luăm

46652
35:01:55,192 --> 35:02:00,872
TFID vectorzer și apoi vom merge

46653
35:01:57,192 --> 35:02:03,360
împinge asta în multinomul inb. Acum

46654
35:02:00,872 --> 35:02:05,592
am desemnat-o ca variabilă

46655
35:02:03,360 --> 35:02:08,000
model. Avem modelul nostru de conductă și

46656
35:02:05,592 --> 35:02:09,760
vom lua acel model și asta

46657
35:02:08,000 --> 35:02:13,040
este atât de elegant. Acest lucru se face doar

46658
35:02:09,760 --> 35:02:15,440
câteva linii de cod. model.potrivit si

46659
35:02:13,040 --> 35:02:17,760
vom potrivi datele. Și mai întâi

46660
35:02:15,440 --> 35:02:20,872
datele trenului și apoi trenul

46661
35:02:17,760 --> 35:02:22,320
tinta. Acum datele trenului au

46662
35:02:20,872 --> 35:02:24,232
diferite articole din ea. Poți vedea

46663
35:02:22,320 --> 35:02:26,872
cel la care tocmai ne uitam și cel

46664
35:02:24,232 --> 35:02:28,800
tren.țintă este ce categorie

46665
35:02:26,872 --> 35:02:30,800
au catalogat deja că aceea

46666
35:02:28,800 --> 35:02:33,192
articol anume ca. Și ce este

46667
35:02:30,800 --> 35:02:36,552
se întâmplă aici sunt datele trenului

46668
35:02:33,192 --> 35:02:38,232
intrând în vectorizatorul TF ID. Deci când

46669
35:02:36,552 --> 35:02:40,400
ai unul dintre aceste articole, merge

46670
35:02:38,232 --> 35:02:42,160
acolo, cântărește toate cuvintele

46671
35:02:40,400 --> 35:02:43,440
acolo. Deci sunt mii de cuvinte

46672
35:02:42,160 --> 35:02:44,872
cu greutăți diferite pe ele. eu

46673
35:02:43,440 --> 35:02:48,320
Amintește-ți că ai executat odată un model pe asta

46674
35:02:44,872 --> 35:02:50,400
și am avut literalmente 2,4 milioane de jetoane

46675
35:02:48,320 --> 35:02:52,640
intra in asta. Deci când ai de-a face

46676
35:02:50,400 --> 35:02:54,800
ca baze de documente mari, puteți avea

46677
35:02:52,640 --> 35:02:56,872
un număr mare de cuvinte diferite. Ea

46678
35:02:54,800 --> 35:02:59,040
apoi ia acele cuvinte, le dă a

46679
35:02:56,872 --> 35:03:00,872
greutate și apoi pe baza acelei greutăți,

46680
35:02:59,040 --> 35:03:03,760
pe baza cuvintelor și a greutăților și

46681
35:03:00,872 --> 35:03:06,480
apoi pune asta în multinomul NB.

46682
35:03:03,760 --> 35:03:08,232
Și odată ce intrăm în golful nostru naiv, noi

46683
35:03:06,480 --> 35:03:10,872
vreau să pun ținta trenului acolo.

46684
35:03:08,232 --> 35:03:14,000
Deci datele trenului la care au fost mapate

46685
35:03:10,872 --> 35:03:16,080
vectorzerul TFID trece acum

46686
35:03:14,000 --> 35:03:18,000
multinomul NB. Și atunci suntem

46687
35:03:16,080 --> 35:03:19,512
spunându-l, ei bine, acestea sunt răspunsurile.

46688
35:03:18,000 --> 35:03:21,440
Acestea sunt răspunsurile la diferite

46689
35:03:19,512 --> 35:03:23,272
documente. Deci acest document care are toate

46690
35:03:21,440 --> 35:03:25,512
aceste cuvinte cu aceste greutăți diferite

46691
35:03:23,272 --> 35:03:27,592
din prima parte va fi

46692
35:03:25,512 --> 35:03:30,960
indiferent de categoria din care iese. Poate

46693
35:03:27,592 --> 35:03:33,440
este emisiunea um talk-show-ul sau articolul despre

46694
35:03:30,960 --> 35:03:36,400
religie diverse. Odată ce ne potrivim asta

46695
35:03:33,440 --> 35:03:38,000
model, putem apoi să luăm etichete și suntem

46696
35:03:36,400 --> 35:03:41,192
urmând a seta că egal cu

46697
35:03:38,000 --> 35:03:43,440
model.predic. Majoritatea utilizării sklearn

46698
35:03:41,192 --> 35:03:45,592
termenul.predict pentru a ne anunța că

46699
35:03:43,440 --> 35:03:46,872
acum am antrenat modelul și acum noi

46700
35:03:45,592 --> 35:03:48,720
vrei să obții niște răspunsuri. Și suntem

46701
35:03:46,872 --> 35:03:50,720
vom pune acolo datele noastre de testare

46702
35:03:48,720 --> 35:03:52,872
pentru că datele noastre de testare sunt lucrurile pe care le avem

46703
35:03:50,720 --> 35:03:54,160
ținut în lateral. Nu l-am antrenat noi

46704
35:03:52,872 --> 35:03:55,760
acolo și nu știm ce se întâmplă

46705
35:03:54,160 --> 35:03:57,760
să ieșim din asta și vrem doar să o facem

46706
35:03:55,760 --> 35:03:59,592
află cât de bune sunt etichetele noastre. Do

46707
35:03:57,760 --> 35:04:01,120
se potrivesc cu ceea ce ar trebui să fie? Acum,

46708
35:03:59,592 --> 35:04:03,440
Am trecut deja prin asta. Există

46709
35:04:01,120 --> 35:04:05,360
nicio ieșire reală de afișat. Aceasta este

46710
35:04:03,440 --> 35:04:07,192
doar pune la punct totul. Acesta este doar

46711
35:04:05,360 --> 35:04:08,960
antrenarea modelului nostru, creând etichetele

46712
35:04:07,192 --> 35:04:10,800
ca să vedem cât de bine este și apoi

46713
35:04:08,960 --> 35:04:13,120
trecem la pasul următor pentru a afla

46714
35:04:10,800 --> 35:04:15,040
ce sa întâmplat. Pentru a face asta, mergem

46715
35:04:13,120 --> 35:04:18,872
pentru a merge înainte și a crea o confuzie

46716
35:04:15,040 --> 35:04:21,192
matrice și o hartă termică. Deci, confuzia

46717
35:04:18,872 --> 35:04:23,760
matrice, care este confuză doar prin ea

46718
35:04:21,192 --> 35:04:26,232
chiar numele, practic va întreba cum

46719
35:04:23,760 --> 35:04:28,320
confuz este răspunsul nostru. A înțeles

46720
35:04:26,232 --> 35:04:30,480
corect sau a omis unele lucruri în

46721
35:04:28,320 --> 35:04:31,680
există sau au niște etichete ratate? Şi

46722
35:04:30,480 --> 35:04:33,512
apoi o să punem asta pe căldură

46723
35:04:31,680 --> 35:04:35,760
harta, așa că avem niște culori frumoase la care să ne uităm

46724
35:04:33,512 --> 35:04:37,440
pentru a vedea cum se complotează. Să mergem

46725
35:04:35,760 --> 35:04:39,192
înainte și luați acest cod și vedeți cum

46726
35:04:37,440 --> 35:04:41,192
că face o plimbare prin ea și vezi

46727
35:04:39,192 --> 35:04:42,872
cum arată. Deci, înapoi la noi

46728
35:04:41,192 --> 35:04:45,912
Caietul Jupyter. Am de gând să pun

46729
35:04:42,872 --> 35:04:48,720
cod acolo și hai să mergem mai departe și să alergăm

46730
35:04:45,912 --> 35:04:50,232
acel cod. Ia-o doar un moment. Şi

46731
35:04:48,720 --> 35:04:53,040
Amintiți-vă, am avut în linie. Astfel,

46732
35:04:50,232 --> 35:04:54,552
Graficul meu apare pe linie aici.

46733
35:04:53,040 --> 35:04:56,080
Și să parcurgem codul și apoi

46734
35:04:54,552 --> 35:04:58,400
ne uitam la asta si vedem ce aia

46735
35:04:56,080 --> 35:05:00,400
înseamnă. Deci, fă-l puțin mai mare.

46736
35:04:58,400 --> 35:05:02,720
Iată-ne. Nu există niciun motiv pentru a nu folosi

46737
35:05:00,400 --> 35:05:05,272
tot ecranul. Prea mare. Deci, avem aici

46738
35:05:02,720 --> 35:05:07,440
din sklearn metrics import confuzie

46739
35:05:05,272 --> 35:05:10,640
matricea. Și asta se va întâmpla

46740
35:05:07,440 --> 35:05:14,552
generează un set de date care spune I the

46741
35:05:10,640 --> 35:05:16,160
predicția a fost așa de adevărul real

46742
35:05:14,552 --> 35:05:17,440
fie era de acord cu asta, fie era ceva

46743
35:05:16,160 --> 35:05:18,800
diferite. Și se va aduna

46744
35:05:17,440 --> 35:05:20,800
acele numere ca să putem arunca o privire și

46745
35:05:18,800 --> 35:05:22,800
doar vezi cât de bine a funcționat. Și suntem

46746
35:05:20,800 --> 35:05:25,272
mergând să setați o variabilă Mat egală cu

46747
35:05:22,800 --> 35:05:27,272
matricea de confuzie. Avem testul nostru

46748
35:05:25,272 --> 35:05:29,832
țintă, datele noastre de testare care nu făceau parte

46749
35:05:27,272 --> 35:05:31,760
a instruirii. Foarte important în date

46750
35:05:29,832 --> 35:05:34,400
știință, păstrăm întotdeauna datele noastre de testare

46751
35:05:31,760 --> 35:05:36,800
separate. Altfel, nu este valabil

46752
35:05:34,400 --> 35:05:38,800
model dacă nu îl putem testa corect

46753
35:05:36,800 --> 35:05:40,480
date noi. Și acestea sunt etichetele noi

46754
35:05:38,800 --> 35:05:42,000
creat din acele date de testare. Acestea sunt

46755
35:05:40,480 --> 35:05:44,080
cele pe care le prezicem că se va întâmpla

46756
35:05:42,000 --> 35:05:47,192
fi. Deci, intrăm și ne creăm SN

46757
35:05:44,080 --> 35:05:50,080
harta termică. SNS este născutul nostru pe mare care

46758
35:05:47,192 --> 35:05:53,760
se așează deasupra pilotului. Deci, noi creăm

46759
35:05:50,080 --> 35:05:57,360
o hartă SNS.heet. Ne luăm confuzia

46760
35:05:53,760 --> 35:05:59,912
matrice și va fi uh mat.t.

46761
35:05:57,360 --> 35:06:02,480
Și apoi avem și alte variabile care merg

46762
35:05:59,912 --> 35:06:04,080
în harta termică SNS. Nu mergem

46763
35:06:02,480 --> 35:06:06,232
pentru a intra în detaliu care sunt toate variabilele

46764
35:06:04,080 --> 35:06:07,832
înseamnă. Adnotarea este egală cu adevărat. Asta e

46765
35:06:06,232 --> 35:06:11,360
ce îi spune să pună numerele aici.

46766
35:06:07,832 --> 35:06:13,832
Deci ai 166, unul, 00001.

46767
35:06:11,360 --> 35:06:16,552
Formatul D și C bara este egală cu false trebuie să

46768
35:06:13,832 --> 35:06:17,680
face cu formatul uh. Dacă le iei

46769
35:06:16,552 --> 35:06:19,592
afară, vei vedea că unele lucruri

46770
35:06:17,680 --> 35:06:21,592
dispare. Și apoi etichetele de bifă X

46771
35:06:19,592 --> 35:06:23,512
și etichetele de bifă Y. Acestea sunt ale noastre

46772
35:06:21,592 --> 35:06:26,232
nume țintă. Și poți vedea bine

46773
35:06:23,512 --> 35:06:29,272
aici, acesta este comp. alt ateism

46774
35:06:26,232 --> 35:06:32,552
graphics composs windows.miscellaneous.

46775
35:06:29,272 --> 35:06:35,360
Și apoi, în sfârșit, avem plt.xl

46776
35:06:32,552 --> 35:06:37,512
eticheta. Amintiți-vă de SNS sau de mare

46777
35:06:35,360 --> 35:06:39,832
se află deasupra bibliotecii noastre mattplot our

46778
35:06:37,512 --> 35:06:41,832
plt. Și așa vrem să-i spunem doar x

46779
35:06:39,832 --> 35:06:44,640
eticheta este egal cu un adevărat este adevărat. The

46780
35:06:41,832 --> 35:06:47,440
etichetele sunt adevărate. Și apoi eticheta y este

46781
35:06:44,640 --> 35:06:49,512
eticheta de predicție. Deci, când spunem un adevărat,

46782
35:06:47,440 --> 35:06:51,832
asta este de fapt. Iar cel

46783
35:06:49,512 --> 35:06:53,192
predicția este ceea ce am prezis. Şi

46784
35:06:51,832 --> 35:06:54,640
să ne uităm la acest grafic pentru că asta este

46785
35:06:53,192 --> 35:06:56,400
probabil un pic confuz în felul în care eu

46786
35:06:54,640 --> 35:06:58,000
zdrăngănit prin ea. Și la ce mă duc

46787
35:06:56,400 --> 35:07:00,640
să fac este să merg înainte și să întorc

46788
35:06:58,000 --> 35:07:02,232
înapoi la diapozitive pentru că au o

46789
35:07:00,640 --> 35:07:03,592
fundal negru au pus acolo că

46790
35:07:02,232 --> 35:07:04,872
îl ajută să strălucească puțin mai bine așa că

46791
35:07:03,592 --> 35:07:07,832
puteți vedea puțin graficul

46792
35:07:04,872 --> 35:07:09,592
mai usor. Deci, citind acest grafic, ce

46793
35:07:07,832 --> 35:07:11,512
vrem să vedem cum este culoarea

46794
35:07:09,592 --> 35:07:14,480
schema a iesit. Și vei vedea a

46795
35:07:11,512 --> 35:07:16,640
linia dreapta jos pe mijloc în diagonală

46796
35:07:14,480 --> 35:07:18,872
din stânga sus până în dreapta jos. Ce

46797
35:07:16,640 --> 35:07:21,120
adică dacă te uiți la etichete, noi

46798
35:07:18,872 --> 35:07:23,272
au eticheta noastră prezisă în stânga și

46799
35:07:21,120 --> 35:07:25,360
adevărata noastră etichetă din dreapta. Acestea sunt

46800
35:07:23,272 --> 35:07:27,120
numerele în care predicția și

46801
35:07:25,360 --> 35:07:28,552
adevărul se adună. Și asta este ceea ce noi

46802
35:07:27,120 --> 35:07:30,480
vrem să vedem este vrem să le vedem pe acelea aprinse

46803
35:07:28,552 --> 35:07:32,800
sus. Asta face harta termică. Ca

46804
35:07:30,480 --> 35:07:34,640
puteți vedea că a făcut o treabă bună

46805
35:07:32,800 --> 35:07:36,480
găsirea acestor date. Și vei observa

46806
35:07:34,640 --> 35:07:38,720
că sunt câteva pete roșii pe

46807
35:07:36,480 --> 35:07:40,000
acolo unde a ratat. Știi, așa este

46808
35:07:38,720 --> 35:07:42,800
un pic confuz când vorbim despre

46809
35:07:40,000 --> 35:07:45,440
vorbi despre religie diverse versus vorbire

46810
35:07:42,800 --> 35:07:47,760
politică diverse, religie socială

46811
35:07:45,440 --> 35:07:49,912
Creștin versus alt ateism. Ea

46812
35:07:47,760 --> 35:07:51,360
a etichetat greșit pe unele dintre acestea. Și acestea sunt

46813
35:07:49,912 --> 35:07:53,192
subiecte foarte asemanatoare. deci ai putea

46814
35:07:51,360 --> 35:07:55,272
înțelegeți de ce le-ar putea eticheta greșit.

46815
35:07:53,192 --> 35:07:56,960
Dar, per total, a făcut o treabă destul de bună.

46816
35:07:55,272 --> 35:07:58,400
Dacă vom crea aceste modele,

46817
35:07:56,960 --> 35:08:00,160
vrem să mergem înainte și să putem folosi

46818
35:07:58,400 --> 35:08:02,720
ei. Deci, să vedem cum arată

46819
35:08:00,160 --> 35:08:05,272
ca. Pentru a face asta, să mergem înainte și

46820
35:08:02,720 --> 35:08:06,552
creați o definiție, o funcție de rulat.

46821
35:08:05,272 --> 35:08:08,160
Și vom apela această funcție.

46822
35:08:06,552 --> 35:08:10,320
Lasă-mă să extind asta doar o crestătură

46823
35:08:08,160 --> 35:08:12,232
aici. Iată-ne. Îmi place al meu în mare

46824
35:08:10,320 --> 35:08:14,160
scrisori. Predicti categoria. Deci, vrem

46825
35:08:12,232 --> 35:08:17,360
pentru a prezice categoria. Vom merge

46826
35:08:14,160 --> 35:08:19,272
trimite-l ca șir. Și atunci suntem

46827
35:08:17,360 --> 35:08:21,040
a-l trimite tren echivalează cu tren. Avem

46828
35:08:19,272 --> 35:08:23,680
modelul nostru de antrenament. Și apoi am avut-o

46829
35:08:21,040 --> 35:08:24,960
modelul conductei este egal cu modelul. În acest fel noi

46830
35:08:23,680 --> 35:08:27,272
nu trebuie să retrimiteți aceste variabile

46831
35:08:24,960 --> 35:08:29,040
de fiecare dată. Definiția știe asta

46832
35:08:27,272 --> 35:08:31,192
pentru că am spus că trenul este egal cu tren și eu

46833
35:08:29,040 --> 35:08:32,872
pune egal pentru model. Și atunci suntem

46834
35:08:31,192 --> 35:08:35,272
urmând a seta predicția egală cu

46835
35:08:32,872 --> 35:08:38,400
model.predic s. Deci va trimite

46836
35:08:35,272 --> 35:08:39,680
orice șir îi trimitem. Este

46837
35:08:38,400 --> 35:08:41,680
mergând să împingă acea sfoară prin

46838
35:08:39,680 --> 35:08:44,552
conductă, conducta model. Merge

46839
35:08:41,680 --> 35:08:48,320
pentru a trece prin și uh tokeniza-l și pune

46840
35:08:44,552 --> 35:08:49,680
prin TF IDF, convertiți-l în

46841
35:08:48,320 --> 35:08:51,760
numere și greutăți pentru toate

46842
35:08:49,680 --> 35:08:54,400
diferite documente și cuvinte. Și apoi

46843
35:08:51,760 --> 35:08:56,872
va pune asta prin golful nostru naiv.

46844
35:08:54,400 --> 35:08:58,320
Și din asta, vom merge înainte și ne vom lua

46845
35:08:56,872 --> 35:09:00,080
predictie. Vom prezice ce

46846
35:08:58,320 --> 35:09:03,592
valoarea este. Și așa o să facem

46847
35:09:00,080 --> 35:09:06,400
tren de întoarcere.numele țintei prezic de

46848
35:09:03,592 --> 35:09:08,480
zero. Și amintiți-vă că trenul.țintă

46849
35:09:06,400 --> 35:09:10,800
nume, sunt doar categorii. as putea

46850
35:09:08,480 --> 35:09:13,832
au pus la fel de ușor categorii uh

46851
35:09:10,800 --> 35:09:15,440
acolo.predictia de zero. Deci luăm

46852
35:09:13,832 --> 35:09:16,800
predicția care este un număr și

46853
35:09:15,440 --> 35:09:19,440
îl transformăm într-un real

46854
35:09:16,800 --> 35:09:20,640
categorie. Îl transformăm din eu

46855
35:09:19,440 --> 35:09:23,120
nu stiu care sunt cifrele reale.

46856
35:09:20,640 --> 35:09:24,640
Să presupunem că zero este egal cu alt ateism. Deci

46857
35:09:23,120 --> 35:09:27,120
vom converti acel zero în

46858
35:09:24,640 --> 35:09:28,800
cuvânt sau uh unul poate este egal cu comp

46859
35:09:27,120 --> 35:09:30,640
grafica. Deci ne vom converti

46860
35:09:28,800 --> 35:09:32,640
numărul unu în grafica comp. Asta e

46861
35:09:30,640 --> 35:09:35,192
tot ce este. Și atunci trebuie să mergem înainte

46862
35:09:32,640 --> 35:09:38,160
și apoi trebuie să mergem înainte și să alergăm

46863
35:09:35,192 --> 35:09:40,000
aceasta. Așa că am încărcat asta. Și apoi odată eu

46864
35:09:38,160 --> 35:09:42,232
rulați asta, putem începe să facem ceva

46865
35:09:40,000 --> 35:09:45,040
previziuni. Lasă-mă să scriu

46866
35:09:42,232 --> 35:09:47,440
categoria prezice. Și să facem

46867
35:09:45,040 --> 35:09:49,192
categoria prezice, Isus Hristos. Și asta

46868
35:09:47,440 --> 35:09:52,320
se întoarce și spune că e social,

46869
35:09:49,192 --> 35:09:54,872
religie, creștină. E destul de bine.

46870
35:09:52,320 --> 35:09:56,640
Rețineți că nu am pus tipărire pe asta.

46871
35:09:54,872 --> 35:09:58,480
Unul dintre lucrurile frumoase despre Jupiter

46872
35:09:56,640 --> 35:10:00,640
editor de notebook și o mulțime de inline

46873
35:09:58,480 --> 35:10:02,400
editori este dacă puneți doar numele lui

46874
35:10:00,640 --> 35:10:04,320
variabila afară, returnează

46875
35:10:02,400 --> 35:10:06,320
variabil train.target_ames, target

46876
35:10:04,320 --> 35:10:08,640
nume. Acesta va imprima automat

46877
35:10:06,320 --> 35:10:10,640
pentru tine. În propriul tău IDE, s-ar putea să ai

46878
35:10:08,640 --> 35:10:12,640
a pune la tipar. Să vedem unde mai suntem

46879
35:10:10,640 --> 35:10:16,080
poate lua asta. Și poate ești un spațiu

46880
35:10:12,640 --> 35:10:19,040
pasionat de știință. Deci, ce zici de trimiterea încărcăturii

46881
35:10:16,080 --> 35:10:21,360
la internaţional

46882
35:10:19,040 --> 35:10:24,720
stația spațială.

46883
35:10:21,360 --> 35:10:28,400
Și dacă conducem asta, obținem știință

46884
35:10:24,720 --> 35:10:31,040
spatiu. Sau poate ești un automobil

46885
35:10:28,400 --> 35:10:32,800
buff. Și hai să facem um Oh, au fost

46886
35:10:31,040 --> 35:10:36,640
O să-mi spună că Audi este mai bun decât BMW,

46887
35:10:32,800 --> 35:10:39,192
dar am de gând să fac BMW este mai bine decât

46888
35:10:36,640 --> 35:10:41,120
un Audi. Deci poate pasionatul nostru de mașini. Iar noi

46889
35:10:39,192 --> 35:10:42,552
alerga asta. Și o să vezi că scrie

46890
35:10:41,120 --> 35:10:45,120
recreative. Presupun că asta este

46891
35:10:42,552 --> 35:10:47,360
RECC înseamnă. Automobile. Așa că am făcut o

46892
35:10:45,120 --> 35:10:49,120
o treabă destul de bună etichetat-o pe aia. Cum

46893
35:10:47,360 --> 35:10:51,192
despre uh dacă avem ceva de genul a

46894
35:10:49,120 --> 35:10:54,960
legenda care trece pe acolo, președinte

46895
35:10:51,192 --> 35:10:58,160
a Indiei. Și dacă rulăm asta, vine

46896
35:10:54,960 --> 35:11:00,552
sus și spune vorbi despre politică diverse.

46897
35:10:58,160 --> 35:11:02,400
Deci, când luăm definiția noastră sau a noastră

46898
35:11:00,552 --> 35:11:04,800
funcţionează şi rulăm toate aceste lucruri

46899
35:11:02,400 --> 35:11:06,960
prin, felicitări, am reușit. Am putut

46900
35:11:04,800 --> 35:11:08,960
pentru a clasifica corect textele în

46901
35:11:06,960 --> 35:11:11,192
diferite grupuri în funcție de care categorie

46902
35:11:08,960 --> 35:11:13,832
ele aparţin folosirii bazei naive

46903
35:11:11,192 --> 35:11:17,680
clasificator. Acum am aruncat

46904
35:11:13,832 --> 35:11:19,912
pipeline, vectorzerul TF IDF, am aruncat

46905
35:11:17,680 --> 35:11:21,592
în grafice. Acestea sunt toate lucrurile care

46906
35:11:19,912 --> 35:11:24,232
nu trebuie neapărat să știi

46907
35:11:21,592 --> 35:11:25,760
înțelege configurația naivă de bază sau

46908
35:11:24,232 --> 35:11:27,592
clasificator, dar sunt importante pentru

46909
35:11:25,760 --> 35:11:31,192
stiu. Una dintre principalele utilizări pentru naiv

46910
35:11:27,592 --> 35:11:33,120
Bays este cu tokenizer TF IDF

46911
35:11:31,192 --> 35:11:36,000
vectorzer unde simbolizează un cuvânt și

46912
35:11:33,120 --> 35:11:38,232
are etichete și folosim conducta

46913
35:11:36,000 --> 35:11:39,912
pentru că trebuie să împingi toate acele date

46914
35:11:38,232 --> 35:11:41,512
prin și o face cu adevărat ușor și

46915
35:11:39,912 --> 35:11:43,192
repede. Nu trebuie să le știi

46916
35:11:41,512 --> 35:11:45,440
înțeleg golfuri naive dar cu siguranță

46917
35:11:43,192 --> 35:11:47,832
ajuta la intelegerea industriei si

46918
35:11:45,440 --> 35:11:50,800
știința datelor. Și ne putem vedea

46919
35:11:47,832 --> 35:11:52,552
categorizer, clasificatorul nostru de bază naiv.

46920
35:11:50,800 --> 35:11:55,192
Am putut prezice categoria

46921
35:11:52,552 --> 35:11:57,680
religie, spațiu, motociclete, mașini,

46922
35:11:55,192 --> 35:11:59,360
politică și să le clasifice corect pe toate

46923
35:11:57,680 --> 35:12:01,680
aceste lucruri diferite în care am împins

46924
35:11:59,360 --> 35:12:04,720
predicția noastră și modelul nostru antrenat.

46925
35:12:01,680 --> 35:12:06,640
Înainte de a ne scufunda în SVM, să luăm

46926
35:12:04,720 --> 35:12:08,400
o privire asupra aplicațiilor suportului

46927
35:12:06,640 --> 35:12:10,400
mașină vectorială, cel puțin ceva general

46928
35:12:08,400 --> 35:12:12,800
cele care sunt utilizate în mod obișnuit cu acesta.

46929
35:12:10,400 --> 35:12:14,800
detectarea feței, text și hipertext

46930
35:12:12,800 --> 35:12:17,512
categorizare, clasificare a

46931
35:12:14,800 --> 35:12:19,440
imagini și bioinformatică.

46932
35:12:17,512 --> 35:12:21,912
Acestea sunt doar câteva dintre cele care

46933
35:12:19,440 --> 35:12:23,440
sunt utilizate cu acest SVM. Pe măsură ce trecem prin

46934
35:12:21,912 --> 35:12:24,960
această lecție, vezi dacă poți să-ți dai seama

46935
35:12:23,440 --> 35:12:26,640
la ce alții l-ai putea aplica,

46936
35:12:24,960 --> 35:12:28,720
și, de asemenea, ce ai vrea să folosești

46937
35:12:26,640 --> 35:12:31,040
alte instrumente pt. Deci, în acest exemplu,

46938
35:12:28,720 --> 35:12:33,120
Săptămâna trecută, eu și fiul meu am vizitat un fruct

46939
35:12:31,040 --> 35:12:35,272
magazin. Tată, este un măr sau un

46940
35:12:33,120 --> 35:12:37,120
căpșuni? Deci, apare întrebarea,

46941
35:12:35,272 --> 35:12:39,192
ce fructe tocmai am luat de la

46942
35:12:37,120 --> 35:12:40,552
stand de fructe? După câteva secunde,

46943
35:12:39,192 --> 35:12:42,800
vă puteți da seama că a fost o

46944
35:12:40,552 --> 35:12:45,120
căpșună. Deci, să luăm acest model a

46945
35:12:42,800 --> 35:12:46,800
faceți un pas mai departe și haideți de ce să nu construim

46946
35:12:45,120 --> 35:12:48,480
un model care poate prezice o necunoscută

46947
35:12:46,800 --> 35:12:50,640
date. Și în asta, vom fi

46948
35:12:48,480 --> 35:12:52,400
privind niște căpșuni dulci sau

46949
35:12:50,640 --> 35:12:53,832
mere crocante. Am vrut să putem

46950
35:12:52,400 --> 35:12:56,640
etichetați-i pe cei doi și decideți ce

46951
35:12:53,832 --> 35:12:58,232
fructul este. Și facem asta având date

46952
35:12:56,640 --> 35:12:59,440
deja introdus. Deci, avem deja un

46953
35:12:58,232 --> 35:13:00,872
buchet de căpșuni. Ne știm

46954
35:12:59,440 --> 35:13:02,480
căpșuni și sunt deja etichetate

46955
35:13:00,872 --> 35:13:03,760
ca atare. Avem deja o grămadă de

46956
35:13:02,480 --> 35:13:05,832
merele. Ne cunoaștem merele și suntem

46957
35:13:03,760 --> 35:13:07,912
etichetat ca atare. Apoi, odată ce ne antrenăm

46958
35:13:05,832 --> 35:13:09,912
model, acel model poate primi apoi

46959
35:13:07,912 --> 35:13:11,120
date noi, iar noile date sunt această imagine.

46960
35:13:09,912 --> 35:13:12,960
În acest caz, puteți vedea o întrebare

46961
35:13:11,120 --> 35:13:14,872
marcați pe ea și trece și trece

46962
35:13:12,960 --> 35:13:17,760
este o căpșună. În acest caz, suntem

46963
35:13:14,872 --> 35:13:20,960
folosind modelul de mașină vector suport.

46964
35:13:17,760 --> 35:13:23,272
SVM este o metodă de învățare supravegheată care

46965
35:13:20,960 --> 35:13:25,440
se uită la date și le sortează într-unul dintre

46966
35:13:23,272 --> 35:13:27,120
doua categorii. Și în acest caz, suntem

46967
35:13:25,440 --> 35:13:29,040
sortarea căpșunilor în

46968
35:13:27,120 --> 35:13:31,120
latura de capsuni. În acest moment, tu

46969
35:13:29,040 --> 35:13:33,440
ar trebui să pun întrebarea, cum

46970
35:13:31,120 --> 35:13:35,592
lucrul de predicție? Înainte să pătrundem

46971
35:13:33,440 --> 35:13:37,832
un exemplu cu numere, hai sa aplicam

46972
35:13:35,592 --> 35:13:39,760
asta pentru scenariul nostru de fructe. Avem al nostru

46973
35:13:37,832 --> 35:13:42,160
mașină vectorială de sprijin. Noi am luat-o

46974
35:13:39,760 --> 35:13:44,232
și am luat mostre etichetate de date,

46975
35:13:42,160 --> 35:13:46,400
căpșuni și mere, și ne desenăm mai departe

46976
35:13:44,232 --> 35:13:49,360
o linie la mijloc între cele două

46977
35:13:46,400 --> 35:13:51,440
grupuri. Această împărțire ne permite acum să luăm

46978
35:13:49,360 --> 35:13:53,120
date noi, în acest caz un măr și a

46979
35:13:51,440 --> 35:13:54,800
căpșuni, și puneți-le în

46980
35:13:53,120 --> 35:13:56,400
grup adecvat în funcție de care parte a

46981
35:13:54,800 --> 35:13:58,480
linia în care cad. Și așa noi

46982
35:13:56,400 --> 35:14:00,640
poate prezice necunoscutul. La fel de colorat și

46983
35:13:58,480 --> 35:14:02,800
oricât de gustos este exemplul de fructe, haideți

46984
35:14:00,640 --> 35:14:04,480
aruncați o privire la un alt exemplu cu unele

46985
35:14:02,800 --> 35:14:06,552
numerele implicate. Și putem lua o

46986
35:14:04,480 --> 35:14:07,680
uită-te mai atent la cum funcționează matematica. În

46987
35:14:06,552 --> 35:14:09,512
acest exemplu, vom fi

46988
35:14:07,680 --> 35:14:11,440
clasificarea bărbaților și femeilor. Și suntem

46989
35:14:09,512 --> 35:14:13,192
va începe cu un set de oameni cu

46990
35:14:11,440 --> 35:14:15,440
o înălțime diferită și una diferită

46991
35:14:13,192 --> 35:14:17,912
greutate. Și pentru ca asta să funcționeze, o vom face

46992
35:14:15,440 --> 35:14:19,680
trebuie să aibă un set de date eșantion de femei

46993
35:14:17,912 --> 35:14:23,120
unde avem înălțimea și greutatea lor

46994
35:14:19,680 --> 35:14:24,800
174, 65, 174, 88 și așa mai departe. Și vom face

46995
35:14:23,120 --> 35:14:28,320
nevoie de un set de date eșantion al bărbatului. Ei

46996
35:14:24,800 --> 35:14:29,760
au o înălțime de 179, 90, 180 până la 80 și așa

46997
35:14:28,320 --> 35:14:31,512
pe. Să mergem mai departe și să punem asta pe a

46998
35:14:29,760 --> 35:14:33,680
grafic, astfel încât să avem o imagine frumoasă. Deci tu

46999
35:14:31,512 --> 35:14:36,160
puteți vedea aici avem două grupuri bazate pe

47000
35:14:33,680 --> 35:14:37,912
înălțimea față de greutate. Iar pe

47001
35:14:36,160 --> 35:14:39,120
pe partea stângă vom avea femeile,

47002
35:14:37,912 --> 35:14:40,720
pe partea dreaptă o să avem

47003
35:14:39,120 --> 35:14:42,960
bărbații. Acum, dacă vom crea un

47004
35:14:40,720 --> 35:14:44,872
clasificator, să adăugăm un nou punct de date

47005
35:14:42,960 --> 35:14:47,440
și află dacă este bărbat sau femeie.

47006
35:14:44,872 --> 35:14:49,760
Deci, înainte de a putea face asta, trebuie

47007
35:14:47,440 --> 35:14:52,480
împărțiți mai întâi datele noastre. Ne putem împărți

47008
35:14:49,760 --> 35:14:54,232
date alegând oricare dintre aceste linii. În

47009
35:14:52,480 --> 35:14:56,000
în acest caz, desenăm în două linii

47010
35:14:54,232 --> 35:14:57,680
datele din mijloc care separă

47011
35:14:56,000 --> 35:14:59,680
bărbații de la femei. Dar pentru a prezice

47012
35:14:57,680 --> 35:15:01,760
genul unui nou punct de date, noi

47013
35:14:59,680 --> 35:15:03,760
ar trebui să împartă datele în cel mai bun mod

47014
35:15:01,760 --> 35:15:06,080
cale posibilă. Și spunem cel mai bun

47015
35:15:03,760 --> 35:15:08,720
cale posibilă deoarece această linie are un

47016
35:15:06,080 --> 35:15:10,720
spațiu maxim care le separă pe cele două

47017
35:15:08,720 --> 35:15:12,960
clasele. Aici puteți vedea că există o

47018
35:15:10,720 --> 35:15:15,120
împărțire clară între cele două diferite

47019
35:15:12,960 --> 35:15:17,040
clasele. Și în acesta, nu este așa

47020
35:15:15,120 --> 35:15:18,872
mult o scindare clara. Asta nu are

47021
35:15:17,040 --> 35:15:21,272
spațiul maxim care separă

47022
35:15:18,872 --> 35:15:23,120
doi. De aceea, această linie se împarte cel mai bine

47023
35:15:21,272 --> 35:15:25,360
datele. Nu vrem să facem doar asta

47024
35:15:23,120 --> 35:15:27,272
aruncându-l în ochi. Și înainte să plecăm

47025
35:15:25,360 --> 35:15:30,000
în plus, trebuie să adăugăm ceva tehnic

47026
35:15:27,272 --> 35:15:31,760
termeni la aceasta. Putem spune, de asemenea, că

47027
35:15:30,000 --> 35:15:33,912
distanța dintre punctele din linie

47028
35:15:31,760 --> 35:15:35,912
ar trebui să fie cât mai departe posibil. În

47029
35:15:33,912 --> 35:15:38,400
termeni tehnici, putem spune distanța

47030
35:15:35,912 --> 35:15:40,800
între vectorul suport și hiper

47031
35:15:38,400 --> 35:15:42,480
avionul ar trebui să fie cât mai departe posibil. Şi

47032
35:15:40,800 --> 35:15:44,872
aici sunt vectorii suport

47033
35:15:42,480 --> 35:15:46,800
punctele extreme din setul de date. Şi

47034
35:15:44,872 --> 35:15:48,400
dacă te uiți la acest set de date, au

47035
35:15:46,800 --> 35:15:50,320
încercuit două puncte care par a fi

47036
35:15:48,400 --> 35:15:52,320
chiar la marginea femeilor şi

47037
35:15:50,320 --> 35:15:54,640
unul la marginea bărbaţilor. Şi

47038
35:15:52,320 --> 35:15:56,960
hiperplanul are o distanță maximă până la

47039
35:15:54,640 --> 35:15:58,800
vectorii suport ai oricărei clase. Acum

47040
35:15:56,960 --> 35:16:00,400
vei vedea linia din mijloc și

47041
35:15:58,800 --> 35:16:01,680
numim asta hiperplanul deoarece

47042
35:16:00,400 --> 35:16:03,760
când ai de-a face cu mai multe

47043
35:16:01,680 --> 35:16:05,832
dimensiuni, într-adevăr nu este doar o linie

47044
35:16:03,760 --> 35:16:07,592
ci un plan de intersectii. Iar tu

47045
35:16:05,832 --> 35:16:10,000
pot vedea aici unde vectorii suport

47046
35:16:07,592 --> 35:16:12,552
au fost desenate în linii întrerupte. The

47047
35:16:10,000 --> 35:16:15,360
matematica din spatele acestui lucru este foarte simplă. Luăm

47048
35:16:12,552 --> 35:16:17,120
D distanța cea mai scurtă până la cea mai apropiată

47049
35:16:15,360 --> 35:16:19,440
punct pozitiv care ar fi pe

47050
35:16:17,120 --> 35:16:21,512
partea masculină și D minus este cel mai scurt

47051
35:16:19,440 --> 35:16:23,440
distanța până la cel mai apropiat punct negativ

47052
35:16:21,512 --> 35:16:25,272
care este de partea femeilor. Suma de

47053
35:16:23,440 --> 35:16:27,512
D plus și D minus se numește

47054
35:16:25,272 --> 35:16:29,512
marja de distanță sau distanța dintre

47055
35:16:27,512 --> 35:16:32,480
cei doi vectori suport care sunt prezentati

47056
35:16:29,512 --> 35:16:35,120
în liniile întrerupte. Și apoi prin găsirea

47057
35:16:32,480 --> 35:16:37,120
cea mai mare marjă de distanță pe care o putem obține

47058
35:16:35,120 --> 35:16:39,192
hiperplanul optim. Odată ce am

47059
35:16:37,120 --> 35:16:41,272
a creat un hiperplan optim, putem

47060
35:16:39,192 --> 35:16:43,120
vedeți cu ușurință în ce parte se potrivesc noile date

47061
35:16:41,272 --> 35:16:44,872
În. Și pe baza hiperplanului, putem

47062
35:16:43,120 --> 35:16:47,120
spuneți că noul punct de date aparține

47063
35:16:44,872 --> 35:16:49,360
genul masculin. Sper să fie clar cum

47064
35:16:47,120 --> 35:16:51,440
care funcționează la nivel vizual. Ca date

47065
35:16:49,360 --> 35:16:53,512
om de știință, ar trebui să întrebi și tu

47066
35:16:51,440 --> 35:16:55,512
ce se întâmplă dacă hiperplanul nu este

47067
35:16:53,512 --> 35:16:57,512
optim. Dacă selectăm un hiperplan

47068
35:16:55,512 --> 35:16:59,680
având o marjă scăzută, atunci există o marjă ridicată

47069
35:16:57,512 --> 35:17:02,000
sansa de mclasificare. Aceasta

47070
35:16:59,680 --> 35:17:04,320
anume model SVM, cel pe care noi

47071
35:17:02,000 --> 35:17:06,800
discutat până acum, se mai numește

47072
35:17:04,320 --> 35:17:09,040
denumit LSVM.

47073
35:17:06,800 --> 35:17:11,272
Până aici este clar, dar o întrebare ar trebui

47074
35:17:09,040 --> 35:17:13,912
să vină. Avem datele noastre eșantion

47075
35:17:11,272 --> 35:17:16,080
set. Dar în loc să arate așa,

47076
35:17:13,912 --> 35:17:18,640
ce dacă ar arăta așa unde noi

47077
35:17:16,080 --> 35:17:20,960
au două seturi de date, dar unul dintre ele

47078
35:17:18,640 --> 35:17:22,480
apare la mijlocul unui alt set. tu

47079
35:17:20,960 --> 35:17:24,320
se poate vedea aici unde avem albastru și

47080
35:17:22,480 --> 35:17:26,232
galbenul și apoi albastrul din nou pe

47081
35:17:24,320 --> 35:17:29,360
cealaltă parte a liniei noastre de date. In aceasta

47082
35:17:26,232 --> 35:17:31,440
set de date, nu putem folosi un hiperplan. Deci

47083
35:17:29,360 --> 35:17:33,512
când vezi astfel de date, sunt

47084
35:17:31,440 --> 35:17:35,592
necesar să se îndepărteze de o vedere 1D a

47085
35:17:33,512 --> 35:17:37,592
datele la o vedere bidimensională a

47086
35:17:35,592 --> 35:17:40,080
datele. Iar pentru transformare, noi

47087
35:17:37,592 --> 35:17:42,480
utilizați ceea ce se numește o funcție de kernel. The

47088
35:17:40,080 --> 35:17:44,872
funcția kernel va prelua intrarea 1D

47089
35:17:42,480 --> 35:17:47,192
și transferați-l într-o formă bidimensională

47090
35:17:44,872 --> 35:17:49,360
ieșire. După cum puteți vedea în această poză

47091
35:17:47,192 --> 35:17:51,592
aici, 1D când este transferat la a

47092
35:17:49,360 --> 35:17:53,760
bidimensională face foarte ușor să

47093
35:17:51,592 --> 35:17:55,272
trageți o linie între cele două seturi de date.

47094
35:17:53,760 --> 35:17:57,760
Dacă o facem și mai mult

47095
35:17:55,272 --> 35:17:59,832
complicat? Cum efectuăm un SVM

47096
35:17:57,760 --> 35:18:01,680
pentru acest tip de set de date? Aici poți

47097
35:17:59,832 --> 35:18:03,272
vezi că avem un set de date bidimensional

47098
35:18:01,680 --> 35:18:05,040
unde datele sunt la mijloc

47099
35:18:03,272 --> 35:18:07,512
înconjurat de datele verzi de pe

47100
35:18:05,040 --> 35:18:09,832
afara. În acest caz, vom merge

47101
35:18:07,512 --> 35:18:12,000
segrega cele două clase. Avem al nostru

47102
35:18:09,832 --> 35:18:13,440
eșantion de set de date și dacă desenați o linie

47103
35:18:12,000 --> 35:18:15,760
prin, evident că nu este un optim

47104
35:18:13,440 --> 35:18:18,552
hiperplan acolo. Deci, pentru a face asta, noi

47105
35:18:15,760 --> 35:18:20,000
trebuie să transferați 2D într-o matrice 3D.

47106
35:18:18,552 --> 35:18:21,360
Și când îl traduci în a

47107
35:18:20,000 --> 35:18:22,800
matrice tridimensională folosind

47108
35:18:21,360 --> 35:18:24,552
kernel, puteți vedea unde puteți plasa

47109
35:18:22,800 --> 35:18:26,640
un hiperplan chiar prin el și

47110
35:18:24,552 --> 35:18:28,400
împărțiți cu ușurință datele. Înainte de a începe

47111
35:18:26,640 --> 35:18:30,480
privind un exemplu de programare și

47112
35:18:28,400 --> 35:18:32,552
scufundă-te în scenariu, să ne uităm la

47113
35:18:30,480 --> 35:18:34,720
avantajul mașinii vectorului suport.

47114
35:18:32,552 --> 35:18:37,360
Vom începe cu intrare înaltă dimensională

47115
35:18:34,720 --> 35:18:39,592
spațiu sau uneori denumit

47116
35:18:37,360 --> 35:18:41,680
blestemul dimensionalității. Ne-am uitat la

47117
35:18:39,592 --> 35:18:43,360
mai devreme o dimensiune, două dimensiuni,

47118
35:18:41,680 --> 35:18:45,272
trei dimensiuni. Când ajungi la a

47119
35:18:43,360 --> 35:18:46,872
mii de dimensiuni, multe probleme

47120
35:18:45,272 --> 35:18:49,192
începe să apară cu majoritatea algoritmilor

47121
35:18:46,872 --> 35:18:50,320
pentru care trebuie ajustate. SVM-ul

47122
35:18:49,192 --> 35:18:52,320
face automat asta în

47123
35:18:50,320 --> 35:18:54,000
spațiu înalt dimensional. Unul dintre

47124
35:18:52,320 --> 35:18:56,160
spațiu de înaltă dimensiune, unul

47125
35:18:54,000 --> 35:18:58,552
spațiul înalt dimensional la care lucrăm este

47126
35:18:56,160 --> 35:19:00,640
vectori de documente rari. Aici este locul

47127
35:18:58,552 --> 35:19:02,080
noi tokenizam cuvintele în documente astfel încât noi

47128
35:19:00,640 --> 35:19:04,000
poate rula algoritmii noștri de învățare automată

47129
35:19:02,080 --> 35:19:06,960
peste ei. Le-am văzut cum au ajuns la fel de sus

47130
35:19:04,000 --> 35:19:09,120
2,4 milioane de jetoane diferite. Asta este o

47131
35:19:06,960 --> 35:19:11,512
mulți vectori de privit. Și în sfârșit,

47132
35:19:09,120 --> 35:19:14,232
avem parametru de regularizare. The

47133
35:19:11,512 --> 35:19:15,832
parametrul de realizare sau lambda este a

47134
35:19:14,232 --> 35:19:17,272
parametru care ajută la a afla dacă

47135
35:19:15,832 --> 35:19:19,040
vom avea o părtinire sau

47136
35:19:17,272 --> 35:19:20,800
supraadaptarea datelor. Fie că este

47137
35:19:19,040 --> 35:19:22,960
va fi supraadaptat la foarte specific

47138
35:19:20,800 --> 35:19:25,512
exemplu sau va fi părtinitoare la a

47139
35:19:22,960 --> 35:19:27,680
valoare ridicată sau scăzută. Cu SVM, acesta

47140
35:19:25,512 --> 35:19:29,440
evită în mod natural supraadaptarea şi

47141
35:19:27,680 --> 35:19:31,512
probleme de părtinire pe care le vedem în multe altele

47142
35:19:29,440 --> 35:19:33,680
algoritmi. Aceste trei avantaje ale

47143
35:19:31,512 --> 35:19:35,192
mașina vectorului suport o face a

47144
35:19:33,680 --> 35:19:37,440
instrument foarte puternic de adăugat la dvs

47145
35:19:35,192 --> 35:19:39,360
repertoriu de instrumente de învățare automată.

47146
35:19:37,440 --> 35:19:40,800
Acum, ți-am promis un caz de utilizare

47147
35:19:39,360 --> 35:19:42,800
studiul. De fapt, ne vom scufunda

47148
35:19:40,800 --> 35:19:44,552
la unele programare Python. Și așa suntem

47149
35:19:42,800 --> 35:19:46,720
urmând să intre într-o enunţare a problemei şi

47150
35:19:44,552 --> 35:19:49,120
începe cu grădina zoologică. Deci în grădina zoologică

47151
35:19:46,720 --> 35:19:50,720
De exemplu, avem membri ai familiei care merg

47152
35:19:49,120 --> 35:19:52,232
la grădina zoologică și avem copilul mic

47153
35:19:50,720 --> 35:19:54,232
spunând: „Tată, este un grup de

47154
35:19:52,232 --> 35:19:56,400
crocodili sau aligatori?" Ei bine, asta e

47155
35:19:54,232 --> 35:19:58,232
greu de diferentiat. Și grădinile zoologice sunt a

47156
35:19:56,400 --> 35:20:00,080
loc minunat pentru a începe să te uiți la știință

47157
35:19:58,232 --> 35:20:02,000
și înțelegerea cum funcționează lucrurile,

47158
35:20:00,080 --> 35:20:03,040
mai ales ca un copil mic. Și așa noi

47159
35:20:02,000 --> 35:20:04,400
pot vedea părinții stând aici

47160
35:20:03,040 --> 35:20:06,320
gândindu-mă, ei bine, care este diferența

47161
35:20:04,400 --> 35:20:08,160
între un crocodil și un aligator?

47162
35:20:06,320 --> 35:20:10,640
Ei bine, unul, crocodilii sunt mai mari

47163
35:20:08,160 --> 35:20:12,232
dimensiune. Aligatorii au dimensiuni mai mici.

47164
35:20:10,640 --> 35:20:14,400
Latimea botului. Crocodilii au o

47165
35:20:12,232 --> 35:20:16,400
botul îngust și aligatorii au o mai lată

47166
35:20:14,400 --> 35:20:17,912
botul. Și, desigur, în zilele noastre

47167
35:20:16,400 --> 35:20:19,592
și vârsta, tatăl stă aici

47168
35:20:17,912 --> 35:20:21,592
gândindu-mă: „Cum pot transforma asta într-un

47169
35:20:19,592 --> 35:20:23,512
lecție pentru fiul meu?" Și el spune: „Lasă a

47170
35:20:21,592 --> 35:20:25,120
suport vector mașină segrega cele două

47171
35:20:23,512 --> 35:20:26,800
grupuri.” Nu știu dacă tatăl meu vreodată

47172
35:20:25,120 --> 35:20:29,120
mi-a spus asta, dar ar fi amuzant.

47173
35:20:26,800 --> 35:20:31,440
Acum, în acest exemplu, nu o vom face

47174
35:20:29,120 --> 35:20:33,272
utilizați măsurători și date reale. Suntem

47175
35:20:31,440 --> 35:20:34,960
folosind asta doar pentru imagini. Și asta este

47176
35:20:33,272 --> 35:20:36,640
foarte frecvente în multe învățare automată

47177
35:20:34,960 --> 35:20:38,080
algoritmi și configurarea acestora. Dar

47178
35:20:36,640 --> 35:20:39,912
hai să ne suflecăm mânecile și vorbim

47179
35:20:38,080 --> 35:20:42,552
despre asta mai mult într-un moment ca noi

47180
35:20:39,912 --> 35:20:45,440
pătrunde în scriptul nostru Python. Deci aici noi

47181
35:20:42,552 --> 35:20:47,832
ajung în codarea noastră reală și sunt

47182
35:20:45,440 --> 35:20:49,680
va muta acest lucru într-un editor Python

47183
35:20:47,832 --> 35:20:50,640
într-o clipă. Dar hai să vorbim a

47184
35:20:49,680 --> 35:20:52,800
puțin despre ceea ce vom face

47185
35:20:50,640 --> 35:20:55,120
acoperire. În primul rând, vom acoperi

47186
35:20:52,800 --> 35:20:57,120
codul de configurare, cum se face de fapt

47187
35:20:55,120 --> 35:20:58,640
creați SVM-ul nostru. Și o să găsești

47188
35:20:57,120 --> 35:21:00,080
că există doar două linii de cod care

47189
35:20:58,640 --> 35:21:02,640
creează-l de fapt. Și restul

47190
35:21:00,080 --> 35:21:04,320
se face atât de rapid și rapid încât este tot

47191
35:21:02,640 --> 35:21:06,400
aici in prima pagina. și vom arăta

47192
35:21:04,320 --> 35:21:07,760
tu cum arată asta până la noi

47193
35:21:06,400 --> 35:21:09,272
date pentru că vom crea unele

47194
35:21:07,760 --> 35:21:10,640
date. Am vorbit doar despre crearea datelor

47195
35:21:09,272 --> 35:21:12,080
acum un minut. Și așa vom intra în

47196
35:21:10,640 --> 35:21:13,592
creând date aici și veți vedea asta

47197
35:21:12,080 --> 35:21:15,040
corectare frumoasă a celor două blob-uri ale noastre și

47198
35:21:13,592 --> 35:21:16,800
vom trece prin asta într-o secundă.

47199
35:21:15,040 --> 35:21:18,232
Și apoi a doua parte este că mergem

47200
35:21:16,800 --> 35:21:19,760
să luăm asta și o să-l ciocnim

47201
35:21:18,232 --> 35:21:21,512
cu o crestătură. Vă vom arăta ce

47202
35:21:19,760 --> 35:21:23,360
arată ca în culise. Dar

47203
35:21:21,512 --> 35:21:25,760
să începem cu crearea de fapt a noastră

47204
35:21:23,360 --> 35:21:27,680
setare. Îmi place să folosesc Anaconda

47205
35:21:25,760 --> 35:21:29,680
Notebook Jupyter pentru că este foarte ușor

47206
35:21:27,680 --> 35:21:32,160
de folosit, dar puteți folosi oricare dintre dvs

47207
35:21:29,680 --> 35:21:33,360
editorii sau setările Python preferate și mergeți

47208
35:21:32,160 --> 35:21:35,192
acolo. Dar hai să mergem mai departe și să comutăm

47209
35:21:33,360 --> 35:21:38,640
acolo și vezi cum arată.

47210
35:21:35,192 --> 35:21:40,720
Deci iată-ne în Anaconda Python

47211
35:21:38,640 --> 35:21:43,040
caiet sau caiet Anaconda Jupyter

47212
35:21:40,720 --> 35:21:45,192
cu Python. Folosim Python 3. I

47213
35:21:43,040 --> 35:21:48,552
cred că acesta este 3.5, dar ar trebui să fie

47214
35:21:45,192 --> 35:21:50,232
funcționează în oricare dintre versiunile tale 3x. Și uh

47215
35:21:48,552 --> 35:21:52,232
ar trebui să te uiți la sklearn și

47216
35:21:50,232 --> 35:21:54,080
asigurați-vă că utilizați o versiune 2x,

47217
35:21:52,232 --> 35:21:55,592
o versiune anterioară. Să mergem să punem noastre

47218
35:21:54,080 --> 35:21:57,440
cod acolo. Și unul dintre lucrurile eu

47219
35:21:55,592 --> 35:21:59,040
ca despre notebook-ul Jupyter este I can

47220
35:21:57,440 --> 35:22:00,800
urcă la vizionare și o să merg înainte

47221
35:21:59,040 --> 35:22:03,040
și comutați numerele de linie pentru a face

47222
35:22:00,800 --> 35:22:04,552
este puțin mai ușor să vorbești despre asta.

47223
35:22:03,040 --> 35:22:06,320
Și putem chiar să creștem dimensiunea

47224
35:22:04,552 --> 35:22:08,552
deoarece aceasta este editată în acest caz

47225
35:22:06,320 --> 35:22:10,160
Folosesc Google Chrome Explorer și

47226
35:22:08,552 --> 35:22:11,912
așa se deschide pentru editor.

47227
35:22:10,160 --> 35:22:13,832
Deși oricine, așa cum am spus eu

47228
35:22:11,912 --> 35:22:15,832
editorul va funcționa. Acum primul pas este

47229
35:22:13,832 --> 35:22:18,160
vor fi importurile noastre și vom merge

47230
35:22:15,832 --> 35:22:20,232
pentru a importa patru părți diferite. The

47231
35:22:18,160 --> 35:22:23,192
primele două la care vreau să te uiți sunt linia

47232
35:22:20,232 --> 35:22:25,440
unu și linia doi sunt numpy ca np și

47233
35:22:23,192 --> 35:22:29,272
bibliotecă mapplot.pipplot

47234
35:22:25,440 --> 35:22:30,960
ca plt. Acum acestea sunt foarte standardizate

47235
35:22:29,272 --> 35:22:33,832
importuri atunci când lucrați. The

47236
35:22:30,960 --> 35:22:35,680
primul este numerele python. Avem nevoie

47237
35:22:33,832 --> 35:22:38,232
asta pentru că suntem parte a platformei

47238
35:22:35,680 --> 35:22:39,832
utilizarea folosește asta pentru matricea numpy. Şi

47239
35:22:38,232 --> 35:22:41,120
Voi vorbi despre asta într-un minut, așa că tu

47240
35:22:39,832 --> 35:22:43,120
putem înțelege de ce vrem să folosim a

47241
35:22:41,120 --> 35:22:45,360
matrice numpy față de un python standard

47242
35:22:43,120 --> 35:22:48,480
matrice. Și în mod normal este destul de standard

47243
35:22:45,360 --> 35:22:50,080
configurat pentru a utiliza NP pentru numpy. Graficul hărții

47244
35:22:48,480 --> 35:22:53,040
biblioteca este modul în care vom vizualiza

47245
35:22:50,080 --> 35:22:55,360
date. Deci, ai nevoie de NP

47246
35:22:53,040 --> 35:22:57,192
pentru modulul sklearn, ci diagrama hărții

47247
35:22:55,360 --> 35:22:59,192
biblioteca este exclusiv pentru uzul nostru

47248
35:22:57,192 --> 35:23:00,800
vizualizare. Și deci chiar nu

47249
35:22:59,192 --> 35:23:02,000
am nevoie de asta pentru SVM, dar mergem

47250
35:23:00,800 --> 35:23:03,440
să-l pun acolo ca să ai un frumos

47251
35:23:02,000 --> 35:23:04,960
ajutor vizual și vă putem arăta ce este

47252
35:23:03,440 --> 35:23:06,552
arata ca. Asta e foarte important la

47253
35:23:04,960 --> 35:23:08,160
sfarsitul cand termini totul asa

47254
35:23:06,552 --> 35:23:09,760
ai un afișaj frumos pentru toată lumea

47255
35:23:08,160 --> 35:23:12,232
uite la. Și apoi, în sfârșit, mergem

47256
35:23:09,760 --> 35:23:14,960
la am să sar unul înainte la linie

47257
35:23:12,232 --> 35:23:18,000
numărul patru. Acesta este sklearn.datas

47258
35:23:14,960 --> 35:23:20,000
sets.samples generator import make

47259
35:23:18,000 --> 35:23:21,760
petele. Și ți-am spus că mergem

47260
35:23:20,000 --> 35:23:23,912
pentru a alcătui date. Și acesta este un instrument

47261
35:23:21,760 --> 35:23:25,592
asta este în sklearn pentru a alcătui date. eu

47262
35:23:23,912 --> 35:23:26,960
personal nu vreau să merg la grădina zoologică,

47263
35:23:25,592 --> 35:23:28,720
ai probleme pentru că ai sărit peste

47264
35:23:26,960 --> 35:23:30,800
gard, și probabil să fie mâncat de

47265
35:23:28,720 --> 35:23:32,480
crocodili sau aligatori la care lucrez

47266
35:23:30,800 --> 35:23:34,480
măsurându-le botul şi lăţimea şi

47267
35:23:32,480 --> 35:23:36,400
lungime. În schimb, doar o să facem

47268
35:23:34,480 --> 35:23:38,800
alcătuiește niște date. Și asta este

47269
35:23:36,400 --> 35:23:41,040
face blobs este. Este un instrument minunat. Dacă

47270
35:23:38,800 --> 35:23:42,320
sunteți gata să vă testați configurația uh

47271
35:23:41,040 --> 35:23:43,512
și nu ești sigur despre ce date

47272
35:23:42,320 --> 35:23:45,040
ai de gând să pui acolo, poți

47273
35:23:43,512 --> 35:23:47,272
creați acest blob și îl face cu adevărat

47274
35:23:45,040 --> 35:23:50,400
usor de folosit. Și, în sfârșit, avem a noastră

47275
35:23:47,272 --> 35:23:52,480
SVM real, SVM-ul de import sklearn pe

47276
35:23:50,400 --> 35:23:54,400
linia trei. Deci asta acoperă toate noastre

47277
35:23:52,480 --> 35:23:56,480
importurilor. Vom crea, amintiți-vă

47278
35:23:54,400 --> 35:23:58,000
Am folosit make blobs pentru a crea date.

47279
35:23:56,480 --> 35:24:01,360
Și vom crea un X mare

47280
35:23:58,000 --> 35:24:02,960
iar un Y minuscul egal face blob-uri

47281
35:24:01,360 --> 35:24:04,960
probe este egal cu 40. Deci vom face

47282
35:24:02,960 --> 35:24:07,192
face 40 de linii de date. O să fie

47283
35:24:04,960 --> 35:24:09,272
au doi centri cu o stare aleatorie

47284
35:24:07,192 --> 35:24:10,960
este egal cu 20. Deci fiecare fiecare al fiecărui grup

47285
35:24:09,272 --> 35:24:13,272
va avea 20 de bucăți diferite de

47286
35:24:10,960 --> 35:24:16,480
date din el. Și felul în care arată este

47287
35:24:13,272 --> 35:24:18,960
că vom avea sub X um un avion XY.

47288
35:24:16,480 --> 35:24:21,760
Deci am două numere sub X și Y va

47289
35:24:18,960 --> 35:24:23,912
fie 01. Sunt cele două centre diferite.

47290
35:24:21,760 --> 35:24:25,912
Deci avem da sau nu în acest caz

47291
35:24:23,912 --> 35:24:28,160
crocodil aligator. Asta este

47292
35:24:25,912 --> 35:24:31,120
reprezintă. Și apoi ți-am spus că

47293
35:24:28,160 --> 35:24:33,120
sklearn real sau SVM este în două

47294
35:24:31,120 --> 35:24:37,272
linii de cod. Și o vedem chiar aici

47295
35:24:33,120 --> 35:24:39,512
cu CLF este egal cu SVM. Nucleul SVC este egal

47296
35:24:37,272 --> 35:24:41,440
liniară. Și am stabilit C egal cu unu.

47297
35:24:39,512 --> 35:24:43,440
Deși în acest exemplu, din moment ce suntem

47298
35:24:41,440 --> 35:24:44,960
nu regularizăm datele pentru că noi

47299
35:24:43,440 --> 35:24:46,872
doresc să fie foarte clar și ușor de făcut

47300
35:24:44,960 --> 35:24:48,232
vezi, am mers înainte. Îl puteți seta la a

47301
35:24:46,872 --> 35:24:50,000
th00 și de multe ori când nu ești

47302
35:24:48,232 --> 35:24:51,440
făcând asta. Dar pentru acest lucru liniar,

47303
35:24:50,000 --> 35:24:53,760
pentru că este un liniar foarte simplu

47304
35:24:51,440 --> 35:24:56,232
de exemplu, avem doar cele două dimensiuni

47305
35:24:53,760 --> 35:24:58,400
și va fi un hiperplan liniar frumos.

47306
35:24:56,232 --> 35:25:00,000
Va fi o linie liniară frumoasă în loc de a

47307
35:24:58,400 --> 35:25:01,680
avion plin. Deci nu avem de-a face cu o

47308
35:25:00,000 --> 35:25:04,480
cantitate mare de date. Și apoi noi toți

47309
35:25:01,680 --> 35:25:07,512
trebuie să faci este să faci clff.fit

47310
35:25:04,480 --> 35:25:08,872
x, y. Și asta este. CLF a fost

47311
35:25:07,512 --> 35:25:10,552
creat. Și apoi vom merge

47312
35:25:08,872 --> 35:25:12,232
înainte și afișați-l. Și mă duc

47313
35:25:10,552 --> 35:25:13,592
vorbiți despre acest afișaj aici doar într-un

47314
35:25:12,232 --> 35:25:15,440
al doilea. Dar lasă-mă să merg înainte și să execut asta

47315
35:25:13,592 --> 35:25:17,912
cod. Și asta este ceea ce am făcut

47316
35:25:15,440 --> 35:25:19,680
am creat două blob-uri. Vei vedea

47317
35:25:17,912 --> 35:25:21,912
albastru pe lateral și apoi un fel de un

47318
35:25:19,680 --> 35:25:23,832
orang-ish uh de cealaltă parte. Asta e

47319
35:25:21,912 --> 35:25:25,680
cele două seturi ale noastre de date. Ei reprezintă unul

47320
35:25:23,832 --> 35:25:27,192
reprezintă crocodili și unul reprezintă

47321
35:25:25,680 --> 35:25:28,960
aligatori. Și apoi avem a noastră

47322
35:25:27,192 --> 35:25:31,440
măsurători. În acest caz, avem like

47323
35:25:28,960 --> 35:25:32,552
lățimea și lungimea botului. si eu

47324
35:25:31,440 --> 35:25:34,960
a spus că o să vin aici sus și

47325
35:25:32,552 --> 35:25:36,872
vorbim doar puțin despre complotul nostru.

47326
35:25:34,960 --> 35:25:38,480
Și veți vedea plt. Asta e ceea ce noi

47327
35:25:36,872 --> 35:25:40,480
importate. Vom face un scatter

47328
35:25:38,480 --> 35:25:41,912
complot. Asta înseamnă că punem doar puncte

47329
35:25:40,480 --> 35:25:44,400
pe acolo. Și apoi uită-te la asta

47330
35:25:41,912 --> 35:25:47,440
notație. Am capitalul X și apoi

47331
35:25:44,400 --> 35:25:49,760
intre paranteze am un colon, 0ero. Asta e

47332
35:25:47,440 --> 35:25:51,592
din numpy. Dacă ai făcut asta într-un mod obișnuit

47333
35:25:49,760 --> 35:25:53,512
matrice, veți primi o eroare într-un Python

47334
35:25:51,592 --> 35:25:55,440
matrice. Trebuie să ai asta într-un numpy

47335
35:25:53,512 --> 35:25:58,232
matrice. Se pare că noi facem blobs

47336
35:25:55,440 --> 35:26:00,552
returnează o matrice numpy. Și această notație

47337
35:25:58,232 --> 35:26:02,552
este grozav pentru că ceea ce înseamnă este

47338
35:26:00,552 --> 35:26:04,232
prima parte este colonul înseamnă că suntem

47339
35:26:02,552 --> 35:26:06,320
va face toate rândurile. Asta e tot

47340
35:26:04,232 --> 35:26:08,320
datele din blob-ul nostru pe care l-am creat sub

47341
35:26:06,320 --> 35:26:10,400
majuscul X. Și apoi partea a doua are

47342
35:26:08,320 --> 35:26:13,120
o virgula 0ero. Vom lua doar

47343
35:26:10,400 --> 35:26:14,480
prima valoare. Și apoi dacă observi,

47344
35:26:13,120 --> 35:26:16,080
facem același lucru, dar o vom face

47345
35:26:14,480 --> 35:26:18,160
ia a doua valoare. Ține minte, noi

47346
35:26:16,080 --> 35:26:20,640
începe întotdeauna cu zero și apoi cu unu. Deci

47347
35:26:18,160 --> 35:26:23,440
avem coloana zero și coloana unu. Şi

47348
35:26:20,640 --> 35:26:25,440
puteți privi asta ca și parcelele noastre XY.

47349
35:26:23,440 --> 35:26:27,680
Primul este xplot și

47350
35:26:25,440 --> 35:26:31,192
al doilea este complotul y. Deci primul

47351
35:26:27,680 --> 35:26:34,320
unul este în partea de jos 0 2 4 6 8 și 10.

47352
35:26:31,192 --> 35:26:37,040
Și apoi al doilea x din unul este

47353
35:26:34,320 --> 35:26:39,760
4 5 6 7 8 9 10 mergând în sus la stânga

47354
35:26:37,040 --> 35:26:41,440
partea mâinii. S= 30 este doar dimensiunea

47355
35:26:39,760 --> 35:26:44,400
puncte. Le putem vedea în loc să fie reale

47356
35:26:41,440 --> 35:26:46,480
puncte minuscule. Și apoi cmap este egal

47357
35:26:44,400 --> 35:26:48,960
plt.cm.pereche.

47358
35:26:46,480 --> 35:26:51,440
Și veți vedea, de asemenea, c este egal cu y.

47359
35:26:48,960 --> 35:26:54,000
Asta e culoarea. Folosim două culori

47360
35:26:51,440 --> 35:26:55,912
01. Și de aceea obținem albastrul frumos

47361
35:26:54,000 --> 35:26:58,080
iar cele două culori diferite pentru

47362
35:26:55,912 --> 35:27:00,320
aligatorul și crocodilul. Acum poți

47363
35:26:58,080 --> 35:27:02,552
vezi aici că am făcut asta exact

47364
35:27:00,320 --> 35:27:04,232
a fost realizat în două linii de cod. Multe

47365
35:27:02,552 --> 35:27:06,232
de ori va fi o a treia linie unde noi

47366
35:27:04,232 --> 35:27:08,320
regularizează datele. O punem între

47367
35:27:06,232 --> 35:27:10,640
ca minus unu și unu și remodelăm

47368
35:27:08,320 --> 35:27:12,160
ea. Dar pentru asta nu este necesar și

47369
35:27:10,640 --> 35:27:14,160
este, de asemenea, cam drăguț pentru că poți

47370
35:27:12,160 --> 35:27:16,080
vezi de fapt ce se întâmplă. Și apoi

47371
35:27:14,160 --> 35:27:17,760
dacă am vrut, am vrut de fapt

47372
35:27:16,080 --> 35:27:19,760
rulează o predicție. Să aruncăm o privire și

47373
35:27:17,760 --> 35:27:22,000
vezi cum arata. Și să prezice

47374
35:27:19,760 --> 35:27:23,832
câteva date noi și le vom arăta din nou

47375
35:27:22,000 --> 35:27:26,080
pe măsură ce ne apropiem de sfârșitul săpatului

47376
35:27:23,832 --> 35:27:29,040
adânc. Îți poți atribui pur și simplu noul

47377
35:27:26,080 --> 35:27:31,440
date. În acest caz, îi dau un uh

47378
35:27:29,040 --> 35:27:34,480
latime si lungime 34 si o latime si

47379
35:27:31,440 --> 35:27:36,872
lungime 56. Și rețineți că am pus datele

47380
35:27:34,480 --> 35:27:38,960
ca un set de paranteze și apoi am

47381
35:27:36,872 --> 35:27:40,960
paranteze în interior. Și motivul pentru care o fac

47382
35:27:38,960 --> 35:27:43,592
asta pentru că atunci când ne uităm la

47383
35:27:40,960 --> 35:27:45,192
date pe care este proiectat să proceseze un volum mare

47384
35:27:43,592 --> 35:27:47,272
cantitatea de date care vin. Nu vrem

47385
35:27:45,192 --> 35:27:48,960
pentru a procesa doar o linie la un moment dat. Şi

47386
35:27:47,272 --> 35:27:50,552
deci, în acest caz, procesez două

47387
35:27:48,960 --> 35:27:53,440
linii. Și apoi o să printez

47388
35:27:50,552 --> 35:27:56,160
și veți vedea clf.predict date noi. Deci

47389
35:27:53,440 --> 35:27:57,512
CLF și partea de predicție urmează să

47390
35:27:56,160 --> 35:28:00,080
da-ne un raspuns. Și să vedem ce

47391
35:27:57,512 --> 35:28:02,232
care arata ca. Și vei vedea 01. Deci

47392
35:28:00,080 --> 35:28:04,872
a prezis primul, 34 merge

47393
35:28:02,232 --> 35:28:06,400
să fie pe o parte și 56 este

47394
35:28:04,872 --> 35:28:08,160
va fi pe cealaltă parte. Deci unul

47395
35:28:06,400 --> 35:28:10,000
a iesit ca un aligator si unul a iesit

47396
35:28:08,160 --> 35:28:12,480
ca un crocodil. Acum e destul de scurt

47397
35:28:10,000 --> 35:28:14,720
explicație pentru configurație, dar într-adevăr noi

47398
35:28:12,480 --> 35:28:16,800
vreau să sapă și să văd ce se întâmplă

47399
35:28:14,720 --> 35:28:19,760
în culise. si sa vedem ce

47400
35:28:16,800 --> 35:28:22,080
care arata ca. Deci, următorul pas este să

47401
35:28:19,760 --> 35:28:24,480
sapă adânc și află ce se întâmplă

47402
35:28:22,080 --> 35:28:26,480
în culise și pune, de asemenea, asta într-o

47403
35:28:24,480 --> 35:28:28,320
frumos frumos grafic. Vom cheltui

47404
35:28:26,480 --> 35:28:30,160
mai multă muncă la asta decât am lucrat noi de fapt

47405
35:28:28,320 --> 35:28:32,160
generarea modelului original. Şi

47406
35:28:30,160 --> 35:28:34,080
vei vedea aici că trecem prin câteva

47407
35:28:32,160 --> 35:28:36,400
pași și voi muta asta la noi

47408
35:28:34,080 --> 35:28:38,400
editor într-o secundă. Intrăm, noi

47409
35:28:36,400 --> 35:28:40,000
creați datele noastre originale. Este exact

47410
35:28:38,400 --> 35:28:41,912
identic cu prima parte și o voi face

47411
35:28:40,000 --> 35:28:43,832
explicați de ce am reluat asta și vă arătăm

47412
35:28:41,912 --> 35:28:45,592
cum sa nu refac asta. Și atunci suntem

47413
35:28:43,832 --> 35:28:47,272
o să intru acolo și să le adaugi

47414
35:28:45,592 --> 35:28:49,760
linii. O să vedem care sunt acestea

47415
35:28:47,272 --> 35:28:51,120
arată liniile și cum să le configurați.

47416
35:28:49,760 --> 35:28:53,040
Și, în sfârșit, o să complotăm totul

47417
35:28:51,120 --> 35:28:55,440
asta aici și arată-l. Și vei primi

47418
35:28:53,040 --> 35:28:56,960
un grafic frumos cu ceea ce am văzut

47419
35:28:55,440 --> 35:28:59,832
mai devreme când treceam prin

47420
35:28:56,960 --> 35:29:02,320
teoria din spatele acestui lucru unde arată

47421
35:28:59,832 --> 35:29:03,512
vectorii suport și hiperplanul. Şi

47422
35:29:02,320 --> 35:29:05,512
acestea sunt făcute acolo unde puteți vedea

47423
35:29:03,512 --> 35:29:07,512
vectori suport ca liniile punctate și

47424
35:29:05,512 --> 35:29:09,360
linia continuă care este hiperplanul.

47425
35:29:07,512 --> 35:29:12,400
Să introducem asta în Jupyter-ul nostru

47426
35:29:09,360 --> 35:29:15,592
caietul. Înainte de a defila în jos la un nou

47427
35:29:12,400 --> 35:29:17,272
linia, vreau să observați rândul 13. It

47428
35:29:15,592 --> 35:29:18,640
are spectacol intriga. Și o să vorbim

47429
35:29:17,272 --> 35:29:20,480
despre asta aici într-o secundă. Dar

47430
35:29:18,640 --> 35:29:22,232
să derulăm în jos la o nouă linie în jos

47431
35:29:20,480 --> 35:29:24,160
Aici. Și voi lipi acel cod

47432
35:29:22,232 --> 35:29:26,320
in. Și vei vedea că intriga arată

47433
35:29:24,160 --> 35:29:28,160
s-a mutat mai jos. Să derulăm în sus a

47434
35:29:26,320 --> 35:29:32,080
putin. Și dacă te uiți sus

47435
35:29:28,160 --> 35:29:34,480
aici din noua noastră secțiune, 1 2 3 și patru

47436
35:29:32,080 --> 35:29:36,160
este același cod pe care îl aveam înainte. Şi

47437
35:29:34,480 --> 35:29:38,552
hai să ne întoarcem aici și să aruncăm o privire la

47438
35:29:36,160 --> 35:29:40,480
că. Ne vom potrivi cu valorile

47439
35:29:38,552 --> 35:29:42,160
SVM-ul nostru. Și apoi o să complotăm

47440
35:29:40,480 --> 35:29:44,480
împrăștia-l. Și apoi vom face o

47441
35:29:42,160 --> 35:29:47,192
spectacol intriga. Deci ar trebui să te întrebi de ce

47442
35:29:44,480 --> 35:29:49,592
refacem același cod. Ei bine, când

47443
35:29:47,192 --> 35:29:51,440
tu faci spectacolul intrigii, asta se evidențiază

47444
35:29:49,592 --> 35:29:53,440
ce este în complot. Deci, odată ce am terminat

47445
35:29:51,440 --> 35:29:55,440
acest spectacol intriga, trebuie să reîncarc asta

47446
35:29:53,440 --> 35:29:58,000
date. Acum, am putea face asta pur și simplu

47447
35:29:55,440 --> 35:30:00,160
eliminând-o aici sus, reluând-o și

47448
35:29:58,000 --> 35:30:01,832
apoi coborând aici, și apoi noi

47449
35:30:00,160 --> 35:30:04,000
nu ar trebui să ruleze din nou aceste prime patru

47450
35:30:01,832 --> 35:30:05,440
linii de cod. Acum, în asta, nu

47451
35:30:04,000 --> 35:30:07,592
contează prea mult. Și vei vedea complotul

47452
35:30:05,440 --> 35:30:10,160
Afișarea este aici jos și apoi eliminată dreapta

47453
35:30:07,592 --> 35:30:11,832
acolo pe linia cinci. voi merge înainte și

47454
35:30:10,160 --> 35:30:13,832
doar șterge asta de acolo pentru că noi

47455
35:30:11,832 --> 35:30:15,680
nu vreau să ne golim ecranul. Noi

47456
35:30:13,832 --> 35:30:17,592
doriți să treceți la următoarea configurație. Deci,

47457
35:30:15,680 --> 35:30:19,832
putem merge înainte și să omitem doar pe primul

47458
35:30:17,592 --> 35:30:22,160
patru rânduri pentru că am făcut asta înainte.

47459
35:30:19,832 --> 35:30:24,080
Și să aruncăm o privire la ax=

47460
35:30:22,160 --> 35:30:25,832
plt.gca.

47461
35:30:24,080 --> 35:30:27,760
Acum, chiar acum, chiar cheltuim

47462
35:30:25,832 --> 35:30:29,832
mult timp doar grafic. Asta-i tot

47463
35:30:27,760 --> 35:30:32,872
facem aici. Bine. Deci, așa este

47464
35:30:29,832 --> 35:30:35,272
afișăm un grafic frumos cu rezultatele noastre

47465
35:30:32,872 --> 35:30:36,960
și datele noastre. AX este foarte standard nu

47466
35:30:35,272 --> 35:30:39,192
variabilă folosită când vorbești despre

47467
35:30:36,960 --> 35:30:41,912
PLT și doar îl setează la asta

47468
35:30:39,192 --> 35:30:43,272
axă ultima axă din PLT. Se poate

47469
35:30:41,912 --> 35:30:45,040
devin foarte confuz dacă lucrezi

47470
35:30:43,272 --> 35:30:46,960
cu multe straturi diferite de date pe

47471
35:30:45,040 --> 35:30:49,440
același grafic și asta îl face foarte

47472
35:30:46,960 --> 35:30:52,320
ușor de referit la topor. Deci asta

47473
35:30:49,440 --> 35:30:54,160
referință se uită la PLT pe care noi

47474
35:30:52,320 --> 35:30:56,160
creat și deja ne-am cartografiat

47475
35:30:54,160 --> 35:30:58,160
două blobs pe. Și atunci vrem să știm

47476
35:30:56,160 --> 35:31:00,000
limitele. Deci vrem să știm cât de mare

47477
35:30:58,160 --> 35:31:02,000
graficul este. Și putem afla x

47478
35:31:00,000 --> 35:31:04,720
limită și limita y pur și simplu cu

47479
35:31:02,000 --> 35:31:07,272
obține limita x și obține comenzi yimit care

47480
35:31:04,720 --> 35:31:09,272
face parte din biblioteca noastră metplot. Și apoi

47481
35:31:07,272 --> 35:31:11,192
vom crea o grilă. Și vei

47482
35:31:09,272 --> 35:31:15,120
vezi aici jos avem am setat

47483
35:31:11,192 --> 35:31:18,320
variabila xx egală cu npini spațiu ximit

47484
35:31:15,120 --> 35:31:20,552
0 ximit 1a 30. Și noi am făcut la fel

47485
35:31:18,320 --> 35:31:22,640
lucru pentru yspace. Și atunci suntem

47486
35:31:20,552 --> 35:31:25,192
vom intra aici și vom crea o plasă

47487
35:31:22,640 --> 35:31:28,000
grila. Și aceasta este o comandă numpy. Deci

47488
35:31:25,192 --> 35:31:30,080
ne-am întors la numerele noastre python. Să

47489
35:31:28,000 --> 35:31:32,080
treci prin ce aceste comenzi numpy

47490
35:31:30,080 --> 35:31:36,160
înseamnă cu spațiul liniei din plasă

47491
35:31:32,080 --> 35:31:38,872
grila. Am luat linia xx small xx= np

47492
35:31:36,160 --> 35:31:40,872
spaţiu. Și avem limita noastră x zero și

47493
35:31:38,872 --> 35:31:43,192
nostru x limită unul și o vom face

47494
35:31:40,872 --> 35:31:45,440
creați 30 de puncte pe el. Și mergem

47495
35:31:43,192 --> 35:31:46,720
să faci același lucru pentru axa y. Acum

47496
35:31:45,440 --> 35:31:48,872
asta nu are nimic de-a face cu a noastră

47497
35:31:46,720 --> 35:31:52,160
evaluarea. Tot ce facem este

47498
35:31:48,872 --> 35:31:53,760
creăm o grilă de date. Și așa

47499
35:31:52,160 --> 35:31:56,160
creăm un set de puncte între

47500
35:31:53,760 --> 35:31:58,160
zero și limita x. Creăm 30

47501
35:31:56,160 --> 35:32:00,000
puncte. Și același lucru cu y.

47502
35:31:58,160 --> 35:32:02,320
Și apoi grila de plasă le face bucle pe toate

47503
35:32:00,000 --> 35:32:04,080
împreună. Deci formează o grilă frumoasă. Deci dacă

47504
35:32:02,320 --> 35:32:06,720
aveam de gând să facem acest spun între

47505
35:32:04,080 --> 35:32:12,160
limitează 0 și 10 și facem 10 puncte, noi

47506
35:32:06,720 --> 35:32:14,160
ar avea un 0 0 1 1 0 1 02 03 04 până la 10

47507
35:32:12,160 --> 35:32:16,232
si asa mai departe. Vă puteți imagina doar un punct

47508
35:32:14,160 --> 35:32:18,000
la fiecare colt una din acele cutii. Şi

47509
35:32:16,232 --> 35:32:20,000
grila de plasă le combină pe toate. Deci noi

47510
35:32:18,000 --> 35:32:21,760
luați y și xx pe care le-am creat și

47511
35:32:20,000 --> 35:32:24,480
creează grila completă. Și am stabilit

47512
35:32:21,760 --> 35:32:26,800
acea grilă în coordonatele y și

47513
35:32:24,480 --> 35:32:29,192
coordonatele xx. Acum amintiți-vă, când suntem

47514
35:32:26,800 --> 35:32:30,872
lucrând cu Numbi în Python, ne place

47515
35:32:29,192 --> 35:32:34,080
separă pe acelea. Ne place să avem în schimb

47516
35:32:30,872 --> 35:32:38,232
din care este x virgulă 1, știi, x virgulă

47517
35:32:34,080 --> 35:32:40,800
y și apoi x2 virgula y2 și în următorul

47518
35:32:38,232 --> 35:32:42,960
set de date, ar fi o coloană de x

47519
35:32:40,800 --> 35:32:44,872
și o coloană de y. Și asta este ceea ce noi

47520
35:32:42,960 --> 35:32:46,960
Avem aici o coloană de y. Noi

47521
35:32:44,872 --> 35:32:49,360
puneți-o ca y y majuscule și o coloană de

47522
35:32:46,960 --> 35:32:51,440
x, xx majuscule cu toate acelea diferite

47523
35:32:49,360 --> 35:32:54,960
punctele fiind enumerate. Și în sfârșit, obținem

47524
35:32:51,440 --> 35:32:57,192
până la numpy vstack. La fel ca noi

47525
35:32:54,960 --> 35:32:59,040
le-am creat în grila de plasă, suntem

47526
35:32:57,192 --> 35:33:01,912
acum le voi pune pe toate într-una

47527
35:32:59,040 --> 35:33:04,080
matrice, matrice XY. Acum că am creat

47528
35:33:01,912 --> 35:33:05,912
teancul de puncte de date, vom merge

47529
35:33:04,080 --> 35:33:08,320
face ceva interesant aici. Suntem

47530
35:33:05,912 --> 35:33:11,512
va crea o valoare Z. Și Z

47531
35:33:08,320 --> 35:33:13,512
este egal cu CLF. Ăsta e al nostru, asta e al nostru

47532
35:33:11,512 --> 35:33:16,000
suport vector mașină pe care am creat-o și

47533
35:33:13,512 --> 35:33:17,592
deja ne-am antrenat. Și avem o

47534
35:33:16,000 --> 35:33:19,912
functie de decizie. Și o să mergem

47535
35:33:17,592 --> 35:33:22,232
pune XY acolo. Deci aici le avem pe toate

47536
35:33:19,912 --> 35:33:23,592
aceste date. O să punem acel XY înăuntru

47537
35:33:22,232 --> 35:33:25,512
acolo, acele date, și o vom face

47538
35:33:23,592 --> 35:33:28,480
remodelează-l. Și vei vedea că avem

47539
35:33:25,512 --> 35:33:31,272
forma xx aici. Asta la propriu

47540
35:33:28,480 --> 35:33:34,640
ia xx, îl resetează, conectat la

47541
35:33:31,272 --> 35:33:37,512
y și valoarea z ne anunță

47542
35:33:34,640 --> 35:33:38,552
fie că este partea stângă. Este

47543
35:33:37,512 --> 35:33:40,800
va genera trei diferite

47544
35:33:38,552 --> 35:33:43,592
valorile. Valoarea z face și va spune

47545
35:33:40,800 --> 35:33:45,680
ne spune dacă acele date sunt un vector suport

47546
35:33:43,592 --> 35:33:47,360
la stânga, hiperplanul în

47547
35:33:45,680 --> 35:33:49,120
mijloc, sau vectorul suport la

47548
35:33:47,360 --> 35:33:50,960
corect. Deci generează trei diferite

47549
35:33:49,120 --> 35:33:52,720
valori pentru fiecare dintre aceste puncte. Şi

47550
35:33:50,960 --> 35:33:54,400
acele puncte au fost remodelate astfel

47551
35:33:52,720 --> 35:33:56,800
sunt chiar pe o linie pe cei trei

47552
35:33:54,400 --> 35:33:58,800
linii diferite. Așa că le-am setat pe toate

47553
35:33:56,800 --> 35:34:00,872
date sus. L-am etichetat la trei

47554
35:33:58,800 --> 35:34:02,800
diferite zone și le-am remodelat.

47555
35:34:00,872 --> 35:34:04,720
Și tocmai am luat 30 de puncte în fiecare

47556
35:34:02,800 --> 35:34:07,192
direcție. Dacă faci calculul, ai

47557
35:34:04,720 --> 35:34:08,640
30 * 30. Deci sunt 900 de puncte de date.

47558
35:34:07,192 --> 35:34:10,480
Și am despărțit-o între cei trei

47559
35:34:08,640 --> 35:34:12,800
linii și l-am remodelat pentru a se potrivi celor trei

47560
35:34:10,480 --> 35:34:15,192
linii. Apoi ne putem întoarce la harta noastră

47561
35:34:12,800 --> 35:34:16,872
plot library unde am creat AX

47562
35:34:15,192 --> 35:34:18,552
și vom crea un contur. Şi

47563
35:34:16,872 --> 35:34:21,040
vei vedea aici unde avem contur,

47564
35:34:18,552 --> 35:34:23,360
capital XX, capital Y, Y. Acestea au

47565
35:34:21,040 --> 35:34:25,440
a fost remodelat pentru a se potrivi cu acele linii. Z este

47566
35:34:23,360 --> 35:34:26,872
etichetele. Deci acum îi avem pe cei trei

47567
35:34:25,440 --> 35:34:28,720
puncte diferite cu etichetele în

47568
35:34:26,872 --> 35:34:30,640
acolo. Și putem seta culorile egale

47569
35:34:28,720 --> 35:34:33,360
K. Și ți-am spus că avem trei diferite

47570
35:34:30,640 --> 35:34:36,232
etichete, dar avem trei niveluri de

47571
35:34:33,360 --> 35:34:38,720
date. Alfa este doar o face

47572
35:34:36,232 --> 35:34:40,480
transparentă. Deci este doar 0,5 din

47573
35:34:38,720 --> 35:34:41,912
valoare acolo. Așa că atunci când îl graficăm,

47574
35:34:40,480 --> 35:34:43,680
datele vor apărea din spatele lui,

47575
35:34:41,912 --> 35:34:46,552
oriunde merg liniile. Și, în cele din urmă,

47576
35:34:43,680 --> 35:34:49,512
stiluri de linii. Aici setam

47577
35:34:46,552 --> 35:34:51,592
doi vectori suport să fie liniuță liniuță

47578
35:34:49,512 --> 35:34:53,120
linii și apoi unul singur este doar a

47579
35:34:51,592 --> 35:34:55,680
linie dreaptă. Asta sunt toate astea

47580
35:34:53,120 --> 35:34:58,000
configurarea face. Și apoi, în sfârșit, luăm

47581
35:34:55,680 --> 35:35:00,640
toporul nostru.împrăştie. Vom merge înainte

47582
35:34:58,000 --> 35:35:02,640
și trasează vectorii suport, dar am făcut-o

47583
35:35:00,640 --> 35:35:04,320
l-au programat acolo, astfel încât să arate

47584
35:35:02,640 --> 35:35:06,552
frumos ca linia liniuță și liniuța

47585
35:35:04,320 --> 35:35:09,192
linie punctată pe acea grilă. Și poți vedea

47586
35:35:06,552 --> 35:35:11,512
aici când facem suportul CLFS

47587
35:35:09,192 --> 35:35:14,232
vectori, ne uităm la coloana zero

47588
35:35:11,512 --> 35:35:16,480
și coloana unu. Și apoi din nou avem

47589
35:35:14,232 --> 35:35:18,320
S este egal cu 100. Deci vom face

47590
35:35:16,480 --> 35:35:20,552
ele mai mari. Și lățimea liniei este egală

47591
35:35:18,320 --> 35:35:21,680
1, culorile feței nu sunt egale cu niciuna. Să luăm o

47592
35:35:20,552 --> 35:35:23,272
uite și vezi cum arată asta când

47593
35:35:21,680 --> 35:35:25,760
o arătăm. Și puteți vedea când ajungem

47594
35:35:23,272 --> 35:35:28,480
până la rezultatul nostru final, creează un

47595
35:35:25,760 --> 35:35:30,720
foarte frumos grafic. Avem pe cei doi

47596
35:35:28,480 --> 35:35:32,800
vectori de suport și linii întrerupte. Și ei

47597
35:35:30,720 --> 35:35:34,480
au datele apropiate. Deci le puteți vedea

47598
35:35:32,800 --> 35:35:36,480
două puncte sau în acest caz cele patru

47599
35:35:34,480 --> 35:35:38,320
punctele în care acele linii se desprind frumos

47600
35:35:36,480 --> 35:35:40,080
datele. Și apoi ai hiperul tău

47601
35:35:38,320 --> 35:35:41,512
avion în jos, care este cât mai departe

47602
35:35:40,080 --> 35:35:43,680
din cele două puncte diferite ca

47603
35:35:41,512 --> 35:35:45,832
posibilă crearea distanței maxime.

47604
35:35:43,680 --> 35:35:47,912
Așa că puteți vedea că avem dragul nostru

47605
35:35:45,832 --> 35:35:49,832
ieșire pentru dimensiunea corpului și a

47606
35:35:47,912 --> 35:35:51,680
lățimea botului și am ușor

47607
35:35:49,832 --> 35:35:54,000
a separat cele două grupuri de crocodili

47608
35:35:51,680 --> 35:35:55,592
și aligator. Felicitări. Ai

47609
35:35:54,000 --> 35:35:58,320
făcut-o. Am reușit. Desigur, acestea

47610
35:35:55,592 --> 35:36:00,320
sunt date pretinse pentru crocodilii noștri și

47611
35:35:58,320 --> 35:36:02,400
aligatori. Dar acest exemplu practic

47612
35:36:00,320 --> 35:36:04,232
vă va ajuta să găsiți orice sprijin

47613
35:36:02,400 --> 35:36:06,080
proiecte de mașini vectoriale în viitor.

47614
35:36:04,232 --> 35:36:08,160
Și puteți vedea cât de ușor sunt de setat

47615
35:36:06,080 --> 35:36:10,080
sus și priviți în profunzime. Vom merge

47616
35:36:08,160 --> 35:36:14,160
acoperă K vecinii cei mai apropiați mult

47617
35:36:10,080 --> 35:36:16,080
denumit KNN. Și KNN este într-adevăr un

47618
35:36:14,160 --> 35:36:18,000
loc fundamental pentru a începe în

47619
35:36:16,080 --> 35:36:19,592
învățarea automată. Este o bază a multor

47620
35:36:18,000 --> 35:36:21,360
a altor lucruri și doar logica

47621
35:36:19,592 --> 35:36:24,080
în spatele ei este ușor de înțeles și

47622
35:36:21,360 --> 35:36:26,160
încorporate în alte forme de mașină

47623
35:36:24,080 --> 35:36:30,720
învăţarea. Deci astăzi, pentru ce este în el

47624
35:36:26,160 --> 35:36:33,760
tu? De ce avem nevoie de KNN? Ce este KNandN?

47625
35:36:30,720 --> 35:36:37,592
Cum alegem factorul K? Când faci

47626
35:36:33,760 --> 35:36:40,000
folosim KNN? Cum funcționează algoritmul KNandN

47627
35:36:37,592 --> 35:36:42,320
munca? Și apoi ne vom scufunda în mine

47628
35:36:40,000 --> 35:36:44,320
partea preferată, cazul de utilizare. Prezice

47629
35:36:42,320 --> 35:36:46,720
dacă o persoană va avea diabet sau

47630
35:36:44,320 --> 35:36:50,000
nu. Acesta este un lucru foarte comun și popular

47631
35:36:46,720 --> 35:36:52,000
setul de date folosit în ceea ce privește testarea

47632
35:36:50,000 --> 35:36:54,232
modele și a învăța cum să folosească

47633
35:36:52,000 --> 35:36:56,800
diferite modele în învățarea automată. De către

47634
35:36:54,232 --> 35:36:58,480
acum, cunoaștem cu toții modele de învățare automată

47635
35:36:56,800 --> 35:37:00,480
face predicții învățând din

47636
35:36:58,480 --> 35:37:02,960
date din trecut disponibile. Deci avem noastre

47637
35:37:00,480 --> 35:37:04,872
valorile de intrare. Modelul nostru de învățare automată

47638
35:37:02,960 --> 35:37:06,800
se bazează pe acele intrări a ceea ce noi

47639
35:37:04,872 --> 35:37:09,592
știm deja și apoi folosim asta pentru

47640
35:37:06,800 --> 35:37:11,832
creați o ieșire estimată. Este un

47641
35:37:09,592 --> 35:37:14,320
câine? Puștiul se uită acolo și

47642
35:37:11,832 --> 35:37:16,160
privind pisica neagră trecându-le în cale.

47643
35:37:14,320 --> 35:37:18,552
Nu, dragă. Puteți face diferența între

47644
35:37:16,160 --> 35:37:20,160
o pisică și un câine pe baza lor

47645
35:37:18,552 --> 35:37:23,120
caracteristici.

47646
35:37:20,160 --> 35:37:25,912
Pisicile. Pisicile au gheare ascuțite, obișnuiesc să

47647
35:37:23,120 --> 35:37:29,192
urcare, lungime mai mica a urechilor, miauna si

47648
35:37:25,912 --> 35:37:30,872
toarcă. Nu-i place să se joace. câini.

47649
35:37:29,192 --> 35:37:33,440
Au gheare tocite, lungime mai mare de

47650
35:37:30,872 --> 35:37:35,120
urechi, latră, îi place să alerge. tu

47651
35:37:33,440 --> 35:37:36,640
de obicei nu văd o pisică alergând

47652
35:37:35,120 --> 35:37:38,960
oameni, deși am o pisică care

47653
35:37:36,640 --> 35:37:40,720
face asta acolo unde fac câinii. Și putem privi

47654
35:37:38,960 --> 35:37:42,640
la acestea. Putem spune că putem evalua

47655
35:37:40,720 --> 35:37:45,120
ascuțimea ghearelor. Cât de ascuțit

47656
35:37:42,640 --> 35:37:47,440
sunt ghearele lor? Și putem evalua

47657
35:37:45,120 --> 35:37:49,512
lungimea urechilor. Și de obicei putem

47658
35:37:47,440 --> 35:37:52,160
sortați pisicile de câini pe baza egalului

47659
35:37:49,512 --> 35:37:54,800
acele două caracteristici. Acum, spune-mi

47660
35:37:52,160 --> 35:37:56,400
dacă este o pisică sau un câine. Nu intrebare.

47661
35:37:54,800 --> 35:37:58,320
De obicei, copiii mici cunosc pisicile și câinii

47662
35:37:56,400 --> 35:38:00,160
pana acum. decât dacă locuieşti într-un loc în care

47663
35:37:58,320 --> 35:38:01,680
nu sunt multe pisici sau câini. Deci, dacă noi

47664
35:38:00,160 --> 35:38:03,760
uită-te la ascuțimea ghearelor, la

47665
35:38:01,680 --> 35:38:06,872
lungimea urechilor și putem vedea asta

47666
35:38:03,760 --> 35:38:09,440
pisica are urechi mai mici și mai ascuțite

47667
35:38:06,872 --> 35:38:11,680
gheare decât celelalte animale. Ei

47668
35:38:09,440 --> 35:38:14,552
caracteristicile sunt mai degrabă ca pisici. Trebuie să fie

47669
35:38:11,680 --> 35:38:17,120
o pisica. Gheare ascuțite, lungimea urechilor și

47670
35:38:14,552 --> 35:38:19,360
merge în grupul pisicilor. Pentru că KNandN

47671
35:38:17,120 --> 35:38:22,320
se bazează pe asemănarea caracteristicilor, putem

47672
35:38:19,360 --> 35:38:24,000
faceți clasificarea folosind clasificatorul KNandN.

47673
35:38:22,320 --> 35:38:26,232
Deci, avem valoarea noastră de intrare, imaginea

47674
35:38:24,000 --> 35:38:28,320
a pisicii negre. Intră în noi

47675
35:38:26,232 --> 35:38:31,912
model antrenat și prezice că aceasta

47676
35:38:28,320 --> 35:38:35,120
este o pisică care iese. Deci ce este knn?

47677
35:38:31,912 --> 35:38:37,120
Ce este algoritmul knandn? K cel mai apropiat

47678
35:38:35,120 --> 35:38:39,272
vecinii este ceea ce înseamnă asta. este

47679
35:38:37,120 --> 35:38:41,680
una dintre cele mai simple mașini supravegheate

47680
35:38:39,272 --> 35:38:44,232
algoritmi de învățare utilizați în principal pentru

47681
35:38:41,680 --> 35:38:46,552
clasificare. Deci vrem să știm că este

47682
35:38:44,232 --> 35:38:49,272
acesta este un câine sau nu este un câine? Este un

47683
35:38:46,552 --> 35:38:51,040
pisica sau nu pisica? Clasifică o dată

47684
35:38:49,272 --> 35:38:53,760
punct în funcție de modul în care sunt vecinii săi

47685
35:38:51,040 --> 35:38:56,320
clasificate. Toate magazinele KNandN sunt disponibile

47686
35:38:53,760 --> 35:38:58,552
cazuri și clasifică cazurile noi pe baza

47687
35:38:56,320 --> 35:39:01,120
o măsură de similitudine. Și iată-ne

47688
35:38:58,552 --> 35:39:03,120
a trecut de la pisici și câini chiar la vin.

47689
35:39:01,120 --> 35:39:05,192
Un alt preferat de-al meu. magazine KNandN

47690
35:39:03,120 --> 35:39:07,512
toate cazurile disponibile și clasifică noi

47691
35:39:05,192 --> 35:39:09,272
cazuri bazate pe o măsură de similitudine. Şi

47692
35:39:07,512 --> 35:39:12,000
aici vezi că avem o măsurătoare

47693
35:39:09,272 --> 35:39:13,592
dioxid de sulf în raport cu nivelul de clorură

47694
35:39:12,000 --> 35:39:15,272
și apoi diferitele vinuri pe care le au

47695
35:39:13,592 --> 35:39:17,272
testate și unde se încadrează pe acel grafic

47696
35:39:15,272 --> 35:39:19,680
bazat pe cât de mult dioxid de sulf și cum

47697
35:39:17,272 --> 35:39:21,272
multă clorură. K și KandN este un perimetru

47698
35:39:19,680 --> 35:39:23,040
care se referă la numărul celor mai apropiate

47699
35:39:21,272 --> 35:39:25,120
vecinii să includă în majoritatea

47700
35:39:23,040 --> 35:39:27,760
procesul de vot. Și așa dacă adăugăm un

47701
35:39:25,120 --> 35:39:29,440
pahar nou de vin acolo, roșu sau alb,

47702
35:39:27,760 --> 35:39:30,960
vrem să știm care sunt vecinii.

47703
35:39:29,440 --> 35:39:33,272
În acest caz, vom pune K

47704
35:39:30,960 --> 35:39:35,040
este egal cu 5. Vom vorbi despre K doar în a

47705
35:39:33,272 --> 35:39:36,872
minut. Un punct de date este clasificat prin

47706
35:39:35,040 --> 35:39:39,272
majoritatea voturilor din cele cinci ale sale

47707
35:39:36,872 --> 35:39:41,120
vecinii cei mai apropiati. Aici, necunoscutul

47708
35:39:39,272 --> 35:39:43,680
punctul ar fi clasificat drept roșu deoarece

47709
35:39:41,120 --> 35:39:46,400
patru din cinci vecini sunt roșii. Deci,

47710
35:39:43,680 --> 35:39:48,552
cum alegem K? Cum îl cunoaștem pe K

47711
35:39:46,400 --> 35:39:49,592
este egal cu 5? Vreau să spun că asta a fost valoarea noastră

47712
35:39:48,552 --> 35:39:52,000
pune acolo. Am spus că vom vorbi

47713
35:39:49,592 --> 35:39:54,232
despre asta. Cum alegem factorul K?

47714
35:39:52,000 --> 35:39:56,160
Algoritmul KNandN se bazează pe caracteristică

47715
35:39:54,232 --> 35:39:59,680
asemănarea. Alegerea valorii corecte a

47716
35:39:56,160 --> 35:40:02,000
K este un proces numit reglarea parametrilor

47717
35:39:59,680 --> 35:40:04,640
și este important pentru o mai bună acuratețe. Deci

47718
35:40:02,000 --> 35:40:06,720
la K este egal cu 3, putem clasifica avem a

47719
35:40:04,640 --> 35:40:08,960
semn de întrebare în mijloc ca fie a

47720
35:40:06,720 --> 35:40:10,960
ca pătrat sau nu. Este un pătrat sau este

47721
35:40:08,960 --> 35:40:12,640
este în acest caz un triunghi? Și așa dacă noi

47722
35:40:10,960 --> 35:40:14,232
set K egal cu trei, vom face

47723
35:40:12,640 --> 35:40:16,080
uita-te la cei mai apropiati trei vecini.

47724
35:40:14,232 --> 35:40:19,512
Vom spune că acesta este un pătrat. Şi

47725
35:40:16,080 --> 35:40:21,272
dacă punem k este egal cu a 7, clasificăm ca a

47726
35:40:19,512 --> 35:40:22,800
triunghi în funcție de ce celălalt

47727
35:40:21,272 --> 35:40:24,872
datele sunt în jur. Și puteți vedea ca

47728
35:40:22,800 --> 35:40:26,872
k se schimbă în funcție de unde

47729
35:40:24,872 --> 35:40:29,120
Ideea este că asta vă schimbă drastic

47730
35:40:26,872 --> 35:40:31,360
răspuns. Și sărim aici. Mergem, cum

47731
35:40:29,120 --> 35:40:33,120
alegem factorul lui k? Vei

47732
35:40:31,360 --> 35:40:35,440
găsiți acest lucru în toate învățarea automată.

47733
35:40:33,120 --> 35:40:37,512
Alegerea acestor factori, aceasta este fața

47734
35:40:35,440 --> 35:40:39,680
primesti. Parcă, Doamne, am făcut-o

47735
35:40:37,512 --> 35:40:41,592
alege K potrivit? Am pus-o corect

47736
35:40:39,680 --> 35:40:42,872
valorile mele în orice învățare automată

47737
35:40:41,592 --> 35:40:45,040
instrument la care te uiți? astfel încât tu

47738
35:40:42,872 --> 35:40:48,160
nu aveți o părtinire uriașă într-o direcție

47739
35:40:45,040 --> 35:40:50,480
sau celălalt. Și în ceea ce privește KNN, the

47740
35:40:48,160 --> 35:40:52,800
număr de K, dacă îl alegeți prea mic,

47741
35:40:50,480 --> 35:40:54,640
părtinirea se bazează pe ea

47742
35:40:52,800 --> 35:40:56,000
zgomotos. Este chiar lângă un cuplu

47743
35:40:54,640 --> 35:40:57,360
lucruri și le va alege

47744
35:40:56,000 --> 35:41:00,480
lucruri și s-ar putea să fii denaturat

47745
35:40:57,360 --> 35:41:02,320
răspuns. Și dacă K este prea mare, atunci

47746
35:41:00,480 --> 35:41:03,760
procesarea va dura o veșnicie.

47747
35:41:02,320 --> 35:41:06,552
Așa că vei trece la procesare

47748
35:41:03,760 --> 35:41:08,552
probleme și probleme de resurse. Deci ce noi

47749
35:41:06,552 --> 35:41:11,512
face cea mai obișnuită utilizare și există altele

47750
35:41:08,552 --> 35:41:14,160
opțiunile pentru alegerea k este să utilizați

47751
35:41:11,512 --> 35:41:16,000
rădăcină pătrată a lui n. Deci n este un număr total

47752
35:41:14,160 --> 35:41:18,800
de valorile pe care le ai iei pătratul

47753
35:41:16,000 --> 35:41:20,800
rădăcina acestuia. In cele mai multe cazuri si tu daca

47754
35:41:18,800 --> 35:41:22,080
este un număr par, așa că dacă îl utilizați

47755
35:41:20,800 --> 35:41:24,320
uh ca în acest caz pătrate și

47756
35:41:22,080 --> 35:41:27,120
triunghiuri chiar dacă vrei să faci

47757
35:41:24,320 --> 35:41:28,960
valoarea ta k impar. Asta îl ajută să selecteze

47758
35:41:27,120 --> 35:41:30,720
mai bine. Deci, cu alte cuvinte, nu ești

47759
35:41:28,960 --> 35:41:32,232
va avea un echilibru între doi

47760
35:41:30,720 --> 35:41:34,232
diferiți factori care sunt egali. Deci

47761
35:41:32,232 --> 35:41:36,232
de obicei se ia rădăcina pătrată a lui n și dacă

47762
35:41:34,232 --> 35:41:37,912
chiar dacă adaugi unul sau scazi

47763
35:41:36,232 --> 35:41:39,912
unul din el și de acolo iei

47764
35:41:37,912 --> 35:41:41,760
valoarea k din aceasta este cea mai comună utilizare

47765
35:41:39,912 --> 35:41:45,440
si este destul de solid. Functioneaza foarte mult

47766
35:41:41,760 --> 35:41:47,680
bine. Când folosim kn? Putem folosi kn

47767
35:41:45,440 --> 35:41:49,272
când datele sunt etichetate. Deci ai nevoie de un

47768
35:41:47,680 --> 35:41:52,640
eticheta pe ea. Știm că avem un grup de

47769
35:41:49,272 --> 35:41:55,680
poze cu caini pisici pisici. Datele sunt

47770
35:41:52,640 --> 35:41:57,360
fără zgomot. Și așa puteți vedea aici când

47771
35:41:55,680 --> 35:42:00,640
avem o clasă și avem like

47772
35:41:57,360 --> 35:42:02,160
subponderal 140 23 Hello Kitty normal

47773
35:42:00,640 --> 35:42:04,480
asta e destul de confuz. Avem un a

47774
35:42:02,160 --> 35:42:06,480
o mare varietate de date care vin. Deci este

47775
35:42:04,480 --> 35:42:08,232
foarte zgomotos și asta ar provoca o

47776
35:42:06,480 --> 35:42:10,000
problema. Setul de date este mic. Deci suntem

47777
35:42:08,232 --> 35:42:13,120
lucrează de obicei cu seturi de date mai mici

47778
35:42:10,000 --> 35:42:14,640
unde ai putea intra în gig de date dacă

47779
35:42:13,120 --> 35:42:17,440
este chiar curat. Nu are multe

47780
35:42:14,640 --> 35:42:19,440
de zgomot pentru că KNandN este un învățător leneș.

47781
35:42:17,440 --> 35:42:21,360
i.e. nu învață o discriminare

47782
35:42:19,440 --> 35:42:23,272
funcția din setul de antrenament. Deci este

47783
35:42:21,360 --> 35:42:25,040
foarte leneș. Deci dacă ai foarte

47784
35:42:23,272 --> 35:42:26,160
date complicate și aveți o mare

47785
35:42:25,040 --> 35:42:28,080
cantitate din ea, nu o vei folosi

47786
35:42:26,160 --> 35:42:30,160
kn. Dar este foarte grozav să obții un

47787
35:42:28,080 --> 35:42:32,160
loc de început. Chiar și cu date mari,

47788
35:42:30,160 --> 35:42:33,760
puteți sorta o mostră mică și puteți obține

47789
35:42:32,160 --> 35:42:36,720
o idee despre cum arată asta folosind

47790
35:42:33,760 --> 35:42:39,192
KNandN și, de asemenea, folosind doar pentru mai mici

47791
35:42:36,720 --> 35:42:42,000
seturi de date. KNandN funcționează foarte bine. Cum

47792
35:42:39,192 --> 35:42:44,480
functioneaza algoritmul KNandN? Luați în considerare a

47793
35:42:42,000 --> 35:42:47,360
set de date având două variabile, înălțimea în

47794
35:42:44,480 --> 35:42:49,592
centimetri și greutatea în kilograme. Şi

47795
35:42:47,360 --> 35:42:51,832
fiecare punct este clasificat ca normal sau

47796
35:42:49,592 --> 35:42:53,440
subponderal. Deci putem vedea chiar aici

47797
35:42:51,832 --> 35:42:55,120
au două variabile, știi, adevărat

47798
35:42:53,440 --> 35:42:56,872
fals. Ori sunt normali, ori sunt

47799
35:42:55,120 --> 35:42:59,040
nu. Sunt subponderali. Pe baza

47800
35:42:56,872 --> 35:43:01,192
dintre datele date, trebuie să clasificăm

47801
35:42:59,040 --> 35:43:03,360
cele de mai jos setate ca normale sau subponderale

47802
35:43:01,192 --> 35:43:08,400
folosind KNandN. Deci dacă avem date noi

47803
35:43:03,360 --> 35:43:10,480
venind in care spune 57 kg si 177 cm, este

47804
35:43:08,400 --> 35:43:12,080
asta va fi normal sau subponderal?

47805
35:43:10,480 --> 35:43:14,552
Pentru a găsi cei mai apropiați vecini, vom găsi

47806
35:43:12,080 --> 35:43:16,480
calculați distanța ukitiană.

47807
35:43:14,552 --> 35:43:18,960
După distanţa uklitiană

47808
35:43:16,480 --> 35:43:21,192
formula, distanța dintre două puncte

47809
35:43:18,960 --> 35:43:24,720
în planul cu coordonatele xy şi

47810
35:43:21,192 --> 35:43:29,440
ab este dat de distanța d este egală cu

47811
35:43:24,720 --> 35:43:31,120
rădăcină pătrată a lui x - a^2 y - b^2. Şi

47812
35:43:29,440 --> 35:43:33,272
vă puteți aminti că din cele două margini

47813
35:43:31,120 --> 35:43:36,320
a unui triunghi. Calculăm al treilea

47814
35:43:33,272 --> 35:43:38,320
muchie deoarece cunoaștem latura x și y

47815
35:43:36,320 --> 35:43:40,800
lateral. Să-l calculăm pentru a înțelege

47816
35:43:38,320 --> 35:43:42,800
în mod clar. Deci avem punctul nostru necunoscut

47817
35:43:40,800 --> 35:43:44,320
și l-am pus acolo în roșu. Iar noi

47818
35:43:42,800 --> 35:43:47,832
avem celelalte puncte ale noastre unde sunt datele

47819
35:43:44,320 --> 35:43:51,832
împrăștiate în jur. Distanța d1 este

47820
35:43:47,832 --> 35:43:55,832
pătrat<unk> de 170 minus 167^ pătrat 57

47821
35:43:51,832 --> 35:43:59,912
- 51^ 2ar care este aproximativ 6,7 și

47822
35:43:55,832 --> 35:44:03,120
distanța 2 este de aproximativ 13 și distanța 3 este

47823
35:43:59,912 --> 35:44:05,360
aproximativ 13.4. În mod similar, vom calcula

47824
35:44:03,120 --> 35:44:07,192
distanța ukitiană a datelor necunoscute

47825
35:44:05,360 --> 35:44:08,720
punct din toate punctele din date

47826
35:44:07,192 --> 35:44:10,232
set. Și pentru că avem de-a face cu

47827
35:44:08,720 --> 35:44:11,440
cantitate mică de date, nu este asta

47828
35:44:10,232 --> 35:44:13,120
greu de făcut și de fapt e frumos

47829
35:44:11,440 --> 35:44:14,720
rapid pentru un computer și nu este un

47830
35:44:13,120 --> 35:44:16,800
matematică cu adevărat complicată. Poți doar

47831
35:44:14,720 --> 35:44:18,800
vezi cât de aproape sunt datele bazate pe

47832
35:44:16,800 --> 35:44:20,400
distanta uklidiana. Prin urmare, avem

47833
35:44:18,800 --> 35:44:22,320
a calculat distanța uklidiană a

47834
35:44:20,400 --> 35:44:26,480
punct de date necunoscut din toate punctele

47835
35:44:22,320 --> 35:44:29,440
după cum se arată unde x1 și y1 sunt egale cu 57 și

47836
35:44:26,480 --> 35:44:30,552
170 a cărui clasă trebuie să o clasificăm. Deci

47837
35:44:29,440 --> 35:44:32,960
acum ne uităm la asta. spunem noi

47838
35:44:30,552 --> 35:44:34,800
Ei bine, aici este distanța ukitică. Cine este

47839
35:44:32,960 --> 35:44:36,400
vor fi vecinii lor cei mai apropiați? Acum

47840
35:44:34,800 --> 35:44:39,040
să calculăm cel mai apropiat vecin la

47841
35:44:36,400 --> 35:44:41,680
k este egal cu 3. Și le putem vedea pe cele trei

47842
35:44:39,040 --> 35:44:43,040
vecinii cei mai apropiați îi pune la normal.

47843
35:44:41,680 --> 35:44:44,720
Și asta este destul de evident când tu

47844
35:44:43,040 --> 35:44:46,320
uita-te la acest grafic. Este destul de ușor să

47845
35:44:44,720 --> 35:44:48,000
spune bine ce știi că doar votăm

47846
35:44:46,320 --> 35:44:49,272
normal normal normal. Trei voturi pentru

47847
35:44:48,000 --> 35:44:51,120
normal. Acesta va fi un normal

47848
35:44:49,272 --> 35:44:53,272
greutate. Deci majoritatea vecinilor sunt

47849
35:44:51,120 --> 35:44:56,552
arătând spre normal. Prin urmare, conform

47850
35:44:53,272 --> 35:44:59,360
Algoritmul KNandN clasa 571 170

47851
35:44:56,552 --> 35:45:02,000
ar trebui să fie normal. Deci o recapitulare a KNandN

47852
35:44:59,360 --> 35:45:04,000
întregul pozitiv K este specificat de-a lungul

47853
35:45:02,000 --> 35:45:05,760
cu o nouă mostră. Selectăm K

47854
35:45:04,000 --> 35:45:07,832
intrări din baza noastră de date care sunt

47855
35:45:05,760 --> 35:45:09,592
cel mai apropiat de noul eșantion. Găsim pe

47856
35:45:07,832 --> 35:45:11,680
cea mai comună clasificare a acestora

47857
35:45:09,592 --> 35:45:13,440
intrări. Aceasta este clasificarea noastră

47858
35:45:11,680 --> 35:45:14,960
da noului eșantion. Deci, după cum poți

47859
35:45:13,440 --> 35:45:16,720
vezi, e destul de simplu. Suntem

47860
35:45:14,960 --> 35:45:18,320
doar căutând cele mai apropiate lucruri care

47861
35:45:16,720 --> 35:45:20,720
se potrivesc cu ceea ce am primit. Deci, să aruncăm o privire

47862
35:45:18,320 --> 35:45:23,592
și vezi cum arată într-o utilizare

47863
35:45:20,720 --> 35:45:26,640
caz în Python. Deci, haideți să ne aruncăm în

47864
35:45:23,592 --> 35:45:29,680
prezice cazul de utilizare a diabetului. Deci, caz de utilizare,

47865
35:45:26,640 --> 35:45:31,440
prezice diabetul. Obiectivul, prezice

47866
35:45:29,680 --> 35:45:34,160
dacă o persoană va fi diagnosticată cu

47867
35:45:31,440 --> 35:45:37,512
diabet sau nu. Avem un set de date de

47868
35:45:34,160 --> 35:45:39,832
768 de persoane care au fost sau nu

47869
35:45:37,512 --> 35:45:41,360
diagnosticat cu diabet. Și să mergem

47870
35:45:39,832 --> 35:45:43,760
înainte și deschideți acel fișier și luați doar un

47871
35:45:41,360 --> 35:45:46,552
uita-te la acele date. Și aceasta este într-o

47872
35:45:43,760 --> 35:45:48,800
format simplu de foaie de calcul. Datele

47873
35:45:46,552 --> 35:45:50,320
însuși este comparat. Foarte frecvente

47874
35:45:48,800 --> 35:45:51,760
set de date. Și este, de asemenea, un lucru foarte comun

47875
35:45:50,320 --> 35:45:54,720
modalitate de a obține datele. Și poți vedea

47876
35:45:51,760 --> 35:45:59,440
aici avem coloanele de la A la I. Adică

47877
35:45:54,720 --> 35:46:02,232
ce 1 2 3 4 5 6 7 8. um opt coloane

47878
35:45:59,440 --> 35:46:04,000
cu un anumit atribut și apoi cel

47879
35:46:02,232 --> 35:46:06,080
a noua coloană care este rezultatul este

47880
35:46:04,000 --> 35:46:07,360
indiferent dacă au diabet. Ca date

47881
35:46:06,080 --> 35:46:09,272
om de știință, primul lucru pe care ar trebui să fii

47882
35:46:07,360 --> 35:46:11,120
Privind este insulina. Ei bine, știi,

47883
35:46:09,272 --> 35:46:12,232
dacă cineva are insulină, are

47884
35:46:11,120 --> 35:46:13,832
diabet pentru că de aceea sunt

47885
35:46:12,232 --> 35:46:15,680
luând-o. Și asta ar putea cauza probleme în

47886
35:46:13,832 --> 35:46:17,760
unele dintre pachetele de învățare automată,

47887
35:46:15,680 --> 35:46:20,640
dar pentru o configurație de bază, aceasta funcționează

47888
35:46:17,760 --> 35:46:22,080
bine pentru că faci KNN. Și următorul

47889
35:46:20,640 --> 35:46:24,000
lucru pe care îl observi este că nu a fost nevoie

47890
35:46:22,080 --> 35:46:25,440
foarte mult să-l deschid. Pot derula

47891
35:46:24,000 --> 35:46:26,960
până în partea de jos a datelor. Există

47892
35:46:25,440 --> 35:46:28,872
768.

47893
35:46:26,960 --> 35:46:32,480
Este aproape un set mic de date. tu

47894
35:46:28,872 --> 35:46:35,272
Știi, la 769, pot să pot încadra cu ușurință asta în

47895
35:46:32,480 --> 35:46:37,272
RAM-ul meu de pe computer. Pot să mă uit la el.

47896
35:46:35,272 --> 35:46:39,192
Pot să-l manipulez. Și nu merge

47897
35:46:37,272 --> 35:46:40,480
să taxeze cu adevărat doar un desktop obișnuit

47898
35:46:39,192 --> 35:46:42,400
calculator. Nici măcar nu ai nevoie de un

47899
35:46:40,480 --> 35:46:44,160
versiunea enterprise pentru a rula o mulțime de asta.

47900
35:46:42,400 --> 35:46:46,232
Deci, să începem cu importarea tuturor

47901
35:46:44,160 --> 35:46:48,872
instrumentele de care avem nevoie. Și înainte de asta, de

47902
35:46:46,232 --> 35:46:50,640
Desigur, trebuie să discutăm ce IDE sunt

47903
35:46:48,872 --> 35:46:52,720
folosind. Cu siguranță, poți folosi orice uh

47904
35:46:50,640 --> 35:46:55,272
editor special pentru Python, dar îmi place

47905
35:46:52,720 --> 35:46:57,760
de folosit pentru a face uh vizual foarte simplu

47906
35:46:55,272 --> 35:47:00,400
chestii. Anaconda, care este grozav pentru

47907
35:46:57,760 --> 35:47:02,640
făcând demonstrații cu Jupyter Notebook.

47908
35:47:00,400 --> 35:47:04,800
Și doar o vedere rapidă a Anacondei

47909
35:47:02,640 --> 35:47:06,800
Navigator, care este noua versiune

47910
35:47:04,800 --> 35:47:09,272
acolo, ceea ce este foarte frumos. Poți vedea

47911
35:47:06,800 --> 35:47:11,512
sub acasă, îmi pot alege aplicația.

47912
35:47:09,272 --> 35:47:13,192
Vom folosi Python 3.6. eu

47913
35:47:11,512 --> 35:47:15,040
au câteva versiuni diferite

47914
35:47:13,192 --> 35:47:16,872
această mașină specială. Dacă merg sub

47915
35:47:15,040 --> 35:47:18,872
medii, pot crea un unic

47916
35:47:16,872 --> 35:47:20,080
mediu pentru fiecare, ceea ce este frumos.

47917
35:47:18,872 --> 35:47:21,680
Și există chiar și un mic buton acolo

47918
35:47:20,080 --> 35:47:23,192
unde pot instala diferite pachete.

47919
35:47:21,680 --> 35:47:24,872
Deci, dacă dau clic pe acel buton și deschid

47920
35:47:23,192 --> 35:47:26,480
terminalul, pot folosi apoi un simplu

47921
35:47:24,872 --> 35:47:28,160
pip install pentru a instala diferite

47922
35:47:26,480 --> 35:47:29,760
pachetele cu care lucrez. Să mergem

47923
35:47:28,160 --> 35:47:31,512
înainte și întoarce-te pe sub casă și suntem

47924
35:47:29,760 --> 35:47:33,040
vom lansa notebook-ul nostru. Și am

47925
35:47:31,512 --> 35:47:34,960
deja, știi, cam ca uh

47926
35:47:33,040 --> 35:47:36,552
emisiuni de bucătărie vechi, deja le-am pregătit

47927
35:47:34,960 --> 35:47:37,912
multe din lucrurile mele. Deci, nu trebuie

47928
35:47:36,552 --> 35:47:40,232
așteptați să se lanseze pentru că este nevoie de o

47929
35:47:37,912 --> 35:47:42,000
câteva minute pentru ca acesta să deschidă un browser

47930
35:47:40,232 --> 35:47:43,272
fereastra. În acest caz, mă duc la it's

47931
35:47:42,000 --> 35:47:45,360
voi deschide Chrome pentru că asta este

47932
35:47:43,272 --> 35:47:46,872
implicit pe care îl folosesc. Și din moment ce

47933
35:47:45,360 --> 35:47:48,480
scenariul este pre-realizat, veți vedea că am un

47934
35:47:46,872 --> 35:47:50,640
numărul de ferestre deschise în partea de sus,

47935
35:47:48,480 --> 35:47:53,040
cel în care lucrăm. Și de atunci

47936
35:47:50,640 --> 35:47:54,720
lucrăm la predicția KNandN

47937
35:47:53,040 --> 35:47:56,160
dacă o persoană va avea diabet sau

47938
35:47:54,720 --> 35:47:58,400
nu. Hai să punem acel titlu

47939
35:47:56,160 --> 35:48:00,800
acolo. Și o să merg și aici sus

47940
35:47:58,400 --> 35:48:02,960
și faceți clic pe celulă. De fapt, vrem

47941
35:48:00,800 --> 35:48:04,800
mergeți mai departe și introduceți mai întâi o celulă dedesubt.

47942
35:48:02,960 --> 35:48:06,872
Și apoi mă voi întoarce la

47943
35:48:04,800 --> 35:48:09,040
celula superioară. Și am de gând să schimb

47944
35:48:06,872 --> 35:48:10,800
tipul de celulă la reducere. Asta înseamnă asta

47945
35:48:09,040 --> 35:48:12,400
nu va rula ca Python. Este o

47946
35:48:10,800 --> 35:48:13,760
limbajul markdown. Deci dacă rulez asta

47947
35:48:12,400 --> 35:48:15,592
primul, vine în mare

47948
35:48:13,760 --> 35:48:18,080
scrisori, ceea ce este cam frumos. Amintiți-vă

47949
35:48:15,592 --> 35:48:19,680
ne la ce lucrăm. Și până acum tu

47950
35:48:18,080 --> 35:48:21,760
ar trebui să fim familiarizați cu a face toate noastre

47951
35:48:19,680 --> 35:48:25,832
importurilor. Vom importa

47952
35:48:21,760 --> 35:48:28,400
panda ca pd import numpy este np. panda

47953
35:48:25,832 --> 35:48:30,720
este cadrul de date uh panda și numpy este

47954
35:48:28,400 --> 35:48:33,192
o matrice de numere. Instrumente foarte puternice pentru

47955
35:48:30,720 --> 35:48:35,512
folosește aici. Deci avem importurile noastre. Deci

47956
35:48:33,192 --> 35:48:38,080
ne-am adus panda sau numpy

47957
35:48:35,512 --> 35:48:40,480
două instrumente generale Python. Și apoi tu

47958
35:48:38,080 --> 35:48:42,232
puteți vedea aici că avem testul nostru de tren

47959
35:48:40,480 --> 35:48:44,160
despicat. Până acum ar trebui să fii familiar

47960
35:48:42,232 --> 35:48:45,760
cu împărțirea datelor. Vrem

47961
35:48:44,160 --> 35:48:48,080
împărțiți o parte din ea pentru a ne antrena lucrul

47962
35:48:45,760 --> 35:48:49,832
și apoi antrenarea modelului nostru particular

47963
35:48:48,080 --> 35:48:51,512
și apoi vrem să mergem înainte și să testăm

47964
35:48:49,832 --> 35:48:54,160
datele rămase pentru a vedea cât de bune sunt

47965
35:48:51,512 --> 35:48:56,400
este. Preprocesarea unui scaler standard

47966
35:48:54,160 --> 35:48:58,480
pre-procesor, astfel încât să nu avem o părtinire de

47967
35:48:56,400 --> 35:49:00,480
numere cu adevărat mari. Amintiți-vă în

47968
35:48:58,480 --> 35:49:02,320
date pe care le-am avut ca număr de sarcini

47969
35:49:00,480 --> 35:49:03,760
nu va deveni foarte mare acolo unde

47970
35:49:02,320 --> 35:49:08,080
cantitatea de insulină pe care o iau și se ridică

47971
35:49:03,760 --> 35:49:09,680
la 256. Deci 256 versus șase care se vor înclina

47972
35:49:08,080 --> 35:49:11,360
rezultate. Deci vrem să mergem înainte și

47973
35:49:09,680 --> 35:49:13,512
schimbă asta ca să fie toate uniforme

47974
35:49:11,360 --> 35:49:15,832
între minus1 și unu. Și apoi

47975
35:49:13,512 --> 35:49:18,552
instrument real. Aceștia sunt vecinii K

47976
35:49:15,832 --> 35:49:21,120
clasificatorul pe care îl vom folosi. Şi

47977
35:49:18,552 --> 35:49:23,440
în cele din urmă, ultimele trei sunt trei instrumente

47978
35:49:21,120 --> 35:49:25,272
a testa. Totul despre testarea modelului nostru.

47979
35:49:23,440 --> 35:49:27,272
Cât de bun este? Tocmai am pus jos testul

47980
35:49:25,272 --> 35:49:29,912
acolo. Și avem matricea noastră de confuzie,

47981
35:49:27,272 --> 35:49:32,400
scorul nostru F1 și precizia noastră. Deci noi

47982
35:49:29,912 --> 35:49:34,552
au cele două module Python generale ale noastre

47983
35:49:32,400 --> 35:49:37,440
importam. Și apoi avem a noastră

47984
35:49:34,552 --> 35:49:39,832
șase module specifice din sklearn

47985
35:49:37,440 --> 35:49:42,160
setare. Și atunci trebuie să mergem înainte

47986
35:49:39,832 --> 35:49:44,232
și rulează asta. Deci acestea sunt de fapt

47987
35:49:42,160 --> 35:49:46,160
importate. Iată-ne. Și apoi mergi mai departe

47988
35:49:44,232 --> 35:49:47,272
la pasul următor. Și așa în acest set,

47989
35:49:46,160 --> 35:49:49,272
vom merge înainte și vom încărca

47990
35:49:47,272 --> 35:49:51,440
baza de date. Vom folosi panda.

47991
35:49:49,272 --> 35:49:53,360
Amintiți-vă că panda este pd. Și vom lua o

47992
35:49:51,440 --> 35:49:55,360
uitați-vă la datele din Python. Ne-am uitat la

47993
35:49:53,360 --> 35:49:57,120
într-o simplă foaie de calcul, dar de obicei

47994
35:49:55,360 --> 35:49:59,272
Îmi place și să-l trag în sus, ca să putem

47995
35:49:57,120 --> 35:50:03,512
vezi ce facem. Deci, iată datele noastre

47996
35:49:59,272 --> 35:50:06,232
set este egal cu PD citit CSV. Este un panda

47997
35:50:03,512 --> 35:50:08,640
comanda. Și dosarul cu diabetul am doar

47998
35:50:06,232 --> 35:50:10,400
puneți în același folder în care IPython-ul meu

47999
35:50:08,640 --> 35:50:12,400
scenariul este. Dacă puneți un alt

48000
35:50:10,400 --> 35:50:15,360
folder, veți avea nevoie de lungimea completă

48001
35:50:12,400 --> 35:50:18,080
Acolo. Putem face, de asemenea, o lungime rapidă de

48002
35:50:15,360 --> 35:50:20,552
uh setul de date. Acesta este un simplu Python

48003
35:50:18,080 --> 35:50:21,832
comanda. Leen pentru lungime. Am putea chiar

48004
35:50:20,552 --> 35:50:24,552
hai să mergem mai departe și să tipărim asta. Vom merge

48005
35:50:21,832 --> 35:50:26,400
imprima. Și dacă o faci pe propria linie,

48006
35:50:24,552 --> 35:50:28,232
set de date privind lungimea în caietul Jupyter,

48007
35:50:26,400 --> 35:50:30,080
o va imprima automat. Dar când

48008
35:50:28,232 --> 35:50:31,272
te afli în majoritatea configurațiilor tale diferite,

48009
35:50:30,080 --> 35:50:33,040
vrei să faci imprimarea în fața

48010
35:50:31,272 --> 35:50:34,960
acolo. Și apoi vrem să aruncăm o privire

48011
35:50:33,040 --> 35:50:37,912
la setul de date real. Și din moment ce suntem

48012
35:50:34,960 --> 35:50:40,000
în panda, putem pur și simplu să facem un set de date

48013
35:50:37,912 --> 35:50:42,160
cap. Și din nou, să mergem mai departe și să adăugăm

48014
35:50:40,000 --> 35:50:44,232
amprenta acolo. Dacă pui o grămadă

48015
35:50:42,160 --> 35:50:46,640
dintre acestea la rând, știți acele date

48016
35:50:44,232 --> 35:50:48,480
set un cap, set de date doi capete, numai

48017
35:50:46,640 --> 35:50:49,680
tipărește ultimul. Deci, eu de obicei

48018
35:50:48,480 --> 35:50:52,400
Întotdeauna îmi place să păstreze declarația de tipărire

48019
35:50:49,680 --> 35:50:54,720
acolo. Dar pentru că majoritatea proiectelor numai

48020
35:50:52,400 --> 35:50:56,400
utilizați un cadru de date, cadrul de date al lui Panda,

48021
35:50:54,720 --> 35:50:58,232
a face acest lucru nu prea contează.

48022
35:50:56,400 --> 35:51:00,080
Cealaltă cale funcționează foarte bine. Iar tu

48023
35:50:58,232 --> 35:51:02,552
putem vedea când apăsăm butonul de alergare, noi

48024
35:51:00,080 --> 35:51:04,320
avem cele 768 de linii, pe care le știam și

48025
35:51:02,552 --> 35:51:06,800
avem sarcinile noastre. Este

48026
35:51:04,320 --> 35:51:08,960
dat automat o etichetă în stânga.

48027
35:51:06,800 --> 35:51:11,832
Amintiți-vă că capul îl arată doar pe primul

48028
35:51:08,960 --> 35:51:13,832
cinci rânduri. Deci avem zero prin

48029
35:51:11,832 --> 35:51:15,592
patru. Și doar o privire rapidă asupra datelor.

48030
35:51:13,832 --> 35:51:17,440
Puteți vedea că se potrivește cu ceea ce ne-am uitat

48031
35:51:15,592 --> 35:51:20,000
înainte. Avem sarcina, glucoza,

48032
35:51:17,440 --> 35:51:22,320
tensiunea arterială până la îmbătrânire. Şi

48033
35:51:20,000 --> 35:51:24,000
apoi rezultatul la final. Și suntem

48034
35:51:22,320 --> 35:51:26,800
o să fac câteva lucruri în asta în continuare

48035
35:51:24,000 --> 35:51:28,960
pas. Vom crea o listă de

48036
35:51:26,800 --> 35:51:30,552
coloane unde nu putem avea zero.

48037
35:51:28,960 --> 35:51:33,760
Nu există niciun fel de piele zero

48038
35:51:30,552 --> 35:51:36,000
grosime sau tensiune arterială zero, zero

48039
35:51:33,760 --> 35:51:37,760
glucoza. Oricare dintre aceia, ai fi mort.

48040
35:51:36,000 --> 35:51:39,040
Deci, nu este un factor foarte bun dacă acestea

48041
35:51:37,760 --> 35:51:40,400
nu dacă au un zero acolo

48042
35:51:39,040 --> 35:51:41,680
pentru că nu aveau datele. Şi

48043
35:51:40,400 --> 35:51:42,960
ne vom uita la asta pentru că suntem

48044
35:51:41,680 --> 35:51:45,120
va începe să-l înlocuiască

48045
35:51:42,960 --> 35:51:46,640
informații cu câteva diferite

48046
35:51:45,120 --> 35:51:49,440
lucruri. Și să vedem cum arată

48047
35:51:46,640 --> 35:51:51,192
ca. Deci, mai întâi creăm o listă frumoasă.

48048
35:51:49,440 --> 35:51:52,720
După cum puteți vedea, avem valorile

48049
35:51:51,192 --> 35:51:54,800
a vorbit despre glucoză, tensiune arterială,

48050
35:51:52,720 --> 35:51:56,320
grosimea pielii. Uh, și acesta este un frumos

48051
35:51:54,800 --> 35:51:58,000
modul când lucrezi cu coloane este

48052
35:51:56,320 --> 35:51:59,912
pentru a enumera coloanele trebuie să faci ceva

48053
35:51:58,000 --> 35:52:01,832
un fel de transformare pe. Uh, foarte

48054
35:51:59,912 --> 35:52:03,912
lucru comun de făcut. Și apoi pentru asta

48055
35:52:01,832 --> 35:52:06,000
o anumită configurație, cu siguranță am putea folosi

48056
35:52:03,912 --> 35:52:07,592
există câteva instrumente Panda care vor

48057
35:52:06,000 --> 35:52:10,320
face multe din asta acolo unde putem înlocui

48058
35:52:07,592 --> 35:52:13,360
NA, dar vom merge înainte și

48059
35:52:10,320 --> 35:52:15,272
faceți-o ca o coloană de set de date este egală cu date

48060
35:52:13,360 --> 35:52:17,360
set coloană.înlocuiește. Aceasta este aceasta

48061
35:52:15,272 --> 35:52:19,120
încă panda. Poti face direct.

48062
35:52:17,360 --> 35:52:21,360
Există și unul pe care îl cauți

48063
35:52:19,120 --> 35:52:24,400
fiica ta. O mulțime de opțiuni diferite în

48064
35:52:21,360 --> 35:52:27,592
aici. Dar nan numpan este ceea ce asta

48065
35:52:24,400 --> 35:52:29,592
reprezintă este non nu există. Deci

48066
35:52:27,592 --> 35:52:33,512
primul lucru pe care îl facem aici este că suntem

48067
35:52:29,592 --> 35:52:34,960
înlocuind zero cu un numpy none.

48068
35:52:33,512 --> 35:52:36,800
Nu există date acolo. Asta este

48069
35:52:34,960 --> 35:52:38,800
spune. Asta se spune corect

48070
35:52:36,800 --> 35:52:41,440
aici. Așa că pune zero și mergem

48071
35:52:38,800 --> 35:52:43,040
pentru a înlocui zerourile fără date. Deci dacă

48072
35:52:41,440 --> 35:52:44,480
este un zero, asta înseamnă al persoanei

48073
35:52:43,040 --> 35:52:45,912
Ei bine, sper să nu fie mort. Să sperăm că ei

48074
35:52:44,480 --> 35:52:47,360
pur si simplu nu am primit datele. Următorul lucru

48075
35:52:45,912 --> 35:52:49,832
dorim să facem este să creăm

48076
35:52:47,360 --> 35:52:52,720
media care este numărul întreg de la

48077
35:52:49,832 --> 35:52:55,832
setul de date din coloană înseamnă unde

48078
35:52:52,720 --> 35:52:57,832
sărim peste NAS. Putem face asta. Asta este o

48079
35:52:55,832 --> 35:52:59,120
panda comanda acolo, skip na. Deci

48080
35:52:57,832 --> 35:53:00,872
o să ne dăm seama ce înseamnă

48081
35:52:59,120 --> 35:53:02,960
acel set de date. Și apoi vom merge

48082
35:53:00,872 --> 35:53:06,320
luați acea coloană de set de date și suntem

48083
35:53:02,960 --> 35:53:08,480
va înlocui toate npnan-urile

48084
35:53:06,320 --> 35:53:10,160
cu mijloacele. De ce am făcut asta? Şi

48085
35:53:08,480 --> 35:53:11,680
am fi putut de fapt să luăm

48086
35:53:10,160 --> 35:53:13,760
acest pas și mers chiar aici jos și

48087
35:53:11,680 --> 35:53:15,040
doar înlocuiți zero și sări peste orice

48088
35:53:13,760 --> 35:53:16,800
unde, cu excepția cazului în care ai putea de fapt, există

48089
35:53:15,040 --> 35:53:18,480
o modalitate de a sări peste zerouri și apoi doar

48090
35:53:16,800 --> 35:53:19,760
înlocuiți toate zerourile. Dar în acest caz,

48091
35:53:18,480 --> 35:53:21,272
vrem să mergem înainte și să o facem așa.

48092
35:53:19,760 --> 35:53:23,760
Așa că puteți vedea că ne schimbăm

48093
35:53:21,272 --> 35:53:25,512
aceasta la o valoare inexistentă. Atunci suntem

48094
35:53:23,760 --> 35:53:28,640
va crea media. Ei bine, asta este

48095
35:53:25,512 --> 35:53:30,720
persoana medie. Deci dacă nu știm

48096
35:53:28,640 --> 35:53:32,720
ce este, dacă nu au primit datele

48097
35:53:30,720 --> 35:53:34,552
iar datele lipsesc, unul dintre

48098
35:53:32,720 --> 35:53:36,872
truc este să-l înlocuiești cu

48099
35:53:34,552 --> 35:53:39,512
medie. Care sunt cele mai frecvente date

48100
35:53:36,872 --> 35:53:40,960
pentru asta? În acest fel, puteți utiliza în continuare

48101
35:53:39,512 --> 35:53:43,040
restul acestor valori pentru a vă face

48102
35:53:40,960 --> 35:53:44,800
calcul și cam aduce doar

48103
35:53:43,040 --> 35:53:46,800
acea valoare anume sau cele care lipsesc

48104
35:53:44,800 --> 35:53:48,480
valori în afara ecuației. Să mergem

48105
35:53:46,800 --> 35:53:50,080
înainte și ia asta și vom merge înainte

48106
35:53:48,480 --> 35:53:52,320
și rulați-l. De fapt nu face

48107
35:53:50,080 --> 35:53:54,232
orice. Deci încă ne pregătim

48108
35:53:52,320 --> 35:53:55,592
date. Dacă vrei să vezi cum arată

48109
35:53:54,232 --> 35:53:57,272
ca, nu avem nimic în

48110
35:53:55,592 --> 35:53:59,040
primele câteva rânduri, așa că nu va fi

48111
35:53:57,272 --> 35:54:01,760
apar. Dar cu siguranță ne-am putea uita

48112
35:53:59,040 --> 35:54:04,640
un rând. Să facem asta. Să intrăm în noul nostru

48113
35:54:01,760 --> 35:54:07,360
set de date. Să tipărim un set de date. Şi

48114
35:54:04,640 --> 35:54:10,000
să alegem în acest caz, să facem

48115
35:54:07,360 --> 35:54:11,592
glucoza. Și dacă conduc asta, asta este

48116
35:54:10,000 --> 35:54:14,320
vom imprima toate glucozei diferite

48117
35:54:11,592 --> 35:54:16,000
niveluri în scădere. Și noi din fericire

48118
35:54:14,320 --> 35:54:17,832
nu vezi nimic aici care să arate

48119
35:54:16,000 --> 35:54:19,272
cum ar fi datele lipsă, cel puțin asupra celor

48120
35:54:17,832 --> 35:54:20,232
se vede. Puteți vedea că a sărit o grămadă

48121
35:54:19,272 --> 35:54:21,440
la mijloc pentru că asta este

48122
35:54:20,232 --> 35:54:23,360
face. Dacă ai prea multe rânduri

48123
35:54:21,440 --> 35:54:25,680
Caietul Jupyter, va sări peste câteva și

48124
35:54:23,360 --> 35:54:27,760
și treceți la următorul dintr-un set de date. Lasă

48125
35:54:25,680 --> 35:54:30,080
du-te și elimin asta. Și doar vom face

48126
35:54:27,760 --> 35:54:32,320
la zero. Și bineînțeles, înaintea noastră

48127
35:54:30,080 --> 35:54:34,160
faceți orice procesare, înainte de a continua

48128
35:54:32,320 --> 35:54:36,400
în continuare, trebuie să împărțim setul de date

48129
35:54:34,160 --> 35:54:37,680
în datele noastre de tren și de testare. Asta

48130
35:54:36,400 --> 35:54:40,000
în felul acesta, avem cu ce să-l antrenăm

48131
35:54:37,680 --> 35:54:40,960
și ceva pentru a-l testa. Și tu ești

48132
35:54:40,000 --> 35:54:42,800
Vom observa că am făcut puțin

48133
35:54:40,960 --> 35:54:45,120
ceva aici cu uh panda

48134
35:54:42,800 --> 35:54:47,912
codul bazei de date. Iată-ne. Desenul meu

48135
35:54:45,120 --> 35:54:50,160
instrument. Am adăugat asta chiar aici

48136
35:54:47,912 --> 35:54:52,800
setul de date. Și ceea ce spune asta este că

48137
35:54:50,160 --> 35:54:55,040
primul în panda, acesta este de la

48138
35:54:52,800 --> 35:54:57,272
panda PD. O să spună înăuntru

48139
35:54:55,040 --> 35:54:59,680
setul de date, vrem să ne uităm la ochi

48140
35:54:57,272 --> 35:55:01,040
locație și sunt toate rândurile. Asta este

48141
35:54:59,680 --> 35:55:02,872
care spune. Deci o să păstrăm totul

48142
35:55:01,040 --> 35:55:06,000
rândurile, dar ne uităm doar la

48143
35:55:02,872 --> 35:55:07,512
zero, coloana de la 0 la 8. Amintiți-vă coloana 9.

48144
35:55:06,000 --> 35:55:09,120
Aici este chiar aici sus. Noi l-am imprimat

48145
35:55:07,512 --> 35:55:10,640
aici este rezultatul. Ei bine, nu este

48146
35:55:09,120 --> 35:55:12,552
parte a datelor de antrenament. Asta face parte

48147
35:55:10,640 --> 35:55:14,960
a răspunsului. Da, este coloana 9, dar

48148
35:55:12,552 --> 35:55:17,360
este listat ca opt. Numărul opt. Deci 0

48149
35:55:14,960 --> 35:55:19,680
la opt este nouă coloane. Deci opt este

48150
35:55:17,360 --> 35:55:22,480
valoarea. Și când îl vezi aici,

48151
35:55:19,680 --> 35:55:24,160
zero, acesta este de fapt 0 la 7. Acesta

48152
35:55:22,480 --> 35:55:25,912
nu-l include pe ultimul. Și apoi

48153
35:55:24,160 --> 35:55:29,192
coborâm aici la Y, care este al nostru

48154
35:55:25,912 --> 35:55:31,192
răspuns. Și îl vrem doar pe ultimul,

48155
35:55:29,192 --> 35:55:33,192
doar coloana 8. Și poți face asta

48156
35:55:31,192 --> 35:55:34,800
fel cu această notație specială. Şi

48157
35:55:33,192 --> 35:55:37,272
apoi, dacă vă amintiți, am importat

48158
35:55:34,800 --> 35:55:39,760
diviziunea de testare a trenului care face parte din

48159
35:55:37,272 --> 35:55:42,552
sklearn chiar acolo. Și pur și simplu punem

48160
35:55:39,760 --> 35:55:44,232
în X-ul nostru și Y-ul nostru. Vom face

48161
35:55:42,552 --> 35:55:45,912
starea aleatorie este egală cu zero. Nu ai

48162
35:55:44,232 --> 35:55:47,832
pentru a o însămânța neapărat. Asta e o sămânță

48163
35:55:45,912 --> 35:55:49,440
număr. Cred că implicit este unul când

48164
35:55:47,832 --> 35:55:51,120
l-ai asezat. Ar trebui să mă uit la asta.

48165
35:55:49,440 --> 35:55:53,040
Și apoi dimensiunea testului. Dimensiunea testului este

48166
35:55:51,120 --> 35:55:55,832
0,2. Asta înseamnă pur și simplu că o vom face

48167
35:55:53,040 --> 35:55:57,592
luați 20% din date și lăsați-le deoparte

48168
35:55:55,832 --> 35:55:59,360
că îl putem testa mai târziu. Asta-i tot

48169
35:55:57,592 --> 35:56:01,272
adică. Și din nou, o să alergăm

48170
35:55:59,360 --> 35:56:02,640
ea. Nu foarte interesant. Până acum, noi

48171
35:56:01,272 --> 35:56:04,872
nu am avut nicio imprimare în afară de a

48172
35:56:02,640 --> 35:56:06,720
uita-te la date. Dar asta este mult

48173
35:56:04,872 --> 35:56:08,480
aceasta este pregătirea acestor date. Odată tu

48174
35:56:06,720 --> 35:56:10,552
Pregătiți-l, liniile reale de cod sunt

48175
35:56:08,480 --> 35:56:12,640
rapid si usor. Și aproape am ajuns.

48176
35:56:10,552 --> 35:56:14,552
Dar scrierea reală a KNandN-ului nostru, noi

48177
35:56:12,640 --> 35:56:16,232
trebuie să mergi înainte și să faci o scară

48178
35:56:14,552 --> 35:56:18,080
date. Dacă vă amintiți bine, noi suntem

48179
35:56:16,232 --> 35:56:20,160
potrivirea datelor într-un scaler standard,

48180
35:56:18,080 --> 35:56:23,192
ceea ce înseamnă în loc ca datele să fie

48181
35:56:20,160 --> 35:56:26,000
de la, știi, cinci la 303 într-unul

48182
35:56:23,192 --> 35:56:27,512
coloana și următoarea coloană este de la 1 la șase,

48183
35:56:26,000 --> 35:56:30,400
o să punem toate astea astfel încât toate

48184
35:56:27,512 --> 35:56:32,160
datele sunt cuprinse între minus1 și unu.

48185
35:56:30,400 --> 35:56:34,400
Asta face acel scaler standard.

48186
35:56:32,160 --> 35:56:37,360
Îl menține standardizat. Și noi vrem doar

48187
35:56:34,400 --> 35:56:39,760
pentru a potrivi scaler-ul cu setul de antrenament,

48188
35:56:37,360 --> 35:56:42,640
dar vrem să ne asigurăm că testarea este setată

48189
35:56:39,760 --> 35:56:45,120
este și testul X care merge

48190
35:56:42,640 --> 35:56:47,040
transformat. Deci îl procesează

48191
35:56:45,120 --> 35:56:49,592
la fel. Deci, iată-ne cu standardul nostru

48192
35:56:47,040 --> 35:56:51,592
scaler. Îi vom numi sc__x pentru

48193
35:56:49,592 --> 35:56:53,440
scalatorul. Și o să importam

48194
35:56:51,592 --> 35:56:58,320
scalatorul standard în această variabilă.

48195
35:56:53,440 --> 35:57:00,320
Și apoi xrain-ul nostru este egal cu sc_x.fit

48196
35:56:58,320 --> 35:57:02,640
transforma. Deci creăm scalatorul

48197
35:57:00,320 --> 35:57:04,800
pe variabila x-ra. Și apoi x-ul nostru

48198
35:57:02,640 --> 35:57:06,800
test, îl vom transforma și noi.

48199
35:57:04,800 --> 35:57:09,760
Așa că ne-am antrenat și transformat

48200
35:57:06,800 --> 35:57:11,360
x-ra. Și apoi testul x nu face parte

48201
35:57:09,760 --> 35:57:13,440
acel antrenament. Nu face parte din aceea a

48202
35:57:11,360 --> 35:57:15,120
antrenarea transformatorului. doar devine

48203
35:57:13,440 --> 35:57:16,552
transformat. Asta e tot ce face. Şi

48204
35:57:15,120 --> 35:57:18,232
din nou, vom merge și vom rula asta.

48205
35:57:16,552 --> 35:57:21,680
Și dacă te uiți la asta, acum am plecat

48206
35:57:18,232 --> 35:57:24,640
prin acești pași, toți trei.

48207
35:57:21,680 --> 35:57:27,832
Ne-am ocupat să ne înlocuim zerourile

48208
35:57:24,640 --> 35:57:30,232
pentru coloanele cheie care nu ar trebui să fie zero,

48209
35:57:27,832 --> 35:57:32,480
și am înlocuit asta cu mijloacele

48210
35:57:30,232 --> 35:57:34,720
din acele coloane. Așa, că ei

48211
35:57:32,480 --> 35:57:36,480
se potrivesc perfect cu modelele noastre de date. Noi am

48212
35:57:34,720 --> 35:57:39,592
vino aici și împărțim datele.

48213
35:57:36,480 --> 35:57:41,592
Deci, acum avem datele noastre de testare și

48214
35:57:39,592 --> 35:57:43,592
date de antrenament. Și apoi am luat și

48215
35:57:41,592 --> 35:57:45,592
am scalat datele. Deci toți ai noștri

48216
35:57:43,592 --> 35:57:48,320
datele intră. Nu, nu, nu ne tragem

48217
35:57:45,592 --> 35:57:51,192
nu antrena partea Y, trenul Y și

48218
35:57:48,320 --> 35:57:53,360
Test Y care nu trebuie antrenat niciodată.

48219
35:57:51,192 --> 35:57:55,040
Sunt doar datele care intră. Asta este

48220
35:57:53,360 --> 35:57:57,040
vrem să ne antrenăm acolo. Apoi definiți

48221
35:57:55,040 --> 35:57:59,760
modelul folosind clasificatorul K vecini

48222
35:57:57,040 --> 35:58:01,912
și potriviți datele trenului în model. Deci

48223
35:57:59,760 --> 35:58:03,440
facem toate acele date de pregătire. Și poți

48224
35:58:01,912 --> 35:58:05,040
vezi aici jos, vom avea doar o

48225
35:58:03,440 --> 35:58:07,832
câteva linii de cod unde ne aflăm

48226
35:58:05,040 --> 35:58:09,360
construindu-ne de fapt modelul și antrenamentul

48227
35:58:07,832 --> 35:58:11,272
ea. Acesta este unul dintre lucrurile interesante

48228
35:58:09,360 --> 35:58:12,800
Python și cât de departe am ajuns. Este așa

48229
35:58:11,272 --> 35:58:13,832
un moment interesant pentru a fi în mașină

48230
35:58:12,800 --> 35:58:16,320
învăț pentru că sunt atât de multe

48231
35:58:13,832 --> 35:58:18,800
instrumente automate. Să vedem. Înainte să facem noi

48232
35:58:16,320 --> 35:58:21,760
asta, hai să facem o lungime rapidă de și

48233
35:58:18,800 --> 35:58:26,640
hai sa facem y. Vrem să facem doar lungime

48234
35:58:21,760 --> 35:58:30,960
de y. Și obținem 768. Și dacă importăm

48235
35:58:26,640 --> 35:58:33,760
matematică, facem matematică punct rădăcină pătrată. Să

48236
35:58:30,960 --> 35:58:36,232
te antrenezi. Iată-ne. Este de fapt

48237
35:58:33,760 --> 35:58:38,960
ar trebui să fie x tren. Înainte să facem noi

48238
35:58:36,232 --> 35:58:41,272
asta, hai să mergem mai departe și să facem import matematică

48239
35:58:38,960 --> 35:58:43,512
și faceți matematica lungimea rădăcinii pătrate a lui y

48240
35:58:41,272 --> 35:58:45,192
test. Și când rulez asta, obținem

48241
35:58:43,512 --> 35:58:46,640
12.409.

48242
35:58:45,192 --> 35:58:48,960
Vreau să vă arăt unde este acest număr

48243
35:58:46,640 --> 35:58:50,552
provine din. Suntem pe cale să folosim 12 este un

48244
35:58:48,960 --> 35:58:52,232
număr par. Deci dacă știi dacă ești

48245
35:58:50,552 --> 35:58:53,832
votând vreodată lucruri, amintiți-vă

48246
35:58:52,232 --> 35:58:55,592
toți vecinii votează. Nu vreau să am

48247
35:58:53,832 --> 35:58:57,360
votează un număr par de vecini. Deci

48248
35:58:55,592 --> 35:58:59,120
vrem să facem ceva ciudat. Și haideți

48249
35:58:57,360 --> 35:59:00,720
ia doar unul. Vom ajunge la 11.

48250
35:58:59,120 --> 35:59:01,912
Lasă-mă să șterg asta de aici. Asta e

48251
35:59:00,720 --> 35:59:03,272
unul dintre motivele pentru care iubesc Jupyter

48252
35:59:01,912 --> 35:59:05,192
Caiet pentru că poți întoarce și

48253
35:59:03,272 --> 35:59:06,080
face tot felul de lucruri din mers. Deci,

48254
35:59:05,192 --> 35:59:07,360
vom merge înainte și vom pune în nostru

48255
35:59:06,080 --> 35:59:09,120
clasificator. Ne creăm

48256
35:59:07,360 --> 35:59:11,272
clasificator acum și va fi

48257
35:59:09,120 --> 35:59:14,080
Clasificator K vecini. În vecini

48258
35:59:11,272 --> 35:59:16,000
egal cu 11. Amintiți-vă, am făcut 12 - 1 pentru

48259
35:59:14,080 --> 35:59:18,320
11. Deci, avem un număr impar de

48260
35:59:16,000 --> 35:59:21,120
vecinii. P= 2 pentru că căutăm

48261
35:59:18,320 --> 35:59:23,832
pentru că sunt sau nu diabetici? Şi

48262
35:59:21,120 --> 35:59:25,592
folosim metrica ukitiană. Acolo

48263
35:59:23,832 --> 35:59:27,360
sunt alte mijloace de măsurare a

48264
35:59:25,592 --> 35:59:29,272
distanta. Ai putea face ca pătrat

48265
35:59:27,360 --> 35:59:31,192
pătrat înseamnă valoare. Există tot felul de

48266
35:59:29,272 --> 35:59:33,360
măsoară acest lucru, dar uklidianul este

48267
35:59:31,192 --> 35:59:35,360
cel mai comun și funcționează destul de bine.

48268
35:59:33,360 --> 35:59:37,440
Este important să evaluezi modelul.

48269
35:59:35,360 --> 35:59:38,872
Să folosim matricea de confuzie pentru a face

48270
35:59:37,440 --> 35:59:41,192
că. Și vom folosi

48271
35:59:38,872 --> 35:59:44,872
matricea de confuzie. Instrument minunat. Şi

48272
35:59:41,192 --> 35:59:46,960
apoi vom sări în scorul F1. Şi

48273
35:59:44,872 --> 35:59:49,440
în cele din urmă, scorul de precizie, care este

48274
35:59:46,960 --> 35:59:51,120
probabil cel mai des folosit citat

48275
35:59:49,440 --> 35:59:52,480
număr atunci când intri la o întâlnire sau

48276
35:59:51,120 --> 35:59:54,320
asa ceva. Deci, hai să mergem înainte

48277
35:59:52,480 --> 35:59:57,512
și lipiți asta acolo. Și vom stabili

48278
35:59:54,320 --> 35:59:59,832
CM egal cu matricea de confuzie. Y

48279
35:59:57,512 --> 36:00:01,760
test, Y prezice. Deci astea sunt cele două

48280
35:59:59,832 --> 36:00:02,960
valorile pe care le vom pune acolo. Şi

48281
36:00:01,760 --> 36:00:05,680
lasă-mă să merg înainte și să-l execut și să printez

48282
36:00:02,960 --> 36:00:08,640
ea afară. Și felul în care interpretezi asta

48283
36:00:05,680 --> 36:00:10,720
este Y-ul prezis, care ar fi

48284
36:00:08,640 --> 36:00:13,592
fii titlul tău aici sus. Poți să faci uh

48285
36:00:10,720 --> 36:00:17,272
hai să facem doar Predicted

48286
36:00:13,592 --> 36:00:20,080
în partea de sus și coborând efectiv.

48287
36:00:17,272 --> 36:00:22,232
Real. Întotdeauna este greu să scrii

48288
36:00:20,080 --> 36:00:24,720
Aici. Real. Asta înseamnă că asta

48289
36:00:22,232 --> 36:00:26,872
coloana aici în mijloc, asta e

48290
36:00:24,720 --> 36:00:30,320
coloană importantă. Și înseamnă că noștri

48291
36:00:26,872 --> 36:00:34,320
predicția a spus 94 și predicția în

48292
36:00:30,320 --> 36:00:38,872
efectiv agreat la 94 și 32. Acest număr

48293
36:00:34,320 --> 36:00:40,480
aici, 13 și 15, astea sunt

48294
36:00:38,872 --> 36:00:41,440
a gresit. Deci ai putea avea vreo trei

48295
36:00:40,480 --> 36:00:43,272
diferit dacă te uiți la asta

48296
36:00:41,440 --> 36:00:45,272
în schimb, pe trei variabile diferite

48297
36:00:43,272 --> 36:00:47,040
din doar doi. Ai ajunge cu un al treilea

48298
36:00:45,272 --> 36:00:48,960
rând aici în coloana care merge în jos

48299
36:00:47,040 --> 36:00:52,160
mijlocul. Deci, în primul caz, noi

48300
36:00:48,960 --> 36:00:54,480
au și cred că zero este a

48301
36:00:52,160 --> 36:00:56,160
94 de persoane care nu au diabet. The

48302
36:00:54,480 --> 36:00:58,480
predicția spunea că 13 dintre acești oameni

48303
36:00:56,160 --> 36:01:00,872
avea diabet și prezentau risc crescut.

48304
36:00:58,480 --> 36:01:03,832
Și cei 32 care aveau diabet au avut

48305
36:01:00,872 --> 36:01:07,680
corect, dar predicția noastră spunea alta

48306
36:01:03,832 --> 36:01:09,832
15 din cele 15, a clasificat ca

48307
36:01:07,680 --> 36:01:12,000
incorect. Deci poți vedea unde

48308
36:01:09,832 --> 36:01:14,480
intră clasificarea și cum aceasta

48309
36:01:12,000 --> 36:01:16,720
lucrează pe matricea de confuzie. Apoi

48310
36:01:14,480 --> 36:01:19,120
vom merge mai departe și vom imprima F1

48311
36:01:16,720 --> 36:01:24,000
scor. Lasă-mă să execut asta. Și vezi

48312
36:01:19,120 --> 36:01:26,800
primim un 69 la scorul nostru de F1. F1

48313
36:01:24,000 --> 36:01:29,912
ia în considerare ambele părți ale

48314
36:01:26,800 --> 36:01:31,512
soldul fals pozitive unde dacă am

48315
36:01:29,912 --> 36:01:33,272
mergeți mai departe și faceți exact exactitatea

48316
36:01:31,512 --> 36:01:36,232
cont și asta este ceea ce majoritatea oamenilor

48317
36:01:33,272 --> 36:01:38,000
gândiți-vă este că se uită la câți suntem

48318
36:01:36,232 --> 36:01:39,680
am inteles corect din cate am gresit.

48319
36:01:38,000 --> 36:01:41,592
Deci o mulțime de oameni atunci când ești un data

48320
36:01:39,680 --> 36:01:43,040
om de știință și vorbești cu alții

48321
36:01:41,592 --> 36:01:45,680
oamenii de știință de date vă vor întreba

48322
36:01:43,040 --> 36:01:48,320
care este scorul F1 pentru Fore. Dacă ești

48323
36:01:45,680 --> 36:01:50,400
vorbind cu publicul larg sau cu uh

48324
36:01:48,320 --> 36:01:51,832
factorii de decizie în afaceri, ei sunt

48325
36:01:50,400 --> 36:01:54,160
mă voi întreba care este exactitatea. Şi

48326
36:01:51,832 --> 36:01:56,640
acuratețea este întotdeauna mai bună decât

48327
36:01:54,160 --> 36:01:58,552
Scorul F1. Dar scorul F1 este mai mult

48328
36:01:56,640 --> 36:02:00,400
povestind. Ne anunță că există

48329
36:01:58,552 --> 36:02:03,832
mai multe fals pozitive decât ne-am dori

48330
36:02:00,400 --> 36:02:06,000
pe aici. Dar 82% nu e prea rău pentru un rapid

48331
36:02:03,832 --> 36:02:08,552
uita-te la oameni diferiti

48332
36:02:06,000 --> 36:02:10,872
statistici și rularea unui sklearn și

48333
36:02:08,552 --> 36:02:13,360
rulează KNN, cel mai apropiat vecin K

48334
36:02:10,872 --> 36:02:16,080
pe ea. Așa că am creat un model folosind

48335
36:02:13,360 --> 36:02:18,480
KNandN care poate prezice dacă o persoană

48336
36:02:16,080 --> 36:02:19,680
va avea sau nu diabet zaharat sau chiar acum

48337
36:02:18,480 --> 36:02:21,832
cel puțin dacă ar trebui să meargă să ia o

48338
36:02:19,680 --> 36:02:24,000
control și să le verifice glicemia

48339
36:02:21,832 --> 36:02:26,872
regulat sau nu. Precizia imprimării

48340
36:02:24,000 --> 36:02:28,480
scorul pe care l-am primit 0818 a fost destul de aproape

48341
36:02:26,872 --> 36:02:29,832
la ceea ce am primit și putem destul de mult

48342
36:02:28,480 --> 36:02:32,552
rotunjește asta și spune doar că avem un

48343
36:02:29,832 --> 36:02:34,400
precizie de 80%. Ne spune că este frumos

48344
36:02:32,552 --> 36:02:37,272
potrivire corectă în model.

48345
36:02:34,400 --> 36:02:40,480
>> Deci, ce este jocul înseamnă gruparea? C

48346
36:02:37,272 --> 36:02:43,120
înseamnă că gruparea este nesupravegheată

48347
36:02:40,480 --> 36:02:45,592
algoritm de învățare. În acest caz, tu

48348
36:02:43,120 --> 36:02:47,592
nu au date etichetate spre deosebire de în

48349
36:02:45,592 --> 36:02:50,960
învăţare supravegheată. Deci ai un set

48350
36:02:47,592 --> 36:02:52,800
de date și doriți să le grupați și

48351
36:02:50,960 --> 36:02:55,592
după cum sugerează și numele, doriți să puneți

48352
36:02:52,800 --> 36:02:57,832
le în grupuri, ceea ce înseamnă obiecte

48353
36:02:55,592 --> 36:03:00,872
care sunt asemănătoare în natură, asemănătoare în

48354
36:02:57,832 --> 36:03:03,760
caracteristicile trebuie puse împreună.

48355
36:03:00,872 --> 36:03:07,360
Deci asta este ceea ce K înseamnă că gruparea este tot

48356
36:03:03,760 --> 36:03:09,680
despre. Termenul K este practic este a

48357
36:03:07,360 --> 36:03:11,680
număr. Deci trebuie să spunem sistemului

48358
36:03:09,680 --> 36:03:13,360
câte clustere trebuie să realizăm. Deci

48359
36:03:11,680 --> 36:03:15,512
dacă K este egal cu doi, vor fi doi

48360
36:03:13,360 --> 36:03:17,440
clustere. Dacă K este egal cu trei, trei

48361
36:03:15,512 --> 36:03:19,512
clustere și așa mai departe și așa mai departe. Asta e

48362
36:03:17,440 --> 36:03:21,360
ceea ce reprezintă K. Și bineînțeles

48363
36:03:19,512 --> 36:03:24,400
există o modalitate de a afla ce este

48364
36:03:21,360 --> 36:03:26,400
cea mai bună sau optimă valoare a lui K pentru a

48365
36:03:24,400 --> 36:03:30,080
date date. Ne vom uita la asta. Deci

48366
36:03:26,400 --> 36:03:32,552
adică K înseamnă grupare. Deci haideți

48367
36:03:30,080 --> 36:03:35,360
luați un exemplu. C înseamnă gruparea este

48368
36:03:32,552 --> 36:03:37,760
folosit în multe scenarii, dar haideți

48369
36:03:35,360 --> 36:03:40,872
luați un exemplu de cricket jocul de

48370
36:03:37,760 --> 36:03:43,360
cricket să presupunem că ați primit date de a

48371
36:03:40,872 --> 36:03:46,320
o mulțime de jucători poate din toate colțurile

48372
36:03:43,360 --> 36:03:49,912
tara sau in toata lumea si asta

48373
36:03:46,320 --> 36:03:52,480
datele conțin informații despre curse

48374
36:03:49,912 --> 36:03:55,592
marcat de oameni sau de jucător

48375
36:03:52,480 --> 36:03:58,400
iar wicket-urile luate de jucător și

48376
36:03:55,592 --> 36:04:02,000
pe baza acestor informații de care avem nevoie

48377
36:03:58,400 --> 36:04:04,320
grupați aceste date în două grupuri

48378
36:04:02,000 --> 36:04:06,872
baterii şi bowlieri. Deci acesta este un

48379
36:04:04,320 --> 36:04:09,832
exemplu interesant. Să vedem cum

48380
36:04:06,872 --> 36:04:12,400
poate efectua acest lucru. Deci avem datele

48381
36:04:09,832 --> 36:04:15,120
care constă în primul rând din două

48382
36:04:12,400 --> 36:04:17,680
caracteristici care este alergările și

48383
36:04:15,120 --> 36:04:20,960
wicketurile. Deci bowlierii practic

48384
36:04:17,680 --> 36:04:22,720
luați wickets și batsmen-ul marchează.

48385
36:04:20,960 --> 36:04:25,192
Vor fi, desigur, câțiva bowlieri

48386
36:04:22,720 --> 36:04:27,360
care poate înscrie niște alergări și similar

48387
36:04:25,192 --> 36:04:29,440
vor fi niște batsmen care vor cine

48388
36:04:27,360 --> 36:04:31,680
ar fi luat câteva portiţe. Dar cu

48389
36:04:29,440 --> 36:04:34,720
aceste informații, dorim să grupăm

48390
36:04:31,680 --> 36:04:36,800
acesti jucători se transformă în batsmen și bowlers.

48391
36:04:34,720 --> 36:04:39,440
Deci, cum funcționează asta? Să spunem că asta este

48392
36:04:36,800 --> 36:04:41,360
cum sunt datele. Deci există

48393
36:04:39,440 --> 36:04:44,800
informații există informații despre

48394
36:04:41,360 --> 36:04:46,872
axa y despre alergarea punctată și pe

48395
36:04:44,800 --> 36:04:49,360
axa x despre wicket-urile luate de

48396
36:04:46,872 --> 36:04:53,120
jucători. Deci, dacă facem un complot rapid, asta

48397
36:04:49,360 --> 36:04:55,832
asa ar arata. Și când o facem

48398
36:04:53,120 --> 36:04:59,360
clustering, trebuie să avem

48399
36:04:55,832 --> 36:05:01,680
clustere așa cum se arată în a treia diagramă

48400
36:04:59,360 --> 36:05:04,160
aici afară. Trebuie să avem un cluster

48401
36:05:01,680 --> 36:05:06,400
care este format din persoane care au punctat

48402
36:05:04,160 --> 36:05:08,960
runde mari care este practic

48403
36:05:06,400 --> 36:05:11,272
baterii. Și apoi avem nevoie de un grup cu

48404
36:05:08,960 --> 36:05:13,912
oameni care au luat o mulțime de wickets

48405
36:05:11,272 --> 36:05:15,832
care sunt de obicei bowlierii. Acolo

48406
36:05:13,912 --> 36:05:18,000
poate fi o anumită suprapunere dar

48407
36:05:15,832 --> 36:05:20,320
nu vom vorbi despre asta chiar acum. Deci

48408
36:05:18,000 --> 36:05:23,120
cu K înseamnă grupare vom avea

48409
36:05:20,320 --> 36:05:25,680
aici înseamnă că K este egal cu doi și noi

48410
36:05:23,120 --> 36:05:27,912
va avea două grupuri care sunt batsmen

48411
36:05:25,680 --> 36:05:30,640
și bowlieri. Deci, cum funcționează asta? The

48412
36:05:27,912 --> 36:05:33,360
modul în care funcționează este primul pas în K

48413
36:05:30,640 --> 36:05:37,040
înseamnă că gruparea este alocarea

48414
36:05:33,360 --> 36:05:41,360
doi centroizi aleatoriu. Deci două puncte

48415
36:05:37,040 --> 36:05:44,400
sunt desemnați ca așa-numiți centrizi. Deci

48416
36:05:41,360 --> 36:05:47,440
în acest caz dorim două clustere care

48417
36:05:44,400 --> 36:05:51,592
înseamnă că K este egal cu doi. Deci două puncte

48418
36:05:47,440 --> 36:05:54,640
au fost desemnați aleatoriu ca centrizi.

48419
36:05:51,592 --> 36:05:56,720
Rețineți că aceste puncte pot fi

48420
36:05:54,640 --> 36:05:59,192
oriunde. Sunt puncte aleatorii. Ei

48421
36:05:56,720 --> 36:06:02,080
nu sunt inițial nu sunt cu adevărat

48422
36:05:59,192 --> 36:06:04,400
centroizii. Centr înseamnă că este o

48423
36:06:02,080 --> 36:06:07,120
punctul central al unui set de date dat. Dar

48424
36:06:04,400 --> 36:06:09,760
în acest caz, când pornește, nu este

48425
36:06:07,120 --> 36:06:12,480
cu adevărat centroidul. Bine. Deci astea

48426
36:06:09,760 --> 36:06:14,872
puncte însă în prezentarea noastră aici

48427
36:06:12,480 --> 36:06:16,720
le-am arătat un punct mai aproape

48428
36:06:14,872 --> 36:06:18,800
aceste puncte de date și altul mai aproape de

48429
36:06:16,720 --> 36:06:21,832
aceste puncte de date. Ele pot fi atribuite

48430
36:06:18,800 --> 36:06:23,592
aleatoriu oriunde. Bine. Deci asta este

48431
36:06:21,832 --> 36:06:26,080
primul pas. Următorul pas este să

48432
36:06:23,592 --> 36:06:30,160
determinați distanța fiecăruia dintre

48433
36:06:26,080 --> 36:06:32,960
puncte de date de la fiecare dintre aleatoriu

48434
36:06:30,160 --> 36:06:35,272
centride alocate. Deci de exemplu noi

48435
36:06:32,960 --> 36:06:38,000
luați acest punct și găsiți distanța

48436
36:06:35,272 --> 36:06:40,720
de la acest centru si distanta de la

48437
36:06:38,000 --> 36:06:42,400
acest cent. Acest punct este luat și

48438
36:06:40,720 --> 36:06:45,040
distanta se gaseste de acest centroid si

48439
36:06:42,400 --> 36:06:48,080
aceasta c și așa mai departe și așa mai departe. Deci pentru

48440
36:06:45,040 --> 36:06:51,512
în fiecare punct se măsoară distanța

48441
36:06:48,080 --> 36:06:54,232
din ambele centroizi și apoi

48442
36:06:51,512 --> 36:06:56,800
oricare dintre distanța este mai mică este acel punct

48443
36:06:54,232 --> 36:06:59,120
atribuit acelui centroid. Deci pentru

48444
36:06:56,800 --> 36:07:01,912
exemplu în acest caz vizual este foarte

48445
36:06:59,120 --> 36:07:04,160
evident că toate aceste puncte de date sunt

48446
36:07:01,912 --> 36:07:05,680
atribuite acestui centroid și toate acestea

48447
36:07:04,160 --> 36:07:07,592
puncte de date sunt alocate acestuia

48448
36:07:05,680 --> 36:07:10,000
centroid și asta este reprezentat

48449
36:07:07,592 --> 36:07:12,872
aici în culoarea albastră și în acest galben

48450
36:07:10,000 --> 36:07:15,832
culoare. Următorul pas este de fapt

48451
36:07:12,872 --> 36:07:18,640
determina punctul central sau

48452
36:07:15,832 --> 36:07:21,440
centrid real pentru aceste două clustere.

48453
36:07:18,640 --> 36:07:23,832
Deci avem acest cluster inițial,

48454
36:07:21,440 --> 36:07:25,512
acest cluster inițial. Dar cum poți

48455
36:07:23,832 --> 36:07:27,440
vezi aceste puncte nu sunt cu adevărat

48456
36:07:25,512 --> 36:07:30,400
centroid. Centroid înseamnă că ar trebui să fie

48457
36:07:27,440 --> 36:07:32,480
poziţia centrală a acestui set de date.

48458
36:07:30,400 --> 36:07:35,040
Poziția centrală a acestui set de date. Deci

48459
36:07:32,480 --> 36:07:38,160
asta trebuie determinat ca

48460
36:07:35,040 --> 36:07:41,040
următorul pas. Deci punctul central al

48461
36:07:38,160 --> 36:07:43,912
se determină centridul real și cel

48462
36:07:41,040 --> 36:07:46,720
centr original alocat aleator este

48463
36:07:43,912 --> 36:07:50,000
repoziționat pe centroidul real al

48464
36:07:46,720 --> 36:07:52,080
aceste noi clustere și acest proces este

48465
36:07:50,000 --> 36:07:55,120
repetat de fapt. Acum ce s-ar putea întâmpla

48466
36:07:52,080 --> 36:07:57,440
este unele dintre aceste puncte pot obține

48467
36:07:55,120 --> 36:07:59,832
realocat. În exemplul nostru nu este așa

48468
36:07:57,440 --> 36:08:02,160
se întâmplă probabil, dar se poate întâmpla așa

48469
36:07:59,832 --> 36:08:04,160
că distanța se găsește între fiecare

48470
36:08:02,160 --> 36:08:06,800
din aceste puncte de date încă o dată cu

48471
36:08:04,160 --> 36:08:08,640
aceşti centroizi. Și dacă există dacă

48472
36:08:06,800 --> 36:08:10,800
este necesar unele puncte pot fi

48473
36:08:08,640 --> 36:08:12,960
realocat. Vom vedea asta mai târziu

48474
36:08:10,800 --> 36:08:16,400
exemplu, dar deocamdată îl vom păstra

48475
36:08:12,960 --> 36:08:20,000
simplu. Deci acest proces este continuat

48476
36:08:16,400 --> 36:08:23,360
până când se oprește repoziționarea centridă și

48477
36:08:20,000 --> 36:08:26,640
acesta este grupul nostru final. Deci asta este

48478
36:08:23,360 --> 36:08:28,720
așa că după repetare ajungem la asta

48479
36:08:26,640 --> 36:08:30,480
poziționați această situație în care

48480
36:08:28,720 --> 36:08:33,120
centroidul nu mai are nevoie de nimic

48481
36:08:30,480 --> 36:08:36,232
repoziționare și asta înseamnă a noastră

48482
36:08:33,120 --> 36:08:38,960
algoritmul are convergență convergența are

48483
36:08:36,232 --> 36:08:41,360
a avut loc și avem clusterul doi

48484
36:08:38,960 --> 36:08:45,040
clustere avem clusterele cu a

48485
36:08:41,360 --> 36:08:47,592
centroid. Deci acest proces se repetă.

48486
36:08:45,040 --> 36:08:50,640
Procesul de calcul al distanței

48487
36:08:47,592 --> 36:08:53,760
iar repoziţionarea centridului este

48488
36:08:50,640 --> 36:08:56,800
repetat până se oprește repoziționarea

48489
36:08:53,760 --> 36:09:00,000
ceea ce înseamnă că algoritmul are

48490
36:08:56,800 --> 36:09:01,760
convergent și avem clusterul final

48491
36:09:00,000 --> 36:09:03,760
cu punctele de date și

48492
36:09:01,760 --> 36:09:05,760
centroizii. Deci asta ești

48493
36:09:03,760 --> 36:09:08,000
o să înveți din această sesiune. Noi

48494
36:09:05,760 --> 36:09:10,400
va vorbi despre tipurile de clustering.

48495
36:09:08,000 --> 36:09:12,480
Ce înseamnă K înseamnă grupare? aplicarea

48496
36:09:10,400 --> 36:09:14,872
de K înseamnă grupare. C înseamnă

48497
36:09:12,480 --> 36:09:17,360
gruparea se face folosind distanța

48498
36:09:14,872 --> 36:09:19,680
masura. Deci vom vorbi despre

48499
36:09:17,360 --> 36:09:22,160
masuri comune de distanta si apoi noi

48500
36:09:19,680 --> 36:09:24,960
va vorbi despre modul în care K înseamnă grupare

48501
36:09:22,160 --> 36:09:27,040
funcționează și intră în detaliile K înseamnă

48502
36:09:24,960 --> 36:09:29,832
algoritm de clustering și apoi vom face

48503
36:09:27,040 --> 36:09:32,400
se încheie cu o demonstrație și un caz de utilizare pentru K

48504
36:09:29,832 --> 36:09:33,680
înseamnă grupare. Deci să începem. În primul rând

48505
36:09:32,400 --> 36:09:35,912
dintre toate, care sunt tipurile de

48506
36:09:33,680 --> 36:09:38,320
clustering? Sunt în primul rând două

48507
36:09:35,912 --> 36:09:40,160
categorii de clustering. ierarhic

48508
36:09:38,320 --> 36:09:42,400
grupare și apoi partiționare

48509
36:09:40,160 --> 36:09:45,440
clustering și fiecare dintre aceste categorii

48510
36:09:42,400 --> 36:09:48,400
sunt mai departe subdivizate în elomerative

48511
36:09:45,440 --> 36:09:50,872
și gruparea divizionară și K înseamnă și

48512
36:09:48,400 --> 36:09:52,960
fuzzy C înseamnă grupare. Să luăm o

48513
36:09:50,872 --> 36:09:55,680
privire rapidă la ceea ce fiecare dintre aceste tipuri

48514
36:09:52,960 --> 36:09:58,400
de clustering sunt. În ierarhic

48515
36:09:55,680 --> 36:10:01,040
clustering, ciorchinii au un arbore

48516
36:09:58,400 --> 36:10:04,232
structura şi gruparea ierarhică este

48517
36:10:01,040 --> 36:10:07,592
împărţit în continuare în elomerativ şi

48518
36:10:04,232 --> 36:10:09,592
dezbinatoare. Agruparea elomemerativă este a

48519
36:10:07,592 --> 36:10:12,080
abordare de jos în sus. Începem cu fiecare

48520
36:10:09,592 --> 36:10:14,720
element ca un grup separat și îmbina

48521
36:10:12,080 --> 36:10:18,080
le în clustere succesiv mai mari.

48522
36:10:14,720 --> 36:10:20,080
Deci, de exemplu, avem A B CDE E F. Noi

48523
36:10:18,080 --> 36:10:23,272
începeți prin a combina B și C formează unul

48524
36:10:20,080 --> 36:10:25,512
cluster. D și E mai formează unul. Apoi noi

48525
36:10:23,272 --> 36:10:27,832
combinați D, E și F încă unul mai mare

48526
36:10:25,512 --> 36:10:30,160
cluster și apoi adăugați BC la asta și apoi

48527
36:10:27,832 --> 36:10:32,320
în cele din urmă A la asta. Comparativ cu asta

48528
36:10:30,160 --> 36:10:34,800
clustering divizor sau divizor

48529
36:10:32,320 --> 36:10:36,960
gruparea este o abordare de sus în jos. Noi

48530
36:10:34,800 --> 36:10:39,592
începe cu întregul set și continuă cu

48531
36:10:36,960 --> 36:10:42,232
împărțiți-l în succesiv mai mici

48532
36:10:39,592 --> 36:10:44,552
clustere. Deci avem ABCDE E F. Noi mai întâi

48533
36:10:42,232 --> 36:10:49,192
luați asta ca un singur cluster și apoi

48534
36:10:44,552 --> 36:10:51,592
descompune-l în A B C D E și F. Apoi

48535
36:10:49,192 --> 36:10:54,800
avem împărțirea grupării partiționale

48536
36:10:51,592 --> 36:10:58,000
în două subtipuri. K înseamnă grupare

48537
36:10:54,800 --> 36:11:00,960
și fuzzy C înseamnă. În K înseamnă grupare

48538
36:10:58,000 --> 36:11:04,080
obiectele sunt împărțite în număr

48539
36:11:00,960 --> 36:11:06,232
de clustere menționate de numărul K.

48540
36:11:04,080 --> 36:11:08,960
De aici vine K. Deci dacă noi

48541
36:11:06,232 --> 36:11:12,232
spunem că K este egal cu doi, obiectele sunt

48542
36:11:08,960 --> 36:11:14,800
împărțit în două grupuri C1 și C2. Şi

48543
36:11:12,232 --> 36:11:17,592
modul în care se face este caracteristicile sau

48544
36:11:14,800 --> 36:11:19,912
se compară caracteristicile și toate

48545
36:11:17,592 --> 36:11:22,232
obiecte cu caracteristici similare

48546
36:11:19,912 --> 36:11:24,400
sunt clubați împreună. Deci așa este K

48547
36:11:22,232 --> 36:11:26,552
înseamnă că gruparea este făcută. Vom vedea

48548
36:11:24,400 --> 36:11:29,360
mai detaliat pe măsură ce avansăm. Şi

48549
36:11:26,552 --> 36:11:32,400
fuzzy C înseamnă foarte asemănător cu K înseamnă

48550
36:11:29,360 --> 36:11:34,640
în sensul că clubează obiecte că

48551
36:11:32,400 --> 36:11:37,272
au caracteristici similare împreună.

48552
36:11:34,640 --> 36:11:40,160
Dar în timp ce în K înseamnă gruparea doi

48553
36:11:37,272 --> 36:11:41,760
obiectele nu pot aparține sau oricărui obiect a

48554
36:11:40,160 --> 36:11:44,720
un singur obiect nu poate aparține a două

48555
36:11:41,760 --> 36:11:46,872
grupuri diferite în C înseamnă obiecte

48556
36:11:44,720 --> 36:11:49,040
poate aparține mai multor clustere. Deci

48557
36:11:46,872 --> 36:11:51,680
aceasta este diferența principală dintre K

48558
36:11:49,040 --> 36:11:54,080
înseamnă și C fuzzy înseamnă. Deci ce sunt

48559
36:11:51,680 --> 36:11:56,400
unele dintre aplicaţiile K înseamnă

48560
36:11:54,080 --> 36:11:59,440
clustering? C înseamnă că se utilizează clustering

48561
36:11:56,400 --> 36:12:02,320
într-o varietate de exemple sau varietate de

48562
36:11:59,440 --> 36:12:04,800
pornirea cazurilor de afaceri în viața reală

48563
36:12:02,320 --> 36:12:07,592
de la performanta academica, diagnostic

48564
36:12:04,800 --> 36:12:10,000
sisteme, motoare de căutare și wireless

48565
36:12:07,592 --> 36:12:11,760
rețele de senzori și multe altele. Așa că haideți

48566
36:12:10,000 --> 36:12:14,480
aruncați o privire puțin mai profundă la fiecare dintre

48567
36:12:11,760 --> 36:12:16,800
aceste exemple. Performanța academică. Deci

48568
36:12:14,480 --> 36:12:19,120
pe baza punctajelor elevilor,

48569
36:12:16,800 --> 36:12:21,912
elevii sunt clasificați în A, B, C

48570
36:12:19,120 --> 36:12:24,232
si asa mai departe. Clustering formează o coloană vertebrală

48571
36:12:21,912 --> 36:12:26,640
a motoarelor de căutare. Când o căutare este

48572
36:12:24,232 --> 36:12:28,960
efectuate, rezultatele căutării trebuie să fie

48573
36:12:26,640 --> 36:12:31,680
grupate împreună. Motoarele de căutare

48574
36:12:28,960 --> 36:12:34,320
de foarte multe ori folosiți clustering pentru a face acest lucru.

48575
36:12:31,680 --> 36:12:36,320
Și la fel, în cazul wireless

48576
36:12:34,320 --> 36:12:38,872
rețele de senzori, clustering

48577
36:12:36,320 --> 36:12:41,440
algoritmul joacă rolul de a găsi

48578
36:12:38,872 --> 36:12:44,080
capete de cluster care colectează toate

48579
36:12:41,440 --> 36:12:46,720
date din clusterul respectiv. Deci

48580
36:12:44,080 --> 36:12:49,440
clustering în special K înseamnă clustering

48581
36:12:46,720 --> 36:12:51,680
folosește măsurarea distanței. Deci să luăm un

48582
36:12:49,440 --> 36:12:53,512
uite ce este măsura distanței. Deci

48583
36:12:51,680 --> 36:12:56,160
în timp ce acestea sunt diferitele tipuri de

48584
36:12:53,512 --> 36:12:59,440
gruparea în acest videoclip ne vom concentra

48585
36:12:56,160 --> 36:13:03,592
pe K înseamnă grupare. Deci distanta

48586
36:12:59,440 --> 36:13:07,040
măsura spune cât de asemănătoare sunt unele obiecte

48587
36:13:03,592 --> 36:13:09,832
sunt. Deci, asemănarea este măsurată folosind

48588
36:13:07,040 --> 36:13:11,680
ceea ce se numește măsura distanței și

48589
36:13:09,832 --> 36:13:14,872
care sunt diferitele tipuri de distanță

48590
36:13:11,680 --> 36:13:17,272
măsuri. Există distanță ukidiană.

48591
36:13:14,872 --> 36:13:19,440
Există distanță de Manhattan. Apoi noi

48592
36:13:17,272 --> 36:13:22,160
au măsura distanței ukitiană la pătrat

48593
36:13:19,440 --> 36:13:24,000
și măsura distanței cosinus. Acestea sunt

48594
36:13:22,160 --> 36:13:26,720
unele dintre măsurile de distanță susținute

48595
36:13:24,000 --> 36:13:29,360
prin k înseamnă grupare. Să aruncăm o privire

48596
36:13:26,720 --> 36:13:31,192
la fiecare dintre acestea. Ce este ukidian

48597
36:13:29,360 --> 36:13:33,360
măsura distanței? Acest lucru nu este altceva decât

48598
36:13:31,192 --> 36:13:35,512
distanța dintre două puncte. Deci noi

48599
36:13:33,360 --> 36:13:38,160
au învățat în liceu cum să găsească

48600
36:13:35,512 --> 36:13:40,720
distanța dintre două puncte. Aceasta este

48601
36:13:38,160 --> 36:13:43,040
o formulă puțin sofisticată pentru asta.

48602
36:13:40,720 --> 36:13:48,080
Dar știm că unul mai simplu este pătrat

48603
36:13:43,040 --> 36:13:50,720
roo<unk> din y2 - y1 pătrat x2 - x1

48604
36:13:48,080 --> 36:13:53,272
pătrat. Deci aceasta este o extensie a acesteia

48605
36:13:50,720 --> 36:13:56,552
formula. Deci, aceasta este distanța ukidiană

48606
36:13:53,272 --> 36:13:58,960
între două puncte. Ce este pătratul

48607
36:13:56,552 --> 36:14:02,960
măsura distanței ukidiane? Nu e nimic

48608
36:13:58,960 --> 36:14:04,960
ci pătratul distanței ukidiane

48609
36:14:02,960 --> 36:14:08,000
după cum sugerează și numele. Deci în loc de

48610
36:14:04,960 --> 36:14:10,640
luând rădăcina pătrată, lăsăm

48611
36:14:08,000 --> 36:14:12,720
pătrat așa cum este. Și apoi avem

48612
36:14:10,640 --> 36:14:16,552
Măsurarea distanței Manhattan. În caz de

48613
36:14:12,720 --> 36:14:19,360
Distanța Manhattan, este suma dintre

48614
36:14:16,552 --> 36:14:22,160
distanțe pe axa x și pe

48615
36:14:19,360 --> 36:14:24,160
axa y. Și rețineți că luăm

48616
36:14:22,160 --> 36:14:25,912
valoare absolută astfel încât negativul

48617
36:14:24,160 --> 36:14:27,912
valorile nu intră în joc. Deci asta este

48618
36:14:25,912 --> 36:14:30,160
măsura distanței Manhattan. Apoi noi

48619
36:14:27,912 --> 36:14:33,040
au măsura distanței cosinus. In aceasta

48620
36:14:30,160 --> 36:14:35,272
caz, luăm unghiul dintre cele două

48621
36:14:33,040 --> 36:14:38,080
vectori formați prin unirea punctelor

48622
36:14:35,272 --> 36:14:40,800
de la origine. Deci acesta este cosinusul

48623
36:14:38,080 --> 36:14:42,480
măsura distanței. Bine. Deci asta a fost un

48624
36:14:40,800 --> 36:14:45,272
privire de ansamblu rapidă despre diverse

48625
36:14:42,480 --> 36:14:48,000
măsuri de distanță care sunt susținute de

48626
36:14:45,272 --> 36:14:51,680
K înseamnă. Acum să mergem și să verificăm cum

48627
36:14:48,000 --> 36:14:55,040
exact K înseamnă lucrări de grupare. Bine.

48628
36:14:51,680 --> 36:14:57,272
Deci așa funcționează K înseamnă clustering.

48629
36:14:55,040 --> 36:15:00,480
Aceasta este ca o diagramă a întregului

48630
36:14:57,272 --> 36:15:03,440
proces. Există un punct de plecare și

48631
36:15:00,480 --> 36:15:05,360
apoi precizăm numărul de clustere

48632
36:15:03,440 --> 36:15:08,960
pe care o dorim. Acum sunt câteva

48633
36:15:05,360 --> 36:15:11,120
moduri de a face asta. Putem face prin încercare

48634
36:15:08,960 --> 36:15:13,192
si eroare. Așa că precizăm un anumit

48635
36:15:11,120 --> 36:15:15,592
numărul poate k este egal cu 3 sau patru sau

48636
36:15:13,192 --> 36:15:18,320
cinci pentru început și apoi ca noi

48637
36:15:15,592 --> 36:15:20,720
progres ne continuăm să schimbăm până când ajungem

48638
36:15:18,320 --> 36:15:23,360
cele mai bune clustere sau există o

48639
36:15:20,720 --> 36:15:26,400
tehnica numita tehnica cotului prin care

48640
36:15:23,360 --> 36:15:28,480
putem determina valoarea lui k. Ce

48641
36:15:26,400 --> 36:15:30,552
ar trebui să fie cea mai bună valoare a lui k? Câți

48642
36:15:28,480 --> 36:15:33,192
ar trebui formate grupuri? Deci odată noi

48643
36:15:30,552 --> 36:15:37,040
au valoarea lui K precizăm că și

48644
36:15:33,192 --> 36:15:39,760
atunci sistemul va atribui atât de multe

48645
36:15:37,040 --> 36:15:42,480
centride. Deci alege la întâmplare asta

48646
36:15:39,760 --> 36:15:44,872
începe cu atâtea puncte aleatoriu

48647
36:15:42,480 --> 36:15:47,512
care sunt considerate a fi centridele

48648
36:15:44,872 --> 36:15:50,160
dintre aceste clustere și apoi măsoară

48649
36:15:47,512 --> 36:15:54,400
distanța fiecăruia dintre punctele de date

48650
36:15:50,160 --> 36:15:57,440
din aceste centroide și le atribuie pe acelea

48651
36:15:54,400 --> 36:15:59,912
indică centr-ul corespunzător din

48652
36:15:57,440 --> 36:16:02,160
care distanta este minima. Deci fiecare

48653
36:15:59,912 --> 36:16:05,360
punctul de date va fi atribuit

48654
36:16:02,160 --> 36:16:09,192
centrid care este cel mai apropiat de acesta și

48655
36:16:05,360 --> 36:16:12,160
astfel avem k număr de inițiale

48656
36:16:09,192 --> 36:16:16,000
clustere. Totuși, aceasta nu este finala

48657
36:16:12,160 --> 36:16:19,040
clustere. Următorul pas pe care îl face este pentru

48658
36:16:16,000 --> 36:16:21,912
noile grupuri pentru clusterele care

48659
36:16:19,040 --> 36:16:25,120
au fost formate calculează media

48660
36:16:21,912 --> 36:16:27,440
poziţia calculează astfel noul

48661
36:16:25,120 --> 36:16:30,000
pozitia centroidului. pozitia lui

48662
36:16:27,440 --> 36:16:31,832
mișcări centrice în comparație cu aleatoriu

48663
36:16:30,000 --> 36:16:34,400
a alocat unul. Deci este un iterativ

48664
36:16:31,832 --> 36:16:36,960
proces. Încă o dată distanța fiecăruia

48665
36:16:34,400 --> 36:16:40,480
punct este măsurat din acest nou centroid

48666
36:16:36,960 --> 36:16:43,360
punct și dacă este necesar punctele de date

48667
36:16:40,480 --> 36:16:46,080
sunt realocate noilor centroizi

48668
36:16:43,360 --> 36:16:48,552
si pozitia medie sau noul centrid

48669
36:16:46,080 --> 36:16:51,440
se calculează încă o dată. Dacă centridul

48670
36:16:48,552 --> 36:16:53,512
se mișcă apoi iterația continuă care

48671
36:16:51,440 --> 36:16:56,000
înseamnă că convergența nu a avut loc.

48672
36:16:53,512 --> 36:16:58,320
Gruparea nu a convergit. Deci ca

48673
36:16:56,000 --> 36:17:01,360
atâta timp cât există o mișcare a

48674
36:16:58,320 --> 36:17:04,320
centrată, această iterație continuă să se întâmple.

48675
36:17:01,360 --> 36:17:07,592
Dar odată ce centridul încetează să se miște care

48676
36:17:04,320 --> 36:17:10,000
înseamnă că clusterul a convergit sau

48677
36:17:07,592 --> 36:17:12,872
procesul de grupare a convergit

48678
36:17:10,000 --> 36:17:15,680
acesta va fi rezultatul final. Deci acum noi

48679
36:17:12,872 --> 36:17:18,552
au poziția finală a centroidului

48680
36:17:15,680 --> 36:17:21,272
iar punctele de date sunt alocate

48681
36:17:18,552 --> 36:17:22,552
conform celui mai apropiat centrid. eu

48682
36:17:21,272 --> 36:17:25,272
știi că este puțin dificil să faci

48683
36:17:22,552 --> 36:17:27,120
înțelegeți din această diagramă simplă.

48684
36:17:25,272 --> 36:17:30,160
Deci hai să facem puțin

48685
36:17:27,120 --> 36:17:32,480
vizualizare și vedem dacă putem explica

48686
36:17:30,160 --> 36:17:35,120
e mai bine. Să luăm un exemplu. Dacă noi

48687
36:17:32,480 --> 36:17:37,512
au un set de date pentru un magazin alimentar. Deci

48688
36:17:35,120 --> 36:17:41,120
să presupunem că avem un set de date pentru a

48689
36:17:37,512 --> 36:17:44,232
magazin alimentar și acum vrem să aflăm

48690
36:17:41,120 --> 36:17:47,440
câte grupuri trebuie să fie răspândite

48691
36:17:44,232 --> 36:17:49,760
peste. Deci, cum găsim optimul

48692
36:17:47,440 --> 36:17:52,320
numărul de clustere? Există o tehnică

48693
36:17:49,760 --> 36:17:54,080
numită metoda cotului. Deci când acestea

48694
36:17:52,320 --> 36:17:57,912
se formează ciorchini, există a

48695
36:17:54,080 --> 36:18:01,440
parametru numit în suma de pătrate.

48696
36:17:57,912 --> 36:18:04,232
Și cu cât această valoare este mai mică, cu atât mai bine

48697
36:18:01,440 --> 36:18:07,040
clusterul este. Asta înseamnă toate acestea

48698
36:18:04,232 --> 36:18:10,800
punctele sunt foarte apropiate unele de altele. Deci

48699
36:18:07,040 --> 36:18:15,360
folosim aceasta în suma de pătrate ca a

48700
36:18:10,800 --> 36:18:17,512
măsura pentru a găsi numărul optim de

48701
36:18:15,360 --> 36:18:20,400
clustere care pot fi formate pentru un dat

48702
36:18:17,512 --> 36:18:23,440
set de date. Deci creăm clustere sau noi

48703
36:18:20,400 --> 36:18:26,720
lăsați sistemul să creeze clustere de a

48704
36:18:23,440 --> 36:18:30,400
varietate de numere poate de 10 10

48705
36:18:26,720 --> 36:18:34,232
clustere și pentru fiecare valoare a lui K the

48706
36:18:30,400 --> 36:18:37,192
în SS este măsurată și valoarea lui K

48707
36:18:34,232 --> 36:18:41,192
care are cea mai mică cantitate din SS

48708
36:18:37,192 --> 36:18:44,232
sau WSS care este considerat optim

48709
36:18:41,192 --> 36:18:47,272
valoarea lui K. Deci aceasta este schematică

48710
36:18:44,232 --> 36:18:51,512
reprezentare. Deci avem pe axa y

48711
36:18:47,272 --> 36:18:53,272
suma dintre pătrate sau wss și mai departe

48712
36:18:51,512 --> 36:18:56,160
axa x avem numărul de

48713
36:18:53,272 --> 36:18:58,400
clustere. Deci, după cum vă puteți imagina dacă

48714
36:18:56,160 --> 36:19:00,960
au k este egal cu unu ceea ce înseamnă tot

48715
36:18:58,400 --> 36:19:03,272
punctele de date sunt într-un singur cluster

48716
36:19:00,960 --> 36:19:05,360
valoarea ss va fi foarte mare

48717
36:19:03,272 --> 36:19:08,232
pentru că probabil sunt împrăştiate toate

48718
36:19:05,360 --> 36:19:10,640
peste. În momentul în care l-ai împărțit în două

48719
36:19:08,232 --> 36:19:13,192
va avea loc o cădere drastică în

48720
36:19:10,640 --> 36:19:15,912
în ss value și asta este

48721
36:19:13,192 --> 36:19:19,040
reprezentat aici. Dar apoi ca valoare

48722
36:19:15,912 --> 36:19:22,000
de K crește scăderea ratei de

48723
36:19:19,040 --> 36:19:24,080
scăderea nu va fi atât de mare. Va fi

48724
36:19:22,000 --> 36:19:26,640
continuă să scadă dar probabil cel

48725
36:19:24,080 --> 36:19:29,272
rata de scădere nu va fi mare. Deci

48726
36:19:26,640 --> 36:19:32,000
asta ne da o idee. Deci de aici noi

48727
36:19:29,272 --> 36:19:35,440
fă-ți o idee, de exemplu, cea optimă

48728
36:19:32,000 --> 36:19:38,552
valoarea lui K ar trebui să fie fie două, fie trei

48729
36:19:35,440 --> 36:19:41,760
sau cel mult patru dar dincolo de asta

48730
36:19:38,552 --> 36:19:45,192
creșterea numărului de clustere nu este

48731
36:19:41,760 --> 36:19:46,872
schimbând dramatic valoarea în WSS

48732
36:19:45,192 --> 36:19:49,760
pentru că cam asta devine

48733
36:19:46,872 --> 36:19:52,320
stabilizat. Bine. Acum că avem

48734
36:19:49,760 --> 36:19:54,720
valoarea lui K și să presupunem că

48735
36:19:52,320 --> 36:19:59,360
acestea sunt punctele noastre de livrare. Următorul

48736
36:19:54,720 --> 36:20:02,000
pasul este practic de a aloca doi centrid

48737
36:19:59,360 --> 36:20:04,872
la întâmplare. Deci, să presupunem că C1 și C2 sunt

48738
36:20:02,000 --> 36:20:07,760
centridele alocate aleatoriu. Acum, cel

48739
36:20:04,872 --> 36:20:10,960
distanța fiecărei locații față de

48740
36:20:07,760 --> 36:20:14,000
centridul este măsurat și fiecare punct este

48741
36:20:10,960 --> 36:20:17,440
atribuit centridului care este cel mai apropiat

48742
36:20:14,000 --> 36:20:19,680
la el. Deci, de exemplu, aceste puncte sunt

48743
36:20:17,440 --> 36:20:22,960
foarte evident că acestea sunt cele mai apropiate de

48744
36:20:19,680 --> 36:20:26,080
C1 în timp ce acest punct este departe de

48745
36:20:22,960 --> 36:20:27,832
C2. Deci aceste puncte vor fi atribuite

48746
36:20:26,080 --> 36:20:30,800
care sunt apropiate de C1 vor fi atribuite

48747
36:20:27,832 --> 36:20:32,800
la C1 și aceste puncte sau locații

48748
36:20:30,800 --> 36:20:35,912
care sunt apropiate de C2 vor fi atribuite

48749
36:20:32,800 --> 36:20:38,640
la C2. Și atunci așa este cum

48750
36:20:35,912 --> 36:20:41,760
se face gruparea inițială. Aceasta este o parte

48751
36:20:38,640 --> 36:20:44,720
din C1 și aceasta face parte din C2. Apoi

48752
36:20:41,760 --> 36:20:47,912
următorul pas este calcularea reală

48753
36:20:44,720 --> 36:20:49,912
centrat din aceste date deoarece amintiți-vă C1

48754
36:20:47,912 --> 36:20:53,120
și C2 nu sunt centridele. Ei au

48755
36:20:49,912 --> 36:20:55,440
au fost atribuite aleatoriu puncte și numai

48756
36:20:53,120 --> 36:20:57,760
lucru care s-a făcut au fost datele

48757
36:20:55,440 --> 36:21:00,552
punctele care sunt cele mai apropiate de ele au

48758
36:20:57,760 --> 36:21:02,800
le-a fost atribuit. Dar acum în asta

48759
36:21:00,552 --> 36:21:04,552
pasul va fi centroidul real

48760
36:21:02,800 --> 36:21:06,160
calculate care pot fi pentru fiecare dintre

48761
36:21:04,552 --> 36:21:08,000
aceste seturi de date undeva la mijloc.

48762
36:21:06,160 --> 36:21:10,720
Deci, acesta este punctul principal care va fi

48763
36:21:08,000 --> 36:21:13,440
fi calculate și centr va

48764
36:21:10,720 --> 36:21:17,040
să fie poziționat sau repoziționat efectiv

48765
36:21:13,440 --> 36:21:19,832
acolo. La fel si cu C2. Deci noul centroid

48766
36:21:17,040 --> 36:21:22,480
pentru acest grup este C2. această nouă poziție

48767
36:21:19,832 --> 36:21:24,872
iar C1 se află în această nouă poziție. Dată

48768
36:21:22,480 --> 36:21:26,800
din nou, distanța fiecăreia dintre date

48769
36:21:24,872 --> 36:21:28,800
punctele se calculează din acestea

48770
36:21:26,800 --> 36:21:30,552
centroizii. Acum amintiți-vă, nu este

48771
36:21:28,800 --> 36:21:32,872
necesar ca distanta inca

48772
36:21:30,552 --> 36:21:34,960
rămâne cel sau fiecare dintre aceste puncte de date

48773
36:21:32,872 --> 36:21:36,872
raman inca in acelasi grup. De către

48774
36:21:34,960 --> 36:21:38,480
recalculând distanța, poate fi

48775
36:21:36,872 --> 36:21:41,832
posibil ca unele puncte să obțină

48776
36:21:38,480 --> 36:21:45,680
realocat astfel. Vezi asta? Deci

48777
36:21:41,832 --> 36:21:48,960
acest punct anterior a fost mai aproape de C2

48778
36:21:45,680 --> 36:21:51,760
pentru că C2 a fost aici. Dar după

48779
36:21:48,960 --> 36:21:55,120
recalculara repozitionare este

48780
36:21:51,760 --> 36:21:58,640
a observat că aceasta este mai aproape de C1 decât

48781
36:21:55,120 --> 36:22:01,760
C2. Deci aceasta este noua grupare. Deci unii

48782
36:21:58,640 --> 36:22:04,400
punctele vor fi realocate. Și din nou

48783
36:22:01,760 --> 36:22:06,400
centrid se va calcula iar dacă

48784
36:22:04,400 --> 36:22:08,400
centroidul nu se schimbă, deci este a

48785
36:22:06,400 --> 36:22:10,552
proces repetitiv, proces iterativ.

48786
36:22:08,400 --> 36:22:13,272
Și dacă centroidul nu se schimbă o dată

48787
36:22:10,552 --> 36:22:16,320
centroidul nu se mai schimbă, adică

48788
36:22:13,272 --> 36:22:18,960
algoritmul a convergit și asta este

48789
36:22:16,320 --> 36:22:21,592
grupul nostru final cu acesta ca

48790
36:22:18,960 --> 36:22:23,360
centroizii C1 și C2 ca centroizi

48791
36:22:21,592 --> 36:22:25,440
aceste puncte de date ca parte a fiecăruia

48792
36:22:23,360 --> 36:22:27,272
cluster. Așa că sper că acest lucru vă ajută

48793
36:22:25,440 --> 36:22:30,480
înţelegerea întregului proces

48794
36:22:27,272 --> 36:22:33,760
procesul iterativ al lui K înseamnă grupare.

48795
36:22:30,480 --> 36:22:36,640
Deci, să aruncăm o privire la mijloacele K

48796
36:22:33,760 --> 36:22:40,720
algoritm de grupare. Să zicem că avem

48797
36:22:36,640 --> 36:22:44,232
x1, x2, x3, n număr de puncte ca al nostru

48798
36:22:40,720 --> 36:22:46,640
intrări și dorim să împărțim acest lucru în k

48799
36:22:44,232 --> 36:22:48,960
clustere sau vrem să creăm k

48800
36:22:46,640 --> 36:22:52,480
clustere. Deci primul pas este să

48801
36:22:48,960 --> 36:22:55,192
alegeți aleatoriu k puncte și numiți-le

48802
36:22:52,480 --> 36:22:57,360
centroizii. Nu sunt adevărați centrizi

48803
36:22:55,192 --> 36:23:00,720
deoarece centr se presupune a fi un centru

48804
36:22:57,360 --> 36:23:03,680
punct, dar se numesc doar centrizi.

48805
36:23:00,720 --> 36:23:07,760
Și calculăm distanța fiecăruia

48806
36:23:03,680 --> 36:23:12,232
și fiecare punct de intrare din fiecare dintre

48807
36:23:07,760 --> 36:23:16,480
centroizii. Deci distanța lui X1 de la

48808
36:23:12,232 --> 36:23:19,040
C1 din C2 C3 fiecare dintre distanțele noi

48809
36:23:16,480 --> 36:23:22,080
calculează și apoi află care

48810
36:23:19,040 --> 36:23:24,872
distanța este cea mai mică și atribuiți X1 la

48811
36:23:22,080 --> 36:23:28,160
acel centroid anume aleatoriu. Repetați

48812
36:23:24,872 --> 36:23:31,040
acel proces pentru X2. calculează-i

48813
36:23:28,160 --> 36:23:34,232
distanța de la fiecare dintre centroizii C1,

48814
36:23:31,040 --> 36:23:36,320
C2, C3 până la CK și găsiți care este

48815
36:23:34,232 --> 36:23:38,480
distanța cea mai mică și atribuiți X2 acesteia

48816
36:23:36,320 --> 36:23:41,192
un anumit centroid. La fel și cu X3 și așa

48817
36:23:38,480 --> 36:23:45,120
pe. Deci asta este prima rundă a

48818
36:23:41,192 --> 36:23:47,192
sarcina care se face. Acum avem K

48819
36:23:45,120 --> 36:23:50,160
grupuri pentru că există avem

48820
36:23:47,192 --> 36:23:54,232
a atribuit valoarea lui K. Deci există K

48821
36:23:50,160 --> 36:23:56,720
centroizi și uh, deci există K grupuri.

48822
36:23:54,232 --> 36:23:59,912
Toate aceste intrări au fost împărțite în K

48823
36:23:56,720 --> 36:24:02,480
grupuri. Cu toate acestea, amintiți-vă că am ales

48824
36:23:59,912 --> 36:24:05,272
centride aleatoriu. Deci nu sunt reale

48825
36:24:02,480 --> 36:24:08,000
centride. Deci, acum, ce avem de făcut, noi

48826
36:24:05,272 --> 36:24:10,872
trebuie să calculeze centroizii actuali

48827
36:24:08,000 --> 36:24:13,120
pentru fiecare dintre aceste grupuri care este ca

48828
36:24:10,872 --> 36:24:15,272
poziţia medie ceea ce înseamnă că

48829
36:24:13,120 --> 36:24:18,640
poziţia celui selectat aleatoriu

48830
36:24:15,272 --> 36:24:21,512
centrizii se vor schimba acum și se vor schimba

48831
36:24:18,640 --> 36:24:25,360
fie poziţiile principale ale acestor noi

48832
36:24:21,512 --> 36:24:28,872
au format grupe K. Și odată ce s-a făcut asta,

48833
36:24:25,360 --> 36:24:31,360
repetăm încă o dată acest proces de

48834
36:24:28,872 --> 36:24:33,200
calculând distanța. Corect? Deci asta

48835
36:24:31,360 --> 36:24:36,488
este ceea ce facem ca parte a pasului

48836
36:24:33,200 --> 36:24:40,080
patru. Repetăm ​​pasul doi și trei. Deci

48837
36:24:36,488 --> 36:24:44,952
calculăm din nou distanța lui X1

48838
36:24:40,080 --> 36:24:47,112
din centroidul C1, C2, C3 și apoi

48839
36:24:44,952 --> 36:24:50,392
vezi care este cea mai mică valoare și atribuie

48840
36:24:47,112 --> 36:24:54,640
X1 la asta. Calculați distanța lui X2

48841
36:24:50,392 --> 36:24:56,392
de la C1, C2, C3 sau orice altceva până la CK și

48842
36:24:54,640 --> 36:24:59,280
găsiți care este distanța cea mai mică

48843
36:24:56,392 --> 36:25:01,592
și atribuiți X2 acelui centroid și așadar

48844
36:24:59,280 --> 36:25:04,560
pe. În acest proces pot exista unele

48845
36:25:01,592 --> 36:25:07,280
reatribuire. Probabil că X1 a fost atribuit

48846
36:25:04,560 --> 36:25:09,840
la cluster C2 și după ce a făcut asta

48847
36:25:07,280 --> 36:25:12,000
calculul poate acum îi este atribuit X1

48848
36:25:09,840 --> 36:25:14,800
C1. Deci acest tip de realocare poate

48849
36:25:12,000 --> 36:25:18,488
se întâmplă. Așa că repetăm pașii doi și

48850
36:25:14,800 --> 36:25:21,672
trei până la poziția centridelor

48851
36:25:18,488 --> 36:25:24,720
nu te schimba sau nu te mai schimba si atat

48852
36:25:21,672 --> 36:25:26,640
când avem convergenţă. Deci hai să luăm

48853
36:25:24,720 --> 36:25:29,752
o privire detaliată asupra fiecăruia dintre acestea

48854
36:25:26,640 --> 36:25:31,840
trepte. Deci alegem aleatoriu K cluster

48855
36:25:29,752 --> 36:25:34,160
centre. Le numim centroide

48856
36:25:31,840 --> 36:25:36,560
pentru că nu sunt inițial sunt

48857
36:25:34,160 --> 36:25:39,440
nu chiar centrizii. Așa că ne lăsăm

48858
36:25:36,560 --> 36:25:42,392
numiți-le C1 C2 până la CK. Și apoi pas

48859
36:25:39,440 --> 36:25:45,360
doi, atribuim fiecare punct de date la

48860
36:25:42,392 --> 36:25:48,720
cel mai apropiat centru. Deci ceea ce facem, noi

48861
36:25:45,360 --> 36:25:51,592
calculați distanța fiecărei valori X

48862
36:25:48,720 --> 36:25:57,752
din fiecare valoare C. Deci distanța

48863
36:25:51,592 --> 36:26:00,640
intre X1 C1 distanta dintre X1 C2 X1

48864
36:25:57,752 --> 36:26:02,952
C3 și apoi aflăm care este cel mai mic

48865
36:26:00,640 --> 36:26:06,640
valoare. Corect? Asta e valoarea minima

48866
36:26:02,952 --> 36:26:09,512
găsim și atribuim X1 acelui anume

48867
36:26:06,640 --> 36:26:13,280
centroid. Apoi mergem lângă x2. Găsiți

48868
36:26:09,512 --> 36:26:16,952
distanța lui x2 de la c1, x2 de la c2,

48869
36:26:13,280 --> 36:26:19,440
x2 de la c3 și așa mai departe până la ck. Și apoi

48870
36:26:16,952 --> 36:26:21,592
atribuie-o punctului sau

48871
36:26:19,440 --> 36:26:24,080
centroid care are cea mai mică valoare și

48872
36:26:21,592 --> 36:26:27,592
asa mai departe. Deci acesta este pasul numărul doi. În

48873
36:26:24,080 --> 36:26:30,160
Pasul numărul trei, acum găsim

48874
36:26:27,592 --> 36:26:33,032
centr real pentru fiecare grup. Deci ce are

48875
36:26:30,160 --> 36:26:36,392
sa întâmplat ca parte a pasului numărul doi?

48876
36:26:33,032 --> 36:26:40,560
Acum avem toate punctele, toate datele

48877
36:26:36,392 --> 36:26:42,800
puncte grupate în K grupe deoarece noi

48878
36:26:40,560 --> 36:26:45,360
am vrut să creăm K clustere, nu?

48879
36:26:42,800 --> 36:26:47,752
Deci avem K grupuri. Fiecare poate fi

48880
36:26:45,360 --> 36:26:50,160
având un anumit număr de valori de intrare.

48881
36:26:47,752 --> 36:26:52,488
Nu trebuie să fie distribuite în mod egal. De către

48882
36:26:50,160 --> 36:26:56,560
calea, în funcție de distanță, vom face

48883
36:26:52,488 --> 36:26:59,200
au grupele K. Dar amintiți-vă inițiala

48884
36:26:56,560 --> 36:27:01,512
valorile lui C1 C2 nu au fost cu adevărat

48885
36:26:59,200 --> 36:27:04,720
centriști ai acestor grupuri, nu? noi

48886
36:27:01,512 --> 36:27:08,160
atribuiți-le aleatoriu. Deci acum în pas

48887
36:27:04,720 --> 36:27:11,200
trei, de fapt calculăm centr

48888
36:27:08,160 --> 36:27:13,672
a fiecărei grupe ceea ce înseamnă originalul

48889
36:27:11,200 --> 36:27:16,640
punctul despre care credeam că este centridul

48890
36:27:13,672 --> 36:27:18,800
se va schimba pe noua pozitie care este

48891
36:27:16,640 --> 36:27:22,640
centridul real pentru fiecare dintre acestea

48892
36:27:18,800 --> 36:27:25,112
grupuri. Bine? Și calculăm din nou

48893
36:27:22,640 --> 36:27:27,920
distanţă. Așa că revenim la pasul doi

48894
36:27:25,112 --> 36:27:30,392
care este ceea ce calculăm din nou

48895
36:27:27,920 --> 36:27:34,080
distanța fiecăruia dintre aceste puncte de la

48896
36:27:30,392 --> 36:27:38,488
centroiidele nou poziționate și dacă

48897
36:27:34,080 --> 36:27:41,592
a cerut să reatribuim aceste puncte către

48898
36:27:38,488 --> 36:27:43,920
noi centroizi. Deci, așa cum am spus mai devreme

48899
36:27:41,592 --> 36:27:47,032
poate exista o realocare. Deci noi acum

48900
36:27:43,920 --> 36:27:50,640
au un nou set sau un nou grup. Noi încă

48901
36:27:47,032 --> 36:27:52,952
au K grupuri dar numărul de articole

48902
36:27:50,640 --> 36:27:56,800
iar misiunea efectivă poate fi

48903
36:27:52,952 --> 36:27:59,840
diferit de ceea ce era la pasul doi

48904
36:27:56,800 --> 36:28:02,720
aici. Bine, așa că s-ar putea schimba. Apoi

48905
36:27:59,840 --> 36:28:05,672
facem încă o dată pasul trei pentru a găsi

48906
36:28:02,720 --> 36:28:09,112
noul centroid al acestui nou grup. Deci

48907
36:28:05,672 --> 36:28:12,000
avem din nou un nou set de clustere, noi

48908
36:28:09,112 --> 36:28:14,560
centroizi și noi atribuiri. Noi

48909
36:28:12,000 --> 36:28:17,440
repetați acest pas doi din nou. Încă o dată

48910
36:28:14,560 --> 36:28:20,872
găsim și atunci este posibil ca

48911
36:28:17,440 --> 36:28:24,640
după ce a trecut prin trei sau patru sau

48912
36:28:20,872 --> 36:28:26,640
de cinci ori centridul se va opri din mișcare

48913
36:28:24,640 --> 36:28:29,032
în sensul că atunci când calculezi

48914
36:28:26,640 --> 36:28:31,512
noua valoare a centridului care va fi

48915
36:28:29,032 --> 36:28:34,560
aceeași cu valoarea inițială sau va exista

48916
36:28:31,512 --> 36:28:37,840
be very marginal change. So that is when

48917
36:28:34,560 --> 36:28:41,032
spunem că s-a produs convergenţa şi că

48918
36:28:37,840 --> 36:28:43,512
este clusterul nostru final. Asta este

48919
36:28:41,032 --> 36:28:47,360
formarea clusterului final. Toate

48920
36:28:43,512 --> 36:28:50,392
corect. Deci, să vedem câteva demonstrații ale

48921
36:28:47,360 --> 36:28:52,800
uh K înseamnă grupare. De fapt o vom face

48922
36:28:50,392 --> 36:28:54,800
vezi câteva demonstrații live în uh Python

48923
36:28:52,800 --> 36:28:57,032
notebook folosind Python notebook. Dar

48924
36:28:54,800 --> 36:28:59,200
înainte de asta să aflăm care este

48925
36:28:57,032 --> 36:29:01,512
problema pe care încercăm să o rezolvăm. The

48926
36:28:59,200 --> 36:29:04,232
Declarația problemei este să spunem Walmart

48927
36:29:01,512 --> 36:29:08,160
vrea să deschidă un lanț de magazine peste tot

48928
36:29:04,232 --> 36:29:11,112
statul Florida și dorește

48929
36:29:08,160 --> 36:29:14,080
găsiți locațiile optime pentru magazine. Acum

48930
36:29:11,112 --> 36:29:16,720
problema aici este dacă se deschid prea multe

48931
36:29:14,080 --> 36:29:20,160
magazine aproape unul de celălalt evident că

48932
36:29:16,720 --> 36:29:22,392
nu vor face profit dar dacă ei dacă

48933
36:29:20,160 --> 36:29:24,800
magazinele sunt prea departe unul de altul

48934
36:29:22,392 --> 36:29:27,592
nu va avea suficiente vânzări. Deci cum

48935
36:29:24,800 --> 36:29:30,160
ei optimizează asta? Acum pentru un

48936
36:29:27,592 --> 36:29:33,280
organizație precum Walmart, care este un

48937
36:29:30,160 --> 36:29:36,080
gigantul comerțului electronic au deja

48938
36:29:33,280 --> 36:29:39,360
adresele clienților lor în lor

48939
36:29:36,080 --> 36:29:42,640
baza de date. Deci, ei pot folosi acest lucru

48940
36:29:39,360 --> 36:29:46,160
informații sau aceste date și folosiți K mijloace

48941
36:29:42,640 --> 36:29:49,440
gruparea pentru a găsi locația optimă.

48942
36:29:46,160 --> 36:29:52,392
Acum, înainte de a intra în Python

48943
36:29:49,440 --> 36:29:54,312
notebook și vă arăt codul live, I

48944
36:29:52,392 --> 36:29:57,592
am vrut să te trezesc foarte repede

48945
36:29:54,312 --> 36:29:59,360
un rezumat al codului din slide-uri și

48946
36:29:57,592 --> 36:30:02,560
apoi vom intra în Python

48947
36:29:59,360 --> 36:30:05,360
caietul. Deci în acest bloc suntem

48948
36:30:02,560 --> 36:30:09,280
practic importând toate cele necesare

48949
36:30:05,360 --> 36:30:13,592
biblioteci precum numpy, mattplot lib și

48950
36:30:09,280 --> 36:30:15,840
așa mai departe și încărcăm datele care

48951
36:30:13,592 --> 36:30:18,872
este disponibil sub formă de să spunem

48952
36:30:15,840 --> 36:30:21,440
adresele pentru simplitate noi

48953
36:30:18,872 --> 36:30:23,840
le va lua doar ca niște puncte de date.

48954
36:30:21,440 --> 36:30:27,032
Apoi următorul lucru pe care îl facem este să facem rapid

48955
36:30:23,840 --> 36:30:29,280
un grafic de dispersie pentru a vedea cum sunt

48956
36:30:27,032 --> 36:30:31,592
legate între ele cu privire la

48957
36:30:29,280 --> 36:30:35,592
reciproc. Deci, în diagrama de dispersie noi

48958
36:30:31,592 --> 36:30:37,200
vezi că există câteva grupuri distincte

48959
36:30:35,592 --> 36:30:39,032
fiind deja format. Deci poți

48960
36:30:37,200 --> 36:30:41,512
de fapt face o idee despre cum

48961
36:30:39,032 --> 36:30:44,080
cluster ar arăta și câte clustere

48962
36:30:41,512 --> 36:30:46,872
care este numărul optim de clustere

48963
36:30:44,080 --> 36:30:50,560
și apoi începe K mijloacele reale

48964
36:30:46,872 --> 36:30:53,752
procesul de grupare. Deci vom atribui

48965
36:30:50,560 --> 36:30:56,640
fiecare dintre acestea indică către centride şi

48966
36:30:53,752 --> 36:30:58,720
apoi verificați dacă sunt optime

48967
36:30:56,640 --> 36:31:01,280
distanta care este cea mai scurta distanta

48968
36:30:58,720 --> 36:31:05,112
și atribuiți fiecare dintre datele de puncte

48969
36:31:01,280 --> 36:31:07,512
indică centroidele și apoi mergeți

48970
36:31:05,112 --> 36:31:10,488
prin acest proces iterativ până în

48971
36:31:07,512 --> 36:31:13,032
întreg procesul converge și în final noi

48972
36:31:10,488 --> 36:31:17,672
obține o ieșire ca aceasta. Deci avem patru

48973
36:31:13,032 --> 36:31:20,160
clustere distincte și um care este putem

48974
36:31:17,672 --> 36:31:22,640
spune că așa este populația

48975
36:31:20,160 --> 36:31:26,720
probabil distribuite în toată Florida

48976
36:31:22,640 --> 36:31:29,112
stare și uh aceste centroiide sunt ca

48977
36:31:26,720 --> 36:31:31,672
locația în care ar trebui să fie magazinul

48978
36:31:29,112 --> 36:31:34,872
locația optimă în care se află magazinul

48979
36:31:31,672 --> 36:31:37,440
ar trebui să fie. Deci așa e noi

48980
36:31:34,872 --> 36:31:40,000
determina cele mai bune locații pentru

48981
36:31:37,440 --> 36:31:42,488
magazin și așa putem ajuta Walmart

48982
36:31:40,000 --> 36:31:46,312
găsi cele mai bune locații pentru magazinele lor

48983
36:31:42,488 --> 36:31:48,160
în Florida. Așa că acum să luăm asta în considerare

48984
36:31:46,312 --> 36:31:50,000
Caiet Python. Să vedem cum asta

48985
36:31:48,160 --> 36:31:52,800
arata cand invatam sa rulam

48986
36:31:50,000 --> 36:31:56,080
cod live. În regulă. Deci acesta este

48987
36:31:52,800 --> 36:31:59,200
codul pentru K înseamnă grupare în Jupyter

48988
36:31:56,080 --> 36:32:02,080
caietul. Avem aici câteva exemple

48989
36:31:59,200 --> 36:32:04,640
pe care vom demonstra cum înseamnă K

48990
36:32:02,080 --> 36:32:06,312
clustering este folosit și chiar există o

48991
36:32:04,640 --> 36:32:08,560
implementare mică a K mijloace

48992
36:32:06,312 --> 36:32:11,440
gruparea de asemenea. Bine. Deci hai să luăm

48993
36:32:08,560 --> 36:32:13,112
a început. Bine. Deci acest bloc este

48994
36:32:11,440 --> 36:32:14,872
practic importând diversele

48995
36:32:13,112 --> 36:32:17,512
biblioteci care sunt necesare ca

48996
36:32:14,872 --> 36:32:20,488
mattplot lib și numpy și așa mai departe și așa

48997
36:32:17,512 --> 36:32:23,840
mai departe care ar fi folosit ca parte a

48998
36:32:20,488 --> 36:32:26,560
codul. Apoi mergem și creăm

48999
36:32:23,840 --> 36:32:28,232
blob-uri care sunt similare cu clusterele. Acum

49000
36:32:26,560 --> 36:32:31,512
aceasta este o caracteristică foarte îngrijită care este

49001
36:32:28,232 --> 36:32:34,800
disponibil în scikitlearn. Face blobs este

49002
36:32:31,512 --> 36:32:37,032
o caracteristică plăcută care creează grupuri de

49003
36:32:34,800 --> 36:32:38,872
seturi de date. Deci e minunat

49004
36:32:37,032 --> 36:32:41,752
funcționalitate care este ușor disponibilă

49005
36:32:38,872 --> 36:32:44,080
pentru ca noi să creăm niște date de testare

49006
36:32:41,752 --> 36:32:46,640
lucru. Bine. Deci exact asta e ceea ce noi

49007
36:32:44,080 --> 36:32:50,392
fac aici. Folosim make blobs

49008
36:32:46,640 --> 36:32:53,032
și putem specifica câte clustere avem

49009
36:32:50,392 --> 36:32:54,800
vreau. Deci centrele pe care le amintim aici.

49010
36:32:53,032 --> 36:32:56,872
Deci va merge înainte și așa doar noi

49011
36:32:54,800 --> 36:33:00,560
a menționat patru. Deci va merge înainte și

49012
36:32:56,872 --> 36:33:02,872
creați niște date de testare pentru noi. Și asta

49013
36:33:00,560 --> 36:33:05,112
asa arata. După cum puteți vedea vizual

49014
36:33:02,872 --> 36:33:08,800
de asemenea, ne putem da seama că există

49015
36:33:05,112 --> 36:33:12,000
patru clase sau grupuri distincte în

49016
36:33:08,800 --> 36:33:16,080
acest set de date. Și asta este ceea ce face

49017
36:33:12,000 --> 36:33:18,800
blobs oferă de fapt. Acum de aici

49018
36:33:16,080 --> 36:33:21,200
în continuare vom rula practic

49019
36:33:18,800 --> 36:33:23,672
standardul K înseamnă funcționalitate adică

49020
36:33:21,200 --> 36:33:26,720
ușor disponibile. Deci chiar nu

49021
36:33:23,672 --> 36:33:28,640
trebuie să implementeze K înseamnă în sine. C

49022
36:33:26,720 --> 36:33:31,032
înseamnă funcționalitate sau funcția

49023
36:33:28,640 --> 36:33:33,360
este ușor disponibil. Trebuie doar să

49024
36:33:31,032 --> 36:33:36,560
alimentați datele și vom crea

49025
36:33:33,360 --> 36:33:39,840
clustere. Deci acesta este codul pentru asta.

49026
36:33:36,560 --> 36:33:42,800
Importăm k mijloace și apoi creăm un

49027
36:33:39,840 --> 36:33:46,232
exemplu de k înseamnă și specificăm

49028
36:33:42,800 --> 36:33:49,200
valoarea lui k. Acest n_clusters este valoarea

49029
36:33:46,232 --> 36:33:51,280
de k. Amintiți-vă că K înseamnă în K înseamnă K este

49030
36:33:49,200 --> 36:33:54,080
practic numărul de clustere care

49031
36:33:51,280 --> 36:33:55,920
doriți să creați și este un număr întreg

49032
36:33:54,080 --> 36:33:57,840
valoare. Deci aici ne aflăm

49033
36:33:55,920 --> 36:34:01,752
precizând că. Deci avem K este egal

49034
36:33:57,840 --> 36:34:04,488
la patru și astfel se creează acea instanță.

49035
36:34:01,752 --> 36:34:06,952
Luăm acest exemplu și ca în oricare

49036
36:34:04,488 --> 36:34:09,512
alte funcționalități de învățare automată se potrivesc

49037
36:34:06,952 --> 36:34:12,872
este ceea ce folosim funcția sau

49038
36:34:09,512 --> 36:34:14,720
metoda mai degrabă potrivită este ceea ce folosim

49039
36:34:12,872 --> 36:34:17,200
antrenează modelul. Aici nu există real

49040
36:34:14,720 --> 36:34:19,752
antrenament uh un fel de lucru, dar asta este

49041
36:34:17,200 --> 36:34:21,032
suna. Bine. Așa că numim fit și

49042
36:34:19,752 --> 36:34:23,840
ceea ce facem aici suntem doar

49043
36:34:21,032 --> 36:34:26,952
transmiterea datelor. Deci x are aceste valori

49044
36:34:23,840 --> 36:34:30,720
datele care au fost create corect. Deci

49045
36:34:26,952 --> 36:34:33,512
asta trecem pe aici și uh

49046
36:34:30,720 --> 36:34:38,952
aceasta va merge înainte și va crea

49047
36:34:33,512 --> 36:34:42,000
clustere și atunci folosim

49048
36:34:38,952 --> 36:34:44,640
după ce ne potrivim, rulăm predicția

49049
36:34:42,000 --> 36:34:47,920
care practic atribuie pentru fiecare dintre

49050
36:34:44,640 --> 36:34:50,392
aceste observații care îl grupează

49051
36:34:47,920 --> 36:34:52,800
îi aparține. În regulă. Deci se va numi

49052
36:34:50,392 --> 36:34:55,360
clusterele. Poate că acesta este grupul unu.

49053
36:34:52,800 --> 36:34:58,720
Acesta este doi, trei și așa mai departe. Sau va

49054
36:34:55,360 --> 36:35:02,312
începe de fapt de la zero, cluster 0, 1,

49055
36:34:58,720 --> 36:35:04,488
2 și 3 poate. Și apoi pentru fiecare dintre

49056
36:35:02,312 --> 36:35:06,560
observații pe care le va atribui

49057
36:35:04,488 --> 36:35:10,488
cărui cluster îi aparține va

49058
36:35:06,560 --> 36:35:12,312
atribuie o valoare. Deci, acesta este stocat în y_k

49059
36:35:10,488 --> 36:35:15,752
înseamnă că atunci când numim prezice asta este ceea ce

49060
36:35:12,312 --> 36:35:19,592
o face. Și putem arunca o privire rapidă la

49061
36:35:15,752 --> 36:35:21,360
acestea uh y_k înseamnă sau cluster

49062
36:35:19,592 --> 36:35:23,440
numerele care au fost atribuite pentru fiecare

49063
36:35:21,360 --> 36:35:25,840
observatie. Deci acesta este clusterul

49064
36:35:23,440 --> 36:35:27,752
număr alocat pentru observație unu.

49065
36:35:25,840 --> 36:35:30,392
Poate asta este pentru observația a doua,

49066
36:35:27,752 --> 36:35:32,800
observația trei și așa mai departe. Deci avem

49067
36:35:30,392 --> 36:35:34,800
câte cam 300 de mostre cred

49068
36:35:32,800 --> 36:35:37,280
nu? Deci toate cele 300 de mostre care există

49069
36:35:34,800 --> 36:35:39,032
300 de valori aici. Fiecare dintre ele

49070
36:35:37,280 --> 36:35:42,160
este dat numărul clusterului și clusterul

49071
36:35:39,032 --> 36:35:44,160
numărul merge de la 0 la trei. Deci acolo

49072
36:35:42,160 --> 36:35:48,232
sunt patru clustere. Deci numerele merg

49073
36:35:44,160 --> 36:35:50,488
de la 0 1 2 3. Deci asta se vede

49074
36:35:48,232 --> 36:35:53,200
aici. Bine. Acum, deci asta a fost rapid

49075
36:35:50,488 --> 36:35:56,160
exemplu de generare a unor date fictive

49076
36:35:53,200 --> 36:35:57,920
și apoi gruparea asta. Bine. Și asta

49077
36:35:56,160 --> 36:36:00,232
poate fi aplicat dacă aveți date adecvate.

49078
36:35:57,920 --> 36:36:03,280
Puteți să-l încărcați în X pentru

49079
36:36:00,232 --> 36:36:05,280
exemplu aici și apoi rulați K. Deci asta

49080
36:36:03,280 --> 36:36:07,592
este partea centrală a mijloacelor K

49081
36:36:05,280 --> 36:36:10,312
exemplu de program de grupare. Deci tu

49082
36:36:07,592 --> 36:36:12,488
practic creează o instanță și tu

49083
36:36:10,312 --> 36:36:15,360
menționați de câte grupuri doriți

49084
36:36:12,488 --> 36:36:17,512
specificând acest parametru n_clusters și

49085
36:36:15,360 --> 36:36:20,160
aceasta este și valoarea lui k și apoi

49086
36:36:17,512 --> 36:36:23,512
transmiteți datele pentru a obține valorile. Acum, cel

49087
36:36:20,160 --> 36:36:26,800
următoarea secțiune a acestui cod este

49088
36:36:23,512 --> 36:36:29,592
implementarea unui k mijloace. Acum asta este

49089
36:36:26,800 --> 36:36:32,160
un fel de implementare brută a

49090
36:36:29,592 --> 36:36:33,592
k înseamnă algoritm. Deci ne vom plimba

49091
36:36:32,160 --> 36:36:36,312
prin tine te voi ghida prin

49092
36:36:33,592 --> 36:36:38,312
codificați la fiecare pas ceea ce face

49093
36:36:36,312 --> 36:36:41,512
și apoi vom mai vedea câteva

49094
36:36:38,312 --> 36:36:44,392
exemple de modul în care K înseamnă gruparea poate

49095
36:36:41,512 --> 36:36:46,392
poate fi folosit în unele exemple din viața reală

49096
36:36:44,392 --> 36:36:48,640
cazuri de utilizare din viața reală. În regulă. Deci in

49097
36:36:46,392 --> 36:36:51,360
acest caz aici este ceea ce facem noi

49098
36:36:48,640 --> 36:36:55,032
practic implementând K mijloace

49099
36:36:51,360 --> 36:36:58,488
clustering și există o funcție sau a

49100
36:36:55,032 --> 36:37:01,672
biblioteca calculează pentru două perechi date

49101
36:36:58,488 --> 36:37:03,672
de puncte se va calcula

49102
36:37:01,672 --> 36:37:05,592
distanta dintre ele si vezi care dintre ele

49103
36:37:03,672 --> 36:37:07,512
este cel mai apropiat și așa mai departe. Deci asta este

49104
36:37:05,592 --> 36:37:09,592
așa seamănă cu ceea ce K

49105
36:37:07,512 --> 36:37:12,488
înseamnă că face bine. Deci calculează

49106
36:37:09,592 --> 36:37:15,752
distanța fiecărui punct sau a fiecărui set de date

49107
36:37:12,488 --> 36:37:17,512
din centroid predefinit și apoi bazat

49108
36:37:15,752 --> 36:37:19,280
pe care este cel mai jos acest lucru

49109
36:37:17,512 --> 36:37:21,512
unui anumit punct de date este alocat

49110
36:37:19,280 --> 36:37:23,672
acel centroid. Deci asta este practic

49111
36:37:21,512 --> 36:37:26,392
disponibil ca o funcție standard și noi

49112
36:37:23,672 --> 36:37:28,872
îl va folosi aici. Așa cum s-a explicat

49113
36:37:26,392 --> 36:37:32,640
în diapozitive primul pas adică

49114
36:37:28,872 --> 36:37:37,360
făcut în cazul C înseamnă că gruparea este să

49115
36:37:32,640 --> 36:37:40,232
alocați aleatoriu niște centride. Deci ca a

49116
36:37:37,360 --> 36:37:42,720
primul pas alocăm aleatoriu un cuplu

49117
36:37:40,232 --> 36:37:44,800
de centrizi pe care îi numim aici suntem

49118
36:37:42,720 --> 36:37:47,840
apelând ca centre

49119
36:37:44,800 --> 36:37:50,872
și apoi punem asta într-o buclă și noi

49120
36:37:47,840 --> 36:37:53,360
trece printr-un proces iterativ.

49121
36:37:50,872 --> 36:37:55,752
Pentru fiecare dintre punctele de date, mai întâi

49122
36:37:53,360 --> 36:37:57,920
aflați folosind această funcție în perechi

49123
36:37:55,752 --> 36:38:00,232
argument de distanță. Pentru fiecare dintre

49124
36:37:57,920 --> 36:38:02,488
puncte, aflăm care dintre ele care

49125
36:38:00,232 --> 36:38:06,312
centru sau care uh aleatoriu

49126
36:38:02,488 --> 36:38:10,080
centrid este cel mai apropiat și în consecință

49127
36:38:06,312 --> 36:38:13,592
atribuim acele date sau punct de date

49128
36:38:10,080 --> 36:38:16,000
acel centrid sau cluster anume. Şi

49129
36:38:13,592 --> 36:38:20,160
odată ce este făcut pentru toate datele

49130
36:38:16,000 --> 36:38:22,000
puncte, calculăm noul centr prin

49131
36:38:20,160 --> 36:38:24,232
aflarea poziţiei medii cu

49132
36:38:22,000 --> 36:38:26,872
pozitia centrala. Corect? Deci noi

49133
36:38:24,232 --> 36:38:29,672
calculați noul centroid și apoi noi

49134
36:38:26,872 --> 36:38:32,488
verificați dacă noul centroid este

49135
36:38:29,672 --> 36:38:35,672
coordonatele sau poziția este aceeași

49136
36:38:32,488 --> 36:38:39,280
ca centroidul anterior. Pozițiile

49137
36:38:35,672 --> 36:38:42,560
vom compara si daca este la fel

49138
36:38:39,280 --> 36:38:44,488
asta înseamnă că procesul a convergit. Deci

49139
36:38:42,560 --> 36:38:46,800
amintiți-vă că facem acest proces până la

49140
36:38:44,488 --> 36:38:48,952
centroizii sau centridul nu se mișcă

49141
36:38:46,800 --> 36:38:52,080
mai corect, astfel încât centroidul devine

49142
36:38:48,952 --> 36:38:55,280
relocate de fiecare dată când această realocare este

49143
36:38:52,080 --> 36:38:57,440
făcut așa în momentul în care nu se schimbă

49144
36:38:55,280 --> 36:38:59,840
nu mai poziția centului

49145
36:38:57,440 --> 36:39:01,512
schimbarea mai știm acea convergență

49146
36:38:59,840 --> 36:39:03,512
s-a întâmplat așa până atunci, așa vezi

49147
36:39:01,512 --> 36:39:06,560
aici aceasta este ca o buclă infinită while

49148
36:39:03,512 --> 36:39:09,200
adevărat este o buclă infinită pe care doar o rupe

49149
36:39:06,560 --> 36:39:11,672
când centrele sunt aceleași noul

49150
36:39:09,200 --> 36:39:14,640
pozițiile de centru și centru vechi sunt

49151
36:39:11,672 --> 36:39:16,560
nume și odată ce s-a terminat uh noi

49152
36:39:14,640 --> 36:39:18,800
returnați centrele și etichetele. Acum

49153
36:39:16,560 --> 36:39:20,640
desigur, după cum s-a explicat, acesta nu este un

49154
36:39:18,800 --> 36:39:22,872
foarte sofisticat și avansat

49155
36:39:20,640 --> 36:39:24,952
implementare implementare foarte de bază

49156
36:39:22,872 --> 36:39:27,512
pentru că unul dintre defectele acestui lucru este că

49157
36:39:24,952 --> 36:39:31,512
uneori ceea ce se întâmplă este centroidul

49158
36:39:27,512 --> 36:39:33,752
pozitia se va continua in miscare dar in

49159
36:39:31,512 --> 36:39:36,872
schimbarea va fi foarte minoră. Deci în asta

49160
36:39:33,752 --> 36:39:39,920
caz, de asemenea, care este de fapt convergență

49161
36:39:36,872 --> 36:39:41,920
corect. Deci, de exemplu, modificarea este 0,1

49162
36:39:39,920 --> 36:39:43,752
putem considera că convergenţă

49163
36:39:41,920 --> 36:39:46,232
altfel ceea ce se va întâmpla este această voință

49164
36:39:43,752 --> 36:39:48,872
fie durează pentru totdeauna, fie nu va fi niciodată

49165
36:39:46,232 --> 36:39:50,872
sfârşit. Deci e un mic defect aici. Deci

49166
36:39:48,872 --> 36:39:52,560
asta este ceva ce pot fi verificate suplimentare

49167
36:39:50,872 --> 36:39:54,312
trebuie adăugate aici. Dar din nou ca

49168
36:39:52,560 --> 36:39:57,112
a menționat că acest lucru nu este cel mai mult

49169
36:39:54,312 --> 36:39:59,672
implementare sofisticată. Aceasta este

49170
36:39:57,112 --> 36:40:02,312
ca un fel de implementare brută a

49171
36:39:59,672 --> 36:40:05,200
k înseamnă grupare. Bine. Deci dacă noi

49172
36:40:02,312 --> 36:40:07,752
executați acest cod, acesta este ceea ce obținem

49173
36:40:05,200 --> 36:40:10,640
ieșirea. Deci aceasta este definiția

49174
36:40:07,752 --> 36:40:13,512
această funcție anume și apoi noi

49175
36:40:10,640 --> 36:40:15,752
numiți asta find_clusters și trecem de noi

49176
36:40:13,512 --> 36:40:19,360
datele x și numărul de clustere care

49177
36:40:15,752 --> 36:40:21,360
este patru și dacă vom rula asta și o complotăm

49178
36:40:19,360 --> 36:40:23,280
aceasta este rezultatul pe care îl obținem. Deci asta

49179
36:40:21,360 --> 36:40:25,592
este, desigur, fiecare cluster este reprezentat

49180
36:40:23,280 --> 36:40:27,592
printr-o culoare diferită. Deci avem un

49181
36:40:25,592 --> 36:40:30,080
ciorchine în culoarea verde, culoarea galbenă și

49182
36:40:27,592 --> 36:40:32,080
așa mai departe și așa mai departe. Și aceste puncte mari

49183
36:40:30,080 --> 36:40:33,592
aici acestea sunt centroidele este

49184
36:40:32,080 --> 36:40:35,840
poziţia finală a centroididelor. Şi

49185
36:40:33,592 --> 36:40:38,720
după cum puteți vedea vizual și asta

49186
36:40:35,840 --> 36:40:41,440
apare ca un fel de centru al tuturor

49187
36:40:38,720 --> 36:40:43,440
aceste puncte aici. Corect? La fel și asta

49188
36:40:41,440 --> 36:40:46,232
este ca centrul tuturor acestor puncte

49189
36:40:43,440 --> 36:40:47,752
aici și așa mai departe. Deci acesta este exemplul

49190
36:40:46,232 --> 36:40:52,000
sau acesta este un exemplu de a

49191
36:40:47,752 --> 36:40:54,720
implementarea lui K înseamnă grupare și

49192
36:40:52,000 --> 36:40:58,488
uh în continuare vom trece să vedem un cuplu

49193
36:40:54,720 --> 36:41:01,592
de exemple despre modul în care K înseamnă clustering

49194
36:40:58,488 --> 36:41:04,800
folosit în unele scenarii din viața reală

49195
36:41:01,592 --> 36:41:07,840
sau cazuri de utilizare. În exemplul următor sau

49196
36:41:04,800 --> 36:41:10,640
demo, vom vedea cum putem folosi

49197
36:41:07,840 --> 36:41:12,800
K înseamnă grupare pentru a realiza culoarea

49198
36:41:10,640 --> 36:41:15,440
compresie. Vom lua câteva

49199
36:41:12,800 --> 36:41:18,560
imagini. Deci vor fi două exemple

49200
36:41:15,440 --> 36:41:21,200
și vom încerca să folosim mijloacele C

49201
36:41:18,560 --> 36:41:23,920
gruparea pentru a comprima culorile. Aceasta

49202
36:41:21,200 --> 36:41:26,800
este o situație comună în imagine

49203
36:41:23,920 --> 36:41:29,440
procesare când ai o imagine cu

49204
36:41:26,800 --> 36:41:32,000
milioane de culori, dar apoi tu

49205
36:41:29,440 --> 36:41:34,000
nu o poate reda pe unele dispozitive care

49206
36:41:32,000 --> 36:41:36,312
este posibil să nu aibă suficientă memorie. Uh, așa că

49207
36:41:34,000 --> 36:41:40,560
este scenariul în care ceva

49208
36:41:36,312 --> 36:41:43,200
astfel se poate folosi. Deci înainte din nou

49209
36:41:40,560 --> 36:41:46,488
intrăm în caietul Python hai

49210
36:41:43,200 --> 36:41:49,360
aruncați o privire rapid la cod. Ca

49211
36:41:46,488 --> 36:41:53,440
de obicei importăm bibliotecile și apoi

49212
36:41:49,360 --> 36:41:55,512
importăm imaginea și atunci o facem

49213
36:41:53,440 --> 36:41:58,952
aplatiza-l. Deci remodelarea este

49214
36:41:55,512 --> 36:42:02,488
practic avem informații despre imagine

49215
36:41:58,952 --> 36:42:05,672
este stocat sub formă de pixeli și uh

49216
36:42:02,488 --> 36:42:08,488
dacă imaginea este ca de exemplu 427x

49217
36:42:05,672 --> 36:42:12,000
640 și are trei culori. Deci asta e

49218
36:42:08,488 --> 36:42:16,080
dimensiunea de ansamblu a

49219
36:42:12,000 --> 36:42:20,232
imaginea inițială. doar o remodelăm și um

49220
36:42:16,080 --> 36:42:23,840
apoi transmiteți acest lucru la algoritmul nostru și acesta

49221
36:42:20,232 --> 36:42:26,312
va crea apoi clustere de numai 16

49222
36:42:23,840 --> 36:42:29,280
clustere. Deci aceste culori există

49223
36:42:26,312 --> 36:42:32,488
milioane de culori și acum trebuie

49224
36:42:29,280 --> 36:42:36,232
reduceți-l la 16 culori. Deci folosim k

49225
36:42:32,488 --> 36:42:37,840
este egal cu 16 și u așa este atunci când noi

49226
36:42:36,232 --> 36:42:40,160
vizualizați așa arată. Acolo

49227
36:42:37,840 --> 36:42:42,560
acestea sunt toate aproximativ 16 milioane

49228
36:42:40,160 --> 36:42:46,000
culori posibile. Spațiul de culoare de intrare

49229
36:42:42,560 --> 36:42:49,840
are 16 milioane de culori posibile și noi

49230
36:42:46,000 --> 36:42:51,360
doar subcomprimați-l la 16 culori. Deci

49231
36:42:49,840 --> 36:42:54,392
asa ar arata cand noi

49232
36:42:51,360 --> 36:42:57,840
comprimați-l la 16 culori. Și aceasta este

49233
36:42:54,392 --> 36:43:00,872
cum arată imaginea originală. Și după

49234
36:42:57,840 --> 36:43:02,872
compresie la 16 culori, așa este

49235
36:43:00,872 --> 36:43:06,160
arata noua imagine. După cum puteți vedea,

49236
36:43:02,872 --> 36:43:10,232
nu există prea multe informații care

49237
36:43:06,160 --> 36:43:14,392
a fost pierdut. deși calitatea imaginii

49238
36:43:10,232 --> 36:43:16,720
cu siguranta se reduce putin. Deci

49239
36:43:14,392 --> 36:43:19,440
acesta este un exemplu pe care vom merge

49240
36:43:16,720 --> 36:43:22,160
vezi acum în caietul Python. Să mergem

49241
36:43:19,440 --> 36:43:25,512
în Python și încă o dată ca întotdeauna

49242
36:43:22,160 --> 36:43:29,200
vom importa câteva biblioteci și vom încărca

49243
36:43:25,512 --> 36:43:31,840
această imagine numită floare.jpg.

49244
36:43:29,200 --> 36:43:34,800
Bine. Deci hai să încărcăm asta și asta este

49245
36:43:31,840 --> 36:43:38,080
cum arată. Aceasta este imaginea originală

49246
36:43:34,800 --> 36:43:40,488
care are cred că 16 milioane de culori și

49247
36:43:38,080 --> 36:43:42,872
uh, aceasta este forma acestei imagini care

49248
36:43:40,488 --> 36:43:45,360
este practic ceea ce este forma

49249
36:43:42,872 --> 36:43:49,592
nimic altceva decât dimensiunea generală exact așa

49250
36:43:45,360 --> 36:43:51,200
acesta este 427 pixeli pe 640 pixeli și apoi

49251
36:43:49,592 --> 36:43:53,592
sunt trei straturi care este acesta

49252
36:43:51,200 --> 36:43:56,000
trei este practic pentru RGB, care este roșu

49253
36:43:53,592 --> 36:43:58,720
verde albastru, așa că imaginea color va avea asta

49254
36:43:56,000 --> 36:44:01,592
corect, așa că aceasta este forma asta acum

49255
36:43:58,720 --> 36:44:03,920
ceea ce trebuie să facem este să luăm date a

49256
36:44:01,592 --> 36:44:07,360
uite cum arată datele. Așa că lasă-mă

49257
36:44:03,920 --> 36:44:09,592
creează o celulă nouă și îți arată ce

49258
36:44:07,360 --> 36:44:12,560
este în date. Practic am capturat

49259
36:44:09,592 --> 36:44:14,640
aceste informații.

49260
36:44:12,560 --> 36:44:17,640
Deci ce sunt datele? Lasă-mă doar să-ți arăt

49261
36:44:14,640 --> 36:44:17,640
aici.

49262
36:44:18,640 --> 36:44:25,032
În regulă. Deci haideți să aruncăm o privire la

49263
36:44:21,512 --> 36:44:27,200
China. Care sunt valorile în China? Şi

49264
36:44:25,032 --> 36:44:29,840
uh, dacă vezi aici, așa sunt datele

49265
36:44:27,200 --> 36:44:32,952
este stocat. Acesta nu este altceva decât pixelul

49266
36:44:29,840 --> 36:44:36,640
valorile. Bine? Deci aceasta este ca o matrice

49267
36:44:32,952 --> 36:44:39,032
și fiecare are aproximativ pentru pentru acest 427x

49268
36:44:36,640 --> 36:44:40,952
640 pixeli. În regulă. Deci așa este

49269
36:44:39,032 --> 36:44:44,080
arata. Acum problema aici sunt acestea

49270
36:44:40,952 --> 36:44:46,872
valorile sunt mari. Cifrele sunt mari.

49271
36:44:44,080 --> 36:44:49,752
Așa că trebuie să le normalizăm între ele

49272
36:44:46,872 --> 36:44:52,000
0 și unu. Corect? Deci de aceea vom face

49273
36:44:49,752 --> 36:44:54,312
practic creează încă o variabilă care

49274
36:44:52,000 --> 36:44:56,080
sunt date care vor conține valorile

49275
36:44:54,312 --> 36:44:59,512
intre 0 si unu. Și modul de a face

49276
36:44:56,080 --> 36:45:02,720
adică împărțim la 255. Deci împărțim

49277
36:44:59,512 --> 36:45:05,032
China până în 255 și obținem noile valori

49278
36:45:02,720 --> 36:45:08,392
în date. Deci hai să rulăm această bucată

49279
36:45:05,032 --> 36:45:10,560
de cod și aceasta este forma. Deci noi acum

49280
36:45:08,392 --> 36:45:13,672
am, de asemenea, da, ceea ce am făcut este noi

49281
36:45:10,560 --> 36:45:15,592
schimbat folosind remodelarea în care am convertit

49282
36:45:13,672 --> 36:45:18,232
tridimensionalul într-o

49283
36:45:15,592 --> 36:45:21,200
set de date bidimensionale. Și lasă-ne

49284
36:45:18,232 --> 36:45:24,000
arunca o privire si cum

49285
36:45:21,200 --> 36:45:27,280
lasa-ma doar sa inserez

49286
36:45:24,000 --> 36:45:29,112
probabil o celulă aici și aruncați o privire la

49287
36:45:27,280 --> 36:45:31,440
cum arată datele. În regulă. Deci asta

49288
36:45:29,112 --> 36:45:34,160
așa arată datele și acum vedeți

49289
36:45:31,440 --> 36:45:36,392
aceasta este valorile sunt între 0 și

49290
36:45:34,160 --> 36:45:38,312
unul. Corect? Deci, dacă ați observat mai devreme în

49291
36:45:36,392 --> 36:45:40,952
în cazul Chinei valorile au fost mari

49292
36:45:38,312 --> 36:45:42,640
numere. Acum totul este între 0 și

49293
36:45:40,952 --> 36:45:45,512
unul. Acesta este unul dintre lucrurile de care avem nevoie

49294
36:45:42,640 --> 36:45:47,592
a face. În regulă. Deci după aceea următoarea

49295
36:45:45,512 --> 36:45:51,032
lucru pe care trebuie să-l facem este să vizualizăm

49296
36:45:47,592 --> 36:45:54,640
asta și uh putem lua un set aleatoriu de

49297
36:45:51,032 --> 36:45:57,280
poate 10.000 de puncte și trasează-l și

49298
36:45:54,640 --> 36:46:00,640
verifica si vezi cum arata asta. Așa că haideți

49299
36:45:57,280 --> 36:46:02,872
doar complotează asta și uh așa că așa este

49300
36:46:00,640 --> 36:46:05,032
original culoarea pixelului

49301
36:46:02,872 --> 36:46:07,200
distributia este. Acestea sunt două parcele unul

49302
36:46:05,032 --> 36:46:09,440
este roșu împotriva verde și altul este roșu

49303
36:46:07,200 --> 36:46:11,512
contra albastru și acesta este originalul

49304
36:46:09,440 --> 36:46:13,920
distributia culorii. Atunci ce

49305
36:46:11,512 --> 36:46:17,512
vom face este că vom folosi K mijloace

49306
36:46:13,920 --> 36:46:20,232
clustering pentru a crea doar 16 clustere

49307
36:46:17,512 --> 36:46:23,032
pentru diferitele culori și apoi aplicați

49308
36:46:20,232 --> 36:46:25,032
că la imagine. Acum ce se va întâmpla

49309
36:46:23,032 --> 36:46:27,840
este deoarece datele sunt mari pentru că acolo

49310
36:46:25,032 --> 36:46:30,160
sunt milioane de culori folosind K obișnuit

49311
36:46:27,840 --> 36:46:32,160
înseamnă poate consuma puțin timp. Deci

49312
36:46:30,160 --> 36:46:34,952
există o altă versiune a K înseamnă

49313
36:46:32,160 --> 36:46:36,720
care se numește mini lot K înseamnă. Deci

49314
36:46:34,952 --> 36:46:39,280
vom folosi ceea ce este care

49315
36:46:36,720 --> 36:46:41,920
procesele în conceptul general rămâne

49316
36:46:39,280 --> 36:46:43,752
la fel, dar asta practic o prelucrează

49317
36:46:41,920 --> 36:46:45,592
în loturi mai mici. Asta e singurul

49318
36:46:43,752 --> 36:46:48,872
lucru. Bine. Deci rezultatele vor fi frumoase

49319
36:46:45,592 --> 36:46:51,360
mult să fie la fel. Deci hai să mergem înainte și

49320
36:46:48,872 --> 36:46:53,440
executați această bucată de cod și, de asemenea

49321
36:46:51,360 --> 36:46:56,312
vizualizați asta astfel încât să putem vedea asta

49322
36:46:53,440 --> 36:46:58,640
sunt așa cele 16 culori

49323
36:46:56,312 --> 36:47:01,360
uh ar uita. Deci, acesta este roșu împotriva

49324
36:46:58,640 --> 36:47:03,440
verde și acesta este roșu față de albastru.

49325
36:47:01,360 --> 36:47:06,160
există destul de multă asemănare

49326
36:47:03,440 --> 36:47:08,488
între această schemă originală de culori şi

49327
36:47:06,160 --> 36:47:10,488
cel nou. Corect? Deci nu arata

49328
36:47:08,488 --> 36:47:12,872
foarte foarte complet diferit sau

49329
36:47:10,488 --> 36:47:16,232
ceva de genul asta. Acum aplicăm asta

49330
36:47:12,872 --> 36:47:18,952
culorile nou create la imagine

49331
36:47:16,232 --> 36:47:20,952
și uh putem arunca o privire uh cum este asta

49332
36:47:18,952 --> 36:47:23,280
uh caut. Acum le putem compara pe ambele

49333
36:47:20,952 --> 36:47:25,752
imagini. Deci aceasta este imaginea noastră originală

49334
36:47:23,280 --> 36:47:28,488
și aceasta este noua noastră imagine. Așa cum poți

49335
36:47:25,752 --> 36:47:31,512
vezi ca nu sunt prea multe informatii

49336
36:47:28,488 --> 36:47:34,560
care s-a pierdut. uh cam mult

49337
36:47:31,512 --> 36:47:36,872
arata ca imaginea originala. Da, noi

49338
36:47:34,560 --> 36:47:39,032
se poate vedea că de exemplu aici există o

49339
36:47:36,872 --> 36:47:41,280
putin uh pare putin

49340
36:47:39,032 --> 36:47:43,512
plictisitor în comparație cu acesta corect

49341
36:47:41,280 --> 36:47:47,112
pentru că am cam scos o parte din

49342
36:47:43,512 --> 36:47:50,000
detaliile mai fine ale culorii dar

49343
36:47:47,112 --> 36:47:52,232
în ansamblu, informațiile de vârf au fost

49344
36:47:50,000 --> 36:47:54,312
menţinută. În același timp, principalul

49345
36:47:52,232 --> 36:47:57,032
avantajul este că acum asta poate fi asta

49346
36:47:54,312 --> 36:47:59,592
este o imagine care poate fi redată pe o

49347
36:47:57,032 --> 36:48:01,920
dispozitiv care poate să nu fie chiar așa

49348
36:47:59,592 --> 36:48:04,232
sofisticat. Acum să mai luăm unul

49349
36:48:01,920 --> 36:48:06,952
exemplu cu o imagine diferită. În

49350
36:48:04,232 --> 36:48:10,000
al doilea exemplu, vom lua o imagine a

49351
36:48:06,952 --> 36:48:12,640
palatul de vară din China și repetăm

49352
36:48:10,000 --> 36:48:15,440
acelasi proces. Acesta este un mare

49353
36:48:12,640 --> 36:48:19,592
imagine color de definiție cu milioane de

49354
36:48:15,440 --> 36:48:22,312
culori și, de asemenea, tridimensional.

49355
36:48:19,592 --> 36:48:26,160
Acum o vom reduce la 16 culori

49356
36:48:22,312 --> 36:48:28,560
folosirea K înseamnă grupare. Și facem

49357
36:48:26,160 --> 36:48:32,800
același proces ca înainte. Ne remodelăm

49358
36:48:28,560 --> 36:48:36,160
și apoi grupăm culorile la 16

49359
36:48:32,800 --> 36:48:38,488
și apoi redăm imaginea încă o dată.

49360
36:48:36,160 --> 36:48:41,032
Și vom vedea că culoarea

49361
36:48:38,488 --> 36:48:43,440
calitatea imaginii este ușor

49362
36:48:41,032 --> 36:48:46,800
se deteriorează. După cum puteți vedea aici, asta

49363
36:48:43,440 --> 36:48:48,872
are detalii mult mai fine în aceasta care sunt

49364
36:48:46,800 --> 36:48:50,952
probabil lipsește aici. Dar atunci asta e

49365
36:48:48,872 --> 36:48:53,840
compromisul pentru că sunt unele

49366
36:48:50,952 --> 36:48:56,872
dispozitive care ar putea să nu poată fi manevrate

49367
36:48:53,840 --> 36:49:00,080
acest tip de imagini de înaltă densitate. Deci

49368
36:48:56,872 --> 36:49:02,080
hai să rulăm acest cod în blocnotesul Python.

49369
36:49:00,080 --> 36:49:04,720
În regulă. Deci hai sa aplicam acelasi lucru

49370
36:49:02,080 --> 36:49:08,488
tehnică pentru o altă imagine care este

49371
36:49:04,720 --> 36:49:11,752
uh chiar mai complicat și are, probabil

49372
36:49:08,488 --> 36:49:14,000
schema de culori mult complicata. Deci asta

49373
36:49:11,752 --> 36:49:17,672
este imaginea. Acum încă o dată putem

49374
36:49:14,000 --> 36:49:19,840
uitați-vă la forma care este de 427x

49375
36:49:17,672 --> 36:49:22,160
640x3

49376
36:49:19,840 --> 36:49:24,000
și acestea sunt noile date ar arăta

49377
36:49:22,160 --> 36:49:27,032
oarecum așa în comparație cu

49378
36:49:24,000 --> 36:49:31,112
imaginea florii. Deci avem niște valori noi

49379
36:49:27,032 --> 36:49:33,440
aici și vom aduce și asta ca tine

49380
36:49:31,112 --> 36:49:36,800
se poate vedea că numerele sunt mult mai mari. Deci noi

49381
36:49:33,440 --> 36:49:39,280
va mult mai mare, așa că acum va trebui

49382
36:49:36,800 --> 36:49:41,920
scalați-le la valori între 0 și

49383
36:49:39,280 --> 36:49:46,232
unul. Și asta se face prin împărțirea la

49384
36:49:41,920 --> 36:49:49,840
255. Deci hai să mergem mai departe și să facem asta

49385
36:49:46,232 --> 36:49:53,440
și remodelați-l. Bine. Așa că obținem un

49386
36:49:49,840 --> 36:49:55,280
matrice bidimensională și vom face

49387
36:49:53,440 --> 36:49:58,080
apoi ca pas următor vom merge înainte

49388
36:49:55,280 --> 36:50:01,512
și vizualizați așa cum arată

49389
36:49:58,080 --> 36:50:05,592
16 culori și practic așa este

49390
36:50:01,512 --> 36:50:09,920
ar arăta în 16 milioane de culori. Și acum noi

49391
36:50:05,592 --> 36:50:13,440
pot crea clustere din aceasta. The

49392
36:50:09,920 --> 36:50:15,592
16 K înseamnă clustere pe care le vom crea. Deci

49393
36:50:13,440 --> 36:50:19,032
asa este distributia

49394
36:50:15,592 --> 36:50:23,360
pixelii ar arăta cu 16 culori. Şi

49395
36:50:19,032 --> 36:50:26,952
apoi mergem înainte și aplicăm asta și

49396
36:50:23,360 --> 36:50:29,592
vizualizați cum se caută cu

49397
36:50:26,952 --> 36:50:32,640
cu noul doar 16 culori. Deci odata

49398
36:50:29,592 --> 36:50:35,672
din nou, după cum puteți vedea, asta arată mult

49399
36:50:32,640 --> 36:50:38,232
mai bogat în culoare, dar în același timp,

49400
36:50:35,672 --> 36:50:40,720
și asta probabil că nu are, ca noi

49401
36:50:38,232 --> 36:50:42,872
pot vedea, nu pare atât de bogat ca acesta

49402
36:50:40,720 --> 36:50:44,872
una, dar cu toate acestea, informația

49403
36:50:42,872 --> 36:50:47,672
nu se pierde, forma și toate astea

49404
36:50:44,872 --> 36:50:51,360
chestii. Și acest lucru poate fi redat și pe

49405
36:50:47,672 --> 36:50:54,560
un dispozitiv ușor, care este probabil

49406
36:50:51,360 --> 36:50:56,392
nu atât de sofisticat. Bine, deci asta e

49407
36:50:54,560 --> 36:50:59,200
cam asta. Deci am văzut două

49408
36:50:56,392 --> 36:51:03,032
exemple despre cum poate fi compresia culorilor

49409
36:50:59,200 --> 36:51:05,840
făcut uh folosind K înseamnă grupare și noi

49410
36:51:03,032 --> 36:51:08,488
am văzut și în exemplele anterioare

49411
36:51:05,840 --> 36:51:10,800
despre cum să implementezi C înseamnă codul pentru

49412
36:51:08,488 --> 36:51:13,672
aproximativ modul de implementare a mijloacelor C

49413
36:51:10,800 --> 36:51:17,672
clustering și folosim câteva date eșantion

49414
36:51:13,672 --> 36:51:20,000
folosind blob pentru a executa doar mijloacele C

49415
36:51:17,672 --> 36:51:21,920
cluster care are loc după date

49416
36:51:20,000 --> 36:51:24,160
colectare şi înainte de statistică

49417
36:51:21,920 --> 36:51:26,872
analiza. Deci, înainte de a conduce vreunul

49418
36:51:24,160 --> 36:51:30,080
formule statistice și analize pe

49419
36:51:26,872 --> 36:51:32,160
date și stoarceți datele pentru a le extrage

49420
36:51:30,080 --> 36:51:34,080
câteva informații valoroase, procesul

49421
36:51:32,160 --> 36:51:36,800
pe care o executați se numește inițială

49422
36:51:34,080 --> 36:51:38,872
analiza datelor. Ca să luăm datele de la

49423
36:51:36,800 --> 36:51:40,872
sursa, curățarea datelor,

49424
36:51:38,872 --> 36:51:44,160
transformând datele într-o lizibilă

49425
36:51:40,872 --> 36:51:46,952
format și folosind acele date care pot fi citite

49426
36:51:44,160 --> 36:51:49,200
construiți niște diagrame de bază ce este exact

49427
36:51:46,952 --> 36:51:51,440
se întâmplă cu această companie anume,

49428
36:51:49,200 --> 36:51:53,360
marca sau orice altceva. Să zicem că îți dau

49429
36:51:51,440 --> 36:51:55,752
unele date de la companie. Atunci primești

49430
36:51:53,360 --> 36:51:57,752
unele perspective ale acesteia. Câte număr de

49431
36:51:55,752 --> 36:51:59,840
trafic pe care l-ai primit? Câte număr de

49432
36:51:57,752 --> 36:52:01,840
comenzile primite? Care este vânzarea

49433
36:51:59,840 --> 36:52:04,160
pe care le-ați făcut într-o anumită lună,

49434
36:52:01,840 --> 36:52:06,000
un anumit trimestru sau anume an? Şi

49435
36:52:04,160 --> 36:52:08,080
care a fost profitul? Atât de bază

49436
36:52:06,000 --> 36:52:10,720
informațiile pe care le convertiți din

49437
36:52:08,080 --> 36:52:14,080
date și creați un tablou de bord. Corect? Asta

49438
36:52:10,720 --> 36:52:16,488
se numește analiza inițială a datelor. Deci a

49439
36:52:14,080 --> 36:52:19,032
pas dincolo de analiza inițială a datelor este

49440
36:52:16,488 --> 36:52:20,560
cunoscut sub numele de analiza exploratorie a datelor.

49441
36:52:19,032 --> 36:52:23,032
Aici executați câteva

49442
36:52:20,560 --> 36:52:25,512
statistici și probabilitate și prezice

49443
36:52:23,032 --> 36:52:28,160
viitorul. Corect? Deci haideți să ne scufundăm adânc

49444
36:52:25,512 --> 36:52:30,232
și învață ce este exact exploratoriu

49445
36:52:28,160 --> 36:52:32,232
analiza datelor. Deci o definiție simplă

49446
36:52:30,232 --> 36:52:35,360
pentru analiza exploratorie a datelor este ca

49447
36:52:32,232 --> 36:52:38,000
urmează. Analiza exploratorie a datelor este a

49448
36:52:35,360 --> 36:52:40,640
pas cheie în procesul de analiză a datelor care

49449
36:52:38,000 --> 36:52:43,512
vă ajută să identificați modele, contururi

49450
36:52:40,640 --> 36:52:46,000
și relațiile dintre variabile

49451
36:52:43,512 --> 36:52:47,752
înainte de a face presupuneri. Nu este

49452
36:52:46,000 --> 36:52:49,512
ca și cum ai crea un tablou de bord din

49453
36:52:47,752 --> 36:52:51,840
analiza inițială a datelor și puteți

49454
36:52:49,512 --> 36:52:53,672
prezice viitorul. Nu, nu este ca

49455
36:52:51,840 --> 36:52:55,672
că. S-ar putea să trebuiască să reziste. S-ar putea

49456
36:52:53,672 --> 36:52:57,752
trebuie să treacă prin nişte permutări şi

49457
36:52:55,672 --> 36:52:59,512
combinatii. S-ar putea să trebuiască să verificați

49458
36:52:57,752 --> 36:53:02,560
anotimpurile. S-ar putea să trebuiască să verificați

49459
36:52:59,512 --> 36:53:04,488
posibilitati, nu? Pe parcursul unora

49460
36:53:02,560 --> 36:53:06,800
anumite anotimpuri ale anului, haideți

49461
36:53:04,488 --> 36:53:09,360
spune că e Crăciun, atunci te poți aștepta

49462
36:53:06,800 --> 36:53:11,840
niste vanzari bune. Să zicem că sunt unele

49463
36:53:09,360 --> 36:53:13,840
festival, este o ocazie specială,

49464
36:53:11,840 --> 36:53:16,392
vă puteți aștepta la niște vânzări bune pe

49465
36:53:13,840 --> 36:53:19,592
produs, nu? și poate o parte din

49466
36:53:16,392 --> 36:53:21,440
an, poate o parte din 10 ani, a

49467
36:53:19,592 --> 36:53:23,840
deceniu, nu? Într-o anumită perioadă de

49468
36:53:21,440 --> 36:53:26,312
timp, ar putea exista un motiv din cauza

49469
36:53:23,840 --> 36:53:29,032
care vânzările unui anumit produs

49470
36:53:26,312 --> 36:53:31,280
erau ridicate. Deci, pentru a vă asigura că dvs

49471
36:53:29,032 --> 36:53:34,080
presupuneri pentru a vă asigura că dvs

49472
36:53:31,280 --> 36:53:37,920
proiecția vânzărilor este 100% corectă

49473
36:53:34,080 --> 36:53:39,672
sau cel puțin 90 până la 95% exacte atunci tu

49474
36:53:37,920 --> 36:53:42,000
ar putea fi nevoit să treacă prin explorare

49475
36:53:39,672 --> 36:53:45,200
analiza datelor de unde utilizați

49476
36:53:42,000 --> 36:53:46,872
statistici în analiza datelor dvs. Acum

49477
36:53:45,200 --> 36:53:48,800
există anumiți pași pe care îi puteți

49478
36:53:46,872 --> 36:53:51,512
trebuie să urmeze în timp ce treci prin

49479
36:53:48,800 --> 36:53:54,640
analiza exploratorie a datelor. Deci urmeaza

49480
36:53:51,512 --> 36:53:57,280
sunt pașii. Deci primii pași

49481
36:53:54,640 --> 36:53:59,200
ar putea fi ușor relevant pentru inițială

49482
36:53:57,280 --> 36:54:01,512
analiza datelor, cum ar fi conectarea datelor,

49483
36:53:59,200 --> 36:54:04,560
curățarea, transformarea și încărcarea

49484
36:54:01,512 --> 36:54:07,752
ea. După aceea, veți importa anumite

49485
36:54:04,560 --> 36:54:10,392
biblioteci din Python și după aceea tu

49486
36:54:07,752 --> 36:54:12,392
citește datele exact în ce ai

49487
36:54:10,392 --> 36:54:14,640
datele dvs. Numărul de coloane, cel

49488
36:54:12,392 --> 36:54:16,720
numărul de rânduri și dacă există vreun nul

49489
36:54:14,640 --> 36:54:18,560
valori, dacă există intrări uh

49490
36:54:16,720 --> 36:54:20,312
care sunt invalide, poate fi necesar

49491
36:54:18,560 --> 36:54:22,560
verifică asta, citește asta și s-ar putea să ai

49492
36:54:20,312 --> 36:54:25,032
pentru a verifica dacă există intrări duplicate. Este

49493
36:54:22,560 --> 36:54:27,360
posibil ca o intrare să fi fost

49494
36:54:25,032 --> 36:54:28,952
introduse de două persoane diferite, nu?

49495
36:54:27,360 --> 36:54:30,872
Poate exista o dublare. Deci tu

49496
36:54:28,952 --> 36:54:32,232
ar putea fi nevoit să le elimine

49497
36:54:30,872 --> 36:54:34,080
dublari. S-ar putea să trebuiască să verificați

49498
36:54:32,232 --> 36:54:35,672
pentru unele valori lipsă. S-ar putea să ai

49499
36:54:34,080 --> 36:54:37,752
pentru a calcula numărul total de lipsă

49500
36:54:35,672 --> 36:54:40,080
valorile din setul de date și încercați

49501
36:54:37,752 --> 36:54:42,000
eliminați-le din calcul

49502
36:54:40,080 --> 36:54:43,672
în timpul analizei exploratorii a datelor.

49503
36:54:42,000 --> 36:54:45,360
După aceea, trebuie să faci ceva

49504
36:54:43,672 --> 36:54:46,952
ingineria modelelor. Urmat de asta tu

49505
36:54:45,360 --> 36:54:49,592
s-ar putea să fie nevoie să facă o funcție

49506
36:54:46,952 --> 36:54:51,440
inginerie creând caracteristici și apoi

49507
36:54:49,592 --> 36:54:53,920
veți începe cu exploratorie

49508
36:54:51,440 --> 36:54:55,672
analiza datelor și la final tu

49509
36:54:53,920 --> 36:54:57,840
va genera o proiecție sau a

49510
36:54:55,672 --> 36:54:59,840
prezice sau da ipoteza ta că

49511
36:54:57,840 --> 36:55:02,392
acest lucru s-ar putea întâmpla în viitor și tu

49512
36:54:59,840 --> 36:55:04,232
ar putea fi nevoit să ia măsuri pentru a o evita sau

49513
36:55:02,392 --> 36:55:06,488
s-ar putea să trebuiască să luați măsuri

49514
36:55:04,232 --> 36:55:08,952
improvizează-l corect, așa că așa este

49515
36:55:06,488 --> 36:55:12,560
pașii în analiza exploratorie a datelor luați

49516
36:55:08,952 --> 36:55:15,280
parte acum să continuăm și să începem cu

49517
36:55:12,560 --> 36:55:18,000
demonstrația noastră despre datele exploratorii Python

49518
36:55:15,280 --> 36:55:19,920
analiză și în această sesiune vom fi

49519
36:55:18,000 --> 36:55:22,080
folosind cazul de utilizare despre care am discutat

49520
36:55:19,920 --> 36:55:23,672
înaintea căruia se întâmplă să fie elevii

49521
36:55:22,080 --> 36:55:25,920
set de date de performanță. Deci in asta

49522
36:55:23,672 --> 36:55:28,232
un anumit set de date pe care îl vom avea

49523
36:55:25,920 --> 36:55:30,160
unele coloane bazate pe activitatea fizică

49524
36:55:28,232 --> 36:55:32,640
distanta fata de casa parentala

49525
36:55:30,160 --> 36:55:34,232
educarea disciplinelor notele acestea

49526
36:55:32,640 --> 36:55:36,488
au obținut punctaj la examenul anterior. The

49527
36:55:34,232 --> 36:55:38,560
note pe care le-au marcat în

49528
36:55:36,488 --> 36:55:40,872
examenul anterior și dacă au vreunul

49529
36:55:38,560 --> 36:55:42,800
dizabilități dacă au vreunul

49530
36:55:40,872 --> 36:55:45,200
resursele de care au nevoie pentru a scrie

49531
36:55:42,800 --> 36:55:46,952
examene corect. Deci câțiva parametrii

49532
36:55:45,200 --> 36:55:48,720
parametri importanți care vom fi

49533
36:55:46,952 --> 36:55:52,080
discutând în această sesiune și urmat

49534
36:55:48,720 --> 36:55:54,560
prin asta vom proiecta viitorul care

49535
36:55:52,080 --> 36:55:58,488
cum vei ști ei să se îmbunătățească în lor

49536
36:55:54,560 --> 36:56:00,560
examene şi dacă este o problemă şi dacă

49537
36:55:58,488 --> 36:56:01,840
există o soluție, atunci putem

49538
36:56:00,560 --> 36:56:03,672
implementați acea soluție și ajutați

49539
36:56:01,840 --> 36:56:05,840
elevii să obțină note mai bune la lor

49540
36:56:03,672 --> 36:56:07,592
examen. Deci, acesta este cazul general de utilizare pentru

49541
36:56:05,840 --> 36:56:10,232
această demonstrație. Acum să luăm

49542
36:56:07,592 --> 36:56:13,200
a început cu caietul nostru Jupyter. Acum

49543
36:56:10,232 --> 36:56:15,112
suntem pe caietul lui Jupiter. Acum hai

49544
36:56:13,200 --> 36:56:18,160
începe. Așa că mi-ar plăcea să am un

49545
36:56:15,112 --> 36:56:22,440
titlu pentru caietul meu um. Deci voi scrie

49546
36:56:18,160 --> 36:56:22,440
un cod HTML pentru asta.

49547
36:56:22,952 --> 36:56:32,080
Deci cod HTML uh

49548
36:56:26,872 --> 36:56:34,000
și am trei apostrofe

49549
36:56:32,080 --> 36:56:37,440
si aici as vrea sa scriu ceva

49550
36:56:34,000 --> 36:56:39,752
în H1. Așa că vreau ca titlul meu să fie în H1.

49551
36:56:37,440 --> 36:56:43,592
Deci

49552
36:56:39,752 --> 36:56:47,080
stilul va fi

49553
36:56:43,592 --> 36:56:47,080
culoarea de fundal

49554
36:56:51,840 --> 36:56:55,720
numele va fi albastru închis.

49555
36:56:56,232 --> 36:57:02,312
Așa că haideți să continuăm cu simplul

49556
36:56:58,640 --> 36:57:04,800
fundal de dans care va fi de obicei t

49557
36:57:02,312 --> 36:57:09,560
si culoarea

49558
36:57:04,800 --> 36:57:09,560
de text va fi portocaliu

49559
36:57:09,592 --> 36:57:19,080
și vreau să am și fontul let's

49560
36:57:13,840 --> 36:57:19,080
Lasă-mă să dau dimensiunea fontului ca 30.

49561
36:57:24,232 --> 36:57:29,560
Și în rândul următor, mi-ar plăcea să am

49562
36:57:26,560 --> 36:57:29,560
hotar

49563
36:57:30,312 --> 36:57:37,000
raza. Pot da raza graniței ca

49564
36:57:33,360 --> 36:57:37,000
20 pixeli

49565
36:57:37,512 --> 36:57:44,752
și căptușeală

49566
36:57:39,920 --> 36:57:44,752
să fie de 16 pixeli.

49567
36:57:48,312 --> 36:57:53,640
Alinierea textului, aș dori să o păstrez

49568
36:57:50,640 --> 36:57:53,640
centru.

49569
36:57:55,840 --> 36:58:02,392
Iată. Să codificăm să închidem

49570
36:57:58,232 --> 36:58:06,560
H1. Și acum să codificăm uh

49571
36:58:02,392 --> 36:58:09,752
culoarea de fundal sau culoarea chenarului. Deci

49572
36:58:06,560 --> 36:58:12,312
stilul B.

49573
36:58:09,752 --> 36:58:14,800
Deci, ceea ce putem face este că putem, practic

49574
36:58:12,312 --> 36:58:17,512
au acest cod aici și ce vom avea

49575
36:58:14,800 --> 36:58:19,512
facem este că vom reutiliza acest cod special

49576
36:58:17,512 --> 36:58:23,440
segment pentru că vom avea

49577
36:58:19,512 --> 36:58:26,640
mai multe coduri HTML în special

49578
36:58:23,440 --> 36:58:29,032
uh caiet de lucru care va explica

49579
36:58:26,640 --> 36:58:31,112
rezultatele analizei care suntem

49580
36:58:29,032 --> 36:58:33,672
făcând. Deci felul în care rulăm codul

49581
36:58:31,112 --> 36:58:36,560
iar după aceea vom primi câteva

49582
36:58:33,672 --> 36:58:39,440
vizualizări și voi scrie

49583
36:58:36,560 --> 36:58:42,488
unele conținut textual în XT într-un HTML

49584
36:58:39,440 --> 36:58:44,232
pagina astfel încât să fie mai ușor pentru

49585
36:58:42,488 --> 36:58:47,280
oamenii să înțeleagă ce este ce anume

49586
36:58:44,232 --> 36:58:50,160
se întâmplă aici chiar așa că culoarea

49587
36:58:47,280 --> 36:58:53,752
va fi albastru deschis și acum vine

49588
36:58:50,160 --> 36:58:56,080
text vom închide acest lucru și aici vom face

49589
36:58:53,752 --> 36:58:58,232
scrie textul ca

49590
36:58:56,080 --> 36:59:00,720
Python

49591
36:58:58,232 --> 36:59:04,160
explora

49592
36:59:00,720 --> 36:59:07,112
analiza datelor

49593
36:59:04,160 --> 36:59:10,512
și vom face

49594
36:59:07,112 --> 36:59:10,512
rupe aici

49595
36:59:10,800 --> 36:59:14,440
performanța elevului

49596
36:59:19,032 --> 36:59:27,840
si aici vom inchide H1

49597
36:59:24,800 --> 36:59:29,672
și în sfârșit vom afișa acest lucru în HTML

49598
36:59:27,840 --> 36:59:32,488
cod. Deci, practic, am ratat asta

49599
36:59:29,672 --> 36:59:34,872
bibliotecă. Deci vom importa din

49600
36:59:32,488 --> 36:59:36,952
ipython display import html de afișat

49601
36:59:34,872 --> 36:59:39,440
acest cod special. Deci fără asta

49602
36:59:36,952 --> 36:59:41,752
o anumită bibliotecă nu putem afișa niciuna

49603
36:59:39,440 --> 36:59:43,920
Codurile HTML în caietul nostru. Deci vom face

49604
36:59:41,752 --> 36:59:46,392
rulează rapid asta și avem un titlu

49605
36:59:43,920 --> 36:59:49,752
aici. Acum să continuăm cu

49606
36:59:46,392 --> 36:59:53,032
următoarea parte. Acum vom folosi câteva

49607
36:59:49,752 --> 36:59:55,280
biblioteci precum CAD boost și light bgm.

49608
36:59:53,032 --> 36:59:58,080
Deci pentru asta ar putea fi necesar să instalăm

49609
36:59:55,280 --> 37:00:00,080
aceste biblioteci. Deci vom folosi pip

49610
36:59:58,080 --> 37:00:04,160
instalați aici

49611
37:00:00,080 --> 37:00:06,952
pip install cat boost

49612
37:00:04,160 --> 37:00:09,672
și control enter pentru a rula acest particular

49613
37:00:06,952 --> 37:00:11,592
segment de cod sau puteți folosi și rulați și

49614
37:00:09,672 --> 37:00:15,000
este instalat și după aceea vom face

49615
37:00:11,592 --> 37:00:15,000
instala de asemenea

49616
37:00:15,672 --> 37:00:19,232
bgm ușoară

49617
37:00:19,592 --> 37:00:23,800
g scuze nu bgm

49618
37:00:24,000 --> 37:00:29,440
deci este deja instalat

49619
37:00:26,160 --> 37:00:32,000
Acum vom începe să importăm

49620
37:00:29,440 --> 37:00:35,360
bibliotecile de care avem nevoie. Așa vom fi

49621
37:00:32,000 --> 37:00:37,112
nevoie de numpy, panda, seabon, mattplot

49622
37:00:35,360 --> 37:00:40,160
lib și vom importa și altul

49623
37:00:37,112 --> 37:00:43,440
bibliotecă specială care este pentru ignorare

49624
37:00:40,160 --> 37:00:45,200
avertismente. Deci vom importa avertismente și

49625
37:00:43,440 --> 37:00:47,672
după aceea de la noi vom importa

49626
37:00:45,200 --> 37:00:50,080
că avertismentele de pe afișajul IPython

49627
37:00:47,672 --> 37:00:52,800
import ieșire clară și după aceea noi

49628
37:00:50,080 --> 37:00:54,640
îi va spune caietului jupyter să

49629
37:00:52,800 --> 37:00:57,280
import dacă există avertismente. Deci

49630
37:00:54,640 --> 37:01:00,952
acel cod va avertiza filtrul de puncte

49631
37:00:57,280 --> 37:01:04,232
avertismente și în paranteze vom face

49632
37:01:00,952 --> 37:01:07,032
scrie ignora. Deci bibliotecile de bază

49633
37:01:04,232 --> 37:01:09,440
de care vom avea nevoie sunt următoarele.

49634
37:01:07,032 --> 37:01:11,360
import

49635
37:01:09,440 --> 37:01:16,080
numpy

49636
37:01:11,360 --> 37:01:19,112
ca np. Să copiem rapid asta și

49637
37:01:16,080 --> 37:01:23,840
continua. Intră. Și acum vom fi

49638
37:01:19,112 --> 37:01:26,160
având nevoie de panda ca pd.

49639
37:01:23,840 --> 37:01:29,160
Intră. Și acum vom avea nevoie

49640
37:01:26,160 --> 37:01:29,160
os de mare

49641
37:01:30,560 --> 37:01:36,392
SNS.

49642
37:01:32,952 --> 37:01:39,952
Și vom folosi și mattplot lib

49643
37:01:36,392 --> 37:01:39,952
py plot

49644
37:01:43,592 --> 37:01:50,672
ca plt.

49645
37:01:46,080 --> 37:01:50,672
Și după aceea vom importa avertismente

49646
37:01:51,672 --> 37:01:56,312
din

49647
37:01:54,488 --> 37:01:59,280
Eu Python

49648
37:01:56,312 --> 37:02:00,952
afișaj cu puncte

49649
37:01:59,280 --> 37:02:02,952
import

49650
37:02:00,952 --> 37:02:05,512
clar

49651
37:02:02,952 --> 37:02:08,000
ieșire

49652
37:02:05,512 --> 37:02:11,872
avertismente

49653
37:02:08,000 --> 37:02:11,872
avertismente de filtru de puncte

49654
37:02:12,800 --> 37:02:18,560
ignora.

49655
37:02:15,752 --> 37:02:21,360
Acum vom rula rapid această interogare.

49656
37:02:18,560 --> 37:02:23,512
Fugi. Și acum vom continua

49657
37:02:21,360 --> 37:02:26,872
ingineria caracteristicilor.

49658
37:02:23,512 --> 37:02:29,840
Deci, puteți folosi un hashtag pentru a ignora asta

49659
37:02:26,872 --> 37:02:32,312
anumită linie din execuție pentru

49660
37:02:29,840 --> 37:02:37,112
Caietul Jupyter.

49661
37:02:32,312 --> 37:02:40,232
Și aici vom importa importul

49662
37:02:37,112 --> 37:02:44,920
din skarn

49663
37:02:40,232 --> 37:02:44,920
dot impute import

49664
37:02:45,440 --> 37:02:49,080
calculator simplu

49665
37:02:50,080 --> 37:02:54,872
din skarn

49666
37:02:52,560 --> 37:02:57,360
model de puncte

49667
37:02:54,872 --> 37:03:01,280
selecție

49668
37:02:57,360 --> 37:03:04,160
import kf fold. Iată. Acum hai

49669
37:03:01,280 --> 37:03:06,312
rulați rapid această interogare.

49670
37:03:04,160 --> 37:03:09,440
Iată. Acum vom continua cu

49671
37:03:06,312 --> 37:03:12,080
modelare și evaluare a modelului. Odată ce noi

49672
37:03:09,440 --> 37:03:15,512
am terminat cu asta, atunci vom face direct

49673
37:03:12,080 --> 37:03:17,840
introduceți datele în caietul nostru de note. Deci pentru

49674
37:03:15,512 --> 37:03:20,800
modelând datele vom folosi din nou a

49675
37:03:17,840 --> 37:03:24,000
cod hash, astfel încât această linie specială

49676
37:03:20,800 --> 37:03:28,720
nu se va executa

49677
37:03:24,000 --> 37:03:31,360
si import niste biblioteci aprinse

49678
37:03:28,720 --> 37:03:34,488
GBM

49679
37:03:31,360 --> 37:03:39,080
ca LGB

49680
37:03:34,488 --> 37:03:39,080
din biblioteca light GBM.

49681
37:03:41,280 --> 37:03:46,752
import

49682
37:03:42,872 --> 37:03:46,752
regresor LGBM

49683
37:03:47,512 --> 37:03:54,232
din importul CAD boost

49684
37:03:51,920 --> 37:03:57,112
boost regresor. Iată. Să

49685
37:03:54,232 --> 37:04:00,232
rulați rapid această comandă.

49686
37:03:57,112 --> 37:04:03,592
Iată. Acum, în sfârșit, avem unul

49687
37:04:00,232 --> 37:04:06,080
mai multă sarcină înainte de a importa datele care

49688
37:04:03,592 --> 37:04:09,200
este evaluarea modelului. Odată ce este făcut,

49689
37:04:06,080 --> 37:04:11,512
putem continua cu importul datelor.

49690
37:04:09,200 --> 37:04:14,872
Iată. Să-l rulăm repede. Şi

49691
37:04:11,512 --> 37:04:17,112
acum pana acum e bine. Noi am făcut

49692
37:04:14,872 --> 37:04:19,280
importurile și caracteristicile de bază ale bibliotecii

49693
37:04:17,112 --> 37:04:21,840
se face ingineria, se face modelarea

49694
37:04:19,280 --> 37:04:25,032
și se face și evaluarea modelului. Acum

49695
37:04:21,840 --> 37:04:29,440
putem începe cu importarea datelor. Deci

49696
37:04:25,032 --> 37:04:32,720
haideți să adăugăm și codul HTML unde

49697
37:04:29,440 --> 37:04:35,512
am făcut acest import. Deci iată-mă

49698
37:04:32,720 --> 37:04:38,392
voi încerca să adaug un alt segment și eu

49699
37:04:35,512 --> 37:04:41,280
va importa aici codul HTML care

49700
37:04:38,392 --> 37:04:43,752
afișează un format HTML similar care

49701
37:04:41,280 --> 37:04:46,232
explică exact ce se întâmplă aici.

49702
37:04:43,752 --> 37:04:48,800
O clipă am codul gata.

49703
37:04:46,232 --> 37:04:51,112
O să-l lipesc aici. Iată.

49704
37:04:48,800 --> 37:04:54,000
Să rulăm rapid acest lucru, astfel încât să avem un

49705
37:04:51,112 --> 37:04:55,920
Cod HTML aici pagina aici care explică

49706
37:04:54,000 --> 37:04:58,000
ce se intampla mai exact aici. Deci suntem

49707
37:04:55,920 --> 37:05:01,920
biblioteci importatoare și, de asemenea, student

49708
37:04:58,000 --> 37:05:04,392
date. Acum să importăm datele studenților.

49709
37:05:01,920 --> 37:05:07,672
Pentru asta, să scriem interogarea. Deci noi

49710
37:05:04,392 --> 37:05:13,560
importă datele ca cadru de date și

49711
37:05:07,672 --> 37:05:13,560
după aceea vom scrie panda citi CSV

49712
37:05:13,920 --> 37:05:20,232
dreapta și aici vom adăuga locația

49713
37:05:17,512 --> 37:05:24,000
a dosarului. Corect? Deci dosarul este

49714
37:05:20,232 --> 37:05:25,840
aflat în secțiunea mea de descărcări. Deci

49715
37:05:24,000 --> 37:05:28,312
să copiem rapid acea locație și

49716
37:05:25,840 --> 37:05:31,200
lipiți-l aici. Deci aceasta este locația

49717
37:05:28,312 --> 37:05:33,512
din dosarul meu. Să-l rulăm repede. Deci

49718
37:05:31,200 --> 37:05:37,032
ar putea fi o eroare. E în regulă. Noi

49719
37:05:33,512 --> 37:05:38,872
poate rezolva. Deci în astfel de scenarii

49720
37:05:37,032 --> 37:05:41,592
nici nu trebuie să vă faceți griji, puteți adăuga

49721
37:05:38,872 --> 37:05:44,000
un R, dar chiar dacă asta nu-ți merge

49722
37:05:41,592 --> 37:05:45,840
ar putea fi nevoit să o schimbe în acest caz

49723
37:05:44,000 --> 37:05:48,720
a functionat dar in caz ca nu merge

49724
37:05:45,840 --> 37:05:51,280
ceea ce poți face este că poți elimina

49725
37:05:48,720 --> 37:05:55,440
uh r și poți doar să schimbi asta

49726
37:05:51,280 --> 37:05:58,560
de la uh înainte slash la backlash. Aceasta

49727
37:05:55,440 --> 37:06:00,640
va ajuta, de asemenea. Deci asta ar putea merita

49728
37:05:58,560 --> 37:06:02,488
ea. Deci poate funcționa și asta. Deci astea sunt

49729
37:06:00,640 --> 37:06:06,000
situațiile în care puteți utiliza acest lucru.

49730
37:06:02,488 --> 37:06:08,312
Acum hai să continuăm cu încă ceva uh

49731
37:06:06,000 --> 37:06:10,640
fapte interesante. Să încercăm

49732
37:06:08,312 --> 37:06:13,920
înțelege ce se întâmplă cu uh-ul nostru

49733
37:06:10,640 --> 37:06:17,440
set de date. Corect? Deci ceea ce poți face este

49734
37:06:13,920 --> 37:06:19,512
acum datele sunt stocate în variabila df as

49735
37:06:17,440 --> 37:06:23,672
un cadru de date. Deci ceea ce poți face este să citești

49736
37:06:19,512 --> 37:06:26,232
aceste date particulare df.shape forma deci

49737
37:06:23,672 --> 37:06:28,232
că poți înțelege ce este uh

49738
37:06:26,232 --> 37:06:32,080
ce se întâmplă cu aceste date. Corect?

49739
37:06:28,232 --> 37:06:34,392
Deci vă poate spune că sunt 6

49740
37:06:32,080 --> 37:06:36,872
scuze 6,67

49741
37:06:34,392 --> 37:06:40,000
rânduri și 20 de coloane. Acum să adăugăm

49742
37:06:36,872 --> 37:06:42,800
o altă parte de interogare și aici puteți uh

49743
37:06:40,000 --> 37:06:45,672
incearca sa vezi capul exact ce cap

49744
37:06:42,800 --> 37:06:47,512
înseamnă, practic, cap înseamnă uh coloana

49745
37:06:45,672 --> 37:06:51,440
antete. Deci ceea ce poți face este doar

49746
37:06:47,512 --> 37:06:54,080
scrie df dot head

49747
37:06:51,440 --> 37:06:57,672
și fugi. Acum aveți antetele coloanelor

49748
37:06:54,080 --> 37:07:01,112
și câteva coloane de probă

49749
37:06:57,672 --> 37:07:04,488
scuze câteva rânduri de probă. Acum hai

49750
37:07:01,112 --> 37:07:06,160
continuă cu verificarea duplicatelor

49751
37:07:04,488 --> 37:07:07,752
și identificarea numărului total de

49752
37:07:06,160 --> 37:07:11,840
intrări duplicat în acest special

49753
37:07:07,752 --> 37:07:14,160
set de date. Deci, puteți nota df dot

49754
37:07:11,840 --> 37:07:16,160
duplicat

49755
37:07:14,160 --> 37:07:18,952
punct

49756
37:07:16,160 --> 37:07:21,200
suma și veți obține numărul de

49757
37:07:18,952 --> 37:07:23,752
duplicate prezente în acest special

49758
37:07:21,200 --> 37:07:26,000
dosar. Deci avem zero intrări duplicat.

49759
37:07:23,752 --> 37:07:28,800
Acum să vedem dacă există ceva nul uh

49760
37:07:26,000 --> 37:07:33,112
elemente din acest cadru de date particular.

49761
37:07:28,800 --> 37:07:35,280
Deci df dot este nul

49762
37:07:33,112 --> 37:07:36,872
sumă în puncte.

49763
37:07:35,280 --> 37:07:40,800
Deci toate acestea sunt funcții. Control

49764
37:07:36,872 --> 37:07:43,280
intra. Iată. Deci în coloană

49765
37:07:40,800 --> 37:07:45,280
calitatea profesorului sunt 78 nule

49766
37:07:43,280 --> 37:07:47,592
intrări și în educație parentală

49767
37:07:45,280 --> 37:07:51,360
nivel sunt 90 de intrări nule și

49768
37:07:47,592 --> 37:07:55,592
distanta de acasa sunt u 67 nul

49769
37:07:51,360 --> 37:07:59,360
intrări. Acum ceea ce putem face este de la

49770
37:07:55,592 --> 37:08:02,392
bine, deci din df shape putem adăuga o

49771
37:07:59,360 --> 37:08:04,232
celulă nouă aici și putem scrie un HTML

49772
37:08:02,392 --> 37:08:05,752
cod pentru ca privitorul să poată înțelege

49773
37:08:04,232 --> 37:08:08,232
că încercăm să ne înțelegem

49774
37:08:05,752 --> 37:08:10,720
date. Deci haideți să scriem un cod rapid pentru

49775
37:08:08,232 --> 37:08:12,720
că. Deci, să nu pierdem mult timp

49776
37:08:10,720 --> 37:08:14,640
doar scriind codul HTML. Deci am

49777
37:08:12,720 --> 37:08:16,640
acel cod HTML scris într-un blocnotes

49778
37:08:14,640 --> 37:08:18,800
deja. Așa că o voi lipi aici

49779
37:08:16,640 --> 37:08:22,392
și haideți să o rulăm repede ca să avem

49780
37:08:18,800 --> 37:08:23,752
o vizibilitate HTML aici. Deci asta a fost

49781
37:08:22,392 --> 37:08:26,312
ar trebui să fie rezultatul. Deci vom face

49782
37:08:23,752 --> 37:08:28,312
adauga-l aici. Deci ceea ce vom face este

49783
37:08:26,312 --> 37:08:32,312
editați rapid acest anumit conținut.

49784
37:08:28,312 --> 37:08:36,200
Vom copia rapid acest cod și

49785
37:08:32,312 --> 37:08:36,200
lipiți-l aici.

49786
37:08:36,488 --> 37:08:43,360
Modificați conținutul de la import

49787
37:08:40,000 --> 37:08:45,360
biblioteci la

49788
37:08:43,360 --> 37:08:48,800
lectură

49789
37:08:45,360 --> 37:08:55,920
datele elevilor și vom tăia acest cod

49790
37:08:48,800 --> 37:08:58,872
de aici și îl vom lipi aici

49791
37:08:55,920 --> 37:09:00,640
astfel încât să ne dea câteva informații.

49792
37:08:58,872 --> 37:09:02,160
Să rulăm și acest cod special

49793
37:09:00,640 --> 37:09:04,312
segment

49794
37:09:02,160 --> 37:09:06,160
astfel încât să avem date despre studenți de tranzacționare.

49795
37:09:04,312 --> 37:09:09,032
Iată. Acum, următoarea parte a acestui lucru

49796
37:09:06,160 --> 37:09:11,672
sesiunea va fi despre crearea unei ținte

49797
37:09:09,032 --> 37:09:14,312
variabilă. Deci ținta generală a acestui lucru

49798
37:09:11,672 --> 37:09:16,800
analiza anumitor date se referă la examen

49799
37:09:14,312 --> 37:09:18,800
scor. Corect? Așa că ne putem numi ținta

49800
37:09:16,800 --> 37:09:20,872
variabilă ca punctaj la examen. Și haideți

49801
37:09:18,800 --> 37:09:25,360
înțelegeți distribuția acesteia

49802
37:09:20,872 --> 37:09:28,160
punctaj special la examen cu uh the

49803
37:09:25,360 --> 37:09:32,840
variabilele pe care le avem. Acum să scriem

49804
37:09:28,160 --> 37:09:32,840
graficul punctului.

49805
37:09:33,032 --> 37:09:39,952
Mărimea figurii ar trebui să fie în jur de 15 virgulă 9

49806
37:09:41,112 --> 37:09:48,488
este egal cu să adăugăm o paranteză aici 15

49807
37:09:44,312 --> 37:09:52,080
virgula 9 sau să o păstrăm așa cum ar fi șase 9

49808
37:09:48,488 --> 37:09:55,840
fi un pic mai mare. Acum intra acum noi

49809
37:09:52,080 --> 37:09:58,720
va folosi biblioteca seabbond aici. punct SNS

49810
37:09:55,840 --> 37:10:01,112
complot de numărare

49811
37:09:58,720 --> 37:10:04,080
x este egal cu cadrul de date curățat

49812
37:10:01,112 --> 37:10:07,280
tinta. Bine. Înainte de ținta curățată

49813
37:10:04,080 --> 37:10:09,840
ar putea fi nevoiți să mai alergăm câteva. Bine.

49814
37:10:07,280 --> 37:10:12,000
Nu am efectuat curățarea datelor până acum,

49815
37:10:09,840 --> 37:10:14,872
nu? Deci, să continuăm cu datele

49816
37:10:12,000 --> 37:10:17,440
curatenie pana acum. Așa că am găsit câteva goale

49817
37:10:14,872 --> 37:10:21,672
intrări, nu? Intrări nule și noi, de asemenea

49818
37:10:17,440 --> 37:10:23,440
am găsit câteva Deci aici avem 299 de rânduri

49819
37:10:21,672 --> 37:10:26,000
care au valori lipsă. Deci vom face

49820
37:10:23,440 --> 37:10:28,080
trebuie s-o elimini. Pentru asta noi

49821
37:10:26,000 --> 37:10:31,920
ar putea fi nevoie să creeze o nouă coloană care

49822
37:10:28,080 --> 37:10:34,392
trebuie să fie numit ca nu drept atribuit

49823
37:10:31,920 --> 37:10:39,280
cadru de date df nealocat care este

49824
37:10:34,392 --> 37:10:41,280
egal cu df dot drop na. Așa vom fi

49825
37:10:39,280 --> 37:10:44,080
eliminând aici valorile nule. Este o

49826
37:10:41,280 --> 37:10:49,840
funcția. Și aici hai să tipărim

49827
37:10:44,080 --> 37:10:53,032
valorile. Print df dot df

49828
37:10:49,840 --> 37:10:57,112
na formă de punct. Deci câte rânduri

49829
37:10:53,032 --> 37:10:59,840
si coloane avem dreapta si dupa aceea

49830
37:10:57,112 --> 37:11:02,392
să încercăm și să eliminăm nulul

49831
37:10:59,840 --> 37:11:04,872
valorile, de asemenea, dot este nul, așa că noi nu

49832
37:11:02,392 --> 37:11:09,032
au, practic, nu avem valori nule

49833
37:11:04,872 --> 37:11:11,672
dar avem câteva intrări ilegale poate

49834
37:11:09,032 --> 37:11:14,392
unii acolo, acum hai să alergăm repede

49835
37:11:11,672 --> 37:11:18,080
această interogare, așa că iată, așa că noua

49836
37:11:14,392 --> 37:11:19,592
datele sunt de aproximativ 678

49837
37:11:18,080 --> 37:11:23,112
20

49838
37:11:19,592 --> 37:11:25,032
deci există Um, bine. Am făcut ceva

49839
37:11:23,112 --> 37:11:27,112
greseala aici. Deci, ar trebui să-l adăugăm

49840
37:11:25,032 --> 37:11:27,752
ca nul. N U N L N N N N N N N N N N N N

49841
37:11:27,112 --> 37:11:27,840
N N N N N N L N N N N N N N N N N N N N N

49842
37:11:27,752 --> 37:11:30,080
N N N N N N N N N N N N N N N N N N N N

49843
37:11:27,840 --> 37:11:31,920
N N N N N N N U L. Acum rulați rapid acest lucru.

49844
37:11:30,080 --> 37:11:34,872
Deci nu ar trebui să primim nicio eroare asta

49845
37:11:31,920 --> 37:11:37,360
timp.

49846
37:11:34,872 --> 37:11:40,952
Iată. Fără erori. Până acum, bine.

49847
37:11:37,360 --> 37:11:45,112
Acum să descriem noul set de date. df

49848
37:11:40,952 --> 37:11:48,232
na punct descrie. Deci astea sunt noi

49849
37:11:45,112 --> 37:11:50,560
coloane și rânduri pe care le avem. Iar noi

49850
37:11:48,232 --> 37:11:53,280
au o variație standard,

49851
37:11:50,560 --> 37:11:57,280
abatere standard, minim, maxim. Deci

49852
37:11:53,280 --> 37:12:00,080
scorurile sunt împărțite în 25%, 50% și

49853
37:11:57,280 --> 37:12:01,360
75%. Care s-ar putea baza pe ore

49854
37:12:00,080 --> 37:12:03,840
studiate care s-ar putea baza pe

49855
37:12:01,360 --> 37:12:04,952
prezență, ore de somn, anterioare

49856
37:12:03,840 --> 37:12:07,280
curs, sesiuni de formare cuvenite,

49857
37:12:04,952 --> 37:12:10,392
totul. Deci ore minime de somn,

49858
37:12:07,280 --> 37:12:12,952
ore maxime de somn, 25% din asta, 50% din

49859
37:12:10,392 --> 37:12:16,312
asta, 75% din asta. Deci asta se presupune

49860
37:12:12,952 --> 37:12:18,560
pentru a fi cel descris. Acum ce vom face

49861
37:12:16,312 --> 37:12:22,000
este că avem o variabilă țintă care este

49862
37:12:18,560 --> 37:12:25,512
scorul examenului. Corect? Acum vom face câteva

49863
37:12:22,000 --> 37:12:28,560
modificări la acesta. Știm deja într-un

49864
37:12:25,512 --> 37:12:31,592
examen va exista o valoare prag. Ea

49865
37:12:28,560 --> 37:12:34,000
poate fi de 25 de puncte pe examen. Poate fi 50

49866
37:12:31,592 --> 37:12:36,232
puncte pe examen și poate fi de 100 de puncte

49867
37:12:34,000 --> 37:12:38,872
per examen. Corect? In situatia noastra haideti

49868
37:12:36,232 --> 37:12:41,672
consideră că valoarea pragului este 100

49869
37:12:38,872 --> 37:12:45,200
semne. Corect? Dacă există o situație

49870
37:12:41,672 --> 37:12:47,200
unde marcajele sunt introduse într-un mod greșit

49871
37:12:45,200 --> 37:12:49,592
corect se poate dacă adaugă dacă au vrut

49872
37:12:47,200 --> 37:12:52,160
să adauge 11 dar din greșeală dacă au adăugat

49873
37:12:49,592 --> 37:12:55,672
uh încă unul corect triplu nu este

49874
37:12:52,160 --> 37:12:59,280
o intrare corectă, așa că vom încerca

49875
37:12:55,672 --> 37:13:01,752
elimină astfel de date

49876
37:12:59,280 --> 37:13:04,488
așa că vom crea un nou cadru de date

49877
37:13:01,752 --> 37:13:08,232
aici care este dataf frame curățat este

49878
37:13:04,488 --> 37:13:10,872
este egal cu dataf frame

49879
37:13:08,232 --> 37:13:15,512
nu nul deci am eliminat nulul

49880
37:13:10,872 --> 37:13:19,360
valorile. BF NA. Acum vom adăuga al nostru

49881
37:13:15,512 --> 37:13:23,360
variabila țintă care este scorul la examen

49882
37:13:19,360 --> 37:13:26,232
ar trebui să fie. Deci să ieșim din asta și

49883
37:13:23,360 --> 37:13:28,800
aici îl vom adăuga așa cum ar trebui să fie mai puțin

49884
37:13:26,232 --> 37:13:32,952
decat sau egal cu 100 dar nu mai mult de

49885
37:13:28,800 --> 37:13:35,112
100. Să folosim paranteze pătrate.

49886
37:13:32,952 --> 37:13:41,112
Aici, de asemenea, formatul este pătrat

49887
37:13:35,112 --> 37:13:44,080
paranteze. ing acţiune acum intra şi

49888
37:13:41,112 --> 37:13:47,920
vom descrie acest anume

49889
37:13:44,080 --> 37:13:51,920
setul de date în loc de FNA îl vom copia

49890
37:13:47,920 --> 37:13:55,032
lipiți asta aici acum hai să rulăm asta

49891
37:13:51,920 --> 37:13:56,872
ok scorul examenului nu este identificat hai

49892
37:13:55,032 --> 37:14:00,488
verificați rapid eroarea și rezolvați-o

49893
37:13:56,872 --> 37:14:03,672
da, așa că am ratat să adăugăm două puncte aici

49894
37:14:00,488 --> 37:14:05,440
nu este o problemă, așa că asta a fost

49895
37:14:03,672 --> 37:14:07,592
ar trebui să fie așa cum este acum hai să alergăm

49896
37:14:05,440 --> 37:14:10,488
asta și vom avea răspunsul peste

49897
37:14:07,592 --> 37:14:12,800
aici. Deci avem rezultatul. Acum hai

49898
37:14:10,488 --> 37:14:14,952
verificați uh capul acestui anume

49899
37:14:12,800 --> 37:14:17,920
set de date curat. Deci putem folosi

49900
37:14:14,952 --> 37:14:20,640
același cod aici și lipiți-l corect

49901
37:14:17,920 --> 37:14:23,360
aici și în loc să descriem să scriem

49902
37:14:20,640 --> 37:14:25,512
cap, astfel încât să avem antetul de uh

49903
37:14:23,360 --> 37:14:28,872
acest set de date special. Deci avem noastre

49904
37:14:25,512 --> 37:14:31,440
studiază și totul normal și vom face

49905
37:14:28,872 --> 37:14:33,592
clasifică dreptul la date. Deci vom face

49906
37:14:31,440 --> 37:14:36,872
folosiți trei coloane studiul nostru

49907
37:14:33,592 --> 37:14:39,440
prezența și scorurile anterioare și uh

49908
37:14:36,872 --> 37:14:41,032
dupa aceea vom folosi si noi

49909
37:14:39,440 --> 37:14:43,592
alte coloane din aceste date particulare

49910
37:14:41,032 --> 37:14:45,920
set care se întâmplă să fie parental

49911
37:14:43,592 --> 37:14:49,672
implicare acces la resurse somn

49912
37:14:45,920 --> 37:14:51,512
ore ting sesiuni etc. Și acum noastre

49913
37:14:49,672 --> 37:14:53,752
ținta va fi scorul la examen pe care noi

49914
37:14:51,512 --> 37:14:55,920
creat aici. Corect? Acest examen

49915
37:14:53,752 --> 37:14:58,392
scorul va fi obiectivul nostru. Și folosind asta

49916
37:14:55,920 --> 37:15:00,800
țintă specială a punctajului la examen, vom face

49917
37:14:58,392 --> 37:15:03,032
clasifica datele. Bine? Vom face

49918
37:15:00,800 --> 37:15:06,232
clasifică datele în termeni de uh, hai

49919
37:15:03,032 --> 37:15:09,112
spune uh prima clasa uh clasa a doua si

49920
37:15:06,232 --> 37:15:12,640
treci sau ceva de genul ăsta. Corect?

49921
37:15:09,112 --> 37:15:15,920
Deci, dacă un student are un punctaj mai jos

49922
37:15:12,640 --> 37:15:17,840
64 și asta e o categorie separată.

49923
37:15:15,920 --> 37:15:19,440
Dacă punctajul studentului este egal

49924
37:15:17,840 --> 37:15:21,752
la sau peste 65 de ani, asta este diferit

49925
37:15:19,440 --> 37:15:25,440
categorie. Și dacă studentul marchează

49926
37:15:21,752 --> 37:15:28,000
dincolo de 70, asta e o categorie diferită.

49927
37:15:25,440 --> 37:15:31,512
Și înainte de a continua cu asta,

49928
37:15:28,000 --> 37:15:34,488
hai să încercăm să adăugăm un cod HTML înainte de asta

49929
37:15:31,512 --> 37:15:36,000
un anumit set de date astfel încât să avem u an

49930
37:15:34,488 --> 37:15:38,640
înțelegerea a ceea ce s-a întâmplat exact

49931
37:15:36,000 --> 37:15:40,720
aici. Deci, hai să o fac repede

49932
37:15:38,640 --> 37:15:43,112
copiați lipiți acest cod special aici. Deci

49933
37:15:40,720 --> 37:15:44,872
îl vom rula și acum vom face

49934
37:15:43,112 --> 37:15:46,872
descrie verifica coloana tip de date

49935
37:15:44,872 --> 37:15:50,080
separați și totul și vă vom dori

49936
37:15:46,872 --> 37:15:54,000
știți să creați variabile de categorie de tip de date

49937
37:15:50,080 --> 37:15:56,312
chiar acum pana acum e bine. Acum vom face

49938
37:15:54,000 --> 37:15:58,952
creați categoriile.

49939
37:15:56,312 --> 37:16:02,080
Deci apel num

49940
37:15:58,952 --> 37:16:05,720
egal cu

49941
37:16:02,080 --> 37:16:05,720
ore studiate

49942
37:16:05,840 --> 37:16:10,112
prezența la virgulă.

49943
37:16:10,232 --> 37:16:17,512
Deci, să adăugăm rapid datele

49944
37:16:14,000 --> 37:16:19,360
scorurile la examenele anterioare.

49945
37:16:17,512 --> 37:16:22,000
Doar un minut. Să adăugăm rapid

49946
37:16:19,360 --> 37:16:23,592
coloane. Lasă-mă să iau ceva timp. Acolo tu

49947
37:16:22,000 --> 37:16:26,080
du-te. Am adăugat coloanele. Așa suntem

49948
37:16:23,592 --> 37:16:28,312
luând în considerare trei coloane diferite. uh

49949
37:16:26,080 --> 37:16:30,160
prezența la studii și scorurile anterioare

49950
37:16:28,312 --> 37:16:32,080
pentru num call și cat call. Suntem

49951
37:16:30,160 --> 37:16:35,200
considerând celelalte coloane în afară de

49952
37:16:32,080 --> 37:16:36,952
primele trei și valoarea noastră țintă este

49953
37:16:35,200 --> 37:16:40,392
scorul examenului. Să rulăm rapid asta.

49954
37:16:36,952 --> 37:16:42,872
Iată. Și acum vom încerca

49955
37:16:40,392 --> 37:16:46,952
construiți niște vizualizări și înainte

49956
37:16:42,872 --> 37:16:50,800
hai să încercăm să adăugăm niște date

49957
37:16:46,952 --> 37:16:53,752
din HTML. Să încercăm să creăm un

49958
37:16:50,800 --> 37:16:57,360
Bine, ceea ce putem face este pur și simplu să copiem asta

49959
37:16:53,752 --> 37:16:59,440
un anumit fișier HTML aici. Putem lua

49960
37:16:57,360 --> 37:17:01,440
aceasta

49961
37:16:59,440 --> 37:17:03,280
și adaugă-l aici ca să o facem

49962
37:17:01,440 --> 37:17:06,800
intelege exact ce se intampla

49963
37:17:03,280 --> 37:17:10,720
în continuare. Și în locul studentului cititor

49964
37:17:06,800 --> 37:17:13,600
date, vom scrie vizualizarea datelor

49965
37:17:10,720 --> 37:17:15,744
pentru datele elevilor.

49966
37:17:13,600 --> 37:17:19,280
Și vom păstra aceleași culori închise

49967
37:17:15,744 --> 37:17:20,960
fundal albastru și culoarea u pentru date

49968
37:17:19,280 --> 37:17:23,280
vizualizarea va fi albastru deschis și

49969
37:17:20,960 --> 37:17:25,920
datele elevilor vor fi portocalii. Să

49970
37:17:23,280 --> 37:17:28,720
alergați repede și iată-l. Acum

49971
37:17:25,920 --> 37:17:31,664
variabila noastră țintă este scorul la examen. Corect

49972
37:17:28,720 --> 37:17:34,240
acum vom compara acest particular

49973
37:17:31,664 --> 37:17:37,520
variabilă țintă cu alte trei

49974
37:17:34,240 --> 37:17:40,480
parametrii. Deci parametrii noștri vor fi

49975
37:17:37,520 --> 37:17:42,800
următoarele uh așa cum am discutat uh

49976
37:17:40,480 --> 37:17:45,920
crearea segregării în setul de date

49977
37:17:42,800 --> 37:17:48,720
corect. Deci, primul va fi distribuția

49978
37:17:45,920 --> 37:17:51,024
variabila tinta cu alti parametri.

49979
37:17:48,720 --> 37:17:53,600
Deci vom crea un alt fișier HTML pentru

49980
37:17:51,024 --> 37:17:57,200
asta chiar aici. Doar un minut în timp ce eu

49981
37:17:53,600 --> 37:18:00,320
lipiți codul pentru um HTML rulează rapid

49982
37:17:57,200 --> 37:18:03,200
acest. Iată. Deci distribuția de

49983
37:18:00,320 --> 37:18:06,384
țintă scor variabil la examen împotriva unora

49984
37:18:03,200 --> 37:18:08,320
parametrii. Acum vom scrie intriga

49985
37:18:06,384 --> 37:18:12,080
pentru asta

49986
37:18:08,320 --> 37:18:17,200
graficul punctului. Deci vom merge

49987
37:18:12,080 --> 37:18:20,080
considerați dimensiunea egală cu 15 6

49988
37:18:17,200 --> 37:18:24,320
dimensiune mare

49989
37:18:20,080 --> 37:18:26,560
este egal cu 15 6 acelasi ca si noi

49990
37:18:24,320 --> 37:18:32,320
luate în considerare înainte. Și vom folosi

49991
37:18:26,560 --> 37:18:34,320
Graficul de numărare a punctelor Cbond SNS

49992
37:18:32,320 --> 37:18:37,024
paranteză deschisă. Aceasta este o funcție x este

49993
37:18:34,320 --> 37:18:39,280
egal cu df

49994
37:18:37,024 --> 37:18:42,720
curat. Bine. Ce putem face este doar

49995
37:18:39,280 --> 37:18:46,000
luăm repede numele coloanei astfel încât noi

49996
37:18:42,720 --> 37:18:49,920
nu creați nicio greșeală aici și noi

49997
37:18:46,000 --> 37:18:53,744
îl va lipi aici în loc de df.

49998
37:18:49,920 --> 37:18:57,200
Iată. Sau țintă.

49999
37:18:53,744 --> 37:19:01,800
Deci ținta noastră este scorul la examen,

50000
37:18:57,200 --> 37:19:01,800
iar peletul îl vom folosi ca verde

50001
37:19:02,160 --> 37:19:07,360
iar titlul parcelei va fi distribuție

50002
37:19:04,240 --> 37:19:10,560
a scorului la examen variabil țintă. Putem

50003
37:19:07,360 --> 37:19:14,080
copiați asta. Bine, cu doar un minut înainte

50004
37:19:10,560 --> 37:19:16,480
asta fac.

50005
37:19:14,080 --> 37:19:20,880
Ar trebui să folosim acum ghilimele duble.

50006
37:19:16,480 --> 37:19:23,280
Copiați acest lucru și lipiți-l aici.

50007
37:19:20,880 --> 37:19:24,800
Cred că s-au stins punct și virgulă. Bine, nu a

50008
37:19:23,280 --> 37:19:27,664
problema.

50009
37:19:24,800 --> 37:19:31,024
Este chiar aici. Să adăugăm un punct ca a

50010
37:19:27,664 --> 37:19:32,640
punct. Și următoarea linie, dacă tu

50011
37:19:31,024 --> 37:19:38,560
nevoie, puteți adăuga punctul. Dacă nu

50012
37:19:32,640 --> 37:19:43,104
puteți ignora plt dot grid true

50013
37:19:38,560 --> 37:19:44,960
care este egal cu major

50014
37:19:43,104 --> 37:19:49,840
virgulă

50015
37:19:44,960 --> 37:19:55,280
accesul este egal cu y

50016
37:19:49,840 --> 37:19:57,744
stilul liniei de virgulă este egal cu așa vreau

50017
37:19:55,280 --> 37:20:01,600
liniile să fie cratima în acest fel I

50018
37:19:57,744 --> 37:20:07,440
vreau liniile și virgulă lățimea liniei um

50019
37:20:01,600 --> 37:20:11,744
să spunem 0,5 sau 0,7. Să mergem cu 0,7

50020
37:20:07,440 --> 37:20:13,920
lățimea liniei este egală cu 0,9 mm. Acolo tu

50021
37:20:11,744 --> 37:20:16,720
du-te. Acum să rulăm rapid această interogare.

50022
37:20:13,920 --> 37:20:19,440
Iată. Făcut. Și avem

50023
37:20:16,720 --> 37:20:21,360
prima vizualizare. Deci aici puteți vedea

50024
37:20:19,440 --> 37:20:24,160
sunt niște studenți care sunt

50025
37:20:21,360 --> 37:20:25,840
scor 58 59 și poți vedea maxim

50026
37:20:24,160 --> 37:20:28,960
numărul de studenți au deja punctaj

50027
37:20:25,840 --> 37:20:32,384
note bune, care este sub 65 și uh

50028
37:20:28,960 --> 37:20:34,000
scuze care este sub 70 și peste 65 și

50029
37:20:32,384 --> 37:20:37,440
există un număr bun de studenți

50030
37:20:34,000 --> 37:20:40,384
care au, de asemenea, un scor peste 65 ca

50031
37:20:37,440 --> 37:20:43,360
bine, așa că îmi pare rău și 70 70. Deci noi

50032
37:20:40,384 --> 37:20:46,160
au acum mai puțin sau egal cu 70 71.

50033
37:20:43,360 --> 37:20:48,320
Și cel mai mare marcator în unele situații

50034
37:20:46,160 --> 37:20:50,384
mai sunt si 100. Daca poti vedea acolo

50035
37:20:48,320 --> 37:20:52,160
este o ușoară creștere aici. Sunt câteva

50036
37:20:50,384 --> 37:20:55,104
elevi toppers poate care au

50037
37:20:52,160 --> 37:20:56,960
a marcat deja 100. Acum avem

50038
37:20:55,104 --> 37:20:59,520
lista aici. Acum avem ce trebuie să facem

50039
37:20:56,960 --> 37:21:02,800
trebuie să segregam, aceasta este partea întâi

50040
37:20:59,520 --> 37:21:05,440
care este mai mic sau egal cu 64 care

50041
37:21:02,800 --> 37:21:08,384
se încadrează sub 65 de ani și altă categorie

50042
37:21:05,440 --> 37:21:11,104
care se încadrează între 65 şi 70 şi

50043
37:21:08,384 --> 37:21:13,920
peste 70. Deci trebuie să le catalogăm pe acestea

50044
37:21:11,104 --> 37:21:17,744
trei uh date și segregați-le ca

50045
37:21:13,920 --> 37:21:21,360
jos 65, sus care este peste 70 și mijloc

50046
37:21:17,744 --> 37:21:24,800
între 70 și 65. Chiar acum înainte de asta

50047
37:21:21,360 --> 37:21:26,640
dacă doriți să adăugați un document HTML uh

50048
37:21:24,800 --> 37:21:28,560
scuze segment aici care explică despre

50049
37:21:26,640 --> 37:21:31,440
distribuția țintei puteți, de asemenea

50050
37:21:28,560 --> 37:21:33,744
face asta. Este deja adăugat aici. Acum

50051
37:21:31,440 --> 37:21:37,440
hai sa continuam. Dar in caz ca daca vrei

50052
37:21:33,744 --> 37:21:39,280
pentru a adăuga uh câteva date care explică

50053
37:21:37,440 --> 37:21:42,480
că încercăm să-l segregam, poți

50054
37:21:39,280 --> 37:21:44,720
fa si asta. Mi-ar plăcea să fac asta.

50055
37:21:42,480 --> 37:21:47,600
Să adăugăm rapid codul HTML

50056
37:21:44,720 --> 37:21:49,104
aici. Deci, ce va fi acest cod special

50057
37:21:47,600 --> 37:21:52,160
face este că va spune procentul de

50058
37:21:49,104 --> 37:21:55,920
elevi care au un punctaj mai mic de 65.

50059
37:21:52,160 --> 37:21:58,384
Numărul stu uh procent de studenți

50060
37:21:55,920 --> 37:22:00,160
uh, punctând între 65 și 70 și

50061
37:21:58,384 --> 37:22:02,720
procente de elevi care obțin scoruri

50062
37:22:00,160 --> 37:22:05,664
dincolo de 70. Nu? Să rulăm asta. Şi

50063
37:22:02,720 --> 37:22:09,840
aici avem rezultatul. De jos 21,81%

50064
37:22:05,664 --> 37:22:13,840
scoruri sub 64, în timp ce 24% au peste 70

50065
37:22:09,840 --> 37:22:15,920
iar 50% sunt între 65 și 69. Corect

50066
37:22:13,840 --> 37:22:17,840
acum hai să continuăm cu

50067
37:22:15,920 --> 37:22:19,520
parte de segregare a datelor. Deci pentru

50068
37:22:17,840 --> 37:22:22,160
segregare vom crea trei

50069
37:22:19,520 --> 37:22:25,840
diferite variabile A, B, C. Deci mai întâi A

50070
37:22:22,160 --> 37:22:29,440
este egală cu lungimea DF revendicată. Deci

50071
37:22:25,840 --> 37:22:34,000
hai să copiem numele coloanei, scuze date

50072
37:22:29,440 --> 37:22:36,640
numele cadrului lungimea DF curățată în interior

50073
37:22:34,000 --> 37:22:40,320
la parantezele pătrate vom adăuga din nou DF

50074
37:22:36,640 --> 37:22:42,720
curățat de variabila țintă care este examen

50075
37:22:40,320 --> 37:22:46,880
scor

50076
37:22:42,720 --> 37:22:50,640
haideți să adăugăm aici și ghilimele simple

50077
37:22:46,880 --> 37:22:53,440
care marchează între sau mai puțin

50078
37:22:50,640 --> 37:22:56,160
decât să începem cu mai puțin sau egal

50079
37:22:53,440 --> 37:23:02,160
la 64 nu vom lua în considerare este 65 vom lua

50080
37:22:56,160 --> 37:23:06,480
considera 64 impartit la len de df curatat

50081
37:23:02,160 --> 37:23:09,600
țintă variabilă scor examen ghilimele simple

50082
37:23:06,480 --> 37:23:11,664
în 100

50083
37:23:09,600 --> 37:23:14,384
care ne va da acum procentul

50084
37:23:11,664 --> 37:23:18,240
în mod similar, să copiem și să lipim asta

50085
37:23:14,384 --> 37:23:19,920
încă de trei ori pentru B și C. Deci aici

50086
37:23:18,240 --> 37:23:24,000
în loc de minus ar trebui să adăugăm

50087
37:23:19,920 --> 37:23:26,560
egal cu si altul. Deci aici

50088
37:23:24,000 --> 37:23:30,480
egal cu și în loc de A voi scrie

50089
37:23:26,560 --> 37:23:35,600
B și ultimul este C. Și în loc de

50090
37:23:30,480 --> 37:23:38,640
64 vom adăuga 70 aici pentru sus și aici

50091
37:23:35,600 --> 37:23:42,080
vom face câteva modificări. Ar trebui să fie

50092
37:23:38,640 --> 37:23:45,440
mai mare sau egal cu

50093
37:23:42,080 --> 37:23:50,384
65. Deci aceasta este a treia categorie A B C

50094
37:23:45,440 --> 37:23:54,880
și apoi vom continua cu tipărirea

50095
37:23:50,384 --> 37:23:57,600
dosarele. Deci tipăriți

50096
37:23:54,880 --> 37:24:01,840
partea de jos

50097
37:23:57,600 --> 37:24:04,000
pentru prima care este f de

50098
37:24:01,840 --> 37:24:07,200
a

50099
37:24:04,000 --> 37:24:08,880
este de a face 2f

50100
37:24:07,200 --> 37:24:12,640
și vom adăuga simbolul procentului

50101
37:24:08,880 --> 37:24:14,480
aici r sub

50102
37:24:12,640 --> 37:24:17,744
64.

50103
37:24:14,480 --> 37:24:21,560
Acum putem copia și lipi același lucru aici și

50104
37:24:17,744 --> 37:24:21,560
putem schimba variabilele.

50105
37:24:21,600 --> 37:24:32,440
Deci aici vom adăuga sub peste 70.

50106
37:24:27,104 --> 37:24:32,440
În sfârșit, între cei din mijloc

50107
37:24:33,280 --> 37:24:39,664
65 și 70.

50108
37:24:36,480 --> 37:24:44,480
Iată. Aici vom schimba

50109
37:24:39,664 --> 37:24:46,960
valori de la A la B și aici de la A la C.

50110
37:24:44,480 --> 37:24:49,280
Iată. Și putem alerga rapid

50111
37:24:46,960 --> 37:24:51,440
această interogare. Deci nu e 70. A fost

50112
37:24:49,280 --> 37:24:54,080
ar trebui să aibă 69.

50113
37:24:51,440 --> 37:24:58,720
Iată. Așa că am uitat să menționăm

50114
37:24:54,080 --> 37:25:01,744
acesta anume. Acum hai să rulăm asta.

50115
37:24:58,720 --> 37:25:04,880
Iată. Deci avem 21%

50116
37:25:01,744 --> 37:25:08,960
dintre persoanele care au sub 64 de ani, 24%

50117
37:25:04,880 --> 37:25:10,880
peste 70 și 53% sunt în medie.

50118
37:25:08,960 --> 37:25:13,024
Așa că cred că școala se concentrează pe

50119
37:25:10,880 --> 37:25:15,440
îmbunătățirea acestui procent special,

50120
37:25:13,024 --> 37:25:17,600
reducerea acestui procent anume și

50121
37:25:15,440 --> 37:25:19,664
crescând acest procent special

50122
37:25:17,600 --> 37:25:22,320
și încercați să eliminați dacă este posibil acest lucru

50123
37:25:19,664 --> 37:25:25,104
unul special care sunt sub 64. Deci

50124
37:25:22,320 --> 37:25:28,160
asta e motoa generala cred. Acum asa

50125
37:25:25,104 --> 37:25:30,880
departe atât de bine. Să încercăm acum să eliminăm

50126
37:25:28,160 --> 37:25:32,640
valori infinite din HTML, nu? Deci

50127
37:25:30,880 --> 37:25:34,480
înainte de asta, să adăugăm asta

50128
37:25:32,640 --> 37:25:37,600
un anumit cod HTML aici. Deci care

50129
37:25:34,480 --> 37:25:39,024
explică ceea ce încercăm să facem. Deci noi

50130
37:25:37,600 --> 37:25:41,024
va implementa mai întâi codul care

50131
37:25:39,024 --> 37:25:43,600
previne avertismentul despre valori infinite

50132
37:25:41,024 --> 37:25:45,920
în timpul vizualizării datelor. Și acum haideți

50133
37:25:43,600 --> 37:25:48,960
adăugați codul care va încerca să îl elimine

50134
37:25:45,920 --> 37:25:52,880
uh valorile infinite. Să copiem asta

50135
37:25:48,960 --> 37:25:56,640
un anumit cadru de date curățat uh date

50136
37:25:52,880 --> 37:25:59,640
numele cadrului aici. Acum df curatat

50137
37:25:56,640 --> 37:25:59,640
dotreplace

50138
37:26:01,200 --> 37:26:08,720
paranteze pătrate np dot info

50139
37:26:07,200 --> 37:26:11,440
virgulă

50140
37:26:08,720 --> 37:26:14,240
minus np

50141
37:26:11,440 --> 37:26:16,720
puncte informații din aceste paranteze pătrate

50142
37:26:14,240 --> 37:26:18,384
punct np

50143
37:26:16,720 --> 37:26:20,720
na

50144
37:26:18,384 --> 37:26:24,320
valorile non na pe care încercăm să le eliminăm

50145
37:26:20,720 --> 37:26:27,920
na valori în locul acelor valori pe tine

50146
37:26:24,320 --> 37:26:31,280
putem scrie adevărat și după aceea vom face

50147
37:26:27,920 --> 37:26:33,744
încercați să eliminați nulul. Deci dacă este

50148
37:26:31,280 --> 37:26:36,160
nulă

50149
37:26:33,744 --> 37:26:38,080
suma de puncte da-mi numărul total de nul

50150
37:26:36,160 --> 37:26:40,384
valori după aceasta. Corect? Deci hai să încercăm

50151
37:26:38,080 --> 37:26:43,744
să execute asta. Iată. Deci toate

50152
37:26:40,384 --> 37:26:45,600
intrările nule au fost eliminate aici.

50153
37:26:43,744 --> 37:26:48,080
Acum să vedem distribuția

50154
37:26:45,600 --> 37:26:51,360
valori numerice aici. Deci înainte de asta

50155
37:26:48,080 --> 37:26:54,080
hai să adăugăm codul HTML pentru asta. Deci

50156
37:26:51,360 --> 37:26:56,560
hai să rulăm repede asta. Deci distribuția

50157
37:26:54,080 --> 37:26:59,440
a valorilor numerice. Așa vom fi

50158
37:26:56,560 --> 37:27:02,960
luând în considerare acești trei parametri. Deci

50159
37:26:59,440 --> 37:27:05,600
dacă te întorci aici, poți să vezi

50160
37:27:02,960 --> 37:27:07,920
prezența studiată și scorurile anterioare.

50161
37:27:05,600 --> 37:27:10,560
Deci, vom lua în considerare aceste trei

50162
37:27:07,920 --> 37:27:13,200
valorile sau aceste trei coloane și verificați

50163
37:27:10,560 --> 37:27:16,160
distribuția acestor variabile

50164
37:27:13,200 --> 37:27:19,440
împotriva punctajului la examen. Deci este

50165
37:27:16,160 --> 37:27:22,480
făcând orice fel de variație pe care o cunoști

50166
37:27:19,440 --> 37:27:24,080
dacă participarea este mare? Dacă dacă

50167
37:27:22,480 --> 37:27:28,320
prezența este mare este scorul la examen

50168
37:27:24,080 --> 37:27:31,920
înalt și uh în afară de asta avem dacă

50169
37:27:28,320 --> 37:27:34,384
studiile noastre este mare este scorul uh nota

50170
37:27:31,920 --> 37:27:36,320
este mare și dacă scorurile anterioare sunt

50171
37:27:34,384 --> 37:27:38,880
mare există șansa de a deveni mai bine

50172
37:27:36,320 --> 37:27:40,640
scorurile la acest examen special. Deci ce

50173
37:27:38,880 --> 37:27:42,480
încercăm să facem este să încercăm

50174
37:27:40,640 --> 37:27:45,360
vezi dacă există vreo implicare directă

50175
37:27:42,480 --> 37:27:48,080
a numărului de ore de studiu și a numărului de

50176
37:27:45,360 --> 37:27:49,744
zile de participare și numărul de uh sau the

50177
37:27:48,080 --> 37:27:52,080
numărul de note pe care le-au primit în

50178
37:27:49,744 --> 37:27:55,024
cursul anterior și vom încerca să construim un

50179
37:27:52,080 --> 37:27:57,744
vizualizare pe acel front.

50180
37:27:55,024 --> 37:28:00,800
Deci hai să mergem și să construim asta. Așa că vom încerca

50181
37:27:57,744 --> 37:28:04,744
încercați să scrieți codul aici.

50182
37:28:00,800 --> 37:28:04,744
Axa figurii

50183
37:28:05,104 --> 37:28:10,160
egal tot

50184
37:28:08,080 --> 37:28:12,560
punct

50185
37:28:10,160 --> 37:28:13,840
subploturi. Deci vom avea trei

50186
37:28:12,560 --> 37:28:16,160
diferite parcele aici de când suntem

50187
37:28:13,840 --> 37:28:18,160
luând în considerare trei u diferite

50188
37:28:16,160 --> 37:28:22,560
categorii.

50189
37:28:18,160 --> 37:28:28,080
Și dimensiunea fixă ar trebui să fie egală cu

50190
37:28:22,560 --> 37:28:30,480
12A 4. Iată. Acum

50191
37:28:28,080 --> 37:28:36,720
accesul

50192
37:28:30,480 --> 37:28:39,024
este egal cu a accesa variabila punct

50193
37:28:36,720 --> 37:28:41,360
pe idx

50194
37:28:39,024 --> 37:28:44,600
apel prin virgulă

50195
37:28:41,360 --> 37:28:44,600
în enumerare

50196
37:28:52,384 --> 37:28:57,840
iar noi vom încerca să importam pe mare

50197
37:28:54,880 --> 37:29:01,840
biblioteca aici. Vom încerca să creăm

50198
37:28:57,840 --> 37:29:04,840
histo complotează aici. Histograme aici

50199
37:29:01,840 --> 37:29:04,840
complot.

50200
37:29:22,160 --> 37:29:25,840
Deci, stilul de linie îl vom selecta

50201
37:29:24,160 --> 37:29:28,720
unul

50202
37:29:25,840 --> 37:29:33,640
iar virgula

50203
37:29:28,720 --> 37:29:33,640
lățimea liniei va fi de 0,7.

50204
37:29:34,240 --> 37:29:40,840
Iată. Următorul va fi accesul

50205
37:29:41,840 --> 37:29:47,600
set de puncte

50206
37:29:44,240 --> 37:29:50,560
titlu. Deci pentru asta ne vom stabili

50207
37:29:47,600 --> 37:29:52,800
titlul ca distribuție de coloane. Deci

50208
37:29:50,560 --> 37:29:55,664
coloanele vor fi cele trei uh

50209
37:29:52,800 --> 37:29:59,200
prezență, ore studiate și ce

50210
37:29:55,664 --> 37:30:02,000
a fost al treilea pe care l-am considerat

50211
37:29:59,200 --> 37:30:03,664
cursul anterior. Corect? Deci în loc de

50212
37:30:02,000 --> 37:30:05,920
menționându-le în mod specific, ceea ce noi

50213
37:30:03,664 --> 37:30:10,240
putem doar să scriem coloane

50214
37:30:05,920 --> 37:30:15,104
aici. C L și închideți.

50215
37:30:10,240 --> 37:30:18,720
Iată. Și în sfârșit,

50216
37:30:15,104 --> 37:30:21,744
plt.strâns Dreapta.

50217
37:30:18,720 --> 37:30:24,800
Și arată intriga. Iată. Să

50218
37:30:21,744 --> 37:30:27,200
rulați rapid această interogare. Fugi. Și acum noi

50219
37:30:24,800 --> 37:30:29,104
va avea vizualizările aici.

50220
37:30:27,200 --> 37:30:30,720
Deci, puteți vedea direct

50221
37:30:29,104 --> 37:30:34,080
implicarea acestor trei parametri

50222
37:30:30,720 --> 37:30:36,000
aici. Dacă ei încearcă să ajute dacă

50223
37:30:34,080 --> 37:30:37,440
atunci se mărește numărul de ore

50224
37:30:36,000 --> 37:30:39,200
poti vedea daca exista ceva mai bun

50225
37:30:37,440 --> 37:30:40,800
îmbunătățirea scorurilor. Dacă prezenţa

50226
37:30:39,200 --> 37:30:44,800
este crescută, dacă există o îmbunătățire

50227
37:30:40,800 --> 37:30:46,640
în scoruri sau dacă uh anterioară înscrie

50228
37:30:44,800 --> 37:30:49,360
ajutați, atunci puteți afla cum

50229
37:30:46,640 --> 37:30:52,240
este. Iată. Acum putem scrie a

50230
37:30:49,360 --> 37:30:54,384
rezultat aici sub forma unei pagini HTML.

50231
37:30:52,240 --> 37:30:56,720
Și dacă rulăm asta, îți va oferi

50232
37:30:54,384 --> 37:30:58,240
rezultat. Pauzele sau golurile din oră

50233
37:30:56,720 --> 37:31:00,880
variabila de studiu se poate datora

50234
37:30:58,240 --> 37:31:02,880
respondenții răspunzând corespunzător. The

50235
37:31:00,880 --> 37:31:05,200
variabile prezența și scorurile anterioare

50236
37:31:02,880 --> 37:31:07,024
care prezintă o distribuţie uniformă

50237
37:31:05,200 --> 37:31:09,280
au un impact normal asupra scorurilor la examen

50238
37:31:07,024 --> 37:31:11,520
variabilă care este variabila noastră țintă.

50239
37:31:09,280 --> 37:31:13,744
Acum să continuăm cu o altă parte a

50240
37:31:11,520 --> 37:31:15,104
această sesiune care va fi despre

50241
37:31:13,744 --> 37:31:17,360
relația dintre numerice

50242
37:31:15,104 --> 37:31:19,360
valorile și variabilele țintă. Acum noi

50243
37:31:17,360 --> 37:31:22,384
va copia lipi același cod și va face

50244
37:31:19,360 --> 37:31:24,480
câteva minute modificări ale acestuia. Deci singurul

50245
37:31:22,384 --> 37:31:27,280
schimbarea pe care i-am făcut-o este că încercăm

50246
37:31:24,480 --> 37:31:28,960
să construim un complot de dispersie. Deci vom face

50247
37:31:27,280 --> 37:31:33,104
primesc un grafic de dispersie aici. Dar

50248
37:31:28,960 --> 37:31:35,104
înainte de asta să încercăm să adăugăm altul

50249
37:31:33,104 --> 37:31:38,240
aici și încercați să adăugați un cod HTML

50250
37:31:35,104 --> 37:31:40,480
ceea ce explică de ce o facem.

50251
37:31:38,240 --> 37:31:41,920
Iată o diagramă de dispersie. Deci

50252
37:31:40,480 --> 37:31:44,240
practic, acestea două sunt unul și cel

50253
37:31:41,920 --> 37:31:46,560
la fel. Aici folosim câteva grafice pe coloană. Deci

50254
37:31:44,240 --> 37:31:48,160
aici am făcut același lucru folosind scatter

50255
37:31:46,560 --> 37:31:50,640
complot care va ajuta la o mai bună

50256
37:31:48,160 --> 37:31:52,560
înţelegere. Acum vom încerca să construim

50257
37:31:50,640 --> 37:31:54,240
unele corelații.

50258
37:31:52,560 --> 37:31:56,384
Deci, practic, se numește o listă

50259
37:31:54,240 --> 37:31:58,240
se creează corelația care conține

50260
37:31:56,384 --> 37:32:00,720
numele coloanelor pentru care doriți

50261
37:31:58,240 --> 37:32:04,240
pentru a calcula corelația. Deci aici înăuntru

50262
37:32:00,720 --> 37:32:06,384
situația noastră este df c r care este

50263
37:32:04,240 --> 37:32:08,320
un cadru de date și este creat de

50264
37:32:06,384 --> 37:32:11,200
selectând numai aceste coloane pentru df

50265
37:32:08,320 --> 37:32:12,720
cadru de date curățat creat eficient a

50266
37:32:11,200 --> 37:32:14,800
noul cadru de date care conține numai

50267
37:32:12,720 --> 37:32:17,520
coloane specificate. Acum al doilea

50268
37:32:14,800 --> 37:32:20,720
care este co r care este un calcul

50269
37:32:17,520 --> 37:32:22,960
corelație. Deci această metodă calculează

50270
37:32:20,720 --> 37:32:26,640
matricea de corelație pentru coloanele selectate

50271
37:32:22,960 --> 37:32:28,384
care este n df c r. Cel indica

50272
37:32:26,640 --> 37:32:30,160
corelație pozitivă perfectă minus unu

50273
37:32:28,384 --> 37:32:31,840
indică negativul perfect

50274
37:32:30,160 --> 37:32:34,080
corelația și zero indică nr

50275
37:32:31,840 --> 37:32:37,104
corelație. Și în sfârșit configurarea

50276
37:32:34,080 --> 37:32:39,280
complot. Această linie stabilește dimensiunea figurii

50277
37:32:37,104 --> 37:32:42,720
a intrigii. În acest special

50278
37:32:39,280 --> 37:32:44,880
situație alegem cinci și patru.

50279
37:32:42,720 --> 37:32:47,024
Acum, să încercăm rapid să executăm

50280
37:32:44,880 --> 37:32:50,960
această întrebare și vedeți răspunsul. Iar noi

50281
37:32:47,024 --> 37:32:52,560
va adăuga, de asemenea, codul HTML pentru acest lucru

50282
37:32:50,960 --> 37:32:56,800
pentru care avem o mai bună înțelegere

50283
37:32:52,560 --> 37:32:58,720
aceasta. Deci vom adăuga acel HTML

50284
37:32:56,800 --> 37:33:01,024
uh caseta aici care va explica ce

50285
37:32:58,720 --> 37:33:03,920
exact s-a întâmplat aici. Deci acesta este al nostru

50286
37:33:01,024 --> 37:33:06,560
complot și aceasta este corelația. Acum

50287
37:33:03,920 --> 37:33:09,440
hai să încercăm să adăugăm corect codul HTML

50288
37:33:06,560 --> 37:33:12,000
aici. Rezultatul acestor date particulare

50289
37:33:09,440 --> 37:33:14,320
vizualizarea va fi menținută aici.

50290
37:33:12,000 --> 37:33:16,480
Deci orele de studiu și de prezență

50291
37:33:14,320 --> 37:33:18,384
arată o corelație pozitivă cu

50292
37:33:16,480 --> 37:33:20,384
variabila țintă care este ora de examene.

50293
37:33:18,384 --> 37:33:22,720
Cu toate acestea, cursul anterior pare să aibă

50294
37:33:20,384 --> 37:33:24,880
nici o relație sau puțină cu

50295
37:33:22,720 --> 37:33:27,360
variabila tinta. Chiar acum hai

50296
37:33:24,880 --> 37:33:30,560
continuă cu următoarea noastră parte din asta

50297
37:33:27,360 --> 37:33:34,000
sesiune. Deci acum vom încerca să identificăm

50298
37:33:30,560 --> 37:33:37,024
relația dintre studii

50299
37:33:34,000 --> 37:33:40,080
ore și prezență și extrașcolare

50300
37:33:37,024 --> 37:33:41,440
scoruri. Corect? Deci avem alte u

50301
37:33:40,080 --> 37:33:43,840
coloane de luat în considerare care este

50302
37:33:41,440 --> 37:33:45,600
activități extracurriculare. Deci există

50303
37:33:43,840 --> 37:33:47,840
o credinţă că activităţile extraşcolare

50304
37:33:45,600 --> 37:33:49,600
va ajuta, de asemenea, elevii să studieze mai bine.

50305
37:33:47,840 --> 37:33:51,744
Deci vom afla dacă există o relație

50306
37:33:49,600 --> 37:33:53,280
între variabila ţintă şi aceasta

50307
37:33:51,744 --> 37:33:56,080
participarea la activități extracurriculare

50308
37:33:53,280 --> 37:33:58,800
și ore de studiu. Acum să adăugăm rapid

50309
37:33:56,080 --> 37:34:02,720
codul aici. Acum să executăm rapid

50310
37:33:58,800 --> 37:34:04,240
codul. Acum avem vizualizarea

50311
37:34:02,720 --> 37:34:06,000
ceea ce explică relaţia dintre

50312
37:34:04,240 --> 37:34:08,480
numărul de ore studiate

50313
37:34:06,000 --> 37:34:10,800
activități extracurriculare etc. Deci aici

50314
37:34:08,480 --> 37:34:13,920
este și acum să adăugăm un cod HTML

50315
37:34:10,800 --> 37:34:15,440
care explică acest rezultat

50316
37:34:13,920 --> 37:34:18,920
în acest cod special trebuia să

50317
37:34:15,440 --> 37:34:18,920
fi adăugat aici.

50318
37:34:20,960 --> 37:34:26,960
Deci aceasta este coloana rezultată aici.

50319
37:34:24,880 --> 37:34:28,880
Acum, aici se explică despre

50320
37:34:26,960 --> 37:34:30,960
influențelor pe care le efectuează. Deci

50321
37:34:28,880 --> 37:34:34,640
activități extracale, venituri ale părinților și

50322
37:34:30,960 --> 37:34:37,200
lucruri suplimentare care influențează scorurile

50323
37:34:34,640 --> 37:34:40,800
și iată.

50324
37:34:37,200 --> 37:34:43,200
Acum să luăm în considerare și alte coloane

50325
37:34:40,800 --> 37:34:45,200
corect ceilalți parametri cum ar fi

50326
37:34:43,200 --> 37:34:47,440
resursele sunt disponibile sau nu parentale

50327
37:34:45,200 --> 37:34:50,240
educație și alte lucruri care de asemenea

50328
37:34:47,440 --> 37:34:52,000
ar fi putut influența scorurile la examene ale

50329
37:34:50,240 --> 37:34:54,080
elevilor. Deci, pentru asta, să adăugăm un HTML

50330
37:34:52,000 --> 37:34:55,360
cod astfel încât să avem o pagină HTML aici

50331
37:34:54,080 --> 37:34:57,520
care explică ce urmează

50332
37:34:55,360 --> 37:35:00,560
procedura pe care o urmam. Corect

50333
37:34:57,520 --> 37:35:02,240
acum să adăugăm interogarea aici. Deci aici noi

50334
37:35:00,560 --> 37:35:04,720
iau în considerare ceilalți parametri

50335
37:35:02,240 --> 37:35:06,640
cum ar fi venitul familiei, influența de la egal la egal,

50336
37:35:04,720 --> 37:35:08,800
nivel de motivație, gen, parental

50337
37:35:06,640 --> 37:35:10,880
implicare, nivelul educațional al părinților

50338
37:35:08,800 --> 37:35:13,520
și activități extracurriculare. Iar noi

50339
37:35:10,880 --> 37:35:16,320
le consideră împotriva țintei

50340
37:35:13,520 --> 37:35:19,360
variabilă care este scorul la examen. Și acum

50341
37:35:16,320 --> 37:35:20,960
hai sa executam aceasta interogare. Iată.

50342
37:35:19,360 --> 37:35:23,200
Acum am generat un grafic care

50343
37:35:20,960 --> 37:35:25,520
explică despre acest anume

50344
37:35:23,200 --> 37:35:27,840
parametri față de variabila țintă.

50345
37:35:25,520 --> 37:35:31,920
Și acum să adăugăm pagina HTML aici

50346
37:35:27,840 --> 37:35:34,320
care explică aceste rezultate.

50347
37:35:31,920 --> 37:35:36,800
Să-l rulăm repede. Și iată.

50348
37:35:34,320 --> 37:35:38,720
Deci când anumiți factori afectează Q1 și Q2

50349
37:35:36,800 --> 37:35:40,720
dar nu Q2, se poate înțelege că

50350
37:35:38,720 --> 37:35:42,880
individul a depășit provocările

50351
37:35:40,720 --> 37:35:45,024
prin efort personal. Corect? Deci dacă

50352
37:35:42,880 --> 37:35:47,024
politici guvernamentale și sociale corporative

50353
37:35:45,024 --> 37:35:49,360
contribuatorii se concentrează pe abordare

50354
37:35:47,024 --> 37:35:52,000
acest aspect, se pare că am putea

50355
37:35:49,360 --> 37:35:53,744
a crea o țară dinamică cu mai mare

50356
37:35:52,000 --> 37:35:56,320
mobilitate socială și oportunități deschise

50357
37:35:53,744 --> 37:35:58,080
pentru toti. Corect? Deci dacă extracurricular

50358
37:35:56,320 --> 37:35:59,920
activităţile pot depăşi influenţa

50359
37:35:58,080 --> 37:36:01,664
alte variabile ale performanței academice

50360
37:35:59,920 --> 37:36:04,720
atunci ar trebui să promovăm acest tip de

50361
37:36:01,664 --> 37:36:07,360
dreptul de mediu. Deci așa ești tu

50362
37:36:04,720 --> 37:36:09,920
poate obține extragerea unor statistici

50363
37:36:07,360 --> 37:36:14,720
analiza acestui set de date special.

50364
37:36:09,920 --> 37:36:16,560
Acum să redenumim rapid acest piton

50365
37:36:14,720 --> 37:36:18,720
eda

50366
37:36:16,560 --> 37:36:20,384
elevilor

50367
37:36:18,720 --> 37:36:23,360
performanta

50368
37:36:20,384 --> 37:36:26,080
și îl puteți redenumi și salva rapid.

50369
37:36:23,360 --> 37:36:28,480
Bun venit la probabilitatea de reîmprospătare la matematică

50370
37:36:26,080 --> 37:36:30,960
și statistici.

50371
37:36:28,480 --> 37:36:33,104
În această lecție, vom explica

50372
37:36:30,960 --> 37:36:34,720
conceptele de statistică şi

50373
37:36:33,104 --> 37:36:37,280
probabilitate.

50374
37:36:34,720 --> 37:36:40,160
Descrieți probabilitatea condiționată. Definiți

50375
37:36:37,280 --> 37:36:42,720
regula probabilității în lanț. Discutați

50376
37:36:40,160 --> 37:36:45,520
măsura varianței. Identificați

50377
37:36:42,720 --> 37:36:48,800
tipuri de distribuție gshian.

50378
37:36:45,520 --> 37:36:51,520
Baza de statistică și probabilitate.

50379
37:36:48,800 --> 37:36:53,520
Probabilitate și statistică. Știința datelor

50380
37:36:51,520 --> 37:36:56,240
se bazează foarte mult pe estimări şi

50381
37:36:53,520 --> 37:36:58,880
previziuni. O parte semnificativă a

50382
37:36:56,240 --> 37:37:00,800
știința datelor este alcătuită din evaluări

50383
37:36:58,880 --> 37:37:02,880
si prognoza.

50384
37:37:00,800 --> 37:37:05,520
Se folosesc metode statistice pentru a face

50385
37:37:02,880 --> 37:37:07,920
estimări pentru analize ulterioare.

50386
37:37:05,520 --> 37:37:10,720
Teoria probabilității este utilă pentru realizarea

50387
37:37:07,920 --> 37:37:13,600
previziuni. Metodele statistice sunt

50388
37:37:10,720 --> 37:37:16,320
dependentă foarte mult de teoria probabilității

50389
37:37:13,600 --> 37:37:19,664
și toate probabilitățile și statisticile sunt

50390
37:37:16,320 --> 37:37:22,960
dependent de date. Datele sunt informații

50391
37:37:19,664 --> 37:37:26,320
dobândite pentru referință sau cercetare prin

50392
37:37:22,960 --> 37:37:29,104
observații, fapte și măsurători.

50393
37:37:26,320 --> 37:37:31,600
Datele sunt un set de fapte structurate în

50394
37:37:29,104 --> 37:37:34,720
forma în care computerele pot interpreta astfel

50395
37:37:31,600 --> 37:37:38,384
ca numere, cuvinte, estimări și

50396
37:37:34,720 --> 37:37:40,720
vederi. Importanța datelor. Datele ajută în

50397
37:37:38,384 --> 37:37:42,960
văzând mai multe despre informații de către

50398
37:37:40,720 --> 37:37:45,520
identificarea posibilelor legături între

50399
37:37:42,960 --> 37:37:48,000
două caracteristici. Datele ajută la

50400
37:37:45,520 --> 37:37:50,800
detectarea distorsiunii prin descoperire

50401
37:37:48,000 --> 37:37:53,024
modele ascunse bazate pe anterioare

50402
37:37:50,800 --> 37:37:55,744
modele de informare. Datele pot fi

50403
37:37:53,024 --> 37:37:58,240
folosit pentru a anticipa viitorul sau

50404
37:37:55,744 --> 37:38:00,560
prezice starea actuală a lucrurilor.

50405
37:37:58,240 --> 37:38:02,800
De asemenea, datele ajută la determinarea dacă

50406
37:38:00,560 --> 37:38:05,744
două informații au oricare

50407
37:38:02,800 --> 37:38:09,280
exemplu în comun sau nu. Tipuri de

50408
37:38:05,744 --> 37:38:11,600
date. Datele ar putea fi cantitative. Asta

50409
37:38:09,280 --> 37:38:14,320
sunt date care pot fi măsurate sau numărate

50410
37:38:11,600 --> 37:38:16,880
în cifre. Sau poate fi calitativ

50411
37:38:14,320 --> 37:38:19,744
care sunt date care sunt în general împărțite

50412
37:38:16,880 --> 37:38:21,664
în grupuri sau în cuvinte mai simple care

50413
37:38:19,744 --> 37:38:24,880
nu poate fi numărat sau măsurat în

50414
37:38:21,664 --> 37:38:27,280
numere. Să luăm în considerare un exemplu. A

50415
37:38:24,880 --> 37:38:29,440
datele despre informațiile despre clienți ale unei bănci pot

50416
37:38:27,280 --> 37:38:32,560
conţine cantitative şi calitative

50417
37:38:29,440 --> 37:38:36,160
date. Luați în considerare acest instantaneu unde suntem

50418
37:38:32,560 --> 37:38:39,920
au ID de client, prenume, geografie,

50419
37:38:36,160 --> 37:38:42,320
sex, vârstă, sold, are C sau card este

50420
37:38:39,920 --> 37:38:45,440
membru activ. Printre aceste variabile

50421
37:38:42,320 --> 37:38:47,920
putem vedea că numele de familie este în mare parte calitativ

50422
37:38:45,440 --> 37:38:51,360
întrucât nu poate fi numărat și măsurat în

50423
37:38:47,920 --> 37:38:53,840
numere. Geografia și genul sunt, de asemenea

50424
37:38:51,360 --> 37:38:57,200
calitative deoarece nu pot fi numărate

50425
37:38:53,840 --> 37:39:00,320
numere și sunt în mare parte grupuri. are C sau

50426
37:38:57,200 --> 37:39:02,560
card care are card de credit și este

50427
37:39:00,320 --> 37:39:05,024
membru activ deși conțin

50428
37:39:02,560 --> 37:39:07,744
numeric în formă dar acestea sunt

50429
37:39:05,024 --> 37:39:11,360
categoric, ceea ce înseamnă că acestea au fost

50430
37:39:07,744 --> 37:39:14,960
împărțit în grupuri de unu și zero care

50431
37:39:11,360 --> 37:39:18,720
reprezintă, prin urmare, da și nu ca răspuns

50432
37:39:14,960 --> 37:39:21,360
aceste două variabile sunt de asemenea calitative

50433
37:39:18,720 --> 37:39:24,000
ID-ul clientului este din nou deși a

50434
37:39:21,360 --> 37:39:27,104
date numerice însă semnificația

50435
37:39:24,000 --> 37:39:28,720
sau intuiția din spatele ID-ului clientului este

50436
37:39:27,104 --> 37:39:31,024
categoric.

50437
37:39:28,720 --> 37:39:35,280
Prin urmare, poate fi păstrat în calitativ

50438
37:39:31,024 --> 37:39:37,600
date de asemenea. Cu toate acestea, vârsta și echilibrul

50439
37:39:35,280 --> 37:39:39,600
acestea sunt informaţii numerice care

50440
37:39:37,600 --> 37:39:42,080
au fost măsurate sau numărate și

50441
37:39:39,600 --> 37:39:44,240
se pot efectua operaţii numerice pe

50442
37:39:42,080 --> 37:39:46,560
ei. Prin urmare, acestea sunt sub

50443
37:39:44,240 --> 37:39:49,664
categorii de date cantitative.

50444
37:39:46,560 --> 37:39:52,384
Introducere în statistica descriptivă.

50445
37:39:49,664 --> 37:39:54,560
Statistici descriptive. Un descriptiv

50446
37:39:52,384 --> 37:39:56,640
măsurarea este măsura sumară care

50447
37:39:54,560 --> 37:39:59,360
cantitativ înfățișează cel mai mult

50448
37:39:56,640 --> 37:40:01,280
caracteristici importante ale unui set de date

50449
37:39:59,360 --> 37:40:04,000
permițând o mai bună înțelegere a

50450
37:40:01,280 --> 37:40:06,160
informația. Datele pot fi măsurate ca

50451
37:40:04,000 --> 37:40:08,000
diferite niveluri. Nivelurile de

50452
37:40:06,160 --> 37:40:10,240
măsurarea descrie natura

50453
37:40:08,000 --> 37:40:13,200
informațiile stocate în datele atribuite

50454
37:40:10,240 --> 37:40:15,744
la variabile. Datele calitative pot

50455
37:40:13,200 --> 37:40:17,920
fi măsurat ca nominal sau ordinal.

50456
37:40:15,744 --> 37:40:20,640
Datele cantitative pot fi măsurate în

50457
37:40:17,920 --> 37:40:23,200
termeni de interval și tip de raport.

50458
37:40:20,640 --> 37:40:26,240
Date nominale. Datele sunt clasificate

50459
37:40:23,200 --> 37:40:28,800
folosind nume, etichete sau calități. Pentru

50460
37:40:26,240 --> 37:40:31,520
exemplu, numele mărcii, codul poștal și

50461
37:40:28,800 --> 37:40:34,720
gen. Datele ordinale pot fi aranjate în

50462
37:40:31,520 --> 37:40:38,000
ordonat sau clasat și poate fi comparat.

50463
37:40:34,720 --> 37:40:41,200
Exemplele includ note, recenzii cu stele,

50464
37:40:38,000 --> 37:40:43,664
poziția, cursa și data. Interval

50465
37:40:41,200 --> 37:40:46,160
data sunt datele care sunt comandate și au

50466
37:40:43,664 --> 37:40:49,520
diferențe semnificative între date

50467
37:40:46,160 --> 37:40:52,960
puncte. De exemplu, temperatura în Celsius

50468
37:40:49,520 --> 37:40:55,104
și anul nașterii. Datele raportului sunt similare

50469
37:40:52,960 --> 37:40:58,080
la nivelul intervalului cu adaosul

50470
37:40:55,104 --> 37:41:00,480
proprietatea zero inerent. matematică

50471
37:40:58,080 --> 37:41:03,520
calculele pot fi efectuate pe ambele

50472
37:41:00,480 --> 37:41:06,720
date de interval, precum și de raport. Pentru

50473
37:41:03,520 --> 37:41:09,360
de exemplu, înălțimea, vârsta și greutatea.

50474
37:41:06,720 --> 37:41:11,600
Populație versus eșantion. Înainte

50475
37:41:09,360 --> 37:41:13,920
analizând datele, este important să

50476
37:41:11,600 --> 37:41:17,104
a afla dacă este dintr-o populație sau

50477
37:41:13,920 --> 37:41:19,840
o mostră. Populația este o colecție de

50478
37:41:17,104 --> 37:41:22,880
toate articolele disponibile, precum și fiecare unitate

50479
37:41:19,840 --> 37:41:25,280
în studiul nostru. Eșantionul este un subset al

50480
37:41:22,880 --> 37:41:28,560
populaţie care conţine doar câteva

50481
37:41:25,280 --> 37:41:31,024
unități ale populației. Date despre populație

50482
37:41:28,560 --> 37:41:33,600
este utilizat pentru studiu atunci când grupul de date este

50483
37:41:31,024 --> 37:41:36,160
foarte mic și poate oferi tot ceea ce este necesar

50484
37:41:33,600 --> 37:41:39,024
informaţii. Se recoltează probe

50485
37:41:36,160 --> 37:41:42,480
aleatoriu și reprezintă întregul

50486
37:41:39,024 --> 37:41:45,360
populația în cel mai bun mod posibil.

50487
37:41:42,480 --> 37:41:48,000
Măsuri de tendință centrală. The

50488
37:41:45,360 --> 37:41:50,880
tendinţa centrală este o singură valoare care

50489
37:41:48,000 --> 37:41:53,600
ajută la descrierea datelor prin

50490
37:41:50,880 --> 37:41:55,664
determinarea poziţiei sale centrale.

50491
37:41:53,600 --> 37:41:58,320
Măsurile de tendinţă centrală sunt

50492
37:41:55,664 --> 37:42:01,520
cunoscute uneori sub numele de statistici rezumative sau

50493
37:41:58,320 --> 37:42:04,000
măsuri de amplasare centrală. Cel mai mult

50494
37:42:01,520 --> 37:42:07,664
măsurători populare ale tendinței centrale

50495
37:42:04,000 --> 37:42:10,000
sunt medie, mediană și mod. Normalul

50496
37:42:07,664 --> 37:42:12,640
distribuția este în formă de clopot

50497
37:42:10,000 --> 37:42:15,104
distribuție simetrică în care medie,

50498
37:42:12,640 --> 37:42:17,600
mediana și modul sunt toate egale. The

50499
37:42:15,104 --> 37:42:19,840
curba de aici arată în formă de clopot

50500
37:42:17,600 --> 37:42:22,800
curba sau distribuția normală a

50501
37:42:19,840 --> 37:42:26,080
variabila X. Punctul de aici, adică

50502
37:42:22,800 --> 37:42:28,160
X1 este punctul care reprezintă

50503
37:42:26,080 --> 37:42:31,664
medie, mediană și modul acesteia

50504
37:42:28,160 --> 37:42:34,880
distributie. Media medie este calculată prin

50505
37:42:31,664 --> 37:42:38,080
împărțind aceste sume a tuturor valorilor datelor la

50506
37:42:34,880 --> 37:42:40,320
numărul total de valori ale datelor. Se ajunge

50507
37:42:38,080 --> 37:42:43,440
afectate atunci când sunt neobișnuite sau

50508
37:42:40,320 --> 37:42:46,560
valori extreme. Este sensibil la

50509
37:42:43,440 --> 37:42:49,600
valori aberante. Media poate fi calculată ca

50510
37:42:46,560 --> 37:42:51,520
însumarea tuturor valorilor lui X din a

50511
37:42:49,600 --> 37:42:53,104
colecție împărțită la dimensiunea

50512
37:42:51,520 --> 37:42:55,664
colectare.

50513
37:42:53,104 --> 37:43:01,664
De exemplu, avem o colecție unde

50514
37:42:55,664 --> 37:43:03,840
avem valori ca 7 3 4 1 6 și 7.

50515
37:43:01,664 --> 37:43:07,200
Aflam suma acestor valori

50516
37:43:03,840 --> 37:43:11,840
care este 28 și sunt în total șase

50517
37:43:07,200 --> 37:43:14,640
valorile. Deci 28 / 6 ne oferă o valoare medie

50518
37:43:11,840 --> 37:43:16,320
de 4,66.

50519
37:43:14,640 --> 37:43:18,480
mediană,

50520
37:43:16,320 --> 37:43:20,560
este valoarea de mijloc în setul de

50521
37:43:18,480 --> 37:43:22,080
date care au fost sortate crescător

50522
37:43:20,560 --> 37:43:24,480
comanda.

50523
37:43:22,080 --> 37:43:27,024
Este o alternativă mai bună pentru a însemna de atunci

50524
37:43:24,480 --> 37:43:28,720
este mai puțin afectată de valori aberante și

50525
37:43:27,024 --> 37:43:31,024
deformat.

50526
37:43:28,720 --> 37:43:32,720
Este mai aproape de centrala actuală

50527
37:43:31,024 --> 37:43:35,024
valoare.

50528
37:43:32,720 --> 37:43:37,600
Mediana este calculată diferit pentru

50529
37:43:35,024 --> 37:43:39,920
diferite dimensiuni de date.

50530
37:43:37,600 --> 37:43:43,664
Diferențiat ca și cum numărul total de

50531
37:43:39,920 --> 37:43:46,720
valorile sunt impare sau dacă numărul total de

50532
37:43:43,664 --> 37:43:50,960
valorile sunt egale. Dacă dimensiunea datelor

50533
37:43:46,720 --> 37:43:54,000
este ciudat. De exemplu, în acest caz noi

50534
37:43:50,960 --> 37:43:56,640
au cinci elemente.

50535
37:43:54,000 --> 37:43:58,240
După ce sortăm orice valoare medie am

50536
37:43:56,640 --> 37:44:03,440
obţine

50537
37:43:58,240 --> 37:44:06,800
asta înseamnă n termen de 1 cu 2 în acest caz

50538
37:44:03,440 --> 37:44:09,664
5 1 / 2

50539
37:44:06,800 --> 37:44:12,240
acesta este al treilea termen care este patru este

50540
37:44:09,664 --> 37:44:14,640
valoarea mediană.

50541
37:44:12,240 --> 37:44:18,320
În cazul în care numărul total de valori

50542
37:44:14,640 --> 37:44:20,320
este chiar ca și cum aici există șase valori.

50543
37:44:18,320 --> 37:44:22,640
Media sau media celor două

50544
37:44:20,320 --> 37:44:25,664
valorile centrale este considerată drept cea

50545
37:44:22,640 --> 37:44:30,960
mediană. În acest caz, mediana este

50546
37:44:25,664 --> 37:44:33,520
media de 6 și patru care este cinci. Modul.

50547
37:44:30,960 --> 37:44:36,800
Modul reprezintă cea mai comună valoare în

50548
37:44:33,520 --> 37:44:40,080
setul de date. Nu este deloc afectat

50549
37:44:36,800 --> 37:44:42,080
prin observatii extreme.

50550
37:44:40,080 --> 37:44:45,200
Este cea mai bună măsură a centralului

50551
37:44:42,080 --> 37:44:46,800
tendința de a fi extrem de distorsionate sau nenormale

50552
37:44:45,200 --> 37:44:49,360
distributie.

50553
37:44:46,800 --> 37:44:51,664
Se determină modul pentru datele categorice

50554
37:44:49,360 --> 37:44:53,200
prin estimarea frecvenţelor pentru fiecare

50555
37:44:51,664 --> 37:44:55,280
categorii

50556
37:44:53,200 --> 37:44:58,800
iar apoi categoria cu cea mai mare

50557
37:44:55,280 --> 37:45:01,280
frecvența este considerată a fi mod.

50558
37:44:58,800 --> 37:45:03,840
Ca și în acest caz, 7 are cea mai mare

50559
37:45:01,280 --> 37:45:07,104
frecventa. Prin urmare, șapte devine modul

50560
37:45:03,840 --> 37:45:09,744
valoare. Cu toate acestea, în caz de continuu

50561
37:45:07,104 --> 37:45:11,600
date sau date cantitative, the

50562
37:45:09,744 --> 37:45:14,240
calculul modului este ușor

50563
37:45:11,600 --> 37:45:16,560
diferite. Primul pas în calcul

50564
37:45:14,240 --> 37:45:18,960
de mod este împărțirea datelor în

50565
37:45:16,560 --> 37:45:20,880
clase care sunt egale cu atunci

50566
37:45:18,960 --> 37:45:23,744
obținerea frecvenței punctelor de date

50567
37:45:20,880 --> 37:45:26,080
aflate în acea gamă de clase

50568
37:45:23,744 --> 37:45:29,200
iar în final selectând clasa cu

50569
37:45:26,080 --> 37:45:31,200
cea mai mare frecvență.

50570
37:45:29,200 --> 37:45:33,664
Folosind intervalul clasei respective și

50571
37:45:31,200 --> 37:45:35,920
frecvențe, putem obține modul final

50572
37:45:33,664 --> 37:45:39,360
valoare.

50573
37:45:35,920 --> 37:45:42,384
Folosind formula L 

50574
37:45:39,360 --> 37:45:47,920
minus F_sub_1 înmulțit la H împărțit la

50575
37:45:42,384 --> 37:45:50,800
FM minus F_sub_1 plus FM minus F_sub_2.

50576
37:45:47,920 --> 37:45:53,600
Aici L este limita inferioară sau limita inferioară

50577
37:45:50,800 --> 37:45:57,744
observarea clasei de mod.

50578
37:45:53,600 --> 37:46:00,880
H este dimensiunea clasei de mod.

50579
37:45:57,744 --> 37:46:03,024
FM este frecvența clasei de mod.

50580
37:46:00,880 --> 37:46:06,560
F_sub_1 este frecvența clasei

50581
37:46:03,024 --> 37:46:09,024
trecerea la modul. Și F_sub_2 este

50582
37:46:06,560 --> 37:46:11,440
frecvența clasei care reușește

50583
37:46:09,024 --> 37:46:13,200
modul. Aceasta ne oferă modul final

50584
37:46:11,440 --> 37:46:16,160
valoare.

50585
37:46:13,200 --> 37:46:18,000
Media versus așteptare.

50586
37:46:16,160 --> 37:46:19,600
Acum să vorbim despre medie versus

50587
37:46:18,000 --> 37:46:22,560
așteptare.

50588
37:46:19,600 --> 37:46:25,664
Deci, în general, folosim valoarea așteptată

50589
37:46:22,560 --> 37:46:28,640
sau așteptarea când vrem să calculăm

50590
37:46:25,664 --> 37:46:31,024
media unei distribuții de probabilitate

50591
37:46:28,640 --> 37:46:33,440
care reprezintă valoarea medie noi

50592
37:46:31,024 --> 37:46:36,880
așteptați să apară înainte de a colecta vreuna

50593
37:46:33,440 --> 37:46:39,360
date. Și pe de altă parte, mediul este

50594
37:46:36,880 --> 37:46:42,480
folosit practic atunci când vrem să calculăm

50595
37:46:39,360 --> 37:46:45,024
valoarea medie a unui eșantion dat.

50596
37:46:42,480 --> 37:46:48,720
Aceasta reprezintă valoarea medie a brutului

50597
37:46:45,024 --> 37:46:51,280
date pe care este posibil să le fi colectat deja.

50598
37:46:48,720 --> 37:46:53,520
Putem înțelege acest lucru folosind un simplu

50599
37:46:51,280 --> 37:46:56,384
exemplu.

50600
37:46:53,520 --> 37:46:59,024
Acum să calculăm valoarea așteptată a

50601
37:46:56,384 --> 37:47:01,600
această distribuție de probabilitate, putem

50602
37:46:59,024 --> 37:47:03,104
utilizați o formulă specifică din cea precedentă

50603
37:47:01,600 --> 37:47:05,520
discuție.

50604
37:47:03,104 --> 37:47:08,384
Aceasta va fi valoarea așteptată

50605
37:47:05,520 --> 37:47:13,200
unde X va fi valoarea datelor

50606
37:47:08,384 --> 37:47:15,600
iar acest PX este probabilitatea valorii.

50607
37:47:13,200 --> 37:47:17,744
De exemplu, am putea calcula

50608
37:47:15,600 --> 37:47:22,104
valoarea aşteptată pentru această probabilitate

50609
37:47:17,744 --> 37:47:22,104
distribuția să fie așa cum se arată.

50610
37:47:22,160 --> 37:47:29,664
Deci aici vor fi 1,45 goluri.

50611
37:47:27,520 --> 37:47:32,080
Deci acesta reprezintă numărul așteptat

50612
37:47:29,664 --> 37:47:34,640
de goluri pe care echipa le va înscrie în oricare

50613
37:47:32,080 --> 37:47:36,800
joc dat.

50614
37:47:34,640 --> 37:47:39,520
Și atunci dacă vorbești despre calcul

50615
37:47:36,800 --> 37:47:41,664
medie, deci calculăm de obicei media

50616
37:47:39,520 --> 37:47:44,384
după ce am adunat efectiv crud

50617
37:47:41,664 --> 37:47:46,720
date.

50618
37:47:44,384 --> 37:47:48,720
De exemplu, să presupunem că înregistrăm

50619
37:47:46,720 --> 37:47:53,320
numărul de goluri pe care le va face o echipă de fotbal

50620
37:47:48,720 --> 37:47:53,320
scor în 15 jocuri diferite.

50621
37:47:53,600 --> 37:47:58,240
Acum să calculăm numărul mediu de

50622
37:47:55,520 --> 37:48:01,840
goluri marcate pe meci,

50623
37:47:58,240 --> 37:48:04,480
putem folosi următoarea formulă

50624
37:48:01,840 --> 37:48:06,960
unde suma lui x este practic suma lui

50625
37:48:04,480 --> 37:48:08,960
toate obiectivele împărțite la n și

50626
37:48:06,960 --> 37:48:11,920
număr de înregistrări sau putem spune că

50627
37:48:08,960 --> 37:48:16,440
dimensiunea eșantionului.

50628
37:48:11,920 --> 37:48:16,440
Este așa cum se arată pe ecran.

50629
37:48:29,024 --> 37:48:34,960
Deci acesta reprezintă numărul mediu de

50630
37:48:31,200 --> 37:48:37,280
goluri marcate pe meci de echipă.

50631
37:48:34,960 --> 37:48:38,880
Măsuri de asimetrie.

50632
37:48:37,280 --> 37:48:41,104
Diferența dintre cele trei

50633
37:48:38,880 --> 37:48:42,640
curbe distincte pot fi studiate în aceasta

50634
37:48:41,104 --> 37:48:45,104
imagine.

50635
37:48:42,640 --> 37:48:48,480
Curba centrală este normală sau nu

50636
37:48:45,104 --> 37:48:51,440
curba skeus. Aici înseamnă, mediană și mod

50637
37:48:48,480 --> 37:48:53,744
toate se află pe același punct. Acest lucru este normal

50638
37:48:51,440 --> 37:48:57,600
curba este simetrică față de medie,

50639
37:48:53,744 --> 37:48:59,520
mediană și mod.

50640
37:48:57,600 --> 37:49:01,840
Asta înseamnă partea stângă a

50641
37:48:59,520 --> 37:49:04,880
curba este o imagine în oglindă a dreptei

50642
37:49:01,840 --> 37:49:07,664
partea de mână a curbei.

50643
37:49:04,880 --> 37:49:11,104
Cu toate acestea, în caz de distorsiuni negative

50644
37:49:07,664 --> 37:49:12,960
date, coada este alungită în stânga

50645
37:49:11,104 --> 37:49:15,024
partea mâinii

50646
37:49:12,960 --> 37:49:18,384
iar media este mai mică decât modul

50647
37:49:15,024 --> 37:49:21,600
iar valorile mediane sau este în stânga

50648
37:49:18,384 --> 37:49:23,744
partea de mână a modului.

50649
37:49:21,600 --> 37:49:26,320
Prin urmare, indicând faptul că valorile aberante sunt

50650
37:49:23,744 --> 37:49:29,280
în direcția negativă.

50651
37:49:26,320 --> 37:49:31,744
Pe de altă parte, în caz de pozitiv

50652
37:49:29,280 --> 37:49:35,200
denaturate, datele sunt concentrate pe

50653
37:49:31,744 --> 37:49:37,840
partea stângă a curbei.

50654
37:49:35,200 --> 37:49:41,024
În timp ce coada este alungită sau mai lungă

50655
37:49:37,840 --> 37:49:43,104
partea dreaptă a curbei,

50656
37:49:41,024 --> 37:49:44,800
media este mai mare decât modul și

50657
37:49:43,104 --> 37:49:47,104
mediană

50658
37:49:44,800 --> 37:49:49,600
sau se află în partea dreaptă a modului

50659
37:49:47,104 --> 37:49:53,640
iar mediana indicând faptul că valorile aberante

50660
37:49:49,600 --> 37:49:53,640
sunt în direcția pozitivă.

50661
37:49:56,800 --> 37:50:02,080
Să luăm în considerare un exemplu.

50662
37:49:59,664 --> 37:50:06,480
Graficul de aici arată venitul global

50663
37:50:02,080 --> 37:50:09,520
repartizarea pentru anul 2003 2013 si

50664
37:50:06,480 --> 37:50:12,000
o proiecție pentru 2035.

50665
37:50:09,520 --> 37:50:15,520
Dacă vedem distribuția globală a venitului

50666
37:50:12,000 --> 37:50:18,480
statisticile pentru 2003 sunt foarte corecte

50667
37:50:15,520 --> 37:50:20,640
deformat.

50668
37:50:18,480 --> 37:50:24,160
Putem observa în graficul anterior

50669
37:50:20,640 --> 37:50:27,880
că în 2003

50670
37:50:24,160 --> 37:50:27,880
media de 3.451 USD

50671
37:50:29,024 --> 37:50:33,720
a fost mai mare decât mediana de 1090 USD.

50672
37:50:33,840 --> 37:50:38,800
Venitul global cu siguranță nu este

50673
37:50:36,080 --> 37:50:44,384
distribuite uniform. Majoritatea

50674
37:50:38,800 --> 37:50:46,384
oamenii câștigă mai puțin de 2.000 de dolari în fiecare an.

50675
37:50:44,384 --> 37:50:51,080
în timp ce doar un mic procent din

50676
37:50:46,384 --> 37:50:51,080
populația câștigă mai mult de 14.000 de dolari.

50677
37:50:51,104 --> 37:50:54,744
Măsuri de variabilitate.

50678
37:50:56,640 --> 37:51:01,104
Măsuri de variabilitate.

50679
37:50:58,800 --> 37:51:03,600
Dispersia. Măsura centrală

50680
37:51:01,104 --> 37:51:06,640
tendinţele oferă o singură valoare care

50681
37:51:03,600 --> 37:51:08,720
se adresează întregii valori. Cu toate acestea, cel

50682
37:51:06,640 --> 37:51:11,360
tendința centrală nu poate descrie

50683
37:51:08,720 --> 37:51:13,360
punct de vedere în întregime. Metrica a

50684
37:51:11,360 --> 37:51:16,384
dispersia ne ajută să ne concentrăm asupra

50685
37:51:13,360 --> 37:51:18,720
inconsecvență în răspândirea datelor.

50686
37:51:16,384 --> 37:51:21,840
Măsurile de dispersie descriu

50687
37:51:18,720 --> 37:51:24,720
răspândirea datelor.

50688
37:51:21,840 --> 37:51:27,440
Gama, gama intercortilă, standard

50689
37:51:24,720 --> 37:51:30,560
abaterea și varianța sunt exemple de

50690
37:51:27,440 --> 37:51:32,320
măsuri de dispersie.

50691
37:51:30,560 --> 37:51:34,240
Gamă.

50692
37:51:32,320 --> 37:51:36,160
Gama de distribuție este

50693
37:51:34,240 --> 37:51:39,664
diferența dintre cel mai mare și cel

50694
37:51:36,160 --> 37:51:42,160
cea mai mică cantitate de date.

50695
37:51:39,664 --> 37:51:46,000
Gama, de exemplu, nu include

50696
37:51:42,160 --> 37:51:48,160
toate aspectele pozitive dintr-o serie.

50697
37:51:46,000 --> 37:51:50,160
Se concentrează pe cele mai șocante

50698
37:51:48,160 --> 37:51:52,960
aspecte și ignoră care nu sunt

50699
37:51:50,160 --> 37:51:58,880
considerat critic. De exemplu, pentru a

50700
37:51:52,960 --> 37:52:03,200
set 13, 33, 45, 67, 70.

50701
37:51:58,880 --> 37:52:05,920
Intervalul este 57. Acesta este maximul de

50702
37:52:03,200 --> 37:52:10,080
aceasta care este 70 minus minimul peste

50703
37:52:05,920 --> 37:52:12,560
aici care este 13.

50704
37:52:10,080 --> 37:52:14,880
Varianta.

50705
37:52:12,560 --> 37:52:17,280
Varianta este media tuturor pătratului

50706
37:52:14,880 --> 37:52:19,664
abaterile.

50707
37:52:17,280 --> 37:52:22,240
Este definit ca suma pătratului

50708
37:52:19,664 --> 37:52:25,744
distanța dintre fiecare punct și medie

50709
37:52:22,240 --> 37:52:28,080
sau dispersia în jurul mediei.

50710
37:52:25,744 --> 37:52:32,480
Abaterea standard este utilizată ca

50711
37:52:28,080 --> 37:52:32,480
varianța suferă de o diferență unitară.

50712
37:52:32,800 --> 37:52:39,200
Varianta poate fi calculată ca pătrat sigma

50713
37:52:35,360 --> 37:52:41,440
însumarea peste x - mu^ 2

50714
37:52:39,200 --> 37:52:45,024
împărțit la n

50715
37:52:41,440 --> 37:52:48,000
unde mu este media datelor, x este

50716
37:52:45,024 --> 37:52:52,240
punctul de date individual

50717
37:52:48,000 --> 37:52:54,640
iar n este dimensiunea datelor.

50718
37:52:52,240 --> 37:52:56,960
Această reprezentare este pentru o populație

50719
37:52:54,640 --> 37:52:58,960
date.

50720
37:52:56,960 --> 37:53:01,744
pentru un eșantion de date variația poate fi

50721
37:52:58,960 --> 37:53:04,800
calculat ca X minus

50722
37:53:01,744 --> 37:53:08,640
Xar însumarea întregului pătrat

50723
37:53:04,800 --> 37:53:11,104
peste el împărțit la n minus unu.

50724
37:53:08,640 --> 37:53:16,000
Aici Xbar este media acestor mostre

50725
37:53:11,104 --> 37:53:18,880
date și n este dimensiunea eșantionului.

50726
37:53:16,000 --> 37:53:20,384
Unitățile de valori și varianța nu sunt

50727
37:53:18,880 --> 37:53:24,880
egale.

50728
37:53:20,384 --> 37:53:28,080
Deci, este utilizată o altă măsură de variabilitate.

50729
37:53:24,880 --> 37:53:30,880
Abaterea standard.

50730
37:53:28,080 --> 37:53:32,480
Abaterea standard este un termen statistic

50731
37:53:30,880 --> 37:53:37,744
folosit pentru a măsura cantitatea de

50732
37:53:32,480 --> 37:53:40,240
variabilitate sau dispersie în jurul unei medii.

50733
37:53:37,744 --> 37:53:43,440
Abaterea standard este calculată ca

50734
37:53:40,240 --> 37:53:46,080
rădăcina pătrată a varianței. Ea descrie

50735
37:53:43,440 --> 37:53:49,960
concentrarea datelor în jurul

50736
37:53:46,080 --> 37:53:49,960
media setului de date.

50737
37:53:50,000 --> 37:53:54,560
Abaterea standard așa cum este indicat

50738
37:53:52,080 --> 37:53:56,720
anterior poate fi calculat ca pătrat

50739
37:53:54,560 --> 37:53:59,440
rădăcina varianței

50740
37:53:56,720 --> 37:54:02,480
pentru o dată de populație. Standard

50741
37:53:59,440 --> 37:54:05,360
abaterea sigma poate fi calculată ca

50742
37:54:02,480 --> 37:54:09,744
rădăcină pătrată a însumării peste x i minus

50743
37:54:05,360 --> 37:54:13,200
mu^ pătrat / n

50744
37:54:09,744 --> 37:54:16,720
unde mu este media datelor x i sunt

50745
37:54:13,200 --> 37:54:19,520
punctele de date și n este dimensiunea. Să

50746
37:54:16,720 --> 37:54:22,080
luați în considerare un exemplu.

50747
37:54:19,520 --> 37:54:25,024
Să aflăm media, varianța și

50748
37:54:22,080 --> 37:54:30,384
abatere standard pentru aceste date. The

50749
37:54:25,024 --> 37:54:32,960
valorile datelor sunt 3, 5, 6, 9 și 10. Pentru

50750
37:54:30,384 --> 37:54:36,080
aflați media, mai întâi găsim suma

50751
37:54:32,960 --> 37:54:39,024
dintre toate aceste valori de date

50752
37:54:36,080 --> 37:54:42,320
adică 33 și împărțiți-l la număr,

50753
37:54:39,024 --> 37:54:45,664
care este cinci.

50754
37:54:42,320 --> 37:54:48,320
Obținem media de 6,6. Pentru a calcula

50755
37:54:45,664 --> 37:54:49,920
varianță, începem prin a calcula

50756
37:54:48,320 --> 37:54:54,080
abatere.

50757
37:54:49,920 --> 37:54:57,360
Adică X minus media lui X. Aici este 3

50758
37:54:54,080 --> 37:54:59,920
una dintre valorile datelor și 6.6 este

50759
37:54:57,360 --> 37:55:05,104
media.

50760
37:54:59,920 --> 37:55:07,440
Deci 3 - 6,6 pătrat și facem asta

50761
37:55:05,104 --> 37:55:10,080
pentru a afla suma tuturor abaterilor

50762
37:55:07,440 --> 37:55:12,320
împărțit la numărătoare

50763
37:55:10,080 --> 37:55:14,880
care este cinci.

50764
37:55:12,320 --> 37:55:17,880
Sfârșim prin a obține o variație generală de

50765
37:55:14,880 --> 37:55:17,880
6,64.

50766
37:55:18,560 --> 37:55:23,920
Abaterea standard, așa cum știm

50767
37:55:21,024 --> 37:55:27,024
măsurată la rădăcina pătrată a varianţei care

50768
37:55:23,920 --> 37:55:31,080
este pătrat<unk> de 6,64

50769
37:55:27,024 --> 37:55:31,080
care se ridică la 2.576.

50770
37:55:31,360 --> 37:55:37,744
Măsuri de relație.

50771
37:55:34,480 --> 37:55:39,920
Măsuri ale coarianței relației.

50772
37:55:37,744 --> 37:55:43,024
Covarianța este măsura articulației

50773
37:55:39,920 --> 37:55:44,800
variabilitatea a două variabile.

50774
37:55:43,024 --> 37:55:47,840
Măsoară direcția

50775
37:55:44,800 --> 37:55:50,000
relația dintre variabile. Ea

50776
37:55:47,840 --> 37:55:54,160
determină dacă o variabilă va cauza

50777
37:55:50,000 --> 37:55:57,920
celălalt să se modifice în același mod.

50778
37:55:54,160 --> 37:56:00,160
Coarianța dintre variabilele X și Y poate

50779
37:55:57,920 --> 37:56:03,744
fi calculată ca însumare peste

50780
37:56:00,160 --> 37:56:07,024
produsul X I - XR

50781
37:56:03,744 --> 37:56:10,080
și Y I - Y bară întregul împărțit la N

50782
37:56:07,024 --> 37:56:13,520
minus unu.

50783
37:56:10,080 --> 37:56:16,960
Aici Xar și Y bar sunt media lui X și

50784
37:56:13,520 --> 37:56:19,744
Y respectiv. Valoarea covarianței

50785
37:56:16,960 --> 37:56:22,640
poate varia de la minus infinit la un plus

50786
37:56:19,744 --> 37:56:25,744
infinit.

50787
37:56:22,640 --> 37:56:28,744
Corelaţie. Corelația este normalizată

50788
37:56:25,744 --> 37:56:28,744
coarianţă.

50789
37:56:28,800 --> 37:56:33,920
Măsoară puterea asocierii

50790
37:56:31,280 --> 37:56:36,080
între două variabile. Cel mai comun

50791
37:56:33,920 --> 37:56:38,720
măsura de corelare este Pearson

50792
37:56:36,080 --> 37:56:42,160
coeficient de corelație.

50793
37:56:38,720 --> 37:56:44,800
Corelația între două variabile

50794
37:56:42,160 --> 37:56:48,800
X și Y pot fi măsurate în raport cu

50795
37:56:44,800 --> 37:56:51,200
coarianța ca coarianță între X

50796
37:56:48,800 --> 37:56:55,840
și Y împărțit la abaterea standard

50797
37:56:51,200 --> 37:56:58,384
a lui X și abaterea standard a lui Y.

50798
37:56:55,840 --> 37:57:02,160
Valoarea corelației variază de la a

50799
37:56:58,384 --> 37:57:05,720
negativ 1 la pozitiv 1.

50800
37:57:02,160 --> 37:57:05,720
Tipuri de corelație.

50801
37:57:06,000 --> 37:57:10,000
Corelația poate fi fie pozitivă

50802
37:57:08,080 --> 37:57:12,240
corelație,

50803
37:57:10,000 --> 37:57:15,240
corelație zero sau negativă

50804
37:57:12,240 --> 37:57:15,240
corelație.

50805
37:57:16,160 --> 37:57:22,384
Prima poză de aici reprezintă a

50806
37:57:18,880 --> 37:57:24,560
corelație pozitivă perfectă

50807
37:57:22,384 --> 37:57:26,320
în care o linie dreaptă cu un pozitiv

50808
37:57:24,560 --> 37:57:28,480
panta

50809
37:57:26,320 --> 37:57:31,520
reprezintă relația dintre

50810
37:57:28,480 --> 37:57:33,664
cele două variabile.

50811
37:57:31,520 --> 37:57:35,520
Corelația zero înseamnă că linia

50812
37:57:33,664 --> 37:57:38,240
reprezentând relaţia dintre

50813
37:57:35,520 --> 37:57:41,240
cele două variabile este orizontală față de

50814
37:57:38,240 --> 37:57:41,240
xaxis.

50815
37:57:41,920 --> 37:57:46,160
Corelația negativă perfectă poate fi

50816
37:57:44,000 --> 37:57:49,520
reprezentată printr-o linie dreaptă cu a

50817
37:57:46,160 --> 37:57:52,240
panta negativa.

50818
37:57:49,520 --> 37:57:55,104
Corelația egală cu 1 implică a

50819
37:57:52,240 --> 37:57:57,440
relație pozitivă. Atunci unul

50820
37:57:55,104 --> 37:58:00,640
variabila mărește cealaltă variabilă

50821
37:57:57,440 --> 37:58:02,640
crește de asemenea. O valoare de corelație a

50822
37:58:00,640 --> 37:58:05,664
unul negativ implică un negativ

50823
37:58:02,640 --> 37:58:09,744
relație. Atunci o variabilă

50824
37:58:05,664 --> 37:58:12,080
crește celelalte scade.

50825
37:58:09,744 --> 37:58:14,480
Coeficientul de corelație de zero

50826
37:58:12,080 --> 37:58:17,360
arată că variabilele sunt complet

50827
37:58:14,480 --> 37:58:21,320
independente unele de altele.

50828
37:58:17,360 --> 37:58:21,320
Să luăm în considerare un exemplu.

50829
37:58:21,440 --> 37:58:27,080
Aici avem două variabile înălțime și

50830
37:58:24,080 --> 37:58:27,080
greutate.

50831
37:58:27,360 --> 37:58:31,520
Pentru a calcula corelația dintre

50832
37:58:29,104 --> 37:58:33,744
inaltime si greutate,

50833
37:58:31,520 --> 37:58:36,384
folosim formula de corelare ca

50834
37:58:33,744 --> 37:58:39,360
covarianța lui X

50835
37:58:36,384 --> 37:58:42,880
și Y împărțit la deviația standard a lui X

50836
37:58:39,360 --> 37:58:45,360
și abaterea standard a lui Y.

50837
37:58:42,880 --> 37:58:48,720
Aici înălțimea este variabila X și greutatea

50838
37:58:45,360 --> 37:58:51,360
este variabila Y.

50839
37:58:48,720 --> 37:58:56,000
Mai întâi pentru a calcula coarianța, calculăm

50840
37:58:51,360 --> 37:58:59,360
valorile barelor x - xar și y - y și

50841
37:58:56,000 --> 37:59:04,104
apoi produsul lor.

50842
37:58:59,360 --> 37:59:04,104
Apoi calculăm x - xr²

50843
37:59:04,160 --> 37:59:09,664
și y - y bară valori pătrate de calculat

50844
37:59:07,520 --> 37:59:12,800
abaterile standard de înălţime şi

50845
37:59:09,664 --> 37:59:16,000
respectiv greutate. Corelație ca și noi

50846
37:59:12,800 --> 37:59:18,880
know a fost definit ca covarianța lui X

50847
37:59:16,000 --> 37:59:22,960
iar I și Y împărțiți la standard

50848
37:59:18,880 --> 37:59:24,880
abaterile lui X și Y.

50849
37:59:22,960 --> 37:59:29,280
Aceasta poate fi reprezentată și ca

50850
37:59:24,880 --> 37:59:31,200
însumarea peste x - xr înmulțit la y -

50851
37:59:29,280 --> 37:59:33,744
y bar

50852
37:59:31,200 --> 37:59:38,000
împărțit la rădăcina pătrată a însumării peste

50853
37:59:33,744 --> 37:59:40,800
suma abaterilor pătrate care este x - xr

50854
37:59:38,000 --> 37:59:45,280
pătrat înmulțit la rădăcina pătrată a

50855
37:59:40,800 --> 37:59:49,744
însumarea peste y - y bar pătrat adică

50856
37:59:45,280 --> 37:59:52,320
suma abaterilor pătrate pentru y.

50857
37:59:49,744 --> 37:59:55,560
Acum să aflăm valorile în care să le punem

50858
37:59:52,320 --> 37:59:55,560
această formulă.

50859
37:59:55,840 --> 38:00:01,200
Mai întâi aflăm suma totală a

50860
37:59:58,560 --> 38:00:03,360
înălțime pentru a obține media înălțimii care

50861
38:00:01,200 --> 38:00:05,520
este 5,14.

50862
38:00:03,360 --> 38:00:08,720
În mod similar, obținem suma greutății la

50863
38:00:05,520 --> 38:00:12,240
obținem media greutății ca 50. Acum obținem

50864
38:00:08,720 --> 38:00:15,200
însumarea peste x - xr înmulțită la

50865
38:00:12,240 --> 38:00:19,280
y - y bar pentru a obține numărătorul pentru

50866
38:00:15,200 --> 38:00:21,280
formula. Apoi calculăm x - xr pătrat

50867
38:00:19,280 --> 38:00:24,960
însumare

50868
38:00:21,280 --> 38:00:27,840
și y - y bar pătrat care este suma de

50869
38:00:24,960 --> 38:00:29,360
abaterea pătrată a lui x și y

50870
38:00:27,840 --> 38:00:31,520
respectiv.

50871
38:00:29,360 --> 38:00:33,920
Acum punem valorile în această finală

50872
38:00:31,520 --> 38:00:37,720
formula de corelare pentru a obține o corelație

50873
38:00:33,920 --> 38:00:37,720
valoare de 0,889.

50874
38:00:38,880 --> 38:00:43,664
Aceasta indică faptul că înălțimea și greutatea

50875
38:00:40,880 --> 38:00:46,160
au o relație pozitivă.

50876
38:00:43,664 --> 38:00:49,880
Este evident că pe măsură ce înălțimea crește,

50877
38:00:46,160 --> 38:00:49,880
creste si greutatea.

50878
38:00:50,080 --> 38:00:56,000
În acest modul, vom vorbi despre

50879
38:00:52,560 --> 38:00:58,720
așteptări și variații.

50880
38:00:56,000 --> 38:01:01,104
Deci valoarea așteptată sau putem spune că înseamnă

50881
38:00:58,720 --> 38:01:04,000
a unei variabile date pe care o putem nota

50882
38:01:01,104 --> 38:01:06,320
prin X este o variabilă aleatoare discretă unde

50883
38:01:04,000 --> 38:01:09,600
este o medie ponderată a posibilului

50884
38:01:06,320 --> 38:01:11,744
valorile pe care X le poate lua și fiecare valoare este

50885
38:01:09,600 --> 38:01:15,104
va fi conform probabilității

50886
38:01:11,744 --> 38:01:17,920
a evenimentului specific care are loc.

50887
38:01:15,104 --> 38:01:21,200
Deci, de obicei, valoarea așteptată a lui X este

50888
38:01:17,920 --> 38:01:23,744
notat printr-o formulă simplă unde putem

50889
38:01:21,200 --> 38:01:26,384
definiți așteptările pe baza X

50890
38:01:23,744 --> 38:01:28,384
parametrul

50891
38:01:26,384 --> 38:01:30,720
care va fi suma fiecăruia

50892
38:01:28,384 --> 38:01:34,960
rezultat posibil înmulțit cu

50893
38:01:30,720 --> 38:01:37,024
probabilitatea producerii rezultatului.

50894
38:01:34,960 --> 38:01:39,360
Deci, în termeni mai concreti,

50895
38:01:37,024 --> 38:01:41,360
așteptarea este ceea ce ne-am aștepta

50896
38:01:39,360 --> 38:01:44,360
rezultatul unui experiment care urmează să fie efectuat

50897
38:01:41,360 --> 38:01:44,360
medie.

50898
38:01:45,200 --> 38:01:51,840
Putem lua un exemplu pentru monedă. Dacă

50899
38:01:48,320 --> 38:01:54,320
atunci o monedă este aruncată de 10 ori

50900
38:01:51,840 --> 38:01:57,640
unul este cel mai probabil să obțină cinci capete și

50901
38:01:54,320 --> 38:01:57,640
cinci cozi.

50902
38:01:57,920 --> 38:02:02,384
Aceeași logică poate fi discutată dacă vorbim

50903
38:02:00,384 --> 38:02:04,880
despre un alt exemplu de rulare a

50904
38:02:02,384 --> 38:02:08,160
dieice. Deci sunt șase posibile

50905
38:02:04,880 --> 38:02:11,440
rezultate atunci când aruncați un zar. 1 2 3 4

50906
38:02:08,160 --> 38:02:15,024
5 6. Și fiecare dintre acestea are o probabilitate

50907
38:02:11,440 --> 38:02:17,360
de 1x 6 de apariție. Deci putem spune asta

50908
38:02:15,024 --> 38:02:19,520
așteptarea va fi 1

50909
38:02:17,360 --> 38:02:23,520
înmulțit cu probabilitatea ca

50910
38:02:19,520 --> 38:02:31,280
se întâmplă care va fi 1x 6 2x

50911
38:02:23,520 --> 38:02:34,640
6 3x 6 4x 6 5x 6 6x 6 și asta

50912
38:02:31,280 --> 38:02:38,160
ne va oferi 3.5 ca rezultat.

50913
38:02:34,640 --> 38:02:41,440
Valoarea așteptată este 3,5.

50914
38:02:38,160 --> 38:02:43,600
Deci, dacă vă gândiți bine, 3,5 este jumătate

50915
38:02:41,440 --> 38:02:46,080
între valorile posibile pe care le pot

50916
38:02:43,600 --> 38:02:47,664
luați și asta ar trebui să avem

50917
38:02:46,080 --> 38:02:49,744
aşteptat.

50918
38:02:47,664 --> 38:02:52,480
În continuare vorbim despre conceptul de

50919
38:02:49,744 --> 38:02:54,800
varianţă. Deci variația unui aleatoriu

50920
38:02:52,480 --> 38:02:57,104
variabila ne permite sa stim ceva

50921
38:02:54,800 --> 38:02:59,024
despre răspândirea valorilor posibile

50922
38:02:57,104 --> 38:03:02,000
a variabilei.

50923
38:02:59,024 --> 38:03:04,800
Deci, pentru o variabilă aleatoare discretă X,

50924
38:03:02,000 --> 38:03:06,960
varianțele lui X vor fi notate cu

50925
38:03:04,800 --> 38:03:08,800
folosind o formulă simplă care urmează să

50926
38:03:06,960 --> 38:03:12,160
fi var=

50927
38:03:08,800 --> 38:03:14,480
E X - M întregul pătrat unde M este

50928
38:03:12,160 --> 38:03:17,520
practic valoarea aşteptată a

50929
38:03:14,480 --> 38:03:20,080
așteptarea lui X. Deci aceasta seamănă mai mult cu a

50930
38:03:17,520 --> 38:03:23,360
abaterea standard a lui X care poate de asemenea

50931
38:03:20,080 --> 38:03:25,664
fi reprezentat prin utilizarea acestei formule. Deci

50932
38:03:23,360 --> 38:03:28,880
varianţa nu se comportă la fel

50933
38:03:25,664 --> 38:03:33,560
fel ca așteptare când ne înmulțim și

50934
38:03:28,880 --> 38:03:33,560
adăugați constante la variabile aleatoare.

50935
38:03:33,664 --> 38:03:37,920
Deci acum există două tipuri diferite de

50936
38:03:35,920 --> 38:03:40,720
variație pe care o putem avea un târg

50937
38:03:37,920 --> 38:03:43,024
înţelegere pe. În primul rând avem

50938
38:03:40,720 --> 38:03:45,104
varianță scăzută și atunci avem mare

50939
38:03:43,024 --> 38:03:48,000
varianţă.

50940
38:03:45,104 --> 38:03:50,480
Deci, variația scăzută înseamnă pur și simplu că acolo

50941
38:03:48,000 --> 38:03:53,280
este o mică variație în producție

50942
38:03:50,480 --> 38:03:55,520
a funcției țintă cu modificări în

50943
38:03:53,280 --> 38:03:58,480
setul de date de tranzacționare și în același timp

50944
38:03:55,520 --> 38:04:01,280
variație mare în timp, așa cum putem vedea aici

50945
38:03:58,480 --> 38:04:03,600
varianța mare arată o variație mare în

50946
38:04:01,280 --> 38:04:06,320
predicţia funcţiei ţintă cu

50947
38:04:03,600 --> 38:04:08,480
modificări ale setului de date de tranzacționare. Deci a

50948
38:04:06,320 --> 38:04:10,720
modelul care arată o varianță mare învață a

50949
38:04:08,480 --> 38:04:13,520
mult și să performeze bine cu antrenamentul

50950
38:04:10,720 --> 38:04:16,480
set de date și nu se generalizează bine

50951
38:04:13,520 --> 38:04:19,024
cu setul de date nevăzut și de aceea

50952
38:04:16,480 --> 38:04:21,600
ca urmare un astfel de model dă bine

50953
38:04:19,024 --> 38:04:24,480
rezultate cu setul de date de antrenament, dar arată

50954
38:04:21,600 --> 38:04:26,480
rate mari de eroare pe setul de date de testare

50955
38:04:24,480 --> 38:04:29,104
iar din moment ce varianţa mare un model

50956
38:04:26,480 --> 38:04:32,320
învață prea multe din setul de date

50957
38:04:29,104 --> 38:04:34,320
duce la o supraadaptare a modelului. Deci

50958
38:04:32,320 --> 38:04:36,320
modelul cu varianță mare va avea

50959
38:04:34,320 --> 38:04:39,024
câteva probleme la care poate duce

50960
38:04:36,320 --> 38:04:43,000
supraadaptare sau poate duce și la

50961
38:04:39,024 --> 38:04:43,000
creșterea complexității modelului.

50962
38:04:43,200 --> 38:04:49,840
În continuare avem skewes.

50963
38:04:46,800 --> 38:04:51,744
Deci, în termeni simpli, este, în principiu, asimetrie

50964
38:04:49,840 --> 38:04:54,384
o măsură a asimetriei a

50965
38:04:51,744 --> 38:04:56,720
distributie. Deci distribuția este

50966
38:04:54,384 --> 38:04:59,664
asimetric atunci când este stânga și dreapta

50967
38:04:56,720 --> 38:05:02,480
laturile nu sunt imaginile în oglindă.

50968
38:04:59,664 --> 38:05:04,800
Momentan aceasta este o imagine în oglindă și a

50969
38:05:02,480 --> 38:05:07,440
distribuţia poate avea drept pozitiv sau

50970
38:05:04,800 --> 38:05:10,440
putem spune negativ sau poate avea zero

50971
38:05:07,440 --> 38:05:10,440
deformat.

50972
38:05:10,800 --> 38:05:15,600
Deci corectă în acest scenariu este

50973
38:05:13,200 --> 38:05:18,384
practic distribuția este mai lungă

50974
38:05:15,600 --> 38:05:20,880
partea dreaptă a vârfului său

50975
38:05:18,384 --> 38:05:23,200
și o distribuție oblică la stânga va avea loc

50976
38:05:20,880 --> 38:05:25,664
fie putem spune unde este mai lung pe

50977
38:05:23,200 --> 38:05:28,000
partea stângă.

50978
38:05:25,664 --> 38:05:30,640
Deci putem vedea că îl avem pe acesta ca parte

50979
38:05:28,000 --> 38:05:33,200
din partea dreaptă. Este mai alungit

50980
38:05:30,640 --> 38:05:36,160
spre partea dreaptă și acesta este

50981
38:05:33,200 --> 38:05:38,160
mai alungit spre partea stângă. Deci

50982
38:05:36,160 --> 38:05:41,520
ne putem gândi la skewes în termeni de

50983
38:05:38,160 --> 38:05:44,240
cozi. O coadă este falsificare lungă și

50984
38:05:41,520 --> 38:05:46,640
sfârşitul unei distribuţii. Deci pur și simplu

50985
38:05:44,240 --> 38:05:48,720
indică faptul că sunt observații la

50986
38:05:46,640 --> 38:05:51,520
un capăt al distribuţiei dar că

50987
38:05:48,720 --> 38:05:54,160
sunt relativ rare. Deci a

50988
38:05:51,520 --> 38:05:56,720
distribuția oblică la dreapta are o coadă lungă

50989
38:05:54,160 --> 38:05:59,440
în partea dreaptă, după cum puteți vedea aici.

50990
38:05:56,720 --> 38:06:02,240
Deci numărul suporturilor observate. Să

50991
38:05:59,440 --> 38:06:04,640
să spunem că avem date pe an.

50992
38:06:02,240 --> 38:06:06,880
Deci, din nou, putem avea o mai asimilă

50993
38:06:04,640 --> 38:06:09,104
spre partea dreaptă unde sunt datele

50994
38:06:06,880 --> 38:06:11,200
fiind în scădere pe măsură ce continuăm

50995
38:06:09,104 --> 38:06:14,000
creste numarul de ani. Pentru

50996
38:06:11,200 --> 38:06:17,744
exemplu, putem avea vânzări ridicate către

50997
38:06:14,000 --> 38:06:21,600
începutul anului presupune în 2022

50998
38:06:17,744 --> 38:06:23,280
dar din nou pe măsură ce trecem la 2023 secunde

50999
38:06:21,600 --> 38:06:26,384
jumătate dintre noi vedem căderea

51000
38:06:23,280 --> 38:06:28,800
performanta. Deci, pe bună dreptate, este denaturat

51001
38:06:26,384 --> 38:06:31,360
și în același fel să presupunem că am început

51002
38:06:28,800 --> 38:06:34,160
cu cifra de vânzări era într-adevăr mai mică

51003
38:06:31,360 --> 38:06:37,840
presupunând 2002

51004
38:06:34,160 --> 38:06:39,664
dar din nou pe măsură ce am trecut la 2023 acum

51005
38:06:37,840 --> 38:06:42,240
vânzările noastre au fost treptat

51006
38:06:39,664 --> 38:06:44,320
crescând. Deci este mai degrabă înclinată

51007
38:06:42,240 --> 38:06:49,440
spre secțiunea din stânga ca parte a

51008
38:06:44,320 --> 38:06:52,320
deformare negativă. În continuare avem curtoza.

51009
38:06:49,440 --> 38:06:55,744
Deci curtoza este practic o măsură a

51010
38:06:52,320 --> 38:06:58,480
coada unei distribuții.

51011
38:06:55,744 --> 38:07:01,744
Deci, taeness este cât de des valorile aberante

51012
38:06:58,480 --> 38:07:04,384
apar și acționează ca curtis este coada

51013
38:07:01,744 --> 38:07:07,024
a distribuţiei raportate la o normală

51014
38:07:04,384 --> 38:07:10,240
distributie. Deci o distributie cu

51015
38:07:07,024 --> 38:07:12,800
curttoza medie se numește meocurtică.

51016
38:07:10,240 --> 38:07:15,024
O distribuție cu curtoză scăzută ca

51017
38:07:12,800 --> 38:07:17,360
acesta. Aceasta se numește ca

51018
38:07:15,024 --> 38:07:19,920
platicurtic si apoi distributie cu

51019
38:07:17,360 --> 38:07:23,200
curtoză mare ca aceasta. Aceasta este

51020
38:07:19,920 --> 38:07:25,664
numit leptoccuric.

51021
38:07:23,200 --> 38:07:28,560
Deci cozile aici se îngustează la capăt

51022
38:07:25,664 --> 38:07:31,024
ambele părți ale unei distribuții ca aceasta.

51023
38:07:28,560 --> 38:07:33,104
Deci ele reprezintă probabilitatea sau

51024
38:07:31,024 --> 38:07:36,880
frecvenţa valorilor care sunt extrem de

51025
38:07:33,104 --> 38:07:39,440
mare sau extrem de scăzută la medie.

51026
38:07:36,880 --> 38:07:43,104
Cu alte cuvinte, cozile aici reprezintă

51027
38:07:39,440 --> 38:07:46,160
cât de des apar valorile aberante.

51028
38:07:43,104 --> 38:07:48,640
Deci există trei tipuri de curtis. Noi

51029
38:07:46,160 --> 38:07:50,960
au platocurtic ceea ce este negativ,

51030
38:07:48,640 --> 38:07:53,920
leptocortic care este un pozitiv spre

51031
38:07:50,960 --> 38:07:56,560
capătul de sus și apoi avem messertic

51032
38:07:53,920 --> 38:07:59,600
care este o distribuție normală. Deci

51033
38:07:56,560 --> 38:08:01,744
messertic este coada medie. Atat de normal

51034
38:07:59,600 --> 38:08:04,880
distribuţiile la care au o curtoză

51035
38:08:01,744 --> 38:08:07,520
trei. Deci orice distribuție cu un curtis

51036
38:08:04,880 --> 38:08:10,960
de o valoare aproximativă de trei va fi

51037
38:08:07,520 --> 38:08:13,600
messertic. Și curtoza este descrisă în

51038
38:08:10,960 --> 38:08:16,880
termenii excesului de curttoză care este

51039
38:08:13,600 --> 38:08:19,440
curtoza minus3. Și din moment ce normal

51040
38:08:16,880 --> 38:08:22,160
distributie au o curtoza de

51041
38:08:19,440 --> 38:08:24,384
trei axe curtises face compararea a

51042
38:08:22,160 --> 38:08:27,440
curtoza distributiei la normal

51043
38:08:24,384 --> 38:08:30,560
distributia si mai usoara. Introducere

51044
38:08:27,440 --> 38:08:33,744
la probabilitate.

51045
38:08:30,560 --> 38:08:35,840
Teoria probabilității. Probabilitatea este a

51046
38:08:33,744 --> 38:08:38,720
măsură a probabilității ca un eveniment

51047
38:08:35,840 --> 38:08:42,000
va avea loc.

51048
38:08:38,720 --> 38:08:44,160
Să luăm în considerare un exemplu de aruncare a monedelor

51049
38:08:42,000 --> 38:08:48,480
unde șansele de a obține cap pe a

51050
38:08:44,160 --> 38:08:50,800
monedele sunt 1 cu doi sau 50%.

51051
38:08:48,480 --> 38:08:54,384
Probabilitatea fiecărui eveniment dat este

51052
38:08:50,800 --> 38:08:57,360
între zero și unu, ambele inclusiv.

51053
38:08:54,384 --> 38:09:00,800
Suma unei probabilități cumulate de evenimente

51054
38:08:57,360 --> 38:09:03,600
nu poate fi mai mare de unu.

51055
38:09:00,800 --> 38:09:06,640
Prin urmare, probabilitatea unui eveniment x se află

51056
38:09:03,600 --> 38:09:08,640
intre zero si unu. Aceasta înseamnă că

51057
38:09:06,640 --> 38:09:13,880
integrala probabilității de

51058
38:09:08,640 --> 38:09:13,880
distribuția pe x este egală cu 1.

51059
38:09:14,160 --> 38:09:20,000
Probabilitate condiționată. Condițional

51060
38:09:16,720 --> 38:09:23,360
probabilitatea oricărui eveniment A este definită ca

51061
38:09:20,000 --> 38:09:28,240
probabilitatea de apariție a lui A dată

51062
38:09:23,360 --> 38:09:31,520
acel eveniment B a avut loc anterior.

51063
38:09:28,240 --> 38:09:34,480
Probabilitatea condiției evenimentului A dat B

51064
38:09:31,520 --> 38:09:37,200
poate fi estimată ca probabilitate pentru A

51065
38:09:34,480 --> 38:09:40,640
intersecția B care este probabilitatea de

51066
38:09:37,200 --> 38:09:45,480
atât A cât și B se întâmplă împreună

51067
38:09:40,640 --> 38:09:45,480
împărțit la probabilitatea lui B.

51068
38:09:45,600 --> 38:09:50,880
Este scris și ca acea probabilitate

51069
38:09:47,920 --> 38:09:54,800
a A intersecției B este egală cu

51070
38:09:50,880 --> 38:09:58,664
probabilitatea A dat B înmulțită la

51071
38:09:54,800 --> 38:09:58,664
probabilitatea lui B.

51072
38:09:59,024 --> 38:10:04,640
Să luăm în considerare un exemplu.

51073
38:10:01,664 --> 38:10:07,280
Într-o monedă, facem o întoarcere cu două monede.

51074
38:10:04,640 --> 38:10:11,560
Moneda unu primește capete, cozi, capete și

51075
38:10:07,280 --> 38:10:11,560
cozile în flipurile ulterioare.

51076
38:10:12,000 --> 38:10:18,320
în timp ce moneda 2 primește cozi, capete, capete,

51077
38:10:15,024 --> 38:10:20,720
și cozi în flipurile ulterioare. Acum,

51078
38:10:18,320 --> 38:10:23,744
probabilitatea ca moneda unu să obțină a

51079
38:10:20,720 --> 38:10:26,240
capul este 2 din patru. În timp ce

51080
38:10:23,744 --> 38:10:29,600
probabilitatea ca moneda doi să primească capete

51081
38:10:26,240 --> 38:10:31,920
este din nou doi din patru.

51082
38:10:29,600 --> 38:10:34,560
Probabilitatea ca ambii să bată unul și

51083
38:10:31,920 --> 38:10:38,280
moneda doi va avea un capete este doar unul

51084
38:10:34,560 --> 38:10:38,280
din cele patru flip-uri.

51085
38:10:38,384 --> 38:10:43,360
De aici probabilitatea ca monedă unul să fie

51086
38:10:40,800 --> 38:10:46,080
obține capete având în vedere că moneda 2 este deja

51087
38:10:43,360 --> 38:10:50,880
capete pot fi calculate ca probabilitate de

51088
38:10:46,080 --> 38:10:54,000
monedă o margine intersecție monedă 2 margine

51089
38:10:50,880 --> 38:10:57,104
adică 1x4 împărțit la probabilitatea de

51090
38:10:54,000 --> 38:11:00,000
monedă 2 margine

51091
38:10:57,104 --> 38:11:05,200
acesta este un dat care este 2x 4 care este

51092
38:11:00,000 --> 38:11:08,384
va fi bazat pe 0,5 sau 50%.

51093
38:11:05,200 --> 38:11:10,560
teorema de bază Teorema de bază calculează

51094
38:11:08,384 --> 38:11:14,560
probabilitatea condiționată a unui eveniment

51095
38:11:10,560 --> 38:11:17,104
pe baza probabilităţilor sale anterioare.

51096
38:11:14,560 --> 38:11:19,520
Practic teorema de bază încorporează

51097
38:11:17,104 --> 38:11:22,160
distribuția de probabilitate anterioară la

51098
38:11:19,520 --> 38:11:25,840
prezice baza probabilităților posterioare

51099
38:11:22,160 --> 38:11:28,560
teorema probabilității condiționate

51100
38:11:25,840 --> 38:11:32,384
poate fi exprimat ca probabilitate pentru A

51101
38:11:28,560 --> 38:11:35,280
dat B este egal cu probabilitatea lui B dat A

51102
38:11:32,384 --> 38:11:38,384
împărțit la probabilitatea lui B înmulțită

51103
38:11:35,280 --> 38:11:40,560
la probabilitatea lui A.

51104
38:11:38,384 --> 38:11:42,800
Teorema de bază permite actualizarea

51105
38:11:40,560 --> 38:11:45,200
valori de probabilitate prin utilizarea de noi

51106
38:11:42,800 --> 38:11:48,000
informații sau dovezi. Aici

51107
38:11:45,200 --> 38:11:50,480
probabilitatea lui A este cunoscută ca anterioară

51108
38:11:48,000 --> 38:11:52,880
probabilitate. Aceasta este probabilitatea de

51109
38:11:50,480 --> 38:11:56,320
eveniment care înainte de orice date noi este

51110
38:11:52,880 --> 38:11:59,360
colectate. Probabilitatea A dat B este

51111
38:11:56,320 --> 38:12:01,744
cunoscută sub denumirea de probabilitate posterioară. Ea

51112
38:11:59,360 --> 38:12:03,520
este probabilitatea revizuită a unui eveniment

51113
38:12:01,744 --> 38:12:05,840
care apar după luarea în

51114
38:12:03,520 --> 38:12:09,024
luând în considerare noile informații

51115
38:12:05,840 --> 38:12:11,840
probabilitatea lui B dat A este cunoscută ca

51116
38:12:09,024 --> 38:12:14,640
probabilitatea și probabilitatea lui B este

51117
38:12:11,840 --> 38:12:18,000
probabilitatea de a observa o dovadă B

51118
38:12:14,640 --> 38:12:20,320
model. Un exemplu, luați în considerare un exemplu

51119
38:12:18,000 --> 38:12:23,440
pentru calcularea probabilității de a avea

51120
38:12:20,320 --> 38:12:26,880
diabet zaharat bazat pe frecvența fast-food-ului

51121
38:12:23,440 --> 38:12:30,384
consumului. Iată datele observate.

51122
38:12:26,880 --> 38:12:34,560
Să presupunem că audiența fast-food este de 20%.

51123
38:12:30,384 --> 38:12:37,104
Prevalența diabetului zaharat este de 10% și este de 5%.

51124
38:12:34,560 --> 38:12:39,920
fast-food și diabet.

51125
38:12:37,104 --> 38:12:42,240
Șansele de diabet cu mâncare rapidă

51126
38:12:39,920 --> 38:12:45,440
aceasta este probabilitatea condiționată a lui D

51127
38:12:42,240 --> 38:12:48,160
dat B poate fi calculat ca probabilitate

51128
38:12:45,440 --> 38:12:51,360
de diabet și fast-food împreună

51129
38:12:48,160 --> 38:12:55,440
împărțit la probabilitatea de fast-food.

51130
38:12:51,360 --> 38:12:57,600
Asta înseamnă 5% împărțit la 20%. că

51131
38:12:55,440 --> 38:13:00,160
este egal cu 25%.

51132
38:12:57,600 --> 38:13:02,560
Definiți o analiză care poate indica mâncatul rapid

51133
38:13:00,160 --> 38:13:05,600
mâncarea crește șansa de a avea

51134
38:13:02,560 --> 38:13:08,480
diabet zaharat cu 25%.

51135
38:13:05,600 --> 38:13:11,744
Regula probabilității înmulțirii

51136
38:13:08,480 --> 38:13:14,320
dacă evenimentele A şi B sunt statistic

51137
38:13:11,744 --> 38:13:16,960
independent și probabilitatea lui A

51138
38:13:14,320 --> 38:13:20,320
intersecția B poate fi dată ca

51139
38:13:16,960 --> 38:13:23,840
probabilitatea A dat B înmulțită la

51140
38:13:20,320 --> 38:13:26,880
probabilitatea lui B. Cu toate acestea, probabilitatea

51141
38:13:23,840 --> 38:13:29,600
al A intersecției B este de asemenea dat ca

51142
38:13:26,880 --> 38:13:33,664
probabilitatea lui A înmulțită la

51143
38:13:29,600 --> 38:13:37,280
probabilitatea lui B. Aici probabilitatea lui A

51144
38:13:33,664 --> 38:13:40,160
dat B este egal cu probabilitatea lui A când

51145
38:13:37,280 --> 38:13:43,664
presupunem că probabilitatea lui B este non

51146
38:13:40,160 --> 38:13:46,560
zero. În mod similar, probabilitatea B este egală

51147
38:13:43,664 --> 38:13:50,384
probabilitatea lui B dat A presupunând

51148
38:13:46,560 --> 38:13:52,560
probabilitatea lui A este diferită de zero. Regula lanțului

51149
38:13:50,384 --> 38:13:55,520
de probabilitate probabilitate comună

51150
38:13:52,560 --> 38:13:57,520
distribuții pe mai multe variabile aleatoare

51151
38:13:55,520 --> 38:14:00,640
poate fi redus în condițional

51152
38:13:57,520 --> 38:14:04,720
distribuții pe o singură variabilă. Ea

51153
38:14:00,640 --> 38:14:08,240
poate fi exprimat ca probabilitate de X1 X2

51154
38:14:04,720 --> 38:14:11,280
așa mai departe până când XN este egal cu probabilitatea X1

51155
38:14:08,240 --> 38:14:16,960
probabilitatea de intersecție a lui X I dată

51156
38:14:11,280 --> 38:14:19,920
probabilitatea de X1 până la X I minus unu.

51157
38:14:16,960 --> 38:14:23,600
De exemplu, probabilitatea comună a lui A,

51158
38:14:19,920 --> 38:14:27,280
B și C pot fi date ca probabilitate pentru A

51159
38:14:23,600 --> 38:14:32,000
dat B. C înmulțit la probabilitatea de

51160
38:14:27,280 --> 38:14:35,104
B dat C se înmulțește la probabilitatea lui C.

51161
38:14:32,000 --> 38:14:37,280
Sigmoid logistic.

51162
38:14:35,104 --> 38:14:39,600
Funcția de logistică este un tip de

51163
38:14:37,280 --> 38:14:42,240
funcţia sigmoidă care urmăreşte să prezică

51164
38:14:39,600 --> 38:14:45,744
clasa la care o anumită probă

51165
38:14:42,240 --> 38:14:48,560
aparține. Rezultatul său este binar discret

51166
38:14:45,744 --> 38:14:51,920
valoare. o probabilitate între zero și

51167
38:14:48,560 --> 38:14:54,560
unul. Sigmoidul logistic este util

51168
38:14:51,920 --> 38:14:56,880
funcţie care urmează curba da. Ea

51169
38:14:54,560 --> 38:15:00,160
se saturează când intrarea este foarte mare

51170
38:14:56,880 --> 38:15:04,560
sau foarte mici. Sigmoid logistic este

51171
38:15:00,160 --> 38:15:07,664
exprimat ca sigma de x= 1 pe 1 e to

51172
38:15:04,560 --> 38:15:10,384
puterea minus x.

51173
38:15:07,664 --> 38:15:13,440
Sigmoidul logistic poate fi exprimat ca

51174
38:15:10,384 --> 38:15:17,920
funcția sigmoidă a lui x este dată ca 1 pe

51175
38:15:13,440 --> 38:15:19,744
1 e ^ minus x unde e este ooler-ul

51176
38:15:17,920 --> 38:15:22,384
număr.

51177
38:15:19,744 --> 38:15:24,720
distribuție Gshian.

51178
38:15:22,384 --> 38:15:26,960
Distribuția gossian este un tip de

51179
38:15:24,720 --> 38:15:29,200
distribuţie în care datele tind să

51180
38:15:26,960 --> 38:15:33,360
grupează în jurul unei valori centrale cu

51181
38:15:29,200 --> 38:15:35,440
puțin sau deloc părtinire la stânga sau la dreapta.

51182
38:15:33,360 --> 38:15:37,664
Este adesea menționată ca fiind normală

51183
38:15:35,440 --> 38:15:40,320
distributie.

51184
38:15:37,664 --> 38:15:42,720
În lipsa unor informații prealabile,

51185
38:15:40,320 --> 38:15:45,664
distribuția normală este frecvent un târg

51186
38:15:42,720 --> 38:15:47,600
presupunere în învățarea automată

51187
38:15:45,664 --> 38:15:49,744
ecuație.

51188
38:15:47,600 --> 38:15:52,240
Formula de calcul gaussian

51189
38:15:49,744 --> 38:15:55,024
distribuția este descrisă ca fiind normală

51190
38:15:52,240 --> 38:15:57,520
distribuția lui X.

51191
38:15:55,024 --> 38:16:00,384
Aceasta este funcția lui x dată medie ca

51192
38:15:57,520 --> 38:16:03,024
mu și varianța este sigma pătrat poate fi

51193
38:16:00,384 --> 38:16:07,360
calculat ca 1 pe pătrat sigma

51194
38:16:03,024 --> 38:16:11,600
roo<unk> de 2 pi e la puterea -/ x -

51195
38:16:07,360 --> 38:16:14,800
starea de spirit / sigma pătrat

51196
38:16:11,600 --> 38:16:18,480
unde mu este valoarea medie sau de vârf care

51197
38:16:14,800 --> 38:16:21,200
este de asemenea valoarea așteptată a lui x.

51198
38:16:18,480 --> 38:16:23,744
Sigma este abaterea standard. Sigma

51199
38:16:21,200 --> 38:16:26,000
pătratul este varianța.

51200
38:16:23,744 --> 38:16:28,560
O distribuție normală standard are a

51201
38:16:26,000 --> 38:16:31,024
medie de zero și o abatere standard de

51202
38:16:28,560 --> 38:16:35,024
unul.

51203
38:16:31,024 --> 38:16:37,280
Distribuția Goshan poate fi univariată

51204
38:16:35,024 --> 38:16:39,920
care descrie distribuția a

51205
38:16:37,280 --> 38:16:42,320
o singură variabilă X.

51206
38:16:39,920 --> 38:16:44,880
Poate fi, de asemenea, multivariat acolo unde se poate

51207
38:16:42,320 --> 38:16:47,360
folosit doar pentru a descrie distribuția de

51208
38:16:44,880 --> 38:16:53,080
mai multe variabile.

51209
38:16:47,360 --> 38:16:53,080
Este reprezentat în formate 3D sau ND.

51210
38:16:53,840 --> 38:16:59,664
Legea numerelor mari.

51211
38:16:57,600 --> 38:17:02,800
Acum să vorbim despre legea marelui

51212
38:16:59,664 --> 38:17:05,104
numere. Legea numerelor mari spune

51213
38:17:02,800 --> 38:17:07,440
că o medie de eșantion observată de la a

51214
38:17:05,104 --> 38:17:10,000
eșantionul mare va fi aproape de adevărat

51215
38:17:07,440 --> 38:17:12,880
media populației și că va obține

51216
38:17:10,000 --> 38:17:15,280
mai aproape în eșantionul mai mare. Deci legea

51217
38:17:12,880 --> 38:17:17,920
de număr mare nu garantează că

51218
38:17:15,280 --> 38:17:19,920
un eșantion dat în spațiu un eșantion mic

51219
38:17:17,920 --> 38:17:22,384
va reflecta adevărata populație

51220
38:17:19,920 --> 38:17:24,640
caracteristici sau ceea ce face un eșantion

51221
38:17:22,384 --> 38:17:27,840
nu reflectă adevărata populație va fi

51222
38:17:24,640 --> 38:17:30,320
echilibrat de o probă ulterioară. Aceasta este

51223
38:17:27,840 --> 38:17:32,320
pentru ca legea numerelor mari să se exprime

51224
38:17:30,320 --> 38:17:35,360
relaţia dintre scară şi

51225
38:17:32,320 --> 38:17:37,360
rata de crestere.

51226
38:17:35,360 --> 38:17:41,024
Deci, există mai multe exemple prin intermediul

51227
38:17:37,360 --> 38:17:43,520
pe care o putem înțelege

51228
38:17:41,024 --> 38:17:45,600
și este utilizat pe scară largă în statistică

51229
38:17:43,520 --> 38:17:47,744
analiza în lucrul cu centrala

51230
38:17:45,600 --> 38:17:50,880
teorema limitei în ceea ce privește afacerea

51231
38:17:47,744 --> 38:17:52,720
crestere. Deci există mai multe în timp real

51232
38:17:50,880 --> 38:17:55,664
configurația în care acestea vor fi

51233
38:17:52,720 --> 38:17:58,160
folosit. Deci, dacă vorbești despre aruncarea unui

51234
38:17:55,664 --> 38:18:00,560
monedă deci aruncând o monedă într-un număr de

51235
38:17:58,160 --> 38:18:03,104
ori ne va oferi două tipuri diferite de

51236
38:18:00,560 --> 38:18:05,104
rezultate.

51237
38:18:03,104 --> 38:18:08,080
rezultatul se va răspândi uniform între

51238
38:18:05,104 --> 38:18:10,960
cap și cozi și media așteptată

51239
38:18:08,080 --> 38:18:13,840
valoarea va fi la jumătate.

51240
38:18:10,960 --> 38:18:16,720
Asta înseamnă de 50 de ori cozi și de 30 de ori

51241
38:18:13,840 --> 38:18:19,520
capete. Dar din nou, dacă arunci o monedă

51242
38:18:16,720 --> 38:18:22,560
de 1.000 de ori, atunci rezultatul poate fi în

51243
38:18:19,520 --> 38:18:26,480
maniere diferite deoarece din 1.000,

51244
38:18:22,560 --> 38:18:30,080
sa zicem de 850 de ori a fost cap si

51245
38:18:26,480 --> 38:18:32,720
doar de 150 de ori a fost cozi și așa

51246
38:18:30,080 --> 38:18:35,104
pe. Deci, de aceea, posibilitatea unuia

51247
38:18:32,720 --> 38:18:37,744
evenimentul care are loc va fi schimbat

51248
38:18:35,104 --> 38:18:40,320
în seturi mari de mostre în comparație cu a

51249
38:18:37,744 --> 38:18:43,280
seturi de mostre mici, ca să spunem 10

51250
38:18:40,320 --> 38:18:45,744
ori. Deci numărul de capete și cozi

51251
38:18:43,280 --> 38:18:49,360
dezechilibrat pentru un număr mai mic de încercări.

51252
38:18:45,744 --> 38:18:51,744
Deci putem vedea că este dezechilibrat.

51253
38:18:49,360 --> 38:18:54,320
Dar din nou, de îndată ce mai aruncăm un număr

51254
38:18:51,744 --> 38:18:56,384
de monede mai înclină spre balanţă

51255
38:18:54,320 --> 38:18:58,720
valoare sau putem vedea cele observate

51256
38:18:56,384 --> 38:19:01,920
medii.

51257
38:18:58,720 --> 38:19:04,560
În continuare avem valoarea p.

51258
38:19:01,920 --> 38:19:07,024
Deci valoarea p este practic un număr

51259
38:19:04,560 --> 38:19:09,360
calculat din testul statistic

51260
38:19:07,024 --> 38:19:11,744
care descrie cât de probabil avem să avem

51261
38:19:09,360 --> 38:19:15,360
a găsit un anumit set de observații

51262
38:19:11,744 --> 38:19:18,240
dacă ipoteza nulă ar fi adevărată. Deci p

51263
38:19:15,360 --> 38:19:20,640
valorile sunt utilizate în testarea ipotezelor pentru

51264
38:19:18,240 --> 38:19:22,160
ajuta să decidă dacă respinge nulul

51265
38:19:20,640 --> 38:19:24,384
ipoteza.

51266
38:19:22,160 --> 38:19:26,384
Și cu cât valoarea p este mai mică, cu atât mai mult

51267
38:19:24,384 --> 38:19:27,920
probabil că vom respinge nulul

51268
38:19:26,384 --> 38:19:30,000
ipoteza.

51269
38:19:27,920 --> 38:19:33,280
Deci avem un termen numit nul

51270
38:19:30,000 --> 38:19:36,240
ipoteza. Deci toate testele statistice

51271
38:19:33,280 --> 38:19:38,960
au ipoteza nula. Deci pentru majoritatea

51272
38:19:36,240 --> 38:19:41,200
testează ipoteza nulă este că acolo

51273
38:19:38,960 --> 38:19:43,600
nu există o relație între variabilele noastre

51274
38:19:41,200 --> 38:19:46,384
de în primul sau că nu există

51275
38:19:43,600 --> 38:19:49,664
diferenta intre grupuri. De exemplu în

51276
38:19:46,384 --> 38:19:51,744
un test t cu două cozi non-ipoteza este

51277
38:19:49,664 --> 38:19:54,240
că diferenţa dintre două grupuri

51278
38:19:51,744 --> 38:19:56,560
va fi zero.

51279
38:19:54,240 --> 38:19:58,640
Deci valoarea p ne va spune cum

51280
38:19:56,560 --> 38:20:02,160
probabil că datele noastre ar putea avea

51281
38:19:58,640 --> 38:20:04,480
survenit sub ipoteza nulă.

51282
38:20:02,160 --> 38:20:06,800
Se face prin calcularea probabilității

51283
38:20:04,480 --> 38:20:08,960
a unei statistici de testare

51284
38:20:06,800 --> 38:20:12,000
care este numărul calculat de a

51285
38:20:08,960 --> 38:20:14,384
test statistic folosind datele noastre. Deci p

51286
38:20:12,000 --> 38:20:17,104
valoarea ne spune cât de des ne-am aștepta

51287
38:20:14,384 --> 38:20:18,880
pentru a vedea o statistică de test ca fiind extremă sau

51288
38:20:17,104 --> 38:20:21,200
mai extremă

51289
38:20:18,880 --> 38:20:24,720
decât unul calculat printr-o statistică

51290
38:20:21,200 --> 38:20:26,640
test. dacă ipoteza nulă a testului

51291
38:20:24,720 --> 38:20:28,720
era adevărat.

51292
38:20:26,640 --> 38:20:31,600
Deci, există mai multe limitări ca

51293
38:20:28,720 --> 38:20:34,240
bine. Deci, primul este rezultatele pot fi

51294
38:20:31,600 --> 38:20:37,024
semnificative, dar din nou sunt ei pot

51295
38:20:34,240 --> 38:20:39,664
să nu fie practic așa cum am comparat-o

51296
38:20:37,024 --> 38:20:42,560
se poate baza pe ipoteze multiple pentru

51297
38:20:39,664 --> 38:20:45,104
un joc pentru testul medical. Dacă

51298
38:20:42,560 --> 38:20:47,600
testul va fi pozitiv sau nu

51299
38:20:45,104 --> 38:20:50,160
poate prezenta valori egale ale efectului a

51300
38:20:47,600 --> 38:20:52,800
variabilă, dar nu mărimea în real

51301
38:20:50,160 --> 38:20:55,280
viata. Ce anume va fi

51302
38:20:52,800 --> 38:20:58,240
aplicarea unui test antidrog nu a reușit

51303
38:20:55,280 --> 38:21:00,720
in compania farmaceutica? Prin urmare, este

51304
38:20:58,240 --> 38:21:03,600
recomandat să folosești încredere și niveluri

51305
38:21:00,720 --> 38:21:05,920
pe lângă valorile p de cuantificat

51306
38:21:03,600 --> 38:21:08,960
sau putem spune să dăm o cifră solidă

51307
38:21:05,920 --> 38:21:11,200
rezerva pe care o vom obține.

51308
38:21:08,960 --> 38:21:13,520
Valorile p ca acestea sunt interpretate

51309
38:21:11,200 --> 38:21:15,664
susținând sau putem spune infirmarea

51310
38:21:13,520 --> 38:21:18,480
ipoteză alternativă.

51311
38:21:15,664 --> 38:21:21,744
Deci valoarea p vă poate spune doar dacă sau

51312
38:21:18,480 --> 38:21:23,744
nu este susținută ipoteza nulă. Ea

51313
38:21:21,744 --> 38:21:27,600
nu ne poate spune dacă alternativa noastră

51314
38:21:23,744 --> 38:21:30,160
ipoteza este adevărată sau de ce. Deci riscul

51315
38:21:27,600 --> 38:21:33,024
a respingerii ipotezei nule este

51316
38:21:30,160 --> 38:21:34,880
adesea mai mare decât valoarea p. Deci

51317
38:21:33,024 --> 38:21:37,440
mai ales când ne uităm la o

51318
38:21:34,880 --> 38:21:40,560
un singur studiu sau când se utilizează un eșantion mic

51319
38:21:37,440 --> 38:21:42,800
dimensiuni. Deci acest lucru se datorează faptului că este mai mic

51320
38:21:40,560 --> 38:21:45,024
cadru de referință, cu atât sunt mai mari

51321
38:21:42,800 --> 38:21:47,200
șansa ca pe măsură ce ne dăm peste o

51322
38:21:45,024 --> 38:21:49,744
model semnificativ statistic

51323
38:21:47,200 --> 38:21:51,920
complet accidental.

51324
38:21:49,744 --> 38:21:54,480
Recomandări cheie.

51325
38:21:51,920 --> 38:21:56,880
Recomandări cheie. Probabilitatea și

51326
38:21:54,480 --> 38:22:00,000
statisticile structurează premisa

51327
38:21:56,880 --> 38:22:03,024
date. Datele ajută la anticiparea

51328
38:22:00,000 --> 38:22:05,744
viitor sau măsurare în vederea trecutului

51329
38:22:03,024 --> 38:22:08,320
modele de informare.

51330
38:22:05,744 --> 38:22:10,560
Tendința centrală este o singură valoare

51331
38:22:08,320 --> 38:22:12,800
care ajută la descrierea datelor prin

51332
38:22:10,560 --> 38:22:15,600
identificarea acestor poziţii centrale. The

51333
38:22:12,800 --> 38:22:18,640
media, mediana și modul sunt măsurile

51334
38:22:15,600 --> 38:22:20,720
a tendintelor centrale.

51335
38:22:18,640 --> 38:22:23,280
Distribuția la care tind datele

51336
38:22:20,720 --> 38:22:26,480
fi în preajma unei valori centrale cu o lipsă de

51337
38:22:23,280 --> 38:22:30,080
părtinire sau părtinire minimă spre stânga sau

51338
38:22:26,480 --> 38:22:32,800
dreapta este numită distribuție gshian.

51339
38:22:30,080 --> 38:22:36,640
Așa că acum să ne aprofundăm în definiția lui

51340
38:22:32,800 --> 38:22:38,480
funcția de distribuție a probabilității.

51341
38:22:36,640 --> 38:22:41,200
Ce este distribuția probabilității

51342
38:22:38,480 --> 38:22:43,360
funcţie? O funcție care definește

51343
38:22:41,200 --> 38:22:45,664
relația dintre o variabilă aleatoare

51344
38:22:43,360 --> 38:22:47,520
și probabilitatea acesteia astfel încât să puteți

51345
38:22:45,664 --> 38:22:49,440
afla probabilitatea variabilei

51346
38:22:47,520 --> 38:22:52,240
folosind funcția se numește a

51347
38:22:49,440 --> 38:22:55,360
funcția de densitate de probabilitate.

51348
38:22:52,240 --> 38:22:58,000
Cu cuvinte simple, densitatea probabilității este

51349
38:22:55,360 --> 38:23:00,800
relația dintre o observație

51350
38:22:58,000 --> 38:23:02,320
și probabilitatea. Unele rezultate ale a

51351
38:23:00,800 --> 38:23:04,720
variabila aleatoare va avea un nivel scăzut

51352
38:23:02,320 --> 38:23:06,480
densitatea probabilității și alte rezultate

51353
38:23:04,720 --> 38:23:09,200
va avea o probabilitate foarte mare

51354
38:23:06,480 --> 38:23:12,800
densitate. Practic, probabilitatea a

51355
38:23:09,200 --> 38:23:15,200
variabila X care se întâmplă sau se produce

51356
38:23:12,800 --> 38:23:16,960
variază și poate lua uneori o

51357
38:23:15,200 --> 38:23:18,880
valoare mai mică sau poate lua o cale

51358
38:23:16,960 --> 38:23:20,560
valoare mai mare.

51359
38:23:18,880 --> 38:23:22,480
Forma generală a probabilității

51360
38:23:20,560 --> 38:23:24,384
densitatea este denumită probabilitate

51361
38:23:22,480 --> 38:23:27,360
distributie. Iar calculul de

51362
38:23:24,384 --> 38:23:29,440
probabilități pentru rezultate specifice ale a

51363
38:23:27,360 --> 38:23:32,160
variabila aleatoare este realizata de a

51364
38:23:29,440 --> 38:23:35,440
funcția de densitate de probabilitate sau PDF pentru

51365
38:23:32,160 --> 38:23:39,360
scurt. Acum considerăm o variabilă X cu a

51366
38:23:35,440 --> 38:23:41,024
PDF de f ofx.

51367
38:23:39,360 --> 38:23:42,960
Aceasta este densitatea ta de probabilitate

51368
38:23:41,024 --> 38:23:45,520
funcția va arăta ca. S-ar putea să existe

51369
38:23:42,960 --> 38:23:49,360
un punct în care probabilitatea lui X

51370
38:23:45,520 --> 38:23:51,520
apariția este foarte mare. Prin urmare, dvs

51371
38:23:49,360 --> 38:23:54,080
funcția de distribuție a probabilității sau f

51372
38:23:51,520 --> 38:23:55,920
ofx va fi, de asemenea, foarte mare. La alta

51373
38:23:54,080 --> 38:23:58,480
punctează distribuția sau

51374
38:23:55,920 --> 38:24:00,960
probabilitatea ca X să se întâmple sau să apară

51375
38:23:58,480 --> 38:24:03,440
va fi foarte scăzut. De aici f

51376
38:24:00,960 --> 38:24:06,640
ofx va avea, de asemenea, un foarte mic

51377
38:24:03,440 --> 38:24:08,960
valoare. Practic, având în vedere eșantionul aleatoriu

51378
38:24:06,640 --> 38:24:10,800
a unei variabile pe care ar putea dori să o știm

51379
38:24:08,960 --> 38:24:12,800
lucruri precum forma probabilității

51380
38:24:10,800 --> 38:24:14,560
distributie. Aici e ceva

51381
38:24:12,800 --> 38:24:16,560
numită distribuție normală unde a

51382
38:24:14,560 --> 38:24:19,360
funcția de distribuție a probabilității ia

51383
38:24:16,560 --> 38:24:22,000
pe o formă de clopot.

51384
38:24:19,360 --> 38:24:23,744
Cu toate acestea, aceasta nu este probabilitatea

51385
38:24:22,000 --> 38:24:25,664
funcţie de densitate care ar putea întotdeauna

51386
38:24:23,744 --> 38:24:27,520
apar. Există probabilități diferite

51387
38:24:25,664 --> 38:24:29,200
funcțiile de distribuție și toate acestea

51388
38:24:27,520 --> 38:24:31,664
graficele arată foarte diferit de fiecare

51389
38:24:29,200 --> 38:24:33,600
altele. Cunoscând probabilitatea

51390
38:24:31,664 --> 38:24:35,600
distribuția pentru o variabilă aleatoare poate

51391
38:24:33,600 --> 38:24:37,840
vă ajută să calculați mișcările

51392
38:24:35,600 --> 38:24:40,000
distribuție precum media și varianța.

51393
38:24:37,840 --> 38:24:42,320
Dar poate fi util și pentru altele

51394
38:24:40,000 --> 38:24:44,560
consideraţii generale precum determinarea

51395
38:24:42,320 --> 38:24:47,600
dacă o observaţie este improbabilă sau

51396
38:24:44,560 --> 38:24:50,960
foarte puțin probabil și ar putea fi un aberant sau

51397
38:24:47,600 --> 38:24:54,560
o anomalie ca să luăm în considerare acest grafic

51398
38:24:50,960 --> 38:24:57,024
în sine. În acest grafic, aceste puncte sunt peste

51399
38:24:54,560 --> 38:24:58,800
aici care au o probabilitate foarte mică

51400
38:24:57,024 --> 38:25:01,840
distributie

51401
38:24:58,800 --> 38:25:04,800
sunt valori aberante ceea ce înseamnă că șansa

51402
38:25:01,840 --> 38:25:06,800
dintre ele care apar este foarte scăzută. Şi

51403
38:25:04,800 --> 38:25:08,880
practic acesta nu este ceva care

51404
38:25:06,800 --> 38:25:11,744
veți vedea în regula

51405
38:25:08,880 --> 38:25:13,920
scenariu pentru variabila dvs. X. Acum haideți

51406
38:25:11,744 --> 38:25:17,200
luați în considerare două puncte A și B care sunt

51407
38:25:13,920 --> 38:25:19,664
valorile pe care le poate lua o variabilă X. P din

51408
38:25:17,200 --> 38:25:22,560
A și P din B reprezintă doar

51409
38:25:19,664 --> 38:25:25,024
probabilitatea lui A și probabilitatea de

51410
38:25:22,560 --> 38:25:27,200
B care poate fi aflat prin desenul a

51411
38:25:25,024 --> 38:25:30,960
linie dreaptă și coincizând-o cu a noastră

51412
38:25:27,200 --> 38:25:33,024
grafice. Zona de sub grafic peste

51413
38:25:30,960 --> 38:25:36,560
aici care vă va oferi

51414
38:25:33,024 --> 38:25:40,080
probabilitatea apariţiei acestei regiuni poate

51415
38:25:36,560 --> 38:25:42,320
se scrie ca probabilitate de A mai mică decât

51416
38:25:40,080 --> 38:25:44,480
egal cu X care este o probabilitate ca

51417
38:25:42,320 --> 38:25:47,744
căutăm aici mai puțin decât egal

51418
38:25:44,480 --> 38:25:51,440
la probabilitatea lui B. Ce înseamnă aceasta

51419
38:25:47,744 --> 38:25:53,520
exact? Aceasta înseamnă că această zonă este

51420
38:25:51,440 --> 38:25:56,480
va fi întotdeauna mai mare sau egal

51421
38:25:53,520 --> 38:25:58,720
la probabilitatea lui A dar mai mică decât sau

51422
38:25:56,480 --> 38:26:01,744
egală cu probabilitatea lui B. Aceasta

51423
38:25:58,720 --> 38:26:03,920
ne oferă regiunea îngustă

51424
38:26:01,744 --> 38:26:06,960
a probabilităţii care este prezentă peste

51425
38:26:03,920 --> 38:26:09,920
aici. Și făcând asta putem găsi

51426
38:26:06,960 --> 38:26:12,960
probabilitatea de apariție pentru orice valoare

51427
38:26:09,920 --> 38:26:15,360
de X. Să presupunem că doriți să găsiți

51428
38:26:12,960 --> 38:26:18,080
probabilitatea ca B să se întâmple. Pentru a

51429
38:26:15,360 --> 38:26:21,600
funcția de distribuție a probabilității, cea

51430
38:26:18,080 --> 38:26:24,560
probabilitatea ca B să se întâmple nu este pur și simplu

51431
38:26:21,600 --> 38:26:27,520
acest punct aici, dar întreaga zonă a

51432
38:26:24,560 --> 38:26:30,080
graficul care are loc înainte

51433
38:26:27,520 --> 38:26:32,080
acest punct în sine. Deci dacă vrei

51434
38:26:30,080 --> 38:26:33,600
găsiți probabilitatea dintre acestea

51435
38:26:32,080 --> 38:26:36,640
regiuni, va trebui să găsiți

51436
38:26:33,600 --> 38:26:39,200
întreaga zonă și nu doar

51437
38:26:36,640 --> 38:26:41,200
probabilitate la un moment dat.

51438
38:26:39,200 --> 38:26:42,880
Acum, până acum am tot vorbit

51439
38:26:41,200 --> 38:26:44,880
diferite tipuri de variabile care este

51440
38:26:42,880 --> 38:26:48,320
variabile aleatoare discrete şi continue

51441
38:26:44,880 --> 38:26:50,640
variabile. Ce înseamnă mai exact acestea? A

51442
38:26:48,320 --> 38:26:52,720
variabilă care poate lua doar o valoare

51443
38:26:50,640 --> 38:26:55,520
într-un anumit interval se numește a

51444
38:26:52,720 --> 38:26:57,280
variabilă aleatoare discretă. Valoarea este

51445
38:26:55,520 --> 38:27:00,320
de obicei la o anumită distanță de

51446
38:26:57,280 --> 38:27:03,104
o altă valoare finită. Un exemplu în acest sens

51447
38:27:00,320 --> 38:27:05,440
ar fi suma a două zaruri. Practic

51448
38:27:03,104 --> 38:27:08,080
valorile care sunt bine definite sunt numite

51449
38:27:05,440 --> 38:27:10,000
valori discrete sau şi o variabilă care

51450
38:27:08,080 --> 38:27:13,360
are valori bine definite va fi

51451
38:27:10,000 --> 38:27:15,920
numită variabilă aleatoare discretă.

51452
38:27:13,360 --> 38:27:19,024
Această variabilă poate lua numai valori care

51453
38:27:15,920 --> 38:27:21,360
se încadrează într-un anumit set de valori.

51454
38:27:19,024 --> 38:27:23,664
Să presupunem că arunci un zar. Zarurile pot

51455
38:27:21,360 --> 38:27:26,160
vă oferă doar rezultate specifice care

51456
38:27:23,664 --> 38:27:29,024
variază de la 1 la șase. Asta este ceea ce tu

51457
38:27:26,160 --> 38:27:31,104
ar numi o ieșire discretă.

51458
38:27:29,024 --> 38:27:33,744
Pe de altă parte, o aleatorie continuă

51459
38:27:31,104 --> 38:27:36,080
variabila poate lua o infinitate diferita

51460
38:27:33,744 --> 38:27:38,160
valori într-un interval de valori. Pentru

51461
38:27:36,080 --> 38:27:40,880
de exemplu, înălțimea unui elev. The

51462
38:27:38,160 --> 38:27:46,240
înălțimea unui elev nu este fixă. Chiar și

51463
38:27:40,880 --> 38:27:50,080
dacă înălțimea este de 1,7 m, în realitate,

51464
38:27:46,240 --> 38:27:52,560
înălțimea poate fi de 1,77 sau 1,765

51465
38:27:50,080 --> 38:27:54,384
sau 1.789.

51466
38:27:52,560 --> 38:27:56,800
Înălțimea exactă este foarte greu de găsit

51467
38:27:54,384 --> 38:28:00,160
determina pentru ca nu ne este usor

51468
38:27:56,800 --> 38:28:02,720
pentru a afla valoarea exactă a înălțimii

51469
38:28:00,160 --> 38:28:04,800
a unui student. Deci, practic, înălțimea

51470
38:28:02,720 --> 38:28:06,800
poate lua o gamă infinită diferită

51471
38:28:04,800 --> 38:28:08,800
a valorilor. Când încercăm să definim

51472
38:28:06,800 --> 38:28:11,280
valorile pe care o continuă aleatorie

51473
38:28:08,800 --> 38:28:13,440
variabila poate lua, de obicei o spunem în

51474
38:28:11,280 --> 38:28:15,664
forma unui interval de valori care

51475
38:28:13,440 --> 38:28:18,160
înseamnă că valoarea poate scădea în asta

51476
38:28:15,664 --> 38:28:20,960
interval și poate lua orice valoare în aceasta

51477
38:28:18,160 --> 38:28:23,360
interval. Nu este ca o întâmplare discretă

51478
38:28:20,960 --> 38:28:26,160
variabilă unde puteți defini definitiv

51479
38:28:23,360 --> 38:28:27,600
valorile.

51480
38:28:26,160 --> 38:28:29,104
Acum să înțelegem o probabilitate

51481
38:28:27,600 --> 38:28:31,360
funcția de densitate cu ajutorul a

51482
38:28:29,104 --> 38:28:33,360
grafic. Luați în considerare graficul de mai jos

51483
38:28:31,360 --> 38:28:36,080
arată distribuția precipitațiilor într-un

51484
38:28:33,360 --> 38:28:38,384
an într-un oraș. Axa x are

51485
38:28:36,080 --> 38:28:40,384
precipitații în inci sau cantitatea de ploaie

51486
38:28:38,384 --> 38:28:42,320
că primim și axa y are

51487
38:28:40,384 --> 38:28:45,600
funcția de densitate de probabilitate a

51488
38:28:42,320 --> 38:28:47,440
primind acea cantitate de ploaie.

51489
38:28:45,600 --> 38:28:50,160
Probabilitatea unei cantități de

51490
38:28:47,440 --> 38:28:53,200
precipitatiile se obtin prin gasirea zonei

51491
38:28:50,160 --> 38:28:56,240
a curbei din stânga acesteia. Deci haideți

51492
38:28:53,200 --> 38:28:59,104
sa zicem ca avem 3.

51493
38:28:56,240 --> 38:29:01,600
Dacă doriți să găsiți probabilitatea de 3

51494
38:28:59,104 --> 38:29:05,664
în cazul ploilor care au loc, am avea

51495
38:29:01,600 --> 38:29:08,320
pentru a afla aria curbei

51496
38:29:05,664 --> 38:29:10,000
care cade în stânga a trei. Când

51497
38:29:08,320 --> 38:29:12,640
tragem o linie din trei care

51498
38:29:10,000 --> 38:29:16,640
interceptează graficul și se extinde în continuare

51499
38:29:12,640 --> 38:29:18,560
pe yaxis, obținem o valoare de

51500
38:29:16,640 --> 38:29:20,640
0,5.

51501
38:29:18,560 --> 38:29:23,024
Mai simplu spus, asta înseamnă că

51502
38:29:20,640 --> 38:29:25,600
probabilitatea de 3 in de precipitații

51503
38:29:23,024 --> 38:29:29,104
apariția va fi mai mică decât sau

51504
38:29:25,600 --> 38:29:31,200
egal cu 0,5. Probabilitatea exactă poate

51505
38:29:29,104 --> 38:29:34,160
fi aflat prin găsirea zonei de

51506
38:29:31,200 --> 38:29:38,744
curba

51507
38:29:34,160 --> 38:29:38,744
care cade în stânga a trei.

51508
38:29:38,880 --> 38:29:43,360
Cum găsim probabilitatea

51509
38:29:40,320 --> 38:29:45,104
functie de distributie?

51510
38:29:43,360 --> 38:29:47,360
Primul pas este să vă rezumați

51511
38:29:45,104 --> 38:29:49,664
densitate cu ajutorul unei histograme.

51512
38:29:47,360 --> 38:29:51,440
Primul pas într-o estimare a densității

51513
38:29:49,664 --> 38:29:53,360
este de a crea o histogramă a

51514
38:29:51,440 --> 38:29:56,320
observatii

51515
38:29:53,360 --> 38:29:58,640
în eşantionul aleator.

51516
38:29:56,320 --> 38:30:00,960
Acum, ce este o histogramă? O histogramă este

51517
38:29:58,640 --> 38:30:03,200
un complot care implică mai întâi gruparea

51518
38:30:00,960 --> 38:30:06,160
observarea în coșuri și numărarea

51519
38:30:03,200 --> 38:30:08,480
numărul de evenimente care se încadrează în fiecare coș.

51520
38:30:06,160 --> 38:30:10,800
Numărările sau frecvența observării

51521
38:30:08,480 --> 38:30:13,360
în fiecare pubele sunt apoi trasate ca o bară

51522
38:30:10,800 --> 38:30:16,000
grafic cu binurile pe axa x și

51523
38:30:13,360 --> 38:30:18,320
frecvența pe axa y. Alegerea

51524
38:30:16,000 --> 38:30:19,840
a numărului de pubele este important

51525
38:30:18,320 --> 38:30:22,384
controlează grosieritatea

51526
38:30:19,840 --> 38:30:24,480
distributie si la randul sau cat de bine cel

51527
38:30:22,384 --> 38:30:26,560
este reprezentată grafic densitatea observației.

51528
38:30:24,480 --> 38:30:28,960
Este o idee bună să experimentezi

51529
38:30:26,560 --> 38:30:31,360
dimensiuni diferite ale recipientelor pentru o anumită date

51530
38:30:28,960 --> 38:30:35,480
eșantion pentru a obține mai multe perspective sau

51531
38:30:31,360 --> 38:30:35,480
vederi asupra acelorași date.

51532
38:30:35,600 --> 38:30:40,240
În același timp, numărul de pubele este

51533
38:30:37,664 --> 38:30:41,920
important deoarece determină câte bare

51534
38:30:40,240 --> 38:30:44,480
histograma va avea si lor

51535
38:30:41,920 --> 38:30:46,960
lățimi. Acest lucru va schimba nu numai

51536
38:30:44,480 --> 38:30:49,200
forma graficului dar și modul în care

51537
38:30:46,960 --> 38:30:51,840
se citește graficul. Aceasta va determina, de asemenea

51538
38:30:49,200 --> 38:30:53,600
cum este trasată densitatea noastră. Acum hai

51539
38:30:51,840 --> 38:30:56,560
vezi cum ne putem rezuma densitatea

51540
38:30:53,600 --> 38:30:58,240
cu histograme folosind Python. Primul

51541
38:30:56,560 --> 38:31:00,480
hai să importam toate cele necesare

51542
38:30:58,240 --> 38:31:02,320
modulele pe care le vom avea nevoie.

51543
38:31:00,480 --> 38:31:05,440
Vom cere Mattplot lib

51544
38:31:02,320 --> 38:31:07,840
trasează grafice. Vom avea nevoie de

51545
38:31:05,440 --> 38:31:09,600
funcție aleatorie normală, astfel încât să putem

51546
38:31:07,840 --> 38:31:12,160
obține o distribuție normală. Mergem

51547
38:31:09,600 --> 38:31:15,744
pentru a importa media și abaterea standard

51548
38:31:12,160 --> 38:31:18,240
de la numpy pentru a fi folosit pe graficele noastre și, de asemenea

51549
38:31:15,744 --> 38:31:20,880
vom normaliza datele noastre. Deci suntem

51550
38:31:18,240 --> 38:31:23,880
va importa funcția nom din

51551
38:31:20,880 --> 38:31:23,880
sci.

51552
38:31:25,744 --> 38:31:30,560
Am terminat de importat tot

51553
38:31:27,440 --> 38:31:32,880
modulele necesare. Acum să generăm un

51554
38:31:30,560 --> 38:31:34,960
probă

51555
38:31:32,880 --> 38:31:36,880
care are o mărime de mii și este

51556
38:31:34,960 --> 38:31:38,960
va fi o distribuție normală. Şi

51557
38:31:36,880 --> 38:31:44,200
vom complota și asta cu

51558
38:31:38,960 --> 38:31:44,200
ajutorul unei histograme în containere de 10.

51559
38:31:44,720 --> 38:31:48,880
Deci, după cum puteți vedea aici, obțineți o normalitate

51560
38:31:46,800 --> 38:31:52,080
distribuție care nu este altceva decât o

51561
38:31:48,880 --> 38:31:54,880
curbă aproape în formă de clopot și avem 10

51562
38:31:52,080 --> 38:31:59,440
pubele aici care sunt centrate la zero și

51563
38:31:54,880 --> 38:32:02,240
care se extind de la minus3 la 3.

51564
38:31:59,440 --> 38:32:04,720
Cum va arăta graficul nostru dacă schimbăm

51565
38:32:02,240 --> 38:32:07,104
totusi numarul de pubele?

51566
38:32:04,720 --> 38:32:09,024
Hai să-l rulăm și să vedem. Deci mai ai

51567
38:32:07,104 --> 38:32:11,600
o distributie normala dar nu este ca

51568
38:32:09,024 --> 38:32:13,840
bine definite din cauza cât de mai puțin

51569
38:32:11,600 --> 38:32:15,920
numărul de pubele sunt. pierzi majoritatea

51570
38:32:13,840 --> 38:32:18,000
a datelor care vor contribui la

51571
38:32:15,920 --> 38:32:19,664
distribuția ta normală. Nu este

51572
38:32:18,000 --> 38:32:21,920
arată ca o distribuție normală adecvată

51573
38:32:19,664 --> 38:32:24,720
dar seamănă mai mult cu o dată discretă

51574
38:32:21,920 --> 38:32:27,664
în acest moment. Acum să aruncăm o privire la

51575
38:32:24,720 --> 38:32:29,840
următorul pas de a găsi o probabilitate

51576
38:32:27,664 --> 38:32:31,840
funcția de distribuție.

51577
38:32:29,840 --> 38:32:34,640
Următorul pas se numește parametri

51578
38:32:31,840 --> 38:32:37,360
estimarea densității. Ce este mai exact

51579
38:32:34,640 --> 38:32:39,600
estimarea densității parametrice? The

51580
38:32:37,360 --> 38:32:42,160
funcția de densitate de probabilitate este de multe

51581
38:32:39,600 --> 38:32:43,920
tipuri. Forma histogramei dvs. va

51582
38:32:42,160 --> 38:32:46,160
vă ajută să determinați ce tip de a

51583
38:32:43,920 --> 38:32:48,880
functia este. Putem si calcula

51584
38:32:46,160 --> 38:32:51,280
parametrii asociați cu

51585
38:32:48,880 --> 38:32:54,000
funcția de a obține densitatea noastră. Acum

51586
38:32:51,280 --> 38:32:57,664
distribuție de probabilitate diferită

51587
38:32:54,000 --> 38:33:00,160
funcţiile vor avea

51588
38:32:57,664 --> 38:33:01,520
diferite grafice care vor avea

51589
38:33:00,160 --> 38:33:03,840
forme diferite şi care vor de asemenea

51590
38:33:01,520 --> 38:33:06,384
au parametri diferiți, cum ar fi media,

51591
38:33:03,840 --> 38:33:09,104
abaterea standard etc asociată cu

51592
38:33:06,384 --> 38:33:13,280
ei. Folosind acești parametri, putem

51593
38:33:09,104 --> 38:33:15,440
găsiți puncte importante ale datelor noastre.

51594
38:33:13,280 --> 38:33:17,360
Prin urmare, este foarte important pentru noi

51595
38:33:15,440 --> 38:33:20,000
recunoașteți ce tip de distribuție este

51596
38:33:17,360 --> 38:33:21,664
este. Vor avea loc distribuții comune

51597
38:33:20,000 --> 38:33:24,480
iar şi iar în diferite şi

51598
38:33:21,664 --> 38:33:26,560
uneori domenii neașteptate.

51599
38:33:24,480 --> 38:33:29,280
Familiarizarea cu probabilitatea comună

51600
38:33:26,560 --> 38:33:31,744
distribuțiile vă vor ajuta să identificați a

51601
38:33:29,280 --> 38:33:33,744
distribuție dintr-o histogramă. Și o dată

51602
38:33:31,744 --> 38:33:36,000
identificate, puteți încerca să estimați

51603
38:33:33,744 --> 38:33:38,384
densitatea variabilei aleatoare cu

51604
38:33:36,000 --> 38:33:40,080
o distribuție de probabilitate aleasă. Aceasta

51605
38:33:38,384 --> 38:33:42,160
poate fi realizat prin estimarea

51606
38:33:40,080 --> 38:33:45,024
parametrii distribuției din a

51607
38:33:42,160 --> 38:33:46,800
eșantion aleatoriu de date. Acum, un exemplu

51608
38:33:45,024 --> 38:33:49,104
din aceasta ar fi o distribuție normală

51609
38:33:46,800 --> 38:33:51,520
care are doi parametri principali, media

51610
38:33:49,104 --> 38:33:53,840
și abaterea standard. Având în vedere acestea două

51611
38:33:51,520 --> 38:33:56,320
parametrii, vom cunoaște acum

51612
38:33:53,840 --> 38:33:58,720
funcția de distribuție a probabilității. Acestea

51613
38:33:56,320 --> 38:34:01,200
parametrii pot fi estimați din date prin

51614
38:33:58,720 --> 38:34:03,920
calcularea mediei eșantionului și eșantionului

51615
38:34:01,200 --> 38:34:05,840
abaterea standard. Tot acest proces

51616
38:34:03,920 --> 38:34:08,880
este cunoscută sub denumirea de densitate parametrică

51617
38:34:05,840 --> 38:34:11,024
estimare și include identificarea

51618
38:34:08,880 --> 38:34:12,800
funcția dvs. de distribuție a probabilității

51619
38:34:11,024 --> 38:34:16,440
și obținerea parametrilor care sunt

51620
38:34:12,800 --> 38:34:16,440
asociat cu acesta.

51621
38:34:16,560 --> 38:34:22,920
Acum, odată ce am estimat densitatea,

51622
38:34:18,560 --> 38:34:22,920
putem verifica dacă se potrivește bine.

51623
38:34:24,000 --> 38:34:28,720
Acest lucru se poate face în trei diferite

51624
38:34:26,160 --> 38:34:30,800
moduri. Unul este reprezentarea grafică a densității

51625
38:34:28,720 --> 38:34:33,104
funcția și comparând forma cu cea

51626
38:34:30,800 --> 38:34:35,360
histogramă. Următorul este eșantionarea

51627
38:34:33,104 --> 38:34:38,080
funcția de densitate și compararea

51628
38:34:35,360 --> 38:34:40,480
eșantionul generat la eșantionul real. Şi

51629
38:34:38,080 --> 38:34:42,640
ultimul folosește un test statistic

51630
38:34:40,480 --> 38:34:44,800
pentru a confirma dacă datele se potrivesc cu

51631
38:34:42,640 --> 38:34:48,080
distributie. Acum aici, cât poți

51632
38:34:44,800 --> 38:34:51,520
vezi tot ce am făcut este să ne luăm datele și

51633
38:34:48,080 --> 38:34:53,360
a trasat funcția de densitate deasupra

51634
38:34:51,520 --> 38:34:55,360
histograma noastră și am comparat

51635
38:34:53,360 --> 38:34:56,720
forma. Deci distribuția astfel încât

51636
38:34:55,360 --> 38:34:58,800
funcția de densitate pe care o suntem de fapt

51637
38:34:56,720 --> 38:35:01,440
considerând că aici este un normal

51638
38:34:58,800 --> 38:35:03,600
distribuție și din acest grafic putem

51639
38:35:01,440 --> 38:35:06,240
vezi că se potrivește aproape exact la noi

51640
38:35:03,600 --> 38:35:08,880
histogramă. Acum să vedem cum putem

51641
38:35:06,240 --> 38:35:12,384
efectuați estimarea densității parametrice

51642
38:35:08,880 --> 38:35:14,640
folosind Python. Pentru început,

51643
38:35:12,384 --> 38:35:16,880
să generăm un eșantion aleatoriu de

51644
38:35:14,640 --> 38:35:19,600
mii de observații dintr-un normal

51645
38:35:16,880 --> 38:35:22,160
distribuție cu o medie de 50 care este

51646
38:35:19,600 --> 38:35:24,480
determinat de parametrul LOC şi a

51647
38:35:22,160 --> 38:35:28,664
abaterea standard de cinci care este

51648
38:35:24,480 --> 38:35:28,664
determinat de parametrul de scară.

51649
38:35:29,200 --> 38:35:33,104
Acum doar să vă arăt ce

51650
38:35:31,664 --> 38:35:35,920
distribuția arată ca, vom face

51651
38:35:33,104 --> 38:35:38,080
trasează-l sub forma unei histograme. Deci

51652
38:35:35,920 --> 38:35:40,160
asa arata histograma.

51653
38:35:38,080 --> 38:35:42,640
Dar aceasta este doar pentru a vă oferi o bază

51654
38:35:40,160 --> 38:35:45,520
idee despre datele noastre și despre cum arată acestea

51655
38:35:42,640 --> 38:35:49,024
odată trasată. Dar să presupunem că noi

51656
38:35:45,520 --> 38:35:51,280
nu cunosc distribuția probabilității

51657
38:35:49,024 --> 38:35:53,280
și nu știm cum arată

51658
38:35:51,280 --> 38:35:56,384
ca histogramă și nu știm asta

51659
38:35:53,280 --> 38:35:58,320
ca e normal. Deci acum, dacă doar am

51660
38:35:56,384 --> 38:35:59,744
presupunem că este normal, putem

51661
38:35:58,320 --> 38:36:02,080
calculați parametrii

51662
38:35:59,744 --> 38:36:04,160
distribuţia în special media şi

51663
38:36:02,080 --> 38:36:05,664
abaterea standard.

51664
38:36:04,160 --> 38:36:07,520
Nu ne-am aștepta la medie și

51665
38:36:05,664 --> 38:36:10,000
abaterea standard să fie 50 și cinci.

51666
38:36:07,520 --> 38:36:12,960
Exact având în vedere dimensiunea mică a eșantionului și

51667
38:36:10,000 --> 38:36:15,024
zgomotul din datele de eșantionare.

51668
38:36:12,960 --> 38:36:18,000
Deci din cauza acestui zgomot și a micului

51669
38:36:15,024 --> 38:36:20,000
dimensiunea eșantionului, avem o medie de aproape 50

51670
38:36:18,000 --> 38:36:22,640
și o abatere standard de puțină

51671
38:36:20,000 --> 38:36:25,280
mai mult de cinci.

51672
38:36:22,640 --> 38:36:28,384
Acum să definim distribuția ca

51673
38:36:25,280 --> 38:36:30,384
normal. Deci, acum, folosind asta am definit

51674
38:36:28,384 --> 38:36:34,480
o distributie normala. Noi am folosit

51675
38:36:30,384 --> 38:36:37,600
metoda norma a bibliotecii sci-fi uh si

51676
38:36:34,480 --> 38:36:39,200
uh, facem asta cu media și

51677
38:36:37,600 --> 38:36:42,880
abaterea standard pe care o avem

51678
38:36:39,200 --> 38:36:44,384
obţinute din probele noastre. Deci până la

51679
38:36:42,880 --> 38:36:46,480
acum presupunem doar că este o

51680
38:36:44,384 --> 38:36:48,720
distribuţie normală şi din această cauză

51681
38:36:46,480 --> 38:36:51,520
parametrii pe care i-am calculat este

51682
38:36:48,720 --> 38:36:53,440
media și abaterea standard

51683
38:36:51,520 --> 38:36:55,744
și folosind media calculată și

51684
38:36:53,440 --> 38:36:57,360
abaterea standard am ajuns la normal

51685
38:36:55,744 --> 38:36:59,664
distributie.

51686
38:36:57,360 --> 38:37:02,240
Și până acum ține din nou minte noi

51687
38:36:59,664 --> 38:37:04,800
nu știu sigur că este o

51688
38:37:02,240 --> 38:37:06,960
distributie normala. Până acum tot ce avem

51689
38:37:04,800 --> 38:37:08,480
sunt aceste date.

51690
38:37:06,960 --> 38:37:10,640
Deci următorul lucru pe care îl vom face

51691
38:37:08,480 --> 38:37:12,960
se potrivește distribuția cu acestea

51692
38:37:10,640 --> 38:37:14,880
parametrii

51693
38:37:12,960 --> 38:37:17,200
și apoi eșantionați probabilitățile pentru a

51694
38:37:14,880 --> 38:37:19,744
distribuție pentru un interval de valori în

51695
38:37:17,200 --> 38:37:22,160
domeniul nostru care în acest caz este 30 și

51696
38:37:19,744 --> 38:37:24,160
70. Deci tot ce facem este că suntem

51697
38:37:22,160 --> 38:37:27,440
calcularea probabilităților pentru un interval de

51698
38:37:24,160 --> 38:37:31,960
rezultate. Și în acest caz am luat

51699
38:37:27,440 --> 38:37:31,960
30 și 70 ca domeniul nostru.

51700
38:37:32,240 --> 38:37:36,960
Deci acestea sunt probabilitatea

51701
38:37:33,920 --> 38:37:38,640
valori de distribuție pentru normal

51702
38:37:36,960 --> 38:37:41,280
distribuția pe care am definit-o

51703
38:37:38,640 --> 38:37:42,960
aici. Și asta va face asta

51704
38:37:41,280 --> 38:37:45,360
practic, vă voi oferi schița

51705
38:37:42,960 --> 38:37:46,800
a distribuției dumneavoastră normale.

51706
38:37:45,360 --> 38:37:48,880
Acestea sunt punctele în care dvs

51707
38:37:46,800 --> 38:37:50,560
distribuția normală va fi reprezentată grafic. Uh

51708
38:37:48,880 --> 38:37:52,960
acum ceea ce vom face practic este

51709
38:37:50,560 --> 38:37:55,664
vom trasa histogramele folosind

51710
38:37:52,960 --> 38:37:58,384
mostrele pe care le-am generat deja

51711
38:37:55,664 --> 38:38:00,880
împreună cu valorile şi probabilităţile

51712
38:37:58,384 --> 38:38:04,200
a funcției normale pe care am definit-o

51713
38:38:00,880 --> 38:38:04,200
aici.

51714
38:38:05,024 --> 38:38:09,744
Deci, după cum puteți vedea, este tot ce este

51715
38:38:07,104 --> 38:38:13,024
aproape o potrivire completă. Normalul

51716
38:38:09,744 --> 38:38:14,640
distribuția pe care o avem aici este făcută

51717
38:38:13,024 --> 38:38:18,880
folosind media și standardul

51718
38:38:14,640 --> 38:38:20,560
abaterea probelor noastre reale.

51719
38:38:18,880 --> 38:38:22,480
Motivul pentru care am luat în considerare mediul și standardul

51720
38:38:20,560 --> 38:38:25,360
abaterea a fost pentru că am presupus că este

51721
38:38:22,480 --> 38:38:28,000
o distribuţie normală şi parametrii

51722
38:38:25,360 --> 38:38:30,720
asociate cu distribuția normală

51723
38:38:28,000 --> 38:38:32,640
sunt media și abaterea standard. Folosind

51724
38:38:30,720 --> 38:38:36,480
media și deviația standard, am obținut

51725
38:38:32,640 --> 38:38:38,080
distribuția normală. Noi am calculat

51726
38:38:36,480 --> 38:38:40,880
probabilități pentru acest normal

51727
38:38:38,080 --> 38:38:42,880
distribuție folosind un domeniu aleator de 30

51728
38:38:40,880 --> 38:38:45,024
și 70

51729
38:38:42,880 --> 38:38:48,480
și am trasat probabilitățile și

51730
38:38:45,024 --> 38:38:50,560
valorile de deasupra histogramei noastre pentru a vedea dacă

51731
38:38:48,480 --> 38:38:53,600
distribuția normală se potrivea cu noi

51732
38:38:50,560 --> 38:38:55,280
histogramă. Dacă nu a fost o potrivire, tu

51733
38:38:53,600 --> 38:38:58,080
ar trebui să meargă și să facă la fel

51734
38:38:55,280 --> 38:39:01,480
procedură cu altă probabilitate comună

51735
38:38:58,080 --> 38:39:01,480
funcții de densitate

51736
38:39:01,840 --> 38:39:06,160
până când ați găsit o funcție care a fost a

51737
38:39:03,744 --> 38:39:08,640
potrivirea corectă la histograma dvs. Acum hai

51738
38:39:06,160 --> 38:39:11,840
treceți la pasul final care este utilizat

51739
38:39:08,640 --> 38:39:13,744
în calculul unui PDF. Această finală

51740
38:39:11,840 --> 38:39:16,640
pasul se numește densitate neparametrică

51741
38:39:13,744 --> 38:39:18,960
estimare și este folosită numai atunci când

51742
38:39:16,640 --> 38:39:21,360
forma unei histograme nu se potrivește cu a

51743
38:39:18,960 --> 38:39:23,920
funcţia comună de densitate de probabilitate sau

51744
38:39:21,360 --> 38:39:25,600
nu poate fi făcut să se potrivească cu unul. In aceasta

51745
38:39:23,920 --> 38:39:28,000
caz, vom calcula densitatea

51746
38:39:25,600 --> 38:39:30,080
folosind toate mostrele din datele noastre folosind

51747
38:39:28,000 --> 38:39:31,840
anumiți algoritmi.

51748
38:39:30,080 --> 38:39:34,240
Acest lucru se face numai atunci când o mostră de date

51749
38:39:31,840 --> 38:39:36,720
nu seamănă cu o probabilitate comună

51750
38:39:34,240 --> 38:39:38,880
distributie sau nu se poate face usor

51751
38:39:36,720 --> 38:39:40,800
pentru a se potrivi distribuției. Și aceasta este

51752
38:39:38,880 --> 38:39:43,360
adesea cazul când datele au două

51753
38:39:40,800 --> 38:39:46,480
culmi. Acest lucru se mai numește și biodal

51754
38:39:43,360 --> 38:39:48,000
distribuţie sau are multe vârfuri care

51755
38:39:46,480 --> 38:39:50,160
se mai numește și multimodal

51756
38:39:48,000 --> 38:39:52,880
distributie. În acest caz,

51757
38:39:50,160 --> 38:39:55,520
estimarea densității parametrice nu va

51758
38:39:52,880 --> 38:39:57,520
să fie fezabile, iar metodele alternative pot

51759
38:39:55,520 --> 38:39:59,920
să fie folosite care nu folosesc un comun

51760
38:39:57,520 --> 38:40:01,920
distributie. În schimb, vei folosi un

51761
38:39:59,920 --> 38:40:04,480
algoritm care este folosit pentru aproximare

51762
38:40:01,920 --> 38:40:06,880
distribuția de probabilitate a datelor

51763
38:40:04,480 --> 38:40:09,744
fără o distribuţie predefinită care

51764
38:40:06,880 --> 38:40:12,000
este denumit și neparametric

51765
38:40:09,744 --> 38:40:14,880
metodă pentru că nu folosim niciuna

51766
38:40:12,000 --> 38:40:17,104
parametri predefiniti. Distributia

51767
38:40:14,880 --> 38:40:19,520
va avea în continuare parametri, dar aceștia sunt

51768
38:40:17,104 --> 38:40:22,000
nu este controlabil în același mod ca a

51769
38:40:19,520 --> 38:40:24,880
distribuție simplă de probabilitate. Pentru

51770
38:40:22,000 --> 38:40:26,960
de exemplu, o metodă neparametrică ar putea

51771
38:40:24,880 --> 38:40:29,520
estima densitatea folosind toate

51772
38:40:26,960 --> 38:40:31,520
observații într-un eșantion aleatoriu în

51773
38:40:29,520 --> 38:40:34,920
efect făcând toate observațiile în

51774
38:40:31,520 --> 38:40:34,920
parametrii eșantionului.

51775
38:40:37,520 --> 38:40:42,240
Acum luați în considerare acest grafic care are două

51776
38:40:39,744 --> 38:40:44,080
culmi. Tu asta nu este normal

51777
38:40:42,240 --> 38:40:46,480
distribuție sau orice alt fel de

51778
38:40:44,080 --> 38:40:48,720
distribuție cu care suntem familiarizați.

51779
38:40:46,480 --> 38:40:52,160
Deci pentru asta nu vom folosi a

51780
38:40:48,720 --> 38:40:54,240
metoda de estimare parametrică, dar suntem

51781
38:40:52,160 --> 38:40:57,840
doar sa calculez parametrii

51782
38:40:54,240 --> 38:41:00,160
pentru fiecare punct de probă din aceasta.

51783
38:40:57,840 --> 38:41:02,240
Poate cel mai comun nonparametric

51784
38:41:00,160 --> 38:41:04,384
abordare pentru estimarea probabilității

51785
38:41:02,240 --> 38:41:07,024
funcția de densitate a unei aleatorii continue

51786
38:41:04,384 --> 38:41:09,920
variabilă se numește netezire a nucleului sau

51787
38:41:07,024 --> 38:41:13,024
estimarea densității nucleului sau KDE pentru

51788
38:41:09,920 --> 38:41:15,200
scurt. Estimarea densității nucleului este a

51789
38:41:13,024 --> 38:41:17,440
metoda neparametrică de utilizare a datelor

51790
38:41:15,200 --> 38:41:19,104
stabilit pentru a estima probabilitățile pentru noi

51791
38:41:17,440 --> 38:41:21,440
puncte.

51792
38:41:19,104 --> 38:41:23,840
Utilizează o funcție matematică și

51793
38:41:21,440 --> 38:41:26,000
netezirea probabilităților. Deci deci

51794
38:41:23,840 --> 38:41:28,560
suma probabilităților rezultate este

51795
38:41:26,000 --> 38:41:31,024
mereu unul. Acum, în acest caz, un nucleu este

51796
38:41:28,560 --> 38:41:33,104
o funcție matematică care returnează a

51797
38:41:31,024 --> 38:41:35,840
probabilitatea pentru o valoare dată a lui a

51798
38:41:33,104 --> 38:41:37,600
variabilă aleatoare. Nucleul în mod eficient

51799
38:41:35,840 --> 38:41:40,384
netezește sau interpolează

51800
38:41:37,600 --> 38:41:42,960
probabilități într-o serie de rezultate

51801
38:41:40,384 --> 38:41:45,840
pentru o variabilă aleatorie astfel încât suma

51802
38:41:42,960 --> 38:41:47,520
de probabilități este întotdeauna egal cu unu. A

51803
38:41:45,840 --> 38:41:50,320
cerinţa de a se comporta bine

51804
38:41:47,520 --> 38:41:52,560
probabilități. Ai si un parametru

51805
38:41:50,320 --> 38:41:54,640
numit parametrul de netezire care

51806
38:41:52,560 --> 38:41:57,600
controlează domeniul sau fereastra de

51807
38:41:54,640 --> 38:41:59,104
observaţii din eşantioanele de date care

51808
38:41:57,600 --> 38:42:02,160
contribuie la estimarea

51809
38:41:59,104 --> 38:42:05,520
probabilitatea pentru un eșantion dat. As such

51810
38:42:02,160 --> 38:42:07,840
estimarea densității nucleului este s este

51811
38:42:05,520 --> 38:42:10,480
uneori denumit parsen dvs

51812
38:42:07,840 --> 38:42:12,560
rosenbalt window. Now at the end you

51813
38:42:10,480 --> 38:42:14,480
au, de asemenea, o funcție de bază care este a

51814
38:42:12,560 --> 38:42:16,800
funcția care este aleasă pentru a controla

51815
38:42:14,480 --> 38:42:18,960
contribuția eșantioanelor în setul de date

51816
38:42:16,800 --> 38:42:21,744
spre estimarea probabilității a

51817
38:42:18,960 --> 38:42:23,744
new point. Acest lucru se face doar pentru a face

51818
38:42:21,744 --> 38:42:26,080
sigur că nu înveți din multe

51819
38:42:23,744 --> 38:42:29,104
de zgomot și pe care nu îl folosești prea mult

51820
38:42:26,080 --> 38:42:31,024
of the outliers. Again let's see how we

51821
38:42:29,104 --> 38:42:35,840
poate efectua densitate neparametrică

51822
38:42:31,024 --> 38:42:37,440
estimare cu ajutorul lui Python.

51823
38:42:35,840 --> 38:42:39,744
Deci, mai întâi vom începe prin a importa toate

51824
38:42:37,440 --> 38:42:42,080
modulele necesare împreună cu

51825
38:42:39,744 --> 38:42:45,720
estimarea densității nucleului care poate fi

51826
38:42:42,080 --> 38:42:45,720
importat din skarn.

51827
38:42:47,600 --> 38:42:53,200
Acum să creăm o distribuție biodial

51828
38:42:51,024 --> 38:42:56,480
prin combinarea a două mostre diferite.

51829
38:42:53,200 --> 38:43:00,320
Proba unu și proba doi. Eșantionul unul

51830
38:42:56,480 --> 38:43:02,560
are 300 de exemple cu o medie de 20 și a

51831
38:43:00,320 --> 38:43:06,320
abaterea standard de cinci. În timp ce eșantionează

51832
38:43:02,560 --> 38:43:10,744
Two are 700 de exemple cu o medie de 40

51833
38:43:06,320 --> 38:43:10,744
și o abatere standard de cinci.

51834
38:43:10,880 --> 38:43:15,664
Apoi îl vom folosi stack to com

51835
38:43:13,280 --> 38:43:18,640
pentru a le îmbina pe amândouă împreună pentru a obține o

51836
38:43:15,664 --> 38:43:20,640
proba finala.

51837
38:43:18,640 --> 38:43:23,200
Mijloacele pe care le-am ales care este 20

51838
38:43:20,640 --> 38:43:25,440
iar 40 sunt alese aproape unul de altul

51839
38:43:23,200 --> 38:43:28,080
asigurați-vă că distribuțiile se suprapun în

51840
38:43:25,440 --> 38:43:30,480
proba combinată.

51841
38:43:28,080 --> 38:43:32,240
Deci asta este distribuția noastră.

51842
38:43:30,480 --> 38:43:35,520
Haideți să-l trasăm astfel încât să obțineți o bază

51843
38:43:32,240 --> 38:43:39,600
idee despre cum arată graficul nostru.

51844
38:43:35,520 --> 38:43:41,744
Deci, așa arată graficul nostru.

51845
38:43:39,600 --> 38:43:44,640
Acum știm deja că niciunul dintre

51846
38:43:41,744 --> 38:43:47,024
diverse probabilități diferite uh uh

51847
38:43:44,640 --> 38:43:48,560
funcțiile de distribuție se potrivesc acestor grafice.

51848
38:43:47,024 --> 38:43:52,520
Așa că acum vom face spectacol

51849
38:43:48,560 --> 38:43:52,520
estimări neparametrice.

51850
38:43:52,720 --> 38:43:57,384
Pentru a efectua estimări neparametrice,

51851
38:43:57,664 --> 38:44:01,744
vom folosi scikitlearn-ul

51852
38:43:59,520 --> 38:44:04,480
bibliotecă de învățare automată care oferă

51853
38:44:01,744 --> 38:44:07,104
clasa de densitate a nucleului care implementează

51854
38:44:04,480 --> 38:44:10,000
densitatea nucleului îmi pare rău că implementează

51855
38:44:07,104 --> 38:44:12,160
estimarea densității nucleului. Mai întâi

51856
38:44:10,000 --> 38:44:17,080
clasa este construită cu cea dorită

51857
38:44:12,160 --> 38:44:17,080
lățimea de bandă sau dimensiunea ferestrei de două

51858
38:44:17,200 --> 38:44:24,160
și funcția ta de bază

51859
38:44:20,160 --> 38:44:25,920
care în acest caz este o funcție gshian.

51860
38:44:24,160 --> 38:44:28,080
Este o idee bună să testați măcar

51861
38:44:25,920 --> 38:44:29,840
diferite configurații ale datelor dvs.

51862
38:44:28,080 --> 38:44:32,880
Și în acest caz vom încerca doar

51863
38:44:29,840 --> 38:44:34,640
o lățime de bandă de două și un nucleu gshian.

51864
38:44:32,880 --> 38:44:37,280
Dar de obicei sunt mai multe

51865
38:44:34,640 --> 38:44:39,200
diferite nuclee pe care le poți uh

51866
38:44:37,280 --> 38:44:40,720
știi că te poți juca

51867
38:44:39,200 --> 38:44:43,024
cu și puteți, de asemenea, să vă modificați

51868
38:44:40,720 --> 38:44:46,920
lățime de bandă pentru a se potrivi exact

51869
38:44:43,024 --> 38:44:46,920
distribuția pe care o aveți.

51870
38:44:47,360 --> 38:44:52,160
Acum hai să rulăm asta.

51871
38:44:50,240 --> 38:44:54,880
Uh, acum ne-am luat nucleul

51872
38:44:52,160 --> 38:44:57,744
estimarea densității. Acum putem

51873
38:44:54,880 --> 38:45:00,080
evaluați cât de bine se estimează densitatea

51874
38:44:57,744 --> 38:45:01,600
potrivește datele noastre prin calcul

51875
38:45:00,080 --> 38:45:03,520
probabilități

51876
38:45:01,600 --> 38:45:05,744
pentru o serie de observaţii şi

51877
38:45:03,520 --> 38:45:07,840
comparând forme cu histograma doar

51878
38:45:05,744 --> 38:45:10,384
așa cum am făcut pentru cazul parametrilor

51879
38:45:07,840 --> 38:45:12,640
înainte. Deci din nou vom face doar

51880
38:45:10,384 --> 38:45:15,280
calcula diferite probabilități folosind

51881
38:45:12,640 --> 38:45:16,720
funcția de densitate a nucleului

51882
38:45:15,280 --> 38:45:19,200
și doar o să-l punem deasupra

51883
38:45:16,720 --> 38:45:22,080
a unei histograme pentru a vedea cât de bine este

51884
38:45:19,200 --> 38:45:24,320
funcția de densitate a nucleului este estimativă

51885
38:45:22,080 --> 38:45:25,744
pentru datele noastre.

51886
38:45:24,320 --> 38:45:27,840
Deci acestea sunt probabilitățile ca

51887
38:45:25,744 --> 38:45:30,720
am ajuns în sfârşit cu con uh

51888
38:45:27,840 --> 38:45:32,720
cu estimarea densității nucleului. Şi

51889
38:45:30,720 --> 38:45:34,880
acum o să-l punem peste capul nostru

51890
38:45:32,720 --> 38:45:37,440
histogramă.

51891
38:45:34,880 --> 38:45:39,520
Deci, după cum puteți vedea, este aproape complet

51892
38:45:37,440 --> 38:45:42,560
potrivi. S-au omis doar câteva dintre acestea

51893
38:45:39,520 --> 38:45:44,880
valori aberante care din nou variază

51894
38:45:42,560 --> 38:45:47,104
foarte sus. Dar, per total, avem un frumos

51895
38:45:44,880 --> 38:45:49,024
potrivire bună.

51896
38:45:47,104 --> 38:45:52,800
Uh, singura problemă este că nu este foarte

51897
38:45:49,024 --> 38:45:55,280
netedă și poți încerca din nou să o modifici

51898
38:45:52,800 --> 38:45:57,664
lățimea de bandă la valori diferite. Da

51899
38:45:55,280 --> 38:46:02,480
hai să încercăm în acest caz să-l modificăm

51900
38:45:57,664 --> 38:46:04,880
la trei și vezi cât de bine merge. Bine.

51901
38:46:02,480 --> 38:46:08,000
Deci acum avem noi probabilități și

51902
38:46:04,880 --> 38:46:10,720
hai să-l rulăm peste lățimea noastră de bandă. Uh

51903
38:46:08,000 --> 38:46:12,800
așa că din nou utilizăm o lățime de bandă de trei.

51904
38:46:10,720 --> 38:46:16,240
Puteți vedea că ne potrivim datele

51905
38:46:12,800 --> 38:46:18,384
chiar mai bine și suntem din nou

51906
38:46:16,240 --> 38:46:20,320
ignorând multe dintre valorile aberante care sunt

51907
38:46:18,384 --> 38:46:22,560
acolo afară. Deci asta ne va oferi o

51908
38:46:20,320 --> 38:46:24,880
estimare mai buna. Prima întrebare

51909
38:46:22,560 --> 38:46:27,520
probabil că asta este în mintea ta este ceea ce este

51910
38:46:24,880 --> 38:46:29,440
în ea pentru tine? De la ce te poti astepta

51911
38:46:27,520 --> 38:46:31,920
acest video?

51912
38:46:29,440 --> 38:46:34,560
Mai întâi vom explica conceptul de

51913
38:46:31,920 --> 38:46:36,320
regresie un algoritm de învățare automată

51914
38:46:34,560 --> 38:46:38,880
la tine.

51915
38:46:36,320 --> 38:46:41,024
În continuare, vom arunca o privire la pătratul R

51916
38:46:38,880 --> 38:46:43,664
eroare care poate fi folosită pentru a calcula

51917
38:46:41,024 --> 38:46:45,280
eroare în modelele de regresie.

51918
38:46:43,664 --> 38:46:47,440
Următorul

51919
38:46:45,280 --> 38:46:50,320
vă vom învăța cum să calculați R

51920
38:46:47,440 --> 38:46:52,000
eroare pătrată și în cele din urmă vom face

51921
38:46:50,320 --> 38:46:54,880
implementați eroarea R pătrat cu

51922
38:46:52,000 --> 38:46:58,480
ajutorul lui Python.

51923
38:46:54,880 --> 38:47:00,160
Deci, ce este regresia?

51924
38:46:58,480 --> 38:47:02,320
Regresia nu este altceva decât o mașinărie

51925
38:47:00,160 --> 38:47:04,320
algoritm de învățare care ne ajută

51926
38:47:02,320 --> 38:47:07,360
determina relatia dintre doi

51927
38:47:04,320 --> 38:47:09,920
sau mai multe variabile. Utilizează intrarea sau

51928
38:47:07,360 --> 38:47:13,920
variabile independente pentru a găsi valoarea

51929
38:47:09,920 --> 38:47:16,480
a variabilelor de ieşire sau dependente.

51930
38:47:13,920 --> 38:47:19,280
Regresia este un algoritm de predicție

51931
38:47:16,480 --> 38:47:21,360
ceea ce înseamnă că având în vedere unele variabile noi

51932
38:47:19,280 --> 38:47:23,600
poate prezice valoarea unei ieșiri

51933
38:47:21,360 --> 38:47:25,840
variabilă.

51934
38:47:23,600 --> 38:47:27,920
Valoarea prezisă nu va fi

51935
38:47:25,840 --> 38:47:31,200
dintr-un set de valori dar se va întâmpla

51936
38:47:27,920 --> 38:47:33,520
să fie o valoare unică în sine.

51937
38:47:31,200 --> 38:47:35,664
Acum să înțelegem ce anume

51938
38:47:33,520 --> 38:47:38,560
regresia se face cu ajutorul câtorva

51939
38:47:35,664 --> 38:47:40,160
variabile de intrare independente. In aceasta

51940
38:47:38,560 --> 38:47:43,520
caz, variabilele care vom fi

51941
38:47:40,160 --> 38:47:46,384
se uită la apa de ploaie, îngrășământ și

51942
38:47:43,520 --> 38:47:48,800
semințe. Când trecem de aceste independente

51943
38:47:46,384 --> 38:47:50,880
variabilele de intrare prin regresie

51944
38:47:48,800 --> 38:47:52,720
model, vom obține o prognoză

51945
38:47:50,880 --> 38:47:55,104
ieșire.

51946
38:47:52,720 --> 38:47:56,880
Rezultatul prezis este că o recoltă va

51947
38:47:55,104 --> 38:47:59,104
germinează când toate acestea trei

51948
38:47:56,880 --> 38:48:01,520
componentele sunt puse împreună în anumite

51949
38:47:59,104 --> 38:48:04,560
cantități. Deci cu ajutorul lui

51950
38:48:01,520 --> 38:48:07,360
regresia având în vedere datele brute de intrare putem

51951
38:48:04,560 --> 38:48:09,744
aflați variabila dependentă de ieșire

51952
38:48:07,360 --> 38:48:12,000
pe care o vom primi

51953
38:48:09,744 --> 38:48:14,800
când toate aceste variabile de intrare sunt

51954
38:48:12,000 --> 38:48:17,280
mai mult sau mai puțin combinate. Regresia este

51955
38:48:14,800 --> 38:48:19,520
nimic altceva decât o metodă statistică care

51956
38:48:17,280 --> 38:48:21,744
este folosit pentru a determina puterea si

51957
38:48:19,520 --> 38:48:24,240
caracterul relației dintre a

51958
38:48:21,744 --> 38:48:26,160
variabilă dependentă și o serie de altele

51959
38:48:24,240 --> 38:48:28,880
variabile.

51960
38:48:26,160 --> 38:48:31,360
Acum folosiți regresia dacă aveți un set

51961
38:48:28,880 --> 38:48:33,600
de puncte de date putem folosi o regresie

51962
38:48:31,360 --> 38:48:35,920
model pentru a se potrivi unei linii care trece prin

51963
38:48:33,600 --> 38:48:38,240
majoritatea acestor puncte de date și le folosiți pentru

51964
38:48:35,920 --> 38:48:40,320
prezice rezultatul pentru noi puncte de date.

51965
38:48:38,240 --> 38:48:43,440
Linia se potrivește folosind ecuația lui a

51966
38:48:40,320 --> 38:48:46,080
linie dreaptă sau o ecuație polomială.

51967
38:48:43,440 --> 38:48:48,880
Acum, în acest grafic, considerăm că avem

51968
38:48:46,080 --> 38:48:50,800
variabila noastră dependentă sau ieșirea y

51969
38:48:48,880 --> 38:48:54,160
iar variabila noastră independentă sau

51970
38:48:50,800 --> 38:48:56,080
ieșire x. pentru o anumită valoare a noastră

51971
38:48:54,160 --> 38:48:58,160
variabilă independentă. Mergem să

51972
38:48:56,080 --> 38:49:01,200
obține o anumită valoare a dependentului nostru

51973
38:48:58,160 --> 38:49:03,280
variabilă sau producția noastră. Folosind datele

51974
38:49:01,200 --> 38:49:06,800
dat aici, putem vedea cum este rezultatul nostru

51975
38:49:03,280 --> 38:49:09,744
variază atunci când variază intrarea noastră. A prezice

51976
38:49:06,800 --> 38:49:11,664
valoarea rezultatului nostru Y, mergem

51977
38:49:09,744 --> 38:49:14,320
a trebui să găsească o relație între

51978
38:49:11,664 --> 38:49:15,744
toate aceste puncte de date. Pentru a face asta,

51979
38:49:14,320 --> 38:49:17,744
vom trasa o linie dreaptă

51980
38:49:15,744 --> 38:49:20,080
prin ea. Pentru că, după cum puteți vedea, toate

51981
38:49:17,744 --> 38:49:22,720
punctele de date se află mai mult sau mai puțin de-a lungul a

51982
38:49:20,080 --> 38:49:25,840
linie dreaptă dată. Acum folosind

51983
38:49:22,720 --> 38:49:29,200
linie dreaptă pentru orice valoare a lui x putem

51984
38:49:25,840 --> 38:49:32,320
găsiți valoarea aproximativă a lui y. Deci

51985
38:49:29,200 --> 38:49:35,520
să presupunem că doriți să găsiți valoarea lui y

51986
38:49:32,320 --> 38:49:37,600
într-un punct x care este dat aici să spunem

51987
38:49:35,520 --> 38:49:40,800
atunci tot ce trebuie să faci este să extinzi o linie

51988
38:49:37,600 --> 38:49:43,920
din acest punct la un model prezis

51989
38:49:40,800 --> 38:49:46,080
care este această linie aici și apoi putem

51990
38:49:43,920 --> 38:49:48,560
vezi unde este acest punct pe linie

51991
38:49:46,080 --> 38:49:52,800
coincide cu axa y și obțineți

51992
38:49:48,560 --> 38:49:55,360
valoarea aproximativă a rezultatului.

51993
38:49:52,800 --> 38:50:01,600
Este dată ecuația unei drepte

51994
38:49:55,360 --> 38:50:04,160
ca y = b b1 x e. Unde b este a

51995
38:50:01,600 --> 38:50:06,800
constantă dată de interceptul y al nostru

51996
38:50:04,160 --> 38:50:10,744
linie sau practic unde linia

51997
38:50:06,800 --> 38:50:10,744
se intersectează pe axa y.

51998
38:50:11,280 --> 38:50:16,640
B1 este panta dreptei noastre și x este

51999
38:50:14,960 --> 38:50:19,744
punctul pentru care dorim să găsim

52000
38:50:16,640 --> 38:50:22,560
ieșire. E în acest caz nu este altceva decât un

52001
38:50:19,744 --> 38:50:24,384
termen de corectare a erorilor.

52002
38:50:22,560 --> 38:50:27,104
Deci, practic, aceasta este regresia

52003
38:50:24,384 --> 38:50:30,320
funcționează și așa se face predicția

52004
38:50:27,104 --> 38:50:32,880
locul într-un model de regresie. În continuare noi

52005
38:50:30,320 --> 38:50:36,880
va explica conceptul de R pătrat

52006
38:50:32,880 --> 38:50:39,104
eroare pentru tine. Deci, ce este eroarea R pătrat?

52007
38:50:36,880 --> 38:50:41,600
Eroarea R pătrat nu este altceva decât o eroare

52008
38:50:39,104 --> 38:50:44,384
termen de măsurare care calculează cum

52009
38:50:41,600 --> 38:50:46,384
bine, un model de regresie se potrivește datelor.

52010
38:50:44,384 --> 38:50:49,440
Determină cantitatea de variație în

52011
38:50:46,384 --> 38:50:52,080
un model cauzat de variabilele de intrare.

52012
38:50:49,440 --> 38:50:54,384
Acum, R pătrat este o măsură statistică

52013
38:50:52,080 --> 38:50:56,560
care reprezintă porţiunea de varianţă

52014
38:50:54,384 --> 38:50:58,880
pentru o variabilă dependentă adică

52015
38:50:56,560 --> 38:51:01,920
explicată printr-o variabilă independentă sau

52016
38:50:58,880 --> 38:51:04,160
variabile într-un model de regresie. R2 este

52017
38:51:01,920 --> 38:51:06,640
folosit pentru a explica în ce măsură

52018
38:51:04,160 --> 38:51:09,280
varianţa unei variabile afectează

52019
38:51:06,640 --> 38:51:12,384
varianța unei a doua variabile.

52020
38:51:09,280 --> 38:51:14,800
Deci, dacă pătratul R al unui model este 0,5

52021
38:51:12,384 --> 38:51:16,880
apoi aproximativ jumătate din cele observate

52022
38:51:14,800 --> 38:51:20,160
variația poate fi explicată prin

52023
38:51:16,880 --> 38:51:23,360
intrările modelului.

52024
38:51:20,160 --> 38:51:26,480
Cu alte cuvinte, un R pătrat de 60%

52025
38:51:23,360 --> 38:51:30,440
dezvăluie că 60% din datele noastre se potrivesc cu noi

52026
38:51:26,480 --> 38:51:30,440
exact modelul de regresie.

52027
38:51:30,640 --> 38:51:38,560
Acum, în acest caz, în acest grafic dacă am

52028
38:51:34,080 --> 38:51:41,520
au o varianță de 60% înseamnă că 60%

52029
38:51:38,560 --> 38:51:44,480
dintre punctele noastre de date cad exact asupra noastră

52030
38:51:41,520 --> 38:51:46,800
linie de regresie. Totuși nu este

52031
38:51:44,480 --> 38:51:49,664
întotdeauna cazul în care un R pătrat mare este

52032
38:51:46,800 --> 38:51:51,520
bun pentru un model de regresie. Calitatea

52033
38:51:49,664 --> 38:51:53,744
a măsurii statistice depinde de

52034
38:51:51,520 --> 38:51:56,320
mulți factori, cum ar fi natura

52035
38:51:53,744 --> 38:51:58,320
variabilele utilizate în model, the

52036
38:51:56,320 --> 38:52:00,560
unitatea de măsură a variabilelor și

52037
38:51:58,320 --> 38:52:03,840
transformarea datelor aplicate.

52038
38:52:00,560 --> 38:52:05,280
Astfel, uneori un R pătrat mare poate

52039
38:52:03,840 --> 38:52:08,480
indica problemele cu

52040
38:52:05,280 --> 38:52:10,480
model de regresie. O cifră R pătrată mică

52041
38:52:08,480 --> 38:52:13,104
este în general un semn rău pentru predicție

52042
38:52:10,480 --> 38:52:15,360
modele. Acum, în tot acest timp am fost

52043
38:52:13,104 --> 38:52:18,720
vorbind despre varianță în modelul nostru.

52044
38:52:15,360 --> 38:52:20,640
Ce este mai exact varianța? Varianta este

52045
38:52:18,720 --> 38:52:22,800
nimic altceva decât un termen statistic care

52046
38:52:20,640 --> 38:52:25,024
determină cât de răspândite sunt datele noastre

52047
38:52:22,800 --> 38:52:27,840
și ne spune câte valori aberante sunt

52048
38:52:25,024 --> 38:52:30,320
prezent în ea. Practic, este o măsură

52049
38:52:27,840 --> 38:52:33,024
de cât de mult este răspândit un set de numere

52050
38:52:30,320 --> 38:52:35,664
din valoarea lor medie.

52051
38:52:33,024 --> 38:52:38,720
Folosind varianță, puteți, practic, să vă dați seama

52052
38:52:35,664 --> 38:52:41,600
unde sunt centrate datele dvs

52053
38:52:38,720 --> 38:52:44,000
si cat de raspandit este de la medie si

52054
38:52:41,600 --> 38:52:46,960
de asemenea, puteți afla câte valori aberante

52055
38:52:44,000 --> 38:52:49,664
are.

52056
38:52:46,960 --> 38:52:52,664
Acum, cum puteți calcula R pătratul

52057
38:52:49,664 --> 38:52:52,664
eroare?

52058
38:52:52,880 --> 38:52:57,664
Să începem prin a lua în considerare datele care

52059
38:52:55,104 --> 38:52:59,600
ni s-a dat așa cum se arată mai jos. Acum

52060
38:52:57,664 --> 38:53:01,744
putem găsi relația dintre

52061
38:52:59,600 --> 38:53:03,840
variabilele de intrare și de ieșire prin

52062
38:53:01,744 --> 38:53:06,080
trasarea unei linii drepte sau a unei regresii

52063
38:53:03,840 --> 38:53:08,720
model care trece prin majoritatea

52064
38:53:06,080 --> 38:53:11,024
date. Pentru a obține potrivirea perfectă pentru a

52065
38:53:08,720 --> 38:53:13,520
model, nu trebuie neapărat să avem

52066
38:53:11,024 --> 38:53:15,744
linia care trece prin cât mai multe date

52067
38:53:13,520 --> 38:53:17,744
puncte pe cât posibil.

52068
38:53:15,744 --> 38:53:19,840
O adevărată măsură a unui model bun este aceea

52069
38:53:17,744 --> 38:53:22,160
reducem eroarea care este prezentă în

52070
38:53:19,840 --> 38:53:25,104
modelul nostru. Acum cum găsești asta

52071
38:53:22,160 --> 38:53:27,200
eroare? Eroarea prezentă în modelul nostru este

52072
38:53:25,104 --> 38:53:29,920
dat de nimic altceva decât de distanță

52073
38:53:27,200 --> 38:53:32,384
între linia noastră prezisă și date

52074
38:53:29,920 --> 38:53:35,360
puncte care nu cad pe linie.

52075
38:53:32,384 --> 38:53:37,360
Acesta este ceea ce trebuie să minimizăm.

52076
38:53:35,360 --> 38:53:39,360
Distanța dintre punctele noastre de date și

52077
38:53:37,360 --> 38:53:41,200
linia noastră poate fi calculată prin

52078
38:53:39,360 --> 38:53:44,384
scăzând

52079
38:53:41,200 --> 38:53:47,600
punctul nostru de date din punctul în care

52080
38:53:44,384 --> 38:53:49,360
coincide pe linia noastră de regresie. Noi

52081
38:53:47,600 --> 38:53:51,520
pătratează asta doar pentru a scăpa de oricare

52082
38:53:49,360 --> 38:53:52,960
coeficienţi negativi care pot apărea datorită

52083
38:53:51,520 --> 38:53:55,600
pentru a găsi diferența dintre

52084
38:53:52,960 --> 38:53:57,744
doua puncte. Acum, pentru a găsi variația în

52085
38:53:55,600 --> 38:53:59,744
datele noastre, vom găsi media

52086
38:53:57,744 --> 38:54:02,384
și scădeți punctele de date din

52087
38:53:59,744 --> 38:54:04,800
înseamnă. Acest lucru ne va spune practic cum

52088
38:54:02,384 --> 38:54:08,160
răspândit punctul nostru de date este din

52089
38:54:04,800 --> 38:54:10,320
valoare medie. Apoi le putem pătra

52090
38:54:08,160 --> 38:54:12,560
diferențe și adună rezultatul pentru a obține

52091
38:54:10,320 --> 38:54:14,720
variația noastră totală. Acest lucru este de asemenea cunoscut

52092
38:54:12,560 --> 38:54:16,640
ca suma totală a pătratelor. Și folosind

52093
38:54:14,720 --> 38:54:19,440
în aceasta putem găsi variația totală

52094
38:54:16,640 --> 38:54:22,080
datele noastre. Media nu este altceva decât

52095
38:54:19,440 --> 38:54:26,080
media datelor noastre. Și folosind media

52096
38:54:22,080 --> 38:54:28,000
putem găsi centrul datelor noastre.

52097
38:54:26,080 --> 38:54:30,160
Deci exact aici se află datele noastre

52098
38:54:28,000 --> 38:54:33,024
centrat. Aceasta este valoarea medie care

52099
38:54:30,160 --> 38:54:35,520
apare în datele noastre. Acum, varianța este

52100
38:54:33,024 --> 38:54:39,024
nimic altceva decât distanța dintre toate noastre

52101
38:54:35,520 --> 38:54:40,800
puncte de date din medie. Dacă o facem

52102
38:54:39,024 --> 38:54:43,360
asta, practic o să aflăm

52103
38:54:40,800 --> 38:54:46,240
cât de răspândite sunt datele noastre de

52104
38:54:43,360 --> 38:54:48,880
valoarea medie sau cât de departe toate datele noastre

52105
38:54:46,240 --> 38:54:50,640
punctele se află unul față de celălalt.

52106
38:54:48,880 --> 38:54:53,520
Când scădem poziţia noastră

52107
38:54:50,640 --> 38:54:55,920
puncte de date din media noastră și pătratul

52108
38:54:53,520 --> 38:54:59,104
și adunăm toate acestea, obținem ceva

52109
38:54:55,920 --> 38:55:01,280
cunoscută sub denumirea de suma totală a pătratelor.

52110
38:54:59,104 --> 38:55:03,600
Acum eroarea R squ este totalul

52111
38:55:01,280 --> 38:55:06,800
variația datelor noastre de intrare. Poate fi

52112
38:55:03,600 --> 38:55:10,560
obţinut prin împărţirea SSR la SST

52113
38:55:06,800 --> 38:55:13,200
și scăzând rezultatele dintr-unul.

52114
38:55:10,560 --> 38:55:16,960
Deci eroarea R pătrat devine total 1

52115
38:55:13,200 --> 38:55:19,520
minus suma erorilor noastre pătrate

52116
38:55:16,960 --> 38:55:22,384
împărțit la suma pătratului

52117
38:55:19,520 --> 38:55:25,600
diferența dintre punctele noastre de date și

52118
38:55:22,384 --> 38:55:29,280
media. Acum această valoare ne oferă

52119
38:55:25,600 --> 38:55:32,000
varianță și de aceea putem spune că

52120
38:55:29,280 --> 38:55:35,200
R squ este folosit pentru a găsi porțiunea din

52121
38:55:32,000 --> 38:55:37,360
variații în datele noastre.

52122
38:55:35,200 --> 38:55:39,840
Acum, cum puteți implementa eroarea R squ

52123
38:55:37,360 --> 38:55:41,600
cu Python?

52124
38:55:39,840 --> 38:55:44,240
Pentru a calcula eroarea R pătrat cu

52125
38:55:41,600 --> 38:55:46,000
Python, ne vom uita la date

52126
38:55:44,240 --> 38:55:48,560
care descrie condițiile meteorologice

52127
38:55:46,000 --> 38:55:50,080
care au fost prezente în timpul celui de-al Doilea Război Mondial.

52128
38:55:48,560 --> 38:55:51,664
Și folosind variabilele care sunt

52129
38:55:50,080 --> 38:55:54,384
prezent în datele noastre, vom face

52130
38:55:51,664 --> 38:55:57,024
creați un model care prezice cotidianul

52131
38:55:54,384 --> 38:55:58,800
prognoza meteo în timpul celui de-al Doilea Război Mondial.

52132
38:55:57,024 --> 38:56:02,000
Și apoi vom folosi R pătrat

52133
38:55:58,800 --> 38:56:05,840
eroare pentru a găsi acuratețea modelului nostru.

52134
38:56:02,000 --> 38:56:07,440
Deci acesta este modelul nostru R pătrat uh. Deci

52135
38:56:05,840 --> 38:56:09,664
vom începe prin a importa

52136
38:56:07,440 --> 38:56:12,480
toate modulele noastre necesare. Suntem

52137
38:56:09,664 --> 38:56:15,440
va folosi modelul numpy pentru a efectua

52138
38:56:12,480 --> 38:56:17,664
calcule numerice pe baza noastră de date

52139
38:56:15,440 --> 38:56:20,320
și matrice și vom folosi

52140
38:56:17,664 --> 38:56:22,640
seaborn și mattplot lib pentru a complot nostru

52141
38:56:20,320 --> 38:56:24,880
date.

52142
38:56:22,640 --> 38:56:27,280
Așa că acum am reușit să le importăm pe toate

52143
38:56:24,880 --> 38:56:30,560
seturile noastre de date.

52144
38:56:27,280 --> 38:56:33,024
Să ne încărcăm și datele citind

52145
38:56:30,560 --> 38:56:36,560
fișierul CSV care este stocat ca în

52146
38:56:33,024 --> 38:56:36,560
forma unui cadru de date.

52147
38:56:36,800 --> 38:56:42,320
Deci aici, după cum puteți vedea, am citit

52148
38:56:38,720 --> 38:56:44,480
în fișierul CSV într-o variabilă

52149
38:56:42,320 --> 38:56:46,384
numit vreme și apoi după aceea suntem

52150
38:56:44,480 --> 38:56:48,800
schimbarea vremii în datele unui panda

52151
38:56:46,384 --> 38:56:53,080
cadru numit climat. Aceasta este ceea ce nostru

52152
38:56:48,800 --> 38:56:53,080
Cadrul de date arată în sfârșit ca.

52153
38:56:53,600 --> 38:56:58,320
Deci, după cum puteți vedea în cadrul nostru de date, noi

52154
38:56:55,920 --> 38:57:00,080
avem cinci rânduri pentru că suntem doar

52155
38:56:58,320 --> 38:57:03,520
uitându-ne la primele cinci rânduri și avem

52156
38:57:00,080 --> 38:57:05,440
31 de coloane. Deci acestea sunt valori care

52157
38:57:03,520 --> 38:57:08,960
nu sunt necesare și care sunt în principiu

52158
38:57:05,440 --> 38:57:13,320
ne vom crește valoarea erorii. Deci

52159
38:57:08,960 --> 38:57:13,320
hai sa le aruncam si sa scapam de ele.

52160
38:57:13,600 --> 38:57:19,440
Acum să renunțăm și la oricare

52161
38:57:17,024 --> 38:57:21,520
valori goale care pot apărea în

52162
38:57:19,440 --> 38:57:24,480
coloanele rămase din setul nostru de date și

52163
38:57:21,520 --> 38:57:27,280
vezi cum arată setul de date final.

52164
38:57:24,480 --> 38:57:29,200
Deci acesta este setul nostru final de date. Avem

52165
38:57:27,280 --> 38:57:30,880
la sfarsit ramanem doar max

52166
38:57:29,200 --> 38:57:33,600
temperatura, temperatura minimă și

52167
38:57:30,880 --> 38:57:36,160
temperatura medie.

52168
38:57:33,600 --> 38:57:39,160
Acum să reprezentăm un grafic de numărare a unui număr maxim

52169
38:57:36,160 --> 38:57:39,160
temperatura.

52170
38:57:41,600 --> 38:57:46,240
Un complot de numărare va merge practic

52171
38:57:44,320 --> 38:57:49,744
prin întreaga temperatură maximă

52172
38:57:46,240 --> 38:57:53,024
coloană și află de câte ori

52173
38:57:49,744 --> 38:57:54,480
apare fiecare valoare a temperaturii. Deci este

52174
38:57:53,024 --> 38:57:58,720
să-mi dau seama câte merg

52175
38:57:54,480 --> 38:58:00,960
să numere de câte ori 29.44444

52176
38:57:58,720 --> 38:58:03,360
s-a întâmplat și va pune la cale asta

52177
38:58:00,960 --> 38:58:05,600
pe acest grafic și va face asta

52178
38:58:03,360 --> 38:58:08,720
pentru fiecare valoare unică a temperaturii care

52179
38:58:05,600 --> 38:58:11,104
este prezent în rubrica noastră. Deci in sfarsit

52180
38:58:08,720 --> 38:58:14,320
aceasta este valoarea pe care o primim. Da

52181
38:58:11,104 --> 38:58:16,560
aici, după cum puteți vedea majoritatea

52182
38:58:14,320 --> 38:58:19,744
valorile noastre de temperatură sunt concentrate

52183
38:58:16,560 --> 38:58:22,000
în cadrul acestui interval. Aceasta înseamnă că acestea

52184
38:58:19,744 --> 38:58:24,720
valorile temperaturii sunt cele care

52185
38:58:22,000 --> 38:58:27,024
apar cel mai frecvent. Celelalte

52186
38:58:24,720 --> 38:58:31,024
pot fi considerate valori aberante deoarece

52187
38:58:27,024 --> 38:58:33,200
acestea sunt rareori văzute în datele noastre

52188
38:58:31,024 --> 38:58:35,520
și pot denatura și mai mult rezultatul

52189
38:58:33,200 --> 38:58:38,080
pe care o vom primi. Acum hai să facem

52190
38:58:35,520 --> 38:58:40,160
la fel si cu temperatura minima. Să

52191
38:58:38,080 --> 38:58:42,384
trasează o diagramă de numărare pentru minim

52192
38:58:40,160 --> 38:58:44,240
temperatura.

52193
38:58:42,384 --> 38:58:46,640
Deci pentru temperatura minimă putem

52194
38:58:44,240 --> 38:58:49,280
vezi un complot foarte asemănător cu cel care

52195
38:58:46,640 --> 38:58:51,600
am ajuns la o temperatură maximă. Majoritatea

52196
38:58:49,280 --> 38:58:54,480
dintre valori sunt concentrate în jurul

52197
38:58:51,600 --> 38:58:58,200
această regiune, dar valorile aberante aici

52198
38:58:54,480 --> 38:58:58,200
sunt mult mai putine.

52199
38:58:59,024 --> 38:59:04,800
Acum haideți să trasăm o diagramă de regresie între

52200
38:59:01,600 --> 38:59:07,840
temperatura noastră maximă și minimă.

52201
38:59:04,800 --> 38:59:10,800
Deci, folosind graficul de regresie putem reprezenta un grafic

52202
38:59:07,840 --> 38:59:13,280
o linie de regresie pentru cele două variabile

52203
38:59:10,800 --> 38:59:15,840
în axa noastră x și y. Deci acesta este al nostru

52204
38:59:13,280 --> 38:59:19,664
axa x și aceasta este axa noastră y. Aceasta este

52205
38:59:15,840 --> 38:59:23,960
practic, mergi la trasarea unei linii drepte

52206
38:59:19,664 --> 38:59:23,960
care se potrivește cel mai bine cu datele

52207
38:59:24,384 --> 38:59:28,880
că ajungem aici. Deci aici

52208
38:59:27,280 --> 38:59:30,960
după cum puteți vedea, aceasta este o regresie

52209
38:59:28,880 --> 38:59:33,360
linie. Această linie albastră subțire este a

52210
38:59:30,960 --> 38:59:37,600
linia de regresie care intersectează noastre

52211
38:59:33,360 --> 38:59:40,880
temperatura minimă la o valoare care este

52212
38:59:37,600 --> 38:59:44,800
intre -30 si -40 si trece

52213
38:59:40,880 --> 38:59:47,360
prin toate datele noastre. Deci uh pentru a

52214
38:59:44,800 --> 38:59:50,880
valoarea temperaturii maxime care este

52215
38:59:47,360 --> 38:59:53,280
zero folosind acest lucru putem prezice

52216
38:59:50,880 --> 38:59:56,320
temperatura minima pe care ar avea

52217
38:59:53,280 --> 38:59:59,360
a avut loc în aceeași zi.

52218
38:59:56,320 --> 39:00:02,080
Deci pentru zero va fi undeva în jur -

52219
38:59:59,360 --> 39:00:04,560
10°C. Deci dacă am vedea temperatura maximă

52220
39:00:02,080 --> 39:00:06,720
de 0° în acea zi, am fi văzut a

52221
39:00:04,560 --> 39:00:09,664
temperatura minimă de minus 10 pe

52222
39:00:06,720 --> 39:00:12,000
aceeași zi. Acum să trasăm o hartă termică către

52223
39:00:09,664 --> 39:00:14,384
vezi cum sunt corelate aceste valori

52224
39:00:12,000 --> 39:00:15,920
unul pe altul. Deci corelația este

52225
39:00:14,384 --> 39:00:19,600
practic

52226
39:00:15,920 --> 39:00:22,320
folosit pentru a afla ce valori afectează fiecare

52227
39:00:19,600 --> 39:00:25,024
altele liniar

52228
39:00:22,320 --> 39:00:27,840
sau care valori

52229
39:00:25,024 --> 39:00:30,960
atunci când este schimbat va afecta și schimbarea

52230
39:00:27,840 --> 39:00:35,320
în alte valori. Deci aici, cât poți

52231
39:00:30,960 --> 39:00:35,320
vezi temperatura minima

52232
39:00:39,024 --> 39:00:44,800
iar temperatura maximă au a

52233
39:00:41,280 --> 39:00:47,664
corelație de 0,8. 88 ceea ce înseamnă dacă

52234
39:00:44,800 --> 39:00:51,104
temperatura minimă se schimbă apoi

52235
39:00:47,664 --> 39:00:54,104
temperatura maximă se va schimba și în

52236
39:00:51,104 --> 39:00:54,104
0,88.

52237
39:00:55,104 --> 39:00:58,480
Acum cea mai bună corelație este evident

52238
39:00:57,104 --> 39:01:00,480
va fi între medii

52239
39:00:58,480 --> 39:01:02,480
temperaturile și minimele și maximele

52240
39:01:00,480 --> 39:01:04,384
temperaturile. Temperatura medie este

52241
39:01:02,480 --> 39:01:07,840
nimic altceva decât temperatura medie

52242
39:01:04,384 --> 39:01:10,160
valoarea pe care o avem. Deci asta este

52243
39:01:07,840 --> 39:01:12,640
practic o să se întindă în mijlocul

52244
39:01:10,160 --> 39:01:14,240
toate valorile noastre de temperatură care este

52245
39:01:12,640 --> 39:01:16,240
de ce vom avea un lucru mai bun

52246
39:01:14,240 --> 39:01:17,920
corelație pentru temperatura medie. Dar

52247
39:01:16,240 --> 39:01:19,360
temperatura minima si maxima

52248
39:01:17,920 --> 39:01:21,360
temperatura sunt de asemenea destul de bune

52249
39:01:19,360 --> 39:01:22,960
corelat cu o valoare de corelare de

52250
39:01:21,360 --> 39:01:25,664
0,88.

52251
39:01:22,960 --> 39:01:28,000
Aceasta înseamnă că dacă minimul nostru

52252
39:01:25,664 --> 39:01:29,520
temperatura fluctuează, maximul nostru

52253
39:01:28,000 --> 39:01:31,280
temperatura va varia de asemenea

52254
39:01:29,520 --> 39:01:33,664
proporţional.

52255
39:01:31,280 --> 39:01:36,000
Acum să ne separăm intrarea și ieșirea

52256
39:01:33,664 --> 39:01:38,080
valorile. Vom prezice

52257
39:01:36,000 --> 39:01:40,720
temperatura maximă dată fiind minimul nostru

52258
39:01:38,080 --> 39:01:45,480
temperatura. Aici x este intrarea noastră

52259
39:01:40,720 --> 39:01:45,480
variabilă și y este variabila noastră de ieșire.

52260
39:01:46,480 --> 39:01:51,200
Deci acum, practic, vom ajunge

52261
39:01:48,320 --> 39:01:53,744
toate valorile importante din x și y

52262
39:01:51,200 --> 39:01:55,520
seturi de date. Deci, după aceea, asta este

52263
39:01:53,744 --> 39:01:58,880
seturile noastre de date x și y vor căuta

52264
39:01:55,520 --> 39:02:01,920
ca. Acum să împărțim setul nostru de date în

52265
39:01:58,880 --> 39:02:03,920
seturi de antrenament și testare.

52266
39:02:01,920 --> 39:02:06,384
Setul de antrenament va fi folosit pentru antrenament

52267
39:02:03,920 --> 39:02:08,720
modelul nostru de regresie și setul de testare

52268
39:02:06,384 --> 39:02:11,664
va fi folosit pentru a prezice cât de bine noastre

52269
39:02:08,720 --> 39:02:14,320
modelul de regresie este performant.

52270
39:02:11,664 --> 39:02:17,280
Datele de antrenament sunt datele care vor

52271
39:02:14,320 --> 39:02:19,024
să fie vizibil pentru modelul nostru sau pentru datele

52272
39:02:17,280 --> 39:02:21,840
la care un model are voie să aibă acces

52273
39:02:19,024 --> 39:02:24,320
la. Datele de testare vor fi date pe care

52274
39:02:21,840 --> 39:02:27,520
modelul nu a mai văzut sau pe care nu l-a văzut

52275
39:02:24,320 --> 39:02:29,744
nu are acces și, prin urmare, va avea

52276
39:02:27,520 --> 39:02:32,720
să lucreze pe date complet noi

52277
39:02:29,744 --> 39:02:35,200
pentru a testa mai bine cât de bine ne-am adaptat

52278
39:02:32,720 --> 39:02:36,960
setul nostru de date. Acum ne putem împărți datele

52279
39:02:35,200 --> 39:02:39,520
pus în seturi de antrenament și testare de

52280
39:02:36,960 --> 39:02:44,160
folosind funcționalitatea de împărțire a testului trenului

52281
39:02:39,520 --> 39:02:47,104
din biblioteca noastră de selecție skarn.mmodel.

52282
39:02:44,160 --> 39:02:51,744
Acum, în sfârșit, din biblioteca noastră scikitlearn

52283
39:02:47,104 --> 39:02:53,664
să importăm un model de regresie liniară.

52284
39:02:51,744 --> 39:02:55,520
Vom inițializa un liniar

52285
39:02:53,664 --> 39:02:57,920
model de regresie la o variabilă numită

52286
39:02:55,520 --> 39:03:00,320
regresor și apoi vom potrivi a

52287
39:02:57,920 --> 39:03:02,384
model de regresie liniară la antrenamentul nostru

52288
39:03:00,320 --> 39:03:05,104
set de date.

52289
39:03:02,384 --> 39:03:07,200
Așa că, în sfârșit, am primit liniarul nostru antrenat

52290
39:03:05,104 --> 39:03:09,744
model de regresie. Acum să folosim asta

52291
39:03:07,200 --> 39:03:12,560
model pentru a efectua predicții asupra noastră

52292
39:03:09,744 --> 39:03:14,800
set de date de testare. Deci acestea sunt

52293
39:03:12,560 --> 39:03:17,104
valorile pe care le-am primit după alergare

52294
39:03:14,800 --> 39:03:20,480
modelul nostru de regresie liniară pe nostru

52295
39:03:17,104 --> 39:03:22,384
set de date de testare. Să vedem cât de bine

52296
39:03:20,480 --> 39:03:25,664
am jucat.

52297
39:03:22,384 --> 39:03:28,800
Vom importa scorul R2 de la

52298
39:03:25,664 --> 39:03:31,360
metrica noastră skarn.

52299
39:03:28,800 --> 39:03:34,240
Acum scorul R2 va face direct R

52300
39:03:31,360 --> 39:03:36,960
eroare pătrată asupra predicției noastre și

52301
39:03:34,240 --> 39:03:39,440
testează setul de date și vezi cât de bine

52302
39:03:36,960 --> 39:03:42,160
setul de date de testare se potrivește cu o predicție

52303
39:03:39,440 --> 39:03:44,240
set de date.

52304
39:03:42,160 --> 39:03:46,560
Deci acum avem o eroare R pătrat

52305
39:03:44,240 --> 39:03:52,840
de 0,9345

52306
39:03:46,560 --> 39:03:52,840
ceea ce înseamnă practic că 93% dintre noi

52307
39:03:53,360 --> 39:03:58,640
valorile de ieșire sunt influențate de noastre

52308
39:03:55,744 --> 39:04:02,384
valorile de intrare. Aceasta înseamnă, de asemenea, că a

52309
39:03:58,640 --> 39:04:04,560
modelul este 93% precis

52310
39:04:02,384 --> 39:04:08,080
și că aproximativ

52311
39:04:04,560 --> 39:04:10,720
93% din variația noastră observată poate fi

52312
39:04:08,080 --> 39:04:13,104
explicate prin intrările modelului. vreodată

52313
39:04:10,720 --> 39:04:15,840
m-am întrebat cum să construim un proiect AI care

52314
39:04:13,104 --> 39:04:18,800
de fapt este observat de Google, OpenAI,

52315
39:04:15,840 --> 39:04:21,520
sau startup-uri de top, nu doar un chartboard

52316
39:04:18,800 --> 39:04:24,880
sau teme reciclate. Astăzi mă duc

52317
39:04:21,520 --> 39:04:28,240
vă ghidează prin 10 idei de proiecte AI pentru

52318
39:04:24,880 --> 39:04:30,800
26 care sunt practice, futuriste și

52319
39:04:28,240 --> 39:04:33,840
portofoliu gata. iti spun exact

52320
39:04:30,800 --> 39:04:35,840
la care modele, cadru și seturi de date

52321
39:04:33,840 --> 39:04:38,720
pentru a putea începe să codificați

52322
39:04:35,840 --> 39:04:40,960
imediat. Acum, înainte să sărim în lovitură

52323
39:04:38,720 --> 39:04:43,200
care butonează like, distribuie și abonează-te

52324
39:04:40,960 --> 39:04:45,440
pentru că ținem pasul cu IA pentru viitor

52325
39:04:43,200 --> 39:04:48,384
proiectele vă va oferi un masiv

52326
39:04:45,440 --> 39:04:51,360
marginea. Să începem cu cumpărăturile AI

52327
39:04:48,384 --> 39:04:54,384
prietene. Acest proiect acționează ca un personal

52328
39:04:51,360 --> 39:04:56,960
stilist și designer de interior. Utilizatori

52329
39:04:54,384 --> 39:04:59,600
încărcați fotografii cu camera, ținuta sau

52330
39:04:56,960 --> 39:05:01,600
chiar fața, iar AI sugerează produse

52331
39:04:59,600 --> 39:05:04,000
care se potrivesc cu culoarea, stilul și

52332
39:05:01,600 --> 39:05:06,480
preferințe. Nu este vorba doar despre

52333
39:05:04,000 --> 39:05:08,880
aruncând recomandări cuiva.

52334
39:05:06,480 --> 39:05:11,440
Este vorba despre viziunea computerizată pentru a înțelege

52335
39:05:08,880 --> 39:05:13,360
imagini, IA generativă pentru a crea stil

52336
39:05:11,440 --> 39:05:15,744
sugestii și recomandări

52337
39:05:13,360 --> 39:05:17,744
algoritmi pentru a găsi produsele perfecte.

52338
39:05:15,744 --> 39:05:20,800
Sisteme de recomandare personalizate

52339
39:05:17,744 --> 39:05:22,960
generează implicare și conversii masive

52340
39:05:20,800 --> 39:05:26,000
motiv pentru care companii precum Amazon,

52341
39:05:22,960 --> 39:05:28,240
Flipkart, Myntra sau Urban Ladder ar fi

52342
39:05:26,000 --> 39:05:30,560
fii încântat să lovești pe cineva care poate construi

52343
39:05:28,240 --> 39:05:33,280
aceasta. Finalizarea unui astfel de proiect

52344
39:05:30,560 --> 39:05:35,744
demonstrează abilități de învățare profundă,

52345
39:05:33,280 --> 39:05:38,800
viziune computerizată, IA generativă și full

52346
39:05:35,744 --> 39:05:40,800
implementarea stivei pentru aplicații web sau mobile.

52347
39:05:38,800 --> 39:05:43,440
În timp ce cumpărăturile și stilul de viață AI este

52348
39:05:40,800 --> 39:05:46,240
interesant, următorul proiect durează până la

52349
39:05:43,440 --> 39:05:48,800
sănătatea și bunăstarea noastră. Cel inteligent

52350
39:05:46,240 --> 39:05:51,840
Analizorul de sănătate prezice epuizarea stresului

52351
39:05:48,800 --> 39:05:54,320
sau probleme de somn prin analiza vocii,

52352
39:05:51,840 --> 39:05:57,024
expresii micropului facial și variabile

52353
39:05:54,320 --> 39:05:59,360
date. Folosește AI multimodel care

52354
39:05:57,024 --> 39:06:02,480
integrează analiza seriilor temporale pentru

52355
39:05:59,360 --> 39:06:04,384
date variabile. NLP pentru voce și text

52356
39:06:02,480 --> 39:06:06,384
și viziune computerizată pentru micro

52357
39:06:04,384 --> 39:06:08,880
expresii. Startup-uri de tehnologie medicală în

52358
39:06:06,384 --> 39:06:11,840
India și la nivel global le place sănătos, cura

52359
39:06:08,880 --> 39:06:14,560
Fitbit și Apple Health caută

52360
39:06:11,840 --> 39:06:17,200
pentru inginerii care pot face predictive

52361
39:06:14,560 --> 39:06:19,440
instrumente de wellness. Construirea acestui proiect

52362
39:06:17,200 --> 39:06:22,640
demonstrează capacitatea ta de a lucra cu

52363
39:06:19,440 --> 39:06:24,880
AI multimodel, pre-procesează date complexe

52364
39:06:22,640 --> 39:06:27,200
seturi, tren modele și vizualizați

52365
39:06:24,880 --> 39:06:29,520
rezultat. Trecerea de la sănătatea personală la

52366
39:06:27,200 --> 39:06:32,240
eficiența profesională, AI

52367
39:06:29,520 --> 39:06:34,800
agentul de productivitate vă automatizează zilnic

52368
39:06:32,240 --> 39:06:37,200
fluxul de lucru. Citește e-mailurile, vă scanează

52369
39:06:34,800 --> 39:06:39,840
calendarul, înțelege prioritățile și

52370
39:06:37,200 --> 39:06:43,200
construiește un program optimizat. Se foloseste

52371
39:06:39,840 --> 39:06:45,600
NLP pentru a analiza e-mailurile, integrare API

52372
39:06:43,200 --> 39:06:48,320
cu alte instrumente precum Gmail, Slack și

52373
39:06:45,600 --> 39:06:50,560
Noțiune și algoritmi de optimizare la

52374
39:06:48,320 --> 39:06:52,960
prioritizează sarcina în mod eficient.

52375
39:06:50,560 --> 39:06:55,440
Pierderea productivității este o problemă majoră pentru

52376
39:06:52,960 --> 39:06:58,560
companiilor, motiv pentru care giganților tehnologiei le place

52377
39:06:55,440 --> 39:07:00,960
Google Workspace, Microsoft 365 și

52378
39:06:58,560 --> 39:07:03,600
startup-urile în automatizarea fluxului de lucru ar fi

52379
39:07:00,960 --> 39:07:06,160
foarte interesat de acest proiect. Este o

52380
39:07:03,600 --> 39:07:08,880
mod excelent de a demonstra automatizarea, NLP

52381
39:07:06,160 --> 39:07:11,024
Integrarea API și problemă practică

52382
39:07:08,880 --> 39:07:13,600
abilități de rezolvare. Ducând automatizarea la

52383
39:07:11,024 --> 39:07:16,000
nivelul următor, sistemul de acțiune vocală

52384
39:07:13,600 --> 39:07:19,440
permite utilizatorilor să rostească comenzi și să aibă

52385
39:07:16,000 --> 39:07:21,920
AI efectuează acțiuni în mai mulți pași, cum ar fi

52386
39:07:19,440 --> 39:07:24,384
rezervarea zborurilor, organizarea dosarelor sau

52387
39:07:21,920 --> 39:07:26,640
generarea de rapoarte. Se bazează pe

52388
39:07:24,384 --> 39:07:29,520
modele speechtoext, intentie

52389
39:07:26,640 --> 39:07:32,160
clasificare folosind NLP și sarcină

52390
39:07:29,520 --> 39:07:34,880
conducte de automatizare. Te poți antrena

52391
39:07:32,160 --> 39:07:38,320
modele de clasificare a intențiilor folosind date

52392
39:07:34,880 --> 39:07:40,480
setați în setul de date NLU pentru snips. Aceasta

52393
39:07:38,320 --> 39:07:43,280
proiectul se bazează direct pe productivitate

52394
39:07:40,480 --> 39:07:46,800
AI și este exact genul de muncă care

52395
39:07:43,280 --> 39:07:49,600
Amazon openai sau Apple ar observa pentru

52396
39:07:46,800 --> 39:07:52,320
soluții de automatizare prin voce. Dată

52397
39:07:49,600 --> 39:07:54,960
avem sarcină automatizată, de ce nu exploram

52398
39:07:52,320 --> 39:07:56,960
creativitate? Creator de povești AI generativ

52399
39:07:54,960 --> 39:07:59,440
vă permite să creați povești complete

52400
39:07:56,960 --> 39:08:02,384
inclusiv scenarii, personaje și

52401
39:07:59,440 --> 39:08:05,360
elemente vizuale bazate pe doar câteva cuvinte cheie.

52402
39:08:02,384 --> 39:08:07,664
Acum folosește modele mari de limbaj pentru

52403
39:08:05,360 --> 39:08:10,880
generarea de text și generarea de imagini

52404
39:08:07,664 --> 39:08:12,720
modele precum difuzie stabila deli3 pentru

52405
39:08:10,880 --> 39:08:15,520
vizuale și vă puteți antrena și

52406
39:08:12,720 --> 39:08:18,480
modele ajustate pe seturi de date precum CMU

52407
39:08:15,520 --> 39:08:21,600
corpus de rezumat al cărții despre solicitări de scriere

52408
39:08:18,480 --> 39:08:25,520
bibliotecă text în vorbire, cum ar fi scope TTS

52409
39:08:21,600 --> 39:08:27,920
sau GTTS poate adăuga medii de narațiune

52410
39:08:25,520 --> 39:08:30,000
companii precum Netflix, Ubisoft și

52411
39:08:27,920 --> 39:08:32,640
Adobe investește activ în

52412
39:08:30,000 --> 39:08:34,960
IA generativă și un proiect ca acesta

52413
39:08:32,640 --> 39:08:37,280
cu siguranta ar iesi in evidenta. Construind pe

52414
39:08:34,960 --> 39:08:40,240
ideea de capacități AI multiple

52415
39:08:37,280 --> 39:08:42,800
lucrând împreună, multi-aent AI

52416
39:08:40,240 --> 39:08:45,920
proiectul de echipă introduce colaborarea

52417
39:08:42,800 --> 39:08:48,320
între agenții AI. Mai mulți agenți AI

52418
39:08:45,920 --> 39:08:50,880
li se atribuie roluri specializate precum

52419
39:08:48,320 --> 39:08:53,024
cercetând, scriind, criticând și

52420
39:08:50,880 --> 39:08:55,360
rezumând. Ei comunică și

52421
39:08:53,024 --> 39:08:57,744
coordonați pentru a finaliza o sarcină complexă

52422
39:08:55,360 --> 39:09:00,384
folosind armarea multi-aentă,

52423
39:08:57,744 --> 39:09:03,024
protocoale de învățare și comunicare.

52424
39:09:00,384 --> 39:09:05,600
Enterprise AI și platforme de automatizare

52425
39:09:03,024 --> 39:09:08,960
investesc mult în această abordare

52426
39:09:05,600 --> 39:09:11,280
și companii precum Enthropic, OpenAI, AI

52427
39:09:08,960 --> 39:09:14,160
startup-urile fluxului de lucru caută activ

52428
39:09:11,280 --> 39:09:16,000
ingineri care pot construi IA în colaborare

52429
39:09:14,160 --> 39:09:18,960
sisteme de la colaborare la

52430
39:09:16,000 --> 39:09:21,360
observatie. Cititorul de limbaj corporal AI

52431
39:09:18,960 --> 39:09:24,384
analizează microexpresii, ton de

52432
39:09:21,360 --> 39:09:26,880
voce și postură pentru a oferi feedback

52433
39:09:24,384 --> 39:09:29,440
abilități de comunicare. Se poate aplica

52434
39:09:26,880 --> 39:09:32,384
în interviuri, vorbire în public sau la distanță

52435
39:09:29,440 --> 39:09:34,960
antrenament. Instrumente de viziune computerizată, cum ar fi

52436
39:09:32,384 --> 39:09:37,664
poză deschisă sau pistă poză media pipe

52437
39:09:34,960 --> 39:09:40,080
gesturi și postură. În timp ce audio

52438
39:09:37,664 --> 39:09:43,200
biblioteci de prelucrare precum librosa

52439
39:09:40,080 --> 39:09:46,800
analiza modelelor de ton pot fi antrenate folosind

52440
39:09:43,200 --> 39:09:49,664
seturi de date precum Raves pentru audio și CK

52441
39:09:46,800 --> 39:09:52,560
plus pentru expresiile faciale. HR tech

52442
39:09:49,664 --> 39:09:54,960
companii precum High View, Pytrics și AI

52443
39:09:52,560 --> 39:09:57,744
startup-urile de coaching ar aprecia foarte mult

52444
39:09:54,960 --> 39:10:01,440
acest tip de proiect, deoarece ajută la bridge

52445
39:09:57,744 --> 39:10:03,664
comportamentul uman și analiza AI. Nucation

52446
39:10:01,440 --> 39:10:06,384
este, de asemenea, o altă zonă în curs de transformare

52447
39:10:03,664 --> 39:10:09,440
de AI. Tutorul personalizat cu

52448
39:10:06,384 --> 39:10:12,000
dificultatea de adaptare creează un tutor AI

52449
39:10:09,440 --> 39:10:14,240
care ajustează lecțiile în timp real

52450
39:10:12,000 --> 39:10:16,160
asupra performanței elevilor. Cunoașterea

52451
39:10:14,240 --> 39:10:18,720
urmărirea modelelor precum cunoașterea profundă

52452
39:10:16,160 --> 39:10:21,520
trasare combinata cu transformatoare pt

52453
39:10:18,720 --> 39:10:24,320
generarea de conținut permite AI să se adapteze

52454
39:10:21,520 --> 39:10:27,024
fiecărui cursant. Seturi de date precum

52455
39:10:24,320 --> 39:10:29,920
evaluările sau plasele edn pot fi folosite pentru

52456
39:10:27,024 --> 39:10:32,640
antrenament. Acum acest AI poate genera noi

52457
39:10:29,920 --> 39:10:35,664
întrebări, explicații și motivații

52458
39:10:32,640 --> 39:10:38,480
feedback bazat pe ritmul de învățare.

52459
39:10:35,664 --> 39:10:40,560
Companii precum Baiju, Vidanto, Corsera

52460
39:10:38,480 --> 39:10:43,360
și Udemy caută constant

52461
39:10:40,560 --> 39:10:45,840
talent care poate construi învățarea adaptivă

52462
39:10:43,360 --> 39:10:48,000
platforme. În continuare, trecem la cercetare

52463
39:10:45,840 --> 39:10:50,720
augmentare cu autonomul

52464
39:10:48,000 --> 39:10:52,960
agent de cercetare. Acest AI poate răspunde

52465
39:10:50,720 --> 39:10:55,664
întrebări de cercetare prin lectura academică

52466
39:10:52,960 --> 39:10:57,664
lucrări, extragerea de perspective, rezumarea

52467
39:10:55,664 --> 39:11:01,024
informații și citarea surselor

52468
39:10:57,664 --> 39:11:04,240
automat. Utilizează S2 sau date

52469
39:11:01,024 --> 39:11:06,560
stabilit pentru lucrări academice. Cybboard pentru

52470
39:11:04,240 --> 39:11:09,440
înglobări de texte științifice și îmbrățișări

52471
39:11:06,560 --> 39:11:12,080
transformatoare de fata sau lang chain pentru

52472
39:11:09,440 --> 39:11:15,024
raționament și rezumare. Citare

52473
39:11:12,080 --> 39:11:18,384
extracția se poate face cu trecători NLP

52474
39:11:15,024 --> 39:11:20,640
sau respinge platformele academice. laboratoare AI

52475
39:11:18,384 --> 39:11:23,920
iar companii precum Google Research, deschise

52476
39:11:20,640 --> 39:11:26,960
AI, poarta de cercetare și LCV ar angaja

52477
39:11:23,920 --> 39:11:28,960
inginerii care pot construi acest sistem.

52478
39:11:26,960 --> 39:11:31,920
Acest proiect se leagă perfect cu

52479
39:11:28,960 --> 39:11:35,280
IA centrată pe educație extinzând învățarea

52480
39:11:31,920 --> 39:11:38,160
în capacitățile de cercetare automatizate.

52481
39:11:35,280 --> 39:11:40,800
În cele din urmă, ajungem la robotica lumii reale

52482
39:11:38,160 --> 39:11:43,664
control cu AI. Ultimul

52483
39:11:40,800 --> 39:11:46,160
demonstrarea abilităților de vârf. Aceasta

52484
39:11:43,664 --> 39:11:49,280
proiectul antrenează AI pentru a controla robotul

52485
39:11:46,160 --> 39:11:52,320
arme sau umanoizi bazate mai degrabă pe obiective

52486
39:11:49,280 --> 39:11:55,200
decât doar instrucțiuni rigide. Folosește pi

52487
39:11:52,320 --> 39:11:58,384
bullet sau vbots pentru simulare. Stabil

52488
39:11:55,200 --> 39:12:01,440
linia de bază 3 sau R lib pentru armare

52489
39:11:58,384 --> 39:12:04,240
învățarea și deschiderea CV-ului sau media pipe pt

52490
39:12:01,440 --> 39:12:06,720
intrare vizuală. Sim pentru transferul real

52491
39:12:04,240 --> 39:12:09,600
tehnicile aduc simulări în realitate

52492
39:12:06,720 --> 39:12:12,384
scenarii mondiale. Companii de robotică ca

52493
39:12:09,600 --> 39:12:15,024
Boston Dynamics, Appronic, Amazon

52494
39:12:12,384 --> 39:12:18,320
Robotica și Agibot caută

52495
39:12:15,024 --> 39:12:20,720
ingineri capabili de endtoend AIdriven

52496
39:12:18,320 --> 39:12:23,600
sisteme robotizate. După ce am explorat

52497
39:12:20,720 --> 39:12:26,240
proiecte AI bazate pe software, robotica este

52498
39:12:23,600 --> 39:12:28,640
următorul pas pentru a arăta stăpânirea AI

52499
39:12:26,240 --> 39:12:31,600
aplicat în lumea fizică. Acestea 10

52500
39:12:28,640 --> 39:12:33,024
Proiectele AI sunt mai mult decât idei.

52501
39:12:31,600 --> 39:12:34,320
>> Vom afla despre o parte din mașină

52502
39:12:33,024 --> 39:12:36,240
interviu pentru învățare și învățare profundă

52503
39:12:34,320 --> 39:12:39,440
întrebări.

52504
39:12:36,240 --> 39:12:41,920
Deci, să începem cu prima noastră întrebare.

52505
39:12:39,440 --> 39:12:45,280
Prima întrebare este cum să detectăm

52506
39:12:41,920 --> 39:12:47,600
valori aberante în date. Deci, în analiza datelor

52507
39:12:45,280 --> 39:12:49,600
și învățarea automată, găsiți adesea

52508
39:12:47,600 --> 39:12:51,440
puncte de date care se află la un nivel anormal

52509
39:12:49,600 --> 39:12:54,080
distanța față de alte puncte într-un mod aleatoriu

52510
39:12:51,440 --> 39:12:56,640
eșantion dintr-o populație. Acestea sunt

52511
39:12:54,080 --> 39:12:58,480
numite valori aberante. Acum valori aberante în date

52512
39:12:56,640 --> 39:13:00,720
poate afecta semnificativ orice predicție

52513
39:12:58,480 --> 39:13:03,440
analiza. Sunt în principal trei

52514
39:13:00,720 --> 39:13:06,320
diferite metode de tratare a valorii aberante.

52515
39:13:03,440 --> 39:13:07,744
Mai întâi avem metoda univariată. Ea

52516
39:13:06,320 --> 39:13:10,000
este una dintre cele mai simple metode pentru

52517
39:13:07,744 --> 39:13:13,104
detectarea valorii aberante. Univariatul

52518
39:13:10,000 --> 39:13:14,720
metoda folosește box plots. Un box plot este a

52519
39:13:13,104 --> 39:13:18,000
afișaj grafic pentru descrierea

52520
39:13:14,720 --> 39:13:19,840
distribuțiile datelor. Box plots utilizare

52521
39:13:18,000 --> 39:13:21,744
mediana și cea inferioară și superioară

52522
39:13:19,840 --> 39:13:23,520
quartiles.

52523
39:13:21,744 --> 39:13:26,384
Această metodă caută puncte de date cu

52524
39:13:23,520 --> 39:13:28,640
valori extreme pe o variabilă. În continuare, noi

52525
39:13:26,384 --> 39:13:30,800
au metoda multivariată. Deci,

52526
39:13:28,640 --> 39:13:33,280
valorile aberante multivariate pot fi găsite într-un

52527
39:13:30,800 --> 39:13:35,280
spațiu n-dimensional având n caracteristici.

52528
39:13:33,280 --> 39:13:37,600
Căutăm combinații neobișnuite ale tuturor

52529
39:13:35,280 --> 39:13:40,800
variabilele din această metodă. In sfarsit,

52530
39:13:37,600 --> 39:13:42,480
avem eroare Minowski. Această metodă

52531
39:13:40,800 --> 39:13:44,560
reduce contribuția potențialului

52532
39:13:42,480 --> 39:13:46,720
valori aberante în procesul de instruire. The

52533
39:13:44,560 --> 39:13:48,640
Eroarea Minowski este un indice de pierdere care este

52534
39:13:46,720 --> 39:13:50,800
mai insensibil la valori aberante decât cel

52535
39:13:48,640 --> 39:13:53,440
eroare pătratică medie standard. Acum în mișcare

52536
39:13:50,800 --> 39:13:56,640
la a doua întrebare. Ce este a

52537
39:13:53,440 --> 39:13:58,720
matricea de confuzie? Deci o matrice de confuzie

52538
39:13:56,640 --> 39:14:00,384
este un tabel care este folosit pentru a descrie

52539
39:13:58,720 --> 39:14:02,800
performanţa unui model de clasificare pe

52540
39:14:00,384 --> 39:14:05,280
un set de date de testare pentru care este adevărat

52541
39:14:02,800 --> 39:14:07,280
valorile sunt deja cunoscute. Ținta

52542
39:14:05,280 --> 39:14:10,000
variabila are două valori pozitive sau

52543
39:14:07,280 --> 39:14:12,000
negativ. Coloanele reprezintă

52544
39:14:10,000 --> 39:14:14,240
valorile reale ale variabilei țintă

52545
39:14:12,000 --> 39:14:15,840
pe care o puteți vedea aici. Rândurile

52546
39:14:14,240 --> 39:14:18,640
reprezintă valorile prezise ale

52547
39:14:15,840 --> 39:14:20,640
variabilă țintă pe care o puteți vedea aici.

52548
39:14:18,640 --> 39:14:23,280
Acum există patru termeni importanți care

52549
39:14:20,640 --> 39:14:27,280
sunt legate de matricea de confuzie. Primul

52550
39:14:23,280 --> 39:14:29,280
avem adevărat pozitiv care este acesta.

52551
39:14:27,280 --> 39:14:31,744
Deci în adevărat pozitiv valoarea prezisă

52552
39:14:29,280 --> 39:14:33,664
se potrivește cu valoarea reală. Deci realul

52553
39:14:31,744 --> 39:14:36,720
valoarea a fost pozitivă și modelul de asemenea

52554
39:14:33,664 --> 39:14:39,520
a prezis o valoare pozitivă. Apoi avem

52555
39:14:36,720 --> 39:14:42,560
negativ adevărat care este de asemenea reprezentat

52556
39:14:39,520 --> 39:14:44,160
ca tn. Adevăratul negativ descrie

52557
39:14:42,560 --> 39:14:46,720
valoarea estimată se potrivește cu cea reală

52558
39:14:44,160 --> 39:14:48,384
valoare. Acum valoarea reală a fost negativă

52559
39:14:46,720 --> 39:14:52,320
iar modelul a prezis un negativ

52560
39:14:48,384 --> 39:14:54,240
valoare. În continuare avem fals pozitiv. Acum

52561
39:14:52,320 --> 39:14:57,104
fals pozitiv este cunoscut și ca tip

52562
39:14:54,240 --> 39:14:59,440
o singura eroare. În fals pozitiv

52563
39:14:57,104 --> 39:15:01,280
valoarea prezisă a fost prezisă în mod fals.

52564
39:14:59,440 --> 39:15:03,840
Valoarea reală a fost negativă, dar

52565
39:15:01,280 --> 39:15:06,640
modelul a prezis o valoare pozitivă.

52566
39:15:03,840 --> 39:15:08,480
În sfârșit avem fals negativ. Un fals

52567
39:15:06,640 --> 39:15:10,960
negativ este cunoscut și ca tipul doi

52568
39:15:08,480 --> 39:15:13,360
eroare. Deci, în fals negativ

52569
39:15:10,960 --> 39:15:15,360
valoarea prezisă a fost prezisă în mod fals.

52570
39:15:13,360 --> 39:15:17,664
Valoarea reală a fost pozitivă, dar

52571
39:15:15,360 --> 39:15:20,480
modelul a prezis o valoare negativă. Acum

52572
39:15:17,664 --> 39:15:23,920
trecând la a treia noastră întrebare care este

52573
39:15:20,480 --> 39:15:25,920
explicați curba ROC. Acum curba ROC

52574
39:15:23,920 --> 39:15:27,520
este una dintre cele mai importante evaluări

52575
39:15:25,920 --> 39:15:30,880
metrici pentru verificarea performanței

52576
39:15:27,520 --> 39:15:33,200
orice model de clasificare. ROC înseamnă

52577
39:15:30,880 --> 39:15:35,600
caracteristica de funcționare a receptorului.

52578
39:15:33,200 --> 39:15:37,104
Caracteristica de funcționare a receptorului sau ROC

52579
39:15:35,600 --> 39:15:39,744
curba este o metodă de a compara

52580
39:15:37,104 --> 39:15:41,744
teste de diagnostic. Curba ROC este

52581
39:15:39,744 --> 39:15:43,840
creat prin trasarea adevăratului pozitiv

52582
39:15:41,744 --> 39:15:46,000
rata față de rata fals pozitivă la

52583
39:15:43,840 --> 39:15:47,840
diferite setări de prag. Deci aici mai departe

52584
39:15:46,000 --> 39:15:50,000
pe axa y aveți adevăratul pozitiv

52585
39:15:47,840 --> 39:15:52,240
rata. Pe axa x avem falsul

52586
39:15:50,000 --> 39:15:54,080
rata pozitiva. Adevărata rată pozitivă

52587
39:15:52,240 --> 39:15:55,664
indică proporția de observații

52588
39:15:54,080 --> 39:15:57,440
care au fost corect prezis a fi

52589
39:15:55,664 --> 39:16:00,240
pozitiv din toate pozitive

52590
39:15:57,440 --> 39:16:02,000
observatii. La fel, falsul

52591
39:16:00,240 --> 39:16:03,520
rata pozitivă este proporția de

52592
39:16:02,000 --> 39:16:05,744
observatii care sunt incorect

52593
39:16:03,520 --> 39:16:08,000
prezis a fi pozitiv din toate

52594
39:16:05,744 --> 39:16:10,000
observatii negative.

52595
39:16:08,000 --> 39:16:12,560
Puteți lua un exemplu. Să presupunem că în

52596
39:16:10,000 --> 39:16:14,160
teste medicale, rata adevărată pozitivă

52597
39:16:12,560 --> 39:16:16,384
este rata în care se află oamenii

52598
39:16:14,160 --> 39:16:18,384
identificate corect pentru a testa pozitiv

52599
39:16:16,384 --> 39:16:21,280
pentru boala în cauză. Să zicem

52600
39:16:18,384 --> 39:16:23,664
testarea virusului corona. ROC nu

52601
39:16:21,280 --> 39:16:25,280
depind de orice distribuție de clasă. Acest

52602
39:16:23,664 --> 39:16:27,024
îl face util pentru evaluare

52603
39:16:25,280 --> 39:16:29,280
clasificatori care prezic evenimente rare precum

52604
39:16:27,024 --> 39:16:32,000
ca boli sau dezastre. Acum trecerea la

52605
39:16:29,280 --> 39:16:34,880
a patra întrebare avem care sunt

52606
39:16:32,000 --> 39:16:36,880
ipoteze pentru regresia liniară. Deci

52607
39:16:34,880 --> 39:16:38,320
analiza de regresie liniară este utilizată pentru

52608
39:16:36,880 --> 39:16:40,800
modelarea relaţiei dintre a

52609
39:16:38,320 --> 39:16:43,600
o singură variabilă dependentă Y și una sau

52610
39:16:40,800 --> 39:16:45,104
mai multe caracteristici sau variabile predictoare.

52611
39:16:43,600 --> 39:16:48,384
Unele dintre ipotezele importante pentru

52612
39:16:45,104 --> 39:16:50,640
regresia liniară sunt atât mai întâi ei

52613
39:16:48,384 --> 39:16:52,160
ar trebui să aibă liniaritate. Atât de liniară

52614
39:16:50,640 --> 39:16:53,360
regresia are nevoie de relație

52615
39:16:52,160 --> 39:16:56,160
între independent și cel

52616
39:16:53,360 --> 39:16:58,384
variabilele dependente să fie liniare. Este

52617
39:16:56,160 --> 39:17:00,080
de asemenea, crucial pentru a verifica valorile aberante din moment ce

52618
39:16:58,384 --> 39:17:02,320
regresia liniară este sensibilă la

52619
39:17:00,080 --> 39:17:04,000
efecte aberante. Mai departe avem

52620
39:17:02,320 --> 39:17:05,664
homociasticitate.

52621
39:17:04,000 --> 39:17:07,360
Homoscadasticitatea

52622
39:17:05,664 --> 39:17:10,080
ilustrează o situație în care

52623
39:17:07,360 --> 39:17:11,600
termen de eroare care este zgomotul sau aleatoriu

52624
39:17:10,080 --> 39:17:13,360
perturbarea relaţiei dintre

52625
39:17:11,600 --> 39:17:15,024
caracteristicile și variabila țintă este

52626
39:17:13,360 --> 39:17:17,440
la fel pe toate nivelurile

52627
39:17:15,024 --> 39:17:19,664
variabile dependente. În al treilea rând avem

52628
39:17:17,440 --> 39:17:22,640
independenta. Deci observațiile ar trebui să fie

52629
39:17:19,664 --> 39:17:25,024
independente unele de altele. În sfârșit, noi

52630
39:17:22,640 --> 39:17:26,480
nu au multi-olinearitate.

52631
39:17:25,024 --> 39:17:28,000
Deci ar trebui să fie puțin sau deloc

52632
39:17:26,480 --> 39:17:29,744
multi-liniaritate.

52633
39:17:28,000 --> 39:17:32,240
Variabilele independente nu ar trebui să fie prea

52634
39:17:29,744 --> 39:17:33,920
foarte corelate. Acum trecerea la noi

52635
39:17:32,240 --> 39:17:35,600
a cincea întrebare din lista noastră de interviuri

52636
39:17:33,920 --> 39:17:38,240
întrebări.

52637
39:17:35,600 --> 39:17:40,640
Întrebarea este ce este regularizarea

52638
39:17:38,240 --> 39:17:43,200
în învățarea automată? Explicați L2

52639
39:17:40,640 --> 39:17:45,200
regularizare.

52640
39:17:43,200 --> 39:17:46,800
Deci regularizarea este o învățare automată

52641
39:17:45,200 --> 39:17:48,640
tehnică care este utilizată pentru a reduce

52642
39:17:46,800 --> 39:17:50,384
erori prin ajustarea funcției

52643
39:17:48,640 --> 39:17:52,560
adecvat pe antrenamentul stabilit în

52644
39:17:50,384 --> 39:17:54,880
pentru a evita supraadaptarea datelor. Deci

52645
39:17:52,560 --> 39:17:56,560
supraajustarea are loc atunci când un model învață

52646
39:17:54,880 --> 39:17:58,960
detaliile și zgomotul din antrenament

52647
39:17:56,560 --> 39:18:00,640
date în măsura în care este negativ

52648
39:17:58,960 --> 39:18:03,840
influențează performanța modelului asupra

52649
39:18:00,640 --> 39:18:06,640
date noi. Deci aici puteți vedea că avem un

52650
39:18:03,840 --> 39:18:08,880
un complot frumos care arată cât de supraadaptat

52651
39:18:06,640 --> 39:18:13,104
datele pot fi vizualizate

52652
39:18:08,880 --> 39:18:15,744
și aici avem o linie de potrivire bună peste

52653
39:18:13,104 --> 39:18:18,480
aceleași puncte de date. Deci este și asta

52654
39:18:15,744 --> 39:18:20,560
cunoscută sub numele de linie de regresie. Acum L2

52655
39:18:18,480 --> 39:18:23,024
regularizarea este cunoscută și sub denumirea de creastă

52656
39:18:20,560 --> 39:18:24,720
regresie. Deci regresia crestei se modifica

52657
39:18:23,024 --> 39:18:26,960
modelul suprainstalat prin adăugarea

52658
39:18:24,720 --> 39:18:29,744
mărimea pătrată a coeficientului ca a

52659
39:18:26,960 --> 39:18:32,384
termen de penalizare la funcția de pierdere. Așa mai departe

52660
39:18:29,744 --> 39:18:34,880
în dreapta poți vedea un set de date

52661
39:18:32,384 --> 39:18:37,440
punctele trasate și avem liniarul nostru

52662
39:18:34,880 --> 39:18:39,024
linie de regresie și iată-ne

52663
39:18:37,440 --> 39:18:41,840
calcularea funcției de cost pentru

52664
39:18:39,024 --> 39:18:45,440
linia de regresie a crestei. Deci costul nostru

52665
39:18:41,840 --> 39:18:48,640
funcția este de fapt pierdere plus lambda

52666
39:18:45,440 --> 39:18:50,480
în însumarea lui w ^ 2 unde pierderea este

52667
39:18:48,640 --> 39:18:53,280
de fapt suma erorilor pătrate sau

52668
39:18:50,480 --> 39:18:55,840
reziduuri pătrate. Lambda înseamnă

52669
39:18:53,280 --> 39:18:59,104
penalizare pentru erori. W se numește

52670
39:18:55,840 --> 39:19:02,080
panta curbei sau dreptei. Bine. Acum

52671
39:18:59,104 --> 39:19:04,240
luați în considerare un caz în care sunt două

52672
39:19:02,080 --> 39:19:06,800
puncte care trec prin liniar

52673
39:19:04,240 --> 39:19:09,744
linie de regresie. Acum dacă calculezi

52674
39:19:06,800 --> 39:19:12,720
funcția de cost, obținem valoarea ca

52675
39:19:09,744 --> 39:19:14,880
1,69. Deci aici ne-am asumat acea pierdere

52676
39:19:12,720 --> 39:19:17,104
este zero deoarece cele două puncte se află

52677
39:19:14,880 --> 39:19:20,960
direct pe linie. Noi am luat

52678
39:19:17,104 --> 39:19:24,480
lambda să fie 1 și w este 1,3. Deci dacă tu

52679
39:19:20,960 --> 39:19:28,320
folosește această funcție sau această formulă, tu

52680
39:19:24,480 --> 39:19:31,360
obțineți funcția de cost ca 1,69.

52681
39:19:28,320 --> 39:19:33,664
Acum, mergând mai departe, să luăm în considerare un altul

52682
39:19:31,360 --> 39:19:35,600
situație în care vom calcula la fel

52683
39:19:33,664 --> 39:19:38,640
funcția de cost pentru regresia crestei

52684
39:19:35,600 --> 39:19:41,360
linie. Există o oarecare pierdere pentru ambele

52685
39:19:38,640 --> 39:19:43,200
puncte deoarece nu sunt pe aceeași linie.

52686
39:19:41,360 --> 39:19:47,024
Deci aici puteți vedea suma pătratului

52687
39:19:43,200 --> 39:19:50,560
reziduurile este 0,05 care este de fapt

52688
39:19:47,024 --> 39:19:53,600
suma de 2 pătrate. Presupun că asta este 2

52689
39:19:50,560 --> 39:19:56,384
și 0,1 pentru acesta.

52690
39:19:53,600 --> 39:20:00,560
Deci, dacă le pătrați pe ambele și le adăugați

52691
39:19:56,384 --> 39:20:03,024
valoarea este 05 a lambda este din nou 1 și w we

52692
39:20:00,560 --> 39:20:06,720
au presupus a fi 6. Acum dacă găsești

52693
39:20:03,024 --> 39:20:08,480
funcția de cost valoarea este 41. Să

52694
39:20:06,720 --> 39:20:10,160
trageți linia de regresie liniară și

52695
39:20:08,480 --> 39:20:12,384
linia de regresie creastă cu toate cele

52696
39:20:10,160 --> 39:20:14,800
puncte constatăm că regresia crestei

52697
39:20:12,384 --> 39:20:17,024
linia ca cea mai potrivită din moment ce costul său

52698
39:20:14,800 --> 39:20:19,280
funcția este mai mică. Acum venind la

52699
39:20:17,024 --> 39:20:21,280
a șasea întrebare.

52700
39:20:19,280 --> 39:20:25,664
Care sunt diferitele metode de împărțire

52701
39:20:21,280 --> 39:20:27,840
un arbore într-un algoritm de arbore de decizie?

52702
39:20:25,664 --> 39:20:30,960
Deci, există trei metode de a împărți a

52703
39:20:27,840 --> 39:20:33,024
arborele de decizie. Mai întâi avem variație.

52704
39:20:30,960 --> 39:20:34,720
Deci reducerea varianței este un algoritm

52705
39:20:33,024 --> 39:20:37,200
care este folosit pentru țintă continuă

52706
39:20:34,720 --> 39:20:39,280
variabile. Acest algoritm folosește

52707
39:20:37,200 --> 39:20:41,104
variația formulei standard pentru a alege

52708
39:20:39,280 --> 39:20:42,720
cel mai bine împărțit. Deci aici puteți vedea

52709
39:20:41,104 --> 39:20:45,520
varianța formulei standard care este

52710
39:20:42,720 --> 39:20:48,240
însumarea lui x care este tot

52711
39:20:45,520 --> 39:20:51,024
puncte individuale minus xar care este

52712
39:20:48,240 --> 39:20:53,664
medie pătrată împărțită la numărul total

52713
39:20:51,024 --> 39:20:55,200
de observatii. Acum despărțirea cu

52714
39:20:53,664 --> 39:20:58,384
varianța inferioară este selectată ca

52715
39:20:55,200 --> 39:21:00,480
criterii de împărțire a populației.

52716
39:20:58,384 --> 39:21:02,240
Acum pașii pentru a calcula varianța sunt

52717
39:21:00,480 --> 39:21:05,024
trebuie să calculați varianța pentru fiecare

52718
39:21:02,240 --> 39:21:07,360
nod și apoi trebuie să calculați pentru

52719
39:21:05,024 --> 39:21:10,080
fiecare împărțire ca medie ponderată a

52720
39:21:07,360 --> 39:21:12,560
fiecare variație de nod.

52721
39:21:10,080 --> 39:21:15,840
Mergând înainte, a doua metodă pe care o avem

52722
39:21:12,560 --> 39:21:17,600
este câștig de informații. Deci câștig de informații

52723
39:21:15,840 --> 39:21:20,640
este folosit pentru împărțirea nodurilor atunci când

52724
39:21:17,600 --> 39:21:23,600
variabila țintă este categorică.

52725
39:21:20,640 --> 39:21:25,440
Funcționează pe conceptul de entropie. Acum

52726
39:21:23,600 --> 39:21:27,920
gradul de dezorganizare în a

52727
39:21:25,440 --> 39:21:29,920
sistemul este cunoscut sub denumirea de entropie. Deci aici tu

52728
39:21:27,920 --> 39:21:32,640
poate vedea formula pentru obținerea de informații

52729
39:21:29,920 --> 39:21:36,240
care este 1 minus entropia.

52730
39:21:32,640 --> 39:21:37,664
În cele din urmă avem impuritatea genială. Deci geniu

52731
39:21:36,240 --> 39:21:39,440
impuritatea este probabilitatea de

52732
39:21:37,664 --> 39:21:42,080
clasificând incorect un aleatoriu

52733
39:21:39,440 --> 39:21:43,664
elementul ales în setul de date dacă acesta

52734
39:21:42,080 --> 39:21:45,840
au fost etichetate aleatoriu conform

52735
39:21:43,664 --> 39:21:48,000
distribuția claselor în setul de date. Deci

52736
39:21:45,840 --> 39:21:51,360
mai jos puteți vedea formula pentru gen

52737
39:21:48,000 --> 39:21:54,480
impuritate. Deci avem 1 însumare în minus

52738
39:21:51,360 --> 39:21:56,800
de pi pătrat întreg unde n reprezintă

52739
39:21:54,480 --> 39:21:58,800
numărul de clase și p din i

52740
39:21:56,800 --> 39:22:02,320
reprezintă probabilitatea de la întâmplare

52741
39:21:58,800 --> 39:22:06,000
alegerea unui element din clasa i.

52742
39:22:02,320 --> 39:22:08,160
Trec acum la a șaptea întrebare.

52743
39:22:06,000 --> 39:22:09,920
Deci întrebarea este cum găsim

52744
39:22:08,160 --> 39:22:12,384
valoarea optimă a clusterului în K înseamnă

52745
39:22:09,920 --> 39:22:14,160
algoritm de grupare. Acum sunt două

52746
39:22:12,384 --> 39:22:17,024
metode pentru a găsi clusterul optim

52747
39:22:14,160 --> 39:22:18,800
valoare. Deci mai întâi avem metoda cotului

52748
39:22:17,024 --> 39:22:22,000
care este una dintre cele mai cunoscute pentru

52749
39:22:18,800 --> 39:22:23,840
găsirea numărului optim de clustere.

52750
39:22:22,000 --> 39:22:26,384
Deci, în această metodă, trebuie să calculați

52751
39:22:23,840 --> 39:22:28,800
suma din cadrul grupului de erori pătrate

52752
39:22:26,384 --> 39:22:30,800
pentru diferite valori ale lui K și alegeți

52753
39:22:28,800 --> 39:22:34,240
K pentru care în cadrul grupului suma de

52754
39:22:30,800 --> 39:22:36,320
erorile pătrate încep mai întâi să scadă.

52755
39:22:34,240 --> 39:22:39,200
Deci, în graficul de mai jos al erorilor pătrate

52756
39:22:36,320 --> 39:22:42,560
față de numărul de clustere K pe care le puteți

52757
39:22:39,200 --> 39:22:46,160
vezi la K este egal cu 4 eroarea pătrată

52758
39:22:42,560 --> 39:22:50,240
începe să scadă. Deci, de aici optimul nostru

52759
39:22:46,160 --> 39:22:51,744
Valoarea K este patru. În continuare avem siloidul

52760
39:22:50,240 --> 39:22:53,664
metoda.

52761
39:22:51,744 --> 39:22:56,160
Deci metoda celoid măsoară cum

52762
39:22:53,664 --> 39:22:59,024
un punct este similar cu propriul său cluster

52763
39:22:56,160 --> 39:23:01,840
comparativ cu alte clustere. Media

52764
39:22:59,024 --> 39:23:04,160
metoda seloidului calculează media

52765
39:23:01,840 --> 39:23:06,480
observații pentru diferite valori ale lui K.

52766
39:23:04,160 --> 39:23:09,600
Numărul optim de clustere K este

52767
39:23:06,480 --> 39:23:12,160
unul care maximizează media peste a

52768
39:23:09,600 --> 39:23:14,384
intervalul de valori posibile pentru K. The

52769
39:23:12,160 --> 39:23:17,600
scorul seloidului atinge maximul global

52770
39:23:14,384 --> 39:23:20,320
la K optimă. Deci în cazul nostru cel

52771
39:23:17,600 --> 39:23:22,880
seloidul mediu atinge maximul la k is

52772
39:23:20,320 --> 39:23:25,104
egal cu doi pe care le puteți vedea aici. Deci

52773
39:23:22,880 --> 39:23:28,560
valoarea optimă a clusterului nostru va fi două

52774
39:23:25,104 --> 39:23:31,280
Aici. Mergând înainte cu a opta întrebare

52775
39:23:28,560 --> 39:23:32,960
în lista noastră este cum funcționează punerea în comun

52776
39:23:31,280 --> 39:23:35,840
lucru stratificat într-un neural convoluțional

52777
39:23:32,960 --> 39:23:37,520
rețea. Deci stratul de pooling efectuează a

52778
39:23:35,840 --> 39:23:39,840
operatiune de subesantionare pentru a

52779
39:23:37,520 --> 39:23:42,880
reduce dimensionalitatea caracteristicii

52780
39:23:39,840 --> 39:23:45,744
harta. Deci, în operațiunea de pooling, tu

52781
39:23:42,880 --> 39:23:47,664
glisați un filtru bidimensional peste fiecare

52782
39:23:45,744 --> 39:23:49,360
canal al hărții caracteristicilor și rezumați

52783
39:23:47,664 --> 39:23:51,520
caracteristici care se află în regiunea acoperită

52784
39:23:49,360 --> 39:23:53,440
de filtru.

52785
39:23:51,520 --> 39:23:54,880
Este o practică comună să se facă periodic

52786
39:23:53,440 --> 39:23:56,960
introduceți un strat de grupare între ele

52787
39:23:54,880 --> 39:23:58,320
straturi convoluționale succesive în a

52788
39:23:56,960 --> 39:23:59,920
rețea neuronală convoluțională

52789
39:23:58,320 --> 39:24:01,440
arhitectura.

52790
39:23:59,920 --> 39:24:04,080
Deci stratul de pooling funcționează

52791
39:24:01,440 --> 39:24:07,280
independent pe fiecare felie de adâncime

52792
39:24:04,080 --> 39:24:10,240
intrarea și o redimensionează în mod special folosind

52793
39:24:07,280 --> 39:24:12,720
operația maximă. Deci în diagramă

52794
39:24:10,240 --> 39:24:16,320
arătat aici puteți vedea că avem un

52795
39:24:12,720 --> 39:24:19,200
harta caracteristicilor rectificată. Folosim un 2

52796
39:24:16,320 --> 39:24:21,744
 2 filtre și efectuează un pooling maxim

52797
39:24:19,200 --> 39:24:23,840
operare. Așa că luați în considerare acest lucru drept

52798
39:24:21,744 --> 39:24:27,024
filtrul. Dacă efectuați operația max

52799
39:24:23,840 --> 39:24:30,000
peste valori

52800
39:24:27,024 --> 39:24:33,104
să zicem 0 5 3 și 1. Așadar, având în vedere

52801
39:24:30,000 --> 39:24:35,600
aceasta este harta caracteristicilor piscinei noastre maxime

52802
39:24:33,104 --> 39:24:38,320
valoarea va fi cinci. La fel pentru asta

52803
39:24:35,600 --> 39:24:40,640
o bucată de date va fi șapte.

52804
39:24:38,320 --> 39:24:42,640
Apoi, dacă glisați filtrul peste acesta

52805
39:24:40,640 --> 39:24:45,104
cadru pătrat, obțineți opt. Şi

52806
39:24:42,640 --> 39:24:48,080
în mod similar aici obțineți șase. Deci asta este

52807
39:24:45,104 --> 39:24:50,960
cunoscută și sub numele de hartă a caracteristicilor extrase.

52808
39:24:48,080 --> 39:24:53,840
Mergând înainte, a noua întrebare din partea noastră

52809
39:24:50,960 --> 39:24:55,600
lista este cum funcționează rețeaua LSTM? Deci

52810
39:24:53,840 --> 39:24:57,440
rețelele de memorie pe termen lung sunt a

52811
39:24:55,600 --> 39:24:59,440
tip de reţele neuronale recurente care

52812
39:24:57,440 --> 39:25:01,600
sunt capabili să învețe dependența de ordine

52813
39:24:59,440 --> 39:25:03,520
și probleme de predicție a secvenței. Aşa

52814
39:25:01,600 --> 39:25:05,104
amintirea informațiilor pentru perioade lungi de timp

52815
39:25:03,520 --> 39:25:08,800
de timp este practic implicit

52816
39:25:05,104 --> 39:25:10,560
comportament. Acum, LSTM-urile au și asta

52817
39:25:08,800 --> 39:25:12,240
structură în formă de lanț pe care o puteți vedea

52818
39:25:10,560 --> 39:25:14,160
aici.

52819
39:25:12,240 --> 39:25:16,160
Dar modulul care se repetă are altceva

52820
39:25:14,160 --> 39:25:18,240
structura. Deci, în loc să ai un

52821
39:25:16,160 --> 39:25:21,664
un singur strat de rețea neuronală, există

52822
39:25:18,240 --> 39:25:23,520
patru interacționând într-un mod cu totul special.

52823
39:25:21,664 --> 39:25:25,520
Acum, puteți vedea că acestea sunt numite ca

52824
39:25:23,520 --> 39:25:28,160
porţi. Aceste porți conțin sigmoid

52825
39:25:25,520 --> 39:25:30,960
activări. O activare sigmoidă este

52826
39:25:28,160 --> 39:25:34,080
similar cu activarea tanh. În schimb

52827
39:25:30,960 --> 39:25:36,640
de squishing valori între minus1 și  

52828
39:25:34,080 --> 39:25:41,920
unul, strică valorile între 0 și

52829
39:25:36,640 --> 39:25:44,480
unul. Un LSTDM are patru porți.

52830
39:25:41,920 --> 39:25:47,104
Acum acestea se numesc uitați, amintiți-vă,

52831
39:25:44,480 --> 39:25:49,520
învață și folosește sau scoate. Deci dacă vezi

52832
39:25:47,104 --> 39:25:51,664
asta în primul pas, folosim

52833
39:25:49,520 --> 39:25:53,280
uita poarta care decide ce

52834
39:25:51,664 --> 39:25:55,664
informațiile ar trebui aruncate sau

52835
39:25:53,280 --> 39:25:58,000
păstrat. informatiile din precedente

52836
39:25:55,664 --> 39:25:59,600
starea ascunsă și informațiile din

52837
39:25:58,000 --> 39:26:02,000
curentul de intrare este trecut prin

52838
39:25:59,600 --> 39:26:04,384
funcția sigmoidă. Valorile ies la iveală

52839
39:26:02,000 --> 39:26:06,320
intre zero si unu.

52840
39:26:04,384 --> 39:26:07,600
Deci, dacă valoarea este mai aproape de zero, aceasta

52841
39:26:06,320 --> 39:26:09,744
înseamnă că trebuie să uiți asta

52842
39:26:07,600 --> 39:26:11,920
informații și dacă valoarea este mai apropiată

52843
39:26:09,744 --> 39:26:13,664
la unul, înseamnă că trebuie să păstrați asta

52844
39:26:11,920 --> 39:26:16,384
informaţii.

52845
39:26:13,664 --> 39:26:18,384
În continuare avem poarta de intrare. Deci

52846
39:26:16,384 --> 39:26:20,800
poarta de intrare este folosită pentru a actualiza celula

52847
39:26:18,384 --> 39:26:22,880
stare. În primul rând, trecem de precedentul

52848
39:26:20,800 --> 39:26:25,280
starea ascunsă și intrarea curentă în

52849
39:26:22,880 --> 39:26:26,960
o funcție sigmoidă

52850
39:26:25,280 --> 39:26:29,280
care decide ce valori vor fi

52851
39:26:26,960 --> 39:26:31,840
actualizat prin transformarea valorilor să fie

52852
39:26:29,280 --> 39:26:34,800
între 0 și 1. Zero înseamnă nu

52853
39:26:31,840 --> 39:26:36,560
important și unul înseamnă important. Tu

52854
39:26:34,800 --> 39:26:38,960
trece, de asemenea, starea ascunsă și curent

52855
39:26:36,560 --> 39:26:41,520
introduceți în funcția bronz pentru a aplatiza

52856
39:26:38,960 --> 39:26:44,240
valorile cuprinse între minus1 și unu.

52857
39:26:41,520 --> 39:26:46,640
Acest lucru ajută la reglarea rețelei.

52858
39:26:44,240 --> 39:26:49,104
Apoi înmulțiți rezultatul bronz cu

52859
39:26:46,640 --> 39:26:50,800
ieșirea sigmoidiană. Ieșirea sigmoidă

52860
39:26:49,104 --> 39:26:54,240
va decide care este informația

52861
39:26:50,800 --> 39:26:56,480
important să se păstreze de la ieșirea tanh.

52862
39:26:54,240 --> 39:26:59,104
Și, în sfârșit, la pasul trei avem

52863
39:26:56,480 --> 39:27:02,080
poarta de iesire. Această poartă de ieșire este folosită pentru

52864
39:26:59,104 --> 39:27:04,960
decide care ar trebui să fie următoarea stare ascunsă

52865
39:27:02,080 --> 39:27:06,560
fii. Mai întâi trecem de precedentul ascuns

52866
39:27:04,960 --> 39:27:09,440
starea și intrarea curentă în a

52867
39:27:06,560 --> 39:27:11,744
funcția sigmoidă. Apoi trecem pe lângă nou

52868
39:27:09,440 --> 39:27:14,560
starea celulei modificată în tanage

52869
39:27:11,744 --> 39:27:16,640
funcția. Înmulțim apoi tanajul

52870
39:27:14,560 --> 39:27:18,560
ieșire cu ieșirea sigmoidă pentru a decide

52871
39:27:16,640 --> 39:27:21,744
ce informații ar trebui starea ascunsă

52872
39:27:18,560 --> 39:27:23,840
transporta. Ieșirea este starea ascunsă.

52873
39:27:21,744 --> 39:27:25,920
Starea nouă a celulei și noua stare ascunsă

52874
39:27:23,840 --> 39:27:29,104
starea este apoi transferată la următoarea

52875
39:27:25,920 --> 39:27:30,720
pas de timp. În cele din urmă, vorbind despre

52876
39:27:29,104 --> 39:27:33,840
ultima întrebare din lista noastră de interviuri

52877
39:27:30,720 --> 39:27:36,240
întrebări, am explicat conceptul

52878
39:27:33,840 --> 39:27:38,384
de coborâre în gradient în învățarea profundă.

52879
39:27:36,240 --> 39:27:40,160
Acum coborârea gradientului este o optimizare

52880
39:27:38,384 --> 39:27:42,800
algoritm care este folosit în principal pentru a găsi

52881
39:27:40,160 --> 39:27:44,960
minimul unei funcții în mașină

52882
39:27:42,800 --> 39:27:47,920
învăţarea. Coborârea în gradient este obișnuită

52883
39:27:44,960 --> 39:27:49,664
actualizați parametrii dintr-un model.

52884
39:27:47,920 --> 39:27:51,664
Parametrii pot varia în funcție de

52885
39:27:49,664 --> 39:27:53,440
algoritmi precum coeficienții în

52886
39:27:51,664 --> 39:27:55,840
regresie liniară și ponderi în neural

52887
39:27:53,440 --> 39:27:59,280
retelelor.

52888
39:27:55,840 --> 39:28:02,800
Puteți vedea că avem aceste hărți și mai departe

52889
39:27:59,280 --> 39:28:05,840
pe axa y avem pierderea. Pe

52890
39:28:02,800 --> 39:28:08,320
pe axa x avem greutatea și aici

52891
39:28:05,840 --> 39:28:11,600
încearcă să găsească minimul local sau

52892
39:28:08,320 --> 39:28:13,280
minimul global. Acum acest gradient

52893
39:28:11,600 --> 39:28:14,960
metoda de coborâre este utilizată pentru a minimiza

52894
39:28:13,280 --> 39:28:17,664
funcția de cost și actualizarea parametrilor

52895
39:28:14,960 --> 39:28:19,360
a modelului de învăţare. Gradientul

52896
39:28:17,664 --> 39:28:22,160
indică întotdeauna în direcția

52897
39:28:19,360 --> 39:28:24,240
cea mai abruptă creștere a funcției de pierdere.

52898
39:28:22,160 --> 39:28:25,920
Algoritmul de coborâre a gradientului ia a

52899
39:28:24,240 --> 39:28:28,240
pas în direcția negativului

52900
39:28:25,920 --> 39:28:30,720
gradient pentru a reduce pierderea ca

52901
39:28:28,240 --> 39:28:32,320
cât mai repede posibil. Pentru a determina

52902
39:28:30,720 --> 39:28:34,384
următorul punct de-a lungul funcției de pierdere

52903
39:28:32,320 --> 39:28:36,320
curba, algoritmul de coborâre a gradientului

52904
39:28:34,384 --> 39:28:38,384
adaugă o parte din gradient

52905
39:28:36,320 --> 39:28:40,640
magnitudinea până la punctul de plecare. Acum

52906
39:28:38,384 --> 39:28:42,384
acest proces se repetă pentru a găsi

52907
39:28:40,640 --> 39:28:45,024
minim global.

52908
39:28:42,384 --> 39:28:47,440
>> Bine ați venit la probabilitatea de reîmprospătare la matematică

52909
39:28:45,024 --> 39:28:49,920
și statistici.

52910
39:28:47,440 --> 39:28:52,160
În această lecție, vom explica

52911
39:28:49,920 --> 39:28:53,664
conceptele de statistică şi

52912
39:28:52,160 --> 39:28:56,320
probabilitate.

52913
39:28:53,664 --> 39:28:59,104
Descrieți probabilitatea condiționată. Definiți

52914
39:28:56,320 --> 39:29:01,664
regula probabilității în lanț. Discutați

52915
39:28:59,104 --> 39:29:04,480
măsura varianței. Identificați

52916
39:29:01,664 --> 39:29:07,744
tipuri de distribuție gshian.

52917
39:29:04,480 --> 39:29:10,480
Baza de statistică și probabilitate.

52918
39:29:07,744 --> 39:29:12,480
Probabilitate și statistică. Știința datelor

52919
39:29:10,480 --> 39:29:15,104
se bazează foarte mult pe estimări şi

52920
39:29:12,480 --> 39:29:17,744
previziuni. O parte semnificativă a

52921
39:29:15,104 --> 39:29:19,664
știința datelor este alcătuită din evaluări

52922
39:29:17,744 --> 39:29:21,744
si prognoza.

52923
39:29:19,664 --> 39:29:24,384
Se folosesc metode statistice pentru a face

52924
39:29:21,744 --> 39:29:26,880
estimări pentru analize ulterioare.

52925
39:29:24,384 --> 39:29:29,600
Teoria probabilității este utilă pentru realizarea

52926
39:29:26,880 --> 39:29:32,480
previziuni. Metodele statistice sunt

52927
39:29:29,600 --> 39:29:35,200
dependentă foarte mult de teoria probabilității

52928
39:29:32,480 --> 39:29:37,280
și toate probabilitățile și statisticile sunt

52929
39:29:35,200 --> 39:29:39,520
dependent de date.

52930
39:29:37,280 --> 39:29:43,200
Datele sunt informații obținute pentru

52931
39:29:39,520 --> 39:29:46,384
referință sau cercetare prin observații,

52932
39:29:43,200 --> 39:29:48,720
fapte și măsurători. Datele sunt un set

52933
39:29:46,384 --> 39:29:51,744
de fapte structurate sub forma care

52934
39:29:48,720 --> 39:29:54,960
computerele pot interpreta, cum ar fi numere,

52935
39:29:51,744 --> 39:29:57,664
cuvinte, estimări și opinii.

52936
39:29:54,960 --> 39:29:59,664
Importanța datelor. Datele ajută la vizualizare

52937
39:29:57,664 --> 39:30:01,920
mai multe despre informații de către

52938
39:29:59,664 --> 39:30:04,480
identificarea posibilelor legături între

52939
39:30:01,920 --> 39:30:06,960
două caracteristici. Datele ajută la

52940
39:30:04,480 --> 39:30:09,744
detectarea distorsiunii prin descoperire

52941
39:30:06,960 --> 39:30:12,000
modele ascunse bazate pe anterioare

52942
39:30:09,744 --> 39:30:14,800
modele de informare. Datele pot fi

52943
39:30:12,000 --> 39:30:17,200
folosit pentru a anticipa viitorul sau

52944
39:30:14,800 --> 39:30:19,520
prezice starea actuală a lucrurilor.

52945
39:30:17,200 --> 39:30:21,744
De asemenea, datele ajută la determinarea dacă

52946
39:30:19,520 --> 39:30:24,800
două informații au oricare

52947
39:30:21,744 --> 39:30:28,160
exemplu în comun sau nu. Tipuri de

52948
39:30:24,800 --> 39:30:30,480
date. Datele ar putea fi cantitative. Asta

52949
39:30:28,160 --> 39:30:33,200
sunt date care pot fi măsurate sau numărate

52950
39:30:30,480 --> 39:30:35,744
în cifre sau poate fi calitativ

52951
39:30:33,200 --> 39:30:38,720
care sunt date care sunt în general împărțite

52952
39:30:35,744 --> 39:30:40,560
în grupuri sau în cuvinte mai simple care

52953
39:30:38,720 --> 39:30:43,744
nu poate fi numărat sau măsurat în

52954
39:30:40,560 --> 39:30:46,240
numere. Să luăm în considerare un exemplu a

52955
39:30:43,744 --> 39:30:48,384
datele despre informațiile despre clienți ale unei bănci pot

52956
39:30:46,240 --> 39:30:51,520
conţine cantitative şi calitative

52957
39:30:48,384 --> 39:30:55,104
date. Luați în considerare acest instantaneu unde suntem

52958
39:30:51,520 --> 39:30:58,880
au ID de client, prenume, geografie,

52959
39:30:55,104 --> 39:31:01,360
sex, vârstă, sold, are C sau card este

52960
39:30:58,880 --> 39:31:04,480
membru activ. Printre aceste variabile

52961
39:31:01,360 --> 39:31:06,880
putem vedea că numele de familie este în mare parte calitativ

52962
39:31:04,480 --> 39:31:10,320
întrucât nu poate fi numărat și măsurat în

52963
39:31:06,880 --> 39:31:12,880
numere. Geografia și genul sunt, de asemenea

52964
39:31:10,320 --> 39:31:16,160
calitative deoarece nu pot fi numărate

52965
39:31:12,880 --> 39:31:19,360
numere și sunt în mare parte grupuri. are C sau

52966
39:31:16,160 --> 39:31:21,520
card care are card de credit și este

52967
39:31:19,360 --> 39:31:24,000
membru activ deși conțin

52968
39:31:21,520 --> 39:31:26,720
numeric în formă dar acestea sunt

52969
39:31:24,000 --> 39:31:30,320
categoric, ceea ce înseamnă că acestea au fost

52970
39:31:26,720 --> 39:31:33,920
împărțit în grupuri de unu și zero care

52971
39:31:30,320 --> 39:31:37,664
reprezintă, prin urmare, da și nu ca răspuns

52972
39:31:33,920 --> 39:31:40,320
aceste două variabile sunt de asemenea calitative

52973
39:31:37,664 --> 39:31:43,024
ID-ul clientului este din nou deși a

52974
39:31:40,320 --> 39:31:46,080
date numerice însă semnificația

52975
39:31:43,024 --> 39:31:47,664
sau intuiția din spatele ID-ului clientului este

52976
39:31:46,080 --> 39:31:50,080
categoric.

52977
39:31:47,664 --> 39:31:54,240
Prin urmare, poate fi păstrat în calitativ

52978
39:31:50,080 --> 39:31:56,560
date de asemenea. Cu toate acestea, vârsta și echilibrul

52979
39:31:54,240 --> 39:31:58,560
acestea sunt informaţii numerice care

52980
39:31:56,560 --> 39:32:01,024
au fost măsurate sau numărate și

52981
39:31:58,560 --> 39:32:03,280
se pot efectua operaţii numerice pe

52982
39:32:01,024 --> 39:32:05,600
ei. Prin urmare, acestea sunt sub

52983
39:32:03,280 --> 39:32:08,640
categorii de date cantitative.

52984
39:32:05,600 --> 39:32:11,280
Introducere în statistica descriptivă.

52985
39:32:08,640 --> 39:32:13,440
Statistici descriptive. Un descriptiv

52986
39:32:11,280 --> 39:32:15,600
măsurarea este măsura sumară care

52987
39:32:13,440 --> 39:32:18,320
cantitativ înfățișează cel mai mult

52988
39:32:15,600 --> 39:32:20,160
caracteristici importante ale unui set de date

52989
39:32:18,320 --> 39:32:22,880
permițând o mai bună înțelegere a

52990
39:32:20,160 --> 39:32:25,024
informația. Datele pot fi măsurate ca

52991
39:32:22,880 --> 39:32:26,960
diferite niveluri. Nivelurile de

52992
39:32:25,024 --> 39:32:29,200
măsurarea descrie natura

52993
39:32:26,960 --> 39:32:32,080
informațiile stocate în datele atribuite

52994
39:32:29,200 --> 39:32:34,720
la variabile. Datele calitative pot

52995
39:32:32,080 --> 39:32:36,880
fi măsurat ca nominal sau ordinal.

52996
39:32:34,720 --> 39:32:39,600
Datele cantitative pot fi măsurate în

52997
39:32:36,880 --> 39:32:42,160
termeni de interval și tip de raport.

52998
39:32:39,600 --> 39:32:45,200
Date nominale. Datele sunt clasificate

52999
39:32:42,160 --> 39:32:47,744
folosind nume, etichete sau calități. Pentru

53000
39:32:45,200 --> 39:32:50,480
exemplu, numele mărcii, codul poștal și

53001
39:32:47,744 --> 39:32:53,664
gen. Datele ordinale pot fi aranjate în

53002
39:32:50,480 --> 39:32:57,024
ordonat sau clasat și poate fi comparat.

53003
39:32:53,664 --> 39:33:00,160
Exemplele includ note, recenzii cu stele,

53004
39:32:57,024 --> 39:33:02,640
poziția, cursa și data. Interval

53005
39:33:00,160 --> 39:33:05,104
data sunt datele care sunt comandate și au

53006
39:33:02,640 --> 39:33:08,480
diferențe semnificative între date

53007
39:33:05,104 --> 39:33:11,920
puncte. Exemplu de temperatură în Celsius

53008
39:33:08,480 --> 39:33:14,080
și anul nașterii. Datele raportului sunt similare

53009
39:33:11,920 --> 39:33:17,024
la nivelul intervalului cu adaosul

53010
39:33:14,080 --> 39:33:19,440
proprietatea zero inerent. Matematic

53011
39:33:17,024 --> 39:33:22,480
calculele pot fi efectuate pe ambele

53012
39:33:19,440 --> 39:33:25,664
date de interval, precum și de raport. Pentru

53013
39:33:22,480 --> 39:33:28,320
de exemplu, înălțimea, vârsta și greutatea.

53014
39:33:25,664 --> 39:33:30,560
Populație versus eșantion. Înainte

53015
39:33:28,320 --> 39:33:32,960
analizând datele, este important să

53016
39:33:30,560 --> 39:33:36,080
a afla dacă este dintr-o populație sau

53017
39:33:32,960 --> 39:33:38,800
o mostră. Populația este o colecție de

53018
39:33:36,080 --> 39:33:41,840
toate articolele disponibile, precum și fiecare unitate

53019
39:33:38,800 --> 39:33:44,240
în studiul nostru. Eșantionul este un subset al

53020
39:33:41,840 --> 39:33:47,520
populaţie care conţine doar câteva

53021
39:33:44,240 --> 39:33:50,080
unități ale populației. Date despre populație

53022
39:33:47,520 --> 39:33:52,560
este utilizat pentru studiu atunci când grupul de date este

53023
39:33:50,080 --> 39:33:55,104
foarte mic și poate oferi tot ceea ce este necesar

53024
39:33:52,560 --> 39:33:58,080
informaţii. Se recoltează probe

53025
39:33:55,104 --> 39:34:01,440
aleatoriu și reprezintă întregul

53026
39:33:58,080 --> 39:34:04,080
populația în cel mai bun mod posibil.

53027
39:34:01,440 --> 39:34:06,640
Măsuri de tendință centrală.

53028
39:34:04,080 --> 39:34:09,520
Tendința centrală este o singură valoare

53029
39:34:06,640 --> 39:34:12,560
care ajută la descrierea datelor

53030
39:34:09,520 --> 39:34:14,720
prin determinarea poziţiei sale centrale.

53031
39:34:12,560 --> 39:34:17,360
Măsurile de tendinţă centrală sunt

53032
39:34:14,720 --> 39:34:19,920
cunoscute uneori sub numele de statistici rezumative sau

53033
39:34:17,360 --> 39:34:22,080
măsuri de amplasare centrală.

53034
39:34:19,920 --> 39:34:26,240
Cele mai populare măsurători ale centralei

53035
39:34:22,080 --> 39:34:28,960
tendințele sunt medie, mediană și mod. The

53036
39:34:26,240 --> 39:34:31,600
distribuția normală este în formă de clopot

53037
39:34:28,960 --> 39:34:34,080
distribuție simetrică în care medie,

53038
39:34:31,600 --> 39:34:36,560
mediana și modul sunt toate egale. The

53039
39:34:34,080 --> 39:34:38,800
curba de aici arată în formă de clopot

53040
39:34:36,560 --> 39:34:41,744
curba sau distribuția normală a

53041
39:34:38,800 --> 39:34:45,024
variabila X. Punctul de aici, adică

53042
39:34:41,744 --> 39:34:47,104
X1 este punctul care reprezintă

53043
39:34:45,024 --> 39:34:50,640
medie, mediană și modul acesteia

53044
39:34:47,104 --> 39:34:53,840
distributie. Media medie este calculată prin

53045
39:34:50,640 --> 39:34:57,024
împărțind aceste sume a tuturor valorilor datelor la

53046
39:34:53,840 --> 39:34:59,360
numărul total de valori ale datelor. Se ajunge

53047
39:34:57,024 --> 39:35:02,384
afectate atunci când sunt neobișnuite sau

53048
39:34:59,360 --> 39:35:05,520
valori extreme. Este sensibil la

53049
39:35:02,384 --> 39:35:08,560
valori aberante. Media poate fi calculată ca

53050
39:35:05,520 --> 39:35:10,480
însumarea tuturor valorilor lui X din a

53051
39:35:08,560 --> 39:35:12,080
colecție împărțită la dimensiunea

53052
39:35:10,480 --> 39:35:14,640
colectare.

53053
39:35:12,080 --> 39:35:20,640
De exemplu, avem o colecție unde

53054
39:35:14,640 --> 39:35:22,800
avem valori ca 7 3 4 1 6 și 7.

53055
39:35:20,640 --> 39:35:26,160
Aflam suma acestor valori

53056
39:35:22,800 --> 39:35:30,800
care este 28 și sunt în total șase

53057
39:35:26,160 --> 39:35:33,664
valorile. Deci 28 / 6 ne oferă o valoare medie

53058
39:35:30,800 --> 39:35:35,280
de 4,66.

53059
39:35:33,664 --> 39:35:37,440
mediană,

53060
39:35:35,280 --> 39:35:39,600
este valoarea de mijloc în setul de

53061
39:35:37,440 --> 39:35:41,024
date care au fost sortate crescător

53062
39:35:39,600 --> 39:35:43,440
comanda.

53063
39:35:41,024 --> 39:35:46,080
Este o alternativă mai bună pentru a însemna de atunci

53064
39:35:43,440 --> 39:35:47,664
este mai puțin afectată de valori aberante și

53065
39:35:46,080 --> 39:35:50,000
deformat.

53066
39:35:47,664 --> 39:35:51,664
Este mai aproape de centrala actuală

53067
39:35:50,000 --> 39:35:54,000
valoare.

53068
39:35:51,664 --> 39:35:56,560
Mediana este calculată diferit pentru

53069
39:35:54,000 --> 39:35:58,880
diferite dimensiuni de date.

53070
39:35:56,560 --> 39:36:02,640
Diferențiat ca și cum numărul total de

53071
39:35:58,880 --> 39:36:05,664
valorile sunt impare sau dacă numărul total de

53072
39:36:02,640 --> 39:36:09,920
valorile sunt egale. Dacă dimensiunea datelor

53073
39:36:05,664 --> 39:36:12,960
este ciudat. De exemplu, în acest caz noi

53074
39:36:09,920 --> 39:36:15,600
au cinci elemente.

53075
39:36:12,960 --> 39:36:17,200
După ce sortăm orice valoare medie am

53076
39:36:15,600 --> 39:36:22,384
obţine

53077
39:36:17,200 --> 39:36:25,840
asta înseamnă n termen de 1 cu 2 în acest caz

53078
39:36:22,384 --> 39:36:28,720
5 1 / 2

53079
39:36:25,840 --> 39:36:31,200
acesta este al treilea termen care este patru este

53080
39:36:28,720 --> 39:36:33,600
valoarea mediană.

53081
39:36:31,200 --> 39:36:37,360
În cazul în care numărul total de valori

53082
39:36:33,600 --> 39:36:39,280
este chiar ca și cum aici există șase valori.

53083
39:36:37,360 --> 39:36:41,600
Media sau media celor două

53084
39:36:39,280 --> 39:36:44,640
valorile centrale este considerată drept cea

53085
39:36:41,600 --> 39:36:50,000
mediană. În acest caz, mediana este

53086
39:36:44,640 --> 39:36:52,480
media de 6 și patru care este cinci. Modul.

53087
39:36:50,000 --> 39:36:55,840
Modul reprezintă cea mai comună valoare în

53088
39:36:52,480 --> 39:36:59,024
setul de date. Nu este deloc afectat

53089
39:36:55,840 --> 39:37:01,024
prin observatii extreme.

53090
39:36:59,024 --> 39:37:04,160
Este cea mai bună măsură a centralului

53091
39:37:01,024 --> 39:37:05,744
tendința de a fi extrem de distorsionate sau nenormale

53092
39:37:04,160 --> 39:37:08,320
distributie.

53093
39:37:05,744 --> 39:37:10,640
Se determină modul pentru datele categorice

53094
39:37:08,320 --> 39:37:12,160
prin estimarea frecvenţelor pentru fiecare

53095
39:37:10,640 --> 39:37:14,240
categorii

53096
39:37:12,160 --> 39:37:17,840
iar apoi categoria cu cea mai mare

53097
39:37:14,240 --> 39:37:20,240
frecvența este considerată a fi mod.

53098
39:37:17,840 --> 39:37:22,800
Ca și în acest caz, 7 are cea mai mare

53099
39:37:20,240 --> 39:37:26,160
frecventa. Prin urmare, șapte devine modul

53100
39:37:22,800 --> 39:37:28,720
valoare. Cu toate acestea, în caz de continuu

53101
39:37:26,160 --> 39:37:30,640
date sau date cantitative, the

53102
39:37:28,720 --> 39:37:33,200
calculul modului este ușor

53103
39:37:30,640 --> 39:37:35,600
diferite. Primul pas în calcul

53104
39:37:33,200 --> 39:37:37,920
de mod este împărțirea datelor în

53105
39:37:35,600 --> 39:37:39,840
clase care sunt egale cu atunci

53106
39:37:37,920 --> 39:37:42,720
obținerea frecvenței punctelor de date

53107
39:37:39,840 --> 39:37:45,024
aflate în acea gamă de clase

53108
39:37:42,720 --> 39:37:48,160
iar în final selectând clasa cu

53109
39:37:45,024 --> 39:37:50,160
cea mai mare frecvență.

53110
39:37:48,160 --> 39:37:52,640
Folosind intervalul clasei respective și

53111
39:37:50,160 --> 39:37:54,880
frecvențe, putem obține modul final

53112
39:37:52,640 --> 39:37:58,320
valoare.

53113
39:37:54,880 --> 39:38:02,240
Folosind formula L 

53114
39:37:58,320 --> 39:38:06,880
minus F_sub_1 înmulțit la H / FM minus

53115
39:38:02,240 --> 39:38:09,744
F_sub_1 plus FM minus F_sub_2.

53116
39:38:06,880 --> 39:38:12,560
Aici L este limita inferioară sau limita inferioară

53117
39:38:09,744 --> 39:38:16,720
observarea clasei de mod.

53118
39:38:12,560 --> 39:38:19,840
H este dimensiunea clasei de mod.

53119
39:38:16,720 --> 39:38:22,080
FM este frecvența clasei de mod.

53120
39:38:19,840 --> 39:38:25,520
F_sub_1 este frecvența clasei

53121
39:38:22,080 --> 39:38:28,000
trecerea la modul și F_sub_2 este

53122
39:38:25,520 --> 39:38:30,384
frecvența clasei care reușește

53123
39:38:28,000 --> 39:38:32,160
modul. Aceasta ne oferă modul final

53124
39:38:30,384 --> 39:38:35,104
valoare,

53125
39:38:32,160 --> 39:38:37,024
medie versus așteptare.

53126
39:38:35,104 --> 39:38:38,640
Acum să vorbim despre medie versus

53127
39:38:37,024 --> 39:38:41,520
așteptare.

53128
39:38:38,640 --> 39:38:44,640
Deci, în general, folosim valoarea așteptată

53129
39:38:41,520 --> 39:38:47,664
sau așteptarea când vrem să calculăm

53130
39:38:44,640 --> 39:38:50,080
media unei distribuții de probabilitate

53131
39:38:47,664 --> 39:38:52,384
care reprezintă valoarea medie noi

53132
39:38:50,080 --> 39:38:55,840
așteptați să apară înainte de a colecta vreuna

53133
39:38:52,384 --> 39:38:58,320
date. Și pe de altă parte, mediul este

53134
39:38:55,840 --> 39:39:01,440
folosit practic atunci când vrem să calculăm

53135
39:38:58,320 --> 39:39:04,000
valoarea medie a unui eșantion dat.

53136
39:39:01,440 --> 39:39:07,664
Aceasta reprezintă valoarea medie a brutului

53137
39:39:04,000 --> 39:39:10,240
date pe care este posibil să le fi colectat deja.

53138
39:39:07,664 --> 39:39:12,480
Putem înțelege acest lucru folosind un simplu

53139
39:39:10,240 --> 39:39:15,360
exemplu.

53140
39:39:12,480 --> 39:39:18,000
Acum să calculăm valoarea așteptată a

53141
39:39:15,360 --> 39:39:20,560
această distribuție de probabilitate, putem

53142
39:39:18,000 --> 39:39:22,080
utilizați o formulă specifică din cea precedentă

53143
39:39:20,560 --> 39:39:24,560
discuție.

53144
39:39:22,080 --> 39:39:27,360
Aceasta va fi valoarea așteptată

53145
39:39:24,560 --> 39:39:32,160
unde X va fi valoarea datelor

53146
39:39:27,360 --> 39:39:34,480
iar acest PX este probabilitatea valorii.

53147
39:39:32,160 --> 39:39:36,720
De exemplu, am putea calcula

53148
39:39:34,480 --> 39:39:41,000
valoarea aşteptată pentru această probabilitate

53149
39:39:36,720 --> 39:39:41,000
distribuția să fie așa cum se arată.

53150
39:39:41,024 --> 39:39:48,560
Deci aici vor fi 1,45 goluri.

53151
39:39:46,384 --> 39:39:50,960
Deci acesta reprezintă numărul așteptat

53152
39:39:48,560 --> 39:39:53,520
de goluri pe care echipa le va înscrie în oricare

53153
39:39:50,960 --> 39:39:55,744
joc dat.

53154
39:39:53,520 --> 39:39:58,560
Și atunci dacă vorbești despre calcul

53155
39:39:55,744 --> 39:40:00,720
medie, deci calculăm de obicei media

53156
39:39:58,560 --> 39:40:03,360
după ce am adunat efectiv crud

53157
39:40:00,720 --> 39:40:05,664
date.

53158
39:40:03,360 --> 39:40:07,664
De exemplu, să presupunem că înregistrăm

53159
39:40:05,664 --> 39:40:12,280
numărul de goluri pe care le va face o echipă de fotbal

53160
39:40:07,664 --> 39:40:12,280
scor în 15 jocuri diferite.

53161
39:40:12,560 --> 39:40:17,280
Acum să calculăm numărul mediu de

53162
39:40:14,480 --> 39:40:20,880
goluri marcate pe meci,

53163
39:40:17,280 --> 39:40:23,440
putem folosi următoarea formulă

53164
39:40:20,880 --> 39:40:26,000
unde suma lui x este practic suma lui

53165
39:40:23,440 --> 39:40:27,920
toate obiectivele împărțite la n și

53166
39:40:26,000 --> 39:40:30,880
număr de înregistrări sau putem spune că

53167
39:40:27,920 --> 39:40:35,384
dimensiunea eșantionului.

53168
39:40:30,880 --> 39:40:35,384
Este așa cum se arată pe ecran.

53169
39:40:48,080 --> 39:40:53,920
Deci acesta reprezintă numărul mediu de

53170
39:40:50,160 --> 39:40:56,240
goluri marcate pe meci de echipă.

53171
39:40:53,920 --> 39:40:57,840
Măsuri de asimetrie.

53172
39:40:56,240 --> 39:41:00,080
Diferența dintre cele trei

53173
39:40:57,840 --> 39:41:01,600
curbe distincte pot fi studiate în aceasta

53174
39:41:00,080 --> 39:41:04,160
imagine.

53175
39:41:01,600 --> 39:41:07,024
Curba centrală este normală sau nu

53176
39:41:04,160 --> 39:41:10,000
curbă neregulată. Aici înseamnă, mediană și

53177
39:41:07,024 --> 39:41:12,240
mod toate se află pe același punct. Aceasta

53178
39:41:10,000 --> 39:41:16,560
curba normală este simetrică față de ea

53179
39:41:12,240 --> 39:41:18,560
medie, mediană și mod.

53180
39:41:16,560 --> 39:41:20,800
Asta înseamnă partea stângă a

53181
39:41:18,560 --> 39:41:23,840
curba este o imagine în oglindă a dreptei

53182
39:41:20,800 --> 39:41:26,640
partea de mână a curbei.

53183
39:41:23,840 --> 39:41:30,160
Cu toate acestea, în caz de distorsiuni negative

53184
39:41:26,640 --> 39:41:32,000
date, coada este alungită în stânga

53185
39:41:30,160 --> 39:41:34,000
partea mâinii

53186
39:41:32,000 --> 39:41:37,360
iar media este mai mică decât modul

53187
39:41:34,000 --> 39:41:40,560
iar valorile mediane sau este în stânga

53188
39:41:37,360 --> 39:41:42,800
partea de mână a modului.

53189
39:41:40,560 --> 39:41:45,280
Prin urmare, indicând faptul că valorile aberante sunt

53190
39:41:42,800 --> 39:41:48,240
în direcția negativă.

53191
39:41:45,280 --> 39:41:50,800
Pe de altă parte, în caz de pozitiv

53192
39:41:48,240 --> 39:41:54,160
denaturate, datele sunt concentrate pe

53193
39:41:50,800 --> 39:41:56,800
partea stângă a curbei.

53194
39:41:54,160 --> 39:42:00,000
În timp ce coada este alungită sau mai lungă

53195
39:41:56,800 --> 39:42:02,080
partea dreaptă a curbei,

53196
39:42:00,000 --> 39:42:03,744
media este mai mare decât modul și

53197
39:42:02,080 --> 39:42:06,160
mediană

53198
39:42:03,744 --> 39:42:08,560
sau se află în partea dreaptă a modului

53199
39:42:06,160 --> 39:42:12,600
iar mediana indicând faptul că valorile aberante

53200
39:42:08,560 --> 39:42:12,600
sunt în direcția pozitivă.

53201
39:42:15,744 --> 39:42:20,960
Să luăm în considerare un exemplu.

53202
39:42:18,560 --> 39:42:25,440
Graficul de aici arată venitul global

53203
39:42:20,960 --> 39:42:28,384
repartizarea pentru anul 2003 2013 si

53204
39:42:25,440 --> 39:42:30,880
o proiecție pentru 2035.

53205
39:42:28,384 --> 39:42:34,480
Dacă vedem distribuția globală a venitului

53206
39:42:30,880 --> 39:42:37,440
statisticile pentru 2003 sunt foarte corecte

53207
39:42:34,480 --> 39:42:39,600
deformat.

53208
39:42:37,440 --> 39:42:43,104
Putem observa în graficul anterior

53209
39:42:39,600 --> 39:42:46,920
că în 2003

53210
39:42:43,104 --> 39:42:46,920
media de 3.451 USD

53211
39:42:48,000 --> 39:42:52,744
a fost mai mare decât mediana de 1090 USD.

53212
39:42:52,800 --> 39:42:57,840
Venitul global cu siguranță nu este

53213
39:42:55,104 --> 39:43:03,360
distribuite uniform. Majoritatea

53214
39:42:57,840 --> 39:43:05,360
oamenii câștigă mai puțin de 2.000 de dolari în fiecare an.

53215
39:43:03,360 --> 39:43:10,080
în timp ce doar un mic procent din

53216
39:43:05,360 --> 39:43:13,720
populația câștigă mai mult de 14.000 de dolari.

53217
39:43:10,080 --> 39:43:13,720
Măsuri de variabilitate.

53218
39:43:15,600 --> 39:43:20,080
Măsuri de variabilitate.

53219
39:43:17,840 --> 39:43:22,640
Dispersia. Măsura centrală

53220
39:43:20,080 --> 39:43:25,600
tendinţele oferă o singură valoare care

53221
39:43:22,640 --> 39:43:27,664
se adresează întregii valori. Cu toate acestea, cel

53222
39:43:25,600 --> 39:43:30,384
tendința centrală nu poate descrie

53223
39:43:27,664 --> 39:43:32,320
punct de vedere în întregime. Metrica a

53224
39:43:30,384 --> 39:43:35,440
dispersia ne ajută să ne concentrăm asupra

53225
39:43:32,320 --> 39:43:37,664
inconsecvență în răspândirea datelor.

53226
39:43:35,440 --> 39:43:40,800
Măsurile de dispersie descriu

53227
39:43:37,664 --> 39:43:43,664
răspândirea datelor.

53228
39:43:40,800 --> 39:43:46,480
Gama, gama intercortilă, standard

53229
39:43:43,664 --> 39:43:49,520
abaterea și varianța sunt exemple de

53230
39:43:46,480 --> 39:43:51,280
măsuri de dispersie.

53231
39:43:49,520 --> 39:43:53,200
Gamă.

53232
39:43:51,280 --> 39:43:55,200
Gama de distribuție este

53233
39:43:53,200 --> 39:43:58,560
diferența dintre cel mai mare și cel

53234
39:43:55,200 --> 39:44:01,024
cea mai mică cantitate de date.

53235
39:43:58,560 --> 39:44:04,960
Gama, de exemplu, nu include

53236
39:44:01,024 --> 39:44:07,024
toate aspectele pozitive dintr-o serie.

53237
39:44:04,960 --> 39:44:09,024
Se concentrează pe cele mai șocante

53238
39:44:07,024 --> 39:44:11,920
aspecte și ignoră care nu sunt

53239
39:44:09,024 --> 39:44:17,744
considerat critic. De exemplu, pentru a

53240
39:44:11,920 --> 39:44:22,160
set 13, 33, 45, 67, 70.

53241
39:44:17,744 --> 39:44:24,800
Intervalul este 57. Acesta este maximul de

53242
39:44:22,160 --> 39:44:28,960
aceasta care este 70 minus minimul peste

53243
39:44:24,800 --> 39:44:31,440
aici care este 13.

53244
39:44:28,960 --> 39:44:33,744
Varianta.

53245
39:44:31,440 --> 39:44:36,160
Varianta este media tuturor pătratului

53246
39:44:33,744 --> 39:44:38,640
abaterile.

53247
39:44:36,160 --> 39:44:41,104
Este definit ca suma pătratului

53248
39:44:38,640 --> 39:44:44,640
distanța dintre fiecare punct și medie

53249
39:44:41,104 --> 39:44:46,960
sau dispersia în jurul mediei.

53250
39:44:44,640 --> 39:44:51,360
Abaterea standard este utilizată ca

53251
39:44:46,960 --> 39:44:51,360
varianța suferă de o diferență unitară.

53252
39:44:51,664 --> 39:44:58,080
Varianta poate fi calculată ca pătrat sigma

53253
39:44:54,240 --> 39:45:00,320
însumarea peste x - mu^ 2

53254
39:44:58,080 --> 39:45:03,920
împărțit la n

53255
39:45:00,320 --> 39:45:06,960
unde mu este media datelor, x este

53256
39:45:03,920 --> 39:45:11,104
punctul de date individual

53257
39:45:06,960 --> 39:45:13,520
iar n este dimensiunea datelor.

53258
39:45:11,104 --> 39:45:15,920
Această reprezentare este pentru o populație

53259
39:45:13,520 --> 39:45:18,000
date.

53260
39:45:15,920 --> 39:45:20,800
Pentru un eșantion de date variația poate fi

53261
39:45:18,000 --> 39:45:23,744
calculat ca X minus

53262
39:45:20,800 --> 39:45:27,600
Xar însumarea întregului pătrat

53263
39:45:23,744 --> 39:45:30,080
peste el împărțit la n minus unu.

53264
39:45:27,600 --> 39:45:34,960
Aici Xbar este media acestor mostre

53265
39:45:30,080 --> 39:45:37,840
date și n este dimensiunea eșantionului.

53266
39:45:34,960 --> 39:45:39,360
Unitățile de valori și varianța nu sunt

53267
39:45:37,840 --> 39:45:43,840
egale.

53268
39:45:39,360 --> 39:45:47,024
Deci, este utilizată o altă măsură de variabilitate.

53269
39:45:43,840 --> 39:45:49,920
Abaterea standard.

53270
39:45:47,024 --> 39:45:51,520
Abaterea standard este un termen statistic

53271
39:45:49,920 --> 39:45:56,720
folosit pentru a măsura cantitatea de

53272
39:45:51,520 --> 39:45:59,200
variabilitate sau dispersie în jurul unei medii.

53273
39:45:56,720 --> 39:46:02,384
Abaterea standard este calculată ca

53274
39:45:59,200 --> 39:46:05,024
rădăcina pătrată a varianței. Ea descrie

53275
39:46:02,384 --> 39:46:08,960
concentrarea datelor în jurul

53276
39:46:05,024 --> 39:46:11,024
media setului de date.

53277
39:46:08,960 --> 39:46:13,520
Abaterea standard așa cum este indicat

53278
39:46:11,024 --> 39:46:15,744
anterior poate fi calculat ca pătrat

53279
39:46:13,520 --> 39:46:18,384
rădăcina varianței

53280
39:46:15,744 --> 39:46:21,440
pentru o dată de populație. Standard

53281
39:46:18,384 --> 39:46:24,320
abaterea sigma poate fi calculată ca

53282
39:46:21,440 --> 39:46:28,800
rădăcină pătrată a însumării peste x i minus

53283
39:46:24,320 --> 39:46:32,160
mu^ pătrat / n

53284
39:46:28,800 --> 39:46:35,664
unde mu este media datelor x i sunt

53285
39:46:32,160 --> 39:46:38,480
punctele de date și n este dimensiunea. Să

53286
39:46:35,664 --> 39:46:41,024
luați în considerare un exemplu.

53287
39:46:38,480 --> 39:46:44,000
Să aflăm media, varianța și

53288
39:46:41,024 --> 39:46:49,104
abatere standard pentru aceste date. The

53289
39:46:44,000 --> 39:46:51,664
valorile datelor sunt trei, 5, 6, 9 și 10.

53290
39:46:49,104 --> 39:46:55,024
Pentru a afla media, mai întâi găsim

53291
39:46:51,664 --> 39:46:58,000
suma tuturor acestor valori de date

53292
39:46:55,024 --> 39:47:01,280
adică 33 și împărțiți-l la număr,

53293
39:46:58,000 --> 39:47:04,640
care este cinci.

53294
39:47:01,280 --> 39:47:07,280
Obținem media de 6,6. Pentru a calcula

53295
39:47:04,640 --> 39:47:08,960
varianță, începem prin a calcula

53296
39:47:07,280 --> 39:47:12,560
abatere.

53297
39:47:08,960 --> 39:47:14,800
Adică X minus media lui X. Aici

53298
39:47:12,560 --> 39:47:18,880
trei este una dintre valorile datelor

53299
39:47:14,800 --> 39:47:24,080
iar 6,6 este media.

53300
39:47:18,880 --> 39:47:26,384
Deci 3 - 6,6 pătrat și facem asta

53301
39:47:24,080 --> 39:47:29,024
pentru a afla suma tuturor abaterilor

53302
39:47:26,384 --> 39:47:31,200
împărțit la numărătoare

53303
39:47:29,024 --> 39:47:33,744
care este cinci.

53304
39:47:31,200 --> 39:47:36,744
ajungem să obținem o variație generală de

53305
39:47:33,744 --> 39:47:36,744
6,64.

53306
39:47:37,520 --> 39:47:42,800
Abaterea standard, așa cum știm

53307
39:47:39,920 --> 39:47:46,000
măsurată la rădăcina pătrată a varianţei care

53308
39:47:42,800 --> 39:47:49,960
este pătrat<unk> de 6,64

53309
39:47:46,000 --> 39:47:49,960
care se ridică la 2.576.

53310
39:47:50,320 --> 39:47:56,640
Măsuri de relație.

53311
39:47:53,360 --> 39:47:58,800
Măsuri de relație. Coarianță.

53312
39:47:56,640 --> 39:48:01,920
Coarianța este măsura articulației

53313
39:47:58,800 --> 39:48:03,744
variabilitatea a două variabile.

53314
39:48:01,920 --> 39:48:06,720
Măsoară direcția

53315
39:48:03,744 --> 39:48:08,880
relația dintre variabile. Ea

53316
39:48:06,720 --> 39:48:13,104
determină dacă o variabilă va cauza

53317
39:48:08,880 --> 39:48:16,880
celălalt să se modifice în același mod.

53318
39:48:13,104 --> 39:48:19,104
Coarianța dintre variabilele X și Y poate

53319
39:48:16,880 --> 39:48:22,720
fi calculată ca însumare peste

53320
39:48:19,104 --> 39:48:26,080
produsul X I - XR

53321
39:48:22,720 --> 39:48:29,024
și Y I - Y bară întregul împărțit la N

53322
39:48:26,080 --> 39:48:32,560
minus unu.

53323
39:48:29,024 --> 39:48:36,000
Aici Xar și Y bar sunt media lui X și

53324
39:48:32,560 --> 39:48:38,720
Y respectiv. Valoarea covarianței

53325
39:48:36,000 --> 39:48:41,600
poate varia de la minus infinit la un plus

53326
39:48:38,720 --> 39:48:43,104
infinit.

53327
39:48:41,600 --> 39:48:47,720
Corelaţie.

53328
39:48:43,104 --> 39:48:47,720
Corelația este coarianța normalizată.

53329
39:48:47,744 --> 39:48:52,880
Măsoară puterea asocierii

53330
39:48:50,240 --> 39:48:55,104
între două variabile. Cel mai comun

53331
39:48:52,880 --> 39:48:57,664
măsura de corelare este Pearson

53332
39:48:55,104 --> 39:49:01,200
coeficient de corelație.

53333
39:48:57,664 --> 39:49:03,744
Corelația între două variabile

53334
39:49:01,200 --> 39:49:07,744
X și Y pot fi măsurate în raport cu

53335
39:49:03,744 --> 39:49:10,160
coarianța ca coarianță între X

53336
39:49:07,744 --> 39:49:14,800
și Y împărțit la abaterea standard

53337
39:49:10,160 --> 39:49:17,360
a lui X și abaterea standard a lui Y.

53338
39:49:14,800 --> 39:49:21,104
Valoarea corelației variază de la a

53339
39:49:17,360 --> 39:49:24,744
negativ 1 la pozitiv 1.

53340
39:49:21,104 --> 39:49:24,744
Tipuri de corelație.

53341
39:49:24,960 --> 39:49:28,960
Corelația poate fi fie pozitivă

53342
39:49:27,104 --> 39:49:31,280
corelație,

53343
39:49:28,960 --> 39:49:34,280
corelație zero sau negativă

53344
39:49:31,280 --> 39:49:34,280
corelație.

53345
39:49:35,104 --> 39:49:41,360
Prima poză de aici reprezintă a

53346
39:49:37,840 --> 39:49:43,600
corelație pozitivă perfectă

53347
39:49:41,360 --> 39:49:45,280
în care o linie dreaptă cu un pozitiv

53348
39:49:43,600 --> 39:49:47,520
panta

53349
39:49:45,280 --> 39:49:50,480
reprezintă relația dintre

53350
39:49:47,520 --> 39:49:52,640
cele două variabile.

53351
39:49:50,480 --> 39:49:54,480
Corelația zero înseamnă că linia

53352
39:49:52,640 --> 39:49:57,200
reprezentând relaţia dintre

53353
39:49:54,480 --> 39:50:00,200
cele două variabile este orizontală față de

53354
39:49:57,200 --> 39:50:00,200
xaxis.

53355
39:50:00,880 --> 39:50:05,200
Corelația negativă perfectă poate fi

53356
39:50:02,960 --> 39:50:08,480
reprezentată printr-o linie dreaptă cu a

53357
39:50:05,200 --> 39:50:11,200
panta negativa.

53358
39:50:08,480 --> 39:50:14,080
Corelația egală cu 1 implică a

53359
39:50:11,200 --> 39:50:16,480
relație pozitivă. Atunci unul

53360
39:50:14,080 --> 39:50:19,600
variabila mărește cealaltă variabilă

53361
39:50:16,480 --> 39:50:21,664
crește de asemenea. O valoare de corelație a

53362
39:50:19,600 --> 39:50:24,640
negativ 1 implică un negativ

53363
39:50:21,664 --> 39:50:28,744
relație. Atunci o variabilă

53364
39:50:24,640 --> 39:50:28,744
crește celelalte scade.

53365
39:50:28,800 --> 39:50:33,440
Coeficientul de corelație de zero

53366
39:50:31,024 --> 39:50:36,384
arată că variabilele sunt complet

53367
39:50:33,440 --> 39:50:40,360
independente unele de altele.

53368
39:50:36,384 --> 39:50:40,360
Să luăm în considerare un exemplu.

53369
39:50:40,480 --> 39:50:46,024
Aici avem două variabile înălțime și

53370
39:50:43,024 --> 39:50:46,024
greutate.

53371
39:50:46,320 --> 39:50:50,560
Pentru a calcula corelația dintre

53372
39:50:48,080 --> 39:50:52,800
inaltime si greutate,

53373
39:50:50,560 --> 39:50:55,360
folosim formula de corelare ca

53374
39:50:52,800 --> 39:50:58,384
covarianța lui X

53375
39:50:55,360 --> 39:51:01,840
și Y împărțit la deviația standard a lui X

53376
39:50:58,384 --> 39:51:04,320
și abaterea standard a lui Y.

53377
39:51:01,840 --> 39:51:07,600
Aici înălțimea este variabila X și greutatea

53378
39:51:04,320 --> 39:51:10,240
este variabila Y.

53379
39:51:07,600 --> 39:51:14,960
Mai întâi pentru a calcula coarianța, calculăm

53380
39:51:10,240 --> 39:51:18,240
valorile barelor x - xar și y - y și

53381
39:51:14,960 --> 39:51:23,000
apoi produsul lor.

53382
39:51:18,240 --> 39:51:23,000
Apoi calculăm x - xr²

53383
39:51:23,024 --> 39:51:28,640
și y - y bară valori pătrate de calculat

53384
39:51:26,384 --> 39:51:31,744
abaterile standard de înălţime şi

53385
39:51:28,640 --> 39:51:34,960
respectiv greutate. Corelație ca și noi

53386
39:51:31,744 --> 39:51:37,840
know a fost definit ca covarianță a lui x

53387
39:51:34,960 --> 39:51:41,920
iar i și y împărțiți la standard

53388
39:51:37,840 --> 39:51:43,840
abaterile lui x și y.

53389
39:51:41,920 --> 39:51:48,240
Aceasta poate fi reprezentată și ca

53390
39:51:43,840 --> 39:51:50,160
însumarea peste x - xr înmulțit la y -

53391
39:51:48,240 --> 39:51:52,720
y bar

53392
39:51:50,160 --> 39:51:55,200
împărțit la rădăcina pătrată a însumării peste

53393
39:51:52,720 --> 39:51:58,960
suma abaterilor pătrate

53394
39:51:55,200 --> 39:52:02,320
adică x - xr pătrat înmulțit la

53395
39:51:58,960 --> 39:52:05,200
rădăcină pătrată a însumării peste y - yar

53396
39:52:02,320 --> 39:52:08,800
întreg pătrat care este suma pătratului

53397
39:52:05,200 --> 39:52:11,280
abateri pentru y.

53398
39:52:08,800 --> 39:52:14,520
Acum să aflăm valorile în care să le punem

53399
39:52:11,280 --> 39:52:14,520
această formulă.

53400
39:52:14,800 --> 39:52:20,160
Mai întâi aflăm suma totală a

53401
39:52:17,600 --> 39:52:22,320
înălțime pentru a obține media înălțimii care

53402
39:52:20,160 --> 39:52:24,560
este 5,14.

53403
39:52:22,320 --> 39:52:27,664
În mod similar, obținem suma greutății la

53404
39:52:24,560 --> 39:52:31,280
obținem media greutății ca 50. Acum obținem

53405
39:52:27,664 --> 39:52:34,160
însumarea peste x - xr înmulțită la

53406
39:52:31,280 --> 39:52:38,240
y - y bar pentru a obține numărătorul pentru

53407
39:52:34,160 --> 39:52:40,240
formula. Apoi calculăm x - xr pătrat

53408
39:52:38,240 --> 39:52:43,920
însumare

53409
39:52:40,240 --> 39:52:46,800
și y - y bar pătrat care este suma de

53410
39:52:43,920 --> 39:52:48,320
abaterea pătrată a lui x și y

53411
39:52:46,800 --> 39:52:50,480
respectiv.

53412
39:52:48,320 --> 39:52:52,960
Acum punem valorile în această finală

53413
39:52:50,480 --> 39:52:56,664
formula de corelare pentru a obține o corelație

53414
39:52:52,960 --> 39:52:56,664
valoare de 0,889.

53415
39:52:57,840 --> 39:53:02,720
Aceasta indică faptul că înălțimea și greutatea

53416
39:52:59,920 --> 39:53:05,104
au o relație pozitivă.

53417
39:53:02,720 --> 39:53:08,840
Este evident că pe măsură ce înălțimea crește,

53418
39:53:05,104 --> 39:53:08,840
creste si greutatea.

53419
39:53:09,024 --> 39:53:14,960
În acest modul, vom vorbi despre

53420
39:53:11,520 --> 39:53:17,664
așteptări și variații.

53421
39:53:14,960 --> 39:53:20,080
Deci valoarea așteptată sau putem spune că înseamnă

53422
39:53:17,664 --> 39:53:22,960
a unei variabile date pe care o putem nota

53423
39:53:20,080 --> 39:53:25,280
prin X este o variabilă aleatoare discretă unde

53424
39:53:22,960 --> 39:53:28,560
este o medie ponderată a posibilului

53425
39:53:25,280 --> 39:53:30,720
valorile pe care X le poate lua și fiecare valoare este

53426
39:53:28,560 --> 39:53:34,080
va fi conform probabilității

53427
39:53:30,720 --> 39:53:36,880
a evenimentului specific care are loc.

53428
39:53:34,080 --> 39:53:40,160
Deci, de obicei, valoarea așteptată a lui X este

53429
39:53:36,880 --> 39:53:42,800
notat printr-o formulă simplă unde putem

53430
39:53:40,160 --> 39:53:45,280
definiți așteptările pe baza X

53431
39:53:42,800 --> 39:53:47,360
parametrul.

53432
39:53:45,280 --> 39:53:49,600
care va fi suma fiecăruia

53433
39:53:47,360 --> 39:53:53,920
rezultat posibil înmulțit cu

53434
39:53:49,600 --> 39:53:56,000
probabilitatea producerii rezultatului.

53435
39:53:53,920 --> 39:53:58,240
Deci, în termeni mai concreti,

53436
39:53:56,000 --> 39:54:00,240
așteptarea este ceea ce ne-am aștepta

53437
39:53:58,240 --> 39:54:03,240
rezultatul unui experiment care urmează să fie efectuat

53438
39:54:00,240 --> 39:54:03,240
medie.

53439
39:54:04,160 --> 39:54:10,800
Putem lua un exemplu pentru monedă. Dacă

53440
39:54:07,280 --> 39:54:13,360
atunci o monedă este aruncată de 10 ori

53441
39:54:10,800 --> 39:54:16,600
unul este cel mai probabil să obțină cinci capete și

53442
39:54:13,360 --> 39:54:16,600
cinci cozi.

53443
39:54:16,880 --> 39:54:22,384
Aceeași logică poate fi discutată dacă vorbim

53444
39:54:19,440 --> 39:54:24,640
despre un alt exemplu de aruncare a unui zar.

53445
39:54:22,384 --> 39:54:28,880
Deci, există șase rezultate posibile când

53446
39:54:24,640 --> 39:54:31,840
arunci un zar 1 2 3 4 5 6. Și fiecare

53447
39:54:28,880 --> 39:54:34,320
dintre acestea are o probabilitate de 1 cu 6 de

53448
39:54:31,840 --> 39:54:36,960
care se produce. Deci putem spune că

53449
39:54:34,320 --> 39:54:39,200
așteptarea va fi înmulțită cu 1

53450
39:54:36,960 --> 39:54:44,800
după probabilitatea ca acest lucru să se întâmple

53451
39:54:39,200 --> 39:54:50,560
care va fi 1x 6 2x 6 3x 6

53452
39:54:44,800 --> 39:54:53,920
  4x 6 5x 6 6x 6 și asta merge

53453
39:54:50,560 --> 39:54:57,104
pentru a ne oferi 3,5 ca rezultat. The

53454
39:54:53,920 --> 39:55:00,480
valoarea estimată este 3,5.

53455
39:54:57,104 --> 39:55:02,560
Deci, dacă vă gândiți bine, 3,5 este jumătate

53456
39:55:00,480 --> 39:55:05,024
între valorile posibile pe care le pot

53457
39:55:02,560 --> 39:55:06,640
luați și asta ar trebui să avem

53458
39:55:05,024 --> 39:55:08,720
aşteptat.

53459
39:55:06,640 --> 39:55:11,440
În continuare vorbim despre conceptul de

53460
39:55:08,720 --> 39:55:13,840
varianţă. Deci variația unui aleatoriu

53461
39:55:11,440 --> 39:55:16,080
variabila ne permite sa stim ceva

53462
39:55:13,840 --> 39:55:19,200
despre răspândirea valorilor posibile

53463
39:55:16,080 --> 39:55:22,320
a variabilei. Deci pentru un discret

53464
39:55:19,200 --> 39:55:24,720
variabila aleatoare X varianțele lui X este

53465
39:55:22,320 --> 39:55:27,744
urmând a fi notat cu ajutorul unui simplu

53466
39:55:24,720 --> 39:55:31,104
formula care va fi var=

53467
39:55:27,744 --> 39:55:33,440
E X - M întregul pătrat unde M este

53468
39:55:31,104 --> 39:55:36,480
practic valoarea aşteptată a

53469
39:55:33,440 --> 39:55:39,024
așteptarea lui X. Deci aceasta seamănă mai mult cu a

53470
39:55:36,480 --> 39:55:42,240
abaterea standard a lui X care poate de asemenea

53471
39:55:39,024 --> 39:55:44,560
fi reprezentat prin utilizarea acestei formule. Deci

53472
39:55:42,240 --> 39:55:47,744
varianţa nu se comportă la fel

53473
39:55:44,560 --> 39:55:52,520
fel ca așteptare când ne înmulțim și

53474
39:55:47,744 --> 39:55:52,520
adăugați constante la variabile aleatoare.

53475
39:55:52,560 --> 39:55:56,800
Deci acum există două tipuri diferite de

53476
39:55:54,800 --> 39:55:59,664
variație pe care o putem avea un târg

53477
39:55:56,800 --> 39:56:02,000
înţelegere pe. În primul rând avem

53478
39:55:59,664 --> 39:56:04,080
varianță scăzută și atunci avem mare

53479
39:56:02,000 --> 39:56:06,960
varianţă.

53480
39:56:04,080 --> 39:56:09,520
Deci, variația scăzută înseamnă pur și simplu că acolo

53481
39:56:06,960 --> 39:56:12,240
este o mică variație în producție

53482
39:56:09,520 --> 39:56:14,480
a funcției țintă cu modificări în

53483
39:56:12,240 --> 39:56:17,440
setul de date de tranzacționare și în același timp

53484
39:56:14,480 --> 39:56:20,240
variație mare în timp, așa cum putem vedea aici

53485
39:56:17,440 --> 39:56:22,640
varianța mare arată o variație mare în

53486
39:56:20,240 --> 39:56:25,360
predicţia funcţiei ţintă cu

53487
39:56:22,640 --> 39:56:27,440
modificări ale setului de date de tranzacționare. Deci a

53488
39:56:25,360 --> 39:56:29,664
modelul care arată o varianță mare învață a

53489
39:56:27,440 --> 39:56:32,480
mult și să performeze bine cu antrenamentul

53490
39:56:29,664 --> 39:56:35,440
set de date și nu se generalizează bine

53491
39:56:32,480 --> 39:56:38,000
cu setul de date nevăzut și de aceea

53492
39:56:35,440 --> 39:56:40,560
ca urmare un astfel de model dă bine

53493
39:56:38,000 --> 39:56:43,440
rezultate cu setul de date de antrenament, dar arată

53494
39:56:40,560 --> 39:56:45,440
rate mari de eroare pe setul de date de testare

53495
39:56:43,440 --> 39:56:48,160
iar din moment ce varianţa mare un model

53496
39:56:45,440 --> 39:56:51,200
învață prea multe din setul de date

53497
39:56:48,160 --> 39:56:53,200
duce la o supraadaptare a modelului. Deci

53498
39:56:51,200 --> 39:56:55,280
modelul cu varianță mare va avea

53499
39:56:53,200 --> 39:56:57,920
câteva probleme la care poate duce

53500
39:56:55,280 --> 39:57:01,880
supraadaptare sau poate duce și la

53501
39:56:57,920 --> 39:57:01,880
creșterea complexității modelului.

53502
39:57:02,080 --> 39:57:08,720
În continuare avem skewes.

53503
39:57:05,664 --> 39:57:10,640
Deci, în termeni simpli, este, în principiu, asimetrie

53504
39:57:08,720 --> 39:57:13,360
o măsură a asimetriei a

53505
39:57:10,640 --> 39:57:15,600
distributie. Deci distribuția este

53506
39:57:13,360 --> 39:57:18,640
asimetric atunci când este stânga și dreapta

53507
39:57:15,600 --> 39:57:21,520
laturile nu sunt imaginile în oglindă.

53508
39:57:18,640 --> 39:57:23,840
Momentan aceasta este o imagine în oglindă și a

53509
39:57:21,520 --> 39:57:26,384
distribuţia poate avea drept pozitiv sau

53510
39:57:23,840 --> 39:57:29,384
putem spune negativ sau poate avea zero

53511
39:57:26,384 --> 39:57:29,384
deformat.

53512
39:57:29,744 --> 39:57:34,560
Deci corectă în acest scenariu este

53513
39:57:32,160 --> 39:57:37,360
practic distribuția este mai lungă

53514
39:57:34,560 --> 39:57:39,840
partea dreaptă a vârfului său

53515
39:57:37,360 --> 39:57:42,160
și o distribuție oblică la stânga va avea loc

53516
39:57:39,840 --> 39:57:44,640
fie putem spune unde este mai lung pe

53517
39:57:42,160 --> 39:57:46,960
partea stângă.

53518
39:57:44,640 --> 39:57:49,600
Deci putem vedea că îl avem pe acesta ca parte

53519
39:57:46,960 --> 39:57:52,160
din partea dreaptă. Este mai alungit

53520
39:57:49,600 --> 39:57:55,104
spre partea dreaptă și acesta este

53521
39:57:52,160 --> 39:57:57,104
mai alungit spre partea stângă. Deci

53522
39:57:55,104 --> 39:58:00,480
ne putem gândi la skewes în termeni de

53523
39:57:57,104 --> 39:58:03,280
cozi. O coadă este falsificare lungă și

53524
39:58:00,480 --> 39:58:05,600
sfârşitul unei distribuţii. Deci pur și simplu

53525
39:58:03,280 --> 39:58:07,744
indică faptul că sunt observații la

53526
39:58:05,600 --> 39:58:10,480
un capăt al distribuţiei dar că

53527
39:58:07,744 --> 39:58:13,104
sunt relativ rare. Deci a

53528
39:58:10,480 --> 39:58:15,600
distribuția oblică la dreapta are o coadă lungă

53529
39:58:13,104 --> 39:58:18,320
în partea dreaptă, după cum puteți vedea aici.

53530
39:58:15,600 --> 39:58:21,104
Deci numărul suporturilor observate. Să

53531
39:58:18,320 --> 39:58:23,520
să spunem că avem date pe an.

53532
39:58:21,104 --> 39:58:25,744
Deci, din nou, putem avea o mai asimilă

53533
39:58:23,520 --> 39:58:28,000
spre partea dreaptă unde sunt datele

53534
39:58:25,744 --> 39:58:30,080
fiind în scădere pe măsură ce continuăm

53535
39:58:28,000 --> 39:58:32,880
creste numarul de ani. Pentru

53536
39:58:30,080 --> 39:58:36,640
exemplu, putem avea vânzări ridicate către

53537
39:58:32,880 --> 39:58:40,560
începutul anului presupune în 2022

53538
39:58:36,640 --> 39:58:42,160
dar din nou pe măsură ce trecem la 2023 secunde

53539
39:58:40,560 --> 39:58:45,360
jumătate dintre noi vedem căderea

53540
39:58:42,160 --> 39:58:47,840
performanta. Deci, pe bună dreptate, este denaturat

53541
39:58:45,360 --> 39:58:50,320
și în același fel să presupunem că am început

53542
39:58:47,840 --> 39:58:53,104
cu cifra de vânzări era într-adevăr mai mică

53543
39:58:50,320 --> 39:58:56,800
presupunând 2002

53544
39:58:53,104 --> 39:58:58,640
dar din nou pe măsură ce am trecut la 2023 acum

53545
39:58:56,800 --> 39:59:01,200
vânzările noastre au fost treptat

53546
39:58:58,640 --> 39:59:03,280
crescând. Deci este mai degrabă înclinată

53547
39:59:01,200 --> 39:59:08,480
spre secțiunea din stânga ca parte a

53548
39:59:03,280 --> 39:59:11,280
deformare negativă. În continuare avem curtoza.

53549
39:59:08,480 --> 39:59:14,720
Deci curtoza este practic o măsură a

53550
39:59:11,280 --> 39:59:17,440
coada unei distribuții.

53551
39:59:14,720 --> 39:59:20,720
Deci, taeness este cât de des valorile aberante

53552
39:59:17,440 --> 39:59:23,360
apar și acționează ca curtis este coada

53553
39:59:20,720 --> 39:59:26,000
a distribuţiei raportate la o normală

53554
39:59:23,360 --> 39:59:29,200
distributie. Deci o distributie cu

53555
39:59:26,000 --> 39:59:31,744
curttoza medie este numită messortică.

53556
39:59:29,200 --> 39:59:33,920
O distribuție cu curtoză scăzută ca

53557
39:59:31,744 --> 39:59:36,240
acesta. Aceasta se numește ca

53558
39:59:33,920 --> 39:59:38,880
platicurtic si apoi distributie cu

53559
39:59:36,240 --> 39:59:42,080
curtoză mare ca aceasta. Aceasta este

53560
39:59:38,880 --> 39:59:44,640
numit leptocortic.

53561
39:59:42,080 --> 39:59:47,440
Deci cozile aici se îngustează la capăt

53562
39:59:44,640 --> 39:59:49,920
ambele părți ale unei distribuții ca aceasta.

53563
39:59:47,440 --> 39:59:52,000
Deci ele reprezintă probabilitatea sau

53564
39:59:49,920 --> 39:59:55,744
frecvenţa valorilor care sunt extrem de

53565
39:59:52,000 --> 39:59:58,320
mare sau extrem de scăzută la medie.

53566
39:59:55,744 --> 40:00:02,080
Cu alte cuvinte, cozile aici reprezintă

53567
39:59:58,320 --> 40:00:05,104
cât de des apar valorile aberante.

53568
40:00:02,080 --> 40:00:07,600
Deci există trei tipuri de curtis. Noi

53569
40:00:05,104 --> 40:00:09,920
au platicurtic care este negativ,

53570
40:00:07,600 --> 40:00:12,960
leptocortic care este un pozitiv spre

53571
40:00:09,920 --> 40:00:15,520
capătul de sus și apoi avem messertic

53572
40:00:12,960 --> 40:00:18,560
care este o distribuție normală. Deci

53573
40:00:15,520 --> 40:00:20,720
messertic este coada medie. Atat de normal

53574
40:00:18,560 --> 40:00:23,280
distribuţiile la care au o curtoză

53575
40:00:20,720 --> 40:00:26,000
trei. Deci orice distribuție cu a

53576
40:00:23,280 --> 40:00:29,200
curtoza de aproximativ valoare de trei este

53577
40:00:26,000 --> 40:00:32,080
va fi messertic. Și curtoza este

53578
40:00:29,200 --> 40:00:35,360
descrise în termeni de exces de curttoză

53579
40:00:32,080 --> 40:00:38,080
care este curtoza minus3. Și de când

53580
40:00:35,360 --> 40:00:41,104
distributie normala au o curtoza

53581
40:00:38,080 --> 40:00:43,360
de trei axe curtise face compararea a

53582
40:00:41,104 --> 40:00:46,384
curtoza distributiei la normal

53583
40:00:43,360 --> 40:00:49,520
distributia si mai usoara. Introducere

53584
40:00:46,384 --> 40:00:52,720
la probabilitate.

53585
40:00:49,520 --> 40:00:54,800
Teoria probabilității. Probabilitatea este a

53586
40:00:52,720 --> 40:00:57,664
măsură a probabilității ca un eveniment

53587
40:00:54,800 --> 40:01:01,024
va avea loc.

53588
40:00:57,664 --> 40:01:03,104
Să luăm în considerare un exemplu de aruncare a monedelor

53589
40:01:01,024 --> 40:01:07,440
unde șansele de a obține cap pe a

53590
40:01:03,104 --> 40:01:09,744
monedele sunt 1 cu doi sau 50%.

53591
40:01:07,440 --> 40:01:13,600
Probabilitatea fiecărui eveniment dat este

53592
40:01:09,744 --> 40:01:16,320
între zero și unu, ambele inclusiv. Sumă

53593
40:01:13,600 --> 40:01:19,840
a unei probabilități cumulative de evenimente

53594
40:01:16,320 --> 40:01:22,560
nu poate fi mai mare de unu.

53595
40:01:19,840 --> 40:01:25,600
Prin urmare, probabilitatea unui eveniment X se află

53596
40:01:22,560 --> 40:01:27,600
intre zero si unu. Aceasta înseamnă că

53597
40:01:25,600 --> 40:01:32,920
integrala probabilității de

53598
40:01:27,600 --> 40:01:32,920
distribuția pe x este egală cu 1.

53599
40:01:33,104 --> 40:01:38,960
Probabilitate condiționată. Condițional

53600
40:01:35,664 --> 40:01:42,320
probabilitatea oricărui eveniment A este definită ca

53601
40:01:38,960 --> 40:01:47,200
probabilitatea de apariție a lui A dată

53602
40:01:42,320 --> 40:01:50,480
acel eveniment B a avut loc anterior.

53603
40:01:47,200 --> 40:01:53,360
Probabilitatea condiției evenimentului A dat B

53604
40:01:50,480 --> 40:01:56,080
poate fi estimată ca probabilitate pentru A

53605
40:01:53,360 --> 40:01:59,600
intersecția B care este probabilitatea de

53606
40:01:56,080 --> 40:02:04,360
atât A cât și B se întâmplă împreună

53607
40:01:59,600 --> 40:02:04,360
împărțit la probabilitatea lui B.

53608
40:02:04,560 --> 40:02:09,840
Este scris și ca acea probabilitate

53609
40:02:06,880 --> 40:02:13,744
a A intersecției B este egală cu

53610
40:02:09,840 --> 40:02:17,720
probabilitatea A dat B înmulțită la

53611
40:02:13,744 --> 40:02:17,720
probabilitatea lui B.

53612
40:02:18,000 --> 40:02:23,600
Să luăm în considerare un exemplu.

53613
40:02:20,720 --> 40:02:26,240
Într-o monedă, facem o întoarcere cu două monede.

53614
40:02:23,600 --> 40:02:30,520
Moneda unu primește capete, cozi, capete și

53615
40:02:26,240 --> 40:02:30,520
cozile în flipurile ulterioare.

53616
40:02:30,880 --> 40:02:37,280
în timp ce moneda doi primește cozi, capete, capete,

53617
40:02:33,920 --> 40:02:39,600
și cozi în flipurile ulterioare. Acum,

53618
40:02:37,280 --> 40:02:42,640
probabilitatea ca moneda unu să obțină a

53619
40:02:39,600 --> 40:02:45,104
capul este 2 din patru. În timp ce

53620
40:02:42,640 --> 40:02:48,480
probabilitatea ca moneda doi să primească capete

53621
40:02:45,104 --> 40:02:50,800
este din nou doi din patru.

53622
40:02:48,480 --> 40:02:53,440
Probabilitatea ca ambii să bată unul și

53623
40:02:50,800 --> 40:02:57,160
moneda doi va avea un capete este doar unul

53624
40:02:53,440 --> 40:02:57,160
din cele patru flip-uri.

53625
40:02:57,360 --> 40:03:02,320
De aici probabilitatea ca monedă unul să fie

53626
40:02:59,744 --> 40:03:05,024
obține capete având în vedere că moneda 2 este deja

53627
40:03:02,320 --> 40:03:09,840
capete pot fi calculate ca probabilitate de

53628
40:03:05,024 --> 40:03:12,960
monedă o margine intersecție monedă 2 margine

53629
40:03:09,840 --> 40:03:16,080
adică 1x4 împărțit la probabilitatea de

53630
40:03:12,960 --> 40:03:19,024
monedă 2 margine

53631
40:03:16,080 --> 40:03:24,160
acesta este un dat care este 2x 4 care este

53632
40:03:19,024 --> 40:03:27,280
va fi bazat pe 0,5 sau 50%.

53633
40:03:24,160 --> 40:03:29,520
teorema de bază Teorema de bază calculează

53634
40:03:27,280 --> 40:03:33,600
probabilitatea condiționată a unui eveniment

53635
40:03:29,520 --> 40:03:36,240
pe baza probabilităţilor sale anterioare.

53636
40:03:33,600 --> 40:03:38,640
Practic teorema de bază încorporează

53637
40:03:36,240 --> 40:03:40,880
distribuția de probabilitate anterioară la

53638
40:03:38,640 --> 40:03:44,880
prezice probabilitățile posterioare.

53639
40:03:40,880 --> 40:03:47,600
Teorema de bază pentru probabilitatea condiționată

53640
40:03:44,880 --> 40:03:51,440
poate fi exprimat ca probabilitate pentru A

53641
40:03:47,600 --> 40:03:54,320
dat B este egal cu probabilitatea lui B dat A

53642
40:03:51,440 --> 40:03:57,360
împărțit la probabilitatea lui B înmulțită

53643
40:03:54,320 --> 40:03:59,520
la probabilitatea lui A.

53644
40:03:57,360 --> 40:04:01,744
Teorema de bază permite actualizarea

53645
40:03:59,520 --> 40:04:04,240
valori de probabilitate prin utilizarea de noi

53646
40:04:01,744 --> 40:04:06,960
informații sau dovezi. Aici

53647
40:04:04,240 --> 40:04:09,440
probabilitatea lui A este cunoscută ca anterioară

53648
40:04:06,960 --> 40:04:12,800
probabilitate. Aceasta este probabilitatea de

53649
40:04:09,440 --> 40:04:16,160
eveniment înainte de colectarea oricăror date noi.

53650
40:04:12,800 --> 40:04:19,200
Probabilitatea unui B dat este cunoscută sub numele de

53651
40:04:16,160 --> 40:04:21,664
probabilitate posterioară. Este cea revizuită

53652
40:04:19,200 --> 40:04:24,080
probabilitatea ca un eveniment să se producă după

53653
40:04:21,664 --> 40:04:27,280
luând în considerare noul

53654
40:04:24,080 --> 40:04:29,664
probabilitatea de informare a lui B dat A este

53655
40:04:27,280 --> 40:04:32,560
cunoscut sub numele de probabilitate și probabilitate

53656
40:04:29,664 --> 40:04:36,640
a lui B este probabilitatea de a observa an

53657
40:04:32,560 --> 40:04:38,640
modelul de dovezi B. Un exemplu, luați în considerare un

53658
40:04:36,640 --> 40:04:41,744
exemplu pentru calcularea probabilității

53659
40:04:38,640 --> 40:04:44,320
de a avea diabet pe baza frecvenței de

53660
40:04:41,744 --> 40:04:47,200
consumul de fast-food. Aici este

53661
40:04:44,320 --> 40:04:51,104
date observate. Să spunem fast-food

53662
40:04:47,200 --> 40:04:56,080
audiența este de 20%. Prevalența diabetului este

53663
40:04:51,104 --> 40:04:58,880
10% și 5% sunt fast-food și diabet.

53664
40:04:56,080 --> 40:05:01,200
Șansele de diabet cu mâncare rapidă

53665
40:04:58,880 --> 40:05:04,384
aceasta este probabilitatea condiționată a lui D

53666
40:05:01,200 --> 40:05:07,104
dat B poate fi calculat ca probabilitate

53667
40:05:04,384 --> 40:05:10,384
de diabet și fast-food împreună

53668
40:05:07,104 --> 40:05:14,384
împărțit la probabilitatea de fast-food.

53669
40:05:10,384 --> 40:05:16,560
Asta înseamnă 5% împărțit la 20%. că

53670
40:05:14,384 --> 40:05:19,200
este egal cu 25%.

53671
40:05:16,560 --> 40:05:21,520
Definiți o analiză care poate indica mâncatul rapid

53672
40:05:19,200 --> 40:05:24,560
mâncarea crește șansa de a avea

53673
40:05:21,520 --> 40:05:27,440
diabet zaharat cu 25%.

53674
40:05:24,560 --> 40:05:30,720
Regula probabilității înmulțirii

53675
40:05:27,440 --> 40:05:33,280
dacă evenimentele A şi B sunt statistic

53676
40:05:30,720 --> 40:05:35,920
independent și probabilitatea lui A

53677
40:05:33,280 --> 40:05:39,360
intersecția B poate fi dată ca

53678
40:05:35,920 --> 40:05:42,720
probabilitatea A dat B înmulțită la

53679
40:05:39,360 --> 40:05:45,744
probabilitatea lui B. Cu toate acestea, probabilitatea

53680
40:05:42,720 --> 40:05:48,480
al A intersecției B este de asemenea dat ca

53681
40:05:45,744 --> 40:05:52,560
probabilitatea lui A înmulțită la

53682
40:05:48,480 --> 40:05:56,240
probabilitatea lui B. Aici probabilitatea lui A

53683
40:05:52,560 --> 40:05:59,024
dat B este egal cu probabilitatea lui A când

53684
40:05:56,240 --> 40:06:02,560
presupunem că probabilitatea lui B este non

53685
40:05:59,024 --> 40:06:05,440
zero. În mod similar, probabilitatea B este egală

53686
40:06:02,560 --> 40:06:08,800
probabilitatea lui B dat A presupunând

53687
40:06:05,440 --> 40:06:10,960
probabilitatea lui A este diferită de zero.

53688
40:06:08,800 --> 40:06:13,440
Regula în lanț a probabilității comune

53689
40:06:10,960 --> 40:06:16,000
distribuții de probabilitate pe mai multe

53690
40:06:13,440 --> 40:06:18,320
variabilele aleatoare pot fi reduse în

53691
40:06:16,000 --> 40:06:21,024
distribuții condiționate pe un singur

53692
40:06:18,320 --> 40:06:25,200
variabilă. Poate fi exprimat ca

53693
40:06:21,024 --> 40:06:28,000
probabilitatea de X1 X2 așa mai departe până la Xn

53694
40:06:25,200 --> 40:06:31,280
este egală cu probabilitatea intersecției X1

53695
40:06:28,000 --> 40:06:36,000
probabilitatea de X I dată probabilitatea de

53696
40:06:31,280 --> 40:06:38,880
X1 până la X I minus unu.

53697
40:06:36,000 --> 40:06:42,560
De exemplu, probabilitatea comună a lui A,

53698
40:06:38,880 --> 40:06:46,240
B și C pot fi date ca probabilitate pentru A

53699
40:06:42,560 --> 40:06:50,960
dat B. C înmulțit la probabilitatea de

53700
40:06:46,240 --> 40:06:54,080
B dat C se înmulțește la probabilitatea lui C.

53701
40:06:50,960 --> 40:06:56,240
Sigmoid logistic.

53702
40:06:54,080 --> 40:06:58,560
Funcția de logistică este un tip de

53703
40:06:56,240 --> 40:07:01,280
funcţia sigmoidă care urmăreşte să prezică

53704
40:06:58,560 --> 40:07:04,800
clasa la care o anumită probă

53705
40:07:01,280 --> 40:07:07,600
aparține. Rezultatul său este binar discret

53706
40:07:04,800 --> 40:07:10,880
valoare. o probabilitate între zero și

53707
40:07:07,600 --> 40:07:13,520
unul. Sigmoidul logistic este util

53708
40:07:10,880 --> 40:07:15,840
funcţie care urmează curba da. Ea

53709
40:07:13,520 --> 40:07:19,104
se saturează când intrarea este foarte mare

53710
40:07:15,840 --> 40:07:23,520
sau foarte mici. Sigmoid logistic este

53711
40:07:19,104 --> 40:07:26,640
exprimat ca sigma de x= 1 pe 1 e to

53712
40:07:23,520 --> 40:07:29,360
puterea minus x.

53713
40:07:26,640 --> 40:07:32,384
Sigmoidul logistic poate fi exprimat ca

53714
40:07:29,360 --> 40:07:36,880
funcția sigmoidă a lui x este dată ca 1 pe

53715
40:07:32,384 --> 40:07:38,800
1 e ^ minus x unde e este ooler-ul

53716
40:07:36,880 --> 40:07:41,360
număr.

53717
40:07:38,800 --> 40:07:43,664
distribuție Gshian.

53718
40:07:41,360 --> 40:07:45,920
Distribuția gossian este un tip de

53719
40:07:43,664 --> 40:07:48,240
distribuţie în care datele tind să

53720
40:07:45,920 --> 40:07:52,320
grupează în jurul unei valori centrale cu

53721
40:07:48,240 --> 40:07:54,384
puțin sau deloc părtinire la stânga sau la dreapta.

53722
40:07:52,320 --> 40:07:56,640
Este adesea menționată ca fiind normală

53723
40:07:54,384 --> 40:07:59,280
distributie.

53724
40:07:56,640 --> 40:08:01,600
În lipsa unor informații prealabile,

53725
40:07:59,280 --> 40:08:04,640
distribuția normală este frecvent un târg

53726
40:08:01,600 --> 40:08:06,640
presupunere în învățarea automată

53727
40:08:04,640 --> 40:08:08,880
ecuație.

53728
40:08:06,640 --> 40:08:11,280
Formula de calcul gaussian

53729
40:08:08,880 --> 40:08:14,080
distribuția este descrisă ca fiind normală

53730
40:08:11,280 --> 40:08:16,480
distribuția lui X.

53731
40:08:14,080 --> 40:08:19,360
Aceasta este funcția lui x dată medie ca

53732
40:08:16,480 --> 40:08:22,000
mu și varianța este sigma pătrat poate fi

53733
40:08:19,360 --> 40:08:26,320
calculat ca 1 pe pătrat sigma

53734
40:08:22,000 --> 40:08:30,560
roo<unk> de 2 pi e la puterea -/ x -

53735
40:08:26,320 --> 40:08:33,744
starea de spirit / sigma pătrat

53736
40:08:30,560 --> 40:08:37,520
unde mu este valoarea medie sau de vârf care

53737
40:08:33,744 --> 40:08:40,160
este de asemenea valoarea așteptată a lui x.

53738
40:08:37,520 --> 40:08:42,720
Sigma este abaterea standard. Sigma

53739
40:08:40,160 --> 40:08:44,960
pătratul este varianța.

53740
40:08:42,720 --> 40:08:47,520
O distribuție normală standard are a

53741
40:08:44,960 --> 40:08:50,000
medie de zero și o abatere standard de

53742
40:08:47,520 --> 40:08:54,000
unul.

53743
40:08:50,000 --> 40:08:56,240
Distribuția Gshian poate fi univariată

53744
40:08:54,000 --> 40:08:58,880
care descrie distribuția a

53745
40:08:56,240 --> 40:09:01,280
o singură variabilă X.

53746
40:08:58,880 --> 40:09:03,840
Poate fi, de asemenea, multivariat acolo unde se poate

53747
40:09:01,280 --> 40:09:06,320
folosit doar pentru a descrie distribuția de

53748
40:09:03,840 --> 40:09:12,024
mai multe variabile.

53749
40:09:06,320 --> 40:09:12,024
Este reprezentat în formate 3D sau ND.

53750
40:09:12,800 --> 40:09:18,560
Legea numerelor mari.

53751
40:09:16,480 --> 40:09:21,664
Acum să vorbim despre legea marelui

53752
40:09:18,560 --> 40:09:24,000
numere. Legea numerelor mari spune

53753
40:09:21,664 --> 40:09:26,320
că o medie de eșantion observată de la a

53754
40:09:24,000 --> 40:09:28,960
eșantionul mare va fi aproape de adevărat

53755
40:09:26,320 --> 40:09:32,000
media populației și că va obține

53756
40:09:28,960 --> 40:09:34,320
mai aproape în eșantionul mai mare. Deci legea

53757
40:09:32,000 --> 40:09:36,960
de număr mare nu garantează că

53758
40:09:34,320 --> 40:09:38,960
un eșantion dat în spațiu un eșantion mic

53759
40:09:36,960 --> 40:09:41,520
va reflecta adevărata populație

53760
40:09:38,960 --> 40:09:43,664
caracteristici sau ceea ce face un eșantion

53761
40:09:41,520 --> 40:09:46,880
nu reflectă adevărata populație va fi

53762
40:09:43,664 --> 40:09:49,360
echilibrat de o probă ulterioară. Aceasta este

53763
40:09:46,880 --> 40:09:51,360
pentru ca legea numerelor mari să se exprime

53764
40:09:49,360 --> 40:09:54,320
relaţia dintre scară şi

53765
40:09:51,360 --> 40:09:56,384
rata de crestere.

53766
40:09:54,320 --> 40:10:00,000
Deci, există mai multe exemple prin intermediul

53767
40:09:56,384 --> 40:10:02,480
pe care o putem înțelege

53768
40:10:00,000 --> 40:10:04,560
și este utilizat pe scară largă în statistică

53769
40:10:02,480 --> 40:10:06,720
analiza în lucrul cu centrala

53770
40:10:04,560 --> 40:10:09,920
teorema limitei în ceea ce privește afacerea

53771
40:10:06,720 --> 40:10:11,664
crestere. Deci există mai multe în timp real

53772
40:10:09,920 --> 40:10:14,640
configurația în care acestea vor fi

53773
40:10:11,664 --> 40:10:17,104
folosit. Deci, dacă vorbești despre aruncarea unui

53774
40:10:14,640 --> 40:10:19,520
monedă deci aruncând o monedă într-un număr de

53775
40:10:17,104 --> 40:10:22,080
ori ne va oferi două tipuri diferite de

53776
40:10:19,520 --> 40:10:24,080
rezultate.

53777
40:10:22,080 --> 40:10:27,024
rezultatul se va răspândi uniform între

53778
40:10:24,080 --> 40:10:29,920
cap și cozi și media așteptată

53779
40:10:27,024 --> 40:10:32,880
valoarea va fi la jumătate.

53780
40:10:29,920 --> 40:10:35,664
Asta înseamnă de 50 de ori cozi și de 30 de ori

53781
40:10:32,880 --> 40:10:38,480
capete. Dar din nou, dacă arunci o monedă

53782
40:10:35,664 --> 40:10:41,520
de 1.000 de ori, atunci rezultatul poate fi în

53783
40:10:38,480 --> 40:10:45,440
maniere diferite deoarece din 1.000,

53784
40:10:41,520 --> 40:10:49,024
sa zicem de 850 de ori a fost cap si

53785
40:10:45,440 --> 40:10:51,664
doar de 150 de ori a fost cozi și așa

53786
40:10:49,024 --> 40:10:54,080
pe. Deci, de aceea, posibilitatea unuia

53787
40:10:51,664 --> 40:10:56,800
evenimentul care are loc va fi schimbat

53788
40:10:54,080 --> 40:10:59,280
în seturi mari de mostre în comparație cu a

53789
40:10:56,800 --> 40:11:02,240
seturi de mostre mici, ca să spunem 10

53790
40:10:59,280 --> 40:11:04,720
ori. Deci numărul de capete și cozi

53791
40:11:02,240 --> 40:11:08,320
dezechilibrat pentru un număr mai mic de încercări.

53792
40:11:04,720 --> 40:11:10,720
Deci putem vedea că este dezechilibrat.

53793
40:11:08,320 --> 40:11:13,280
Dar din nou, de îndată ce mai aruncăm un număr

53794
40:11:10,720 --> 40:11:15,360
de monede mai înclină spre balanţă

53795
40:11:13,280 --> 40:11:17,664
valoare sau putem vedea cele observate

53796
40:11:15,360 --> 40:11:20,880
medii.

53797
40:11:17,664 --> 40:11:23,520
În continuare avem valoarea p.

53798
40:11:20,880 --> 40:11:26,080
Deci valoarea p este practic un număr

53799
40:11:23,520 --> 40:11:28,320
calculat din testul statistic

53800
40:11:26,080 --> 40:11:30,800
care descrie cât de probabil avem să avem

53801
40:11:28,320 --> 40:11:34,320
a găsit un anumit set de observații

53802
40:11:30,800 --> 40:11:37,200
dacă ipoteza nulă ar fi adevărată. Deci p

53803
40:11:34,320 --> 40:11:39,664
valorile sunt utilizate în testarea ipotezelor pentru

53804
40:11:37,200 --> 40:11:42,960
ajuta să decidă dacă respinge nulul

53805
40:11:39,664 --> 40:11:45,024
ipoteză. Și cu cât valoarea p este mai mică,

53806
40:11:42,960 --> 40:11:46,880
cu atât este mai probabil să respingem

53807
40:11:45,024 --> 40:11:48,960
ipoteza nulă.

53808
40:11:46,880 --> 40:11:52,240
Deci avem un termen numit nul

53809
40:11:48,960 --> 40:11:55,200
ipoteza. Deci toate testele statistice

53810
40:11:52,240 --> 40:11:57,920
au ipoteza nula. Deci pentru majoritatea

53811
40:11:55,200 --> 40:12:00,240
testează ipoteza nulă este că acolo

53812
40:11:57,920 --> 40:12:02,560
nu există o relație între variabilele noastre

53813
40:12:00,240 --> 40:12:05,360
de în primul sau că nu există

53814
40:12:02,560 --> 40:12:08,640
diferenta intre grupuri. De exemplu în

53815
40:12:05,360 --> 40:12:10,800
un test t cu două cozi non-ipoteza este

53816
40:12:08,640 --> 40:12:13,200
că diferenţa dintre două grupuri

53817
40:12:10,800 --> 40:12:15,520
va fi zero.

53818
40:12:13,200 --> 40:12:17,664
Deci valoarea p ne va spune cum

53819
40:12:15,520 --> 40:12:21,200
probabil că datele noastre ar putea avea

53820
40:12:17,664 --> 40:12:23,440
survenit sub ipoteza nulă.

53821
40:12:21,200 --> 40:12:25,744
Se face prin calcularea probabilității

53822
40:12:23,440 --> 40:12:27,920
a unei statistici de testare

53823
40:12:25,744 --> 40:12:30,960
care este numărul calculat de a

53824
40:12:27,920 --> 40:12:33,360
test statistic folosind datele noastre. Deci p

53825
40:12:30,960 --> 40:12:36,080
valoarea ne spune cât de des ne-am aștepta

53826
40:12:33,360 --> 40:12:37,840
pentru a vedea o statistică de test ca fiind extremă sau

53827
40:12:36,080 --> 40:12:40,160
mai extremă

53828
40:12:37,840 --> 40:12:43,744
decât unul calculat printr-o statistică

53829
40:12:40,160 --> 40:12:45,600
test. dacă ipoteza nulă a testului

53830
40:12:43,744 --> 40:12:47,664
era adevărat.

53831
40:12:45,600 --> 40:12:50,560
Deci, există mai multe limitări ca

53832
40:12:47,664 --> 40:12:53,200
bine. Deci, primul este rezultatele pot fi

53833
40:12:50,560 --> 40:12:56,000
semnificative, dar din nou sunt ei pot

53834
40:12:53,200 --> 40:12:58,640
să nu fie practic așa cum am comparat-o

53835
40:12:56,000 --> 40:13:01,520
se poate baza pe ipoteze multiple pentru

53836
40:12:58,640 --> 40:13:04,080
un joc pentru testul medical. Dacă

53837
40:13:01,520 --> 40:13:06,560
testul va fi pozitiv sau nu

53838
40:13:04,080 --> 40:13:09,104
poate prezenta valori egale ale efectului a

53839
40:13:06,560 --> 40:13:11,744
variabilă, dar nu mărimea în real

53840
40:13:09,104 --> 40:13:14,240
viata. Ce anume va fi

53841
40:13:11,744 --> 40:13:17,200
aplicarea unui test antidrog nu a reușit

53842
40:13:14,240 --> 40:13:19,664
in compania farmaceutica? Prin urmare, este

53843
40:13:17,200 --> 40:13:22,560
recomandat să folosești încredere și niveluri

53844
40:13:19,664 --> 40:13:24,880
pe lângă valorile p de cuantificat

53845
40:13:22,560 --> 40:13:27,920
sau putem spune să dăm o cifră solidă

53846
40:13:24,880 --> 40:13:30,160
rezerva pe care o vom obține.

53847
40:13:27,920 --> 40:13:32,480
Valorile p ca acestea sunt interpretate

53848
40:13:30,160 --> 40:13:34,640
susținând sau putem spune infirmarea

53849
40:13:32,480 --> 40:13:37,520
ipoteză alternativă.

53850
40:13:34,640 --> 40:13:40,720
Deci valoarea p vă poate spune doar dacă sau

53851
40:13:37,520 --> 40:13:42,720
nu este susținută ipoteza nulă. Ea

53852
40:13:40,720 --> 40:13:46,560
nu ne poate spune dacă alternativa noastră

53853
40:13:42,720 --> 40:13:49,104
ipoteza este adevărată sau de ce. Deci riscul

53854
40:13:46,560 --> 40:13:52,000
a respingerii ipotezei nule este

53855
40:13:49,104 --> 40:13:53,840
adesea mai mare decât valoarea p. Deci

53856
40:13:52,000 --> 40:13:56,384
mai ales când ne uităm la o

53857
40:13:53,840 --> 40:13:59,520
un singur studiu sau când se utilizează un eșantion mic

53858
40:13:56,384 --> 40:14:01,744
dimensiuni. Deci acest lucru se datorează faptului că este mai mic

53859
40:13:59,520 --> 40:14:03,920
cadru de referință, cu atât sunt mai mari

53860
40:14:01,744 --> 40:14:06,080
șansa ca pe măsură ce ne dăm peste o

53861
40:14:03,920 --> 40:14:08,720
model semnificativ statistic

53862
40:14:06,080 --> 40:14:10,880
complet accidental.

53863
40:14:08,720 --> 40:14:13,360
Recomandări cheie.

53864
40:14:10,880 --> 40:14:15,744
Recomandări cheie. Probabilitatea și

53865
40:14:13,360 --> 40:14:18,880
statisticile structurează premisa

53866
40:14:15,744 --> 40:14:21,920
date. Datele ajută la anticiparea

53867
40:14:18,880 --> 40:14:24,800
viitor sau măsurare în vederea trecutului

53868
40:14:21,920 --> 40:14:27,360
modele de informare.

53869
40:14:24,800 --> 40:14:29,664
Tendința centrală este o singură valoare

53870
40:14:27,360 --> 40:14:31,840
care ajută la descrierea datelor prin

53871
40:14:29,664 --> 40:14:34,720
identificarea acestor poziţii centrale. The

53872
40:14:31,840 --> 40:14:37,664
media, mediana și modul sunt măsurile

53873
40:14:34,720 --> 40:14:39,840
a tendintelor centrale.

53874
40:14:37,664 --> 40:14:42,384
Distribuția la care tind datele

53875
40:14:39,840 --> 40:14:45,520
fi în preajma unei valori centrale cu o lipsă de

53876
40:14:42,384 --> 40:14:49,104
părtinire sau părtinire minimă spre stânga sau

53877
40:14:45,520 --> 40:14:50,960
dreapta este numită distribuție gshian.

53878
40:14:49,104 --> 40:14:53,024
>> Numele meu este Richard Kersner cu

53879
40:14:50,960 --> 40:14:54,960
pur și simplu învață echipa. Asta e certificat,

53880
40:14:53,024 --> 40:14:57,280
treci înainte. Vom acoperi

53881
40:14:54,960 --> 40:14:59,024
matematică pentru învățarea automată. Deci

53882
40:14:57,280 --> 40:15:01,024
agenda de astăzi va cuprinde date

53883
40:14:59,024 --> 40:15:04,800
și tipurile sale. Atunci ne vom scufunda

53884
40:15:01,024 --> 40:15:06,960
în algebra liniară și conceptele ei,

53885
40:15:04,800 --> 40:15:08,800
calcul, statistici pentru mașină

53886
40:15:06,960 --> 40:15:12,000
învăţare, probabilitate pentru maşină

53887
40:15:08,800 --> 40:15:13,200
învăţare, demonstraţii practice şi, bineînţeles

53888
40:15:12,000 --> 40:15:15,024
aruncarea acolo la mijloc se duce

53889
40:15:13,200 --> 40:15:18,080
să fie matricele tale și alte câteva

53890
40:15:15,024 --> 40:15:20,880
lucruri care să meargă împreună cu toate acestea.

53891
40:15:18,080 --> 40:15:22,960
Datele și tipurile lor. Datele denotă

53892
40:15:20,880 --> 40:15:25,024
informații individuale de fapt

53893
40:15:22,960 --> 40:15:26,960
colectate din diverse surse. Este

53894
40:15:25,024 --> 40:15:28,640
stocate, prelucrate și ulterior utilizate pentru

53895
40:15:26,960 --> 40:15:30,560
analiza.

53896
40:15:28,640 --> 40:15:32,800
Și așa vedem aici uh doar un uriaș

53897
40:15:30,560 --> 40:15:36,960
grupare de informații, multă tehnologie

53898
40:15:32,800 --> 40:15:38,240
lucruri, bani, semne de dolar, numere

53899
40:15:36,960 --> 40:15:40,160
și apoi ai spectacolul tău

53900
40:15:38,240 --> 40:15:41,840
analitice pentru a genera perspective și

53901
40:15:40,160 --> 40:15:43,520
sper că ai un share frumos

53902
40:15:41,840 --> 40:15:44,880
acţionarii adunaţi la adunare şi

53903
40:15:43,520 --> 40:15:47,440
esti capabil sa explici ceva

53904
40:15:44,880 --> 40:15:50,384
pot intelege. Deci vorbim despre

53905
40:15:47,440 --> 40:15:52,640
tipuri de date de date pe care le avem în tipurile noastre

53906
40:15:50,384 --> 40:15:54,240
de date avem un calitativ

53907
40:15:52,640 --> 40:15:56,880
categoric

53908
40:15:54,240 --> 40:15:58,960
crezi nominal sau ordinal și apoi

53909
40:15:56,880 --> 40:16:01,920
ai dvs. cantitativ sau numeric

53910
40:15:58,960 --> 40:16:03,664
care este discretă sau continuă

53911
40:16:01,920 --> 40:16:06,384
și să ne uităm puțin mai îndeaproape la acestea

53912
40:16:03,664 --> 40:16:09,024
vocabularul tipului de date întotdeauna al oamenilor

53913
40:16:06,384 --> 40:16:11,840
preferatul este cuvintele din vocabular

53914
40:16:09,024 --> 40:16:14,384
nu al meu, dar haideți să ne aprofundăm în asta

53915
40:16:11,840 --> 40:16:17,360
ceea ce înțelegem prin nominale nominale sunt

53916
40:16:14,384 --> 40:16:19,280
folosit pentru a eticheta diverse doar uh eticheta noastre

53917
40:16:17,360 --> 40:16:22,800
variabile fără a furniza niciuna

53918
40:16:19,280 --> 40:16:26,080
valoare măsurabilă. Țara, genul,

53919
40:16:22,800 --> 40:16:28,320
rasă, păr, culoare etc. Este ceva

53920
40:16:26,080 --> 40:16:30,320
că fie marcați adevărat, fie fals. Aceasta

53921
40:16:28,320 --> 40:16:33,024
este o etichetă. Este pornit sau oprit. Fie ei

53922
40:16:30,320 --> 40:16:34,160
au o pălărie roșie sau nu. Da

53923
40:16:33,024 --> 40:16:38,000
de multe ori când te gândești

53924
40:16:34,160 --> 40:16:40,320
etichete de date nominale, gândiți-vă la asta ca la a

53925
40:16:38,000 --> 40:16:42,800
adevărat fals tip de configurare. Și ne uităm la

53926
40:16:40,320 --> 40:16:45,664
ordinal. Acestea sunt date categorice cu a

53927
40:16:42,800 --> 40:16:47,280
stabiliți-o ordine sau o scară. Uh și tu

53928
40:16:45,664 --> 40:16:50,240
se poate gândi la intervalul de salariu este grozav

53929
40:16:47,280 --> 40:16:52,560
unul. Evaluările filmelor etc. Vezi aici

53930
40:16:50,240 --> 40:16:55,280
intervalul de salariu dacă ai 10.000 to

53931
40:16:52,560 --> 40:16:59,520
20.000 de angajați care câștigă asta

53932
40:16:55,280 --> 40:17:02,000
rata este de la 150 20.000 la 30.000 100 și așa

53933
40:16:59,520 --> 40:17:04,320
înainte. Unii dintre termenii pe care îi veți auzi sunt

53934
40:17:02,000 --> 40:17:05,600
găleată. Uh, aici ai 10

53935
40:17:04,320 --> 40:17:07,024
diferite găleți și vrei

53936
40:17:05,600 --> 40:17:10,240
separa-l în ceva care face

53937
40:17:07,024 --> 40:17:12,960
sens în acele 10 găleți. Și așa când

53938
40:17:10,240 --> 40:17:14,800
începem să vorbim despre ordinal, o mulțime de

53939
40:17:12,960 --> 40:17:17,280
ori când ajungi la alamă

53940
40:17:14,800 --> 40:17:18,880
oase, din nou, vorbim adevărat fals.

53941
40:17:17,280 --> 40:17:22,240
Dacă ești membru al celor 10 to

53942
40:17:18,880 --> 40:17:24,240
Gama de 20k, uh așa mai departe, acestea ar fi fiecare

53943
40:17:22,240 --> 40:17:26,320
fie parte din acel grup, fie ești

53944
40:17:24,240 --> 40:17:27,664
nu. Dar acum vorbim despre găleți

53945
40:17:26,320 --> 40:17:30,960
și vrem să numărăm câți oameni sunt

53946
40:17:27,664 --> 40:17:34,384
în acea găleată. Numerică cantitativă

53947
40:17:30,960 --> 40:17:37,520
datele se împart în două clase, discrete

53948
40:17:34,384 --> 40:17:39,840
sau continuu. Și așa date cu o finală

53949
40:17:37,520 --> 40:17:42,384
set de valori care pot fi clasificate

53950
40:17:39,840 --> 40:17:45,360
la întrebările privind puterea clasei răspuns

53951
40:17:42,384 --> 40:17:47,104
corect și alergă lovit în cricket. multe

53952
40:17:45,360 --> 40:17:50,240
de ori când vezi asta te poți gândi

53953
40:17:47,104 --> 40:17:53,104
întreg uh și un număr întreg foarte restrâns

53954
40:17:50,240 --> 40:17:55,200
adică poți avea doar 100 de întrebări

53955
40:17:53,104 --> 40:17:56,800
la un test. Deci poți, este foarte

53956
40:17:55,200 --> 40:17:59,440
discret. Am doar 100 diferite

53957
40:17:56,800 --> 40:18:01,104
valorile pe care le poate atinge. Deci gandeste-te

53958
40:17:59,440 --> 40:18:03,200
de obicei vorbiți despre numere întregi

53959
40:18:01,104 --> 40:18:04,960
dar într-un interval foarte mic. Ei

53960
40:18:03,200 --> 40:18:05,920
nu au un capăt deschis sau ceva asemănător

53961
40:18:04,960 --> 40:18:08,880
că.

53962
40:18:05,920 --> 40:18:12,160
Uh, atât de discret este foarte solid, simplu de

53963
40:18:08,880 --> 40:18:14,384
numără, setează numărul. Continuă pe

53964
40:18:12,160 --> 40:18:17,200
de altă parte uh date continue pot lua

53965
40:18:14,384 --> 40:18:20,160
orice valoare numerică dintr-un interval. Deci

53966
40:18:17,200 --> 40:18:21,744
presiunea apei, greutatea unei persoane etc.

53967
40:18:20,160 --> 40:18:24,000
De obicei începem să ne gândim la float

53968
40:18:21,744 --> 40:18:26,384
valori unde pot ajunge fenomenal

53969
40:18:24,000 --> 40:18:28,000
mici în ceea ce valorează.

53970
40:18:26,384 --> 40:18:30,080
Și există o serie întreagă de valori

53971
40:18:28,000 --> 40:18:32,880
care se încadrează chiar între discret și

53972
40:18:30,080 --> 40:18:34,880
continuu. Te poți gândi la

53973
40:18:32,880 --> 40:18:37,360
bursa. Ai sume în dolari.

53974
40:18:34,880 --> 40:18:39,280
Este încă discret, dar începe

53975
40:18:37,360 --> 40:18:40,960
devine destul de complicat când ai

53976
40:18:39,280 --> 40:18:44,080
cum ar fi, știi, să sari la bursă

53977
40:18:40,960 --> 40:18:48,000
de la 525,33 USD

53978
40:18:44,080 --> 40:18:49,840
până la 580,67 USD.

53979
40:18:48,000 --> 40:18:52,080
Există o mulțime de valori de puncte acolo.

53980
40:18:49,840 --> 40:18:54,000
Tot s-ar numi discret, dar tu

53981
40:18:52,080 --> 40:18:56,320
începe să-l consideri aproape continuu

53982
40:18:54,000 --> 40:18:59,024
pentru că are o astfel de variație în

53983
40:18:56,320 --> 40:19:01,920
ea. Acum vorbim despre n-am făcut noi

53984
40:18:59,024 --> 40:19:04,320
a trecut peste nominal și ordinal uh aproape

53985
40:19:01,920 --> 40:19:06,480
diagrame adevărate false și ne-am uitat la

53986
40:19:04,320 --> 40:19:08,160
date cantitative şi numerice care

53987
40:19:06,480 --> 40:19:10,640
începem să intrăm în cifre.

53988
40:19:08,160 --> 40:19:12,480
Discret poți, de obicei, de multe ori

53989
40:19:10,640 --> 40:19:14,000
discret va fi pus în ar putea fi

53990
40:19:12,480 --> 40:19:15,840
pus în adevărat fals, dar de obicei este

53991
40:19:14,000 --> 40:19:17,104
nu. Deci vrem să abordăm chestia asta

53992
40:19:15,840 --> 40:19:19,920
și primul lucru la care vrem să ne uităm

53993
40:19:17,104 --> 40:19:21,520
este foarte de bază, care este algebra ta.

53994
40:19:19,920 --> 40:19:24,320
Deci, vom arunca o privire la liniar

53995
40:19:21,520 --> 40:19:27,024
algebră. Vă puteți aminti când erați

53996
40:19:24,320 --> 40:19:28,384
Geometrie uklidiană avem o linie.

53997
40:19:27,024 --> 40:19:30,080
Ei bine, hai să trecem prin asta. Avem

53998
40:19:28,384 --> 40:19:33,280
algebra liniară este domeniul

53999
40:19:30,080 --> 40:19:35,360
matematică privind ecuațiile liniare

54000
40:19:33,280 --> 40:19:37,664
şi reprezentările lor în vector

54001
40:19:35,360 --> 40:19:40,160
spaţii şi prin matrice. Ţi-am spus

54002
40:19:37,664 --> 40:19:44,960
vom vorbi despre matrice. Uh

54003
40:19:40,160 --> 40:19:50,320
deci o ecuație liniară este pur și simplu um uh 2x

54004
40:19:44,960 --> 40:19:53,520
  4 y - 3 z = 10. Foarte liniar. 10 x  

54005
40:19:50,320 --> 40:19:55,440
12,4 4 y = z. Și acum chiar poți

54006
40:19:53,520 --> 40:19:57,664
rezolvați aceste două ecuații prin combinare

54007
40:19:55,440 --> 40:19:59,840
ei. Uh, și despre asta vorbim

54008
40:19:57,664 --> 40:20:03,520
o ecuație liniară.

54009
40:19:59,840 --> 40:20:05,840
În vectori, avem a b= c. Acum,

54010
40:20:03,520 --> 40:20:08,720
începem să privim o direcție.

54011
40:20:05,840 --> 40:20:11,600
Și aceste valori se gândesc de obicei la un xyz

54012
40:20:08,720 --> 40:20:14,320
complot. Hm, deci fiecare este o direcție.

54013
40:20:11,600 --> 40:20:17,440
Și distanța reală de ca a

54014
40:20:14,320 --> 40:20:20,000
triunghiul A este C. Și apoi matricea ta

54015
40:20:17,440 --> 40:20:22,480
poate descrie tot felul de lucruri. Hm, eu

54016
40:20:20,000 --> 40:20:25,360
găsiți matrice uh încurcă multe

54017
40:20:22,480 --> 40:20:28,560
oameni, nu pentru că ar fi deosebit

54018
40:20:25,360 --> 40:20:31,104
dificil, dar din cauza amplorii

54019
40:20:28,560 --> 40:20:35,200
iar diferitele lucruri sunt folosite pentru.

54020
40:20:31,104 --> 40:20:36,960
Și o matrice este o diagramă sau un um, tu

54021
40:20:35,200 --> 40:20:39,104
știi, gândește-te la o foaie de calcul, dar tu

54022
40:20:36,960 --> 40:20:43,520
au rândurile și coloanele tale. Şi

54023
40:20:39,104 --> 40:20:47,024
veți vedea aici avem a * b= c. Foarte

54024
40:20:43,520 --> 40:20:48,800
important să vă cunoașteți numărul. Uh, deci

54025
40:20:47,024 --> 40:20:50,720
în funcție de modul în care se face matematica,

54026
40:20:48,800 --> 40:20:52,320
pentru ce îl folosești, asigurându-te

54027
40:20:50,720 --> 40:20:54,640
ai aceleasi randuri si numarul de

54028
40:20:52,320 --> 40:20:56,000
coloane sau un singur număr, sunt toate

54029
40:20:54,640 --> 40:20:58,560
fel de lucruri care joacă în asta

54030
40:20:56,000 --> 40:21:00,080
poate face matricele confuze. Uh, dar

54031
40:20:58,560 --> 40:21:02,320
într-adevăr are mult mai mult de-a face cu ce

54032
40:21:00,080 --> 40:21:05,744
domeniul în care lucrați. Uh, sunteți

54033
40:21:02,320 --> 40:21:10,640
adăugând mai multe polomii unde tu

54034
40:21:05,744 --> 40:21:12,080
au ca uh uh ax^2 plus b y plus, tu

54035
40:21:10,640 --> 40:21:14,000
Știi, începi să vezi că poate fi foarte

54036
40:21:12,080 --> 40:21:16,240
confuz versus unul foarte simplu

54037
40:21:14,000 --> 40:21:18,384
matricea. Și să mergem puțin

54038
40:21:16,240 --> 40:21:20,320
mai adânc în acestea pentru că acestea sunt așa

54039
40:21:18,384 --> 40:21:22,160
în primul rând, asta este ceea ce suntem aici să vorbim

54040
40:21:20,320 --> 40:21:25,280
despre aceste matematice diferite uh

54041
40:21:22,160 --> 40:21:26,800
calculele matematice care apar.

54042
40:21:25,280 --> 40:21:28,384
Deci ne uităm la ecuații liniare.

54043
40:21:26,800 --> 40:21:30,384
Să pătrundem mai adânc în asta. An

54044
40:21:28,384 --> 40:21:33,920
ecuație având ordinul maxim unu

54045
40:21:30,384 --> 40:21:35,840
se numește ecuație liniară. Uh, așa este

54046
40:21:33,920 --> 40:21:38,560
liniară pentru că atunci când te uiți la asta noi

54047
40:21:35,840 --> 40:21:42,080
au uh ax plus b= c care este unul

54048
40:21:38,560 --> 40:21:46,880
variabilă. Avem două ax variabile plus b

54049
40:21:42,080 --> 40:21:50,000
y = c ax plus b y plus z c cz z= d şi

54050
40:21:46,880 --> 40:21:52,160
asa mai departe. Dar toate acestea sunt pentru

54051
40:21:50,000 --> 40:21:54,080
puterea unuia. Nu vezi x pătrat. tu

54052
40:21:52,160 --> 40:21:55,600
nu vezi x cub. Deci vorbim

54053
40:21:54,080 --> 40:21:57,920
despre ecuațiile liniare. Asta este

54054
40:21:55,600 --> 40:22:00,000
despre care vorbim în adăugarea lor.

54055
40:21:57,920 --> 40:22:02,000
Dacă te-ai scufundat deja în spune

54056
40:22:00,000 --> 40:22:06,000
rețelele neuronale, ar trebui să recunoașteți

54057
40:22:02,000 --> 40:22:08,560
acest topor plus b y plus cz um setup plus

54058
40:22:06,000 --> 40:22:10,880
interceptarea. uh, ceea ce este practic

54059
40:22:08,560 --> 40:22:13,360
rețeaua dvs. neuronală fiecare nod

54060
40:22:10,880 --> 40:22:15,840
însumând toate intrările diferite și

54061
40:22:13,360 --> 40:22:20,480
putem detalia cele mai comune

54062
40:22:15,840 --> 40:22:24,160
formula este y = mx c.

54063
40:22:20,480 --> 40:22:28,320
Deci ai ta uh y egal cu m care

54064
40:22:24,160 --> 40:22:31,200
este panta ta, valoarea ta x plus c care

54065
40:22:28,320 --> 40:22:33,664
este interceptarea ta um y. Ei cam

54066
40:22:31,200 --> 40:22:35,600
a etichetat-o greșit aici

54067
40:22:33,664 --> 40:22:37,840
m-a aruncat pentru o buclă, dar c ar fi

54068
40:22:35,600 --> 40:22:40,880
fii interceptarea ta. Deci, când setați x

54069
40:22:37,840 --> 40:22:43,600
egal cu zero, y egal cu c. Și asta este

54070
40:22:40,880 --> 40:22:45,440
asta e interceptarea ta chiar acolo. Uh

54071
40:22:43,600 --> 40:22:48,000
și asta tocmai le-au inversat

54072
40:22:45,440 --> 40:22:50,320
valoarea lui y. Când x este egal cu 0, este egal

54073
40:22:48,000 --> 40:22:52,880
interceptarea y, care este c. Și a ta

54074
40:22:50,320 --> 40:22:56,320
linia de gradient a pantei, care este m. Deci

54075
40:22:52,880 --> 40:22:58,320
obțineți y = 2x 3. Și există

54076
40:22:56,320 --> 40:23:00,000
o mulțime de moduri ușoare de a calcula acest lucru. Acest

54077
40:22:58,320 --> 40:23:01,600
de ce acesta este motivul pentru care începem întotdeauna cu

54078
40:23:00,000 --> 40:23:03,600
cel mai elementar când rezolvăm unul dintre

54079
40:23:01,600 --> 40:23:05,520
aceste probleme. Și apoi desigur că

54080
40:23:03,600 --> 40:23:08,384
um, una dintre cele mai importante lucruri la pachet

54081
40:23:05,520 --> 40:23:10,160
este gradientul pantei dreptei. Da

54082
40:23:08,384 --> 40:23:12,320
panta este foarte importanta ca m

54083
40:23:10,160 --> 40:23:16,384
valoare. În acest caz am mers înainte și

54084
40:23:12,320 --> 40:23:18,384
rezolvat asta. Dacă ai y = 2x 3 tu

54085
40:23:16,384 --> 40:23:20,640
pot vedea cum are un grafic de linii frumos

54086
40:23:18,384 --> 40:23:23,664
aici in dreapta.

54087
40:23:20,640 --> 40:23:25,840
Deci matrice o matrice se referă la a

54088
40:23:23,664 --> 40:23:29,280
reprezentare dreptunghiulară a unui tablou

54089
40:23:25,840 --> 40:23:31,920
de numere dispuse în coloane și rânduri.

54090
40:23:29,280 --> 40:23:34,640
Deci vorbim de m rânduri cu n coloane

54091
40:23:31,920 --> 40:23:37,744
aici. A11 este denotă elementul

54092
40:23:34,640 --> 40:23:40,720
primul rând din prima coloană. În mod similar

54093
40:23:37,744 --> 40:23:43,664
a12 și se pronunță într-adevăr a11 în

54094
40:23:40,720 --> 40:23:48,880
această configurație specială. Deci este rândul unu

54095
40:23:43,664 --> 40:23:50,720
coloana unu. A12 este un rând de coloana 2

54096
40:23:48,880 --> 40:23:52,320
uh primul rând și a doua coloană și așa

54097
40:23:50,720 --> 40:23:53,920
pe.

54098
40:23:52,320 --> 40:23:56,160
Și există o mulțime de moduri de a denota

54099
40:23:53,920 --> 40:23:58,960
aceasta. Le-am văzut ca pe o capitală

54100
40:23:56,160 --> 40:24:01,360
litera A, litera A mai mică pentru rândul de sus

54101
40:23:58,960 --> 40:24:02,960
sau vreau să spun că poți vedea unde pot merge

54102
40:24:01,360 --> 40:24:05,840
tot felul de direcții diferite cât de departe

54103
40:24:02,960 --> 40:24:06,960
ca valoare. Ia-ți doar un moment

54104
40:24:05,840 --> 40:24:09,024
realizezi că trebuie să fie unele

54105
40:24:06,960 --> 40:24:12,560
desemnare în ceea ce privește rândul în care se află

54106
40:24:09,024 --> 40:24:14,800
și în ce coloană se află. Și avem noastre

54107
40:24:12,560 --> 40:24:16,320
operatii de baza. Avem plus.

54108
40:24:14,800 --> 40:24:20,800
Deci, când te gândești la adăugare, tu

54109
40:24:16,320 --> 40:24:23,664
au două matrice de 2x doi și tu

54110
40:24:20,800 --> 40:24:25,520
trebuie doar să adăugați fiecare număr în parte

54111
40:24:23,664 --> 40:24:27,440
matrice și apoi când ajungi la

54112
40:24:25,520 --> 40:24:30,960
jos aveți uh în acest caz

54113
40:24:27,440 --> 40:24:32,960
soluția este 12, 10 2 este 12, 5 3 este 8

54114
40:24:30,960 --> 40:24:34,560
si asa mai departe. Și același lucru cu

54115
40:24:32,960 --> 40:24:37,104
scăderea.

54116
40:24:34,560 --> 40:24:39,744
Acum, din nou, numărați matricele dvs

54117
40:24:37,104 --> 40:24:42,560
Doriți să vă verificați dimensiunile

54118
40:24:39,744 --> 40:24:44,320
matrizați forma pe care o veți vedea forma

54119
40:24:42,560 --> 40:24:46,080
mult în programare. Deci suntem

54120
40:24:44,320 --> 40:24:48,640
vorbind despre dimensiuni vorbim

54121
40:24:46,080 --> 40:24:51,200
despre formă. Dacă cele două forme sunt

54122
40:24:48,640 --> 40:24:54,160
egal, asta se întâmplă când adaugi

54123
40:24:51,200 --> 40:24:56,000
le împreună sau le scadă. Iar noi

54124
40:24:54,160 --> 40:24:57,744
au inmultire. Când te uiți la

54125
40:24:56,000 --> 40:25:00,640
înmulțirea cu care ajungi a

54126
40:24:57,744 --> 40:25:03,920
o configurație foarte ușor diferită.

54127
40:25:00,640 --> 40:25:06,640
Acum, dacă ne uităm la ultimul nostru, suntem

54128
40:25:03,920 --> 40:25:08,160
um uh suntem ca, de ce? Acest lucru devine întotdeauna

54129
40:25:06,640 --> 40:25:10,080
la mine când ajungem la matrice. Ei

54130
40:25:08,160 --> 40:25:12,880
nu spune cu adevărat de ce te înmulți

54131
40:25:10,080 --> 40:25:15,744
matrici. Ştii, primul meu gând

54132
40:25:12,880 --> 40:25:20,880
este 1 * 2, 4 * 3. Dar dacă te uiți la

54133
40:25:15,744 --> 40:25:22,384
asta, obținem 1 * 2 4 * 3, 1 * 3 4 *

54134
40:25:20,880 --> 40:25:27,200
5,

54135
40:25:22,384 --> 40:25:29,360
uh 6 * 2 3 * 3, 6 * 3 3 * 5. Dacă

54136
40:25:27,200 --> 40:25:32,160
te uiți la aceste matrici, uh,

54137
40:25:29,360 --> 40:25:33,920
Gândește-te la asta mai mult ca la o ecuație. Şi

54138
40:25:32,160 --> 40:25:35,600
Deci avem, uh, dacă vă amintiți când am

54139
40:25:33,920 --> 40:25:37,360
înapoi aici pentru linia noastră multiplă

54140
40:25:35,600 --> 40:25:39,520
ecuații, să mergem înapoi sus a

54141
40:25:37,360 --> 40:25:41,360
câteva diapozitive la care ne uitam,

54142
40:25:39,520 --> 40:25:45,664
două variabile. Deci acesta este un doi

54143
40:25:41,360 --> 40:25:48,480
ecuație variabilă. ax plus b y= c.

54144
40:25:45,664 --> 40:25:50,160
Hm, și acesta este un mod de a face totul

54145
40:25:48,480 --> 40:25:51,600
rapid să rezolve aceste variabile. Şi

54146
40:25:50,160 --> 40:25:53,664
de aceea ai matricea și

54147
40:25:51,600 --> 40:25:56,160
de aceea faci

54148
40:25:53,664 --> 40:26:01,920
înmulțirea așa cum o fac. Şi

54149
40:25:56,160 --> 40:26:03,520
acesta este produsul punctual al uh 1 * 2 4 *

54150
40:26:01,920 --> 40:26:07,744
3

54151
40:26:03,520 --> 40:26:13,840
1 * 3 4 * 5

54152
40:26:07,744 --> 40:26:16,880
uh 6 * 2 3 * 3 6 * 3 3 * 5. Și asta

54153
40:26:13,840 --> 40:26:19,440
ne oferă un mic frumos 14, 23, 21 și

54154
40:26:16,880 --> 40:26:23,024
33 de aici, care apoi poate fi folosit și

54155
40:26:19,440 --> 40:26:25,200
redus la o simplă formulă um ca

54156
40:26:23,024 --> 40:26:27,744
în măsura în care rezolvați variabilele pe care le aveți

54157
40:26:25,200 --> 40:26:29,360
intrări suficiente. Uh și apoi în matrice

54158
40:26:27,744 --> 40:26:32,320
operațiuni, când aveți de-a face cu a

54159
40:26:29,360 --> 40:26:34,240
o mulțime de matrice, acum ține cont

54160
40:26:32,320 --> 40:26:36,480
înmulțirea matricelor este diferită de

54161
40:26:34,240 --> 40:26:37,840
găsirea produsului a două matrici.

54162
40:26:36,480 --> 40:26:39,520
Bine? Deci vorbim despre

54163
40:26:37,840 --> 40:26:42,320
înmulțire, despre care vorbim

54164
40:26:39,520 --> 40:26:43,600
rezolvarea uh pentru ecuații. Când ești

54165
40:26:42,320 --> 40:26:45,744
găsind produsul, sunteți doar

54166
40:26:43,600 --> 40:26:47,280
găsind o dată două. Tine cont de asta

54167
40:26:45,744 --> 40:26:49,024
pentru că asta apare. Am avut asta

54168
40:26:47,280 --> 40:26:51,280
vin de mai multe ori unde sunt eu

54169
40:26:49,024 --> 40:26:54,240
modificând datele și devin confuz în ceea ce privește

54170
40:26:51,280 --> 40:26:56,384
ce fac cu el. Uh transpune

54171
40:26:54,240 --> 40:26:58,960
răsturnând matricea peste diagonala ei.

54172
40:26:56,384 --> 40:27:00,720
Apare tot timpul acolo unde te ai

54173
40:26:58,960 --> 40:27:05,024
mai am 12, dar în loc să fie

54174
40:27:00,720 --> 40:27:07,360
uh 128, acum este 1214 821. Doar ești

54175
40:27:05,024 --> 40:27:09,744
răsturnând coloanele și rândurile. Uh

54176
40:27:07,360 --> 40:27:11,360
și apoi bineînțeles că poți face o inversă

54177
40:27:09,744 --> 40:27:13,664
um schimbând semnele valorilor

54178
40:27:11,360 --> 40:27:15,440
peste această diagonală principală. Și poți

54179
40:27:13,664 --> 40:27:18,880
vezi aici avem inversul a la

54180
40:27:15,440 --> 40:27:23,840
minus1 și se termină cu uh în loc de 12

54181
40:27:18,880 --> 40:27:26,720
8 14 12 acum este -22 -12 vectori uh

54182
40:27:23,840 --> 40:27:30,880
vector înseamnă doar că avem

54183
40:27:26,720 --> 40:27:33,664
o valoare și o direcție și avem jos

54184
40:27:30,880 --> 40:27:35,600
patru numere aici pe vectorul nostru.

54185
40:27:33,664 --> 40:27:39,200
în matematică unidimensional

54186
40:27:35,600 --> 40:27:41,024
matricea se numește vector. Uh, dacă tu

54187
40:27:39,200 --> 40:27:44,000
ai xplotul tău și ai unul singur

54188
40:27:41,024 --> 40:27:46,720
valoare care valorează de-a lungul axei x și

54189
40:27:44,000 --> 40:27:48,160
este o singură dimensiune. Dacă ai două

54190
40:27:46,720 --> 40:27:50,960
dimensiuni pe care te poți gândi să le pui

54191
40:27:48,160 --> 40:27:53,520
le pe un grafic. S-ar putea să aveți x și

54192
40:27:50,960 --> 40:27:55,104
ați putea avea y și fiecare valoare indică

54193
40:27:53,520 --> 40:27:57,024
o direcție. Și apoi desigur că

54194
40:27:55,104 --> 40:27:59,840
distanța reală va fi

54195
40:27:57,024 --> 40:28:01,744
ipoteza acelui triunghi. Uh și tu

54196
40:27:59,840 --> 40:28:03,664
poate face asta cu tridimensionale x y

54197
40:28:01,744 --> 40:28:06,384
și z. și o poți face până la capăt

54198
40:28:03,664 --> 40:28:09,920
la a n-a dimensiuni. Deci când vorbesc

54199
40:28:06,384 --> 40:28:12,080
despre k înseamnă uh pentru clasificare

54200
40:28:09,920 --> 40:28:14,160
și cât de apropiate sunt datele între ele, ei

54201
40:28:12,080 --> 40:28:16,560
va calcula asta pe baza

54202
40:28:14,160 --> 40:28:18,560
Teorema lui Pitagora. Deci ai lua

54203
40:28:16,560 --> 40:28:20,240
pătratul fiecărei valori, adună-le

54204
40:28:18,560 --> 40:28:22,800
toate împreună și găsiți rădăcina pătrată

54205
40:28:20,240 --> 40:28:24,560
si asta iti da o distanta cat

54206
40:28:22,800 --> 40:28:26,880
unde este acel punct, unde este acel vector

54207
40:28:24,560 --> 40:28:29,280
există sau o valoare punctuală reală. Şi

54208
40:28:26,880 --> 40:28:31,104
atunci puteți compara valoarea această a punctului cu

54209
40:28:29,280 --> 40:28:34,640
altul și o face foarte ușor

54210
40:28:31,104 --> 40:28:36,800
comparație versus compararea uh 50 sau 60

54211
40:28:34,640 --> 40:28:41,200
numere diferite. Și asta ne aduce în sus

54212
40:28:36,800 --> 40:28:43,440
la vectorii genelor și valorile genei I. Uh eu

54213
40:28:41,200 --> 40:28:46,800
vectorii genelor vectorii care nu

54214
40:28:43,440 --> 40:28:49,520
își schimbă intervalul în timp ce se transformă

54215
40:28:46,800 --> 40:28:52,000
iar eu gena valorează valorile scalare care

54216
40:28:49,520 --> 40:28:54,960
sunt asociate vectorilor.

54217
40:28:52,000 --> 40:28:56,800
Din punct de vedere conceptual, vă puteți gândi la vector

54218
40:28:54,960 --> 40:29:00,720
ca imaginea ta. ai o poza.

54219
40:28:56,800 --> 40:29:02,480
Sunt două dimensiuni x și y. Şi

54220
40:29:00,720 --> 40:29:04,880
deci când faci acele două dimensiuni și

54221
40:29:02,480 --> 40:29:09,520
acele două valori sau oricare ar fi acea valoare

54222
40:29:04,880 --> 40:29:12,720
este acel punct, dar valorile

54223
40:29:09,520 --> 40:29:16,240
schimbați când o înclinați și așa dacă noi

54224
40:29:12,720 --> 40:29:20,080
luați și avem un vector a și acesta este a

54225
40:29:16,240 --> 40:29:21,920
setați valoarea uh b este um dvs. ești tu

54226
40:29:20,080 --> 40:29:25,200
au a și b care este igiena ta

54227
40:29:21,920 --> 40:29:28,160
vector. Doi este valoarea genei i. Deci,

54228
40:29:25,200 --> 40:29:30,160
modificăm toate valorile cu două.

54229
40:29:28,160 --> 40:29:31,920
Asta înseamnă că noi suntem tu, poate că suntem

54230
40:29:30,160 --> 40:29:34,960
întinzând-o într-o direcție, făcând

54231
40:29:31,920 --> 40:29:36,560
este înalt dacă faci editarea imaginilor.

54232
40:29:34,960 --> 40:29:38,160
Hăi, acesta este unul dintre locurile aici

54233
40:29:36,560 --> 40:29:40,320
intră. Dar poți vedea când ești

54234
40:29:38,160 --> 40:29:43,200
transformându-ți diferit

54235
40:29:40,320 --> 40:29:45,520
informațiile, cum le transformi

54236
40:29:43,200 --> 40:29:49,104
apoi valoarea ta de igienă. Și poți vedea

54237
40:29:45,520 --> 40:29:52,240
aici uh tranziție vector după linie

54238
40:29:49,104 --> 40:29:55,280
uh avem 3 a este vectorul de igienă.

54239
40:29:52,240 --> 40:29:57,024
Trei este valoarea de igienă. Deci A nu

54240
40:29:55,280 --> 40:29:59,840
schimbare. Cu asta am început.

54241
40:29:57,024 --> 40:30:02,560
Asta e poza ta originală. Și trei

54242
40:29:59,840 --> 40:30:05,280
uh o obligă într-o direcție și poate

54243
40:30:02,560 --> 40:30:06,880
uh B este denaturat în altă direcție.

54244
40:30:05,280 --> 40:30:08,720
Și astfel ai o imagine frumoasă înclinată

54245
40:30:06,880 --> 40:30:10,960
pentru că ai modificat-o de către cei de

54246
40:30:08,720 --> 40:30:13,920
valorile de igienă.

54247
40:30:10,960 --> 40:30:16,720
Deci hai să mergem mai departe și să lansăm o demonstrație

54248
40:30:13,920 --> 40:30:19,104
algebră liniară. Și pentru a face asta, sunt

54249
40:30:16,720 --> 40:30:22,320
o să trec prin Anaconda mea de încredere

54250
40:30:19,104 --> 40:30:25,024
în caietul meu Jupiter. și vom face

54251
40:30:22,320 --> 40:30:28,720
creați un nou notebook numit liniar

54252
40:30:25,024 --> 40:30:30,320
algebră. Din moment ce lucrăm în Python,

54253
40:30:28,720 --> 40:30:33,200
uh, vom folosi numpy-ul nostru. eu

54254
40:30:30,320 --> 40:30:36,320
importați întotdeauna ca matrice np sau numpy.

54255
40:30:33,200 --> 40:30:39,840
Probabil cel mai popular modul um pentru

54256
40:30:36,320 --> 40:30:41,664
făcând matrice și lucruri în

54257
40:30:39,840 --> 40:30:43,664
dat fiind că aceasta face parte dintr-o serie. eu sunt

54258
40:30:41,664 --> 40:30:45,360
nu va intra prea mult în numpy. Uh

54259
40:30:43,664 --> 40:30:47,600
vom merge mai departe și vom crea două

54260
40:30:45,360 --> 40:30:51,280
variabile diferite. A pentru o matrice numpy

54261
40:30:47,600 --> 40:30:52,640
10 15 și b 29.

54262
40:30:51,280 --> 40:30:55,520
Vom merge înainte și vom rula asta. Și poți

54263
40:30:52,640 --> 40:30:57,024
vezi că sunt cele două matrice ale noastre 105 29. Și eu

54264
40:30:55,520 --> 40:31:00,480
a mers înainte și a adăugat un spațiu acolo

54265
40:30:57,024 --> 40:31:02,880
între astfel încât să fie mai ușor de citit. Şi

54266
40:31:00,480 --> 40:31:04,320
deoarece este ultima linie, nu avem

54267
40:31:02,880 --> 40:31:06,960
pentru a pune pe ea declarația de tipărire dacă nu

54268
40:31:04,320 --> 40:31:10,160
vrei tu. Putem simplu, dar putem simplu

54269
40:31:06,960 --> 40:31:15,200
face un plus b. Deci, când conduc asta, noi

54270
40:31:10,160 --> 40:31:19,280
avem 10 15 29 și obținem 30 24, adică

54271
40:31:15,200 --> 40:31:21,360
ceea ce te astepti. 10 20 15 9. Tu

54272
40:31:19,280 --> 40:31:24,720
aproape că ar putea privi această adăugare ca

54273
40:31:21,360 --> 40:31:26,384
fiind um

54274
40:31:24,720 --> 40:31:28,720
doar adunând coloanele aici

54275
40:31:26,384 --> 40:31:32,320
coborând. Și dacă am vrea să o facem a

54276
40:31:28,720 --> 40:31:35,840
altfel, am putea face și un plus

54277
40:31:32,320 --> 40:31:39,024
b punctul t. Amintiți-vă că le răstoarnă. Şi

54278
40:31:35,840 --> 40:31:42,384
deci dacă facem asta, acum îi primim

54279
40:31:39,024 --> 40:31:44,480
acum au 304 mergând în sens invers. Noi

54280
40:31:42,384 --> 40:31:45,920
ar putea face și ceva distractiv.

54281
40:31:44,480 --> 40:31:49,200
Există o mulțime de moduri diferite de a face

54282
40:31:45,920 --> 40:31:53,200
aceasta. Uh, în ceea ce privește un plus b, pot și eu

54283
40:31:49,200 --> 40:31:55,440
face un plus b. T și o să vezi

54284
40:31:53,200 --> 40:31:57,744
ca asta va iesi la fel. Cei 30

54285
40:31:55,440 --> 40:32:01,664
24 fie că transpun a și b sau

54286
40:31:57,744 --> 40:32:03,440
transpune-le pe amândouă la final.

54287
40:32:01,664 --> 40:32:06,000
Și, la fel, putem foarte ușor

54288
40:32:03,440 --> 40:32:11,200
scădeți doi vectori. Pot să merg în minus

54289
40:32:06,000 --> 40:32:13,024
b. Și rulăm asta și obținem - 106. Acum

54290
40:32:11,200 --> 40:32:14,320
amintiți-vă, aceasta este ultima linie din aceasta

54291
40:32:13,024 --> 40:32:17,104
o anumită secțiune. De aceea nu o fac

54292
40:32:14,320 --> 40:32:20,000
trebuie să puneți amprenta în jurul ei. Hm, și

54293
40:32:17,104 --> 40:32:22,640
la fel cum am făcut înainte, putem

54294
40:32:20,000 --> 40:32:25,200
transpune fie individul, fie noi

54295
40:32:22,640 --> 40:32:30,440
poate transpune configurația principală și apoi noi

54296
40:32:25,200 --> 40:32:30,440
obține un minus 106 mergând în sens invers.

54297
40:32:30,800 --> 40:32:35,600
Acum, nu am menționat asta în documentul nostru

54298
40:32:32,480 --> 40:32:37,104
note, dar puteți face și un scalar

54299
40:32:35,600 --> 40:32:38,880
înmulțire.

54300
40:32:37,104 --> 40:32:41,280
Lasă-mă să pun jos scaler ca să poți

54301
40:32:38,880 --> 40:32:45,440
amintiți-vă că. Ce vorbim

54302
40:32:41,280 --> 40:32:51,024
cam aici am această matrice aici

54303
40:32:45,440 --> 40:32:52,800
u și dacă merg un timp u uh vom lua

54304
40:32:51,024 --> 40:32:58,720
valoarea doi o vom înmulți cu fiecare

54305
40:32:52,800 --> 40:33:01,360
valoare aici. Deci 2 * 30 este 60 2 * 15

54306
40:32:58,720 --> 40:33:03,440
și la fel cum am făcut înainte

54307
40:33:01,360 --> 40:33:04,960
um asta se întâmplă des pentru că când

54308
40:33:03,440 --> 40:33:08,960
faci matrice de care trebuie

54309
40:33:04,960 --> 40:33:11,664
Întoarceți-le, veți obține 6030 venind pe aici.

54310
40:33:08,960 --> 40:33:14,664
Deci, în numpy uh avem cum se numesc ei

54311
40:33:11,664 --> 40:33:14,664
produs punctual

54312
40:33:14,960 --> 40:33:18,640
și ce asta într-un

54313
40:33:16,800 --> 40:33:21,600
vectori bidimensionali este

54314
40:33:18,640 --> 40:33:22,640
echivalentul înmulțirii cu două matrice

54315
40:33:21,600 --> 40:33:24,720
și amintiți-vă despre care vorbeam

54316
40:33:22,640 --> 40:33:27,920
înmulțirea matriceală

54317
40:33:24,720 --> 40:33:30,240
unde este fântâna hai să mergem

54318
40:33:27,920 --> 40:33:32,960
prin ea

54319
40:33:30,240 --> 40:33:37,280
vom merge mai departe și vom începe prin a defini două

54320
40:33:32,960 --> 40:33:39,664
um numpy tablouri vom avea uh 10 20 256

54321
40:33:37,280 --> 40:33:43,360
sau u-ul nostru și E-ul nostru și apoi suntem

54322
40:33:39,664 --> 40:33:45,744
o să mergem înainte și să facem dacă luăm

54323
40:33:43,360 --> 40:33:47,920
valorile uh și dacă vă amintiți

54324
40:33:45,744 --> 40:33:52,160
corect

54325
40:33:47,920 --> 40:33:58,840
o matrice ca aceasta ar fi 10 * 25 20

54326
40:33:52,160 --> 40:33:58,840
* 6. Vom merge înainte și vom imprima asta.

54327
40:34:00,320 --> 40:34:05,744
Iată-ne.

54328
40:34:02,480 --> 40:34:10,520
Și apoi vom merge înainte și vom face uh np

54329
40:34:05,744 --> 40:34:10,520
punct din virgulă

54330
40:34:10,560 --> 40:34:14,320
v.

54331
40:34:12,160 --> 40:34:17,280
Și vom găsi când vom face asta, vom merge

54332
40:34:14,320 --> 40:34:18,880
și rulează asta, uh, vom obține uh

54333
40:34:17,280 --> 40:34:20,480
370

54334
40:34:18,880 --> 40:34:22,320
370.

54335
40:34:20,480 --> 40:34:26,720
Deci aceasta este o multiplicare a tulpinii unde

54336
40:34:22,320 --> 40:34:28,880
ei îl folosesc pentru a rezolva algebra liniară

54337
40:34:26,720 --> 40:34:30,640
uh, când ai mai multe numere

54338
40:34:28,880 --> 40:34:31,920
peste. Și așa ar putea fi foarte

54339
40:34:30,640 --> 40:34:33,520
complicat. Am putea avea un întreg

54340
40:34:31,920 --> 40:34:35,840
șir de variabile diferite care intră

54341
40:34:33,520 --> 40:34:39,744
aici. Dar pentru asta primim un uh frumos

54342
40:34:35,840 --> 40:34:42,640
valoare pentru înmulțirea noastră de puncte

54343
40:34:39,744 --> 40:34:44,800
și am adăugat mai devreme care a fost

54344
40:34:42,640 --> 40:34:46,384
doar adaosul tău de bază. Uh și de

54345
40:34:44,800 --> 40:34:48,960
desigur, o matrice pe care o poți obține foarte

54346
40:34:46,384 --> 40:34:51,744
complicat pe acestea sau în acest caz

54347
40:34:48,960 --> 40:34:55,104
Vom merge înainte și facem să creăm

54348
40:34:51,744 --> 40:34:59,520
două matrice complexe.

54349
40:34:55,104 --> 40:35:02,960
Aceasta este o matrice a um știi 1210

54350
40:34:59,520 --> 40:35:04,160
46 431. Vom imprima doar A, pentru tine

54351
40:35:02,960 --> 40:35:06,960
pot vedea cum arată. Iată

54352
40:35:04,160 --> 40:35:09,280
imprima A.

54353
40:35:06,960 --> 40:35:13,360
Tipărim A. Puteți vedea că avem

54354
40:35:09,280 --> 40:35:16,160
a um 2x3

54355
40:35:13,360 --> 40:35:18,384
matrice de straturi pentru A. Și mai putem pune

54356
40:35:16,160 --> 40:35:20,720
împreună, întotdeauna sunt distractive când ești

54357
40:35:18,384 --> 40:35:22,560
jucându-se cu valorile tipărite. Am putea

54358
40:35:20,720 --> 40:35:25,744
fa asa ceva. Am putea intra

54359
40:35:22,560 --> 40:35:29,600
aici. Iată-ne. Am putea tipări o.

54360
40:35:25,744 --> 40:35:31,360
Avem sfârșitul cu uh equals a run. Şi

54361
40:35:29,600 --> 40:35:33,744
acest fel îi dă un aspect frumos. Uh,

54362
40:35:31,360 --> 40:35:35,600
iată matricea ta. Asta este tot.

54363
40:35:33,744 --> 40:35:37,664
Virgulă, n înseamnă că doar îl etichetează pe

54364
40:35:35,600 --> 40:35:39,920
sfârşitul. Asta e tot ce face

54365
40:35:37,664 --> 40:35:42,000
acolo. Și apoi putem pur și simplu să adăugăm

54366
40:35:39,920 --> 40:35:43,360
ce este un plus b. Și ar trebui deja

54367
40:35:42,000 --> 40:35:45,280
ghici pentru că aceasta este la fel cu ce

54368
40:35:43,360 --> 40:35:47,520
am făcut înainte. Nu este nicio diferență.

54369
40:35:45,280 --> 40:35:51,440
Uh, facem o simplă adăugare vectorială. Noi

54370
40:35:47,520 --> 40:35:54,640
au 12 2 este 14, 10 8 este 18. Și așa

54371
40:35:51,440 --> 40:35:58,720
pe. Și la fel cum am făcut matricea

54372
40:35:54,640 --> 40:36:01,104
în plus, putem face și un minus b și

54373
40:35:58,720 --> 40:36:03,664
faceți scăderea matricei noastre.

54374
40:36:01,104 --> 40:36:10,840
Și ne uităm la asta, ce avem? 12

54375
40:36:03,664 --> 40:36:10,840
- 2 este 10. 10 - 8 um unde suntem?

54376
40:36:11,920 --> 40:36:16,560
Oh, iată-ne. 8 min

54377
40:36:15,104 --> 40:36:18,384
confuz la ce mă uit. ar trebui

54378
40:36:16,560 --> 40:36:21,280
au retipărit numerele originale.

54379
40:36:18,384 --> 40:36:25,920
Uh, dar putem vedea aici 12 - 2 este de

54380
40:36:21,280 --> 40:36:28,720
cursul 10. 10 - 8 este 2. Uh 4 - 46 este -

54381
40:36:25,920 --> 40:36:30,320
42 și așa mai departe. Deci la fel ca a

54382
40:36:28,720 --> 40:36:33,840
scăderea ca înainte, o numim doar

54383
40:36:30,320 --> 40:36:35,744
scăderea matricei. Este identic.

54384
40:36:33,840 --> 40:36:37,840
Acum, dacă vă amintiți aici, am avut

54385
40:36:35,744 --> 40:36:41,200
adăugare scalară în care adăugăm doar

54386
40:36:37,840 --> 40:36:44,160
un număr la o matrice. De asemenea, puteți face

54387
40:36:41,200 --> 40:36:46,384
înmulțirea scalară. Uh și atât de simplu

54388
40:36:44,160 --> 40:36:48,800
dacă ai o singură valoare A și tu

54389
40:36:46,384 --> 40:36:53,104
au B care este matricea ta, putem de asemenea

54390
40:36:48,800 --> 40:36:57,024
fă A * B. Când vom rula asta, uh, poți

54391
40:36:53,104 --> 40:36:59,280
vezi aici avem 2 * 4 este 8. Uh, 5 * 4

54392
40:36:57,024 --> 40:37:01,024
este 20 și așa mai departe. Doar ești

54393
40:36:59,280 --> 40:37:03,840
înmulțind cele patru peste fiecare dintre

54394
40:37:01,024 --> 40:37:06,240
aceste valori. Și acesta este un interesant

54395
40:37:03,840 --> 40:37:09,360
unul care apare. Un pic de a

54396
40:37:06,240 --> 40:37:11,664
teaserul creierului este matrice și vector

54397
40:37:09,360 --> 40:37:14,640
înmulțire.

54398
40:37:11,664 --> 40:37:17,104
Și atunci când ne uităm la asta,

54399
40:37:14,640 --> 40:37:18,384
uh, facem doar o matrice obișnuită. Ea

54400
40:37:17,104 --> 40:37:21,024
nu trebuie neapărat să fie un numpy

54401
40:37:18,384 --> 40:37:25,440
matrice. Avem o

54402
40:37:21,024 --> 40:37:28,000
care are matricea noastră um de matrice și b

54403
40:37:25,440 --> 40:37:30,880
care este o singură matrice și așa putem

54404
40:37:28,000 --> 40:37:33,024
de aici

54405
40:37:30,880 --> 40:37:36,320
face punctul

54406
40:37:33,024 --> 40:37:39,024
a b și aceasta va returna doi

54407
40:37:36,320 --> 40:37:41,200
valori și prima valoare este că este

54408
40:37:39,024 --> 40:37:45,024
ai putea spune că e ca și cum am fi

54409
40:37:41,200 --> 40:37:47,664
făcând mai întâi această matrice b matrice

54410
40:37:45,024 --> 40:37:49,104
a și apoi cu un al doilea și așa

54411
40:37:47,664 --> 40:37:50,800
îl împarte astfel încât să ai o matrice de

54412
40:37:49,104 --> 40:37:52,480
înmulțirea vectorială și amestecați și

54413
40:37:50,800 --> 40:37:54,800
meci. Când intri într-adevăr

54414
40:37:52,480 --> 40:37:56,880
chestii complicate de backend, asta

54415
40:37:54,800 --> 40:37:59,664
devine mai comun pentru că ești acum

54416
40:37:56,880 --> 40:38:02,160
ai straturi peste straturi de date și

54417
40:37:59,664 --> 40:38:04,384
deci vei ajunge cu o matrice și o

54418
40:38:02,160 --> 40:38:06,240
set de matrici vectoriale uh. vrei

54419
40:38:04,384 --> 40:38:09,200
sa se inmulteasca?

54420
40:38:06,240 --> 40:38:11,200
Acum, ține cont că dacă faci

54421
40:38:09,200 --> 40:38:12,640
știința datelor, de multe ori nu ești

54422
40:38:11,200 --> 40:38:15,360
privind la asta. Aceasta este ceea ce se întâmplă

54423
40:38:12,640 --> 40:38:17,744
în culise. Deci, dacă ești în um

54424
40:38:15,360 --> 40:38:20,000
scikit-ul uitându-se la sklearn unde

54425
40:38:17,744 --> 40:38:21,600
faci modele de regresie liniară,

54426
40:38:20,000 --> 40:38:24,240
aceasta este o parte din matematica care este ascunsă

54427
40:38:21,600 --> 40:38:26,000
în culise care se întâmplă. Altele

54428
40:38:24,240 --> 40:38:28,240
ori în care s-ar putea să te trezești nevoit

54429
40:38:26,000 --> 40:38:30,000
faceți o parte din aceasta și manipulați datele

54430
40:38:28,240 --> 40:38:31,920
în jur ca să se potrivească bine și apoi pleci

54431
40:38:30,000 --> 40:38:36,160
înapoi înăuntru și îl treci prin

54432
40:38:31,920 --> 40:38:39,024
scikit. Și dacă putem face aici sus

54433
40:38:36,160 --> 40:38:41,024
unde am făcut o matrice și un vector

54434
40:38:39,024 --> 40:38:43,520
înmulțire, putem face și matrice

54435
40:38:41,024 --> 40:38:45,744
înmulțirea matriceală. Și dacă alergăm

54436
40:38:43,520 --> 40:38:47,104
aici avem cele două matrici, uh

54437
40:38:45,744 --> 40:38:48,720
puteți vedea că avem un lucru foarte complicat

54438
40:38:47,104 --> 40:38:52,000
matrice care, desigur, iese acolo

54439
40:38:48,720 --> 40:38:54,080
pentru punctul nostru. Și doar ca să o repet,

54440
40:38:52,000 --> 40:38:57,664
avem transpunerea noastră o matrice care este

54441
40:38:54,080 --> 40:38:59,744
dvs. T. Și deci dacă creăm o matrice A

54442
40:38:57,664 --> 40:39:04,320
și apoi îl transpunem, puteți vedea

54443
40:38:59,744 --> 40:39:10,720
cum îl întoarce de la 5 10 15 20 25 30 la

54444
40:39:04,320 --> 40:39:12,720
5 15 25 10 20 30 uh rânduri și coloane.

54445
40:39:10,720 --> 40:39:15,440
Și cu siguranță cu matematica, uh, asta

54446
40:39:12,720 --> 40:39:17,600
apare mult. Um, apare și a

54447
40:39:15,440 --> 40:39:19,920
lot cu grafic XY. Când îl pui

54448
40:39:17,600 --> 40:39:21,600
în piplot, aveți un format în care

54449
40:39:19,920 --> 40:39:24,000
se uită la perechi de numere şi

54450
40:39:21,600 --> 40:39:25,840
atunci ei vor toți X și toți Y.

54451
40:39:24,000 --> 40:39:27,920
Deci, știi, transpunerea este o

54452
40:39:25,840 --> 40:39:30,384
instrument important atât pentru matematică cât și

54453
40:39:27,920 --> 40:39:32,960
pentru complot și tot felul de lucruri.

54454
40:39:30,384 --> 40:39:37,200
Un alt instrument despre care nu am discutat

54455
40:39:32,960 --> 40:39:40,080
este matricea ta de identitate. Uh și acesta

54456
40:39:37,200 --> 40:39:43,664
este mai multă definiție.

54457
40:39:40,080 --> 40:39:46,160
Uh, matricea de identitate. Avem aici

54458
40:39:43,664 --> 40:39:51,024
unul în care tocmai am făcut două. Deci

54459
40:39:46,160 --> 40:39:53,664
se reduce ca unul 0 0 1 uh 1 0 0 1 0. It

54460
40:39:51,024 --> 40:39:55,920
creează o diagonală de unu. Și ce asta

54461
40:39:53,664 --> 40:39:58,080
Este atunci când îți faci identitățile,

54462
40:39:55,920 --> 40:40:00,000
ai putea compara toate

54463
40:39:58,080 --> 40:40:02,480
caracteristici diferite la diferite

54464
40:40:00,000 --> 40:40:04,560
caracteristicile și modul în care acestea se corelează. Și de

54465
40:40:02,480 --> 40:40:06,880
Bineînțeles, când ai o caracteristică

54466
40:40:04,560 --> 40:40:10,960
în comparație cu caracteristica una în sine este

54467
40:40:06,880 --> 40:40:12,384
întotdeauna unul uh unde este de obicei între

54468
40:40:10,960 --> 40:40:14,560
zero unu in functie de cat de bine

54469
40:40:12,384 --> 40:40:16,384
se corelează. Deci când vorbim despre

54470
40:40:14,560 --> 40:40:18,640
matricea identitară asta suntem

54471
40:40:16,384 --> 40:40:20,800
vorbind chiar aici este că tu

54472
40:40:18,640 --> 40:40:22,480
creați această matrice prestabilită și apoi dvs

54473
40:40:20,800 --> 40:40:23,744
ar putea ajusta aceste numere în funcție de

54474
40:40:22,480 --> 40:40:26,160
cu ce lucrezi și cu ce

54475
40:40:23,744 --> 40:40:28,240
domeniul este. Și apoi un alt lucru putem

54476
40:40:26,160 --> 40:40:30,480
face uh să închei asta. Vom lovi

54477
40:40:28,240 --> 40:40:34,160
tu cu cel mai complicat uh um

54478
40:40:30,480 --> 40:40:37,520
piesă din acest puzzle aici este inversă

54479
40:40:34,160 --> 40:40:41,920
um o matrice. Și să mergem înainte și

54480
40:40:37,520 --> 40:40:43,360
pune um este o descriere lungă.

54481
40:40:41,920 --> 40:40:46,880
Hai sa punem descrierea. Aceasta

54482
40:40:43,360 --> 40:40:50,720
este direct de pe site-ul web

54483
40:40:46,880 --> 40:40:53,200
pentru um numpy. Da un pătrat

54484
40:40:50,720 --> 40:40:57,104
matricea A, iată matricea noastră pătrată A,

54485
40:40:53,200 --> 40:40:59,920
care este 2 1 0 0 1 0 1 2 1. Rețineți

54486
40:40:57,104 --> 40:41:02,320
3x3, este pătrat. Trebuie să fie egal.

54487
40:40:59,920 --> 40:41:06,800
Va returna matricea A

54488
40:41:02,320 --> 40:41:10,720
punct satisfacator invers A um A invers.

54489
40:41:06,800 --> 40:41:13,600
Deci, iată multiplicarea noastră matriceală.

54490
40:41:10,720 --> 40:41:17,200
Um și apoi, desigur, este egal cu punctul

54491
40:41:13,600 --> 40:41:20,160
uh da, inversul unui um cu un

54492
40:41:17,200 --> 40:41:23,024
forma identităţii unui zero în formă de punct.

54493
40:41:20,160 --> 40:41:25,104
Aceasta este doar remodelarea identității.

54494
40:41:23,024 --> 40:41:27,744
E puțin complicat acolo. Da

54495
40:41:25,104 --> 40:41:30,160
mergem și avem aici matricea noastră. Uh

54496
40:41:27,744 --> 40:41:32,720
vom merge înainte și vom rula asta. Și poți

54497
40:41:30,160 --> 40:41:36,240
vezi cu ce ajungem este să ajungem

54498
40:41:32,720 --> 40:41:40,480
cu o matrice 0,5 minus 0,5 și așa

54499
40:41:36,240 --> 40:41:44,640
mai departe cu 211 coborând la 1 0 0 1

54500
40:41:40,480 --> 40:41:47,104
0 1 2 1. Pătruns puțin adânc

54501
40:41:44,640 --> 40:41:49,440
pe înțelegerea matematicii atunci când aveți nevoie

54502
40:41:47,104 --> 40:41:50,800
acesta este probabil cu adevărat este ceea ce este

54503
40:41:49,440 --> 40:41:54,080
foarte important atunci când faci date

54504
40:41:50,800 --> 40:41:55,664
știință versus scrisul de mână

54505
40:41:54,080 --> 40:41:57,664
și caută matematica și scrisul de mână

54506
40:41:55,664 --> 40:42:00,560
toate piesele scoase. trebuie sa stii

54507
40:41:57,664 --> 40:42:02,320
despre algoritmul liniar invers al lui a.

54508
40:42:00,560 --> 40:42:03,664
Deci, dacă apare, poți cu ușurință

54509
40:42:02,320 --> 40:42:06,000
trage-l în sus sau măcar amintește-ți unde

54510
40:42:03,664 --> 40:42:07,840
caută-l. Ai aruncat o privire la

54511
40:42:06,000 --> 40:42:10,240
partea algebrică a acestuia. Să mergem înainte și

54512
40:42:07,840 --> 40:42:11,664
aruncați o privire la partea de calcul a uh

54513
40:42:10,240 --> 40:42:14,960
ce se întâmplă aici cu mașina

54514
40:42:11,664 --> 40:42:16,560
învăţarea. Deci calcul, Doamne,

54515
40:42:14,960 --> 40:42:18,080
și ecuații diferențiale, trebuie

54516
40:42:16,560 --> 40:42:21,440
aruncă asta acolo pentru că asta-i tot

54517
40:42:18,080 --> 40:42:23,024
parte din sacul de trucuri, mai ales

54518
40:42:21,440 --> 40:42:25,520
când faci rețele neuronale mari,

54519
40:42:23,024 --> 40:42:27,280
dar apare și în multe alte domenii.

54520
40:42:25,520 --> 40:42:29,440
Vestea bună este că cea mai mare parte este deja

54521
40:42:27,280 --> 40:42:30,960
făcut pentru tine în spate. Uh, atunci când

54522
40:42:29,440 --> 40:42:32,720
apare, chiar trebuie

54523
40:42:30,960 --> 40:42:34,480
înțeleg din știința datelor, nu

54524
40:42:32,720 --> 40:42:36,720
analiza datelor. Analiza datelor înseamnă

54525
40:42:34,480 --> 40:42:39,360
de fapt sapi adânc

54526
40:42:36,720 --> 40:42:41,104
rezolvarea acestor ecuații matematice. U și a

54527
40:42:39,360 --> 40:42:43,920
rețeaua neuronală este doar un gigant

54528
40:42:41,104 --> 40:42:45,920
ecuație diferențială. Deci vorbim

54529
40:42:43,920 --> 40:42:49,664
despre calcul, vom merge

54530
40:42:45,920 --> 40:42:53,664
înainte și înțelegeți-l vorbind despre

54531
40:42:49,664 --> 40:42:56,480
mașini față de timp și viteză. uh, deci ajută

54532
40:42:53,664 --> 40:42:58,160
pentru a calcula rata spontană a

54533
40:42:56,480 --> 40:43:00,080
schimbare.

54534
40:42:58,160 --> 40:43:02,560
Să presupunem că tragem un grafic al

54535
40:43:00,080 --> 40:43:04,640
viteza unei mașini în raport cu timpul. Deci

54536
40:43:02,560 --> 40:43:06,960
după cum puteți vedea aici coborând

54537
40:43:04,640 --> 40:43:09,360
autostrada probabil s-a contopit cu autostrada

54538
40:43:06,960 --> 40:43:12,320
de pe o rampă de acces. Așa că a trebuit să accelerez

54539
40:43:09,360 --> 40:43:15,024
așa că viteza mea a crescut mult, uh, blocat

54540
40:43:12,320 --> 40:43:16,800
traficul fuzionat în trafic. Trafic

54541
40:43:15,024 --> 40:43:19,744
se deschide si accelerez din nou pana la

54542
40:43:16,800 --> 40:43:22,000
limita de viteză și poate că Peters

54543
40:43:19,744 --> 40:43:25,744
de acolo sus. Deci poți privi asta ca

54544
40:43:22,000 --> 40:43:26,880
ca um viteza față de timp. primesc

54545
40:43:25,744 --> 40:43:29,200
din ce în ce mai repede pentru că sunt

54546
40:43:26,880 --> 40:43:31,744
accelerând continuu. Și dacă lovesc

54547
40:43:29,200 --> 40:43:33,520
frânele, merge în sens invers. Deci

54548
40:43:31,744 --> 40:43:36,560
rata de schimbare a vitezei în raport cu

54549
40:43:33,520 --> 40:43:38,560
timpul nu este altceva decât accelerație. Cum

54550
40:43:36,560 --> 40:43:40,160
accelerăm repede? The

54551
40:43:38,560 --> 40:43:42,160
accelerația este aria dintre

54552
40:43:40,160 --> 40:43:46,480
punctul de început al lui x și punctul final al

54553
40:43:42,160 --> 40:43:48,720
delta x. Ca să putem calcula un simplu

54554
40:43:46,480 --> 40:43:51,744
daca ai avea x si delta x am putea pune a

54555
40:43:48,720 --> 40:43:53,744
linie acolo și acea pantă a dreptei este

54556
40:43:51,744 --> 40:43:55,840
accelerația noastră.

54557
40:43:53,744 --> 40:43:58,160
Acum e destul de ușor când faci

54558
40:43:55,840 --> 40:44:00,000
algebră liniară dar nu vreau să știu

54559
40:43:58,160 --> 40:44:02,080
este doar pentru acea linie și cele două

54560
40:44:00,000 --> 40:44:04,384
puncte. Vreau să știu peste

54561
40:44:02,080 --> 40:44:06,640
întregul cu care lucrez. Asta e

54562
40:44:04,384 --> 40:44:08,160
unde intrăm în calcul. Deci când noi

54563
40:44:06,640 --> 40:44:10,320
vorbiți despre distanța dintre x și

54564
40:44:08,160 --> 40:44:12,640
delta x trebuie să fie cel mai mic

54565
40:44:10,320 --> 40:44:15,664
posibil aproape de zero pentru a

54566
40:44:12,640 --> 40:44:17,920
aproximați accelerația.

54567
40:44:15,664 --> 40:44:19,840
Deci ideea este că în loc de vreau să spun

54568
40:44:17,920 --> 40:44:22,880
dacă ai luat vreodată un calcul de bază

54569
40:44:19,840 --> 40:44:25,360
clasă ar trage bare aici jos și

54570
40:44:22,880 --> 40:44:27,360
ai împărți această zonă, haideți

54571
40:44:25,360 --> 40:44:30,160
merge înapoi pe un ecran. tu imparti asta

54572
40:44:27,360 --> 40:44:32,384
zonă a acestei perioade de timp până poate

54573
40:44:30,160 --> 40:44:34,160
10 secțiuni și ai folosi asta și tu

54574
40:44:32,384 --> 40:44:35,920
putea calcula accelerația dintre

54575
40:44:34,160 --> 40:44:38,240
fiecare dintre acele 10 secțiuni

54576
40:44:35,920 --> 40:44:40,800
lucru. Uh și apoi continuăm să facem

54577
40:44:38,240 --> 40:44:44,320
acel spațiu din ce în ce mai mic până când

54578
40:44:40,800 --> 40:44:48,160
delta x este aproape uh infantil

54579
40:44:44,320 --> 40:44:51,840
mici. Și astfel obținem o funcție de uh

54580
40:44:48,160 --> 40:44:54,000
este egal cu o limită pe măsură ce h merge la zero al lui a

54581
40:44:51,840 --> 40:44:57,200
funcția unui plus h minus o funcție a

54582
40:44:54,000 --> 40:45:00,080
a peste h. Și asta calculezi

54583
40:44:57,200 --> 40:45:01,840
panta dreptei.

54584
40:45:00,080 --> 40:45:04,640
Doar calculăm panta de sub

54585
40:45:01,840 --> 40:45:06,800
probe din ce în ce mai mici din ce în ce mai mici.

54586
40:45:04,640 --> 40:45:08,880
Uh și asta este calculul. Calculul

54587
40:45:06,800 --> 40:45:11,280
este integrala. Puteți vedea aici jos

54588
40:45:08,880 --> 40:45:13,920
Avem frumosul nostru semn integral. Aspecte

54589
40:45:11,280 --> 40:45:16,320
ca un gigant s. Și asta este

54590
40:45:13,920 --> 40:45:20,384
înseamnă că am luat asta până la

54591
40:45:16,320 --> 40:45:22,160
cât de mic putem pentru acea prelevare. Uh

54592
40:45:20,384 --> 40:45:24,960
deci vorbim de calcul. Găsind

54593
40:45:22,160 --> 40:45:27,840
zona de sub panta este principala

54594
40:45:24,960 --> 40:45:29,744
proces în integrare. Similar

54595
40:45:27,840 --> 40:45:32,640
intervale mici sunt făcute din cele mai mici

54596
40:45:29,744 --> 40:45:35,280
lungimea posibilă a lui x plus delta x unde

54597
40:45:32,640 --> 40:45:37,664
delta x se apropie aproape de un infantism

54598
40:45:35,280 --> 40:45:39,840
spatiu mic. Și apoi ajută să găsești

54599
40:45:37,664 --> 40:45:42,240
accelerația globală prin însumare

54600
40:45:39,840 --> 40:45:44,080
toate lungimile împreună. Uh, deci suntem

54601
40:45:42,240 --> 40:45:46,480
însumând toate acceleraţiile din

54602
40:45:44,080 --> 40:45:50,960
de la început până la sfârșit. Și așa iată

54603
40:45:46,480 --> 40:45:55,024
integrala noastra. însumăm a lui x * d ofx =

54604
40:45:50,960 --> 40:45:57,440
a c. Acesta este calculul nostru de bază

54605
40:45:55,024 --> 40:46:01,024
aici. Deci când vorbim despre

54606
40:45:57,440 --> 40:46:02,800
calcul multivariant, uh multivariat

54607
40:46:01,024 --> 40:46:05,520
calculul se ocupă cu funcţiile care au

54608
40:46:02,800 --> 40:46:06,800
mai multe variabile și puteți vedea aici

54609
40:46:05,520 --> 40:46:10,640
începem să intrăm în unele foarte

54610
40:46:06,800 --> 40:46:13,360
ecuații complicate. Um uh schimbare în w

54611
40:46:10,640 --> 40:46:16,320
peste schimbarea timpului este egală cu schimbarea lui w

54612
40:46:13,360 --> 40:46:19,104
peste schimbarea lui z. diferenţialul lui z

54613
40:46:16,320 --> 40:46:21,104
la dx diferența de la x la dt. Se ajunge

54614
40:46:19,104 --> 40:46:23,200
destul de complicat. Uh și într-adevăr

54615
40:46:21,104 --> 40:46:25,520
se traduce în multivariat

54616
40:46:23,200 --> 40:46:28,080
integrare folosind integrale duble. Şi

54617
40:46:25,520 --> 40:46:31,920
deci aveți suma sumei lui f

54618
40:46:28,080 --> 40:46:36,240
ofxy al lui d al a este egal cu suma de la c la

54619
40:46:31,920 --> 40:46:40,000
d și a la b din f ofxy dx dy este egal cu uh

54620
40:46:36,240 --> 40:46:42,480
suma a la b suma a c la d a lui fxy

54621
40:46:40,000 --> 40:46:44,880
dy dx.

54622
40:46:42,480 --> 40:46:46,880
înțelegând însăși specificul

54623
40:46:44,880 --> 40:46:50,240
totul se întâmplă aici și de fapt

54624
40:46:46,880 --> 40:46:52,960
a face calculul este de obicei unul de calcul,

54625
40:46:50,240 --> 40:46:54,240
calculul 2 și ecuațiile diferențiale.

54626
40:46:52,960 --> 40:46:57,440
Deci vorbești despre trei

54627
40:46:54,240 --> 40:47:00,000
cursuri de lungă durată pentru a explora și rezolva

54628
40:46:57,440 --> 40:47:01,440
aceste ecuații matematice. Ce vrem noi

54629
40:47:00,000 --> 40:47:04,560
ia de aici despre care vorbim

54630
40:47:01,440 --> 40:47:07,104
calculul. Vorbim despre însumare

54631
40:47:04,560 --> 40:47:09,520
dintre toate aceste pante diferite. Și așa

54632
40:47:07,104 --> 40:47:13,520
încă rezolvăm un uh liniar

54633
40:47:09,520 --> 40:47:15,440
expresie. Încă rezolvăm y = mx  

54634
40:47:13,520 --> 40:47:17,600
b, dar facem asta pentru

54635
40:47:15,440 --> 40:47:19,104
x-uri mici infantil. Și apoi noi

54636
40:47:17,600 --> 40:47:21,520
vreau să le rezumăm. Asta este

54637
40:47:19,104 --> 40:47:25,024
semn integral înseamnă. Suma unui din

54638
40:47:21,520 --> 40:47:27,200
x d din x= a plus c.

54639
40:47:25,024 --> 40:47:29,440
Și când vezi astea foarte complicate

54640
40:47:27,200 --> 40:47:31,920
uh diferențierea multivariată folosind

54641
40:47:29,440 --> 40:47:34,080
lanțul guvernează când venim aici

54642
40:47:31,920 --> 40:47:37,664
și avem schimbarea lui w la

54643
40:47:34,080 --> 40:47:40,160
schimbarea lui t este egală cu schimbarea lui w dz uh

54644
40:47:37,664 --> 40:47:41,664
si asa mai departe. Asta se întâmplă

54645
40:47:40,160 --> 40:47:43,840
aici. Asta înseamnă acestea. Suntem

54646
40:47:41,664 --> 40:47:46,640
practic căutând zona de sub

54647
40:47:43,840 --> 40:47:49,520
curba care vine cu adevărat la cum este

54648
40:47:46,640 --> 40:47:51,360
schimbarea se schimbă și viteza crește.

54649
40:47:49,520 --> 40:47:53,600
Cum se schimbă asta? Și apoi termini

54650
40:47:51,360 --> 40:47:55,664
sus cu un strat multiplu. Deci dacă am

54651
40:47:53,600 --> 40:47:57,840
trei straturi de rețele neuronale, cum este

54652
40:47:55,664 --> 40:47:59,440
al treilea strat se schimbă pe baza

54653
40:47:57,840 --> 40:48:01,440
schimbarea celui de-al doilea strat care se bazează pe

54654
40:47:59,440 --> 40:48:03,200
primul strat se schimbă? Și primești

54655
40:48:01,440 --> 40:48:06,480
poza aici pe care acum o avem foarte

54656
40:48:03,200 --> 40:48:08,960
integrare multivariată complicată

54657
40:48:06,480 --> 40:48:11,840
cu integrale.

54658
40:48:08,960 --> 40:48:13,280
Vestea bună este că putem rezolva asta

54659
40:48:11,840 --> 40:48:14,880
matematic și asta facem

54660
40:48:13,280 --> 40:48:17,360
când faci rețele neuronale și invers

54661
40:48:14,880 --> 40:48:18,800
propagare. Deci, lucrul frumos este

54662
40:48:17,360 --> 40:48:20,720
pe care nu trebuie să rezolvi asta

54663
40:48:18,800 --> 40:48:22,560
hârtie dacă nu ești o analiză a datelor și

54664
40:48:20,720 --> 40:48:24,160
lucrezi la partea din spate a

54665
40:48:22,560 --> 40:48:26,000
integrând aceste formule şi construind

54666
40:48:24,160 --> 40:48:28,240
scenariul pentru a le construi efectiv. Deci noi

54667
40:48:26,000 --> 40:48:30,160
vorbim despre aplicații ale calculului. Uh

54668
40:48:28,240 --> 40:48:32,720
ne oferă instrumentele pentru a construi un

54669
40:48:30,160 --> 40:48:34,800
model predictiv precis. Um asa este

54670
40:48:32,720 --> 40:48:36,240
cu adevărat în culise ne dorim

54671
40:48:34,800 --> 40:48:38,480
ghici care este schimbarea schimbării

54672
40:48:36,240 --> 40:48:40,640
al schimbării este.

54673
40:48:38,480 --> 40:48:41,920
E un pic prostesc. Eu știu că doar

54674
40:48:40,640 --> 40:48:44,320
a aruncat asta acolo. Este un fel de a

54675
40:48:41,920 --> 40:48:46,320
meta termen. Dar dacă poți ghici cum

54676
40:48:44,320 --> 40:48:48,480
lucrurile se vor schimba, atunci poți

54677
40:48:46,320 --> 40:48:51,024
ghici care sunt noile numere.

54678
40:48:48,480 --> 40:48:52,960
Calculul multivariat explică

54679
40:48:51,024 --> 40:48:54,800
modificarea variabilei noastre țintă în

54680
40:48:52,960 --> 40:48:57,920
raport cu rata de schimbare în

54681
40:48:54,800 --> 40:49:00,384
variabile de intrare. Deci, există multiplu nostru

54682
40:48:57,920 --> 40:49:01,840
variabile care intră acolo. Dacă unul

54683
40:49:00,384 --> 40:49:04,960
variabila se schimbă, cum afectează aceasta

54684
40:49:01,840 --> 40:49:07,280
cealalta variabila? Și apoi în gradient

54685
40:49:04,960 --> 40:49:10,800
coborâre, calculul este folosit pentru a găsi

54686
40:49:07,280 --> 40:49:12,800
maxime locale și globale. Și aceasta este

54687
40:49:10,800 --> 40:49:14,640
cu adevărat mare. Uh, chiar o vom face

54688
40:49:12,800 --> 40:49:18,000
au o secțiune întreagă aici despre gradient

54689
40:49:14,640 --> 40:49:19,920
coborâre pentru că este cu adevărat, vreau să spun eu

54690
40:49:18,000 --> 40:49:21,520
a vorbit despre rețelele neuronale și despre cum tu

54691
40:49:19,920 --> 40:49:23,840
pot vedea cum intră diferitele straturi

54692
40:49:21,520 --> 40:49:26,800
acolo, dar coborârea în gradient este una dintre

54693
40:49:23,840 --> 40:49:30,160
cele mai importante lucruri pentru a încerca să ghicească

54694
40:49:26,800 --> 40:49:33,840
cel mai bun răspuns la ceva. Deci haideți

54695
40:49:30,160 --> 40:49:36,640
aruncați o privire la codul din spatele gradientului

54696
40:49:33,840 --> 40:49:39,520
coborâre. Și înainte să deschidem

54697
40:49:36,640 --> 40:49:42,640
cod, hai să facem foarte repede uh

54698
40:49:39,520 --> 40:49:44,960
coborâre în gradient.

54699
40:49:42,640 --> 40:49:47,664
Să presupunem că avem o curbă ca aceasta. Şi

54700
40:49:44,960 --> 40:49:51,664
cel mai obișnuit este că acest lucru se întâmplă

54701
40:49:47,664 --> 40:49:55,024
reprezintă eroarea ta. Hopa!

54702
40:49:51,664 --> 40:49:57,200
Eroare. Iată-ne. Eroare. Ah, greu

54703
40:49:55,024 --> 40:50:00,320
citeste acolo. Și vreau să fac o eroare

54704
40:49:57,200 --> 40:50:02,560
cât mai jos posibil. Și așa sunt

54705
40:50:00,320 --> 40:50:07,440
uitându-mă la el, vreau să găsesc asta

54706
40:50:02,560 --> 40:50:10,000
linie aici care este valoarea minimă. Deci

54707
40:50:07,440 --> 40:50:14,880
căutăm minimul și asta

54708
40:50:10,000 --> 40:50:16,880
face asta prin eșantionare acolo și apoi

54709
40:50:14,880 --> 40:50:18,880
pe baza asta presupune că ar putea fi

54710
40:50:16,880 --> 40:50:21,920
undeva aici și merge, hei, asta este

54711
40:50:18,880 --> 40:50:23,920
tot coborând. Merge aici și apoi

54712
40:50:21,920 --> 40:50:25,664
se întoarce aici și apoi se duce a

54713
40:50:23,920 --> 40:50:28,000
puțin mai aproape și doar se joacă

54714
40:50:25,664 --> 40:50:30,800
un minim până ajunge în acel loc,

54715
40:50:28,000 --> 40:50:34,960
acel loc de jos. Și așa vrem

54716
40:50:30,800 --> 40:50:37,024
minimizați eroarea în uh pe flip

54717
40:50:34,960 --> 40:50:38,720
rețineți, ați putea dori să fiți

54718
40:50:37,024 --> 40:50:41,840
maximizând ceva. Vrei să primești

54719
40:50:38,720 --> 40:50:44,160
cel mai bun rezultat al acestuia. Uh, pur și simplu

54720
40:50:41,840 --> 40:50:46,640
uh minus valoarea. Uh, dacă ești

54721
40:50:44,160 --> 40:50:49,600
căutând unde este vârful, acesta este

54722
40:50:46,640 --> 40:50:52,000
la fel ca un negativ pentru unde

54723
40:50:49,600 --> 40:50:53,744
valea este si cautand acea vale.

54724
40:50:52,000 --> 40:50:57,200
Uh, asta e tot ce este și aceasta este o cale

54725
40:50:53,744 --> 40:50:59,280
de a-l găsi. Deci chestia tare este um

54726
40:50:57,200 --> 40:51:01,520
toate sarcinile grele s-au terminat. Hm eu

54727
40:50:59,280 --> 40:51:03,920
de fapt, a ajuns să pună cap la cap una

54728
40:51:01,520 --> 40:51:05,664
dintre acestea cu ceva timp în urmă, ca atunci când eu

54729
40:51:03,920 --> 40:51:08,160
nu știam despre asocier și am fost

54730
40:51:05,664 --> 40:51:11,600
abia incepand. Băiete, a trecut mult timp

54731
40:51:08,160 --> 40:51:13,600
înapoi și uh se joacă la un nivel foarte scăzut. Cum

54732
40:51:11,600 --> 40:51:16,080
joci mare jos? nu rămâne blocat în

54733
40:51:13,600 --> 40:51:18,160
văi, uh, dă-ți seama aceste curbe și

54734
40:51:16,080 --> 40:51:19,920
lucruri de genul ăsta. Ei bine, faci asta și

54735
40:51:18,160 --> 40:51:21,664
capătul din spate este tot calculul și

54736
40:51:19,920 --> 40:51:24,480
ecuații diferențiale pentru a calcula acest lucru

54737
40:51:21,664 --> 40:51:27,280
afară. Vestea bună este că nu trebuie

54738
40:51:24,480 --> 40:51:31,664
face-le. Uh, așa că, în schimb, vom merge

54739
40:51:27,280 --> 40:51:36,080
aduna codul si hai sa mergem mai departe

54740
40:51:31,664 --> 40:51:38,384
și să vedem ce putem face cu asta.

54741
40:51:36,080 --> 40:51:40,240
Deci, băieții din spate au pus laolaltă a

54742
40:51:38,384 --> 40:51:41,664
un mic cod frumos aici, care este

54743
40:51:40,240 --> 40:51:43,520
un fel de distracție.

54744
40:51:41,664 --> 40:51:45,600
uh unele lucruri pe care le vom nota și

54745
40:51:43,520 --> 40:51:47,104
acestea sunt lucruri cu adevărat importante

54746
40:51:45,600 --> 40:51:49,024
pentru că atunci când începi să-ți faci datele

54747
40:51:47,104 --> 40:51:52,000
știință și săpat în mașina ta

54748
40:51:49,024 --> 40:51:54,160
modele de învățare veți găsi

54749
40:51:52,000 --> 40:51:56,560
aceste lucruri sunt pietre de poticnire. Uh

54750
40:51:54,160 --> 40:52:00,480
primul este curentul x. Unde suntem

54751
40:51:56,560 --> 40:52:02,480
începe la? Ține cont de modelul tău

54752
40:52:00,480 --> 40:52:04,384
cu care lucrezi este foarte

54753
40:52:02,480 --> 40:52:06,560
generic. Deci, orice folosiți pentru a minimiza

54754
40:52:04,384 --> 40:52:09,280
prima întrebare este unde suntem

54755
40:52:06,560 --> 40:52:12,880
început? Hm, și am început de la asta pentru că

54756
40:52:09,280 --> 40:52:15,200
algoritmul începe de la x= 3. Deci, noi

54757
40:52:12,880 --> 40:52:17,664
a ales în mod arbitrar cinci. Rata de învățare

54758
40:52:15,200 --> 40:52:19,360
este uh câte bare să săriți mergând unul

54759
40:52:17,664 --> 40:52:20,320
fel sau altul. Uh, de fapt, sunt

54760
40:52:19,360 --> 40:52:22,480
o să separă puțin asta

54761
40:52:20,320 --> 40:52:24,800
pentru că acestea două sunt cu adevărat importante.

54762
40:52:22,480 --> 40:52:26,800
Hm, dacă avem de-a face cu ceva de genul

54763
40:52:24,800 --> 40:52:28,480
aici vorbim despre um uh

54764
40:52:26,800 --> 40:52:31,104
Ei bine, aici este funcția noastră

54765
40:52:28,480 --> 40:52:34,800
vom folosi gradientul nostru um de

54766
40:52:31,104 --> 40:52:36,480
funcția noastră um 2 * x 5. Păstrați-o

54767
40:52:34,800 --> 40:52:38,720
simplu. Deci, aceasta este o funcție la care mergem

54768
40:52:36,480 --> 40:52:41,200
pentru a lucra cu. Deci dacă am de-a face cu

54769
40:52:38,720 --> 40:52:44,320
incremente de th00 și 0,1 urmează să

54770
40:52:41,200 --> 40:52:47,440
să fie foarte mult timp. Și dacă am de-a face

54771
40:52:44,320 --> 40:52:50,640
cu incremente de 0,001,

54772
40:52:47,440 --> 40:52:52,800
uh 0.1 va sări peste răspunsul meu.

54773
40:52:50,640 --> 40:52:54,320
Deci nu voi primi un răspuns foarte bun. Hm

54774
40:52:52,800 --> 40:52:56,720
și apoi ne uităm la precizie. Aceasta

54775
40:52:54,320 --> 40:52:59,280
ne spune când să oprim algoritmul. Deci

54776
40:52:56,720 --> 40:53:01,440
din nou, foarte specific pentru ceea ce ești

54777
40:52:59,280 --> 40:53:05,840
lucrând la. uh, dacă lucrezi cu

54778
40:53:01,440 --> 40:53:08,880
bani și nu-i transformi într-un

54779
40:53:05,840 --> 40:53:11,600
valoare flotantă, uh, s-ar putea să ai de-a face

54780
40:53:08,880 --> 40:53:14,000
0,01 care este un ban care ar putea fi al tău

54781
40:53:11,600 --> 40:53:16,080
precizia cu care lucrezi. Hm și

54782
40:53:14,000 --> 40:53:18,560
apoi desigur dimensiunea pasului precedent

54783
40:53:16,080 --> 40:53:20,320
max iterații uh vrem ceva

54784
40:53:18,560 --> 40:53:22,960
decupat la un anumit punct. De obicei

54785
40:53:20,320 --> 40:53:25,920
care este încorporat într-o mulțime de minimizare

54786
40:53:22,960 --> 40:53:27,920
funcții. Și apoi iată-ne actualul uh

54787
40:53:25,920 --> 40:53:29,520
formula cu care vom lucra.

54788
40:53:27,920 --> 40:53:31,280
Și apoi intrăm, mergem cât timp

54789
40:53:29,520 --> 40:53:36,240
dimensiunea pasului anterior este mai mare decât

54790
40:53:31,280 --> 40:53:40,240
precizie și este mai mică decât maxim

54791
40:53:36,240 --> 40:53:42,240
spune asta de 10 ori repede. Hm

54792
40:53:40,240 --> 40:53:43,664
noi doar spunem dacă este uh dacă suntem dacă

54793
40:53:42,240 --> 40:53:45,200
suntem încă mai mari decât precizia noastră

54794
40:53:43,664 --> 40:53:47,744
nivel, trebuie să continuăm să săpăm

54795
40:53:45,200 --> 40:53:50,160
mai adânc. Hm și apoi nici noi nu vrem

54796
40:53:47,744 --> 40:53:52,880
a trece pe lângă un tu sau orice ar fi acesta, a

54797
40:53:50,160 --> 40:53:54,960
milioane sau 10.000 de uh alergând. Asta e

54798
40:53:52,880 --> 40:53:57,280
de fapt destul de sus. nu o fac aproape niciodată

54799
40:53:54,960 --> 40:53:59,840
iterații maxime mai mult de 100 sau

54800
40:53:57,280 --> 40:54:01,840
200. Ocazii rare la care ai putea merge

54801
40:53:59,840 --> 40:54:04,080
patru sau 500 dacă depinde de

54802
40:54:01,840 --> 40:54:06,160
problema cu care lucrezi. Uh, deci noi

54803
40:54:04,080 --> 40:54:08,720
avem anterioarele noastre egale cu actualul nostru.

54804
40:54:06,160 --> 40:54:10,720
Astfel putem urmări în timp.

54805
40:54:08,720 --> 40:54:13,840
Acum, curentul este egal cu curentul

54806
40:54:10,720 --> 40:54:16,640
minus rata de multiplicare a formulei noastre

54807
40:54:13,840 --> 40:54:19,520
anterior x. Deci acum am generat

54808
40:54:16,640 --> 40:54:22,384
noua versiune. Mărimea pasului anterior

54809
40:54:19,520 --> 40:54:25,664
este egal cu curentul absolut anterior.

54810
40:54:22,384 --> 40:54:27,920
Uh, deci căutăm schimbarea în x

54811
40:54:25,664 --> 40:54:30,080
itters este egal cu iterațiile unu. Asta e

54812
40:54:27,920 --> 40:54:31,360
așa că știm să ne oprim dacă ajungem prea departe.

54813
40:54:30,080 --> 40:54:35,200
Și apoi vom tipări doar

54814
40:54:31,360 --> 40:54:37,840
minim local apare la x aici. Şi

54815
40:54:35,200 --> 40:54:39,600
dacă mergem înainte și rulăm asta,

54816
40:54:37,840 --> 40:54:43,200
Uh, puteți vedea chiar aici că se dă jos

54817
40:54:39,600 --> 40:54:46,720
până în acest punct și spune, hei, um,

54818
40:54:43,200 --> 40:54:49,200
minim local este minus 3,3222

54819
40:54:46,720 --> 40:54:50,800
pentru această serie special creată de noi.

54820
40:54:49,200 --> 40:54:55,664
Uh, și asta a fost creat din noi

54821
40:54:50,800 --> 40:54:57,664
formula aici. lambda x2 * x 5. Acum,

54822
40:54:55,664 --> 40:55:00,560
când voi conduce chestiile astea, o vei face

54823
40:54:57,664 --> 40:55:04,080
vezi asta iese mult

54824
40:55:00,560 --> 40:55:05,600
și uh cu trusa sklearn și și una

54825
40:55:04,080 --> 40:55:08,160
din motivele frumoase ale ruperii acestui lucru

54826
40:55:05,600 --> 40:55:10,800
în felul în care am făcut-o, aș putea trece peste

54827
40:55:08,160 --> 40:55:12,480
acele piese de top. Uh acele piese de top

54828
40:55:10,800 --> 40:55:15,600
sunt totul atunci când începi să privești

54829
40:55:12,480 --> 40:55:19,744
aceste seturi de instrumente de minimizare încorporate

54830
40:55:15,600 --> 40:55:23,960
cod. Și așa, de la um, vom face doar asta

54831
40:55:19,744 --> 40:55:23,960
de fapt docs.cipi.org

54832
40:55:26,160 --> 40:55:34,240
și ne uităm la scikit. Acolo

54833
40:55:30,480 --> 40:55:36,880
mergem. Um optimizare minimiza. Poți

54834
40:55:34,240 --> 40:55:38,384
minimizați doar o valoare. Ai

54835
40:55:36,880 --> 40:55:41,280
funcția care se intră. Această funcție

54836
40:55:38,384 --> 40:55:43,664
poate fi foarte complicat. Deci am folosit un

54837
40:55:41,280 --> 40:55:46,240
Funcție foarte simplă aici. S-ar putea

54838
40:55:43,664 --> 40:55:47,600
fie că sunt tot felul de lucruri care

54839
40:55:46,240 --> 40:55:49,520
ar putea fi acolo. Și există un număr

54840
40:55:47,600 --> 40:55:52,240
de metode pentru a rezolva acest lucru în măsura în care

54841
40:55:49,520 --> 40:55:54,000
se micșorează. Uh și nodul tău x.

54842
40:55:52,240 --> 40:55:57,520
Acolo este valoarea ta de pornire.

54843
40:55:54,000 --> 40:55:58,880
Deci funcția ta, valoarea ta de pornire. Hm

54844
40:55:57,520 --> 40:56:00,320
sunt tot felul de lucruri care vin

54845
40:55:58,880 --> 40:56:03,280
aici putem privi ceea ce nu suntem

54846
40:56:00,320 --> 40:56:06,480
mergând la. Um optimizare automat

54847
40:56:03,280 --> 40:56:08,720
creează limite de constrângeri. Unele dintre acestea

54848
40:56:06,480 --> 40:56:10,160
se face automat, dar tu chiar

54849
40:56:08,720 --> 40:56:12,240
mare lucru pe care vreau să-l subliniez aici

54850
40:56:10,160 --> 40:56:13,600
trebuie să ai un punct de plecare.

54851
40:56:12,240 --> 40:56:15,920
Vrei să începi cu ceva care

54852
40:56:13,600 --> 40:56:17,360
știi deja că este în mare parte răspunsul.

54853
40:56:15,920 --> 40:56:18,960
Dacă nu, atunci va avea

54854
40:56:17,360 --> 40:56:20,720
un timp al naibii de a încerca să-l calculeze

54855
40:56:18,960 --> 40:56:21,920
afară.

54856
40:56:20,720 --> 40:56:23,840
Sau îți poți scrie propriul mic scenariu

54857
40:56:21,920 --> 40:56:25,520
care face asta și și face un nivel scăzut

54858
40:56:23,840 --> 40:56:29,104
ghicind și încearcă să găsească max

54859
40:56:25,520 --> 40:56:30,960
valoare. Asta ne duce la statistici.

54860
40:56:29,104 --> 40:56:33,600
Cam despre ce este vorba

54861
40:56:30,960 --> 40:56:36,880
înțelegând lucrurile. Mult vocabular

54862
40:56:33,600 --> 40:56:38,480
și statistici. Uh, statistici, ei bine,

54863
40:56:36,880 --> 40:56:40,960
Presupun că totul este relativ. Este

54864
40:56:38,480 --> 40:56:42,720
cu siguranță nu o clasă de educație. Uh asa a

54865
40:56:40,960 --> 40:56:45,024
o grămadă de lucruri se întâmplă. Statistici.

54866
40:56:42,720 --> 40:56:48,000
Preocupări statistice cu privire la colecție,

54867
40:56:45,024 --> 40:56:52,384
organizare, analiză, interpretare,

54868
40:56:48,000 --> 40:56:56,080
și prezentarea datelor. Asta este o

54869
40:56:52,384 --> 40:56:58,000
gura. Deci avem de la un capăt la altul

54870
40:56:56,080 --> 40:57:00,080
suntem

54871
40:56:58,000 --> 40:57:03,104
valabil, ce inseamna? Cum facem

54872
40:57:00,080 --> 40:57:04,800
il organizez? Cum o analizăm?

54873
40:57:03,104 --> 40:57:06,640
Atunci trebuie să iei acele analize și

54874
40:57:04,800 --> 40:57:09,024
interpretează-l în ceva care uh

54875
40:57:06,640 --> 40:57:11,600
oamenii pot folosi. un fel de reducere la

54876
40:57:09,024 --> 40:57:13,200
de înțeles. Hm, și în zilele noastre tu

54877
40:57:11,600 --> 40:57:14,720
trebuie să-l poată prezenta. Dacă tu

54878
40:57:13,200 --> 40:57:15,840
nu o pot prezenta, atunci nimeni altcineva nu este

54879
40:57:14,720 --> 40:57:17,920
o sa inteleg ce naiba esti

54880
40:57:15,840 --> 40:57:20,800
a făcut.

54881
40:57:17,920 --> 40:57:22,384
Deci, ne uităm la terminologii. Uh,

54882
40:57:20,800 --> 40:57:24,240
există o mulțime de terminologii

54883
40:57:22,384 --> 40:57:28,640
în funcție de domeniul pe care îl lucrezi

54884
40:57:24,240 --> 40:57:31,280
in. Deci clar dacă lucrezi în um a

54885
40:57:28,640 --> 40:57:36,000
domeniu care se ocupă de

54886
40:57:31,280 --> 40:57:37,360
viruși și celule de ceai și și cum

54887
40:57:36,000 --> 40:57:38,384
știi de unde vine asta și

54888
40:57:37,360 --> 40:57:40,240
studiezi diferiți oameni

54889
40:57:38,384 --> 40:57:44,960
atunci vei avea o populație.

54890
40:57:40,240 --> 40:57:46,960
dacă lucrezi cu um mecanic

54891
40:57:44,960 --> 40:57:48,560
Gear um știi puțin diferit

54892
40:57:46,960 --> 40:57:51,360
dacă cauți clătinarea

54893
40:57:48,560 --> 40:57:52,880
statistici uh pentru a ști când să înlocuiască a

54894
40:57:51,360 --> 40:57:54,800
rotorul pe o mașină sau ceva de genul

54895
40:57:52,880 --> 40:57:57,744
că uh, asta poate fi mare lucru. tu

54896
40:57:54,800 --> 40:58:01,104
Știți, avem acești fani uriași care se întorc

54897
40:57:57,744 --> 40:58:03,440
în sistemele noastre de procesare a apelor uzate. Și așa

54898
40:58:01,104 --> 40:58:05,024
acei fani, încep să se clătinească și să fredoneze

54899
40:58:03,440 --> 40:58:07,360
și face lucruri diferite pe care senzorii

54900
40:58:05,024 --> 40:58:08,640
ridica. La un moment dat, înlocuiești

54901
40:58:07,360 --> 40:58:10,160
ei? În loc să aștepți

54902
40:58:08,640 --> 40:58:11,920
pauză, caz în care a costat mult

54903
40:58:10,160 --> 40:58:14,560
bani. În loc să înlocuiți o bucșă,

54904
40:58:11,920 --> 40:58:16,560
inlocuiesti toata unitatea de ventilator. Uh

54905
40:58:14,560 --> 40:58:19,840
un proiect interesant care a venit pentru

54906
40:58:16,560 --> 40:58:21,744
orasul nostru cu ceva vreme in urma. Uh așa populația,

54907
40:58:19,840 --> 40:58:24,640
toate obiectele sunt măsurători ale căror

54908
40:58:21,744 --> 40:58:27,024
proprietățile sunt observate. Da

54909
40:58:24,640 --> 40:58:28,880
asta este populația ta toate obiectele.

54910
40:58:27,024 --> 40:58:32,480
Este ușor să-l vezi cu oamenii pentru că

54911
40:58:28,880 --> 40:58:34,640
avem populația noastră și mare. Hm dar

54912
40:58:32,480 --> 40:58:36,480
in cazul fanilor de canalizare suntem

54913
40:58:34,640 --> 40:58:37,840
vorbind despre modul în care unitățile de ventilator. Asta e

54914
40:58:36,480 --> 40:58:39,920
populația de fani care suntem

54915
40:58:37,840 --> 40:58:42,384
lucrând cu.

54916
40:58:39,920 --> 40:58:44,384
Ai un parametru o matrice, adică

54917
40:58:42,384 --> 40:58:45,920
folosit pentru a reprezenta o populaţie sau

54918
40:58:44,384 --> 40:58:48,000
caracteristic.

54919
40:58:45,920 --> 40:58:50,160
Aveți eșantionul dvs. un subset al

54920
40:58:48,000 --> 40:58:51,920
populatia studiata. Nu vrei să faci

54921
40:58:50,160 --> 40:58:53,664
pe toate pentru că atunci nu ai un

54922
40:58:51,920 --> 40:58:55,024
dacă vii cu o concluzie pt

54923
40:58:53,664 --> 40:58:57,104
toți, nu aveți cum să

54924
40:58:55,024 --> 40:58:58,240
testându-l. Deci luați o probă. Uh

54925
40:58:57,104 --> 40:58:59,744
uneori nu ai de ales. tu

54926
40:58:58,240 --> 40:59:02,240
pot lua doar o mostră din ceea ce se întâmplă

54927
40:58:59,744 --> 40:59:05,104
pe. Nu poți studia întregul

54928
40:59:02,240 --> 40:59:07,744
populatia. Și o variabilă, o metrică a

54929
40:59:05,104 --> 40:59:09,520
interes pentru fiecare persoană sau obiect în a

54930
40:59:07,744 --> 40:59:12,640
populatia.

54931
40:59:09,520 --> 40:59:14,800
Tipuri de eșantionare. Avem probabilistică

54932
40:59:12,640 --> 40:59:17,280
abordare. uh selectând mostre din a

54933
40:59:14,800 --> 40:59:20,160
populație mai mare folosind o metodă bazată

54934
40:59:17,280 --> 40:59:21,440
pe teoria probabilității

54935
40:59:20,160 --> 40:59:23,360
și vom intra în puțin mai mult

54936
40:59:21,440 --> 40:59:26,160
mai profund asupra acestora. Avem aleatoriu

54937
40:59:23,360 --> 40:59:28,384
stratificat sistematic și apoi aveți

54938
40:59:26,160 --> 40:59:30,720
selectarea abordării neprobabilistice

54939
40:59:28,384 --> 40:59:33,104
mostre bazate pe judecata subiectiva

54940
40:59:30,720 --> 40:59:35,200
al cercetătorului mai degrabă decât aleatoriu

54941
40:59:33,104 --> 40:59:37,840
selecție. Uh, are de-a face cu

54942
40:59:35,200 --> 40:59:41,520
comoditate încercând să atingă o cotă um

54943
40:59:37,840 --> 40:59:42,640
sau bulgăre de zăpadă. Uh și sunt foarte părtinitori.

54944
40:59:41,520 --> 40:59:44,960
Acesta este unul dintre motivele pentru care vei vedea

54945
40:59:42,640 --> 40:59:47,920
această ștampilă mare de pe ea scrie părtinitoare. Da

54946
40:59:44,960 --> 40:59:50,320
trebuie să fii foarte atent la asta. Deci

54947
40:59:47,920 --> 40:59:52,160
eșantionare probabilistică atunci când vorbim

54948
40:59:50,320 --> 40:59:54,384
despre o eșantionare aleatorie, selectăm

54949
40:59:52,160 --> 40:59:56,720
mostre de mărime aleatorie din fiecare grup sau

54950
40:59:54,384 --> 40:59:59,520
categorie. Deci noi este la fel de aleatoriu ca tine

54951
40:59:56,720 --> 41:00:02,480
poate obține. Vorbim despre sistematic

54952
40:59:59,520 --> 41:00:04,384
prelevarea de probe. Selectăm randomsiz

54953
41:00:02,480 --> 41:00:08,240
mostre din fiecare grupă sau categorie cu

54954
41:00:04,384 --> 41:00:09,744
un interval periodic fix. Deci suntem amabili

54955
41:00:08,240 --> 41:00:12,384
de a o împărți. Asta ar fi ca o

54956
41:00:09,744 --> 41:00:13,920
configurarea timpului sau diferite categorii. Şi

54957
41:00:12,384 --> 41:00:17,024
ați putea să vă puneți întrebarea, ce este a

54958
41:00:13,920 --> 41:00:19,200
categorie sau grup? Uh, dacă te uiți la

54959
41:00:17,024 --> 41:00:21,744
Mă duc înapoi la o fereastră. Să zicem

54960
41:00:19,200 --> 41:00:25,664
studiem economia diferită

54961
41:00:21,744 --> 41:00:28,160
a unei zone. Știm cam asta

54962
41:00:25,664 --> 41:00:31,024
pe baza culturii lor, unde au venit

54963
41:00:28,160 --> 41:00:33,920
de, ar putea fi nevoie să fie separate.

54964
41:00:31,024 --> 41:00:35,920
Și așa și când spun despărțit, eu

54965
41:00:33,920 --> 41:00:38,160
nu înseamnă despărțiți de ei

54966
41:00:35,920 --> 41:00:39,840
locul unde locuiesc. Adică, în măsura în care

54967
41:00:38,160 --> 41:00:41,360
analiza, vrem să ne uităm la

54968
41:00:39,840 --> 41:00:44,320
diferite grupuri și asigurați-vă că sunt

54969
41:00:41,360 --> 41:00:47,840
toate reprezentate. Deci, dacă am avea ca un

54970
41:00:44,320 --> 41:00:51,440
80% dintr-un grup care se spune

54971
41:00:47,840 --> 41:00:55,280
hispanic sau indian și, de asemenea, în asta

54972
41:00:51,440 --> 41:00:57,280
aceeași zonă, avem 20% 20% care sunt let's

54973
41:00:55,280 --> 41:00:59,664
sunați pe expatrioții noștri. Au părăsit America

54974
41:00:57,280 --> 41:01:02,560
și sunt drăguți și caucazianul tău

54975
41:00:59,664 --> 41:01:05,200
grup. Am putea dori să eșantionăm un grup

54976
41:01:02,560 --> 41:01:08,000
care este reprezentativ pentru ambele. Uh, deci

54977
41:01:05,200 --> 41:01:09,360
vorbim de eșantionarea stratificată

54978
41:01:08,000 --> 41:01:10,800
și vorbim despre grupuri. Aceia

54979
41:01:09,360 --> 41:01:12,480
sunt grupurile despre care vorbim. Şi

54980
41:01:10,800 --> 41:01:14,480
ne duce la eșantionarea stratificată,

54981
41:01:12,480 --> 41:01:17,520
selectând aproximativ egalizat

54982
41:01:14,480 --> 41:01:19,600
mostre din fiecare grup sau categorie. Uh,

54983
41:01:17,520 --> 41:01:22,640
în acest fel putem separa efectiv

54984
41:01:19,600 --> 41:01:24,160
categorii și oferă-ne o perspectivă asupra

54985
41:01:22,640 --> 41:01:26,560
diferitele culturi și cum asta

54986
41:01:24,160 --> 41:01:28,384
le-ar putea afecta în zona respectivă. Da

54987
41:01:26,560 --> 41:01:30,800
puteți vedea că acestea sunt foarte foarte

54988
41:01:28,384 --> 41:01:33,600
diferit depinde de ceea ce ești

54989
41:01:30,800 --> 41:01:35,600
lucrând cu um în ceea ce privește datele dvs. și

54990
41:01:33,600 --> 41:01:37,200
ceea ce studiezi. Și așa putem vedea

54991
41:01:35,600 --> 41:01:39,104
aici doar pentru a merge un pic mai mult

54992
41:01:37,200 --> 41:01:41,664
au selectat 25 de angajați din a

54993
41:01:39,104 --> 41:01:42,960
companie de 250 de angajați la întâmplare. Nu

54994
41:01:41,664 --> 41:01:44,560
îi pasă de ceva la ei. Ce grupuri

54995
41:01:42,960 --> 41:01:47,024
ei sunt, în ce birou sunt,

54996
41:01:44,560 --> 41:01:49,200
nimic. Hm și s-ar putea să selectăm

54997
41:01:47,024 --> 41:01:52,480
un angajat din 50 unici

54998
41:01:49,200 --> 41:01:54,320
angajati intr-o companie de 250 de angajati.

54999
41:01:52,480 --> 41:01:56,640
Și apoi trebuie să selectăm un angajat

55000
41:01:54,320 --> 41:01:58,160
din fiecare sucursală din biroul companiei.

55001
41:01:56,640 --> 41:02:00,080
Deci avem toate ramurile diferite.

55002
41:01:58,160 --> 41:02:01,920
Există grupul nostru sau categoriile noastre de

55003
41:02:00,080 --> 41:02:03,360
ramura. Și categoria ar putea

55004
41:02:01,920 --> 41:02:06,320
depinde de ceea ce studiezi. Deci

55005
41:02:03,360 --> 41:02:08,080
are multe variații acolo. Vezi tu

55006
41:02:06,320 --> 41:02:10,240
acest tip de grupare și clasificare

55007
41:02:08,080 --> 41:02:12,160
este, de asemenea, folosit pentru a genera o mulțime de

55008
41:02:10,240 --> 41:02:14,720
dezinformare.

55009
41:02:12,160 --> 41:02:16,880
Uh, dacă studiezi doar un grup și

55010
41:02:14,720 --> 41:02:18,384
atunci spui că asta este

55011
41:02:16,880 --> 41:02:20,000
toată lumea presupune că pentru asta este

55012
41:02:18,384 --> 41:02:21,600
toată lumea. Și așa trebuie să fii foarte

55013
41:02:20,000 --> 41:02:24,480
atent la asta. și este foarte lipsit de etică

55014
41:02:21,600 --> 41:02:27,520
lucru de făcut. Deci, tipuri de

55015
41:02:24,480 --> 41:02:29,440
statistici. Vorbim despre statistici,

55016
41:02:27,520 --> 41:02:33,024
vom vorbi despre descriptiv

55017
41:02:29,440 --> 41:02:35,024
şi statistici inferenţiale. Așa sunt

55018
41:02:33,024 --> 41:02:37,664
mulți termeni diferiți în statistică pentru

55019
41:02:35,024 --> 41:02:41,200
sparge-l. Uh, așa că vorbim

55020
41:02:37,664 --> 41:02:42,480
despre o anumită configurație. Deci suntem

55021
41:02:41,200 --> 41:02:45,920
vorbind despre descriptive și

55022
41:02:42,480 --> 41:02:48,880
statistici inferenţiale. Tu baza

55023
41:02:45,920 --> 41:02:51,024
a cuvântului descrie este destul de solid.

55024
41:02:48,880 --> 41:02:54,000
tu descrii datele. Ce face

55025
41:02:51,024 --> 41:02:55,520
arata ca? Cu statistici inferioare,

55026
41:02:54,000 --> 41:02:58,240
o să luăm asta de la mic

55027
41:02:55,520 --> 41:02:59,840
populație la o populație mare. Deci, dacă

55028
41:02:58,240 --> 41:03:01,520
Lucrezi cu o companie de droguri, uh

55029
41:02:59,840 --> 41:03:04,000
ați putea să vă uitați la date și să spuneți:

55030
41:03:01,520 --> 41:03:07,360
„Acești oameni au fost ajutați de acest medicament.

55031
41:03:04,000 --> 41:03:09,744
S-au descurcat cu 80% mai bine decât ei

55032
41:03:07,360 --> 41:03:13,024
sănătate sau o rată de supraviețuire cu 80% mai bună decât

55033
41:03:09,744 --> 41:03:15,024
oamenii care nu aveau drogul.

55034
41:03:13,024 --> 41:03:16,720
Deci, putem deduce că acel medicament va fi

55035
41:03:15,024 --> 41:03:18,240
lucrează în populația și voința mai mare

55036
41:03:16,720 --> 41:03:20,640
ajuta oamenii. Deci acolo ajungi

55037
41:03:18,240 --> 41:03:22,240
inferenția dvs. Așa suntem

55038
41:03:20,640 --> 41:03:24,240
prezicerea modului în care va afecta

55039
41:03:22,240 --> 41:03:26,320
populație mai mare.

55040
41:03:24,240 --> 41:03:28,560
Deci statistici descriptive cu care este obișnuit

55041
41:03:26,320 --> 41:03:31,104
descrie caracteristicile de bază ale datelor și

55042
41:03:28,560 --> 41:03:34,320
constituie baza analizei cantitative

55043
41:03:31,104 --> 41:03:36,240
de date. Deci avem o măsură de centrală

55044
41:03:34,320 --> 41:03:39,104
tendinte. Avem media ta, mediana

55045
41:03:36,240 --> 41:03:40,880
și modul. Și atunci avem o măsură de

55046
41:03:39,104 --> 41:03:43,104
răspândit ca raza ta, ta

55047
41:03:40,880 --> 41:03:45,520
intervalul intercuartil, varianța dvs. și

55048
41:03:43,104 --> 41:03:46,800
abaterea ta standard. Și mergem

55049
41:03:45,520 --> 41:03:49,104
să privesc toate acestea puțin mai adânc

55050
41:03:46,800 --> 41:03:53,024
aici într-o secundă. Dar unul dintre ei tu

55051
41:03:49,104 --> 41:03:55,664
se poate gândi la cum sunt datele

55052
41:03:53,024 --> 41:03:58,000
diferențe diferențe știi ce este

55053
41:03:55,664 --> 41:04:00,384
gama maximă de bărbați toate chestiile astea sunt ale tale

55054
41:03:58,000 --> 41:04:02,720
răspândit și orice este doar un singur

55055
41:04:00,384 --> 41:04:04,080
numărul este de obicei centralul tău

55056
41:04:02,720 --> 41:04:07,104
măsura tendințelor centrale

55057
41:04:04,080 --> 41:04:08,960
tendinte. Deci vorbim despre răutate

55058
41:04:07,104 --> 41:04:11,360
este media setului de valori

55059
41:04:08,960 --> 41:04:13,840
considerată. care este rezultatul mediu

55060
41:04:11,360 --> 41:04:16,640
de orice se întâmplă? Și apoi a ta

55061
41:04:13,840 --> 41:04:19,200
mediana separă jumătatea superioară și cea

55062
41:04:16,640 --> 41:04:21,600
jumătate inferioară a datelor.

55063
41:04:19,200 --> 41:04:24,800
Deci unde este punctul central al tuturor

55064
41:04:21,600 --> 41:04:26,720
diferitele tale puncte de date? Deci răul tău

55065
41:04:24,800 --> 41:04:29,360
s-ar putea să aibă câteva câteva cu adevărat mari

55066
41:04:26,720 --> 41:04:31,600
numere care o obligă uh astfel încât

55067
41:04:29,360 --> 41:04:34,800
media este mult mai mare decât dacă ai lua

55068
41:04:31,600 --> 41:04:36,880
acele valori aberante unde mediana

55069
41:04:34,800 --> 41:04:39,360
ar separând înaltul de cel

55070
41:04:36,880 --> 41:04:40,560
low vă poate oferi un număr mult mai mic.

55071
41:04:39,360 --> 41:04:42,720
s-ar putea să te uiți și să spui: „Oh, asta e

55072
41:04:40,560 --> 41:04:44,240
asta e ciudat. De ce media este atât de mare

55073
41:04:42,720 --> 41:04:45,600
mai mare decât mediana?" Ei bine, este

55074
41:04:44,240 --> 41:04:47,840
pentru că aveți niște valori aberante sau de ce

55075
41:04:45,600 --> 41:04:50,240
e cu mult mai jos? Și apoi modul

55076
41:04:47,840 --> 41:04:51,600
este cea mai frecventă valoare care apare.

55077
41:04:50,240 --> 41:04:53,664
Uh, asta este foarte interesant. Dacă

55078
41:04:51,600 --> 41:04:55,664
studiezi economie și cum oamenii

55079
41:04:53,664 --> 41:04:59,200
faci, s-ar putea să descoperi că cel mai mult

55080
41:04:55,664 --> 41:05:02,960
venitul comun ca în SUA era la

55081
41:04:59,200 --> 41:05:05,840
un punct 24.000 pe an în cazul în care

55082
41:05:02,960 --> 41:05:07,600
media a fost mai aproape de 80.000. Și este

55083
41:05:05,840 --> 41:05:09,104
cum ar fi, wow, ce diferență. Ei bine,

55084
41:05:07,600 --> 41:05:11,600
sunt unii oameni care au mulți bani

55085
41:05:09,104 --> 41:05:13,440
și așa că se înclină în sus. Deci

55086
41:05:11,600 --> 41:05:14,880
omul obișnuit nu face așa ceva

55087
41:05:13,440 --> 41:05:16,384
de bani. Și apoi te uiți la

55088
41:05:14,880 --> 41:05:18,480
venitul mediu și ești ca, ei bine,

55089
41:05:16,384 --> 41:05:20,560
venitul mediu este puțin mai aproape de

55090
41:05:18,480 --> 41:05:22,880
media. Uh, deci creează o foarte

55091
41:05:20,560 --> 41:05:25,024
mod interesant de a privi datele.

55092
41:05:22,880 --> 41:05:26,800
Din nou, toate acestea sunt centrale

55093
41:05:25,024 --> 41:05:29,840
tendințe, numere simple pe care le puteți căuta

55094
41:05:26,800 --> 41:05:32,000
la pentru întreaga răspândire a datelor.

55095
41:05:29,840 --> 41:05:33,664
Și ne uităm la măsura centrală

55096
41:05:32,000 --> 41:05:35,920
tendinte. Media este media

55097
41:05:33,664 --> 41:05:37,840
notele unui elev într-o clasă. Deci

55098
41:05:35,920 --> 41:05:40,080
aici avem suma medie a notelor

55099
41:05:37,840 --> 41:05:42,720
dintre elevi numărul total de elevi

55100
41:05:40,080 --> 41:05:46,160
și așa cum am vorbit despre mediana uh dacă

55101
41:05:42,720 --> 41:05:47,600
avem de la 0 la 10 și luăm jumătate

55102
41:05:46,160 --> 41:05:49,024
numerele și puneți-le pe o parte a

55103
41:05:47,600 --> 41:05:51,104
linia jumătate din numere pe cealaltă

55104
41:05:49,024 --> 41:05:53,024
parte a liniei ajungem cu cinci

55105
41:05:51,104 --> 41:05:55,200
la mijloc si apoi modul ce

55106
41:05:53,024 --> 41:05:58,720
nota a fost notată de majoritatea elevilor

55107
41:05:55,200 --> 41:06:01,104
într-un test într-un caz simplu în care majoritatea

55108
41:05:58,720 --> 41:06:03,520
oamenii au obținut un scor de 82% și au primit

55109
41:06:01,104 --> 41:06:06,800
anumite probleme greșit ușor de înțeles

55110
41:06:03,520 --> 41:06:08,640
afară. nu atât de ușor când ai

55111
41:06:06,800 --> 41:06:11,200
diferite zone în care like you have like

55112
41:06:08,640 --> 41:06:12,560
um oh să ne întoarcem la economie a

55113
41:06:11,200 --> 41:06:14,240
putin mai greu de calculat

55114
41:06:12,560 --> 41:06:17,200
dacă ai un grup mare care marchează

55115
41:06:14,240 --> 41:06:19,520
asta face 30.000 și ceva mai mare

55116
41:06:17,200 --> 41:06:21,664
grup care face 26.000. Deci ce faci

55117
41:06:19,520 --> 41:06:22,960
pus jos pentru modul? Cu siguranță

55118
41:06:21,664 --> 41:06:24,320
există o serie de moduri de a calcula

55119
41:06:22,960 --> 41:06:25,840
asta și de fapt este altceva

55120
41:06:24,320 --> 41:06:28,240
variații în funcție de ceea ce ești

55121
41:06:25,840 --> 41:06:30,480
făcând. Deci acum ne uităm la o măsură

55122
41:06:28,240 --> 41:06:31,664
de răspândire uh. Care este

55123
41:06:30,480 --> 41:06:33,664
diferența dintre cel mai înalt și cel

55124
41:06:31,664 --> 41:06:35,520
cea mai mica valoare? Primul lucru pe care vrei să-l faci

55125
41:06:33,664 --> 41:06:37,840
Uită-te, știi, că am avut pe toți

55126
41:06:35,520 --> 41:06:41,280
în test a avut un punctaj între 60 și 100%,

55127
41:06:37,840 --> 41:06:42,720
cineva a primit 100% sau poate 60 până la 90%. Ea

55128
41:06:41,280 --> 41:06:46,240
a fost atât de greu încât mulți oameni au putut

55129
41:06:42,720 --> 41:06:49,104
nu primesc 100%. Um, și tu ai a ta

55130
41:06:46,240 --> 41:06:52,080
intervalul intercuartil. Quartortile se împart

55131
41:06:49,104 --> 41:06:53,600
un set de date de clasare în patru egale

55132
41:06:52,080 --> 41:06:55,664
piese.

55133
41:06:53,600 --> 41:06:57,520
lucru foarte comun de făcut ca parte a tuturor

55134
41:06:55,664 --> 41:07:01,200
pachetele de bază indiferent dacă sunteți

55135
41:06:57,520 --> 41:07:03,024
lucrând în cadre de date cu panda

55136
41:07:01,200 --> 41:07:05,360
dacă lucrezi în scala dacă

55137
41:07:03,024 --> 41:07:07,024
lucrezi în Rum, vei vedea asta

55138
41:07:05,360 --> 41:07:09,024
vino acolo unde au intervalul min

55139
41:07:07,024 --> 41:07:11,024
maximul tău și apoi va avea ta

55140
41:07:09,024 --> 41:07:13,840
intervalul intercuartil cum arată

55141
41:07:11,024 --> 41:07:16,080
ca în fiecare trimestru de variație a datelor

55142
41:07:13,840 --> 41:07:18,240
măsoară cât de departe fiecare număr din set

55143
41:07:16,080 --> 41:07:21,440
este de la medie și deci din

55144
41:07:18,240 --> 41:07:23,104
orice alt număr din set, deci tu

55145
41:07:21,440 --> 41:07:26,080
au ca un fel de multă turbulență

55146
41:07:23,104 --> 41:07:28,384
pe în aceste date. Și apoi standardul

55147
41:07:26,080 --> 41:07:30,240
abaterea, este măsura

55148
41:07:28,384 --> 41:07:33,104
varianţa sau dispersia unui set de

55149
41:07:30,240 --> 41:07:35,360
valori din medie. Și vei face de obicei

55150
41:07:33,104 --> 41:07:37,920
să văd dacă fac un grafic, aș putea

55151
41:07:35,360 --> 41:07:40,720
au valoarea grafică. Hm și apoi

55152
41:07:37,920 --> 41:07:42,640
pe baza erorii, aș putea reprezenta un grafic

55153
41:07:40,720 --> 41:07:44,240
reprezentați grafic abaterea standard și

55154
41:07:42,640 --> 41:07:47,104
eroare pe grafic ca fundal deci

55155
41:07:44,240 --> 41:07:49,840
poți vedea cât de departe este. Da

55156
41:07:47,104 --> 41:07:51,920
abaterea standard este folosită foarte mult. Deci

55157
41:07:49,840 --> 41:07:54,000
măsurarea răspândirii uh mărci ale a

55158
41:07:51,920 --> 41:07:58,080
student din 100 pe care le avem aici

55159
41:07:54,000 --> 41:08:00,384
de la 50 la 63 sau de la 50 la 90 uh, deci

55160
41:07:58,080 --> 41:08:02,720
gama note maxime note minime noi

55161
41:08:00,384 --> 41:08:05,920
au de la 90 la 45 și răspândirea acesteia este

55162
41:08:02,720 --> 41:08:08,880
45 90 - 45 și apoi avem

55163
41:08:05,920 --> 41:08:10,560
intervalul intercuartil folosind aceleași semne

55164
41:08:08,880 --> 41:08:13,104
acolo puteți vedea aici unde

55165
41:08:10,560 --> 41:08:15,920
mediana este și apoi este primul

55166
41:08:13,104 --> 41:08:17,744
trimestrul al doilea trimestru și al treilea

55167
41:08:15,920 --> 41:08:19,104
trimestru bazat pe împărțirea lui în afară de

55168
41:08:17,744 --> 41:08:20,720
acele valori

55169
41:08:19,104 --> 41:08:22,560
Și pentru a înțelege varianța și

55170
41:08:20,720 --> 41:08:25,360
abaterea standard, mai întâi trebuie să

55171
41:08:22,560 --> 41:08:27,440
afla media. Uh, aici este al nostru

55172
41:08:25,360 --> 41:08:29,744
stii sa calculezi media acolo.

55173
41:08:27,440 --> 41:08:31,744
Ajungem la aproximativ 66 pentru

55174
41:08:29,744 --> 41:08:33,520
medie. Și apoi ne uităm la asta

55175
41:08:31,744 --> 41:08:35,600
variație odată ce cunoaștem mijloacele pe care le putem

55176
41:08:33,520 --> 41:08:39,440
do este egal cu notele minus media

55177
41:08:35,600 --> 41:08:41,280
pătrat. De ce este pătrat? Uh pentru că

55178
41:08:39,440 --> 41:08:43,744
unul, vrei să te asiguri că ești tu

55179
41:08:41,280 --> 41:08:45,440
nu ai like dacă tu dacă pui

55180
41:08:43,744 --> 41:08:47,920
toate chestiile astea împreună, ajungi să ajungi

55181
41:08:45,440 --> 41:08:49,360
o eroare în măsura în care negativul cuiva, al cuiva

55182
41:08:47,920 --> 41:08:52,320
pozitiv, cineva este puțin mai sus, este a

55183
41:08:49,360 --> 41:08:54,320
putin mai jos. Deci îl vezi mereu

55184
41:08:52,320 --> 41:08:56,560
valoare pătrată și peste total

55185
41:08:54,320 --> 41:08:58,800
observatii. Și așa standardul

55186
41:08:56,560 --> 41:09:02,240
abaterea este egală cu rădăcina pătrată a

55187
41:08:58,800 --> 41:09:04,720
varianță, care este de aproximativ 16. Și

55188
41:09:02,240 --> 41:09:06,640
dacă te-ai uita la un previzibil

55189
41:09:04,720 --> 41:09:09,360
model, te-ai uita la

55190
41:09:06,640 --> 41:09:12,480
abatere bazată pe eroare. Cât de mult

55191
41:09:09,360 --> 41:09:14,240
are eroare? Uh, asta e din nou

55192
41:09:12,480 --> 41:09:16,480
foarte important să știi dacă ești dacă

55193
41:09:14,240 --> 41:09:18,560
predicția ta prezice ceva,

55194
41:09:16,480 --> 41:09:21,280
ce șanse există să fie departe sau

55195
41:09:18,560 --> 41:09:24,240
doar un pic off.

55196
41:09:21,280 --> 41:09:26,000
Acum că ne-am uitat la instrumentele um ca

55197
41:09:24,240 --> 41:09:28,080
în măsura în care unele dintre elementele de bază pentru a vă face

55198
41:09:26,000 --> 41:09:30,384
statistici și despre ce vorbim,

55199
41:09:28,080 --> 41:09:31,664
hai să mergem mai departe și să tragem o mică demonstrație

55200
41:09:30,384 --> 41:09:33,744
și să-ți arăt cum arată

55201
41:09:31,664 --> 41:09:35,664
Cod Python. Uh, ca să poți lua câteva

55202
41:09:33,744 --> 41:09:37,440
mic hands-on aici. Pentru asta, să mergem

55203
41:09:35,664 --> 41:09:40,240
înapoi în caietul nostru Jupyter în

55204
41:09:37,440 --> 41:09:42,960
Python. Acum, aproape toate acestea poți

55205
41:09:40,240 --> 41:09:44,720
face in numpy. Ultima dată când am lucrat

55206
41:09:42,960 --> 41:09:47,600
numpy. De data asta vom merge înainte

55207
41:09:44,720 --> 41:09:50,960
și folosește panda. Și dacă îți amintești de la

55208
41:09:47,600 --> 41:09:53,600
panda sunt aici, uh, acesta este practic un

55209
41:09:50,960 --> 41:09:58,160
cadru de date, rânduri, coloane. Să mergem

55210
41:09:53,600 --> 41:10:00,384
înainte și face o imprimare df. cap

55211
41:09:58,160 --> 41:10:02,480
și rulează asta.

55212
41:10:00,384 --> 41:10:04,320
Și puteți vedea că avem numele

55213
41:10:02,480 --> 41:10:06,320
Jane, Michael, William, Rosie, Hannah,

55214
41:10:04,320 --> 41:10:08,080
și salariile lor aici. Și de

55215
41:10:06,320 --> 41:10:09,920
desigur, în loc să trebuiască să facă totul

55216
41:10:08,080 --> 41:10:11,360
acele calcule de mână și adăugați

55217
41:10:09,920 --> 41:10:13,664
totul împreună și împărțit prin

55218
41:10:11,360 --> 41:10:17,664
total, putem face ceva foarte simplu

55219
41:10:13,664 --> 41:10:19,360
pe acest uh, cum ar fi folosiți comanda înseamnă în

55220
41:10:17,664 --> 41:10:22,480
panda. Și deci dacă merg înainte și fac asta

55221
41:10:19,360 --> 41:10:24,000
print df, alege-ne coloana salariul pentru că

55222
41:10:22,480 --> 41:10:25,744
vrem să găsim mijloacele pentru asta

55223
41:10:24,000 --> 41:10:27,200
colery.

55224
41:10:25,744 --> 41:10:29,840
Vrem să găsim mijloacele pentru asta

55225
41:10:27,200 --> 41:10:32,160
coloana. Uh și mergem și imprimăm asta.

55226
41:10:29,840 --> 41:10:35,840
Și puteți vedea că uh media

55227
41:10:32,160 --> 41:10:37,360
venitul de aici este de 71.000.

55228
41:10:35,840 --> 41:10:42,024
Uh, și hai să mergem mai departe și să facem asta.

55229
41:10:37,360 --> 41:10:42,024
Vom merge înainte și vom pune în uh mijloace.

55230
41:10:42,560 --> 41:10:48,384
Și dacă vom face asta, și noi

55231
41:10:44,080 --> 41:10:52,960
poate doriți să găsiți mediana.

55232
41:10:48,384 --> 41:10:54,960
Și mediana este foarte asemănătoare cu excepția

55233
41:10:52,960 --> 41:10:56,800
de fapt este doar mediană. Suntem

55234
41:10:54,960 --> 41:10:58,160
obişnuit cu medii şi medie. Este un fel

55235
41:10:56,800 --> 41:11:01,744
interesant că acelea sunt ei folosesc

55236
41:10:58,160 --> 41:11:03,600
două cuvinte diferite. Uh poate fi înăuntru

55237
41:11:01,744 --> 41:11:05,600
unele calcule mici diferențe dar

55238
41:11:03,600 --> 41:11:08,720
în cea mai mare parte mijlocul este

55239
41:11:05,600 --> 41:11:12,024
medie. Uh și apoi mediana oops

55240
41:11:08,720 --> 41:11:12,024
hai sa punem o

55241
41:11:12,080 --> 41:11:16,800
mediana aici. Salariul DF așa este

55242
41:11:14,800 --> 41:11:20,560
se afișează puțin mai bine. Putem vedea

55243
41:11:16,800 --> 41:11:23,600
mediana este de 54 um000. Deci, la jumătatea drumului

55244
41:11:20,560 --> 41:11:24,800
este semnificativ sub medie. De ce?

55245
41:11:23,600 --> 41:11:26,800
Pentru că avem pe cineva aici care

55246
41:11:24,800 --> 41:11:28,720
face 189.000.

55247
41:11:26,800 --> 41:11:30,560
La naiba, Rosie pentru că ne-ai aruncat

55248
41:11:28,720 --> 41:11:32,560
numere. Dar asta e ceva ce ai vrea

55249
41:11:30,560 --> 41:11:34,800
vrei sa observi. Acesta este acesta este

55250
41:11:32,560 --> 41:11:36,480
diferența dintre acestea este uriașă și așa

55251
41:11:34,800 --> 41:11:37,920
este care este sensul din spatele aceluia când

55252
41:11:36,480 --> 41:11:40,800
studiezi o populație și cauți

55253
41:11:37,920 --> 41:11:42,720
la uh diferitele date care vin. Și

55254
41:11:40,800 --> 41:11:46,000
bineînțeles că vrem și noi să aflăm

55255
41:11:42,720 --> 41:11:48,880
care este cel mai comun venit

55256
41:11:46,000 --> 41:11:51,104
oamenii fac din acest eșantion mic.

55257
41:11:48,880 --> 41:11:53,440
Și așa vom merge înainte și vom face modul.

55258
41:11:51,104 --> 41:11:55,920
Și puteți vedea aici cu modul uh

55259
41:11:53,440 --> 41:11:57,920
este la 50.000.

55260
41:11:55,920 --> 41:12:00,880
Deci asta este foarte grăitor

55261
41:11:57,920 --> 41:12:03,664
majoritatea oamenilor fac 50.000. The

55262
41:12:00,880 --> 41:12:05,840
punctul de mijloc este la 54.000. Deci jumătate din

55263
41:12:03,664 --> 41:12:08,960
oamenii fac mai mult decât atât. Ce

55264
41:12:05,840 --> 41:12:13,104
care îmi spune că dacă cel mai comun

55265
41:12:08,960 --> 41:12:14,560
venitul este cu mult sub mediana, atunci

55266
41:12:13,104 --> 41:12:16,560
sunt câteva, există un SK, știi,

55267
41:12:14,560 --> 41:12:18,560
sunt multe salarii mari

55268
41:12:16,560 --> 41:12:21,280
sus, dar sunt niște salarii foarte mici

55269
41:12:18,560 --> 41:12:23,664
acolo. Și astfel această tendință care este

55270
41:12:21,280 --> 41:12:26,080
foarte frecvente în statistică atunci când ești

55271
41:12:23,664 --> 41:12:28,800
analizând economia și diferite

55272
41:12:26,080 --> 41:12:31,104
venitul oamenilor este destul de comun și

55273
41:12:28,800 --> 41:12:32,560
diferența mai mare între acestea este, de asemenea

55274
41:12:31,104 --> 41:12:35,104
foarte important când studiem

55275
41:12:32,560 --> 41:12:37,920
statistici. Uh și când auzi pe cineva

55276
41:12:35,104 --> 41:12:39,440
spune doar hei, venitul mediu ai fost tu

55277
41:12:37,920 --> 41:12:40,880
s-ar putea să înceapă să pună întrebări

55278
41:12:39,440 --> 41:12:42,560
punct. De ce nu vorbești despre

55279
41:12:40,880 --> 41:12:44,800
venitul mediu? De ce nu vorbești

55280
41:12:42,560 --> 41:12:47,200
despre modul cel mai frecvent venit?

55281
41:12:44,800 --> 41:12:48,384
Ce ascunzi? Uh și dacă ești

55282
41:12:47,200 --> 41:12:49,744
făcând aceste analize, ar trebui să fii

55283
41:12:48,384 --> 41:12:51,520
privindu-i pe aceștia spunând: „Hei, de ce

55284
41:12:49,744 --> 41:12:53,440
acestea sunt discrepanțe? De ce sunt acestea așa

55285
41:12:51,520 --> 41:12:55,520
diferit?" Și, desigur, cu orice uh

55286
41:12:53,440 --> 41:12:57,024
analiză, este important să aflați

55287
41:12:55,520 --> 41:12:59,360
minim

55288
41:12:57,024 --> 41:13:04,160
si maximul. Deci, vom merge înainte.

55289
41:12:59,360 --> 41:13:06,720
Pur și simplu, uhm, o să trag

55290
41:13:04,160 --> 41:13:09,360
minimul tău și apoi fă trageri maxime

55291
41:13:06,720 --> 41:13:13,360
maximul. destul de simplu

55292
41:13:09,360 --> 41:13:15,360
în măsura în care îl traduc și știe

55293
41:13:13,360 --> 41:13:16,960
ce esti tu stii ce esti cel mai mic

55294
41:13:15,360 --> 41:13:19,744
valoare și care este valoarea ta cea mai mare

55295
41:13:16,960 --> 41:13:22,000
aici. Pe care îl vei folosi pentru a genera

55296
41:13:19,744 --> 41:13:24,160
ca o răspândire mai târziu. Și foarte repede

55297
41:13:22,000 --> 41:13:26,320
în modul fără mod, uh rețineți că pune

55298
41:13:24,160 --> 41:13:28,800
modul zero. După cum am spus, există un cuplu

55299
41:13:26,320 --> 41:13:30,640
diferite moduri în care puteți calcula modul.

55300
41:13:28,800 --> 41:13:32,320
Hm, deși, știi, unul standard

55301
41:13:30,640 --> 41:13:35,520
destul de bine. Desigur, putem face

55302
41:13:32,320 --> 41:13:38,080
interval, care este valoarea maximă minus min.

55303
41:13:35,520 --> 41:13:40,880
Deci acum avem o gamă de 149.000

55304
41:13:38,080 --> 41:13:42,720
între capătul superior și capătul inferior.

55305
41:13:40,880 --> 41:13:45,024
Și poate doriți să căutați în sus

55306
41:13:42,720 --> 41:13:49,104
valori individuale asupra tuturor acestora. Dar

55307
41:13:45,024 --> 41:13:51,744
se dovedește că există o descriere

55308
41:13:49,104 --> 41:13:54,000
caracteristică la panda.

55309
41:13:51,744 --> 41:13:56,384
Și astfel, în panda, putem face de fapt df

55310
41:13:54,000 --> 41:13:58,800
descrie salariul. Și dacă facem asta tu

55311
41:13:56,384 --> 41:14:01,520
vedem că sunt șapte

55312
41:13:58,800 --> 41:14:03,024
setări. Iată media noastră. Hm, al nostru

55313
41:14:01,520 --> 41:14:06,000
abatere standard, ceea ce noi nu am făcut-o

55314
41:14:03,024 --> 41:14:07,024
calculează încă, care ar fi doar o BTS.

55315
41:14:06,000 --> 41:14:08,720
Și trebuie să fii puțin atent

55316
41:14:07,024 --> 41:14:10,960
pentru că atunci când îl calculează, arată

55317
41:14:08,720 --> 41:14:12,640
pentru topoare și lucruri de genul ăsta. Uh, noi

55318
41:14:10,960 --> 41:14:14,640
au valoarea noastră minimă, iar aici este a noastră

55319
41:14:12,640 --> 41:14:16,240
cortile,

55320
41:14:14,640 --> 41:14:18,384
uh, valoarea noastră maximă și apoi de

55321
41:14:16,240 --> 41:14:20,000
desigur numele salariu. Uh, deci astea sunt

55322
41:14:18,384 --> 41:14:22,640
acestea sunt statisticile de bază. tu

55323
41:14:20,000 --> 41:14:25,104
le pot ridica și doar descrie. Acest

55324
41:14:22,640 --> 41:14:28,160
este un dicționar. Așa că chiar aș putea face

55325
41:14:25,104 --> 41:14:32,080
ceva de genul um aici aș putea

55326
41:14:28,160 --> 41:14:34,560
de fapt, numără și fugi. Și acum

55327
41:14:32,080 --> 41:14:36,160
imprimă doar numărătoarea. Uh așa pentru că

55328
41:14:34,560 --> 41:14:38,640
acesta este un dicționar, puteți trage orice

55329
41:14:36,160 --> 41:14:40,320
una dintre aceste valori de aici. Este

55330
41:14:38,640 --> 41:14:42,320
un fel de mod rapid și murdar de a trage

55331
41:14:40,320 --> 41:14:43,744
toate informațiile diferite și apoi

55332
41:14:42,320 --> 41:14:46,160
împărțiți-l și în funcție de ceea ce aveți

55333
41:14:43,744 --> 41:14:49,744
nevoie. Acum, dacă am intrat și am dat

55334
41:14:46,160 --> 41:14:51,840
ai această informație într-o întâlnire, la

55335
41:14:49,744 --> 41:14:55,024
la un moment dat, ai cam cădea

55336
41:14:51,840 --> 41:14:57,360
adormit. Asta as face oricum.

55337
41:14:55,024 --> 41:14:59,200
Așa că vrem să mergem înainte și să vedem

55338
41:14:57,360 --> 41:15:01,600
despre reprezentarea grafică aici. Și vom merge

55339
41:14:59,200 --> 41:15:04,640
înainte și puneți-o într-o histogramă și

55340
41:15:01,600 --> 41:15:06,000
trasează pe el graficul salariilor.

55341
41:15:04,640 --> 41:15:09,440
Și hai să mergem mai departe și să punem asta

55342
41:15:06,000 --> 41:15:10,880
aici. Așa că facem graficul nostru pe hartă în linie.

55343
41:15:09,440 --> 41:15:13,104
Amintiți-vă că este un caiet al lui Jupiter

55344
41:15:10,880 --> 41:15:14,640
lucru. Uh, multe din noua versiune a

55345
41:15:13,104 --> 41:15:17,024
biblioteca mapplot o face

55346
41:15:14,640 --> 41:15:18,960
automat, dar în caz că eu întotdeauna

55347
41:15:17,024 --> 41:15:21,024
pune-l acolo. Uh, import mattplot

55348
41:15:18,960 --> 41:15:23,024
bibliotecă piplot ca plt. Ăsta e al meu

55349
41:15:21,024 --> 41:15:25,104
complotând.

55350
41:15:23,024 --> 41:15:26,320
Și apoi avem cadrul nostru de date. Uh eu

55351
41:15:25,104 --> 41:15:28,560
nu cred că chiar nu am nevoie

55352
41:15:26,320 --> 41:15:30,080
resping cadrul de date. Poate am putea

55353
41:15:28,560 --> 41:15:32,960
doar să ne amintim ce este în el. Deci

55354
41:15:30,080 --> 41:15:35,920
Vom merge mai departe și doar imprimăm

55355
41:15:32,960 --> 41:15:38,080
DF. Așa mai avem. Și apoi

55356
41:15:35,920 --> 41:15:40,384
avem salariul nostru. Salariul DF

55357
41:15:38,080 --> 41:15:44,560
salariu.parcela titlu titlu salariu

55358
41:15:40,384 --> 41:15:47,200
culoare de distribuție gri. Uh complot AXV

55359
41:15:44,560 --> 41:15:50,000
salariul de linie valoarea medie. Deci, suntem

55360
41:15:47,200 --> 41:15:53,104
va lua valoarea medie um culoare

55361
41:15:50,000 --> 41:15:56,000
liniuță în stil violet. Acesta este doar tot

55362
41:15:53,104 --> 41:15:59,200
făcându-l frumos. Ce liniuță de culoare

55363
41:15:56,000 --> 41:16:00,960
lățimea liniei de două așa ceva.

55364
41:15:59,200 --> 41:16:02,240
Și mediana. Și să mergem înainte și

55365
41:16:00,960 --> 41:16:04,640
rulează asta doar ca să vezi ce suntem

55366
41:16:02,240 --> 41:16:07,104
vorbind despre.

55367
41:16:04,640 --> 41:16:10,560
Și deci aici sus ne luăm asupra noastră

55368
41:16:07,104 --> 41:16:12,480
complot. Um deci aici sunt datele. Aici e al nostru

55369
41:16:10,560 --> 41:16:14,320
cadrul nostru de date a fost imprimat astfel încât să puteți

55370
41:16:12,480 --> 41:16:16,640
vezi cu salariile. Căutăm

55371
41:16:14,320 --> 41:16:18,640
la repartizarea salariilor si doar uita-te

55372
41:16:16,640 --> 41:16:22,160
la felul în care sunt salariul este

55373
41:16:18,640 --> 41:16:25,664
distribuite. Ai nostru în asta

55374
41:16:22,160 --> 41:16:28,960
în cazul în care am făcut să vedem că avem roșu pentru

55375
41:16:25,664 --> 41:16:32,480
median avem violet

55376
41:16:28,960 --> 41:16:35,440
pentru media noastră sau media și poți doar

55377
41:16:32,480 --> 41:16:36,800
vezi cum e cu adevărat, aici este situația noastră anormală.

55378
41:16:35,440 --> 41:16:40,080
Iată persoana noastră care face mult

55379
41:16:36,800 --> 41:16:42,720
bani. Iată media um și iată

55380
41:16:40,080 --> 41:16:44,880
mediana. Um, și așa cum te uiți la

55381
41:16:42,720 --> 41:16:46,384
asta, poți spune: „Uau”. Um, pe baza

55382
41:16:44,880 --> 41:16:47,840
media, chiar nu vă spune

55383
41:16:46,384 --> 41:16:50,320
multe despre ceea ce iau oamenii cu adevărat

55384
41:16:47,840 --> 41:16:52,320
acasă. Tot ce face este să-ți spună cât

55385
41:16:50,320 --> 41:16:55,744
banii sunt în asta, știi, ce

55386
41:16:52,320 --> 41:16:57,360
salariul mediu este. Deci, unii dintre

55387
41:16:55,744 --> 41:17:01,024
lucruri pe care vrei să le iei în plus

55388
41:16:57,360 --> 41:17:04,880
asta este că este foarte ușor de trasat

55389
41:17:01,024 --> 41:17:08,384
o linie AXV. Acestea sunt acestea sus și

55390
41:17:04,880 --> 41:17:09,840
linii în jos pentru marcajele dvs. Hm, și ca

55391
41:17:08,384 --> 41:17:11,200
afișați afișați datele, vreau să spun,

55392
41:17:09,840 --> 41:17:13,104
la asta poți adăuga tot felul de lucruri

55393
41:17:11,200 --> 41:17:14,384
și devine cu adevărat complicat. Păstrând-o

55394
41:17:13,104 --> 41:17:16,320
simplu este destul de simplu. Mă uit

55395
41:17:14,384 --> 41:17:18,320
la asta și văd că avem un major

55396
41:17:16,320 --> 41:17:20,800
outlier aici. Cu siguranță putem face o

55397
41:17:18,320 --> 41:17:22,160
histogramă și chestii de genul ăsta. Hm, dar

55398
41:17:20,800 --> 41:17:24,000
știi, poza valorează cât o mie

55399
41:17:22,160 --> 41:17:26,880
cuvinte. Ceea ce vrei cu adevărat să te asiguri

55400
41:17:24,000 --> 41:17:29,280
iei este că putem face o bază

55401
41:17:26,880 --> 41:17:31,520
descrie care trage toate acestea

55402
41:17:29,280 --> 41:17:33,280
informații și putem tipări oricare dintre ele

55403
41:17:31,520 --> 41:17:35,200
informațiile individuale din

55404
41:17:33,280 --> 41:17:38,080
descrie uh pentru că acesta este un

55405
41:17:35,200 --> 41:17:38,080
dicţionar.

55406
41:17:38,160 --> 41:17:43,440
Și așa dacă vrem să mergem înainte și să privim

55407
41:17:40,080 --> 41:17:45,024
sus um valoarea medie, putem face și noi

55408
41:17:43,440 --> 41:17:49,664
descrie medie. Deci, dacă faci multe

55409
41:17:45,024 --> 41:17:50,880
de statistici, uh putând

55410
41:17:49,664 --> 41:17:52,384
nu are imprimarea acolo, așa că este

55411
41:17:50,880 --> 41:17:54,560
o să-l tipăr doar pe ultimul,

55412
41:17:52,384 --> 41:17:56,384
care se întâmplă să fie media. Poti

55413
41:17:54,560 --> 41:17:58,320
faceți referire foarte ușor la oricare dintre acestea.

55414
41:17:56,384 --> 41:17:59,840
Și atunci poți, de asemenea, dacă faci

55415
41:17:58,320 --> 41:18:01,920
ceva un pic mai complicat

55416
41:17:59,840 --> 41:18:04,560
și nu ai nevoie doar de elementele de bază, tu

55417
41:18:01,920 --> 41:18:07,600
poate trece și trage pe oricare dintre

55418
41:18:04,560 --> 41:18:10,320
individual um

55419
41:18:07,600 --> 41:18:13,024
referințe de la panda mai departe

55420
41:18:10,320 --> 41:18:16,000
aici. Deci acum am avut ocazia

55421
41:18:13,024 --> 41:18:19,024
descrieți datele noastre. Hai să intrăm în

55422
41:18:16,000 --> 41:18:20,384
statistici inferenţiale. inferior

55423
41:18:19,024 --> 41:18:24,384
statisticile vă permit să faceți

55424
41:18:20,384 --> 41:18:25,840
predicții sau inferențe din date. Şi

55425
41:18:24,384 --> 41:18:29,920
puteți vedea aici că avem un pic drăguț

55426
41:18:25,840 --> 41:18:31,840
Poze evaluările filmelor și dacă am luat

55427
41:18:29,920 --> 41:18:33,520
acest grup de oameni și a spus hei cum

55428
41:18:31,840 --> 41:18:36,000
multora le place filmul nu le place

55429
41:18:33,520 --> 41:18:37,440
nu pot spune și apoi întrebi doar la întâmplare

55430
41:18:36,000 --> 41:18:39,744
persoană care iese din film care

55431
41:18:37,440 --> 41:18:43,744
nu a fost în acest studiu, uh, poți

55432
41:18:39,744 --> 41:18:46,800
deduceți că 55% șansă de a spune că a plăcut

55433
41:18:43,744 --> 41:18:49,600
35% șanse de a spune nu mi-a plăcut sau un 10 sau

55434
41:18:46,800 --> 41:18:51,280
11% sanse sa nu spun. Deci asta e

55435
41:18:49,600 --> 41:18:53,024
bazele reale despre ceea ce vorbim

55436
41:18:51,280 --> 41:18:54,320
vei deduce că în următorul

55437
41:18:53,024 --> 41:18:57,200
persoana va urma acestea

55438
41:18:54,320 --> 41:19:00,160
statistici.

55439
41:18:57,200 --> 41:19:01,744
Să ne uităm la estimarea punctuală. Uh

55440
41:19:00,160 --> 41:19:03,840
este un proces de găsire a unui

55441
41:19:01,744 --> 41:19:06,880
valoare aproximativă pentru o populație

55442
41:19:03,840 --> 41:19:09,360
parametru ca medie sau medie de la

55443
41:19:06,880 --> 41:19:11,104
eșantioane aleatorii ale populației. Să

55444
41:19:09,360 --> 41:19:14,320
luați un exemplu de testare a vaccinurilor pentru

55445
41:19:11,104 --> 41:19:16,080
COVID 19. Vaccinuri și virusuri gripale, toate

55446
41:19:14,320 --> 41:19:17,744
că. Este un lucru destul de mare despre cum să faci

55447
41:19:16,080 --> 41:19:20,160
le testați și vă asigurați că sunt

55448
41:19:17,744 --> 41:19:21,744
mergând să lucreze la populație. Un grup

55449
41:19:20,160 --> 41:19:23,744
de oameni sunt aleși dintre

55450
41:19:21,744 --> 41:19:26,080
populatia. Testele medicale sunt

55451
41:19:23,744 --> 41:19:28,480
efectuate. Rezultatele sunt generalizate pentru

55452
41:19:26,080 --> 41:19:30,160
intreaga populatie. Deci iată un

55453
41:19:28,480 --> 41:19:32,080
protejat, aici este grupul nostru mic de aici

55454
41:19:30,160 --> 41:19:33,600
unde le-am selectat. Fugim

55455
41:19:32,080 --> 41:19:35,840
studiile medicale asupra lor și apoi la

55456
41:19:33,600 --> 41:19:37,440
rezultatele funcționează pentru populație. tu

55457
41:19:35,840 --> 41:19:40,080
frumoasă diagramă cu săgețile care merg înapoi

55458
41:19:37,440 --> 41:19:42,320
și mai departe și foarte înfricoșător co virus în

55459
41:19:40,080 --> 41:19:44,480
mijlocul unuia. Și să aruncăm o privire

55460
41:19:42,320 --> 41:19:46,240
la aplicaţiile de inferior

55461
41:19:44,480 --> 41:19:47,840
statistici.

55462
41:19:46,240 --> 41:19:51,440
Foarte central este ceea ce ei numesc

55463
41:19:47,840 --> 41:19:54,080
testarea ipotezei și încrederea

55464
41:19:51,440 --> 41:19:56,720
interval care merg cu asta. Și apoi ca

55465
41:19:54,080 --> 41:19:59,200
intrăm în

55466
41:19:56,720 --> 41:20:01,360
probabilitate, intrăm în binomul nostru

55467
41:19:59,200 --> 41:20:04,160
teorema, distribuția noastră normală și

55468
41:20:01,360 --> 41:20:06,384
teorema limitei centrale. Ipoteza

55469
41:20:04,160 --> 41:20:09,600
testarea. Testarea ipotezelor este folosită pentru

55470
41:20:06,384 --> 41:20:13,664
măsoară plauzibilitatea unei ipoteze

55471
41:20:09,600 --> 41:20:17,520
ipoteză prin utilizarea datelor eșantionului. Acum

55472
41:20:13,664 --> 41:20:19,104
când vorbim despre teoreme, teorie,

55473
41:20:17,520 --> 41:20:21,520
ipoteza,

55474
41:20:19,104 --> 41:20:25,200
uh rețineți că dacă vă aflați într-o

55475
41:20:21,520 --> 41:20:29,104
clasa de filozofie, teoria este aceeași ca

55476
41:20:25,200 --> 41:20:30,960
ipoteza în care teorema este științifică

55477
41:20:29,104 --> 41:20:33,600
uh declarație care este ceva care are

55478
41:20:30,960 --> 41:20:35,440
a fost dovedit, deși este întotdeauna pentru

55479
41:20:33,600 --> 41:20:37,024
dezbatere pentru că în știință ne dorim mereu

55480
41:20:35,440 --> 41:20:39,520
pentru a se asigura că lucrurile sunt la îndemână. Deci

55481
41:20:37,024 --> 41:20:41,744
o ipoteză este la fel ca o phil

55482
41:20:39,520 --> 41:20:44,080
clasă filozofică denumind o teorie

55483
41:20:41,744 --> 41:20:45,840
unde teoria în știință nu este aceeași.

55484
41:20:44,080 --> 41:20:48,800
Teoria în știință spune că așa a fost

55485
41:20:45,840 --> 41:20:50,160
bine dovedit. Gravitația este o teorie. Da

55486
41:20:48,800 --> 41:20:52,640
dacă vrei să dezbatem teoria

55487
41:20:50,160 --> 41:20:54,640
gravitația încearcă să sari în sus și în jos. Dacă tu

55488
41:20:52,640 --> 41:20:56,640
vreau să am o teorie despre de ce

55489
41:20:54,640 --> 41:21:00,000
economia se prăbușește în tine

55490
41:20:56,640 --> 41:21:01,744
domeniu care este o dezbatere filozofică.

55491
41:21:00,000 --> 41:21:04,640
Foarte important. Am auzit oameni amestecându-se

55492
41:21:01,744 --> 41:21:06,880
alea sus și este o supărare de-a mea.

55493
41:21:04,640 --> 41:21:08,880
Când vorbim despre testarea ipotezelor,

55494
41:21:06,880 --> 41:21:11,840
etapele implicate în testarea ipotezelor

55495
41:21:08,880 --> 41:21:13,600
este mai întâi formulăm o ipoteză. Noi

55496
41:21:11,840 --> 41:21:16,384
găsiți testul potrivit pentru a ne testa

55497
41:21:13,600 --> 41:21:18,720
ipoteza. Executăm testul și noi

55498
41:21:16,384 --> 41:21:20,384
ia o decizie. Și așa când ești

55499
41:21:18,720 --> 41:21:22,720
vorbind despre ipoteză, de obicei ești

55500
41:21:20,384 --> 41:21:25,200
încercând să o infirme. Dacă nu poți

55501
41:21:22,720 --> 41:21:27,024
infirma-l și funcționează pentru toate

55502
41:21:25,200 --> 41:21:30,320
fapte, atunci ai putea numi asta a

55503
41:21:27,024 --> 41:21:32,080
teorema la un moment dat. Deci, într-un caz de utilizare,

55504
41:21:30,320 --> 41:21:33,744
hai sa luam un exemplu. Avem

55505
41:21:32,080 --> 41:21:35,920
patru elevi. li s-a dat o sarcină

55506
41:21:33,744 --> 41:21:37,920
curata o camera in fiecare zi. Sună ca

55507
41:21:35,920 --> 41:21:39,600
lucrez cu copiii mei. Au decis să

55508
41:21:37,920 --> 41:21:41,920
repartizați sarcina de curățare a camerei

55509
41:21:39,600 --> 41:21:44,160
între ei. Au făcut asta făcând

55510
41:21:41,920 --> 41:21:46,320
patru chipuri care au numele lor pe el

55511
41:21:44,160 --> 41:21:48,800
iar numele care este preluat trebuie să

55512
41:21:46,320 --> 41:21:50,720
face curățenia pentru ziua respectivă. Rob a luat

55513
41:21:48,800 --> 41:21:52,960
ocazia de a face chits și a scris

55514
41:21:50,720 --> 41:21:55,920
numele tuturor pe el. Deci, iată-ne

55515
41:21:52,960 --> 41:21:58,384
patru oameni, Nick, Rob, Imlia, Imlia,

55516
41:21:55,920 --> 41:22:00,880
si vara.

55517
41:21:58,384 --> 41:22:03,024
Acum Rick, Imlia și Summer ne întreabă

55518
41:22:00,880 --> 41:22:05,520
pentru a decide dacă Rob a făcut ceva

55519
41:22:03,024 --> 41:22:07,280
stricaciune in pregatirea chits i.e

55520
41:22:05,520 --> 41:22:09,600
dacă Rob și-a scris numele pe unul

55521
41:22:07,280 --> 41:22:11,200
de chit. Pentru asta vom afla

55522
41:22:09,600 --> 41:22:13,360
probabilitatea ca Rob să obțină

55523
41:22:11,200 --> 41:22:16,240
lucrare de curatenie in prima zi, a doua zi,

55524
41:22:13,360 --> 41:22:18,080
a treia zi și așa mai departe până la 12 zile. The

55525
41:22:16,240 --> 41:22:21,200
probabilitatea ca Rob să primească postul

55526
41:22:18,080 --> 41:22:23,280
scade in fiecare zi. i.e. rândul lui niciodată

55527
41:22:21,200 --> 41:22:26,080
apare. Atunci cu siguranță a făcut-o

55528
41:22:23,280 --> 41:22:28,160
ceva răutăți în timp ce făceau chits. Deci

55529
41:22:26,080 --> 41:22:30,560
probabilitatea ca Rob să nu lucreze

55530
41:22:28,160 --> 41:22:33,920
prima zi este trei din patru. Există

55531
41:22:30,560 --> 41:22:38,640
o șansă de 75 de a nu fi lucrat. Uh

55532
41:22:33,920 --> 41:22:41,104
două zile 34s * 34s egal.56.

55533
41:22:38,640 --> 41:22:43,024
3 zile ai 3/4 34 34 care

55534
41:22:41,104 --> 41:22:46,560
este egal cu 42.

55535
41:22:43,024 --> 41:22:48,880
Când ajungi în ziua 12, este 0032

55536
41:22:46,560 --> 41:22:51,664
care este mai mic de 0,05.

55537
41:22:48,880 --> 41:22:54,384
Amintiți-vă acest 0,05 uh care apare a

55538
41:22:51,664 --> 41:22:57,200
multe când vorbim despre um sigur

55539
41:22:54,384 --> 41:22:59,280
valori atunci când ne uităm la statistici.

55540
41:22:57,200 --> 41:23:01,744
Rob trișează pentru care nu a fost ales

55541
41:22:59,280 --> 41:23:05,024
12 zile consecutive. Asta e foarte mare

55542
41:23:01,744 --> 41:23:08,384
probabilitate când în ziua 12 el încă

55543
41:23:05,024 --> 41:23:10,880
nu s-a angajat să curețe camera.

55544
41:23:08,384 --> 41:23:12,480
Așa că ajungem la importantul nostru important

55545
41:23:10,880 --> 41:23:15,200
terminologii.

55546
41:23:12,480 --> 41:23:16,800
Avem ipoteza nulă.

55547
41:23:15,200 --> 41:23:18,800
o afirmaţie generală care afirmă că

55548
41:23:16,800 --> 41:23:20,960
nu există nicio relație între doi

55549
41:23:18,800 --> 41:23:23,520
fenomen măsurat sau nu asoc

55550
41:23:20,960 --> 41:23:26,384
asociere între grupuri.

55551
41:23:23,520 --> 41:23:28,880
Ipoteza alternativă contrară

55552
41:23:26,384 --> 41:23:30,880
ipoteza nulă pe care o afirmă oricând

55553
41:23:28,880 --> 41:23:33,520
ceva se întâmplă o nouă teorie este

55554
41:23:30,880 --> 41:23:36,560
preferată în locul unuia vechi. Și așa

55555
41:23:33,520 --> 41:23:38,640
cele două ipoteze merg mână în mână. Uh

55556
41:23:36,560 --> 41:23:40,320
deci nulul tău este întotdeauna interesant

55557
41:23:38,640 --> 41:23:42,720
în vorbim despre știința datelor

55558
41:23:40,320 --> 41:23:44,720
și matematica din spatele ei. Este vorba despre

55559
41:23:42,720 --> 41:23:47,200
dovedind că lucrurile au nu

55560
41:23:44,720 --> 41:23:49,440
corelație. Ipoteza nulă spune acestea

55561
41:23:47,200 --> 41:23:51,520
doi au relații zero unul cu celălalt.

55562
41:23:49,440 --> 41:23:53,104
Acolo unde ipoteza alternativă spune:

55563
41:23:51,520 --> 41:23:56,640
Hei, am găsit o relație. Aceasta este ceea ce

55564
41:23:53,104 --> 41:23:58,880
este. Avem valoarea p. Valoarea p este

55565
41:23:56,640 --> 41:24:00,800
probabilitatea de a găsi cele observate

55566
41:23:58,880 --> 41:24:04,080
sau rezultate mai extreme când nul

55567
41:24:00,800 --> 41:24:06,160
ipoteza unei întrebări de studiu este adevărată.

55568
41:24:04,080 --> 41:24:08,000
Și valoarea t, este pur și simplu

55569
41:24:06,160 --> 41:24:10,240
diferenta calculata reprezentata in

55570
41:24:08,000 --> 41:24:12,240
unități de eroare standard. Cu cât este mai mare

55571
41:24:10,240 --> 41:24:14,720
magnitudinea lui t, cu atât dovezile sunt mai mari

55572
41:24:12,240 --> 41:24:17,280
împotriva ipotezei nule. Și poți

55573
41:24:14,720 --> 41:24:20,240
priviți valoarea t ca fiind specifică

55574
41:24:17,280 --> 41:24:22,640
testul pe care îl faceți unde valoarea p

55575
41:24:20,240 --> 41:24:25,200
este derivat din valoarea ta și tu ești

55576
41:24:22,640 --> 41:24:26,720
căutând ceea ce ei numesc 5% sau cel

55577
41:24:25,200 --> 41:24:28,880
0,05

55578
41:24:26,720 --> 41:24:31,440
arătând că are o corelaţie ridicată.

55579
41:24:28,880 --> 41:24:33,280
Așa că săpând mai adânc, să presupunem că

55580
41:24:31,440 --> 41:24:35,024
un nou medicament este dezvoltat cu scopul de a

55581
41:24:33,280 --> 41:24:37,664
scăderea tensiunii arteriale mai mult decât

55582
41:24:35,024 --> 41:24:40,160
medicamentul existent. Și acesta este un bun

55583
41:24:37,664 --> 41:24:41,664
unul pentru că nu este aici valoarea nulă

55584
41:24:40,160 --> 41:24:43,024
că nu ai niciun medicament. Nulul

55585
41:24:41,664 --> 41:24:45,104
valoarea aici este că este mai bună decât

55586
41:24:43,024 --> 41:24:47,200
medicamentul existent. Noul medicament nu

55587
41:24:45,104 --> 41:24:50,720
scade tensiunea arterială mai mult decât

55588
41:24:47,200 --> 41:24:52,560
medicamentul existent. Acum, dacă primim asta

55589
41:24:50,720 --> 41:24:54,960
care spune că ipoteza noastră nulă este

55590
41:24:52,560 --> 41:24:57,520
corect. Nu există nicio corelație și

55591
41:24:54,960 --> 41:25:00,560
noul medicament nu își face treaba. The

55592
41:24:57,520 --> 41:25:02,160
ipoteza alternativă pe care o face noul medicament

55593
41:25:00,560 --> 41:25:05,024
scade semnificativ tensiunea arterială

55594
41:25:02,160 --> 41:25:06,880
mai mult decât medicamentul existent. Uh, da, noi

55595
41:25:05,024 --> 41:25:10,800
am un nou medicament acolo. Și asta e a noastră

55596
41:25:06,880 --> 41:25:13,280
ipoteza alternativă sau H1 sau HA.

55597
41:25:10,800 --> 41:25:15,200
Și ne uităm la rezultatele valorii p din

55598
41:25:13,280 --> 41:25:17,200
dovezile precum studiile medicale care arată

55599
41:25:15,200 --> 41:25:19,664
rezultate pozitive care vor respinge

55600
41:25:17,200 --> 41:25:23,664
ipoteza nulă. Și din nou, ei sunt

55601
41:25:19,664 --> 41:25:25,840
caut 0,05 sau 5%. Iar t

55602
41:25:23,664 --> 41:25:27,520
valoare comparând toate testele pozitive

55603
41:25:25,840 --> 41:25:30,320
rezultate şi găsirea mijloacelor de diferite

55604
41:25:27,520 --> 41:25:32,720
mostre pentru a testa ipoteza. Deci

55605
41:25:30,320 --> 41:25:34,384
aceasta este specifică testului. cum uh

55606
41:25:32,720 --> 41:25:37,200
ce procent de crestere au facut

55607
41:25:34,384 --> 41:25:40,240
au și asta ne duce la încredere

55608
41:25:37,200 --> 41:25:42,384
intervale. Un interval de încredere este a

55609
41:25:40,240 --> 41:25:45,840
gamă de valori suntem siguri că suntem adevărate

55610
41:25:42,384 --> 41:25:47,744
valorile observațiilor se află în. Să spunem

55611
41:25:45,840 --> 41:25:50,560
ai întrebat un stăpân de câine în jurul tău și

55612
41:25:47,744 --> 41:25:53,520
i-a întrebat câte cutii de mâncare faci

55613
41:25:50,560 --> 41:25:55,440
cumpărați pentru dvs. pe an pentru câinele dvs.

55614
41:25:53,520 --> 41:25:58,480
Prin calcule ai ajuns să cunoști

55615
41:25:55,440 --> 41:26:00,960
că, în medie, în jur de 95% din

55616
41:25:58,480 --> 41:26:03,104
oamenii au cumpărat în jur de 200 până la 300 de conserve de

55617
41:26:00,960 --> 41:26:06,720
alimente. Prin urmare, putem spune că avem un

55618
41:26:03,104 --> 41:26:09,200
interval de încredere de 230 unde 95% din

55619
41:26:06,720 --> 41:26:12,000
valorile noastre stau în acele date răspândite

55620
41:26:09,200 --> 41:26:13,600
răspândit. Uh și acesta este graficul cu adevărat

55621
41:26:12,000 --> 41:26:15,104
ajuta foarte mult. Deci poți începe să vezi

55622
41:26:13,600 --> 41:26:18,080
la ce te uiți aici unde ești

55623
41:26:15,104 --> 41:26:19,744
au 95%. Ai vârful tău în asta

55624
41:26:18,080 --> 41:26:21,360
în cazul în care este o distribuție normală. Deci tu

55625
41:26:19,744 --> 41:26:24,384
au curba clopotului frumos egală pe ambele

55626
41:26:21,360 --> 41:26:26,640
laturi. Nu este asimetric. Și 95% din

55627
41:26:24,384 --> 41:26:28,480
toate valorile se află într-un foarte mic

55628
41:26:26,640 --> 41:26:31,440
interval. Și apoi ai valorile aberante

55629
41:26:28,480 --> 41:26:34,160
cei 2,5% merg în fiecare sens.

55630
41:26:31,440 --> 41:26:36,800
Așa că am atins ipoteza uh și

55631
41:26:34,160 --> 41:26:38,384
vom trece la probabilitate. Uh

55632
41:26:36,800 --> 41:26:39,840
deci ai ipoteza ta. Odată ce ai făcut-o

55633
41:26:38,384 --> 41:26:41,104
a generat ipoteza dvs., vrem

55634
41:26:39,840 --> 41:26:43,360
cunoașteți probabilitatea apariției a ceva

55635
41:26:41,104 --> 41:26:46,000
care se produce. Probabilitatea este o măsură a

55636
41:26:43,360 --> 41:26:47,744
probabilitatea ca un eveniment să se producă. Oricare

55637
41:26:46,000 --> 41:26:50,560
evenimentul poate fi prezis cu total

55638
41:26:47,744 --> 41:26:53,024
certitudine și poate fi prezis doar ca a

55639
41:26:50,560 --> 41:26:54,880
probabilitatea apariției acesteia. Deci oricare

55640
41:26:53,024 --> 41:26:56,720
evenimentul nu poate fi prezis cu totalul

55641
41:26:54,880 --> 41:26:59,440
certitudinea. Poate fi prezis doar ca a

55642
41:26:56,720 --> 41:27:01,104
probabilitatea apariției acesteia. Uh scor

55643
41:26:59,440 --> 41:27:04,320
predictie. ce bine o sa faci

55644
41:27:01,104 --> 41:27:07,200
indiferent de sportul în care practicați, vremea

55645
41:27:04,320 --> 41:27:09,744
predicție, predicție stoc, dacă ai făcut-o

55646
41:27:07,200 --> 41:27:11,520
a studiat fizica și teoria haosului, chiar

55647
41:27:09,744 --> 41:27:13,440
locația scaunului pe care stai

55648
41:27:11,520 --> 41:27:16,560
on are probabilitatea să se miște

55649
41:27:13,440 --> 41:27:18,800
3 ft peste. Desigur, această probabilitate este

55650
41:27:16,560 --> 41:27:21,200
unul în ca uh cred că am calculat ca

55651
41:27:18,800 --> 41:27:24,000
sub unu la trilioane peste trilioane.

55652
41:27:21,200 --> 41:27:25,280
Deci, cu atât probabilitatea este mai bună, cu atât

55653
41:27:24,000 --> 41:27:26,560
mai probabil se va întâmpla. Acolo

55654
41:27:25,280 --> 41:27:29,600
sunt unele lucruri care au un nivel atât de scăzut

55655
41:27:26,560 --> 41:27:31,744
probabilitatea ca noi să nu le vedem. Deci

55656
41:27:29,600 --> 41:27:33,360
vorbim despre o variabilă aleatoare. Uh

55657
41:27:31,744 --> 41:27:35,360
variabilă aleatoare este o variabilă a cărei

55658
41:27:33,360 --> 41:27:38,880
valorile posibile sunt rezultate numerice

55659
41:27:35,360 --> 41:27:41,360
a unui fenomen aleatoriu. Deci avem

55660
41:27:38,880 --> 41:27:44,080
aruncarea monedelor. Câte capete vor apărea în

55661
41:27:41,360 --> 41:27:45,520
seria de 20 de monede? probabil

55662
41:27:44,080 --> 41:27:47,440
știi că în medie sunt 10,

55663
41:27:45,520 --> 41:27:49,840
dar chiar nu poți ști pentru că este

55664
41:27:47,440 --> 41:27:51,920
foarte aleatoriu. De câte ori o minge roșie

55665
41:27:49,840 --> 41:27:54,384
este cules dintr-o pungă de bile dacă există

55666
41:27:51,920 --> 41:27:56,384
număr egal de bile roșii și albastre

55667
41:27:54,384 --> 41:27:59,200
bile și bile verzi acolo. Câte

55668
41:27:56,384 --> 41:28:02,880
ori suma cifrelor de pe două zaruri uh

55669
41:27:59,200 --> 41:28:04,160
rezultat sau cinci fiecare? Hm ca să știi

55670
41:28:02,880 --> 41:28:07,280
e cât de des o să te rostogolești

55671
41:28:04,160 --> 41:28:09,200
doi cinci pe perechea ta de zaruri. Deci într-o

55672
41:28:07,280 --> 41:28:11,024
caz de utilizare, hai să luăm în considerare exemplul

55673
41:28:09,200 --> 41:28:12,960
de a arunca două zaruri. Avem o întâmplare

55674
41:28:11,024 --> 41:28:17,744
rezultatul variabil este egal cu y. Poți lua

55675
41:28:12,960 --> 41:28:19,744
valorile 2 3 4 5 6 7 8 9 10 11 12. Deci avem

55676
41:28:17,744 --> 41:28:22,480
au o variabilă aleatoare și o combinație

55677
41:28:19,744 --> 41:28:25,200
de zaruri și în loc să se uite la cum

55678
41:28:22,480 --> 41:28:27,104
de multe ori ambele zaruri erau aruncate cinci

55679
41:28:25,200 --> 41:28:29,440
hai să mergem mai departe și să ne uităm la o sumă totală

55680
41:28:27,104 --> 41:28:31,440
de cinci și aveți în măsura în care dvs

55681
41:28:29,440 --> 41:28:35,744
variabile aleatoare puteți avea un unu patru

55682
41:28:31,440 --> 41:28:38,384
este egal cu 5 4 1 2 3 32 deci patru dintre acestea

55683
41:28:35,744 --> 41:28:40,160
rolurile pot fi patru dacă te uiți la toate

55684
41:28:38,384 --> 41:28:43,664
opțiuni diferite, aveți patru dintre acestea

55685
41:28:40,160 --> 41:28:46,640
aruncări aleatorii pot fi un cinci și dacă noi

55686
41:28:43,664 --> 41:28:48,320
uita-te la numarul total

55687
41:28:46,640 --> 41:28:51,104
care se întâmplă să fie 36 diferite

55688
41:28:48,320 --> 41:28:53,104
opțiuni. Uh, puteți vedea că avem

55689
41:28:51,104 --> 41:28:54,720
patru din 36 de șanse de fiecare dată

55690
41:28:53,104 --> 41:28:56,080
aruncați zarurile pe care le veți arunca

55691
41:28:54,720 --> 41:28:59,520
în total cinci. Vei avea un

55692
41:28:56,080 --> 41:29:01,664
rezultatul de cinci. Și ne vom uita la a

55693
41:28:59,520 --> 41:29:03,104
puțin mai profund despre ce înseamnă asta. Uh

55694
41:29:01,664 --> 41:29:05,520
dar te-ai putea gândi la asta la ce

55695
41:29:03,104 --> 41:29:07,600
punct dacă cineva nu aruncă niciodată un cinci sau

55696
41:29:05,520 --> 41:29:09,664
ei dau întotdeauna un cinci, poți spune,

55697
41:29:07,600 --> 41:29:11,104
— Hei, probabil că persoana respectivă înșală.

55698
41:29:09,664 --> 41:29:13,280
uh ne vom uita putin mai atent la

55699
41:29:11,104 --> 41:29:15,360
matematica în spatele asta, dar să luăm în considerare

55700
41:29:13,280 --> 41:29:17,840
asta, deoarece unul dintre cazuri este în două

55701
41:29:15,360 --> 41:29:19,744
zaruri și jocuri de noroc. Există și o

55702
41:29:17,840 --> 41:29:21,440
distribuție binomială. Este

55703
41:29:19,744 --> 41:29:23,440
probabilitatea de a avea succes sau

55704
41:29:21,440 --> 41:29:25,440
eșecul ca rezultat al unui experiment

55705
41:29:23,440 --> 41:29:29,104
sau proces care se repetă multiplu

55706
41:29:25,440 --> 41:29:31,664
ori. Și cheia este prin sensul doi

55707
41:29:29,104 --> 41:29:34,240
binom. Uh așa că trec sau eșuează

55708
41:29:31,664 --> 41:29:36,480
examen, câștigarea sau pierderea unui joc și

55709
41:29:34,240 --> 41:29:38,384
primind fie cap, fie coadă. Deci dacă tu

55710
41:29:36,480 --> 41:29:41,840
a văzut vreodată distribuția binomială, este

55711
41:29:38,384 --> 41:29:45,360
bazat pe un tip de configurare adevărat fals.

55712
41:29:41,840 --> 41:29:47,664
Câștigi sau pierzi. Să luăm în considerare o utilizare

55713
41:29:45,360 --> 41:29:51,600
caz și să luăm în considerare jocul de

55714
41:29:47,664 --> 41:29:53,840
fotbal între două cluburi Barcelona și

55715
41:29:51,600 --> 41:29:55,840
Dortmund. Echipele vor trebui să joace a

55716
41:29:53,840 --> 41:29:58,080
în total patru meciuri și trebuie

55717
41:29:55,840 --> 41:30:00,320
afla sansele Barcelonei

55718
41:29:58,080 --> 41:30:02,160
câștigând seria. Deci ne uităm la

55719
41:30:00,320 --> 41:30:04,560
total de jocuri și ne uităm la cinci

55720
41:30:02,160 --> 41:30:06,480
diferite jocuri sau meciuri. Să zicem

55721
41:30:04,560 --> 41:30:10,720
că șansa de câștig pentru Barcelona este

55722
41:30:06,480 --> 41:30:12,480
75% sau 75. Asta înseamnă că la fiecare joc ei

55723
41:30:10,720 --> 41:30:15,440
au 75% șanse să o facă

55724
41:30:12,480 --> 41:30:20,240
câștigați acel joc și șansele de a pierde sunt de 25%

55725
41:30:15,440 --> 41:30:22,384
sau 0,25. În mod clar 75 plus 0,25 este egal cu 1.

55726
41:30:20,240 --> 41:30:25,520
Deci asta reprezintă 100% din joc.

55727
41:30:22,384 --> 41:30:27,920
Probabilitatea de a obține K câștigă în n

55728
41:30:25,520 --> 41:30:29,600
potrivirile sunt calculate.

55729
41:30:27,920 --> 41:30:31,840
Și noi vorbim așa dacă ai

55730
41:30:29,600 --> 41:30:34,320
cinci jocuri și vrei să știi dacă eu

55731
41:30:31,840 --> 41:30:36,560
joacă um câte victorii în cele cinci

55732
41:30:34,320 --> 41:30:38,960
jocuri ar trebui să primesc? Ce este un procent

55733
41:30:36,560 --> 41:30:41,360
pe alea? Și probabilitatea pentru

55734
41:30:38,960 --> 41:30:47,104
obținerea de k victorii în n meciuri este

55735
41:30:41,360 --> 41:30:50,800
calculat prin px= k= n k p k q la

55736
41:30:47,104 --> 41:30:53,600
n minus k. Aici p este probabilitatea

55737
41:30:50,800 --> 41:30:55,744
de succes și q este probabilitatea de

55738
41:30:53,600 --> 41:31:00,720
eșec. Și astfel putem face jocuri totale de

55739
41:30:55,744 --> 41:31:04,160
n este egal cu 5 unde k este egal cu 012345.

55740
41:31:00,720 --> 41:31:07,664
P care este șansa de câștig este 75.

55741
41:31:04,160 --> 41:31:11,600
Q șansa de a pierde este egală cu 1 minus p

55742
41:31:07,664 --> 41:31:13,440
care este egal cu 1 - 0075 care este egal cu 0,25.

55743
41:31:11,600 --> 41:31:15,920
Probabilitatea ca Barcelona să piardă

55744
41:31:13,440 --> 41:31:18,480
toate meciurile pot fi conectate

55745
41:31:15,920 --> 41:31:21,480
numerele și ajungem cu a

55746
41:31:18,480 --> 41:31:21,480
09765625.

55747
41:31:23,600 --> 41:31:27,440
O șansă foarte mică

55748
41:31:25,024 --> 41:31:29,840
își pierd toate meciurile.

55749
41:31:27,440 --> 41:31:32,800
Și putem introduce valoarea pentru doi

55750
41:31:29,840 --> 41:31:36,720
chibrituri. Probabilitatea ca Barcelona să o facă

55751
41:31:32,800 --> 41:31:38,240
a câștiga cel puțin două meciuri este 00878. Și

55752
41:31:36,720 --> 41:31:40,384
bineînțeles că putem trece la probabilitate

55753
41:31:38,240 --> 41:31:44,160
că Barcelona va câștiga trei meciuri

55754
41:31:40,384 --> 41:31:46,080
cele 26 și bineînțeles patru meciuri și așa

55755
41:31:44,160 --> 41:31:48,640
pe. Și este întotdeauna plăcut să iei asta

55756
41:31:46,080 --> 41:31:50,480
informații um și hai să găsim

55757
41:31:48,640 --> 41:31:53,440
probabilităţi discrete cumulate pentru

55758
41:31:50,480 --> 41:31:58,160
fiecare dintre rezultatele pe care le are Barcelona

55759
41:31:53,440 --> 41:32:02,800
a câștigat trei sau mai multe meciuri x= 3 x= 4 x= 5

55760
41:31:58,160 --> 41:32:05,920
și ajungem cu p =264 plus 395  

55761
41:32:02,800 --> 41:32:08,720
237 care este egal cu 89.

55762
41:32:05,920 --> 41:32:10,800
În realitate probabilitatea Barcelonei

55763
41:32:08,720 --> 41:32:15,280
câștigarea seriei este mult mai mare decât

55764
41:32:10,800 --> 41:32:17,280
75. Și este întotdeauna plăcut să stingi o

55765
41:32:15,280 --> 41:32:19,280
frumos grafic, astfel încât să puteți vedea de fapt

55766
41:32:17,280 --> 41:32:22,000
numărul de victorii la probabilitatea și

55767
41:32:19,280 --> 41:32:24,480
cum se întâmplă asta cu binomul nostru

55768
41:32:22,000 --> 41:32:27,600
caz. Continuând în importanta noastră

55769
41:32:24,480 --> 41:32:29,840
terminologie, locație, locația

55770
41:32:27,600 --> 41:32:32,880
centrul graficului depinde de

55771
41:32:29,840 --> 41:32:35,280
valoare medie. Și asta e ceva foarte

55772
41:32:32,880 --> 41:32:36,960
lucruri importante. Atât de multe dintre date noi

55773
41:32:35,280 --> 41:32:38,800
uită-te și când începi să privești

55774
41:32:36,960 --> 41:32:40,720
probabilitățile are aproape întotdeauna a

55775
41:32:38,800 --> 41:32:42,000
normalizat arată ca graficul din

55776
41:32:40,720 --> 41:32:44,240
mijloc.

55777
41:32:42,000 --> 41:32:45,840
uh, dar ai lasat deformat unde

55778
41:32:44,240 --> 41:32:47,024
datele sunt înclinate spre stânga și tu

55779
41:32:45,840 --> 41:32:49,600
se întâmplă mai multe lucruri la

55780
41:32:47,024 --> 41:32:50,960
stânga și aveți date deformate la dreapta și

55781
41:32:49,600 --> 41:32:52,480
deci când apare aceasta și acestea

55782
41:32:50,960 --> 41:32:54,320
probabilitățile apar acolo unde sunt

55783
41:32:52,480 --> 41:32:56,800
înclinat este foarte important să luați o

55784
41:32:54,320 --> 41:32:58,720
uită-te mai atent la asta, mai ales ajungi

55785
41:32:56,800 --> 41:33:00,080
cu un set normalizat de date dar tu

55786
41:32:58,720 --> 41:33:03,200
trebuie să fie, de asemenea, conștient că uneori este

55787
41:33:00,080 --> 41:33:05,520
o date denaturate și apoi înălțimea înălțimii

55788
41:33:03,200 --> 41:33:07,744
a pantei depinde invers de

55789
41:33:05,520 --> 41:33:09,200
abaterea standard

55790
41:33:07,744 --> 41:33:10,720
deci puteți vedea aici jos standardul

55791
41:33:09,200 --> 41:33:12,800
abaterea este într-adevăr mare

55792
41:33:10,720 --> 41:33:15,024
o strivește. Și dacă standardul

55793
41:33:12,800 --> 41:33:16,320
abaterea este mică, atunci majoritatea dvs

55794
41:33:15,024 --> 41:33:17,280
datele vor ajunge chiar acolo în

55795
41:33:16,320 --> 41:33:19,840
mijloc. O să ai o distracție plăcută

55796
41:33:17,280 --> 41:33:22,000
vârf. Hm, și deci fiind conștient de asta

55797
41:33:19,840 --> 41:33:24,000
că ai putea avea probabilitatea ca

55798
41:33:22,000 --> 41:33:26,080
se potrivește cu anumite date, dar are multe

55799
41:33:24,000 --> 41:33:28,880
valori aberante. Deci ești dacă ai cu adevărat

55800
41:33:26,080 --> 41:33:31,520
abatere standard ridicată, um, dacă ești

55801
41:33:28,880 --> 41:33:33,200
efectuarea analizei bursiere,

55802
41:33:31,520 --> 41:33:35,104
asta înseamnă probabil că previziunile tale sunt

55803
41:33:33,200 --> 41:33:36,320
nu te va face mulți bani. uh

55804
41:33:35,104 --> 41:33:38,160
unde dacă ai o foarte mică

55805
41:33:36,320 --> 41:33:40,720
abatere, s-ar putea să ai dreptate la țintă

55806
41:33:38,160 --> 41:33:43,600
și se pregătește să devină milionar. care

55807
41:33:40,720 --> 41:33:46,800
ne conduce la zcore. îți spune Zcore

55808
41:33:43,600 --> 41:33:48,720
cât de departe este de medie un punct de date.

55809
41:33:46,800 --> 41:33:51,360
Se măsoară în termeni de standard

55810
41:33:48,720 --> 41:33:53,024
abateri de la medie. Aproximativ 68% din

55811
41:33:51,360 --> 41:33:56,080
rezultatele se găsesc între unu

55812
41:33:53,024 --> 41:33:58,080
abaterea standard. Aproximativ 95% din

55813
41:33:56,080 --> 41:33:59,600
rezultatele se găsesc între două standarde

55814
41:33:58,080 --> 41:34:01,440
abaterile.

55815
41:33:59,600 --> 41:34:02,960
Și ai citit simbolurile. Desigur,

55816
41:34:01,440 --> 41:34:07,360
le place să arunce niște litere grecești

55817
41:34:02,960 --> 41:34:09,104
acolo. avem mu minus 2 sigma. Mu este

55818
41:34:07,360 --> 41:34:12,480
doar un mod rapid. Este genul ăsta de

55819
41:34:09,104 --> 41:34:14,080
funky tu. Înseamnă doar media. Uh și

55820
41:34:12,480 --> 41:34:16,384
atunci sigma este standardul

55821
41:34:14,080 --> 41:34:18,080
abatere. Și acesta este o cu a

55822
41:34:16,384 --> 41:34:20,384
săgeată mică spre dreapta sau

55823
41:34:18,080 --> 41:34:23,744
mică coadă clătinândă în sus. O cu

55824
41:34:20,384 --> 41:34:27,744
a cu o linie pe ea. Uh asa mu minus 2

55825
41:34:23,744 --> 41:34:30,880
sigma este dvs. 95% din rezultate sunt

55826
41:34:27,744 --> 41:34:33,600
găsit între două abateri standard.

55827
41:34:30,880 --> 41:34:35,440
Teorema limitei centrale. Asta merge

55828
41:34:33,600 --> 41:34:37,360
înapoi la înclinare. Dacă vă amintiți, noi

55829
41:34:35,440 --> 41:34:40,560
se uitau la valorile neregulate ale acestui lucru

55830
41:34:37,360 --> 41:34:42,880
diapozitivul anterior. Au rămas deformate,

55831
41:34:40,560 --> 41:34:44,480
normalizat și înclinat la dreapta. Când suntem

55832
41:34:42,880 --> 41:34:46,960
vorbind că este denaturat sau nu

55833
41:34:44,480 --> 41:34:49,520
denaturată, distribuția eșantionului

55834
41:34:46,960 --> 41:34:51,520
mijloacele vor fi aproximativ normal

55835
41:34:49,520 --> 41:34:54,800
distribuit, uniform distribuit, nu

55836
41:34:51,520 --> 41:34:57,840
deformat. Dacă luați mostre mari aleatorii

55837
41:34:54,800 --> 41:35:00,800
din populaţia cu media mu şi

55838
41:34:57,840 --> 41:35:02,320
abaterea standard sigma cu

55839
41:35:00,800 --> 41:35:04,640
înlocuire

55840
41:35:02,320 --> 41:35:07,664
și puteți vedea aici, bineînțeles că noi

55841
41:35:04,640 --> 41:35:09,920
au nostru uh mu minus 2 sigma și

55842
41:35:07,664 --> 41:35:11,360
răspândit aici în jos media mediana și

55843
41:35:09,920 --> 41:35:14,320
modul și așa când vorbești

55844
41:35:11,360 --> 41:35:15,840
despre populații foarte mari

55845
41:35:14,320 --> 41:35:17,920
aceste numere ar trebui să vină împreună și

55846
41:35:15,840 --> 41:35:19,920
nu ar trebui să ai o valoare distorsionată. Dacă

55847
41:35:17,920 --> 41:35:22,080
tu faci asta e un steag care e ceva

55848
41:35:19,920 --> 41:35:24,000
greșit. De aceea este atât de important

55849
41:35:22,080 --> 41:35:26,080
pentru a fi conștient de ce se întâmplă cu dvs

55850
41:35:24,000 --> 41:35:29,440
date, unde vin mostrele dvs

55851
41:35:26,080 --> 41:35:30,640
din, și matematica din spatele lui. Și dacă

55852
41:35:29,440 --> 41:35:34,160
tu vei face toate astea, trebuie

55853
41:35:30,640 --> 41:35:36,560
sari in probabilitatea conditionata. The

55854
41:35:34,160 --> 41:35:39,440
probabilitatea condiționată a unui eveniment A este

55855
41:35:36,560 --> 41:35:41,664
o probabilitate ca evenimentul să se producă

55856
41:35:39,440 --> 41:35:44,384
având în vedere cunoștințele pe care le are un eveniment B

55857
41:35:41,664 --> 41:35:48,640
a avut loc deja. Și vei vedea asta ca

55858
41:35:44,384 --> 41:35:50,960
Teorema Baze. golf B A Y S. Uh, și asta

55859
41:35:48,640 --> 41:35:54,880
este citit. Adică, ai astea funky

55860
41:35:50,960 --> 41:35:58,000
arătând paranteze P mici. A B. Aceasta este

55861
41:35:54,880 --> 41:36:00,960
probabilitatea ca A să fie adevărată în timp ce B

55862
41:35:58,000 --> 41:36:02,880
este deja adevărat. Și ai

55863
41:36:00,960 --> 41:36:06,480
probabilitatea ca B să fie adevărat atunci când A este

55864
41:36:02,880 --> 41:36:08,800
deja adevărat. Deci, P B de A probabilitate

55865
41:36:06,480 --> 41:36:11,744
a A ființa adevărată împărțită la

55866
41:36:08,800 --> 41:36:13,840
probabilitatea ca B să fie adevărată. Și vorbim

55867
41:36:11,744 --> 41:36:16,240
despre teorema lui BA care a apărut în urmă

55868
41:36:13,840 --> 41:36:18,320
în anii 1800 când a descoperit acest lucru.

55869
41:36:16,240 --> 41:36:20,480
Aceasta este o formulă atât de importantă și

55870
41:36:18,320 --> 41:36:23,920
este într-adevăr nu este dacă chiar o faci

55871
41:36:20,480 --> 41:36:27,360
matematica pe care ai putea să le faci um um

55872
41:36:23,920 --> 41:36:28,640
XY este egal cu J K și apoi le împărțiți

55873
41:36:27,360 --> 41:36:30,800
afară și o să vezi la fel

55874
41:36:28,640 --> 41:36:33,200
matematică dar funcționează cu probabilități

55875
41:36:30,800 --> 41:36:35,744
ceea ce o face cu adevărat drăguță. Și așa dacă

55876
41:36:33,200 --> 41:36:38,240
ai un s ai putea avea opt sau

55877
41:36:35,744 --> 41:36:39,920
nouă studii diferite în curs

55878
41:36:38,240 --> 41:36:41,280
diferite zone pe care le au diferiți oameni

55879
41:36:39,920 --> 41:36:44,560
au făcut studiile pe care le-au adus

55880
41:36:41,280 --> 41:36:47,744
împreună. Hm, dacă ne uităm la co-ul de azi

55881
41:36:44,560 --> 41:36:50,000
virus virusul s-a răspândit uh cu siguranță

55882
41:36:47,744 --> 41:36:52,720
studii făcute în China versus studiile

55883
41:36:50,000 --> 41:36:54,640
felul în care se fac în SUA acele date

55884
41:36:52,720 --> 41:36:56,560
este diferit în fiecare dintre aceste studii

55885
41:36:54,640 --> 41:36:58,960
dar dacă poţi găsi un loc în care

55886
41:36:56,560 --> 41:37:01,360
se suprapune acolo unde ei studiază la fel

55887
41:36:58,960 --> 41:37:02,960
lucru împreună, apoi puteți calcula

55888
41:37:01,360 --> 41:37:05,520
modificările pe care trebuie să le faci într-unul singur

55889
41:37:02,960 --> 41:37:09,024
studiază pentru a-i face egali și asta este

55890
41:37:05,520 --> 41:37:10,640
adevărat și dacă ai un studiu despre uh um

55891
41:37:09,024 --> 41:37:13,024
un grup și vrei să afli mai multe

55892
41:37:10,640 --> 41:37:15,200
despre asta. Deci această formulă este foarte

55893
41:37:13,024 --> 41:37:17,104
puternic. Uh, chiar are de-a face cu

55894
41:37:15,200 --> 41:37:19,360
partea de colectare a datelor din matematică și

55895
41:37:17,104 --> 41:37:21,360
știința datelor și înțelegerea unde

55896
41:37:19,360 --> 41:37:23,440
de la care provin datele și cum sunteți

55897
41:37:21,360 --> 41:37:25,744
urmând a combina diferite studii în

55898
41:37:23,440 --> 41:37:27,664
grupuri diferite. Și vom merge înainte și

55899
41:37:25,744 --> 41:37:29,600
intra într-un caz de utilizare. Hai să aflăm

55900
41:37:27,664 --> 41:37:32,320
șansa unei persoane de a obține plămâni

55901
41:37:29,600 --> 41:37:33,664
boală cauzată de fumat. Uh și asta este

55902
41:37:32,320 --> 41:37:35,600
cam interesant felul în care vorbesc

55903
41:37:33,664 --> 41:37:38,080
aceasta. Hm să spunem asta conform

55904
41:37:35,600 --> 41:37:41,024
raport medical furnizat de spital

55905
41:37:38,080 --> 41:37:44,160
afirmă că aproximativ 10% din toți pacienții

55906
41:37:41,024 --> 41:37:46,800
au tratat suferit de boli pulmonare pulmonare.

55907
41:37:44,160 --> 41:37:50,000
Deci avem un fel de medical generic

55908
41:37:46,800 --> 41:37:52,160
raport. Au aflat în continuare uh de către a

55909
41:37:50,000 --> 41:37:55,840
sondaj că 15% dintre pacienţi care

55910
41:37:52,160 --> 41:37:58,880
vizitează-i fumează. Deci avem 10% asta

55911
41:37:55,840 --> 41:38:02,080
sunt boli pulmonare și um 15% din

55912
41:37:58,880 --> 41:38:04,560
pacientii fumeaza. Și în sfârșit, 5% din

55913
41:38:02,080 --> 41:38:07,600
oamenii au continuat să fumeze chiar și atunci când

55914
41:38:04,560 --> 41:38:09,520
avea boală pulmonară. Nu cel mai strălucitor

55915
41:38:07,600 --> 41:38:10,800
alegere um, dar știi că este o

55916
41:38:09,520 --> 41:38:13,104
dependență, așa că poate fi cu adevărat dificil

55917
41:38:10,800 --> 41:38:15,840
a da cu piciorul. Și astfel ne putem uita la

55918
41:38:13,104 --> 41:38:18,960
probabilitate de o probabilitate anterioară de

55919
41:38:15,840 --> 41:38:21,280
10% persoane cu boli pulmonare. Și apoi

55920
41:38:18,960 --> 41:38:24,800
probabilitatea b probabilitatea ca un pacient

55921
41:38:21,280 --> 41:38:28,960
fumatul este de 15%.

55922
41:38:24,800 --> 41:38:30,880
Uh și probabilitatea de B um dacă B atunci

55923
41:38:28,960 --> 41:38:33,440
A. Probabilitatea ca un pacient să fumeze

55924
41:38:30,880 --> 41:38:36,720
chiar dacă au boli pulmonare este

55925
41:38:33,440 --> 41:38:38,320
5%. Și probabilitatea lui A este B.

55926
41:38:36,720 --> 41:38:40,480
Probabilitatea ca pacientul să aibă

55927
41:38:38,320 --> 41:38:42,000
boli pulmonare dacă fumează. Și apoi

55928
41:38:40,480 --> 41:38:43,744
când puneți formulele împreună, uh

55929
41:38:42,000 --> 41:38:45,664
ai aici o soluție bună. Primești

55930
41:38:43,744 --> 41:38:47,104
probabilitatea lui A lui B, probabilitatea

55931
41:38:45,664 --> 41:38:49,840
că pacientul va avea boală pulmonară

55932
41:38:47,104 --> 41:38:53,280
dacă fumează. Și puteți doar conecta

55933
41:38:49,840 --> 41:38:56,000
numerele direct și obținem un 3,33%

55934
41:38:53,280 --> 41:38:58,160
sansa. Prin urmare, există o șansă de 3,33%.

55935
41:38:56,000 --> 41:39:01,104
că o persoană care fumează va primi un plămân

55936
41:38:58,160 --> 41:39:03,744
boala. Deci, vom trage în sus un

55937
41:39:01,104 --> 41:39:06,800
Micul cod Python, întotdeauna preferatul meu,

55938
41:39:03,744 --> 41:39:08,720
suflecați mânecile. Ține minte, suntem

55939
41:39:06,800 --> 41:39:11,520
o să fac asta, cam așa

55940
41:39:08,720 --> 41:39:14,160
modul backend, astfel încât să puteți vedea

55941
41:39:11,520 --> 41:39:17,440
ce se întâmplă. Și apoi mai târziu suntem

55942
41:39:14,160 --> 41:39:19,520
o să creăm în care vom intra

55943
41:39:17,440 --> 41:39:20,960
un alt demo care vă arată câteva dintre

55944
41:39:19,520 --> 41:39:25,024
instrumente care sunt deja prefabricate pentru

55945
41:39:20,960 --> 41:39:26,320
aceasta. Să începem prin a crea un set. Deci

55946
41:39:25,024 --> 41:39:30,800
vom crea un set cu curly

55947
41:39:26,320 --> 41:39:34,480
bretele. Asta înseamnă că setul nostru are um

55948
41:39:30,800 --> 41:39:36,560
numai valori unice. Deci ai o listă

55949
41:39:34,480 --> 41:39:39,920
ai tupilele tale care nu pot niciodată

55950
41:39:36,560 --> 41:39:43,440
schimbați și apoi aveți um în acest caz

55951
41:39:39,920 --> 41:39:46,384
setul. Deci 47, nu poți crea un

55952
41:39:43,440 --> 41:39:49,360
47, 4. Va șterge cele patru. Deci

55953
41:39:46,384 --> 41:39:51,600
sunt doar valori unice. Și dacă folosești

55954
41:39:49,360 --> 41:39:53,600
dicționare,

55955
41:39:51,600 --> 41:39:56,160
memento rapid, asta ar trebui să arate

55956
41:39:53,600 --> 41:39:58,480
familiar pentru că este un dicționar

55957
41:39:56,160 --> 41:40:01,024
unde ai o valoare și acea valoare este

55958
41:39:58,480 --> 41:40:03,600
atribuită sau acea cheie este atribuită unui

55959
41:40:01,024 --> 41:40:05,600
valoare. Deci ai putea avea o valoare cheie

55960
41:40:03,600 --> 41:40:07,440
configurat ca dicționar. Deci este ca o

55961
41:40:05,600 --> 41:40:11,200
dicționar fără valoare. Este doar

55962
41:40:07,440 --> 41:40:17,000
cheile și toate trebuie să fie unice.

55963
41:40:11,200 --> 41:40:17,000
Și dacă rulăm asta, avem un set de 47.

55964
41:40:17,280 --> 41:40:21,440
Putem lua și o listă, un um obișnuit

55965
41:40:20,240 --> 41:40:22,880
setare. Și o să merg înainte și

55966
41:40:21,440 --> 41:40:25,744
doar introduceți un alt număr aici,

55967
41:40:22,880 --> 41:40:29,664
patru și rulează-l. Uh, și poți vedea

55968
41:40:25,744 --> 41:40:32,800
aici dacă îmi iau lista 1 2 3 4 și eu

55969
41:40:29,664 --> 41:40:36,480
convertiți-l într-un set și iată-l. al meu

55970
41:40:32,800 --> 41:40:38,560
set from list equals set my list.

55971
41:40:36,480 --> 41:40:40,384
Rezultatul este 1 2 3 4. Deci, este doar

55972
41:40:38,560 --> 41:40:42,320
șterge ultimele patru direct din

55973
41:40:40,384 --> 41:40:44,800
acolo.

55974
41:40:42,320 --> 41:40:48,080
Și cu seturile, poți intra și tu

55975
41:40:44,800 --> 41:40:51,360
acolo și imprimați aici este setul meu. al meu

55976
41:40:48,080 --> 41:40:54,800
setul trei este în set. Și apoi dacă

55977
41:40:51,360 --> 41:40:57,440
faci trei în setul meu,

55978
41:40:54,800 --> 41:41:00,080
asta va fi o funcție logică. Uh

55979
41:40:57,440 --> 41:41:04,160
și unul în setul meu, șase nu este în

55980
41:41:00,080 --> 41:41:06,960
setată și așa mai departe. Dacă rulăm asta,

55981
41:41:04,160 --> 41:41:09,280
obținem trei este în setul adevărat este

55982
41:41:06,960 --> 41:41:12,640
în mulțime fals pentru că 357 este altul

55983
41:41:09,280 --> 41:41:16,800
unul. Șase este în set, șase nu este

55984
41:41:12,640 --> 41:41:18,880
setul. Deci nu în setul meu. De asemenea, puteți

55985
41:41:16,800 --> 41:41:22,800
folosește asta cu o listă. Am fi putut doar

55986
41:41:18,880 --> 41:41:25,360
folosit 357 și ar fi la fel

55987
41:41:22,800 --> 41:41:27,664
răspunsul pe există trei și de obicei

55988
41:41:25,360 --> 41:41:29,664
faci dacă trei este în dar trei în mine

55989
41:41:27,664 --> 41:41:32,000
Setul încă funcționează doar pe obișnuit

55990
41:41:29,664 --> 41:41:34,160
listă. Și vom merge înainte și vom face puțin

55991
41:41:32,000 --> 41:41:38,080
iterație. Vom face un fel de

55992
41:41:34,160 --> 41:41:39,360
zarul unul. Ține minte 1 2 3 4 5 6.

55993
41:41:38,080 --> 41:41:42,080
Și așa vom aduce un

55994
41:41:39,360 --> 41:41:44,320
instrument de iterație și import produs ca

55995
41:41:42,080 --> 41:41:46,160
produs.

55996
41:41:44,320 --> 41:41:48,480
Și îți voi arăta ce înseamnă asta în

55997
41:41:46,160 --> 41:41:51,280
doar o secundă. Deci avem cele două zaruri ale noastre.

55998
41:41:48,480 --> 41:41:53,744
Avem zarul A și va fi a

55999
41:41:51,280 --> 41:41:55,104
set de valori. Ei pot avea doar unul

56000
41:41:53,744 --> 41:41:57,280
valoare pentru fiecare. De aceea au pus

56001
41:41:55,104 --> 41:42:00,160
el într-un set. Și dacă îți amintești de la

56002
41:41:57,280 --> 41:42:03,280
interval, este de până la șapte. Deci asta este

56003
41:42:00,160 --> 41:42:05,440
va fi 1 2 3 4 5 6. Nu va fi

56004
41:42:03,280 --> 41:42:08,480
include cele șapte. Și același lucru

56005
41:42:05,440 --> 41:42:09,744
pentru zarurile noastre B.

56006
41:42:08,480 --> 41:42:12,480
Și atunci vom face și noi

56007
41:42:09,744 --> 41:42:17,840
vom crea o listă care este

56008
41:42:12,480 --> 41:42:19,664
produsul dintre A și B. Deci, ce este um a b?

56009
41:42:17,840 --> 41:42:22,160
Și dacă mergem înainte și rulăm asta, va fi

56010
41:42:19,664 --> 41:42:23,840
imprima asta. Și te vei vedea înăuntru

56011
41:42:22,160 --> 41:42:27,104
acest caz când se spune produs pentru că

56012
41:42:23,840 --> 41:42:29,024
este un instrument de iterație,

56013
41:42:27,104 --> 41:42:31,600
vorbim despre crearea unui tupol de

56014
41:42:29,024 --> 41:42:34,240
cei doi. Așa că acum am creat un tupol

56015
41:42:31,600 --> 41:42:37,200
dintre toate rezultatele posibile ale zarurilor

56016
41:42:34,240 --> 41:42:38,960
unde zarul A este unul la trei unu la șase

56017
41:42:37,200 --> 41:42:40,720
iar zarul B este de la 1 la șase. Și poți vedea

56018
41:42:38,960 --> 41:42:42,960
unu la unu, unu la doi, unu la trei și

56019
41:42:40,720 --> 41:42:45,744
asa mai departe. Îți amintești că aveam un diapozitiv

56020
41:42:42,960 --> 41:42:47,200
asta mai devreme unde am vorbit despre um

56021
41:42:45,744 --> 41:42:50,000
diferite toate rezultatele diferite

56022
41:42:47,200 --> 41:42:52,640
a unui zar. Ne putem juca cu asta

56023
41:42:50,000 --> 41:42:57,440
un pic. Uh, putem face zaruri

56024
41:42:52,640 --> 41:42:59,200
este egal cu două fețe de zaruri împărțite 1 2 3 4 5 6.

56025
41:42:57,440 --> 41:43:00,960
Un alt mod de a face ceea ce am făcut

56026
41:42:59,200 --> 41:43:03,280
înainte și apoi putem crea un eveniment

56027
41:43:00,960 --> 41:43:06,080
spațiu în care avem un set care este

56028
41:43:03,280 --> 41:43:07,600
produsul zarurilor fețe repetate egal

56029
41:43:06,080 --> 41:43:10,480
sfârşitul zarurilor. Și vom merge înainte și doar

56030
41:43:07,600 --> 41:43:12,320
rulează asta. Și puteți vedea aici doar

56031
41:43:10,480 --> 41:43:15,104
o pune din nou prin toate diferitele

56032
41:43:12,320 --> 41:43:17,520
variabile posibile pe care le putem avea. Și apoi

56033
41:43:15,104 --> 41:43:20,384
dacă am fi vrut să luăm același lucru

56034
41:43:17,520 --> 41:43:22,880
aici și tipăriți-le pe toate așa cum am făcut noi

56035
41:43:20,384 --> 41:43:25,200
înainte să putem trece doar prin

56036
41:43:22,880 --> 41:43:30,160
rezultat și spațiu pentru evenimente. Sfârșitul rezultatului

56037
41:43:25,200 --> 41:43:32,080
egală. Așa că spațiul evenimentului se creează

56038
41:43:30,160 --> 41:43:34,720
o secvență și după cum puteți vedea aici când

56039
41:43:32,080 --> 41:43:36,080
o tipărim le stivuiește versus

56040
41:43:34,720 --> 41:43:38,240
trecând prin și punându-le într-un frumos

56041
41:43:36,080 --> 41:43:40,480
linie.

56042
41:43:38,240 --> 41:43:43,520
și vom merge înainte și vom face ceva. um,

56043
41:43:40,480 --> 41:43:45,600
hai sa imprimam. De când avem sfârșitul

56044
41:43:43,520 --> 41:43:47,600
imprimarea cu virgulă, asta înseamnă doar

56045
41:43:45,600 --> 41:43:49,920
doar că nu va lovi

56046
41:43:47,600 --> 41:43:54,360
revenirea coborând la linia următoare.

56047
41:43:49,920 --> 41:43:54,360
Uh, și vom merge înainte și vom face lungimea

56048
41:43:54,384 --> 41:43:58,384
a spațiului nostru de evenimente. Uh, asta va fi un

56049
41:43:57,104 --> 41:44:01,520
variabilă importantă pe care o vom dori

56050
41:43:58,384 --> 41:44:02,880
sa stiu intr-un minut.

56051
41:44:01,520 --> 41:44:04,880
Și bineînțeles, dacă mă las dus de cap

56052
41:44:02,880 --> 41:44:06,240
cu tastarea mea de lungime, uh, vom face

56053
41:44:04,880 --> 41:44:09,280
imprimați-l de două ori și îmi va da un

56054
41:44:06,240 --> 41:44:12,384
eroare. Deci avem 36 diferite

56055
41:44:09,280 --> 41:44:14,240
posibile variații aici

56056
41:44:12,384 --> 41:44:16,880
și s-ar putea să vrem să calculăm ceva

56057
41:44:14,240 --> 41:44:19,520
cum rămâne cu multiplu de

56058
41:44:16,880 --> 41:44:21,440
trei? Dacă vrem să avem

56059
41:44:19,520 --> 41:44:25,280
uh probabilitatea multiplului de

56060
41:44:21,440 --> 41:44:27,280
trei în configurația noastră?

56061
41:44:25,280 --> 41:44:30,240
Și așa, uh, putem pune împreună codul

56062
41:44:27,280 --> 41:44:34,720
pentru rezultatul în spațiul de evenimente al lui xy

56063
41:44:30,240 --> 41:44:36,320
este egal cu rezultatul dacă x y

56064
41:44:34,720 --> 41:44:37,744
restul 3. Deci, vom împărți

56065
41:44:36,320 --> 41:44:40,480
cu trei și uită-te la restul și

56066
41:44:37,744 --> 41:44:42,240
este egal cu zero.

56067
41:44:40,480 --> 41:44:43,664
Atunci este un rezultat favorabil și suntem

56068
41:44:42,240 --> 41:44:45,840
va da rezultatul la final

56069
41:44:43,664 --> 41:44:47,744
Acolo.

56070
41:44:45,840 --> 41:44:50,080
Și îl vom transforma într-un set. Deci,

56071
41:44:47,744 --> 41:44:52,720
rezultatul favorabil este egal cu un set. Nu

56072
41:44:50,080 --> 41:44:54,240
necesar pentru că știm că nu este

56073
41:44:52,720 --> 41:44:58,360
se va repeta, dar doar

56074
41:44:54,240 --> 41:44:58,360
în caz că, vom merge înainte și vom face asta.

56075
41:44:58,384 --> 41:45:03,024
Și dacă vrem să imprimăm rezultatul,

56076
41:45:01,664 --> 41:45:05,664
putem merge înainte și vedem cum arată

56077
41:45:03,024 --> 41:45:08,720
ca. Și puteți vedea aici, acestea sunt toate

56078
41:45:05,664 --> 41:45:11,840
multipli de trei. 1 plus 2 este 3,

56079
41:45:08,720 --> 41:45:15,024
5 4 este 9, care împărțit la 3 este 3 și

56080
41:45:11,840 --> 41:45:17,104
asa mai departe.

56081
41:45:15,024 --> 41:45:18,960
Și așa cum ne-am uitat pe lungime, uh

56082
41:45:17,104 --> 41:45:24,960
a celui de dinainte, să mergem înainte și

56083
41:45:18,960 --> 41:45:28,920
tipăriți lungimea rezultatului nostru f astfel încât noi

56084
41:45:24,960 --> 41:45:28,920
pot vedea cum arată.

56085
41:45:30,384 --> 41:45:34,560
Iată-ne.

56086
41:45:32,560 --> 41:45:35,600
Și, desigur, am uitat să adaug

56087
41:45:34,560 --> 41:45:37,360
imprimați în mijloc pentru că suntem

56088
41:45:35,600 --> 41:45:38,800
buclă prin și punând capăt

56089
41:45:37,360 --> 41:45:40,560
pe configurarea de acolo. Deci, suntem

56090
41:45:38,800 --> 41:45:45,320
o să pun amprenta acolo. Și dacă

56091
41:45:40,560 --> 41:45:45,320
Eu conduc asta, poți să vezi

56092
41:45:46,080 --> 41:45:53,104
ajungem cu 12. Deci, avem 36 în total

56093
41:45:49,520 --> 41:45:57,104
opțiuni. Avem 12 care sunt multiple

56094
41:45:53,104 --> 41:45:59,520
asta adună la un multiplu de trei.

56095
41:45:57,104 --> 41:46:02,640
Și putem converti cu ușurință a calcula

56096
41:45:59,520 --> 41:46:05,104
probabilitatea asta uh prin simpla luare

56097
41:46:02,640 --> 41:46:09,080
durata rezultatului nostru favorabil peste

56098
41:46:05,104 --> 41:46:09,080
lungimea spațiului evenimentului.

56099
41:46:09,104 --> 41:46:13,664
Și dacă o tipărim, lasă-mă să pun asta

56100
41:46:10,800 --> 41:46:15,744
acolo. Probabilitate

56101
41:46:13,664 --> 41:46:19,360
ultima linie. Așa că o introducem. Încheiem

56102
41:46:15,744 --> 41:46:21,744
cu o șansă de 3333. Și este aproximativ

56103
41:46:19,360 --> 41:46:23,200
un al treilea.

56104
41:46:21,744 --> 41:46:24,480
Și am putea dori să facem acest aspect

56105
41:46:23,200 --> 41:46:26,160
frumos. Deci hai să mergem înainte și să punem

56106
41:46:24,480 --> 41:46:27,840
o altă linie acolo. Probabilitatea de

56107
41:46:26,160 --> 41:46:30,880
obținerea sumei care este un multiplu al

56108
41:46:27,840 --> 41:46:33,880
trei este

56109
41:46:30,880 --> 41:46:33,880
3333.

56110
41:46:34,080 --> 41:46:38,384
Putem calcula același lucru pentru cinci

56111
41:46:36,320 --> 41:46:40,720
zaruri.

56112
41:46:38,384 --> 41:46:42,960
Și dacă facem asta pentru cinci zaruri și plecăm

56113
41:46:40,720 --> 41:46:45,520
înainte și rulați-l, puteți vedea că doar

56114
41:46:42,960 --> 41:46:47,840
au o mulțime de opțiuni. Deci

56115
41:46:45,520 --> 41:46:51,104
pur și simplu continuă și mai departe aici jos. Iar noi

56116
41:46:47,840 --> 41:46:54,104
se poate uita la durata evenimentului

56117
41:46:51,104 --> 41:46:54,104
spatiu.

56118
41:46:59,104 --> 41:47:05,360
Și avem peste 7.776

56119
41:47:02,384 --> 41:47:07,200
alegeri. Sunt multe alegeri.

56120
41:47:05,360 --> 41:47:10,000
Si daca vrem sa punem intrebarea ca

56121
41:47:07,200 --> 41:47:12,640
am făcut mai sus, uh care este suma unde

56122
41:47:10,000 --> 41:47:15,600
suma este un multiplu de cinci dar nu a

56123
41:47:12,640 --> 41:47:18,240
multiplu de trei? Putem trece prin toate

56124
41:47:15,600 --> 41:47:22,000
dintre aceste opțiuni diferite. Și apoi uh

56125
41:47:18,240 --> 41:47:24,800
puteți vedea aici uh d1 d2 d3 d4 d5

56126
41:47:22,000 --> 41:47:27,920
este egal cu rezultatul. Și dacă adaugi

56127
41:47:24,800 --> 41:47:29,664
acestea toate împreună și

56128
41:47:27,920 --> 41:47:32,800
împărțirea la cinci nu are a

56129
41:47:29,664 --> 41:47:35,200
restul de zero, dar restul este

56130
41:47:32,800 --> 41:47:38,080
de asemenea, a împărțirii la trei nu este egală

56131
41:47:35,200 --> 41:47:39,920
la zero. Deci multiplu de cinci este

56132
41:47:38,080 --> 41:47:42,560
egal cu zero dar multiplu de trei

56133
41:47:39,920 --> 41:47:44,560
nu este. Putem doar să îl aplicăm aici

56134
41:47:42,560 --> 41:47:47,024
și apoi ne putem uita la asta

56135
41:47:44,560 --> 41:47:48,800
rezultat favorabil. Vom merge înainte și

56136
41:47:47,024 --> 41:47:52,240
setați asta și ne vom uita doar la

56137
41:47:48,800 --> 41:47:55,240
aceasta. Care este durata noastră favorabilă

56138
41:47:52,240 --> 41:47:55,240
rezultat?

56139
41:47:58,560 --> 41:48:02,640
Întotdeauna este bine să vedem ce suntem

56140
41:47:59,920 --> 41:48:05,640
lucrând cu. Și așa avem 94 din

56141
41:48:02,640 --> 41:48:05,640
776.

56142
41:48:06,640 --> 41:48:10,080
Și apoi, bineînțeles, putem face doar o

56143
41:48:08,240 --> 41:48:11,664
împărțire simplă pentru a obține probabilitatea

56144
41:48:10,080 --> 41:48:14,384
pe aici. Care este probabilitatea ca

56145
41:48:11,664 --> 41:48:16,480
vom scoate un multiplu de cinci

56146
41:48:14,384 --> 41:48:19,744
cand le adaugi?

56147
41:48:16,480 --> 41:48:20,960
dar nu multiplu de trei. Și așa

56148
41:48:19,744 --> 41:48:22,480
doar îi vom împărți pe cei doi

56149
41:48:20,960 --> 41:48:24,720
numere. Și puteți vedea aici că primim

56150
41:48:22,480 --> 41:48:28,024
uh.16255

56151
41:48:24,720 --> 41:48:28,024
sau 11,62%.

56152
41:48:30,160 --> 41:48:35,200
Și astfel poți avea cu adevărat o imagine frumoasă

56153
41:48:32,384 --> 41:48:37,600
că asta nu este chiar o matematică complicată

56154
41:48:35,200 --> 41:48:39,920
chiar aici despre probabilități. uh este

56155
41:48:37,600 --> 41:48:41,840
doar câte opțiuni ai și

56156
41:48:39,920 --> 41:48:44,720
la câte dintre acestea te duci

56157
41:48:41,840 --> 41:48:46,960
pentru a putea veni cu

56158
41:48:44,720 --> 41:48:49,920
soluția pe care o cauți. Și asta

56159
41:48:46,960 --> 41:48:51,840
ne conduce la o matrice de confuzie. A

56160
41:48:49,920 --> 41:48:53,664
matricea de confuzie este un tabel care este

56161
41:48:51,840 --> 41:48:55,600
folosit pentru a descrie performanța unui

56162
41:48:53,664 --> 41:48:57,744
model de clasificare pe un set de teste

56163
41:48:55,600 --> 41:49:00,160
date pentru care sunt adevăratele valori

56164
41:48:57,744 --> 41:49:03,600
cunoscut. Și așa veți vedea în stânga noi

56165
41:49:00,160 --> 41:49:06,000
avem cele prezise și cele actuale și noi

56166
41:49:03,600 --> 41:49:08,384
au un negativ uh fals negativ

56167
41:49:06,000 --> 41:49:11,200
pozitiv adevărat pozitiv

56168
41:49:08,384 --> 41:49:14,160
um și apoi avem fals pozitiv și

56169
41:49:11,200 --> 41:49:17,520
negativ adevărat. Și te poți gândi la asta

56170
41:49:14,160 --> 41:49:19,280
ca modelul prezis de dvs. Ce înseamnă asta

56171
41:49:17,520 --> 41:49:21,520
medie? Asta înseamnă că dacă ți-ai împărțit

56172
41:49:19,280 --> 41:49:24,080
date și le folosiți două treimi pentru a

56173
41:49:21,520 --> 41:49:25,664
creați modelul, apoi îl puteți testa

56174
41:49:24,080 --> 41:49:27,744
împotriva unui caz real pentru ultimul

56175
41:49:25,664 --> 41:49:30,240
a treia sa vedem cat de bine iese. Cum

56176
41:49:27,744 --> 41:49:33,280
de multe ori a fost adevărat pozitiv

56177
41:49:30,240 --> 41:49:35,520
versus fals pozitiv? A dat o

56178
41:49:33,280 --> 41:49:38,384
răspuns fals pozitiv. Și poți

56179
41:49:35,520 --> 41:49:40,240
Imaginați-vă în situații medicale, asta

56180
41:49:38,384 --> 41:49:42,080
este o afacere destul de mare. Nu vrei

56181
41:49:40,240 --> 41:49:44,160
da un fals pozitiv. Deci s-ar putea

56182
41:49:42,080 --> 41:49:46,640
ajustați-vă modelul în consecință, astfel încât

56183
41:49:44,160 --> 41:49:48,880
nu ai un fals pozitiv. Spune cu a

56184
41:49:46,640 --> 41:49:50,384
test co virus, ar fi mai bine să aveți un

56185
41:49:48,880 --> 41:49:53,104
fals negativ și apoi întoarceți-vă și obțineți

56186
41:49:50,384 --> 41:49:55,600
retestat decat sa aiba 30% fals

56187
41:49:53,104 --> 41:49:58,640
pozitive acolo unde testul este frumos

56188
41:49:55,600 --> 41:50:00,640
mult invalid. Deci, într-un caz de utilizare, cum ar fi

56189
41:49:58,640 --> 41:50:02,560
predicția cancerului, să luăm în considerare o

56190
41:50:00,640 --> 41:50:04,640
exemplu unde un model de predicție a cancerului

56191
41:50:02,560 --> 41:50:07,104
este pusă la încercare pentru acuratețea sa și

56192
41:50:04,640 --> 41:50:09,280
precizie. Rezultatul real al unei persoane

56193
41:50:07,104 --> 41:50:11,104
raportul medical este comparat cu cel

56194
41:50:09,280 --> 41:50:13,840
predicția făcută de învățarea automată

56195
41:50:11,104 --> 41:50:15,840
model. Și așa puteți vedea aici aici

56196
41:50:13,840 --> 41:50:17,360
actualul nostru a prezis dacă ei

56197
41:50:15,840 --> 41:50:19,520
ai cancer sau nu. Știi cancerul a

56198
41:50:17,360 --> 41:50:22,160
unul mare. Nu vrei să ai un uh

56199
41:50:19,520 --> 41:50:23,360
fals pozitiv. Adică un fals negativ.

56200
41:50:22,160 --> 41:50:25,280
Cu alte cuvinte, nu vrei să ai

56201
41:50:23,360 --> 41:50:27,440
iti spune ca nu ai cancer

56202
41:50:25,280 --> 41:50:29,520
când faci. Deci asta ar fi ceva

56203
41:50:27,440 --> 41:50:31,104
chiar ai fi căutat în asta

56204
41:50:29,520 --> 41:50:34,080
domeniu anume. Nu vrei un

56205
41:50:31,104 --> 41:50:35,600
fals negativ. Uh și asta e din nou,

56206
41:50:34,080 --> 41:50:38,160
știi, tu ai creat un model, tu

56207
41:50:35,600 --> 41:50:40,480
au sute de oameni sau mii de

56208
41:50:38,160 --> 41:50:42,480
bucăți de date care vin. Există un

56209
41:50:40,480 --> 41:50:43,920
real celebru studiu de caz unde au

56210
41:50:42,480 --> 41:50:45,920
imaginile și toate măsurătorile

56211
41:50:43,920 --> 41:50:48,384
ei iau și sunt aproximativ 36 diferite

56212
41:50:45,920 --> 41:50:50,960
măsurătorile pe care le iau. Și apoi dacă tu

56213
41:50:48,384 --> 41:50:52,880
rulați un model de bază, doriți să știți

56214
41:50:50,960 --> 41:50:54,720
cat de exact este. Câte um

56215
41:50:52,880 --> 41:50:56,160
rezultate negative ai care sunt

56216
41:50:54,720 --> 41:50:57,664
fie spunându-le oamenilor că au cancer

56217
41:50:56,160 --> 41:50:59,664
care nu sau să le spună oamenilor că nu

56218
41:50:57,664 --> 41:51:02,160
au cancer ca au? Și apoi noi

56219
41:50:59,664 --> 41:51:04,384
putem lua aceste numere și ne putem hrăni

56220
41:51:02,160 --> 41:51:07,104
ele în acuratețea noastră, precizia noastră,

56221
41:51:04,384 --> 41:51:09,024
și rechemarea noastră. Uh, atât de exactitate,

56222
41:51:07,104 --> 41:51:11,200
metrica de precizie și reamintire

56223
41:51:09,024 --> 41:51:15,104
pentru a măsura cât de exact sunt rezultatele

56224
41:51:11,200 --> 41:51:17,280
sunt prezise. Și acesta este totalul tău

56225
41:51:15,104 --> 41:51:18,480
um adevărat unde ai obținut rezultatele potrivite.

56226
41:51:17,280 --> 41:51:21,104
le adunați, adevărat

56227
41:51:18,480 --> 41:51:23,440
pozitiv, adevăratul negativ peste tot

56228
41:51:21,104 --> 41:51:26,880
rezultate. Deci ce procent dintre ei erau

56229
41:51:23,440 --> 41:51:28,640
exacte versus ceea ce a fost greșit. vorbim

56230
41:51:26,880 --> 41:51:30,240
despre precizie este o măsurătoare de măsurat

56231
41:51:28,640 --> 41:51:32,000
câte dintre cele prezise corect

56232
41:51:30,240 --> 41:51:36,480
cazuri s-au dovedit de fapt a fi

56233
41:51:32,000 --> 41:51:38,800
pozitiv. Deci avem o precizie

56234
41:51:36,480 --> 41:51:42,240
adevărat pozitiv. Din nou, dacă vorbești

56235
41:51:38,800 --> 41:51:44,960
cam ca uh testarea COVID cu

56236
41:51:42,240 --> 41:51:47,664
viruși, chiar vrei să fie un

56237
41:51:44,960 --> 41:51:49,840
un număr mare. vrei asta adevărat

56238
41:51:47,664 --> 41:51:51,280
ca să fie punctul central în care tu

56239
41:51:49,840 --> 41:51:53,600
ar putea avea opusul dacă ești

56240
41:51:51,280 --> 41:51:56,480
te descurci cu cancerul unde vrei nu

56241
41:51:53,600 --> 41:51:58,880
false negative. Uh, deci acesta este al tău

56242
41:51:56,480 --> 41:52:02,240
metrica aici. Precizia este testul tău

56243
41:51:58,880 --> 41:52:05,360
pozitiv uh adevărat pozitiv plus uh fals

56244
41:52:02,240 --> 41:52:07,440
pozitiv. Și apoi îți amintești câte

56245
41:52:05,360 --> 41:52:09,744
dintre cazurile pozitive reale pe care le-am fost

56246
41:52:07,440 --> 41:52:12,320
capabil să prezică rapid cu modelul nostru.

56247
41:52:09,744 --> 41:52:15,520
Deci testul pozitiv este testul pozitiv

56248
41:52:12,320 --> 41:52:17,520
plus falsul negativ de acolo. Şi

56249
41:52:15,520 --> 41:52:21,280
Vom dori să mergem mai departe și să facem o demonstrație

56250
41:52:17,520 --> 41:52:24,560
clasificatorul naiv de golf. Înainte să ajung

56251
41:52:21,280 --> 41:52:25,600
prea departe în uh naiv baze clasificator

56252
41:52:24,560 --> 41:52:30,384
pentru că o vom scoate din

56253
41:52:25,600 --> 41:52:31,744
sklearn sau scikit. Hai să mergem înainte

56254
41:52:30,384 --> 41:52:33,280
un fel de pagina interesanta aici pt

56255
41:52:31,744 --> 41:52:35,744
clasificatoare. Când intri în

56256
41:52:33,280 --> 41:52:37,744
sklearn kit, există o mulțime de moduri de a face

56257
41:52:35,744 --> 41:52:40,384
clasificare. O să măresc doar

56258
41:52:37,744 --> 41:52:42,480
aici pentru a putea vedea câteva dintre titluri.

56259
41:52:40,384 --> 41:52:44,720
Uh, există totul de la cel mai apropiat

56260
41:52:42,480 --> 41:52:46,480
vecin liniar

56261
41:52:44,720 --> 41:52:50,240
dar ne vom concentra pe

56262
41:52:46,480 --> 41:52:52,240
golfuri naive de aici. Și asta este doar

56263
41:52:50,240 --> 41:52:54,480
un set de date eșantion pe care l-au pus

56264
41:52:52,240 --> 41:52:57,200
împreună. Și puteți vedea cum unele dintre ele

56265
41:52:54,480 --> 41:53:00,000
acestea au o ieșire foarte diferită. The

56266
41:52:57,200 --> 41:53:03,104
naive bay amintiți-vă este înființat ca probabil

56267
41:53:00,000 --> 41:53:05,744
cel mai simplificat calculator uh sau um

56268
41:53:03,104 --> 41:53:07,360
un set de predicții acolo. Și așa

56269
41:53:05,744 --> 41:53:08,960
despre ce am tot vorbit cu

56270
41:53:07,360 --> 41:53:11,024
adevărat fals și chestii de genul ăsta unde

56271
41:53:08,960 --> 41:53:13,600
există un uh

56272
41:53:11,024 --> 41:53:14,960
o convingere că există o independentă

56273
41:53:13,600 --> 41:53:17,200
presupunere între trăsăturile unde

56274
41:53:14,960 --> 41:53:19,744
se presupune foarte mult că trăsăturile au

56275
41:53:17,200 --> 41:53:21,840
un fel de conexiune, atunci putem

56276
41:53:19,744 --> 41:53:23,200
merge mai departe și folosește asta pentru

56277
41:53:21,840 --> 41:53:26,160
predictie. Și așa suntem

56278
41:53:23,200 --> 41:53:27,600
folosind ca un clasificator naiv bay versus

56279
41:53:26,160 --> 41:53:30,480
multe dintre celelalte clasificatoare care sunt

56280
41:53:27,600 --> 41:53:32,720
acolo afară.

56281
41:53:30,480 --> 41:53:35,280
Pentru asta vom folosi uh the

56282
41:53:32,720 --> 41:53:38,160
reclame de rețele sociale. Sunt puține date

56283
41:53:35,280 --> 41:53:42,240
Pune-te aici și dă-mi drumul și deschid

56284
41:53:38,160 --> 41:53:45,440
asta sus dosarul. Uh, aici mergem. Are

56285
41:53:42,240 --> 41:53:48,000
ID utilizator, sex, vârstă, salariu estimat,

56286
41:53:45,440 --> 41:53:52,000
a cumparat. Și așa avem, puteți vedea

56287
41:53:48,000 --> 41:53:56,240
ID-ul utilizatorului, bărbat de 19 ani, estimat

56288
41:53:52,000 --> 41:53:57,664
salariu 19.000 si cumparat zero. Da

56289
41:53:56,240 --> 41:54:01,200
fie va face o achiziție, fie

56290
41:53:57,664 --> 41:54:03,024
nu. Deci uită-te la ultimul. 01. Noi

56291
41:54:01,200 --> 41:54:05,744
ar trebui să se gândească la binome. noi

56292
41:54:03,024 --> 41:54:09,104
ar trebui să se gândească la o bază naivă simplă

56293
41:54:05,744 --> 41:54:10,720
tip de configurație a clasificatorului.

56294
41:54:09,104 --> 41:54:14,240
Deci, dacă închidem asta, o vom face

56295
41:54:10,720 --> 41:54:16,480
mergeți mai departe și importați numpy-ul nostru ca np.

56296
41:54:14,240 --> 41:54:18,480
Ne bucurăm să avem o imagine bună

56297
41:54:16,480 --> 41:54:21,280
datele noastre. Așa că vom pune în mattplot

56298
41:54:18,480 --> 41:54:23,280
bibliotecă. Iată panda noastră, datele noastre

56299
41:54:21,280 --> 41:54:24,720
cadru.

56300
41:54:23,280 --> 41:54:26,960
Uh și apoi vom merge înainte și

56301
41:54:24,720 --> 41:54:28,384
importa setul de date. Și setul de date

56302
41:54:26,960 --> 41:54:31,280
va fi din care o vom citi

56303
41:54:28,384 --> 41:54:32,640
rețeaua socială ads.csv. Atunci suntem

56304
41:54:31,280 --> 41:54:34,384
o să imprimi capul doar ca să poți

56305
41:54:32,640 --> 41:54:37,104
să-l vezi din nou, chiar dacă ți-am arătat

56306
41:54:34,384 --> 41:54:40,800
acesta în dosar. Și X este egal cu datele

56307
41:54:37,104 --> 41:54:43,744
setați I locația uh două trei valori și Y

56308
41:54:40,800 --> 41:54:45,280
va fi coloana patru uh 4. Să

56309
41:54:43,744 --> 41:54:47,360
Eu doar rulez asta, așa că este puțin mai ușor

56310
41:54:45,280 --> 41:54:50,240
să trec peste asta. Poți vedea bine

56311
41:54:47,360 --> 41:54:54,800
aici ne vom uita la uh 012

56312
41:54:50,240 --> 41:54:57,280
este vârsta și salariul estimat. Deci 2 trei

56313
41:54:54,800 --> 41:55:00,384
și asta este ceea ce am locația înseamnă doar um

56314
41:54:57,280 --> 41:55:02,640
că ne uităm la număr versus

56315
41:55:00,384 --> 41:55:04,480
o locație obișnuită. Uh locație obișnuită

56316
41:55:02,640 --> 41:55:06,320
ai spune de fapt vârsta și estimarea

56317
41:55:04,480 --> 41:55:08,240
salariu.

56318
41:55:06,320 --> 41:55:10,880
Și apoi coloana a patra este au făcut a

56319
41:55:08,240 --> 41:55:12,240
cumpărare? Au cumpărat ceva. Uh

56320
41:55:10,880 --> 41:55:13,664
deci acestea sunt cele trei coloane care suntem

56321
41:55:12,240 --> 41:55:15,280
ne vom uita când vom face asta.

56322
41:55:13,664 --> 41:55:17,840
Și am mers înainte și le-am importat

56323
41:55:15,280 --> 41:55:19,664
și a importat datele. Deci acum datele noastre

56324
41:55:17,840 --> 41:55:22,664
set este setat cu aceste informații în

56325
41:55:19,664 --> 41:55:22,664
ea.

56326
41:55:23,024 --> 41:55:26,960
Și va trebui să mergem înainte și să împărțim

56327
41:55:24,640 --> 41:55:29,744
date sus. Deci avem nevoie de noi de la

56328
41:55:26,960 --> 41:55:32,640
selecția modelului sklearn pe care o putem importa

56329
41:55:29,744 --> 41:55:34,640
împărțirea testului trenului. Uh, asta face un lucru frumos

56330
41:55:32,640 --> 41:55:36,800
job. Putem seta starea aleatorie astfel

56331
41:55:34,640 --> 41:55:39,104
alege aleatoriu datele. Și suntem doar

56332
41:55:36,800 --> 41:55:41,600
va lua uh 25% din ea

56333
41:55:39,104 --> 41:55:44,880
intră în test testul nostru x și y

56334
41:55:41,600 --> 41:55:48,320
test și cei 75% vor merge la x tren și

56335
41:55:44,880 --> 41:55:50,560
y tren. În acest fel, odată ce ne creăm

56336
41:55:48,320 --> 41:55:52,384
model, putem avea apoi date de văzut doar

56337
41:55:50,560 --> 41:55:56,640
cât de precis sau cât de bine are

56338
41:55:52,384 --> 41:55:59,664
realizat cu predicția noastră.

56339
41:55:56,640 --> 41:56:02,880
Următorul pas în preprocesarea datelor noastre

56340
41:55:59,664 --> 41:56:04,480
este să mergi înainte și să faci scalarea caracteristicilor.

56341
41:56:02,880 --> 41:56:06,240
Acum, multe dintre acestea încep să se uite

56342
41:56:04,480 --> 41:56:08,320
familiar. Dacă ați făcut o serie de

56343
41:56:06,240 --> 41:56:10,720
alte module și configurare, ar trebui

56344
41:56:08,320 --> 41:56:12,320
începeți să observați că ne aducem

56345
41:56:10,720 --> 41:56:14,640
date. Aruncăm o privire la ceea ce suntem

56346
41:56:12,320 --> 41:56:17,440
lucrând cu. uh mergem înainte și ne despărțim

56347
41:56:14,640 --> 41:56:18,800
până la antrenament și testare. Uh in

56348
41:56:17,440 --> 41:56:20,640
acest caz, vom merge înainte și

56349
41:56:18,800 --> 41:56:24,160
scala-l. Scala înseamnă că punem

56350
41:56:20,640 --> 41:56:26,000
este între o valoare de minus1 și un uh

56351
41:56:24,160 --> 41:56:28,320
sau undeva în acel punct de mijloc

56352
41:56:26,000 --> 41:56:31,280
acolo. În acest fel, dacă ai ceva uriaș

56353
41:56:28,320 --> 41:56:33,840
set, nu ai această configurație uriașă.

56354
41:56:31,280 --> 41:56:39,104
Dacă ne întoarcem până aici unde salariul uh

56355
41:56:33,840 --> 41:56:40,560
salariul este de 20.000 față de vârsta de 35 de ani, ei bine,

56356
41:56:39,104 --> 41:56:43,360
există șanse mari cu o mulțime de

56357
41:56:40,560 --> 41:56:45,440
matematica back-end care 20.000 va denatura

56358
41:56:43,360 --> 41:56:47,360
rezultate si salariul estimat va

56359
41:56:45,440 --> 41:56:48,880
au un impact mai mare decât vârsta

56360
41:56:47,360 --> 41:56:50,640
în loc să le echilibreze şi

56361
41:56:48,880 --> 41:56:52,640
lăsând calculele să le cântărească

56362
41:56:50,640 --> 41:56:55,360
în mod corespunzător.

56363
41:56:52,640 --> 41:56:58,960
Și, în sfârșit, ajungem să creăm cu adevărat

56364
41:56:55,360 --> 41:57:00,640
modelul nostru naiv de golf.

56365
41:56:58,960 --> 41:57:04,800
Um, și apoi vom merge înainte și

56366
41:57:00,640 --> 41:57:07,744
import golfurile naive din Gazian.

56367
41:57:04,800 --> 41:57:09,920
Și Gazianul este cel mai elementar

56368
41:57:07,744 --> 41:57:12,480
unul. La asta ne uităm acum.

56369
41:57:09,920 --> 41:57:15,664
Se pare totuși, dacă mergi la SK

56370
41:57:12,480 --> 41:57:17,280
kit de învățare, au un număr de

56371
41:57:15,664 --> 41:57:20,320
altele pe care le poți trage acolo.

56372
41:57:17,280 --> 41:57:22,800
Există un Bernoli. Eu nu am folosit niciodată

56373
41:57:20,320 --> 41:57:25,920
acela. categoric

56374
41:57:22,800 --> 41:57:27,440
compliment. Și iată Gazianul nostru. Uh

56375
41:57:25,920 --> 41:57:30,000
deci există o serie de opțiuni diferite

56376
41:57:27,440 --> 41:57:32,384
te poti uita la. Gazian când vii la

56377
41:57:30,000 --> 41:57:34,640
golfurile naive este cel mai frecvent

56378
41:57:32,384 --> 41:57:36,240
folosit. Deci vorbim despre

56379
41:57:34,640 --> 41:57:37,664
golfuri naive asta este de obicei ceea ce oamenii

56380
41:57:36,240 --> 41:57:39,840
vorbesc despre când ei când sunt

56381
41:57:37,664 --> 41:57:41,280
trăgând asta înăuntru. Și unul dintre cei drăguți

56382
41:57:39,840 --> 41:57:44,000
lucruri despre gazian dacă mergi la

56383
41:57:41,280 --> 41:57:46,240
site-ul lor pentru a-i învăța pe naivi

56384
41:57:44,000 --> 41:57:47,600
Bay Gazian e multă mișto

56385
41:57:46,240 --> 41:57:50,320
caracteristici. Una dintre ele este că poți face

56386
41:57:47,600 --> 41:57:51,744
se potrivește parțial aici. Hm asta înseamnă dacă

56387
41:57:50,320 --> 41:57:53,440
ai o cantitate imensă de date, tu

56388
41:57:51,744 --> 41:57:57,600
nu trebuie să proceseze totul la tine

56389
41:57:53,440 --> 41:57:59,600
dată. Îl puteți combina în Gausian

56390
41:57:57,600 --> 41:58:01,360
uh NB model. Și mai sunt multe altele

56391
41:57:59,600 --> 41:58:03,840
diferite lucruri pe care le poți face cu el ca

56392
41:58:01,360 --> 41:58:06,080
în ceea ce privește potrivirea datelor și cum um

56393
41:58:03,840 --> 41:58:07,360
manipulați-l. Noi doar facem

56394
41:58:06,080 --> 41:58:09,104
elementele de bază. Deci vom merge înainte și

56395
41:58:07,360 --> 41:58:12,000
creați clasificatorul nostru. Vom merge

56396
41:58:09,104 --> 41:58:13,360
egal cu Gausian NB.

56397
41:58:12,000 --> 41:58:15,920
Și apoi vom face o potrivire. Suntem

56398
41:58:13,360 --> 41:58:20,560
se va potrivi cu datele noastre de antrenament și noastre

56399
41:58:15,920 --> 41:58:22,384
soluție de antrenament. Deci, X-Rain, Y tren,

56400
41:58:20,560 --> 41:58:24,160
și vom merge înainte și vom rula asta. Uh,

56401
41:58:22,384 --> 41:58:26,560
ne va spune că a rulat

56402
41:58:24,160 --> 41:58:29,200
cod chiar acolo.

56403
41:58:26,560 --> 41:58:32,080
Și acum avem clasificatorul nostru antrenat

56404
41:58:29,200 --> 41:58:33,840
model. Deci, următorul pas este că trebuie

56405
41:58:32,080 --> 41:58:35,920
mergeți mai departe și executați o predicție. Suntem

56406
41:58:33,840 --> 41:58:37,664
va face predicția noastră Y este egală cu

56407
41:58:35,920 --> 41:58:40,800
clasificator.predic

56408
41:58:37,664 --> 41:58:44,664
testul X. Deci, aici ne potrivim datele și acum

56409
41:58:40,800 --> 41:58:44,664
vom merge înainte și vom prezice.

56410
41:58:45,744 --> 41:58:52,560
Și acum ajungem la matricea noastră de confuzie.

56411
41:58:49,200 --> 41:58:54,960
Uh, de la valorile matricei Sklearn

56412
41:58:52,560 --> 41:58:56,720
vă puteți importa matricea de confuzie

56413
41:58:54,960 --> 41:58:59,024
la fel cum te scutește de a face toate

56414
41:58:56,720 --> 41:59:00,160
matematică simplă. Face totul pentru tine. Şi

56415
41:58:59,024 --> 41:59:02,480
apoi vom merge mai departe și vom crea

56416
41:59:00,160 --> 41:59:05,744
metrica confuziei cu testul y și

56417
41:59:02,480 --> 41:59:08,384
y prezice. Deci avem actualul nostru și

56418
41:59:05,744 --> 41:59:10,160
avem valoarea noastră prezisă.

56419
41:59:08,384 --> 41:59:11,840
Și puteți vedea de aici că acesta este

56420
41:59:10,160 --> 41:59:14,720
diagrama la care ne-am uitat. Aici este prezis.

56421
41:59:11,840 --> 41:59:18,560
Deci, adevărat pozitiv, fals pozitiv, fals

56422
41:59:14,720 --> 41:59:20,320
negativ, adevărat negativ.

56423
41:59:18,560 --> 41:59:24,104
Și dacă mergem înainte și rulăm asta, acolo

56424
41:59:20,320 --> 41:59:24,104
o avem. 653725.

56425
41:59:24,880 --> 41:59:30,480
Și în această predicție specială, noi

56426
41:59:27,360 --> 41:59:32,160
a avut 65 uh sau a prezis adevărul cât de departe

56427
41:59:30,480 --> 41:59:35,200
ca o achiziție. Vor face o

56428
41:59:32,160 --> 41:59:37,360
cumpărare și am ghicit trei greșit.

56429
41:59:35,200 --> 41:59:40,384
Și apoi am avut 25 pe care le-am prezis

56430
41:59:37,360 --> 41:59:44,640
nu cumpără, iar șapte dintre ei au făcut-o. Deci,

56431
41:59:40,384 --> 41:59:46,720
acolo este matricea noastră de confuzie.

56432
41:59:44,640 --> 41:59:49,280
În acest moment, dacă ai fi cu tine

56433
41:59:46,720 --> 41:59:50,880
acţionari sau o şedinţă de consiliu, um tu

56434
41:59:49,280 --> 41:59:52,240
ar începe să audă niște ațițit dacă

56435
41:59:50,880 --> 41:59:54,080
se uitau la numere și la tine

56436
41:59:52,240 --> 41:59:56,384
spune: „Hei, iată confuzia mea uh

56437
41:59:54,080 --> 41:59:58,640
matrice." Deci, hai să mergem înainte și

56438
41:59:56,384 --> 42:00:00,000
vizualiza rezultatele.

56439
41:59:58,640 --> 42:00:04,480
Vom trage din diagrama hărții

56440
42:00:00,000 --> 42:00:06,720
culorile bibliotecii importă harta de culori listată.

56441
42:00:04,480 --> 42:00:09,200
Um, și acesta este de fapt al mașinii mele

56442
42:00:06,720 --> 42:00:12,384
voi arunca o eroare pentru că aceasta este

56443
42:00:09,200 --> 42:00:14,480
fiind um din cauza modului de configurare

56444
42:00:12,384 --> 42:00:17,104
este. Am o versiune mai nouă aici decât

56445
42:00:14,480 --> 42:00:19,200
când au pus împreună demo-ul. Iar noi

56446
42:00:17,104 --> 42:00:22,160
nevoie de setul nostru X și setul Y, care

56447
42:00:19,200 --> 42:00:25,280
este trenul nostru X și trenul Y. Și apoi

56448
42:00:22,160 --> 42:00:28,160
ne vom crea X1, X2. Și vom pune

56449
42:00:25,280 --> 42:00:31,840
asta într-o grilă. Uh, și am stabilit X-ul nostru

56450
42:00:28,160 --> 42:00:33,200
setați oprirea minimă și X setați oprirea maximă.

56451
42:00:31,840 --> 42:00:35,440
Și dacă vii până aici,

56452
42:00:33,200 --> 42:00:37,520
mergem la pasul 0. 001. Aceasta este

56453
42:00:35,440 --> 42:00:38,800
ne va oferi o linie drăguță, uh, este

56454
42:00:37,520 --> 42:00:41,744
ce face asta. Și apoi mergem

56455
42:00:38,800 --> 42:00:44,560
a trasa conturul, uh, a reprezenta un grafic x

56456
42:00:41,744 --> 42:00:46,160
limitează, trasează limita y și pune

56457
42:00:44,560 --> 42:00:48,560
diagramă de dispersie acolo. Și să mergem

56458
42:00:46,160 --> 42:00:50,960
înainte și rulați asta. Uh, sincer să fiu,

56459
42:00:48,560 --> 42:00:52,560
când fac aceste grafice, așa este

56460
42:00:50,960 --> 42:00:53,920
multe moduri diferite de a face asta. Există

56461
42:00:52,560 --> 42:00:56,480
atât de multe moduri diferite de a pune acest cod

56462
42:00:53,920 --> 42:00:59,024
împreună pentru a vă arăta ce facem.

56463
42:00:56,480 --> 42:01:00,960
este mult mai ușor să tragi în sus

56464
42:00:59,024 --> 42:01:04,320
grafic și apoi mergeți înapoi și explicați

56465
42:01:00,960 --> 42:01:07,200
ea. Deci primul lucru pe care vrem să-l remarcăm

56466
42:01:04,320 --> 42:01:10,000
aici când ne uităm la date

56467
42:01:07,200 --> 42:01:12,080
acesta este setul de antrenament.

56468
42:01:10,000 --> 42:01:14,240
Și așa îi avem pe cei care nu au făcut a

56469
42:01:12,080 --> 42:01:17,104
cumpărare. Am desenat o zonă frumoasă pentru

56470
42:01:14,240 --> 42:01:19,440
că asta este definit de golful naiv

56471
42:01:17,104 --> 42:01:21,440
setare. Și apoi îi avem pe cei care au făcut-o

56472
42:01:19,440 --> 42:01:23,360
faceți o achiziție, verdele. Și poți

56473
42:01:21,440 --> 42:01:25,104
vezi ca unele dintre punctele verzi cad

56474
42:01:23,360 --> 42:01:27,520
în zona roșie și o parte din roșie

56475
42:01:25,104 --> 42:01:30,240
puncte cad în verde. Deci chiar și a noastră

56476
42:01:27,520 --> 42:01:32,480
setul de antrenament nu va fi 100%. Uh

56477
42:01:30,240 --> 42:01:34,240
nu am putea face asta. Și așa suntem

56478
42:01:32,480 --> 42:01:37,520
uitându-ne la datele noastre diferite care vin

56479
42:01:34,240 --> 42:01:40,000
jos. Uh, putem să ne aranjam x1

56480
42:01:37,520 --> 42:01:43,744
x2, așa că avem un complot frumos. Şi

56481
42:01:40,000 --> 42:01:45,280
vom crea conturul um.

56482
42:01:43,744 --> 42:01:47,920
Asta e acea linie drăguță care este trasă în jos

56483
42:01:45,280 --> 42:01:49,840
mijlocul aici cu roșu verde.

56484
42:01:47,920 --> 42:01:51,664
Um asta e ceea ce face asta

56485
42:01:49,840 --> 42:01:55,360
chiar aici cu remodelarea și observația

56486
42:01:51,664 --> 42:01:57,104
că a trebuit să facem dacă tu

56487
42:01:55,360 --> 42:02:00,320
amintește-ți de numpy um dacă ai făcut

56488
42:01:57,104 --> 42:02:05,520
modulul numpy um ajungi cu perechi

56489
42:02:00,320 --> 42:02:07,600
știi x uh x1 x2 x1 x2 rândul următor și

56490
42:02:05,520 --> 42:02:09,360
așa mai departe, trebuie să-l răsturnești, așa că e tot

56491
42:02:07,600 --> 42:02:11,600
pe un rând aveți toate x1-urile și toate

56492
42:02:09,360 --> 42:02:15,200
x2-urile tale. Um deci cam asta suntem

56493
42:02:11,600 --> 42:02:17,200
caută chiar aici pe această configurație.

56494
42:02:15,200 --> 42:02:19,520
Uh, și apoi diagrama de dispersie este de

56495
42:02:17,200 --> 42:02:20,720
bineînțeles, datele dvs. împrăștiate

56496
42:02:19,520 --> 42:02:22,800
acolo. Doar trecem prin toate

56497
42:02:20,720 --> 42:02:25,440
puncte care pun aceste puncte mici drăguțe

56498
42:02:22,800 --> 42:02:27,840
în configurația noastră de aici. Și avem a noastră

56499
42:02:25,440 --> 42:02:29,280
salariul estimativ si H. nostru Iar apoi de

56500
42:02:27,840 --> 42:02:31,920
desigur, punctele sunt au făcut a

56501
42:02:29,280 --> 42:02:33,520
cumpărare sau nu. Și doar o notă rapidă,

56502
42:02:31,920 --> 42:02:36,384
asta e cam amuzant. Poți vedea sus

56503
42:02:33,520 --> 42:02:39,280
aici, unde scrie X set Y set egal uh

56504
42:02:36,384 --> 42:02:42,240
Trenul X Trenul Y, care pare un fel de a

56505
42:02:39,280 --> 42:02:43,840
putin ciudat de facut. Hm, asta pentru că

56506
42:02:42,240 --> 42:02:46,240
acesta este probabil inițial un

56507
42:02:43,840 --> 42:02:47,440
definiție. Uh, deci este propriul său modul

56508
42:02:46,240 --> 42:02:50,160
care ar putea fi numit iar și iar

56509
42:02:47,440 --> 42:02:51,200
din nou. Și care este într-adevăr o modalitate bună

56510
42:02:50,160 --> 42:02:52,720
fă-o pentru că următorul lucru la care mergem

56511
42:02:51,200 --> 42:02:55,200
să vrei să faci este să faci exact același lucru

56512
42:02:52,720 --> 42:02:57,600
lucru, dar vom vizualiza

56513
42:02:55,200 --> 42:02:59,104
rezultatele setului de testare. Uh, așa putem

56514
42:02:57,600 --> 42:03:02,080
vezi ce s-a întâmplat cu grupul nostru de testare,

56515
42:02:59,104 --> 42:03:04,384
25% al nostru.

56516
42:03:02,080 --> 42:03:07,104
Și puteți vedea aici jos că avem

56517
42:03:04,384 --> 42:03:09,440
set de testare. Uh, și asta, dacă te uiți la

56518
42:03:07,104 --> 42:03:12,320
două grafice unul lângă altul, acesta

56519
42:03:09,440 --> 42:03:14,480
evident că are 75% din date, deci

56520
42:03:12,320 --> 42:03:17,440
se va arăta mult mai mult. Aceasta este

56521
42:03:14,480 --> 42:03:19,440
doar 25% din date. Puteți vedea asta

56522
42:03:17,440 --> 42:03:21,280
există un număr care sunt cam pe

56523
42:03:19,440 --> 42:03:22,960
marginea dacă ar putea ghici

56524
42:03:21,280 --> 42:03:25,744
vârsta și veniturile pe care le vor face a

56525
42:03:22,960 --> 42:03:27,024
cumpărare sau nu. U, dar asta spus, asta

56526
42:03:25,744 --> 42:03:28,880
încă este destul de clar. E destul de bine

56527
42:03:27,024 --> 42:03:31,360
cât este devizul şi

56528
42:03:28,880 --> 42:03:34,880
ce bine face.

56529
42:03:31,360 --> 42:03:37,360
Acum, graficele sunt cu adevărat eficiente pentru

56530
42:03:34,880 --> 42:03:39,360
arătându-le oamenilor ce se întâmplă, dar tu

56531
42:03:37,360 --> 42:03:41,104
trebuie să aibă și numerele. Si asa,

56532
42:03:39,360 --> 42:03:43,520
vom face din sklearn, suntem

56533
42:03:41,104 --> 42:03:44,480
vom importa valori, apoi suntem

56534
42:03:43,520 --> 42:03:46,640
vom imprima valorile noastre

56535
42:03:44,480 --> 42:03:49,920
portul de clasificare din testul Y și

56536
42:03:46,640 --> 42:03:52,160
Y prezice.

56537
42:03:49,920 --> 42:03:54,720
Și puteți vedea aici că avem precizie

56538
42:03:52,160 --> 42:03:56,240
Precizia zerourilor este de 90. Acolo este a noastră

56539
42:03:54,720 --> 42:04:00,320
reamintire

56540
42:03:56,240 --> 42:04:03,200
96. Avem un scor F1 și un suport.

56541
42:04:00,320 --> 42:04:05,360
Și avem precizia noastră, rechemarea

56542
42:04:03,200 --> 42:04:07,840
obtinerea corecta. Uh, și apoi putem face

56543
42:04:05,360 --> 42:04:10,384
acuratețea noastră, media macro și

56544
42:04:07,840 --> 42:04:13,520
medie ponderată. Uh, ca să-l poți vedea

56545
42:04:10,384 --> 42:04:15,840
trage destul de bine în măsura în care um cum

56546
42:04:13,520 --> 42:04:18,384
exact este. Ai putea spune că merge

56547
42:04:15,840 --> 42:04:21,104
a fi aproximativ 90% va ghici

56548
42:04:18,384 --> 42:04:23,664
corect um că ei nu sunt

56549
42:04:21,104 --> 42:04:25,744
merg sa cumpere. Și am avut 89%

56550
42:04:23,664 --> 42:04:27,520
șansa ca ei să cumpere.

56551
42:04:25,744 --> 42:04:29,664
Hm, și apoi celelalte numere ca tine

56552
42:04:27,520 --> 42:04:31,024
coboară să aibă un pic diferit

56553
42:04:29,664 --> 42:04:33,600
sens, dar este destul de simplu

56554
42:04:31,024 --> 42:04:35,600
pe aici. Iată acuratețea noastră și aici

56555
42:04:33,600 --> 42:04:36,960
media noastră micro și ponderată

56556
42:04:35,600 --> 42:04:38,960
medie și tot ce ai putea

56557
42:04:36,960 --> 42:04:42,160
nevoie. Și dacă ai uitat exact

56558
42:04:38,960 --> 42:04:44,720
definiția exactității, este adevărată

56559
42:04:42,160 --> 42:04:47,440
pozitiv, adevărat negativ peste toate

56560
42:04:44,720 --> 42:04:50,320
configurații diferite. Precizia este adevăratul tău

56561
42:04:47,440 --> 42:04:53,280
pozitiv peste toate pozitive, adevărat și

56562
42:04:50,320 --> 42:04:56,640
fals. Și amintirea este un adevărat pozitiv

56563
42:04:53,280 --> 42:04:58,080
peste adevărat pozitiv plus fals negativ.

56564
42:04:56,640 --> 42:05:00,960
Și ne putem întoarce foarte repede înapoi

56565
42:04:58,080 --> 42:05:03,280
acolo, astfel încât să puteți vedea acele numere

56566
42:05:00,960 --> 42:05:06,720
aici. Uh, iată precizia noastră, aici

56567
42:05:03,280 --> 42:05:07,520
rechemarea noastră și iată exactitatea noastră

56568
42:05:06,720 --> 42:05:09,440
aceasta.

56569
42:05:07,520 --> 42:05:11,360
>> Bine ați venit la această călătorie interesantă în

56570
42:05:09,440 --> 42:05:13,600
lumea statisticii pentru date

56571
42:05:11,360 --> 42:05:15,920
stiinta. Te-ai întrebat vreodată cum sunt date

56572
42:05:13,600 --> 42:05:18,800
se transformă din numere brute în

56573
42:05:15,920 --> 42:05:21,280
perspective puternice care conduc deciziile?

56574
42:05:18,800 --> 42:05:23,280
Ei bine, statistica este magia din spatele ei

56575
42:05:21,280 --> 42:05:25,744
toate. Astăzi, vom descoperi cum

56576
42:05:23,280 --> 42:05:28,320
metodele statistice ne ajută să rezumam

56577
42:05:25,744 --> 42:05:31,024
date, incertitudinea modelului, test

56578
42:05:28,320 --> 42:05:33,744
ipoteză și găsiți relații care

56579
42:05:31,024 --> 42:05:35,744
poate prezice viitorul. Așadar, prindeți centura.

56580
42:05:33,744 --> 42:05:37,744
Suntem pe cale să transformăm numere în

56581
42:05:35,744 --> 42:05:40,000
cunoștințe. Fără nicio altă prelungire,

56582
42:05:37,744 --> 42:05:42,000
hai sa incepem. Acum, pentru a începe,

56583
42:05:40,000 --> 42:05:44,320
iată o întrebare cheie. Ce sunt

56584
42:05:42,000 --> 42:05:46,720
statistici în știința datelor? Acum,

56585
42:05:44,320 --> 42:05:49,360
statistica este știința colectării,

56586
42:05:46,720 --> 42:05:51,744
analiza si interpretarea datelor. De către

56587
42:05:49,360 --> 42:05:54,240
aplicând metode statistice, putem

56588
42:05:51,744 --> 42:05:57,104
descoperi modele în date și creați

56589
42:05:54,240 --> 42:05:59,744
decizii informate. Acum, pe măsură ce continuăm,

56590
42:05:57,104 --> 42:06:02,320
observați cum aceste concepte esențiale

56591
42:05:59,744 --> 42:06:04,880
va forma coloana vertebrală a multor date

56592
42:06:02,320 --> 42:06:07,664
practici științifice. Să explorăm cheia

56593
42:06:04,880 --> 42:06:10,320
funcțiile statisticii în știința datelor.

56594
42:06:07,664 --> 42:06:13,360
În primul rând, statisticile ajută la rezumarea datelor

56595
42:06:10,320 --> 42:06:16,880
folosind măsuri precum medie, mediană și

56596
42:06:13,360 --> 42:06:19,600
varianţă. În continuare, modelează incertitudinea

56597
42:06:16,880 --> 42:06:21,600
cu probabilitate și distribuții. Deci,

56598
42:06:19,600 --> 42:06:25,200
putem înţelege mai bine riscul şi

56599
42:06:21,600 --> 42:06:28,080
variabilitatea datelor noastre. De asemenea, testează

56600
42:06:25,200 --> 42:06:30,960
ipoteze precum atunci când folosim AB

56601
42:06:28,080 --> 42:06:33,104
testarea pentru a compara diferite rezultate.

56602
42:06:30,960 --> 42:06:36,240
Statisticile găsesc relații prin

56603
42:06:33,104 --> 42:06:38,640
metode precum regresia și corelarea

56604
42:06:36,240 --> 42:06:41,280
dezvăluind modul în care variabilele influențează fiecare

56605
42:06:38,640 --> 42:06:44,560
altele. Și, în sfârșit, toate aceste instrumente

56606
42:06:41,280 --> 42:06:47,104
permiteți decizia bazată pe date-m transformare brută

56607
42:06:44,560 --> 42:06:49,024
numerele în perspective acționabile. Acum,

56608
42:06:47,104 --> 42:06:51,840
hai să vorbim despre de ce face statisticile

56609
42:06:49,024 --> 42:06:54,000
materie în știința datelor. Formular de statistici

56610
42:06:51,840 --> 42:06:56,640
coloana vertebrală a științei datelor, oferind

56611
42:06:54,000 --> 42:06:59,200
cadrul matematic necesar pentru

56612
42:06:56,640 --> 42:07:01,440
dați sens datelor și desenați fiabile

56613
42:06:59,200 --> 42:07:03,840
concluzii. Fără statistici, asta

56614
42:07:01,440 --> 42:07:05,920
ar fi imposibil să se transforme datele brute

56615
42:07:03,840 --> 42:07:09,360
în perspective semnificative sau face

56616
42:07:05,920 --> 42:07:11,440
decizii sigure bazate pe dovezi. Acum

56617
42:07:09,360 --> 42:07:14,384
să aruncăm o privire la ramurile principale

56618
42:07:11,440 --> 42:07:16,960
a statisticilor. Statistici descriptive

56619
42:07:14,384 --> 42:07:19,600
şi statistică inferenţială. Deci mai întâi

56620
42:07:16,960 --> 42:07:21,664
hai sa vorbim despre definitie. Apoi noi

56621
42:07:19,600 --> 42:07:24,080
au metode și măsuri. Acum in

56622
42:07:21,664 --> 42:07:26,160
cazul statisticii descriptive, acum

56623
42:07:24,080 --> 42:07:28,320
să aruncăm o privire la ramurile principale

56624
42:07:26,160 --> 42:07:30,560
a statisticilor. Deci practic există

56625
42:07:28,320 --> 42:07:33,744
două ramuri de bază. descriptiv

56626
42:07:30,560 --> 42:07:36,080
statistica si statistica inferiora.

56627
42:07:33,744 --> 42:07:39,024
Statistica descriptivă rezumă și

56628
42:07:36,080 --> 42:07:41,200
descrie datele folosind măsuri precum media,

56629
42:07:39,024 --> 42:07:43,920
mediană, mod, interval și standard

56630
42:07:41,200 --> 42:07:46,800
abatere. Scopul ei este organizarea

56631
42:07:43,920 --> 42:07:49,664
și prezentați datele de obicei cu diagrame,

56632
42:07:46,800 --> 42:07:52,320
grafic sau tabele rezumative. Domeniul de aplicare al

56633
42:07:49,664 --> 42:07:54,384
statistica descriptivă se limitează la

56634
42:07:52,320 --> 42:07:56,720
eșantion de date în sine. Acum pe de alta

56635
42:07:54,384 --> 42:07:59,920
de mână, statistica inferenţială face

56636
42:07:56,720 --> 42:08:03,104
inferențe despre populații bazate pe

56637
42:07:59,920 --> 42:08:05,664
mostre. Folosește metode precum ipoteza

56638
42:08:03,104 --> 42:08:08,320
testare, intervale de încredere și

56639
42:08:05,664 --> 42:08:11,024
regresie. Scopul aici este de a desena

56640
42:08:08,320 --> 42:08:14,160
concluzie și face previziuni cu

56641
42:08:11,024 --> 42:08:17,520
exemple comune inclusiv testarea AB și

56642
42:08:14,160 --> 42:08:20,384
analiza sondajului. Sfera de aplicare a inferiorului

56643
42:08:17,520 --> 42:08:22,960
statisticile se extinde dincolo de eșantion la

56644
42:08:20,384 --> 42:08:25,520
populația mai mare. Înțelegerea

56645
42:08:22,960 --> 42:08:28,480
ambele aceste ramuri este esenţială pentru

56646
42:08:25,520 --> 42:08:30,960
analizarea și interpretarea datelor în orice

56647
42:08:28,480 --> 42:08:32,640
proiect de știință a datelor. Acum să luăm o

56648
42:08:30,960 --> 42:08:35,200
uitați-vă mai atent la descriptiv

56649
42:08:32,640 --> 42:08:37,920
statistici începând cu măsuri de

56650
42:08:35,200 --> 42:08:40,640
tendinta centrala. Prima măsură aici

56651
42:08:37,920 --> 42:08:43,520
este media care este media tuturor

56652
42:08:40,640 --> 42:08:46,080
valori calculate pur și simplu ca sumă a

56653
42:08:43,520 --> 42:08:48,480
toate punctele de date împărțite la total

56654
42:08:46,080 --> 42:08:50,240
numără. Urmează mediana care

56655
42:08:48,480 --> 42:08:53,360
reprezintă valoarea de mijloc atunci când

56656
42:08:50,240 --> 42:08:55,440
datele sunt sortate de la cel mai mic la cel mai mare.

56657
42:08:53,360 --> 42:08:58,560
Acest lucru este util mai ales atunci când faceți afaceri

56658
42:08:55,440 --> 42:09:00,720
cu distribuții distorsionate. Și în sfârșit,

56659
42:08:58,560 --> 42:09:03,600
modul este cel mai frecvent

56660
42:09:00,720 --> 42:09:06,480
valoarea care apare în setul de date, ajutând

56661
42:09:03,600 --> 42:09:09,024
identificăm modele comune sau repetate

56662
42:09:06,480 --> 42:09:11,360
rezultate. Să continuăm scufundarea noastră profundă

56663
42:09:09,024 --> 42:09:14,320
în statistici descriptive prin căutare

56664
42:09:11,360 --> 42:09:16,800
la măsurile de variabilitate. În primul rând,

56665
42:09:14,320 --> 42:09:18,560
avem gama. Acesta este pur și simplu

56666
42:09:16,800 --> 42:09:21,280
diferența dintre maxim și

56667
42:09:18,560 --> 42:09:23,744
valoarea minimă într-un set de date care ne arată

56668
42:09:21,280 --> 42:09:26,480
răspândirea datelor noastre care măsoară

56669
42:09:23,744 --> 42:09:29,024
media diferenţelor pătrate

56670
42:09:26,480 --> 42:09:31,840
din medie. Asta ne spune cât

56671
42:09:29,024 --> 42:09:34,384
valorile din setul nostru de date diferă de

56672
42:09:31,840 --> 42:09:36,960
media. Strâns legată este

56673
42:09:34,384 --> 42:09:39,840
abaterea standard care este pătratul

56674
42:09:36,960 --> 42:09:43,104
rădăcina varianței. Ne oferă mai mult

56675
42:09:39,840 --> 42:09:45,520
simț intuitiv al cât de mult valorile

56676
42:09:43,104 --> 42:09:47,840
de obicei deviază de la medie. Şi

56677
42:09:45,520 --> 42:09:50,960
în sfârșit, avem interquartile

56678
42:09:47,840 --> 42:09:54,160
gama sau spunem IQR. Aceasta ne arată

56679
42:09:50,960 --> 42:09:56,384
intervalul de mijloc de 50% din datele noastre,

56680
42:09:54,160 --> 42:09:59,440
ajutându-ne să înțelegem cum sunt datele

56681
42:09:56,384 --> 42:10:02,240
distribuite în centru și evitați

56682
42:09:59,440 --> 42:10:04,640
efectul valorilor aberante. Înțelegerea

56683
42:10:02,240 --> 42:10:06,800
aceste patru măsuri ne permit

56684
42:10:04,640 --> 42:10:10,160
rezuma nu doar centrul nostru

56685
42:10:06,800 --> 42:10:12,880
date, dar cât de răspândite și variate noastre

56686
42:10:10,160 --> 42:10:15,200
setul de date este. Acum să ne uităm la unele

56687
42:10:12,880 --> 42:10:18,160
aplicații practice ale descriptive

56688
42:10:15,200 --> 42:10:20,960
statistici. O utilizare majoră este datele

56689
42:10:18,160 --> 42:10:23,104
explorare și rezumare unde noi

56690
42:10:20,960 --> 42:10:25,664
obține rapid o privire de ansamblu și de bază

56691
42:10:23,104 --> 42:10:27,600
înțelegerea seturilor de date complexe

56692
42:10:25,664 --> 42:10:29,360
ajutând să urmărească performanța și să detecteze

56693
42:10:27,600 --> 42:10:32,240
probleme devreme în domenii precum

56694
42:10:29,360 --> 42:10:34,720
producție sau operațiuni. Şi

56695
42:10:32,240 --> 42:10:37,600
în cele din urmă, ele sunt esențiale pentru afaceri

56696
42:10:34,720 --> 42:10:40,480
rapoarte și tablouri de bord unde sunt concise

56697
42:10:37,600 --> 42:10:42,720
rezumatele sunt esențiale pentru manageri

56698
42:10:40,480 --> 42:10:45,200
revizuiți tendințele și faceți bazat pe date

56699
42:10:42,720 --> 42:10:48,160
deciziilor. Deci, pe scurt, descriptiv

56700
42:10:45,200 --> 42:10:51,104
statisticile ajută la transformarea datelor brute în

56701
42:10:48,160 --> 42:10:53,664
informații clare care pot fi acționate pentru multe

56702
42:10:51,104 --> 42:10:56,384
afaceri, științifice și operaționale

56703
42:10:53,664 --> 42:10:59,104
context. Să explorăm primul tip de

56704
42:10:56,384 --> 42:11:01,840
date în statistică, calitative sau

56705
42:10:59,104 --> 42:11:04,240
date categorice. Acest tip de date

56706
42:11:01,840 --> 42:11:06,960
include informaţii descriptive care

56707
42:11:04,240 --> 42:11:09,520
nu poate fi măsurat numeric precum

56708
42:11:06,960 --> 42:11:12,384
categorii sau etichete și da sau nu

56709
42:11:09,520 --> 42:11:14,384
răspunsuri. Toate acestea sunt despre calități

56710
42:11:12,384 --> 42:11:17,024
sau caracteristici mai degrabă decât

56711
42:11:14,384 --> 42:11:20,000
cantități. Datele calitative pot fi

56712
42:11:17,024 --> 42:11:22,320
împărțit în continuare în două tipuri. Nominal

56713
42:11:20,000 --> 42:11:25,360
unde categoriile nu au specific

56714
42:11:22,320 --> 42:11:28,560
ordine și ordinal unde categoriile

56715
42:11:25,360 --> 42:11:31,280
au o comandă sau un clasament. Recunoașterea

56716
42:11:28,560 --> 42:11:33,840
iar clasificarea datelor calitative este foarte

56717
42:11:31,280 --> 42:11:36,160
important deoarece afectează modul în care informațiile

56718
42:11:33,840 --> 42:11:38,720
este analizat şi interpretat în

56719
42:11:36,160 --> 42:11:41,360
statistici. Acum să discutăm pe al doilea

56720
42:11:38,720 --> 42:11:44,080
principal tip de date în statistică care este

56721
42:11:41,360 --> 42:11:46,640
date cantitative sau numerice. Aceasta

56722
42:11:44,080 --> 42:11:48,720
tipul de date include informații care

56723
42:11:46,640 --> 42:11:51,744
poate fi măsurat și exprimat cu

56724
42:11:48,720 --> 42:11:54,640
numere făcându-l ideal pentru matematică

56725
42:11:51,744 --> 42:11:57,520
analiza. Datele cantitative sunt mai departe

56726
42:11:54,640 --> 42:12:00,240
împărțite în două categorii principale. În primul rând,

56727
42:11:57,520 --> 42:12:02,640
există date discrete. Acestea sunt

56728
42:12:00,240 --> 42:12:05,280
valori numărabile cu fixe specifice

56729
42:12:02,640 --> 42:12:08,480
puncte precum numărul de studenți,

56730
42:12:05,280 --> 42:12:10,880
mașini vândute sau clicuri pe site. În al doilea rând,

56731
42:12:08,480 --> 42:12:13,664
există date continue care includ

56732
42:12:10,880 --> 42:12:16,240
infinite valori posibile în cadrul unui dat

56733
42:12:13,664 --> 42:12:18,880
interval. Exemple de date continue

56734
42:12:16,240 --> 42:12:21,200
includ înălțimea, greutatea, temperatura sau

56735
42:12:18,880 --> 42:12:23,920
timp. Înțelegerea distincției

56736
42:12:21,200 --> 42:12:26,240
între datele discrete şi continue este

56737
42:12:23,920 --> 42:12:29,024
foarte important deoarece determină care

56738
42:12:26,240 --> 42:12:31,520
metode statistice și vizualizări

56739
42:12:29,024 --> 42:12:34,000
va fi cel mai potrivit. Acum să ne scufundăm

56740
42:12:31,520 --> 42:12:36,384
în fundamentele probabilităţii.

56741
42:12:34,000 --> 42:12:38,880
Probabilitatea măsoară probabilitatea de

56742
42:12:36,384 --> 42:12:42,160
un eveniment care are loc și este întotdeauna

56743
42:12:38,880 --> 42:12:44,384
exprimată ca valoare între 0 și 1.

56744
42:12:42,160 --> 42:12:47,664
Iată câteva concepte cheie. Dacă

56745
42:12:44,384 --> 42:12:50,800
probabilitate sau P egal cu zero, că

56746
42:12:47,664 --> 42:12:53,280
înseamnă că evenimentul nu va avea loc niciodată. Dacă P

56747
42:12:50,800 --> 42:12:56,560
este egal cu 1, evenimentul va fi întotdeauna

56748
42:12:53,280 --> 42:12:58,720
apar. Și dacă P este egal cu 0,5,

56749
42:12:56,560 --> 42:13:02,320
evenimentul are șanse egale să se producă

56750
42:12:58,720 --> 42:13:04,720
sau nu se produce. Este cu adevărat un 50/50%

56751
42:13:02,320 --> 42:13:07,920
scenariu. Acum, înțelegerea acestor elemente de bază

56752
42:13:04,720 --> 42:13:10,384
principiul ne ajută să cuantificăm incertitudinea

56753
42:13:07,920 --> 42:13:13,280
și să facă predicții informate despre

56754
42:13:10,384 --> 42:13:15,664
rezultate viitoare. Acum să ne uităm la

56755
42:13:13,280 --> 42:13:18,000
diferite tipuri de probabilitate. În primul rând

56756
42:13:15,664 --> 42:13:20,960
există probabilitate clasică. Aceasta este

56757
42:13:18,000 --> 42:13:23,520
pe baza unor rezultate la fel de probabile precum

56758
42:13:20,960 --> 42:13:26,880
aruncarea unei monede echitabile sau rostogolirea a

56759
42:13:23,520 --> 42:13:30,000
moar echilibrat. Următoarea probabilitate empirică

56760
42:13:26,880 --> 42:13:32,880
care se bazează pe frecvența observată. Este

56761
42:13:30,000 --> 42:13:35,664
calculată din date reale, cum ar fi

56762
42:13:32,880 --> 42:13:37,840
proporția zilelor ploioase din trecut

56763
42:13:35,664 --> 42:13:40,240
luna. Să spunem de exemplu

56764
42:13:37,840 --> 42:13:43,024
probabilitatea ca astăzi să plouă dată

56765
42:13:40,240 --> 42:13:45,520
că este înnorat. Înțelegând acestea

56766
42:13:43,024 --> 42:13:47,920
trei tipuri ne ajută să alegem dreptul

56767
42:13:45,520 --> 42:13:50,000
abordare pentru diferite situații.

56768
42:13:47,920 --> 42:13:53,104
Fie că anticipăm rezultate,

56769
42:13:50,000 --> 42:13:55,600
analizând date sau luând decizii în temeiul

56770
42:13:53,104 --> 42:13:58,080
incertitudinea. Acum probabilitatea are a

56771
42:13:55,600 --> 42:14:00,640
gamă largă de aplicații puternice în

56772
42:13:58,080 --> 42:14:02,880
știința datelor. În primul rând, este folosit

56773
42:14:00,640 --> 42:14:05,280
în modelarea predictivă și mașină

56774
42:14:02,880 --> 42:14:08,560
învățarea unde algoritmii estimează

56775
42:14:05,280 --> 42:14:11,104
rezultate viitoare bazate pe datele existente.

56776
42:14:08,560 --> 42:14:13,920
Probabilitatea joacă, de asemenea, un rol cheie în

56777
42:14:11,104 --> 42:14:15,920
managementul riscului și luarea deciziilor

56778
42:14:13,920 --> 42:14:18,384
ajuta afacerile și cercetătorii

56779
42:14:15,920 --> 42:14:21,520
evalua probabilitatea de diferit

56780
42:14:18,384 --> 42:14:23,920
scenarii și planificați în consecință.

56781
42:14:21,520 --> 42:14:26,240
Calculul probabilității condiționate a

56782
42:14:23,920 --> 42:14:29,280
șansa unui eveniment dat fiind că

56783
42:14:26,240 --> 42:14:31,840
s-a produs altul. Acest lucru este crucial în

56784
42:14:29,280 --> 42:14:35,024
domenii precum asistența medicală, detectarea fraudelor

56785
42:14:31,840 --> 42:14:37,600
și analize de marketing.

56786
42:14:35,024 --> 42:14:41,024
Și, în sfârșit, probabilitatea este fundamentală

56787
42:14:37,600 --> 42:14:43,360
în testarea AB și proiectarea experimentală,

56788
42:14:41,024 --> 42:14:46,384
permițându-ne să măsurăm eficacitatea

56789
42:14:43,360 --> 42:14:48,480
de noi strategii sau produse. Acestea

56790
42:14:46,384 --> 42:14:51,600
aplicațiile arată cum probabilitatea

56791
42:14:48,480 --> 42:14:54,384
permite un progres mai inteligent bazat pe dovezi

56792
42:14:51,600 --> 42:14:56,480
în știința modernă a datelor. Să ne uităm la

56793
42:14:54,384 --> 42:14:59,360
una dintre cele mai frecvente probabilități

56794
42:14:56,480 --> 42:15:01,440
distribuții, distribuția normală.

56795
42:14:59,360 --> 42:15:04,384
Această distribuție este renumită pentru ea

56796
42:15:01,440 --> 42:15:07,840
curbă simetrică în formă de clopot, care arată

56797
42:15:04,384 --> 42:15:10,720
că cele mai multe valori se grupează în jurul mediei

56798
42:15:07,840 --> 42:15:13,440
cu tot mai puţine valori apărând ca

56799
42:15:10,720 --> 42:15:16,080
te îndepărtezi de centru. Acum multe

56800
42:15:13,440 --> 42:15:18,880
fenomene naturale precum înălțimi, test

56801
42:15:16,080 --> 42:15:21,360
scorurile și erorile de măsurare tind să

56802
42:15:18,880 --> 42:15:23,360
urmați acest model făcând normalul

56803
42:15:21,360 --> 42:15:26,000
distribuția un concept cheie în

56804
42:15:23,360 --> 42:15:28,240
statistici. Se caracterizează prin două

56805
42:15:26,000 --> 42:15:30,560
parametrii principali. Media care

56806
42:15:28,240 --> 42:15:33,104
determină centrul curbei şi

56807
42:15:30,560 --> 42:15:34,880
abaterea standard care controlează

56808
42:15:33,104 --> 42:15:36,960
răspândirea acestuia.

56809
42:15:34,880 --> 42:15:39,360
Recunoașterea ajutorului de distribuție

56810
42:15:36,960 --> 42:15:41,840
analiștii fac predicții, calculează

56811
42:15:39,360 --> 42:15:44,880
probabilități și aplică statistici

56812
42:15:41,840 --> 42:15:47,280
tehnici la datele din lumea reală. În continuare,

56813
42:15:44,880 --> 42:15:49,280
haideți să explorăm distribuția binomială,

56814
42:15:47,280 --> 42:15:51,840
care este o altă probabilitate comună

56815
42:15:49,280 --> 42:15:54,880
distributie. Distribuția binomială

56816
42:15:51,840 --> 42:15:57,744
este discret și este folosit pentru situații

56817
42:15:54,880 --> 42:16:00,560
cu rezultate binare precum succesul sau

56818
42:15:57,744 --> 42:16:03,024
eșec. Se bazează pe un număr fix

56819
42:16:00,560 --> 42:16:05,600
de procese în care fiecare proces are o

56820
42:16:03,024 --> 42:16:07,664
probabilitate constantă de succes precum

56821
42:16:05,600 --> 42:16:10,640
aruncând o monedă un anumit număr de

56822
42:16:07,664 --> 42:16:13,200
ori sau ratele de eșec de urmărire.

56823
42:16:10,640 --> 42:16:15,664
Exemple de experimente binomiale includ

56824
42:16:13,200 --> 42:16:18,160
fâșii de monede și măsurând câte

56825
42:16:15,664 --> 42:16:20,960
elevii trec sau nu un test. Aceasta

56826
42:16:18,160 --> 42:16:23,600
distribuția ne ajută să modelăm și să analizăm

56827
42:16:20,960 --> 42:16:26,960
rezultate atunci când sunt doar două posibilități

56828
42:16:23,600 --> 42:16:29,360
există în fiecare proces. Acum să ne concentrăm asupra

56829
42:16:26,960 --> 42:16:31,840
distribuția otrăvirii. O altă cheie

56830
42:16:29,360 --> 42:16:33,840
tip de distribuție de probabilitate. The

56831
42:16:31,840 --> 42:16:36,720
distribuția otravă este una discretă

56832
42:16:33,840 --> 42:16:39,664
distribuție utilizată special pentru modelare

56833
42:16:36,720 --> 42:16:41,664
evenimente rare. Este deosebit de util

56834
42:16:39,664 --> 42:16:44,720
pentru modelarea evenimentelor care au loc

56835
42:16:41,664 --> 42:16:47,920
independent pe un interval fix de

56836
42:16:44,720 --> 42:16:50,560
timp sau spațiu. De exemplu, prezice

56837
42:16:47,920 --> 42:16:53,104
de câte ori un eveniment ca un client

56838
42:16:50,560 --> 42:16:55,744
sosirea pe un site web, primirea unei vizite

56839
42:16:53,104 --> 42:16:57,744
s-ar putea întâmpla într-o anumită perioadă.

56840
42:16:55,744 --> 42:17:00,240
Exemplele tipice includ clientul

56841
42:16:57,744 --> 42:17:02,880
sosiri la un magazin, ratele defectelor și

56842
42:17:00,240 --> 42:17:05,360
producția sau numărarea site-ului web

56843
42:17:02,880 --> 42:17:07,360
vizite pe o perioadă stabilită. Aceasta

56844
42:17:05,360 --> 42:17:09,600
distribuția este un instrument excelent pentru

56845
42:17:07,360 --> 42:17:12,160
înțelegerea și prezicerea aleatoriei

56846
42:17:09,600 --> 42:17:14,960
evenimente independente care nu au loc

56847
42:17:12,160 --> 42:17:17,024
foarte des, dar sunt importante de urmărit.

56848
42:17:14,960 --> 42:17:19,104
Este o ramură care ne permite să facem

56849
42:17:17,024 --> 42:17:21,360
inferențe, predicții sau

56850
42:17:19,104 --> 42:17:24,384
generalizări despre o mai mare

56851
42:17:21,360 --> 42:17:26,640
populație folosind date eșantionate. Aici sunt

56852
42:17:24,384 --> 42:17:29,200
câteva concepte cheie. Primul este

56853
42:17:26,640 --> 42:17:31,840
populație versus eșantion. Populația

56854
42:17:29,200 --> 42:17:33,920
reprezintă întregul grup pe care vrem

56855
42:17:31,840 --> 42:17:36,800
știi despre cât eșantionul este

56856
42:17:33,920 --> 42:17:39,200
subset de la care colectăm de fapt date.

56857
42:17:36,800 --> 42:17:41,360
Următorul concept este distribuția eșantionării

56858
42:17:39,200 --> 42:17:44,480
care se referă la distribuirea a

56859
42:17:41,360 --> 42:17:47,104
statistică pentru mai multe eșantioane din

56860
42:17:44,480 --> 42:17:49,920
aceeași populație. Eroare standard

56861
42:17:47,104 --> 42:17:52,320
măsoară cât de mult statistica eșantionului

56862
42:17:49,920 --> 42:17:55,360
este de așteptat să varieze din cauza aleatoriei

56863
42:17:52,320 --> 42:17:57,840
prelevarea de probe. Și în sfârșit, marja de eroare

56864
42:17:55,360 --> 42:18:00,080
ne spune cât de mult ne putem aștepta

56865
42:17:57,840 --> 42:18:03,200
estimările să difere de adevărate

56866
42:18:00,080 --> 42:18:05,440
valoarea populatiei. Împreună aceste concepte

56867
42:18:03,200 --> 42:18:08,560
formează baza pentru desenul fiabil

56868
42:18:05,440 --> 42:18:10,240
perspective din eșantionul de date în inferenție

56869
42:18:08,560 --> 42:18:12,384
statistici.

56870
42:18:10,240 --> 42:18:15,280
Să trecem în revistă câteva dintre tehnicile principale

56871
42:18:12,384 --> 42:18:17,920
folosit în statistica inferioră. În primul rând, am

56872
42:18:15,280 --> 42:18:21,280
am testat ipoteza. Această metodă

56873
42:18:17,920 --> 42:18:24,320
ne permite să testăm afirmații sau idei despre

56874
42:18:21,280 --> 42:18:27,104
parametrii populației pe baza eșantionului

56875
42:18:24,320 --> 42:18:29,744
date care ne ajută să stabilim dacă sunt observate

56876
42:18:27,104 --> 42:18:32,384
rezultatele sunt semnificative statistic

56877
42:18:29,744 --> 42:18:34,800
și fiabilitatea estimării noastre. În continuare

56878
42:18:32,384 --> 42:18:36,720
sunt intervale de încredere. Acestea oferă

56879
42:18:34,800 --> 42:18:39,104
un interval de valori probabile pentru a

56880
42:18:36,720 --> 42:18:42,160
parametrul populației dându-ne un sens

56881
42:18:39,104 --> 42:18:44,320
a posibilelor variații fiabilitatea noastră

56882
42:18:42,160 --> 42:18:47,104
estimare. Și, în sfârșit, regresie

56883
42:18:44,320 --> 42:18:49,664
analiza este folosită pentru a modela și analiza

56884
42:18:47,104 --> 42:18:52,080
relațiile dintre variabile,

56885
42:18:49,664 --> 42:18:54,800
permițându-ne să facem predicții, să descoperim

56886
42:18:52,080 --> 42:18:57,840
tendințe și înțelegeți cum se schimbă în

56887
42:18:54,800 --> 42:18:59,520
un factor îl poate afecta pe altul. Acum,

56888
42:18:57,840 --> 42:19:02,080
să trecem prin ipoteză

56889
42:18:59,520 --> 42:19:04,880
proces de testare. Primul pas este să

56890
42:19:02,080 --> 42:19:08,320
formula ipoteza. Începeți cu nul

56891
42:19:04,880 --> 42:19:10,720
ipoteză reprezentată ca Hnot, care

56892
42:19:08,320 --> 42:19:13,200
afirmă că nu există efect sau

56893
42:19:10,720 --> 42:19:16,800
diferenţă. Apoi mai este alternativa

56894
42:19:13,200 --> 42:19:19,024
ipoteza reprezentată ca H1 care

56895
42:19:16,800 --> 42:19:21,744
sugerează că un efect sau o diferență

56896
42:19:19,024 --> 42:19:24,240
exista. Acum, după configurarea

56897
42:19:21,744 --> 42:19:27,360
ipoteza următorul pas este alegerea a

56898
42:19:24,240 --> 42:19:29,664
nivelul de semnificație notat de alfa.

56899
42:19:27,360 --> 42:19:36,480
Alegeri comune pentru nivelurile de semnificație

56900
42:19:29,664 --> 42:19:38,384
include 0,05 5% 01 1% 010 care este 10%.

56901
42:19:36,480 --> 42:19:40,320
Nivelul de semnificație este important

56902
42:19:38,384 --> 42:19:42,960
deoarece controlează probabilitatea de

56903
42:19:40,320 --> 42:19:46,080
făcând o eroare de tip unu, cunoscută și sub numele

56904
42:19:42,960 --> 42:19:48,480
fals pozitiv. Și acum fiecare pas în

56905
42:19:46,080 --> 42:19:50,720
procesul este esențial pentru a se asigura că

56906
42:19:48,480 --> 42:19:53,024
rezultatele statistice sunt ambele semnificative

56907
42:19:50,720 --> 42:19:55,840
si de incredere. Următorul pas este să

56908
42:19:53,024 --> 42:19:58,320
colectarea și analizarea datelor eșantionului. Asigurați-vă

56909
42:19:55,840 --> 42:20:00,560
datele sunt reprezentate prin alegerea a

56910
42:19:58,320 --> 42:20:03,200
mostra buna. Apoi calculați

56911
42:20:00,560 --> 42:20:06,000
statistică adecvată și de testare pentru dvs

56912
42:20:03,200 --> 42:20:08,720
test de ipoteză. Odată ce este făcut, este

56913
42:20:06,000 --> 42:20:11,104
timpul pentru a lua o decizie. Comparați p

56914
42:20:08,720 --> 42:20:13,840
valoarea la nivelul de semnificație ales

56915
42:20:11,104 --> 42:20:16,384
alfa. Acum, dacă valoarea p este mai mică decât

56916
42:20:13,840 --> 42:20:19,024
sau egal cu alpha, respingeți valoarea nulă

56917
42:20:16,384 --> 42:20:21,664
ipoteza. Dacă valoarea p este mai mare

56918
42:20:19,024 --> 42:20:24,720
decât alfa, nu reușiți să respingeți nulul

56919
42:20:21,664 --> 42:20:26,800
ipoteza. Și în sfârșit, interpretează-ți

56920
42:20:24,720 --> 42:20:29,360
rezultate. Trageți-vă concluziile cu

56921
42:20:26,800 --> 42:20:31,920
respect pentru contextul și problema la

56922
42:20:29,360 --> 42:20:34,480
mână. Păstrând întotdeauna imaginea de ansamblu

56923
42:20:31,920 --> 42:20:37,200
în minte. Urmând acești pași ajută

56924
42:20:34,480 --> 42:20:40,320
asigurați-vă că testul dvs. de ipoteză este robust,

56925
42:20:37,200 --> 42:20:42,880
clară și semnificativă. Să revizuim

56926
42:20:40,320 --> 42:20:45,440
tipuri comune de teste de ipoteză utilizate în

56927
42:20:42,880 --> 42:20:48,320
statistică. Testul cu un singur eșantion compară

56928
42:20:45,440 --> 42:20:51,360
media unui eșantion la o valoare cunoscută

56929
42:20:48,320 --> 42:20:53,920
iar testul zed cu o singură probă este utilizat când

56930
42:20:51,360 --> 42:20:56,880
abaterea standard a populației este

56931
42:20:53,920 --> 42:20:59,744
cunoscut. În continuare, avem două probe de testare.

56932
42:20:56,880 --> 42:21:02,160
Testul t eșantioane independente compară

56933
42:20:59,744 --> 42:21:04,720
la mijloacele a două grupuri diferite

56934
42:21:02,160 --> 42:21:07,200
în timp ce probele pereche testul t compară

56935
42:21:04,720 --> 42:21:10,384
înainte și după măsurători pentru

56936
42:21:07,200 --> 42:21:12,640
acelasi subiect. Pentru testarea datelor categorice,

56937
42:21:10,384 --> 42:21:16,240
testul de forfecare verifică

56938
42:21:12,640 --> 42:21:19,600
independență sau bunătate de potrivire. Şi

56939
42:21:16,240 --> 42:21:22,880
testul exact al lui Fiser este util pentru mici

56940
42:21:19,600 --> 42:21:25,840
dimensiunile probei. Și în sfârșit, neparametric

56941
42:21:22,880 --> 42:21:28,800
teste precum testul bărbat Whitney U și

56942
42:21:25,840 --> 42:21:31,440
Wil Coxson a semnat testul de rang servi ca

56943
42:21:28,800 --> 42:21:33,440
alternative la testul t când date

56944
42:21:31,440 --> 42:21:35,440
nu îndeplinește anumite parametri

56945
42:21:33,440 --> 42:21:37,840
presupuneri. Alegerea corectă

56946
42:21:35,440 --> 42:21:40,320
testul de ipoteză depinde de datele dvs

56947
42:21:37,840 --> 42:21:42,640
tip și întrebarea specifică pe care o doriți

56948
42:21:40,320 --> 42:21:45,840
a raspunde. Să explorăm centrala

56949
42:21:42,640 --> 42:21:48,640
teorema limită sau CLT a fundației pentru

56950
42:21:45,840 --> 42:21:51,200
statistici inferioare. Limita centrală

56951
42:21:48,640 --> 42:21:53,920
teorema afirmă că ca mărime a eșantionului

56952
42:21:51,200 --> 42:21:56,800
crește, distribuția eșantionului

56953
42:21:53,920 --> 42:21:59,024
mijloacele se apropie de o distribuție normală

56954
42:21:56,800 --> 42:22:01,840
chiar dacă datele originale sunt un normal

56955
42:21:59,024 --> 42:22:04,160
distribuite. Acest eșantion funcționează pentru orice

56956
42:22:01,840 --> 42:22:06,384
distribuţia populaţiei făcându-l

56957
42:22:04,160 --> 42:22:08,480
incredibil de puternic. Acum pentru totdeauna

56958
42:22:06,384 --> 42:22:11,200
rezultate, dimensiunea eșantionului ar trebui

56959
42:22:08,480 --> 42:22:12,960
de obicei, 30 sau mai mult. Ce este

56960
42:22:11,200 --> 42:22:15,024
interesantă este media eșantionului

56961
42:22:12,960 --> 42:22:18,160
distributie care va avea aceeasi

56962
42:22:15,024 --> 42:22:20,720
medie ca populație. Standardul

56963
42:22:18,160 --> 42:22:23,840
eroare care măsoară variabilitatea prin

56964
42:22:20,720 --> 42:22:26,720
media eșantionului este egală cu sigma / pătrat

56965
42:22:23,840 --> 42:22:29,440
roo<unk> din n. Și aceasta devine mai mică pe măsură ce

56966
42:22:26,720 --> 42:22:32,320
dimensiunea eșantionului crește. Și în cele din urmă

56967
42:22:29,440 --> 42:22:35,440
formula prezentată aici care este z este equ= to

56968
42:22:32,320 --> 42:22:38,720
x -

56969
42:22:35,440 --> 42:22:41,840
sigma împărțită la sigma peste pătrat

56970
42:22:38,720 --> 42:22:44,560
rădăcina lui n. Să standardizăm și să comparăm

56971
42:22:41,840 --> 42:22:47,200
eșantion înseamnă. CLT face cel mai mult

56972
42:22:44,560 --> 42:22:49,744
statistici parametrice posibile şi este

56973
42:22:47,200 --> 42:22:51,600
coloana vertebrală pentru multe teste statistice.

56974
42:22:49,744 --> 42:22:54,480
Să trecem în revistă principalele tipuri de

56975
42:22:51,600 --> 42:22:56,720
analize de regresie care sunt obișnuite

56976
42:22:54,480 --> 42:22:59,664
modelați și înțelegeți relațiile

56977
42:22:56,720 --> 42:23:02,320
între variabile. Primul este liniar

56978
42:22:59,664 --> 42:23:04,320
regresie. Această tehnică analizează

56979
42:23:02,320 --> 42:23:07,024
relaţie între o continuă

56980
42:23:04,320 --> 42:23:09,520
variabilă și o altă variabilă rezultată

56981
42:23:07,024 --> 42:23:13,024
în linie dreaptă. Este folosit în mod obișnuit

56982
42:23:09,520 --> 42:23:15,440
în prezicerea vânzărilor sau a prețurilor. Următorul este

56983
42:23:13,024 --> 42:23:18,080
regresie logistică. Spre deosebire de liniar

56984
42:23:15,440 --> 42:23:20,640
regresie, această metodă este utilizată pentru

56985
42:23:18,080 --> 42:23:23,280
rezultate binare, ajutând la estimare

56986
42:23:20,640 --> 42:23:26,160
probabilități cum ar fi dacă un e-mail

56987
42:23:23,280 --> 42:23:28,384
este spam sau un pacient are o boală.

56988
42:23:26,160 --> 42:23:31,104
Trecerea la regresia multiplă, aceasta

56989
42:23:28,384 --> 42:23:34,160
ne permite să socotim efectul de

56990
42:23:31,104 --> 42:23:36,640
mai multe variabile simultan, modelând mai multe

56991
42:23:34,160 --> 42:23:39,440
relații complexe precum determinarea

56992
42:23:36,640 --> 42:23:42,000
preturile caselor. În sfârșit, polomial

56993
42:23:39,440 --> 42:23:44,080
regresie care este folosită pentru neliniare

56994
42:23:42,000 --> 42:23:46,320
relatii. Curba rezultată

56995
42:23:44,080 --> 42:23:48,800
mai degrabă decât o linie dreaptă ne permite

56996
42:23:46,320 --> 42:23:51,744
surprinde tendințele de creștere și alte modele

56997
42:23:48,800 --> 42:23:54,384
care nu sunt liniare. Înțelegând acestea

56998
42:23:51,744 --> 42:23:56,720
tipurile de regresie ajută analiștii să aleagă

56999
42:23:54,384 --> 42:23:59,280
modelul potrivit pentru date și

57000
42:23:56,720 --> 42:24:00,960
problema afacerii la îndemână. Să

57001
42:23:59,280 --> 42:24:03,520
clarificați diferențele importante

57002
42:24:00,960 --> 42:24:06,080
între corelație și cauzalitate.

57003
42:24:03,520 --> 42:24:08,320
Corelația este o măsură statistică a

57004
42:24:06,080 --> 42:24:10,720
modul în care două variabile se mișcă împreună.

57005
42:24:08,320 --> 42:24:14,080
Valorile corelației variază de la minus 10

57006
42:24:10,720 --> 42:24:16,720
la unul. Dar amintiți-vă că corelația face

57007
42:24:14,080 --> 42:24:18,960
nu implică cauzalitate. Pe de alta parte,

57008
42:24:16,720 --> 42:24:21,840
cauzalitate înseamnă că o variabilă

57009
42:24:18,960 --> 42:24:24,000
de fapt provoacă schimbări în altul.

57010
42:24:21,840 --> 42:24:27,104
Stabilirea cauzalității necesită

57011
42:24:24,000 --> 42:24:29,440
experimentare controlată și este mult

57012
42:24:27,104 --> 42:24:32,000
relație mai puternică decât simplă

57013
42:24:29,440 --> 42:24:34,320
corelație. Fii mereu atent când

57014
42:24:32,000 --> 42:24:36,800
interpretarea rezultatelor. Doar pentru că doi

57015
42:24:34,320 --> 42:24:39,024
variabilele se mișcă împreună nu înseamnă una

57016
42:24:36,800 --> 42:24:41,024
cauza pe celălalt. Să ne uităm la unele

57017
42:24:39,024 --> 42:24:43,840
probleme comune cu interpretarea

57018
42:24:41,024 --> 42:24:46,080
corelație și cauzalitate. Primul este

57019
42:24:43,840 --> 42:24:48,480
a treia problemă variabilă care se întâmplă

57020
42:24:46,080 --> 42:24:50,720
când o variabilă ascunsă îi afectează pe ambele

57021
42:24:48,480 --> 42:24:52,880
variabile într-o întrebare care duce la a

57022
42:24:50,720 --> 42:24:54,880
conexiune înșelătoare. Există și asta

57023
42:24:52,880 --> 42:24:57,664
problema de directionalitate acolo unde este

57024
42:24:54,880 --> 42:25:00,160
neclar care variabilă provoacă altele

57025
42:24:57,664 --> 42:25:02,080
să se schimbe, dar ambele sunt de fapt cauzate

57026
42:25:00,160 --> 42:25:03,840
printr-o a treia variabilă care este cea fierbinte

57027
42:25:02,080 --> 42:25:06,320
vremea. Aceasta demonstrează că

57028
42:25:03,840 --> 42:25:08,640
corelația nu înseamnă o singură variabilă

57029
42:25:06,320 --> 42:25:10,640
provoacă pe celălalt. Așa că căutați mereu

57030
42:25:08,640 --> 42:25:13,200
factori ascunși înainte de a presupune

57031
42:25:10,640 --> 42:25:15,360
cauzalitate. Să vorbim despre statistică

57032
42:25:13,200 --> 42:25:18,240
erori în mod specific de tip unu și tip

57033
42:25:15,360 --> 42:25:21,104
doua erori. Tastați o eroare numită și

57034
42:25:18,240 --> 42:25:23,520
ca fals pozitiv apare atunci când respingem

57035
42:25:21,104 --> 42:25:26,160
adevărata ipoteză nulă. In alta

57036
42:25:23,520 --> 42:25:28,640
cuvinte, concluzionăm greșit că există o

57037
42:25:26,160 --> 42:25:31,024
efect atunci când de fapt nu există. The

57038
42:25:28,640 --> 42:25:34,160
probabilitatea de a face această eroare este

57039
42:25:31,024 --> 42:25:36,640
egal cu nivelul de semnificație alfa.

57040
42:25:34,160 --> 42:25:38,800
De exemplu, încheierea unui medicament funcționează

57041
42:25:36,640 --> 42:25:42,080
când de fapt nu. Pe de alta

57042
42:25:38,800 --> 42:25:44,560
parte, eroarea de tip doi este fals negativă

57043
42:25:42,080 --> 42:25:47,360
înseamnă a nu respinge un nul fals

57044
42:25:44,560 --> 42:25:50,384
ipoteza. Atunci ne este dor de un real

57045
42:25:47,360 --> 42:25:53,360
efect sau diferență. Probabilitatea de

57046
42:25:50,384 --> 42:25:55,664
eroarea de tip doi este beta. De exemplu,

57047
42:25:53,360 --> 42:25:57,744
ratând efectul real al unui drog și

57048
42:25:55,664 --> 42:26:00,640
văzând că nu funcționează când de fapt

57049
42:25:57,744 --> 42:26:03,200
face. Înțelegerea acestor erori este esențială

57050
42:26:00,640 --> 42:26:05,200
pentru proiectarea unor experimente bune şi

57051
42:26:03,200 --> 42:26:07,664
interpretarea rezultatelor statistice

57052
42:26:05,200 --> 42:26:10,240
în mod corespunzător. Să ne uităm la trei comune

57053
42:26:07,664 --> 42:26:12,960
metode de eșantionare folosind statistici. The

57054
42:26:10,240 --> 42:26:15,440
primul este eșantionarea aleatorie. Aici fiecare

57055
42:26:12,960 --> 42:26:18,320
individul din populație are un egal

57056
42:26:15,440 --> 42:26:21,024
șansa de a fi selectat unde la fiecare n-a

57057
42:26:18,320 --> 42:26:23,360
individul este ales. Eșantionarea aleatorie este

57058
42:26:21,024 --> 42:26:27,024
crucial pentru asigurarea reprezentativității

57059
42:26:23,360 --> 42:26:29,920
probă. Urmează eșantionarea stratificată. The

57060
42:26:27,024 --> 42:26:33,104
populația este împărțită în omogene

57061
42:26:29,920 --> 42:26:35,840
subgrupuri sau straturi și apoi o aleatorie

57062
42:26:33,104 --> 42:26:38,000
eșantionul este extras din fiecare grupă. Aceasta

57063
42:26:35,840 --> 42:26:40,800
abordarea se asigură că toate grupurile sunt

57064
42:26:38,000 --> 42:26:43,280
reprezentate în eşantion. Și în sfârșit,

57065
42:26:40,800 --> 42:26:46,720
eșantionarea în cluster împarte populația

57066
42:26:43,280 --> 42:26:48,800
în clustere, adesea bazate pe geografie.

57067
42:26:46,720 --> 42:26:51,600
Grupuri întregi sunt apoi aleatoriu

57068
42:26:48,800 --> 42:26:54,640
selectat. Este rentabil și util

57069
42:26:51,600 --> 42:26:56,960
pentru populații mari răspândite.

57070
42:26:54,640 --> 42:26:59,200
Alegerea metodei potrivite asigură

57071
42:26:56,960 --> 42:27:01,840
datele reprezintă cu adevărat întregul

57072
42:26:59,200 --> 42:27:04,560
populația și întărește studiul

57073
42:27:01,840 --> 42:27:06,560
concluzii. Așa că băieți, să încheiem cu

57074
42:27:04,560 --> 42:27:08,880
unele aplicații din lumea reală ale

57075
42:27:06,560 --> 42:27:11,840
statistici. În analiza de afaceri,

57076
42:27:08,880 --> 42:27:14,880
statisticile sunt folosite pentru testarea AB pentru

57077
42:27:11,840 --> 42:27:17,664
optimizarea site-urilor web, segmentarea clienților

57078
42:27:14,880 --> 42:27:20,240
și direcționarea, prognoza vânzărilor și

57079
42:27:17,664 --> 42:27:22,384
planificarea cererii şi controlul calităţii şi

57080
42:27:20,240 --> 42:27:24,960
de asemenea, îmbunătățirea procesului. Acestea

57081
42:27:22,384 --> 42:27:27,744
tehnicile ajută companiile să devină mai inteligente

57082
42:27:24,960 --> 42:27:29,920
decizii bazate pe date în fiecare zi.

57083
42:27:27,744 --> 42:27:32,640
Statisticile joacă un rol vital în

57084
42:27:29,920 --> 42:27:34,800
sănătate și medicină, de asemenea. Ei

57085
42:27:32,640 --> 42:27:37,744
sunt cheie pentru analiza studiilor clinice

57086
42:27:34,800 --> 42:27:39,840
rezultate, efectuarea epidemologică

57087
42:27:37,744 --> 42:27:42,000
studii, evaluarea tratamentului

57088
42:27:39,840 --> 42:27:44,560
eficacitatea și identificarea riscurilor

57089
42:27:42,000 --> 42:27:47,200
factori. Prin utilizarea acestor abordări,

57090
42:27:44,560 --> 42:27:49,744
cercetători și practicieni din domeniul sănătății

57091
42:27:47,200 --> 42:27:52,240
poate îmbunătăți rezultatele pacienților în public

57092
42:27:49,744 --> 42:27:54,720
sănătate. De la afaceri la medicină,

57093
42:27:52,240 --> 42:27:57,104
statisticile transformă informația brută

57094
42:27:54,720 --> 42:27:59,744
în perspective acționabile care creează

57095
42:27:57,104 --> 42:28:02,080
impact real. Statistica are o mare

57096
42:27:59,744 --> 42:28:04,800
impact în tehnologie, știința datelor și

57097
42:28:02,080 --> 42:28:07,600
sisteme de recomener financiar și energetic

57098
42:28:04,800 --> 42:28:10,160
care personalizează ceea ce văd utilizatorii. În

57099
42:28:07,600 --> 42:28:12,800
finanțe, ajutor statistic cu riscul

57100
42:28:10,160 --> 42:28:15,104
evaluare si management, optimizare

57101
42:28:12,800 --> 42:28:17,520
portofolii de investiţii, determinând

57102
42:28:15,104 --> 42:28:19,920
scoruri de credit și piață de sprijin

57103
42:28:17,520 --> 42:28:22,160
cercetare și analiză. Acum, acestea

57104
42:28:19,920 --> 42:28:24,880
aplicațiile arată cât de statistic

57105
42:28:22,160 --> 42:28:27,920
tehnicile ajută la luarea unor decizii mai inteligente

57106
42:28:24,880 --> 42:28:30,080
și să rezolve provocări complexe de-a lungul înalte

57107
42:28:27,920 --> 42:28:32,480
industria de impact. Ești unul dintre mulți

57108
42:28:30,080 --> 42:28:34,160
cine visează să devină cercetător al datelor?

57109
42:28:32,480 --> 42:28:36,000
Continuați să urmăriți acest videoclip dacă sunteți

57110
42:28:34,160 --> 42:28:38,080
pasionat de știința datelor pentru că noi

57111
42:28:36,000 --> 42:28:39,840
vă va spune cum funcționează cu adevărat

57112
42:28:38,080 --> 42:28:41,920
sub capotă. Emma este o dată

57113
42:28:39,840 --> 42:28:44,000
om de stiinta. Să vedem cum o zi în ea

57114
42:28:41,920 --> 42:28:46,320
viața se duce în timp ce ea lucrează la date

57115
42:28:44,000 --> 42:28:47,744
proiect științific. Ei bine, este foarte

57116
42:28:46,320 --> 42:28:49,600
important să înțelegem afacerea

57117
42:28:47,744 --> 42:28:52,880
problema mai intai. În întâlnirea noastră cu

57118
42:28:49,600 --> 42:28:55,024
clienților, Emma pune întrebări relevante,

57119
42:28:52,880 --> 42:28:57,104
înţelege şi defineşte obiective pentru

57120
42:28:55,024 --> 42:29:00,080
problema care trebuie abordată.

57121
42:28:57,104 --> 42:29:02,384
E un suflet curios care cere multe

57122
42:29:00,080 --> 42:29:05,520
înțelept, una dintre multele trăsături ale unui bun

57123
42:29:02,384 --> 42:29:07,664
cercetător de date. Acum, ea caută date

57124
42:29:05,520 --> 42:29:10,160
achiziție pentru a aduna și a răzui date

57125
42:29:07,664 --> 42:29:12,960
din mai multe surse, cum ar fi servere web,

57126
42:29:10,160 --> 42:29:15,520
jurnale, baze de date, API-uri și online

57127
42:29:12,960 --> 42:29:17,600
depozite. Oh, se pare că am găsit

57128
42:29:15,520 --> 42:29:20,240
datele corecte necesită atât timp cât și

57129
42:29:17,600 --> 42:29:22,560
efort. După ce datele sunt adunate vin

57130
42:29:20,240 --> 42:29:25,104
pregătirea datelor. Acest pas implică

57131
42:29:22,560 --> 42:29:27,440
curățarea datelor și transformarea datelor.

57132
42:29:25,104 --> 42:29:29,600
Curățarea datelor este cea mai consumatoare de timp

57133
42:29:27,440 --> 42:29:32,384
proces deoarece implică manipularea multor

57134
42:29:29,600 --> 42:29:34,800
scenarii complexe. Aici se ocupă Emma

57135
42:29:32,384 --> 42:29:37,024
tipuri de date inconsecvente, scrise greșit

57136
42:29:34,800 --> 42:29:39,840
atribute, valori lipsă, duplicat

57137
42:29:37,024 --> 42:29:42,080
valori și altele. Apoi în date

57138
42:29:39,840 --> 42:29:44,560
transformare ea modifică datele

57139
42:29:42,080 --> 42:29:46,720
bazate pe reguli de cartografiere definite. Într-o

57140
42:29:44,560 --> 42:29:49,104
instrumente de proiect ETL precum talentul și

57141
42:29:46,720 --> 42:29:51,360
Informatica sunt folosite pentru a executa complexe

57142
42:29:49,104 --> 42:29:53,200
transformări care ajută echipa să

57143
42:29:51,360 --> 42:29:55,360
înțelegeți mai bine structura datelor.

57144
42:29:53,200 --> 42:29:57,520
Apoi înțelegeți ce puteți de fapt

57145
42:29:55,360 --> 42:30:00,720
a face cu datele tale este foarte important. Pentru

57146
42:29:57,520 --> 42:30:03,360
că Emma face analiză exploratorie a datelor

57147
42:30:00,720 --> 42:30:04,960
cu ajutorul EDA. Ea definește și

57148
42:30:03,360 --> 42:30:07,024
rafinează selecția caracteristicii

57149
42:30:04,960 --> 42:30:09,440
variabilele care vor fi utilizate în model

57150
42:30:07,024 --> 42:30:11,280
dezvoltare. Dar dacă Emma omite asta

57151
42:30:09,440 --> 42:30:13,200
pas? S-ar putea să ajungă să aleagă

57152
42:30:11,280 --> 42:30:15,920
variabile greșite care vor produce o

57153
42:30:13,200 --> 42:30:18,160
model inexact. Astfel, date exploratorii

57154
42:30:15,920 --> 42:30:20,384
analiza devine cea mai importantă

57155
42:30:18,160 --> 42:30:22,720
pas. Acum, ea trece la miez

57156
42:30:20,384 --> 42:30:24,880
activitatea unui proiect de știință a datelor care

57157
42:30:22,720 --> 42:30:26,720
este modelarea datelor. Ea în mod repetitiv

57158
42:30:24,880 --> 42:30:29,200
aplică învățarea automată diversă

57159
42:30:26,720 --> 42:30:32,160
tehnici precum KNandN, arbore de decizie,

57160
42:30:29,200 --> 42:30:34,160
cuțite pe baza datelor pentru a identifica

57161
42:30:32,160 --> 42:30:36,480
modelul care se potrivește cel mai bine afacerii

57162
42:30:34,160 --> 42:30:38,720
cerințe. Ea antrenează modelele pe

57163
42:30:36,480 --> 42:30:41,104
setul de date de antrenament și le testează

57164
42:30:38,720 --> 42:30:43,520
selectați cel mai performant model. Emma

57165
42:30:41,104 --> 42:30:46,000
preferă Python pentru modelarea datelor.

57166
42:30:43,520 --> 42:30:49,200
Cu toate acestea, se poate face și folosind R și

57167
42:30:46,000 --> 42:30:51,840
SAS. Ei bine, partea cea mai dificilă nu este încă

57168
42:30:49,200 --> 42:30:53,840
peste. Vizualizare și comunicare.

57169
42:30:51,840 --> 42:30:55,920
Emma se întâlnește din nou cu clienții

57170
42:30:53,840 --> 42:30:58,160
comunica constatările de afaceri într-un

57171
42:30:55,920 --> 42:31:00,320
mod simplu și eficient de a convinge

57172
42:30:58,160 --> 42:31:03,280
părțile interesate. Ea folosește instrumente precum

57173
42:31:00,320 --> 42:31:05,600
Tableau, PowerBI și ClickView care pot

57174
42:31:03,280 --> 42:31:07,920
ajutați-o să creeze rapoarte puternice

57175
42:31:05,600 --> 42:31:10,240
și tablouri de bord. Și apoi, în sfârșit, ea

57176
42:31:07,920 --> 42:31:11,840
implementează și întreține modelul. Ea

57177
42:31:10,240 --> 42:31:13,840
testează modelul selectat în a

57178
42:31:11,840 --> 42:31:15,360
mediu de pre-producție înainte

57179
42:31:13,840 --> 42:31:17,360
implementându-l în producție

57180
42:31:15,360 --> 42:31:19,744
mediu care este cea mai bună practică.

57181
42:31:17,360 --> 42:31:22,480
Corect? După implementarea cu succes,

57182
42:31:19,744 --> 42:31:25,360
ea folosește rapoarte și tablouri de bord pentru a obține

57183
42:31:22,480 --> 42:31:27,280
analiză în timp real. Mai departe, și ea

57184
42:31:25,360 --> 42:31:29,360
monitorizează și menține proiectul

57185
42:31:27,280 --> 42:31:31,280
performanta. Ei bine, așa e Emma

57186
42:31:29,360 --> 42:31:33,104
finalizează proiectul de știință a datelor. Noi

57187
42:31:31,280 --> 42:31:35,600
au văzut rutina zilnică a unei date

57188
42:31:33,104 --> 42:31:37,840
om de știință este foarte distractiv, are o

57189
42:31:35,600 --> 42:31:40,160
multe aspecte interesante și vine

57190
42:31:37,840 --> 42:31:42,384
cu propria sa parte de provocări. Acum,

57191
42:31:40,160 --> 42:31:44,800
să vedem cum se schimbă știința datelor

57192
42:31:42,384 --> 42:31:47,360
lumea. Tehnici de știință a datelor de-a lungul

57193
42:31:44,800 --> 42:31:49,024
cu date genomice oferă o mai profundă

57194
42:31:47,360 --> 42:31:50,960
înţelegerea problemelor genetice şi

57195
42:31:49,024 --> 42:31:54,000
reacție la anumite medicamente și

57196
42:31:50,960 --> 42:31:56,320
boli. Companii de logistică precum DHL,

57197
42:31:54,000 --> 42:31:58,560
FedEx a descoperit cele mai bune rute către

57198
42:31:56,320 --> 42:32:00,880
navă, momentul cel mai potrivit pentru livrare,

57199
42:31:58,560 --> 42:32:03,360
cel mai bun mod de transport de ales,

57200
42:32:00,880 --> 42:32:06,160
conducând astfel la eficientizarea costurilor. Cu

57201
42:32:03,360 --> 42:32:08,880
știința datelor, este posibil să nu numai

57202
42:32:06,160 --> 42:32:10,800
prezice uzura angajaților, dar și să

57203
42:32:08,880 --> 42:32:13,440
înţelege variabilele cheie care

57204
42:32:10,800 --> 42:32:15,840
influența fluctuația angajaților. De asemenea, cel

57205
42:32:13,440 --> 42:32:18,384
companiile aeriene pot acum prezice cu ușurință

57206
42:32:15,840 --> 42:32:20,480
întârzierea zborului și informați pasagerii

57207
42:32:18,384 --> 42:32:22,640
în prealabil pentru a le spori călătoria

57208
42:32:20,480 --> 42:32:24,800
experiență. Ei bine, dacă te întrebi,

57209
42:32:22,640 --> 42:32:27,520
sunt diverse roluri oferite unui

57210
42:32:24,800 --> 42:32:29,664
cercetător de date ca analist de date,

57211
42:32:27,520 --> 42:32:32,480
inginer de învățare automată, învățare profundă

57212
42:32:29,664 --> 42:32:35,200
inginer, inginer de date și, desigur,

57213
42:32:32,480 --> 42:32:37,520
cercetător de date. Salariile de bază medii

57214
42:32:35,200 --> 42:32:41,280
a unui cercetător de date poate varia de la

57215
42:32:37,520 --> 42:32:43,664
95.000 USD până la 165.000 USD.

57216
42:32:41,280 --> 42:32:45,840
Deci asta a fost despre știința datelor. sunt

57217
42:32:43,664 --> 42:32:48,384
ești gata să fii cercetător de date? Dacă

57218
42:32:45,840 --> 42:32:50,240
da, atunci începe azi. Lumea lui

57219
42:32:48,384 --> 42:32:52,560
date. Imaginează-ți asta. Tu faci cumpărături

57220
42:32:50,240 --> 42:32:55,024
online și dintr-o dată vezi un produs

57221
42:32:52,560 --> 42:32:58,080
care pare că a fost făcut doar pentru

57222
42:32:55,024 --> 42:33:00,720
tu. De unde au știut? Nu este de

57223
42:32:58,080 --> 42:33:02,720
sansa. Este știința datelor. Știința datelor

57224
42:33:00,720 --> 42:33:05,200
ajutați companiile să înțeleagă ceea ce aveți

57225
42:33:02,720 --> 42:33:07,520
cum ar fi, prezice de ce vei avea nevoie în continuare și

57226
42:33:05,200 --> 42:33:10,080
îmbunătățim modul în care cumpărăm și folosim

57227
42:33:07,520 --> 42:33:12,240
tehnologie. Și aici este partea cea mai bună.

57228
42:33:10,080 --> 42:33:15,104
Știința datelor nu înseamnă doar vizionare

57229
42:33:12,240 --> 42:33:17,744
Netflix. Este una dintre cele cu cea mai rapidă creștere

57230
42:33:15,104 --> 42:33:20,640
cariere în lume chiar acum. De fapt,

57231
42:33:17,744 --> 42:33:23,200
Biroul de Statistică al Muncii din SUA spune

57232
42:33:20,640 --> 42:33:28,080
că se așteaptă ca locurile de muncă din știința datelor

57233
42:33:23,200 --> 42:33:30,800
crește cu 36% până în 2033, mult mai rapid decât majoritatea

57234
42:33:28,080 --> 42:33:32,880
a celorlalte locuri de muncă. Companii de pretutindeni

57235
42:33:30,800 --> 42:33:35,440
folosesc datele pentru a deveni mai inteligent

57236
42:33:32,880 --> 42:33:38,080
deciziilor. Asta înseamnă cererea pentru

57237
42:33:35,440 --> 42:33:39,840
oamenii de știință de date este uriaș. Și hai să vorbim

57238
42:33:38,080 --> 42:33:42,560
despre salariu. Probabil că ești

57239
42:33:39,840 --> 42:33:44,800
te întrebi cât de mult pot câștiga de fapt?

57240
42:33:42,560 --> 42:33:47,104
Ei bine, pentru poziția de nivel de intrare, date

57241
42:33:44,800 --> 42:33:49,024
oamenii de știință din SUA câștigă în jur

57242
42:33:47,104 --> 42:33:52,640
152.000 USD

57243
42:33:49,024 --> 42:33:55,744
pe an chiar acum. Și până în 2025, unii

57244
42:33:52,640 --> 42:33:57,744
poate câștiga până la 230.000 USD.

57245
42:33:55,744 --> 42:34:01,024
Și în India, salariile de pornire variază

57246
42:33:57,744 --> 42:34:03,200
de la 50.000 de rupii la 1 lakh pe lună.

57247
42:34:01,024 --> 42:34:05,440
Și profesioniștii cu experiență pot câștiga

57248
42:34:03,200 --> 42:34:07,280
mai mult de 5 lakh rupii pe lună.

57249
42:34:05,440 --> 42:34:09,920
E impresionant, nu? Dar cel mai bun

57250
42:34:07,280 --> 42:34:12,240
o parte este ca cercetător de date, nu vei face asta

57251
42:34:09,920 --> 42:34:14,720
doar oprește-te aici. Abilitățile pe care le dezvoltați

57252
42:34:12,240 --> 42:34:17,360
în acest rol, cum ar fi învățarea automată, datele

57253
42:34:14,720 --> 42:34:20,160
vizualizarea și statisticile sunt foarte bune

57254
42:34:17,360 --> 42:34:22,560
transferabil și crucial pentru mutarea în

57255
42:34:20,160 --> 42:34:24,800
Roluri AI. Deci, dacă devine un AI

57256
42:34:22,560 --> 42:34:27,280
inginer sau un specialist AI, the

57257
42:34:24,800 --> 42:34:29,360
fundația pe care o construiți în știința datelor

57258
42:34:27,280 --> 42:34:32,480
te va ajuta să treci de nivel și să urmărești

57259
42:34:29,360 --> 42:34:34,384
oportunități interesante de hyping în AI

57260
42:34:32,480 --> 42:34:37,024
câmp. Acum, dacă te gândești la asta

57261
42:34:34,384 --> 42:34:39,024
Sună grozav, dar de unde să încep?

57262
42:34:37,024 --> 42:34:41,280
Ei bine, asta este exact ceea ce

57263
42:34:39,024 --> 42:34:44,240
curs certificat profesional în date

57264
42:34:41,280 --> 42:34:46,080
știință de la IIT Kpur și Simply Learn

57265
42:34:44,240 --> 42:34:48,080
este conceput pentru a face. Te va primi

57266
42:34:46,080 --> 42:34:50,560
a început și asigurați-vă că sunteți pregătit pentru

57267
42:34:48,080 --> 42:34:53,024
această industrie în plină expansiune. În această lună de 11

57268
42:34:50,560 --> 42:34:54,800
program interactiv online live, tu

57269
42:34:53,024 --> 42:34:57,024
va învăța abilitățile de care aveți nevoie pentru a deveni

57270
42:34:54,800 --> 42:34:59,440
un profesionist în știința datelor. Nu mai mult

57271
42:34:57,024 --> 42:35:01,840
teorie, gata de puf. Obții hands-on

57272
42:34:59,440 --> 42:35:04,720
proiecte, cursuri de viață și mentorat

57273
42:35:01,840 --> 42:35:06,960
de la facultatea IT Kpur plus lumea reală

57274
42:35:04,720 --> 42:35:09,360
expert în industrie care vă va ajuta să construiți

57275
42:35:06,960 --> 42:35:11,664
aptitudinile tale. Deci acest curs vine cu

57276
42:35:09,360 --> 42:35:13,840
caracteristici uimitoare interesante care face

57277
42:35:11,664 --> 42:35:16,160
învăţarea şi mai de impact. Opt

57278
42:35:13,840 --> 42:35:18,720
interacțiune de ori mai mare în live online

57279
42:35:16,160 --> 42:35:20,560
cursuri cu expert în industrie. Obisnuit

57280
42:35:18,720 --> 42:35:22,880
cursuri online live conduse de

57281
42:35:20,560 --> 42:35:25,024
profesioniști cu experiență care aduc real

57282
42:35:22,880 --> 42:35:27,360
cunoștințe despre lume în fiecare sesiune.

57283
42:35:25,024 --> 42:35:29,664
Veți ajunge și la master 13 plus cheia

57284
42:35:27,360 --> 42:35:32,000
abilități, inclusiv AI generativă, prompt

57285
42:35:29,664 --> 42:35:34,720
inginerie, încărcare, AI consumabil,

57286
42:35:32,000 --> 42:35:36,560
AI de conversie, NLP și multe altele.

57287
42:35:34,720 --> 42:35:38,880
Acestea sunt abilitățile pe care companiile de top

57288
42:35:36,560 --> 42:35:41,440
utilizați în fiecare zi. Și vei câștiga hands-on

57289
42:35:38,880 --> 42:35:43,840
experiență cu peste 14 instrumente din industrie

57290
42:35:41,440 --> 42:35:46,640
precum Python, SQL, Tableau, Dali 2,

57291
42:35:43,840 --> 42:35:48,384
Midjourney, TensorFlow și multe altele. Și prin

57292
42:35:46,640 --> 42:35:50,720
la sfârșitul acestui curs, vei fi

57293
42:35:48,384 --> 42:35:52,800
gata să facă față provocărilor din lumea reală

57294
42:35:50,720 --> 42:35:54,960
folosind aceste instrumente puternice și

57295
42:35:52,800 --> 42:35:57,440
tehnici. Dar nu doar vorbim

57296
42:35:54,960 --> 42:36:00,480
despre manual și teorie. Vei lucra

57297
42:35:57,440 --> 42:36:02,800
pe peste 25 de proiecte din lumea reală

57298
42:36:00,480 --> 42:36:05,520
ai experiență practică cu instrumentele

57299
42:36:02,800 --> 42:36:07,664
și abilitățile pe care le vei folosi în industrie.

57300
42:36:05,520 --> 42:36:10,320
De exemplu, primul nostru proiect ar fi

57301
42:36:07,664 --> 42:36:12,640
despre analiza vânzărilor. Veți folosi Python

57302
42:36:10,320 --> 42:36:15,360
pentru a analiza o companie de îmbrăcăminte a patra

57303
42:36:12,640 --> 42:36:17,600
datele de vânzări trimestriale din Australia

57304
42:36:15,360 --> 42:36:19,360
de stat, ajutând compania să se informeze

57305
42:36:17,600 --> 42:36:21,440
deciziilor. Următorul proiect ar fi

57306
42:36:19,360 --> 42:36:23,024
despre analiza performanței angajaților

57307
42:36:21,440 --> 42:36:24,640
unde înveți cum să construiești o mașină

57308
42:36:23,024 --> 42:36:27,520
modele de învățare pentru a înțelege

57309
42:36:24,640 --> 42:36:29,104
factori care influenţează fluctuaţia angajaţilor.

57310
42:36:27,520 --> 42:36:31,024
Al treilea proiect al nostru ar fi despre

57311
42:36:29,104 --> 42:36:33,200
e-commerce care va ajuta Amazon

57312
42:36:31,024 --> 42:36:35,024
să-și îmbunătățească motorul de recomandare pentru a

57313
42:36:33,200 --> 42:36:37,440
oferi o recomandare mai bună

57314
42:36:35,024 --> 42:36:39,200
clientii. La finalizarea cu succes,

57315
42:36:37,440 --> 42:36:41,744
veți primi un certificat de program

57316
42:36:39,200 --> 42:36:44,640
eliberat direct de academia orăşenească ENI

57317
42:36:41,744 --> 42:36:46,640
IT Kpool în termen de 45 de zile de la finalizare

57318
42:36:44,640 --> 42:36:48,240
cohorta ta. Acest prestigios

57319
42:36:46,640 --> 42:36:50,720
certificatul vă va ajuta să vă îmbunătățiți

57320
42:36:48,240 --> 42:36:53,104
relua si arata potentialilor angajati ca

57321
42:36:50,720 --> 42:36:55,024
ai stăpânit abilitățile necesare

57322
42:36:53,104 --> 42:36:56,880
reuși. Veți beneficia și de master

57323
42:36:55,024 --> 42:36:58,960
cursuri oferite de IT distins

57324
42:36:56,880 --> 42:37:01,104
Facultatea Kur care aduc adâncul lor

57325
42:36:58,960 --> 42:37:02,800
expertiza in acest curs. În plus, o vei face

57326
42:37:01,104 --> 42:37:05,360
fi expus la instrumente în tendințe precum

57327
42:37:02,800 --> 42:37:06,960
chargeb2 geni și inginerie promptă.

57328
42:37:05,360 --> 42:37:08,720
Acum, dacă te întrebi cine va fi

57329
42:37:06,960 --> 42:37:10,880
predând toate acestea, apoi IT

57330
42:37:08,720 --> 42:37:12,640
Facultatea de carpool este aici pentru tine. Acestea

57331
42:37:10,880 --> 42:37:14,384
experții au fost în acest domeniu pentru

57332
42:37:12,640 --> 42:37:16,080
ani și am lucrat cu vârf

57333
42:37:14,384 --> 42:37:17,664
companiilor. Veți obține și stăpân

57334
42:37:16,080 --> 42:37:19,520
cursuri de la ei și ei vor îndruma

57335
42:37:17,664 --> 42:37:21,200
dumneavoastră prin procesul de învățare. Tu esti

57336
42:37:19,520 --> 42:37:23,024
nu doar învățând dintr-un manual. tu

57337
42:37:21,200 --> 42:37:25,024
învață de la oamenii care au

57338
42:37:23,024 --> 42:37:26,720
fost acolo și făcut asta. Și cel mai bun

57339
42:37:25,024 --> 42:37:28,640
parte este odată ce ați învățat

57340
42:37:26,720 --> 42:37:31,104
abilități, învață pur și simplu asistență în carieră

57341
42:37:28,640 --> 42:37:32,720
echipa te va ajuta să treci la pasul următor

57342
42:37:31,104 --> 42:37:35,104
care te va ajuta să construiești un criminal

57343
42:37:32,720 --> 42:37:37,280
CV-ul, vă arată cum să vă evidențiați

57344
42:37:35,104 --> 42:37:39,280
recrutori și chiar vă oferă acces la

57345
42:37:37,280 --> 42:37:41,440
interviuri simulate. În plus, vei face și tu

57346
42:37:39,280 --> 42:37:43,840
obține acces la o rețea exclusivă

57347
42:37:41,440 --> 42:37:45,664
evenimente și hackathon-uri cu care să vă conectați

57348
42:37:43,840 --> 42:37:47,200
profesionisti din industrie. Împreună cu

57349
42:37:45,664 --> 42:37:49,520
Asistentul de lucru al lui Simply Learn, o vei face

57350
42:37:47,200 --> 42:37:51,520
de asemenea, obțineți acces la cariera ID Kpur

57351
42:37:49,520 --> 42:37:53,360
servicii care vă ajută să vă conectați cu top

57352
42:37:51,520 --> 42:37:55,200
recrutori și interviuri cu terenuri

57353
42:37:53,360 --> 42:37:56,640
companii de top în tehnologie. Deci, pe

57354
42:37:55,200 --> 42:37:58,640
terminând acest curs, vei fi gata

57355
42:37:56,640 --> 42:38:00,560
pentru roluri de top în domeniul științei datelor, cum ar fi datele

57356
42:37:58,640 --> 42:38:02,960
oameni de știință, inginer de învățare automată,

57357
42:38:00,560 --> 42:38:05,280
Specialist AI și analist de afaceri. The

57358
42:38:02,960 --> 42:38:07,520
veștile bune sunt companii de top precum Amazon,

57359
42:38:05,280 --> 42:38:10,320
EY, Fidelity Investment, Johnson și

57360
42:38:07,520 --> 42:38:13,104
Johnson, Borafhone, Accenture, Infosys

57361
42:38:10,320 --> 42:38:15,440
iar Nvidia caută profesioniști

57362
42:38:13,104 --> 42:38:18,800
la fel ca tine. Și cu salariile în

57363
42:38:15,440 --> 42:38:20,560
SUA atingând aproximativ 230.000 de dolari și în plus

57364
42:38:18,800 --> 42:38:23,280
India ajungând până la cinci lakh per

57365
42:38:20,560 --> 42:38:25,200
lună, perspectivele dvs. de carieră arată grozav.

57366
42:38:23,280 --> 42:38:27,024
Deci în ce vei învăța de fapt

57367
42:38:25,200 --> 42:38:28,560
acest curs? Așa că iată o scurtă privire

57368
42:38:27,024 --> 42:38:30,240
programa în care vei învăța

57369
42:38:28,560 --> 42:38:33,024
acest curs care este fundamentul în

57370
42:38:30,240 --> 42:38:34,880
Python, SQL și matematică, date de bază

57371
42:38:33,024 --> 42:38:37,744
știință cum ar fi învățarea automată, datele

57372
42:38:34,880 --> 42:38:40,320
vizualizare, NLP, subiecte speciale ca

57373
42:38:37,744 --> 42:38:41,920
VNB, taxa GBT, inginerie promptă și

57374
42:38:40,320 --> 42:38:43,664
veți lucra și la proiecte din industrie

57375
42:38:41,920 --> 42:38:45,200
despre care am menționat-o deja.

57376
42:38:43,664 --> 42:38:47,104
Veți avea și opțiunea de a alege

57377
42:38:45,200 --> 42:38:49,360
opționale precum povestirea datelor cu

57378
42:38:47,104 --> 42:38:51,664
PowerBI și analize de afaceri cu

57379
42:38:49,360 --> 42:38:53,840
Excel pentru a vă adapta experiența de învățare

57380
42:38:51,664 --> 42:38:56,000
și concentrează-te pe domeniile care te interesează

57381
42:38:53,840 --> 42:38:57,744
cel mai mult. Așa că nu aștepta, grăbește-te și

57382
42:38:56,000 --> 42:38:59,600
înscrie-te acum și găsește linkul cursului în

57383
42:38:57,744 --> 42:39:01,744
caseta de descriere de mai jos și în pin

57384
42:38:59,600 --> 42:39:03,840
comentarii. Te-ai întrebat vreodată cum

57385
42:39:01,744 --> 42:39:06,160
magazinul tău online preferat pare să știe

57386
42:39:03,840 --> 42:39:08,080
exact ceea ce cauți? Fiecare

57387
42:39:06,160 --> 42:39:10,384
când răsfoiți, adăugați în coș sau doriți

57388
42:39:08,080 --> 42:39:12,480
enumerați un articol, lăsați indicii

57389
42:39:10,384 --> 42:39:15,104
despre stilul tău, culorile preferate,

57390
42:39:12,480 --> 42:39:16,960
mărci, și chiar timpuri de cumpărături. Date

57391
42:39:15,104 --> 42:39:18,480
oamenii de știință intervin, analizează acestea

57392
42:39:16,960 --> 42:39:20,160
modele și creați un super

57393
42:39:18,480 --> 42:39:22,560
experiență de cumpărături personalizată.

57394
42:39:20,160 --> 42:39:24,880
Deodată, magazinul îți arată doar

57395
42:39:22,560 --> 42:39:27,104
piesele potrivite la momentul potrivit.

57396
42:39:24,880 --> 42:39:29,200
Aproape ca și cum îți citește gândurile.

57397
42:39:27,104 --> 42:39:31,664
Aceasta este știința datelor. Întoarce-ți clicurile

57398
42:39:29,200 --> 42:39:33,840
într-o plină de cumpărături creată doar pentru

57399
42:39:31,664 --> 42:39:35,520
tu. Bună ziua tuturor. Bine ai revenit la

57400
42:39:33,840 --> 42:39:37,360
Canalul YouTube al lui Simply Learn. Dacă

57401
42:39:35,520 --> 42:39:39,600
ești deja un pasionat al științei datelor

57402
42:39:37,360 --> 42:39:41,920
sau pur și simplu am devenit curios despre acest lucru incitant

57403
42:39:39,600 --> 42:39:44,384
câmp, ești în locul potrivit. Astăzi

57404
42:39:41,920 --> 42:39:46,240
în acest videoclip, mă scufund în 10

57405
42:39:44,384 --> 42:39:48,640
pași esențiali pentru a te ajuta să devii

57406
42:39:46,240 --> 42:39:51,280
următorul cercetător de date la cerere și terenuri

57407
42:39:48,640 --> 42:39:53,440
acel job de vis. Gata cu așteptarea. Să

57408
42:39:51,280 --> 42:39:55,840
scufundă-te direct și te duce pe calea către

57409
42:39:53,440 --> 42:39:58,080
viitorul tău în știința datelor. Deci, hai

57410
42:39:55,840 --> 42:40:00,480
vezi cei 10 pași esențiali pentru a deveni

57411
42:39:58,080 --> 42:40:02,800
următorul cercetător de date la cerere. Pasul

57412
42:40:00,480 --> 42:40:05,024
numărul unu este limbajele de programare.

57413
42:40:02,800 --> 42:40:06,560
Începând cu Python este un începător este a

57414
42:40:05,024 --> 42:40:08,384
o mișcare grozavă pentru că este simplă,

57415
42:40:06,560 --> 42:40:10,720
versatil și utilizat pe scară largă în date

57416
42:40:08,384 --> 42:40:12,720
stiinta. Sintaxă simplă Python

57417
42:40:10,720 --> 42:40:15,104
îl face prietenos pentru începători, ajutându-te

57418
42:40:12,720 --> 42:40:17,104
să înțeleagă rapid noțiunile de bază ale programării și

57419
42:40:15,104 --> 42:40:20,480
scufundă-te în bibliotecile de știință a datelor, cum ar fi

57420
42:40:17,104 --> 42:40:22,880
panda, numpy și mattplotive cu ușurință.

57421
42:40:20,480 --> 42:40:24,640
Adăugarea lui R la setul tău de abilități este valoroasă

57422
42:40:22,880 --> 42:40:26,880
pentru că excelează la statistică

57423
42:40:24,640 --> 42:40:29,200
analiza și vizualizarea datelor doi

57424
42:40:26,880 --> 42:40:31,200
părți esențiale ale științei datelor. Poți

57425
42:40:29,200 --> 42:40:33,840
fiți confortabil cu Python și R în interior

57426
42:40:31,200 --> 42:40:35,920
o lună sau două. Deci trec la următorul

57427
42:40:33,840 --> 42:40:38,080
pas care este sistemul de control al versiunilor.

57428
42:40:35,920 --> 42:40:40,320
Învățarea unui sistem de control al versiunilor, cum ar fi

57429
42:40:38,080 --> 42:40:42,160
Git este esențial pentru că îți permite

57430
42:40:40,320 --> 42:40:44,640
pentru a urmări, gestiona și colabora și

57431
42:40:42,160 --> 42:40:46,320
codifică eficient. Cu Git, puteți salva

57432
42:40:44,640 --> 42:40:48,480
diferite versiuni ale lucrării tale, realizarea

57433
42:40:46,320 --> 42:40:50,800
este ușor să dai înapoi dacă ceva merge

57434
42:40:48,480 --> 42:40:53,520
greșit sau să experimenteze fără a pierde

57435
42:40:50,800 --> 42:40:55,280
progres. Acest lucru este util mai ales atunci când

57436
42:40:53,520 --> 42:40:56,960
lucrul cu știința datelor complexe

57437
42:40:55,280 --> 42:40:59,104
proiecte în care ați putea încerca

57438
42:40:56,960 --> 42:41:01,360
diferite modele de tehnici de analiză.

57439
42:40:59,104 --> 42:41:03,840
Una sau două săptămâni pentru exersare împreună cu

57440
42:41:01,360 --> 42:41:06,160
Python și R sunt bune pentru a începe. Acum

57441
42:41:03,840 --> 42:41:08,320
trecând la a treia etapă care este datele

57442
42:41:06,160 --> 42:41:10,240
structuri și algoritmi. Date de învățare

57443
42:41:08,320 --> 42:41:12,080
structurile și algoritmii este crucială pentru

57444
42:41:10,240 --> 42:41:13,664
devenind un cercetător al datelor pentru că ei

57445
42:41:12,080 --> 42:41:16,160
oferă baza pentru eficiență

57446
42:41:13,664 --> 42:41:18,720
manipularea datelor și rezolvarea problemelor. Date

57447
42:41:16,160 --> 42:41:20,720
structuri precum matrice, stive, indicii și

57448
42:41:18,720 --> 42:41:22,800
arborii vă ajută să stocați și să organizați datele

57449
42:41:20,720 --> 42:41:24,720
în moduri care o fac mai ușor și mai rapid

57450
42:41:22,800 --> 42:41:26,560
pentru a accesa, procesa și analiza.

57451
42:41:24,720 --> 42:41:28,560
Pe de altă parte, algoritmii vă oferă

57452
42:41:26,560 --> 42:41:30,560
strategii pentru a îndeplini sarcini precum

57453
42:41:28,560 --> 42:41:32,640
căutarea, sortarea și optimizarea datelor

57454
42:41:30,560 --> 42:41:34,800
operațiuni care sunt esențiale pentru

57455
42:41:32,640 --> 42:41:36,480
manipularea unor seturi mari de date. În timp ce mulți

57456
42:41:34,800 --> 42:41:38,240
candidații se luptă cu eseul,

57457
42:41:36,480 --> 42:41:40,480
stăpânirea ei vă oferă o vârstă de ajutor

57458
42:41:38,240 --> 42:41:42,800
ieși în evidență în interviuri și

57459
42:41:40,480 --> 42:41:44,880
strălucește ca un cercetător de date calificat

57460
42:41:42,800 --> 42:41:46,880
capabil să abordeze cele mai dificile date

57461
42:41:44,880 --> 42:41:48,720
probleme. Petrece aproximativ două luni în

57462
42:41:46,880 --> 42:41:50,800
asta, vei intra in forma pt

57463
42:41:48,720 --> 42:41:53,840
sigur. Acum trecem la numărul pasului

57464
42:41:50,800 --> 42:41:55,664
patru adică SQL. Învățarea SQL este

57465
42:41:53,840 --> 42:41:57,360
esențial pentru oamenii de știință de date deoarece aceasta

57466
42:41:55,664 --> 42:41:58,960
vă permite să accesați, să gestionați și

57467
42:41:57,360 --> 42:42:02,000
manipula datele direct în interior

57468
42:41:58,960 --> 42:42:04,800
bazele de date unde sunt cele mai multe date din lumea reală

57469
42:42:02,000 --> 42:42:07,744
locuiește. Cu SQL, puteți crea noi

57470
42:42:04,800 --> 42:42:10,160
tabele, modificați pe cele existente, ștergeți

57471
42:42:07,744 --> 42:42:13,664
înregistrări inutile și rulați interogări către

57472
42:42:10,160 --> 42:42:15,920
filtrați, sortați și agregați datele. Acestea

57473
42:42:13,664 --> 42:42:18,384
abilitățile vă permit să recuperați, să curățați,

57474
42:42:15,920 --> 42:42:20,640
și organizați datele în mod eficient. Miez

57475
42:42:18,384 --> 42:42:22,720
abilitățile necesare oricărui rol în știința datelor.

57476
42:42:20,640 --> 42:42:24,480
Este ușor și nu trebuie să cheltuiești

57477
42:42:22,720 --> 42:42:26,320
mai mult de o lună pentru a avea o adâncime

57478
42:42:24,480 --> 42:42:28,560
înțelegerea acesteia. Acum trecem la

57479
42:42:26,320 --> 42:42:30,800
al cincilea pas care este matematica și

57480
42:42:28,560 --> 42:42:32,480
statistici. Matematică și statistică

57481
42:42:30,800 --> 42:42:34,880
sunt esențiale pentru știința datelor deoarece

57482
42:42:32,480 --> 42:42:36,800
ele formează coloana vertebrală a analizei datelor,

57483
42:42:34,880 --> 42:42:39,440
construirea de modele și interpretare.

57484
42:42:36,800 --> 42:42:42,240
Subiecte precum algebra liniară, calculul,

57485
42:42:39,440 --> 42:42:44,000
probabilitatea și statistica oferă date

57486
42:42:42,240 --> 42:42:46,384
oamenii de știință instrumentele pentru a înțelege datele

57487
42:42:44,000 --> 42:42:48,384
tipare, efectuează analize precise și

57488
42:42:46,384 --> 42:42:50,880
luați decizii bazate pe date. Stăpânirea

57489
42:42:48,384 --> 42:42:53,664
aceste zone vă permit să construiți robust

57490
42:42:50,880 --> 42:42:56,080
modele, validarea rezultatelor și abordarea

57491
42:42:53,664 --> 42:42:58,000
probleme complexe care vă fac cu încredere

57492
42:42:56,080 --> 42:43:00,240
o date bine rotunjite și pricepute

57493
42:42:58,000 --> 42:43:02,880
om de stiinta. Asigurați-vă că cheltuiți două

57494
42:43:00,240 --> 42:43:04,720
luni pentru a înțelege aceste subiecte. Acum în mișcare

57495
42:43:02,880 --> 42:43:06,640
la pasul numărul șase, adică date

57496
42:43:04,720 --> 42:43:08,320
pre-procesare și vizualizare.

57497
42:43:06,640 --> 42:43:10,320
Învățarea pregătirii datelor și procesării

57498
42:43:08,320 --> 42:43:13,024
vizualizarea este esențială pentru date

57499
42:43:10,320 --> 42:43:16,080
om de știință pentru că aceste abilități te fac

57500
42:43:13,024 --> 42:43:18,720
date precise, perspicace și ușor de utilizat

57501
42:43:16,080 --> 42:43:21,600
intelege. Biblioteci Python precum NumPy

57502
42:43:18,720 --> 42:43:23,920
iar Panders sunt cruciale pentru manipulare

57503
42:43:21,600 --> 42:43:26,160
și crearea de date, permițându-vă

57504
42:43:23,920 --> 42:43:28,560
gestionează valorile lipsă, filtrează zgomotul,

57505
42:43:26,160 --> 42:43:31,104
și pregătiți datele pentru analiză. Odată ce

57506
42:43:28,560 --> 42:43:33,360
datele sunt gata, vizualizarea vă permite

57507
42:43:31,104 --> 42:43:36,640
descoperi modele și comunică rezultatele

57508
42:43:33,360 --> 42:43:39,200
eficient. Biblioteci precum Mattplot sfat

57509
42:43:36,640 --> 42:43:41,024
și Seaborn ajută la crearea clară, de impact

57510
42:43:39,200 --> 42:43:43,360
vizuale, permițându-vă să interpretați

57511
42:43:41,024 --> 42:43:45,280
tendințe și să transmită perspective într-un fel

57512
42:43:43,360 --> 42:43:47,520
asta e usor de inteles de altii.

57513
42:43:45,280 --> 42:43:49,104
Împreună cu aceste instrumente, creați date

57514
42:43:47,520 --> 42:43:51,360
pre-procesare și vizualizare

57515
42:43:49,104 --> 42:43:53,440
fundamentale pentru știința datelor eficiente.

57516
42:43:51,360 --> 42:43:55,200
Dacă aveți o bază solidă pe Python

57517
42:43:53,440 --> 42:43:56,800
și matematică, vei obține un bun

57518
42:43:55,200 --> 42:43:59,200
înțelegerea prelucrării datelor

57519
42:43:56,800 --> 42:44:01,200
și vizualizare într-o lună sau două. Acum

57520
42:43:59,200 --> 42:44:03,104
trecând la treapta a șaptea adică

57521
42:44:01,200 --> 42:44:04,560
Fundamentele învățării automate. Masina

57522
42:44:03,104 --> 42:44:06,384
bazele învăţării implică

57523
42:44:04,560 --> 42:44:08,640
înțelegerea modului în care algoritmii permit

57524
42:44:06,384 --> 42:44:10,640
calculatoare pentru a învăța din date și a face

57525
42:44:08,640 --> 42:44:12,384
previziuni asupra deciziilor fără

57526
42:44:10,640 --> 42:44:14,240
programare explicită. Cele două principale

57527
42:44:12,384 --> 42:44:16,240
categoriile sunt învăţarea supervizată şi

57528
42:44:14,240 --> 42:44:18,080
învăţare nesupravegheată. În supravegheat

57529
42:44:16,240 --> 42:44:19,920
învățând, modelele sunt antrenate pe etichete

57530
42:44:18,080 --> 42:44:22,960
date pentru a face predicții în timp ce sunteți în

57531
42:44:19,920 --> 42:44:25,200
modelele de învățare nesupravegheate găsesc

57532
42:44:22,960 --> 42:44:28,320
modele în datele neetichetate. Popular

57533
42:44:25,200 --> 42:44:30,384
instrumente precum TensorFlow, PyTorch ajută

57534
42:44:28,320 --> 42:44:32,240
construi și antrenează modele complexe

57535
42:44:30,384 --> 42:44:35,664
mai ales pentru învățarea profundă. în timp ce

57536
42:44:32,240 --> 42:44:37,840
skyit learn este esențial folosit pentru

57537
42:44:35,664 --> 42:44:39,744
algoritmi de învățare automată mai simpli și

57538
42:44:37,840 --> 42:44:41,920
Prelucrarea datelor. Aceste instrumente fac

57539
42:44:39,744 --> 42:44:44,240
este mai ușor să implementați învățarea automată

57540
42:44:41,920 --> 42:44:46,320
fundamentale în mod eficient și construiți

57541
42:44:44,240 --> 42:44:48,320
decizii inteligente bazate pe date.

57542
42:44:46,320 --> 42:44:50,640
Dedică aproximativ trei luni

57543
42:44:48,320 --> 42:44:52,960
înțelegeți nucleul învățării automate.

57544
42:44:50,640 --> 42:44:54,800
Acum ajungem la următorul pas care este profund

57545
42:44:52,960 --> 42:44:56,480
învăţarea. Învățarea profundă este un subset al

57546
42:44:54,800 --> 42:44:58,384
învățarea automată care se concentrează pe

57547
42:44:56,480 --> 42:45:00,640
algoritmi inspirați din structurile de

57548
42:44:58,384 --> 42:45:02,640
creierul uman numit rețele neuronale.

57549
42:45:00,640 --> 42:45:05,104
Învățarea profundă folosește rețele neuronale cu

57550
42:45:02,640 --> 42:45:07,840
straturi multiple adesea zeci sau sute

57551
42:45:05,104 --> 42:45:10,480
pentru a învăța modele complexe de la mare

57552
42:45:07,840 --> 42:45:12,640
seturi de date. Tipuri specializate ca

57553
42:45:10,480 --> 42:45:15,024
reţele neuronale convoluţionale adică

57554
42:45:12,640 --> 42:45:18,000
CNN-urile sunt excelente pentru procesarea imaginilor

57555
42:45:15,024 --> 42:45:20,560
în timp ce rețelele neuronale recurente RNN-urile sunt

57556
42:45:18,000 --> 42:45:23,104
folosit pentru date secvențe, cum ar fi textul sau ora

57557
42:45:20,560 --> 42:45:25,600
serie. Instrumente esențiale precum TensorFlow,

57558
42:45:23,104 --> 42:45:27,600
PyTorch face construirea, antrenamentul și

57559
42:45:25,600 --> 42:45:29,360
implementarea modelelor de învățare profundă mai mult

57560
42:45:27,600 --> 42:45:32,000
accesibil, permițându-vă să creați

57561
42:45:29,360 --> 42:45:34,640
soluții AI puternice în diverse

57562
42:45:32,000 --> 42:45:36,960
domenii. Cred că va dura vreo 2

57563
42:45:34,640 --> 42:45:38,720
luni pentru a avea o bună stăpânire pe adânc

57564
42:45:36,960 --> 42:45:40,720
învățarea conceptelor și modul de implementare

57565
42:45:38,720 --> 42:45:42,720
ei. Acum trecem la pasul al nouălea

57566
42:45:40,720 --> 42:45:44,320
adică specializări. Odată ce ai

57567
42:45:42,720 --> 42:45:46,080
a înțeles învățarea profundă, parcă

57568
42:45:44,320 --> 42:45:48,800
atingând un nou nivel ca date

57569
42:45:46,080 --> 42:45:52,320
om de stiinta. Așa cum medicii se specializează

57570
42:45:48,800 --> 42:45:54,480
domenii în nefrologie și cardiologie, date

57571
42:45:52,320 --> 42:45:56,880
oamenii de știință aleg adesea să se specializeze în

57572
42:45:54,480 --> 42:45:59,360
domenii precum procesarea limbajului natural

57573
42:45:56,880 --> 42:46:02,080
sau viziune computerizată. Limbajul natural

57574
42:45:59,360 --> 42:46:03,920
prelucrarea se concentrează pe mașinile de predare

57575
42:46:02,080 --> 42:46:06,160
pentru a înțelege și genera uman

57576
42:46:03,920 --> 42:46:08,640
aplicații care permit limba, cum ar fi

57577
42:46:06,160 --> 42:46:11,104
chatbot, analiza sentimentelor și

57578
42:46:08,640 --> 42:46:12,640
tranziția lingvistică. Este vorba de a face

57579
42:46:11,104 --> 42:46:15,280
computerele citesc, scriu și chiar

57580
42:46:12,640 --> 42:46:17,200
interpretează emoțiile umane prin text sau

57581
42:46:15,280 --> 42:46:19,664
vorbire. Viziunea computerizată, pe de altă parte

57582
42:46:17,200 --> 42:46:22,320
mâna este totul despre a permite mașinilor să

57583
42:46:19,664 --> 42:46:24,560
vedeți și interpretați imagini sau videoclipuri. Acest

57584
42:46:22,320 --> 42:46:26,384
câmpul alimentează inovații precum facial

57585
42:46:24,560 --> 42:46:28,560
recunoașterea, detectarea obiectelor și

57586
42:46:26,384 --> 42:46:30,560
conducere autonomă. Acum nu ai nevoie

57587
42:46:28,560 --> 42:46:33,200
să învețe pe amândouă. Puteți alege ce

57588
42:46:30,560 --> 42:46:35,440
te intereseaza cel mai mult. Acum cheltuiți unul pentru

57589
42:46:33,200 --> 42:46:38,000
două luni scufundându-se adânc într-una dintre acestea

57590
42:46:35,440 --> 42:46:40,320
zone. Acum trecem la ultimul, dar nu

57591
42:46:38,000 --> 42:46:42,384
cel mai mic pas care este big data. Mare

57592
42:46:40,320 --> 42:46:44,880
datele se referă la volume extrem de mari

57593
42:46:42,384 --> 42:46:47,440
de date generate rapid din surse

57594
42:46:44,880 --> 42:46:49,600
cum ar fi rețelele sociale și senzorii. Pentru date

57595
42:46:47,440 --> 42:46:52,080
oameni de știință, învățând să gestioneze datele mari

57596
42:46:49,600 --> 42:46:54,960
este esențială deoarece necesită specializare

57597
42:46:52,080 --> 42:46:57,104
instrumente precum Hadoop și Spark pentru a analiza

57598
42:46:54,960 --> 42:46:58,720
și extrageți informații în mod eficient. Cu

57599
42:46:57,104 --> 42:47:00,800
companii care se bazează pe datadriven

57600
42:46:58,720 --> 42:47:02,960
deciziile, abilitățile de big data te fac a

57601
42:47:00,800 --> 42:47:05,024
profesionist foarte solicitat în

57602
42:47:02,960 --> 42:47:06,880
câmp. Concentrează-te aproximativ 2 luni și tu

57603
42:47:05,024 --> 42:47:09,024
va putea identifica tendințele și modelele

57604
42:47:06,880 --> 42:47:10,640
din seturi de date foarte ușor. Odată ce ești

57605
42:47:09,024 --> 42:47:12,384
gata, este timpul să construiești un criminal

57606
42:47:10,640 --> 42:47:14,720
CV plin cu proiecte care

57607
42:47:12,384 --> 42:47:17,840
arătați-vă noile abilități. Începeți să aplicați

57608
42:47:14,720 --> 42:47:19,840
la locuri de muncă pe platforme precum Noy și Indate

57609
42:47:17,840 --> 42:47:21,744
și supraalimentați-vă LinkedIn. Conectați-vă

57610
42:47:19,840 --> 42:47:23,920
cu cercetătorii de date. Vezi ce aptitudini

57611
42:47:21,744 --> 42:47:25,840
ei stăpânesc și învață din lor

57612
42:47:23,920 --> 42:47:27,664
călătorii de asemenea. Continuă să-ți ascuți

57613
42:47:25,840 --> 42:47:29,664
propriile abilități și când va veni momentul, tu

57614
42:47:27,664 --> 42:47:32,080
va fi gata să zdrobească acele interviuri

57615
42:47:29,664 --> 42:47:33,360
și obțineți rolul de cercetător al datelor de vis

57616
42:47:32,080 --> 42:47:35,024
în 2025.

57617
42:47:33,360 --> 42:47:38,160
>> Da. pas cu pas vom parcurge

57618
42:47:35,024 --> 42:47:39,664
toate acestea și ne vom asigura că

57619
42:47:38,160 --> 42:47:41,520
învățăm totul și aducem

57620
42:47:39,664 --> 42:47:44,880
totul împreună spre final

57621
42:47:41,520 --> 42:47:47,920
corect, fără alte prelungiri, lasă-mă doar

57622
42:47:44,880 --> 42:47:53,480
aprofundarea imediată în afaceri

57623
42:47:47,920 --> 42:47:53,480
dreptul de a învăța știința datelor

57624
42:47:54,480 --> 42:47:58,720
corect

57625
42:47:56,080 --> 42:48:01,440
și cu această știință a datelor există și

57626
42:47:58,720 --> 42:48:04,720
ceva care este prefixat care este

57627
42:48:01,440 --> 42:48:04,720
știința datelor aplicate

57628
42:48:06,384 --> 42:48:13,000
iar sufixul pentru aceasta este cu Python

57629
42:48:13,024 --> 42:48:17,440
aplicați corect știința datelor cu Python

57630
42:48:15,200 --> 42:48:19,520
corect, deci există două chei

57631
42:48:17,440 --> 42:48:21,600
concepte din care vor face parte

57632
42:48:19,520 --> 42:48:23,520
acest curs primul este cel

57633
42:48:21,600 --> 42:48:26,000
cunoștințe despre știința datelor care ce

57634
42:48:23,520 --> 42:48:27,440
știința datelor este și apoi pentru că suntem

57635
42:48:26,000 --> 42:48:29,664
facem corect un curs aplicat

57636
42:48:27,440 --> 42:48:32,160
făcând un curs aplicat voi încerca

57637
42:48:29,664 --> 42:48:35,280
lega aceste concepte pe care le vom face

57638
42:48:32,160 --> 42:48:37,600
înțelegeți în știința datelor cu un instrument

57639
42:48:35,280 --> 42:48:42,160
corect care este Python pentru tine, corect noi

57640
42:48:37,600 --> 42:48:44,080
Știu deja despre 60-65% din Python

57641
42:48:42,160 --> 42:48:46,640
dreapta care este Python-ul fundamental

57642
42:48:44,080 --> 42:48:52,024
iar acum vom trece la următorul

57643
42:48:46,640 --> 42:48:52,024
pas către Python avansat

57644
42:48:52,640 --> 42:48:59,024
dreapta și folosind efectul de pârghie Python dreapta

57645
42:48:55,360 --> 42:49:01,664
Python vom rezolva multe

57646
42:48:59,024 --> 42:49:03,840
probleme de utilizare corectă a științei datelor

57647
42:49:01,664 --> 42:49:06,960
aceasta.

57648
42:49:03,840 --> 42:49:09,200
Bine. Deci, primele sesiuni, nu?

57649
42:49:06,960 --> 42:49:11,840
Primele câteva sesiuni vor fi despre

57650
42:49:09,200 --> 42:49:14,560
făcându-ți un sân cu Python. Ce

57651
42:49:11,840 --> 42:49:16,720
Python este, nu? Ce cum și ce

57652
42:49:14,560 --> 42:49:18,720
pachete avem? Cum lucrează ei în

57653
42:49:16,720 --> 42:49:20,720
realitate, nu? Și toate acele lucruri.

57654
42:49:18,720 --> 42:49:22,880
Și apoi o vom cupla cu

57655
42:49:20,720 --> 42:49:24,320
concepte de știință a datelor. Și apoi în sfârșit

57656
42:49:22,880 --> 42:49:27,520
spre sfârşitul sesiunii în

57657
42:49:24,320 --> 42:49:29,440
ultimele ore, vom face uh noi

57658
42:49:27,520 --> 42:49:31,024
va lua un set de date real. Și mai departe

57659
42:49:29,440 --> 42:49:33,744
acel set de date îl vom aplica pe toate

57660
42:49:31,024 --> 42:49:35,520
aceste concepte dreptul de a înțelege

57661
42:49:33,744 --> 42:49:38,480
date mai bine și vom desena

57662
42:49:35,520 --> 42:49:40,384
inferențe din asta pentru a converti asta

57663
42:49:38,480 --> 42:49:42,384
în informații pentru a lua măsuri

57664
42:49:40,384 --> 42:49:44,320
perspective sau folosirea acelor acțiuni

57665
42:49:42,384 --> 42:49:47,920
perspective luând o decizie mai bună.

57666
42:49:44,320 --> 42:49:51,920
Corect? Vom face toate acestea în

57667
42:49:47,920 --> 42:49:54,240
mod real. Bine. Deci acum băieți dacă voi

57668
42:49:51,920 --> 42:49:58,640
înţelege acest lucru apoi următorul punct de

57669
42:49:54,240 --> 42:50:02,080
disputa este seturi de date

57670
42:49:58,640 --> 42:50:04,000
corect unul dintre cele mai cunoscute cuvinte cheie pe

57671
42:50:02,080 --> 42:50:05,664
planeta chiar acum chiar unul dintre

57672
42:50:04,000 --> 42:50:10,320
cele mai cunoscute cuvinte cheie de pe planetă

57673
42:50:05,664 --> 42:50:12,320
acum crezi că aceste două lucruri

57674
42:50:10,320 --> 42:50:15,664
bine, lasă-mă să o spun altfel, ce să fac

57675
42:50:12,320 --> 42:50:18,960
crezi că asta poate fi posibil

57676
42:50:15,664 --> 42:50:21,200
explicație despre acest termen de știință a datelor

57677
42:50:18,960 --> 42:50:23,200
știi datele Știi știința ce faci

57678
42:50:21,200 --> 42:50:26,240
crezi că va urma în acestea

57679
42:50:23,200 --> 42:50:29,024
sesiuni? Cum este știința datelor pentru tine

57680
42:50:26,240 --> 42:50:31,744
după aceste două cuvinte? Bine. Deci asta este

57681
42:50:29,024 --> 42:50:35,440
oameni formați din două cuvinte date corecte

57682
42:50:31,744 --> 42:50:39,720
și știința corectă. Deci ceea ce încercăm

57683
42:50:35,440 --> 42:50:39,720
a face este că suntem

57684
42:50:40,960 --> 42:50:45,480
încercând să înțeleagă datele

57685
42:50:46,384 --> 42:50:52,720
nu? Încercăm să înțelegem datele

57686
42:50:48,960 --> 42:50:54,880
corect și apoi fă ceva corect

57687
42:50:52,720 --> 42:50:58,800
înțelegerea științei sale înțelegerea

57688
42:50:54,880 --> 42:51:01,744
natura uh comportamentul acestor date

57689
42:50:58,800 --> 42:51:04,744
și transformându-l în ceva numit ca

57690
42:51:01,744 --> 42:51:04,744
informaţii

57691
42:51:04,960 --> 42:51:10,800
corect știm diferența dintre date

57692
42:51:07,664 --> 42:51:14,240
iar datele informaţionale sunt ceva care

57693
42:51:10,800 --> 42:51:18,664
este complet brut bine este complet

57694
42:51:14,240 --> 42:51:18,664
crud nu are sens

57695
42:51:19,104 --> 42:51:23,600
corect, nu are sens, nu-i asa

57696
42:51:21,840 --> 42:51:27,280
exemplu

57697
42:51:23,600 --> 42:51:29,200
Vă dau aceste statistici ale unui jucător

57698
42:51:27,280 --> 42:51:31,840
Să presupunem că Sid Dhoni îți dau statistici

57699
42:51:29,200 --> 42:51:34,480
a lui Mahindra Singh Dhoni drept că ce

57700
42:51:31,840 --> 42:51:37,200
care au fost scorurile lui uh ce este al lui

57701
42:51:34,480 --> 42:51:40,240
spune ce vârstă are și știi totul

57702
42:51:37,200 --> 42:51:42,320
acele lucruri acum totul este acolo

57703
42:51:40,240 --> 42:51:44,880
corect, dar nu știm ce să facem

57704
42:51:42,320 --> 42:51:47,440
este corect crezi că scorul lui Dhoni

57705
42:51:44,880 --> 42:51:50,800
are orice context oamenii are vreunul

57706
42:51:47,440 --> 42:51:52,960
context nu este corect, dar când eu în adânc

57707
42:51:50,800 --> 42:51:54,640
dar eu când merg și mă scufund adânc despre asta

57708
42:51:52,960 --> 42:51:57,280
corect care este primul lucru pe care îl găsești

57709
42:51:54,640 --> 42:52:00,160
din scoruri care este primul lucru

57710
42:51:57,280 --> 42:52:03,024
afli scorurile pe care încerci să le faci

57711
42:52:00,160 --> 42:52:05,744
Găsiți media scorului, nu-i așa

57712
42:52:03,024 --> 42:52:07,600
în ultimele 10 reprize

57713
42:52:05,744 --> 42:52:09,440
chiar în ultimele 10 reprize înainte de aceasta

57714
42:52:07,600 --> 42:52:12,880
de asemenea, ai nevoie de ceva care se numește

57715
42:52:09,440 --> 42:52:15,024
ca o declarație de problemă nu este acum pentru

57716
42:52:12,880 --> 42:52:17,840
exemplu, declarația problemei este select

57717
42:52:15,024 --> 42:52:19,744
Selectorii vor să-i înțeleagă pe selectori

57718
42:52:17,840 --> 42:52:21,744
vrea să înțeleagă că dacă

57719
42:52:19,744 --> 42:52:24,480
Mahindra Singh Dhoni ar trebui să fie aleasă

57720
42:52:21,744 --> 42:52:27,664
sus. Deci acum este o problemă

57721
42:52:24,480 --> 42:52:31,440
selectorii vor să vadă că dacă Dhoni

57722
42:52:27,664 --> 42:52:34,080
este potrivit sau nu pentru următorul turneu.

57723
42:52:31,440 --> 42:52:40,640
Deci, ce vom face, vom încerca acum

57724
42:52:34,080 --> 42:52:43,440
ia media scorurilor corect pentru

57725
42:52:40,640 --> 42:52:45,664
ultimele 10 reprize. Și dacă acest scor este

57726
42:52:43,440 --> 42:52:49,744
să presupunem X, vom încerca să comparăm acest lucru

57727
42:52:45,664 --> 42:52:52,160
cu Y. Ce este Y? Y este o referință,

57728
42:52:49,744 --> 42:52:54,640
corect? Y este o referință pe care vrem să o facem

57729
42:52:52,160 --> 42:52:56,960
compara-l cu. Acum când ești

57730
42:52:54,640 --> 42:52:59,920
făcând aceste comparații, când ești

57731
42:52:56,960 --> 42:53:03,600
aplicarea acestor tehnici la acest scor,

57732
42:52:59,920 --> 42:53:06,560
acest lucru devine acum o informație,

57733
42:53:03,600 --> 42:53:09,440
nu? Și la sfârșitul zilei o dată

57734
42:53:06,560 --> 42:53:12,160
ai rata grevă odată ce ai

57735
42:53:09,440 --> 42:53:15,600
scorul mediu al lui Dhoni odată ce ai

57736
42:53:12,160 --> 42:53:18,240
vârsta lui odată ce ai scorul de fitness

57737
42:53:15,600 --> 42:53:21,520
toate aceste lucruri te vor ajuta acum

57738
42:53:18,240 --> 42:53:23,840
ia această decizie specială deoarece

57739
42:53:21,520 --> 42:53:25,600
acum ceea ce ai se numește ca

57740
42:53:23,840 --> 42:53:28,000
dreptul de informare deoarece aceasta are

57741
42:53:25,600 --> 42:53:31,200
context

57742
42:53:28,000 --> 42:53:35,024
corect asta are sens

57743
42:53:31,200 --> 42:53:37,600
iar aceasta este de obicei procesată

57744
42:53:35,024 --> 42:53:39,600
nu? Acesta este de obicei procesat. Corect?

57745
42:53:37,600 --> 42:53:41,920
Acesta este de obicei procesat. Acum ce a făcut

57746
42:53:39,600 --> 42:53:43,664
facem? Acum ce am făcut aici? Dacă tu

57747
42:53:41,920 --> 42:53:47,384
va merge și va citi despre știința datelor,

57748
42:53:43,664 --> 42:53:47,384
știința datelor spune,

57749
42:53:47,440 --> 42:53:54,320
știința datelor spune

57750
42:53:49,920 --> 42:53:58,024
este arta de a colecta,

57751
42:53:54,320 --> 42:53:58,024
nu? curatenie,

57752
42:53:58,800 --> 42:54:01,800
analizând,

57753
42:54:03,600 --> 42:54:06,600
modelare,

57754
42:54:08,240 --> 42:54:11,240
imbunatatirea,

57755
42:54:12,640 --> 42:54:16,520
nu? Și vizualizând,

57756
42:54:19,104 --> 42:54:25,840
nu? Vizualizarea

57757
42:54:21,520 --> 42:54:28,320
ziua, nu? Dacă o persoană este expertă în

57758
42:54:25,840 --> 42:54:30,880
făcând toate aceste lucruri, această persoană

57759
42:54:28,320 --> 42:54:33,664
oamenii se numesc cumulativ date

57760
42:54:30,880 --> 42:54:35,520
om de stiinta. Corect?

57761
42:54:33,664 --> 42:54:37,280
Acea persoană se numește un om de știință de date.

57762
42:54:35,520 --> 42:54:39,024
Corect? Deci, înainte de a trece la definiție

57763
42:54:37,280 --> 42:54:40,560
de data scientist, acum vă voi da

57764
42:54:39,024 --> 42:54:43,520
mai multe exemple, nu? iti dau

57765
42:54:40,560 --> 42:54:45,440
mai multe exemple. Oameni din știința datelor

57766
42:54:43,520 --> 42:54:47,744
după cum am spus este o combinație a acestora

57767
42:54:45,440 --> 42:54:49,520
lucruri, nu? Trebuie să colectați

57768
42:54:47,744 --> 42:54:52,640
date,

57769
42:54:49,520 --> 42:54:54,080
nu? Trebuie să colectați datele,

57770
42:54:52,640 --> 42:54:56,880
nu? Corect. Și asta are multe

57771
42:54:54,080 --> 42:55:01,440
lucruri. Datele pot fi conectate din două

57772
42:54:56,880 --> 42:55:05,520
tipuri în două tipuri. Unul este primar

57773
42:55:01,440 --> 42:55:07,104
iar al doilea este secundar.

57774
42:55:05,520 --> 42:55:09,920
Corect? Care este calea primară de a

57775
42:55:07,104 --> 42:55:12,640
colectarea datelor? De pe dispozitivele dvs. IoT,

57776
42:55:09,920 --> 42:55:16,640
nu? De la senzori,

57777
42:55:12,640 --> 42:55:20,160
de la mașinile tale încorporate,

57778
42:55:16,640 --> 42:55:24,840
nu? Apoi din sondajele tale

57779
42:55:20,160 --> 42:55:24,840
pe care plutești, nu? Chestionare,

57780
42:55:25,104 --> 42:55:27,920
nu? Toate aceste lucruri sunt primare

57781
42:55:26,640 --> 42:55:29,840
moduri. Care este calea secundară de

57782
42:55:27,920 --> 42:55:33,480
colectarea datelor?

57783
42:55:29,840 --> 42:55:33,480
date de achiziție,

57784
42:55:33,600 --> 42:55:40,160
nu? Utilizarea datelor de pe internet

57785
42:55:38,320 --> 42:55:42,384
pentru că nu l-ați generat. tu

57786
42:55:40,160 --> 42:55:44,960
folosesc doar datele altcuiva.

57787
42:55:42,384 --> 42:55:47,960
Corect? Ceva de genul transferului

57788
42:55:44,960 --> 42:55:47,960
învăţarea.

57789
42:55:48,000 --> 42:55:52,240
Ce este învățarea prin transfer?

57790
42:55:50,480 --> 42:55:56,384
Învățarea prin transfer este o tehnică în care

57791
42:55:52,240 --> 42:56:00,000
să presupunem că eu sunt banca A și tu sunteți banca B

57792
42:55:56,384 --> 42:56:04,560
așa că banca A a creat un model

57793
42:56:00,000 --> 42:56:07,200
corect instruiți cu privire la datele lor acum sunteți

57794
42:56:04,560 --> 42:56:09,200
va folosi exact același model corect

57795
42:56:07,200 --> 42:56:11,280
vei folosi exact același model

57796
42:56:09,200 --> 42:56:13,440
corect, poate nu vezi datele

57797
42:56:11,280 --> 42:56:16,240
dar folosești doar proprietatea lui

57798
42:56:13,440 --> 42:56:18,320
date cum ar fi modul mediu median și o mulțime de

57799
42:56:16,240 --> 42:56:20,384
modelând lucrurile care vor veni vom face

57800
42:56:18,320 --> 42:56:22,800
aflați despre ele și folosiți acest model

57801
42:56:20,384 --> 42:56:25,104
cu privire la datele dumneavoastră specifice, așadar într-un

57802
42:56:22,800 --> 42:56:26,960
felul în care nu ai avut suficiente date pentru a

57803
42:56:25,104 --> 42:56:29,200
creează tu modelul, dar ești

57804
42:56:26,960 --> 42:56:31,024
acum folosind modelul altcuiva pentru a alerga

57805
42:56:29,200 --> 42:56:33,520
datele dvs. de pe ele așa cum se numesc

57806
42:56:31,024 --> 42:56:36,000
ca transfer de învăţare deci acest gen de

57807
42:56:33,520 --> 42:56:39,200
colectarea este practic date secundare

57808
42:56:36,000 --> 42:56:46,024
colectare astfel încât să puteți colecta datele

57809
42:56:39,200 --> 42:56:46,024
chiar atunci puteți efectua analiza datelor

57810
42:56:46,720 --> 42:56:50,000
corect puteți efectua analiza datelor

57811
42:56:48,640 --> 42:56:53,744
corect Cum veți efectua aceste date

57812
42:56:50,000 --> 42:56:56,744
analiza? Folosind complex

57813
42:56:53,744 --> 42:56:56,744
algoritmi,

57814
42:56:57,104 --> 42:57:03,240
nu? Folosind algoritmi complexi, nu?

57815
42:56:59,840 --> 42:57:03,240
Cateva statistici,

57816
42:57:03,600 --> 42:57:09,480
corect? Puteți folosi artificial

57817
42:57:06,480 --> 42:57:09,480
inteligenta,

57818
42:57:12,720 --> 42:57:18,520
nu? Inteligenţă artificială. Poți

57819
42:57:14,800 --> 42:57:18,520
utilizați învățarea automată.

57820
42:57:19,920 --> 42:57:24,160
Corect.

57821
42:57:22,080 --> 42:57:30,200
Corect. Puteți folosi toate aceste lucruri pentru

57822
42:57:24,160 --> 42:57:30,200
analiza datelor. Atunci te poți transforma

57823
42:57:31,280 --> 42:57:38,024
transforma

57824
42:57:33,920 --> 42:57:38,024
tiparele

57825
42:57:39,744 --> 42:57:45,744
în previziuni.

57826
42:57:43,520 --> 42:57:48,000
Corect? Puteți transfera aceste modele

57827
42:57:45,744 --> 42:57:50,960
în predicții, nu? Ceea ce poate fi

57828
42:57:48,000 --> 42:57:54,440
folosit pentru afaceri

57829
42:57:50,960 --> 42:57:54,440
luarea deciziilor,

57830
42:57:55,520 --> 42:58:01,800
nu? Pentru luarea deciziilor de afaceri.

57831
42:57:57,440 --> 42:58:01,800
Apoi puteți valida rezultatele,

57832
42:58:03,920 --> 42:58:08,664
nu? Și prezentați rezultatele,

57833
42:58:09,280 --> 42:58:14,000
nu? Deci aceasta este ca o viață completă

57834
42:58:11,024 --> 42:58:15,840
ciclu al unui cercetător de date, nu? Deci

57835
42:58:14,000 --> 42:58:18,160
înainte de a merge mai departe, lasă-mă să-ți dau

57836
42:58:15,840 --> 42:58:20,560
ce combinații trebuie să aveți

57837
42:58:18,160 --> 42:58:23,200
deveni un om de știință a datelor. Primul

57838
42:58:20,560 --> 42:58:26,664
este

57839
42:58:23,200 --> 42:58:26,664
cunoștințe de domeniu,

57840
42:58:29,360 --> 42:58:33,920
nu? Deci, ce este cunoașterea domeniului?

57841
42:58:32,480 --> 42:58:35,664
În primul rând, ți-am spus chiar acolo

57842
42:58:33,920 --> 42:58:38,480
va fi o problema, nu? vei fi

57843
42:58:35,664 --> 42:58:39,920
rezolvarea unei probleme în orice proiect de date

57844
42:58:38,480 --> 42:58:41,840
stiinta. Vei încerca să rezolvi un

57845
42:58:39,920 --> 42:58:44,384
problema corectă și problema va fi

57846
42:58:41,840 --> 42:58:45,744
aparţinând unui anumit domeniu chiar dacă

57847
42:58:44,384 --> 42:58:47,440
chiar lucrezi pentru tine

57848
42:58:45,744 --> 42:58:49,104
dacă ești antreprenor și atunci

57849
42:58:47,440 --> 42:58:51,520
vei rezolva o problemă. Deci asta

57850
42:58:49,104 --> 42:58:55,160
partea de cunoștințe de domeniu include lucruri

57851
42:58:51,520 --> 42:58:55,160
precum înțelegerea

57852
42:58:55,600 --> 42:59:00,384
este o diagramă foarte importantă

57853
42:58:58,800 --> 42:59:03,744
înţelegere

57854
42:59:00,384 --> 42:59:05,104
cerința clientului

57855
42:59:03,744 --> 42:59:07,840
intelegerea corecta a clientului

57856
42:59:05,104 --> 42:59:11,560
dreptul de cerință

57857
42:59:07,840 --> 42:59:11,560
criterii importante

57858
42:59:12,384 --> 42:59:18,200
drept important

57859
42:59:14,560 --> 42:59:18,200
cunoasterea criteriilor

57860
42:59:18,240 --> 42:59:23,744
nu? De exemplu, pentru a da un exemplu,

57861
42:59:21,200 --> 42:59:25,440
să presupunem că am creat o mașină

57862
42:59:23,744 --> 42:59:27,664
model de învățare. Bine? Înțelegerea

57863
42:59:25,440 --> 42:59:31,920
date, am creat o învățare automată

57864
42:59:27,664 --> 42:59:34,320
model a cărui precizie este de 90%. Corect? este

57865
42:59:31,920 --> 42:59:37,280
90% o precizie bună?

57866
42:59:34,320 --> 42:59:39,360
Da, o precizie destul de decentă. Da.

57867
42:59:37,280 --> 42:59:40,960
Să presupunem că trebuie să preziceți vânzările,

57868
42:59:39,360 --> 42:59:42,640
nu? Vindeți ceva.

57869
42:59:40,960 --> 42:59:44,560
Să presupunem că vinzi haine și tu

57870
42:59:42,640 --> 42:59:46,800
doresc să prezică care vor fi vânzările

57871
42:59:44,560 --> 42:59:48,560
pentru saptamana urmatoare. Când folosești asta

57872
42:59:46,800 --> 42:59:50,640
model, indiferent de modelul de ieșire

57873
42:59:48,560 --> 42:59:54,240
tu, care va fi exactitatea

57874
42:59:50,640 --> 42:59:57,024
ieșirea dvs. folosind acest model?

57875
42:59:54,240 --> 42:59:58,960
Câtă precizie?

57876
42:59:57,024 --> 43:00:02,640
90%.

57877
42:59:58,960 --> 43:00:05,600
Dar întrebarea mea este că modelul este de 90%. Dar al meu

57878
43:00:02,640 --> 43:00:08,080
întrebarea pentru tine este că dacă 90% precizie

57879
43:00:05,600 --> 43:00:10,080
este pe datele de vânzări, o persoană ca mine o va face

57880
43:00:08,080 --> 43:00:13,440
fii foarte foarte fericit. Bine? Foarte foarte

57881
43:00:10,080 --> 43:00:16,880
fericit. Probabil că voi dansa, nu?

57882
43:00:13,440 --> 43:00:20,800
Dar dacă încerci să aplici același model

57883
43:00:16,880 --> 43:00:23,664
drept pentru un caz de diagnostic medical, va

57884
43:00:20,800 --> 43:00:26,720
te interesează să te operezi

57885
43:00:23,664 --> 43:00:29,440
un astfel de spital sau o instituţie unde

57886
43:00:26,720 --> 43:00:31,840
precizia ajunge la 90%. Domeniul

57887
43:00:29,440 --> 43:00:33,920
cunoștințe, nu? Cunoașterea domeniului. Noi

57888
43:00:31,840 --> 43:00:36,240
trebuie să înțelegeți care sunt exacte

57889
43:00:33,920 --> 43:00:38,720
cerințe. Trebuie să înțelegem ce

57890
43:00:36,240 --> 43:00:41,280
sunt așteptările exacte,

57891
43:00:38,720 --> 43:00:43,520
nu? Și trebuie să știm cât de mult facem

57892
43:00:41,280 --> 43:00:45,280
trebuie să pivotăm, nu? Deci primul

57893
43:00:43,520 --> 43:00:47,920
lucru în știința datelor sunt acestea

57894
43:00:45,280 --> 43:00:50,160
acuratețe și totul este subiectiv

57895
43:00:47,920 --> 43:00:52,640
corect sunt subiective. Deci pentru asta

57896
43:00:50,160 --> 43:00:55,104
aveți nevoie de cunoștințe de domeniu. Domeniul

57897
43:00:52,640 --> 43:00:56,560
cunoștințe partea foarte importantă băieți foarte

57898
43:00:55,104 --> 43:01:00,160
importante aceste trei lucruri pe care le sunt

57899
43:00:56,560 --> 43:01:02,960
merg sa spun. A doua parte este oamenii

57900
43:01:00,160 --> 43:01:04,720
schimbătorul de joc chiar în a doua parte

57901
43:01:02,960 --> 43:01:07,920
este

57902
43:01:04,720 --> 43:01:10,320
informatică.

57903
43:01:07,920 --> 43:01:13,280
Acum, dacă te duc înapoi în istorie, bine

57904
43:01:10,320 --> 43:01:16,160
dacă te duc înapoi în istorie în anii '80

57905
43:01:13,280 --> 43:01:17,840
sau undeva atunci ești bine câte

57906
43:01:16,160 --> 43:01:19,360
dintre voi credeți că știința datelor este o nouă

57907
43:01:17,840 --> 43:01:20,720
concept

57908
43:01:19,360 --> 43:01:23,840
câți dintre voi cred că știința datelor

57909
43:01:20,720 --> 43:01:26,800
este un concept nou. Sper că nu este

57910
43:01:23,840 --> 43:01:30,240
un concept nou pe care toată lumea știe că da

57911
43:01:26,800 --> 43:01:32,000
se întâmplă de secole la fel ca

57912
43:01:30,240 --> 43:01:34,720
voi veți fi șocați dacă sunteți deja

57913
43:01:32,000 --> 43:01:36,800
nu știu că AI a fost inventată în anul respectiv

57914
43:01:34,720 --> 43:01:40,000
1956

57915
43:01:36,800 --> 43:01:43,520
1956 6 la Universitatea Dharma. AI

57916
43:01:40,000 --> 43:01:48,160
a fost inventat de Paul McCarthy, nu? Şi

57917
43:01:43,520 --> 43:01:50,800
am văzut boom-ul AI în anul 2010,

57918
43:01:48,160 --> 43:01:53,280
nu? O călătorie atât de lungă. Același caz

57919
43:01:50,800 --> 43:01:56,720
cu știința datelor pentru că oamenii s-au întors

57920
43:01:53,280 --> 43:01:59,520
ziua în care știința datelor a fost numită date

57921
43:01:56,720 --> 43:02:02,720
minerit. Toată lumea a auzit despre aceste date

57922
43:01:59,520 --> 43:02:05,104
minerit, baze de date de cunoștințe. Da, noi

57923
43:02:02,720 --> 43:02:07,104
Avem nevoie pentru a extrage datele. Acum, ce

57924
43:02:05,104 --> 43:02:09,440
au fost problemele? Care au fost sughiturile

57925
43:02:07,104 --> 43:02:14,480
de data mining? Sughițul pentru date

57926
43:02:09,440 --> 43:02:18,560
minerit era că făceam totul

57927
43:02:14,480 --> 43:02:21,360
totul manual

57928
43:02:18,560 --> 43:02:23,840
chiar acum dacă îți dau 100 de puncte pot

57929
43:02:21,360 --> 43:02:26,480
tu calculezi media

57930
43:02:23,840 --> 43:02:30,160
sau să zicem dacă îți dau două puncte

57931
43:02:26,480 --> 43:02:32,000
înmulțiți 2 * 3 cât timp veți

57932
43:02:30,160 --> 43:02:34,160
ia?

57933
43:02:32,000 --> 43:02:37,840
2 secunde.

57934
43:02:34,160 --> 43:02:43,600
Da. Cât timp va dura un computer?

57935
43:02:37,840 --> 43:02:45,280
2 secunde. Dacă vă dau să înmulțiți 2

57936
43:02:43,600 --> 43:02:47,920
489

57937
43:02:45,280 --> 43:02:50,080
înmulțit cu 200, cât timp va fi

57938
43:02:47,920 --> 43:02:52,560
ai să calculezi asta? Spune 5

57939
43:02:50,080 --> 43:02:56,000
secunde. Cât timp va avea computerul

57940
43:02:52,560 --> 43:03:02,000
ia? 2 secunde. Acum, dacă îți dau

57941
43:02:56,000 --> 43:03:03,520
înmulțiți 2 48 9 în 15 1 95 4386

57942
43:03:02,000 --> 43:03:07,280
cat timp iti va lua sa calculezi

57943
43:03:03,520 --> 43:03:09,520
asta manual? Poate spune 1 minut

57944
43:03:07,280 --> 43:03:12,240
80 de secunde 1 minut. Cât timp a

57945
43:03:09,520 --> 43:03:15,104
computer va lua? Inca 2 secunde

57946
43:03:12,240 --> 43:03:17,840
nu? încă 2 secunde corect și dacă eu

57947
43:03:15,104 --> 43:03:21,200
iti dau sa calculezi asta peste 200

57948
43:03:17,840 --> 43:03:23,664
de ori vei lua 200 de minute corect

57949
43:03:21,200 --> 43:03:27,200
folosind computerul paralel va

57950
43:03:23,664 --> 43:03:28,720
mai durează aproximativ 3 până la 5 secunde, așa că

57951
43:03:27,200 --> 43:03:31,520
înțelegi puterea lui

57952
43:03:28,720 --> 43:03:33,520
computer înțelegeți acest concept

57953
43:03:31,520 --> 43:03:36,320
in aceasta relatie ce se intampla

57954
43:03:33,520 --> 43:03:39,920
pe atunci ce făcea informatica

57955
43:03:36,320 --> 43:03:42,880
oamenii a revoluționat modul

57956
43:03:39,920 --> 43:03:46,000
data mining se întâmpla și chestia aia

57957
43:03:42,880 --> 43:03:48,880
acum se numește așa din nou acel lucru

57958
43:03:46,000 --> 43:03:50,720
acum se numește știința datelor în care

57959
43:03:48,880 --> 43:03:52,800
informatica este una dintre cele mai multe

57960
43:03:50,720 --> 43:03:55,664
contribuitori importanți. Deci asta este doar

57961
43:03:52,800 --> 43:03:59,360
un motiv. Acum manual dreapta manual

57962
43:03:55,664 --> 43:04:02,000
dacă vă spun 1 milion de rânduri de date

57963
43:03:59,360 --> 43:04:04,320
corect 1 milion de rânduri de date bine așa

57964
43:04:02,000 --> 43:04:07,664
câte pagini vei pagini vei

57965
43:04:04,320 --> 43:04:09,920
necesitatea de a stoca aceste date presupune că dvs

57966
43:04:07,664 --> 43:04:11,440
caietul este asa

57967
43:04:09,920 --> 43:04:13,920
corect aceste cutii și iată-te

57968
43:04:11,440 --> 43:04:17,104
stochează datele 1 milion, așa că poate tu

57969
43:04:13,920 --> 43:04:19,104
pot cumpăra un număr de notebook-uri, dar acum o fac

57970
43:04:17,104 --> 43:04:21,840
crezi că este la fel de ușor de depozitat

57971
43:04:19,104 --> 43:04:25,360
ceva în computer pentru că înapoi în

57972
43:04:21,840 --> 43:04:30,080
în ziua în care oamenii am avut probleme de memorie,

57973
43:04:25,360 --> 43:04:32,000
nu-i asa? Constrângeri de memorie.

57974
43:04:30,080 --> 43:04:35,920
Deci există ceva numit al lui Murray

57975
43:04:32,000 --> 43:04:38,720
legea, nu? Care spune ca

57976
43:04:35,920 --> 43:04:41,024
progresul în microprocesoare va

57977
43:04:38,720 --> 43:04:42,640
creșterea prețului microprocesorului

57978
43:04:41,024 --> 43:04:46,640
va scadea, nu? Deci asta este

57979
43:04:42,640 --> 43:04:50,384
se întâmplă chiar acum. În anii 1980, dacă eu

57980
43:04:46,640 --> 43:04:51,840
vă arăt băieți corect, nu? Da. 2.5

57981
43:04:50,384 --> 43:04:54,720
kg. Exact. Corect. Avea dimensiunea a

57982
43:04:51,840 --> 43:04:57,360
hard disk-ul frigiderului, dar acum se potrivește în tine

57983
43:04:54,720 --> 43:04:59,280
palma dreapta. Deci acest lucru a fost activat

57984
43:04:57,360 --> 43:05:02,720
tehnicile de stocare corectă prelucrarea

57985
43:04:59,280 --> 43:05:04,720
tehnici drept infrastructura

57986
43:05:02,720 --> 43:05:06,000
lucruri precum big data ce fel de date

57987
43:05:04,720 --> 43:05:08,384
crezi că vom avea de-a face

57988
43:05:06,000 --> 43:05:12,384
oameni din știința datelor pe care îi cunoașteți cu toții

57989
43:05:08,384 --> 43:05:14,960
termen foarte faimos termen tipul de date

57990
43:05:12,384 --> 43:05:17,920
Big data corect toată lumea știe despre big

57991
43:05:14,960 --> 43:05:23,280
date ce sunt date mari da o date care

57992
43:05:17,920 --> 43:05:26,640
este rapid corect, are veracitatea vitezei

57993
43:05:23,280 --> 43:05:28,640
varietate drept deci Acest tip de date are nevoie

57994
43:05:26,640 --> 43:05:31,440
pentru a fi depozitat. Acest tip de date trebuie

57995
43:05:28,640 --> 43:05:33,664
fi prelucrate. Deci care lucru a adus totul

57996
43:05:31,440 --> 43:05:36,160
aceste lucruri în știința datelor? A fost

57997
43:05:33,664 --> 43:05:38,880
dat nouă de informatică, nu?

57998
43:05:36,160 --> 43:05:43,560
Deci, inclusiv oamenii de informatică

57999
43:05:38,880 --> 43:05:43,560
lucruri precum gestionarea bazelor de date,

58000
43:05:44,240 --> 43:05:51,080
corect? Validarea datelor, nu? Date

58001
43:05:48,080 --> 43:05:51,080
infrastructura,

58002
43:05:51,664 --> 43:05:57,920
nu? Infrastructura de date,

58003
43:05:53,840 --> 43:06:00,720
nu? Apoi am avut limbi, computer

58004
43:05:57,920 --> 43:06:04,960
limbi

58005
43:06:00,720 --> 43:06:07,280
care este Python chiar acum pentru noi. Corect?

58006
43:06:04,960 --> 43:06:09,280
Din nou te gândești când faci asta

58007
43:06:07,280 --> 43:06:11,920
lucru manual corect să presupunem că faci asta

58008
43:06:09,280 --> 43:06:14,160
lucru manual cât de ușor crezi

58009
43:06:11,920 --> 43:06:16,880
va deveni folosind ceva de genul Python

58010
43:06:14,160 --> 43:06:19,664
sau orice alt limbaj de calculator de creat

58011
43:06:16,880 --> 43:06:22,000
modele complexe. Cât de ușor va fi

58012
43:06:19,664 --> 43:06:24,800
faceți asta pentru a crea complexitatea în

58013
43:06:22,000 --> 43:06:28,480
modele chiar de unde puteți captura

58014
43:06:24,800 --> 43:06:30,000
natura neliniară nu-i așa că oamenii nu sunt

58015
43:06:28,480 --> 43:06:33,104
ea

58016
43:06:30,000 --> 43:06:34,640
de exemplu hai sa iti spun

58017
43:06:33,104 --> 43:06:40,480
aceasta

58018
43:06:34,640 --> 43:06:43,744
2 4 6 8 10 liniuță care crezi că este

58019
43:06:40,480 --> 43:06:47,440
următorul număr băieți 12 dacă vă spun

58020
43:06:43,744 --> 43:06:48,320
definește-mi asta în bine să plec

58021
43:06:47,440 --> 43:06:49,600
pleca

58022
43:06:48,320 --> 43:06:53,000
Ce crezi că va fi

58023
43:06:49,600 --> 43:06:53,000
următorul număr aici?

58024
43:06:57,280 --> 43:07:01,800
Care este următorul număr? 11.

58025
43:07:04,640 --> 43:07:07,960
Următorul număr

58026
43:07:08,320 --> 43:07:12,080
25.

58027
43:07:09,920 --> 43:07:14,160
Perfect. Acum băieți, dacă vă cer să scrieți

58028
43:07:12,080 --> 43:07:15,840
aceste numere, corect, așa cum tu

58029
43:07:14,160 --> 43:07:19,200
le-a prezis, îmi puteți da un

58030
43:07:15,840 --> 43:07:21,104
funcția f ofx este egală cu ceea ce este f

58031
43:07:19,200 --> 43:07:24,960
de x aici?

58032
43:07:21,104 --> 43:07:27,520
Este de 2x, nu? Este de 2x. f ofx este egal

58033
43:07:24,960 --> 43:07:29,840
la 2x. Dacă vă spun să creați un

58034
43:07:27,520 --> 43:07:32,080
funcția, va fi f din x este egal cu

58035
43:07:29,840 --> 43:07:34,560
2x. Care va fi funcția aici,

58036
43:07:32,080 --> 43:07:36,480
baieti?

58037
43:07:34,560 --> 43:07:39,664
f ofx

58038
43:07:36,480 --> 43:07:46,320
va fi egal cu

58039
43:07:39,664 --> 43:07:48,560
x 1. Da. x 1. Da. Și aici f ofx

58040
43:07:46,320 --> 43:07:52,640
va fi egal cu

58041
43:07:48,560 --> 43:07:55,960
x². Da. Acum ultimul exemplu, nu?

58042
43:07:52,640 --> 43:07:55,960
Ultimul exemplu.

58043
43:08:00,320 --> 43:08:04,640
Care este următorul număr de aici? Eu nu

58044
43:08:02,240 --> 43:08:07,440
vrei numarul. Vreau functia. eu

58045
43:08:04,640 --> 43:08:11,200
vreau asta ca sa pot generaliza.

58046
43:08:07,440 --> 43:08:13,280
Nu-i aşa? Cum ai ajuns la această cifră?

58047
43:08:11,200 --> 43:08:17,024
Câți dintre voi cred că nu se poate

58048
43:08:13,280 --> 43:08:20,560
pentru a determina asta? Câte

58049
43:08:17,024 --> 43:08:23,104
din tine

58050
43:08:20,560 --> 43:08:26,080
gandeste-te

58051
43:08:23,104 --> 43:08:28,720
nu este

58052
43:08:26,080 --> 43:08:33,240
posibil

58053
43:08:28,720 --> 43:08:33,240
pentru a determina asta?

58054
43:08:33,520 --> 43:08:39,600
Da. Câți dintre voi cred că dacă eu

58055
43:08:36,384 --> 43:08:41,920
doar schimbă această întrebare și te întreb

58056
43:08:39,600 --> 43:08:44,320
cati dintre voi credeti ca nu se poate

58057
43:08:41,920 --> 43:08:47,320
pentru a determina acest lucru

58058
43:08:44,320 --> 43:08:47,320
manual?

58059
43:08:47,360 --> 43:08:52,160
Același răspuns. Dar acum spun câte dintre

58060
43:08:50,240 --> 43:08:54,640
crezi că nu se poate

58061
43:08:52,160 --> 43:08:56,800
determina asta

58062
43:08:54,640 --> 43:08:59,440
cu calculatoare?

58063
43:08:56,800 --> 43:09:01,600
Răspunsul tău va rămâne în continuare nu? tu

58064
43:08:59,440 --> 43:09:03,600
cred că nu pot aproxima această funcție

58065
43:09:01,600 --> 43:09:07,024
folosind computere?

58066
43:09:03,600 --> 43:09:10,320
Avem ceva numit la fel de adânc

58067
43:09:07,024 --> 43:09:12,800
rețele neuronale

58068
43:09:10,320 --> 43:09:14,880
și sunt numite universale

58069
43:09:12,800 --> 43:09:17,280
aproximatori de funcții.

58070
43:09:14,880 --> 43:09:18,880
Corect? Deci asta este oamenii cu probleme.

58071
43:09:17,280 --> 43:09:20,800
Aceasta este problema. Corect? voi arăta

58072
43:09:18,880 --> 43:09:22,480
asta pentru tine când va veni momentul. Corect?

58073
43:09:20,800 --> 43:09:24,240
Îmi voi aminti acest exemplu și o voi face

58074
43:09:22,480 --> 43:09:26,480
arată-ți asta. Dar acum ce sunt

58075
43:09:24,240 --> 43:09:30,384
încercarea de a vă spune sunt lucrurile care

58076
43:09:26,480 --> 43:09:33,200
părea imposibil manual a fost rezolvată de

58077
43:09:30,384 --> 43:09:36,080
ce? S-a rezolvat prin calculatoare. The

58078
43:09:33,200 --> 43:09:40,000
distribuția acestuia este așa. Can

58079
43:09:36,080 --> 43:09:43,024
iti dai seama singur? Nu. Nu?

58080
43:09:40,000 --> 43:09:45,024
Nu putem. Nu-i aşa? Nu putem face asta.

58081
43:09:43,024 --> 43:09:48,000
Deci acest tip de aproximare va fi

58082
43:09:45,024 --> 43:09:50,880
dat de ce? Va fi dat doar de

58083
43:09:48,000 --> 43:09:53,664
masini. Corect? Și asta înseamnă oamenii

58084
43:09:50,880 --> 43:09:56,384
știința datelor este totul despre. Corect? Este

58085
43:09:53,664 --> 43:09:59,280
ce a făcut informatica în interiorul datelor

58086
43:09:56,384 --> 43:10:01,200
stiinta. Corect? Sper că acest lucru este clar.

58087
43:09:59,280 --> 43:10:03,520
Presupun că mulți dintre voi veți merge

58088
43:10:01,200 --> 43:10:05,744
pentru interviuri și tot ce urmează

58089
43:10:03,520 --> 43:10:07,104
aceste cursuri. Corect? Deci acesta va fi un

58090
43:10:05,744 --> 43:10:09,920
lucru foarte foarte important pentru tine

58091
43:10:07,104 --> 43:10:11,840
stiu. Corect? Adesea este întrebat de ce date

58092
43:10:09,920 --> 43:10:14,560
știința are informatica în

58093
43:10:11,840 --> 43:10:16,240
ea. Corect? Motivul este acesta. Bine? Deci

58094
43:10:14,560 --> 43:10:18,640
acesta este rolul informaticii

58095
43:10:16,240 --> 43:10:21,104
în interiorul științei datelor. Acum oamenii

58096
43:10:18,640 --> 43:10:23,440
al treilea lucru al treilea cerc care este

58097
43:10:21,104 --> 43:10:26,080
una dintre cele mai multe

58098
43:10:23,440 --> 43:10:28,800
piese este

58099
43:10:26,080 --> 43:10:33,520
matematica

58100
43:10:28,800 --> 43:10:37,600
și statistici corecte statistici matematice

58101
43:10:33,520 --> 43:10:42,720
care a fost optimizarea

58102
43:10:37,600 --> 43:10:45,600
optimizarea corectă a modelelor dvs. corecte

58103
43:10:42,720 --> 43:10:49,744
proiectare

58104
43:10:45,600 --> 43:10:52,000
de model. Corect? Acum băieți, dacă vă uitați

58105
43:10:49,744 --> 43:10:54,320
atent, dacă te uiți cu atenție, în

58106
43:10:52,000 --> 43:10:56,720
pentru a aproxima acest lucru, ceea ce tu ce

58107
43:10:54,320 --> 43:11:00,080
te vei juca cu? vei fi

58108
43:10:56,720 --> 43:11:02,000
jucându-se cu multe date. vei fi

58109
43:11:00,080 --> 43:11:04,800
jucându-se cu multă matematică să

58110
43:11:02,000 --> 43:11:07,520
concepte matematice şi statistice

58111
43:11:04,800 --> 43:11:09,520
concepte, nu-i așa? Cum ai făcut

58112
43:11:07,520 --> 43:11:12,000
tu numesti asta? Asta e matematică, nu? Aceasta

58113
43:11:09,520 --> 43:11:15,280
este statistica si matematica. găsirea

58114
43:11:12,000 --> 43:11:18,640
medie, mediană, mod, abateri standard,

58115
43:11:15,280 --> 43:11:20,880
probabilitatea, statistica, toate acestea vor

58116
43:11:18,640 --> 43:11:23,200
duce la acest tip de rezultat, nu-i așa?

58117
43:11:20,880 --> 43:11:25,744
Deci, aceasta devine a treia roată a acesteia

58118
43:11:23,200 --> 43:11:30,320
special uh din acest anume

58119
43:11:25,744 --> 43:11:33,744
diagramă. Și acest punct de intersecție,

58120
43:11:30,320 --> 43:11:39,744
nu? Punctul dulce de intersecție

58121
43:11:33,744 --> 43:11:44,160
este practic știința datelor.

58122
43:11:39,744 --> 43:11:47,200
Da. este în special știința datelor.

58123
43:11:44,160 --> 43:11:49,840
Corect? Deci acum oamenii sunt bine

58124
43:11:47,200 --> 43:11:53,600
acest punct

58125
43:11:49,840 --> 43:11:56,960
reprezintă practic date

58126
43:11:53,600 --> 43:11:59,280
dreptul de inginerie dreptul de inginerie a datelor

58127
43:11:56,960 --> 43:12:02,720
ingineria datelor face parte din oameni

58128
43:11:59,280 --> 43:12:05,840
știința datelor care ne permite să captăm

58129
43:12:02,720 --> 43:12:08,240
datele corecte exact cum vor fi datele

58130
43:12:05,840 --> 43:12:10,960
flux cum vor fi stocate datele cum

58131
43:12:08,240 --> 43:12:13,280
datele vor fi curățate corect, toate acestea sunt

58132
43:12:10,960 --> 43:12:15,600
făcut de acasă se face prin date

58133
43:12:13,280 --> 43:12:16,960
inginerie Doar pentru că am dreptate

58134
43:12:15,600 --> 43:12:18,880
acolo vei merge chiar la interviu

58135
43:12:16,960 --> 43:12:23,200
după asta și încearcă să te aduci singur

58136
43:12:18,880 --> 43:12:25,280
locuri de muncă în acest domeniu știința datelor AI ML

58137
43:12:23,200 --> 43:12:27,280
daca intelegerea mea este corecta este asta

58138
43:12:25,280 --> 43:12:29,840
scopul da, așa că acum băieți vor exista

58139
43:12:27,280 --> 43:12:31,744
trei tipuri de companii

58140
43:12:29,840 --> 43:12:35,744
sau să spunem pentru a simplifica să spunem două

58141
43:12:31,744 --> 43:12:39,104
tipurile unul este mic, iar celălalt este

58142
43:12:35,744 --> 43:12:40,640
mare drept deci intr-o organizatie mica daca

58143
43:12:39,104 --> 43:12:42,320
devii o parte a mic sau

58144
43:12:40,640 --> 43:12:45,744
organizație și tu ești datele

58145
43:12:42,320 --> 43:12:48,320
om de știință acolo Poți fi implicat

58146
43:12:45,744 --> 43:12:51,360
toate aceste lucruri, nu? Toate acestea

58147
43:12:48,320 --> 43:12:53,744
lucruri posibile, nu? Șefii tăi și

58148
43:12:51,360 --> 43:12:56,384
managementul tău se va aștepta să faci asta

58149
43:12:53,744 --> 43:12:58,080
construiți toate aceste fluxuri, nu? Să știi

58150
43:12:56,384 --> 43:12:59,664
informatică, ar trebui să știi matematică

58151
43:12:58,080 --> 43:13:01,280
și statistici și ar trebui să aveți domeniul

58152
43:12:59,664 --> 43:13:04,080
cunoștințe și vi se va cere să faceți

58153
43:13:01,280 --> 43:13:06,880
toate acestea. Dar dacă ai de gând

58154
43:13:04,080 --> 43:13:09,744
deveni parte a unei mari organizații,

58155
43:13:06,880 --> 43:13:12,080
de obicei toate aceste roluri sunt fragmentate.

58156
43:13:09,744 --> 43:13:13,600
Toate aceste roluri sunt fragmentate,

58157
43:13:12,080 --> 43:13:15,744
nu? Există date separate

58158
43:13:13,600 --> 43:13:17,744
echipa de infrastructură. Există un separat

58159
43:13:15,744 --> 43:13:19,920
echipa de guvernare a datelor. Acum băieți, când voi

58160
43:13:17,744 --> 43:13:21,840
Continuați să colectați datele, puteți

58161
43:13:19,920 --> 43:13:24,384
colectează orice date sensibile despre asta

58162
43:13:21,840 --> 43:13:26,640
posibil din punct de vedere etic nu este corect? Şi

58163
43:13:24,384 --> 43:13:28,640
nici din punct de vedere legal nu este corect. Întrebarea mea

58164
43:13:26,640 --> 43:13:31,440
pentru tine este cine va avea grijă de asta

58165
43:13:28,640 --> 43:13:33,600
conformare? A cărui responsabilitate într-adevăr

58166
43:13:31,440 --> 43:13:36,384
este de a avea grijă de această conformitate?

58167
43:13:33,600 --> 43:13:38,080
Savantul de date. Deci despre asta este vorba

58168
43:13:36,384 --> 43:13:40,000
fragmentare. Dacă faci parte dintr-un mare

58169
43:13:38,080 --> 43:13:42,320
organizație, acest lucru va fi luat

58170
43:13:40,000 --> 43:13:44,080
de altcineva, nu? Dar dacă ești un

58171
43:13:42,320 --> 43:13:46,080
parte dintr-o organizație mică, veți face

58172
43:13:44,080 --> 43:13:48,640
să știi că vei fi de așteptat să faci asta

58173
43:13:46,080 --> 43:13:50,560
totul de unul singur. În dacă dacă faci parte

58174
43:13:48,640 --> 43:13:53,360
a unei organizații mari atunci crezi

58175
43:13:50,560 --> 43:13:56,240
trebuie să ai cunoștințe despre acest domeniu?

58176
43:13:53,360 --> 43:13:57,920
Răspunsul este nu. De ce? Pentru că acolo

58177
43:13:56,240 --> 43:14:00,000
va fi un set separat de oameni care sunt

58178
43:13:57,920 --> 43:14:01,840
numit ca ce? Care sunt numite ca

58179
43:14:00,000 --> 43:14:05,200
analist de afaceri. Ai auzit despre

58180
43:14:01,840 --> 43:14:07,360
această poziție oameni? Analist de afaceri.

58181
43:14:05,200 --> 43:14:10,000
Care este rolul unui analist de afaceri? Este

58182
43:14:07,360 --> 43:14:12,960
practic un traducător tehnic, nu?

58183
43:14:10,000 --> 43:14:14,880
cine stie tehnic, cine stie domeniul

58184
43:14:12,960 --> 43:14:16,960
iar persoana respectivă merge și vorbește cu

58185
43:14:14,880 --> 43:14:18,960
client, vorbește cu clientul într-un profan

58186
43:14:16,960 --> 43:14:20,560
limbaj, convertiți-l în tehnic

58187
43:14:18,960 --> 43:14:22,640
cerință cuplată cu domeniul

58188
43:14:20,560 --> 43:14:24,880
cunoștințe și vă dau documentul.

58189
43:14:22,640 --> 43:14:27,520
Aceasta este practic o inginerie medicală

58190
43:14:24,880 --> 43:14:29,200
problema. Deci avem nevoie de asta asta asta asta

58191
43:14:27,520 --> 43:14:31,600
și trebuie să îndeplinești acest lucru

58192
43:14:29,200 --> 43:14:33,440
acest criteriu. Dar din nou, dacă faci parte

58193
43:14:31,600 --> 43:14:35,600
a unei organizații mici, care trebuie

58194
43:14:33,440 --> 43:14:36,880
ai grija de asta? Cine trebuie să facă

58195
43:14:35,600 --> 43:14:40,240
sigur că știi totul despre a

58196
43:14:36,880 --> 43:14:45,200
domeniu? Tu însuți, nu? tu

58197
43:14:40,240 --> 43:14:49,280
pe tine, nu? Apoi oamenii, această zonă

58198
43:14:45,200 --> 43:14:52,720
de obicei reprezintă pe cine? Această zonă

58199
43:14:49,280 --> 43:14:55,360
reprezintă cercetarea

58200
43:14:52,720 --> 43:14:56,960
și analiză.

58201
43:14:55,360 --> 43:14:58,880
De ce?

58202
43:14:56,960 --> 43:15:00,880
Pentru că ei avem oameni care au

58203
43:14:58,880 --> 43:15:02,880
cunoștințe de domeniu și avem oameni care

58204
43:15:00,880 --> 43:15:05,744
sunt cunoștințe de matematică, statistici. Ai tu

58205
43:15:02,880 --> 43:15:08,800
a auzit despre o poziție numită actury

58206
43:15:05,744 --> 43:15:11,024
în lume? Știința acturială. Acturi

58207
43:15:08,800 --> 43:15:14,000
sunt oameni care practic au de-a face

58208
43:15:11,024 --> 43:15:16,000
cu uh domenii care sunt foarte foarte

58209
43:15:14,000 --> 43:15:18,640
foarte mult intrinseci de date. Corect? Pentru

58210
43:15:16,000 --> 43:15:20,720
exemplu, domeniul financiar, nu? Finanțe

58211
43:15:18,640 --> 43:15:23,440
este totul despre numere. Deci iată-ne

58212
43:15:20,720 --> 43:15:25,280
știință actală și avem matematică, statistici,

58213
43:15:23,440 --> 43:15:26,880
optimizare, dezvoltare de modele, toate

58214
43:15:25,280 --> 43:15:28,480
acele lucruri care se întâmplă acolo. Suntem

58215
43:15:26,880 --> 43:15:30,800
de asemenea, în acest moment, oamenii

58216
43:15:28,480 --> 43:15:34,000
aparţinând căreia secţiune cercetare şi

58217
43:15:30,800 --> 43:15:35,920
analiza datelor corect și apoi oamenii

58218
43:15:34,000 --> 43:15:39,104
acolo este a treia intersecție la dreapta

58219
43:15:35,920 --> 43:15:42,160
există o a treia a treia intersecție

58220
43:15:39,104 --> 43:15:47,160
care este această parte și acest popor

58221
43:15:42,160 --> 43:15:47,160
numit învățare automată

58222
43:15:48,800 --> 43:15:53,440
învățarea corectă a mașinii de ce mașină

58223
43:15:50,560 --> 43:15:56,720
învățând dacă poți combina puterea

58224
43:15:53,440 --> 43:15:59,200
statisticile de matematică corect și tu combinați

58225
43:15:56,720 --> 43:16:01,104
puterea informaticii, veți găsi

58226
43:15:59,200 --> 43:16:03,024
să fii într-o poziție în care tu

58227
43:16:01,104 --> 43:16:05,440
te poți numi un machine learning

58228
43:16:03,024 --> 43:16:06,960
inginer. Corect? Cum funcționează o mașină

58229
43:16:05,440 --> 43:16:09,360
inginer de învățare devine o dată

58230
43:16:06,960 --> 43:16:12,720
om de stiinta? Când se cuplează cu

58231
43:16:09,360 --> 43:16:14,960
expertiza domeniului, nu? Deci in asta

58232
43:16:12,720 --> 43:16:16,720
curs oameni în acest curs vom

58233
43:16:14,960 --> 43:16:19,440
să te învețe informatica. Vom face

58234
43:16:16,720 --> 43:16:21,664
să te înveți puțin despre statisticile de matematică.

58235
43:16:19,440 --> 43:16:24,160
Dar ceea ce nu te putem învăța este domeniul

58236
43:16:21,664 --> 43:16:26,080
cunoștințe. Da.

58237
43:16:24,160 --> 43:16:28,000
și făcând baza a ceea ce suntem

58238
43:16:26,080 --> 43:16:29,744
a face. Foarte foarte important să

58239
43:16:28,000 --> 43:16:33,520
înţelege. Corect? Daca intelegi

58240
43:16:29,744 --> 43:16:36,320
atunci jumătate din bătălie este câștigată. Corect?

58241
43:16:33,520 --> 43:16:38,320
Deci acum să răspund la întrebarea care a fost

58242
43:16:36,320 --> 43:16:40,240
postat mai devreme, răspunsul la întrebare

58243
43:16:38,320 --> 43:16:41,920
care a fost postat mai devreme. Există

58244
43:16:40,240 --> 43:16:43,920
lucruri diferite în lumea datelor

58245
43:16:41,920 --> 43:16:46,240
stiinta. Corect? Deci poți alege și

58246
43:16:43,920 --> 43:16:48,560
alege orice sau poți face totul

58247
43:16:46,240 --> 43:16:50,480
de unul singur. Dacă sunteți ingineri

58248
43:16:48,560 --> 43:16:52,640
atunci cred că poți fi la dulce

58249
43:16:50,480 --> 43:16:54,640
loc înainte în viață dacă alegi

58250
43:16:52,640 --> 43:16:56,160
un domeniu pentru tine. De exemplu, tu

58251
43:16:54,640 --> 43:16:57,920
alege să faci parte din automobile

58252
43:16:56,160 --> 43:16:59,744
industrie, tu alegi să faci parte

58253
43:16:57,920 --> 43:17:03,024
industria medicală, alegi să fii un

58254
43:16:59,744 --> 43:17:06,160
parte din industria de vânzare cu amănuntul, de exemplu, alegeți

58255
43:17:03,024 --> 43:17:08,384
a face parte din industria aeronautică,

58256
43:17:06,160 --> 43:17:10,960
nu? Tu alegi să faci parte din

58257
43:17:08,384 --> 43:17:12,800
industria financiară, nu? Deci orice ai tu

58258
43:17:10,960 --> 43:17:14,560
va alege, acest lucru va primi

58259
43:17:12,800 --> 43:17:16,560
dezvoltat de-a lungul timpului, nu? Acesta este

58260
43:17:14,560 --> 43:17:19,104
cel mai dificil dintre acestea trei. incerc

58261
43:17:16,560 --> 43:17:22,080
ca să vă dau exemplu corect domeniul meu

58262
43:17:19,104 --> 43:17:25,024
a fost industria agricolă drept agri

58263
43:17:22,080 --> 43:17:28,384
produse la care am lucrat mult

58264
43:17:25,024 --> 43:17:30,320
industria agricola drept asa din nou pentru

58265
43:17:28,384 --> 43:17:32,640
acum, în rolul meu actual, asta este ceva

58266
43:17:30,320 --> 43:17:34,800
pe care nu le am am aceasta expertiza

58267
43:17:32,640 --> 43:17:36,800
Am această expertiză, așa că va fi la fel

58268
43:17:34,800 --> 43:17:39,104
cu voi și voi veți dezvolta asta

58269
43:17:36,800 --> 43:17:42,640
cunoștințe de-a lungul timpului acum voi încerca

58270
43:17:39,104 --> 43:17:45,664
ca să vă dau un exemplu alegeri corecte

58271
43:17:42,640 --> 43:17:48,560
pentru a vă face să înțelegeți cum știința datelor

58272
43:17:45,664 --> 43:17:50,480
poate fi utilizat într-un anumit caz de utilizare.

58273
43:17:48,560 --> 43:17:53,600
Bine, poate putem extinde asta la multe

58274
43:17:50,480 --> 43:17:55,664
de alte cazuri de utilizare și exemple, nu?

58275
43:17:53,600 --> 43:17:57,440
Vorbind despre sezonul electoral, nu?

58276
43:17:55,664 --> 43:18:00,384
Vorbind despre sezonul electoral,

58277
43:17:57,440 --> 43:18:03,520
nu? Vom încerca să înțelegem

58278
43:18:00,384 --> 43:18:05,360
cum folosim știința datelor pentru că este

58279
43:18:03,520 --> 43:18:09,024
foarte larg utilizat în aceste date

58280
43:18:05,360 --> 43:18:12,160
stiinta. Corect? Acum, lasă-mă să vorbesc despre

58281
43:18:09,024 --> 43:18:13,664
prima fază. Să spunem că asta este

58282
43:18:12,160 --> 43:18:15,600
preelectorală

58283
43:18:13,664 --> 43:18:17,600
faza,

58284
43:18:15,600 --> 43:18:20,080
nu?

58285
43:18:17,600 --> 43:18:22,080
Corect. Aceasta este faza pre-electorală. În

58286
43:18:20,080 --> 43:18:24,960
faza asta pre-electorală, ce faci

58287
43:18:22,080 --> 43:18:26,800
cred că vor fi sarcinile cu care an

58288
43:18:24,960 --> 43:18:30,000
agenție precum Comisia Electorală din India

58289
43:18:26,800 --> 43:18:32,480
va face? Prima sarcină poate fi

58290
43:18:30,000 --> 43:18:34,640
că vor fi

58291
43:18:32,480 --> 43:18:37,640
face alegătorului

58292
43:18:34,640 --> 43:18:37,640
înregistrare,

58293
43:18:37,920 --> 43:18:44,440
corect? Înregistrarea alegătorilor și datele

58294
43:18:40,320 --> 43:18:44,440
management, nu-i așa?

58295
43:18:44,640 --> 43:18:49,840
Da, va începe cu asta.

58296
43:18:47,600 --> 43:18:54,200
Și care vor fi lucrurile din interiorul asta?

58297
43:18:49,840 --> 43:18:54,200
Primul lucru va fi colectarea datelor,

58298
43:18:54,720 --> 43:18:57,920
nu? Primul lucru va fi datele

58299
43:18:55,920 --> 43:19:00,640
colectare. Deci, vei colecta

58300
43:18:57,920 --> 43:19:02,960
date de la toți alegătorii înregistrați,

58301
43:19:00,640 --> 43:19:04,720
nu? Poate că poate fi demografia lor

58302
43:19:02,960 --> 43:19:07,440
informații, unde locuiesc, ce este

58303
43:19:04,720 --> 43:19:09,440
vârsta lor, care este sexul lor, nu?

58304
43:19:07,440 --> 43:19:11,744
Care este comportamentul lor anterioar la sondaje?

58305
43:19:09,440 --> 43:19:14,480
Au ieșit anterior sau nu?

58306
43:19:11,744 --> 43:19:19,360
Corect? Toate aceste detalii le putem colecta.

58307
43:19:14,480 --> 43:19:21,440
Atunci putem face și curățarea datelor?

58308
43:19:19,360 --> 43:19:23,520
Pentru că ți-am spus, nu? Că acolo

58309
43:19:21,440 --> 43:19:26,080
pot fi o mulțime de concedieri. Unii

58310
43:19:23,520 --> 43:19:28,720
numele persoanei poate apărea de două ori, nu?

58311
43:19:26,080 --> 43:19:30,080
Unii oameni pot fi o nepotrivire. Să presupunem

58312
43:19:28,720 --> 43:19:34,104
de exemplu, am învățat acest lucru în

58313
43:19:30,080 --> 43:19:34,104
Python. Raghav.

58314
43:19:36,320 --> 43:19:42,104
Raghav.

58315
43:19:39,104 --> 43:19:42,104
Raghav.

58316
43:19:42,160 --> 43:19:48,720
Radha. Corect.

58317
43:19:45,440 --> 43:19:50,480
Corect. Ce oameni sunt toți aceștia?

58318
43:19:48,720 --> 43:19:53,360
Acesta aparține aceluiași nume.

58319
43:19:50,480 --> 43:19:55,200
Corect. Eu sunt aici. Dar pentru un computer,

58320
43:19:53,360 --> 43:19:56,800
pentru un computer, câte ragavve sunt

58321
43:19:55,200 --> 43:19:59,520
acolo? Altele diferite. Toate sunt

58322
43:19:56,800 --> 43:20:01,360
diferit. Corect? Deci exemple ca acestea,

58323
43:19:59,520 --> 43:20:03,840
nu? Unii oameni ar fi putut muri. Ei

58324
43:20:01,360 --> 43:20:05,744
s-ar putea să nu mai existe. Corect? Deci

58325
43:20:03,840 --> 43:20:08,480
toată această parte va fi îngrijită unde

58326
43:20:05,744 --> 43:20:10,640
oameni în procesul de curățare a datelor.

58327
43:20:08,480 --> 43:20:13,200
Corect? Eliminarea duplicatelor, actualizare

58328
43:20:10,640 --> 43:20:15,104
noile adrese, nu? Corectarea

58329
43:20:13,200 --> 43:20:18,560
informații despre fiecare alegător, toate acestea

58330
43:20:15,104 --> 43:20:24,160
lucruri, nu? Și acum, în sfârșit, putem

58331
43:20:18,560 --> 43:20:25,920
include, de asemenea, o aromă de analiză a datelor,

58332
43:20:24,160 --> 43:20:28,960
nu? Ce va include analiza datelor

58333
43:20:25,920 --> 43:20:32,320
in asta? Putem analiza demografia

58334
43:20:28,960 --> 43:20:35,440
date pentru identificarea alegătorilor eligibili. Nu este

58335
43:20:32,320 --> 43:20:38,960
asta? Da. Oamenii de până acum nu am avut

58336
43:20:35,440 --> 43:20:40,800
am înțeles de ce nu este automatizat.

58337
43:20:38,960 --> 43:20:42,240
Cum vei ridica toate cum cum

58338
43:20:40,800 --> 43:20:44,880
vei ridica toate detaliile și

58339
43:20:42,240 --> 43:20:46,800
nuanțe? Să presupunem că completezi un formular

58340
43:20:44,880 --> 43:20:48,640
drept din greșeală ai. Să presupunem că tu

58341
43:20:46,800 --> 43:20:51,200
au 25 de ani. Să presupunem că ai

58342
43:20:48,640 --> 43:20:54,800
scris 250. Deci asta înseamnă că elimin

58343
43:20:51,200 --> 43:20:56,384
acest? elimin această intrare a ta

58344
43:20:54,800 --> 43:20:58,480
pentru că din greșeală ați scris dvs

58345
43:20:56,384 --> 43:21:01,664
vârsta de 250 de ani

58346
43:20:58,480 --> 43:21:04,800
250 de ani este posibil în lumea noastră actuală

58347
43:21:01,664 --> 43:21:07,360
niciodată corect așa că va trebui să-i spun

58348
43:21:04,800 --> 43:21:11,024
mașină asta pentru că aceasta este o greșeală

58349
43:21:07,360 --> 43:21:14,240
te rog converti-l la 25, nu-i asa?

58350
43:21:11,024 --> 43:21:16,880
numit ca imputare, deci aceasta este mai ales a

58351
43:21:14,240 --> 43:21:20,240
sarcină manuală nu manuală, dar trebuie să o faci

58352
43:21:16,880 --> 43:21:21,920
înțelegeți manual problema și apoi

58353
43:21:20,240 --> 43:21:26,720
codificați-l

58354
43:21:21,920 --> 43:21:28,800
Să presupunem că cineva și-a scris starea

58355
43:21:26,720 --> 43:21:35,664
ca

58356
43:21:28,800 --> 43:21:41,280
E D L H I dreapta si tara

58357
43:21:35,664 --> 43:21:42,384
ca I D I N corect deci care este aceasta stare

58358
43:21:41,280 --> 43:21:46,000
referindu-se la ce este aceasta tara

58359
43:21:42,384 --> 43:21:48,560
referindu-se la oameni sunt foarte deștepți

58360
43:21:46,000 --> 43:21:50,240
India corect, putem spune că aceasta este India și

58361
43:21:48,560 --> 43:21:52,640
dacă aceasta este India, atunci ce este aceasta

58362
43:21:50,240 --> 43:21:55,104
arătând spre

58363
43:21:52,640 --> 43:21:56,720
televiziune doar pentru că ai spus și este a

58364
43:21:55,104 --> 43:21:59,280
este o întrebare principală pe care vreau să o faci

58365
43:21:56,720 --> 43:22:02,960
explica asta spune-mi daca se poate

58366
43:21:59,280 --> 43:22:05,664
face asta automat, nu avem dreptul

58367
43:22:02,960 --> 43:22:08,384
pentru a folosi reguli manuale corect trebuie

58368
43:22:05,664 --> 43:22:11,520
spune pentru că noi care suntem mai inteligenți

58369
43:22:08,384 --> 43:22:14,880
oameni sau mașini oameni drept mașini

58370
43:22:11,520 --> 43:22:16,720
sunt doar mai optimizate, așa că știm

58371
43:22:14,880 --> 43:22:19,280
prin inteligenţa umană că aceasta este

58372
43:22:16,720 --> 43:22:21,520
arătând spre Delhi și acesta nu este EDLHI

58373
43:22:19,280 --> 43:22:23,360
deci aceasta este curățarea datelor. În sfârșit,

58374
43:22:21,520 --> 43:22:26,384
avem analize de date. Deci, crezi

58375
43:22:23,360 --> 43:22:30,384
oamenii pe baza acestor puncte de date, noi

58376
43:22:26,384 --> 43:22:32,160
pot înțelege că cine sunt eligibili

58377
43:22:30,384 --> 43:22:34,880
alegătorii

58378
43:22:32,160 --> 43:22:37,600
și poate cei care nu sunt încă înregistrați,

58379
43:22:34,880 --> 43:22:40,240
poate cine nu a votat in trecut.

58380
43:22:37,600 --> 43:22:42,880
Putem face toate acele analize

58381
43:22:40,240 --> 43:22:45,104
și să ajungă la acele popoare și

58382
43:22:42,880 --> 43:22:47,744
persoane? Asta e prima parte. Aceasta

58383
43:22:45,104 --> 43:22:51,104
doar prima parte a fazei preelectorale.

58384
43:22:47,744 --> 43:22:54,880
Acum trecem la partea a doua la dreapta

58385
43:22:51,104 --> 43:22:58,480
trecând la a doua parte să spunem

58386
43:22:54,880 --> 43:23:01,480
uh noi spunem public

58387
43:22:58,480 --> 43:23:01,480
opinie

58388
43:23:02,160 --> 43:23:06,560
cu privire la dreptul de votare la vot

58389
43:23:04,720 --> 43:23:08,080
ceea ce este pe cale să se întâmple primul lucru

58390
43:23:06,560 --> 43:23:12,800
veți dori să colectați informații

58391
43:23:08,080 --> 43:23:16,080
despre oameni corect, așa că poți să ieși

58392
43:23:12,800 --> 43:23:20,000
și ajunge la toate cele 1,88 miliarde de oameni din

58393
43:23:16,080 --> 43:23:24,560
țara asta care le place

58394
43:23:20,000 --> 43:23:26,880
votați pentru ce partid este posibil

58395
43:23:24,560 --> 43:23:28,960
1,8 8 miliarde crezi că este posibil

58396
43:23:26,880 --> 43:23:30,800
pentru 1 miliard

58397
43:23:28,960 --> 43:23:32,960
crezi ca se poate pentru 500?

58398
43:23:30,800 --> 43:23:36,080
milioane crezi că este posibil

58399
43:23:32,960 --> 43:23:38,320
100 de milioane nu e în regulă, așa că în principiu sunt

58400
43:23:36,080 --> 43:23:42,384
vorbind despre ce am ceva

58401
43:23:38,320 --> 43:23:44,800
care se numeşte ca populaţie

58402
43:23:42,384 --> 43:23:48,880
corect și dacă trebuie să studiez despre asta

58403
43:23:44,800 --> 43:23:51,104
populație care este de 1,88 miliarde de oameni

58404
43:23:48,880 --> 43:23:52,800
ceea ce este imposibil ceea ce tocmai ai spus

58405
43:23:51,104 --> 43:23:56,640
ce trebuie să fac dacă mă opresc

58406
43:23:52,800 --> 43:24:01,024
proces fără drept, mă voi duce să colectez

58407
43:23:56,640 --> 43:24:05,360
ceva care se numește probă

58408
43:24:01,024 --> 43:24:08,960
corect, lucrăm întotdeauna în mostre corect

58409
43:24:05,360 --> 43:24:13,200
să presupunem că cineva spune că o Coca-Cola

58410
43:24:08,960 --> 43:24:15,600
sticla nu contine 500 ml lichid

58411
43:24:13,200 --> 43:24:17,920
despre care pretinde corect să presupunem pe cineva

58412
43:24:15,600 --> 43:24:21,024
a pus posibilă această acuzație că

58413
43:24:17,920 --> 43:24:23,280
Sticlele de Coca-Cola nu au 500 ml

58414
43:24:21,024 --> 43:24:25,840
lichid pe care îl promit. Acum există

58415
43:24:23,280 --> 43:24:27,920
două moduri de a face față acestui lucru. Corect? Acolo

58416
43:24:25,840 --> 43:24:30,240
sunt două moduri de a face față acestui lucru. Fie eu

58417
43:24:27,920 --> 43:24:33,440
du-te și adună toate sticlele de

58418
43:24:30,240 --> 43:24:36,320
Coca-Cola în lume. Posibil

58419
43:24:33,440 --> 43:24:39,200
niciodata corect. Deci ce voi face? o voi face

58420
43:24:36,320 --> 43:24:41,920
du-te și ridică o mână de sticle.

58421
43:24:39,200 --> 43:24:43,520
Corect? O mână de sticle. Deci ce este

58422
43:24:41,920 --> 43:24:45,744
acea mână de sticle? Acestea sunt

58423
43:24:43,520 --> 43:24:48,080
numite mostre. Un ultim lucru.

58424
43:24:45,744 --> 43:24:49,744
Să presupunem că cineva spune asta din cauza unui

58425
43:24:48,080 --> 43:24:53,440
industrie

58426
43:24:49,744 --> 43:24:55,920
toţi peştii lacului mor sau

58427
43:24:53,440 --> 43:24:57,840
sunt infectati. Este posibil să mergi

58428
43:24:55,920 --> 43:25:00,800
și adună și verifică toți peștii din interior

58429
43:24:57,840 --> 43:25:03,744
iaz sau lac? Nu. Corect. Ce va

58430
43:25:00,800 --> 43:25:06,240
facem? Vom colecta din nou o mână de

58431
43:25:03,744 --> 43:25:10,384
pești și îi vom testa. Corect?

58432
43:25:06,240 --> 43:25:13,840
Din nou mostre. Acum cum funcționează datele brute

58433
43:25:10,384 --> 43:25:16,080
colectat? Date brute ca in sper ca tu

58434
43:25:13,840 --> 43:25:17,664
intelege asta. Nu mai este vorba despre asta

58435
43:25:16,080 --> 43:25:19,840
populatie

58436
43:25:17,664 --> 43:25:22,000
cu acest pas fiind spus. Acum ești

58437
43:25:19,840 --> 43:25:24,880
care se ocupă de mostre. Deci acum vrei

58438
43:25:22,000 --> 43:25:26,960
să mă întrebați cum este creat eșantionul? Da,

58439
43:25:24,880 --> 43:25:30,080
acum ajung la asta. Acum băieți, acolo

58440
43:25:26,960 --> 43:25:34,320
sunt o mulțime de al doilea punct este cum să

58441
43:25:30,080 --> 43:25:36,560
eșantion nu? Cum se eșantionează

58442
43:25:34,320 --> 43:25:38,880
nu? Deci avem tehnici de eșantionare

58443
43:25:36,560 --> 43:25:42,160
oameni. Unul este numit probabilist

58444
43:25:38,880 --> 43:25:44,000
iar unul este numit nonrobabilistic.

58445
43:25:42,160 --> 43:25:46,384
Corect? Nu voi intra corect în detaliu

58446
43:25:44,000 --> 43:25:48,960
acum. Vreau doar să vă spun o privire de ansamblu

58447
43:25:46,384 --> 43:25:50,880
probabilistic este să presupunem că ești

58448
43:25:48,960 --> 43:25:53,840
producția de tricouri corect

58449
43:25:50,880 --> 43:25:55,664
fabricând tricouri corect și presupunem

58450
43:25:53,840 --> 43:25:58,080
ai creat

58451
43:25:55,664 --> 43:26:00,080
100 de loturi

58452
43:25:58,080 --> 43:26:03,440
de

58453
43:26:00,080 --> 43:26:06,384
mii de tricouri, așa că aceasta este cutie

58454
43:26:03,440 --> 43:26:09,600
o cutie doua cutie trei cutie patru pana in sus

58455
43:26:06,384 --> 43:26:12,000
la 100 dreapta 100 cutii si in fiecare cutie

58456
43:26:09,600 --> 43:26:14,320
cate tricouri sunt 1 th00and

58457
43:26:12,000 --> 43:26:17,520
chiar acum să presupunem că ești o calitate

58458
43:26:14,320 --> 43:26:20,000
inspector. Ești un inspector de calitate.

58459
43:26:17,520 --> 43:26:23,104
Este posibil ca tu să treci peste

58460
43:26:20,000 --> 43:26:25,440
toate cele 100 de loturi cu toate bifând toate

58461
43:26:23,104 --> 43:26:27,744
cele mii de tricouri unul câte unul? Nu.

58462
43:26:25,440 --> 43:26:31,360
Corect. Ce vei face? Vei proba

58463
43:26:27,744 --> 43:26:34,320
din nou. Vei proba. Acum cel mai mult

58464
43:26:31,360 --> 43:26:37,104
mod obișnuit de eșantionare a acestor tipuri de

58465
43:26:34,320 --> 43:26:38,800
problema este eșantionarea probabilistică. Ce

58466
43:26:37,104 --> 43:26:40,384
este probabilitatea? Care este probabilitatea

58467
43:26:38,800 --> 43:26:42,480
de a primi cap sau cozi când tu

58468
43:26:40,384 --> 43:26:45,600
rotiți atunci când aruncați moneda? în egală măsură

58469
43:26:42,480 --> 43:26:48,240
probabil 1x2 și 1x2. Ce este

58470
43:26:45,600 --> 43:26:51,840
probabilitatea de a obține 1 2 3 4 5 6 pe a

58471
43:26:48,240 --> 43:26:54,080
aruncarea unui zar? 1x 6. Acum ce este

58472
43:26:51,840 --> 43:26:56,000
probabilitatea de a alege orice tricou din

58473
43:26:54,080 --> 43:26:57,744
acest prim slot din mii

58474
43:26:56,000 --> 43:27:00,560
tricouri?

58475
43:26:57,744 --> 43:27:02,880
1 cu 000.

58476
43:27:00,560 --> 43:27:04,800
Da. Deci crezi că toate tricourile

58477
43:27:02,880 --> 43:27:08,560
au o probabilitate egală la fel de probabilă

58478
43:27:04,800 --> 43:27:11,840
de a fi preluat fără nicio părtinire? Dacă

58479
43:27:08,560 --> 43:27:15,664
te decizi să desenezi cinci tricouri, corect,

58480
43:27:11,840 --> 43:27:19,024
din fiecare din această casetă, dreapta și

58481
43:27:15,664 --> 43:27:21,360
să presupunem că două sunt defecte și trei

58482
43:27:19,024 --> 43:27:23,440
nu sunt defecte, ce vei face?

58483
43:27:21,360 --> 43:27:25,920
Vei accepta lotul sau vei respinge

58484
43:27:23,440 --> 43:27:27,600
mult? Avem majoritatea tricourilor de

58485
43:27:25,920 --> 43:27:29,104
nedefective

58486
43:27:27,600 --> 43:27:30,560
sau să spunem că vom respinge lotul. Noi

58487
43:27:29,104 --> 43:27:32,480
va respinge lotul. Vom respinge

58488
43:27:30,560 --> 43:27:34,800
lot. Să spunem că vom respinge lotul.

58489
43:27:32,480 --> 43:27:37,600
Bine. Deși acest lucru este în principiu

58490
43:27:34,800 --> 43:27:41,200
subiectiv conform politicilor companiei

58491
43:27:37,600 --> 43:27:44,000
dar să zicem că am respins. Acum oamenii mei

58492
43:27:41,200 --> 43:27:47,280
întrebarea pentru tine este ce dacă acest întreg

58493
43:27:44,000 --> 43:27:49,664
lotul avea doar două tricouri defecte dar

58494
43:27:47,280 --> 43:27:52,160
acum ce se va intampla? Întregul lot

58495
43:27:49,664 --> 43:27:55,440
vor fi respinse.

58496
43:27:52,160 --> 43:27:58,000
Da. Să presupunem că ai probat un tricou.

58497
43:27:55,440 --> 43:28:00,240
Haideți să schimbăm cazul de utilizare. spun eu

58498
43:27:58,000 --> 43:28:02,080
ai probat un singur tricou și asta

58499
43:28:00,240 --> 43:28:04,720
tricoul era defect. Acum o vei face

58500
43:28:02,080 --> 43:28:07,200
respinge lotul și asta este la fel

58501
43:28:04,720 --> 43:28:09,920
caz probabil. Deci aceasta se numește ca

58502
43:28:07,200 --> 43:28:12,384
eşantionarea probabilistică a oamenilor şi acolo

58503
43:28:09,920 --> 43:28:15,440
nu poți să te întorci. Nu există

58504
43:28:12,384 --> 43:28:17,744
modul în care nu puteți spune asta, domnule, vă rog

58505
43:28:15,440 --> 43:28:19,744
lasă acest lot să treacă pentru că

58506
43:28:17,744 --> 43:28:21,920
există șansa ca restul

58507
43:28:19,744 --> 43:28:24,000
tricourile nu sunt defecte. Nu, nu este

58508
43:28:21,920 --> 43:28:26,480
felul în care se întâmplă asta. Se întâmplă

58509
43:28:24,000 --> 43:28:30,080
la întâmplare. Deci, corect asta se numește ca

58510
43:28:26,480 --> 43:28:34,000
eșantionare aleatorie.

58511
43:28:30,080 --> 43:28:37,280
Corect? eșantionare aleatorie. Acum să presupunem că tu

58512
43:28:34,000 --> 43:28:40,080
fac o cercetare de cancer, nu?

58513
43:28:37,280 --> 43:28:42,720
Faceți o cercetare a cancerului, nu?

58514
43:28:40,080 --> 43:28:45,360
Deci, pentru oamenii tăi care cercetează cancerul, ce

58515
43:28:42,720 --> 43:28:48,720
de oameni vei avea nevoie? Oameni care

58516
43:28:45,360 --> 43:28:50,640
a avut cancer în trecut, nu-i așa? Pentru a

58517
43:28:48,720 --> 43:28:52,640
să știe mai multe despre problema lor, să știe

58518
43:28:50,640 --> 43:28:54,880
mai multe despre starea lor medicală. Deci

58519
43:28:52,640 --> 43:28:57,440
este posibil ca oamenii ca în acest folos

58520
43:28:54,880 --> 43:28:59,744
în cazul în care poți merge și ridica orice persoană

58521
43:28:57,440 --> 43:29:02,080
din populatie si intreaba-i

58522
43:28:59,744 --> 43:29:05,104
intrebari? Nu. Nu? Asta nu este

58523
43:29:02,080 --> 43:29:07,600
posibil. Deci acum este probabilitatea

58524
43:29:05,104 --> 43:29:10,560
la fel de probabil sau s-a schimbat când

58525
43:29:07,600 --> 43:29:13,360
alegi proba? S-a schimbat. Acum

58526
43:29:10,560 --> 43:29:16,720
există o părtinire care este introdusă că

58527
43:29:13,360 --> 43:29:19,024
vrei doar oameni care au avut cancer.

58528
43:29:16,720 --> 43:29:22,384
Corect? Deci genul ăsta de eșantionare de oameni

58529
43:29:19,024 --> 43:29:26,560
se numește eșantionare neprobabilistă.

58530
43:29:22,384 --> 43:29:30,560
Corect? Eșantionare non-robabilistică. Clar?

58531
43:29:26,560 --> 43:29:32,640
Acum tehnica de eșantionare. Corect? Acum al treilea

58532
43:29:30,560 --> 43:29:37,024
lucru în această schemă poate fi oameni

58533
43:29:32,640 --> 43:29:40,240
ce? Poate fi colectarea datelor

58534
43:29:37,024 --> 43:29:42,480
modul corect de colectare a datelor chiar așa

58535
43:29:40,240 --> 43:29:45,440
cum colectezi datele? Poți

58536
43:29:42,480 --> 43:29:49,104
plutiți un sondaj

58537
43:29:45,440 --> 43:29:53,600
pe internet să zicem.

58538
43:29:49,104 --> 43:29:56,320
Poți să mergi și să stai în afara unui mall

58539
43:29:53,600 --> 43:29:58,480
sau birou,

58540
43:29:56,320 --> 43:30:01,360
nu-i asa? Cum vei cum vei putea

58541
43:29:58,480 --> 43:30:03,600
probabil intervievați pe cineva,

58542
43:30:01,360 --> 43:30:06,480
nu? Intervievați cuiva, nu? Poți

58543
43:30:03,600 --> 43:30:09,104
purtați o discuție de grup.

58544
43:30:06,480 --> 43:30:11,840
Da. Toate aceste tehnici.

58545
43:30:09,104 --> 43:30:14,640
Da. Nu, poate. Corect. In aceeasi parte,

58546
43:30:11,840 --> 43:30:16,880
sondaje de opinie publica, nu? Acum,

58547
43:30:14,640 --> 43:30:18,800
Băieți, deci acesta a fost un scurt

58548
43:30:16,880 --> 43:30:22,320
introducere, nu? Și asta poate fi

58549
43:30:18,800 --> 43:30:25,280
extins la orice industrie. Corect? Începând cu

58550
43:30:22,320 --> 43:30:28,280
acum, puteți avea exemplu în domeniul medical

58551
43:30:25,280 --> 43:30:28,280
stiinta,

58552
43:30:29,920 --> 43:30:34,800
nu? Puteți avea un exemplu în

58553
43:30:31,840 --> 43:30:37,104
automobile,

58554
43:30:34,800 --> 43:30:39,440
nu? Puteți avea un exemplu în

58555
43:30:37,104 --> 43:30:43,280
vânzare cu amănuntul,

58556
43:30:39,440 --> 43:30:46,520
nu? Corect. Atunci poți avea exemplu

58557
43:30:43,280 --> 43:30:46,520
în producţie.

58558
43:30:47,664 --> 43:30:52,640
Corect? Puteți avea exemplu în

58559
43:30:49,664 --> 43:30:56,640
educatie,

58560
43:30:52,640 --> 43:30:59,600
nu? Poți avea exemplu în sport,

58561
43:30:56,640 --> 43:31:01,840
nu? Analiză IPL, analiză cricket,

58562
43:30:59,600 --> 43:31:04,000
toate aceste analize sportive, nu? Acestea

58563
43:31:01,840 --> 43:31:06,080
sunt cele mai cunoscute domenii, nu? Ei

58564
43:31:04,000 --> 43:31:08,320
sunt cele mai cunoscute domenii. Ei sunt

58565
43:31:06,080 --> 43:31:10,720
nu subiecte, sunt domenii, nu? În

58566
43:31:08,320 --> 43:31:12,720
care știința datelor este utilizată pe scară largă.

58567
43:31:10,720 --> 43:31:15,280
Deci, am să verific. Băieți, în

58568
43:31:12,720 --> 43:31:18,000
automobile, există cel mai mare exemplu,

58569
43:31:15,280 --> 43:31:21,280
mașini cu conducere autonomă.

58570
43:31:18,000 --> 43:31:24,160
Da, condus autonom. Cum faci

58571
43:31:21,280 --> 43:31:26,000
crezi ca e posibil? Știința datelor

58572
43:31:24,160 --> 43:31:29,520
din nou

58573
43:31:26,000 --> 43:31:32,384
ca Tesla. Absolut. Tesla este la nivel

58574
43:31:29,520 --> 43:31:36,080
trei. Avem cinci niveluri.

58575
43:31:32,384 --> 43:31:39,744
Nivelul trei este AI îngust. Nivelul patru este

58576
43:31:36,080 --> 43:31:43,920
AGI și nivelul cinci este super AI. Suntem

58577
43:31:39,744 --> 43:31:45,664
se va deplasa primul la dreapta cu

58578
43:31:43,920 --> 43:31:47,600
aspectul tehnic drept cu

58579
43:31:45,664 --> 43:31:51,480
aspectul tehnic în știința noastră a datelor

58580
43:31:47,600 --> 43:31:51,480
desigur corect

58581
43:31:57,600 --> 43:32:02,640
dreapta care se bazează pe Python

58582
43:32:00,880 --> 43:32:06,080
corect pentru că acesta este limbajul nostru de bază

58583
43:32:02,640 --> 43:32:08,000
pe care le-am învățat până acum chiar așa în

58584
43:32:06,080 --> 43:32:12,104
Oamenii Python vom începe și vom acoperi

58585
43:32:08,000 --> 43:32:12,104
patru dintre pachete

58586
43:32:12,720 --> 43:32:17,520
chiar acum și pe măsură ce trecem la mașină

58587
43:32:15,104 --> 43:32:19,024
învăţare şi alte uh învăţare profundă şi

58588
43:32:17,520 --> 43:32:21,280
tot ce vei explora mai mult și

58589
43:32:19,024 --> 43:32:24,800
mai multe pachete. Primul pachet pe care îl avem

58590
43:32:21,280 --> 43:32:26,480
a acoperi va fi numpy.

58591
43:32:24,800 --> 43:32:31,720
Corect? Îți voi explica în detaliu ce

58592
43:32:26,480 --> 43:32:31,720
numpy este. Apoi vom acoperi panda.

58593
43:32:32,240 --> 43:32:38,480
Apoi vom acoperi buza mattplot

58594
43:32:36,320 --> 43:32:41,440
și apoi în cele din urmă vom acoperi ceva

58595
43:32:38,480 --> 43:32:43,024
numit cbond.

58596
43:32:41,440 --> 43:32:45,600
Corect? Vom acoperi ceva numit ca

58597
43:32:43,024 --> 43:32:51,024
cbond. Deci aceste patru pachete în mod inerent

58598
43:32:45,600 --> 43:32:55,024
trebuie să acoperim în Python pentru a ne asigura

58599
43:32:51,024 --> 43:32:57,840
suntem capabili să reducem

58600
43:32:55,024 --> 43:32:59,840
timpul

58601
43:32:57,840 --> 43:33:02,240
în codificarea corectă suntem capabili să reducem

58602
43:32:59,840 --> 43:33:05,360
timpul de codificare și utilizare a acestora

58603
43:33:02,240 --> 43:33:07,440
pachetele ne ajută imediat să obținem

58604
43:33:05,360 --> 43:33:10,640
rezultatele dorite sunt corecte, sper tuturor

58605
43:33:07,440 --> 43:33:12,480
amintiți-vă conceptul de module

58606
43:33:10,640 --> 43:33:14,560
am acoperit în Python facem cu toții

58607
43:33:12,480 --> 43:33:16,720
amintiți-vă funcțiile și modulele. Poți

58608
43:33:14,560 --> 43:33:18,560
utilizați caietul Jupyter. Dacă Jupyter-ul tău

58609
43:33:16,720 --> 43:33:20,080
notebook-ul nu este instalat, puteți utiliza

58610
43:33:18,560 --> 43:33:24,480
ceva care se numește Google

58611
43:33:20,080 --> 43:33:26,320
Colaborare, nu? Accesați Google, tastați

58612
43:33:24,480 --> 43:33:30,880
colaborare,

58613
43:33:26,320 --> 43:33:32,560
nu? Să presupunem că scrii Colab,

58614
43:33:30,880 --> 43:33:36,240
nu? Și atunci vei vedea asta

58615
43:33:32,560 --> 43:33:40,160
opțiunea. Faceți clic pe Google Colab și acesta

58616
43:33:36,240 --> 43:33:43,104
vă va permite să codificați în Python, nu?

58617
43:33:40,160 --> 43:33:46,240
Deci acum vom discuta despre

58618
43:33:43,104 --> 43:33:49,024
pachet numpy în python. Bine, numpy

58619
43:33:46,240 --> 43:33:54,360
pachet în python.

58620
43:33:49,024 --> 43:33:54,360
Deci numpy este a

58621
43:33:55,920 --> 43:33:58,920
fundamentale

58622
43:34:00,000 --> 43:34:08,080
pachet

58623
43:34:02,080 --> 43:34:12,080
pentru știința datelor în Python. Corect? Este

58624
43:34:08,080 --> 43:34:14,480
unul dintre cele mai fundamentale pachete pentru

58625
43:34:12,080 --> 43:34:17,664
practicarea științei datelor în Python.

58626
43:34:14,480 --> 43:34:19,920
Corect? De ce este asta? De ce este așa de ce este

58627
43:34:17,664 --> 43:34:24,360
numpy atât de fundamental? Ce este așa

58628
43:34:19,920 --> 43:34:24,360
special? Pachetul NumPy

58629
43:34:25,024 --> 43:34:32,384
ne oferă un nou tip de date

58630
43:34:29,520 --> 43:34:36,080
pentru manipulare

58631
43:34:32,384 --> 43:34:39,200
date în Python

58632
43:34:36,080 --> 43:34:44,560
numit ca

58633
43:34:39,200 --> 43:34:47,880
N D matrice, nu? matrice ND care

58634
43:34:44,560 --> 43:34:47,880
reprezintă

58635
43:34:48,720 --> 43:34:54,384
asta inseamna

58636
43:34:51,200 --> 43:34:57,360
N dimensional

58637
43:34:54,384 --> 43:35:00,560
tablouri dreapta n tablouri dimensionale dreapta

58638
43:34:57,360 --> 43:35:03,744
aceasta reprezintă n tablouri dimensionale

58639
43:35:00,560 --> 43:35:07,520
asa ca pana acum

58640
43:35:03,744 --> 43:35:09,440
pana acum am studiat

58641
43:35:07,520 --> 43:35:12,800
despre

58642
43:35:09,440 --> 43:35:14,720
listă întreg

58643
43:35:12,800 --> 43:35:16,880
tpples,

58644
43:35:14,720 --> 43:35:20,240
corzi,

58645
43:35:16,880 --> 43:35:23,720
nu? Din care

58646
43:35:20,240 --> 43:35:23,720
din care

58647
43:35:25,104 --> 43:35:28,840
tipurile de date

58648
43:35:29,664 --> 43:35:38,880
cum ar fi lista

58649
43:35:32,640 --> 43:35:43,640
elevii au fost folosiți pentru a stoca date,

58650
43:35:38,880 --> 43:35:43,640
nu? stocați date, nu?

58651
43:35:43,840 --> 43:35:51,104
Și gamă

58652
43:35:46,720 --> 43:35:55,440
folosit pentru generare

58653
43:35:51,104 --> 43:35:57,200
date noi care sunt în primul rând secvenţiale.

58654
43:35:55,440 --> 43:35:58,880
Corect?

58655
43:35:57,200 --> 43:36:01,360
Acum există unul, acum există unul

58656
43:35:58,880 --> 43:36:04,560
problema nu? Există o problemă și

58657
43:36:01,360 --> 43:36:09,104
ar trebui să existe o întrebare că acolo

58658
43:36:04,560 --> 43:36:15,200
ar trebui să fie o întrebare.

58659
43:36:09,104 --> 43:36:20,080
De ce avem nevoie de un nou tip de date

58660
43:36:15,200 --> 43:36:24,384
pentru a lucra cu știința datelor,

58661
43:36:20,080 --> 43:36:26,000
nu? De ce avem nevoie de asta? Da. Deci

58662
43:36:24,384 --> 43:36:29,104
răspuns la această întrebare oamenii

58663
43:36:26,000 --> 43:36:33,024
răspunsul la această întrebare se află în a

58664
43:36:29,104 --> 43:36:36,640
mica explicatie nu? Da se află într-o

58665
43:36:33,024 --> 43:36:39,104
mica explicatie care este aceea

58666
43:36:36,640 --> 43:36:42,160
Python

58667
43:36:39,104 --> 43:36:44,160
este o

58668
43:36:42,160 --> 43:36:47,024
înalt

58669
43:36:44,160 --> 43:36:51,024
nivel

58670
43:36:47,024 --> 43:36:56,024
limba nu? Python este un nivel înalt

58671
43:36:51,024 --> 43:36:56,024
limba, nu? Şi

58672
43:36:56,080 --> 43:37:03,000
un limbaj înalt

58673
43:36:59,360 --> 43:37:03,000
este de obicei

58674
43:37:03,440 --> 43:37:08,440
foarte

58675
43:37:05,440 --> 43:37:08,440
îndepărtată

58676
43:37:08,640 --> 43:37:13,024
din

58677
43:37:10,560 --> 43:37:15,200
hardware.

58678
43:37:13,024 --> 43:37:17,520
Un limbaj highle este aproape de hardware

58679
43:37:15,200 --> 43:37:19,024
sau departe de hardware. Ai făcut-o

58680
43:37:17,520 --> 43:37:21,840
nu participă la programarea Python

58681
43:37:19,024 --> 43:37:24,640
esentiale?

58682
43:37:21,840 --> 43:37:26,560
Care este tipul de limbaj de programare

58683
43:37:24,640 --> 43:37:29,280
care este cel mai aproape de hardware? A

58684
43:37:26,560 --> 43:37:33,160
limbaj de nivel scăzut.

58685
43:37:29,280 --> 43:37:33,160
Dacă acesta este hardware-ul meu,

58686
43:37:33,280 --> 43:37:40,880
da, acesta este sistemul meu de operare.

58687
43:37:37,440 --> 43:37:43,440
Acesta este stratul meu de aplicare. Corect? Deci,

58688
43:37:40,880 --> 43:37:45,440
limbajul langu de nivel greu este aici și

58689
43:37:43,440 --> 43:37:48,960
limbi de nivel scăzut aici. Corect? care

58690
43:37:45,440 --> 43:37:51,104
este cel mai apropiat. Deci limbi binare,

58691
43:37:48,960 --> 43:37:53,840
limbaje de asamblare,

58692
43:37:51,104 --> 43:37:57,024
nu? Toate acestea sunt cele mai apropiate de

58693
43:37:53,840 --> 43:37:58,480
hardware pentru că unde este procesarea

58694
43:37:57,024 --> 43:38:02,560
se întâmplă? Unde este procesarea

58695
43:37:58,480 --> 43:38:07,080
întâmplarea datelor? La hardware,

58696
43:38:02,560 --> 43:38:07,080
nu-i asa? Prelucrarea datelor

58697
43:38:08,000 --> 43:38:14,560
se întâmplă

58698
43:38:11,360 --> 43:38:16,320
la hardware.

58699
43:38:14,560 --> 43:38:18,384
Nu vă faceți griji. De fapt, se întâmplă la

58700
43:38:16,320 --> 43:38:20,800
hardware nu? Ce este procesarea?

58701
43:38:18,384 --> 43:38:23,024
Procesarea este semnale de zerouri și unu

58702
43:38:20,800 --> 43:38:25,664
nu? Ce sunt zerourile și unuurile? Acestea

58703
43:38:23,024 --> 43:38:28,080
sunt semnale electrice.

58704
43:38:25,664 --> 43:38:31,360
Acestea sunt semnalele electrice, nu?

58705
43:38:28,080 --> 43:38:33,360
Care este practic activat și oprit. Corect?

58706
43:38:31,360 --> 43:38:36,720
Și este comunicat hardware-ului

58707
43:38:33,360 --> 43:38:40,080
cu ajutorul rezistențelor

58708
43:38:36,720 --> 43:38:43,024
și microprocesoare.

58709
43:38:40,080 --> 43:38:45,600
Corect? Nu este corect? De ce un computer

58710
43:38:43,024 --> 43:38:48,000
stie doar zerouri si unu? Pentru că zero

58711
43:38:45,600 --> 43:38:51,384
este oprit și unul este pe care este

58712
43:38:48,000 --> 43:38:51,384
curent electric

58713
43:38:51,840 --> 43:38:56,480
curent electric corect pentru a activa sau

58714
43:38:54,800 --> 43:38:59,360
dezactivează anumite lucruri drept adevărat și

58715
43:38:56,480 --> 43:39:02,560
porți false chiar așa că se întâmplă la

58716
43:38:59,360 --> 43:39:05,600
hardware deci acum oameni daca intelegi

58717
43:39:02,560 --> 43:39:09,024
această parte apoi încercați să vă conectați logic

58718
43:39:05,600 --> 43:39:13,024
la ceea ce am de gând să spun când vei fi

58719
43:39:09,024 --> 43:39:15,840
studiind știința datelor

58720
43:39:13,024 --> 43:39:19,104
cu ce fel de date vei avea de-a face

58721
43:39:15,840 --> 43:39:21,440
date mari,

58722
43:39:19,104 --> 43:39:23,744
nu? Și așa cum sugerează și numele, va fi

58723
43:39:21,440 --> 43:39:25,664
au mult volum,

58724
43:39:23,744 --> 43:39:28,160
nu? Va avea mult volum

58725
43:39:25,664 --> 43:39:31,440
în afară de multe alte lucruri, nu?

58726
43:39:28,160 --> 43:39:34,000
Va fi foarte foarte mare. Și pe asta

58727
43:39:31,440 --> 43:39:35,744
volum mare de date, veți face

58728
43:39:34,000 --> 43:39:37,840
prelucrare.

58729
43:39:35,744 --> 43:39:40,240
Vei face procesare. Ce face

58730
43:39:37,840 --> 43:39:43,920
mijloace de prelucrare?

58731
43:39:40,240 --> 43:39:45,600
Ce înseamnă prelucrare? Operațiuni.

58732
43:39:43,920 --> 43:39:48,640
Deci unde are loc această operațiune?

58733
43:39:45,600 --> 43:39:50,800
Acest lucru se întâmplă în hardware

58734
43:39:48,640 --> 43:39:53,200
și pentru hardware care este cel mai apropiat

58735
43:39:50,800 --> 43:39:54,720
limbaj la hardware la un nivel scăzut

58736
43:39:53,200 --> 43:39:57,520
limbaj.

58737
43:39:54,720 --> 43:39:59,840
Dar acum oameni dar acum avem o

58738
43:39:57,520 --> 43:40:01,840
situatia din fata noastra. Ce este

58739
43:39:59,840 --> 43:40:03,664
situație în care ce încercăm să facem

58740
43:40:01,840 --> 43:40:06,240
știința datelor cu? Ce încercăm

58741
43:40:03,664 --> 43:40:09,520
face data science cu?

58742
43:40:06,240 --> 43:40:11,920
Python, nu?

58743
43:40:09,520 --> 43:40:14,640
Și Python este ce?

58744
43:40:11,920 --> 43:40:17,280
Un limbaj de nivel înalt,

58745
43:40:14,640 --> 43:40:20,960
nu-i aşa? Da. Deci, există o

58746
43:40:17,280 --> 43:40:24,464
discrepanță. Da. Una mare

58747
43:40:20,960 --> 43:40:26,640
pentru că nivel greu, limbaj de nivel înalt,

58748
43:40:24,464 --> 43:40:29,664
acestea

58749
43:40:26,640 --> 43:40:33,080
sunt lente

58750
43:40:29,664 --> 43:40:33,080
în procesare,

58751
43:40:33,200 --> 43:40:38,320
nu? Acestea sunt foarte lente

58752
43:40:35,200 --> 43:40:41,104
procesare, nu? Deci, pentru acest tip de

58753
43:40:38,320 --> 43:40:44,080
limbi pentru a gestiona acest tip de date

58754
43:40:41,104 --> 43:40:48,160
și astfel de operațiuni, da

58755
43:40:44,080 --> 43:40:50,464
foarte greu, așa că hai să păstrăm

58756
43:40:48,160 --> 43:40:52,640
hai să lăsăm această parte deoparte dacă tu

58757
43:40:50,464 --> 43:40:56,464
înțelegeți asta acum, să trecem la

58758
43:40:52,640 --> 43:41:00,360
al doilea punct dreapta

58759
43:40:56,464 --> 43:41:00,360
când ai învățat Python

58760
43:41:00,384 --> 43:41:07,440
pe o scară de la 1 la 10 cât de ușor a fost

58761
43:41:05,440 --> 43:41:10,464
ușurința de utilizare a Python

58762
43:41:07,440 --> 43:41:13,664
Este un număr relativ mai mare, nu?

58763
43:41:10,464 --> 43:41:16,160
Un număr relativ mai mare. Deci acum băieți,

58764
43:41:13,664 --> 43:41:18,720
când vorbesc despre știința datelor, nu?

58765
43:41:16,160 --> 43:41:22,800
Când vorbesc despre

58766
43:41:18,720 --> 43:41:25,744
știința datelor, bine?

58767
43:41:22,800 --> 43:41:30,384
Corect? Când vorbesc despre știința datelor,

58768
43:41:25,744 --> 43:41:32,464
treaba mea este că aceasta va fi folosită de

58769
43:41:30,384 --> 43:41:34,880
mase,

58770
43:41:32,464 --> 43:41:37,840
nu? Va fi folosit de mase. Multe

58771
43:41:34,880 --> 43:41:41,200
manageri de oameni, programatori, afaceri

58772
43:41:37,840 --> 43:41:43,280
analiști, analiști de date, posibil drept

58773
43:41:41,200 --> 43:41:45,920
care sunt din mediul netehnic care

58774
43:41:43,280 --> 43:41:47,440
nu știu codificare, pot face și date

58775
43:41:45,920 --> 43:41:49,520
știință deoarece știința datelor este o

58776
43:41:47,440 --> 43:41:52,000
chestia generala nu? Înțelegerea

58777
43:41:49,520 --> 43:41:55,600
datele la care nu ar trebui să fie limitate

58778
43:41:52,000 --> 43:41:57,664
capacitatea ta de a înțelege uh

58779
43:41:55,600 --> 43:42:00,240
tehnici foarte complexe

58780
43:41:57,664 --> 43:42:03,280
limbaj. Deci pentru acești oameni care

58781
43:42:00,240 --> 43:42:05,440
limbajul este potrivit, care este Python

58782
43:42:03,280 --> 43:42:06,960
nu? Este cel mai ușor de înțeles. Este

58783
43:42:05,440 --> 43:42:09,600
un limbaj de nivel înalt aproape ca

58784
43:42:06,960 --> 43:42:11,664
engleză. Da. Deci, Python este un simplu

58785
43:42:09,600 --> 43:42:13,600
limbaj. Deci, în această parte, oamenii,

58786
43:42:11,664 --> 43:42:16,160
Python se potrivește, nu? Care este o

58787
43:42:13,600 --> 43:42:20,440
lucru mai mare. În partea a doua, când

58788
43:42:16,160 --> 43:42:20,440
vorbim despre operațiuni,

58789
43:42:20,640 --> 43:42:26,384
vorbim despre operațiuni. In aceasta

58790
43:42:23,600 --> 43:42:29,384
parte, există o problemă, nu? Python

58791
43:42:26,384 --> 43:42:29,384
eșuează,

58792
43:42:30,464 --> 43:42:36,960
nu? Python eșuează, nu? pentru că este

58793
43:42:33,440 --> 43:42:39,280
un limbaj înalt. Am spus asta bine

58794
43:42:36,960 --> 43:42:44,280
există un limbaj numit drept C

58795
43:42:39,280 --> 43:42:44,280
care este o limbă de nivel mediu

58796
43:42:45,920 --> 43:42:52,384
dreapta și limbajul C cu care oamenii sunt obișnuiți

58797
43:42:49,200 --> 43:42:55,664
creați sisteme de operare OS. Este folosit

58798
43:42:52,384 --> 43:42:59,880
pentru a crea rețele

58799
43:42:55,664 --> 43:42:59,880
aplicații de rețea.

58800
43:43:00,720 --> 43:43:07,360
Este folosit pentru a crea jocuri,

58801
43:43:03,664 --> 43:43:10,360
nu? Toate lucrurile care sunt aproape de

58802
43:43:07,360 --> 43:43:10,360
hardware,

58803
43:43:10,960 --> 43:43:18,464
C este folosit, nu? Deci C se potrivește acestei facturi,

58804
43:43:15,024 --> 43:43:20,000
corect? C se potrivește acestei facturi.

58805
43:43:18,464 --> 43:43:22,320
Python

58806
43:43:20,000 --> 43:43:26,104
a spus că bine, dacă C se potrivește și

58807
43:43:22,320 --> 43:43:26,104
Python este scris

58808
43:43:26,240 --> 43:43:30,880
în C, scris pe C, nu? Este scris

58809
43:43:28,720 --> 43:43:34,464
deasupra limbajului C. Acum ce sa întâmplat

58810
43:43:30,880 --> 43:43:37,360
a fost Python spus în regulă dacă am intrinsec

58811
43:43:34,464 --> 43:43:40,240
tipurile de date sunt prelucrarea mea intrinsecă

58812
43:43:37,360 --> 43:43:43,744
nu este potrivit pentru știința datelor, dar al meu

58813
43:43:40,240 --> 43:43:47,920
natura de nivel înalt este să facem un singur lucru

58814
43:43:43,744 --> 43:43:51,440
să luăm limbajul C și să-i folosim puterea

58815
43:43:47,920 --> 43:43:55,520
corect folosește-și puterea că este foarte

58816
43:43:51,440 --> 43:43:59,520
aproape de hardware și să creăm un nou

58817
43:43:55,520 --> 43:44:04,080
tipul de date corect, să creăm o nouă date

58818
43:43:59,520 --> 43:44:07,280
tip care este scris deasupra lui C și

58819
43:44:04,080 --> 43:44:10,560
care se poate integra cu Python

58820
43:44:07,280 --> 43:44:16,160
perfect. Și oamenii aceste date noi

58821
43:44:10,560 --> 43:44:18,640
tipul a fost numit ca matrice

58822
43:44:16,160 --> 43:44:23,360
și asta ți-a fost dat de ceva

58823
43:44:18,640 --> 43:44:26,320
numit ca pachet num py. Corect? Nump py

58824
43:44:23,360 --> 43:44:28,800
pachet. A definit un nou tip de date

58825
43:44:26,320 --> 43:44:34,664
care era matrice. Și împreună cu definirea

58826
43:44:28,800 --> 43:44:34,664
matricea, a dat diverse operații.

58827
43:44:35,104 --> 43:44:40,320
Corect? A dat diverse operațiuni

58828
43:44:38,000 --> 43:44:42,880
se putea

58829
43:44:40,320 --> 43:44:45,840
efectua

58830
43:44:42,880 --> 43:44:49,600
pe matrice,

58831
43:44:45,840 --> 43:44:51,920
nu? S-ar putea lucra pe matrice.

58832
43:44:49,600 --> 43:44:55,840
E simplu, nu? programul

58833
43:44:51,920 --> 43:44:59,360
puterea de procesare a mințit cu C corect

58834
43:44:55,840 --> 43:45:03,360
stătea cu C. Așa că am dezvoltat un nou

58835
43:44:59,360 --> 43:45:06,640
tip de date folosind C peste Python și

58836
43:45:03,360 --> 43:45:09,664
acel nou tip de date a fost numit ca și matrice

58837
43:45:06,640 --> 43:45:13,104
iar această matrice a fost definită într-un nou

58838
43:45:09,664 --> 43:45:15,744
modul care a fost numit modul numpy

58839
43:45:13,104 --> 43:45:19,200
care vă spunea cum să creați matricele

58840
43:45:15,744 --> 43:45:22,000
și apoi cum să manipulezi acele matrice

58841
43:45:19,200 --> 43:45:25,024
pentru a face știința datelor. Aveam opțiuni

58842
43:45:22,000 --> 43:45:28,000
ca Java, aveam opțiuni precum C, nu?

58843
43:45:25,024 --> 43:45:30,320
Aveam opțiuni precum forotron pentru a fi folosite

58844
43:45:28,000 --> 43:45:33,744
pentru știința datelor, dar am ales Python

58845
43:45:30,320 --> 43:45:35,920
din cauza simplității sale și a simplității

58846
43:45:33,744 --> 43:45:38,080
sintaxele din care oamenii

58847
43:45:35,920 --> 43:45:42,080
fundalul non-programare ar putea, de asemenea

58848
43:45:38,080 --> 43:45:44,240
utilizați Python pentru a face știința datelor.

58849
43:45:42,080 --> 43:45:46,720
Chiar acum limitarea era aceea

58850
43:45:44,240 --> 43:45:49,200
pentru că este lent pentru că este ridicat

58851
43:45:46,720 --> 43:45:52,160
nivel aveam nevoie de ceva care ar putea

58852
43:45:49,200 --> 43:45:54,560
fă-o repede și asta a fost folosind o

58853
43:45:52,160 --> 43:45:57,600
tip de date extern care nu este intern

58854
43:45:54,560 --> 43:46:01,360
la Python și asta a fost matrice și asta

58855
43:45:57,600 --> 43:46:05,280
matricea este definită în interiorul unui nou modul uh

58856
43:46:01,360 --> 43:46:09,104
sau o bibliotecă numită num py care este

58857
43:46:05,280 --> 43:46:12,080
piton numeric dreapta piton numeric.

58858
43:46:09,104 --> 43:46:15,024
Înapoi la programare chiar acolo unde noi

58859
43:46:12,080 --> 43:46:17,600
am inteles bine despre asta

58860
43:46:15,024 --> 43:46:19,200
intrebare corecta.

58861
43:46:17,600 --> 43:46:22,200
Deci

58862
43:46:19,200 --> 43:46:22,200
numpy

58863
43:46:22,640 --> 43:46:30,000
în esență este

58864
43:46:25,520 --> 43:46:31,664
construit deasupra

58865
43:46:30,000 --> 43:46:34,960
C

58866
43:46:31,664 --> 43:46:37,520
limba care este

58867
43:46:34,960 --> 43:46:40,560
compatibil

58868
43:46:37,520 --> 43:46:48,160
cu Python.

58869
43:46:40,560 --> 43:46:51,280
Ea valorifică puterea de apropiere a lui C

58870
43:46:48,160 --> 43:46:53,664
cu hardware,

58871
43:46:51,280 --> 43:46:56,640
nu? C cu hardware

58872
43:46:53,664 --> 43:47:00,920
care în cele din urmă

58873
43:46:56,640 --> 43:47:00,920
face prelucrarea

58874
43:47:00,960 --> 43:47:04,520
mai repede in

58875
43:47:05,664 --> 43:47:11,840
Python. Corect?

58876
43:47:08,384 --> 43:47:14,800
Deci, aceasta este prima parte corectă

58877
43:47:11,840 --> 43:47:16,800
asta este o primă parte acum

58878
43:47:14,800 --> 43:47:18,240
al doilea lucru sunt oamenii, așa că asta este

58879
43:47:16,800 --> 43:47:22,240
despre performanță a cam corect acestea

58880
43:47:18,240 --> 43:47:28,840
sunt performanța bit cele de mai sus

58881
43:47:22,240 --> 43:47:28,840
este despre performanță

58882
43:47:28,960 --> 43:47:34,560
de

58883
43:47:31,744 --> 43:47:39,024
chiar acum ajungând la următoarea parte care

58884
43:47:34,560 --> 43:47:44,160
este eficiența memoriei Y memoria corectă

58885
43:47:39,024 --> 43:47:46,880
eficienta chiar asa

58886
43:47:44,160 --> 43:47:51,520
matrice create

58887
43:47:46,880 --> 43:47:53,024
prin nump py in

58888
43:47:51,520 --> 43:47:57,280
piton

58889
43:47:53,024 --> 43:48:00,280
au mai puțină memorie

58890
43:47:57,280 --> 43:48:00,280
exhaustiv

58891
43:48:00,720 --> 43:48:06,464
decât liste în Python corect și voi face

58892
43:48:04,800 --> 43:48:08,800
demonstrați-vă aceste puncte mai târziu

58893
43:48:06,464 --> 43:48:11,840
prin cod, nu?

58894
43:48:08,800 --> 43:48:16,800
În listă, nu? În listă,

58895
43:48:11,840 --> 43:48:18,384
fiecare articol este un obiect, nu? Fiecare articol

58896
43:48:16,800 --> 43:48:21,024
este un obiect, nu? Sper să vă amintiți

58897
43:48:18,384 --> 43:48:23,920
asta, băieți. Fiecare articol este un obiect,

58898
43:48:21,024 --> 43:48:28,640
nu?

58899
43:48:23,920 --> 43:48:32,104
Și ține, nu? Se ține

58900
43:48:28,640 --> 43:48:32,104
metainformații

58901
43:48:32,240 --> 43:48:36,160
ca

58902
43:48:34,464 --> 43:48:38,384
referințe

58903
43:48:36,160 --> 43:48:40,560
și tipuri,

58904
43:48:38,384 --> 43:48:46,160
nu? etc., nu? O mulțime de informații

58905
43:48:40,560 --> 43:48:49,280
ține, nu? Acest lucru face

58906
43:48:46,160 --> 43:48:54,384
lista consuma

58907
43:48:49,280 --> 43:48:57,104
mai multa memorie, nu? Dar dar

58908
43:48:54,384 --> 43:48:59,520
matrice în

58909
43:48:57,104 --> 43:49:03,360
numpy

58910
43:48:59,520 --> 43:49:06,000
sunt învecinate

58911
43:49:03,360 --> 43:49:10,080
ceea ce înseamnă

58912
43:49:06,000 --> 43:49:12,464
că ei nu

58913
43:49:10,080 --> 43:49:14,800
creați obiecte

58914
43:49:12,464 --> 43:49:18,000
ci mai degrabă

58915
43:49:14,800 --> 43:49:20,464
depozitați direct

58916
43:49:18,000 --> 43:49:22,384
datele

58917
43:49:20,464 --> 43:49:24,960
in

58918
43:49:22,384 --> 43:49:27,104
continuu

58919
43:49:24,960 --> 43:49:29,200
memorie

58920
43:49:27,104 --> 43:49:33,520
blocuri

58921
43:49:29,200 --> 43:49:39,104
unul după altul. Corect? De asemenea

58922
43:49:33,520 --> 43:49:42,560
tablourile sunt omogene în natură. Corect?

58923
43:49:39,104 --> 43:49:45,200
Puteți stoca doar datele omogene

58924
43:49:42,560 --> 43:49:47,104
în matrice spre deosebire de liste. În listă ai putea

58925
43:49:45,200 --> 43:49:49,600
stocați diferite tipuri de date.

58926
43:49:47,104 --> 43:49:52,384
Corect? Dar în matrice nu poți corecta.

58927
43:49:49,600 --> 43:49:55,200
trebuie să stocați același tip de date

58928
43:49:52,384 --> 43:49:58,880
în matrice omogenă. Deci este o

58929
43:49:55,200 --> 43:50:02,384
bloc de memorie contiguă care este sens

58930
43:49:58,880 --> 43:50:04,160
că puteți stoca datele în continuitate

58931
43:50:02,384 --> 43:50:06,880
drept unul după altul în memorie

58932
43:50:04,160 --> 43:50:08,880
bloc. Deci accesul este mai rapid

58933
43:50:06,880 --> 43:50:11,360
locația de memorie și memoria

58934
43:50:08,880 --> 43:50:13,664
eficienta este foarte mai mare drept ca

58935
43:50:11,360 --> 43:50:17,520
comparativ cu tipul de date nativ, cum ar fi

58936
43:50:13,664 --> 43:50:20,560
liste sau tpples în Python. Matrice

58937
43:50:17,520 --> 43:50:23,200
sunt practic

58938
43:50:20,560 --> 43:50:25,024
operatii vectorizate

58939
43:50:23,200 --> 43:50:27,024
corect voi vorbi despre vorbi despre to

58940
43:50:25,024 --> 43:50:29,360
tu cu vectori care sunt vectorii corect

58941
43:50:27,024 --> 43:50:34,240
sunt operaţiile vectorizate şi

58942
43:50:29,360 --> 43:50:41,440
sunt mult mai convenabile

58943
43:50:34,240 --> 43:50:44,880
pentru a face față în comparație cu lista

58944
43:50:41,440 --> 43:50:47,024
în Python chiar în listă trebuie să mergi

58945
43:50:44,880 --> 43:50:49,520
printr-o mulțime de bucle, nu? Am văzut

58946
43:50:47,024 --> 43:50:52,464
că trebuie să trecem prin listă

58947
43:50:49,520 --> 43:50:55,920
înţelegere. Dar vei vedea în

58948
43:50:52,464 --> 43:50:58,240
Python panda, scuze, în Python numpy,

58949
43:50:55,920 --> 43:51:00,320
operatiile vectorizate sunt foarte foarte

58950
43:50:58,240 --> 43:51:02,880
simplu, nu? Sunt foarte foarte

58951
43:51:00,320 --> 43:51:05,360
simplu, nu? Din nou, pentru toate acestea, eu

58952
43:51:02,880 --> 43:51:07,520
iti va da exemple, dar va da

58953
43:51:05,360 --> 43:51:12,920
ia ceva timp pentru că trebuie

58954
43:51:07,520 --> 43:51:12,920
înțelegi ce matrice sunt mai întâi, nu?

58955
43:51:13,024 --> 43:51:20,000
Bine. Apoi

58956
43:51:16,240 --> 43:51:22,560
cel mai important

58957
43:51:20,000 --> 43:51:26,160
alte pachete

58958
43:51:22,560 --> 43:51:28,560
care sunt panda,

58959
43:51:26,160 --> 43:51:30,384
mattplot lib,

58960
43:51:28,560 --> 43:51:32,000
obligațiune cb,

58961
43:51:30,384 --> 43:51:34,000
sklearn,

58962
43:51:32,000 --> 43:51:36,880
cypy

58963
43:51:34,000 --> 43:51:39,200
toate sunt scrise

58964
43:51:36,880 --> 43:51:40,720
deasupra

58965
43:51:39,200 --> 43:51:42,320
de

58966
43:51:40,720 --> 43:51:44,080
numpy

58967
43:51:42,320 --> 43:51:47,920
pachet.

58968
43:51:44,080 --> 43:51:50,880
Acesta este motivul pentru acest motiv

58969
43:51:47,920 --> 43:51:52,880
se numeste ca

58970
43:51:50,880 --> 43:51:54,560
fundamentale

58971
43:51:52,880 --> 43:51:56,640
pachet.

58972
43:51:54,560 --> 43:51:58,960
Toate celelalte pachete care fac dvs

58973
43:51:56,640 --> 43:52:02,960
viata mai usoara ca om de stiinta de date unde

58974
43:51:58,960 --> 43:52:05,744
nu trebuie să vă faceți griji pentru cod.

58975
43:52:02,960 --> 43:52:09,920
Toate aceste pachete

58976
43:52:05,744 --> 43:52:12,000
facem știința noastră a datelor

58977
43:52:09,920 --> 43:52:16,320
călătorie lină

58978
43:52:12,000 --> 43:52:22,080
pentru că trebuie să ne îngrijorăm

58979
43:52:16,320 --> 43:52:23,920
mai puțin despre cod și mai mult despre

58980
43:52:22,080 --> 43:52:26,960
logica.

58981
43:52:23,920 --> 43:52:29,200
Da. Deci pentru acestea pentru înțelegere

58982
43:52:26,960 --> 43:52:31,920
dintre aceste pachete este foarte important

58983
43:52:29,200 --> 43:52:35,920
că înțelegem numpy mai întâi și apoi

58984
43:52:31,920 --> 43:52:38,000
mergem înainte dreapta

58985
43:52:35,920 --> 43:52:40,464
acum

58986
43:52:38,000 --> 43:52:42,960
atunci hai să începem. Deci primul

58987
43:52:40,464 --> 43:52:46,320
pas dreapta primul pas pe care il ai

58988
43:52:42,960 --> 43:52:49,664
să vezi corect primul pas pe care tu

58989
43:52:46,320 --> 43:52:52,384
trebuie să vedeți în timp ce utilizați pachetul numpy este

58990
43:52:49,664 --> 43:52:54,560
practic de unde vei importa

58991
43:52:52,384 --> 43:52:56,320
pachetul chiar de unde veți importa

58992
43:52:54,560 --> 43:53:03,200
pachetul.

58993
43:52:56,320 --> 43:53:12,960
Deci pentru a importa pachetul num py scriem

58994
43:53:03,200 --> 43:53:17,840
import nump py ca np exact unde np

58995
43:53:12,960 --> 43:53:20,800
este un pseudonim drept este un pseudonim

58996
43:53:17,840 --> 43:53:23,024
corect, așa că vă rugăm să faceți acest import nump py

58997
43:53:20,800 --> 43:53:27,024
ca np

58998
43:53:23,024 --> 43:53:30,960
corect dacă nu obții niciun rezultat pentru

58999
43:53:27,024 --> 43:53:34,464
asta atunci poți scrie pip install

59000
43:53:30,960 --> 43:53:37,840
nump py right pip install nump py și

59001
43:53:34,464 --> 43:53:39,280
executați acest lucru exact când doriți

59002
43:53:37,840 --> 43:53:41,360
executa asta, iti va da asta

59003
43:53:39,280 --> 43:53:45,104
mesaj sau vă va da voi

59004
43:53:41,360 --> 43:53:47,200
descarcă acest pachet pentru tine right pip

59005
43:53:45,104 --> 43:53:49,024
reprezintă

59006
43:53:47,200 --> 43:53:52,464
piton

59007
43:53:49,024 --> 43:53:55,200
pachet index

59008
43:53:52,464 --> 43:53:59,440
corect

59009
43:53:55,200 --> 43:54:01,520
practic este ca un magazin de jocuri,

59010
43:53:59,440 --> 43:54:06,240
magazin de aplicații,

59011
43:54:01,520 --> 43:54:08,320
nu? Sau magazin Windows

59012
43:54:06,240 --> 43:54:10,960
pentru Python,

59013
43:54:08,320 --> 43:54:12,720
nu?

59014
43:54:10,960 --> 43:54:15,720
Deci, te duci doar la aceste Play

59015
43:54:12,720 --> 43:54:15,720
magazin,

59016
43:54:16,640 --> 43:54:21,104
Windows Store, App Store al dvs. Python

59017
43:54:19,280 --> 43:54:25,200
și cerându-le să descarce acest lucru pentru

59018
43:54:21,104 --> 43:54:28,000
tu, nu? Este numit și ca

59019
43:54:25,200 --> 43:54:30,320
manager de pachete

59020
43:54:28,000 --> 43:54:32,160
pip drept

59021
43:54:30,320 --> 43:54:35,840
dacă se face, puteți verifica și

59022
43:54:32,160 --> 43:54:38,080
versiune puteți spune np dot

59023
43:54:35,840 --> 43:54:40,160
versiunea

59024
43:54:38,080 --> 43:54:42,080
și vă va oferi versiunea de

59025
43:54:40,160 --> 43:54:45,080
numpy

59026
43:54:42,080 --> 43:54:45,080
corect

59027
43:54:47,664 --> 43:54:52,240
numpy este o sursă deschisă

59028
43:54:52,320 --> 43:54:58,240
pachet,

59029
43:54:54,160 --> 43:55:01,440
nu? Da, cam asta e. Da, este

59030
43:54:58,240 --> 43:55:05,840
un pachet open-source, oameni,

59031
43:55:01,440 --> 43:55:10,000
nu? Pachetul open source. Și dacă tu

59032
43:55:05,840 --> 43:55:12,080
vrei să vezi codul, poți accesa

59033
43:55:10,000 --> 43:55:15,664
GitHub.

59034
43:55:12,080 --> 43:55:18,384
Accesați Google, scrieți codul uh pentru

59035
43:55:15,664 --> 43:55:23,840
numpy. Îți va arăta pe GitHub.

59036
43:55:18,384 --> 43:55:25,440
Corect. făcut. Deci, să spunem că sunt bine, așa că eu

59037
43:55:23,840 --> 43:55:28,880
spune

59038
43:55:25,440 --> 43:55:30,800
avem când suntem atât de bine înainte de această permisiune

59039
43:55:28,880 --> 43:55:33,744
am ajuns la un pic de teorie înainte

59040
43:55:30,800 --> 43:55:36,880
Fac asta cu tine. Deci, băieți, am spus

59041
43:55:33,744 --> 43:55:40,200
acel num py

59042
43:55:36,880 --> 43:55:40,200
are matrice

59043
43:55:40,240 --> 43:55:45,744
ca

59044
43:55:43,104 --> 43:55:49,024
tip de date

59045
43:55:45,744 --> 43:55:52,640
dreapta si asta este scris pe C care

59046
43:55:49,024 --> 43:55:56,024
aleargă direct

59047
43:55:52,640 --> 43:55:56,024
pe hardware

59048
43:55:57,280 --> 43:56:05,104
de asemenea, această matrice numpy

59049
43:56:01,200 --> 43:56:07,664
practic este un vector,

59050
43:56:05,104 --> 43:56:09,440
nu? Practic este un vector. Acum,

59051
43:56:07,664 --> 43:56:14,880
ce este un vector, oameni buni? Ce este a

59052
43:56:09,440 --> 43:56:16,640
vector? Un vector este o mărime care are

59053
43:56:14,880 --> 43:56:20,104
semn

59054
43:56:16,640 --> 43:56:20,104
plus magnitudine,

59055
43:56:20,240 --> 43:56:25,520
nu? Are un semn și o magnitudine. Daca eu

59056
43:56:23,280 --> 43:56:32,080
spuneți că acesta este un spațiu de cartition, acesta este

59057
43:56:25,520 --> 43:56:37,440
Eu, acesta este J. Și spun că acesta este 3 eu

59058
43:56:32,080 --> 43:56:41,104
și 4 J dreapta 3 I cap 4 Jcap. Deci asta este

59059
43:56:37,440 --> 43:56:43,360
un vector dreapta și aceasta este direcția

59060
43:56:41,104 --> 43:56:46,640
baieti. Dacă ai studiat elementul

59061
43:56:43,360 --> 43:56:49,664
matematică ai ști asta.

59062
43:56:46,640 --> 43:56:52,640
Da, oameni buni, acesta este un vector. Dacă desenez

59063
43:56:49,664 --> 43:56:55,024
altul ca acesta

59064
43:56:52,640 --> 43:56:57,200
atunci acesta este un alt vector. Așa că voi face

59065
43:56:55,024 --> 43:57:01,440
numi asta spune

59066
43:56:57,200 --> 43:57:05,104
uh 2 I și 5 J. Da, acesta este altul

59067
43:57:01,440 --> 43:57:06,880
vector și acesta este dreptul teta. Aceasta

59068
43:57:05,104 --> 43:57:09,520
este direcția.

59069
43:57:06,880 --> 43:57:11,280
Aceasta este direcția. Și ce este

59070
43:57:09,520 --> 43:57:18,160
magnitudinea?

59071
43:57:11,280 --> 43:57:22,384
3 I 3² 4² care este 9 16 care este 25

59072
43:57:18,160 --> 43:57:25,840
sub rădăcină care este 5. Deci mărimea

59073
43:57:22,384 --> 43:57:29,200
de vector este cinci și direcția este egală

59074
43:57:25,840 --> 43:57:33,664
la theta. Aceasta este o mărime vectorială.

59075
43:57:29,200 --> 43:57:36,160
Acum ce este asta? Ce este asta? Aceasta este

59076
43:57:33,664 --> 43:57:41,800
un scalar.

59077
43:57:36,160 --> 43:57:41,800
Acesta este un scalar. Da. Numai magnitudinea

59078
43:57:43,520 --> 43:57:50,240
nu-i asa? Aceasta este doar magnitudinea scalară.

59079
43:57:46,464 --> 43:57:55,160
Și apoi am 2a 3. Nu? Aceasta este

59080
43:57:50,240 --> 43:57:55,160
ce? Acesta este un vector.

59081
43:57:55,520 --> 43:58:02,464
Are două dimensiuni

59082
43:57:58,384 --> 43:58:04,240
sau o singură dimensiune. Doar o dimensiune,

59083
43:58:02,464 --> 43:58:08,080
nu?

59084
43:58:04,240 --> 43:58:11,440
Acesta este un vector cu o dimensiune.

59085
43:58:08,080 --> 43:58:16,160
Da. Vector cu o singură dimensiune. Acum dacă spun

59086
43:58:11,440 --> 43:58:18,800
acest 2 3 4 5, cum se numește? Aceasta

59087
43:58:16,160 --> 43:58:20,560
se numește matrice,

59088
43:58:18,800 --> 43:58:25,000
nu? Corect? Aceasta se numește matrice

59089
43:58:20,560 --> 43:58:25,000
care este ce colecție de vectori

59090
43:58:27,024 --> 43:58:32,560
și această colecție de m vectori matrice

59091
43:58:29,440 --> 43:58:35,520
este numit bidimensional. Corect? Ea

59092
43:58:32,560 --> 43:58:41,000
este numit bidimensional.

59093
43:58:35,520 --> 43:58:41,000
Acum, dacă ai asta

59094
43:58:43,664 --> 43:58:48,960
astfel încât acestea sunt stivuite una în spatele celuilalt.

59095
43:58:47,200 --> 43:58:55,320
Acesta este unul. Acestea sunt două. Deci asta este

59096
43:58:48,960 --> 43:58:55,320
trei nu? Deci avem trei straturi

59097
43:58:55,600 --> 43:58:59,600
în matrice.

59098
43:58:58,080 --> 43:59:01,104
Deci câte dimensiuni vor fi acestea

59099
43:58:59,600 --> 43:59:03,520
oameni?

59100
43:59:01,104 --> 43:59:06,800
O dimensiune, două dimensiuni și trei

59101
43:59:03,520 --> 43:59:09,200
dimensiune. Aceasta este o trei dimensiuni

59102
43:59:06,800 --> 43:59:13,200
matrice,

59103
43:59:09,200 --> 43:59:16,800
nu? Sau vector tridimensional

59104
43:59:13,200 --> 43:59:19,840
sau matrice tridimensională.

59105
43:59:16,800 --> 43:59:22,080
O sa repet inca o data. Ce este un single

59106
43:59:19,840 --> 43:59:24,800
valoare? O singură valoare este numită a

59107
43:59:22,080 --> 43:59:27,520
scalar. Corect? Are doar amploare.

59108
43:59:24,800 --> 43:59:29,840
Acum, când ai mai multe valori,

59109
43:59:27,520 --> 43:59:32,080
nu? Acesta se numește vector. Ea

59110
43:59:29,840 --> 43:59:36,880
are o direcție. Are o amploare. Şi

59111
43:59:32,080 --> 43:59:40,160
aceasta este o singură dimensiune. Acum multiple

59112
43:59:36,880 --> 43:59:43,360
vectori chiar așa sau poate puteți

59113
43:59:40,160 --> 43:59:44,640
spune asa, nu? ești tu

59114
43:59:43,360 --> 43:59:46,080
înțelegând de ce îl numesc unul

59115
43:59:44,640 --> 43:59:48,320
dimensiune? Poate fi fie asta

59116
43:59:46,080 --> 43:59:51,024
dimensiune sau poate fi această dimensiune.

59117
43:59:48,320 --> 43:59:54,160
În orice dimensiune stivuiți doi vectori,

59118
43:59:51,024 --> 43:59:56,160
îți vei obține o matrice. Corect?

59119
43:59:54,160 --> 44:00:00,464
Vă veți obține o matrice care este

59120
43:59:56,160 --> 44:00:03,104
acum două dimensiuni. Are rânduri și el

59121
44:00:00,464 --> 44:00:04,800
are coloane.

59122
44:00:03,104 --> 44:00:09,024
Corect?

59123
44:00:04,800 --> 44:00:13,104
Acum, dacă stivuiți mai multe astfel de matrice

59124
44:00:09,024 --> 44:00:16,464
unul după altul, nu? Aceasta devine un

59125
44:00:13,104 --> 44:00:19,104
matrice tridimensională. Și asta poate merge

59126
44:00:16,464 --> 44:00:21,200
pana la cate dimensiuni oameni? Cum

59127
44:00:19,104 --> 44:00:25,520
la multe dimensiuni se poate ajunge? Ea

59128
44:00:21,200 --> 44:00:27,200
poate merge până la asta

59129
44:00:25,520 --> 44:00:32,640
poate

59130
44:00:27,200 --> 44:00:35,360
merge până la n dimensiuni,

59131
44:00:32,640 --> 44:00:37,920
nu? N dimensiuni,

59132
44:00:35,360 --> 44:00:40,720
nu? Deci acum îl înțelegem? De ce noi

59133
44:00:37,920 --> 44:00:42,560
numiți-o ND

59134
44:00:40,720 --> 44:00:47,560
matrice?

59135
44:00:42,560 --> 44:00:47,560
Da, matrice n dimensiuni,

59136
44:00:48,880 --> 44:00:52,464
nu? De aceea numim ceva

59137
44:00:50,640 --> 44:00:55,360
ce?

59138
44:00:52,464 --> 44:00:57,280
Corect. N matrice dimensiuni. Suntem doar

59139
44:00:55,360 --> 44:00:59,840
capabil să vizualizeze trei dimensiuni

59140
44:00:57,280 --> 44:01:03,024
oameni. Poate ajunge până la 100 de dimensiuni,

59141
44:00:59,840 --> 44:01:04,960
500 de dimensiuni, 1.000 de dimensiuni, oricare

59142
44:01:03,024 --> 44:01:07,360
dimensiuni.

59143
44:01:04,960 --> 44:01:10,960
Scala sunt cele mai puțin importante.

59144
44:01:07,360 --> 44:01:13,960
vectorii sunt mai importanți. Deci acum noi

59145
44:01:10,960 --> 44:01:13,960
au

59146
44:01:14,240 --> 44:01:19,360
multiple

59147
44:01:15,840 --> 44:01:22,360
dimensiuni in

59148
44:01:19,360 --> 44:01:22,360
matrice

59149
44:01:23,744 --> 44:01:29,200
și anume 0D,

59150
44:01:26,640 --> 44:01:36,384
1D,

59151
44:01:29,200 --> 44:01:40,240
2D, 3D și așa mai departe până la N D, nu? NV

59152
44:01:36,384 --> 44:01:42,080
matrice. Acum să creăm primul nostru

59153
44:01:40,240 --> 44:01:47,744
matrice. Corect? Să creăm primul nostru

59154
44:01:42,080 --> 44:01:50,744
matrice. Și acesta va fi zero

59155
44:01:47,744 --> 44:01:50,744
dimensiune

59156
44:01:52,640 --> 44:02:00,560
matrice, nu? Matrice cu dimensiuni zero. Cum

59157
44:01:55,440 --> 44:02:05,280
vei crea asta? Vei spune un r0

59158
44:02:00,560 --> 44:02:07,520
este egal cu np dot array și veți

59159
44:02:05,280 --> 44:02:11,024
menționați ce este o valoare scalară. Ce este

59160
44:02:07,520 --> 44:02:13,840
o valoare scalară? Este o valoare simplă. eu

59161
44:02:11,024 --> 44:02:17,440
spune două, nu? np matrice de puncte egal cu

59162
44:02:13,840 --> 44:02:22,464
două. Și când vei verifica acum sau

59163
44:02:17,440 --> 44:02:27,920
tipăriți tipul de ar r0, va spune

59164
44:02:22,464 --> 44:02:30,464
tu clasa num py nd matrice. Corect? Este

59165
44:02:27,920 --> 44:02:33,280
o matrice cu dimensiune zero. Și dacă vrei

59166
44:02:30,464 --> 44:02:35,520
a verifica

59167
44:02:33,280 --> 44:02:41,960
dimensiunea,

59168
44:02:35,520 --> 44:02:41,960
trebuie doar să scrii un r0 dot end div,

59169
44:02:43,200 --> 44:02:48,960
nu? Și îți arată că există

59170
44:02:46,000 --> 44:02:54,720
dimensiuni zero prezente. Deci ce este asta

59171
44:02:48,960 --> 44:02:58,080
pe scurt? Acesta este un scalar. am

59172
44:02:54,720 --> 44:02:59,920
a introdus o singură valoare oameni 2 200 500

59173
44:02:58,080 --> 44:03:04,000
orice vrei sa intri. Iar cel

59174
44:02:59,920 --> 44:03:06,720
sintaxa este np dot array np dot array.

59175
44:03:04,000 --> 44:03:10,240
Instruiți pachetul nump py să

59176
44:03:06,720 --> 44:03:14,000
preluați matricea funcției din matricea metodei

59177
44:03:10,240 --> 44:03:18,000
și transformă acest lucru în acel anume

59178
44:03:14,000 --> 44:03:20,640
tip de date matrice dreapta zero

59179
44:03:18,000 --> 44:03:22,560
iar când verificați tipul tip este nd

59180
44:03:20,640 --> 44:03:24,720
matrice, dar care este dimensiunea acesteia

59181
44:03:22,560 --> 44:03:29,520
nd matrice aceasta este zero, ceea ce este nimic

59182
44:03:24,720 --> 44:03:32,560
dar un drept scalar am creat asta

59183
44:03:29,520 --> 44:03:35,560
asta am creat noi

59184
44:03:32,560 --> 44:03:35,560
Corect

59185
44:03:35,664 --> 44:03:44,200
acum baieti,

59186
44:03:38,320 --> 44:03:44,200
dacă am creat această listă, nu?

59187
44:03:45,360 --> 44:03:50,440
Să spunem că Lis este egal cu

59188
44:03:50,560 --> 44:03:55,664
Da. Deci asta era o listă,

59189
44:03:53,840 --> 44:03:59,440
nu? Aceasta a fost o listă și asta a fost asta

59190
44:03:55,664 --> 44:04:01,440
este ce oameni ce este asta ce avem

59191
44:03:59,440 --> 44:04:03,744
tocmai a studiat în conformitate cu asta? Ce

59192
44:04:01,440 --> 44:04:06,880
dimensiunea este aceasta lista?

59193
44:04:03,744 --> 44:04:09,664
Deci ceea ce încerc să fac este că o voi face

59194
44:04:06,880 --> 44:04:13,960
creați o

59195
44:04:09,664 --> 44:04:13,960
o singură afacere

59196
44:04:14,080 --> 44:04:22,240
matrice cu o sau să spunem dintr-o listă

59197
44:04:20,000 --> 44:04:26,360
bine, hai să-ți arăt cum ne descurcăm

59198
44:04:22,240 --> 44:04:26,360
asta in regula

59199
44:04:29,520 --> 44:04:34,240
asa spun eu

59200
44:04:31,664 --> 44:04:36,240
grăbește-te să citești numele erorii ar nu

59201
44:04:34,240 --> 44:04:41,920
definit. De ce? Pentru că tu ai creat

59202
44:04:36,240 --> 44:04:43,600
tablou de la a a r0. Hai grabeste-te.

59203
44:04:41,920 --> 44:04:44,960
Corect.

59204
44:04:43,600 --> 44:04:46,960
Voi crea o matrice unidimensională.

59205
44:04:44,960 --> 44:04:51,440
Cum o să fac oamenii ăia? voi spune a

59206
44:04:46,960 --> 44:04:55,104
ar r1 este egal cu np matrice de puncte. Și poate

59207
44:04:51,440 --> 44:04:58,560
Trec o listă 1D înăuntru? Sau pot spune

59208
44:04:55,104 --> 44:05:01,600
Pot trece lis înăuntrul asta? Când o fac

59209
44:04:58,560 --> 44:05:05,360
acești oameni văd acum ce se va întâmpla. A

59210
44:05:01,600 --> 44:05:07,664
R R1 va fi egal cu acest drept si daca

59211
44:05:05,360 --> 44:05:08,000
tu spui lasă-mă să spun print a ar a ar a ar

59212
44:05:07,664 --> 44:05:10,080
a ar a ar a ar a ar a ar a ar a ar a ar

59213
44:05:08,000 --> 44:05:15,280
r r r r r r r r r r r r r r r r r r r1

59214
44:05:10,080 --> 44:05:19,880
va fi așa, bine acesta este al tău

59215
44:05:15,280 --> 44:05:19,880
a ar r r1 dot nim

59216
44:05:20,000 --> 44:05:26,464
vei vedea că îți dă un drept

59217
44:05:22,464 --> 44:05:29,280
acesta este o matrice unidimensională

59218
44:05:26,464 --> 44:05:29,280
matrice de dimensiuni

59219
44:05:43,104 --> 44:05:49,744
Da. Deci de exemplu

59220
44:05:45,664 --> 44:05:53,360
când spun scalar corect când spun

59221
44:05:49,744 --> 44:05:58,560
scalar zic eu

59222
44:05:53,360 --> 44:06:02,080
35 de ani nu? când spun vector

59223
44:05:58,560 --> 44:06:03,600
1D spun eu

59224
44:06:02,080 --> 44:06:06,640
uh

59225
44:06:03,600 --> 44:06:09,520
deci acestea sunt semnele mele

59226
44:06:06,640 --> 44:06:11,360
acum zic 35

59227
44:06:09,520 --> 44:06:16,240
40

59228
44:06:11,360 --> 44:06:19,920
50 chiar acum, care sunt aceste note mele

59229
44:06:16,240 --> 44:06:22,384
la trei materii

59230
44:06:19,920 --> 44:06:26,640
da note la trei materii, acesta este al meu

59231
44:06:22,384 --> 44:06:29,664
spune Hindi, aceasta este engleză și asta este

59232
44:06:26,640 --> 44:06:32,000
matematică corect sau să spunem știință pentru că

59233
44:06:29,664 --> 44:06:34,880
nu toată lumea are limba engleză științifică hindi

59234
44:06:32,000 --> 44:06:37,200
și matematică, băieți acum, dacă trebuie

59235
44:06:34,880 --> 44:06:40,464
creați o matrice

59236
44:06:37,200 --> 44:06:43,280
de două dimensiuni ce voi scrie așa

59237
44:06:40,464 --> 44:06:47,360
asta înseamnă că acesta este un student

59238
44:06:43,280 --> 44:06:50,320
un om student nu este băieți da nu

59239
44:06:47,360 --> 44:06:53,664
poate că acum în matrice vom avea ce

59240
44:06:50,320 --> 44:06:53,664
vom avea mai mulți studenți

59241
44:06:55,360 --> 44:07:00,240
Da. Nu. Poate într-o matrice oamenii noi

59242
44:06:58,160 --> 44:07:03,024
va avea mai mulți studenți. Să presupunem

59243
44:07:00,240 --> 44:07:08,080
acesta a fost S1. Acum veți avea S_sub_1,

59244
44:07:03,024 --> 44:07:10,320
S_UB_2, S3, S4 le place asta.

59245
44:07:08,080 --> 44:07:14,160
Și fiecare elev va avea propriile sale

59246
44:07:10,320 --> 44:07:18,744
lista individuală de note. Asa pot spune

59247
44:07:14,160 --> 44:07:18,744
că fac o listă imbricată?

59248
44:07:19,664 --> 44:07:27,880
Pot să spun că oamenii? fac o

59249
44:07:21,920 --> 44:07:27,880
listă imbricată. Deci acum hai să facem totul bine

59250
44:07:28,320 --> 44:07:36,600
de la a

59251
44:07:31,520 --> 44:07:36,600
listă imbricată. Bine, o listă imbricată.

59252
44:07:36,720 --> 44:07:41,280
Deci, ar r2 este egal cu matricea np

59253
44:07:39,920 --> 44:07:45,200
lista. Va trebui să fac o listă

59254
44:07:41,280 --> 44:07:47,104
primul. Lis2 este egal cu. Deci acesta este al meu

59255
44:07:45,200 --> 44:07:49,664
prima paranteză. Ce este acest parantez

59256
44:07:47,104 --> 44:07:51,360
reprezentand? acest parantez mai mare. Acum eu

59257
44:07:49,664 --> 44:07:54,800
va pune o altă paranteză în interiorul acesteia și

59258
44:07:51,360 --> 44:07:58,080
Voi scrie 1 1 22 33 3. Voi pune a

59259
44:07:54,800 --> 44:07:59,744
iar virgulă. Scrie o virgulă. Atunci o voi face

59260
44:07:58,080 --> 44:08:05,840
spune

59261
44:07:59,744 --> 44:08:09,744
4455 666 virgula 778899

59262
44:08:05,840 --> 44:08:13,240
corect, voi face asta chiar acum, voi spune

59263
44:08:09,744 --> 44:08:13,240
lista la

59264
44:08:13,360 --> 44:08:16,360
doi

59265
44:08:20,320 --> 44:08:25,664
când vei face asta vei vedea că

59266
44:08:22,384 --> 44:08:28,080
a fost creată o matrice ca aceasta

59267
44:08:25,664 --> 44:08:30,384
nu?

59268
44:08:28,080 --> 44:08:34,160
ca asta AR R2

59269
44:08:30,384 --> 44:08:36,240
corect acest lucru a fost creat chiar atunci când

59270
44:08:34,160 --> 44:08:40,720
verificăm dimensiunea este două

59271
44:08:36,240 --> 44:08:43,200
matrice de dimensiuni dreapta

59272
44:08:40,720 --> 44:08:46,464
da, notele a trei elevi diferiți

59273
44:08:43,200 --> 44:08:49,200
la trei subiecte diferite

59274
44:08:46,464 --> 44:08:51,280
și aceasta este aceeași tehnică pe care o poți

59275
44:08:49,200 --> 44:08:52,560
creați o matrice tridimensională cum va

59276
44:08:51,280 --> 44:08:54,800
creați o matrice tridimensională

59277
44:08:52,560 --> 44:08:56,560
oameni

59278
44:08:54,800 --> 44:08:59,024
dacă merg aici cum vei crea un

59279
44:08:56,560 --> 44:09:03,024
matrice tridimensională

59280
44:08:59,024 --> 44:09:04,640
Acum să presupunem că am date în asta și asta

59281
44:09:03,024 --> 44:09:08,560
este lista mea principală. Bine, acesta este al meu

59282
44:09:04,640 --> 44:09:13,240
lista principală. În asta am date

59283
44:09:08,560 --> 44:09:13,240
iar aceasta poate fi reprezentată astfel.

59284
44:09:14,320 --> 44:09:21,024
Acesta este al meu

59285
44:09:16,464 --> 44:09:24,920
prima matrice, nu? Și acesta este

59286
44:09:21,024 --> 44:09:24,920
vector în interiorul acestuia

59287
44:09:26,240 --> 44:09:34,080
V_sub_1, V_sub_2, V3.

59288
44:09:29,920 --> 44:09:37,024
Apoi aceasta poate fi numită M1. Și acum

59289
44:09:34,080 --> 44:09:40,160
pentru a crea o configurație tridimensională, cum

59290
44:09:37,024 --> 44:09:44,640
ai nevoie de multe M1? Ai nevoie de mai multe

59291
44:09:40,160 --> 44:09:48,640
M1s, nu-i așa? Ai nevoie de M1, M2, M3,

59292
44:09:44,640 --> 44:09:54,800
matrice multiplă ca acest oameni.

59293
44:09:48,640 --> 44:09:57,920
ca aceasta matrice 1, matrice 2, matrice 3.

59294
44:09:54,800 --> 44:10:00,384
Deci ce vei face? te vei avea

59295
44:09:57,920 --> 44:10:04,464
ce oameni vor avea?

59296
44:10:00,384 --> 44:10:07,600
Vei avea un alt galben, nu?

59297
44:10:04,464 --> 44:10:11,160
Și vei avea înăuntru acest galben

59298
44:10:07,600 --> 44:10:11,160
multiple violete.

59299
44:10:12,160 --> 44:10:18,920
nu-i aşa?

59300
44:10:13,920 --> 44:10:18,920
nu? Din nou așa.

59301
44:10:27,200 --> 44:10:35,600
Da. Așa o să aveți oameni.

59302
44:10:31,024 --> 44:10:41,024
Așa că pot spune că oamenii pot să spun asta ca mine

59303
44:10:35,600 --> 44:10:44,024
cresc dimensiunile ca mine

59304
44:10:41,024 --> 44:10:44,024
crescând

59305
44:10:46,000 --> 44:10:49,320
dimensiunile

59306
44:10:49,360 --> 44:10:58,080
Pun 1D scuze 0D corect și bine

59307
44:10:54,464 --> 44:11:00,320
din nou în acest V_sub_1 în acest V_sub1 face

59308
44:10:58,080 --> 44:11:04,520
crezi că vei avea mai multe scaler

59309
44:11:00,320 --> 44:11:04,520
oamenii pot spune asta

59310
44:11:05,200 --> 44:11:13,280
pot spune că mai mulți scalatori creează o

59311
44:11:08,640 --> 44:11:15,840
vectori multiplii vectori creează o matrice

59312
44:11:13,280 --> 44:11:18,320
Și mai multe matrice creează una

59313
44:11:15,840 --> 44:11:21,520
matrice tridimensională.

59314
44:11:18,320 --> 44:11:24,720
Pot să spun asta? Lasă-mă să vorbesc cu tine despre

59315
44:11:21,520 --> 44:11:30,880
o imagine. Corect?

59316
44:11:24,720 --> 44:11:33,280
Imagine, nu? Ce este alcătuită o imagine

59317
44:11:30,880 --> 44:11:37,384
de oameni?

59318
44:11:33,280 --> 44:11:37,384
Din ce este alcătuită o imagine?

59319
44:11:38,384 --> 44:11:44,000
H

59320
44:11:41,200 --> 44:11:44,000
pixeli.

59321
44:11:44,384 --> 44:11:52,080
Da sau nu? nu,

59322
44:11:47,280 --> 44:11:54,960
nu rame. Frames sunt în principiu videoclipuri.

59323
44:11:52,080 --> 44:11:58,080
Pixelii creează o imagine, nu? Deci,

59324
44:11:54,960 --> 44:12:04,560
câți pixeli avem aici? 1 2 1 2 3

59325
44:11:58,080 --> 44:12:06,320
4 5 6 7 8 9 10 11 12 13 14 15 16. Nu?

59326
44:12:04,560 --> 44:12:08,800
Să presupunem

59327
44:12:06,320 --> 44:12:13,520
acesta este un vector, nu? Acesta este unul

59328
44:12:08,800 --> 44:12:15,744
vector și acesta este un scalar

59329
44:12:13,520 --> 44:12:18,000
nu? Scalar 1, scalar 2, scalar 3,

59330
44:12:15,744 --> 44:12:20,240
scalar 4. Și aceasta va face vector

59331
44:12:18,000 --> 44:12:24,560
v_sub1.

59332
44:12:20,240 --> 44:12:28,560
Acesta este v_sub_2, v_ub3, v4. Și împreună

59333
44:12:24,560 --> 44:12:30,960
împreună pot numi asta m_sub_1 și

59334
44:12:28,560 --> 44:12:33,744
numi asta albastru?

59335
44:12:30,960 --> 44:12:35,664
Deci pentru o imagine colorată, câte

59336
44:12:33,744 --> 44:12:37,920
canale sunt oameni? Câte

59337
44:12:35,664 --> 44:12:41,104
canale sunt acolo? Cum o numim?

59338
44:12:37,920 --> 44:12:43,440
O numim imaginea ca

59339
44:12:41,104 --> 44:12:45,600
RGB

59340
44:12:43,440 --> 44:12:48,160
Imagine RGB

59341
44:12:45,600 --> 44:12:50,160
asta inseamna rosu,

59342
44:12:48,160 --> 44:12:52,000
verde,

59343
44:12:50,160 --> 44:12:55,280
albastru.

59344
44:12:52,000 --> 44:12:58,080
Deci aceasta este partea albastră. Deci la fel și tu

59345
44:12:55,280 --> 44:13:01,520
va avea o parte roșie în față.

59346
44:12:58,080 --> 44:13:04,960
Atunci vei avea o parte verde și apoi

59347
44:13:01,520 --> 44:13:07,280
în sfârșit vei avea o parte albastră. Da.

59348
44:13:04,960 --> 44:13:09,920
Înțelegeți băieți? De ce noi

59349
44:13:07,280 --> 44:13:12,880
necesită matrice tridimensionale?

59350
44:13:09,920 --> 44:13:15,600
Da. Să presupunem că acum doriți să faceți o

59351
44:13:12,880 --> 44:13:18,160
schimbare la acest pixel. Deci vei face

59352
44:13:15,600 --> 44:13:20,160
mergi la al treilea strat care este albastru

59353
44:13:18,160 --> 44:13:22,640
strat. Apoi vei trece la a treia

59354
44:13:20,160 --> 44:13:24,720
coloana. Veți merge la a treia coloană

59355
44:13:22,640 --> 44:13:28,080
și al treilea rând. Și așa vei face

59356
44:13:24,720 --> 44:13:29,600
ajunge la acest pixel. Toată lumea? Da. Nu.

59357
44:13:28,080 --> 44:13:32,640
Poate.

59358
44:13:29,600 --> 44:13:36,240
Da. Deci acesta este motivul pentru care avem nevoie

59359
44:13:32,640 --> 44:13:39,024
pentru a crea o matrice 3D.

59360
44:13:36,240 --> 44:13:41,440
Corect. Pentru a ingera informații ca aceasta,

59361
44:13:39,024 --> 44:13:47,960
nu? Pentru a ingera astfel de informații.

59362
44:13:41,440 --> 44:13:47,960
Deci putem crea și o matrice 3D. Corect.

59363
44:13:50,800 --> 44:13:54,464
Corect. Și cum ți-am spus? Câte

59364
44:13:52,384 --> 44:13:56,320
paranteze voi avea? Paranteze pătrate.

59365
44:13:54,464 --> 44:14:00,640
Voi avea trei paranteze drepte. Deci

59366
44:13:56,320 --> 44:14:04,000
acum acesta este doar un student.

59367
44:14:00,640 --> 44:14:06,000
Corect. Acum voi pune o virgulă aici.

59368
44:14:04,000 --> 44:14:09,384
Corect? Bine, voi pune o virgulă aici și

59369
44:14:06,000 --> 44:14:09,384
voi începe.

59370
44:14:14,160 --> 44:14:19,024
Corect, voi face asta. Voi spune această listă

59371
44:14:17,104 --> 44:14:21,280
trei

59372
44:14:19,024 --> 44:14:24,384
un r3

59373
44:14:21,280 --> 44:14:26,160
lista trei ar r r3

59374
44:14:24,384 --> 44:14:29,160
un r3

59375
44:14:26,160 --> 44:14:29,160
r

59376
44:14:29,200 --> 44:14:33,840
iar acum vei vedea că există o

59377
44:14:31,024 --> 44:14:37,160
matrice tridimensională

59378
44:14:33,840 --> 44:14:37,160
corect baieti

59379
44:14:42,080 --> 44:14:46,720
corect acesta este un tridimensional

59380
44:14:44,464 --> 44:14:46,720
matrice

59381
44:14:51,280 --> 44:14:57,384
Da. Merg mai departe. Există mai multe moduri

59382
44:14:57,920 --> 44:15:03,440
creați matrice, nu? Primul noi

59383
44:15:01,200 --> 44:15:05,840
au făcut.

59384
44:15:03,440 --> 44:15:08,080
Așa am făcut

59385
44:15:05,840 --> 44:15:11,440
din liste.

59386
44:15:08,080 --> 44:15:13,920
Din lista am făcut-o.

59387
44:15:11,440 --> 44:15:19,104
Apoi va fi al doilea

59388
44:15:13,920 --> 44:15:22,240
de la uh putem crea o matrice zero

59389
44:15:19,104 --> 44:15:24,880
corect putem crea

59390
44:15:22,240 --> 44:15:31,080
matricea lui on

59391
44:15:24,880 --> 44:15:31,080
chiar atunci putem crea o matrice personalizată

59392
44:15:31,440 --> 44:15:38,640
corect iti voi arata toate astea

59393
44:15:36,640 --> 44:15:41,104
corect, îți voi arăta toate astea, așa că haideți

59394
44:15:38,640 --> 44:15:44,360
începe cu matricea pornit scuze zero

59395
44:15:41,104 --> 44:15:44,360
acele matrice

59396
44:15:44,800 --> 44:15:50,240
corect ce ai de facut trebuie

59397
44:15:47,200 --> 44:15:52,960
scrie deci să zicem zero

59398
44:15:50,240 --> 44:15:56,384
ar r r0 bine o matrice zero dimensiune zero

59399
44:15:52,960 --> 44:15:58,960
deci spui np dot zeros

59400
44:15:56,384 --> 44:16:03,000
corect și tu creezi

59401
44:15:58,960 --> 44:16:03,000
un doi

59402
44:16:03,024 --> 44:16:10,240
corect

59403
44:16:04,800 --> 44:16:12,320
a doua dreapta si daca spun

59404
44:16:10,240 --> 44:16:14,320
uh 0

59405
44:16:12,320 --> 44:16:17,664
capăt punct

59406
44:16:14,320 --> 44:16:20,160
corect, vei vedea că este o singură dimensiune

59407
44:16:17,664 --> 44:16:24,384
matrice

59408
44:16:20,160 --> 44:16:28,384
corect este o matrice unidimensională

59409
44:16:24,384 --> 44:16:31,200
corect, așa că doi este implicit luat ca așa

59410
44:16:28,384 --> 44:16:33,104
lasă-mă să îți arăt asta

59411
44:16:31,200 --> 44:16:34,880
va arăta așa corect este luat

59412
44:16:33,104 --> 44:16:37,360
ca orizontal care este dimensiunea

59413
44:16:34,880 --> 44:16:39,520
acest tip un vector care este dimensiunea

59414
44:16:37,360 --> 44:16:43,024
a acestui vector

59415
44:16:39,520 --> 44:16:46,320
nu nu este 1. Practic este 2 1,

59416
44:16:43,024 --> 44:16:50,384
nu? 2a 1.

59417
44:16:46,320 --> 44:16:53,744
Scuze, 1 virgulă 2. Păi.

59418
44:16:50,384 --> 44:16:57,440
1 virgula 2. Nu-i asa? Acum, ce dacă tu

59419
44:16:53,744 --> 44:17:00,880
a trebuit să creeze un 2 1? Ce? Dacă tu

59420
44:16:57,440 --> 44:17:03,280
a trebuit să creeze un 2 1? Corect? Deci, lasă-mă

59421
44:17:00,880 --> 44:17:07,880
doar arată-ți asta.

59422
44:17:03,280 --> 44:17:07,880
Deci, eu zic să așteptați

59423
44:17:08,880 --> 44:17:12,600
ca asta. Bine.

59424
44:17:13,280 --> 44:17:20,320
Acum, când fac asta, spun a ar r r o dată

59425
44:17:17,360 --> 44:17:26,240
si spun aici

59426
44:17:20,320 --> 44:17:30,600
2, 1, nu? Eu zic 2a 1. Acum vei face

59427
44:17:26,240 --> 44:17:30,600
vezi oamenii ce se va întâmpla cu asta.

59428
44:17:31,840 --> 44:17:37,104
Acum

59429
44:17:33,664 --> 44:17:39,520
pentru că ați creat dreptul specificat

59430
44:17:37,104 --> 44:17:41,920
doua dimensiuni, nu? Ce va fi asta

59431
44:17:39,520 --> 44:17:45,440
convertit la acum?

59432
44:17:41,920 --> 44:17:48,000
H în ce se va converti asta? Aceasta

59433
44:17:45,440 --> 44:17:49,744
va fi convertit în

59434
44:17:48,000 --> 44:17:52,720
a

59435
44:17:49,744 --> 44:17:56,800
vector bidimensional. Implicit, a fost

59436
44:17:52,720 --> 44:18:00,384
asta, nu? Care a fost acest vector,

59437
44:17:56,800 --> 44:18:01,664
nu? În mod implicit, era acest vector,

59438
44:18:00,384 --> 44:18:04,800
nu? Care este dimensiunea acestui lucru

59439
44:18:01,664 --> 44:18:08,240
vector? 1 câte valori pui

59440
44:18:04,800 --> 44:18:10,880
aici, nu? 1 2 ca asta. Așa că sunăm

59441
44:18:08,240 --> 44:18:13,200
aceasta doar o dimensiune. Noi numim asta

59442
44:18:10,880 --> 44:18:18,160
doar o dimensiune. Dar acum când voi face

59443
44:18:13,200 --> 44:18:22,520
rulați pe acesta, veți vedea da 2 1.

59444
44:18:18,160 --> 44:18:22,520
Și acum vei vedea că asta este

59445
44:18:22,560 --> 44:18:27,600
două dimensiuni, nu? Vezi tu că asta este

59446
44:18:24,384 --> 44:18:29,840
două dimensiuni. Acum clar oamenii doar

59447
44:18:27,600 --> 44:18:31,840
orientarea s-a schimbat. Dar acum vezi

59448
44:18:29,840 --> 44:18:33,840
parantezele există acum două paranteze

59449
44:18:31,840 --> 44:18:36,320
pentru că ce ai instruit acum?

59450
44:18:33,840 --> 44:18:40,640
Acum ați instruit Python și

59451
44:18:36,320 --> 44:18:42,960
mai degrabă numpy pentru a crea vectorul ca 2  

59452
44:18:40,640 --> 44:18:45,104
1. Deci ai spus să-mi dai acest zero

59453
44:18:42,960 --> 44:18:47,664
și dă-mi acest zero aici. Deci

59454
44:18:45,104 --> 44:18:52,464
în momentul în care faci asta, acum ești

59455
44:18:47,664 --> 44:18:58,240
specificând rândurile și coloanele.

59456
44:18:52,464 --> 44:19:00,960
Acum, acest 21 drept, să spunem că acesta este 21.

59457
44:18:58,240 --> 44:19:02,960
Acum permiteți-mi să creez o altă cruce cu două

59458
44:19:00,960 --> 44:19:05,360
matrice bidimensională pentru tine. Lasă-mă

59459
44:19:02,960 --> 44:19:07,440
suna asta 10

59460
44:19:05,360 --> 44:19:10,560
virgula 10. Nu? Deci câte rânduri și

59461
44:19:07,440 --> 44:19:13,024
coloane va avea oameni?

59462
44:19:10,560 --> 44:19:16,600
Câte rânduri și coloane va avea?

59463
44:19:13,024 --> 44:19:16,600
Eu zic 21.

59464
44:19:19,360 --> 44:19:27,104
Va avea 10 rânduri și 10 coloane

59465
44:19:22,960 --> 44:19:31,280
aceasta. Ai văzut asta? Da. 10 rânduri și 10

59466
44:19:27,104 --> 44:19:33,664
coloane. Corect?

59467
44:19:31,280 --> 44:19:35,744
În mod implicit, este 1 2 așa. Este

59468
44:19:33,664 --> 44:19:37,664
un vector unidimensional și acesta este a

59469
44:19:35,744 --> 44:19:42,160
vector bidimensional. Ce zici de a

59470
44:19:37,664 --> 44:19:45,104
vector tridimensional? 0 punct 0

59471
44:19:42,160 --> 44:19:48,720
uh a ar r3

59472
44:19:45,104 --> 44:19:50,240
este egal cu np zerouri de puncte, nu? np

59473
44:19:48,720 --> 44:19:53,240
do.zer,

59474
44:19:50,240 --> 44:19:53,240
nu?

59475
44:19:54,080 --> 44:20:02,384
H ar trebui să scriu doar 3a 3a 3? si eu

59476
44:19:59,360 --> 44:20:06,240
ar trebui să verifice asta.

59477
44:20:02,384 --> 44:20:08,960
Da, vei avea un vector 3 3 3 3

59478
44:20:06,240 --> 44:20:13,104
matrice cu trei matrice stivuite în spate

59479
44:20:08,960 --> 44:20:18,280
unul pe altul. Corect? Dacă spun patru, asta

59480
44:20:13,104 --> 44:20:18,280
vor fi patru. Deci cum citim asta?

59481
44:20:20,640 --> 44:20:30,320
numărul de straturi,

59482
44:20:24,560 --> 44:20:32,640
numărul de rânduri și numărul de coloane.

59483
44:20:30,320 --> 44:20:35,104
Deci, mă puteți ajuta cu o sintaxă? Can

59484
44:20:32,640 --> 44:20:40,080
mă ajutați cu o sintaxă care poate

59485
44:20:35,104 --> 44:20:42,320
creează-mi o matrice 3D de cinci straturi,

59486
44:20:40,080 --> 44:20:44,720
trei rânduri și trei coloane? Ce va

59487
44:20:42,320 --> 44:20:46,320
scriu?

59488
44:20:44,720 --> 44:20:50,744
Cinci straturi, trei rânduri și trei

59489
44:20:46,320 --> 44:20:50,744
coloane. ce voi scrie?

59490
44:20:53,440 --> 44:21:02,320
5 33. Da, vei primi cinci straturi. 1 2

59491
44:20:57,440 --> 44:21:06,160
3 4 5 chiar așa. Să presupunem

59492
44:21:02,320 --> 44:21:08,240
trebuie să reprezinte

59493
44:21:06,160 --> 44:21:10,880
o imagine

59494
44:21:08,240 --> 44:21:13,360
cu

59495
44:21:10,880 --> 44:21:15,744
cu spune

59496
44:21:13,360 --> 44:21:18,744
Canal RGB

59497
44:21:15,744 --> 44:21:18,744
şi

59498
44:21:19,600 --> 44:21:29,200
să zicem 256 și 256 pixeli. Cum vei face

59499
44:21:24,640 --> 44:21:32,720
creez asta? Deci voi spune img imaginea dreapta

59500
44:21:29,200 --> 44:21:37,024
este egal cu np dot

59501
44:21:32,720 --> 44:21:42,320
zero și voi spune în interiorul asta

59502
44:21:37,024 --> 44:21:44,640
trei canale 256 cruce 256

59503
44:21:42,320 --> 44:21:47,840
corect și când vei rula asta

59504
44:21:44,640 --> 44:21:51,744
imaginea va fi așa

59505
44:21:47,840 --> 44:21:55,200
fii așa, acesta este un canal

59506
44:21:51,744 --> 44:21:58,000
două canale și acesta este trei canale

59507
44:21:55,200 --> 44:21:59,920
Și am înțeles că numpy este a

59508
44:21:58,000 --> 44:22:02,960
pachet fundamental pentru știința datelor în

59509
44:21:59,920 --> 44:22:05,520
Python. Corect? Acest pachet ne oferă o

59510
44:22:02,960 --> 44:22:08,464
nou tip de date cu care să lucreze

59511
44:22:05,520 --> 44:22:11,440
numite tablouri n-dimensionale. Corect?

59512
44:22:08,464 --> 44:22:15,024
Acum ce sunt matricele? Ce sunt matricele?

59513
44:22:11,440 --> 44:22:17,920
Matricele nu sunt altceva decât vectori corect

59514
44:22:15,024 --> 44:22:20,160
care sunt stocate într-un bloc contiguu

59515
44:22:17,920 --> 44:22:22,464
de memorie, ceea ce înseamnă că sunt stocate

59516
44:22:20,160 --> 44:22:24,800
continuu unul dupa altul si ei

59517
44:22:22,464 --> 44:22:27,280
nu vă transformați în obiect

59518
44:22:24,800 --> 44:22:29,200
spre deosebire de listă și sunt mult mai rapide

59519
44:22:27,280 --> 44:22:31,280
sunt mai eficiente de memorie decât lista

59520
44:22:29,200 --> 44:22:32,960
Vă voi dovedi acest fapt astăzi cu

59521
44:22:31,280 --> 44:22:36,384
ajutorul exemplului prin ajutorul lui

59522
44:22:32,960 --> 44:22:38,720
codul corect deci de ce numpy arrays pentru că

59523
44:22:36,384 --> 44:22:40,640
numpy este un pachet care este construit deasupra

59524
44:22:38,720 --> 44:22:43,744
a limbajului C care este compatibil cu

59525
44:22:40,640 --> 44:22:45,920
python și C fiind un nivel mediu

59526
44:22:43,744 --> 44:22:49,024
limba interacționează direct cu

59527
44:22:45,920 --> 44:22:50,960
hardware. Deci, indiferent de operațiune pe care o executați

59528
44:22:49,024 --> 44:22:53,664
într-un fapt care devine direct

59529
44:22:50,960 --> 44:22:56,240
executat pe hardware-ul propriu-zis. Corect?

59530
44:22:53,664 --> 44:22:58,560
Acesta este motivul pentru care uh

59531
44:22:56,240 --> 44:23:00,560
performanța este mult mai bună când încercăm

59532
44:22:58,560 --> 44:23:03,440
utilizați tablourile n dimensionale. Împreună cu

59533
44:23:00,560 --> 44:23:05,664
aceasta aceste sintaxe tipul de sintaxe

59534
44:23:03,440 --> 44:23:07,744
obișnuiam să tastam uh în lista pe care o voi arăta

59535
44:23:05,664 --> 44:23:10,320
că și vouă astăzi cu ajutorul lui

59536
44:23:07,744 --> 44:23:15,104
exemplu sunt mult mai simple atunci când încercați

59537
44:23:10,320 --> 44:23:17,200
fă-le cu nd matrice corect, așadar matrice

59538
44:23:15,104 --> 44:23:20,000
sunt practic operații vectorizate

59539
44:23:17,200 --> 44:23:21,840
corect și sunt, de asemenea, foarte convenabile

59540
44:23:20,000 --> 44:23:24,464
de a face faţă în comparaţie cu listele şi

59541
44:23:21,840 --> 44:23:26,560
alte tipuri de date native în python dreapta

59542
44:23:24,464 --> 44:23:29,280
iar partea cea mai importantă este că în

59543
44:23:26,560 --> 44:23:30,880
călătoria noastră în știința datelor, indiferent de alta

59544
44:23:29,280 --> 44:23:32,384
pachete pachete pe care le vom folosi. Corect?

59545
44:23:30,880 --> 44:23:34,320
Din nou, ce sunt pachetele? Ei au

59546
44:23:32,384 --> 44:23:37,104
lucruri predefinite stocate pentru tine astfel încât

59547
44:23:34,320 --> 44:23:39,840
poți să le folosești și să te concentrezi mai puțin asupra

59548
44:23:37,104 --> 44:23:42,560
cod și multe altele despre logică. Corect? Ai nevoie

59549
44:23:39,840 --> 44:23:44,160
a fi conștient de logică mai mult decât

59550
44:23:42,560 --> 44:23:46,720
cunoaşterea codului. Corect? Deci, noi

59551
44:23:44,160 --> 44:23:49,200
au pachete pentru ceea ce contine

59552
44:23:46,720 --> 44:23:52,320
metode din interiorul lor pe care le puteți folosi

59553
44:23:49,200 --> 44:23:56,720
și fără alte calcule

59554
44:23:52,320 --> 44:23:59,440
poți lucra direct cu ei. Corect?

59555
44:23:56,720 --> 44:24:02,240
Așa am început cu numpy

59556
44:23:59,440 --> 44:24:06,320
dreapta și sintaxa pentru a importa numpy a fost

59557
44:24:02,240 --> 44:24:08,800
import numpy ca np unde np era un alias

59558
44:24:06,320 --> 44:24:10,960
corect. Ai putea să faci pip install numpy

59559
44:24:08,800 --> 44:24:13,280
dacă cineva nu a avut acces la numpy

59560
44:24:10,960 --> 44:24:15,440
dacă numpy nu venea implicit. tu

59561
44:24:13,280 --> 44:24:19,104
poate folosi pip install numpy care este

59562
44:24:15,440 --> 44:24:21,360
pachetul index python corect și asta

59563
44:24:19,104 --> 44:24:23,440
este ca fereastra magazinului de aplicații Play Store pentru

59564
44:24:21,360 --> 44:24:26,320
piton. Toate pachetele sunt depozitate în

59565
44:24:23,440 --> 44:24:28,000
pip și poți să-l suni pe pip poți să-l întrebi pe pip

59566
44:24:26,320 --> 44:24:29,664
pentru a descărca acel pachet pentru tine, astfel încât

59567
44:24:28,000 --> 44:24:32,800
poti folosi acest drept, practic este

59568
44:24:29,664 --> 44:24:34,240
managerul de pachete so numpy este un deschis

59569
44:24:32,800 --> 44:24:35,920
sursa si daca vrei sa vezi codul

59570
44:24:34,240 --> 44:24:38,800
poți să mergi la github și să verifici codul

59571
44:24:35,920 --> 44:24:40,384
pentru tine chiar în numpy avem

59572
44:24:38,800 --> 44:24:43,104
n tablouri dimensionale acum întrebarea

59573
44:24:40,384 --> 44:24:45,104
apare oameni că de ce avem nevoie de numpy

59574
44:24:43,104 --> 44:24:48,160
corect, deci răspunsul meu la acest aspect

59575
44:24:45,104 --> 44:24:49,744
întrebarea este când te vei ocupa

59576
44:24:48,160 --> 44:24:51,104
știința datelor exact când vei deveni

59577
44:24:49,744 --> 44:24:53,840
un cercetător de date cu care vei avea de-a face

59578
44:24:51,104 --> 44:24:56,240
cu date Chiar acum întrebarea mea este cum

59579
44:24:53,840 --> 44:24:59,104
vei ingera cum vei face

59580
44:24:56,240 --> 44:25:01,840
mașina ingera datele chiar acolo

59581
44:24:59,104 --> 44:25:03,600
pentru a fi o modalitate potrivită pentru tine de a introduce

59582
44:25:01,840 --> 44:25:05,840
date către mașină pe care trebuie să le facă

59583
44:25:03,600 --> 44:25:08,880
manipulări ale datelor pentru a citi

59584
44:25:05,840 --> 44:25:11,664
date, astfel încât toate acestea sunt începute ca bază

59585
44:25:08,880 --> 44:25:13,280
pachet de matrice numpy chiar altfel decât

59586
44:25:11,664 --> 44:25:15,360
că devine foarte greu şi

59587
44:25:13,280 --> 44:25:17,664
greoi pentru noi să ne ocupăm de asta și

59588
44:25:15,360 --> 44:25:20,080
asta ne oferă multă uşurinţă şi

59589
44:25:17,664 --> 44:25:21,664
flexibilitate pentru a face față unor astfel de masive

59590
44:25:20,080 --> 44:25:23,840
cantitățile de date pe care le veți însoți

59591
44:25:21,664 --> 44:25:27,280
cu mine, deoarece vom merge mai departe în acest sens

59592
44:25:23,840 --> 44:25:31,840
curs anume. Da, perfect. Acum

59593
44:25:27,280 --> 44:25:34,000
Oameni buni, lăsați-mă să trag PBT-urile.

59594
44:25:31,840 --> 44:25:36,080
Despre asta discutăm despre oameni. Noi

59595
44:25:34,000 --> 44:25:38,464
începe cu ceva care se numește ca

59596
44:25:36,080 --> 44:25:41,200
scalar, nu? Începem cu ceva

59597
44:25:38,464 --> 44:25:43,360
care se numește scalar care este a

59598
44:25:41,200 --> 44:25:46,000
cantitate care are doar magnitudine.

59599
44:25:43,360 --> 44:25:48,320
Corect? În limbaj numpy, asta este și

59600
44:25:46,000 --> 44:25:50,464
numit ca 0D, nu? Se numește ca

59601
44:25:48,320 --> 44:25:53,200
dimensiune zero. Apoi oamenii avem

59602
44:25:50,464 --> 44:25:55,104
vector dreapta și vectorul are o constantă

59603
44:25:53,200 --> 44:25:57,664
dimensiune. Are o singură dimensiune

59604
44:25:55,104 --> 44:25:59,360
corect îl poți interpreta ca un rând sau

59605
44:25:57,664 --> 44:26:01,104
îl puteți interpreta ca pe o coloană

59606
44:25:59,360 --> 44:26:03,600
chiar nu contează pentru că asta este

59607
44:26:01,104 --> 44:26:06,000
doar o singură dimensiune chiar așa

59608
44:26:03,600 --> 44:26:07,360
de obicei va fi scris cu cinci virgule

59609
44:26:06,000 --> 44:26:10,560
gol chiar nu va fi nimic

59610
44:26:07,360 --> 44:26:12,464
scris în fața ei, așa că asta cu numpy

59611
44:26:10,560 --> 44:26:16,880
terminologia si nomenclatura se numeste

59612
44:26:12,464 --> 44:26:19,024
ca o singură dimensiune chiar atunci când mergi mai departe

59613
44:26:16,880 --> 44:26:21,664
apoi obțineți combinați doi vectori

59614
44:26:19,024 --> 44:26:24,880
primești o formă și acum asta se numește

59615
44:26:21,664 --> 44:26:27,520
ca o matrice și În terminologia numpy ea

59616
44:26:24,880 --> 44:26:29,104
se numește drept bidimensional și

59617
44:26:27,520 --> 44:26:31,360
când încercați să stivuiți mai multe

59618
44:26:29,104 --> 44:26:32,960
matrici bidimensionale una înainte cu

59619
44:26:31,360 --> 44:26:35,104
unul după altul sau unul înaintea fiecăruia

59620
44:26:32,960 --> 44:26:37,360
altfel devin ceva numit

59621
44:26:35,104 --> 44:26:38,880
ca tridimensional și acum în mine

59622
44:26:37,360 --> 44:26:40,720
capacitate nu știu ce patru

59623
44:26:38,880 --> 44:26:43,104
dimensiunea arată ca, dar există o mare

59624
44:26:40,720 --> 44:26:45,520
posibilitatea ca ai n dimensional

59625
44:26:43,104 --> 44:26:48,640
date drept le are are n suntem

59626
44:26:45,520 --> 44:26:52,160
care se ocupă cu datele n dimensiuni corecte

59627
44:26:48,640 --> 44:26:55,024
să presupunem că cu asta adaug și timpul corect

59628
44:26:52,160 --> 44:26:57,440
la t egal cu 1 la t=2 care va servi

59629
44:26:55,024 --> 44:26:59,440
ca a patra dimensiune pentru aceste date

59630
44:26:57,440 --> 44:27:00,960
dar cum arata ca nu am

59631
44:26:59,440 --> 44:27:04,000
știu cu adevărat asta pentru că oamenii

59632
44:27:00,960 --> 44:27:06,960
sunt capabili doar să vizualizeze 3D trei

59633
44:27:04,000 --> 44:27:09,280
dimensiuni la dreapta maximă, astfel încât să puteți accesa

59634
44:27:06,960 --> 44:27:12,464
n dimensiuni și de aici denumirea n

59635
44:27:09,280 --> 44:27:15,520
tablouri dimensionale dreapta și tablouri post

59636
44:27:12,464 --> 44:27:17,280
această postare dreaptă la care am trecut

59637
44:27:15,520 --> 44:27:20,960
creez anumite lucruri și am încercat

59638
44:27:17,280 --> 44:27:22,640
explicați corect datele, astfel încât datele

59639
44:27:20,960 --> 44:27:24,720
vă va arăta așa corect

59640
44:27:22,640 --> 44:27:28,800
ar putea avea o cantitate scalară care este

59641
44:27:24,720 --> 44:27:31,840
marchează corect unul marchează chiar acum dacă merg

59642
44:27:28,800 --> 44:27:34,464
pe vectori într-o zi pot fi semne

59643
44:27:31,840 --> 44:27:38,464
a unui student

59644
44:27:34,464 --> 44:27:40,320
notele corecte ale unui student la științe

59645
44:27:38,464 --> 44:27:43,840
engleză

59646
44:27:40,320 --> 44:27:47,440
și matematică drept 35

59647
44:27:43,840 --> 44:27:49,520
40 și 50 din să zicem 50 drept trei

59648
44:27:47,440 --> 44:27:51,440
subiecte astfel încât aceasta va fi caracterizată

59649
44:27:49,520 --> 44:27:52,800
drept vector care va fi

59650
44:27:51,440 --> 44:27:56,320
dimensiune scrisă pentru Pentru aceasta va

59651
44:27:52,800 --> 44:27:58,720
fie 3 virgula nimic. Acesta va fi zero

59652
44:27:56,320 --> 44:28:02,560
forma corectă va fi zero. Pentru aceasta

59653
44:27:58,720 --> 44:28:05,664
matricea să presupunem că avem 1 2 3 patru

59654
44:28:02,560 --> 44:28:09,000
elevii și fiecare elev va avea

59655
44:28:05,664 --> 44:28:09,000
trei semne.

59656
44:28:12,560 --> 44:28:15,744
Corect? Fiecare elev va avea trei

59657
44:28:13,920 --> 44:28:19,840
semne. Deci care va fi forma

59658
44:28:15,744 --> 44:28:21,744
asta? Avem patru rânduri și trei

59659
44:28:19,840 --> 44:28:25,664
coloane. Corect? Deci acesta va fi

59660
44:28:21,744 --> 44:28:28,560
forma dreapta acestei matrice 2D dreapta și

59661
44:28:25,664 --> 44:28:30,720
acum dacă stivuiți imagini chiar una în spate

59662
44:28:28,560 --> 44:28:33,360
unul pe altul, atunci va fi așa

59663
44:28:30,720 --> 44:28:36,240
imaginea dreapta ti-am dat un exemplu asa ca

59664
44:28:33,360 --> 44:28:40,384
acesta are 4 4 pixeli, astfel încât forma va

59665
44:28:36,240 --> 44:28:43,744
fii 3 4 4 corect acesta va fi

59666
44:28:40,384 --> 44:28:46,320
forma pentru această matrice 3D specială

59667
44:28:43,744 --> 44:28:48,320
băieți potriviti, așa că introduceți

59668
44:28:46,320 --> 44:28:51,200
date doar ca să vă spun puțin mai multe

59669
44:28:48,320 --> 44:28:54,384
deoarece IA generativă este foarte populară

59670
44:28:51,200 --> 44:28:58,880
zilele acestea. Corect? Și dacă îți spun

59671
44:28:54,384 --> 44:29:02,080
faptul că GPT-ul din Ciad

59672
44:28:58,880 --> 44:29:05,200
pe care le folosiți sau ați fi folosit

59673
44:29:02,080 --> 44:29:07,840
dreptul are

59674
44:29:05,200 --> 44:29:10,640
niciodată văzută

59675
44:29:07,840 --> 44:29:13,104
un singur

59676
44:29:10,640 --> 44:29:17,200
cuvânt

59677
44:29:13,104 --> 44:29:21,520
în timpul vieții sale.

59678
44:29:17,200 --> 44:29:25,200
Corect? Tot ce vede

59679
44:29:21,520 --> 44:29:29,200
sunt numere, nu? Numai numere. Cum

59680
44:29:25,200 --> 44:29:30,800
vedem numere? Să presupunem că spun al meu

59681
44:29:29,200 --> 44:29:32,560
nume

59682
44:29:30,800 --> 44:29:35,560
este

59683
44:29:32,560 --> 44:29:35,560
Raghav.

59684
44:29:35,840 --> 44:29:40,080
Raghav

59685
44:29:37,840 --> 44:29:41,840
este o

59686
44:29:40,080 --> 44:29:44,800
frumos

59687
44:29:41,840 --> 44:29:47,200
nume. Corect? Deci acestea sunt două date,

59688
44:29:44,800 --> 44:29:49,440
nu? Acestea sunt două puncte de date. Acum noi

59689
44:29:47,200 --> 44:29:51,280
toți știu că computerele nu

59690
44:29:49,440 --> 44:29:53,744
înțelege că aceste computere potrivite nu

59691
44:29:51,280 --> 44:29:55,920
intelegeti bine astea nu exista nimic

59692
44:29:53,744 --> 44:29:58,320
nicio înțelegere ca computerele să știe

59693
44:29:55,920 --> 44:30:00,800
ce text este corect nu stie decat 0 si

59694
44:29:58,320 --> 44:30:02,384
unul da dhika corect stie doar zerouri

59695
44:30:00,800 --> 44:30:04,000
iar unii să vadă cum vom converti asta

59696
44:30:02,384 --> 44:30:07,000
deci există ceva numit ca

59697
44:30:04,000 --> 44:30:07,000
vocabular

59698
44:30:07,600 --> 44:30:12,464
corect, deci vocabularul nu este altceva decât

59699
44:30:10,160 --> 44:30:14,560
cuvinte unice

59700
44:30:12,464 --> 44:30:18,000
exact câte cuvinte unice am în

59701
44:30:14,560 --> 44:30:19,360
acesta mă numesc Raga patru. Acest lucru nu este

59702
44:30:18,000 --> 44:30:22,640
unic. Acest lucru se repetă. Aceasta este

59703
44:30:19,360 --> 44:30:24,800
repetând. Cinci, șase. Și aceasta este

59704
44:30:22,640 --> 44:30:27,200
repetând. Deci am șase cuvinte. Deci acum

59705
44:30:24,800 --> 44:30:29,200
Băieți, voi face ceva numit cuvânt

59706
44:30:27,200 --> 44:30:30,960
la

59707
44:30:29,200 --> 44:30:32,640
chiar acolo unde voi converti aceste cuvinte

59708
44:30:30,960 --> 44:30:35,104
în vectori. Cum îi voi converti?

59709
44:30:32,640 --> 44:30:37,104
Uită-te la asta. Deci voi avea să presupun

59710
44:30:35,104 --> 44:30:39,600
acesta este S_sub_1,

59711
44:30:37,104 --> 44:30:42,640
acesta este S_sub_1 și acesta este S_sub_2,

59712
44:30:39,600 --> 44:30:46,200
nu? Deci voi reprezenta

59713
44:30:42,640 --> 44:30:46,200
S1 ca

59714
44:30:47,024 --> 44:30:59,440
corect. Voi avea un vector

59715
44:30:51,024 --> 44:31:02,080
de mărimea șase. Cum? Voi spune 1 0 0 0.

59716
44:30:59,440 --> 44:31:05,520
nu? 1 0 0. Câte elemente face

59717
44:31:02,080 --> 44:31:08,720
au? Șase elemente. Corect? Numele va fi

59718
44:31:05,520 --> 44:31:13,600
0 1 0 0 0.

59719
44:31:08,720 --> 44:31:18,464
va fi 0 0 0 1 0 0 0

59720
44:31:13,600 --> 44:31:22,464
iar ra va fi 0 0 0 1 0 0 corect asta este

59721
44:31:18,464 --> 44:31:26,000
s1 numele meu este raghub acum când vine

59722
44:31:22,464 --> 44:31:28,960
la s_ub_2 chiar când vine vorba de s_ub_2

59723
44:31:26,000 --> 44:31:34,384
cum voi intra în acest s2

59724
44:31:28,960 --> 44:31:37,024
0 1 0 0 ragh ce este aici

59725
44:31:34,384 --> 44:31:38,384
00 0 1 0 0 0

59726
44:31:37,024 --> 44:31:46,000
ce este

59727
44:31:38,384 --> 44:31:51,104
0 0 0 1 0 sau frumos este 0 0 0 1 și nume

59728
44:31:46,000 --> 44:31:54,720
va fi 0 1 0 0 0 0 chiar acum aceasta va

59729
44:31:51,104 --> 44:31:58,640
fie reprezentarea vectorială a acestora

59730
44:31:54,720 --> 44:32:03,840
două propoziții doar pentru a vă spune un fapt

59731
44:31:58,640 --> 44:32:05,664
GBD3 dreapta GPD3 model dreapta GPD3 sau

59732
44:32:03,840 --> 44:32:09,200
GPD3.5

59733
44:32:05,664 --> 44:32:13,600
au un vocabul vabular

59734
44:32:09,200 --> 44:32:19,360
din 30.000 de cuvinte, nu? 30.000 de cuvinte.

59735
44:32:13,600 --> 44:32:22,080
Și fiecare cuvânt, nu? Fiecare cuvânt

59736
44:32:19,360 --> 44:32:25,080
are o

59737
44:32:22,080 --> 44:32:25,080
dimensiune

59738
44:32:25,104 --> 44:32:29,640
de

59739
44:32:26,640 --> 44:32:29,640
12.500

59740
44:32:29,920 --> 44:32:34,720
numere. Corect? Ce vreau să spun? Să presupunem

59741
44:32:32,160 --> 44:32:37,024
Spun Raghub.

59742
44:32:34,720 --> 44:32:41,440
Deci va fi un cuvânt și va fi

59743
44:32:37,024 --> 44:32:44,840
reprezentat de cinci 11.500

59744
44:32:41,440 --> 44:32:44,840
numere diferite

59745
44:32:45,200 --> 44:32:52,560
corect si ca raghub va fi

59746
44:32:47,920 --> 44:32:56,160
30.000 de cuvinte în acest model GPD corect

59747
44:32:52,560 --> 44:32:58,240
30.000 de cuvinte în acest model GPD corect și

59748
44:32:56,160 --> 44:33:00,560
acest număr total de parametri care

59749
44:32:58,240 --> 44:33:02,720
se antrenează în rețeaua neuronală care

59750
44:33:00,560 --> 44:33:07,520
vom învăța mai târziu despre rețelele neuronale

59751
44:33:02,720 --> 44:33:09,520
sunt aproape aproape de 1

59752
44:33:07,520 --> 44:33:11,600
75

59753
44:33:09,520 --> 44:33:15,920
miliarde

59754
44:33:11,600 --> 44:33:18,000
parametri corecti 1,75 miliarde de parametri

59755
44:33:15,920 --> 44:33:20,720
deci de ce vă spun toate acestea pentru că

59756
44:33:18,000 --> 44:33:23,664
pentru a-ți arăta că ceea ce este

59757
44:33:20,720 --> 44:33:26,720
importanţa vectorilor chiar în

59758
44:33:23,664 --> 44:33:29,280
întreaga învățare automată și știința datelor

59759
44:33:26,720 --> 44:33:30,800
da, oamenii, deci acesta este motivul pentru care oamenii

59760
44:33:29,280 --> 44:33:32,720
acum întrebarea mea este cum vei crea

59761
44:33:30,800 --> 44:33:35,280
acești vectori cum le vei citi

59762
44:33:32,720 --> 44:33:38,080
vectori Nu? Răspunsul este prin

59763
44:33:35,280 --> 44:33:41,024
pachet numpy pentru că este baza

59764
44:33:38,080 --> 44:33:43,200
pachet. Oameni clari? Da. sper

59765
44:33:41,024 --> 44:33:44,720
ora de azi va fi interesantă pentru

59766
44:33:43,200 --> 44:33:46,560
tu pentru că vei cunoaște contextul.

59767
44:33:44,720 --> 44:33:48,240
De ce o facem? Da. Așa că o să încerc

59768
44:33:46,560 --> 44:33:50,560
pentru a vă arăta cum ne convertim

59769
44:33:48,240 --> 44:33:53,600
lucruri la vectori.

59770
44:33:50,560 --> 44:33:55,520
Corect? Bine. Lasă-mă să merg aici acum. Corect.

59771
44:33:53,600 --> 44:33:59,280
Lasă-mă să merg aici.

59772
44:33:55,520 --> 44:34:01,024
Deci oamenii am început să folosim numpy. Deci

59773
44:33:59,280 --> 44:34:03,360
Am început cu dimensiunea zero

59774
44:34:01,024 --> 44:34:05,440
matrice. Corect? Matrice cu dimensiune zero. Deci

59775
44:34:03,360 --> 44:34:08,320
dimensiunea zero nu este altceva decât un scalar.

59776
44:34:05,440 --> 44:34:11,280
Așa că am creat un ar r0 care a fost np dot

59777
44:34:08,320 --> 44:34:12,960
array și am introdus un singur cuvânt

59778
44:34:11,280 --> 44:34:15,744
uh element din interiorul asta care nu este nimic

59779
44:34:12,960 --> 44:34:19,024
dar un scalar și apoi am verificat tipul

59780
44:34:15,744 --> 44:34:21,360
de uh ar0, de asemenea, drept și apoi verific

59781
44:34:19,024 --> 44:34:24,384
dimensiunea de asemenea. Deci răspunsul a fost

59782
44:34:21,360 --> 44:34:27,360
două clasa a fost numpy nd matrice și

59783
44:34:24,384 --> 44:34:31,880
dimensiunea a fost zero exact ceea ce eu

59784
44:34:27,360 --> 44:34:31,880
menționase în pb-ul meu

59785
44:34:31,920 --> 44:34:38,000
corect va avea o dimensiune zero

59786
44:34:35,840 --> 44:34:39,664
așa cum a fost exact același lucru

59787
44:34:38,000 --> 44:34:42,320
dovedit

59788
44:34:39,664 --> 44:34:44,464
corect pentru că acum vine un scalar

59789
44:34:42,320 --> 44:34:46,640
la o dimensiune directă venind la

59790
44:34:44,464 --> 44:34:49,280
o dimensiune creez o listă care este

59791
44:34:46,640 --> 44:34:51,840
nimic altceva decât un tip de date cu o singură dimensiune

59792
44:34:49,280 --> 44:34:54,080
chiar acum creez o matrice care este a

59793
44:34:51,840 --> 44:34:58,560
ar r1 din tabloul din acest particular

59794
44:34:54,080 --> 44:35:01,104
list list și apoi verific tipul de

59795
44:34:58,560 --> 44:35:05,320
print ar1 verifica tipul de ar1 si

59796
44:35:01,104 --> 44:35:05,320
dimensiunea corectă deci când execut

59797
44:35:07,360 --> 44:35:13,664
chiar atunci vei vedea că asta a fost

59798
44:35:10,160 --> 44:35:15,744
matrice numpy și dimensiunea a fost una

59799
44:35:13,664 --> 44:35:19,520
exact așa, deci dacă îți arăt

59800
44:35:15,744 --> 44:35:23,640
altceva spune print a ar r r1 one

59801
44:35:19,520 --> 44:35:23,640
formă de punct

59802
44:35:26,240 --> 44:35:33,000
vei vedea că este 4 virgulă goală dreapta

59803
44:35:28,960 --> 44:35:33,000
și ți-o arăt aici

59804
44:35:35,920 --> 44:35:42,960
va fi gol chiar gol și asta

59805
44:35:39,024 --> 44:35:45,024
va fi virgula 1 drept, deci asta înseamnă că

59806
44:35:42,960 --> 44:35:49,520
are doar patru elemente chiar dacă eu

59807
44:35:45,024 --> 44:35:51,360
crește aceste elemente pentru a spune 55 5 66

59808
44:35:49,520 --> 44:35:54,560
77

59809
44:35:51,360 --> 44:35:56,384
atunci va deveni 7, gol, nu?

59810
44:35:54,560 --> 44:35:59,200
Ceea ce înseamnă că are șapte elemente ca a

59811
44:35:56,384 --> 44:36:02,640
vector. Acum creăm ceva cu a

59812
44:35:59,200 --> 44:36:05,744
listă imbricată în dreapta care este așa. Deci

59813
44:36:02,640 --> 44:36:08,160
cu un cuib vreau un suport care este

59814
44:36:05,744 --> 44:36:11,600
alergând afară chiar atunci în interiorul acestui eu

59815
44:36:08,160 --> 44:36:13,664
au una două și trei liste într-una

59816
44:36:11,600 --> 44:36:15,920
lista. Corect? Deci aceasta este o listă imbricată.

59817
44:36:13,664 --> 44:36:19,104
Acestea sunt notele primului elev, al doilea

59818
44:36:15,920 --> 44:36:22,800
student și al treilea elev. Corect? Deci

59819
44:36:19,104 --> 44:36:27,464
Fac asta și vezi că este corect?

59820
44:36:22,800 --> 44:36:27,464
Și vă voi arăta și forma

59821
44:36:30,000 --> 44:36:36,640
corect. Va fi 3 3 rânduri și trei

59822
44:36:33,920 --> 44:36:39,360
coloane. Trei rânduri și trei coloane.

59823
44:36:36,640 --> 44:36:42,360
Corect? Acum, în mod similar, putem crea

59824
44:36:39,360 --> 44:36:42,360
a

59825
44:36:50,160 --> 44:36:56,160
matricea 3D

59826
44:36:52,560 --> 44:37:00,240
drept cu

59827
44:36:56,160 --> 44:37:03,200
două niveluri dreapta nivelul unu și nivelul doi

59828
44:37:00,240 --> 44:37:06,960
și 3 3 deci forma va fi ce

59829
44:37:03,200 --> 44:37:09,024
oamenii pot ghici cineva forma

59830
44:37:06,960 --> 44:37:11,104
care va fi forma asta pe care o am

59831
44:37:09,024 --> 44:37:14,464
ți-a arătat

59832
44:37:11,104 --> 44:37:16,080
nu? Dacă acesta este 3 4 atunci ce va fi

59833
44:37:14,464 --> 44:37:19,280
asta?

59834
44:37:16,080 --> 44:37:22,000
Trei rânduri și trei coloane. Corect? Deci

59835
44:37:19,280 --> 44:37:24,960
când vei executa, vei obține 2 3 3

59836
44:37:22,000 --> 44:37:26,720
dreapta 2 3 3

59837
44:37:24,960 --> 44:37:28,880
corect

59838
44:37:26,720 --> 44:37:30,880
acum oamenii există mai multe moduri

59839
44:37:28,880 --> 44:37:32,640
chiar există mai multe moduri de a crea

59840
44:37:30,880 --> 44:37:35,600
matrice și ar trebui să le cunoaștem pentru că

59841
44:37:32,640 --> 44:37:37,440
toate acestea sunt foarte foarte utile. Nu

59842
44:37:35,600 --> 44:37:39,920
chiar acum. Nu am suficient context

59843
44:37:37,440 --> 44:37:41,600
să-ți dau chiar acum. Dar mai târziu tu

59844
44:37:39,920 --> 44:37:43,744
voi vedea cu mine sau cu altul

59845
44:37:41,600 --> 44:37:45,664
trainer că modul în care acestea vor fi utilizate

59846
44:37:43,744 --> 44:37:49,200
în special învățarea profundă, nu? Ei

59847
44:37:45,664 --> 44:37:51,280
sunt cheia algoritmilor de învățare profundă,

59848
44:37:49,200 --> 44:37:53,200
nu? Acolo unde inițializam unele greutăți,

59849
44:37:51,280 --> 44:37:55,360
inițializam unele prejudecăți și acelea

59850
44:37:53,200 --> 44:37:58,560
inițializările nu sunt altceva decât

59851
44:37:55,360 --> 44:38:01,360
matrice numpy multidimensionale, nu?

59852
44:37:58,560 --> 44:38:04,360
Matrice Numpy.

59853
44:38:01,360 --> 44:38:04,360
Bine.

59854
44:38:05,520 --> 44:38:11,160
De exemplu, să presupunem că am asta

59855
44:38:12,080 --> 44:38:17,600
Trebuie să înmulțesc asta cu ceva aleatoriu

59856
44:38:15,200 --> 44:38:19,280
numere, nu? Deci, cum vei genera

59857
44:38:17,600 --> 44:38:21,520
aceste numere aleatorii? Vei genera

59858
44:38:19,280 --> 44:38:25,520
le prin numpy. Și poți genera

59859
44:38:21,520 --> 44:38:28,464
ele într-un anumit tip de formă,

59860
44:38:25,520 --> 44:38:30,160
nu? Care este 2 3. Și apoi poți

59861
44:38:28,464 --> 44:38:33,440
inmultiti-le. Puteți înmulți

59862
44:38:30,160 --> 44:38:36,384
matrice și puteți obține rezultatul pentru

59863
44:38:33,440 --> 44:38:38,800
pe tine însuți. Corect? Deci, acesta este modul în care ei

59864
44:38:36,384 --> 44:38:41,024
sunt folosite.

59865
44:38:38,800 --> 44:38:42,880
Așa că am văzut primul lucru din lista noastră

59866
44:38:41,024 --> 44:38:45,664
au acoperit deja. Atunci acum suntem

59867
44:38:42,880 --> 44:38:49,104
trecând la crearea de matrice zero dreapta.

59868
44:38:45,664 --> 44:38:51,744
Așa că creez o matrice zero de unul

59869
44:38:49,104 --> 44:38:54,320
dreptul de dimensiune a unei dimensiuni care

59870
44:38:51,744 --> 44:38:56,384
este 0 0. Sunt reprezentate în flotoare

59871
44:38:54,320 --> 44:39:00,240
corect. Ele sunt reprezentate în flotoare

59872
44:38:56,384 --> 44:39:02,240
0,0 zero. Corect? Acum puteți crea un

59873
44:39:00,240 --> 44:39:04,080
matrice zero bidimensională. Corect? tu

59874
44:39:02,240 --> 44:39:05,664
poate crea o matrice zero bidimensională

59875
44:39:04,080 --> 44:39:08,640
care este trebuie să menționați doar

59876
44:39:05,664 --> 44:39:10,464
forma în interior 2 1. Deci va avea două

59877
44:39:08,640 --> 44:39:12,880
rânduri și o coloană, nu? Două rânduri

59878
44:39:10,464 --> 44:39:15,280
și o coloană. Diferența aici este

59879
44:39:12,880 --> 44:39:17,104
diferența aici este că acestea sunt

59880
44:39:15,280 --> 44:39:18,880
o dimensiune și acestea sunt două

59881
44:39:17,104 --> 44:39:20,800
dimensiuni. Corect? Ai în mod explicit

59882
44:39:18,880 --> 44:39:25,960
a menționat rândurile și coloanele. Deci tu

59883
44:39:20,800 --> 44:39:25,960
poate extinde acest lucru la 10 10 de asemenea.

59884
44:39:27,024 --> 44:39:31,920
Corect? Puteți extinde în 10 10 sau 10  

59885
44:39:29,440 --> 44:39:35,024
6 orice simți ca tine.

59886
44:39:31,920 --> 44:39:38,880
Corect? Va avea 10 rânduri și șase

59887
44:39:35,024 --> 44:39:41,840
coloane. Corect?

59888
44:39:38,880 --> 44:39:47,080
Acum poți și crea

59889
44:39:41,840 --> 44:39:47,080
matricele 3D matricele 3D zero.

59890
44:39:47,280 --> 44:39:53,280
Corect?

59891
44:39:50,240 --> 44:39:55,600
Care este 5a 3a 3. Ce înseamnă cinci?

59892
44:39:53,280 --> 44:39:57,360
Ce înseamnă cinci? Primul element

59893
44:39:55,600 --> 44:40:00,320
reprezintă numărul de straturi. Deci tu

59894
44:39:57,360 --> 44:40:03,920
au cinci straturi, nu? Sunt cinci straturi

59895
44:40:00,320 --> 44:40:05,600
adânc. Apoi aveți trei rânduri și trei

59896
44:40:03,920 --> 44:40:09,240
coloane, nu? Deci va arata

59897
44:40:05,600 --> 44:40:09,240
ceva de genul acesta.

59898
44:40:15,200 --> 44:40:21,160
1

59899
44:40:18,160 --> 44:40:21,160
2

59900
44:40:24,384 --> 44:40:30,000
1 2 3 4 5 chiar așa ceva de genul

59901
44:40:27,600 --> 44:40:35,920
în acest drept, va arăta ca această filă 1

59902
44:40:30,000 --> 44:40:37,600
2 3 1 2 3 1 2 3 corect 5 33 bine da

59903
44:40:35,920 --> 44:40:39,104
numărul de matrici grăbesc ceea ce eu

59904
44:40:37,600 --> 44:40:41,664
reprezentat

59905
44:40:39,104 --> 44:40:43,440
straturi corecte

59906
44:40:41,664 --> 44:40:46,880
rânduri

59907
44:40:43,440 --> 44:40:49,104
coloane stratul din dreapta rânduri și coloane.

59908
44:40:46,880 --> 44:40:50,720
Clar?

59909
44:40:49,104 --> 44:40:52,960
Așa că acum, când executați acest lucru, o veți face

59910
44:40:50,720 --> 44:40:54,640
obține un aranjament ca acesta. Bine. eu

59911
44:40:52,960 --> 44:40:57,024
încearcă să-ți arăt chestia asta cu alta

59912
44:40:54,640 --> 44:41:01,520
exemplu, nu? Care este am creat un

59913
44:40:57,024 --> 44:41:03,440
imaginea unei imagini RGB de 256 cruce 256

59914
44:41:01,520 --> 44:41:06,800
pixeli, nu? Care au toate zerourile

59915
44:41:03,440 --> 44:41:10,000
în interiorul lor. Și așa a fost

59916
44:41:06,800 --> 44:41:12,384
creat, nu? Trei straturi RGB 256

59917
44:41:10,000 --> 44:41:14,384
256. Deci așa va arăta imaginea

59918
44:41:12,384 --> 44:41:17,104
ca

59919
44:41:14,384 --> 44:41:20,160
corect.

59920
44:41:17,104 --> 44:41:24,520
Așa va arăta.

59921
44:41:20,160 --> 44:41:24,520
Acum poți și crea

59922
44:41:27,360 --> 44:41:33,360
matrice cu unele. Corect? Exact

59923
44:41:31,360 --> 44:41:34,720
în același mod în care l-ai creat cu zerouri. eu voi

59924
44:41:33,360 --> 44:41:36,960
da-ti-o. Îți dau 5 minute

59925
44:41:34,720 --> 44:41:39,520
timpul pentru a le crea. Îți arăt unul.

59926
44:41:36,960 --> 44:41:44,464
Așa spun eu

59927
44:41:39,520 --> 44:41:46,640
a1 este egal cu np dot

59928
44:41:44,464 --> 44:41:49,200
o dată

59929
44:41:46,640 --> 44:41:52,160
iar înăuntru trec

59930
44:41:49,200 --> 44:41:55,840
doi

59931
44:41:52,160 --> 44:41:58,000
verific a1. Deci aceasta este o matrice ca aceasta

59932
44:41:55,840 --> 44:42:02,464
nu? Este o matrice ca aceasta. Acum tu

59933
44:41:58,000 --> 44:42:04,000
creați creați două dimensiuni

59934
44:42:02,464 --> 44:42:06,960
şi

59935
44:42:04,000 --> 44:42:11,520
trei dimensiuni

59936
44:42:06,960 --> 44:42:13,920
matrice de unul. Practic este

59937
44:42:11,520 --> 44:42:15,920
ca un plutitor. Grabă. Este reprezentat ca a

59938
44:42:13,920 --> 44:42:18,880
plutesc. Corect. Este reprezentat ca a

59939
44:42:15,920 --> 44:42:20,800
plutesc. Bine.

59940
44:42:18,880 --> 44:42:24,320
Corect.

59941
44:42:20,800 --> 44:42:27,360
Perfect. Corect. De asemenea, băieți cu asta

59942
44:42:24,320 --> 44:42:29,600
chiar și cu aceasta puteți crea

59943
44:42:27,360 --> 44:42:32,720
matrice personalizate. Corect. Puteți crea

59944
44:42:29,600 --> 44:42:34,960
matrice personalizate. Corect. Cum creăm

59945
44:42:32,720 --> 44:42:37,520
matrice personalizate oameni? Cum creăm

59946
44:42:34,960 --> 44:42:39,664
matricele personalizate?

59947
44:42:37,520 --> 44:42:43,440
Ați creat acum zerouri. ai

59948
44:42:39,664 --> 44:42:47,024
create acum cele. Acum ce a mai rămas

59949
44:42:43,440 --> 44:42:48,720
creați matricele personalizate. Uita

59950
44:42:47,024 --> 44:42:50,384
despre asta. Voi ajunge la asta mai târziu

59951
44:42:48,720 --> 44:42:53,280
pe.

59952
44:42:50,384 --> 44:42:56,880
Corect? Să creăm

59953
44:42:53,280 --> 44:42:59,600
matrice personalizate. Corect? Deci sintaxa

59954
44:42:56,880 --> 44:43:04,384
rămâne la fel. Corect? Voi spune cus

59955
44:42:59,600 --> 44:43:07,104
arr este egal cu np.

59956
44:43:04,384 --> 44:43:10,720
Corect? Aceasta este sintaxa np.

59957
44:43:07,104 --> 44:43:13,600
Corect? Și vei spune 6 6 și

59958
44:43:10,720 --> 44:43:16,320
să presupunem că vrei o serie de patru labe.

59959
44:43:13,600 --> 44:43:18,880
Corect? Aceasta este dimensiunea 6 6. Și

59960
44:43:16,320 --> 44:43:21,520
această valoare după virgulă este practic

59961
44:43:18,880 --> 44:43:24,880
valoarea pe care o doriți. Tu executi asta

59962
44:43:21,520 --> 44:43:27,024
și tu copiați acest paste asta și tu

59963
44:43:24,880 --> 44:43:30,800
va primi matricele de patru pt

59964
44:43:27,024 --> 44:43:34,160
pe tine însuți. Corect? Dacă vrei din 10, tu

59965
44:43:30,800 --> 44:43:37,200
va primi de 10. Dacă vrei 10.3,

59966
44:43:34,160 --> 44:43:40,320
vei primi 10.3. Corect? orice care

59967
44:43:37,200 --> 44:43:43,280
vrei tu. Dacă vrei un caz, vei primi

59968
44:43:40,320 --> 44:43:47,160
caz, nu? Toate exemplele. Deci, lasă

59969
44:43:43,280 --> 44:43:47,160
doar iti arat asta.

59970
44:43:55,024 --> 44:44:01,800
Da. Ca aceasta. Acum băieți, cum am făcut

59971
44:43:58,800 --> 44:44:01,800
crea

59972
44:44:01,920 --> 44:44:07,440
sau cum am folosit

59973
44:44:04,464 --> 44:44:09,744
interval în Python?

59974
44:44:07,440 --> 44:44:13,920
Poti folosi

59975
44:44:09,744 --> 44:44:19,280
interval de generat

59976
44:44:13,920 --> 44:44:22,080
numere între 20 și 50,

59977
44:44:19,280 --> 44:44:24,160
nu? 20 până la 50. Îmi puteți da

59978
44:44:22,080 --> 44:44:26,080
sintaxa rapid? Cum ai făcut asta în

59979
44:44:24,160 --> 44:44:30,240
gama?

59980
44:44:26,080 --> 44:44:32,464
Cum facem asta? Am spus că R este egal cu

59981
44:44:30,240 --> 44:44:39,200
interval

59982
44:44:32,464 --> 44:44:41,920
20 la 51. Nu? Și apoi am spus

59983
44:44:39,200 --> 44:44:44,240
eu in R

59984
44:44:41,920 --> 44:44:45,920
imprimeu eu,

59985
44:44:44,240 --> 44:44:49,200
nu? Și așa am primit

59986
44:44:45,920 --> 44:44:52,320
numere, nu? Atat de asemanator

59987
44:44:49,200 --> 44:44:54,320
pentru a varia în Python,

59988
44:44:52,320 --> 44:44:58,464
avem

59989
44:44:54,320 --> 44:45:01,280
un interval în num py. Corect? Cum folosim

59990
44:44:58,464 --> 44:45:05,360
o gama? spun eu

59991
44:45:01,280 --> 44:45:10,240
uh o gamă

59992
44:45:05,360 --> 44:45:13,664
ar r este egal cu np dot range. Corect?

59993
44:45:10,240 --> 44:45:17,360
Și apoi aceeași sintaxă voi spune 20 la

59994
44:45:13,664 --> 44:45:21,024
51. Nu? 20 la 51. Și atât. Şi

59995
44:45:17,360 --> 44:45:23,440
când îmi voi verifica eroarea de rază AR, tu

59996
44:45:21,024 --> 44:45:28,880
voi vedea că mi-am generat numere

59997
44:45:23,440 --> 44:45:32,464
între 20 și 50 și un interval în numpy.

59998
44:45:28,880 --> 44:45:37,104
Corect? O gamă în numpy. Da, dacă tu

59999
44:45:32,464 --> 44:45:40,000
vrei un interval ca să poți folosi acest exemplu

60000
44:45:37,104 --> 44:45:42,080
un interval unu și după virgulă treci de

60001
44:45:40,000 --> 44:45:46,240
al treilea argument. Să presupunem că sunt trei. Deci

60002
44:45:42,080 --> 44:45:52,240
acum va sari de trei ori, nu? 20

60003
44:45:46,240 --> 44:45:54,960
23 26 29 32 35 așa până la 50.

60004
44:45:52,240 --> 44:45:59,960
Acum băieți, există ceva care este

60005
44:45:54,960 --> 44:45:59,960
numit ca lind spatiu

60006
44:46:00,384 --> 44:46:06,384
corect. Ce este lindspace?

60007
44:46:02,880 --> 44:46:08,560
Ea reprezintă

60008
44:46:06,384 --> 44:46:10,640
distanță liniară

60009
44:46:08,560 --> 44:46:15,200
ceea ce înseamnă

60010
44:46:10,640 --> 44:46:21,520
între două numere date.

60011
44:46:15,200 --> 44:46:23,920
Această funcție se va potrivi cu cerințele

60012
44:46:21,520 --> 44:46:27,664
număr de

60013
44:46:23,920 --> 44:46:29,664
numere. Corect? De exemplu, să presupunem pentru

60014
44:46:27,664 --> 44:46:36,080
exemplu,

60015
44:46:29,664 --> 44:46:41,280
trebuie să creăm un interval

60016
44:46:36,080 --> 44:46:44,240
de la 0 la 1. Oameni, sunt infiniti

60017
44:46:41,280 --> 44:46:45,744
numere pe care le pot avea între 0 și 1. Nu este

60018
44:46:44,240 --> 44:46:48,320
asta?

60019
44:46:45,744 --> 44:46:52,024
Numere infinite pe care le pot avea între 0 și

60020
44:46:48,320 --> 44:46:52,024
1. 0,0000000000001

60021
44:46:52,240 --> 44:47:00,320
0 0 1 0 1 01 corect pot merge în

60022
44:46:56,560 --> 44:47:04,080
mod infinit chiar acum, de exemplu

60023
44:47:00,320 --> 44:47:08,160
trebuie să creați numere între 0 și

60024
44:47:04,080 --> 44:47:10,080
10 corect și vrei să creezi și vrei

60025
44:47:08,160 --> 44:47:13,440
a avea

60026
44:47:10,080 --> 44:47:16,240
10 numere în ea corect, deci cum vei face

60027
44:47:13,440 --> 44:47:18,080
face asta nu este plutitor, este vorba despre

60028
44:47:16,240 --> 44:47:20,240
teoria numerelor intre 0 si unu

60029
44:47:18,080 --> 44:47:25,440
ai numere finite infinite, nu?

60030
44:47:20,240 --> 44:47:28,720
Deci spuneți că lindspace este egal cu np dot

60031
44:47:25,440 --> 44:47:31,920
Lindspace, nu? np.tlind spatiu. tu

60032
44:47:28,720 --> 44:47:34,000
menționați de la 0 la 10, doriți să aveți

60033
44:47:31,920 --> 44:47:35,840
10 numere, nu? Și când vei face

60034
44:47:34,000 --> 44:47:38,560
creați lindspace,

60035
44:47:35,840 --> 44:47:40,464
vei vedea că acestea sunt numerele

60036
44:47:38,560 --> 44:47:42,320
există care au fost create,

60037
44:47:40,464 --> 44:47:44,880
nu? Acestea sunt numerele care au

60038
44:47:42,320 --> 44:47:47,664
fost creat,

60039
44:47:44,880 --> 44:47:50,720
nu? Nouă numere. Acum zic 100

60040
44:47:47,664 --> 44:47:53,104
numere. Vreau 100 la distanță uniformă

60041
44:47:50,720 --> 44:47:55,280
numere, nu? Distanțat uniform 100

60042
44:47:53,104 --> 44:47:57,360
numere. Cum sunt chiar ei? Poți

60043
44:47:55,280 --> 44:47:58,880
pur și simplu scădeți un număr dintr-un altul

60044
44:47:57,360 --> 44:48:03,200
și diferența pentru toate numerele

60045
44:47:58,880 --> 44:48:04,720
va fi exact la fel. 0,01 0 1 01.

60046
44:48:03,200 --> 44:48:07,520
Scădeți oricare două numere. Va fi

60047
44:48:04,720 --> 44:48:10,640
0.01 0 1 01. Nu? Unde avem nevoie

60048
44:48:07,520 --> 44:48:12,464
asta? Avem nevoie de asta pentru a reprezenta axele.

60049
44:48:10,640 --> 44:48:14,560
Corect? Când vei trasa grafice, tu

60050
44:48:12,464 --> 44:48:16,800
va avea nevoie de acces între acest interval.

60051
44:48:14,560 --> 44:48:19,744
Ai nevoie de cinci valori care să funcționeze ca

60052
44:48:16,800 --> 44:48:21,744
aceasta. Bine? Să presupunem că vrei de la 0 la

60053
44:48:19,744 --> 44:48:23,104
10 cinci valori diferite, nu? Tu

60054
44:48:21,744 --> 44:48:27,200
va avea cinci valori diferite, cum ar fi

60055
44:48:23,104 --> 44:48:30,320
asta, nu? Între decalajul de 0,5,

60056
44:48:27,200 --> 44:48:33,200
nu? Dacă spun de la 1 la 10, vei avea

60057
44:48:30,320 --> 44:48:36,000
valori ca aceasta,

60058
44:48:33,200 --> 44:48:38,960
nu? Ca aceasta. Clar? 100 de valori ca

60059
44:48:36,000 --> 44:48:42,000
aceasta. Da. Băieți clari. Cum folosim

60060
44:48:38,960 --> 44:48:44,560
spatiu lin? Să presupunem că vrei de la 0 la

60061
44:48:42,000 --> 44:48:47,600
10. Intervalul de la 0 la 10 și 10 va fi

60062
44:48:44,560 --> 44:48:50,464
incluse. Zero nu va fi inclus.

60063
44:48:47,600 --> 44:48:54,520
Corect? Vom începe de la unul. Așa că merg la

60064
44:48:50,464 --> 44:48:54,520
unul din care va fi

60065
44:48:55,840 --> 44:49:01,840
unul. Atunci de ce nu este inclus 0? Da. 0

60066
44:48:59,920 --> 44:49:04,080
este inclus. Corect? 0 este de asemenea inclus

60067
44:49:01,840 --> 44:49:06,720
și 10 este de asemenea inclus. 100 de numere

60068
44:49:04,080 --> 44:49:09,920
între ei. Corect?

60069
44:49:06,720 --> 44:49:12,880
Clar? Acesta este spațiul lin. Acum

60070
44:49:09,920 --> 44:49:15,664
baieti, acum

60071
44:49:12,880 --> 44:49:20,160
presupune că tu

60072
44:49:15,664 --> 44:49:23,840
lohan l spațiul este practic folosit dacă tu

60073
44:49:20,160 --> 44:49:27,440
doriți să creați n numere între

60074
44:49:23,840 --> 44:49:30,320
interval de numere între 0 și 1

60075
44:49:27,440 --> 44:49:32,320
corect să presupunem că ești între 0 și 1

60076
44:49:30,320 --> 44:49:37,360
încercând să trasez un grafic bine și dvs

60077
44:49:32,320 --> 44:49:39,104
valorile sunt 0,2 0,3 0,6 șase drepte și tu

60078
44:49:37,360 --> 44:49:41,744
vrei să desenezi un grafic, așa că va trebui

60079
44:49:39,104 --> 44:49:44,464
marcați axa dreapta pe axa x și

60080
44:49:41,744 --> 44:49:46,464
axa y astfel încât să puteți utiliza lindspace acolo

60081
44:49:44,464 --> 44:49:48,640
și ce va face va dura

60082
44:49:46,464 --> 44:49:51,920
intervalul în care va lua intervalul

60083
44:49:48,640 --> 44:49:54,960
între care doriți să adăugați spațiu egal

60084
44:49:51,920 --> 44:49:57,200
numere și apoi al treilea argument aici

60085
44:49:54,960 --> 44:50:00,160
va fi câte numere faci

60086
44:49:57,200 --> 44:50:02,880
vreau între ele, așa că această sintaxă spune

60087
44:50:00,160 --> 44:50:04,640
tu că

60088
44:50:02,880 --> 44:50:06,880
din

60089
44:50:04,640 --> 44:50:09,744
0 la 1

60090
44:50:06,880 --> 44:50:12,000
da-mi 100 de numere. Cum sunt astea

60091
44:50:09,744 --> 44:50:13,920
numere? În egală măsură

60092
44:50:12,000 --> 44:50:16,800
distanțate

60093
44:50:13,920 --> 44:50:19,360
numere. Numere egale, nu?

60094
44:50:16,800 --> 44:50:21,440
Deci, atunci când vei executa asta, o vei face

60095
44:50:19,360 --> 44:50:23,840
vezi că toate sunt 100 de numere care

60096
44:50:21,440 --> 44:50:26,080
au fost generate, nu? 100 de numere.

60097
44:50:23,840 --> 44:50:28,320
Și toate numerele sunt echidistante de

60098
44:50:26,080 --> 44:50:30,464
unul pe altul pentru că diferența dintre fiecare

60099
44:50:28,320 --> 44:50:32,000
un singur număr din următorul număr este

60100
44:50:30,464 --> 44:50:35,000
0,01

60101
44:50:32,000 --> 44:50:35,000
01.

60102
44:50:38,880 --> 44:50:48,960
Da, asta face. Corect

60103
44:50:43,440 --> 44:50:50,464
acum băieți, acum să presupunem că vrem

60104
44:50:48,960 --> 44:50:52,640
genera

60105
44:50:50,464 --> 44:50:54,320
numere aleatorii, nu? Vrem

60106
44:50:52,640 --> 44:50:55,664
generează numere aleatorii, nu? Acum

60107
44:50:54,320 --> 44:51:00,384
suntem interesați să generăm aleatoriu

60108
44:50:55,664 --> 44:51:02,160
numere. Deci avem ceva numit ca

60109
44:51:00,384 --> 44:51:05,280
aleatoriu

60110
44:51:02,160 --> 44:51:06,960
punct dreapta aleator. Ce va face?

60111
44:51:05,280 --> 44:51:10,080
Aleatoriu.aleatoriu

60112
44:51:06,960 --> 44:51:11,744
va genera

60113
44:51:10,080 --> 44:51:15,104
aleatoriu

60114
44:51:11,744 --> 44:51:18,384
numere plutitoare

60115
44:51:15,104 --> 44:51:21,280
între 0 și 1. Numere aleatoare

60116
44:51:18,384 --> 44:51:23,360
între 0 și 1. Cum se va întâmpla asta?

60117
44:51:21,280 --> 44:51:29,360
vei spune

60118
44:51:23,360 --> 44:51:32,320
rand rand este egal cu np do. punct aleatoriu

60119
44:51:29,360 --> 44:51:34,960
aleatoriu si in interior vei mentiona ce

60120
44:51:32,320 --> 44:51:38,080
este dimensiunea pe care o cauți. Să presupunem

60121
44:51:34,960 --> 44:51:42,464
Vreau 6 6. Deci când vei verifica

60122
44:51:38,080 --> 44:51:47,200
asta vei avea toate numerele pentru 6 6

60123
44:51:42,464 --> 44:51:48,960
dimensiunea dreapta 6 6 matricea chiar acum

60124
44:51:47,200 --> 44:51:50,464
de fiecare dată când reluați acest lucru numerele

60125
44:51:48,960 --> 44:51:52,720
se va schimba pentru că toate acestea sunt

60126
44:51:50,464 --> 44:51:56,464
numere aleatorii

60127
44:51:52,720 --> 44:52:02,560
corect, toate acestea sunt numere aleatorii

60128
44:51:56,464 --> 44:52:04,720
acum spun 100 inmultit cu rand rand

60129
44:52:02,560 --> 44:52:07,664
le vei vedea pe toate toate acestea

60130
44:52:04,720 --> 44:52:09,744
numerele vor fi înmulțite cu 00 dreapta

60131
44:52:07,664 --> 44:52:12,080
toate

60132
44:52:09,744 --> 44:52:17,200
într-o singură cumpărătură.

60133
44:52:12,080 --> 44:52:20,800
Acum, la fel, putem crea și noi

60134
44:52:17,200 --> 44:52:23,664
numere întregi aleatoare cum vom crea

60135
44:52:20,800 --> 44:52:26,800
numere întregi aleatorii băieți

60136
44:52:23,664 --> 44:52:33,664
Spun rand intore

60137
44:52:26,800 --> 44:52:37,024
rand este egal cu np dot random dot rand

60138
44:52:33,664 --> 44:52:39,520
corect si aici vei specifica asta

60139
44:52:37,024 --> 44:52:44,800
care este intervalul de numere pe care îl doriți

60140
44:52:39,520 --> 44:52:48,080
de la asa zic intre 20 si 25 am nevoie

60141
44:52:44,800 --> 44:52:51,600
numere aleatoare și apoi vreau de la

60142
44:52:48,080 --> 44:52:54,000
într-un format 3 3. Corect? Și acum când

60143
44:52:51,600 --> 44:52:56,560
veți verifica aleatoriu pe care îl veți obține

60144
44:52:54,000 --> 44:52:58,960
numere aleatorii generate astfel.

60145
44:52:56,560 --> 44:53:01,960
Bine? Numere aleatorii generate ca

60146
44:52:58,960 --> 44:53:01,960
aceasta.

60147
44:53:04,384 --> 44:53:10,080
Corect?

60148
44:53:06,880 --> 44:53:12,560
Dacă spui 3 3 3 vei primi un 3  

60149
44:53:10,080 --> 44:53:17,320
3 3 matrice. Chiar dacă vei spune doar

60150
44:53:12,560 --> 44:53:17,320
3, veți obține un 1D.

60151
44:53:17,744 --> 44:53:22,560
Băieți potriviti? Puteți schimba

60152
44:53:19,664 --> 44:53:24,080
dimensiune. Deci aceasta este gama de la

60153
44:53:22,560 --> 44:53:26,160
pe care vrei să-l alegi aleatoriu

60154
44:53:24,080 --> 44:53:30,320
numere și aceasta este dimensiunea dvs

60155
44:53:26,160 --> 44:53:33,360
doresc ca această matrice sau vector să fie în.

60156
44:53:30,320 --> 44:53:37,360
Acum băieți, vom trece la următoarea parte

60157
44:53:33,360 --> 44:53:38,720
care este practic proprietăți și din nou

60158
44:53:37,360 --> 44:53:42,640
există o mulțime de operațiuni pe care le vei face

60159
44:53:38,720 --> 44:53:46,664
trebuie să vezi corect

60160
44:53:42,640 --> 44:53:46,664
proprietăţi şi

60161
44:53:46,880 --> 44:53:53,840
atribute

60162
44:53:49,744 --> 44:53:56,640
de numpy

60163
44:53:53,840 --> 44:53:59,104
arrays dreptul de proprietate și atribute ale

60164
44:53:56,640 --> 44:54:02,320
matrice numpy.

60165
44:53:59,104 --> 44:54:06,560
Bine. Acum băieți, primul din asta

60166
44:54:02,320 --> 44:54:08,720
schema lucrurilor este forma matricei,

60167
44:54:06,560 --> 44:54:12,000
nu? Forma matricei. Ce este forma

60168
44:54:08,720 --> 44:54:14,000
matrice? Îți spune

60169
44:54:12,000 --> 44:54:19,200
cel

60170
44:54:14,000 --> 44:54:23,280
dimensiunile matricei

60171
44:54:19,200 --> 44:54:25,920
stocat într-o

60172
44:54:23,280 --> 44:54:29,200
tle. Corect?

60173
44:54:25,920 --> 44:54:30,960
De exemplu, spun a ar r r r r r r r r

60174
44:54:29,200 --> 44:54:32,640
r r r r r r r r r r r r0

60175
44:54:30,960 --> 44:54:34,240
dreapta a r r r r r r r r r r r r r r r r

60176
44:54:32,640 --> 44:54:34,560
r r r r r 1 a ar a ar a ar a ar a ar a

60177
44:54:34,240 --> 44:54:38,080
ar a ar a ar a ar a ar a r r r r r r r r

60178
44:54:34,560 --> 44:54:42,920
r r r r r r r r r r r r r 2 a ar r r3

60179
44:54:38,080 --> 44:54:42,920
corect si apoi spun

60180
44:54:44,080 --> 44:54:50,000
imprima asta

60181
44:54:47,600 --> 44:54:52,384
formă de punct

60182
44:54:50,000 --> 44:54:55,440
chiar așa și vei vedea că asta

60183
44:54:52,384 --> 44:55:00,800
vă va oferi forma fiecărei matrice

60184
44:54:55,440 --> 44:55:04,600
nu? 0D, 1D, 2D și 3D. Oameni potriviti?

60185
44:55:00,800 --> 44:55:04,600
Forma matricei.

60186
44:55:04,720 --> 44:55:09,024
Vă rugăm să încercați. Noi l-am folosit unul

60187
44:55:07,200 --> 44:55:11,744
sau de două ori. Dar aceasta este forma

60188
44:55:09,024 --> 44:55:14,320
matrice înseamnă de fapt.

60189
44:55:11,744 --> 44:55:16,464
Al doilea sunt oamenii

60190
44:55:14,320 --> 44:55:20,240
sfârşitul

60191
44:55:16,464 --> 44:55:26,464
dreapta este sfarsitul

60192
44:55:20,240 --> 44:55:30,160
capătul din dreapta al matricei dreapta vă spune

60193
44:55:26,464 --> 44:55:31,600
rangul matricei, indiferent dacă este unul

60194
44:55:30,160 --> 44:55:32,880
zero dimensional bidimensional

60195
44:55:31,600 --> 44:55:34,800
dimensional tridimensional patru

60196
44:55:32,880 --> 44:55:39,384
dimensională

60197
44:55:34,800 --> 44:55:39,384
deci iar eu voi face la fel si

60198
44:55:46,464 --> 44:55:51,440
bine zic sfarsit si o sa vezi

60199
44:55:48,960 --> 44:55:53,440
vă va da 0 1 2 3 dimensiune zero

60200
44:55:51,440 --> 44:55:56,080
zero rang unu rang doi rang și trei

60201
44:55:53,440 --> 44:55:58,160
rang și poate merge până la capăt

60202
44:55:56,080 --> 44:56:02,800
rang

60203
44:55:58,160 --> 44:56:06,160
înainte de asta ar fi trebuit și eu

60204
44:56:02,800 --> 44:56:06,160
a tipărit aceste matrice

60205
44:56:09,200 --> 44:56:13,464
Corect. Acestea sunt matricele.

60206
44:56:22,560 --> 44:56:26,800
Da.

60207
44:56:24,384 --> 44:56:30,640
Acestea sunt matricele pe care le avem și

60208
44:56:26,800 --> 44:56:32,800
acestea sunt lucrurile ulterioare, nu?

60209
44:56:30,640 --> 44:56:37,840
Matrice de copiere a rangului. Apoi băieți, al treilea

60210
44:56:32,800 --> 44:56:42,000
lucru este dimensiunea de

60211
44:56:37,840 --> 44:56:47,104
matrice, nu? Îți spune

60212
44:56:42,000 --> 44:56:49,664
numărul de elemente din interior. Câți

60213
44:56:47,104 --> 44:56:52,560
elementele pe care le avem în interiorul acestei matrice

60214
44:56:49,664 --> 44:56:56,384
a ar r1? Câte elemente avem? 1

60215
44:56:52,560 --> 44:57:00,320
2 3 4 5 6 7. Câte elemente avem

60216
44:56:56,384 --> 44:57:02,560
au în acest 2 2 ar2? 1 2 3 4 5 6 7 8

60217
44:57:00,320 --> 44:57:05,744
9 care este rândurile înmulțite cu coloanele 3

60218
44:57:02,560 --> 44:57:10,000
* 3 corect și câte elemente avem

60219
44:57:05,744 --> 44:57:14,560
au în acest 3D care este 2 * 3 * 3 care

60220
44:57:10,000 --> 44:57:17,840
are 18 chiar acum, atunci când copiați asta

60221
44:57:14,560 --> 44:57:20,240
corect poți folosi asta

60222
44:57:17,840 --> 44:57:25,840
si spune

60223
44:57:20,240 --> 44:57:25,840
mărimea corectă va spune 17 918

60224
44:57:48,720 --> 44:57:51,720
Da.

60225
44:57:57,024 --> 44:58:03,840
Al patrulea este oamenii.

60226
44:58:00,640 --> 44:58:10,800
Tipul D

60227
44:58:03,840 --> 44:58:14,560
of array vă spune tipul de date al

60228
44:58:10,800 --> 44:58:16,464
matrice. Corect? Și ți-am spus că plasăm

60229
44:58:14,560 --> 44:58:18,960
numai

60230
44:58:16,464 --> 44:58:22,464
omogenă

60231
44:58:18,960 --> 44:58:24,080
date în matrice corect ce se va întâmpla dacă

60232
44:58:22,464 --> 44:58:28,640
noi nu facem asta iti voi arata asta

60233
44:58:24,080 --> 44:58:31,640
de asemenea corect, așa că facem asta corect și noi

60234
44:58:28,640 --> 44:58:31,640
spune

60235
44:58:32,960 --> 44:58:37,104
reintroduceți

60236
44:58:34,560 --> 44:58:40,000
și vei vedea în 64 toate sunt

60237
44:58:37,104 --> 44:58:42,640
numere întregi dreapta toate sunt numere întregi

60238
44:58:40,000 --> 44:58:45,520
acesta este motivul pentru care ajungem în 64

60239
44:58:42,640 --> 44:58:50,080
corect să presupunem că creez o nouă matrice a ar

60240
44:58:45,520 --> 44:58:53,104
r noua dreapta hai sa spun cap

60241
44:58:50,080 --> 44:58:54,880
dreapta hetero

60242
44:58:53,104 --> 44:59:01,080
eterogenă

60243
44:58:54,880 --> 44:59:01,080
și eu spun că este ca n matrice de puncte

60244
44:59:01,440 --> 44:59:05,240
sa zicem asa

60245
44:59:07,744 --> 44:59:12,560
chiar așa acum oameni când vrei

60246
44:59:10,560 --> 44:59:15,960
Verificați

60247
44:59:12,560 --> 44:59:15,960
ar r

60248
44:59:16,240 --> 44:59:21,520
tastați punctul d veți vedea că vă va da

60249
44:59:18,960 --> 44:59:24,560
plutește doar din cauza unei virgule flotante

60250
44:59:21,520 --> 44:59:27,280
numărul din interiorul întregului tablou pe care îl primește

60251
44:59:24,560 --> 44:59:29,104
convertit pentru a pluti chiar între toate

60252
44:59:27,280 --> 44:59:34,000
numere întregi dacă puneți un float, atunci acesta

60253
44:59:29,104 --> 44:59:36,240
va lua plutire direct chiar acum

60254
44:59:34,000 --> 44:59:38,960
Lasă-mă să copiez asta și să spunem

60255
44:59:36,240 --> 44:59:42,240
unul eterogen și să adaug altul

60256
44:59:38,960 --> 44:59:44,240
valoare care este șir și să spunem mai degrabă

60257
44:59:42,240 --> 44:59:46,384
corect și când îl vei executa

60258
44:59:44,240 --> 44:59:48,800
vă va oferi U32 U32 aici este

60259
44:59:46,384 --> 44:59:50,800
reprezentând șiruri corect este tot

60260
44:59:48,800 --> 44:59:53,840
numite drept obiecte, acestea sunt toate

60261
44:59:50,800 --> 44:59:56,000
valorile șirului corect deci precedențele

60262
44:59:53,840 --> 45:00:00,240
corzile cele mai mari, apoi plutesc și apoi

60263
44:59:56,000 --> 45:00:04,080
numerele dvs. întregi sunt corecte dacă plasați

60264
45:00:00,240 --> 45:00:06,320
date eterogene în interiorul matricei numpy

60265
45:00:04,080 --> 45:00:08,640
corect trebuie doar sa pui omogen

60266
45:00:06,320 --> 45:00:12,960
date din matrice

60267
45:00:08,640 --> 45:00:17,280
acum al cincilea este dimensiunea articolului

60268
45:00:12,960 --> 45:00:20,080
de matrice. Corect? Care este dimensiunea articolului?

60269
45:00:17,280 --> 45:00:22,560
Îți oferă

60270
45:00:20,080 --> 45:00:24,560
muşcătura

60271
45:00:22,560 --> 45:00:29,520
ocupat

60272
45:00:24,560 --> 45:00:31,744
de fiecare element al unui tablou. Corect?

60273
45:00:29,520 --> 45:00:34,160
Pentru că presupunem că elementele vor fi

60274
45:00:31,744 --> 45:00:37,024
omogenă. Îți va da mușcătura

60275
45:00:34,160 --> 45:00:39,520
ocupat de fiecare element al tabloului.

60276
45:00:37,024 --> 45:00:43,440
Un singur element. Bine? Deci cum va fi

60277
45:00:39,520 --> 45:00:48,384
se intampla? Deci, să spunem a ar r r0

60278
45:00:43,440 --> 45:00:51,840
sau să spunem ar r r1 dimensiunea punctului articolului

60279
45:00:48,384 --> 45:00:55,280
corect și vei avea opt dreptate. Deci

60280
45:00:51,840 --> 45:00:58,800
de ce opt? Pentru că

60281
45:00:55,280 --> 45:01:01,600
pentru că fiecare dată indică corect fiecare dată

60282
45:00:58,800 --> 45:01:07,360
punctul este ocupant

60283
45:01:01,600 --> 45:01:09,840
rezultatul este de 8 octeți. Lasă-mă să pun asta

60284
45:01:07,360 --> 45:01:09,840
aici.

60285
45:01:13,664 --> 45:01:22,080
Corect. Opt octeți

60286
45:01:15,920 --> 45:01:24,640
deoarece fiecare element din ARR1 este

60287
45:01:22,080 --> 45:01:30,240
ocupand

60288
45:01:24,640 --> 45:01:34,880
64 de biți care sunt

60289
45:01:30,240 --> 45:01:37,744
echivalente cu care sunt echivalente cu 8

60290
45:01:34,880 --> 45:01:41,280
octeți. Corect? o mușcătură este egală cu 8

60291
45:01:37,744 --> 45:01:43,024
biți. Deci 64 de biți vor fi egali cu 8

60292
45:01:41,280 --> 45:01:45,024
octeți. Corect? Așa este dăruirea

60293
45:01:43,024 --> 45:01:49,280
tu rezultatul. Acum dacă ești

60294
45:01:45,024 --> 45:01:55,240
interesat să cunoască toți octeții

60295
45:01:49,280 --> 45:01:55,240
dreapta întregi octeți, atunci spui n octeți

60296
45:01:56,464 --> 45:02:02,464
vă va oferi

60297
45:02:00,384 --> 45:02:04,080
total de octeți

60298
45:02:02,464 --> 45:02:08,960
ocupat

60299
45:02:04,080 --> 45:02:11,024
de elementele matricei. Corect? tu

60300
45:02:08,960 --> 45:02:13,440
spune print

60301
45:02:11,024 --> 45:02:18,560
un punct ar r1

60302
45:02:13,440 --> 45:02:24,464
n octeți dreapta și scrieți

60303
45:02:18,560 --> 45:02:26,640
octeți va fi de 56 de octeți

60304
45:02:24,464 --> 45:02:32,464
corect de ce pentru că câte elemente fac

60305
45:02:26,640 --> 45:02:36,000
avem în ar r1 nostru 1 2 3 4 5 6 7 dreapta

60306
45:02:32,464 --> 45:02:39,744
7 8 sunt 56 corecte 56 total de octeți sunt

60307
45:02:36,000 --> 45:02:42,464
fiind ocupat cu de ar r1 unu. Acum

60308
45:02:39,744 --> 45:02:44,384
baieti, al saptelea

60309
45:02:42,464 --> 45:02:48,520
este

60310
45:02:44,384 --> 45:02:48,520
ca tip dreapta

60311
45:02:48,560 --> 45:02:57,200
în matrice.

60312
45:02:51,280 --> 45:03:00,000
Acest lucru vă va ajuta să schimbați tipul de date

60313
45:02:57,200 --> 45:03:04,384
a matricei. Corect? Schimbați datele

60314
45:03:00,000 --> 45:03:10,000
tipul matricei. Să presupunem că am un arr

60315
45:03:04,384 --> 45:03:13,840
tastați care este uh, așa că voi spune tipăriți

60316
45:03:10,000 --> 45:03:18,840
d tastați dreapta aceasta este sfârșitul 64 dreapta și

60317
45:03:13,840 --> 45:03:18,840
acum ceea ce fac este să spun print

60318
45:03:20,384 --> 45:03:28,320
Stai să-ți ofer o modalitate structurată

60319
45:03:22,960 --> 45:03:30,640
imprimați un r1 dreapta, să spun

60320
45:03:28,320 --> 45:03:30,640
matrice

60321
45:03:33,664 --> 45:03:36,664
R1

60322
45:03:39,840 --> 45:03:46,104
tipul D dreapta de matrice.

60323
45:03:43,104 --> 45:03:46,104
Acum

60324
45:03:46,464 --> 45:03:48,000
a ar r2 scuze a ar a ar a ar a ar a ar a

60325
45:03:47,744 --> 45:03:50,240
ar a ar a ar a ar a ar a r r r r r r r r

60326
45:03:48,000 --> 45:03:52,080
r r r r r r r r r r r r r1 este egal cu a

60327
45:03:50,240 --> 45:03:55,600
ar r1

60328
45:03:52,080 --> 45:04:00,160
punct ca tip punct dreapta ca tip și haideți

60329
45:03:55,600 --> 45:04:02,464
spune că vreau să convertesc asta în np dot

60330
45:04:00,160 --> 45:04:04,320
dreapta np punct

60331
45:04:02,464 --> 45:04:07,840
uh

60332
45:04:04,320 --> 45:04:11,840
int 32 right Vreau să creez convert

60333
45:04:07,840 --> 45:04:15,104
asta în uh ar r r int 32 chiar când o fac

60334
45:04:11,840 --> 45:04:18,080
asta și acum când le voi copia la fel

60335
45:04:15,104 --> 45:04:20,800
lucruri pe care le vei vedea singur. Corect?

60336
45:04:18,080 --> 45:04:24,160
Acum tipul D era int 64 iar acum DT

60337
45:04:20,800 --> 45:04:27,440
tipul este int 32. Nu?

60338
45:04:24,160 --> 45:04:30,000
Dacă vreau, pot face această conversie în

60339
45:04:27,440 --> 45:04:33,280
plutește de asemenea

60340
45:04:30,000 --> 45:04:35,920
plutitor 64. Nu? Și atunci voi doar

60341
45:04:33,280 --> 45:04:39,744
copiați asta

60342
45:04:35,920 --> 45:04:42,384
și îl voi lipi aici.

60343
45:04:39,744 --> 45:04:45,440
Corect? Și acum vei vedea acum

60344
45:04:42,384 --> 45:04:48,560
virgulă mobilă a fost activată.

60345
45:04:45,440 --> 45:04:54,464
Corect? Acum a fost activat. Putem

60346
45:04:48,560 --> 45:04:56,000
merge până la int. Putem merge până la int 8.

60347
45:04:54,464 --> 45:04:59,280
Corect?

60348
45:04:56,000 --> 45:05:03,720
Pot merge la 16.

60349
45:04:59,280 --> 45:05:03,720
nu? Și pot face asta.

60350
45:05:04,000 --> 45:05:10,744
Pot merge la int

60351
45:05:07,200 --> 45:05:10,744
8 de asemenea.

60352
45:05:12,560 --> 45:05:22,384
Da, așa și în data 64 32.

60353
45:05:18,720 --> 45:05:25,384
Deci primul trebuie să fie

60354
45:05:22,384 --> 45:05:25,384
Da.

60355
45:05:28,240 --> 45:05:31,240
32

60356
45:05:38,320 --> 45:05:45,440
orice drept ca asta, bine poți

60357
45:05:42,560 --> 45:05:48,720
converti asta

60358
45:05:45,440 --> 45:05:54,000
de asemenea, oamenii, aceasta este mai târziu la conversie

60359
45:05:48,720 --> 45:05:59,520
puteți defini tipul de date al

60360
45:05:54,000 --> 45:06:00,800
matrice în timp ce timpul de creare, de asemenea. Cum

60361
45:05:59,520 --> 45:06:04,560
ai face asta? Să presupunem că ești

60362
45:06:00,800 --> 45:06:06,960
creând un ar r11 și spui np dot

60363
45:06:04,560 --> 45:06:09,744
matrice dreapta și să presupunem că o luați de la

60364
45:06:06,960 --> 45:06:12,000
o listă și apoi pui doar o virgulă și

60365
45:06:09,744 --> 45:06:14,720
spune tip d. Deci, care va fi implicit

60366
45:06:12,000 --> 45:06:17,440
tip de date aici oameni? Dacă doar fac asta

60367
45:06:14,720 --> 45:06:21,664
dacă execut asta, care va fi

60368
45:06:17,440 --> 45:06:24,160
tip de date implicit? Int 64 este implicit

60369
45:06:21,664 --> 45:06:26,880
nu-i asa? Dar acum să presupunem că vreau

60370
45:06:24,160 --> 45:06:35,240
schimba-l chiar aici. Eu spun că tipul de date este

60371
45:06:26,880 --> 45:06:35,240
egal cu float 32 dreapta scuze float 64

60372
45:06:36,320 --> 45:06:42,960
np punct

60373
45:06:38,720 --> 45:06:46,640
scuze răul meu

60374
45:06:42,960 --> 45:06:49,024
float 64 dreapta si spun a ar r r11 si

60375
45:06:46,640 --> 45:06:52,464
acesta va fi float 64 dacă vrei float

60376
45:06:49,024 --> 45:06:55,280
32 va deveni și float 32 dreapta

60377
45:06:52,464 --> 45:06:57,104
chiar aici în timp ce definiți

60378
45:06:55,280 --> 45:06:58,720
În loc să utilizați ca tip, o puteți face

60379
45:06:57,104 --> 45:07:00,320
chiar aici. Corect? Aceste lucruri vor

60380
45:06:58,720 --> 45:07:02,160
veniți oameni foarte la îndemână pentru că voi

60381
45:07:00,320 --> 45:07:03,840
va trebui să salveze memorie pentru că când

60382
45:07:02,160 --> 45:07:06,640
datele tale devin foarte foarte mari, tu

60383
45:07:03,840 --> 45:07:08,880
va fi mereu în criză pentru memorie

60384
45:07:06,640 --> 45:07:11,024
ca asta. Vrei numere întregi, atunci

60385
45:07:08,880 --> 45:07:12,720
numerele întregi vor fi așa

60386
45:07:11,024 --> 45:07:16,080
aleatoriu.randent

60387
45:07:12,720 --> 45:07:19,920
ca asta. Să presupunem că doriți să generați

60388
45:07:16,080 --> 45:07:21,920
0 la șase, nu? Și să presupunem că vrei

60389
45:07:19,920 --> 45:07:27,360
genera

60390
45:07:21,920 --> 45:07:28,960
spune 100 de numere ca acesta de la 0 la 6

60391
45:07:27,360 --> 45:07:34,920
scoruri

60392
45:07:28,960 --> 45:07:34,920
1 până la șase ca asta la întâmplare

60393
45:07:36,000 --> 45:07:42,800
corect să presupunem că doriți să generați 100

60394
45:07:39,520 --> 45:07:45,840
scoruri pentru cinci batsmen diferiți

60395
45:07:42,800 --> 45:07:48,640
la întâmplare va fi ca acest batsman

60396
45:07:45,840 --> 45:07:54,104
numărul unu al batsmanului număr la numărul batului

60397
45:07:48,640 --> 45:07:54,104
trei, al patrulea și al cincilea. Corect.

60398
45:07:54,240 --> 45:07:57,240
Da.

60399
45:07:59,280 --> 45:08:03,920
Înțelegeți datele băieți. Acum este

60400
45:08:01,200 --> 45:08:10,720
timpul pentru a înțelege datele.

60401
45:08:03,920 --> 45:08:13,840
Da. Acum băieți, avem metode în numpy

60402
45:08:10,720 --> 45:08:16,320
matrice, nu? Metode în matrice numpy.

60403
45:08:13,840 --> 45:08:19,280
Deci care sunt aceste metode? Acum primul

60404
45:08:16,320 --> 45:08:23,560
metoda pe care trebuie să o învățăm se numește ca

60405
45:08:19,280 --> 45:08:23,560
remodela corect. Reformează.

60406
45:08:29,280 --> 45:08:34,000
Da. Deci remodelați este că puteți folosi acest lucru

60407
45:08:31,840 --> 45:08:37,024
crea

60408
45:08:34,000 --> 45:08:41,104
puteți folosi acest lucru pentru a crea

60409
45:08:37,024 --> 45:08:43,104
o nouă formă a matricei. Foarte foarte

60410
45:08:41,104 --> 45:08:47,520
băieți puternici. Foarte puternic. Unul dintre

60411
45:08:43,104 --> 45:08:50,960
cele mai puternice metode din numpy este uh the

60412
45:08:47,520 --> 45:08:53,960
remodelare corect și cum folosim remodelarea

60413
45:08:50,960 --> 45:08:53,960
presupunem

60414
45:08:54,384 --> 45:09:05,360
avem o matrice 1D de 20 de elemente corect

60415
45:09:01,744 --> 45:09:12,160
acum să remodelăm asta

60416
45:09:05,360 --> 45:09:12,160
să-l remodelăm trebuie să găsim factorii

60417
45:09:12,560 --> 45:09:21,280
Corect. Factori de 20. Ce sunt ei? 1

60418
45:09:17,600 --> 45:09:23,920
20 4 5

60419
45:09:21,280 --> 45:09:27,280
2 10.

60420
45:09:23,920 --> 45:09:29,200
Corect. Ceilalți factori.

60421
45:09:27,280 --> 45:09:31,360
Ceilalți factori. Acum vezi ce voi face

60422
45:09:29,200 --> 45:09:34,560
face. Corect. Acum vezi ce voi face. Lasă

60423
45:09:31,360 --> 45:09:39,440
eu creez o matrice aleatorie. Corect?

60424
45:09:34,560 --> 45:09:43,600
Matrice aleatorie. spun aleatoriu

60425
45:09:39,440 --> 45:09:47,744
arr este egal cu entprandom

60426
45:09:43,600 --> 45:09:52,240
dot rand dreapta și lasă-mă să spun că vreau

60427
45:09:47,744 --> 45:09:57,104
creează-l de la 1 la 50 corect și vreau

60428
45:09:52,240 --> 45:10:00,384
să aibă 20 de elemente corect, așa că eu

60429
45:09:57,104 --> 45:10:02,560
spune aranjat aleatoriu

60430
45:10:00,384 --> 45:10:08,440
valorile din acest drept aleatoriu 20

60431
45:10:02,560 --> 45:10:08,440
valorile acum vezi Now reshape

60432
45:10:08,464 --> 45:10:11,464
mai întâi

60433
45:10:11,600 --> 45:10:22,560
Voi remodela in 1 20 dreapta 1A 20 cum

60434
45:10:18,960 --> 45:10:25,560
voi face asta trebuie doar să scrii

60435
45:10:22,560 --> 45:10:25,560
uh

60436
45:10:26,720 --> 45:10:31,360
imprima

60437
45:10:28,800 --> 45:10:33,920
a ar r r imi pare rau random dot ar r

60438
45:10:31,360 --> 45:10:37,360
aleatoriu ar

60439
45:10:33,920 --> 45:10:41,520
dot reshape dot reshape și tu doar

60440
45:10:37,360 --> 45:10:43,840
trece in dimensiunea eu zic 1 20

60441
45:10:41,520 --> 45:10:47,920
corect și când vei face asta o vei face

60442
45:10:43,840 --> 45:10:53,464
vezi că vine acum în format 120

60443
45:10:47,920 --> 45:10:53,464
corect, așa că lasă-mă să scriu și print

60444
45:11:02,640 --> 45:11:07,360
dreapta 2D

60445
45:11:04,640 --> 45:11:10,720
1A 20

60446
45:11:07,360 --> 45:11:15,280
corect și acum ceea ce voi face este să copiez

60447
45:11:10,720 --> 45:11:18,640
asta și voi lipi asta și voi spune 20

60448
45:11:15,280 --> 45:11:21,360
virgula 1 dreapta vei vedea ca va fi

60449
45:11:18,640 --> 45:11:25,520
ca aceasta 20 virgula 1 imediat cu

60450
45:11:21,360 --> 45:11:29,664
remodelează corect, lasă-mă să copiez asta

60451
45:11:25,520 --> 45:11:35,600
Lasă-mă să spun 2D. Sunt încă la 2D. Lasă-mă să spun

60452
45:11:29,664 --> 45:11:39,280
2 10 corect și tu să vezi asta este 2A 10.

60453
45:11:35,600 --> 45:11:43,080
Acum îl pot remodela

60454
45:11:39,280 --> 45:11:43,080
10 2

60455
45:11:43,360 --> 45:11:51,720
dreapta 10 2 dreapta atunci pot remodela

60456
45:11:48,384 --> 45:11:51,720
acelasi lucru

60457
45:11:52,640 --> 45:11:58,880
in

60458
45:11:54,384 --> 45:12:01,360
4A 5 și îl pot remodela în 5A 4

60459
45:11:58,880 --> 45:12:04,240
chiar așa băieți sunteți în stare să vedeți

60460
45:12:01,360 --> 45:12:05,600
puterea o dimensiune pe care o pot

60461
45:12:04,240 --> 45:12:08,000
creați două dimensiuni

60462
45:12:05,600 --> 45:12:11,360
Și acum voi face un pas mai departe

60463
45:12:08,000 --> 45:12:12,640
și o voi scrie în trei dimensiuni.

60464
45:12:11,360 --> 45:12:17,520
Corect? Cum o voi scrie în trei

60465
45:12:12,640 --> 45:12:20,160
dimensiune? Lasă-mă să spun asta 1 virgulă

60466
45:12:17,520 --> 45:12:24,320
2a 10. Nu? Acesta va fi, de asemenea, trei

60467
45:12:20,160 --> 45:12:26,880
dimensiuni. Ne pare rău 2a 2a 5.

60468
45:12:24,320 --> 45:12:29,840
Lasă-mă să spun asta. Și acum mă vei vedea

60469
45:12:26,880 --> 45:12:32,240
poate avea acest lucru în trei dimensiuni.

60470
45:12:29,840 --> 45:12:36,000
Corect?

60471
45:12:32,240 --> 45:12:40,384
Da. Pot spune și în trei dimensiuni

60472
45:12:36,000 --> 45:12:43,280
ca asta. Vreau să am cinci straturi

60473
45:12:40,384 --> 45:12:46,720
cu două rânduri și două coloane. Corect? Aşa

60474
45:12:43,280 --> 45:12:49,280
o vei avea si asa. Corect?

60475
45:12:46,720 --> 45:12:51,744
Așa că oamenii îi putem remodela

60476
45:12:49,280 --> 45:12:53,360
matrice. Foarte puternic. Foarte foarte

60477
45:12:51,744 --> 45:12:57,464
puternic.

60478
45:12:53,360 --> 45:12:57,464
Corect? Foarte foarte puternic.

60479
45:12:57,600 --> 45:13:01,800
Corect? Și poți lua asta

60480
45:13:04,320 --> 45:13:08,104
și salvați imprimarea

60481
45:13:09,440 --> 45:13:16,720
Punctează la întâmplare asta și poți spune print

60482
45:13:14,384 --> 45:13:21,880
formă de punct.

60483
45:13:16,720 --> 45:13:21,880
Corect? Deci acesta a fost primul.

60484
45:13:27,024 --> 45:13:32,240
Da. ca aceasta.

60485
45:13:29,440 --> 45:13:35,440
De asemenea oameni dacă vrei să ne vizualizezi

60486
45:13:32,240 --> 45:13:40,240
poate merge și pe acest traseu.

60487
45:13:35,440 --> 45:13:43,440
Putem avea 10 virgulă 2 virgulă 1, nu?

60488
45:13:40,240 --> 45:13:47,360
O să arate așa, nu? 10

60489
45:13:43,440 --> 45:13:51,464
straturi. 10 straturi pe care le poți avea,

60490
45:13:47,360 --> 45:13:51,464
nu? 10 straturi pe care le poți avea.

60491
45:13:52,000 --> 45:13:58,720
Mare. Acum, a doua metodă pe care o avem

60492
45:13:54,880 --> 45:14:00,464
a învăţa se numeşte ca

60493
45:13:58,720 --> 45:14:03,104
transpune,

60494
45:14:00,464 --> 45:14:07,920
nu? Metoda transpunerii. Corect? Ce

60495
45:14:03,104 --> 45:14:10,640
asta face? Schimbă

60496
45:14:07,920 --> 45:14:15,104
dimensiuni

60497
45:14:10,640 --> 45:14:18,464
precum rândurile și coloanele, nu? Da.

60498
45:14:15,104 --> 45:14:22,800
Absolut. Corect. Să presupunem că aveți o

60499
45:14:18,464 --> 45:14:29,200
matrice, nu? Care este

60500
45:14:22,800 --> 45:14:32,320
22, 33, 44, 55, 66, 77, nu? Aceasta este

60501
45:14:29,200 --> 45:14:35,280
a. Așa că acum, când îl vei transpune,

60502
45:14:32,320 --> 45:14:39,520
nu? Dimensiunea chiar acum forma

60503
45:14:35,280 --> 45:14:42,320
chiar acum este 3A 2. Acum asta va deveni

60504
45:14:39,520 --> 45:14:44,464
2a 3. Și cum se va întâmpla asta? Rânduri

60505
45:14:42,320 --> 45:14:47,200
vor deveni acum coloane iar coloanele vor

60506
45:14:44,464 --> 45:14:49,600
acum devin rânduri. Corect? Deci hai să facem

60507
45:14:47,200 --> 45:14:55,024
coloană rândurile. Corect? Ne pare rău, coloane

60508
45:14:49,600 --> 45:15:00,464
rândurile. Va fi 22 44 66

60509
45:14:55,024 --> 45:15:03,280
33 55 77. Nu? Deci oamenii în transpunere

60510
45:15:00,464 --> 45:15:07,200
nu se pierde nicio informatie. Este doar o

60511
45:15:03,280 --> 45:15:10,384
schimbare în dreptul de vedere care este

60512
45:15:07,200 --> 45:15:19,080
se intampla nu?

60513
45:15:10,384 --> 45:15:19,080
22 44 66 33 55 77.

60514
45:15:19,280 --> 45:15:25,600
De ce avem nevoie de transpunere? Să presupunem că noi

60515
45:15:23,024 --> 45:15:28,320
au două matrice.

60516
45:15:25,600 --> 45:15:30,320
Aceasta este matematica de clasa a XI-a. Corect?

60517
45:15:28,320 --> 45:15:33,920
unul are

60518
45:15:30,320 --> 45:15:39,880
o dimensiune de n cruce m și a doua

60519
45:15:33,920 --> 45:15:39,880
are dimensiunea unei cruci b. Dacă tu

60520
45:15:40,320 --> 45:15:45,080
doresc să se înmulțească

60521
45:15:46,080 --> 45:15:54,280
aceste două matrice spun

60522
45:15:50,240 --> 45:15:54,280
M_sub_1 și M_sub_2,

60523
45:15:54,320 --> 45:16:00,640
corect? Trebuie să existe o satisfacție

60524
45:15:56,560 --> 45:16:04,080
de stare. M ar trebui să fie egal cu A.

60525
45:16:00,640 --> 45:16:05,920
nu? M ar trebui să fie egal cu A. Nu? M

60526
45:16:04,080 --> 45:16:08,880
ar trebui să fie egal cu A. Acest lucru ar trebui să fie

60527
45:16:05,920 --> 45:16:10,464
egal cu acesta și vectorul rezultant

60528
45:16:08,880 --> 45:16:14,880
matricea rezultată pe care o veți obține

60529
45:16:10,464 --> 45:16:17,360
va fi de n dimensiune cruce dreapta. Deci

60530
45:16:14,880 --> 45:16:21,104
de multe ori presupunem că acesta este n cruce m

60531
45:16:17,360 --> 45:16:24,640
aceasta este n cruce m dreapta m cruce n și

60532
45:16:21,104 --> 45:16:26,640
știi că m este egal cu a. Deci ce

60533
45:16:24,640 --> 45:16:28,800
vei face? Veți transpune acest lucru

60534
45:16:26,640 --> 45:16:31,440
matrice nu? Veți transpune acest lucru

60535
45:16:28,800 --> 45:16:34,320
matrice atunci va deveni n cruce m și

60536
45:16:31,440 --> 45:16:36,000
atunci m poate fi echivalent cu a. Corect?

60537
45:16:34,320 --> 45:16:38,880
De exemplu, ceea ce spun, avem

60538
45:16:36,000 --> 45:16:42,960
o matrice care este 2 3 si aceasta

60539
45:16:38,880 --> 45:16:45,360
matricea este 2 5, nu? Deci, poți

60540
45:16:42,960 --> 45:16:48,240
înmulți acești oameni matrice? Este 3 egal

60541
45:16:45,360 --> 45:16:50,240
la 2? Răspunsul este nu. Corect? The

60542
45:16:48,240 --> 45:16:52,160
raspunsul este nu. Deci, ce vei face? tu

60543
45:16:50,240 --> 45:16:57,840
va transpune doar aceasta și aceasta voință

60544
45:16:52,160 --> 45:16:59,840
deveni 3 2 și acesta este 2 5. Și acum

60545
45:16:57,840 --> 45:17:04,560
puteți înmulți aceasta și rezultatul

60546
45:16:59,840 --> 45:17:06,720
va deveni 3 5 matrice. Corect? Deci pentru

60547
45:17:04,560 --> 45:17:08,720
operațiuni ca acestea de care avem nevoie

60548
45:17:06,720 --> 45:17:11,200
transpunere. Corect? Deci cum facem

60549
45:17:08,720 --> 45:17:14,320
o transpune?

60550
45:17:11,200 --> 45:17:15,840
Cum îl transpunem? Deci să zicem

60551
45:17:14,320 --> 45:17:20,000
din nou

60552
45:17:15,840 --> 45:17:24,464
uh a ar r2 corect, acesta este un ar r2 și eu

60553
45:17:20,000 --> 45:17:29,920
doresc să o transpună. Deci eu spun că un r2 t este

60554
45:17:24,464 --> 45:17:33,664
egal cu uh np.transpose transpose

60555
45:17:29,920 --> 45:17:35,360
scuze un punct r2

60556
45:17:33,664 --> 45:17:37,280
transpune

60557
45:17:35,360 --> 45:17:41,360
corect

60558
45:17:37,280 --> 45:17:43,024
iar acum când vei vedea ar r2 ts tu

60559
45:17:41,360 --> 45:17:46,080
va vedea rândurile și coloanele au

60560
45:17:43,024 --> 45:17:50,360
rândurile și coloanele din dreapta schimbate au

60561
45:17:46,080 --> 45:17:50,360
schimbate între ele

60562
45:17:52,464 --> 45:18:02,640
sau să vă mai dau un exemplu

60563
45:17:56,640 --> 45:18:06,360
Dacă nu este clar, lasă-mă să reiau

60564
45:18:02,640 --> 45:18:06,360
asta din nou

60565
45:18:14,880 --> 45:18:20,320
chiar acum. spun eu

60566
45:18:17,664 --> 45:18:23,104
remodelarea punctului

60567
45:18:20,320 --> 45:18:26,080
să spună

60568
45:18:23,104 --> 45:18:28,720
2 10. Nu? Deci acesta este 2 10. Și

60569
45:18:26,080 --> 45:18:34,640
acum când vrei să transpui asta așa

60570
45:18:28,720 --> 45:18:37,640
Voi spune că acest t este egal cu acest punct

60571
45:18:34,640 --> 45:18:37,640
transpune

60572
45:18:38,464 --> 45:18:48,160
t sau a asta și putem verifica asta acum

60573
45:18:44,000 --> 45:18:51,440
si asta va fi. Îmi pare rău băieți. Deci asta

60574
45:18:48,160 --> 45:18:53,840
va fi, va fi așa

60575
45:18:51,440 --> 45:19:01,384
drept transpus.

60576
45:18:53,840 --> 45:19:01,384
Și acum, dacă vrei să vezi asta,

60577
45:19:03,664 --> 45:19:08,560
aceasta a fost forma originală, nu? Rânduri

60578
45:19:05,920 --> 45:19:12,240
iar coloanele au fost acum schimbate,

60579
45:19:08,560 --> 45:19:16,320
transpuse între ele.

60580
45:19:12,240 --> 45:19:18,320
Acum băieți, a treia metodă,

60581
45:19:16,320 --> 45:19:21,440
a treia metodă care există la noi

60582
45:19:18,320 --> 45:19:24,960
se numește aplatizare, nu? Este

60583
45:19:21,440 --> 45:19:24,960
numit ca aplatizare.

60584
45:19:25,200 --> 45:19:33,744
Corect? Ce face aplatizarea? Se reduce

60585
45:19:29,360 --> 45:19:36,320
dimensiunea la o dimensiune. Corect?

60586
45:19:33,744 --> 45:19:40,960
Orice dimensiune ai, o reduce la

60587
45:19:36,320 --> 45:19:44,384
o singură dimensiune. De exemplu, am asta,

60588
45:19:40,960 --> 45:19:46,464
nu? Și acum când spun

60589
45:19:44,384 --> 45:19:48,000
aceasta

60590
45:19:46,464 --> 45:19:53,520
punct_f,

60591
45:19:48,000 --> 45:19:56,160
acesta va deveni acest dot platin.

60592
45:19:53,520 --> 45:19:57,920
Și când vei verifica asta, tu

60593
45:19:56,160 --> 45:19:59,920
va vedea că acum a devenit una

60594
45:19:57,920 --> 45:20:03,520
dimensiune. Indiferent de câte dimensiuni

60595
45:19:59,920 --> 45:20:05,664
ai, va deveni o singură dimensiune.

60596
45:20:03,520 --> 45:20:09,320
Corect? Lasă-mă să iau asta din nou pentru a arăta

60597
45:20:05,664 --> 45:20:09,320
inca un exemplu.

60598
45:20:11,024 --> 45:20:18,384
Corect?

60599
45:20:13,104 --> 45:20:21,384
Și aici spun dot reshape into

60600
45:20:18,384 --> 45:20:21,384
uh

60601
45:20:21,840 --> 45:20:30,800
uh 5 2 2 corect, fac asta la întâmplare

60602
45:20:27,104 --> 45:20:34,080
ar r este acest drept are cinci straturi

60603
45:20:30,800 --> 45:20:36,464
două rânduri și două coloane chiar așa că acum eu

60604
45:20:34,080 --> 45:20:41,664
spune asta

60605
45:20:36,464 --> 45:20:44,384
aplatizare este egal cu acest punct aplatizare

60606
45:20:41,664 --> 45:20:46,720
și dacă îl vei verifica acum din nou, tu

60607
45:20:44,384 --> 45:20:49,280
voi vedea că acum l-a aplatizat.

60608
45:20:46,720 --> 45:20:51,360
Da.

60609
45:20:49,280 --> 45:20:53,600
Acum de ce avem nevoie de asta? Avem nevoie de asta

60610
45:20:51,360 --> 45:20:56,880
pentru o mulțime de operațiuni statistice. Noi

60611
45:20:53,600 --> 45:20:59,024
nevoie de acest lucru pentru a alimenta datele în

60612
45:20:56,880 --> 45:21:00,560
algoritmi. Corect? Pe măsură ce ne vom mișca

60613
45:20:59,024 --> 45:21:02,080
înainte, veți înțelege utilizarea

60614
45:21:00,560 --> 45:21:06,384
aplatizarea.

60615
45:21:02,080 --> 45:21:10,384
Corect? Acum băieți, merg mai departe și uh ca

60616
45:21:06,384 --> 45:21:13,520
discutat, permiteți-mi acum să vă arăt

60617
45:21:10,384 --> 45:21:16,520
puterea de

60618
45:21:13,520 --> 45:21:16,520
numpy,

60619
45:21:16,640 --> 45:21:20,880
nu? Numpy

60620
45:21:18,640 --> 45:21:25,360
peste

60621
45:21:20,880 --> 45:21:27,744
liste și alte tipuri de date, nu? eu

60622
45:21:25,360 --> 45:21:29,840
nu voi lua multe exemple. Doar a

60623
45:21:27,744 --> 45:21:32,960
în al doilea rând, băieți.

60624
45:21:29,840 --> 45:21:38,720
Da. Bine.

60625
45:21:32,960 --> 45:21:41,280
Acum băieți, v-am spus asta

60626
45:21:38,720 --> 45:21:44,464
mai putin

60627
45:21:41,280 --> 45:21:48,384
prelua

60628
45:21:44,464 --> 45:21:50,320
mult mai multa memorie

60629
45:21:48,384 --> 45:21:53,440
în comparație

60630
45:21:50,320 --> 45:21:58,640
la matrice numpy. Corect? Și mă duc

60631
45:21:53,440 --> 45:22:00,464
demonstrează-ți asta. Corect? Acum lasă-mă să folosesc

60632
45:21:58,640 --> 45:22:04,800
permiteți-mi să creez o secvență aleatorie de

60633
45:22:00,464 --> 45:22:08,960
numere aleatoare folosind intervalul în Python

60634
45:22:04,800 --> 45:22:11,360
dreapta și spun că creez un interval de 10.000

60635
45:22:08,960 --> 45:22:13,280
numere din gama dreaptă de 10.000 de numere deci

60636
45:22:11,360 --> 45:22:16,960
ce-mi va da asta imi va da asta

60637
45:22:13,280 --> 45:22:20,160
numere de la 0 la 99999 drept continuu

60638
45:22:16,960 --> 45:22:22,080
numerele corecte, așa că acesta este intervalul pe care îl voi face

60639
45:22:20,160 --> 45:22:24,880
folosi

60640
45:22:22,080 --> 45:22:28,640
un interval în

60641
45:22:24,880 --> 45:22:31,960
numpy Y pentru a crea

60642
45:22:28,640 --> 45:22:31,960
un similar

60643
45:22:32,240 --> 45:22:39,664
serie de numere

60644
45:22:35,200 --> 45:22:42,640
corect, deci să spunem că matricea este egală cu np

60645
45:22:39,664 --> 45:22:45,200
dot range

60646
45:22:42,640 --> 45:22:48,320
corect același lucru același lucru făcut de ambii drept

60647
45:22:45,200 --> 45:22:51,920
Ți-am arătat mai sus și acum lasă-mă

60648
45:22:48,320 --> 45:22:55,104
import sis

60649
45:22:51,920 --> 45:22:58,160
bibliotecă right sis pachet și voi folosi

60650
45:22:55,104 --> 45:23:01,520
ceva numit ca get size of right

60651
45:22:58,160 --> 45:23:05,280
obține dimensiunea de. Ce face asta? Obțineți dimensiunea

60652
45:23:01,520 --> 45:23:07,520
este o metodă

60653
45:23:05,280 --> 45:23:10,320
care calculează

60654
45:23:07,520 --> 45:23:12,800
octeții

60655
45:23:10,320 --> 45:23:15,840
ocupat

60656
45:23:12,800 --> 45:23:18,080
de un singur

60657
45:23:15,840 --> 45:23:20,464
element în

60658
45:23:18,080 --> 45:23:22,960
vanilie Python. Ce este vanilla Python?

60659
45:23:20,464 --> 45:23:25,280
Este pitonul tradițional,

60660
45:23:22,960 --> 45:23:26,880
nu? vanilie Python.

60661
45:23:25,280 --> 45:23:30,464
Așa că lasă-mă să îți arăt asta. eu voi

60662
45:23:26,880 --> 45:23:33,360
folosește asta și voi spune print. Acum baieti,

60663
45:23:30,464 --> 45:23:36,640
dacă primesc

60664
45:23:33,360 --> 45:23:39,600
dimensiunea oricărui număr aleatoriu din acesta

60665
45:23:36,640 --> 45:23:43,104
raza, nu? Orice număr aleatoriu. Spune eu

60666
45:23:39,600 --> 45:23:46,720
ia dimensiunea de cinci, nu? Iar eu atunci

60667
45:23:43,104 --> 45:23:50,160
înmulțiți că byes cu lungimea de

60668
45:23:46,720 --> 45:23:53,280
aleatoriu, nu? Cu lungimea aleatorie

60669
45:23:50,160 --> 45:23:55,280
acest rand, nu?

60670
45:23:53,280 --> 45:23:58,000
Corect? Cu lungimea aleatorie, nu

60671
45:23:55,280 --> 45:23:59,744
cred că voi obține octeții pentru

60672
45:23:58,000 --> 45:24:02,464
întreg

60673
45:23:59,744 --> 45:24:04,800
structura datelor? Ce spun eu este

60674
45:24:02,464 --> 45:24:08,464
presupunem

60675
45:24:04,800 --> 45:24:12,640
eu am folosit gama

60676
45:24:08,464 --> 45:24:15,104
cinci. Deci ce îmi va da asta? 0 1 2 3

60677
45:24:12,640 --> 45:24:18,384
4. Nu? Aceasta va fi rezultatul. Deci

60678
45:24:15,104 --> 45:24:21,440
acum zic ia

60679
45:24:18,384 --> 45:24:25,024
dimensiunea să zic eu două. Corect? Deci să presupunem

60680
45:24:21,440 --> 45:24:28,464
2 este x și apoi îl înmulțesc cu

60681
45:24:25,024 --> 45:24:31,104
lungimea acestei serii care este de cinci. Deci

60682
45:24:28,464 --> 45:24:33,024
crezi că voi primi 5x care va

60683
45:24:31,104 --> 45:24:35,744
reprezintă numărul de octeți ocupați

60684
45:24:33,024 --> 45:24:38,080
de întregul tip de date. Orice

60685
45:24:35,744 --> 45:24:42,000
aleatoriu orice număr aleator care poate fi acesta

60686
45:24:38,080 --> 45:24:45,240
trei nu? De ce să nu te grăbești?

60687
45:24:42,000 --> 45:24:45,240
De ce nu?

60688
45:24:47,744 --> 45:24:54,000
Toate acestea sunt numere întregi. Deci numere întregi

60689
45:24:50,384 --> 45:24:56,160
toți 64 de biți presupunând. Deci dacă tu

60690
45:24:54,000 --> 45:24:57,920
calculați latura de mărime a acesteia și

60691
45:24:56,160 --> 45:25:00,640
dacă înmulțiți cu numărul total de

60692
45:24:57,920 --> 45:25:03,960
numere veți obține dimensiunea totală

60693
45:25:00,640 --> 45:25:03,960
nu-i asa?

60694
45:25:04,800 --> 45:25:08,744
huh? Indexul este în

60695
45:25:10,384 --> 45:25:13,664
nu nu, nu este vorba despre asta, este vorba despre

60696
45:25:12,080 --> 45:25:16,560
element drept elemente omogene

60697
45:25:13,664 --> 45:25:19,360
în interiorul acesteia.

60698
45:25:16,560 --> 45:25:22,464
Spun când folosești gama cinci ce

60699
45:25:19,360 --> 45:25:27,104
va fi rezultatul? 0 1 2 3 4

60700
45:25:22,464 --> 45:25:31,280
chiar acum toate acestea sunt elemente

60701
45:25:27,104 --> 45:25:32,800
elemente de gamă.

60702
45:25:31,280 --> 45:25:36,960
Corect? Toate sunt elemente ale

60703
45:25:32,800 --> 45:25:41,744
gamă. Corect? Acum spun dacă aduc

60704
45:25:36,960 --> 45:25:45,280
mărimea unui element și înmulțiți-l

60705
45:25:41,744 --> 45:25:48,000
cu lungimea întregului interval,

60706
45:25:45,280 --> 45:25:52,160
voi primi octeții ocupați de

60707
45:25:48,000 --> 45:25:56,024
intreaga gama? De exemplu, dacă fac asta,

60708
45:25:52,160 --> 45:25:56,024
nu? Daca fac asta,

60709
45:25:56,640 --> 45:26:02,960
asta e 28, nu? 28 de octeți oameni. 28

60710
45:26:00,464 --> 45:26:06,880
octeți

60711
45:26:02,960 --> 45:26:13,920
octeții sunt ocupați

60712
45:26:06,880 --> 45:26:16,240
de un element din dreapta de gamă

60713
45:26:13,920 --> 45:26:20,000
un element al

60714
45:26:16,240 --> 45:26:24,240
interval chiar acum, dacă doar spun că sunt

60715
45:26:20,000 --> 45:26:27,024
spun doar dacă înmulțesc ca să aflu cum

60716
45:26:24,240 --> 45:26:29,664
gama de multe numere are

60717
45:26:27,024 --> 45:26:31,920
câte numere

60718
45:26:29,664 --> 45:26:35,200
gama are

60719
45:26:31,920 --> 45:26:39,320
egal cu 10.000

60720
45:26:35,200 --> 45:26:39,320
drept atât de total

60721
45:26:39,440 --> 45:26:48,800
memorie ocupată

60722
45:26:41,920 --> 45:26:51,520
va fi cât va fi 28

60723
45:26:48,800 --> 45:26:53,440
ult*mintit cu 10.000 care va fi egal

60724
45:26:51,520 --> 45:26:55,920
la 28.000

60725
45:26:53,440 --> 45:26:59,320
da, și cum vei găsi asta

60726
45:26:55,920 --> 45:26:59,320
spune Print

60727
45:27:00,160 --> 45:27:06,360
aceasta înmulțită cu lungimea memoriei RAM,

60728
45:27:07,280 --> 45:27:13,360
nu? 28.000 de octeți. Clar? Acum, da.

60729
45:27:11,200 --> 45:27:15,280
Acum, asta este pentru gama. Acum, lasă-mă

60730
45:27:13,360 --> 45:27:18,080
foloseste altceva. Deci, cum vei face

60731
45:27:15,280 --> 45:27:21,104
calcula lungimea acestui tablou? Ce

60732
45:27:18,080 --> 45:27:22,880
ce proprietate și atribut vei folosi

60733
45:27:21,104 --> 45:27:26,000
oameni?

60734
45:27:22,880 --> 45:27:27,744
N octeți, nu? N octeți vă vor oferi

60735
45:27:26,000 --> 45:27:29,920
total de octeți ocupați de elementele de

60736
45:27:27,744 --> 45:27:33,840
matricea. Corect? Vom folosi n octeți

60737
45:27:29,920 --> 45:27:38,960
aici. Așa că mă întorc jos și spun

60738
45:27:33,840 --> 45:27:43,520
folosind n octeți pentru matrice. Corect? Iar tu

60739
45:27:38,960 --> 45:27:50,240
o sa vedem care va fi rezultatul. Imprimați

60740
45:27:43,520 --> 45:27:52,640
uh matrice dot n octeți. Corect? Si spun eu

60741
45:27:50,240 --> 45:27:55,024
octeți. Ești gata să vezi rezultatul?

60742
45:27:52,640 --> 45:27:57,024
Vezi ce s-a întâmplat?

60743
45:27:55,024 --> 45:28:00,464
Câți octeți a luat asta? A fost

60744
45:27:57,024 --> 45:28:05,360
luând 28.000 de octeți. Câți octeți asta

60745
45:28:00,464 --> 45:28:07,280
ia? Acest lucru durează 80.000 de octeți.

60746
45:28:05,360 --> 45:28:10,720
Asta a fost nevoie de 2 lakh 80.000. Aceasta este

60747
45:28:07,280 --> 45:28:15,080
luând 80.000. Două lakh octeți în plus de

60748
45:28:10,720 --> 45:28:15,080
memoria este luată după interval.

60749
45:28:15,600 --> 45:28:19,080
Ran este interval.

60750
45:28:24,320 --> 45:28:29,744
Da. Și dacă mă duc doar la milion

60751
45:28:28,240 --> 45:28:34,360
numere,

60752
45:28:29,744 --> 45:28:34,360
nu? Milioane de numere în ambele.

60753
45:28:34,640 --> 45:28:42,800
Vezi diferența care devine,

60754
45:28:37,920 --> 45:28:46,464
nu? Acesta este acum 3 trei 28 de milioane

60755
45:28:42,800 --> 45:28:49,664
octeți pe care îi ia și durează 8

60756
45:28:46,464 --> 45:28:53,200
milioane de octeți. 20 de milioane de octeți suplimentari

60757
45:28:49,664 --> 45:28:56,640
sunt ocupate chiar acum oamenii nu tine

60758
45:28:53,200 --> 45:28:59,104
crede-ma? Da, ăia nenorocit sunt așa

60759
45:28:56,640 --> 45:29:00,720
mai eficient în managementul memoriei ca

60760
45:28:59,104 --> 45:29:03,920
comparativ cu tipurile de date tradiționale

60761
45:29:00,720 --> 45:29:07,520
de Python. Da. Bine, asta e primul

60762
45:29:03,920 --> 45:29:09,664
parte. Acum al doilea este performanța oamenilor,

60763
45:29:07,520 --> 45:29:12,000
corect? Performanţă. Deci la ce mă duc

60764
45:29:09,664 --> 45:29:14,000
face este ceea ce am de gând să fac este să merg

60765
45:29:12,000 --> 45:29:16,560
la

60766
45:29:14,000 --> 45:29:19,360
import

60767
45:29:16,560 --> 45:29:22,240
timp, nu? Este un modul în care

60768
45:29:19,360 --> 45:29:26,440
Python, nu? Să presupunem că x este egal

60769
45:29:22,240 --> 45:29:26,440
a gabari

60770
45:29:26,880 --> 45:29:37,104
atât de corect. Bine. Și apoi am și

60771
45:29:31,664 --> 45:29:38,960
este egal cu intervalul să zicem

60772
45:29:37,104 --> 45:29:40,560
aceasta

60773
45:29:38,960 --> 45:29:43,664
la

60774
45:29:40,560 --> 45:29:45,360
aceasta. Corect? Ambii vor avea

60775
45:29:43,664 --> 45:29:47,744
cantitate egală de numere. Aceleași numere

60776
45:29:45,360 --> 45:29:50,240
amandoi vor avea. Corect?

60777
45:29:47,744 --> 45:29:56,560
Acesta va spune

60778
45:29:50,240 --> 45:29:59,840
uh 1 2 3 1 2 3 10 milioane de valori. 10

60779
45:29:56,560 --> 45:30:03,024
milioane de valori. Acesta va avea și 10

60780
45:29:59,840 --> 45:30:04,560
milioane de valori,

60781
45:30:03,024 --> 45:30:06,960
corect? Ambii vor avea 10 milioane

60782
45:30:04,560 --> 45:30:09,440
valorile. Acum ceea ce încerc să fac este eu

60783
45:30:06,960 --> 45:30:11,664
vreau să le adunăm câte puțin.

60784
45:30:09,440 --> 45:30:13,520
Vreau să le adun corect. vreau

60785
45:30:11,664 --> 45:30:15,360
adăugați primul element din acesta la primul

60786
45:30:13,520 --> 45:30:16,880
element al acesteia. al doilea din aceasta la

60787
45:30:15,360 --> 45:30:18,800
a doua din aceasta, a treia din aceasta la a treia

60788
45:30:16,880 --> 45:30:21,744
de asta asa. Bine, vreau să fac

60789
45:30:18,800 --> 45:30:24,240
aceasta. Acum ceea ce voi face este că voi rula a

60790
45:30:21,744 --> 45:30:28,464
contor, nu? Voi rula un contor

60791
45:30:24,240 --> 45:30:31,200
care este ora de începere,

60792
45:30:28,464 --> 45:30:35,920
nu? Și aceasta este dată de punctul de timp

60793
45:30:31,200 --> 45:30:40,384
timp, nu? Care vă va oferi

60794
45:30:35,920 --> 45:30:43,280
aceasta vă va oferi

60795
45:30:40,384 --> 45:30:45,520
ora curentă, nu? După asta voi

60796
45:30:43,280 --> 45:30:49,104
rulați operația. Voi spune C este egal

60797
45:30:45,520 --> 45:30:51,920
la X Y

60798
45:30:49,104 --> 45:30:54,560
pentru X Y

60799
45:30:51,920 --> 45:31:02,240
în zip

60800
45:30:54,560 --> 45:31:05,104
X Y dreapta în zip X Y dreapta adăugați X Y bit

60801
45:31:02,240 --> 45:31:07,600
de bit element cu element pentru X și Y în

60802
45:31:05,104 --> 45:31:10,464
zip zip este o funcție drept care permite

60803
45:31:07,600 --> 45:31:15,280
tu să faci această operație secvenţial

60804
45:31:10,464 --> 45:31:20,240
dreapta secvenţial dreapta adăugaţi

60805
45:31:15,280 --> 45:31:24,464
elementele lui X și Y

60806
45:31:20,240 --> 45:31:27,464
element cu element dreapta element prin

60807
45:31:24,464 --> 45:31:27,464
element

60808
45:31:28,384 --> 45:31:34,320
dreapta element cu element dreapta si apoi

60809
45:31:31,664 --> 45:31:37,104
Voi imprima corect, așa că ora începe

60810
45:31:34,320 --> 45:31:40,880
va incepe si acum voi spune ora dot

60811
45:31:37,104 --> 45:31:43,440
timpul care este acum timpul de încheiere minus

60812
45:31:40,880 --> 45:31:47,200
ora de începere, așa că asta îmi va da timpul

60813
45:31:43,440 --> 45:31:49,360
luat pentru execuție, băieți

60814
45:31:47,200 --> 45:31:53,920
îmi va da

60815
45:31:49,360 --> 45:31:56,464
delta de timp care este egală cu timpul

60816
45:31:53,920 --> 45:31:58,320
luate pentru operare

60817
45:31:56,464 --> 45:32:01,600
secunde

60818
45:31:58,320 --> 45:32:04,880
corect vor fi luate aceste multe secunde

60819
45:32:01,600 --> 45:32:07,600
corect, așa că lasă-mă să rulez asta și este nevoie

60820
45:32:04,880 --> 45:32:11,024
în jur să zicem

60821
45:32:07,600 --> 45:32:14,384
4,3 secunde drept pentru a face acest lucru corect 4.3

60822
45:32:11,024 --> 45:32:18,000
secunde acum, băieți, vedeți ce se întâmplă. tu

60823
45:32:14,384 --> 45:32:20,160
trebuia să scrie această sintaxă complexă în

60824
45:32:18,000 --> 45:32:23,024
Python tradițional. Acum hai să arăt asta

60825
45:32:20,160 --> 45:32:27,024
pe matrice. Corect? Ce se va întâmpla pe

60826
45:32:23,024 --> 45:32:30,240
matrice? Voi spune a este egal cu np dot

60827
45:32:27,024 --> 45:32:33,104
un interval.

60828
45:32:30,240 --> 45:32:36,320
Corect? Și într-un interval voi trece

60829
45:32:33,104 --> 45:32:39,440
aceleasi valori pe care le-am luat mai sus.

60830
45:32:36,320 --> 45:32:42,440
Corect? Și voi spune b este egal cu np

60831
45:32:39,440 --> 45:32:42,440
punct

60832
45:32:43,520 --> 45:32:48,320
un interval și voi trece aceleași valori

60833
45:32:46,464 --> 45:32:51,280
înăuntru

60834
45:32:48,320 --> 45:32:56,360
exact la fel acum ce voi face

60835
45:32:51,280 --> 45:32:56,360
este și eu să spun același lucru

60836
45:32:58,080 --> 45:33:06,240
corect doar voi schimba execuția

60837
45:33:01,744 --> 45:33:09,600
din C vor deveni acum pur și simplu oameni A B

60838
45:33:06,240 --> 45:33:13,200
ce este simplu asta sau asta

60839
45:33:09,600 --> 45:33:15,920
asta sau asta

60840
45:33:13,200 --> 45:33:17,920
doi corect vezi puterea dacă nu eu

60841
45:33:15,920 --> 45:33:21,024
îți va arăta asta din nou chiar mai târziu

60842
45:33:17,920 --> 45:33:23,280
pe și lasă-mă să rulez asta și vei vedea

60843
45:33:21,024 --> 45:33:28,240
diferența acum permiteți-mi doar să măresc a

60844
45:33:23,280 --> 45:33:31,664
două zerouri la dreapta câteva zerouri

60845
45:33:28,240 --> 45:33:34,664
Două zerouri cresc în ambele utilizare

60846
45:33:31,664 --> 45:33:34,664
cazuri

60847
45:33:36,720 --> 45:33:42,640
se întâmplă și în dreapta să vedem

60848
45:33:39,664 --> 45:33:48,080
Vezi cât timp va dura

60849
45:33:42,640 --> 45:33:50,960
pentru a adăuga 2 milioane 1 miliard de numere.

60850
45:33:48,080 --> 45:33:53,440
1 miliard de numere mi-am cerut sistemului

60851
45:33:50,960 --> 45:33:55,440
sa adaug si vreau sa vad cat timp

60852
45:33:53,440 --> 45:33:59,000
este nevoie.

60853
45:33:55,440 --> 45:33:59,000
Alergare alergare alergare.

60854
45:34:00,384 --> 45:34:06,664
Da. Colonelul a murit. Kernel a murit.

60855
45:34:03,664 --> 45:34:06,664
oameni,

60856
45:34:06,800 --> 45:34:12,880
Va trebui să repornesc.

60857
45:34:09,840 --> 45:34:14,960
Corect. va trebui să import

60858
45:34:12,880 --> 45:34:19,920
numpy

60859
45:34:14,960 --> 45:34:23,240
ca np. Așa că lasă-mă să elimin un zero

60860
45:34:19,920 --> 45:34:23,240
din ambele.

60861
45:34:26,880 --> 45:34:33,360
Durează 4 secunde. Eliminarea unuia

60862
45:34:29,520 --> 45:34:37,744
zero si de aici. Corect?

60863
45:34:33,360 --> 45:34:40,880
Și când fac asta durează 1 secundă. Fă

60864
45:34:37,744 --> 45:34:44,000
vedeți băieți care este diferența

60865
45:34:40,880 --> 45:34:46,640
performanță, de asemenea, potrivită pentru amândoi

60866
45:34:44,000 --> 45:34:49,024
astea? Da.

60867
45:34:46,640 --> 45:34:52,080
Și dacă nu ai înțeles asta, hai

60868
45:34:49,024 --> 45:34:59,720
iti dau un exemplu.

60869
45:34:52,080 --> 45:34:59,720
Gama cinci. Acesta este de la 5 la 10, nu?

60870
45:35:00,160 --> 45:35:06,080
Și asta este în principiu

60871
45:35:02,800 --> 45:35:13,280
adăugarea de elemente,

60872
45:35:06,080 --> 45:35:15,280
nu? 5 7 9 11 13 Corect. Deci asta va

60873
45:35:13,280 --> 45:35:19,520
care va fi rezultatul asta? Acest

60874
45:35:15,280 --> 45:35:22,800
va fi 0 1 2 3 4 și acesta va fi

60875
45:35:19,520 --> 45:35:31,024
ieșire ce 5

60876
45:35:22,800 --> 45:35:35,104
6 7 8 9 corect deci 0 5 5 6 1 7 7 2 9

60877
45:35:31,024 --> 45:35:37,440
8 3 11 9 4 13 și același lucru dacă

60878
45:35:35,104 --> 45:35:42,000
Eu fac aici

60879
45:35:37,440 --> 45:35:46,464
atunci ce se va întâmpla spun 5 spun 5

60880
45:35:42,000 --> 45:35:50,720
și 10 corect și spun că C este egal cu a  

60881
45:35:46,464 --> 45:35:53,520
b și spun c. Același lucru pe care îl primești aici.

60882
45:35:50,720 --> 45:35:56,240
Corect? Putem merge mai departe. Corect? Următorul

60883
45:35:53,520 --> 45:35:58,560
băieți pe care trebuie să le înțelegem

60884
45:35:56,240 --> 45:36:02,320
următorul fragment pe care trebuie să-l înțelegem este

60885
45:35:58,560 --> 45:36:05,744
numit ca indexare în matrice numpy.

60886
45:36:02,320 --> 45:36:08,160
Corect? Indexarea în matrice numpy. Corect?

60887
45:36:05,744 --> 45:36:11,360
Cum indexăm elementele? Corect? Cum

60888
45:36:08,160 --> 45:36:13,744
indexăm elementele?

60889
45:36:11,360 --> 45:36:15,840
indexarea în

60890
45:36:13,744 --> 45:36:20,960
nump py

60891
45:36:15,840 --> 45:36:23,600
indexarea corectă a tablourilor în tablouri numpy

60892
45:36:20,960 --> 45:36:28,640
așa că din nou știți indexarea de la bază

60893
45:36:23,600 --> 45:36:33,800
python, deci să începem cu 1d pentru 1

60894
45:36:28,640 --> 45:36:33,800
matrice corect voi folosi ar r r1

60895
45:36:35,840 --> 45:36:42,720
da, acesta este un ar r1 acum, acesta este un

60896
45:36:38,560 --> 45:36:45,024
ar r1 Bine.

60897
45:36:42,720 --> 45:36:50,240
Acum oamenii ceea ce vreau să fac este ceea ce eu

60898
45:36:45,024 --> 45:36:53,104
vreau să fac este că vreau să aduc eu corect

60899
45:36:50,240 --> 45:36:55,664
vrei să aduci corect poți tăia și

60900
45:36:53,104 --> 45:36:58,464
zar să spunem zaruri

60901
45:36:55,664 --> 45:37:03,080
33 corect, așa că din nou, în mod normal

60902
45:36:58,464 --> 45:37:03,080
indexarea listei ce este 33

60903
45:37:03,360 --> 45:37:07,640
care este indicele de 33 de persoane

60904
45:37:08,960 --> 45:37:15,840
doi deci vei spune același lucru print

60905
45:37:11,920 --> 45:37:18,800
dreapta A R R1 paranteză pătrată 2 și tu

60906
45:37:15,840 --> 45:37:23,664
vei primi 33 pentru tine. Corect? Dacă tu

60907
45:37:18,800 --> 45:37:29,104
vreau să feliem aceleași lucruri, nu? 33 la

60908
45:37:23,664 --> 45:37:35,600
spune 66. Care este indicele?

60909
45:37:29,104 --> 45:37:37,664
33 este 2. 2. Care? 3 4 5 și 6.

60910
45:37:35,600 --> 45:37:41,360
nu? Vom scrie de la 3 la șase. Nu cinci.

60911
45:37:37,664 --> 45:37:43,664
Grabă. Cinci nu sunt incluse. Îți amintești?

60912
45:37:41,360 --> 45:37:45,520
Imprimăm

60913
45:37:43,664 --> 45:37:52,080
a ar r r1

60914
45:37:45,520 --> 45:37:55,280
2 este la 6 și veți obține 33 44 55 66.

60915
45:37:52,080 --> 45:37:58,160
nu? Indexare simplă. Vă rugăm să încercați

60916
45:37:55,280 --> 45:38:00,800
afară. Vă rugăm să încercați. Și dacă vrei

60917
45:37:58,160 --> 45:38:02,800
poti avea si acest cod. Poți

60918
45:38:00,800 --> 45:38:06,384
scrie acest cod. Întotdeauna vei avea

60919
45:38:02,800 --> 45:38:09,600
claritate de ce îl folosim.

60920
45:38:06,384 --> 45:38:11,104
Treci pe oameni. Merg mai departe. Să vedem

60921
45:38:09,600 --> 45:38:14,320
indexarea.

60922
45:38:11,104 --> 45:38:16,240
într-o matrice 2D. Corect? Și înaintea mea

60923
45:38:14,320 --> 45:38:21,640
să-ți explic asta, lasă-mă să te iau

60924
45:38:16,240 --> 45:38:21,640
aici. Corect? Deci, ce va fi o matrice 2D?

60925
45:38:22,240 --> 45:38:28,720
Corect? Aceasta este o matrice 2D. Are trei

60926
45:38:25,104 --> 45:38:32,880
rânduri și trei coloane. Corect? Rânduri

60927
45:38:28,720 --> 45:38:36,960
coloane. Deci, acum, pentru indexarea rândurilor va

60928
45:38:32,880 --> 45:38:40,080
începe de la zero. Deci, dacă trebuie să lansați

60929
45:38:36,960 --> 45:38:43,024
acest rând anume, nu? Deci ce va face

60930
45:38:40,080 --> 45:38:46,000
fi indexul? Va fi rândul 0. Dacă tu

60931
45:38:43,024 --> 45:38:48,160
trebuie să aducă acest rând anume, the

60932
45:38:46,000 --> 45:38:50,464
indicele va fi unul. Și dacă trebuie

60933
45:38:48,160 --> 45:38:53,520
adu acest rând anume, acesta

60934
45:38:50,464 --> 45:38:55,840
indicele va fi doi. În mod similar, pentru

60935
45:38:53,520 --> 45:38:58,464
coloană, dacă trebuie să preluați aceasta

60936
45:38:55,840 --> 45:39:01,024
o anumită coloană, dreapta, veți avea

60937
45:38:58,464 --> 45:39:04,000
coloana este egală cu zero. Acest anume

60938
45:39:01,024 --> 45:39:07,024
coloană, coloană egală cu 1. Aceasta

60939
45:39:04,000 --> 45:39:09,360
coloană specială, coloană egală cu două.

60940
45:39:07,024 --> 45:39:12,720
Corect? indexarea va începe de la minus

60941
45:39:09,360 --> 45:39:14,640
din nou unul corect 012

60942
45:39:12,720 --> 45:39:18,240
așa că lasă-mă să-ți arăt asta corect

60943
45:39:14,640 --> 45:39:20,320
să presupunem că sun ar r r2 acesta este a r2 al meu

60944
45:39:18,240 --> 45:39:23,320
acum

60945
45:39:20,320 --> 45:39:23,320
indexarea

60946
45:39:23,840 --> 45:39:28,640
mai întâi

60947
45:39:25,440 --> 45:39:33,520
row dreapta cum voi face asta voi spune

60948
45:39:28,640 --> 45:39:36,000
imprimați a ar r r2 și voi scrie cum cum

60949
45:39:33,520 --> 45:39:41,104
voi scrie asta

60950
45:39:36,000 --> 45:39:42,640
h Voi scrie rândul 0, nu? Rândul 0. Deci

60951
45:39:41,104 --> 45:39:47,240
ce imi va da asta? Aceasta va da

60952
45:39:42,640 --> 45:39:47,240
eu asta, nu? Sintaxa este

60953
45:39:49,840 --> 45:39:55,744
coloană cu spațiu rând. Corect? Deci acum dacă tu

60954
45:39:52,960 --> 45:39:59,240
trece doar unul, îți va oferi doar

60955
45:39:55,744 --> 45:39:59,240
rânduri, nu?

60956
45:40:11,600 --> 45:40:16,080
rândul unu, rândul doi, rândul trei. Corect?

60957
45:40:13,840 --> 45:40:19,024
În mod similar,

60958
45:40:16,080 --> 45:40:23,080
dacă doriți să-l creați pentru coloane,

60959
45:40:19,024 --> 45:40:23,080
nu? ce vei spune?

60960
45:40:24,560 --> 45:40:28,800
scuze,

60961
45:40:27,024 --> 45:40:30,464
uh

60962
45:40:28,800 --> 45:40:32,960
coloane.

60963
45:40:30,464 --> 45:40:37,320
Uh

60964
45:40:32,960 --> 45:40:37,320
aa a fost

60965
45:40:40,320 --> 45:40:43,320
zero

60966
45:40:45,440 --> 45:40:54,024
coloana 1 coloana 2

60967
45:40:49,840 --> 45:40:54,024
coloana 3. Nu?

60968
45:40:54,640 --> 45:40:57,640
Corect.

60969
45:40:58,560 --> 45:41:10,104
Deci care este coloana mea 1? 76 89 98 76 89

60970
45:41:03,920 --> 45:41:10,104
98 dreapta și dacă doriți coloana 2

60971
45:41:10,160 --> 45:41:15,600
uh scuze

60972
45:41:13,360 --> 45:41:18,720
dacă vrei coloana a doua, aceasta este

60973
45:41:15,600 --> 45:41:23,920
coloana a doua și aceasta este coloana 3 din dreapta

60974
45:41:18,720 --> 45:41:25,920
baieti 90 999 99 independent

60975
45:41:23,920 --> 45:41:29,320
acum dacă te rog să-mi aduci a

60976
45:41:25,920 --> 45:41:29,320
element anume

60977
45:41:29,840 --> 45:41:36,080
element, nu? Spune că vreau să aduci

60978
45:41:32,080 --> 45:41:39,664
eu am 78, nu? Cum vei primi 78? tu

60979
45:41:36,080 --> 45:41:42,560
va spune print a ar r2. Care este rândul

60980
45:41:39,664 --> 45:41:46,384
pentru 78? Cărui rând aparține?

60981
45:41:42,560 --> 45:41:50,880
012. Cărui rând 78 îi aparține? Un rând.

60982
45:41:46,384 --> 45:41:54,464
Cărei coloană aparține? 012.

60983
45:41:50,880 --> 45:41:56,384
1. Grăbește-te. Verificați din nou dacă aparține

60984
45:41:54,464 --> 45:41:59,200
la zero coloană, prima coloană sau a doua

60985
45:41:56,384 --> 45:41:59,200
coloana.

60986
45:42:00,240 --> 45:42:10,960
Corect? Și vei primi uh rău

60987
45:42:05,440 --> 45:42:13,664
01. Deci acestea sunt două. Corect? 78. Nu?

60988
45:42:10,960 --> 45:42:16,384
Al doilea rând prima coloană. Corect? În al doilea rând

60989
45:42:13,664 --> 45:42:20,440
rând prima coloană.

60990
45:42:16,384 --> 45:42:20,440
Cum să-l definești ca a

60991
45:42:27,024 --> 45:42:33,360
nu? Aceasta este matricea ta. Corect? Acum,

60992
45:42:30,880 --> 45:42:37,360
care sunt pozițiile de index pentru asta?

60993
45:42:33,360 --> 45:42:41,840
Acest rând este zero. Rând, primul rând, al doilea

60994
45:42:37,360 --> 45:42:47,104
rând. Aceasta este a ta coloană zero, mai întâi

60995
45:42:41,840 --> 45:42:49,024
coloană, a doua coloană. Da.

60996
45:42:47,104 --> 45:42:52,000
Da. Nu. Poate. Suntem înțelegători

60997
45:42:49,024 --> 45:42:55,840
acest? Acest lucru este clar. Indexarea

60998
45:42:52,000 --> 45:43:01,000
de rânduri și coloane. Acum, acum dacă tu

60999
45:42:55,840 --> 45:43:01,000
au două, deci sintaxa este

61000
45:43:01,024 --> 45:43:07,920
sintaxa este să spunem că aceasta este matricea A. Deci tu

61001
45:43:05,104 --> 45:43:10,720
va spune A în această matrice A pe care o veți

61002
45:43:07,920 --> 45:43:13,840
scrie rândul,

61003
45:43:10,720 --> 45:43:16,240
coloana. Corect? Să presupunem că vreau să accesez

61004
45:43:13,840 --> 45:43:18,960
numai rândul zero. Deci nu va exista

61005
45:43:16,240 --> 45:43:20,560
coloana. Deci ce vei primi? Numărul rândului

61006
45:43:18,960 --> 45:43:22,560
zero.

61007
45:43:20,560 --> 45:43:25,200
Corect? Numărul rândului zero. Și o vei face

61008
45:43:22,560 --> 45:43:28,384
doar pune-o asa. Sau poți pune un

61009
45:43:25,200 --> 45:43:30,464
virgulă și pune două puncte. Colon ce înseamnă?

61010
45:43:28,384 --> 45:43:32,384
Ia totul. Deci le vreau pe toate trei

61011
45:43:30,464 --> 45:43:35,520
coloane împreună. Rând zero și toate trei

61012
45:43:32,384 --> 45:43:39,640
coloane. Deci acesta va fi al tău

61013
45:43:35,520 --> 45:43:39,640
arată. Lasă-mă să îți arăt asta.

61014
45:43:41,600 --> 45:43:47,104
Corect? Vedeți acest rând zero și toate

61015
45:43:44,880 --> 45:43:51,744
coloane. Deci, care va fi răspunsul tău? 76

61016
45:43:47,104 --> 45:43:57,200
88 90. Nu? Apoi, dacă doriți să accesați

61017
45:43:51,744 --> 45:44:00,800
al doilea rând 89 90 99 89 90 99 unul și

61018
45:43:57,200 --> 45:44:02,720
ca asta. Clar? Acum la fel pentru

61019
45:44:00,800 --> 45:44:04,880
coloane ce se va întâmpla? vei lua

61020
45:44:02,720 --> 45:44:06,800
toate rândurile

61021
45:44:04,880 --> 45:44:08,960
virgulă ce coloană vrei? Dacă tu

61022
45:44:06,800 --> 45:44:11,200
spune doi pentru ce va fi rezultatul

61023
45:44:08,960 --> 45:44:20,000
asta? Pentru ce numere vei primi

61024
45:44:11,200 --> 45:44:22,720
acest? Colon, 2, veți primi 33 66 99.

61025
45:44:20,000 --> 45:44:26,880
Acum venim la element, nu?

61026
45:44:22,720 --> 45:44:29,360
Să presupunem că acum vrei să aduci 55 de secunde,

61027
45:44:26,880 --> 45:44:32,240
nu? Deci ce vei scrie? O vei face

61028
45:44:29,360 --> 45:44:34,800
scrie carui rand ii apartine? Urmăriți

61029
45:44:32,240 --> 45:44:37,520
sintaxa. Aparține primului rând.

61030
45:44:34,800 --> 45:44:40,880
Cărei coloană aparține?

61031
45:44:37,520 --> 45:44:42,960
Prima coloană. Deci ce vei primi? 55.

61032
45:44:40,880 --> 45:44:46,464
Vino să venim la acest exemplu. Acum

61033
45:44:42,960 --> 45:44:49,104
vrei 78 în această matrice specială sau

61034
45:44:46,464 --> 45:44:51,280
matricea. Corect? Unde este 78? Pe care rând

61035
45:44:49,104 --> 45:44:55,104
ii apartine?

61036
45:44:51,280 --> 45:45:00,240
Este primul rând? Verificați cu atenție.

61037
45:44:55,104 --> 45:45:03,360
Rând zero. Primul rând. Al doilea rând.

61038
45:45:00,240 --> 45:45:06,640
Da. Așa că am pus două aici. Acum care

61039
45:45:03,360 --> 45:45:08,880
coloana ii apartine? Prima coloană.

61040
45:45:06,640 --> 45:45:10,640
A doua coloană. Îmi pare rău. coloana zero, mai întâi

61041
45:45:08,880 --> 45:45:13,360
coloană, a doua coloană aparține

61042
45:45:10,640 --> 45:45:17,024
prima coloană. Așa că am pus unul aici. Deci când

61043
45:45:13,360 --> 45:45:22,384
dacă pui această sintaxă, vei obține 78.

61044
45:45:17,024 --> 45:45:26,960
clar? Acum al treilea lucru este tăierea

61045
45:45:22,384 --> 45:45:34,000
prin matrice. Corect? Acum pentru asta eu

61046
45:45:26,960 --> 45:45:38,160
vreau vreau 90 99 78 99. Asta înseamnă

61047
45:45:34,000 --> 45:45:40,080
ce? Vreau asta, asta, asta și asta.

61048
45:45:38,160 --> 45:45:41,840
Lasă-mă să te duc mai întâi la PPT. Acum,

61049
45:45:40,080 --> 45:45:43,664
ce-ți cer să mă aduci? Im

61050
45:45:41,840 --> 45:45:47,744
rugându-te să-mi aduci aceste patru

61051
45:45:43,664 --> 45:45:50,160
numere. Corect? Aceste patru numere. Deci,

61052
45:45:47,744 --> 45:45:52,080
aici ce vei scrie? Care sunt rândurile

61053
45:45:50,160 --> 45:45:54,960
inclus în acest popor? Care sunt rândurile

61054
45:45:52,080 --> 45:45:58,320
incluse în asta?

61055
45:45:54,960 --> 45:46:00,880
Rândul unu la toți.

61056
45:45:58,320 --> 45:46:04,320
Corect. Unu la toți.

61057
45:46:00,880 --> 45:46:06,160
Da. Nu doi. Unu la toți.

61058
45:46:04,320 --> 45:46:08,464
Corect? Și lași totul ca

61059
45:46:06,160 --> 45:46:12,080
aceasta. Dacă ai ultimul rând, tu

61060
45:46:08,464 --> 45:46:15,200
lăsați-l gol după două puncte, virgulă.

61061
45:46:12,080 --> 45:46:18,080
Ce coloane vrei pentru asta? Unul

61062
45:46:15,200 --> 45:46:20,560
si doi. Corect? Și când acestea vor

61063
45:46:18,080 --> 45:46:22,160
se intersectează, când acestea se vor intersecta,

61064
45:46:20,560 --> 45:46:24,640
veți obține această zonă. vei primi

61065
45:46:22,160 --> 45:46:29,520
această zonă umbrită, zonă umbrită verde. Deci

61066
45:46:24,640 --> 45:46:31,744
Voi spune că am nevoie de la coloana unu la toate

61067
45:46:29,520 --> 45:46:33,200
coloanele. Corect? Deci ce va fi asta

61068
45:46:31,744 --> 45:46:36,880
te aduc? Ce te va aduce asta?

61069
45:46:33,200 --> 45:46:40,080
Acest lucru vă va aduce 44

61070
45:46:36,880 --> 45:46:46,240
55 66

61071
45:46:40,080 --> 45:46:52,080
și 77 88 99. Nu? Ce va fi asta

61072
45:46:46,240 --> 45:46:56,240
te aduc? Acesta vă va aduce 22 55 88

61073
45:46:52,080 --> 45:46:58,720
33 66 99. Care sunt punctele comune

61074
45:46:56,240 --> 45:47:00,240
între ambele

61075
45:46:58,720 --> 45:47:01,664
accesul

61076
45:47:00,240 --> 45:47:05,600
ambele felii astea? Care sunt

61077
45:47:01,664 --> 45:47:08,600
puncte comune? Este doar atât

61078
45:47:05,600 --> 45:47:08,600
corect

61079
45:47:09,024 --> 45:47:14,880
55 66 88 99 corect, deci crezi că

61080
45:47:12,720 --> 45:47:20,000
va obține rezultatul dvs., da, să-l verificăm

61081
45:47:14,880 --> 45:47:22,960
aici dreapta zic print a ar r2 right si

61082
45:47:20,000 --> 45:47:28,320
asta spun

61083
45:47:22,960 --> 45:47:30,960
Am nevoie de rândul zero, îmi pare rău, rândul unu să îl golesc

61084
45:47:28,320 --> 45:47:35,920
și apoi coloana unu goală și vei face

61085
45:47:30,960 --> 45:47:37,520
obțineți 90 99 78 90 indexare.

61086
45:47:35,920 --> 45:47:42,080
Da.

61087
45:47:37,520 --> 45:47:45,104
Acum băieți, să verificăm

61088
45:47:42,080 --> 45:47:48,960
trei dimensiuni, nu? 3D.

61089
45:47:45,104 --> 45:47:52,080
Eu zic AR R3, nu? Acesta este AR r3 al meu,

61090
45:47:48,960 --> 45:47:59,520
nu? Deci, permiteți-mi să dau doar un exemplu

61091
45:47:52,080 --> 45:48:07,104
aici. Să presupunem că tablourile mele sunt 1 1 22 2 3 4

61092
45:47:59,520 --> 45:48:10,464
4 5 6 7 88 91. Nu? Acesta este primul meu.

61093
45:48:07,104 --> 45:48:13,840
Apoi, în spatele acesteia, am o altă matrice

61094
45:48:10,464 --> 45:48:17,360
care este uh

61095
45:48:13,840 --> 45:48:21,440
111 222 333

61096
45:48:17,360 --> 45:48:25,664
444 555 666

61097
45:48:21,440 --> 45:48:30,080
777 888 9999.

61098
45:48:25,664 --> 45:48:37,360
Corect. Și în mine

61099
45:48:30,080 --> 45:48:38,560
al treilea, am 11 1 1 222 33 33 3 4

61100
45:48:37,360 --> 45:48:45,360
44 44 44 44 44 44 44 44 44 44 44 44 44 4

61101
45:48:38,560 --> 45:48:46,960
55 555 66 66 66 66 66 6 7 8

61102
45:48:45,360 --> 45:48:50,000
9

61103
45:48:46,960 --> 45:48:52,720
se califică pentru o matrice 3D?

61104
45:48:50,000 --> 45:48:55,360
Puteți accesa ceva despre asta

61105
45:48:52,720 --> 45:48:56,640
o anumită matrice dacă i se oferă o șansă

61106
45:48:55,360 --> 45:48:59,520
separat?

61107
45:48:56,640 --> 45:49:02,720
ca acesta. Acum oameni, dacă vreți

61108
45:48:59,520 --> 45:49:04,800
să se deplaseze între straturi, nu? Dacă tu

61109
45:49:02,720 --> 45:49:07,104
vrei să te deplasezi între straturi, nu?

61110
45:49:04,800 --> 45:49:10,880
cred că ți-am spus una anume

61111
45:49:07,104 --> 45:49:12,720
acces care este ce? Care este

61112
45:49:10,880 --> 45:49:15,104
straturi.

61113
45:49:12,720 --> 45:49:18,560
Deci, ce număr va fi dat acestui lucru

61114
45:49:15,104 --> 45:49:21,104
strat? Stratul numărul zero,

61115
45:49:18,560 --> 45:49:24,880
stratul numărul unu

61116
45:49:21,104 --> 45:49:28,240
și stratul numărul doi. Deci acum dacă ai

61117
45:49:24,880 --> 45:49:31,024
pentru a accesa acest 555

61118
45:49:28,240 --> 45:49:33,840
la ce strat vei merge primul tu

61119
45:49:31,024 --> 45:49:38,720
va merge la primul strat. Apoi pe ce rând

61120
45:49:33,840 --> 45:49:42,160
vei merge la? Vei merge la primul rând

61121
45:49:38,720 --> 45:49:45,600
și prima coloană. Deci, dacă treci de asta

61122
45:49:42,160 --> 45:49:47,360
sintaxa ce vei primi? Vei primi 5

61123
45:49:45,600 --> 45:49:49,920
cinci5.

61124
45:49:47,360 --> 45:49:52,080
Corect? Problema rezolvata. Singura

61125
45:49:49,920 --> 45:49:54,800
gâtul de sticlă a fost partea straturilor și tu

61126
45:49:52,080 --> 45:49:57,600
au un parametru sau un argument suplimentar

61127
45:49:54,800 --> 45:50:00,000
pentru acest strat.

61128
45:49:57,600 --> 45:50:03,200
Deci dacă revin la exemplul meu și dacă

61129
45:50:00,000 --> 45:50:08,384
trebuie să accesați acest 555 chiar cum

61130
45:50:03,200 --> 45:50:11,840
vei face asta? Eu zic print a ar r2 a

61131
45:50:08,384 --> 45:50:14,880
r3 drept si asta zic si in aceasta eu

61132
45:50:11,840 --> 45:50:17,104
spune ce am pentru a accesa acest 555 care

61133
45:50:14,880 --> 45:50:20,000
ce număr de strat este acesta? Aceasta este

61134
45:50:17,104 --> 45:50:21,920
stratul numărul zero. Corect? Acesta este stratul

61135
45:50:20,000 --> 45:50:25,360
numărul zero. Și acesta este numărul stratului

61136
45:50:21,920 --> 45:50:27,200
unul. Așa că spun stratul numărul unu. care

61137
45:50:25,360 --> 45:50:29,360
rândul este acesta

61138
45:50:27,200 --> 45:50:32,640
în acest strat special? Este strat

61139
45:50:29,360 --> 45:50:34,464
număr. Ne pare rău, este rândul numărul unu și

61140
45:50:32,640 --> 45:50:36,800
coloana numărul unu. Și când faci asta,

61141
45:50:34,464 --> 45:50:39,520
veți obține 5x5.

61142
45:50:36,800 --> 45:50:46,104
Corect? Dacă vrei 999, ce vrei

61143
45:50:39,520 --> 45:50:46,104
face? Vei schimba asta cu 2, 2, nu?

61144
45:50:46,560 --> 45:50:53,600
Dacă vrei 777 sau să zicem dacă vrei

61145
45:50:49,104 --> 45:50:56,960
98 ce vei face pentru 98

61146
45:50:53,600 --> 45:51:02,800
stratul numărul zero rândul numărul doi coloană

61147
45:50:56,960 --> 45:51:06,720
numărul zero, atunci veți obține acest 98

61148
45:51:02,800 --> 45:51:10,080
clar baieti? Da. Strat, rând, coloană. În

61149
45:51:06,720 --> 45:51:12,800
în același mod, îl vei feli. Corect.

61150
45:51:10,080 --> 45:51:14,464
Il vei felia.

61151
45:51:12,800 --> 45:51:17,600
Da.

61152
45:51:14,464 --> 45:51:20,240
Corect. Voi scrie sintaxa

61153
45:51:17,600 --> 45:51:27,664
ca să nu te încurci. Este

61154
45:51:20,240 --> 45:51:30,160
matrice paranteză pătrată. Strat coloană rând.

61155
45:51:27,664 --> 45:51:32,464
Corect? Strat

61156
45:51:30,160 --> 45:51:34,320
rând

61157
45:51:32,464 --> 45:51:37,840
coloana.

61158
45:51:34,320 --> 45:51:39,360
Corect. Aceasta este sintaxa.

61159
45:51:37,840 --> 45:51:44,640
Perfect.

61160
45:51:39,360 --> 45:51:47,840
Corect. Mare. Putem executa și câteva

61161
45:51:44,640 --> 45:51:50,560
operațiuni, nu? Plus, minus,

61162
45:51:47,840 --> 45:51:53,664
înmulțire, împărțire între doi

61163
45:51:50,560 --> 45:51:55,664
matrice foarte foarte ușor, nu? Ea

61164
45:51:53,664 --> 45:51:57,360
nu ar trebui să ne pună nicio problemă,

61165
45:51:55,664 --> 45:51:59,920
corect? Putem face toate operațiunile

61166
45:51:57,360 --> 45:52:03,360
ceea ce vrem, nu? Între doi

61167
45:51:59,920 --> 45:52:07,464
matrice, nu? De exemplu, nu? tu

61168
45:52:03,360 --> 45:52:07,464
ai avea

61169
45:52:07,520 --> 45:52:14,384
operațiuni corecte pe matrice.

61170
45:52:10,240 --> 45:52:18,880
Deci, să spunem uh

61171
45:52:14,384 --> 45:52:23,280
hai să vedem ca o listă lista corectă. Deci noi

61172
45:52:18,880 --> 45:52:27,200
have list este egal cu 1 2 3 4 5 dreapta

61173
45:52:23,280 --> 45:52:31,024
acum să presupunem că vrei să pătrați

61174
45:52:27,200 --> 45:52:36,384
fiecare element al listei. Corect? Ce

61175
45:52:31,024 --> 45:52:44,640
vei face? Veți spune că sq l este

61176
45:52:36,384 --> 45:52:50,000
egal cu x cu puterea lui 2 pentru x in

61177
45:52:44,640 --> 45:52:52,960
l corect și apoi vei spune print xq l

61178
45:52:50,000 --> 45:52:55,960
și veți obține pătratul listei

61179
45:52:52,960 --> 45:52:55,960
nu?

61180
45:53:01,840 --> 45:53:10,160
Lista originală listă pătrată. Acum

61181
45:53:05,104 --> 45:53:15,840
in array ce se va intampla? Să presupunem că spun

61182
45:53:10,160 --> 45:53:18,720
a 1 este egal cu np matrice de puncte și l I

61183
45:53:15,840 --> 45:53:21,600
creați aceeași matrice din această listă.

61184
45:53:18,720 --> 45:53:23,200
Eu zic print

61185
45:53:21,600 --> 45:53:24,960
original

61186
45:53:23,200 --> 45:53:27,520
matrice

61187
45:53:24,960 --> 45:53:30,880
corect spun A1 corect acesta este originalul meu

61188
45:53:27,520 --> 45:53:33,200
matrice la fel ca aceasta acum vreau să pătrat

61189
45:53:30,880 --> 45:53:36,800
ea

61190
45:53:33,200 --> 45:53:40,080
pătratează elementele tablourilor foarte foarte

61191
45:53:36,800 --> 45:53:43,200
simplu nimic din ce ai nevoie, doar spui

61192
45:53:40,080 --> 45:53:44,720
doar spui

61193
45:53:43,200 --> 45:53:51,440
mp

61194
45:53:44,720 --> 45:53:54,640
a1 este egal cu sq a1 1 este egal cu a1 to

61195
45:53:51,440 --> 45:53:59,104
puterea lui 2, nu? A1 la putere

61196
45:53:54,640 --> 45:54:02,104
din 2, nu? Și apoi imprimați

61197
45:53:59,104 --> 45:54:02,104
cel

61198
45:54:05,744 --> 45:54:17,640
corect obțineți r pătratul. Să presupunem

61199
45:54:10,880 --> 45:54:17,640
vrei să găsești media

61200
45:54:21,664 --> 45:54:28,384
media numerelor

61201
45:54:24,960 --> 45:54:31,664
folosind lista. Corect? Deci ce vei face?

61202
45:54:28,384 --> 45:54:36,320
vei spune

61203
45:54:31,664 --> 45:54:42,240
medie este egală cu suma de

61204
45:54:36,320 --> 45:54:45,280
l lista din dreapta împărțită la lungimea listei

61205
45:54:42,240 --> 45:54:48,384
corect și vei obține mijloacele

61206
45:54:45,280 --> 45:54:51,440
drept care este trei pentru acesta drept

61207
45:54:48,384 --> 45:54:54,664
această listă originală. Acum hai să-ți arăt

61208
45:54:51,440 --> 45:54:54,664
în matrice

61209
45:54:54,960 --> 45:55:01,840
corect. Cum vei face asta? O vei face

61210
45:54:56,960 --> 45:55:04,960
say mean este egal cu np dot mean și tu

61211
45:55:01,840 --> 45:55:08,384
va trece doar a1 dreapta si cand tu

61212
45:55:04,960 --> 45:55:11,104
va verifica înseamnă că veți obține 3.2

61213
45:55:08,384 --> 45:55:13,200
Corect? Nimic ca acest drept direct

61214
45:55:11,104 --> 45:55:15,520
direct astfel dreptul pe care il poti avea

61215
45:55:13,200 --> 45:55:19,024
Ți-am arătat deja adaugă că am deja

61216
45:55:15,520 --> 45:55:21,600
ți-am arătat pătrat și apoi cred

61217
45:55:19,024 --> 45:55:25,104
poți înțelege asta tot

61218
45:55:21,600 --> 45:55:28,000
operațiunile sunt posibile folosind matrice

61219
45:55:25,104 --> 45:55:32,000
corect valorificând puterea matricelor

61220
45:55:28,000 --> 45:55:34,640
corect și băieți din matrice chiar în

61221
45:55:32,000 --> 45:55:36,640
matricele ceea ce poți face este că poți

61222
45:55:34,640 --> 45:55:42,800
efectua

61223
45:55:36,640 --> 45:55:44,960
puteți efectua unele operații cu șir

61224
45:55:42,800 --> 45:55:49,920
operații corecte cu șiruri foarte puternice

61225
45:55:44,960 --> 45:55:55,024
corect, deci, de exemplu, să spunem că am o

61226
45:55:49,920 --> 45:56:01,280
Am o matrice drept Am o matrice

61227
45:55:55,024 --> 45:56:08,880
de nume de oameni corect așa că spun nume

61228
45:56:01,280 --> 45:56:11,880
este egal cu np dot array dreapta și spun

61229
45:56:08,880 --> 45:56:11,880
Radha

61230
45:56:12,160 --> 45:56:19,520
atunci spun D

61231
45:56:15,840 --> 45:56:22,464
corect si apoi spun

61232
45:56:19,520 --> 45:56:24,880
Maduk drept aceste trei nume pe care le am

61233
45:56:22,464 --> 45:56:26,800
drept pentru a putea verifica numele lor

61234
45:56:24,880 --> 45:56:28,880
va fi ca în matrice dreapta și

61235
45:56:26,800 --> 45:56:31,840
tipul de date va fi U6 care este a

61236
45:56:28,880 --> 45:56:35,280
reprezentarea șirurilor chiar acum băieți

61237
45:56:31,840 --> 45:56:40,240
să presupunem că doriți să capitalizați ceea ce doriți

61238
45:56:35,280 --> 45:56:44,560
pentru a valorifica numele dreptului oamenilor

61239
45:56:40,240 --> 45:56:50,880
ce vei face vei zice print-ma

61240
45:56:44,560 --> 45:56:53,440
np docare dreapta npcare dot capitalize

61241
45:56:50,880 --> 45:56:56,080
dreapta majuscule si in interiorul acesta tu

61242
45:56:53,440 --> 45:56:58,720
va trece nume

61243
45:56:56,080 --> 45:57:00,720
și vei vedea că toate numele au fost

61244
45:56:58,720 --> 45:57:03,520
cu majuscule

61245
45:57:00,720 --> 45:57:05,664
bine vezi că acest R a fost

61246
45:57:03,520 --> 45:57:09,560
cu majuscule D a fost scris cu majuscule. M

61247
45:57:05,664 --> 45:57:09,560
a fost valorificată.

61248
45:57:10,320 --> 45:57:15,280
Corect?

61249
45:57:13,024 --> 45:57:17,744
Le puteți converti în upper dacă aveți

61250
45:57:15,280 --> 45:57:21,744
vreau. Imprimați

61251
45:57:17,744 --> 45:57:23,840
np.care dot superior

61252
45:57:21,744 --> 45:57:28,240
nume și le vei avea pe toate

61253
45:57:23,840 --> 45:57:31,360
blocare majuscule. Puteți spune print np.care

61254
45:57:28,240 --> 45:57:34,320
punct mai jos.

61255
45:57:31,360 --> 45:57:36,880
Le vei avea mai jos.

61256
45:57:34,320 --> 45:57:41,664
Corect? Puteți pune titlul. Corect?

61257
45:57:36,880 --> 45:57:46,240
Să presupunem că spun uh

61258
45:57:41,664 --> 45:57:48,720
title e title este egal cu np dot array

61259
45:57:46,240 --> 45:57:51,720
si zic eu

61260
45:57:48,720 --> 45:57:51,720
rahov

61261
45:57:53,104 --> 45:57:59,664
du-te

61262
45:57:55,840 --> 45:58:02,664
chiar atunci spun eu

61263
45:57:59,664 --> 45:58:02,664
dhapati

61264
45:58:04,640 --> 45:58:12,160
corect și spun nebun

61265
45:58:10,000 --> 45:58:15,840
cald

61266
45:58:12,160 --> 45:58:18,320
corect spun aceste trei lucruri acum dacă eu

61267
45:58:15,840 --> 45:58:20,000
spune print

61268
45:58:18,320 --> 45:58:21,664
npcare

61269
45:58:20,000 --> 45:58:25,200
punct

61270
45:58:21,664 --> 45:58:29,440
titlul drept și spun eu

61271
45:58:25,200 --> 45:58:33,664
titluri vei vedea că toate cuvintele

61272
45:58:29,440 --> 45:58:37,360
va fi în mod cu majuscule rael d și s

61273
45:58:33,664 --> 45:58:41,360
de dh sinapati m si V de MaduMa sunt acum

61274
45:58:37,360 --> 45:58:45,520
cu majuscule. pot si eu

61275
45:58:41,360 --> 45:58:50,000
înlocuiți ceva dacă vreau să presupun că eu

61276
45:58:45,520 --> 45:58:53,664
vreau să-l înlocuiesc pe Madhu cu say suri

61277
45:58:50,000 --> 45:59:00,600
corect voi spune print

61278
45:58:53,664 --> 45:59:00,600
dreapta np do.care care dot înlocui

61279
45:59:02,640 --> 45:59:09,440
corect și vei spune unde vrei

61280
45:59:05,664 --> 45:59:12,464
înlocuiesc eu spun titlu

61281
45:59:09,440 --> 45:59:14,880
și în asta vreau să înlocuiesc

61282
45:59:12,464 --> 45:59:17,880
madu

61283
45:59:14,880 --> 45:59:17,880
cu

61284
45:59:19,360 --> 45:59:24,240
suri

61285
45:59:20,880 --> 45:59:26,320
corect si vei spune ca va fi suri_1

61286
45:59:24,240 --> 45:59:29,280
suri one Corect. Madu a fost înlocuit

61287
45:59:26,320 --> 45:59:32,280
cu

61288
45:59:29,280 --> 45:59:32,280
Corect.

61289
45:59:33,360 --> 45:59:40,464
Corect. Daca vrei sa calculezi

61290
45:59:36,960 --> 45:59:46,280
caracterele șirurilor de caractere,

61291
45:59:40,464 --> 45:59:46,280
corect, poți face asta. Tipăriți np.car

61292
45:59:46,464 --> 45:59:52,960
dot str lungime de

61293
45:59:50,720 --> 45:59:55,104
titluri și veți obține 11 caractere

61294
45:59:52,960 --> 45:59:59,200
sunt acolo aici.

61295
45:59:55,104 --> 46:00:01,664
15 sunt aici și 11 sunt aici în

61296
45:59:59,200 --> 46:00:04,240
acest lucru anume.

61297
46:00:01,664 --> 46:00:06,720
Corect? Puteți face mult mai puternic

61298
46:00:04,240 --> 46:00:12,320
lucruri de asemenea. Permiteți-mi să vă arăt un complex

61299
46:00:06,720 --> 46:00:16,880
funcția. Corect? Să presupunem că am f nume

61300
46:00:12,320 --> 46:00:22,360
este egal cu np matrice de puncte.

61301
46:00:16,880 --> 46:00:22,360
Corect? Și o avem pe Ra

61302
46:00:25,200 --> 46:00:32,840
Madu

61303
46:00:27,440 --> 46:00:32,840
corect și avem L nume

61304
46:00:33,920 --> 46:00:36,920
arapati

61305
46:00:42,384 --> 46:00:50,000
vierme. Corect, avem aceste două lucruri.

61306
46:00:45,440 --> 46:00:54,000
Acum pot crea un nou nume complet pentru matrice

61307
46:00:50,000 --> 46:01:02,720
pur și simplu drept spunând pur și simplu np.car

61308
46:00:54,000 --> 46:01:05,720
Punct masina adauga dreapta si spun uh f nume

61309
46:01:02,720 --> 46:01:05,720
corect

61310
46:01:06,384 --> 46:01:09,384
virgulă

61311
46:01:11,664 --> 46:01:16,160
l

61312
46:01:13,360 --> 46:01:19,160
numele corect

61313
46:01:16,160 --> 46:01:19,160
Da.

61314
46:01:26,080 --> 46:01:29,080
Da.

61315
46:01:32,800 --> 46:01:38,464
Numele complet.

61316
46:01:34,880 --> 46:01:40,160
Da. Ra. Am încercat doar să adaug o

61317
46:01:38,464 --> 46:01:43,280
spatiu

61318
46:01:40,160 --> 46:01:46,280
între ele.

61319
46:01:43,280 --> 46:01:46,280
oricum,

61320
46:01:54,464 --> 46:02:02,000
corect. Putem face asta,

61321
46:01:58,240 --> 46:02:04,800
nu? De asemenea, puteți căuta oameni în

61322
46:02:02,000 --> 46:02:08,720
matrice, nu? Foarte puternic. Din nou,

61323
46:02:04,800 --> 46:02:10,384
caută în matrice folosind unde,

61324
46:02:08,720 --> 46:02:14,640
nu?

61325
46:02:10,384 --> 46:02:16,240
Corect. Puteți spune că un 2 este egal

61326
46:02:14,640 --> 46:02:20,560
la

61327
46:02:16,240 --> 46:02:24,464
np matrice de puncte dreapta și voi spune 1 1 22

61328
46:02:20,560 --> 46:02:30,800
33 3 4 4 5 66 corect și acum trebuie să o faci

61329
46:02:24,464 --> 46:02:36,080
să spunem a este egal cu np punct unde este corect și

61330
46:02:30,800 --> 46:02:40,360
în asta spui a2 mai mare decât 20

61331
46:02:36,080 --> 46:02:40,360
corect și când vei verifica A

61332
46:02:43,744 --> 46:02:48,080
uh, îmi dă indexul. De ce este

61333
46:02:45,744 --> 46:02:52,640
dându-mi indicele

61334
46:02:48,080 --> 46:02:56,160
sau imi da indexul?

61335
46:02:52,640 --> 46:03:01,520
Returnează întotdeauna index?

61336
46:02:56,160 --> 46:03:03,840
Încă un lucru este că poți găsi un lucru pe care îl poți

61337
46:03:01,520 --> 46:03:06,720
găsi o

61338
46:03:03,840 --> 46:03:08,800
o scrisoare

61339
46:03:06,720 --> 46:03:10,800
direct printr-o scrisoare. Puteți găsi un

61340
46:03:08,800 --> 46:03:12,384
element

61341
46:03:10,800 --> 46:03:14,240
prin

61342
46:03:12,384 --> 46:03:16,560
o scrisoare. Băieți, acestea sunt toate

61343
46:03:14,240 --> 46:03:18,080
trucuri pe care ar trebui să le știi pentru că tu

61344
46:03:16,560 --> 46:03:19,744
se va ocupa de date și aveți nevoie

61345
46:03:18,080 --> 46:03:21,744
pentru a extrage date, nu? Trebuie să tragi

61346
46:03:19,744 --> 46:03:24,640
multe date, nu? Pe baza condițiilor

61347
46:03:21,744 --> 46:03:29,104
și bazat pe lucruri. Să presupunem că vrei

61348
46:03:24,640 --> 46:03:31,840
aflați numele care au G în ele

61349
46:03:29,104 --> 46:03:34,560
dreapta sau R A în ele. Deci cum o sa faci

61350
46:03:31,840 --> 46:03:41,024
asta? Voi spune tipăriți corect și voi face

61351
46:03:34,560 --> 46:03:46,000
spune uh np do.care care dot găsiți corect

61352
46:03:41,024 --> 46:03:53,880
și voi spune că găsesc acest interior plin

61353
46:03:46,000 --> 46:03:53,880
numeste corect si gaseste-ma ra a right ra a

61354
46:04:03,440 --> 46:04:06,664
doua p

61355
46:04:07,840 --> 46:04:14,160
este adevărat, se întoarce adevărat pentru că

61356
46:04:10,384 --> 46:04:16,000
a găsit-o chiar aici, așa că nu vreau

61357
46:04:14,160 --> 46:04:18,160
să vă spun indexarea prin asta dar

61358
46:04:16,000 --> 46:04:19,920
oricum ar trebui să știi doar asta

61359
46:04:18,160 --> 46:04:21,840
presupun asta pe care iti spun eu

61360
46:04:19,920 --> 46:04:26,000
scrie asta bine pentru că este mult

61361
46:04:21,840 --> 46:04:29,744
mai ușor când vom merge la panda drept

61362
46:04:26,000 --> 46:04:32,464
Doar scrie-l ca o sintaxă, bine

61363
46:04:29,744 --> 46:04:33,104
mai mare decât egal cu zero sper asta

61364
46:04:32,464 --> 46:04:34,464
este clar

61365
46:04:33,104 --> 46:04:36,880
>> deci să începem cu știința datelor

61366
46:04:34,464 --> 46:04:38,720
întrebări și răspunsuri la interviu și The

61367
46:04:36,880 --> 46:04:40,720
problema numărul unu cu care ne-am confrunta este

61368
46:04:38,720 --> 46:04:43,360
rezolvarea problemelor din lumea reală. Iar cel

61369
46:04:40,720 --> 46:04:45,840
Întrebarea unu se ocupă de datele lipsă

61370
46:04:43,360 --> 46:04:48,240
modelare predictivă. Deci imaginează-ți că ai

61371
46:04:45,840 --> 46:04:50,800
dat un set de date unde 30% din date

61372
46:04:48,240 --> 46:04:52,464
pentru variabila predictivă cheie lipsește.

61373
46:04:50,800 --> 46:04:54,464
Această variabilă este crucială pentru a

61374
46:04:52,464 --> 46:04:56,464
model predictiv. Cum te-ai descurca

61375
46:04:54,464 --> 46:04:58,464
această situație pentru a asigura integritatea

61376
46:04:56,464 --> 46:05:00,240
și performanța modelului dvs.? Şi

61377
46:04:58,464 --> 46:05:02,560
Vă rugăm să descrieți pas cu pas abordarea dvs

61378
46:05:00,240 --> 46:05:04,640
pas. Deci, începând cu răspunsul dvs

61379
46:05:02,560 --> 46:05:06,800
poate începe cu gestionarea setului de date lipsă

61380
46:05:04,640 --> 46:05:08,640
este o provocare comună în știința datelor

61381
46:05:06,800 --> 46:05:10,640
și este important să o abordăm

61382
46:05:08,640 --> 46:05:13,024
cu grijă pentru a menține acuratețea

61383
46:05:10,640 --> 46:05:14,880
modelul tău și iată cum ai putea

61384
46:05:13,024 --> 46:05:16,800
aborda aceasta situatie. Numărul unu

61385
46:05:14,880 --> 46:05:18,960
punctul ar putea fi identificarea celor dispăruți

61386
46:05:16,800 --> 46:05:20,960
date. Deci mai întâi trebuie să înțelegi

61387
46:05:18,960 --> 46:05:23,024
unde sunt valorile lipsă în dvs

61388
46:05:20,960 --> 46:05:24,960
set de date. Puteți face acest lucru folosind a

61389
46:05:23,024 --> 46:05:27,440
cod simplu în Python cu biblioteci

61390
46:05:24,960 --> 46:05:31,600
ca mandale. De exemplu, puteți utiliza

61391
46:05:27,440 --> 46:05:33,360
punctul de date este funcția de sumă nulă de puncte

61392
46:05:31,600 --> 46:05:35,440
care vă va arăta numărul de dispăruți

61393
46:05:33,360 --> 46:05:37,360
valorile din fiecare coloană. Atunci poți

61394
46:05:35,440 --> 46:05:39,200
analiza modelul. Stabiliți dacă

61395
46:05:37,360 --> 46:05:41,360
există un model pentru datele lipsă.

61396
46:05:39,200 --> 46:05:43,360
Este aleatoriu sau lipsește pentru a

61397
46:05:41,360 --> 46:05:45,360
motiv? Acest lucru vă poate afecta abordarea.

61398
46:05:43,360 --> 46:05:47,360
Dacă datele lipsesc la întâmplare,

61399
46:05:45,360 --> 46:05:49,664
metodele pe care le utilizați pot fi diferite de

61400
46:05:47,360 --> 46:05:51,920
dacă datele lipsesc sistematic.

61401
46:05:49,664 --> 46:05:54,160
Deci alegerea unei metode de imputare.

61402
46:05:51,920 --> 46:05:56,464
Să vedem următoarea metodă care este

61403
46:05:54,160 --> 46:05:58,640
alegerea unei metode de imputare. Deci dacă

61404
46:05:56,464 --> 46:06:00,560
datele lipsă sunt numerice, ați putea

61405
46:05:58,640 --> 46:06:02,560
înlocuiți valorile lipsă cu media sau

61406
46:06:00,560 --> 46:06:05,104
mediana acelei coloane. Acest lucru este simplu

61407
46:06:02,560 --> 46:06:06,960
și eficient, dar poate fi folosit în primul rând

61408
46:06:05,104 --> 46:06:09,024
când datele lipsesc complet la

61409
46:06:06,960 --> 46:06:11,280
aleatoriu. Apoi vine bazat pe model

61410
46:06:09,024 --> 46:06:13,280
imputarea. Uneori poți folosi altele

61411
46:06:11,280 --> 46:06:15,600
variabilele din date pentru a prezice lipsa

61412
46:06:13,280 --> 46:06:17,840
valori folosind un model de regresie. Aceasta

61413
46:06:15,600 --> 46:06:20,384
poate fi mai precis, dar este și mai mult

61414
46:06:17,840 --> 46:06:23,280
complex. Apoi vom folosi k cel mai apropiat

61415
46:06:20,384 --> 46:06:26,080
vecinii pot algoritm. Dar înainte de asta

61416
46:06:23,280 --> 46:06:27,840
avem aici un fragment de cod care ar putea

61417
46:06:26,080 --> 46:06:30,560
fi folosit pentru implementarea

61418
46:06:27,840 --> 46:06:32,384
imputarea. Puteți folosi Python sau R.

61419
46:06:30,560 --> 46:06:34,464
Și acum, mergând mai departe, vom vedea K

61420
46:06:32,384 --> 46:06:36,560
algoritmul vecinilor cei mai apropiati. Deci asta

61421
46:06:34,464 --> 46:06:38,880
metoda prezice valorile lipsă pe baza

61422
46:06:36,560 --> 46:06:41,200
asupra cât de strâns sunt legate punctele de date

61423
46:06:38,880 --> 46:06:43,104
sunt unul pentru celălalt. Deci după imputare

61424
46:06:41,200 --> 46:06:44,960
este esențial să verifici cum se modifică

61425
46:06:43,104 --> 46:06:47,200
au afectat setul general de date și

61426
46:06:44,960 --> 46:06:49,200
performanța modelului. Uneori completând

61427
46:06:47,200 --> 46:06:52,160
prea multe valori lipsă pot introduce

61428
46:06:49,200 --> 46:06:53,664
părtinire. Și apoi avem vizualizare. Pentru a

61429
46:06:52,160 --> 46:06:55,744
ajuta la intelegerea inainte si dupa

61430
46:06:53,664 --> 46:06:57,520
imputarea, ai putea vizualiza

61431
46:06:55,744 --> 46:07:00,320
distribuţia variabilei folosind

61432
46:06:57,520 --> 46:07:02,000
histograme sau diagrame cu casete. Acest lucru ajută în

61433
46:07:00,320 --> 46:07:04,320
văzând cum s-a schimbat imputarea

61434
46:07:02,000 --> 46:07:05,840
proprietățile statistice ale datelor.

61435
46:07:04,320 --> 46:07:07,920
Și urmând acești pași, poți

61436
46:07:05,840 --> 46:07:09,440
gestionează cu grijă datele lipsă și

61437
46:07:07,920 --> 46:07:11,440
menține integritatea dvs

61438
46:07:09,440 --> 46:07:13,744
model predictiv. Acum trecerea la

61439
46:07:11,440 --> 46:07:16,640
întrebarea numărul doi care se bazează pe

61440
46:07:13,744 --> 46:07:18,384
evaluarea supraadaptarii modelului. Deci

61441
46:07:16,640 --> 46:07:20,640
întrebarea este că ai dezvoltat un

61442
46:07:18,384 --> 46:07:22,800
model predictiv, dar îl bănuiești

61443
46:07:20,640 --> 46:07:24,320
s-ar putea să depășească datele de antrenament.

61444
46:07:22,800 --> 46:07:26,560
Cum ați testa și aborda

61445
46:07:24,320 --> 46:07:28,800
emisiune? Vă rugăm să explicați pașii dvs. și

61446
46:07:26,560 --> 46:07:31,024
tehnici pe care le-ai folosi. Deci ai putea

61447
46:07:28,800 --> 46:07:33,104
începeți răspunsul explicând ce este

61448
46:07:31,024 --> 46:07:35,024
supraadaptare. Deci supraadaptarea este obișnuită

61449
46:07:33,104 --> 46:07:37,744
problemă în care modelul funcționează bine

61450
46:07:35,024 --> 46:07:39,744
date de antrenament, dar slab pe date nevăzute

61451
46:07:37,744 --> 46:07:41,744
indicând că este prea potrivit

61452
46:07:39,744 --> 46:07:44,240
datele de formare detalii specifice și

61453
46:07:41,744 --> 46:07:46,384
zgomot. Deci acum vom vedea un pas cu pas

61454
46:07:44,240 --> 46:07:48,640
ghid despre cum să remediați acest lucru. Numărul

61455
46:07:46,384 --> 46:07:51,104
un pas este validarea încrucișată. Deci unul

61456
46:07:48,640 --> 46:07:53,200
modalitate eficientă de a testa supraadaptarea este

61457
46:07:51,104 --> 46:07:55,200
prin utilizarea tehnicii de validare încrucișată.

61458
46:07:53,200 --> 46:07:57,600
Validarea încrucișată implică împărțirea dvs

61459
46:07:55,200 --> 46:07:59,840
datele de antrenament în mai multe seturi mai mici

61460
46:07:57,600 --> 46:08:02,384
asta este fals și apoi antrenează un model

61461
46:07:59,840 --> 46:08:04,320
pe unele dintre aceste setări și validând-o

61462
46:08:02,384 --> 46:08:05,664
pe celelalte. Deci asta te ajută

61463
46:08:04,320 --> 46:08:07,280
intelegi daca modelul este bun

61464
46:08:05,664 --> 46:08:09,200
performanța este consecventă peste tot

61465
46:08:07,280 --> 46:08:12,560
diferite subseturi de date. De exemplu,

61466
46:08:09,200 --> 46:08:15,920
în Python puteți folosi valoarea încrucișată

61467
46:08:12,560 --> 46:08:19,104
funcția de scor din skarn.mmodel

61468
46:08:15,920 --> 46:08:21,360
selecție. Deci acesta este codul și acesta

61469
46:08:19,104 --> 46:08:23,360
este fragmentul de cod din Python pe care îl aveți

61470
46:08:21,360 --> 46:08:26,960
poate folosi pentru validarea încrucișată și

61471
46:08:23,360 --> 46:08:29,024
aici importăm de la skarn adică

61472
46:08:26,960 --> 46:08:30,720
modulul și importăm

61473
46:08:29,024 --> 46:08:33,744
cruce_bine

61474
46:08:30,720 --> 46:08:36,464
scor și aici am folosit crucea

61475
46:08:33,744 --> 46:08:38,320
val scor funcția și apoi avem

61476
46:08:36,464 --> 46:08:40,320
a tipărit validarea încrucișată medie

61477
46:08:38,320 --> 46:08:42,720
scor și următorul pas pe care îl vom face este

61478
46:08:40,320 --> 46:08:44,464
rularea modelului de validare încrucișată. Deci asta

61479
46:08:42,720 --> 46:08:46,800
este modelul dumneavoastră predictiv pe care îl aveți

61480
46:08:44,464 --> 46:08:49,600
deja construit folosind scikit learn și

61481
46:08:46,800 --> 46:08:51,744
iată trenul x, acestea sunt intrarea x

61482
46:08:49,600 --> 46:08:53,920
caracteristicile datelor dvs. de antrenament și y

61483
46:08:51,744 --> 46:08:55,920
tren acestea sunt etichetele de ieșire ale

61484
46:08:53,920 --> 46:08:57,840
date de antrenament. Deci mergem groaznic

61485
46:08:55,920 --> 46:08:59,520
modelul de validare aici acesta este al tău

61486
46:08:57,840 --> 46:09:02,160
model predictiv pe care îl aveți deja

61487
46:08:59,520 --> 46:09:03,920
construit folosind scikitlearn. Deci x antrenează-te aici

61488
46:09:02,160 --> 46:09:06,320
asta înseamnă că acestea sunt caracteristicile de intrare

61489
46:09:03,920 --> 46:09:07,920
a datelor tale de antrenament și antrenează-te aici

61490
46:09:06,320 --> 46:09:10,320
înseamnă că acestea sunt etichetele de ieșire ale

61491
46:09:07,920 --> 46:09:11,920
date de antrenament si cv egal cu 5. Aceasta

61492
46:09:10,320 --> 46:09:14,384
parametrul testează funcția de împărțit

61493
46:09:11,920 --> 46:09:16,320
datele în cinci părți care sunt false.

61494
46:09:14,384 --> 46:09:18,560
Și modelul este antrenat pe patru dintre

61495
46:09:16,320 --> 46:09:20,464
aceste părți și partea rămasă este

61496
46:09:18,560 --> 46:09:22,720
folosit pentru testare. Deci acest proces

61497
46:09:20,464 --> 46:09:24,960
se rotește până când fiecare parte a fost folosită

61498
46:09:22,720 --> 46:09:27,280
pentru testare o dată și imprimare

61499
46:09:24,960 --> 46:09:29,024
rezultate care reprezintă punctajul punctual. Deci asta

61500
46:09:27,280 --> 46:09:31,920
calculează media scorurilor

61501
46:09:29,024 --> 46:09:34,000
obtinute din fiecare validare bruta pt

61502
46:09:31,920 --> 46:09:36,160
acest scor mediu vă oferă o idee despre

61503
46:09:34,000 --> 46:09:38,640
cât de bine este probabil să performeze modelul tău

61504
46:09:36,160 --> 46:09:40,320
pe date nevăzute. Un scor consistent

61505
46:09:38,640 --> 46:09:42,464
prin sondaje diferite sugerează dvs

61506
46:09:40,320 --> 46:09:44,640
modelul se generalizează bine mai degrabă decât

61507
46:09:42,464 --> 46:09:46,160
supraadaptare la datele de antrenament. Deci acum

61508
46:09:44,640 --> 46:09:48,320
trecând la următorul punct, adică

61509
46:09:46,160 --> 46:09:50,320
eroare de antrenament versus validare. Deci

61510
46:09:48,320 --> 46:09:52,464
reprezentați grafic erorile de instruire și validare

61511
46:09:50,320 --> 46:09:54,560
în funcţie de epoci de formare sau

61512
46:09:52,464 --> 46:09:56,640
complexitatea modelului. Un model care

61513
46:09:54,560 --> 46:09:58,384
supraajustările vor arăta o eroare scăzută

61514
46:09:56,640 --> 46:10:00,880
date de antrenament și o eroare mare pe

61515
46:09:58,384 --> 46:10:03,024
date de validare pe măsură ce se antrenează în continuare.

61516
46:10:00,880 --> 46:10:05,280
Apoi avem tăierea modelului. Dacă tu

61517
46:10:03,024 --> 46:10:07,520
confirmați că modelul este supraadaptat,

61518
46:10:05,280 --> 46:10:09,840
luați în considerare simplificarea acestuia. Acest lucru ar putea însemna

61519
46:10:07,520 --> 46:10:12,160
reducerea numărului de parametri cu

61520
46:10:09,840 --> 46:10:14,720
selectând mai puține caracteristici folosind

61521
46:10:12,160 --> 46:10:17,360
tehnici de regularizare precum lasso sau

61522
46:10:14,720 --> 46:10:18,720
creastă sau alegerea unui model mai puțin complex.

61523
46:10:17,360 --> 46:10:20,880
După acest pas, vom trece la

61524
46:10:18,720 --> 46:10:22,800
pasul tehnicii de regularizare. Deci astea

61525
46:10:20,880 --> 46:10:25,104
tehnicile adaugă o penalizare la pierdere

61526
46:10:22,800 --> 46:10:27,024
funcţia folosită pentru a antrena modelul care

61527
46:10:25,104 --> 46:10:28,960
poate descuraja modelele complexe care

61528
46:10:27,024 --> 46:10:31,840
supraîncărcare. Apoi avem metode comune

61529
46:10:28,960 --> 46:10:34,320
care includ L1 care este lasso și L2

61530
46:10:31,840 --> 46:10:37,024
regularizarea crestei. Și iată cum tu

61531
46:10:34,320 --> 46:10:38,880
poate adăuga regularizare L2 în Python. Deci

61532
46:10:37,024 --> 46:10:40,720
acesta este fragmentul de cod aici. Și ce

61533
46:10:38,880 --> 46:10:43,440
am făcut aici este creăm

61534
46:10:40,720 --> 46:10:45,744
model de creastă și am aplicat alfa

61535
46:10:43,440 --> 46:10:47,920
egal cu 1,0. Deci acest parametru controlează

61536
46:10:45,744 --> 46:10:50,080
puterea regularizării. A

61537
46:10:47,920 --> 46:10:52,464
valoarea alfa mai mare crește

61538
46:10:50,080 --> 46:10:55,520
efect de regularizare care ajută la reducerea

61539
46:10:52,464 --> 46:10:58,000
complexitatea modelului și combaterea supraadaptării.

61540
46:10:55,520 --> 46:11:00,320
Valoarea alfa poate fi reglată pentru a găsi

61541
46:10:58,000 --> 46:11:02,560
echilibru optim între părtinire şi

61542
46:11:00,320 --> 46:11:05,920
varianţă. Și acum vin pentru montaj

61543
46:11:02,560 --> 46:11:08,160
modelul. Deci modelul se potrivește și în asta

61544
46:11:05,920 --> 46:11:10,720
avem trenul X și trenul Y care se antrenează

61545
46:11:08,160 --> 46:11:12,640
modelul crestei pe datele de antrenament. Ea

61546
46:11:10,720 --> 46:11:15,200
ajustează greutatea caracteristicii în X

61547
46:11:12,640 --> 46:11:17,360
tren pentru a prezice trenul Y în timp ce, de asemenea

61548
46:11:15,200 --> 46:11:19,104
având în vedere termenul de regularizare.

61549
46:11:17,360 --> 46:11:21,664
Acest lucru ajută la prevenirea modelului

61550
46:11:19,104 --> 46:11:23,744
potrivindu-se prea mult cu aspectele zgomotoase

61551
46:11:21,664 --> 46:11:25,920
a datelor de antrenament. Și atunci suntem

61552
46:11:23,744 --> 46:11:27,744
reevaluarea modelului. După ce a făcut

61553
46:11:25,920 --> 46:11:29,840
ajustări, este important să

61554
46:11:27,744 --> 46:11:32,000
reevaluați modelul din nou folosind

61555
46:11:29,840 --> 46:11:33,600
aceeași tehnică de validare încrucișată pentru a vedea

61556
46:11:32,000 --> 46:11:34,880
dacă problema supraajustării are

61557
46:11:33,600 --> 46:11:36,720
îmbunătățită. Și apoi avem

61558
46:11:34,880 --> 46:11:38,240
vizualizare. Pentru a ajuta la ilustrarea sau

61559
46:11:36,720 --> 46:11:40,000
ffitting, ai putea crea un complot

61560
46:11:38,240 --> 46:11:42,160
arătând pregătirea și validarea

61561
46:11:40,000 --> 46:11:44,000
erori sau numărul de epoci sau model

61562
46:11:42,160 --> 46:11:45,840
complexitate. Deci, folosind acestea

61563
46:11:44,000 --> 46:11:47,744
tehnici, puteți identifica dacă dvs

61564
46:11:45,840 --> 46:11:50,000
modelul este potrivit și luați măsuri pentru

61565
46:11:47,744 --> 46:11:51,744
corectați-l asigurându-vă că nu funcționează bine

61566
46:11:50,000 --> 46:11:53,840
numai pe datele de antrenament dar si pe

61567
46:11:51,744 --> 46:11:55,104
date noi nevăzute. Deci acum trecerea la

61568
46:11:53,840 --> 46:11:57,600
următoarea întrebare este numărul întrebării

61569
46:11:55,104 --> 46:11:59,840
trei și se bazează pe date în timp real

61570
46:11:57,600 --> 46:12:01,744
procesarea fluxului și întrebarea este

61571
46:11:59,840 --> 46:12:04,080
ai sarcina de a construi un model

61572
46:12:01,744 --> 46:12:06,000
prezice prețurile acțiunilor în timp real. The

61573
46:12:04,080 --> 46:12:08,080
datele vin în fiecare secundă și aveți nevoie

61574
46:12:06,000 --> 46:12:09,744
pentru a vă actualiza previziunile în consecință.

61575
46:12:08,080 --> 46:12:11,744
Descrieți cum v-ați configura

61576
46:12:09,744 --> 46:12:13,520
sistem pentru a gestiona acest tip de date

61577
46:12:11,744 --> 46:12:15,520
eficient și ce instrumente și

61578
46:12:13,520 --> 46:12:17,280
tehnici ai folosi și de ce. Deci tu

61579
46:12:15,520 --> 46:12:19,280
ar putea începe să răspund la această întrebare cu

61580
46:12:17,280 --> 46:12:21,200
manipularea datelor în timp real. Deci manipulare

61581
46:12:19,280 --> 46:12:23,920
date în timp real, mai ales pentru ceva

61582
46:12:21,200 --> 46:12:26,240
la fel de volatil și rapid ca stocul

61583
46:12:23,920 --> 46:12:28,320
preţurile necesită un sistem robust care poate

61584
46:12:26,240 --> 46:12:30,560
procesează și analizează rapid datele și

61585
46:12:28,320 --> 46:12:32,640
cu precizie. Deci iată cum ai putea

61586
46:12:30,560 --> 46:12:35,024
aborda asta. Vom înființa un astfel de

61587
46:12:32,640 --> 46:12:36,640
sistem și vom avea câțiva pași. Deci

61588
46:12:35,024 --> 46:12:38,640
incepand cu pasii. Deci primul

61589
46:12:36,640 --> 46:12:40,960
pasul este alegerea instrumentelor potrivite. The

61590
46:12:38,640 --> 46:12:42,464
instrumentul potrivit ar fi Apache Kafka. Deci

61591
46:12:40,960 --> 46:12:45,024
acesta este un instrument popular pentru manipulare

61592
46:12:42,464 --> 46:12:46,960
date în timp real care sunt transmise în flux deoarece

61593
46:12:45,024 --> 46:12:49,104
vă permite să publicați și să vă abonați la

61594
46:12:46,960 --> 46:12:50,720
fluxuri de înregistrări care sunt date și acesta

61595
46:12:49,104 --> 46:12:53,200
poate face față debitului mare cu un nivel scăzut

61596
46:12:50,720 --> 46:12:54,960
latenta. Kafka acționează ca un tampon și

61597
46:12:53,200 --> 46:12:57,200
gestionează fluxul de date asigurându-se că

61598
46:12:54,960 --> 46:12:59,840
sistemul tău nu este copleșit și

61599
46:12:57,200 --> 46:13:01,440
de asemenea, puteți folosi Apache Spark în special

61600
46:12:59,840 --> 46:13:03,664
Spark streaming este excelent pentru

61601
46:13:01,440 --> 46:13:05,440
prelucrarea datelor. Poate procesa date

61602
46:13:03,664 --> 46:13:07,920
în timp real și performante complexe

61603
46:13:05,440 --> 46:13:10,384
operațiuni precum ferestre, gruparea datelor

61604
46:13:07,920 --> 46:13:12,240
în bucăți dintr-o anumită perioadă de timp

61605
46:13:10,384 --> 46:13:14,880
și agregarea care este rezumat

61606
46:13:12,240 --> 46:13:17,200
date. Deci îl puteți modifica și efectua

61607
46:13:14,880 --> 46:13:19,744
prognozarea prețurilor acțiunilor. Și apoi

61608
46:13:17,200 --> 46:13:21,200
pasul este conducta de procesare a datelor.

61609
46:13:19,744 --> 46:13:23,440
Și primul pas vine aici este

61610
46:13:21,200 --> 46:13:25,664
injecție. Datele intră mai întâi în sistem

61611
46:13:23,440 --> 46:13:27,920
de obicei prin Kafka care colectează

61612
46:13:25,664 --> 46:13:30,800
date trimise de la bursa si apoi

61613
46:13:27,920 --> 46:13:32,640
noi facem prelucrarea. Deci streaming de scântei

61614
46:13:30,800 --> 46:13:34,464
preia aici. Aici poți aplica

61615
46:13:32,640 --> 46:13:36,384
transformări și rulați predicția

61616
46:13:34,464 --> 46:13:38,560
modele pe date. De exemplu, tu

61617
46:13:36,384 --> 46:13:40,384
ar putea calcula medii mobile sau altele

61618
46:13:38,560 --> 46:13:42,384
indicatori care se alimentează în stocul dvs

61619
46:13:40,384 --> 46:13:44,720
model de predicție a prețurilor. Și apoi vine

61620
46:13:42,384 --> 46:13:47,024
ieșirea. În sfârșit, previziunile sunt

61621
46:13:44,720 --> 46:13:49,664
iesit. Aceasta ar putea fi la un tablou de bord

61622
46:13:47,024 --> 46:13:52,320
pentru comercianți, un sistem de tranzacționare automatizat

61623
46:13:49,664 --> 46:13:54,320
sau chiar stocate pentru analize ulterioare. Şi

61624
46:13:52,320 --> 46:13:56,080
apoi dezvoltăm modelul. Acum vine

61625
46:13:54,320 --> 46:13:57,920
dezvoltarea modelului. Probabil ai folosi

61626
46:13:56,080 --> 46:14:00,464
un model de învățare automată care se poate actualiza

61627
46:13:57,920 --> 46:14:03,104
rapid și să încorporeze noi date

61628
46:14:00,464 --> 46:14:05,200
ajunge. modele precum vizează timp

61629
46:14:03,104 --> 46:14:07,520
prognoza seriei sau mai complexe

61630
46:14:05,200 --> 46:14:10,384
modele de învățare automată precum rect neural

61631
46:14:07,520 --> 46:14:12,160
RNN-urile de rețele pot fi potrivite. Modelul

61632
46:14:10,384 --> 46:14:14,464
ar trebui să fie recalificat sau ajustat

61633
46:14:12,160 --> 46:14:16,640
periodic cu date noi pentru a-l asigura

61634
46:14:14,464 --> 46:14:19,104
rămâne exactă. Acum vom ajunge la

61635
46:14:16,640 --> 46:14:21,104
scalabilitate și fiabilitate. Deci asigurați-vă

61636
46:14:19,104 --> 46:14:23,104
sistemul dumneavoastră poate scala ca volum de date

61637
46:14:21,104 --> 46:14:24,880
crește. Acest lucru ar putea însemna să adăugați mai multe

61638
46:14:23,104 --> 46:14:27,200
servere sau optimizarea datelor dvs

61639
46:14:24,880 --> 46:14:29,360
cod de procesare. Implementați monitorizarea la

61640
46:14:27,200 --> 46:14:31,440
prinde orice probleme devreme, cum ar fi întârzierile

61641
46:14:29,360 --> 46:14:33,664
prelucrarea datelor sau performanța modelului

61642
46:14:31,440 --> 46:14:35,440
picături. Și acum vom vedea pasul care

61643
46:14:33,664 --> 46:14:36,880
este vizualizarea și monitorizarea.

61644
46:14:35,440 --> 46:14:39,104
Luați în considerare configurarea în timp real

61645
46:14:36,880 --> 46:14:41,520
tablou de bord care afișează valori cheie, cum ar fi

61646
46:14:39,104 --> 46:14:43,520
acuratețea predicției și timpul de procesare.

61647
46:14:41,520 --> 46:14:45,360
Acest lucru ajută la identificarea rapidă când

61648
46:14:43,520 --> 46:14:47,360
ceva nu merge bine. Prin configurarea dvs

61649
46:14:45,360 --> 46:14:49,104
sistem cu aceste instrumente și strategii,

61650
46:14:47,360 --> 46:14:51,440
poți face față în mod eficient provocării

61651
46:14:49,104 --> 46:14:52,960
de a prezice prețurile acțiunilor în timp real.

61652
46:14:51,440 --> 46:14:55,024
Deci acum vom trece la următoarea întrebare

61653
46:14:52,960 --> 46:14:57,440
asta este întrebarea numărul patru și asta

61654
46:14:55,024 --> 46:14:59,280
se va baza pe analiza datelor scalabile.

61655
46:14:57,440 --> 46:15:02,560
Deci am acoperit două întrebări care

61656
46:14:59,280 --> 46:15:04,640
au fost un pic de întrebări bazate pe cod și acum

61657
46:15:02,560 --> 46:15:07,280
vom vedea alte întrebări care ar fi

61658
46:15:04,640 --> 46:15:10,160
bazate pe analiza datelor scalabile sau acestea

61659
46:15:07,280 --> 46:15:12,000
ar putea fi pe zone diferite și cu

61660
46:15:10,160 --> 46:15:14,720
A 13-a întrebare vom începe din nou cu

61661
46:15:12,000 --> 46:15:16,640
cele de codificare. Deci trec cu întrebarea

61662
46:15:14,720 --> 46:15:18,800
patru care se bazează pe date scalabile

61663
46:15:16,640 --> 46:15:20,464
analitice și întrebarea este dată a

61664
46:15:18,800 --> 46:15:22,240
scenariul în care organizația dvs

61665
46:15:20,464 --> 46:15:24,640
trebuie brusc să-și scaleze datele

61666
46:15:22,240 --> 46:15:27,200
capabilități de analiză datorită unui aflux

61667
46:15:24,640 --> 46:15:29,200
de date care ar fi de 10 ori mai mare decât

61668
46:15:27,200 --> 46:15:31,360
volum normal. Cum te-ai descurca cu asta

61669
46:15:29,200 --> 46:15:33,920
situație pentru a vă asigura analiza datelor

61670
46:15:31,360 --> 46:15:35,664
procesele rămân eficiente și precise?

61671
46:15:33,920 --> 46:15:37,520
Ce tehnologii ai lua în considerare și

61672
46:15:35,664 --> 46:15:39,360
ce pasi ai face? Deci poți

61673
46:15:37,520 --> 46:15:41,024
începe să răspunzi la această întrebare cu

61674
46:15:39,360 --> 46:15:43,360
gestionând o creștere bruscă a datelor

61675
46:15:41,024 --> 46:15:45,600
volumul necesită o abordare strategică a

61676
46:15:43,360 --> 46:15:47,600
scalarea infrastructurii dvs. de analiză

61677
46:15:45,600 --> 46:15:50,560
fără a compromite eficienţa sau

61678
46:15:47,600 --> 46:15:52,384
precizie. Deci vom vedea câțiva pași de la

61679
46:15:50,560 --> 46:15:54,384
că ai putea gestiona eficient acest lucru

61680
46:15:52,384 --> 46:15:56,320
scenariu la care ai începe să răspunzi

61681
46:15:54,384 --> 46:15:58,464
intervievatorul cu care putem începe

61682
46:15:56,320 --> 46:16:01,104
evaluarea infrastructurii actuale

61683
46:15:58,464 --> 46:16:02,960
capacitatea de a face față sarcinilor crescute. Aceasta

61684
46:16:01,104 --> 46:16:05,840
include evaluarea bazelor de date,

61685
46:16:02,960 --> 46:16:08,320
servere și instrumente analitice de identificare

61686
46:16:05,840 --> 46:16:10,160
potenţiale blocaje sau limitări.

61687
46:16:08,320 --> 46:16:12,240
Apoi ai putea trece la pasul următor

61688
46:16:10,160 --> 46:16:14,240
ar fi alegerea tehnologiilor scalabile

61689
46:16:12,240 --> 46:16:15,600
pentru a gestiona volumul crescut de date.

61690
46:16:14,240 --> 46:16:17,520
Luați în considerare utilizarea bazate pe cloud

61691
46:16:15,600 --> 46:16:19,104
soluții precum serviciile web Amazon,

61692
46:16:17,520 --> 46:16:21,440
Platforma cloud Google sau Microsoft

61693
46:16:19,104 --> 46:16:23,104
Azure. Aceste platforme oferă scalabile

61694
46:16:21,440 --> 46:16:25,360
resurse care pot fi ajustate

61695
46:16:23,104 --> 46:16:27,520
în conformitate cu asigurarea încărcării datelor

61696
46:16:25,360 --> 46:16:29,600
platesti doar pentru ceea ce folosesti. integra

61697
46:16:27,520 --> 46:16:31,840
tehnologiile de date mari precum Apache Hadoop

61698
46:16:29,600 --> 46:16:33,840
pentru stocare distribuită și Apache Spark

61699
46:16:31,840 --> 46:16:35,360
pentru prelucrarea rapidă a datelor. Aceste instrumente

61700
46:16:33,840 --> 46:16:38,160
sunt concepute pentru a gestiona volume masive

61701
46:16:35,360 --> 46:16:41,104
de date în mod eficient și poate scala până la

61702
46:16:38,160 --> 46:16:42,464
satisface cerințele standard crescute. Acum noi

61703
46:16:41,104 --> 46:16:44,960
trece la pasul următor care ar fi

61704
46:16:42,464 --> 46:16:47,104
optimizarea procesării datelor. Deci implementați

61705
46:16:44,960 --> 46:16:49,200
partiţionarea şi indexarea datelor

61706
46:16:47,104 --> 46:16:51,664
strategii de îmbunătățire a eficienței

61707
46:16:49,200 --> 46:16:53,600
interogări de date. Acest lucru va ajuta la management

61708
46:16:51,664 --> 46:16:55,744
seturi mari de date prin spargerea lor în

61709
46:16:53,600 --> 46:16:58,384
bucăți mai mici gestionabile și viteză

61710
46:16:55,744 --> 46:17:00,160
operațiunile de căutare și utilizarea în timp real

61711
46:16:58,384 --> 46:17:02,464
cadre de procesare a datelor precum Apache

61712
46:17:00,160 --> 46:17:04,464
Kafka sau Apache Flink care se poate descurca

61713
46:17:02,464 --> 46:17:06,560
debit mare și oferă în timp util

61714
46:17:04,464 --> 46:17:08,080
perspective din fluxuri mari de date. Şi

61715
46:17:06,560 --> 46:17:09,840
următorul pas ar fi automatizarea și

61716
46:17:08,080 --> 46:17:11,744
monitorizare. Automatizați datele de rutină

61717
46:17:09,840 --> 46:17:13,920
sarcina de procesare pentru a reduce manualul

61718
46:17:11,744 --> 46:17:15,664
efortul și accelerarea analizei. Aceasta

61719
46:17:13,920 --> 46:17:17,664
se poate face prin scripting sau folosind

61720
46:17:15,664 --> 46:17:19,744
instrumente de automatizare a fluxului de lucru. Configurați

61721
46:17:17,664 --> 46:17:21,104
sisteme de monitorizare cuprinzătoare la

61722
46:17:19,744 --> 46:17:23,440
urmăriți performanța datelor dvs

61723
46:17:21,104 --> 46:17:25,664
proceselor. Instrumente precum Prometheus pentru

61724
46:17:23,440 --> 46:17:27,744
monitorizare sistem si Graphana pt

61725
46:17:25,664 --> 46:17:29,920
tablourile de bord de analiză și monitorizare sunt

61726
46:17:27,744 --> 46:17:32,080
util aici. Ele ajută să se asigure că

61727
46:17:29,920 --> 46:17:34,240
sistemul funcționează fără probleme și vă alertează

61728
46:17:32,080 --> 46:17:36,960
la problemele potențiale înainte ca acestea să devină

61729
46:17:34,240 --> 46:17:39,024
critică. Și următorul pas va fi

61730
46:17:36,960 --> 46:17:40,880
evaluare și scalare regulată.

61731
46:17:39,024 --> 46:17:43,024
Evaluați continuu performanța

61732
46:17:40,880 --> 46:17:45,104
infrastructura de analiză. Ca datele tale

61733
46:17:43,024 --> 46:17:46,800
crește, continuați să vă ajustați și să vă scalați

61734
46:17:45,104 --> 46:17:48,800
resurse pentru menținerea optimă

61735
46:17:46,800 --> 46:17:50,320
performanta. Planificați revizuiri periodice

61736
46:17:48,800 --> 46:17:52,320
a stivei dvs. de tehnologie și

61737
46:17:50,320 --> 46:17:54,160
infrastructură pentru a se asigura că rămân

61738
46:17:52,320 --> 46:17:56,320
aliniat cu nevoile dvs. de date și

61739
46:17:54,160 --> 46:17:57,744
scopuri organizatorice. Urmând acestea

61740
46:17:56,320 --> 46:17:59,744
pași, vă puteți asigura că datele dvs

61741
46:17:57,744 --> 46:18:01,600
procesele de analiză sunt pregătite să

61742
46:17:59,744 --> 46:18:03,744
gestionați creșterile bruște ale volumului de date

61743
46:18:01,600 --> 46:18:06,800
menținerea eficientă a integrității

61744
46:18:03,744 --> 46:18:08,560
și viteza de înțelegere. Deci asta a fost tot

61745
46:18:06,800 --> 46:18:10,240
pentru întrebarea patru. Acum trecerea la

61746
46:18:08,560 --> 46:18:12,240
întrebarea cinci și aceasta se bazează pe

61747
46:18:10,240 --> 46:18:14,240
integrarea modelelor de învățare automată în

61748
46:18:12,240 --> 46:18:15,840
producție și întrebarea este că aveți

61749
46:18:14,240 --> 46:18:17,840
a dezvoltat un model de învățare automată care

61750
46:18:15,840 --> 46:18:19,664
funcționează bine în mediul de testare.

61751
46:18:17,840 --> 46:18:21,200
Acum trebuie să îl integrați în dvs

61752
46:18:19,664 --> 46:18:23,360
mediu de producție unde va fi

61753
46:18:21,200 --> 46:18:25,024
utilizate în aplicații în timp real. Ce

61754
46:18:23,360 --> 46:18:27,200
măsurile pe care le-ați lua pentru a vă asigura că

61755
46:18:25,024 --> 46:18:29,520
implementarea și operațiunile cu succes ale

61756
46:18:27,200 --> 46:18:31,440
modelul in productie? Deci vom începe

61757
46:18:29,520 --> 46:18:33,744
răspunzând la aceasta prin implementarea cu succes

61758
46:18:31,440 --> 46:18:35,664
un model de învățare automată în producție

61759
46:18:33,744 --> 46:18:38,160
implică mai mulți pași critici pentru

61760
46:18:35,664 --> 46:18:40,800
asigurați-vă că funcționează la fel de bine în timp real

61761
46:18:38,160 --> 46:18:43,200
operațiuni așa cum se întâmplă în testare. Deci tu

61762
46:18:40,800 --> 46:18:45,024
ar avea o cale clară pentru a face

61763
46:18:43,200 --> 46:18:46,800
intervievatorul înțelege. Vom începe

61764
46:18:45,024 --> 46:18:49,104
cu calea cu primul pas

61765
46:18:46,800 --> 46:18:51,200
asta ar fi validarea modelului. Deci

61766
46:18:49,104 --> 46:18:52,880
înainte de a trece ceva în producție

61767
46:18:51,200 --> 46:18:55,520
revalidați performanța modelului dvs

61768
46:18:52,880 --> 46:18:57,440
folosind un set separat de date de validare.

61769
46:18:55,520 --> 46:19:00,464
Acest lucru ajută la confirmarea faptului că modelul

61770
46:18:57,440 --> 46:19:02,000
generalizează bine la date noi nevăzute. The

61771
46:19:00,464 --> 46:19:03,920
următorul pas va fi pregătirea

61772
46:19:02,000 --> 46:19:05,360
mediu de producție. Asigurați-vă că

61773
46:19:03,920 --> 46:19:07,104
mediul de producție este pregătit

61774
46:19:05,360 --> 46:19:09,360
manipula modelul. Aceasta include setarea

61775
46:19:07,104 --> 46:19:11,600
să creeze hardware-ul și software-ul necesar

61776
46:19:09,360 --> 46:19:14,080
asigurându-se că poate face față așteptărilor

61777
46:19:11,600 --> 46:19:16,800
încărcați și că toate dependențele sunt

61778
46:19:14,080 --> 46:19:18,384
instalat și configurat corect. Apoi

61779
46:19:16,800 --> 46:19:20,640
următorul pas vine și anume modelul

61780
46:19:18,384 --> 46:19:22,640
împachetare. Înveliți modelul într-un API care

61781
46:19:20,640 --> 46:19:24,384
este interfața de programare a aplicațiilor

61782
46:19:22,640 --> 46:19:26,320
făcându-l accesibil altor părți ale

61783
46:19:24,384 --> 46:19:28,240
infrastructura dumneavoastră software. Cadre

61784
46:19:26,320 --> 46:19:30,640
ca un balon pentru Python poate fi folosit

61785
46:19:28,240 --> 46:19:32,464
creați un server web simplu care să asculte

61786
46:19:30,640 --> 46:19:34,640
pentru intrări de date și oferă model

61787
46:19:32,464 --> 46:19:37,104
iesiri. Apoi urmează următorul pas care

61788
46:19:34,640 --> 46:19:39,520
este strategiile de implementare. Luați în considerare utilizarea

61789
46:19:37,104 --> 46:19:41,920
instrumente de containerizare precum doer care

61790
46:19:39,520 --> 46:19:43,840
poate ajuta la încapsularea modelului dvs. și al acestuia

61791
46:19:41,920 --> 46:19:46,080
mediu care să asigure funcționarea acestuia

61792
46:19:43,840 --> 46:19:48,640
uniform pe parcursul diferitelor dezvoltări

61793
46:19:46,080 --> 46:19:50,640
și setările de producție. Și atunci vom face

61794
46:19:48,640 --> 46:19:53,200
utilizați strategii de implementare precum albastru

61795
46:19:50,640 --> 46:19:55,360
implementare verde sau lansări canare la

61796
46:19:53,200 --> 46:19:57,280
minimizați timpul de nefuncționare și reduceți riscul de

61797
46:19:55,360 --> 46:19:59,360
introducerea unui model defect în

61798
46:19:57,280 --> 46:20:01,280
producție. Și apoi vine următorul pas

61799
46:19:59,360 --> 46:20:03,024
adică monitorizarea și înregistrarea în jurnal.

61800
46:20:01,280 --> 46:20:05,024
Implementați înregistrarea și monitorizarea la

61801
46:20:03,024 --> 46:20:07,520
urmăriți performanța și sănătatea modelului

61802
46:20:05,024 --> 46:20:11,520
în timp real. Instrumente precum solicitări pentru

61803
46:20:07,520 --> 46:20:13,520
monitorizarea și jurnalul de căutare elastic ELK

61804
46:20:11,520 --> 46:20:15,360
statch kibbana pentru ajutor pentru conectare

61805
46:20:13,520 --> 46:20:17,664
identificarea și diagnosticarea rapidă

61806
46:20:15,360 --> 46:20:19,920
probleme în producție. Și apoi vine

61807
46:20:17,664 --> 46:20:21,664
următorul pas este reglarea performanței.

61808
46:20:19,920 --> 46:20:23,600
Monitorizați performanța modelului

61809
46:20:21,664 --> 46:20:25,920
timp. Dacă performanţa modelului

61810
46:20:23,600 --> 46:20:28,000
se degradează sau dacă datele noi arată diferit

61811
46:20:25,920 --> 46:20:29,920
tipare, poate fi necesar să vă reantrenați sau

61812
46:20:28,000 --> 46:20:32,320
reglați fin modelul pentru a menține

61813
46:20:29,920 --> 46:20:34,640
precizie. Și după acest pas, există un

61814
46:20:32,320 --> 46:20:36,960
pas pentru bucla de feedback. Setați un feedback

61815
46:20:34,640 --> 46:20:39,360
buclă unde previziunile și rezultatele pot

61816
46:20:36,960 --> 46:20:41,440
fi comparat. Acest feedback este crucial

61817
46:20:39,360 --> 46:20:44,240
pentru perfecţionarea continuă a modelului şi

61818
46:20:41,440 --> 46:20:45,920
prind orice derive a datelor sau modificări în

61819
46:20:44,240 --> 46:20:48,640
condiţiile externe care afectează

61820
46:20:45,920 --> 46:20:50,560
model. Și după aceasta vine un ultim pas

61821
46:20:48,640 --> 46:20:52,640
adică verificări legale și de conformitate.

61822
46:20:50,560 --> 46:20:54,880
Asigurați-vă că toate datele utilizate de model sunt în

61823
46:20:52,640 --> 46:20:56,960
producția respectă legile privind confidențialitatea

61824
46:20:54,880 --> 46:20:58,880
si reglementari. Acest lucru este crucial pentru

61825
46:20:56,960 --> 46:21:00,464
menținerea încrederii și a legalității

61826
46:20:58,880 --> 46:21:02,640
mai ales la manipularea sensibilă

61827
46:21:00,464 --> 46:21:04,464
informaţii. Deci, prin planificarea atentă

61828
46:21:02,640 --> 46:21:05,920
și executând acești pași puteți

61829
46:21:04,464 --> 46:21:07,520
tranziți ușor mașina dvs

61830
46:21:05,920 --> 46:21:09,104
model de învățare dintr-o testare

61831
46:21:07,520 --> 46:21:11,280
mediu într-un mediu complet funcțional

61832
46:21:09,104 --> 46:21:12,640
componentă a unui sistem de producţie. Deci

61833
46:21:11,280 --> 46:21:14,080
asta era totul despre numărul întrebării

61834
46:21:12,640 --> 46:21:16,720
cinci. Acum trecem la numărul întrebării

61835
46:21:14,080 --> 46:21:18,880
șase care ar fi bazate pe date

61836
46:21:16,720 --> 46:21:20,880
luarea deciziilor. Și întrebarea este

61837
46:21:18,880 --> 46:21:23,200
compania ta vrea să se orienteze către mai mult

61838
46:21:20,880 --> 46:21:25,280
luarea deciziilor bazate pe date. ai

61839
46:21:23,200 --> 46:21:27,520
a fost însărcinat cu elaborarea unei strategii

61840
46:21:25,280 --> 46:21:29,744
pentru a implementa acest lucru. Ce pași ai face

61841
46:21:27,520 --> 46:21:31,744
ia pentru a se asigura că datele la toate

61842
46:21:29,744 --> 46:21:34,080
nivelurile organizației sunt utilizate

61843
46:21:31,744 --> 46:21:36,160
eficient pentru a lua decizii informate

61844
46:21:34,080 --> 46:21:37,920
și cu ce provocări te-ai putea confrunta și

61845
46:21:36,160 --> 46:21:39,840
cum le-ai adresa? Deci poți

61846
46:21:37,920 --> 46:21:42,720
începeți să răspundeți la aceasta prin implementarea a

61847
46:21:39,840 --> 46:21:44,640
decizie bazată pe date-m strategie care va

61848
46:21:42,720 --> 46:21:47,024
necesită o abordare cuprinzătoare a

61849
46:21:44,640 --> 46:21:49,280
asigurați-vă că datele fiabile sunt accesibile

61850
46:21:47,024 --> 46:21:51,360
și utilizat în mod eficient la toate nivelurile

61851
46:21:49,280 --> 46:21:53,520
a organizatiei. Și acum putem

61852
46:21:51,360 --> 46:21:55,440
dezvoltarea și implementarea acestei strategii. Şi

61853
46:21:53,520 --> 46:21:57,280
la fel ai putea spune această strategie

61854
46:21:55,440 --> 46:21:59,200
la intervievator. Deci numărul unu

61855
46:21:57,280 --> 46:22:01,360
pasul va fi evaluarea datelor curente

61856
46:21:59,200 --> 46:22:03,024
infrastructura. Începe prin a evalua

61857
46:22:01,360 --> 46:22:05,104
infrastructura de date existentă pentru

61858
46:22:03,024 --> 46:22:06,880
înțelegeți ce date sunt disponibile, cum

61859
46:22:05,104 --> 46:22:09,200
este stocat și cum este în prezent

61860
46:22:06,880 --> 46:22:11,920
folosit. Această evaluare va ajuta la identificarea

61861
46:22:09,200 --> 46:22:14,384
lacune în colectarea, stocarea datelor și

61862
46:22:11,920 --> 46:22:16,240
acces care trebuie abordat. Acum noi

61863
46:22:14,384 --> 46:22:19,024
trece la pasul următor care se dezvoltă

61864
46:22:16,240 --> 46:22:21,200
un cadru de guvernare a datelor. Implementați a

61865
46:22:19,024 --> 46:22:23,600
cadru de guvernare a datelor care definește

61866
46:22:21,200 --> 46:22:25,360
cine poate accesa datele, cum pot fi utilizate

61867
46:22:23,600 --> 46:22:28,080
și cine este responsabil de întreținere

61868
46:22:25,360 --> 46:22:29,744
calitatea acestuia. Acest cadru asigură datele

61869
46:22:28,080 --> 46:22:32,160
integritate și securitate care sunt

61870
46:22:29,744 --> 46:22:33,744
critic pentru luarea unor decizii de încredere.

61871
46:22:32,160 --> 46:22:35,664
Acum vom trece la pasul următor, adică

61872
46:22:33,744 --> 46:22:37,280
instruire și împuternicire. Așa că antrenează-te

61873
46:22:35,664 --> 46:22:40,240
angajați la toate nivelurile de pe

61874
46:22:37,280 --> 46:22:42,080
importanța luării deciziilor bazate pe date

61875
46:22:40,240 --> 46:22:44,080
și să le furnizeze instrumentele și

61876
46:22:42,080 --> 46:22:46,000
cunoștințe necesare analizei și

61877
46:22:44,080 --> 46:22:48,080
interpreta datele. Aceasta ar putea include

61878
46:22:46,000 --> 46:22:50,000
sesiuni de formare, ateliere și în curs de desfășurare

61879
46:22:48,080 --> 46:22:52,160
sprijin pentru a se asigura că toată lumea poate folosi datele

61880
46:22:50,000 --> 46:22:54,560
eficient. Acum treceți la pasul următor

61881
46:22:52,160 --> 46:22:56,800
adică implementarea instrumentelor analitice.

61882
46:22:54,560 --> 46:22:58,960
Prin urmare, implementați instrumente analitice ușor de utilizat

61883
46:22:56,800 --> 46:23:01,200
care se pot integra perfect în

61884
46:22:58,960 --> 46:23:03,744
fluxurile zilnice de lucru ale angajaților. Instrumente ca

61885
46:23:01,200 --> 46:23:05,440
Tableau, Microsoft PowerBI sau chiar

61886
46:23:03,744 --> 46:23:07,840
tehnicile avansate Excel pot oferi

61887
46:23:05,440 --> 46:23:09,840
capabilități puternice de analiză a datelor

61888
46:23:07,840 --> 46:23:12,240
fără a necesita tehnică extinsă

61889
46:23:09,840 --> 46:23:13,744
cunoştinţe. După aceasta, vom trece la

61890
46:23:12,240 --> 46:23:16,560
pas care ar fi crearea unui

61891
46:23:13,744 --> 46:23:18,320
platformă centralizată de date. Dezvoltator

61892
46:23:16,560 --> 46:23:20,384
platformă centralizată de date unde toate

61893
46:23:18,320 --> 46:23:22,320
datele organizaționale pot fi accesate și

61894
46:23:20,384 --> 46:23:24,384
analizate. Această platformă ar trebui să fie

61895
46:23:22,320 --> 46:23:27,104
scalabil și sigur oferind un singur

61896
46:23:24,384 --> 46:23:28,800
sursa adevărului pentru organizație.

61897
46:23:27,104 --> 46:23:31,104
Și apoi avem promovarea a

61898
46:23:28,800 --> 46:23:33,440
cultura bazată pe date. Așa că promovați cultura

61899
46:23:31,104 --> 46:23:35,280
care pune în valoare decizia bazată pe date-m

61900
46:23:33,440 --> 46:23:37,600
încurajează experimentarea și învățarea

61901
46:23:35,280 --> 46:23:39,600
din inițiative bazate pe date. sărbători

61902
46:23:37,600 --> 46:23:40,880
succese și să învețe din eșecuri să

61903
46:23:39,600 --> 46:23:43,600
îmbunătățirea continuă a utilizării

61904
46:23:40,880 --> 46:23:45,104
bazat pe date în luarea deciziilor și acolo

61905
46:23:43,600 --> 46:23:47,360
ar fi niște provocări și soluții

61906
46:23:45,104 --> 46:23:49,440
pentru asta. Deci o provocare majoră pe care o știm

61907
46:23:47,360 --> 46:23:50,960
aici este rezistența la schimbare ca unii

61908
46:23:49,440 --> 46:23:53,440
angajaţii pot prefera tradiţionale

61909
46:23:50,960 --> 46:23:55,600
metode de decizie-m. Așa că abordează asta prin

61910
46:23:53,440 --> 46:23:57,744
demonstrând beneficiile tangibile ale

61911
46:23:55,600 --> 46:24:00,160
decizii bazate pe date prin intermediul pilot

61912
46:23:57,744 --> 46:24:02,800
proiecte și povești de succes. Deci date

61913
46:24:00,160 --> 46:24:04,880
silozurile pot împiedica, de asemenea, utilizarea eficientă a datelor

61914
46:24:02,800 --> 46:24:07,600
promovează colaborarea între departamente

61915
46:24:04,880 --> 46:24:09,360
și să integreze surse de date disparate pentru

61916
46:24:07,600 --> 46:24:10,800
depășiți această provocare. După aceea tu

61917
46:24:09,360 --> 46:24:13,280
poate monitoriza și face continuu

61918
46:24:10,800 --> 46:24:14,720
imbunatatire. Deci prin sistematic

61919
46:24:13,280 --> 46:24:16,384
implementând acești pași poți

61920
46:24:14,720 --> 46:24:19,104
transforma-ti organizatia intr-una

61921
46:24:16,384 --> 46:24:21,440
care valorifică datele la toate nivelurile pentru

61922
46:24:19,104 --> 46:24:23,664
luați decizii informate și eficiente.

61923
46:24:21,440 --> 46:24:26,160
Și după ce ai răspuns în acești pași tu

61924
46:24:23,664 --> 46:24:28,320
ar putea face intervievatorul să aibă un adevăr

61925
46:24:26,160 --> 46:24:30,640
și o credință în tine pe care o poți crea

61926
46:24:28,320 --> 46:24:32,240
aceste modele. Acum treceți la următorul

61927
46:24:30,640 --> 46:24:34,384
întrebare care este întrebarea numărul șapte

61928
46:24:32,240 --> 46:24:36,720
și asta se bazează pe manipularea datelor mari

61929
46:24:34,384 --> 46:24:39,200
setați și întrebarea este proiectul dvs

61930
46:24:36,720 --> 46:24:41,664
presupune analiza unor date extrem de mari

61931
46:24:39,200 --> 46:24:43,744
setează potenţial depăşind terabytes în

61932
46:24:41,664 --> 46:24:46,320
dimensiune. Ce strategii ai folosi

61933
46:24:43,744 --> 46:24:48,240
gestionați și analizați seturi de date atât de mari

61934
46:24:46,320 --> 46:24:50,320
eficient? Descrieți instrumentele și

61935
46:24:48,240 --> 46:24:52,240
tehnici pe care le-ai putea folosi și tu

61936
46:24:50,320 --> 46:24:54,240
ar putea începe cu a răspunde la asta

61937
46:24:52,240 --> 46:24:56,800
lucrul cu seturi mari de date în special

61938
46:24:54,240 --> 46:24:58,384
cele din intervalul terabyte prezintă unice

61939
46:24:56,800 --> 46:25:00,800
provocări în ceea ce privește stocarea

61940
46:24:58,384 --> 46:25:02,384
prelucrare si analiza. Deci vom avea un

61941
46:25:00,800 --> 46:25:04,560
abordare structurată pentru a le gestiona

61942
46:25:02,384 --> 46:25:06,640
provocări în mod eficient. Vom începe cu

61943
46:25:04,560 --> 46:25:09,024
stocarea datelor care ar fi utilizată

61944
46:25:06,640 --> 46:25:11,200
sisteme de fișiere distribuite. Luați în considerare utilizarea

61945
46:25:09,024 --> 46:25:14,160
un sistem de fișiere distribuit precum Hadoop

61946
46:25:11,200 --> 46:25:16,560
sistem de fișiere distribuit HDFS sau Amazon

61947
46:25:14,160 --> 46:25:18,880
S3. Aceste sisteme sunt concepute pentru a stoca

61948
46:25:16,560 --> 46:25:21,024
cantități mari de date pe multe servere

61949
46:25:18,880 --> 46:25:23,104
oferind disponibilitate mare și port

61950
46:25:21,024 --> 46:25:25,440
toleranta. Și apoi vine următorul pas

61951
46:25:23,104 --> 46:25:27,104
adică prelucrarea datelor. Pârghie mare

61952
46:25:25,440 --> 46:25:29,520
cadre de prelucrare a datelor. Instrumente ca

61953
46:25:27,104 --> 46:25:31,520
Apache Spark sunt ideale pentru procesare

61954
46:25:29,520 --> 46:25:34,080
seturi mari de date deoarece se ocupă

61955
46:25:31,520 --> 46:25:36,160
calcularea distribuită în mod eficient. Scânteie

61956
46:25:34,080 --> 46:25:38,320
poate efectua sarcini de prelucrare a datelor mult

61957
46:25:36,160 --> 46:25:40,464
mai rapid decât bazat pe disc tradițional

61958
46:25:38,320 --> 46:25:42,880
procesare datorită acestuia în memorie

61959
46:25:40,464 --> 46:25:44,464
capabilități de calcul. Și în continuare noi

61960
46:25:42,880 --> 46:25:46,384
ar putea începe cu date eficiente

61961
46:25:44,464 --> 46:25:48,640
prelevarea de probe. Deci, există multe mostre

61962
46:25:46,384 --> 46:25:50,720
tehnici pe care le putem folosi. Deci, când

61963
46:25:48,640 --> 46:25:53,360
setul de date este prea mare pentru a fi gestionat chiar și

61964
46:25:50,720 --> 46:25:55,104
cu instrumente puternice, luați în considerare utilizarea datelor

61965
46:25:53,360 --> 46:25:57,520
tehnici de eșantionare pentru a reduce dimensiunea

61966
46:25:55,104 --> 46:25:59,360
la un nivel gestionabil fără a pierde

61967
46:25:57,520 --> 46:26:00,960
perspective semnificative. Asigurați-vă că

61968
46:25:59,360 --> 46:26:03,200
eșantionul reprezintă întregul set de date

61969
46:26:00,960 --> 46:26:05,024
cu precizie. Și apoi vine optimizarea

61970
46:26:03,200 --> 46:26:07,280
a interogărilor de date. Indexarea și

61971
46:26:05,024 --> 46:26:08,720
compartimentare. Optimizați-vă interogările de date

61972
46:26:07,280 --> 46:26:10,560
prin implementarea indexării şi

61973
46:26:08,720 --> 46:26:12,320
compartimentare. Acest lucru poate drastic

61974
46:26:10,560 --> 46:26:14,640
reduce timpul necesar executării

61975
46:26:12,320 --> 46:26:16,640
interogări prin limitarea cantității de date

61976
46:26:14,640 --> 46:26:18,320
scanează. Și apoi putem face scalabil

61977
46:26:16,640 --> 46:26:20,320
analitice. Și apoi vom trece la

61978
46:26:18,320 --> 46:26:21,744
următorul pas este analiza scalabilă.

61979
46:26:20,320 --> 46:26:23,744
Și în asta am putea începe cu

61980
46:26:21,744 --> 46:26:25,440
calcul paralel. Utilizați paralel

61981
46:26:23,744 --> 46:26:28,000
capabilitățile de calcul ale cadrelor

61982
46:26:25,440 --> 46:26:30,320
ca scânteie sau dak pentru a analiza datele

61983
46:26:28,000 --> 46:26:32,240
peste mai multe noduri. Acest lucru ajută în

61984
46:26:30,320 --> 46:26:34,640
extinderea operațiunilor dvs. de analiză la

61985
46:26:32,240 --> 46:26:36,160
gestionează eficient seturi mari de date. Şi

61986
46:26:34,640 --> 46:26:38,160
acum vom trece la cea bazată pe cloud

61987
46:26:36,160 --> 46:26:40,560
instrumente analitice. Deci luați în considerare utilizarea

61988
46:26:38,160 --> 46:26:42,880
servicii cloud precum Google BigQuery sau

61989
46:26:40,560 --> 46:26:45,024
AWS Red Shift care sunt concepute pentru

61990
46:26:42,880 --> 46:26:47,360
gestionează seturi de date masive și complexe

61991
46:26:45,024 --> 46:26:48,880
analitice cu ușurință. Și după acest pas

61992
46:26:47,360 --> 46:26:50,800
vom trece la curățarea datelor și

61993
46:26:48,880 --> 46:26:52,960
preprocesare. Aici vom automatiza

61994
46:26:50,800 --> 46:26:55,744
sarcina de preprocesare. Vom folosi automat

61995
46:26:52,960 --> 46:26:57,664
instrumente pentru curățarea și preprocesarea datelor.

61996
46:26:55,744 --> 46:27:00,080
Aceasta include gestionarea valorilor lipsă,

61997
46:26:57,664 --> 46:27:01,840
normalizarea datelor și eliminarea duplicatelor

61998
46:27:00,080 --> 46:27:03,600
ceea ce poate fi deosebit de provocator

61999
46:27:01,840 --> 46:27:05,520
cu un set mare de date. Și după aceasta

62000
46:27:03,600 --> 46:27:08,384
pas, vom trece la pasul care va

62001
46:27:05,520 --> 46:27:10,384
vizualizați un set mare de date. Deci vom folosi

62002
46:27:08,384 --> 46:27:12,720
instrumente specializate. Aceste instrumente ar putea fi

62003
46:27:10,384 --> 46:27:15,200
Tableau sau PowerBI care poate gestiona mari dimensiuni

62004
46:27:12,720 --> 46:27:18,080
set de date prin agregarea datelor și utilizarea

62005
46:27:15,200 --> 46:27:20,160
tehnologii backend eficiente. Pentru mai mult

62006
46:27:18,080 --> 46:27:22,240
explorare detaliată, instrumente precum complot

62007
46:27:20,160 --> 46:27:24,464
sau buchetul poate fi folosit așa cum oferă

62008
46:27:22,240 --> 46:27:26,720
capabilități de vizualizare interactivă

62009
46:27:24,464 --> 46:27:28,080
volume mari de date. Și după aceea,

62010
46:27:26,720 --> 46:27:30,384
ar fi pas pentru regulat

62011
46:27:28,080 --> 46:27:32,720
întreținere și actualizări. Asta ar putea fi

62012
46:27:30,384 --> 46:27:35,104
monitorizarea continuă a datelor

62013
46:27:32,720 --> 46:27:37,440
calitate. Pe măsură ce apar date noi, puteți

62014
46:27:35,104 --> 46:27:39,920
monitorizează continuu calitatea acestuia. Şi

62015
46:27:37,440 --> 46:27:41,920
după acest pas, le-ați putea integra pe toate

62016
46:27:39,920 --> 46:27:43,920
aceste strategii și instrumente în dvs

62017
46:27:41,920 --> 46:27:45,920
fluxul de lucru. Și poți gestiona eficient

62018
46:27:43,920 --> 46:27:48,240
și extrageți informații valoroase din

62019
46:27:45,920 --> 46:27:50,880
prin aceasta seturi de date extrem de mari

62020
46:27:48,240 --> 46:27:52,960
susține o decizie solidă bazată pe date

62021
46:27:50,880 --> 46:27:55,024
realizarea. Și ai putea răspunde la întreg

62022
46:27:52,960 --> 46:27:56,464
strategie pentru intervievator. Acum în mișcare

62023
46:27:55,024 --> 46:27:58,000
la întrebarea numărul opt adică

62024
46:27:56,464 --> 46:28:00,160
bazat pe optimizarea învățării automate

62025
46:27:58,000 --> 46:28:01,744
modele și întrebarea este în timpul modelului

62026
46:28:00,160 --> 46:28:02,800
dezvoltare ați observat că dvs

62027
46:28:01,744 --> 46:28:04,560
modelul de învățare automată este

62028
46:28:02,800 --> 46:28:06,384
subperformant. Ce pași ai face

62029
46:28:04,560 --> 46:28:08,560
luați pentru a diagnostica problema și

62030
46:28:06,384 --> 46:28:10,464
optimizarea performanței modelului? Ce

62031
46:28:08,560 --> 46:28:12,560
tehnici și instrumente ai folosi? Deci

62032
46:28:10,464 --> 46:28:14,960
puteți răspunde la asta începând cu

62033
46:28:12,560 --> 46:28:17,104
optimizarea și optimizarea unei mașini

62034
46:28:14,960 --> 46:28:19,200
model de învățare care este slab performant

62035
46:28:17,104 --> 46:28:21,440
presupune mai multe etape de diagnosticare şi

62036
46:28:19,200 --> 46:28:23,360
îmbunătățirea acurateței și eficienței acestuia. Şi

62037
46:28:21,440 --> 46:28:25,200
aici vom avea o abordare structurată a

62038
46:28:23,360 --> 46:28:27,104
abordează această problemă și poți începe

62039
46:28:25,200 --> 46:28:29,664
asta cu pasul numărul unu care este

62040
46:28:27,104 --> 46:28:31,840
diagnosticarea problemei. Evaluați modelul

62041
46:28:29,664 --> 46:28:33,920
metrici. Începeți prin a evalua temeinic

62042
46:28:31,840 --> 46:28:35,664
valorile de performanță ale modelului dvs.

62043
46:28:33,920 --> 46:28:37,840
Pentru sarcina de clasificare, pentru

62044
46:28:35,664 --> 46:28:40,464
sarcină de clasificare, uitați-vă la precizie,

62045
46:28:37,840 --> 46:28:42,960
precizie, reamintire și scorul F1. Pentru

62046
46:28:40,464 --> 46:28:45,280
sarcină de regresie, luați în considerare R squ, medie

62047
46:28:42,960 --> 46:28:48,080
eroare pătrată care este MSE și medie

62048
46:28:45,280 --> 46:28:50,160
eroare absolută care este MA. Și apoi tu

62049
46:28:48,080 --> 46:28:52,560
poate trece la pasul următor care este utilizarea

62050
46:28:50,160 --> 46:28:54,880
grafice precum curbele ROC pentru clasificare

62051
46:28:52,560 --> 46:28:57,104
modele și diagrame reziduale pentru regresie

62052
46:28:54,880 --> 46:28:58,960
a evalua vizual cu modelul este

62053
46:28:57,104 --> 46:29:00,880
merge prost. După aceea, vom trece la

62054
46:28:58,960 --> 46:29:03,440
următorul pas care este calitatea datelor și

62055
46:29:00,880 --> 46:29:05,664
verificarea cantitatii. Inspectați datele care sunt

62056
46:29:03,440 --> 46:29:08,080
uneori calitatea și cantitatea de

62057
46:29:05,664 --> 46:29:10,160
datele pot fi cauza principală a modelului slab

62058
46:29:08,080 --> 46:29:12,240
performanta. Asigurați-vă că datele sunt curate,

62059
46:29:10,160 --> 46:29:14,720
bine preprocesat și suficient. Uite

62060
46:29:12,240 --> 46:29:17,280
pentru probleme precum valori lipsă, valori aberante

62061
46:29:14,720 --> 46:29:19,104
sau clase dezechilibrate. Și după aceasta

62062
46:29:17,280 --> 46:29:21,024
vom trece la ingineria caracteristicilor

62063
46:29:19,104 --> 46:29:23,360
pas cu care ar fi experimentat

62064
46:29:21,024 --> 46:29:25,024
crearea de noi caracteristici sau transformarea

62065
46:29:23,360 --> 46:29:27,104
cele existente pentru a oferi mai bine

62066
46:29:25,024 --> 46:29:28,960
putere predictivă. Și apoi avem

62067
46:29:27,104 --> 46:29:30,464
următorul pas care este reglarea modelului și

62068
46:29:28,960 --> 46:29:32,080
configurație. După caracteristică

62069
46:29:30,464 --> 46:29:34,320
inginerie, vom trece la pasul următor

62070
46:29:32,080 --> 46:29:36,464
adică reglarea și configurarea modelului.

62071
46:29:34,320 --> 46:29:38,240
Deci, reglare hiperparametrică. Utilizați

62072
46:29:36,464 --> 46:29:40,000
tehnici precum căutarea în grilă sau aleatoriu

62073
46:29:38,240 --> 46:29:41,840
caută pentru a găsi setările optime pentru

62074
46:29:40,000 --> 46:29:44,240
parametrii modelului dvs. Instrumente ca

62075
46:29:41,840 --> 46:29:46,720
scikit invata, grila cauta CV sau

62076
46:29:44,240 --> 46:29:49,024
CV-ul de căutare aleatorie poate automatiza acest lucru

62077
46:29:46,720 --> 46:29:51,200
proces. Și există o validare încrucișată

62078
46:29:49,024 --> 46:29:53,024
care ar implementa validarea încrucișată pentru

62079
46:29:51,200 --> 46:29:55,200
asigurați-vă că performanța modelului este

62080
46:29:53,024 --> 46:29:57,024
consecventă în diferite subseturi de

62081
46:29:55,200 --> 46:29:59,440
setul de date. Și apoi avem următorul

62082
46:29:57,024 --> 46:30:01,440
pas care este încercarea diferitelor modele. Deci

62083
46:29:59,440 --> 46:30:03,520
experimentați cu algoritmi aici. Dacă

62084
46:30:01,440 --> 46:30:05,024
modelele inițiale sunt subperformante, încercați

62085
46:30:03,520 --> 46:30:07,200
diferiți algoritmi care ar putea fi

62086
46:30:05,024 --> 46:30:09,104
mai potrivit pentru problema. Pentru

62087
46:30:07,200 --> 46:30:11,360
de exemplu, dacă ați început cu liniar

62088
46:30:09,104 --> 46:30:13,600
regresie și nu funcționează bine,

62089
46:30:11,360 --> 46:30:16,560
luați în considerare modele mai complexe precum aleatorii

62090
46:30:13,600 --> 46:30:18,560
mașini de creștere a pădurii sau a pantelor.

62091
46:30:16,560 --> 46:30:21,200
Și după aceasta, avem metode nseml

62092
46:30:18,560 --> 46:30:23,440
că putem folosi tehnici precum ambalarea,

62093
46:30:21,200 --> 46:30:25,200
amplificarea sau stivuirea pentru a combina

62094
46:30:23,440 --> 46:30:27,520
predicții ale mai multor modele la

62095
46:30:25,200 --> 46:30:29,520
îmbunătăți performanța generală. După aceasta

62096
46:30:27,520 --> 46:30:32,560
pas, avem o selecție de caracteristici care

62097
46:30:29,520 --> 46:30:34,160
include reducerea dimensionalității. Utilizați

62098
46:30:32,560 --> 46:30:36,160
tehnici precum componenta principală

62099
46:30:34,160 --> 46:30:38,000
analiză care este PCA pentru a reduce

62100
46:30:36,160 --> 46:30:39,920
număr de caracteristici care ar putea ajuta

62101
46:30:38,000 --> 46:30:42,384
îmbunătățirea performanței modelului prin eliminare

62102
46:30:39,920 --> 46:30:44,720
zgomot și redundanță. Și apoi avem

62103
46:30:42,384 --> 46:30:46,464
selectați caracteristicile importante. Așa că folosește modelul

62104
46:30:44,720 --> 46:30:48,240
tehnică bazată pe identificarea și păstrarea

62105
46:30:46,464 --> 46:30:50,720
doar cele mai importante caracteristici care

62106
46:30:48,240 --> 46:30:52,720
impact asupra rezultatului. Și apoi vine

62107
46:30:50,720 --> 46:30:54,960
ultimul pas care este actualizările regulate și

62108
46:30:52,720 --> 46:30:56,960
recalificare. Deci aici puteți monitoriza și

62109
46:30:54,960 --> 46:30:58,800
actualizare care ar putea fi în mod continuu

62110
46:30:56,960 --> 46:31:00,880
monitorizarea performanței modelului peste

62111
46:30:58,800 --> 46:31:03,200
timp pe măsură ce noi date devin disponibile

62112
46:31:00,880 --> 46:31:06,000
actualizați și reantrenați modelul pentru a se adapta

62113
46:31:03,200 --> 46:31:07,920
orice modificări ale tiparelor de bază și

62114
46:31:06,000 --> 46:31:09,520
dupa aceea ai putea avea o consultatie

62115
46:31:07,920 --> 46:31:11,664
și munca de colaborare cu celălalt

62116
46:31:09,520 --> 46:31:13,840
echipe şi prin abordarea metodică

62117
46:31:11,664 --> 46:31:15,200
fiecare dintre aceste zone puteți diagnostica de ce

62118
46:31:13,840 --> 46:31:17,360
modelul dvs. de învățare automată este

62119
46:31:15,200 --> 46:31:19,920
subperformanță și poate lua măsuri pentru

62120
46:31:17,360 --> 46:31:21,200
să-i optimizeze acuratețea și eficiența. Aşa

62121
46:31:19,920 --> 46:31:22,640
totul a fost vorba despre numărul întrebării

62122
46:31:21,200 --> 46:31:24,560
opt. Deci, să începem cu întrebarea

62123
46:31:22,640 --> 46:31:26,800
numărul nouă și acesta se bazează pe

62124
46:31:24,560 --> 46:31:28,720
manipularea datelor nestructurate. Deci

62125
46:31:26,800 --> 46:31:30,960
întrebarea este că vi se oferă o sumă mare

62126
46:31:28,720 --> 46:31:33,744
de date nestructurate, inclusiv text,

62127
46:31:30,960 --> 46:31:35,920
imagini și videoclipuri. Ce strategii ar fi

62128
46:31:33,744 --> 46:31:38,160
utilizați pentru a gestiona și analiza acest tip

62129
46:31:35,920 --> 46:31:40,160
a datelor în mod eficient? Descrieți instrumentele

62130
46:31:38,160 --> 46:31:42,800
și tehnicile pe care le puteți folosi. Deci tu

62131
46:31:40,160 --> 46:31:44,160
pot începe să răspundă la această întrebare până la

62132
46:31:42,800 --> 46:31:46,240
descriind acea confruntare cu

62133
46:31:44,160 --> 46:31:48,160
datele nestructurate pot fi provocatoare din cauza

62134
46:31:46,240 --> 46:31:49,920
la lipsa acestuia de format predefinit sau

62135
46:31:48,160 --> 46:31:51,664
structura. Cu toate acestea, cu dreapta

62136
46:31:49,920 --> 46:31:54,080
strategii și instrumente, puteți

62137
46:31:51,664 --> 46:31:56,160
să o gestioneze și să o analizeze eficient

62138
46:31:54,080 --> 46:31:58,800
extrage perspective valoroase și acolo va

62139
46:31:56,160 --> 46:32:00,560
fii o abordare a modului în care poți face asta. Deci,

62140
46:31:58,800 --> 46:32:02,560
despre abordare vom discuta aici și

62141
46:32:00,560 --> 46:32:04,960
incepand cu pasii. Deci, numărul

62142
46:32:02,560 --> 46:32:08,240
un pas va fi categorizarea datelor și

62143
46:32:04,960 --> 46:32:11,280
organizare. Deci, pasul numărul unu

62144
46:32:08,240 --> 46:32:13,440
acest pas va fi sortarea și etichetarea.

62145
46:32:11,280 --> 46:32:16,320
Vom începe prin a clasifica datele

62146
46:32:13,440 --> 46:32:19,520
în tipuri care vor fi text, imagini sau

62147
46:32:16,320 --> 46:32:21,360
videoclipuri. Utilizați etichetarea pentru a adăuga metadate

62148
46:32:19,520 --> 46:32:23,280
care ajută la organizarea datelor și

62149
46:32:21,360 --> 46:32:25,744
facilitează accesul și analiza

62150
46:32:23,280 --> 46:32:28,240
mai târziu. Apoi și după aceea mai ales

62151
46:32:25,744 --> 46:32:30,880
pentru datele text vom folosi limbajul natural

62152
46:32:28,240 --> 46:32:32,720
procesarea NLP. Vom folosi NLP

62153
46:32:30,880 --> 46:32:36,720
tehnici de extragere a informațiilor utile

62154
46:32:32,720 --> 46:32:38,880
din text. Instrumente precum NLTK, spacy sau

62155
46:32:36,720 --> 46:32:40,800
chiar și modele mai avansate precum BERT pot

62156
46:32:38,880 --> 46:32:43,664
vă ajută să îndepliniți sarcini precum sentimentul

62157
46:32:40,800 --> 46:32:46,080
analiză, recunoaștere a entității și subiect

62158
46:32:43,664 --> 46:32:48,880
modelare. După aceea, vom scrie text

62159
46:32:46,080 --> 46:32:51,360
indexarea. Putem folosi căutarea elastică sau

62160
46:32:48,880 --> 46:32:53,104
Apache sle pentru a indexa volume mari de

62161
46:32:51,360 --> 46:32:55,024
text. Aceste instrumente oferă puternice

62162
46:32:53,104 --> 46:32:57,280
capabilități de căutare și poate gestiona

62163
46:32:55,024 --> 46:32:59,200
interogări complexe în mod eficient. Și după

62164
46:32:57,280 --> 46:33:01,200
că vom trece la datele de imagine. Și să

62165
46:32:59,200 --> 46:33:03,200
structura datelor de imagine vom folosi imaginea

62166
46:33:01,200 --> 46:33:05,664
prelucrare. Vom folosi biblioteci ca

62167
46:33:03,200 --> 46:33:07,840
OpenCV pentru sarcini de bază de procesare a imaginilor

62168
46:33:05,664 --> 46:33:09,744
precum filtrarea și transformările.

62169
46:33:07,840 --> 46:33:11,840
Pentru o analiză mai avansată a imaginii,

62170
46:33:09,744 --> 46:33:14,160
luați în considerare modele de învățare profundă folosind

62171
46:33:11,840 --> 46:33:16,320
cadre precum TensorFlow sau PyTorch.

62172
46:33:14,160 --> 46:33:18,000
Și apoi vom prezenta extracția. Aplicați

62173
46:33:16,320 --> 46:33:20,640
tehnici de extragere a caracteristicilor din

62174
46:33:18,000 --> 46:33:22,560
imagini precum margini, texturi sau cheie

62175
46:33:20,640 --> 46:33:24,880
puncte care pot fi folosite pentru mai departe

62176
46:33:22,560 --> 46:33:26,880
analiză sau învățare automată. Și apoi

62177
46:33:24,880 --> 46:33:28,640
vom ajunge la datele video. Și aici vom face

62178
46:33:26,880 --> 46:33:31,024
face procesare video. și vom folosi

62179
46:33:28,640 --> 46:33:33,024
instrumente precum fmpg care pot fi folosite pentru

62180
46:33:31,024 --> 46:33:35,744
sarcini de procesare video de bază, cum ar fi

62181
46:33:33,024 --> 46:33:37,920
conversia formatului sau extragerea cadrelor

62182
46:33:35,744 --> 46:33:39,360
pentru analiza conținutului video uitați-vă la

62183
46:33:37,920 --> 46:33:41,920
modele de învățare automată care pot

62184
46:33:39,360 --> 46:33:43,920
clasifica sau recunoaște activitățile din

62185
46:33:41,920 --> 46:33:46,640
video și după aceasta vom trece la

62186
46:33:43,920 --> 46:33:48,880
analiza temporală pentru videoclipuri temporale

62187
46:33:46,640 --> 46:33:50,720
componentele sunt tehnici importante precum

62188
46:33:48,880 --> 46:33:53,440
modelarea secvenței sau neuronale recurente

62189
46:33:50,720 --> 46:33:56,320
rețelele RNN-urile pot fi utile pentru a analiza

62190
46:33:53,440 --> 46:33:58,240
secvenţe de cadre pentru activităţi sau

62191
46:33:56,320 --> 46:34:00,464
evenimente și apoi vom trece la date

62192
46:33:58,240 --> 46:34:02,384
depozitare și gestionare. Aici vom folosi

62193
46:34:00,464 --> 46:34:04,320
volumul și complexitatea date de

62194
46:34:02,384 --> 46:34:06,464
date nestructurate și folosiți date mari

62195
46:34:04,320 --> 46:34:09,280
platforme precum Hadoop sau servicii cloud

62196
46:34:06,464 --> 46:34:11,440
ca AWS S3 pentru stocare. Aceste platforme

62197
46:34:09,280 --> 46:34:13,104
poate scala pentru a gestiona dimensiuni mari de date

62198
46:34:11,440 --> 46:34:14,960
și să asigure infrastructura necesară

62199
46:34:13,104 --> 46:34:16,464
pentru a stoca și a prelua date nestructurate

62200
46:34:14,960 --> 46:34:18,384
eficient. Și apoi avem

62201
46:34:16,464 --> 46:34:20,560
vizualizare și raportare personalizată

62202
46:34:18,384 --> 46:34:22,240
tablouri de bord pe care le vom crea aici. Noi

62203
46:34:20,560 --> 46:34:24,560
va dezvolta tablouri de bord personalizate folosind

62204
46:34:22,240 --> 46:34:25,920
instrumente precum Tableau sau PowerBI care pot

62205
46:34:24,560 --> 46:34:27,840
integrează diferite tipuri de date și

62206
46:34:25,920 --> 46:34:29,520
oferă o viziune unificată asupra celor analizate

62207
46:34:27,840 --> 46:34:31,200
date. Și după aceea vom face date

62208
46:34:29,520 --> 46:34:33,200
rezumare. Instrumente care oferă

62209
46:34:31,200 --> 46:34:34,464
capabilitățile de rezumat pot ajuta în

62210
46:34:33,200 --> 46:34:36,720
având în vedere volume mari de

62211
46:34:34,464 --> 46:34:39,360
date nestructurate în mai ușor de gestionat

62212
46:34:36,720 --> 46:34:41,024
și forme interpretabile. Și după aceea

62213
46:34:39,360 --> 46:34:43,280
vom valorifica aceste strategii și

62214
46:34:41,024 --> 46:34:45,104
instrumente și poate gestiona eficient,

62215
46:34:43,280 --> 46:34:47,104
analizați și obțineți perspective din

62216
46:34:45,104 --> 46:34:49,024
date nestructurate care pot fi cruciale

62217
46:34:47,104 --> 46:34:51,200
pentru luarea deciziilor informate în diverse

62218
46:34:49,024 --> 46:34:53,360
aplicatii. Și aceasta este calea care

62219
46:34:51,200 --> 46:34:55,600
puteți explora și explica

62220
46:34:53,360 --> 46:34:57,360
intervievatorul dacă această întrebare a fost

62221
46:34:55,600 --> 46:34:59,744
a întrebat. Acum trecem la numărul întrebării

62222
46:34:57,360 --> 46:35:01,920
10 și asta se va baza pe scalarea AI

62223
46:34:59,744 --> 46:35:04,240
soluții în întreprindere și întrebarea

62224
46:35:01,920 --> 46:35:06,240
este compania ta vrea să-și extindă AI

62225
46:35:04,240 --> 46:35:07,664
operațiuni de la câțiva pilot inițial

62226
46:35:06,240 --> 46:35:09,440
proiecte la nivel de întreprindere

62227
46:35:07,664 --> 46:35:11,520
implementare. Care sunt cheia

62228
46:35:09,440 --> 46:35:13,664
considerații și pași pe care i-ați lua

62229
46:35:11,520 --> 46:35:15,920
pentru a asigura scalarea cu succes a AI

62230
46:35:13,664 --> 46:35:17,664
soluții în întreaga organizație și

62231
46:35:15,920 --> 46:35:19,360
ce provocări te-ai putea confrunta și cum

62232
46:35:17,664 --> 46:35:21,360
le-ai adresa? Deci poți începe

62233
46:35:19,360 --> 46:35:23,744
răspunzând la această întrebare cu scalarea

62234
46:35:21,360 --> 46:35:25,520
Soluții AI. Ai putea să-i răspunzi asta

62235
46:35:23,744 --> 46:35:27,744
scalarea soluțiilor AI într-un

62236
46:35:25,520 --> 46:35:29,840
întreprinderea necesită o planificare atentă şi

62237
46:35:27,744 --> 46:35:32,080
implementarea strategică pentru a asigura

62238
46:35:29,840 --> 46:35:33,840
succes și aliniere la afaceri

62239
46:35:32,080 --> 46:35:36,960
obiective și ar trebui să existe a

62240
46:35:33,840 --> 46:35:38,720
abordare strategică pentru implementarea acestui lucru. Deci

62241
46:35:36,960 --> 46:35:40,800
începând cu abordarea şi cel

62242
46:35:38,720 --> 46:35:43,024
primul pas va fi asta va fi

62243
46:35:40,800 --> 46:35:45,200
aliniere strategică. Deci identificați

62244
46:35:43,024 --> 46:35:46,720
obiectivele de afaceri. Începe prin

62245
46:35:45,200 --> 46:35:48,800
identificarea obiectivelor de afaceri care

62246
46:35:46,720 --> 46:35:50,960
soluțiile AI sunt destinate

62247
46:35:48,800 --> 46:35:52,720
sprijin. Acest lucru asigură că AI

62248
46:35:50,960 --> 46:35:54,720
inițiativele sunt aliniate cu compania

62249
46:35:52,720 --> 46:35:57,104
obiective strategice și poate demonstra

62250
46:35:54,720 --> 46:35:59,360
valoare comercială clară. Și apoi vine

62251
46:35:57,104 --> 46:36:01,360
implicarea părților interesate. Deci angajați-vă

62252
46:35:59,360 --> 46:36:03,840
părți interesate din diferite departamente

62253
46:36:01,360 --> 46:36:05,440
la începutul procesului pentru a aduna input și

62254
46:36:03,840 --> 46:36:08,000
construi suport. Acest lucru ajută în

62255
46:36:05,440 --> 46:36:10,464
înţelegerea nevoilor diverse şi asigură

62256
46:36:08,000 --> 46:36:12,160
acceptare mai largă a soluțiilor AI.

62257
46:36:10,464 --> 46:36:14,464
Și după aceea vine infrastructura

62258
46:36:12,160 --> 46:36:16,080
și tehnologie. Deci există o opțiune

62259
46:36:14,464 --> 46:36:18,000
adică evaluarea și actualizarea

62260
46:36:16,080 --> 46:36:20,160
infrastructura. Evaluați dacă dvs

62261
46:36:18,000 --> 46:36:22,464
infrastructura IT actuală poate suporta

62262
46:36:20,160 --> 46:36:24,640
utilizarea extinsă a AI. S-ar putea să ai nevoie

62263
46:36:22,464 --> 46:36:26,720
pentru a face upgrade hardware, investiți în cloud

62264
46:36:24,640 --> 46:36:28,880
soluţii sau adoptă tehnologii care

62265
46:36:26,720 --> 46:36:30,800
facilitează procesarea și datele AI

62266
46:36:28,880 --> 46:36:32,880
manipulare. Și după aceea avem

62267
46:36:30,800 --> 46:36:34,960
standardizarea instrumentelor. Standardizați

62268
46:36:32,880 --> 46:36:37,200
instrumentele și platformele utilizate pentru IA

62269
46:36:34,960 --> 46:36:38,640
dezvoltare pentru a asigura compatibilitatea şi

62270
46:36:37,200 --> 46:36:40,640
ușurința de întreținere în întreaga

62271
46:36:38,640 --> 46:36:42,960
organizatii. Și după aceea ne vom muta

62272
46:36:40,640 --> 46:36:45,024
la managementul datelor. Date atât de solide

62273
46:36:42,960 --> 46:36:46,640
guvernare care este de a implementa o puternică

62274
46:36:45,024 --> 46:36:48,320
cadru de guvernare a datelor de gestionat

62275
46:36:46,640 --> 46:36:50,240
datele întreprinderii în mod eficient. Acest

62276
46:36:48,320 --> 46:36:52,384
include politici pentru calitatea datelor,

62277
46:36:50,240 --> 46:36:54,320
securitate și conformitate în special

62278
46:36:52,384 --> 46:36:56,160
important atunci când scalați soluții AI care

62279
46:36:54,320 --> 46:36:58,240
se bazează pe cantități mari de date. Și după

62280
46:36:56,160 --> 46:37:00,160
că vom ajunge la accesibilitatea datelor.

62281
46:36:58,240 --> 46:37:02,960
Prin urmare, asigurați-vă că datele sunt accesibile peste tot

62282
46:37:00,160 --> 46:37:04,800
organizaţiei dar şi sigur împotriva

62283
46:37:02,960 --> 46:37:06,640
acces neautorizat. Aceasta implică

62284
46:37:04,800 --> 46:37:08,800
stabilirea scurgerilor de date securizate sau

62285
46:37:06,640 --> 46:37:11,024
depozite care centralizează datele în timp ce

62286
46:37:08,800 --> 46:37:13,200
permițând accesul controlat. Și apoi noi

62287
46:37:11,024 --> 46:37:16,080
treci la pasul următor care este talentul și

62288
46:37:13,200 --> 46:37:18,320
antrenament. Deci, construiește competența AI, adică

62289
46:37:16,080 --> 46:37:20,464
dezvoltați expertiza AI internă prin

62290
46:37:18,320 --> 46:37:22,160
programe de formare și angajare. Deci asta

62291
46:37:20,464 --> 46:37:24,160
construi abilitățile necesare în cadrul

62292
46:37:22,160 --> 46:37:26,640
organizaţie pentru a dezvolta, gestiona şi

62293
46:37:24,160 --> 46:37:28,640
scala soluții AI și după aceea tu

62294
46:37:26,640 --> 46:37:30,960
poate efectua, de asemenea, IA interfuncțională

62295
46:37:28,640 --> 46:37:32,560
echipe care ar putea forma cruce

62296
46:37:30,960 --> 46:37:34,640
echipe funcționale care includ date

62297
46:37:32,560 --> 46:37:36,800
oameni de știință, profesioniști IT și domeniu

62298
46:37:34,640 --> 46:37:38,464
experți. Deci acest lucru favorizează colaborarea

62299
46:37:36,800 --> 46:37:39,744
și asigurați-vă că soluțiile AI sunt

62300
46:37:38,464 --> 46:37:41,840
dezvoltat cu o cuprinzătoare

62301
46:37:39,744 --> 46:37:43,744
înţelegere. Și după formarea acestora

62302
46:37:41,840 --> 46:37:46,320
echipe colaborative, trecem la scalabil

62303
46:37:43,744 --> 46:37:48,640
modele de implementare. Deci test pilot și

62304
46:37:46,320 --> 46:37:51,600
lansare în fază. Înainte de o scară completă

62305
46:37:48,640 --> 46:37:53,360
lansare, efectuați un test pilot pentru a trece la AI

62306
46:37:51,600 --> 46:37:56,384
eficacitatea soluției și integrarea

62307
46:37:53,360 --> 46:37:58,240
capabilități bazate pe feedback, ajustați

62308
46:37:56,384 --> 46:38:00,240
și apoi implementați treptat soluțiile

62309
46:37:58,240 --> 46:38:02,960
intreaga organizatie. Și apoi noi

62310
46:38:00,240 --> 46:38:05,024
au un design modular și flexibil. Deci

62311
46:38:02,960 --> 46:38:07,440
proiectați sistemele AI să fie modulare și

62312
46:38:05,024 --> 46:38:09,920
scalabil permiţând ajustări şi

62313
46:38:07,440 --> 46:38:11,600
extinderi ca nevoi și apoi vom face

62314
46:38:09,920 --> 46:38:13,024
monitorizați și faceți continuu

62315
46:38:11,600 --> 46:38:14,960
imbunatatire. Deci va exista

62316
46:38:13,024 --> 46:38:16,800
metrici de performanță care ar stabili

62317
46:38:14,960 --> 46:38:18,720
metrici pentru a evalua în mod regulat

62318
46:38:16,800 --> 46:38:21,104
performanța sistemelor AI. Vom face

62319
46:38:18,720 --> 46:38:23,360
monitorizați aceste sisteme pentru a vă asigura că sunt îndeplinite

62320
46:38:21,104 --> 46:38:25,520
rezultatele așteptate și adaptați ca

62321
46:38:23,360 --> 46:38:28,080
necesar. Și după aceea avem următorul

62322
46:38:25,520 --> 46:38:30,640
pas care abordează provocările. Deci

62323
46:38:28,080 --> 46:38:32,800
ar putea exista rezistenţă culturală care

62324
46:38:30,640 --> 46:38:34,880
ar putea fi angajați care ar fi

62325
46:38:32,800 --> 46:38:36,240
rezistând schimbărilor, dar trebuie

62326
46:38:34,880 --> 46:38:38,464
abordați acest lucru prin continuu

62327
46:38:36,240 --> 46:38:41,360
educație și prin prezentarea succesului

62328
46:38:38,464 --> 46:38:42,960
Cazuri de utilizare a AI în cadrul organizațiilor

62329
46:38:41,360 --> 46:38:45,280
și luând în considerare cu atenție acestea

62330
46:38:42,960 --> 46:38:47,104
aspecte şi implementarea metodică

62331
46:38:45,280 --> 46:38:49,200
pași pe care îi puteți scala cu succes AI

62332
46:38:47,104 --> 46:38:50,800
soluții în conducerea întreprinderii dvs

62333
46:38:49,200 --> 46:38:53,664
valoare comercială semnificativă și

62334
46:38:50,800 --> 46:38:55,280
inovare. Și asta e tot pentru întrebare

62335
46:38:53,664 --> 46:38:57,600
numărul 10. Acum trecem la întrebare

62336
46:38:55,280 --> 46:38:59,840
numărul 11 și care se bazează pe etică

62337
46:38:57,600 --> 46:39:01,200
considerații în știința datelor. Deci

62338
46:38:59,840 --> 46:39:03,440
întrebarea este în știința datelor dvs

62339
46:39:01,200 --> 46:39:05,520
proiecte cum vă asigurați că etica

62340
46:39:03,440 --> 46:39:07,360
sunt abordate considerente? Descrie

62341
46:39:05,520 --> 46:39:09,600
pașii pe care îi parcurgeți pentru a identifica și

62342
46:39:07,360 --> 46:39:11,440
atenuați riscul etic în proiectele dvs.

62343
46:39:09,600 --> 46:39:13,360
Ce cadre sau linii directoare faci

62344
46:39:11,440 --> 46:39:14,464
urmează? Deci ai putea începe să răspunzi

62345
46:39:13,360 --> 46:39:16,640
această întrebare cu etică

62346
46:39:14,464 --> 46:39:17,920
considerații în care sunt cruciale

62347
46:39:16,640 --> 46:39:20,464
știința datelor pentru a se asigura că

62348
46:39:17,920 --> 46:39:23,104
soluțiile și analizele nu

62349
46:39:20,464 --> 46:39:25,360
în mod evident să provoace rău sau părtinire. Iată

62350
46:39:23,104 --> 46:39:27,664
cum vă puteți asigura că. Deci există

62351
46:39:25,360 --> 46:39:30,160
câțiva pași și îi vom discuta

62352
46:39:27,664 --> 46:39:32,800
trepte. Începând cu numărul unu care

62353
46:39:30,160 --> 46:39:34,560
este educarea cu privire la standarde etice. Deci stai

62354
46:39:32,800 --> 46:39:36,464
informat despre standardele etice în

62355
46:39:34,560 --> 46:39:38,464
știința datelor, cum ar fi corectitudinea,

62356
46:39:36,464 --> 46:39:40,560
responsabilitate, transparență și

62357
46:39:38,464 --> 46:39:42,720
intimitate. Organizațiilor le plac datele

62358
46:39:40,560 --> 46:39:44,960
asociația științifică și ACM au

62359
46:39:42,720 --> 46:39:46,800
coduri de etică la care ne referim ca

62360
46:39:44,960 --> 46:39:48,960
linii directoare. Și apoi avem etica

62361
46:39:46,800 --> 46:39:50,800
evaluarea riscurilor. Identificați potențialul

62362
46:39:48,960 --> 46:39:52,560
probleme etice. Asta ar fi la

62363
46:39:50,800 --> 46:39:54,800
începutul fiecărui proiect. Conduita a

62364
46:39:52,560 --> 46:39:57,440
evaluare amănunțită pentru a identifica orice

62365
46:39:54,800 --> 46:40:00,320
riscul etic potențial, cum ar fi părtinirile în

62366
46:39:57,440 --> 46:40:02,000
date sau impact asupra grupurilor vulnerabile.

62367
46:40:00,320 --> 46:40:04,560
Aceasta implică revizuirea sursei de

62368
46:40:02,000 --> 46:40:06,640
date, metodologiile utilizate pentru date

62369
46:40:04,560 --> 46:40:09,440
colectarea și utilizarea prevăzută a

62370
46:40:06,640 --> 46:40:11,744
rezultatele analizei datelor. Și apoi avem

62371
46:40:09,440 --> 46:40:13,744
analiza părților interesate. Implică-te cu

62372
46:40:11,744 --> 46:40:16,240
părțile interesate să înțeleagă diversitatea

62373
46:40:13,744 --> 46:40:18,384
perspectivele și impactul potențial al

62374
46:40:16,240 --> 46:40:20,880
proiect. Acest lucru ajută la identificare

62375
46:40:18,384 --> 46:40:23,440
probleme etice care pot să nu fie evidente

62376
46:40:20,880 --> 46:40:24,800
din punct de vedere pur tehnic. Şi

62377
46:40:23,440 --> 46:40:27,360
apoi vom trece la atenuare

62378
46:40:24,800 --> 46:40:29,744
strategii. Implementarea atenuării prejudecăților

62379
46:40:27,360 --> 46:40:31,360
tehnici. Vom folosi statistici și

62380
46:40:29,744 --> 46:40:34,160
tehnici de învățare automată pentru a detecta

62381
46:40:31,360 --> 46:40:35,920
și atenuarea prejudecăților în date. Acest lucru ar putea

62382
46:40:34,160 --> 46:40:38,320
implică tehnici precum reeșantionarea,

62383
46:40:35,920 --> 46:40:40,464
reeing sau folosind algoritmi conceputi pentru

62384
46:40:38,320 --> 46:40:42,640
fii corect. Și atunci avem intimitate

62385
46:40:40,464 --> 46:40:44,880
metode de conservare. Folosiți astfel de metode

62386
46:40:42,640 --> 46:40:46,384
ca anonimizarea datelor, criptarea sau

62387
46:40:44,880 --> 46:40:48,464
confidențialitate diferențială de protejat

62388
46:40:46,384 --> 46:40:50,320
intimitatea individuală la analiză

62389
46:40:48,464 --> 46:40:52,384
date sensibile. Apoi avem altele

62390
46:40:50,320 --> 46:40:54,320
metode care este transparența și

62391
46:40:52,384 --> 46:40:56,720
explicabilitate. Acolo avem model

62392
46:40:54,320 --> 46:40:59,024
explicabilitatea şi după aceea venirea la

62393
46:40:56,720 --> 46:41:00,800
documentare și raportare. Deci avem

62394
46:40:59,024 --> 46:41:03,024
pentru a menține documentația minuțioasă a

62395
46:41:00,800 --> 46:41:04,800
surse de date, decizii de model și

62396
46:41:03,024 --> 46:41:06,960
metodologii. Și apoi avem

62397
46:41:04,800 --> 46:41:08,800
monitorizare continuă și feedback.

62398
46:41:06,960 --> 46:41:10,384
Acolo trebuie să monitorizezi rezultatele și

62399
46:41:08,800 --> 46:41:12,640
mecanismele de feedback ar trebui să fie

62400
46:41:10,384 --> 46:41:14,640
aplicat. Și apoi avem panourile

62401
46:41:12,640 --> 46:41:16,720
adică colaborare și consiliere

62402
46:41:14,640 --> 46:41:19,104
panouri. Apoi avem o revizuire etică

62403
46:41:16,720 --> 46:41:21,280
scânduri. Deci, pentru setarea proiectelor complexe

62404
46:41:19,104 --> 46:41:24,000
sau consultarea cu o revizuire etică

62405
46:41:21,280 --> 46:41:26,320
consiliul poate oferi supraveghere și diverse

62406
46:41:24,000 --> 46:41:28,640
perspective asupra implicaţiilor etice

62407
46:41:26,320 --> 46:41:29,920
a metodologiilor de proiect. Deci prin

62408
46:41:28,640 --> 46:41:32,080
abordarea proactivă a eticii

62409
46:41:29,920 --> 46:41:33,520
considerații prin acești pași dumneavoastră

62410
46:41:32,080 --> 46:41:35,744
vă puteți asigura că știința datelor dvs

62411
46:41:33,520 --> 46:41:38,240
proiectele respectă standarde etice înalte

62412
46:41:35,744 --> 46:41:40,560
și contribuie pozitiv la societate

62413
46:41:38,240 --> 46:41:42,240
minimizând în același timp daunele. Deci asta a fost tot

62414
46:41:40,560 --> 46:41:44,800
despre întrebarea 11. Trec acum la

62415
46:41:42,240 --> 46:41:46,560
întrebarea numărul 12 care se bazează pe timp

62416
46:41:44,800 --> 46:41:48,720
prognoză de serie pentru afaceri

62417
46:41:46,560 --> 46:41:50,960
deciziilor. Deci întrebarea numărul 12 este

62418
46:41:48,720 --> 46:41:53,440
ești însărcinat să faci prognoze lunare

62419
46:41:50,960 --> 46:41:56,384
vânzări pentru o companie de retail folosind timpul

62420
46:41:53,440 --> 46:41:58,000
serie de date din ultimii 5 ani. Ce

62421
46:41:56,384 --> 46:42:00,160
pași ai face pentru a pregăti și

62422
46:41:58,000 --> 46:42:02,160
analizați aceste date pentru a fi corecte

62423
46:42:00,160 --> 46:42:04,320
prognoza? Ce instrumente specifice sau

62424
46:42:02,160 --> 46:42:06,240
tehnici ai folosi și de ce? Deci noi

62425
46:42:04,320 --> 46:42:08,800
poate începe să răspundă la aceasta prin serii cronologice

62426
46:42:06,240 --> 46:42:10,640
prognoză și le-am putea aborda

62427
46:42:08,800 --> 46:42:12,720
că este un instrument puternic de predicție

62428
46:42:10,640 --> 46:42:14,384
evenimente viitoare bazate pe date din trecut

62429
46:42:12,720 --> 46:42:16,240
mai ales în context de afaceri cum ar fi

62430
46:42:14,384 --> 46:42:18,320
vânzări cu amănuntul. Deci vom avea o

62431
46:42:16,240 --> 46:42:20,320
abordare structurată aici și vom începe

62432
46:42:18,320 --> 46:42:22,160
cu colectarea și curățarea datelor.

62433
46:42:20,320 --> 46:42:23,664
În primul rând, veți aduna date și veți asigura

62434
46:42:22,160 --> 46:42:25,664
că ați adunat toate cele relevante

62435
46:42:23,664 --> 46:42:27,520
date inclusiv cifrele de vânzări lunare de la

62436
46:42:25,664 --> 46:42:29,600
ultimii cinci ani și, de asemenea, luând în considerare

62437
46:42:27,520 --> 46:42:31,280
inclusiv factori externi care ar putea

62438
46:42:29,600 --> 46:42:33,280
afectează vânzările, cum ar fi cele economice

62439
46:42:31,280 --> 46:42:35,200
indicatori, sărbători și promoționale

62440
46:42:33,280 --> 46:42:37,520
activități. Și apoi vom trece la

62441
46:42:35,200 --> 46:42:39,840
date curate. Vom verifica și ne vom ocupa

62442
46:42:37,520 --> 46:42:41,440
orice neconcordanțe sau valori lipsă.

62443
46:42:39,840 --> 46:42:43,280
Și apoi avem vizualizarea datelor.

62444
46:42:41,440 --> 46:42:45,440
Aici vom reprezenta datele. Vom folosi

62445
46:42:43,280 --> 46:42:47,280
plotând biblioteci precum Matt Lib sau

62446
46:42:45,440 --> 46:42:49,200
Seabbone în Python pentru a vizualiza

62447
46:42:47,280 --> 46:42:51,664
date. Acest lucru va ajuta la identificarea

62448
46:42:49,200 --> 46:42:53,840
modele, tendințe și sezonalitate. Şi

62449
46:42:51,664 --> 46:42:55,840
atunci avem descompunerea datelor. Deci

62450
46:42:53,840 --> 46:42:57,744
are loc o descompunere sezonieră și

62451
46:42:55,840 --> 46:43:00,720
vom folosi tehnici statistice pentru

62452
46:42:57,744 --> 46:43:02,640
descompuneți datele în tendințe sezonier

62453
46:43:00,720 --> 46:43:04,000
si reziduuri. Deci asta poate fi

62454
46:43:02,640 --> 46:43:06,384
realizat cu instrumente precum

62455
46:43:04,000 --> 46:43:08,384
funcția de descompunere sezonieră din

62456
46:43:06,384 --> 46:43:09,840
biblioteca de modele statistice în Python. Şi

62457
46:43:08,384 --> 46:43:12,080
vom înțelege aceste componente

62458
46:43:09,840 --> 46:43:14,880
separat și poate îmbunătăți precizia

62459
46:43:12,080 --> 46:43:17,440
a prognozei noastre. Și apoi următorul pas

62460
46:43:14,880 --> 46:43:20,560
este selecția și prognoza modelului. Deci

62461
46:43:17,440 --> 46:43:22,560
există două modele care este o ara și s

62462
46:43:20,560 --> 46:43:24,384
Modele IMA. Deci trebuie să alegem

62463
46:43:22,560 --> 46:43:26,640
modele adecvate de prognoză bazate pe

62464
46:43:24,384 --> 46:43:29,280
caracteristicile datelor. De exemplu,

62465
46:43:26,640 --> 46:43:31,360
AMA care este integrată în regim de regresie automată

62466
46:43:29,280 --> 46:43:34,880
medie mobilă. Este eficient pentru

62467
46:43:31,360 --> 46:43:37,744
date non-sezon în timp ce SMA adică

62468
46:43:34,880 --> 46:43:39,744
AMA sezonier care este potrivit pentru date

62469
46:43:37,744 --> 46:43:41,600
cu modele sezoniere. Și după

62470
46:43:39,744 --> 46:43:43,200
alegând modelul pe care ne vom muta să trecem

62471
46:43:41,600 --> 46:43:45,024
validare. Vom implementa timpul

62472
46:43:43,200 --> 46:43:47,440
validare încrucișată specifică seriei

62473
46:43:45,024 --> 46:43:49,520
tehnici precum împărțirea bazată pe timp la

62474
46:43:47,440 --> 46:43:51,744
evalua performanța modelului și aceasta va

62475
46:43:49,520 --> 46:43:53,664
asigurați-vă că modelul dvs. generalizează bine

62476
46:43:51,744 --> 46:43:55,920
date nevăzute și apoi avem model

62477
46:43:53,664 --> 46:43:58,320
montaj și diagnosticare. Ne vom potrivi cu

62478
46:43:55,920 --> 46:44:00,080
model care este prin utilizarea clasei cinemax

62479
46:43:58,320 --> 46:44:02,000
de la modele statistice care se vor potrivi cu dvs

62480
46:44:00,080 --> 46:44:04,560
model la date și apoi vom face

62481
46:44:02,000 --> 46:44:07,520
selectați cu atenție parametrii pe baza AIC

62482
46:44:04,560 --> 46:44:09,920
acesta este un criteriu de informare a tortului

62483
46:44:07,520 --> 46:44:11,600
care punctează sau o cercetare aprofundată a grilei

62484
46:44:09,920 --> 46:44:14,464
tehnica si apoi putem face

62485
46:44:11,600 --> 46:44:16,640
diagnosticare și prognoză și validare

62486
46:44:14,464 --> 46:44:19,104
iar după validarea prognozei ne vom muta

62487
46:44:16,640 --> 46:44:21,744
la îmbunătățirea iterativă. Deci există o

62488
46:44:19,104 --> 46:44:24,000
buclă de feedback care ar trebui să fie obligatorie

62489
46:44:21,744 --> 46:44:25,840
și ar trebui să existe o actualizare regulată pentru

62490
46:44:24,000 --> 46:44:28,640
modelul cu date noi de vânzări și

62491
46:44:25,840 --> 46:44:30,720
rafinarea modelului după cum este necesar. Deci asta

62492
46:44:28,640 --> 46:44:33,104
ciclul de îmbunătățire continuă ajută la adaptare

62493
46:44:30,720 --> 46:44:35,024
la schimbarea tiparelor în datele de vânzări. Şi

62494
46:44:33,104 --> 46:44:37,104
urmând acești pași și utilizând aceștia

62495
46:44:35,024 --> 46:44:39,440
instrumente, puteți crea previziuni solide

62496
46:44:37,104 --> 46:44:42,000
care ajută compania de retail să planifice mai bine

62497
46:44:39,440 --> 46:44:43,600
și luați decizii informate. Deci asta a fost

62498
46:44:42,000 --> 46:44:46,240
totul despre întrebarea numărul 12. Acum mișcă-te

62499
46:44:43,600 --> 46:44:48,000
la întrebarea numărul 13 care se bazează pe

62500
46:44:46,240 --> 46:44:50,160
segmentarea clienților folosind mașina

62501
46:44:48,000 --> 46:44:52,240
învăţarea. Deci întrebarea este că ești

62502
46:44:50,160 --> 46:44:54,560
dat un set de date care conține date demografice

62503
46:44:52,240 --> 46:44:56,720
și date despre comportamentul de cumpărare pentru un grup

62504
46:44:54,560 --> 46:44:58,384
a clienților. Sarcina ta este să segmentezi

62505
46:44:56,720 --> 46:45:00,384
acești clienți în grupuri distincte

62506
46:44:58,384 --> 46:45:02,800
pe baza asemănărilor în achiziție

62507
46:45:00,384 --> 46:45:04,000
comportament și demografie. Deci ce pași

62508
46:45:02,800 --> 46:45:05,840
ai lua pentru a face asta

62509
46:45:04,000 --> 46:45:08,160
segmentare și puteți oferi a

62510
46:45:05,840 --> 46:45:10,640
exemplu de fragment de cod Python pentru a ilustra

62511
46:45:08,160 --> 46:45:12,800
etapele inițiale ale manipulării datelor și

62512
46:45:10,640 --> 46:45:14,880
cerere de model. Deci putem începe asta

62513
46:45:12,800 --> 46:45:16,640
prin explicarea segmentării clienților care

62514
46:45:14,880 --> 46:45:18,640
este o abordare puternică de a croi

62515
46:45:16,640 --> 46:45:20,800
strategiile de marketing și îmbunătățirea

62516
46:45:18,640 --> 46:45:22,640
serviciul pentru clienți prin identificarea distincte

62517
46:45:20,800 --> 46:45:25,440
grupuri în funcţie de comportamentul lor şi

62518
46:45:22,640 --> 46:45:27,840
caracteristici. Și aici avem și un

62519
46:45:25,440 --> 46:45:29,600
abordare detaliată a acestei sarcini. Aşa

62520
46:45:27,840 --> 46:45:31,024
Vom începe cu primul pas care

62521
46:45:29,600 --> 46:45:33,664
ar fi explorarea datelor și

62522
46:45:31,024 --> 46:45:35,664
preprocesare. Deci va exista initiala

62523
46:45:33,664 --> 46:45:37,600
explorare care începe prin

62524
46:45:35,664 --> 46:45:40,464
examinarea setului de date pentru a înțelege

62525
46:45:37,600 --> 46:45:42,960
caracteristici disponibile, cum ar fi vârsta, venitul,

62526
46:45:40,464 --> 46:45:45,104
frecvența de cumpărare etc. Apoi ne vom uita

62527
46:45:42,960 --> 46:45:47,280
pentru valori lipsă sau anomalii și

62528
46:45:45,104 --> 46:45:49,600
decide cum să le gestionezi. Asta ar putea fi

62529
46:45:47,280 --> 46:45:51,440
folosind imputarea și apoi vom trece la

62530
46:45:49,600 --> 46:45:52,880
ingineria caracteristicilor. Vom crea noi

62531
46:45:51,440 --> 46:45:55,104
caracteristici care ar putea fi utile pentru

62532
46:45:52,880 --> 46:45:57,280
segmentare cum ar fi durata de viață a clientului

62533
46:45:55,104 --> 46:45:59,360
valoarea sau valoarea medie a tranzacției.

62534
46:45:57,280 --> 46:46:01,104
Vom folosi și normalizarea, adică

62535
46:45:59,360 --> 46:46:03,360
normalizați datele pentru a vă asigura că acestea

62536
46:46:01,104 --> 46:46:05,520
caracteristica nu este disproporționat

62537
46:46:03,360 --> 46:46:07,840
influențează modelul datorită dimensiunii sale.

62538
46:46:05,520 --> 46:46:10,000
Vom folosi scalarea standard sau minmax

62539
46:46:07,840 --> 46:46:11,600
scalarea după caz. Deci atunci vom face

62540
46:46:10,000 --> 46:46:13,600
treci la pasul următor care este alegerea

62541
46:46:11,600 --> 46:46:15,664
tehnica segmentării. Și aici noi

62542
46:46:13,600 --> 46:46:16,800
au k înseamnă grupare. Deci acesta este un

62543
46:46:15,664 --> 46:46:18,800
metodă populară pentru client

62544
46:46:16,800 --> 46:46:20,384
segmentare. Aici ne vom decide asupra

62545
46:46:18,800 --> 46:46:23,360
numărul de clustere prin utilizarea tehnicilor

62546
46:46:20,384 --> 46:46:26,160
ca metoda cotului sau analiza la

62547
46:46:23,360 --> 46:46:29,024
determina numărul optim de clustere. Şi

62548
46:46:26,160 --> 46:46:31,440
apoi avem implementarea modelului și în

62549
46:46:29,024 --> 46:46:33,200
că vom folosi pregătirea datelor și

62550
46:46:31,440 --> 46:46:35,520
vom pregăti datele selectând

62551
46:46:33,200 --> 46:46:37,840
caracteristici relevante și aplicând orice finală

62552
46:46:35,520 --> 46:46:39,920
transformări și apoi avem model

62553
46:46:37,840 --> 46:46:42,384
potrivire. Ne potrivim C înseamnă clustering

62554
46:46:39,920 --> 46:46:45,664
modelează la date și evaluează și

62555
46:46:42,384 --> 46:46:47,360
interpretează analizând clustere și după

62556
46:46:45,664 --> 46:46:50,000
analizând clustere vom trece la

62557
46:46:47,360 --> 46:46:52,240
următorul pas care este perspectiva strategică. Noi

62558
46:46:50,000 --> 46:46:54,320
va oferi informații acționabile bazate

62559
46:46:52,240 --> 46:46:56,560
pe caracteristicile cluster precum

62560
46:46:54,320 --> 46:46:59,104
strategii de marketing orientate pentru fiecare

62561
46:46:56,560 --> 46:47:01,200
segment. Și apoi avem iterativ

62562
46:46:59,104 --> 46:47:03,664
rafinament care este feedback

62563
46:47:01,200 --> 46:47:06,160
încorporare și vom folosi afaceri

62564
46:47:03,664 --> 46:47:07,840
feedback pentru a rafina segmentarea. Dacă

62565
46:47:06,160 --> 46:47:09,920
date suplimentare devin disponibile

62566
46:47:07,840 --> 46:47:12,464
încorporate pentru a spori modelul şi

62567
46:47:09,920 --> 46:47:14,560
acum vom vedea exemplul de cod Python. Deci

62568
46:47:12,464 --> 46:47:16,800
pentru aceasta mai întâi vom importa

62569
46:47:14,560 --> 46:47:19,200
biblioteci și module. După cum puteți vedea mai departe

62570
46:47:16,800 --> 46:47:21,600
pe ecran am importat panda

62571
46:47:19,200 --> 46:47:24,320
test de tren aleatoriu clasificator forestier

62572
46:47:21,600 --> 46:47:26,320
clasificare standard împărțită a scalerului

62573
46:47:24,320 --> 46:47:28,640
raport și după aceea vom încărca

62574
46:47:26,320 --> 46:47:33,024
date și și pentru asta am folosit

62575
46:47:28,640 --> 46:47:34,960
panda pentru a citi datele care sunt citite ssv

62576
46:47:33,024 --> 46:47:37,200
iar după aceea procesăm

62577
46:47:34,960 --> 46:47:39,280
date care sunt prelucrări de date

62578
46:47:37,200 --> 46:47:42,560
manipularea valorilor lipsă și utilizarea

62579
46:47:39,280 --> 46:47:44,384
forward fill sau fil to fill lipsă

62580
46:47:42,560 --> 46:47:46,240
valorile din setul de date și atunci suntem

62581
46:47:44,384 --> 46:47:48,160
prezentând scalarea care se normalizează

62582
46:47:46,240 --> 46:47:50,384
caracteristicile selectate care sunt caracteristice

62583
46:47:48,160 --> 46:47:52,560
unu, caracteristică două și caracteristică trei folosind

62584
46:47:50,384 --> 46:47:54,384
scaler standard și apoi vom trece la

62585
46:47:52,560 --> 46:47:56,240
următorul pas care este împărțirea datelor.

62586
46:47:54,384 --> 46:47:58,560
Vom împărți setul de date în formare

62587
46:47:56,240 --> 46:48:01,024
și seturi de testare. Deci dimensiunea aia de test

62588
46:47:58,560 --> 46:48:03,664
egal cu 0,2 parametri specifică faptul că

62589
46:48:01,024 --> 46:48:05,600
20% din date vor fi folosite pentru testare

62590
46:48:03,664 --> 46:48:07,664
și apoi vom antrena modelul. Vom face

62591
46:48:05,600 --> 46:48:10,320
inițializează și antrenează o pădure aleatoare

62592
46:48:07,664 --> 46:48:12,880
clasificator cu 100 de arbori și un random

62593
46:48:10,320 --> 46:48:14,720
stare pentru reproductibilitate și apoi

62594
46:48:12,880 --> 46:48:18,080
vom evalua modelul. va face

62595
46:48:14,720 --> 46:48:20,720
predicții pe setul de testare care este X

62596
46:48:18,080 --> 46:48:23,440
testați folosind modelul de tren și imprimați a

62597
46:48:20,720 --> 46:48:26,320
raport de clasificare care arată precizia

62598
46:48:23,440 --> 46:48:28,880
reamintiți scorul F1 și suport pentru fiecare

62599
46:48:26,320 --> 46:48:31,104
clasa. Deci, acest cod demonstrează

62600
46:48:28,880 --> 46:48:33,104
procesul de încărcare, preprocesare,

62601
46:48:31,104 --> 46:48:34,960
antrenarea și evaluarea unei mașini

62602
46:48:33,104 --> 46:48:37,024
model de învățare care este pădurea aleatoare

62603
46:48:34,960 --> 46:48:39,280
clasificator pentru echipament de predicție

62604
46:48:37,024 --> 46:48:40,560
defecțiuni într-o fabrică de producție. The

62605
46:48:39,280 --> 46:48:42,320
utilizarea unor tehnici precum datele

62606
46:48:40,560 --> 46:48:44,384
pre-procesare și împărțire împreună cu

62607
46:48:42,320 --> 46:48:46,880
clasificatorul forestier aleatoriu evidențiază

62608
46:48:44,384 --> 46:48:48,960
un flux standard pentru construirea predictivă

62609
46:48:46,880 --> 46:48:50,880
modele de întreținere. Deci asta a fost tot

62610
46:48:48,960 --> 46:48:52,640
despre întrebarea numărul 13. Deci acum

62611
46:48:50,880 --> 46:48:54,800
trecând la întrebarea numărul 14 adică

62612
46:48:52,640 --> 46:48:56,384
bazată pe rata predictivă a clienților și

62613
46:48:54,800 --> 46:48:58,320
întrebarea este că ești însărcinat

62614
46:48:56,384 --> 46:49:00,320
dezvoltarea unui model pentru a prezice care

62615
46:48:58,320 --> 46:49:02,320
clienții sunt susceptibili să abandoneze de la a

62616
46:49:00,320 --> 46:49:04,000
serviciu de abonament. Deci ce pași

62617
46:49:02,320 --> 46:49:06,384
ai lua pentru a construi acest model și

62618
46:49:04,000 --> 46:49:08,000
îi puteți furniza un exemplu de cod Python

62619
46:49:06,384 --> 46:49:09,920
ilustrează pregătirea datelor și

62620
46:49:08,000 --> 46:49:12,240
model de proces de formare? Deci vom începe

62621
46:49:09,920 --> 46:49:14,320
răspunzând la această întrebare despre înfățișare

62622
46:49:12,240 --> 46:49:16,384
ceea ce prezice pierderea clienților. Deci

62623
46:49:14,320 --> 46:49:18,464
prezicerea ratei clienților este crucială pentru

62624
46:49:16,384 --> 46:49:21,360
întreprinderilor să pună în aplicare detenția

62625
46:49:18,464 --> 46:49:22,880
strategii în mod proactiv și vom avea o

62626
46:49:21,360 --> 46:49:25,024
abordare detaliată pentru construirea a

62627
46:49:22,880 --> 46:49:26,560
model predictiv în acest scop.

62628
46:49:25,024 --> 46:49:29,360
Începând cu colectarea datelor și

62629
46:49:26,560 --> 46:49:31,600
explorare și în aceasta vom colecta

62630
46:49:29,360 --> 46:49:34,160
date și după aceea vom efectua

62631
46:49:31,600 --> 46:49:36,320
analiza exploratorie a datelor care este EDA.

62632
46:49:34,160 --> 46:49:38,720
Vom efectua o analiză inițială pentru

62633
46:49:36,320 --> 46:49:40,800
înțelege modelele și tendințele și apoi

62634
46:49:38,720 --> 46:49:42,384
avem inginerie caracteristică. Vom

62635
46:49:40,800 --> 46:49:44,640
creați noi caracteristici și obțineți noi

62636
46:49:42,384 --> 46:49:47,024
caracteristică care ar putea influența o astfel de pierdere

62637
46:49:44,640 --> 46:49:48,880
ca modificare a modelului de utilizare sau a serviciului

62638
46:49:47,024 --> 46:49:50,960
upgrade-uri. Și apoi ne vom ocupa de

62639
46:49:48,880 --> 46:49:53,200
valori lipsă dacă am găsit vreuna. Și apoi

62640
46:49:50,960 --> 46:49:55,520
vom codifica variabilele categoriale. Vom face

62641
46:49:53,200 --> 46:49:58,464
utilizați tehnici precum o codificare fierbinte sau

62642
46:49:55,520 --> 46:50:00,384
codificarea etichetelor pentru variabilele categoriale.

62643
46:49:58,464 --> 46:50:02,240
Și apoi avem caracteristici de scalare

62644
46:50:00,384 --> 46:50:04,240
normalizarea sau standardizarea numerică

62645
46:50:02,240 --> 46:50:06,640
caracteristici pentru a vă asigura că contribuie

62646
46:50:04,240 --> 46:50:09,024
în egală măsură cu performanța modelului. Şi

62647
46:50:06,640 --> 46:50:11,104
apoi vom selecta modelul care este

62648
46:50:09,024 --> 46:50:13,360
vom alege modelul potrivit și

62649
46:50:11,104 --> 46:50:16,560
începe cu pentru manipularea cunoscătoare

62650
46:50:13,360 --> 46:50:18,800
sarcină de clasificare binară care ar putea fi

62651
46:50:16,560 --> 46:50:21,104
cu regresie logistică, pădure aleatoare

62652
46:50:18,800 --> 46:50:22,960
sau mașini de creștere a gradientului. Și după

62653
46:50:21,104 --> 46:50:25,920
selectând modelul, îl vom antrena pe

62654
46:50:22,960 --> 46:50:27,744
modelați și evaluați-l. Deci potriviți-vă modelului dvs

62655
46:50:25,920 --> 46:50:29,520
pe datele de antrenament și după aceea

62656
46:50:27,744 --> 46:50:31,664
evaluați modelul folosind corespunzătoare

62657
46:50:29,520 --> 46:50:35,360
parametri precum acuratețea, precizia,

62658
46:50:31,664 --> 46:50:37,664
reamintim, scorul F1 și ROC să meargă

62659
46:50:35,360 --> 46:50:40,464
performanta. Și apoi vom optimiza

62660
46:50:37,664 --> 46:50:42,880
model folosind reglarea hiperparametrică. Bine

62661
46:50:40,464 --> 46:50:44,640
optimizați parametrul modelului folosind grila

62662
46:50:42,880 --> 46:50:46,800
căutare sau căutare aleatorie pentru a îmbunătăți

62663
46:50:44,640 --> 46:50:48,800
performanta. Și apoi avem caracteristică

62664
46:50:46,800 --> 46:50:50,384
importanța care este analiza și ierarhizarea

62665
46:50:48,800 --> 46:50:52,384
caracteristici prin importanţa lor în

62666
46:50:50,384 --> 46:50:54,640
prezicerea abandonului pentru a rafina modelul

62667
46:50:52,384 --> 46:50:56,560
mai departe. Și apoi și apoi ultimul pas

62668
46:50:54,640 --> 46:50:58,960
este implementarea și monitorizarea. Vom face

62669
46:50:56,560 --> 46:51:00,640
implementați modelul odată implementat validat

62670
46:50:58,960 --> 46:51:02,800
modelul într-un mediu de producție

62671
46:51:00,640 --> 46:51:04,464
unde poate prezice pierderea în timp real. Deci

62672
46:51:02,800 --> 46:51:06,560
după implementarea regulată a modelului

62673
46:51:04,464 --> 46:51:08,800
monitorizați modelul pentru a vă asigura că rămâne

62674
46:51:06,560 --> 46:51:11,200
eficient în timp pe măsură ce apar date noi

62675
46:51:08,800 --> 46:51:13,744
in. Deci acum vom vedea exemplul Python

62676
46:51:11,200 --> 46:51:16,000
cod pentru acest exemplu. Deci incepand cu

62677
46:51:13,744 --> 46:51:19,744
importul de biblioteci vom

62678
46:51:16,000 --> 46:51:23,024
import panda numpy scikitlearn skarn

62679
46:51:19,744 --> 46:51:25,664
tensorflow și tensorflow kas și

62680
46:51:23,024 --> 46:51:27,440
apeluri înapoi și după importarea

62681
46:51:25,664 --> 46:51:30,080
modulele vom începe cu încărcarea datelor

62682
46:51:27,440 --> 46:51:33,744
vom încărca setul de date dintr-un fișier CSV

62683
46:51:30,080 --> 46:51:36,000
numit echipament data dot csv și că

62684
46:51:33,744 --> 46:51:37,920
cu cadrul de date panda și după

62685
46:51:36,000 --> 46:51:40,160
că vom face pregătirea datelor

62686
46:51:37,920 --> 46:51:42,320
ne vom ocupa de valorile lipsă și pentru asta

62687
46:51:40,160 --> 46:51:44,160
vom folosi forward fill pentru a completa lipsa

62688
46:51:42,320 --> 46:51:46,160
valorile din setul de date și apoi avem

62689
46:51:44,160 --> 46:51:48,240
scalarea caracteristicilor care va normaliza

62690
46:51:46,160 --> 46:51:49,920
caracteristici selectate care este caracteristica unu,

62691
46:51:48,240 --> 46:51:52,000
caracteristica doi, caracteristica trei folosind

62692
46:51:49,920 --> 46:51:54,080
scaler standard și după aceea vom folosi

62693
46:51:52,000 --> 46:51:56,384
divizarea datelor. Vom împărți datele

62694
46:51:54,080 --> 46:51:59,104
pus în seturi de antrenament și testare și

62695
46:51:56,384 --> 46:52:01,600
dimensiunea testului va fi egală cu 0,2 și

62696
46:51:59,104 --> 46:52:03,744
acest parametru specifică că 20% din

62697
46:52:01,600 --> 46:52:05,024
datele vor fi folosite pentru testare și după

62698
46:52:03,744 --> 46:52:07,440
că vom începe cu construirea

62699
46:52:05,024 --> 46:52:10,080
model. Mai întâi vom vedea modelul secvenţial

62700
46:52:07,440 --> 46:52:12,000
care inițializează un model secvenţial

62701
46:52:10,080 --> 46:52:15,024
tehnica. Și apoi avem straturi dense

62702
46:52:12,000 --> 46:52:17,440
care adaugă două straturi dense cu 64 de unități

62703
46:52:15,024 --> 46:52:19,200
și funcția de activare a valorii. Apoi noi

62704
46:52:17,440 --> 46:52:21,360
au straturi de abandon care adaugă două

62705
46:52:19,200 --> 46:52:24,160
straturi de abandon cu o rată de abandon de

62706
46:52:21,360 --> 46:52:26,160
0,5 pentru a reduce supraadaptarea. După aceea

62707
46:52:24,160 --> 46:52:27,840
vom face compilarea modelului. Vom face

62708
46:52:26,160 --> 46:52:30,880
compilați modelul folosind atomul

62709
46:52:27,840 --> 46:52:33,024
optimizator și pierdere de entropie încrucișată binară

62710
46:52:30,880 --> 46:52:34,720
funcţie de clasificare binară. Şi

62711
46:52:33,024 --> 46:52:36,960
va fi o oprire devreme

62712
46:52:34,720 --> 46:52:38,880
va defini o oprire anticipată a apelului înapoi

62713
46:52:36,960 --> 46:52:40,880
pentru a opri antrenamentul atunci când validarea

62714
46:52:38,880 --> 46:52:43,024
metrica pierderilor a încetat să se îmbunătățească după

62715
46:52:40,880 --> 46:52:45,360
trei blocuri. Și după antrenamentul

62716
46:52:43,024 --> 46:52:47,440
model, vom evalua modelul. Şi

62717
46:52:45,360 --> 46:52:50,240
evaluarea modelului pe datele de testare

62718
46:52:47,440 --> 46:52:52,240
și imprimați valorile de pierdere și acuratețe.

62719
46:52:50,240 --> 46:52:53,920
Deci, acest cod demonstrează procesul de

62720
46:52:52,240 --> 46:52:55,920
încărcare, preprocesare, construcție,

62721
46:52:53,920 --> 46:52:58,464
compilarea, instruirea și evaluarea a

62722
46:52:55,920 --> 46:53:00,960
model de învățare profundă folosind TensorFlow și

62723
46:52:58,464 --> 46:53:02,960
KAS pentru prezicerea defecțiunilor echipamentelor în

62724
46:53:00,960 --> 46:53:04,640
o fabrică de producție. Deci utilizarea de

62725
46:53:02,960 --> 46:53:07,024
tehnici precum pregătirea datelor,

62726
46:53:04,640 --> 46:53:09,360
regularizarea abandonului şcolar şi precoce

62727
46:53:07,024 --> 46:53:10,800
oprirea ajută la construirea unei adânci robuste

62728
46:53:09,360 --> 46:53:12,880
model de învăţare pentru predicţie

62729
46:53:10,800 --> 46:53:14,640
întreținere. Deci totul este cu întrebare

62730
46:53:12,880 --> 46:53:16,560
numărul 14. Acum vom începe cu întrebarea

62731
46:53:14,640 --> 46:53:18,640
numărul 15 care se bazează pe învățarea profundă

62732
46:53:16,560 --> 46:53:20,320
și NLP. Și întrebarea ta este că ești

62733
46:53:18,640 --> 46:53:22,560
însărcinat cu dezvoltarea unui sentiment

62734
46:53:20,320 --> 46:53:24,160
model de analiză folosind deep learning to

62735
46:53:22,560 --> 46:53:26,160
înțelege opiniile clienților din

62736
46:53:24,160 --> 46:53:28,000
recenzii. Deci, ce pași ați face

62737
46:53:26,160 --> 46:53:30,240
construiți acest model și puteți oferi un

62738
46:53:28,000 --> 46:53:32,384
exemplu de fragment de cod Python pentru a ilustra

62739
46:53:30,240 --> 46:53:34,560
cum ați preprocesa datele și ați antrena

62740
46:53:32,384 --> 46:53:36,240
un model simplu de învățare profundă? Deci vom face

62741
46:53:34,560 --> 46:53:38,800
începe să răspunzi la asta cu sentiment

62742
46:53:36,240 --> 46:53:41,280
analiza pe care analiza sentimentelor folosind

62743
46:53:38,800 --> 46:53:43,360
învățarea profundă permite afacerilor să facă coaching

62744
46:53:41,280 --> 46:53:45,600
sentimentul clienților din date text, cum ar fi

62745
46:53:43,360 --> 46:53:47,200
recenzii sau comentarii în mod eficient. Şi

62746
46:53:45,600 --> 46:53:49,360
vom avea o abordare detaliată pentru

62747
46:53:47,200 --> 46:53:51,024
construirea unui model de analiză a sentimentelor.

62748
46:53:49,360 --> 46:53:52,960
Vom începe cu colectarea datelor și

62749
46:53:51,024 --> 46:53:54,880
curatenie. Vom colecta datele,

62750
46:53:52,960 --> 46:53:57,600
aduna un set substanțial de date de text

62751
46:53:54,880 --> 46:53:59,664
recenzii și sentimentele asociate acestora

62752
46:53:57,600 --> 46:54:01,744
de obicei etichetat ca pozitiv, negativ,

62753
46:53:59,664 --> 46:54:04,000
sau neurale. Și apoi vom curăța

62754
46:54:01,744 --> 46:54:06,464
date, preprocesează datele prin eliminare

62755
46:54:04,000 --> 46:54:08,560
zgomot, cum ar fi etichete HTML, special

62756
46:54:06,464 --> 46:54:10,384
personaje, și așa și cuvinte. Și vom face

62757
46:54:08,560 --> 46:54:12,384
normalizați textul transformându-l în

62758
46:54:10,384 --> 46:54:14,640
literă mică. Și apoi avem text

62759
46:54:12,384 --> 46:54:17,360
prelucrare. Vom converti textul în

62760
46:54:14,640 --> 46:54:19,280
jetoane, cuvinte sau expresii. Și apoi noi

62761
46:54:17,360 --> 46:54:21,280
au vectorizare care se transformă

62762
46:54:19,280 --> 46:54:23,920
jetoane în format numeric folosind

62763
46:54:21,280 --> 46:54:26,240
tehnici precum încorporarea cuvintelor sau TF

62764
46:54:23,920 --> 46:54:29,024
adică frecvența termenului în document

62765
46:54:26,240 --> 46:54:30,720
frecvența și apoi vom folosi umplutura

62766
46:54:29,024 --> 46:54:32,160
si apoi avem optiunea de model

62767
46:54:30,720 --> 46:54:34,720
selecție. va alege un model

62768
46:54:32,160 --> 46:54:37,840
arhitectură bazată pe o abordare de bază

62769
46:54:34,720 --> 46:54:40,160
și utilizați un RNN sau mai avansat

62770
46:54:37,840 --> 46:54:43,664
arhitectură ca LSTM care este lungă

62771
46:54:40,160 --> 46:54:45,840
memorie pe termen scurt sau GRU care este încadrată

62772
46:54:43,664 --> 46:54:48,464
unități recurente care sunt eficiente pentru

62773
46:54:45,840 --> 46:54:51,024
secvență de date precum text și apoi avem

62774
46:54:48,464 --> 46:54:52,720
antrenamentul modelului vom compila modelul

62775
46:54:51,024 --> 46:54:55,104
defini arhitectura modelului și

62776
46:54:52,720 --> 46:54:57,440
compilați-l cu o funcție de pierdere potrivită

62777
46:54:55,104 --> 46:55:00,464
pentru clasificare ca cruce categorială

62778
46:54:57,440 --> 46:55:02,160
entropie și un optimizator ca Adam și

62779
46:55:00,464 --> 46:55:04,384
apoi vom antrena modelul. Ne vom potrivi

62780
46:55:02,160 --> 46:55:06,640
modelul pe datele noastre preprocesate.

62781
46:55:04,384 --> 46:55:08,560
Îl vom evalua și optimiza.

62782
46:55:06,640 --> 46:55:11,104
Evaluarea performanței modelului. Aici folosește

62783
46:55:08,560 --> 46:55:13,360
metrici precum acuratețea, precizia,

62784
46:55:11,104 --> 46:55:15,520
reamintire și scorul F1 pentru a evalua

62785
46:55:13,360 --> 46:55:17,280
model. Și apoi avem hiperparametru

62786
46:55:15,520 --> 46:55:19,744
acordarea. Vom optimiza modelul prin

62787
46:55:17,280 --> 46:55:22,240
ajustarea parametrilor precum rata de învățare,

62788
46:55:19,744 --> 46:55:24,160
numărul de straturi și unități pe strat.

62789
46:55:22,240 --> 46:55:26,160
Și apoi se ajunge la desfășurare. Vom face

62790
46:55:24,160 --> 46:55:28,240
implementați modelul și integrați modelul

62791
46:55:26,160 --> 46:55:30,160
în procesarea de revizuire existentă

62792
46:55:28,240 --> 46:55:32,800
conductă. Deci se poate automat

62793
46:55:30,160 --> 46:55:34,640
clasifica recenzii noi. Deci să vedem

62794
46:55:32,800 --> 46:55:36,640
exemplu de cod Python și vom avea un

62795
46:55:34,640 --> 46:55:39,360
abordare de bază pentru asta. Aici vom face

62796
46:55:36,640 --> 46:55:42,384
import numpy tensorflow secvenţial

62797
46:55:39,360 --> 46:55:44,464
încorporarea LSTM cursă densă în afară. Deci

62798
46:55:42,384 --> 46:55:46,880
încorporarea convertește numere întregi pozitive

62799
46:55:44,464 --> 46:55:48,880
adică indicii în vectori denși ai

62800
46:55:46,880 --> 46:55:51,744
dimensiune fixă și LSTM care este lung

62801
46:55:48,880 --> 46:55:54,320
stratul de memorie pe termen scurt care este utilizat pentru

62802
46:55:51,744 --> 46:55:55,840
dependențe de învățare în datele secvenței.

62803
46:55:54,320 --> 46:55:59,280
Și apoi avem dens care este a

62804
46:55:55,840 --> 46:56:02,464
strat NN conectat regulat densat. Şi

62805
46:55:59,280 --> 46:56:04,560
apoi vom importa secvențe de pad. Şi

62806
46:56:02,464 --> 46:56:06,464
după aceea avem setul de date și

62807
46:56:04,560 --> 46:56:09,104
exemple de date text reprezentând client

62808
46:56:06,464 --> 46:56:11,600
recenzii care se vor stoca în variabilă

62809
46:56:09,104 --> 46:56:13,920
text. Și apoi avem etichete care au

62810
46:56:11,600 --> 46:56:16,384
etichete binare care indică sentimentul unu

62811
46:56:13,920 --> 46:56:17,920
pentru zero pozitiv pentru negativ. Și acum

62812
46:56:16,384 --> 46:56:19,664
vom începe cu preprocesarea

62813
46:56:17,920 --> 46:56:21,744
date. Aici am declarat că

62814
46:56:19,664 --> 46:56:24,240
tokenizer. Vom inițializa a

62815
46:56:21,744 --> 46:56:26,560
tokenizer care va ajuta doar partea de sus

62816
46:56:24,240 --> 46:56:29,024
o mie de cuvinte cele mai frecvente. Și apoi

62817
46:56:26,560 --> 46:56:31,200
avem fit_on

62818
46:56:29,024 --> 46:56:34,080
text care este actualizat intern

62819
46:56:31,200 --> 46:56:36,080
vocabular bazat pe lista de text. Ea

62820
46:56:34,080 --> 46:56:38,960
în esență creează un dicționar de cuvinte

62821
46:56:36,080 --> 46:56:41,360
a indexa perechile. Și apoi avem text către

62822
46:56:38,960 --> 46:56:44,160
secvențe care vor transforma fiecare text

62823
46:56:41,360 --> 46:56:46,000
în text la o succesiune de numere întregi. Şi

62824
46:56:44,160 --> 46:56:48,000
apoi avem secvențe de pad care vor

62825
46:56:46,000 --> 46:56:50,240
asigurați-vă că toate secvențele au aceeași

62826
46:56:48,000 --> 46:56:53,104
lungime prin umplutura secvente mai scurte cu

62827
46:56:50,240 --> 46:56:55,280
zerouri până la lungimea maximă. Și apoi

62828
46:56:53,104 --> 46:56:57,104
vom începe să construim modelul. Aici noi

62829
46:56:55,280 --> 46:56:59,200
au model secvenţial care va configura a

62830
46:56:57,104 --> 46:57:01,520
stivă liniară de straturi. Și apoi avem

62831
46:56:59,200 --> 46:57:04,384
strat de încorporare care va mapa fiecare cuvânt

62832
46:57:01,520 --> 46:57:06,640
index la un vector de încorporare de dimensiunea 64.

62833
46:57:04,384 --> 46:57:09,200
Deci lungimea de intrare este setată la 10, adică

62834
46:57:06,640 --> 46:57:11,664
lungimea secvenţelor de intrare. Apoi

62835
46:57:09,200 --> 46:57:13,744
vom începe cu straturi LSTM. Deci doi

62836
46:57:11,664 --> 46:57:16,384
Se adaugă straturi LSTM. Primul

62837
46:57:13,744 --> 46:57:18,800
returnează secvențe pentru a permite următorul LSTM

62838
46:57:16,384 --> 46:57:20,464
strat pentru a procesa aceste secvențe. Şi

62839
46:57:18,800 --> 46:57:23,280
după aceea avem stratul dropout

62840
46:57:20,464 --> 46:57:25,280
care se aplică abandonului cu o rată de 0,5

62841
46:57:23,280 --> 46:57:27,280
a primului strat LSTM de redus

62842
46:57:25,280 --> 46:57:30,384
supraadaptare. Și după aceea vom veni

62843
46:57:27,280 --> 46:57:32,464
la stratul dens care are ieșire de a

62844
46:57:30,384 --> 46:57:35,280
un singur scalar care reprezintă

62845
46:57:32,464 --> 46:57:38,160
aşezarea prezisă şi utilizarea sigmoidului

62846
46:57:35,280 --> 46:57:40,080
activare pentru a scoate o probabilitate. Şi

62847
46:57:38,160 --> 46:57:42,240
acum vom începe cu compilarea modelelor

62848
46:57:40,080 --> 46:57:44,320
si antrenament. Deci vom configura

62849
46:57:42,240 --> 46:57:46,640
model pentru antrenament și vom folosi binar

62850
46:57:44,320 --> 46:57:48,880
entropia încrucișată ca funcție de pierdere care

62851
46:57:46,640 --> 46:57:51,664
este potrivit pentru clasificarea binară

62852
46:57:48,880 --> 46:57:54,720
și optimizatorul atomic și pistele

62853
46:57:51,664 --> 46:57:56,464
acuratețea constantă ca metrică și apoi

62854
46:57:54,720 --> 46:57:58,800
avem potrivirea care antrenează modelul

62855
46:57:56,464 --> 46:58:01,360
pentru un anumit număr de epoci adică

62856
46:57:58,800 --> 46:58:03,280
iterații sau întregul set de date și

62857
46:58:01,360 --> 46:58:05,024
atunci vom prezice modelul care este

62858
46:58:03,280 --> 46:58:06,640
după antrenament modelul poate prezice

62859
46:58:05,024 --> 46:58:08,960
sentimentul recenziilor din date

62860
46:58:06,640 --> 46:58:10,640
set. Acest lucru este util pentru a verifica modul în care

62861
46:58:08,960 --> 46:58:12,880
modelul efectuează pe datele de antrenament

62862
46:58:10,640 --> 46:58:14,960
în sine. Deci această defalcare explică fiecare

62863
46:58:12,880 --> 46:58:16,880
pasul procesului de codificare care detaliază cum

62864
46:58:14,960 --> 46:58:19,600
datele sunt pregătite și modul în care modelul

62865
46:58:16,880 --> 46:58:21,664
este configurat și apoi îl vom compila

62866
46:58:19,600 --> 46:58:24,160
și utilizarea pentru antrenament și predicție. Deci

62867
46:58:21,664 --> 46:58:26,240
este explicația detaliată ar trebui să ajute

62868
46:58:24,160 --> 46:58:28,560
înțelegerea modului de implementare a unui simplu

62869
46:58:26,240 --> 46:58:30,800
Model LSTM pentru analiza sentimentelor în

62870
46:58:28,560 --> 46:58:33,104
TensorFlow. Acum trec la întrebare

62871
46:58:30,800 --> 46:58:35,360
numărul 16. Deci, să începem cu întrebarea

62872
46:58:33,104 --> 46:58:37,520
numărul 16 care se bazează pe anomalie

62873
46:58:35,360 --> 46:58:39,280
detectarea în datele tranzacțiilor. Deci

62874
46:58:37,520 --> 46:58:41,200
întrebarea este că ești însărcinat

62875
46:58:39,280 --> 46:58:43,440
identificarea tranzacțiilor neobișnuite în a

62876
46:58:41,200 --> 46:58:45,440
datele financiare ale companiei care ar putea

62877
46:58:43,440 --> 46:58:46,800
sugerează activitate frauduloasă. Şi ce dacă

62878
46:58:45,440 --> 46:58:48,880
pași ai face pentru a dezvolta o

62879
46:58:46,800 --> 46:58:51,280
model de detectare a anomaliilor și puteți

62880
46:58:48,880 --> 46:58:52,880
furnizați o probă de fragment de cod Python la

62881
46:58:51,280 --> 46:58:54,960
ilustrați cum ați preprocesa fișierul

62882
46:58:52,880 --> 46:58:56,880
date și aplicați o detectare a anomaliilor

62883
46:58:54,960 --> 46:58:59,200
tehnica. Deci vom începe să răspundem la asta

62884
46:58:56,880 --> 46:59:00,960
cu tehnica de detectare a anomaliilor adica

62885
46:58:59,200 --> 46:59:02,640
detectarea anomaliilor este esenţială pentru

62886
46:59:00,960 --> 46:59:05,104
prevenirea fraudei prin identificare

62887
46:59:02,640 --> 46:59:07,440
tranzacții care se abate semnificativ

62888
46:59:05,104 --> 46:59:09,440
din tipare tipice. Și acum vom vedea

62889
46:59:07,440 --> 46:59:11,744
abordarea structurată a construirii unui

62890
46:59:09,440 --> 46:59:14,080
model de detectare a anomaliilor pentru tranzacție

62891
46:59:11,744 --> 46:59:16,384
date. Vom începe cu colectarea datelor

62892
46:59:14,080 --> 46:59:18,240
și curățenie și vom colecta toate

62893
46:59:16,384 --> 46:59:20,080
compilarea datelor despre tranzacții care ar trebui

62894
46:59:18,240 --> 46:59:22,640
includeți detalii precum suma tranzacției,

62895
46:59:20,080 --> 46:59:24,240
ora, ID-ul utilizatorului și tipul tranzacției. Apoi

62896
46:59:22,640 --> 46:59:25,664
vom trece la inginerie caracteristică și

62897
46:59:24,240 --> 46:59:27,600
dezvolta caracteristici care surprind

62898
46:59:25,664 --> 46:59:30,320
esența tranzacției cum ar fi timpul de

62899
46:59:27,600 --> 46:59:31,920
ziua și ziua săptămânii. Și apoi noi

62900
46:59:30,320 --> 46:59:33,664
au normalizarea datelor. Vom folosi

62901
46:59:31,920 --> 46:59:35,744
tehnici de scalare precum minmax

62902
46:59:33,664 --> 46:59:38,640
scalare sau standardizare pentru a asigura

62903
46:59:35,744 --> 46:59:40,560
că modelul este perfect normalizat.

62904
46:59:38,640 --> 46:59:43,104
Și apoi avem alegerea anomaliei

62905
46:59:40,560 --> 46:59:45,600
tehnica de detectare. Deci aici trebuie

62906
46:59:43,104 --> 46:59:47,920
alege tehnica care este eficientă

62907
46:59:45,600 --> 46:59:50,320
pentru seturi de date și lucrări înalte dimensiuni

62908
46:59:47,920 --> 46:59:52,960
pentru izolarea anomaliilor în loc de

62909
46:59:50,320 --> 46:59:54,720
profilarea punctelor de date normale. După

62910
46:59:52,960 --> 46:59:57,104
alegerea tehnicii anomaliei va

62911
46:59:54,720 --> 46:59:59,360
identificarea anomaliilor de tren. Ne vom potrivi

62912
46:59:57,104 --> 47:00:01,744
modelul ales la date și la

62913
46:59:59,360 --> 47:00:03,600
anomalii care ar fi fost alese

62914
47:00:01,744 --> 47:00:05,840
vor fi acele tranzacții pe care le

62915
47:00:03,600 --> 47:00:07,520
modelul se identifică și după aceasta venim

62916
47:00:05,840 --> 47:00:09,360
până la ultimul pas care este revizuirea și

62917
47:00:07,520 --> 47:00:11,280
acţiune. Aici avem o revizuire manuală

62918
47:00:09,360 --> 47:00:13,744
sunt tranzacțiile semnalate ca potențiale

62919
47:00:11,280 --> 47:00:16,080
anomaliile ar trebui revizuite manual pentru a

62920
47:00:13,744 --> 47:00:18,160
confirmam activitatea frauduloasa si apoi noi

62921
47:00:16,080 --> 47:00:19,664
avem o îmbunătățire continuă, adică noi

62922
47:00:18,160 --> 47:00:21,600
poate actualiza regulat modelul cu

62923
47:00:19,664 --> 47:00:23,920
date noi și feedback din recenzie

62924
47:00:21,600 --> 47:00:25,664
proces pentru a îmbunătăți acuratețea. Și acum

62925
47:00:23,920 --> 47:00:27,200
trecând la predicţia care este după

62926
47:00:25,664 --> 47:00:29,520
antrenarea modelului putem prezice

62927
47:00:27,200 --> 47:00:31,600
sentimentul recenziilor din setul de date

62928
47:00:29,520 --> 47:00:33,360
iar acest lucru este util pentru a verifica modul în care

62929
47:00:31,600 --> 47:00:36,560
modelul efectuează pe datele de antrenament

62930
47:00:33,360 --> 47:00:39,104
în sine. Acum vom vedea codul Python pentru

62931
47:00:36,560 --> 47:00:41,280
vezi cum poți configura acest model pentru

62932
47:00:39,104 --> 47:00:43,840
detectarea anomaliilor. Vom începe prin

62933
47:00:41,280 --> 47:00:45,920
importând bibliotecile și modulul și

62934
47:00:43,840 --> 47:00:47,664
după aceea vom încărca și vom pregăti datele.

62935
47:00:45,920 --> 47:00:50,240
Adică vom încărca datele despre tranzacții de la

62936
47:00:47,664 --> 47:00:51,840
un fișier CSV în cadrul de date panda.

62937
47:00:50,240 --> 47:00:53,920
Și după aceea vom converti

62938
47:00:51,840 --> 47:00:55,840
coloana timpului tranzacției până la data oră

62939
47:00:53,920 --> 47:00:58,160
format care permite extragerea

62940
47:00:55,840 --> 47:00:59,440
caracteristici suplimentare bazate pe timp. Şi

62941
47:00:58,160 --> 47:01:01,280
după aceea vom efectua funcția

62942
47:00:59,440 --> 47:01:03,200
inginerie care va extrage ora

62943
47:01:01,280 --> 47:01:05,520
a zilei de la ora tranzacției

62944
47:01:03,200 --> 47:01:07,664
coloana. Această caracteristică poate fi importantă ca

62945
47:01:05,520 --> 47:01:09,920
tranzacții care au loc la ore neobișnuite

62946
47:01:07,664 --> 47:01:12,160
poate indica fraudă. Și apoi

62947
47:01:09,920 --> 47:01:14,080
vom trece la normalizarea datelor.

62948
47:01:12,160 --> 47:01:16,080
Aceasta va aplica scalarea standard la

62949
47:01:14,080 --> 47:01:17,600
caracteristica sumei n a zilei. Aceasta

62950
47:01:16,080 --> 47:01:19,744
procesul de normalizare presupune

62951
47:01:17,600 --> 47:01:22,000
scăzând media și împărțind la

62952
47:01:19,744 --> 47:01:23,664
abaterea standard pentru fiecare caracteristică

62953
47:01:22,000 --> 47:01:25,920
asigurându-se că caracteristica contribuie

62954
47:01:23,664 --> 47:01:27,744
în egală măsură la analiza şi îmbunătăţirea

62955
47:01:25,920 --> 47:01:29,920
performanța multor machine learning

62956
47:01:27,744 --> 47:01:31,920
algoritmi. Și după aceea vom începe

62957
47:01:29,920 --> 47:01:34,320
cu detectarea anomaliilor cu izolare

62958
47:01:31,920 --> 47:01:36,320
pădure. Asta e o tehnică. Vom face

62959
47:01:34,320 --> 47:01:39,024
inițializarea unui model de pădure de izolare

62960
47:01:36,320 --> 47:01:41,440
cu 100 de arbori care este n estimatori

62961
47:01:39,024 --> 47:01:44,384
egal cu 100. Stabilirea proporţiilor de

62962
47:01:41,440 --> 47:01:46,640
valori aberante care reprezintă o contaminare la 1% din

62963
47:01:44,384 --> 47:01:48,800
datele. Deci acest parametru este crucial

62964
47:01:46,640 --> 47:01:51,104
întrucât influenţează pragul de

62965
47:01:48,800 --> 47:01:52,960
marcând o observaţie ca o anomalie.

62966
47:01:51,104 --> 47:01:55,744
Apoi vom potrivi modelul la scară

62967
47:01:52,960 --> 47:01:58,080
cantitatea n de date și preziceți

62968
47:01:55,744 --> 47:02:00,000
starea de anomalie pentru fiecare tranzacție. Şi

62969
47:01:58,080 --> 47:02:02,384
apoi vom începe cu filtru și afișare

62970
47:02:00,000 --> 47:02:05,280
anomalii. Vom filtra tranzacțiile

62971
47:02:02,384 --> 47:02:07,440
identificate ca anomalii care reprezintă o anomalie

62972
47:02:05,280 --> 47:02:09,520
egal egal cu minus unu. Vom afișa

62973
47:02:07,440 --> 47:02:12,080
aceste tranzacții care pot fi revizuite

62974
47:02:09,520 --> 47:02:14,560
manual pentru a determina dacă acestea reprezintă

62975
47:02:12,080 --> 47:02:16,464
activitatea reală a netei de fraudă. Deci acest cod

62976
47:02:14,560 --> 47:02:18,384
snippet oferă o abordare sistematică

62977
47:02:16,464 --> 47:02:20,800
la detectarea anomaliilor în tranzacție

62978
47:02:18,384 --> 47:02:23,440
date utilizând pădurea de izolare

62979
47:02:20,800 --> 47:02:25,664
capacitatea algoritmilor de a gestiona complexe și

62980
47:02:23,440 --> 47:02:27,280
set de date înalte dimensiuni în mod eficient. Deci

62981
47:02:25,664 --> 47:02:29,280
etapele de preprocesare au asigurat că

62982
47:02:27,280 --> 47:02:30,800
datele sunt formatate corespunzător și

62983
47:02:29,280 --> 47:02:32,720
normalizat pentru modelul opțional

62984
47:02:30,800 --> 47:02:34,320
performanta. Deci despre asta era vorba

62985
47:02:32,720 --> 47:02:36,960
întrebarea numărul 16. Trec acum la

62986
47:02:34,320 --> 47:02:38,880
întrebarea numărul 17 și care se bazează pe

62987
47:02:36,960 --> 47:02:40,800
integrarea modelelor de învățare automată în

62988
47:02:38,880 --> 47:02:42,160
aplicații web. Și întrebarea ta este,

62989
47:02:40,800 --> 47:02:44,464
ați dezvoltat o învățare automată

62990
47:02:42,160 --> 47:02:46,560
model pentru a prezice prețurile imobiliare

62991
47:02:44,464 --> 47:02:48,720
bazat pe diverse caracteristici, cum ar fi locația,

62992
47:02:46,560 --> 47:02:50,320
dimensiune și dotări. Cum ai face

62993
47:02:48,720 --> 47:02:52,384
integrați acest model într-un web

62994
47:02:50,320 --> 47:02:54,464
aplicație pentru a permite utilizatorilor să obțină

62995
47:02:52,384 --> 47:02:56,384
previziuni de preț în timp real? Poți

62996
47:02:54,464 --> 47:02:57,840
furnizați o probă de fragment de cod Python la

62997
47:02:56,384 --> 47:03:00,320
ilustrați cum ați pregăti

62998
47:02:57,840 --> 47:03:03,200
model pentru integrare și manevrare utilizator

62999
47:03:00,320 --> 47:03:04,800
cerere? Deci, începând cu abordarea

63000
47:03:03,200 --> 47:03:07,200
adică integrarea unei învățări automate

63001
47:03:04,800 --> 47:03:09,104
model într-o aplicație web. Aceasta va

63002
47:03:07,200 --> 47:03:11,360
implică mai mulți pași pentru a asigura

63003
47:03:09,104 --> 47:03:13,664
modelul este accesibil și funcționează bine în

63004
47:03:11,360 --> 47:03:15,744
un mediu viu. Deci iată cum tu

63005
47:03:13,664 --> 47:03:17,840
poate aborda această sarcină. Ne-am putea împărți

63006
47:03:15,744 --> 47:03:19,920
în pași și vom începe cu numărul

63007
47:03:17,840 --> 47:03:22,160
un pas care este pregătirea modelului.

63008
47:03:19,920 --> 47:03:23,600
Vom finaliza și salva modelul. Deci

63009
47:03:22,160 --> 47:03:26,320
odată ce modelul tău este antrenat și

63010
47:03:23,600 --> 47:03:28,080
validat, salvați-l folosind un format care

63011
47:03:26,320 --> 47:03:30,384
poate fi încărcat cu ușurință într-un web

63012
47:03:28,080 --> 47:03:32,960
aplicarea. Deci, modulul Python murături

63013
47:03:30,384 --> 47:03:35,440
sau formatul de salvare al modelului TensorFlow sunt

63014
47:03:32,960 --> 47:03:37,840
utilizate în mod obișnuit în acest scop. Apoi noi

63015
47:03:35,440 --> 47:03:39,360
poate utiliza configurarea de backend a aplicației web.

63016
47:03:37,840 --> 47:03:42,640
Pentru aceasta, selectați un web potrivit

63017
47:03:39,360 --> 47:03:44,720
cadru. Deci, Flask este cunoscut popular

63018
47:03:42,640 --> 47:03:46,384
pentru simplitatea și eficacitatea sa în

63019
47:03:44,720 --> 47:03:48,720
mașină care integrează Python

63020
47:03:46,384 --> 47:03:51,104
modele de învățare. Și după aceea, vom face

63021
47:03:48,720 --> 47:03:53,840
dezvolta API-ul. După dezvoltarea

63022
47:03:51,104 --> 47:03:56,240
API în aplicația dvs. Flask pe care îl puteți

63023
47:03:53,840 --> 47:03:58,320
primi intrări ale utilizatorilor pentru caracteristicile modelului,

63024
47:03:56,240 --> 47:04:00,720
încărcați modelul, faceți predicții și

63025
47:03:58,320 --> 47:04:02,640
returnează rezultatul. Și după asta, vom face

63026
47:04:00,720 --> 47:04:04,640
dezvolta UI. Vom proiecta un

63027
47:04:02,640 --> 47:04:07,440
interfață ușor de utilizat. Vom crea un

63028
47:04:04,640 --> 47:04:09,920
interfață de utilizare simplă și intuitivă care permite utilizatorilor

63029
47:04:07,440 --> 47:04:12,080
introduceți caracteristica, cum ar fi locația, dimensiunea

63030
47:04:09,920 --> 47:04:13,600
și trimiteți-le pentru predicție. Şi

63031
47:04:12,080 --> 47:04:15,600
după aceea vom trece la desfășurare

63032
47:04:13,600 --> 47:04:18,080
fază. Vom folosi o platformă cloud precum

63033
47:04:15,600 --> 47:04:20,560
Heroku, AWS sau Google Cloud de implementat

63034
47:04:18,080 --> 47:04:22,240
aplicația dvs. Flask. Și apoi avem

63035
47:04:20,560 --> 47:04:24,720
întreținerea și actualizările. Vom face

63036
47:04:22,240 --> 47:04:27,664
monitorizați și actualizați regulat pentru

63037
47:04:24,720 --> 47:04:30,464
performanță și utilizați modelul după cum este necesar

63038
47:04:27,664 --> 47:04:33,520
pe baza feedback-ului utilizatorului. Deci acum trecerea la

63039
47:04:30,464 --> 47:04:35,520
codul Python și vedeți cum acest model

63040
47:04:33,520 --> 47:04:37,664
poate fi creat. Deci aici vom începe

63041
47:04:35,520 --> 47:04:41,104
importând bibliotecile și modulul și

63042
47:04:37,664 --> 47:04:43,280
folosim flask ple și jsonify și

63043
47:04:41,104 --> 47:04:45,360
vom începe cu inițializarea aplicației.

63044
47:04:43,280 --> 47:04:47,920
Vom inițializa un nou flask web

63045
47:04:45,360 --> 47:04:50,160
aplicație care ar fi specială

63046
47:04:47,920 --> 47:04:52,080
variabilă care oferă fișierelor Python a

63047
47:04:50,160 --> 47:04:54,320
nume unic pentru a face diferența

63048
47:04:52,080 --> 47:04:56,464
ele atunci când sunt importante în altele

63049
47:04:54,320 --> 47:04:58,560
scenarii. Și după aceea vom încărca

63050
47:04:56,464 --> 47:05:00,640
model. Deci încărcarea unei mașini de simulare

63051
47:04:58,560 --> 47:05:02,640
model de învățare din sistemul de fișiere. Deci

63052
47:05:00,640 --> 47:05:04,880
se presupune că acest model este salvat în

63053
47:05:02,640 --> 47:05:07,520
același director ca acest script. Deci

63054
47:05:04,880 --> 47:05:09,920
modelul este încărcat în modul RB care stă

63055
47:05:07,520 --> 47:05:11,600
pentru citirea binarului. Și după aceea vom face

63056
47:05:09,920 --> 47:05:14,560
treceți la ruta API și predicție

63057
47:05:11,600 --> 47:05:17,280
funcția. Deci vom defini un API

63058
47:05:14,560 --> 47:05:20,080
punctul final la predic care ascultă

63059
47:05:17,280 --> 47:05:21,664
cerere post. Aceasta este adresa URL pe care

63060
47:05:20,080 --> 47:05:24,160
front end al aplicației web va

63061
47:05:21,664 --> 47:05:25,664
sunați pentru a trimite date către back-end. Şi

63062
47:05:24,160 --> 47:05:27,744
după aceea vom începe cu prezicerea

63063
47:05:25,664 --> 47:05:30,384
funcția. Și aici avem extras

63064
47:05:27,744 --> 47:05:32,800
caracteristici care preiau datele trimise în

63065
47:05:30,384 --> 47:05:35,920
formatul JSON din cererea de postare

63066
47:05:32,800 --> 47:05:38,160
adică cererea get_json și forța

63067
47:05:35,920 --> 47:05:40,720
l-am stabilit ca adevărat aici și

63068
47:05:38,160 --> 47:05:43,024
formatează forțat datele cererii în

63069
47:05:40,720 --> 47:05:44,800
JSON asigurând compatibilitatea și apoi

63070
47:05:43,024 --> 47:05:47,360
vom extrage caracteristicile relevante care

63071
47:05:44,800 --> 47:05:49,920
este dimensiunea locației și facilitățile de la

63072
47:05:47,360 --> 47:05:51,744
obiect JSON și stocați-le într-o listă ca

63073
47:05:49,920 --> 47:05:53,280
asteptat de model si dupa

63074
47:05:51,744 --> 47:05:55,280
pregătirea caracteristicilor pe care le vom realiza

63075
47:05:53,280 --> 47:05:56,720
predicție pentru care vom folosi modelul încărcat

63076
47:05:55,280 --> 47:05:58,464
face o predicție bazată pe

63077
47:05:56,720 --> 47:06:00,720
caracteristica furnizată și apoi avem

63078
47:05:58,464 --> 47:06:02,464
metoda de predicție a returnării. Aici vom face

63079
47:06:00,720 --> 47:06:05,200
convertiți rezultatul predicției în JSON

63080
47:06:02,464 --> 47:06:06,880
formatați folosind JSON și trimiteți-l înapoi la

63081
47:06:05,200 --> 47:06:08,720
clientul și aceasta va asigura că

63082
47:06:06,880 --> 47:06:10,384
răspunsul poate fi gestionat cu ușurință de către

63083
47:06:08,720 --> 47:06:12,384
aplicație client. Deci asta a fost tot

63084
47:06:10,384 --> 47:06:14,384
despre întrebarea numărul 17. Acum în mișcare

63085
47:06:12,384 --> 47:06:16,384
la întrebarea numărul 18 care se bazează

63086
47:06:14,384 --> 47:06:18,160
la analiza. Și acum trecem la

63087
47:06:16,384 --> 47:06:20,240
întrebarea numărul 18 care se bazează pe

63088
47:06:18,160 --> 47:06:21,840
analiza datelor geospațiale. Și a ta

63089
47:06:20,240 --> 47:06:24,080
întrebarea este că ești însărcinat

63090
47:06:21,840 --> 47:06:25,664
analiza datelor geospațiale pentru a ajuta un oraș

63091
47:06:24,080 --> 47:06:27,744
să-și îmbunătățească transportul public

63092
47:06:25,664 --> 47:06:30,000
sistem. Datele includ GPS

63093
47:06:27,744 --> 47:06:32,320
coordonatele stațiilor de autobuz, numărul de călători

63094
47:06:30,000 --> 47:06:34,080
numere și modele de trafic. Ce pași

63095
47:06:32,320 --> 47:06:35,840
ai lua pentru a analiza aceste date? Şi

63096
47:06:34,080 --> 47:06:37,744
puteți furniza un exemplu de cod Python

63097
47:06:35,840 --> 47:06:39,920
fragment pentru a ilustra cum ați putea

63098
47:06:37,744 --> 47:06:41,664
vizualizați locația stației de autobuz și

63099
47:06:39,920 --> 47:06:44,080
calatorie? Deci poți începe să răspunzi

63100
47:06:41,664 --> 47:06:46,000
această întrebare care suc date mai bune

63101
47:06:44,080 --> 47:06:47,744
analiza poate oferi perspective critice

63102
47:06:46,000 --> 47:06:49,920
asupra cât de eficient este un public

63103
47:06:47,744 --> 47:06:52,464
sistemul de transport deservește orașul său

63104
47:06:49,920 --> 47:06:54,384
și ghidați îmbunătățirile și există o

63105
47:06:52,464 --> 47:06:56,800
abordare detaliată pentru aceasta și putem

63106
47:06:54,384 --> 47:06:58,464
începe cu pregătirea datelor și în aceasta

63107
47:06:56,800 --> 47:07:00,384
vom face colectarea datelor și a datelor

63108
47:06:58,464 --> 47:07:02,160
curatenie si dupa acest pas ne vom muta

63109
47:07:00,384 --> 47:07:04,160
la următorul pas care este exploratoriu

63110
47:07:02,160 --> 47:07:06,160
analiza datelor și în aceasta vom avea

63111
47:07:04,160 --> 47:07:08,560
rezumatul statistic pe care îl vom genera

63112
47:07:06,160 --> 47:07:10,320
statistici descriptive și atunci avem

63113
47:07:08,560 --> 47:07:13,520
analiza corelației

63114
47:07:10,320 --> 47:07:16,000
Și după mutare, avem geospațial

63115
47:07:13,520 --> 47:07:17,920
vizualizare care este cartografierea stației de autobuz.

63116
47:07:16,000 --> 47:07:19,664
Vom trasa locațiile stației de autobuz

63117
47:07:17,920 --> 47:07:22,080
o hartă pentru a le evalua vizual

63118
47:07:19,664 --> 47:07:24,560
distributie in intregul oras. Și după

63119
47:07:22,080 --> 47:07:26,800
că avem hărți termice care vor crea

63120
47:07:24,560 --> 47:07:29,280
date privind numărul de călători pentru a identifica sporturile fierbinți

63121
47:07:26,800 --> 47:07:31,440
și zonele cu posibile lacune de servicii.

63122
47:07:29,280 --> 47:07:33,920
Și după vizualizarea geospațială vom face

63123
47:07:31,440 --> 47:07:36,384
mutați cu analiză spațială. Avem

63124
47:07:33,920 --> 47:07:38,800
analiza de proximitate care va analiza

63125
47:07:36,384 --> 47:07:41,920
apropierea stației de autobuz de zone cheie cum ar fi

63126
47:07:38,800 --> 47:07:43,744
centre comerciale sau zone rezidentiale.

63127
47:07:41,920 --> 47:07:45,920
Și acum trecând la pasul a cincea, adică

63128
47:07:43,744 --> 47:07:47,744
optimizare și recomandare. Deci

63129
47:07:45,920 --> 47:07:50,080
vom avea o optimizare a rutei care

63130
47:07:47,744 --> 47:07:52,080
va sugera modificări ale traseului

63131
47:07:50,080 --> 47:07:54,464
bazate pe tiparele de trafic și numărul de călători

63132
47:07:52,080 --> 47:07:55,840
cererea și recomandările de politică

63133
47:07:54,464 --> 47:07:57,520
care va oferi acționabile

63134
47:07:55,840 --> 47:07:59,840
recomandări pentru îmbunătățirea autobuzului

63135
47:07:57,520 --> 47:08:02,080
frecvente. Acum treceți la eșantion

63136
47:07:59,840 --> 47:08:05,360
Cod Python unde putem defini acest lucru

63137
47:08:02,080 --> 47:08:06,880
model și folosiți-l în consecință. Și aici

63138
47:08:05,360 --> 47:08:09,664
vom începe să importam bibliotecile

63139
47:08:06,880 --> 47:08:14,384
și module. Și aici vom începe cu

63140
47:08:09,664 --> 47:08:16,880
import geopandas și m lib dotpipo.

63141
47:08:14,384 --> 47:08:19,520
Și după import vom începe cu

63142
47:08:16,880 --> 47:08:22,320
încărcarea datelor. Deci vom declara a

63143
47:08:19,520 --> 47:08:25,280
stații variabile de autobuz și încărcați autobuzul

63144
47:08:22,320 --> 47:08:27,280
oprește datele dintr-un fișier forme. Deci formă

63145
47:08:25,280 --> 47:08:29,520
fișierele sunt date vectoriale geospațiale populare

63146
47:08:27,280 --> 47:08:31,280
formate pentru informații geografice

63147
47:08:29,520 --> 47:08:33,440
software-ul de sistem și apoi avem

63148
47:08:31,280 --> 47:08:35,744
wrership care va încărca date de wrership

63149
47:08:33,440 --> 47:08:38,160
dintr-un fișier CSV care include coloane

63150
47:08:35,744 --> 47:08:40,720
pentru longitudine, latitudine și calatorii

63151
47:08:38,160 --> 47:08:42,384
niveluri și după aceea vom crea geo

63152
47:08:40,720 --> 47:08:44,384
cadrul de date care va converti

63153
47:08:42,384 --> 47:08:46,384
cadru de date de luptă într-o date geografice

63154
47:08:44,384 --> 47:08:48,960
cadru și acest pas implică crearea unui

63155
47:08:46,384 --> 47:08:51,104
coloana de geometrie de la longitudine și

63156
47:08:48,960 --> 47:08:53,440
coloane de latitudine și apoi avem

63157
47:08:51,104 --> 47:08:55,920
complotând unul aici, vom reprezenta

63158
47:08:53,440 --> 47:08:58,464
grafice care ar figuri și axa și

63159
47:08:55,920 --> 47:09:00,880
creați o figură pentru un singur subplot

63160
47:08:58,464 --> 47:09:04,800
cu o dimensiune specificată care este 10 10

63161
47:09:00,880 --> 47:09:06,880
in. Și apoi avem harta orașului.parcela. Ea

63162
47:09:04,800 --> 47:09:09,600
se presupune că există o hartă de bază a

63163
47:09:06,880 --> 47:09:12,000
orașul încărcat ca un cadru de date geo

63164
47:09:09,600 --> 47:09:14,080
numită harta orașului. Acesta este trasat primul

63165
47:09:12,000 --> 47:09:16,384
cu o culoare gri deschis pentru a servi drept a

63166
47:09:14,080 --> 47:09:18,384
fundal pentru celelalte straturi. Deci asta

63167
47:09:16,384 --> 47:09:20,464
era totul despre întrebarea numărul 18. Acum

63168
47:09:18,384 --> 47:09:23,024
trecând la întrebarea numărul 19 adică

63169
47:09:20,464 --> 47:09:25,280
bazat pe utilizarea de întreținere predictivă

63170
47:09:23,024 --> 47:09:27,104
machine learning și întrebarea ești tu

63171
47:09:25,280 --> 47:09:29,200
au sarcina de a dezvolta un predictiv

63172
47:09:27,104 --> 47:09:31,440
sistem de întreținere pentru o producție

63173
47:09:29,200 --> 47:09:33,280
instalație care se bazează în mare măsură pe automatizate

63174
47:09:31,440 --> 47:09:35,280
utilaje. Deci datele disponibile

63175
47:09:33,280 --> 47:09:36,800
include parametrii operaționali ai mașinii,

63176
47:09:35,280 --> 47:09:38,560
istoric de întreținere și defecțiuni

63177
47:09:36,800 --> 47:09:40,880
incidente. Ce pași ai face

63178
47:09:38,560 --> 47:09:42,960
dezvolta un model predictiv și poți

63179
47:09:40,880 --> 47:09:44,720
furnizați un exemplu de cod Python? Deci poți

63180
47:09:42,960 --> 47:09:46,720
începe cu întreținerea predictivă care

63181
47:09:44,720 --> 47:09:48,800
este esențială în producție

63182
47:09:46,720 --> 47:09:51,280
ajută la prevenirea defecțiunilor echipamentelor

63183
47:09:48,800 --> 47:09:53,360
reducerea timpilor de nefuncționare și a costurilor de întreținere.

63184
47:09:51,280 --> 47:09:55,440
Și aici ai avea un detaliu

63185
47:09:53,360 --> 47:09:57,024
abordare sau model predictiv pentru aceasta

63186
47:09:55,440 --> 47:09:59,840
începând cu colectarea datelor şi

63187
47:09:57,024 --> 47:10:02,320
integrare. Atunci poți face EDA, adică

63188
47:09:59,840 --> 47:10:04,640
analiza exploratorie a datelor și apoi noi

63189
47:10:02,320 --> 47:10:07,024
poate efectua ingineria caracteristicilor și apoi

63190
47:10:04,640 --> 47:10:09,440
trece la sarcina de pregătire a procesării datelor și

63191
47:10:07,024 --> 47:10:11,520
apoi modelul de selecție și pregătirea

63192
47:10:09,440 --> 47:10:13,920
iar după aceea avem evaluarea modelului

63193
47:10:11,520 --> 47:10:16,000
și tehnica de desfășurare pe care o putem face

63194
47:10:13,920 --> 47:10:18,640
pentru model folosind metrici adecvate

63195
47:10:16,000 --> 47:10:20,160
precum precizia, rechemarea și scorul F1.

63196
47:10:18,640 --> 47:10:22,160
Deci totul a fost vorba despre numărul întrebării

63197
47:10:20,160 --> 47:10:24,384
19. Deci acum treceți la întrebarea numărul 20

63198
47:10:22,160 --> 47:10:26,320
care se bazează pe personalizare folosind

63199
47:10:24,384 --> 47:10:28,080
învățarea automată și întrebarea dvs. este

63200
47:10:26,320 --> 47:10:30,000
ai sarcina de a dezvolta o mașină

63201
47:10:28,080 --> 47:10:32,240
model de învățare pentru personalizarea conținutului

63202
47:10:30,000 --> 47:10:34,384
recomandări pentru utilizatorii unui media

63203
47:10:32,240 --> 47:10:36,880
platforma de streaming. Datele disponibile

63204
47:10:34,384 --> 47:10:38,960
include retailul demografice al utilizatorilor

63205
47:10:36,880 --> 47:10:40,464
istoricul vizualizării și evaluările. Deci ce

63206
47:10:38,960 --> 47:10:42,800
pași ai face pentru a construi un model

63207
47:10:40,464 --> 47:10:44,384
pentru recomandări personalizate și pot

63208
47:10:42,800 --> 47:10:46,320
furnizați un exemplu de cod Python pentru

63209
47:10:44,384 --> 47:10:47,664
asta? Deci poți începe să răspunzi la asta

63210
47:10:46,320 --> 47:10:49,920
cu crearea unui personalizat

63211
47:10:47,664 --> 47:10:51,664
sisteme de recomandare. Asta ar fi

63212
47:10:49,920 --> 47:10:54,000
esențială pentru implicarea utilizatorilor prin

63213
47:10:51,664 --> 47:10:55,840
furnizarea de conținut care este relevant pentru

63214
47:10:54,000 --> 47:10:57,920
interesul lor. Și va exista o

63215
47:10:55,840 --> 47:11:00,240
abordare sistematică sau personalizată

63216
47:10:57,920 --> 47:11:02,384
recomandare de conținut. Vom începe cu

63217
47:11:00,240 --> 47:11:04,384
colectarea și integrarea datelor. Şi

63218
47:11:02,384 --> 47:11:06,640
după aceea, vom efectua EDA, adică

63219
47:11:04,384 --> 47:11:08,960
analiza explorativă a datelor. Și apoi noi

63220
47:11:06,640 --> 47:11:11,440
au inginerie caracteristică. În asta vom

63221
47:11:08,960 --> 47:11:13,200
interacționează caracteristicile și temporalul

63222
47:11:11,440 --> 47:11:15,024
caracteristici. Vom include în funcție de timp

63223
47:11:13,200 --> 47:11:17,200
caracteristici pentru a capta tendințele și

63224
47:11:15,024 --> 47:11:19,440
sezonalitate în comportamentul de vizionare. Şi

63225
47:11:17,200 --> 47:11:21,360
apoi vom selecta modelul care este de lângă

63226
47:11:19,440 --> 47:11:23,520
filtrare colaborativă și hibrid

63227
47:11:21,360 --> 47:11:26,080
modele. Și apoi vom antrena modelul

63228
47:11:23,520 --> 47:11:28,320
și validarea și implementarea și monitorizarea

63229
47:11:26,080 --> 47:11:30,000
ei. Și după aceea vom implementa

63230
47:11:28,320 --> 47:11:32,000
model. Deci, să începem cu începătorii

63231
47:11:30,000 --> 47:11:34,384
întrebări de nivel. Și numărul unu este ceea ce

63232
47:11:32,000 --> 47:11:37,104
este machine learning? Deci învățarea automată

63233
47:11:34,384 --> 47:11:39,664
este un subset al inteligenței artificiale

63234
47:11:37,104 --> 47:11:42,240
care implică utilizarea algoritmilor și

63235
47:11:39,664 --> 47:11:44,640
modele statistice pentru a permite calculatoarelor

63236
47:11:42,240 --> 47:11:46,800
a îndeplini sarcina fără explicit

63237
47:11:44,640 --> 47:11:49,200
instructiuni. adică bazându-se pe

63238
47:11:46,800 --> 47:11:51,200
modele și interferențe. Și acum

63239
47:11:49,200 --> 47:11:52,880
trecând la numărul a doua întrebare, adică

63240
47:11:51,200 --> 47:11:55,104
care sunt diferitele tipuri de mașini

63241
47:11:52,880 --> 47:11:57,104
învăţarea. Deci cele trei tipuri principale de

63242
47:11:55,104 --> 47:11:59,440
Învățarea automată este numărul unu

63243
47:11:57,104 --> 47:12:01,840
învăţarea supravegheată şi apoi vine

63244
47:11:59,440 --> 47:12:04,160
învățare nesupravegheată și apoi există

63245
47:12:01,840 --> 47:12:06,640
învăţarea prin întărire. Acum trecerea la

63246
47:12:04,160 --> 47:12:09,200
următoarea întrebare care este a treia asta este ce

63247
47:12:06,640 --> 47:12:11,200
este învățare supravegheată. Deci supravegheat

63248
47:12:09,200 --> 47:12:13,664
învăţarea presupune formarea unui model pe a

63249
47:12:11,200 --> 47:12:16,464
etichetați setul de date care înseamnă fiecare antrenament

63250
47:12:13,664 --> 47:12:18,464
exemplu este asociat cu o etichetă de ieșire.

63251
47:12:16,464 --> 47:12:21,200
Modelul învață să prezică rezultatul

63252
47:12:18,464 --> 47:12:22,960
din datele de intrare. Acum trecerea la

63253
47:12:21,200 --> 47:12:25,600
a patra întrebare care este

63254
47:12:22,960 --> 47:12:27,920
învăţare nesupravegheată. Deci nesupravegheat

63255
47:12:25,600 --> 47:12:29,920
implică formarea unui model pe date care

63256
47:12:27,920 --> 47:12:31,840
nu are răspunsuri etichetate. The

63257
47:12:29,920 --> 47:12:34,000
modelul încearcă să învețe tiparele și

63258
47:12:31,840 --> 47:12:35,360
structura din datele de intrare. Deci

63259
47:12:34,000 --> 47:12:37,360
baieti, astea sunt nivelul incepatorului

63260
47:12:35,360 --> 47:12:38,880
întrebări și acum vom trece la

63261
47:12:37,360 --> 47:12:41,200
a cincea întrebare care este

63262
47:12:38,880 --> 47:12:43,104
învăţarea prin întărire. Deci întărire

63263
47:12:41,200 --> 47:12:45,440
învățarea este un tip de învățare automată

63264
47:12:43,104 --> 47:12:47,520
unde un agent învață să ia decizii

63265
47:12:45,440 --> 47:12:50,240
prin efectuarea de acţiuni şi primirea

63266
47:12:47,520 --> 47:12:52,880
recompense sau penalități. Scopul este să

63267
47:12:50,240 --> 47:12:54,720
maximizează recompensa cumulativă. Deci acum

63268
47:12:52,880 --> 47:12:57,200
trecând la a șasea întrebare adică

63269
47:12:54,720 --> 47:12:59,024
ce este un model în învățarea automată. Deci

63270
47:12:57,200 --> 47:13:01,280
un model în învățarea automată este a

63271
47:12:59,024 --> 47:13:04,320
reprezentarea matematică a unui real

63272
47:13:01,280 --> 47:13:06,560
proces mondial. Este instruit pe date pentru

63273
47:13:04,320 --> 47:13:09,440
recunoaște tipare și face predicții

63274
47:13:06,560 --> 47:13:11,104
sau decizii bazate pe date noi. Deci acum

63275
47:13:09,440 --> 47:13:13,104
trecând la a șaptea întrebare, asta este

63276
47:13:11,104 --> 47:13:15,024
este supraadaptat? Deci apare supraadaptarea

63277
47:13:13,104 --> 47:13:17,840
atunci când un model de învățare automată funcționează

63278
47:13:15,024 --> 47:13:20,560
bine pe datele de antrenament, dar slab pe

63279
47:13:17,840 --> 47:13:22,640
date noi nevăzute. Indică faptul că

63280
47:13:20,560 --> 47:13:24,560
modelul a învățat zgomotul și detaliile

63281
47:13:22,640 --> 47:13:26,720
în datele de antrenament în loc de

63282
47:13:24,560 --> 47:13:28,640
modele reale. Deci acum venim la

63283
47:13:26,720 --> 47:13:30,880
întrebarea numărul opt asta este

63284
47:13:28,640 --> 47:13:32,720
subadaptare? Așadar, apare subadaptarea

63285
47:13:30,880 --> 47:13:34,464
atunci când un model de învățare automată este de asemenea

63286
47:13:32,720 --> 47:13:37,024
simplu de captat elementul de bază

63287
47:13:34,464 --> 47:13:39,840
modele în date. Funcționează prost

63288
47:13:37,024 --> 47:13:41,520
atât asupra datelor de antrenament, cât și asupra datelor noi.

63289
47:13:39,840 --> 47:13:43,440
Acum treceți la următoarea întrebare, adică

63290
47:13:41,520 --> 47:13:45,840
a noua întrebare și întrebarea este ce

63291
47:13:43,440 --> 47:13:48,384
este o matrice de confuzie? Deci confuzie

63292
47:13:45,840 --> 47:13:50,720
matricea este un tabel folosit pentru a evalua

63293
47:13:48,384 --> 47:13:52,960
performanța unui model de clasificare.

63294
47:13:50,720 --> 47:13:55,600
Acesta rezumă numărul de corecte și

63295
47:13:52,960 --> 47:13:58,000
predicții incorecte făcute de model

63296
47:13:55,600 --> 47:13:59,840
și care este clasificat în funcție de fiecare clasă.

63297
47:13:58,000 --> 47:14:02,080
Acum trecem la a 10-a întrebare, adică

63298
47:13:59,840 --> 47:14:04,160
ce este validarea încrucișată? Deci cruce

63299
47:14:02,080 --> 47:14:06,000
validarea este o tehnică de evaluare

63300
47:14:04,160 --> 47:14:08,240
modul în care rezultatele unei statistici

63301
47:14:06,000 --> 47:14:10,720
analiza se va generaliza la o

63302
47:14:08,240 --> 47:14:13,104
set de date independent. Implica

63303
47:14:10,720 --> 47:14:15,600
partiţionarea datelor în subseturi.

63304
47:14:13,104 --> 47:14:18,384
Antrenarea modelului pe unele subseturi și

63305
47:14:15,600 --> 47:14:21,200
validând-o pe subseturile rămase.

63306
47:14:18,384 --> 47:14:23,440
Acesta a fost totul despre a 10-a

63307
47:14:21,200 --> 47:14:25,520
întrebare sau totalul de la 1 la 10

63308
47:14:23,440 --> 47:14:27,664
intrebari pentru nivel incepator. Acum vom face

63309
47:14:25,520 --> 47:14:30,464
trece la nivel intermediar și aici

63310
47:14:27,664 --> 47:14:33,280
vom acoperi 10 întrebări. Deci vom începe

63311
47:14:30,464 --> 47:14:37,024
cu a 11-a întrebare care este un ROC

63312
47:14:33,280 --> 47:14:39,664
curba. Deci ROC care funcționează receptorul

63313
47:14:37,024 --> 47:14:41,600
curba caracteristica. Este un grafic

63314
47:14:39,664 --> 47:14:44,240
reprezentarea unui clasificator

63315
47:14:41,600 --> 47:14:46,640
performanță pe diferite praguri.

63316
47:14:44,240 --> 47:14:49,360
Acesta prezintă rata pozitivă adevărată, adică

63317
47:14:46,640 --> 47:14:52,080
TPR împotriva unei rate fals pozitive care

63318
47:14:49,360 --> 47:14:54,800
este FPR. Acum trec la a 12-a întrebare care

63319
47:14:52,080 --> 47:14:56,720
este ceea ce este precizia și amintirea. Deci

63320
47:14:54,800 --> 47:14:58,880
precizia este raportul dintre corect

63321
47:14:56,720 --> 47:15:01,744
a prezis observații pozitive la

63322
47:14:58,880 --> 47:15:03,840
totalul de pozitive prezise și reamintirea este

63323
47:15:01,744 --> 47:15:06,000
raportul dintre corect prezis

63324
47:15:03,840 --> 47:15:08,880
observații pozitive la toate actualele

63325
47:15:06,000 --> 47:15:11,600
pozitive. Deci formula este precizia

63326
47:15:08,880 --> 47:15:15,840
egal cu TP/TP

63327
47:15:11,600 --> 47:15:19,520
plus FP și rechemarea este TP/TP

63328
47:15:15,840 --> 47:15:22,384
  F_sub_1. Așa că acum vom trece la al 13-lea

63329
47:15:19,520 --> 47:15:25,200
întrebarea care este scorul F1?

63330
47:15:22,384 --> 47:15:27,520
Deci scorul F1 este media armonică a

63331
47:15:25,200 --> 47:15:29,920
precizie și reamintire. Acesta oferă o

63332
47:15:27,520 --> 47:15:31,744
echilibru între cele două metrici și este

63333
47:15:29,920 --> 47:15:34,960
util atunci când trebuie să echilibrați

63334
47:15:31,744 --> 47:15:38,160
precizie și reamintire. Scorul F1 este egal

63335
47:15:34,960 --> 47:15:40,080
de două ori în precizie în rechemare și

63336
47:15:38,160 --> 47:15:43,360
care este împărțit la precizia plus

63337
47:15:40,080 --> 47:15:46,080
reamintire. Acum vom trece la a 14-a întrebare

63338
47:15:43,360 --> 47:15:47,664
iar aici vom acoperi regularizarea.

63339
47:15:46,080 --> 47:15:50,240
Deci întrebarea este ce este

63340
47:15:47,664 --> 47:15:52,800
regularizare? Deci este o tehnică

63341
47:15:50,240 --> 47:15:55,280
folosit pentru a preveni supraadaptarea prin adăugarea unui

63342
47:15:52,800 --> 47:15:57,104
penalizare la complexitatea modelului şi

63343
47:15:55,280 --> 47:16:00,320
tipurile comune de regularizare

63344
47:15:57,104 --> 47:16:02,640
includ L1 care este lasso și creasta L2

63345
47:16:00,320 --> 47:16:05,024
regularizare. Acum vom trece la

63346
47:16:02,640 --> 47:16:07,920
A 15-a întrebare care este părtinirea

63347
47:16:05,024 --> 47:16:10,000
compromis de varianță. Deci variația de părtinire

63348
47:16:07,920 --> 47:16:12,384
compromisul este o problemă fundamentală în

63349
47:16:10,000 --> 47:16:14,560
învățare automată care implică echilibrare

63350
47:16:12,384 --> 47:16:17,104
eroarea introdusă de modelul

63351
47:16:14,560 --> 47:16:19,440
ipotezele și eroarea datorată modelului

63352
47:16:17,104 --> 47:16:22,080
complexitate. Deci un model bun ar trebui să aibă

63353
47:16:19,440 --> 47:16:24,000
părtinire scăzută și varianță scăzută. Acum vom face

63354
47:16:22,080 --> 47:16:26,560
treceți la întrebarea numărul 16 adică

63355
47:16:24,000 --> 47:16:28,464
ce este ingineria caracteristicilor. Deci caracteristică

63356
47:16:26,560 --> 47:16:31,360
ingineria este procesul de creare

63357
47:16:28,464 --> 47:16:33,360
caracteristici noi sau modificarea celor existente

63358
47:16:31,360 --> 47:16:35,360
pentru a îmbunătăți performanța unei mașini

63359
47:16:33,360 --> 47:16:37,600
model de învățare. Implică tehnici

63360
47:16:35,360 --> 47:16:40,080
precum normalizarea și codificarea

63361
47:16:37,600 --> 47:16:42,640
variabile categorice şi crearea

63362
47:16:40,080 --> 47:16:45,024
termeni de interacțiune. Deci acum vom trece la

63363
47:16:42,640 --> 47:16:47,280
intrebarea numarul 17 si cam asta este

63364
47:16:45,024 --> 47:16:49,440
coborâre în gradient. Deci întrebarea este

63365
47:16:47,280 --> 47:16:52,240
ce este coborârea gradientului și răspunsul tău

63366
47:16:49,440 --> 47:16:54,384
este coborârea gradientului este o optimizare

63367
47:16:52,240 --> 47:16:56,880
algoritm folosit pentru a minimiza costul

63368
47:16:54,384 --> 47:16:58,960
funcția în modelele de învățare automată și

63369
47:16:56,880 --> 47:17:00,640
ajustează iterativ modelul

63370
47:16:58,960 --> 47:17:04,384
parametrii în direcția

63371
47:17:00,640 --> 47:17:06,320
cea mai abruptă coborâre a funcției de coastă.

63372
47:17:04,384 --> 47:17:08,640
Deci, cu asta vom trece la al 18-lea

63373
47:17:06,320 --> 47:17:11,360
întrebare și care va acoperi cu

63374
47:17:08,640 --> 47:17:13,024
diferența dintre ambalare și boosting.

63375
47:17:11,360 --> 47:17:14,880
Deci întrebarea este care este diferența

63376
47:17:13,024 --> 47:17:16,960
între ambalare și boosting și tu

63377
47:17:14,880 --> 47:17:20,000
ar putea răspunde la asta începând cu

63378
47:17:16,960 --> 47:17:22,080
ambalaj care este agregare bootstrap

63379
47:17:20,000 --> 47:17:24,384
care implică antrenarea mai multor modele

63380
47:17:22,080 --> 47:17:26,384
pe diferite subseturi de date și

63381
47:17:24,384 --> 47:17:28,880
făcând media previziunilor lor. Apoi vine

63382
47:17:26,384 --> 47:17:30,800
impulsionarea care presupune modele de antrenament

63383
47:17:28,880 --> 47:17:32,880
secvenţial cu fiecare model nou

63384
47:17:30,800 --> 47:17:35,440
concentrându-se pe corectarea erorilor

63385
47:17:32,880 --> 47:17:37,440
cele anterioare. Și apoi avem

63386
47:17:35,440 --> 47:17:39,840
întrebarea numărul 19 care este a

63387
47:17:37,440 --> 47:17:41,840
arborele de decizie? Deci un arbore de decizie este un

63388
47:17:39,840 --> 47:17:44,000
învăţare supravegheată neparametrică

63389
47:17:41,840 --> 47:17:46,160
algoritm utilizat pentru clasificare și

63390
47:17:44,000 --> 47:17:48,240
regresie. Împarte datele în

63391
47:17:46,160 --> 47:17:50,160
subseturi bazate pe valoarea intrării

63392
47:17:48,240 --> 47:17:52,240
caracteristici care rezultă într-un arbore ca

63393
47:17:50,160 --> 47:17:54,240
structura deciziilor. Acum ne vom muta

63394
47:17:52,240 --> 47:17:56,800
la întrebarea numărul 20, asta este a

63395
47:17:54,240 --> 47:17:59,280
pădure la întâmplare. Deci pădurea întâmplătoare este o

63396
47:17:56,800 --> 47:18:01,360
metoda de învățare a ansamblului care combină

63397
47:17:59,280 --> 47:18:04,384
arbori de decizie multipli pentru a îmbunătăți

63398
47:18:01,360 --> 47:18:06,800
acuratețea și robustețea modelului. Ea

63399
47:18:04,384 --> 47:18:09,360
construiește fiecare arbore folosind un subset aleatoriu

63400
47:18:06,800 --> 47:18:11,840
de caracteristici și puncte de date și apoi

63401
47:18:09,360 --> 47:18:13,600
medie previziunile lor. Deci astea

63402
47:18:11,840 --> 47:18:15,440
au fost întrebările care sunt pentru

63403
47:18:13,600 --> 47:18:18,240
nivel intermediar și acestea sunt doar

63404
47:18:15,440 --> 47:18:20,384
întrebările de bază sau voi spune doar

63405
47:18:18,240 --> 47:18:22,464
întrebările teoretice care pot fi

63406
47:18:20,384 --> 47:18:24,240
intrebat intr-un interviu. Deci fii pregatit

63407
47:18:22,464 --> 47:18:26,080
pentru asta. Acum vom trece la avansat

63408
47:18:24,240 --> 47:18:28,160
întrebări la nivel interviu și vom face

63409
47:18:26,080 --> 47:18:30,800
începe cu întrebarea numărul 21. Și aici

63410
47:18:28,160 --> 47:18:33,200
de asemenea, vom acoperi cele 10 întrebări. Deci

63411
47:18:30,800 --> 47:18:35,744
întrebarea numărul unu sau aceasta este 21

63412
47:18:33,200 --> 47:18:37,744
întrebare și întrebarea este ce este a

63413
47:18:35,744 --> 47:18:39,744
suport vector mașină? Deci sprijin

63414
47:18:37,744 --> 47:18:42,000
mașina vectorială este o învățare supravegheată

63415
47:18:39,744 --> 47:18:44,640
algoritm utilizat pentru clasificare și

63416
47:18:42,000 --> 47:18:46,960
regresie. Găsește hiper-ul optim

63417
47:18:44,640 --> 47:18:49,520
plan care maximizează marja dintre

63418
47:18:46,960 --> 47:18:51,520
diferite clase în spațiul de caracteristici.

63419
47:18:49,520 --> 47:18:54,080
Și apoi vine întrebarea numărul 22 care

63420
47:18:51,520 --> 47:18:56,464
este ceea ce este analiza componentelor principale.

63421
47:18:54,080 --> 47:18:58,800
Deci analiza componentelor principale este a

63422
47:18:56,464 --> 47:19:01,280
tehnica de reducere a dimensionalităţii care

63423
47:18:58,800 --> 47:19:03,520
transformă datele înalte dimensiuni în a

63424
47:19:01,280 --> 47:19:06,160
spațiu dimensional inferior prin găsirea

63425
47:19:03,520 --> 47:19:08,640
direcții care sunt componente principale

63426
47:19:06,160 --> 47:19:10,560
care maximizează variația datelor.

63427
47:19:08,640 --> 47:19:12,464
Și apoi vine întrebarea numărul 23

63428
47:19:10,560 --> 47:19:14,560
asta este o rețea neuronală? Deci a

63429
47:19:12,464 --> 47:19:17,104
rețeaua neuronală este o serie de algoritmi

63430
47:19:14,560 --> 47:19:19,664
acea încercare de a recunoaște subiacente

63431
47:19:17,104 --> 47:19:21,840
relații într-un set de date prin a

63432
47:19:19,664 --> 47:19:24,240
proces care imită modul uman

63433
47:19:21,840 --> 47:19:27,024
creierul funcționează. Este format dintr-un strat de

63434
47:19:24,240 --> 47:19:29,024
noduri sau neuroni interconectați. Şi

63435
47:19:27,024 --> 47:19:31,280
apoi vine întrebarea numărul 24 că

63436
47:19:29,024 --> 47:19:33,200
este ce este învățarea profundă? Atât de adânc

63437
47:19:31,280 --> 47:19:35,360
învățarea este un subset al învățării automate

63438
47:19:33,200 --> 47:19:37,744
care implică rețele neuronale cu multe

63439
47:19:35,360 --> 47:19:39,920
straturi care este rețele neuronale profunde și

63440
47:19:37,744 --> 47:19:42,560
este deosebit de eficient pentru sarcină

63441
47:19:39,920 --> 47:19:44,880
precum recunoașterea imaginii și a vorbirii. Acum eu

63442
47:19:42,560 --> 47:19:48,000
treceți la întrebarea numărul 25, asta este

63443
47:19:44,880 --> 47:19:50,880
este o rețea neuronală convoluțională, adică

63444
47:19:48,000 --> 47:19:52,320
CNN. Deci vom începe răspunsul cu

63445
47:19:50,880 --> 47:19:54,640
răspunzând intervievatorului că a

63446
47:19:52,320 --> 47:19:56,880
rețeaua neuronală convoluțională este un tip

63447
47:19:54,640 --> 47:19:58,880
a modelului de învățare profundă în mod specific

63448
47:19:56,880 --> 47:20:01,840
concepute pentru prelucrarea grilă structurată

63449
47:19:58,880 --> 47:20:04,080
date precum imaginile. Folosește convoluțional

63450
47:20:01,840 --> 47:20:06,240
straturi pentru a extrage caracteristici speciale sau

63451
47:20:04,080 --> 47:20:08,384
caracteristicile și modelele spațiale din

63452
47:20:06,240 --> 47:20:10,640
datele de intrare. Acum trecem la

63453
47:20:08,384 --> 47:20:14,000
întrebarea numărul 26 care este a

63454
47:20:10,640 --> 47:20:16,320
rețea neuronală recurentă sau RNN. Deci a

63455
47:20:14,000 --> 47:20:18,320
rețeaua neuronală recurentă este un tip de

63456
47:20:16,320 --> 47:20:20,800
rețea neuronală concepută pentru secvențial

63457
47:20:18,320 --> 47:20:23,104
date și are conexiuni care formează

63458
47:20:20,800 --> 47:20:26,240
cicluri dirijate permițându-i să se mențină

63459
47:20:23,104 --> 47:20:28,384
o memorie a intrărilor și proceselor anterioare

63460
47:20:26,240 --> 47:20:30,800
secvențe de date. Deci despre asta era vorba

63461
47:20:28,384 --> 47:20:32,720
întrebarea numărul 26 și acum vom trata

63462
47:20:30,800 --> 47:20:34,880
întrebarea numărul 27 asta este

63463
47:20:32,720 --> 47:20:38,640
diferența dintre gradientul lotului

63464
47:20:34,880 --> 47:20:40,960
coborâre și coborâre în gradient stoastic.

63465
47:20:38,640 --> 47:20:43,200
Deci, coborârea gradientului lot calculează

63466
47:20:40,960 --> 47:20:45,280
gradient al funcției de coastă folosind funcția

63467
47:20:43,200 --> 47:20:48,880
întregul set de date de antrenament în timp ce

63468
47:20:45,280 --> 47:20:50,880
coborâre a gradientului stocastic care este SGD

63469
47:20:48,880 --> 47:20:54,000
calculează gradientul folosind doar unul

63470
47:20:50,880 --> 47:20:56,720
exemplu de antrenament la un moment dat. Deci SGD este

63471
47:20:54,000 --> 47:20:58,560
mai rapid dar mai zgomotos. Acum trecem la

63472
47:20:56,720 --> 47:21:00,960
întrebarea numărul 28 asta este

63473
47:20:58,560 --> 47:21:03,104
abandon în rețelele neuronale. Deci abandonul

63474
47:21:00,960 --> 47:21:05,840
este o tehnică de regularizare folosită în

63475
47:21:03,104 --> 47:21:07,920
rețele neuronale pentru a preveni supraadaptarea

63476
47:21:05,840 --> 47:21:10,384
și implică setarea aleatorie a a

63477
47:21:07,920 --> 47:21:12,800
fracţiunea neuronilor la zero în timpul

63478
47:21:10,384 --> 47:21:15,840
formare forțând rețeaua să învețe

63479
47:21:12,800 --> 47:21:17,920
caracteristici mai robuste. Și acum ne vom mișca

63480
47:21:15,840 --> 47:21:19,744
la întrebarea numărul 29 și asta va fi

63481
47:21:17,920 --> 47:21:22,000
despre învățarea prin transfer. Și a ta

63482
47:21:19,744 --> 47:21:23,920
întrebarea este ce este învățarea prin transfer?

63483
47:21:22,000 --> 47:21:26,240
Așa că vom răspunde la asta intervievatorului

63484
47:21:23,920 --> 47:21:28,080
prin începerea că învățarea prin transfer este a

63485
47:21:26,240 --> 47:21:30,720
tehnică în învățarea automată unde a

63486
47:21:28,080 --> 47:21:33,280
modelul dezvoltat pentru o sarcină este reutilizat

63487
47:21:30,720 --> 47:21:36,000
ca punct de plecare pentru un model pe a

63488
47:21:33,280 --> 47:21:37,744
a doua sarcină conexă. Este în special

63489
47:21:36,000 --> 47:21:40,464
util atunci când există date limitate

63490
47:21:37,744 --> 47:21:42,720
disponibil pentru a doua sarcină. Acum vom face

63491
47:21:40,464 --> 47:21:44,800
treceți la ultima întrebare și la a 30-a

63492
47:21:42,720 --> 47:21:48,384
întrebare. Deci asta este a

63493
47:21:44,800 --> 47:21:50,384
rețea adversă generativă care este GN.

63494
47:21:48,384 --> 47:21:52,720
Deci poți începe să răspunzi la asta. Aşa

63495
47:21:50,384 --> 47:21:55,200
rețeaua adversală generativă este un tip

63496
47:21:52,720 --> 47:21:57,664
a modelului de deep learning format din două

63497
47:21:55,200 --> 47:21:59,440
rețele neuronale un generator și a

63498
47:21:57,664 --> 47:22:01,744
discriminatori care sunt instruiți

63499
47:21:59,440 --> 47:22:04,000
simultan. Generatorul creează

63500
47:22:01,744 --> 47:22:06,384
date false în timp ce discriminatorul încearcă

63501
47:22:04,000 --> 47:22:08,800
pentru a distinge între real și fals

63502
47:22:06,384 --> 47:22:11,200
date care conduc la producerea generatorului

63503
47:22:08,800 --> 47:22:14,080
date din ce în ce mai realiste. Și acestea

63504
47:22:11,200 --> 47:22:16,320
întrebările și răspunsurile s-au terminat și acestea

63505
47:22:14,080 --> 47:22:18,240
acoperă o gamă largă de subiecte în mașină

63506
47:22:16,320 --> 47:22:19,920
învăţare şi ar trebui să ajute să se pregătească pentru

63507
47:22:18,240 --> 47:22:21,664
interviuri la diferite niveluri.

63508
47:22:19,920 --> 47:22:23,840
>> Și cu asta am ajuns la sfârșitul

63509
47:22:21,664 --> 47:22:25,664
sesiunea pe AI și mașină

63510
47:22:23,840 --> 47:22:27,520
inginer de invatare curs complet pentru

63511
47:22:25,664 --> 47:22:29,104
începători. Dacă aveți îndoieli sau

63512
47:22:27,520 --> 47:22:30,720
întrebări despre acest videoclip anunță-ne

63513
47:22:29,104 --> 47:22:32,320
în secțiunea de comentarii de mai jos și o echipă

63514
47:22:30,720 --> 47:22:34,080
dintre experți vă vor ajuta cu plăcere.

63515
47:22:32,320 --> 47:22:35,744
Pana data viitoare multumesc si tine

63516
47:22:34,080 --> 47:22:38,744
învăţarea. Rămâneți pe fază pentru mai multe de la

63517
47:22:35,744 --> 47:22:38,744
SimplyLearn.


